marcostrfn commited on
Commit
ceb98c5
·
verified ·
1 Parent(s): 261311c

Actualización de pesos del modelo y configuración

Browse files
config.json CHANGED
@@ -16,7 +16,7 @@
16
  "decoder_layerdrop": 0.0,
17
  "decoder_layers": 6,
18
  "decoder_start_token_id": 2,
19
- "dropout": 0.1,
20
  "dtype": "float32",
21
  "encoder_attention_heads": 12,
22
  "encoder_ffn_dim": 3072,
 
16
  "decoder_layerdrop": 0.0,
17
  "decoder_layers": 6,
18
  "decoder_start_token_id": 2,
19
+ "dropout": 0.2,
20
  "dtype": "float32",
21
  "encoder_attention_heads": 12,
22
  "encoder_ffn_dim": 3072,
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8e83db30b52e45757df8cac1c2ce9f7696e1d7279fa47d7196d87a65227e5a8f
3
  size 560083468
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e1e0ee24a0eacb0b2c21a2670c456bc6f87c94ad63142459b7e52033376c719a
3
  size 560083468
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4c8bdd97b6cbf661d565ffe117adf0a4e13221b6d6530b8639c0f9ed5b1c1dea
3
  size 5201
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1f3a322be425018533bd04b52c70c816be60f528a95cd8bdc3fb10678b4d5b6c
3
  size 5201
training_metrics.json CHANGED
@@ -1 +1 @@
1
- [{"loss": 0.9919142456054687, "grad_norm": 8.775832176208496, "learning_rate": 1.975998075998076e-05, "epoch": 0.1443001443001443, "step": 500}, {"loss": 0.910989013671875, "grad_norm": 4.988423824310303, "learning_rate": 1.951948051948052e-05, "epoch": 0.2886002886002886, "step": 1000}, {"loss": 0.8710120239257813, "grad_norm": 7.674182891845703, "learning_rate": 1.927898027898028e-05, "epoch": 0.4329004329004329, "step": 1500}, {"loss": 0.8792120971679688, "grad_norm": 6.040194511413574, "learning_rate": 1.9038480038480042e-05, "epoch": 0.5772005772005772, "step": 2000}, {"loss": 0.8605200805664063, "grad_norm": 6.622442722320557, "learning_rate": 1.87979797979798e-05, "epoch": 0.7215007215007215, "step": 2500}, {"loss": 0.8386665649414062, "grad_norm": 4.873053073883057, "learning_rate": 1.8557479557479558e-05, "epoch": 0.8658008658008658, "step": 3000}, {"eval_loss": 0.8508646488189697, "eval_accuracy": 0.6283281622050653, "eval_runtime": 206.5221, "eval_samples_per_second": 67.107, "eval_steps_per_second": 8.391, "epoch": 1.0, "step": 3465}, {"loss": 0.8442369384765624, "grad_norm": 6.994507312774658, "learning_rate": 1.8316979316979316e-05, "epoch": 1.0101010101010102, "step": 3500}, {"loss": 0.7976170043945312, "grad_norm": 4.886274814605713, "learning_rate": 1.8076479076479077e-05, "epoch": 1.1544011544011543, "step": 4000}, {"loss": 0.8069803466796875, "grad_norm": 8.111863136291504, "learning_rate": 1.783597883597884e-05, "epoch": 1.2987012987012987, "step": 4500}, {"loss": 0.777977294921875, "grad_norm": 7.708979606628418, "learning_rate": 1.7595478595478596e-05, "epoch": 1.443001443001443, "step": 5000}, {"loss": 0.77459716796875, "grad_norm": 8.029012680053711, "learning_rate": 1.7354978354978354e-05, "epoch": 1.5873015873015874, "step": 5500}, {"loss": 0.7770149536132812, "grad_norm": 6.0439453125, "learning_rate": 1.7114478114478116e-05, "epoch": 1.7316017316017316, "step": 6000}, {"loss": 0.7669492797851563, "grad_norm": 8.73086166381836, "learning_rate": 1.6873977873977877e-05, "epoch": 1.8759018759018757, "step": 6500}, {"eval_loss": 0.7977865934371948, "eval_accuracy": 0.6610866584890684, "eval_runtime": 95.2575, "eval_samples_per_second": 145.49, "eval_steps_per_second": 18.193, "epoch": 2.0, "step": 6930}, {"loss": 0.7564892578125, "grad_norm": 8.144824028015137, "learning_rate": 1.6633477633477635e-05, "epoch": 2.0202020202020203, "step": 7000}, {"loss": 0.7066456298828125, "grad_norm": 7.742922306060791, "learning_rate": 1.6392977392977393e-05, "epoch": 2.1645021645021645, "step": 7500}, {"loss": 0.7087574462890625, "grad_norm": 9.129960060119629, "learning_rate": 1.6152477152477154e-05, "epoch": 2.3088023088023086, "step": 8000}, {"loss": 0.7079486083984375, "grad_norm": 6.732289791107178, "learning_rate": 1.5911976911976915e-05, "epoch": 2.4531024531024532, "step": 8500}, {"loss": 0.7217780151367188, "grad_norm": 7.480606555938721, "learning_rate": 1.5671476671476673e-05, "epoch": 2.5974025974025974, "step": 9000}, {"loss": 0.7076621704101562, "grad_norm": 9.024208068847656, "learning_rate": 1.543097643097643e-05, "epoch": 2.741702741702742, "step": 9500}, {"loss": 0.7076893920898437, "grad_norm": 7.55729341506958, "learning_rate": 1.519047619047619e-05, "epoch": 2.886002886002886, "step": 10000}, {"eval_loss": 0.7794309258460999, "eval_accuracy": 0.6723428818818097, "eval_runtime": 94.7536, "eval_samples_per_second": 146.264, "eval_steps_per_second": 18.29, "epoch": 3.0, "step": 10395}, {"loss": 0.7023424072265625, "grad_norm": 9.555891036987305, "learning_rate": 1.4949975949975952e-05, "epoch": 3.0303030303030303, "step": 10500}, {"loss": 0.6563698120117187, "grad_norm": 11.651517868041992, "learning_rate": 1.4709475709475712e-05, "epoch": 3.1746031746031744, "step": 11000}, {"loss": 0.6435342407226563, "grad_norm": 10.806459426879883, "learning_rate": 1.446897546897547e-05, "epoch": 3.318903318903319, "step": 11500}, {"loss": 0.6460320434570312, "grad_norm": 8.876639366149902, "learning_rate": 1.422847522847523e-05, "epoch": 3.463203463203463, "step": 12000}, {"loss": 0.6549561157226562, "grad_norm": 8.340290069580078, "learning_rate": 1.3987974987974989e-05, "epoch": 3.6075036075036078, "step": 12500}, {"loss": 0.6424026489257812, "grad_norm": 10.572152137756348, "learning_rate": 1.374747474747475e-05, "epoch": 3.751803751803752, "step": 13000}, {"loss": 0.63374755859375, "grad_norm": 11.559617042541504, "learning_rate": 1.3506974506974508e-05, "epoch": 3.896103896103896, "step": 13500}, {"eval_loss": 0.857711136341095, "eval_accuracy": 0.668879428530197, "eval_runtime": 96.8015, "eval_samples_per_second": 143.169, "eval_steps_per_second": 17.903, "epoch": 4.0, "step": 13860}, {"loss": 0.6324700317382812, "grad_norm": 14.752991676330566, "learning_rate": 1.3266474266474268e-05, "epoch": 4.040404040404041, "step": 14000}, {"loss": 0.5762017822265625, "grad_norm": 10.972771644592285, "learning_rate": 1.3025974025974026e-05, "epoch": 4.184704184704184, "step": 14500}, {"loss": 0.5667666625976563, "grad_norm": 7.66707706451416, "learning_rate": 1.2785473785473787e-05, "epoch": 4.329004329004329, "step": 15000}, {"loss": 0.5887897338867187, "grad_norm": 10.922810554504395, "learning_rate": 1.2544973544973547e-05, "epoch": 4.473304473304474, "step": 15500}, {"loss": 0.5900814819335938, "grad_norm": 8.803988456726074, "learning_rate": 1.2304473304473306e-05, "epoch": 4.617604617604617, "step": 16000}, {"loss": 0.5956240234375, "grad_norm": 10.440567970275879, "learning_rate": 1.2063973063973064e-05, "epoch": 4.761904761904762, "step": 16500}, {"loss": 0.5703004150390625, "grad_norm": 8.805602073669434, "learning_rate": 1.1823472823472824e-05, "epoch": 4.9062049062049065, "step": 17000}, {"eval_loss": 0.9026327133178711, "eval_accuracy": 0.6661375279601703, "eval_runtime": 94.8282, "eval_samples_per_second": 146.148, "eval_steps_per_second": 18.275, "epoch": 5.0, "step": 17325}, {"loss": 0.5774053344726563, "grad_norm": 21.320392608642578, "learning_rate": 1.1582972582972585e-05, "epoch": 5.05050505050505, "step": 17500}, {"loss": 0.5199642333984374, "grad_norm": 15.322733879089355, "learning_rate": 1.1342472342472343e-05, "epoch": 5.194805194805195, "step": 18000}, {"loss": 0.5118973999023437, "grad_norm": 15.709745407104492, "learning_rate": 1.1101972101972103e-05, "epoch": 5.339105339105339, "step": 18500}, {"loss": 0.5319998779296875, "grad_norm": 9.59176254272461, "learning_rate": 1.0861471861471862e-05, "epoch": 5.483405483405483, "step": 19000}, {"loss": 0.5180421752929687, "grad_norm": 7.833465099334717, "learning_rate": 1.0620971620971623e-05, "epoch": 5.627705627705628, "step": 19500}, {"loss": 0.5134351196289062, "grad_norm": 16.85687255859375, "learning_rate": 1.0380471380471381e-05, "epoch": 5.772005772005772, "step": 20000}, {"loss": 0.5210989990234375, "grad_norm": 10.841131210327148, "learning_rate": 1.0139971139971141e-05, "epoch": 5.916305916305916, "step": 20500}, {"eval_loss": 0.9208889007568359, "eval_accuracy": 0.6724150371599682, "eval_runtime": 95.2195, "eval_samples_per_second": 145.548, "eval_steps_per_second": 18.2, "epoch": 6.0, "step": 20790}, {"loss": 0.4983470764160156, "grad_norm": 7.504997730255127, "learning_rate": 9.8994708994709e-06, "epoch": 6.0606060606060606, "step": 21000}, {"loss": 0.4519954833984375, "grad_norm": 7.674807548522949, "learning_rate": 9.65897065897066e-06, "epoch": 6.204906204906205, "step": 21500}, {"loss": 0.46082904052734375, "grad_norm": 15.928234100341797, "learning_rate": 9.41847041847042e-06, "epoch": 6.349206349206349, "step": 22000}, {"loss": 0.4500860595703125, "grad_norm": 11.936478614807129, "learning_rate": 9.17797017797018e-06, "epoch": 6.4935064935064934, "step": 22500}, {"loss": 0.4710336608886719, "grad_norm": 10.709681510925293, "learning_rate": 8.937469937469937e-06, "epoch": 6.637806637806638, "step": 23000}, {"loss": 0.4703460693359375, "grad_norm": 17.412616729736328, "learning_rate": 8.696969696969699e-06, "epoch": 6.782106782106782, "step": 23500}, {"loss": 0.4734613342285156, "grad_norm": 7.033045291900635, "learning_rate": 8.456469456469457e-06, "epoch": 6.926406926406926, "step": 24000}, {"eval_loss": 0.9502899050712585, "eval_accuracy": 0.678187459412656, "eval_runtime": 94.8078, "eval_samples_per_second": 146.18, "eval_steps_per_second": 18.279, "epoch": 7.0, "step": 24255}, {"loss": 0.42359262084960936, "grad_norm": 14.651939392089844, "learning_rate": 8.215969215969216e-06, "epoch": 7.070707070707071, "step": 24500}, {"loss": 0.41392657470703126, "grad_norm": 10.419862747192383, "learning_rate": 7.975468975468976e-06, "epoch": 7.215007215007215, "step": 25000}, {"loss": 0.40272747802734377, "grad_norm": 12.77868366241455, "learning_rate": 7.734968734968735e-06, "epoch": 7.359307359307359, "step": 25500}, {"loss": 0.40347076416015626, "grad_norm": 9.191468238830566, "learning_rate": 7.494468494468495e-06, "epoch": 7.503607503607504, "step": 26000}, {"loss": 0.41088717651367185, "grad_norm": 10.89610767364502, "learning_rate": 7.253968253968255e-06, "epoch": 7.6479076479076475, "step": 26500}, {"loss": 0.4141043090820313, "grad_norm": 9.091111183166504, "learning_rate": 7.013468013468014e-06, "epoch": 7.792207792207792, "step": 27000}, {"loss": 0.41574151611328125, "grad_norm": 13.789727210998535, "learning_rate": 6.772967772967773e-06, "epoch": 7.936507936507937, "step": 27500}, {"eval_loss": 1.0799815654754639, "eval_accuracy": 0.6711883974312721, "eval_runtime": 94.7816, "eval_samples_per_second": 146.22, "eval_steps_per_second": 18.284, "epoch": 8.0, "step": 27720}, {"loss": 0.36827951049804686, "grad_norm": 21.697254180908203, "learning_rate": 6.5324675324675335e-06, "epoch": 8.080808080808081, "step": 28000}, {"loss": 0.34379269409179686, "grad_norm": 13.43508529663086, "learning_rate": 6.291967291967292e-06, "epoch": 8.225108225108226, "step": 28500}, {"loss": 0.36548892211914064, "grad_norm": 15.518604278564453, "learning_rate": 6.051467051467052e-06, "epoch": 8.369408369408369, "step": 29000}, {"loss": 0.3516625061035156, "grad_norm": 19.21072006225586, "learning_rate": 5.8109668109668115e-06, "epoch": 8.513708513708513, "step": 29500}, {"loss": 0.3648611755371094, "grad_norm": 23.36908531188965, "learning_rate": 5.57046657046657e-06, "epoch": 8.658008658008658, "step": 30000}, {"loss": 0.3619017028808594, "grad_norm": 7.424315929412842, "learning_rate": 5.329966329966331e-06, "epoch": 8.802308802308803, "step": 30500}, {"loss": 0.3664921569824219, "grad_norm": 8.50534439086914, "learning_rate": 5.0894660894660895e-06, "epoch": 8.946608946608947, "step": 31000}, {"eval_loss": 1.1320959329605103, "eval_accuracy": 0.6696731365899415, "eval_runtime": 94.8628, "eval_samples_per_second": 146.095, "eval_steps_per_second": 18.268, "epoch": 9.0, "step": 31185}, {"loss": 0.3483741760253906, "grad_norm": 18.189367294311523, "learning_rate": 4.848965848965849e-06, "epoch": 9.090909090909092, "step": 31500}, {"loss": 0.3273468933105469, "grad_norm": 24.517826080322266, "learning_rate": 4.608465608465609e-06, "epoch": 9.235209235209235, "step": 32000}, {"loss": 0.32181439208984375, "grad_norm": 4.5538506507873535, "learning_rate": 4.367965367965368e-06, "epoch": 9.37950937950938, "step": 32500}, {"loss": 0.33180300903320314, "grad_norm": 23.3960018157959, "learning_rate": 4.127465127465128e-06, "epoch": 9.523809523809524, "step": 33000}, {"loss": 0.3186815185546875, "grad_norm": 11.066381454467773, "learning_rate": 3.8869648869648875e-06, "epoch": 9.668109668109668, "step": 33500}, {"loss": 0.31593939208984373, "grad_norm": 20.02129364013672, "learning_rate": 3.6464646464646467e-06, "epoch": 9.812409812409813, "step": 34000}, {"loss": 0.32815570068359373, "grad_norm": 10.57058048248291, "learning_rate": 3.4059644059644063e-06, "epoch": 9.956709956709958, "step": 34500}, {"eval_loss": 1.2113646268844604, "eval_accuracy": 0.668157875748611, "eval_runtime": 94.6341, "eval_samples_per_second": 146.448, "eval_steps_per_second": 18.313, "epoch": 10.0, "step": 34650}, {"train_runtime": 7135.7414, "train_samples_per_second": 93.22, "train_steps_per_second": 5.827, "total_flos": 4.250181354967296e+16, "train_loss": 0.5682026640436522, "epoch": 10.0, "step": 34650}]
 
1
+ [{"loss": 1.0481925048828125, "grad_norm": 11.313448905944824, "learning_rate": 1.975998075998076e-05, "epoch": 0.1443001443001443, "step": 500}, {"loss": 0.9450968017578125, "grad_norm": 6.68593692779541, "learning_rate": 1.951948051948052e-05, "epoch": 0.2886002886002886, "step": 1000}, {"loss": 0.8973338623046875, "grad_norm": 7.333189010620117, "learning_rate": 1.927898027898028e-05, "epoch": 0.4329004329004329, "step": 1500}, {"loss": 0.906581298828125, "grad_norm": 6.697900295257568, "learning_rate": 1.9038480038480042e-05, "epoch": 0.5772005772005772, "step": 2000}, {"loss": 0.8833408203125, "grad_norm": 6.7471113204956055, "learning_rate": 1.87979797979798e-05, "epoch": 0.7215007215007215, "step": 2500}, {"loss": 0.8657266845703125, "grad_norm": 4.354027271270752, "learning_rate": 1.8557479557479558e-05, "epoch": 0.8658008658008658, "step": 3000}, {"eval_loss": 0.8943251967430115, "eval_accuracy": 0.6080525290424995, "eval_runtime": 215.022, "eval_samples_per_second": 64.454, "eval_steps_per_second": 8.06, "epoch": 1.0, "step": 3465}, {"loss": 0.8691299438476563, "grad_norm": 8.588912010192871, "learning_rate": 1.8316979316979316e-05, "epoch": 1.0101010101010102, "step": 3500}, {"loss": 0.8413906860351562, "grad_norm": 5.346979141235352, "learning_rate": 1.8076479076479077e-05, "epoch": 1.1544011544011543, "step": 4000}, {"loss": 0.8482789916992187, "grad_norm": 7.854517459869385, "learning_rate": 1.783597883597884e-05, "epoch": 1.2987012987012987, "step": 4500}, {"loss": 0.818630859375, "grad_norm": 9.31502914428711, "learning_rate": 1.7595478595478596e-05, "epoch": 1.443001443001443, "step": 5000}, {"loss": 0.8130513305664062, "grad_norm": 7.741605281829834, "learning_rate": 1.7354978354978354e-05, "epoch": 1.5873015873015874, "step": 5500}, {"loss": 0.8138023681640625, "grad_norm": 8.144558906555176, "learning_rate": 1.7114478114478116e-05, "epoch": 1.7316017316017316, "step": 6000}, {"loss": 0.8008894653320312, "grad_norm": 8.22934341430664, "learning_rate": 1.6873977873977877e-05, "epoch": 1.8759018759018757, "step": 6500}, {"eval_loss": 0.8389391899108887, "eval_accuracy": 0.6411718017172956, "eval_runtime": 97.0885, "eval_samples_per_second": 142.746, "eval_steps_per_second": 17.85, "epoch": 2.0, "step": 6930}, {"loss": 0.7934580688476562, "grad_norm": 6.788987159729004, "learning_rate": 1.6633477633477635e-05, "epoch": 2.0202020202020203, "step": 7000}, {"loss": 0.7662904663085938, "grad_norm": 6.284256935119629, "learning_rate": 1.6392977392977393e-05, "epoch": 2.1645021645021645, "step": 7500}, {"loss": 0.7675670776367187, "grad_norm": 6.0298943519592285, "learning_rate": 1.6152477152477154e-05, "epoch": 2.3088023088023086, "step": 8000}, {"loss": 0.7645794067382813, "grad_norm": 5.4714765548706055, "learning_rate": 1.5911976911976915e-05, "epoch": 2.4531024531024532, "step": 8500}, {"loss": 0.77156787109375, "grad_norm": 7.754717826843262, "learning_rate": 1.5671476671476673e-05, "epoch": 2.5974025974025974, "step": 9000}, {"loss": 0.7640423583984375, "grad_norm": 8.135042190551758, "learning_rate": 1.543097643097643e-05, "epoch": 2.741702741702742, "step": 9500}, {"loss": 0.7590892944335937, "grad_norm": 5.458001136779785, "learning_rate": 1.519047619047619e-05, "epoch": 2.886002886002886, "step": 10000}, {"eval_loss": 0.799248218536377, "eval_accuracy": 0.6600764845948481, "eval_runtime": 96.4459, "eval_samples_per_second": 143.697, "eval_steps_per_second": 17.969, "epoch": 3.0, "step": 10395}, {"loss": 0.7619152221679687, "grad_norm": 9.924676895141602, "learning_rate": 1.4949975949975952e-05, "epoch": 3.0303030303030303, "step": 10500}, {"loss": 0.7388421630859375, "grad_norm": 6.7671074867248535, "learning_rate": 1.4709475709475712e-05, "epoch": 3.1746031746031744, "step": 11000}, {"loss": 0.7168551635742187, "grad_norm": 10.665943145751953, "learning_rate": 1.446897546897547e-05, "epoch": 3.318903318903319, "step": 11500}, {"loss": 0.7253684692382812, "grad_norm": 6.040446758270264, "learning_rate": 1.422847522847523e-05, "epoch": 3.463203463203463, "step": 12000}, {"loss": 0.7182848510742188, "grad_norm": 7.990215301513672, "learning_rate": 1.3987974987974989e-05, "epoch": 3.6075036075036078, "step": 12500}, {"loss": 0.7107592163085937, "grad_norm": 7.975357532501221, "learning_rate": 1.374747474747475e-05, "epoch": 3.751803751803752, "step": 13000}, {"loss": 0.70408544921875, "grad_norm": 10.711268424987793, "learning_rate": 1.3506974506974508e-05, "epoch": 3.896103896103896, "step": 13500}, {"eval_loss": 0.8345581889152527, "eval_accuracy": 0.6641893354498881, "eval_runtime": 96.6944, "eval_samples_per_second": 143.328, "eval_steps_per_second": 17.922, "epoch": 4.0, "step": 13860}, {"loss": 0.7015195922851563, "grad_norm": 9.744124412536621, "learning_rate": 1.3266474266474268e-05, "epoch": 4.040404040404041, "step": 14000}, {"loss": 0.6715598754882812, "grad_norm": 8.739506721496582, "learning_rate": 1.3025974025974026e-05, "epoch": 4.184704184704184, "step": 14500}, {"loss": 0.6614401245117187, "grad_norm": 7.236831188201904, "learning_rate": 1.2785473785473787e-05, "epoch": 4.329004329004329, "step": 15000}, {"loss": 0.6867154541015625, "grad_norm": 12.38715934753418, "learning_rate": 1.2544973544973547e-05, "epoch": 4.473304473304474, "step": 15500}, {"loss": 0.676771240234375, "grad_norm": 8.485615730285645, "learning_rate": 1.2304473304473306e-05, "epoch": 4.617604617604617, "step": 16000}, {"loss": 0.6862166137695312, "grad_norm": 9.019938468933105, "learning_rate": 1.2063973063973064e-05, "epoch": 4.761904761904762, "step": 16500}, {"loss": 0.6546024780273437, "grad_norm": 8.116801261901855, "learning_rate": 1.1823472823472824e-05, "epoch": 4.9062049062049065, "step": 17000}, {"eval_loss": 0.872879683971405, "eval_accuracy": 0.6649108882314742, "eval_runtime": 96.5278, "eval_samples_per_second": 143.575, "eval_steps_per_second": 17.953, "epoch": 5.0, "step": 17325}, {"train_runtime": 3634.9831, "train_samples_per_second": 182.998, "train_steps_per_second": 11.439, "total_flos": 2.125090677483648e+16, "train_loss": 0.7793612992367875, "epoch": 5.0, "step": 17325}]