finetuned-food101 / trainer_state.json
Eric Connelly
🍻 cheers
7e9f9c8 verified
Raw
History Blame Contribute Delete
322 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_metric": 0.6105344295501709,
"best_model_checkpoint": "finetuned-food101/checkpoint-16100",
"epoch": 4.0,
"eval_steps": 100,
"global_step": 16100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002484472049689441,
"grad_norm": 2.018357992172241,
"learning_rate": 0.00019987577639751553,
"loss": 4.5969,
"step": 10
},
{
"epoch": 0.004968944099378882,
"grad_norm": 1.9477064609527588,
"learning_rate": 0.00019975155279503107,
"loss": 4.5962,
"step": 20
},
{
"epoch": 0.007453416149068323,
"grad_norm": 1.6431339979171753,
"learning_rate": 0.00019962732919254659,
"loss": 4.5714,
"step": 30
},
{
"epoch": 0.009937888198757764,
"grad_norm": 1.9268441200256348,
"learning_rate": 0.0001995031055900621,
"loss": 4.5506,
"step": 40
},
{
"epoch": 0.012422360248447204,
"grad_norm": 1.8745810985565186,
"learning_rate": 0.00019937888198757767,
"loss": 4.4664,
"step": 50
},
{
"epoch": 0.014906832298136646,
"grad_norm": 1.825967788696289,
"learning_rate": 0.0001992546583850932,
"loss": 4.415,
"step": 60
},
{
"epoch": 0.017391304347826087,
"grad_norm": 1.822075366973877,
"learning_rate": 0.0001991304347826087,
"loss": 4.3765,
"step": 70
},
{
"epoch": 0.01987577639751553,
"grad_norm": 1.9246478080749512,
"learning_rate": 0.00019900621118012425,
"loss": 4.299,
"step": 80
},
{
"epoch": 0.02236024844720497,
"grad_norm": 1.8662974834442139,
"learning_rate": 0.00019888198757763977,
"loss": 4.1782,
"step": 90
},
{
"epoch": 0.024844720496894408,
"grad_norm": 2.1129419803619385,
"learning_rate": 0.00019875776397515528,
"loss": 4.1344,
"step": 100
},
{
"epoch": 0.024844720496894408,
"eval_accuracy": 0.3063451553286984,
"eval_loss": 4.030449867248535,
"eval_runtime": 87.1659,
"eval_samples_per_second": 130.361,
"eval_steps_per_second": 16.302,
"step": 100
},
{
"epoch": 0.02732919254658385,
"grad_norm": 1.8938136100769043,
"learning_rate": 0.00019863354037267082,
"loss": 4.0639,
"step": 110
},
{
"epoch": 0.02981366459627329,
"grad_norm": 2.3493857383728027,
"learning_rate": 0.00019850931677018634,
"loss": 3.9159,
"step": 120
},
{
"epoch": 0.03229813664596273,
"grad_norm": 2.3934977054595947,
"learning_rate": 0.00019838509316770186,
"loss": 3.9002,
"step": 130
},
{
"epoch": 0.034782608695652174,
"grad_norm": 2.9848217964172363,
"learning_rate": 0.0001982608695652174,
"loss": 3.8664,
"step": 140
},
{
"epoch": 0.037267080745341616,
"grad_norm": 2.182579755783081,
"learning_rate": 0.00019813664596273294,
"loss": 3.7589,
"step": 150
},
{
"epoch": 0.03975155279503106,
"grad_norm": 2.37665057182312,
"learning_rate": 0.00019801242236024846,
"loss": 3.6747,
"step": 160
},
{
"epoch": 0.0422360248447205,
"grad_norm": 2.528806447982788,
"learning_rate": 0.00019788819875776398,
"loss": 3.7115,
"step": 170
},
{
"epoch": 0.04472049689440994,
"grad_norm": 2.4230544567108154,
"learning_rate": 0.00019776397515527952,
"loss": 3.6117,
"step": 180
},
{
"epoch": 0.04720496894409938,
"grad_norm": 2.561897039413452,
"learning_rate": 0.00019763975155279504,
"loss": 3.5795,
"step": 190
},
{
"epoch": 0.049689440993788817,
"grad_norm": 2.853154420852661,
"learning_rate": 0.00019751552795031055,
"loss": 3.5328,
"step": 200
},
{
"epoch": 0.049689440993788817,
"eval_accuracy": 0.4409926955909531,
"eval_loss": 3.3728513717651367,
"eval_runtime": 88.2535,
"eval_samples_per_second": 128.754,
"eval_steps_per_second": 16.101,
"step": 200
},
{
"epoch": 0.05217391304347826,
"grad_norm": 2.532111167907715,
"learning_rate": 0.0001973913043478261,
"loss": 3.387,
"step": 210
},
{
"epoch": 0.0546583850931677,
"grad_norm": 2.5678958892822266,
"learning_rate": 0.0001972670807453416,
"loss": 3.3832,
"step": 220
},
{
"epoch": 0.05714285714285714,
"grad_norm": 2.4794390201568604,
"learning_rate": 0.0001971552795031056,
"loss": 3.3311,
"step": 230
},
{
"epoch": 0.05962732919254658,
"grad_norm": 3.4417531490325928,
"learning_rate": 0.00019703105590062112,
"loss": 3.2617,
"step": 240
},
{
"epoch": 0.062111801242236024,
"grad_norm": 3.0144076347351074,
"learning_rate": 0.00019690683229813663,
"loss": 3.043,
"step": 250
},
{
"epoch": 0.06459627329192547,
"grad_norm": 2.3258306980133057,
"learning_rate": 0.0001967826086956522,
"loss": 3.1299,
"step": 260
},
{
"epoch": 0.0670807453416149,
"grad_norm": 3.9541103839874268,
"learning_rate": 0.00019665838509316772,
"loss": 3.2333,
"step": 270
},
{
"epoch": 0.06956521739130435,
"grad_norm": 4.3033857345581055,
"learning_rate": 0.00019653416149068324,
"loss": 3.021,
"step": 280
},
{
"epoch": 0.07204968944099378,
"grad_norm": 3.252000570297241,
"learning_rate": 0.00019640993788819878,
"loss": 3.0683,
"step": 290
},
{
"epoch": 0.07453416149068323,
"grad_norm": 3.247220039367676,
"learning_rate": 0.0001962857142857143,
"loss": 2.9715,
"step": 300
},
{
"epoch": 0.07453416149068323,
"eval_accuracy": 0.5135087564903634,
"eval_loss": 2.8900182247161865,
"eval_runtime": 86.8214,
"eval_samples_per_second": 130.878,
"eval_steps_per_second": 16.367,
"step": 300
},
{
"epoch": 0.07701863354037267,
"grad_norm": 3.015491008758545,
"learning_rate": 0.00019616149068322981,
"loss": 2.8338,
"step": 310
},
{
"epoch": 0.07950310559006211,
"grad_norm": 4.734148025512695,
"learning_rate": 0.00019603726708074536,
"loss": 2.9681,
"step": 320
},
{
"epoch": 0.08198757763975155,
"grad_norm": 3.052933692932129,
"learning_rate": 0.00019591304347826087,
"loss": 2.8386,
"step": 330
},
{
"epoch": 0.084472049689441,
"grad_norm": 4.703938007354736,
"learning_rate": 0.0001957888198757764,
"loss": 2.9725,
"step": 340
},
{
"epoch": 0.08695652173913043,
"grad_norm": 2.9451019763946533,
"learning_rate": 0.00019566459627329193,
"loss": 2.8719,
"step": 350
},
{
"epoch": 0.08944099378881988,
"grad_norm": 4.3831987380981445,
"learning_rate": 0.00019554037267080748,
"loss": 2.8716,
"step": 360
},
{
"epoch": 0.09192546583850932,
"grad_norm": 3.833592176437378,
"learning_rate": 0.000195416149068323,
"loss": 2.9066,
"step": 370
},
{
"epoch": 0.09440993788819876,
"grad_norm": 4.050900936126709,
"learning_rate": 0.0001952919254658385,
"loss": 2.6445,
"step": 380
},
{
"epoch": 0.0968944099378882,
"grad_norm": 4.814563274383545,
"learning_rate": 0.00019516770186335405,
"loss": 2.6455,
"step": 390
},
{
"epoch": 0.09937888198757763,
"grad_norm": 5.039762496948242,
"learning_rate": 0.00019505590062111802,
"loss": 2.724,
"step": 400
},
{
"epoch": 0.09937888198757763,
"eval_accuracy": 0.5443104813869577,
"eval_loss": 2.509587526321411,
"eval_runtime": 87.6766,
"eval_samples_per_second": 129.601,
"eval_steps_per_second": 16.207,
"step": 400
},
{
"epoch": 0.10186335403726708,
"grad_norm": 5.771543025970459,
"learning_rate": 0.00019493167701863356,
"loss": 2.6617,
"step": 410
},
{
"epoch": 0.10434782608695652,
"grad_norm": 3.382282257080078,
"learning_rate": 0.00019480745341614908,
"loss": 2.6631,
"step": 420
},
{
"epoch": 0.10683229813664596,
"grad_norm": 3.872953176498413,
"learning_rate": 0.0001946832298136646,
"loss": 2.5117,
"step": 430
},
{
"epoch": 0.1093167701863354,
"grad_norm": 3.881727695465088,
"learning_rate": 0.00019455900621118014,
"loss": 2.4816,
"step": 440
},
{
"epoch": 0.11180124223602485,
"grad_norm": 4.131108283996582,
"learning_rate": 0.00019443478260869565,
"loss": 2.534,
"step": 450
},
{
"epoch": 0.11428571428571428,
"grad_norm": 3.308680772781372,
"learning_rate": 0.00019431055900621117,
"loss": 2.4314,
"step": 460
},
{
"epoch": 0.11677018633540373,
"grad_norm": 7.087298393249512,
"learning_rate": 0.00019418633540372674,
"loss": 2.4269,
"step": 470
},
{
"epoch": 0.11925465838509317,
"grad_norm": 5.214663505554199,
"learning_rate": 0.00019406211180124225,
"loss": 2.2572,
"step": 480
},
{
"epoch": 0.12173913043478261,
"grad_norm": 5.976667881011963,
"learning_rate": 0.00019393788819875777,
"loss": 2.4425,
"step": 490
},
{
"epoch": 0.12422360248447205,
"grad_norm": 5.982608795166016,
"learning_rate": 0.00019381366459627331,
"loss": 2.311,
"step": 500
},
{
"epoch": 0.12422360248447205,
"eval_accuracy": 0.5894570095925372,
"eval_loss": 2.1726009845733643,
"eval_runtime": 87.1828,
"eval_samples_per_second": 130.335,
"eval_steps_per_second": 16.299,
"step": 500
},
{
"epoch": 0.1267080745341615,
"grad_norm": 5.053837776184082,
"learning_rate": 0.00019368944099378883,
"loss": 2.2082,
"step": 510
},
{
"epoch": 0.12919254658385093,
"grad_norm": 6.473962306976318,
"learning_rate": 0.00019356521739130435,
"loss": 2.2111,
"step": 520
},
{
"epoch": 0.13167701863354037,
"grad_norm": 6.132943153381348,
"learning_rate": 0.0001934409937888199,
"loss": 2.356,
"step": 530
},
{
"epoch": 0.1341614906832298,
"grad_norm": 3.197087287902832,
"learning_rate": 0.0001933167701863354,
"loss": 2.1868,
"step": 540
},
{
"epoch": 0.13664596273291926,
"grad_norm": 6.199575901031494,
"learning_rate": 0.00019319254658385092,
"loss": 2.4575,
"step": 550
},
{
"epoch": 0.1391304347826087,
"grad_norm": 4.699795722961426,
"learning_rate": 0.00019306832298136647,
"loss": 2.3983,
"step": 560
},
{
"epoch": 0.14161490683229813,
"grad_norm": 5.361752510070801,
"learning_rate": 0.000192944099378882,
"loss": 2.218,
"step": 570
},
{
"epoch": 0.14409937888198757,
"grad_norm": 4.245269775390625,
"learning_rate": 0.00019281987577639753,
"loss": 1.9794,
"step": 580
},
{
"epoch": 0.14658385093167703,
"grad_norm": 2.9164280891418457,
"learning_rate": 0.00019269565217391304,
"loss": 2.1541,
"step": 590
},
{
"epoch": 0.14906832298136646,
"grad_norm": 3.7694873809814453,
"learning_rate": 0.00019257142857142859,
"loss": 2.266,
"step": 600
},
{
"epoch": 0.14906832298136646,
"eval_accuracy": 0.5879609258118454,
"eval_loss": 2.0223026275634766,
"eval_runtime": 88.2805,
"eval_samples_per_second": 128.715,
"eval_steps_per_second": 16.096,
"step": 600
},
{
"epoch": 0.1515527950310559,
"grad_norm": 4.551809787750244,
"learning_rate": 0.0001924472049689441,
"loss": 2.1348,
"step": 610
},
{
"epoch": 0.15403726708074533,
"grad_norm": 5.469175815582275,
"learning_rate": 0.00019232298136645962,
"loss": 2.0839,
"step": 620
},
{
"epoch": 0.1565217391304348,
"grad_norm": 5.535090923309326,
"learning_rate": 0.00019219875776397516,
"loss": 2.0028,
"step": 630
},
{
"epoch": 0.15900621118012423,
"grad_norm": 5.28466272354126,
"learning_rate": 0.00019207453416149068,
"loss": 2.3083,
"step": 640
},
{
"epoch": 0.16149068322981366,
"grad_norm": 7.3980488777160645,
"learning_rate": 0.00019195031055900622,
"loss": 2.1914,
"step": 650
},
{
"epoch": 0.1639751552795031,
"grad_norm": 5.99133825302124,
"learning_rate": 0.00019182608695652177,
"loss": 2.3663,
"step": 660
},
{
"epoch": 0.16645962732919253,
"grad_norm": 4.15263032913208,
"learning_rate": 0.00019170186335403728,
"loss": 1.9666,
"step": 670
},
{
"epoch": 0.168944099378882,
"grad_norm": 4.62333345413208,
"learning_rate": 0.0001915776397515528,
"loss": 2.1487,
"step": 680
},
{
"epoch": 0.17142857142857143,
"grad_norm": 8.580528259277344,
"learning_rate": 0.00019145341614906834,
"loss": 2.0729,
"step": 690
},
{
"epoch": 0.17391304347826086,
"grad_norm": 7.049954891204834,
"learning_rate": 0.00019132919254658386,
"loss": 1.9671,
"step": 700
},
{
"epoch": 0.17391304347826086,
"eval_accuracy": 0.633019449089149,
"eval_loss": 1.758486270904541,
"eval_runtime": 88.0658,
"eval_samples_per_second": 129.028,
"eval_steps_per_second": 16.136,
"step": 700
},
{
"epoch": 0.1763975155279503,
"grad_norm": 5.929836750030518,
"learning_rate": 0.00019120496894409937,
"loss": 1.9726,
"step": 710
},
{
"epoch": 0.17888198757763976,
"grad_norm": 4.58709716796875,
"learning_rate": 0.00019108074534161492,
"loss": 1.9319,
"step": 720
},
{
"epoch": 0.1813664596273292,
"grad_norm": 6.737441539764404,
"learning_rate": 0.00019095652173913043,
"loss": 2.0524,
"step": 730
},
{
"epoch": 0.18385093167701863,
"grad_norm": 8.844467163085938,
"learning_rate": 0.00019083229813664598,
"loss": 2.1296,
"step": 740
},
{
"epoch": 0.18633540372670807,
"grad_norm": 5.9616780281066895,
"learning_rate": 0.0001907080745341615,
"loss": 1.8757,
"step": 750
},
{
"epoch": 0.18881987577639753,
"grad_norm": 7.684135437011719,
"learning_rate": 0.00019058385093167704,
"loss": 1.8596,
"step": 760
},
{
"epoch": 0.19130434782608696,
"grad_norm": 4.873102188110352,
"learning_rate": 0.00019045962732919255,
"loss": 1.9921,
"step": 770
},
{
"epoch": 0.1937888198757764,
"grad_norm": 3.7490782737731934,
"learning_rate": 0.00019033540372670807,
"loss": 2.0498,
"step": 780
},
{
"epoch": 0.19627329192546583,
"grad_norm": 5.863892078399658,
"learning_rate": 0.00019021118012422361,
"loss": 1.7348,
"step": 790
},
{
"epoch": 0.19875776397515527,
"grad_norm": 7.632678985595703,
"learning_rate": 0.00019008695652173913,
"loss": 1.8617,
"step": 800
},
{
"epoch": 0.19875776397515527,
"eval_accuracy": 0.6212267887001672,
"eval_loss": 1.7300000190734863,
"eval_runtime": 88.4568,
"eval_samples_per_second": 128.458,
"eval_steps_per_second": 16.064,
"step": 800
},
{
"epoch": 0.20124223602484473,
"grad_norm": 8.62378215789795,
"learning_rate": 0.00018996273291925467,
"loss": 1.7559,
"step": 810
},
{
"epoch": 0.20372670807453416,
"grad_norm": 7.463620662689209,
"learning_rate": 0.0001898385093167702,
"loss": 2.0599,
"step": 820
},
{
"epoch": 0.2062111801242236,
"grad_norm": 6.657968044281006,
"learning_rate": 0.00018971428571428573,
"loss": 1.6052,
"step": 830
},
{
"epoch": 0.20869565217391303,
"grad_norm": 6.594502925872803,
"learning_rate": 0.00018959006211180125,
"loss": 1.6008,
"step": 840
},
{
"epoch": 0.2111801242236025,
"grad_norm": 5.336763858795166,
"learning_rate": 0.0001894658385093168,
"loss": 1.8464,
"step": 850
},
{
"epoch": 0.21366459627329193,
"grad_norm": 5.568216323852539,
"learning_rate": 0.0001893416149068323,
"loss": 1.8365,
"step": 860
},
{
"epoch": 0.21614906832298136,
"grad_norm": 5.7065510749816895,
"learning_rate": 0.00018921739130434783,
"loss": 1.8583,
"step": 870
},
{
"epoch": 0.2186335403726708,
"grad_norm": 6.466409206390381,
"learning_rate": 0.00018909316770186337,
"loss": 1.6582,
"step": 880
},
{
"epoch": 0.22111801242236026,
"grad_norm": 5.712678909301758,
"learning_rate": 0.00018896894409937889,
"loss": 1.9344,
"step": 890
},
{
"epoch": 0.2236024844720497,
"grad_norm": 4.358852863311768,
"learning_rate": 0.0001888447204968944,
"loss": 1.4694,
"step": 900
},
{
"epoch": 0.2236024844720497,
"eval_accuracy": 0.6077620346739417,
"eval_loss": 1.7506581544876099,
"eval_runtime": 87.3994,
"eval_samples_per_second": 130.012,
"eval_steps_per_second": 16.259,
"step": 900
},
{
"epoch": 0.22608695652173913,
"grad_norm": 7.161348342895508,
"learning_rate": 0.00018872049689440995,
"loss": 2.003,
"step": 910
},
{
"epoch": 0.22857142857142856,
"grad_norm": 8.397992134094238,
"learning_rate": 0.0001885962732919255,
"loss": 1.7533,
"step": 920
},
{
"epoch": 0.231055900621118,
"grad_norm": 8.75161075592041,
"learning_rate": 0.000188472049689441,
"loss": 1.7335,
"step": 930
},
{
"epoch": 0.23354037267080746,
"grad_norm": 3.9503304958343506,
"learning_rate": 0.00018834782608695655,
"loss": 1.6272,
"step": 940
},
{
"epoch": 0.2360248447204969,
"grad_norm": 9.528467178344727,
"learning_rate": 0.00018822360248447206,
"loss": 1.9007,
"step": 950
},
{
"epoch": 0.23850931677018633,
"grad_norm": 10.89683723449707,
"learning_rate": 0.00018809937888198758,
"loss": 1.6834,
"step": 960
},
{
"epoch": 0.24099378881987576,
"grad_norm": 5.9737629890441895,
"learning_rate": 0.00018797515527950312,
"loss": 1.9189,
"step": 970
},
{
"epoch": 0.24347826086956523,
"grad_norm": 5.383342266082764,
"learning_rate": 0.00018785093167701864,
"loss": 1.8391,
"step": 980
},
{
"epoch": 0.24596273291925466,
"grad_norm": 5.408697605133057,
"learning_rate": 0.00018772670807453416,
"loss": 1.7161,
"step": 990
},
{
"epoch": 0.2484472049689441,
"grad_norm": 8.349679946899414,
"learning_rate": 0.0001876024844720497,
"loss": 1.7876,
"step": 1000
},
{
"epoch": 0.2484472049689441,
"eval_accuracy": 0.6133063451553287,
"eval_loss": 1.6519758701324463,
"eval_runtime": 87.6336,
"eval_samples_per_second": 129.665,
"eval_steps_per_second": 16.215,
"step": 1000
},
{
"epoch": 0.25093167701863356,
"grad_norm": 7.187140464782715,
"learning_rate": 0.00018747826086956524,
"loss": 1.8637,
"step": 1010
},
{
"epoch": 0.253416149068323,
"grad_norm": 4.753952503204346,
"learning_rate": 0.00018735403726708076,
"loss": 1.9234,
"step": 1020
},
{
"epoch": 0.25590062111801243,
"grad_norm": 5.245208740234375,
"learning_rate": 0.00018722981366459628,
"loss": 1.6968,
"step": 1030
},
{
"epoch": 0.25838509316770186,
"grad_norm": 4.8791351318359375,
"learning_rate": 0.00018710559006211182,
"loss": 1.4784,
"step": 1040
},
{
"epoch": 0.2608695652173913,
"grad_norm": 9.694734573364258,
"learning_rate": 0.00018698136645962734,
"loss": 1.6259,
"step": 1050
},
{
"epoch": 0.26335403726708073,
"grad_norm": 9.020699501037598,
"learning_rate": 0.00018685714285714285,
"loss": 1.7696,
"step": 1060
},
{
"epoch": 0.26583850931677017,
"grad_norm": 7.134639739990234,
"learning_rate": 0.0001867329192546584,
"loss": 1.8738,
"step": 1070
},
{
"epoch": 0.2683229813664596,
"grad_norm": 6.925185680389404,
"learning_rate": 0.0001866086956521739,
"loss": 1.6153,
"step": 1080
},
{
"epoch": 0.2708074534161491,
"grad_norm": 6.5511579513549805,
"learning_rate": 0.00018648447204968943,
"loss": 1.8047,
"step": 1090
},
{
"epoch": 0.2732919254658385,
"grad_norm": 3.910539150238037,
"learning_rate": 0.000186360248447205,
"loss": 1.7647,
"step": 1100
},
{
"epoch": 0.2732919254658385,
"eval_accuracy": 0.659772947285048,
"eval_loss": 1.4576257467269897,
"eval_runtime": 86.6742,
"eval_samples_per_second": 131.1,
"eval_steps_per_second": 16.395,
"step": 1100
},
{
"epoch": 0.27577639751552796,
"grad_norm": 5.463332176208496,
"learning_rate": 0.00018623602484472052,
"loss": 1.6722,
"step": 1110
},
{
"epoch": 0.2782608695652174,
"grad_norm": 5.566735744476318,
"learning_rate": 0.00018611180124223603,
"loss": 1.734,
"step": 1120
},
{
"epoch": 0.28074534161490683,
"grad_norm": 8.45088005065918,
"learning_rate": 0.00018598757763975158,
"loss": 1.7612,
"step": 1130
},
{
"epoch": 0.28322981366459626,
"grad_norm": 6.647975444793701,
"learning_rate": 0.0001858633540372671,
"loss": 1.6728,
"step": 1140
},
{
"epoch": 0.2857142857142857,
"grad_norm": 5.041713714599609,
"learning_rate": 0.0001857391304347826,
"loss": 1.6758,
"step": 1150
},
{
"epoch": 0.28819875776397513,
"grad_norm": 8.309142112731934,
"learning_rate": 0.00018561490683229815,
"loss": 1.5707,
"step": 1160
},
{
"epoch": 0.2906832298136646,
"grad_norm": 8.672463417053223,
"learning_rate": 0.00018549068322981367,
"loss": 1.6847,
"step": 1170
},
{
"epoch": 0.29316770186335406,
"grad_norm": 8.018989562988281,
"learning_rate": 0.00018536645962732918,
"loss": 1.3782,
"step": 1180
},
{
"epoch": 0.2956521739130435,
"grad_norm": 6.475429058074951,
"learning_rate": 0.00018524223602484473,
"loss": 1.5442,
"step": 1190
},
{
"epoch": 0.2981366459627329,
"grad_norm": 5.768404006958008,
"learning_rate": 0.00018511801242236027,
"loss": 1.7,
"step": 1200
},
{
"epoch": 0.2981366459627329,
"eval_accuracy": 0.6576608290064243,
"eval_loss": 1.4419533014297485,
"eval_runtime": 86.3614,
"eval_samples_per_second": 131.575,
"eval_steps_per_second": 16.454,
"step": 1200
},
{
"epoch": 0.30062111801242236,
"grad_norm": 4.549999713897705,
"learning_rate": 0.0001849937888198758,
"loss": 1.8302,
"step": 1210
},
{
"epoch": 0.3031055900621118,
"grad_norm": 9.671154022216797,
"learning_rate": 0.0001848695652173913,
"loss": 1.5977,
"step": 1220
},
{
"epoch": 0.30559006211180123,
"grad_norm": 5.3373494148254395,
"learning_rate": 0.00018474534161490685,
"loss": 1.541,
"step": 1230
},
{
"epoch": 0.30807453416149067,
"grad_norm": 4.874505043029785,
"learning_rate": 0.00018462111801242236,
"loss": 1.6999,
"step": 1240
},
{
"epoch": 0.3105590062111801,
"grad_norm": 7.157403945922852,
"learning_rate": 0.00018449689440993788,
"loss": 1.8442,
"step": 1250
},
{
"epoch": 0.3130434782608696,
"grad_norm": 7.489334583282471,
"learning_rate": 0.00018437267080745342,
"loss": 1.7671,
"step": 1260
},
{
"epoch": 0.315527950310559,
"grad_norm": 9.33269214630127,
"learning_rate": 0.00018424844720496894,
"loss": 1.6574,
"step": 1270
},
{
"epoch": 0.31801242236024846,
"grad_norm": 4.2884697914123535,
"learning_rate": 0.00018412422360248448,
"loss": 1.5512,
"step": 1280
},
{
"epoch": 0.3204968944099379,
"grad_norm": 8.707039833068848,
"learning_rate": 0.00018400000000000003,
"loss": 1.8651,
"step": 1290
},
{
"epoch": 0.32298136645962733,
"grad_norm": 5.426664352416992,
"learning_rate": 0.00018387577639751554,
"loss": 1.533,
"step": 1300
},
{
"epoch": 0.32298136645962733,
"eval_accuracy": 0.6537006072340051,
"eval_loss": 1.4389325380325317,
"eval_runtime": 86.5703,
"eval_samples_per_second": 131.257,
"eval_steps_per_second": 16.414,
"step": 1300
},
{
"epoch": 0.32546583850931676,
"grad_norm": 6.7798171043396,
"learning_rate": 0.00018375155279503106,
"loss": 1.7068,
"step": 1310
},
{
"epoch": 0.3279503105590062,
"grad_norm": 4.650680065155029,
"learning_rate": 0.0001836273291925466,
"loss": 1.3869,
"step": 1320
},
{
"epoch": 0.33043478260869563,
"grad_norm": 7.123183250427246,
"learning_rate": 0.00018350310559006212,
"loss": 1.6407,
"step": 1330
},
{
"epoch": 0.33291925465838507,
"grad_norm": 5.242658615112305,
"learning_rate": 0.00018337888198757764,
"loss": 1.5,
"step": 1340
},
{
"epoch": 0.33540372670807456,
"grad_norm": 8.704155921936035,
"learning_rate": 0.00018325465838509318,
"loss": 1.5082,
"step": 1350
},
{
"epoch": 0.337888198757764,
"grad_norm": 5.923374176025391,
"learning_rate": 0.0001831304347826087,
"loss": 1.5168,
"step": 1360
},
{
"epoch": 0.3403726708074534,
"grad_norm": 7.103471279144287,
"learning_rate": 0.00018300621118012424,
"loss": 1.5021,
"step": 1370
},
{
"epoch": 0.34285714285714286,
"grad_norm": 7.775028228759766,
"learning_rate": 0.00018288198757763976,
"loss": 1.5028,
"step": 1380
},
{
"epoch": 0.3453416149068323,
"grad_norm": 5.6988606452941895,
"learning_rate": 0.0001827577639751553,
"loss": 1.556,
"step": 1390
},
{
"epoch": 0.34782608695652173,
"grad_norm": 7.056687831878662,
"learning_rate": 0.00018263354037267082,
"loss": 1.3895,
"step": 1400
},
{
"epoch": 0.34782608695652173,
"eval_accuracy": 0.6587168881457361,
"eval_loss": 1.4178403615951538,
"eval_runtime": 88.3555,
"eval_samples_per_second": 128.606,
"eval_steps_per_second": 16.083,
"step": 1400
},
{
"epoch": 0.35031055900621116,
"grad_norm": 8.281564712524414,
"learning_rate": 0.00018250931677018633,
"loss": 1.5364,
"step": 1410
},
{
"epoch": 0.3527950310559006,
"grad_norm": 6.474056243896484,
"learning_rate": 0.00018238509316770188,
"loss": 1.6628,
"step": 1420
},
{
"epoch": 0.3552795031055901,
"grad_norm": 7.75063943862915,
"learning_rate": 0.0001822608695652174,
"loss": 1.4784,
"step": 1430
},
{
"epoch": 0.3577639751552795,
"grad_norm": 6.833581447601318,
"learning_rate": 0.0001821366459627329,
"loss": 1.4988,
"step": 1440
},
{
"epoch": 0.36024844720496896,
"grad_norm": 7.43401575088501,
"learning_rate": 0.00018201242236024845,
"loss": 1.4361,
"step": 1450
},
{
"epoch": 0.3627329192546584,
"grad_norm": 5.032355308532715,
"learning_rate": 0.000181888198757764,
"loss": 1.3549,
"step": 1460
},
{
"epoch": 0.3652173913043478,
"grad_norm": 9.350013732910156,
"learning_rate": 0.0001817639751552795,
"loss": 1.4264,
"step": 1470
},
{
"epoch": 0.36770186335403726,
"grad_norm": 9.7288818359375,
"learning_rate": 0.00018163975155279505,
"loss": 1.5719,
"step": 1480
},
{
"epoch": 0.3701863354037267,
"grad_norm": 9.518999099731445,
"learning_rate": 0.00018151552795031057,
"loss": 1.6384,
"step": 1490
},
{
"epoch": 0.37267080745341613,
"grad_norm": NaN,
"learning_rate": 0.00018140372670807456,
"loss": 1.5497,
"step": 1500
},
{
"epoch": 0.37267080745341613,
"eval_accuracy": 0.6860864208395671,
"eval_loss": 1.304831624031067,
"eval_runtime": 87.6832,
"eval_samples_per_second": 129.592,
"eval_steps_per_second": 16.206,
"step": 1500
},
{
"epoch": 0.37515527950310557,
"grad_norm": 7.9868292808532715,
"learning_rate": 0.00018127950310559008,
"loss": 1.3945,
"step": 1510
},
{
"epoch": 0.37763975155279506,
"grad_norm": 5.725738525390625,
"learning_rate": 0.0001811552795031056,
"loss": 1.7253,
"step": 1520
},
{
"epoch": 0.3801242236024845,
"grad_norm": 7.441699028015137,
"learning_rate": 0.00018103105590062114,
"loss": 1.4803,
"step": 1530
},
{
"epoch": 0.3826086956521739,
"grad_norm": 8.466215133666992,
"learning_rate": 0.00018090683229813665,
"loss": 1.4203,
"step": 1540
},
{
"epoch": 0.38509316770186336,
"grad_norm": 6.456714630126953,
"learning_rate": 0.00018078260869565217,
"loss": 1.6594,
"step": 1550
},
{
"epoch": 0.3875776397515528,
"grad_norm": 7.831303596496582,
"learning_rate": 0.0001806583850931677,
"loss": 1.4667,
"step": 1560
},
{
"epoch": 0.39006211180124223,
"grad_norm": 5.758781909942627,
"learning_rate": 0.00018053416149068323,
"loss": 1.651,
"step": 1570
},
{
"epoch": 0.39254658385093166,
"grad_norm": 8.013723373413086,
"learning_rate": 0.00018040993788819877,
"loss": 1.3823,
"step": 1580
},
{
"epoch": 0.3950310559006211,
"grad_norm": 4.54691219329834,
"learning_rate": 0.00018028571428571432,
"loss": 1.6822,
"step": 1590
},
{
"epoch": 0.39751552795031053,
"grad_norm": 5.699431419372559,
"learning_rate": 0.00018016149068322983,
"loss": 1.3327,
"step": 1600
},
{
"epoch": 0.39751552795031053,
"eval_accuracy": 0.6713895978174778,
"eval_loss": 1.3360953330993652,
"eval_runtime": 87.1032,
"eval_samples_per_second": 130.454,
"eval_steps_per_second": 16.314,
"step": 1600
},
{
"epoch": 0.4,
"grad_norm": 4.3417205810546875,
"learning_rate": 0.00018003726708074535,
"loss": 1.5109,
"step": 1610
},
{
"epoch": 0.40248447204968946,
"grad_norm": 7.195901870727539,
"learning_rate": 0.0001799130434782609,
"loss": 1.4802,
"step": 1620
},
{
"epoch": 0.4049689440993789,
"grad_norm": 8.806529998779297,
"learning_rate": 0.0001797888198757764,
"loss": 1.5731,
"step": 1630
},
{
"epoch": 0.4074534161490683,
"grad_norm": 6.9273834228515625,
"learning_rate": 0.00017966459627329192,
"loss": 1.5988,
"step": 1640
},
{
"epoch": 0.40993788819875776,
"grad_norm": 5.9617838859558105,
"learning_rate": 0.00017954037267080747,
"loss": 1.6041,
"step": 1650
},
{
"epoch": 0.4124223602484472,
"grad_norm": 5.656233787536621,
"learning_rate": 0.00017941614906832298,
"loss": 1.6649,
"step": 1660
},
{
"epoch": 0.41490683229813663,
"grad_norm": 5.794583797454834,
"learning_rate": 0.00017929192546583853,
"loss": 1.5536,
"step": 1670
},
{
"epoch": 0.41739130434782606,
"grad_norm": 7.5949320793151855,
"learning_rate": 0.00017916770186335404,
"loss": 1.7431,
"step": 1680
},
{
"epoch": 0.41987577639751555,
"grad_norm": 4.496397972106934,
"learning_rate": 0.0001790434782608696,
"loss": 1.6657,
"step": 1690
},
{
"epoch": 0.422360248447205,
"grad_norm": 5.932600498199463,
"learning_rate": 0.0001789192546583851,
"loss": 1.53,
"step": 1700
},
{
"epoch": 0.422360248447205,
"eval_accuracy": 0.6697175041802341,
"eval_loss": 1.3424873352050781,
"eval_runtime": 86.0547,
"eval_samples_per_second": 132.044,
"eval_steps_per_second": 16.513,
"step": 1700
},
{
"epoch": 0.4248447204968944,
"grad_norm": 5.496968746185303,
"learning_rate": 0.00017879503105590062,
"loss": 1.5811,
"step": 1710
},
{
"epoch": 0.42732919254658386,
"grad_norm": 5.838241100311279,
"learning_rate": 0.00017867080745341616,
"loss": 1.2809,
"step": 1720
},
{
"epoch": 0.4298136645962733,
"grad_norm": 8.081803321838379,
"learning_rate": 0.00017854658385093168,
"loss": 1.5387,
"step": 1730
},
{
"epoch": 0.4322981366459627,
"grad_norm": 5.952935218811035,
"learning_rate": 0.0001784223602484472,
"loss": 1.5652,
"step": 1740
},
{
"epoch": 0.43478260869565216,
"grad_norm": 8.004572868347168,
"learning_rate": 0.00017829813664596274,
"loss": 1.4191,
"step": 1750
},
{
"epoch": 0.4372670807453416,
"grad_norm": 7.268871784210205,
"learning_rate": 0.00017817391304347828,
"loss": 1.2636,
"step": 1760
},
{
"epoch": 0.43975155279503103,
"grad_norm": 6.050431251525879,
"learning_rate": 0.0001780496894409938,
"loss": 1.3059,
"step": 1770
},
{
"epoch": 0.4422360248447205,
"grad_norm": 6.983301639556885,
"learning_rate": 0.00017792546583850934,
"loss": 1.6516,
"step": 1780
},
{
"epoch": 0.44472049689440996,
"grad_norm": 11.398016929626465,
"learning_rate": 0.00017780124223602486,
"loss": 1.3813,
"step": 1790
},
{
"epoch": 0.4472049689440994,
"grad_norm": 7.321614742279053,
"learning_rate": 0.00017767701863354038,
"loss": 1.538,
"step": 1800
},
{
"epoch": 0.4472049689440994,
"eval_accuracy": 0.6641731936988471,
"eval_loss": 1.3452919721603394,
"eval_runtime": 88.8223,
"eval_samples_per_second": 127.93,
"eval_steps_per_second": 15.998,
"step": 1800
},
{
"epoch": 0.4496894409937888,
"grad_norm": 3.871507167816162,
"learning_rate": 0.00017755279503105592,
"loss": 1.2088,
"step": 1810
},
{
"epoch": 0.45217391304347826,
"grad_norm": 5.824620723724365,
"learning_rate": 0.00017742857142857144,
"loss": 1.5872,
"step": 1820
},
{
"epoch": 0.4546583850931677,
"grad_norm": 6.564426422119141,
"learning_rate": 0.00017730434782608695,
"loss": 1.3216,
"step": 1830
},
{
"epoch": 0.45714285714285713,
"grad_norm": 6.470206260681152,
"learning_rate": 0.0001771801242236025,
"loss": 1.2494,
"step": 1840
},
{
"epoch": 0.45962732919254656,
"grad_norm": 9.240300178527832,
"learning_rate": 0.00017705590062111804,
"loss": 1.7409,
"step": 1850
},
{
"epoch": 0.462111801242236,
"grad_norm": 8.439705848693848,
"learning_rate": 0.00017693167701863356,
"loss": 1.5075,
"step": 1860
},
{
"epoch": 0.4645962732919255,
"grad_norm": 6.919085502624512,
"learning_rate": 0.00017680745341614907,
"loss": 1.4267,
"step": 1870
},
{
"epoch": 0.4670807453416149,
"grad_norm": 5.995780944824219,
"learning_rate": 0.00017668322981366461,
"loss": 1.5704,
"step": 1880
},
{
"epoch": 0.46956521739130436,
"grad_norm": 6.788804531097412,
"learning_rate": 0.00017655900621118013,
"loss": 1.2365,
"step": 1890
},
{
"epoch": 0.4720496894409938,
"grad_norm": 6.92108678817749,
"learning_rate": 0.00017643478260869565,
"loss": 1.5056,
"step": 1900
},
{
"epoch": 0.4720496894409938,
"eval_accuracy": 0.6783419871512805,
"eval_loss": 1.2742019891738892,
"eval_runtime": 87.1221,
"eval_samples_per_second": 130.426,
"eval_steps_per_second": 16.31,
"step": 1900
},
{
"epoch": 0.4745341614906832,
"grad_norm": 8.66635513305664,
"learning_rate": 0.0001763105590062112,
"loss": 1.547,
"step": 1910
},
{
"epoch": 0.47701863354037266,
"grad_norm": 5.245086193084717,
"learning_rate": 0.0001761863354037267,
"loss": 1.441,
"step": 1920
},
{
"epoch": 0.4795031055900621,
"grad_norm": 6.949382781982422,
"learning_rate": 0.00017606211180124222,
"loss": 1.5288,
"step": 1930
},
{
"epoch": 0.48198757763975153,
"grad_norm": 9.583054542541504,
"learning_rate": 0.0001759378881987578,
"loss": 1.1384,
"step": 1940
},
{
"epoch": 0.484472049689441,
"grad_norm": 5.83560037612915,
"learning_rate": 0.0001758136645962733,
"loss": 1.2672,
"step": 1950
},
{
"epoch": 0.48695652173913045,
"grad_norm": 6.719588756561279,
"learning_rate": 0.00017568944099378883,
"loss": 1.4713,
"step": 1960
},
{
"epoch": 0.4894409937888199,
"grad_norm": 5.651910781860352,
"learning_rate": 0.00017556521739130437,
"loss": 1.6415,
"step": 1970
},
{
"epoch": 0.4919254658385093,
"grad_norm": 5.4755706787109375,
"learning_rate": 0.0001754409937888199,
"loss": 1.4491,
"step": 1980
},
{
"epoch": 0.49440993788819876,
"grad_norm": 4.658782482147217,
"learning_rate": 0.0001753167701863354,
"loss": 1.379,
"step": 1990
},
{
"epoch": 0.4968944099378882,
"grad_norm": 7.050572872161865,
"learning_rate": 0.00017519254658385095,
"loss": 1.2728,
"step": 2000
},
{
"epoch": 0.4968944099378882,
"eval_accuracy": 0.7044794508492476,
"eval_loss": 1.1779495477676392,
"eval_runtime": 87.0589,
"eval_samples_per_second": 130.521,
"eval_steps_per_second": 16.322,
"step": 2000
},
{
"epoch": 0.4993788819875776,
"grad_norm": 7.556181907653809,
"learning_rate": 0.00017506832298136646,
"loss": 1.5583,
"step": 2010
},
{
"epoch": 0.5018633540372671,
"grad_norm": 7.117518901824951,
"learning_rate": 0.00017494409937888198,
"loss": 1.6017,
"step": 2020
},
{
"epoch": 0.5043478260869565,
"grad_norm": 6.174365043640137,
"learning_rate": 0.00017481987577639752,
"loss": 1.4675,
"step": 2030
},
{
"epoch": 0.506832298136646,
"grad_norm": 6.404329299926758,
"learning_rate": 0.00017469565217391307,
"loss": 1.5378,
"step": 2040
},
{
"epoch": 0.5093167701863354,
"grad_norm": 8.110492706298828,
"learning_rate": 0.00017457142857142858,
"loss": 1.488,
"step": 2050
},
{
"epoch": 0.5118012422360249,
"grad_norm": 3.424097776412964,
"learning_rate": 0.0001744472049689441,
"loss": 1.2121,
"step": 2060
},
{
"epoch": 0.5142857142857142,
"grad_norm": 5.714499473571777,
"learning_rate": 0.00017432298136645964,
"loss": 1.2844,
"step": 2070
},
{
"epoch": 0.5167701863354037,
"grad_norm": 8.632834434509277,
"learning_rate": 0.00017419875776397516,
"loss": 1.2707,
"step": 2080
},
{
"epoch": 0.5192546583850932,
"grad_norm": 7.8250956535339355,
"learning_rate": 0.00017407453416149067,
"loss": 1.4057,
"step": 2090
},
{
"epoch": 0.5217391304347826,
"grad_norm": 6.396978855133057,
"learning_rate": 0.00017395031055900622,
"loss": 1.1734,
"step": 2100
},
{
"epoch": 0.5217391304347826,
"eval_accuracy": 0.680806125143008,
"eval_loss": 1.2630212306976318,
"eval_runtime": 87.1325,
"eval_samples_per_second": 130.411,
"eval_steps_per_second": 16.309,
"step": 2100
},
{
"epoch": 0.5242236024844721,
"grad_norm": 4.478389739990234,
"learning_rate": 0.00017382608695652173,
"loss": 1.6825,
"step": 2110
},
{
"epoch": 0.5267080745341615,
"grad_norm": 5.685409069061279,
"learning_rate": 0.00017370186335403728,
"loss": 1.1221,
"step": 2120
},
{
"epoch": 0.529192546583851,
"grad_norm": 7.367899417877197,
"learning_rate": 0.00017357763975155282,
"loss": 1.537,
"step": 2130
},
{
"epoch": 0.5316770186335403,
"grad_norm": 8.052840232849121,
"learning_rate": 0.00017345341614906834,
"loss": 1.4139,
"step": 2140
},
{
"epoch": 0.5341614906832298,
"grad_norm": 6.265495777130127,
"learning_rate": 0.00017332919254658385,
"loss": 1.2073,
"step": 2150
},
{
"epoch": 0.5366459627329192,
"grad_norm": 6.785367488861084,
"learning_rate": 0.0001732049689440994,
"loss": 1.4182,
"step": 2160
},
{
"epoch": 0.5391304347826087,
"grad_norm": 7.20573091506958,
"learning_rate": 0.00017308074534161491,
"loss": 1.3468,
"step": 2170
},
{
"epoch": 0.5416149068322982,
"grad_norm": 9.518648147583008,
"learning_rate": 0.00017295652173913043,
"loss": 1.393,
"step": 2180
},
{
"epoch": 0.5440993788819876,
"grad_norm": 8.566499710083008,
"learning_rate": 0.00017283229813664597,
"loss": 1.414,
"step": 2190
},
{
"epoch": 0.546583850931677,
"grad_norm": 9.845856666564941,
"learning_rate": 0.0001727080745341615,
"loss": 1.527,
"step": 2200
},
{
"epoch": 0.546583850931677,
"eval_accuracy": 0.702279327642348,
"eval_loss": 1.1809625625610352,
"eval_runtime": 86.1061,
"eval_samples_per_second": 131.965,
"eval_steps_per_second": 16.503,
"step": 2200
},
{
"epoch": 0.5490683229813664,
"grad_norm": 9.88825798034668,
"learning_rate": 0.00017258385093167703,
"loss": 1.3398,
"step": 2210
},
{
"epoch": 0.5515527950310559,
"grad_norm": 4.545001029968262,
"learning_rate": 0.00017245962732919255,
"loss": 1.7528,
"step": 2220
},
{
"epoch": 0.5540372670807453,
"grad_norm": 11.04814338684082,
"learning_rate": 0.0001723354037267081,
"loss": 1.2975,
"step": 2230
},
{
"epoch": 0.5565217391304348,
"grad_norm": 6.28684139251709,
"learning_rate": 0.0001722111801242236,
"loss": 1.4086,
"step": 2240
},
{
"epoch": 0.5590062111801242,
"grad_norm": 7.978612422943115,
"learning_rate": 0.00017208695652173915,
"loss": 1.4632,
"step": 2250
},
{
"epoch": 0.5614906832298137,
"grad_norm": 5.173329830169678,
"learning_rate": 0.00017196273291925467,
"loss": 1.5102,
"step": 2260
},
{
"epoch": 0.5639751552795031,
"grad_norm": 5.533884048461914,
"learning_rate": 0.00017183850931677019,
"loss": 1.4573,
"step": 2270
},
{
"epoch": 0.5664596273291925,
"grad_norm": 7.535440444946289,
"learning_rate": 0.00017171428571428573,
"loss": 1.6981,
"step": 2280
},
{
"epoch": 0.568944099378882,
"grad_norm": 7.52562952041626,
"learning_rate": 0.00017159006211180125,
"loss": 1.2332,
"step": 2290
},
{
"epoch": 0.5714285714285714,
"grad_norm": 6.707581043243408,
"learning_rate": 0.00017146583850931676,
"loss": 1.3873,
"step": 2300
},
{
"epoch": 0.5714285714285714,
"eval_accuracy": 0.7039514212795916,
"eval_loss": 1.1831145286560059,
"eval_runtime": 85.9731,
"eval_samples_per_second": 132.169,
"eval_steps_per_second": 16.528,
"step": 2300
},
{
"epoch": 0.5739130434782609,
"grad_norm": 9.480440139770508,
"learning_rate": 0.0001713416149068323,
"loss": 1.576,
"step": 2310
},
{
"epoch": 0.5763975155279503,
"grad_norm": 9.64328384399414,
"learning_rate": 0.00017121739130434785,
"loss": 1.4841,
"step": 2320
},
{
"epoch": 0.5788819875776398,
"grad_norm": 6.3002610206604,
"learning_rate": 0.00017109316770186337,
"loss": 1.2611,
"step": 2330
},
{
"epoch": 0.5813664596273292,
"grad_norm": 7.7264275550842285,
"learning_rate": 0.00017096894409937888,
"loss": 1.4146,
"step": 2340
},
{
"epoch": 0.5838509316770186,
"grad_norm": 6.963201999664307,
"learning_rate": 0.00017084472049689443,
"loss": 1.4925,
"step": 2350
},
{
"epoch": 0.5863354037267081,
"grad_norm": 6.235733985900879,
"learning_rate": 0.00017072049689440994,
"loss": 1.4015,
"step": 2360
},
{
"epoch": 0.5888198757763975,
"grad_norm": 7.08598518371582,
"learning_rate": 0.00017059627329192546,
"loss": 1.3037,
"step": 2370
},
{
"epoch": 0.591304347826087,
"grad_norm": 6.619434356689453,
"learning_rate": 0.000170472049689441,
"loss": 1.6309,
"step": 2380
},
{
"epoch": 0.5937888198757764,
"grad_norm": 6.332421779632568,
"learning_rate": 0.00017034782608695652,
"loss": 1.3557,
"step": 2390
},
{
"epoch": 0.5962732919254659,
"grad_norm": 6.135610580444336,
"learning_rate": 0.00017022360248447206,
"loss": 1.3545,
"step": 2400
},
{
"epoch": 0.5962732919254659,
"eval_accuracy": 0.7001672093637243,
"eval_loss": 1.1835651397705078,
"eval_runtime": 86.0365,
"eval_samples_per_second": 132.072,
"eval_steps_per_second": 16.516,
"step": 2400
},
{
"epoch": 0.5987577639751552,
"grad_norm": 9.877408981323242,
"learning_rate": 0.0001700993788819876,
"loss": 1.2388,
"step": 2410
},
{
"epoch": 0.6012422360248447,
"grad_norm": 6.421914100646973,
"learning_rate": 0.00016997515527950312,
"loss": 1.4432,
"step": 2420
},
{
"epoch": 0.6037267080745342,
"grad_norm": 5.323935508728027,
"learning_rate": 0.00016985093167701864,
"loss": 1.3144,
"step": 2430
},
{
"epoch": 0.6062111801242236,
"grad_norm": 12.48570728302002,
"learning_rate": 0.00016972670807453418,
"loss": 1.5679,
"step": 2440
},
{
"epoch": 0.6086956521739131,
"grad_norm": 6.593123912811279,
"learning_rate": 0.0001696024844720497,
"loss": 1.2275,
"step": 2450
},
{
"epoch": 0.6111801242236025,
"grad_norm": 6.936142444610596,
"learning_rate": 0.0001694782608695652,
"loss": 1.1774,
"step": 2460
},
{
"epoch": 0.613664596273292,
"grad_norm": 7.791112899780273,
"learning_rate": 0.00016935403726708076,
"loss": 1.6099,
"step": 2470
},
{
"epoch": 0.6161490683229813,
"grad_norm": 6.408988952636719,
"learning_rate": 0.00016922981366459627,
"loss": 1.4584,
"step": 2480
},
{
"epoch": 0.6186335403726708,
"grad_norm": 8.7936429977417,
"learning_rate": 0.00016910559006211182,
"loss": 1.3348,
"step": 2490
},
{
"epoch": 0.6211180124223602,
"grad_norm": 4.882345676422119,
"learning_rate": 0.00016898136645962733,
"loss": 1.4842,
"step": 2500
},
{
"epoch": 0.6211180124223602,
"eval_accuracy": 0.7129279239637419,
"eval_loss": 1.1441054344177246,
"eval_runtime": 87.2725,
"eval_samples_per_second": 130.201,
"eval_steps_per_second": 16.282,
"step": 2500
},
{
"epoch": 0.6236024844720497,
"grad_norm": 7.860159873962402,
"learning_rate": 0.00016885714285714288,
"loss": 1.4621,
"step": 2510
},
{
"epoch": 0.6260869565217392,
"grad_norm": 5.460740089416504,
"learning_rate": 0.0001687329192546584,
"loss": 1.4405,
"step": 2520
},
{
"epoch": 0.6285714285714286,
"grad_norm": 9.96655559539795,
"learning_rate": 0.0001686086956521739,
"loss": 1.5311,
"step": 2530
},
{
"epoch": 0.631055900621118,
"grad_norm": 7.057131767272949,
"learning_rate": 0.00016848447204968945,
"loss": 1.4878,
"step": 2540
},
{
"epoch": 0.6335403726708074,
"grad_norm": 6.061126708984375,
"learning_rate": 0.00016836024844720497,
"loss": 1.2133,
"step": 2550
},
{
"epoch": 0.6360248447204969,
"grad_norm": 7.528930187225342,
"learning_rate": 0.00016823602484472049,
"loss": 1.4039,
"step": 2560
},
{
"epoch": 0.6385093167701863,
"grad_norm": 4.734296798706055,
"learning_rate": 0.00016811180124223603,
"loss": 1.3136,
"step": 2570
},
{
"epoch": 0.6409937888198758,
"grad_norm": 10.213302612304688,
"learning_rate": 0.00016798757763975157,
"loss": 1.0263,
"step": 2580
},
{
"epoch": 0.6434782608695652,
"grad_norm": 7.67819881439209,
"learning_rate": 0.0001678633540372671,
"loss": 1.5417,
"step": 2590
},
{
"epoch": 0.6459627329192547,
"grad_norm": 10.029603958129883,
"learning_rate": 0.00016773913043478263,
"loss": 1.1974,
"step": 2600
},
{
"epoch": 0.6459627329192547,
"eval_accuracy": 0.7154800668837454,
"eval_loss": 1.1230041980743408,
"eval_runtime": 86.065,
"eval_samples_per_second": 132.028,
"eval_steps_per_second": 16.511,
"step": 2600
},
{
"epoch": 0.6484472049689441,
"grad_norm": 12.451225280761719,
"learning_rate": 0.00016761490683229815,
"loss": 1.3637,
"step": 2610
},
{
"epoch": 0.6509316770186335,
"grad_norm": 8.255215644836426,
"learning_rate": 0.00016749068322981366,
"loss": 1.3378,
"step": 2620
},
{
"epoch": 0.653416149068323,
"grad_norm": 5.389623165130615,
"learning_rate": 0.0001673664596273292,
"loss": 1.3536,
"step": 2630
},
{
"epoch": 0.6559006211180124,
"grad_norm": 7.741150856018066,
"learning_rate": 0.00016724223602484472,
"loss": 1.3554,
"step": 2640
},
{
"epoch": 0.6583850931677019,
"grad_norm": 5.791994094848633,
"learning_rate": 0.00016711801242236024,
"loss": 1.1869,
"step": 2650
},
{
"epoch": 0.6608695652173913,
"grad_norm": 6.631389141082764,
"learning_rate": 0.00016699378881987578,
"loss": 1.2872,
"step": 2660
},
{
"epoch": 0.6633540372670808,
"grad_norm": 89.58702087402344,
"learning_rate": 0.00016686956521739133,
"loss": 1.449,
"step": 2670
},
{
"epoch": 0.6658385093167701,
"grad_norm": 9.893950462341309,
"learning_rate": 0.00016674534161490684,
"loss": 1.3797,
"step": 2680
},
{
"epoch": 0.6683229813664596,
"grad_norm": 8.019680976867676,
"learning_rate": 0.00016662111801242236,
"loss": 1.659,
"step": 2690
},
{
"epoch": 0.6708074534161491,
"grad_norm": 5.2843499183654785,
"learning_rate": 0.0001664968944099379,
"loss": 1.4204,
"step": 2700
},
{
"epoch": 0.6708074534161491,
"eval_accuracy": 0.7001672093637243,
"eval_loss": 1.1766126155853271,
"eval_runtime": 86.8872,
"eval_samples_per_second": 130.779,
"eval_steps_per_second": 16.355,
"step": 2700
},
{
"epoch": 0.6732919254658385,
"grad_norm": 7.297257423400879,
"learning_rate": 0.00016637267080745342,
"loss": 1.2366,
"step": 2710
},
{
"epoch": 0.675776397515528,
"grad_norm": 6.853038787841797,
"learning_rate": 0.00016624844720496894,
"loss": 1.2613,
"step": 2720
},
{
"epoch": 0.6782608695652174,
"grad_norm": 10.860264778137207,
"learning_rate": 0.00016612422360248448,
"loss": 1.4677,
"step": 2730
},
{
"epoch": 0.6807453416149069,
"grad_norm": 7.402227878570557,
"learning_rate": 0.000166,
"loss": 1.324,
"step": 2740
},
{
"epoch": 0.6832298136645962,
"grad_norm": 7.668711185455322,
"learning_rate": 0.0001658757763975155,
"loss": 1.3704,
"step": 2750
},
{
"epoch": 0.6857142857142857,
"grad_norm": 7.363369464874268,
"learning_rate": 0.00016575155279503108,
"loss": 1.3618,
"step": 2760
},
{
"epoch": 0.6881987577639752,
"grad_norm": 4.960102081298828,
"learning_rate": 0.0001656273291925466,
"loss": 1.2222,
"step": 2770
},
{
"epoch": 0.6906832298136646,
"grad_norm": 6.821535110473633,
"learning_rate": 0.00016550310559006212,
"loss": 1.4079,
"step": 2780
},
{
"epoch": 0.6931677018633541,
"grad_norm": 5.65289306640625,
"learning_rate": 0.00016537888198757766,
"loss": 1.4243,
"step": 2790
},
{
"epoch": 0.6956521739130435,
"grad_norm": 6.178348064422607,
"learning_rate": 0.00016525465838509318,
"loss": 1.152,
"step": 2800
},
{
"epoch": 0.6956521739130435,
"eval_accuracy": 0.6949749185954414,
"eval_loss": 1.2165684700012207,
"eval_runtime": 85.8436,
"eval_samples_per_second": 132.369,
"eval_steps_per_second": 16.553,
"step": 2800
},
{
"epoch": 0.698136645962733,
"grad_norm": 6.465919494628906,
"learning_rate": 0.0001651304347826087,
"loss": 1.3611,
"step": 2810
},
{
"epoch": 0.7006211180124223,
"grad_norm": 7.679103374481201,
"learning_rate": 0.00016500621118012424,
"loss": 1.1199,
"step": 2820
},
{
"epoch": 0.7031055900621118,
"grad_norm": 4.632389545440674,
"learning_rate": 0.00016488198757763975,
"loss": 1.3998,
"step": 2830
},
{
"epoch": 0.7055900621118012,
"grad_norm": 6.801785945892334,
"learning_rate": 0.00016475776397515527,
"loss": 1.2069,
"step": 2840
},
{
"epoch": 0.7080745341614907,
"grad_norm": 9.706809997558594,
"learning_rate": 0.0001646335403726708,
"loss": 1.192,
"step": 2850
},
{
"epoch": 0.7105590062111802,
"grad_norm": 4.336630344390869,
"learning_rate": 0.00016450931677018636,
"loss": 1.0797,
"step": 2860
},
{
"epoch": 0.7130434782608696,
"grad_norm": 7.028838157653809,
"learning_rate": 0.00016438509316770187,
"loss": 1.3934,
"step": 2870
},
{
"epoch": 0.715527950310559,
"grad_norm": 7.961177349090576,
"learning_rate": 0.0001642608695652174,
"loss": 1.4124,
"step": 2880
},
{
"epoch": 0.7180124223602484,
"grad_norm": 8.568161964416504,
"learning_rate": 0.00016413664596273293,
"loss": 1.3617,
"step": 2890
},
{
"epoch": 0.7204968944099379,
"grad_norm": 8.702705383300781,
"learning_rate": 0.00016401242236024845,
"loss": 1.162,
"step": 2900
},
{
"epoch": 0.7204968944099379,
"eval_accuracy": 0.7002552142920003,
"eval_loss": 1.167386531829834,
"eval_runtime": 86.3186,
"eval_samples_per_second": 131.64,
"eval_steps_per_second": 16.462,
"step": 2900
},
{
"epoch": 0.7229813664596273,
"grad_norm": 5.8269147872924805,
"learning_rate": 0.000163888198757764,
"loss": 1.4158,
"step": 2910
},
{
"epoch": 0.7254658385093168,
"grad_norm": 7.1003899574279785,
"learning_rate": 0.0001637639751552795,
"loss": 1.174,
"step": 2920
},
{
"epoch": 0.7279503105590062,
"grad_norm": 6.107857704162598,
"learning_rate": 0.00016363975155279502,
"loss": 1.2128,
"step": 2930
},
{
"epoch": 0.7304347826086957,
"grad_norm": 6.136083126068115,
"learning_rate": 0.00016351552795031057,
"loss": 1.5222,
"step": 2940
},
{
"epoch": 0.7329192546583851,
"grad_norm": 8.518939018249512,
"learning_rate": 0.0001633913043478261,
"loss": 1.4467,
"step": 2950
},
{
"epoch": 0.7354037267080745,
"grad_norm": 8.945500373840332,
"learning_rate": 0.00016326708074534163,
"loss": 1.2919,
"step": 2960
},
{
"epoch": 0.737888198757764,
"grad_norm": 5.567399978637695,
"learning_rate": 0.00016314285714285714,
"loss": 1.3656,
"step": 2970
},
{
"epoch": 0.7403726708074534,
"grad_norm": 6.591121196746826,
"learning_rate": 0.0001630186335403727,
"loss": 1.3927,
"step": 2980
},
{
"epoch": 0.7428571428571429,
"grad_norm": 7.108632564544678,
"learning_rate": 0.0001628944099378882,
"loss": 1.2373,
"step": 2990
},
{
"epoch": 0.7453416149068323,
"grad_norm": 6.770077705383301,
"learning_rate": 0.00016277018633540372,
"loss": 1.4516,
"step": 3000
},
{
"epoch": 0.7453416149068323,
"eval_accuracy": 0.7139839831030538,
"eval_loss": 1.1207355260849,
"eval_runtime": 86.4165,
"eval_samples_per_second": 131.491,
"eval_steps_per_second": 16.444,
"step": 3000
},
{
"epoch": 0.7478260869565218,
"grad_norm": 5.914898872375488,
"learning_rate": 0.00016264596273291926,
"loss": 1.2147,
"step": 3010
},
{
"epoch": 0.7503105590062111,
"grad_norm": 9.71444320678711,
"learning_rate": 0.00016252173913043478,
"loss": 1.411,
"step": 3020
},
{
"epoch": 0.7527950310559006,
"grad_norm": 6.712387561798096,
"learning_rate": 0.00016239751552795032,
"loss": 1.4371,
"step": 3030
},
{
"epoch": 0.7552795031055901,
"grad_norm": 4.184564113616943,
"learning_rate": 0.00016227329192546587,
"loss": 1.2996,
"step": 3040
},
{
"epoch": 0.7577639751552795,
"grad_norm": 6.321875095367432,
"learning_rate": 0.00016214906832298138,
"loss": 1.2506,
"step": 3050
},
{
"epoch": 0.760248447204969,
"grad_norm": 5.48466682434082,
"learning_rate": 0.0001620248447204969,
"loss": 1.1892,
"step": 3060
},
{
"epoch": 0.7627329192546584,
"grad_norm": 8.954041481018066,
"learning_rate": 0.00016190062111801244,
"loss": 1.5073,
"step": 3070
},
{
"epoch": 0.7652173913043478,
"grad_norm": 6.705496788024902,
"learning_rate": 0.00016177639751552796,
"loss": 1.3815,
"step": 3080
},
{
"epoch": 0.7677018633540372,
"grad_norm": 9.638246536254883,
"learning_rate": 0.00016165217391304347,
"loss": 1.4076,
"step": 3090
},
{
"epoch": 0.7701863354037267,
"grad_norm": 9.326358795166016,
"learning_rate": 0.00016152795031055902,
"loss": 1.2378,
"step": 3100
},
{
"epoch": 0.7701863354037267,
"eval_accuracy": 0.6905746721816421,
"eval_loss": 1.2071986198425293,
"eval_runtime": 86.5208,
"eval_samples_per_second": 131.333,
"eval_steps_per_second": 16.424,
"step": 3100
},
{
"epoch": 0.7726708074534161,
"grad_norm": 8.85179328918457,
"learning_rate": 0.00016140372670807453,
"loss": 1.5347,
"step": 3110
},
{
"epoch": 0.7751552795031056,
"grad_norm": 6.758512020111084,
"learning_rate": 0.00016127950310559008,
"loss": 1.3171,
"step": 3120
},
{
"epoch": 0.7776397515527951,
"grad_norm": 5.798080921173096,
"learning_rate": 0.0001611552795031056,
"loss": 1.2583,
"step": 3130
},
{
"epoch": 0.7801242236024845,
"grad_norm": 5.800971984863281,
"learning_rate": 0.00016103105590062114,
"loss": 1.116,
"step": 3140
},
{
"epoch": 0.782608695652174,
"grad_norm": 6.780196189880371,
"learning_rate": 0.00016090683229813665,
"loss": 1.3495,
"step": 3150
},
{
"epoch": 0.7850931677018633,
"grad_norm": 6.8307719230651855,
"learning_rate": 0.00016078260869565217,
"loss": 1.1167,
"step": 3160
},
{
"epoch": 0.7875776397515528,
"grad_norm": 10.045748710632324,
"learning_rate": 0.00016065838509316771,
"loss": 1.1134,
"step": 3170
},
{
"epoch": 0.7900621118012422,
"grad_norm": 6.177084922790527,
"learning_rate": 0.00016053416149068323,
"loss": 1.206,
"step": 3180
},
{
"epoch": 0.7925465838509317,
"grad_norm": 4.914190292358398,
"learning_rate": 0.00016040993788819875,
"loss": 1.3714,
"step": 3190
},
{
"epoch": 0.7950310559006211,
"grad_norm": 7.478468894958496,
"learning_rate": 0.0001602857142857143,
"loss": 0.991,
"step": 3200
},
{
"epoch": 0.7950310559006211,
"eval_accuracy": 0.7131039338202939,
"eval_loss": 1.1121686697006226,
"eval_runtime": 86.2088,
"eval_samples_per_second": 131.808,
"eval_steps_per_second": 16.483,
"step": 3200
},
{
"epoch": 0.7975155279503106,
"grad_norm": 6.4600982666015625,
"learning_rate": 0.00016016149068322983,
"loss": 1.2865,
"step": 3210
},
{
"epoch": 0.8,
"grad_norm": 5.785561561584473,
"learning_rate": 0.00016003726708074535,
"loss": 1.4614,
"step": 3220
},
{
"epoch": 0.8024844720496894,
"grad_norm": 4.1848015785217285,
"learning_rate": 0.0001599130434782609,
"loss": 1.1712,
"step": 3230
},
{
"epoch": 0.8049689440993789,
"grad_norm": 4.002833843231201,
"learning_rate": 0.0001597888198757764,
"loss": 1.3205,
"step": 3240
},
{
"epoch": 0.8074534161490683,
"grad_norm": 4.33705997467041,
"learning_rate": 0.00015966459627329193,
"loss": 1.3718,
"step": 3250
},
{
"epoch": 0.8099378881987578,
"grad_norm": 6.072953224182129,
"learning_rate": 0.00015954037267080747,
"loss": 1.4363,
"step": 3260
},
{
"epoch": 0.8124223602484472,
"grad_norm": 5.311767578125,
"learning_rate": 0.00015941614906832299,
"loss": 1.3391,
"step": 3270
},
{
"epoch": 0.8149068322981367,
"grad_norm": 6.9105024337768555,
"learning_rate": 0.0001592919254658385,
"loss": 1.2966,
"step": 3280
},
{
"epoch": 0.8173913043478261,
"grad_norm": 5.310636043548584,
"learning_rate": 0.00015916770186335405,
"loss": 1.1282,
"step": 3290
},
{
"epoch": 0.8198757763975155,
"grad_norm": 5.895457744598389,
"learning_rate": 0.0001590434782608696,
"loss": 1.3078,
"step": 3300
},
{
"epoch": 0.8198757763975155,
"eval_accuracy": 0.7169761506644372,
"eval_loss": 1.1206748485565186,
"eval_runtime": 86.8832,
"eval_samples_per_second": 130.785,
"eval_steps_per_second": 16.355,
"step": 3300
},
{
"epoch": 0.822360248447205,
"grad_norm": 5.530759334564209,
"learning_rate": 0.0001589192546583851,
"loss": 1.3002,
"step": 3310
},
{
"epoch": 0.8248447204968944,
"grad_norm": 7.9369072914123535,
"learning_rate": 0.00015879503105590062,
"loss": 1.289,
"step": 3320
},
{
"epoch": 0.8273291925465839,
"grad_norm": 7.3485426902771,
"learning_rate": 0.00015867080745341617,
"loss": 1.4236,
"step": 3330
},
{
"epoch": 0.8298136645962733,
"grad_norm": 6.818698883056641,
"learning_rate": 0.00015854658385093168,
"loss": 1.2176,
"step": 3340
},
{
"epoch": 0.8322981366459627,
"grad_norm": 6.358404159545898,
"learning_rate": 0.0001584223602484472,
"loss": 1.1425,
"step": 3350
},
{
"epoch": 0.8347826086956521,
"grad_norm": 3.939678907394409,
"learning_rate": 0.00015829813664596274,
"loss": 1.5184,
"step": 3360
},
{
"epoch": 0.8372670807453416,
"grad_norm": 7.679263114929199,
"learning_rate": 0.00015817391304347826,
"loss": 1.4098,
"step": 3370
},
{
"epoch": 0.8397515527950311,
"grad_norm": 4.054044723510742,
"learning_rate": 0.00015804968944099377,
"loss": 1.2641,
"step": 3380
},
{
"epoch": 0.8422360248447205,
"grad_norm": 8.686745643615723,
"learning_rate": 0.00015792546583850934,
"loss": 1.0001,
"step": 3390
},
{
"epoch": 0.84472049689441,
"grad_norm": 4.359888076782227,
"learning_rate": 0.00015780124223602486,
"loss": 1.1483,
"step": 3400
},
{
"epoch": 0.84472049689441,
"eval_accuracy": 0.7245445744961718,
"eval_loss": 1.066516637802124,
"eval_runtime": 85.9778,
"eval_samples_per_second": 132.162,
"eval_steps_per_second": 16.528,
"step": 3400
},
{
"epoch": 0.8472049689440994,
"grad_norm": 6.710513591766357,
"learning_rate": 0.00015767701863354038,
"loss": 1.371,
"step": 3410
},
{
"epoch": 0.8496894409937888,
"grad_norm": 5.640341281890869,
"learning_rate": 0.00015755279503105592,
"loss": 0.8962,
"step": 3420
},
{
"epoch": 0.8521739130434782,
"grad_norm": 9.07288646697998,
"learning_rate": 0.00015742857142857144,
"loss": 1.1876,
"step": 3430
},
{
"epoch": 0.8546583850931677,
"grad_norm": 6.409737586975098,
"learning_rate": 0.00015730434782608695,
"loss": 1.1879,
"step": 3440
},
{
"epoch": 0.8571428571428571,
"grad_norm": 7.162034511566162,
"learning_rate": 0.0001571801242236025,
"loss": 1.1047,
"step": 3450
},
{
"epoch": 0.8596273291925466,
"grad_norm": 10.321228981018066,
"learning_rate": 0.000157055900621118,
"loss": 1.3303,
"step": 3460
},
{
"epoch": 0.8621118012422361,
"grad_norm": 7.930309772491455,
"learning_rate": 0.00015693167701863353,
"loss": 1.2688,
"step": 3470
},
{
"epoch": 0.8645962732919255,
"grad_norm": 7.929530620574951,
"learning_rate": 0.00015680745341614907,
"loss": 1.0794,
"step": 3480
},
{
"epoch": 0.867080745341615,
"grad_norm": 6.65020227432251,
"learning_rate": 0.00015668322981366462,
"loss": 1.1747,
"step": 3490
},
{
"epoch": 0.8695652173913043,
"grad_norm": 7.833930969238281,
"learning_rate": 0.00015655900621118013,
"loss": 1.453,
"step": 3500
},
{
"epoch": 0.8695652173913043,
"eval_accuracy": 0.7267446977030714,
"eval_loss": 1.0639996528625488,
"eval_runtime": 86.8259,
"eval_samples_per_second": 130.871,
"eval_steps_per_second": 16.366,
"step": 3500
},
{
"epoch": 0.8720496894409938,
"grad_norm": 6.314217567443848,
"learning_rate": 0.00015643478260869565,
"loss": 1.3662,
"step": 3510
},
{
"epoch": 0.8745341614906832,
"grad_norm": 6.935042381286621,
"learning_rate": 0.0001563105590062112,
"loss": 1.4166,
"step": 3520
},
{
"epoch": 0.8770186335403727,
"grad_norm": 5.903131484985352,
"learning_rate": 0.0001561863354037267,
"loss": 1.3847,
"step": 3530
},
{
"epoch": 0.8795031055900621,
"grad_norm": 5.503540515899658,
"learning_rate": 0.00015606211180124223,
"loss": 1.0824,
"step": 3540
},
{
"epoch": 0.8819875776397516,
"grad_norm": 7.387447357177734,
"learning_rate": 0.00015593788819875777,
"loss": 1.3476,
"step": 3550
},
{
"epoch": 0.884472049689441,
"grad_norm": 6.536509037017822,
"learning_rate": 0.00015581366459627329,
"loss": 1.2126,
"step": 3560
},
{
"epoch": 0.8869565217391304,
"grad_norm": 4.404107093811035,
"learning_rate": 0.00015568944099378883,
"loss": 1.2508,
"step": 3570
},
{
"epoch": 0.8894409937888199,
"grad_norm": 7.137818813323975,
"learning_rate": 0.00015556521739130437,
"loss": 1.1038,
"step": 3580
},
{
"epoch": 0.8919254658385093,
"grad_norm": 3.9632694721221924,
"learning_rate": 0.0001554409937888199,
"loss": 1.2633,
"step": 3590
},
{
"epoch": 0.8944099378881988,
"grad_norm": 7.339700222015381,
"learning_rate": 0.0001553167701863354,
"loss": 1.4457,
"step": 3600
},
{
"epoch": 0.8944099378881988,
"eval_accuracy": 0.7321129983279063,
"eval_loss": 1.0565322637557983,
"eval_runtime": 85.6808,
"eval_samples_per_second": 132.62,
"eval_steps_per_second": 16.585,
"step": 3600
},
{
"epoch": 0.8968944099378882,
"grad_norm": 6.658189296722412,
"learning_rate": 0.00015519254658385095,
"loss": 0.9933,
"step": 3610
},
{
"epoch": 0.8993788819875776,
"grad_norm": 6.376084804534912,
"learning_rate": 0.00015506832298136646,
"loss": 1.2427,
"step": 3620
},
{
"epoch": 0.901863354037267,
"grad_norm": 6.839380741119385,
"learning_rate": 0.00015494409937888198,
"loss": 1.2968,
"step": 3630
},
{
"epoch": 0.9043478260869565,
"grad_norm": 6.3698601722717285,
"learning_rate": 0.00015481987577639752,
"loss": 1.3086,
"step": 3640
},
{
"epoch": 0.906832298136646,
"grad_norm": 4.997156143188477,
"learning_rate": 0.00015469565217391304,
"loss": 1.3486,
"step": 3650
},
{
"epoch": 0.9093167701863354,
"grad_norm": 6.0088701248168945,
"learning_rate": 0.00015457142857142858,
"loss": 1.235,
"step": 3660
},
{
"epoch": 0.9118012422360249,
"grad_norm": 6.903764247894287,
"learning_rate": 0.00015444720496894413,
"loss": 1.2585,
"step": 3670
},
{
"epoch": 0.9142857142857143,
"grad_norm": 7.442832946777344,
"learning_rate": 0.00015432298136645964,
"loss": 1.2756,
"step": 3680
},
{
"epoch": 0.9167701863354037,
"grad_norm": 7.293776988983154,
"learning_rate": 0.00015419875776397516,
"loss": 1.2326,
"step": 3690
},
{
"epoch": 0.9192546583850931,
"grad_norm": 2.9621481895446777,
"learning_rate": 0.0001540745341614907,
"loss": 1.1636,
"step": 3700
},
{
"epoch": 0.9192546583850931,
"eval_accuracy": 0.7255126287072076,
"eval_loss": 1.057629942893982,
"eval_runtime": 86.1351,
"eval_samples_per_second": 131.921,
"eval_steps_per_second": 16.497,
"step": 3700
},
{
"epoch": 0.9217391304347826,
"grad_norm": 10.847683906555176,
"learning_rate": 0.00015395031055900622,
"loss": 1.2353,
"step": 3710
},
{
"epoch": 0.924223602484472,
"grad_norm": 5.985072135925293,
"learning_rate": 0.00015382608695652174,
"loss": 1.5326,
"step": 3720
},
{
"epoch": 0.9267080745341615,
"grad_norm": 6.25619649887085,
"learning_rate": 0.00015370186335403728,
"loss": 1.2161,
"step": 3730
},
{
"epoch": 0.929192546583851,
"grad_norm": 6.543466091156006,
"learning_rate": 0.0001535776397515528,
"loss": 1.4036,
"step": 3740
},
{
"epoch": 0.9316770186335404,
"grad_norm": 5.6111555099487305,
"learning_rate": 0.00015345341614906834,
"loss": 1.2282,
"step": 3750
},
{
"epoch": 0.9341614906832298,
"grad_norm": 6.730726718902588,
"learning_rate": 0.00015332919254658386,
"loss": 1.1281,
"step": 3760
},
{
"epoch": 0.9366459627329192,
"grad_norm": 6.602107048034668,
"learning_rate": 0.0001532049689440994,
"loss": 1.1716,
"step": 3770
},
{
"epoch": 0.9391304347826087,
"grad_norm": 2.737424612045288,
"learning_rate": 0.00015308074534161492,
"loss": 1.091,
"step": 3780
},
{
"epoch": 0.9416149068322981,
"grad_norm": 6.844805717468262,
"learning_rate": 0.00015295652173913043,
"loss": 1.1411,
"step": 3790
},
{
"epoch": 0.9440993788819876,
"grad_norm": 6.895637512207031,
"learning_rate": 0.00015283229813664598,
"loss": 1.157,
"step": 3800
},
{
"epoch": 0.9440993788819876,
"eval_accuracy": 0.7261286632051395,
"eval_loss": 1.0648393630981445,
"eval_runtime": 86.8569,
"eval_samples_per_second": 130.824,
"eval_steps_per_second": 16.36,
"step": 3800
},
{
"epoch": 0.9465838509316771,
"grad_norm": 6.659364223480225,
"learning_rate": 0.0001527080745341615,
"loss": 1.2882,
"step": 3810
},
{
"epoch": 0.9490683229813665,
"grad_norm": 3.437624216079712,
"learning_rate": 0.000152583850931677,
"loss": 1.0992,
"step": 3820
},
{
"epoch": 0.9515527950310559,
"grad_norm": 9.4873046875,
"learning_rate": 0.00015245962732919255,
"loss": 1.3628,
"step": 3830
},
{
"epoch": 0.9540372670807453,
"grad_norm": 6.623880386352539,
"learning_rate": 0.0001523354037267081,
"loss": 1.2201,
"step": 3840
},
{
"epoch": 0.9565217391304348,
"grad_norm": 5.347780227661133,
"learning_rate": 0.0001522111801242236,
"loss": 0.9752,
"step": 3850
},
{
"epoch": 0.9590062111801242,
"grad_norm": 9.225540161132812,
"learning_rate": 0.00015208695652173916,
"loss": 1.2034,
"step": 3860
},
{
"epoch": 0.9614906832298137,
"grad_norm": 5.735724925994873,
"learning_rate": 0.00015196273291925467,
"loss": 1.111,
"step": 3870
},
{
"epoch": 0.9639751552795031,
"grad_norm": 5.543980598449707,
"learning_rate": 0.0001518385093167702,
"loss": 1.1442,
"step": 3880
},
{
"epoch": 0.9664596273291925,
"grad_norm": 9.901732444763184,
"learning_rate": 0.00015171428571428573,
"loss": 1.299,
"step": 3890
},
{
"epoch": 0.968944099378882,
"grad_norm": 8.65027141571045,
"learning_rate": 0.00015159006211180125,
"loss": 1.1923,
"step": 3900
},
{
"epoch": 0.968944099378882,
"eval_accuracy": 0.7270967174161753,
"eval_loss": 1.0472681522369385,
"eval_runtime": 86.822,
"eval_samples_per_second": 130.877,
"eval_steps_per_second": 16.367,
"step": 3900
},
{
"epoch": 0.9714285714285714,
"grad_norm": 5.825603008270264,
"learning_rate": 0.00015146583850931676,
"loss": 1.313,
"step": 3910
},
{
"epoch": 0.9739130434782609,
"grad_norm": 5.283875942230225,
"learning_rate": 0.0001513416149068323,
"loss": 1.2346,
"step": 3920
},
{
"epoch": 0.9763975155279503,
"grad_norm": 5.817853927612305,
"learning_rate": 0.00015121739130434785,
"loss": 1.3103,
"step": 3930
},
{
"epoch": 0.9788819875776398,
"grad_norm": 8.483689308166504,
"learning_rate": 0.00015109316770186337,
"loss": 1.2589,
"step": 3940
},
{
"epoch": 0.9813664596273292,
"grad_norm": 6.321104526519775,
"learning_rate": 0.00015096894409937888,
"loss": 1.5437,
"step": 3950
},
{
"epoch": 0.9838509316770186,
"grad_norm": 7.132662296295166,
"learning_rate": 0.00015084472049689443,
"loss": 1.1178,
"step": 3960
},
{
"epoch": 0.986335403726708,
"grad_norm": 6.257715702056885,
"learning_rate": 0.00015072049689440994,
"loss": 1.1324,
"step": 3970
},
{
"epoch": 0.9888198757763975,
"grad_norm": 7.432724952697754,
"learning_rate": 0.00015059627329192546,
"loss": 1.2156,
"step": 3980
},
{
"epoch": 0.991304347826087,
"grad_norm": 6.6837158203125,
"learning_rate": 0.000150472049689441,
"loss": 1.2655,
"step": 3990
},
{
"epoch": 0.9937888198757764,
"grad_norm": 8.731260299682617,
"learning_rate": 0.00015034782608695652,
"loss": 1.2325,
"step": 4000
},
{
"epoch": 0.9937888198757764,
"eval_accuracy": 0.7298248701927308,
"eval_loss": 1.050094723701477,
"eval_runtime": 87.0386,
"eval_samples_per_second": 130.551,
"eval_steps_per_second": 16.326,
"step": 4000
},
{
"epoch": 0.9962732919254659,
"grad_norm": 7.174413681030273,
"learning_rate": 0.00015022360248447204,
"loss": 1.4024,
"step": 4010
},
{
"epoch": 0.9987577639751553,
"grad_norm": 9.296140670776367,
"learning_rate": 0.0001500993788819876,
"loss": 1.292,
"step": 4020
},
{
"epoch": 1.0012422360248447,
"grad_norm": 7.022974014282227,
"learning_rate": 0.00014997515527950312,
"loss": 1.1833,
"step": 4030
},
{
"epoch": 1.0037267080745342,
"grad_norm": 7.05012321472168,
"learning_rate": 0.00014985093167701864,
"loss": 1.0308,
"step": 4040
},
{
"epoch": 1.0062111801242235,
"grad_norm": 6.042240142822266,
"learning_rate": 0.00014972670807453418,
"loss": 0.8708,
"step": 4050
},
{
"epoch": 1.008695652173913,
"grad_norm": 4.938986301422119,
"learning_rate": 0.0001496024844720497,
"loss": 1.0892,
"step": 4060
},
{
"epoch": 1.0111801242236025,
"grad_norm": 6.403342247009277,
"learning_rate": 0.00014947826086956522,
"loss": 1.1606,
"step": 4070
},
{
"epoch": 1.013664596273292,
"grad_norm": 3.8224756717681885,
"learning_rate": 0.00014935403726708076,
"loss": 1.0617,
"step": 4080
},
{
"epoch": 1.0161490683229815,
"grad_norm": 7.42360782623291,
"learning_rate": 0.00014922981366459627,
"loss": 0.9664,
"step": 4090
},
{
"epoch": 1.0186335403726707,
"grad_norm": 4.1559529304504395,
"learning_rate": 0.0001491055900621118,
"loss": 1.1503,
"step": 4100
},
{
"epoch": 1.0186335403726707,
"eval_accuracy": 0.7242805597113439,
"eval_loss": 1.0565658807754517,
"eval_runtime": 86.6402,
"eval_samples_per_second": 131.152,
"eval_steps_per_second": 16.401,
"step": 4100
},
{
"epoch": 1.0211180124223602,
"grad_norm": 6.328678131103516,
"learning_rate": 0.00014898136645962733,
"loss": 1.025,
"step": 4110
},
{
"epoch": 1.0236024844720497,
"grad_norm": 7.9734787940979,
"learning_rate": 0.00014885714285714288,
"loss": 1.2318,
"step": 4120
},
{
"epoch": 1.0260869565217392,
"grad_norm": 5.027238845825195,
"learning_rate": 0.0001487329192546584,
"loss": 1.2616,
"step": 4130
},
{
"epoch": 1.0285714285714285,
"grad_norm": 7.277949810028076,
"learning_rate": 0.0001486086956521739,
"loss": 1.1206,
"step": 4140
},
{
"epoch": 1.031055900621118,
"grad_norm": 7.472249984741211,
"learning_rate": 0.00014848447204968945,
"loss": 1.1375,
"step": 4150
},
{
"epoch": 1.0335403726708075,
"grad_norm": 4.62937068939209,
"learning_rate": 0.00014836024844720497,
"loss": 0.9969,
"step": 4160
},
{
"epoch": 1.036024844720497,
"grad_norm": 6.158135414123535,
"learning_rate": 0.0001482360248447205,
"loss": 1.0945,
"step": 4170
},
{
"epoch": 1.0385093167701864,
"grad_norm": 6.552846908569336,
"learning_rate": 0.00014811180124223603,
"loss": 1.1422,
"step": 4180
},
{
"epoch": 1.0409937888198757,
"grad_norm": 7.865995407104492,
"learning_rate": 0.00014798757763975155,
"loss": 1.0421,
"step": 4190
},
{
"epoch": 1.0434782608695652,
"grad_norm": 6.623953819274902,
"learning_rate": 0.0001478633540372671,
"loss": 1.0633,
"step": 4200
},
{
"epoch": 1.0434782608695652,
"eval_accuracy": 0.744433688286544,
"eval_loss": 1.0004760026931763,
"eval_runtime": 87.3833,
"eval_samples_per_second": 130.036,
"eval_steps_per_second": 16.262,
"step": 4200
},
{
"epoch": 1.0459627329192547,
"grad_norm": 2.9450221061706543,
"learning_rate": 0.00014773913043478263,
"loss": 1.0158,
"step": 4210
},
{
"epoch": 1.0484472049689442,
"grad_norm": 4.293970584869385,
"learning_rate": 0.00014761490683229815,
"loss": 0.9092,
"step": 4220
},
{
"epoch": 1.0509316770186334,
"grad_norm": 3.9722843170166016,
"learning_rate": 0.00014749068322981367,
"loss": 0.9706,
"step": 4230
},
{
"epoch": 1.053416149068323,
"grad_norm": 4.5669779777526855,
"learning_rate": 0.0001473664596273292,
"loss": 0.9828,
"step": 4240
},
{
"epoch": 1.0559006211180124,
"grad_norm": 5.340195178985596,
"learning_rate": 0.00014724223602484473,
"loss": 0.9847,
"step": 4250
},
{
"epoch": 1.058385093167702,
"grad_norm": 6.1555304527282715,
"learning_rate": 0.00014711801242236024,
"loss": 0.9667,
"step": 4260
},
{
"epoch": 1.0608695652173914,
"grad_norm": 6.872910499572754,
"learning_rate": 0.00014699378881987579,
"loss": 1.1049,
"step": 4270
},
{
"epoch": 1.0633540372670807,
"grad_norm": 6.4988861083984375,
"learning_rate": 0.0001468695652173913,
"loss": 1.1562,
"step": 4280
},
{
"epoch": 1.0658385093167702,
"grad_norm": 5.785723686218262,
"learning_rate": 0.00014674534161490682,
"loss": 0.9364,
"step": 4290
},
{
"epoch": 1.0683229813664596,
"grad_norm": 9.51654052734375,
"learning_rate": 0.0001466211180124224,
"loss": 1.2061,
"step": 4300
},
{
"epoch": 1.0683229813664596,
"eval_accuracy": 0.7376573088092934,
"eval_loss": 1.0195673704147339,
"eval_runtime": 85.368,
"eval_samples_per_second": 133.106,
"eval_steps_per_second": 16.646,
"step": 4300
},
{
"epoch": 1.0708074534161491,
"grad_norm": 6.055525302886963,
"learning_rate": 0.0001464968944099379,
"loss": 1.0418,
"step": 4310
},
{
"epoch": 1.0732919254658384,
"grad_norm": 5.421204566955566,
"learning_rate": 0.00014637267080745342,
"loss": 1.0929,
"step": 4320
},
{
"epoch": 1.075776397515528,
"grad_norm": 9.280656814575195,
"learning_rate": 0.00014624844720496897,
"loss": 1.2286,
"step": 4330
},
{
"epoch": 1.0782608695652174,
"grad_norm": 4.315008640289307,
"learning_rate": 0.00014612422360248448,
"loss": 1.2768,
"step": 4340
},
{
"epoch": 1.0807453416149069,
"grad_norm": 7.510447025299072,
"learning_rate": 0.000146,
"loss": 1.0406,
"step": 4350
},
{
"epoch": 1.0832298136645964,
"grad_norm": 8.884886741638184,
"learning_rate": 0.00014587577639751554,
"loss": 1.158,
"step": 4360
},
{
"epoch": 1.0857142857142856,
"grad_norm": 6.407387733459473,
"learning_rate": 0.00014575155279503106,
"loss": 1.0883,
"step": 4370
},
{
"epoch": 1.0881987577639751,
"grad_norm": 8.888128280639648,
"learning_rate": 0.00014562732919254657,
"loss": 1.0214,
"step": 4380
},
{
"epoch": 1.0906832298136646,
"grad_norm": 5.50847864151001,
"learning_rate": 0.00014550310559006212,
"loss": 1.0415,
"step": 4390
},
{
"epoch": 1.093167701863354,
"grad_norm": 7.724440097808838,
"learning_rate": 0.00014537888198757766,
"loss": 1.0315,
"step": 4400
},
{
"epoch": 1.093167701863354,
"eval_accuracy": 0.739153392589985,
"eval_loss": 1.0139085054397583,
"eval_runtime": 85.7532,
"eval_samples_per_second": 132.508,
"eval_steps_per_second": 16.571,
"step": 4400
},
{
"epoch": 1.0956521739130434,
"grad_norm": 9.034687995910645,
"learning_rate": 0.00014525465838509318,
"loss": 0.934,
"step": 4410
},
{
"epoch": 1.0981366459627329,
"grad_norm": 4.125546932220459,
"learning_rate": 0.0001451304347826087,
"loss": 0.9062,
"step": 4420
},
{
"epoch": 1.1006211180124224,
"grad_norm": 12.423514366149902,
"learning_rate": 0.00014500621118012424,
"loss": 1.2444,
"step": 4430
},
{
"epoch": 1.1031055900621118,
"grad_norm": 6.781725883483887,
"learning_rate": 0.00014488198757763975,
"loss": 1.1755,
"step": 4440
},
{
"epoch": 1.1055900621118013,
"grad_norm": 3.974307060241699,
"learning_rate": 0.00014475776397515527,
"loss": 0.9203,
"step": 4450
},
{
"epoch": 1.1080745341614906,
"grad_norm": 6.652670383453369,
"learning_rate": 0.0001446335403726708,
"loss": 0.8479,
"step": 4460
},
{
"epoch": 1.11055900621118,
"grad_norm": 7.944617748260498,
"learning_rate": 0.00014450931677018633,
"loss": 1.2384,
"step": 4470
},
{
"epoch": 1.1130434782608696,
"grad_norm": 4.334497928619385,
"learning_rate": 0.00014438509316770187,
"loss": 0.9322,
"step": 4480
},
{
"epoch": 1.115527950310559,
"grad_norm": 6.265549659729004,
"learning_rate": 0.00014426086956521742,
"loss": 1.1439,
"step": 4490
},
{
"epoch": 1.1180124223602483,
"grad_norm": 5.482172012329102,
"learning_rate": 0.00014413664596273293,
"loss": 1.038,
"step": 4500
},
{
"epoch": 1.1180124223602483,
"eval_accuracy": 0.7317609786148024,
"eval_loss": 1.029909610748291,
"eval_runtime": 86.1317,
"eval_samples_per_second": 131.926,
"eval_steps_per_second": 16.498,
"step": 4500
},
{
"epoch": 1.1204968944099378,
"grad_norm": 4.223867416381836,
"learning_rate": 0.00014401242236024845,
"loss": 1.0135,
"step": 4510
},
{
"epoch": 1.1229813664596273,
"grad_norm": 8.013762474060059,
"learning_rate": 0.000143888198757764,
"loss": 1.2437,
"step": 4520
},
{
"epoch": 1.1254658385093168,
"grad_norm": 1.782776951789856,
"learning_rate": 0.0001437639751552795,
"loss": 0.9916,
"step": 4530
},
{
"epoch": 1.1279503105590063,
"grad_norm": 5.063310623168945,
"learning_rate": 0.00014363975155279503,
"loss": 1.0833,
"step": 4540
},
{
"epoch": 1.1304347826086956,
"grad_norm": 5.764039516448975,
"learning_rate": 0.00014351552795031057,
"loss": 1.0594,
"step": 4550
},
{
"epoch": 1.132919254658385,
"grad_norm": 8.462092399597168,
"learning_rate": 0.00014339130434782609,
"loss": 0.9592,
"step": 4560
},
{
"epoch": 1.1354037267080745,
"grad_norm": 4.34237813949585,
"learning_rate": 0.00014326708074534163,
"loss": 0.928,
"step": 4570
},
{
"epoch": 1.137888198757764,
"grad_norm": 7.203433036804199,
"learning_rate": 0.00014314285714285715,
"loss": 1.063,
"step": 4580
},
{
"epoch": 1.1403726708074533,
"grad_norm": 7.482883930206299,
"learning_rate": 0.0001430186335403727,
"loss": 1.2297,
"step": 4590
},
{
"epoch": 1.1428571428571428,
"grad_norm": 7.640567779541016,
"learning_rate": 0.0001428944099378882,
"loss": 0.7728,
"step": 4600
},
{
"epoch": 1.1428571428571428,
"eval_accuracy": 0.7256886385637595,
"eval_loss": 1.0522042512893677,
"eval_runtime": 85.4611,
"eval_samples_per_second": 132.961,
"eval_steps_per_second": 16.627,
"step": 4600
},
{
"epoch": 1.1453416149068323,
"grad_norm": 8.734424591064453,
"learning_rate": 0.00014277018633540372,
"loss": 0.9011,
"step": 4610
},
{
"epoch": 1.1478260869565218,
"grad_norm": 5.528824806213379,
"learning_rate": 0.00014264596273291926,
"loss": 1.2915,
"step": 4620
},
{
"epoch": 1.1503105590062113,
"grad_norm": 8.432668685913086,
"learning_rate": 0.00014252173913043478,
"loss": 1.0122,
"step": 4630
},
{
"epoch": 1.1527950310559005,
"grad_norm": 5.736224174499512,
"learning_rate": 0.0001423975155279503,
"loss": 0.9787,
"step": 4640
},
{
"epoch": 1.15527950310559,
"grad_norm": 9.182514190673828,
"learning_rate": 0.00014227329192546584,
"loss": 0.9586,
"step": 4650
},
{
"epoch": 1.1577639751552795,
"grad_norm": 8.18057918548584,
"learning_rate": 0.00014214906832298138,
"loss": 1.0702,
"step": 4660
},
{
"epoch": 1.160248447204969,
"grad_norm": 7.330738067626953,
"learning_rate": 0.0001420248447204969,
"loss": 0.9131,
"step": 4670
},
{
"epoch": 1.1627329192546583,
"grad_norm": 4.894416332244873,
"learning_rate": 0.00014190062111801244,
"loss": 0.9788,
"step": 4680
},
{
"epoch": 1.1652173913043478,
"grad_norm": 7.602725028991699,
"learning_rate": 0.00014177639751552796,
"loss": 0.9594,
"step": 4690
},
{
"epoch": 1.1677018633540373,
"grad_norm": 4.91877555847168,
"learning_rate": 0.00014165217391304348,
"loss": 0.9302,
"step": 4700
},
{
"epoch": 1.1677018633540373,
"eval_accuracy": 0.7362492299568776,
"eval_loss": 1.0218663215637207,
"eval_runtime": 85.3252,
"eval_samples_per_second": 133.173,
"eval_steps_per_second": 16.654,
"step": 4700
},
{
"epoch": 1.1701863354037267,
"grad_norm": 5.2337422370910645,
"learning_rate": 0.00014152795031055902,
"loss": 1.1092,
"step": 4710
},
{
"epoch": 1.1726708074534162,
"grad_norm": 8.629744529724121,
"learning_rate": 0.00014140372670807454,
"loss": 1.028,
"step": 4720
},
{
"epoch": 1.1751552795031055,
"grad_norm": 6.914172172546387,
"learning_rate": 0.00014127950310559005,
"loss": 1.0481,
"step": 4730
},
{
"epoch": 1.177639751552795,
"grad_norm": 5.989754676818848,
"learning_rate": 0.0001411552795031056,
"loss": 1.0034,
"step": 4740
},
{
"epoch": 1.1801242236024845,
"grad_norm": 5.203980922698975,
"learning_rate": 0.00014103105590062114,
"loss": 1.1532,
"step": 4750
},
{
"epoch": 1.182608695652174,
"grad_norm": 4.077994346618652,
"learning_rate": 0.00014090683229813666,
"loss": 1.064,
"step": 4760
},
{
"epoch": 1.1850931677018632,
"grad_norm": 7.052755355834961,
"learning_rate": 0.00014078260869565217,
"loss": 1.194,
"step": 4770
},
{
"epoch": 1.1875776397515527,
"grad_norm": 9.312969207763672,
"learning_rate": 0.00014065838509316772,
"loss": 1.0624,
"step": 4780
},
{
"epoch": 1.1900621118012422,
"grad_norm": 6.245819568634033,
"learning_rate": 0.00014053416149068323,
"loss": 1.0172,
"step": 4790
},
{
"epoch": 1.1925465838509317,
"grad_norm": 7.503792762756348,
"learning_rate": 0.00014040993788819875,
"loss": 1.1084,
"step": 4800
},
{
"epoch": 1.1925465838509317,
"eval_accuracy": 0.7349291560327378,
"eval_loss": 0.9940283894538879,
"eval_runtime": 85.5561,
"eval_samples_per_second": 132.813,
"eval_steps_per_second": 16.609,
"step": 4800
},
{
"epoch": 1.1950310559006212,
"grad_norm": 6.583471298217773,
"learning_rate": 0.0001402857142857143,
"loss": 1.2656,
"step": 4810
},
{
"epoch": 1.1975155279503105,
"grad_norm": 3.8363754749298096,
"learning_rate": 0.0001401614906832298,
"loss": 0.7829,
"step": 4820
},
{
"epoch": 1.2,
"grad_norm": 7.965066909790039,
"learning_rate": 0.00014003726708074532,
"loss": 0.9891,
"step": 4830
},
{
"epoch": 1.2024844720496894,
"grad_norm": 3.270879030227661,
"learning_rate": 0.0001399130434782609,
"loss": 0.9665,
"step": 4840
},
{
"epoch": 1.204968944099379,
"grad_norm": 7.581824779510498,
"learning_rate": 0.0001397888198757764,
"loss": 1.3112,
"step": 4850
},
{
"epoch": 1.2074534161490682,
"grad_norm": 7.508520603179932,
"learning_rate": 0.00013966459627329193,
"loss": 1.0786,
"step": 4860
},
{
"epoch": 1.2099378881987577,
"grad_norm": 2.655932664871216,
"learning_rate": 0.00013954037267080747,
"loss": 0.8918,
"step": 4870
},
{
"epoch": 1.2124223602484472,
"grad_norm": 3.294532537460327,
"learning_rate": 0.000139416149068323,
"loss": 0.9471,
"step": 4880
},
{
"epoch": 1.2149068322981367,
"grad_norm": 10.930632591247559,
"learning_rate": 0.0001392919254658385,
"loss": 0.9158,
"step": 4890
},
{
"epoch": 1.2173913043478262,
"grad_norm": 6.163077354431152,
"learning_rate": 0.00013916770186335405,
"loss": 1.0345,
"step": 4900
},
{
"epoch": 1.2173913043478262,
"eval_accuracy": 0.744609698143096,
"eval_loss": 0.9774972200393677,
"eval_runtime": 87.4405,
"eval_samples_per_second": 129.951,
"eval_steps_per_second": 16.251,
"step": 4900
},
{
"epoch": 1.2198757763975154,
"grad_norm": 7.32708215713501,
"learning_rate": 0.00013904347826086956,
"loss": 0.9395,
"step": 4910
},
{
"epoch": 1.222360248447205,
"grad_norm": 7.354382038116455,
"learning_rate": 0.00013891925465838508,
"loss": 1.0895,
"step": 4920
},
{
"epoch": 1.2248447204968944,
"grad_norm": 7.127068996429443,
"learning_rate": 0.00013879503105590065,
"loss": 1.1379,
"step": 4930
},
{
"epoch": 1.227329192546584,
"grad_norm": 9.56634521484375,
"learning_rate": 0.00013867080745341617,
"loss": 1.1754,
"step": 4940
},
{
"epoch": 1.2298136645962732,
"grad_norm": 4.587943077087402,
"learning_rate": 0.00013854658385093168,
"loss": 1.2066,
"step": 4950
},
{
"epoch": 1.2322981366459627,
"grad_norm": 4.837312698364258,
"learning_rate": 0.00013842236024844723,
"loss": 1.0871,
"step": 4960
},
{
"epoch": 1.2347826086956522,
"grad_norm": 6.6595916748046875,
"learning_rate": 0.00013829813664596274,
"loss": 0.9062,
"step": 4970
},
{
"epoch": 1.2372670807453416,
"grad_norm": 5.565141201019287,
"learning_rate": 0.00013817391304347826,
"loss": 1.2128,
"step": 4980
},
{
"epoch": 1.2397515527950311,
"grad_norm": 5.343240261077881,
"learning_rate": 0.0001380496894409938,
"loss": 0.9812,
"step": 4990
},
{
"epoch": 1.2422360248447206,
"grad_norm": 8.496342658996582,
"learning_rate": 0.00013792546583850932,
"loss": 1.0541,
"step": 5000
},
{
"epoch": 1.2422360248447206,
"eval_accuracy": 0.7366012496699815,
"eval_loss": 1.0075589418411255,
"eval_runtime": 87.0565,
"eval_samples_per_second": 130.524,
"eval_steps_per_second": 16.323,
"step": 5000
},
{
"epoch": 1.24472049689441,
"grad_norm": 5.603249549865723,
"learning_rate": 0.00013780124223602484,
"loss": 1.0875,
"step": 5010
},
{
"epoch": 1.2472049689440994,
"grad_norm": 7.066832065582275,
"learning_rate": 0.00013767701863354038,
"loss": 0.9288,
"step": 5020
},
{
"epoch": 1.2496894409937889,
"grad_norm": 7.90041971206665,
"learning_rate": 0.00013755279503105592,
"loss": 0.9789,
"step": 5030
},
{
"epoch": 1.2521739130434781,
"grad_norm": 9.516698837280273,
"learning_rate": 0.00013742857142857144,
"loss": 0.9999,
"step": 5040
},
{
"epoch": 1.2546583850931676,
"grad_norm": 7.783109188079834,
"learning_rate": 0.00013730434782608696,
"loss": 1.0498,
"step": 5050
},
{
"epoch": 1.2571428571428571,
"grad_norm": 9.297592163085938,
"learning_rate": 0.0001371801242236025,
"loss": 1.066,
"step": 5060
},
{
"epoch": 1.2596273291925466,
"grad_norm": 6.5852885246276855,
"learning_rate": 0.00013705590062111802,
"loss": 1.1248,
"step": 5070
},
{
"epoch": 1.262111801242236,
"grad_norm": 6.009893417358398,
"learning_rate": 0.00013693167701863353,
"loss": 1.0595,
"step": 5080
},
{
"epoch": 1.2645962732919256,
"grad_norm": 10.027131080627441,
"learning_rate": 0.00013680745341614907,
"loss": 1.193,
"step": 5090
},
{
"epoch": 1.2670807453416149,
"grad_norm": 4.742192268371582,
"learning_rate": 0.0001366832298136646,
"loss": 0.9345,
"step": 5100
},
{
"epoch": 1.2670807453416149,
"eval_accuracy": 0.7397694270879169,
"eval_loss": 1.0074650049209595,
"eval_runtime": 85.8817,
"eval_samples_per_second": 132.31,
"eval_steps_per_second": 16.546,
"step": 5100
},
{
"epoch": 1.2695652173913043,
"grad_norm": 6.307586193084717,
"learning_rate": 0.00013655900621118013,
"loss": 0.8882,
"step": 5110
},
{
"epoch": 1.2720496894409938,
"grad_norm": 5.385798454284668,
"learning_rate": 0.00013643478260869568,
"loss": 1.1246,
"step": 5120
},
{
"epoch": 1.274534161490683,
"grad_norm": 10.382954597473145,
"learning_rate": 0.0001363105590062112,
"loss": 1.2195,
"step": 5130
},
{
"epoch": 1.2770186335403726,
"grad_norm": 8.333847045898438,
"learning_rate": 0.0001361863354037267,
"loss": 1.0761,
"step": 5140
},
{
"epoch": 1.279503105590062,
"grad_norm": 6.926821708679199,
"learning_rate": 0.00013606211180124225,
"loss": 1.151,
"step": 5150
},
{
"epoch": 1.2819875776397516,
"grad_norm": 5.247950553894043,
"learning_rate": 0.00013593788819875777,
"loss": 0.9743,
"step": 5160
},
{
"epoch": 1.284472049689441,
"grad_norm": 6.131479263305664,
"learning_rate": 0.0001358136645962733,
"loss": 0.982,
"step": 5170
},
{
"epoch": 1.2869565217391306,
"grad_norm": 9.793872833251953,
"learning_rate": 0.00013568944099378883,
"loss": 1.2012,
"step": 5180
},
{
"epoch": 1.2894409937888198,
"grad_norm": 6.260509014129639,
"learning_rate": 0.00013556521739130435,
"loss": 1.1532,
"step": 5190
},
{
"epoch": 1.2919254658385093,
"grad_norm": 7.997650146484375,
"learning_rate": 0.0001354409937888199,
"loss": 0.9149,
"step": 5200
},
{
"epoch": 1.2919254658385093,
"eval_accuracy": 0.7261286632051395,
"eval_loss": 1.0558042526245117,
"eval_runtime": 85.877,
"eval_samples_per_second": 132.317,
"eval_steps_per_second": 16.547,
"step": 5200
},
{
"epoch": 1.2944099378881988,
"grad_norm": 5.47863245010376,
"learning_rate": 0.0001353167701863354,
"loss": 0.9028,
"step": 5210
},
{
"epoch": 1.296894409937888,
"grad_norm": 8.695116996765137,
"learning_rate": 0.00013519254658385095,
"loss": 1.0238,
"step": 5220
},
{
"epoch": 1.2993788819875776,
"grad_norm": 4.540287017822266,
"learning_rate": 0.00013506832298136647,
"loss": 1.2833,
"step": 5230
},
{
"epoch": 1.301863354037267,
"grad_norm": 6.292470932006836,
"learning_rate": 0.00013494409937888198,
"loss": 1.1346,
"step": 5240
},
{
"epoch": 1.3043478260869565,
"grad_norm": 11.708168983459473,
"learning_rate": 0.00013481987577639753,
"loss": 0.9925,
"step": 5250
},
{
"epoch": 1.306832298136646,
"grad_norm": 7.93981409072876,
"learning_rate": 0.00013469565217391304,
"loss": 1.1607,
"step": 5260
},
{
"epoch": 1.3093167701863355,
"grad_norm": 5.9505767822265625,
"learning_rate": 0.00013457142857142856,
"loss": 1.1483,
"step": 5270
},
{
"epoch": 1.3118012422360248,
"grad_norm": 6.372278690338135,
"learning_rate": 0.0001344472049689441,
"loss": 0.9704,
"step": 5280
},
{
"epoch": 1.3142857142857143,
"grad_norm": 5.066626071929932,
"learning_rate": 0.00013432298136645965,
"loss": 1.219,
"step": 5290
},
{
"epoch": 1.3167701863354038,
"grad_norm": 7.538371562957764,
"learning_rate": 0.00013419875776397516,
"loss": 1.2583,
"step": 5300
},
{
"epoch": 1.3167701863354038,
"eval_accuracy": 0.7476018657044794,
"eval_loss": 0.97026127576828,
"eval_runtime": 87.7379,
"eval_samples_per_second": 129.511,
"eval_steps_per_second": 16.196,
"step": 5300
},
{
"epoch": 1.319254658385093,
"grad_norm": 6.197633266448975,
"learning_rate": 0.0001340745341614907,
"loss": 0.9438,
"step": 5310
},
{
"epoch": 1.3217391304347825,
"grad_norm": 4.5123982429504395,
"learning_rate": 0.00013395031055900622,
"loss": 1.0034,
"step": 5320
},
{
"epoch": 1.324223602484472,
"grad_norm": 9.826772689819336,
"learning_rate": 0.00013382608695652174,
"loss": 0.9244,
"step": 5330
},
{
"epoch": 1.3267080745341615,
"grad_norm": 7.484212398529053,
"learning_rate": 0.00013370186335403728,
"loss": 1.1137,
"step": 5340
},
{
"epoch": 1.329192546583851,
"grad_norm": 9.522153854370117,
"learning_rate": 0.0001335776397515528,
"loss": 1.075,
"step": 5350
},
{
"epoch": 1.3316770186335405,
"grad_norm": 7.441765785217285,
"learning_rate": 0.00013345341614906831,
"loss": 1.2174,
"step": 5360
},
{
"epoch": 1.3341614906832298,
"grad_norm": 6.224626064300537,
"learning_rate": 0.00013332919254658386,
"loss": 1.122,
"step": 5370
},
{
"epoch": 1.3366459627329192,
"grad_norm": 14.881075859069824,
"learning_rate": 0.0001332049689440994,
"loss": 1.1255,
"step": 5380
},
{
"epoch": 1.3391304347826087,
"grad_norm": 4.68292236328125,
"learning_rate": 0.00013308074534161492,
"loss": 1.2162,
"step": 5390
},
{
"epoch": 1.341614906832298,
"grad_norm": 10.786056518554688,
"learning_rate": 0.00013295652173913043,
"loss": 1.0745,
"step": 5400
},
{
"epoch": 1.341614906832298,
"eval_accuracy": 0.7424975798644724,
"eval_loss": 0.9902403950691223,
"eval_runtime": 87.4227,
"eval_samples_per_second": 129.978,
"eval_steps_per_second": 16.254,
"step": 5400
},
{
"epoch": 1.3440993788819875,
"grad_norm": 6.61173152923584,
"learning_rate": 0.00013283229813664598,
"loss": 0.9695,
"step": 5410
},
{
"epoch": 1.346583850931677,
"grad_norm": 5.859536170959473,
"learning_rate": 0.0001327080745341615,
"loss": 0.9959,
"step": 5420
},
{
"epoch": 1.3490683229813665,
"grad_norm": 5.674126148223877,
"learning_rate": 0.000132583850931677,
"loss": 0.8,
"step": 5430
},
{
"epoch": 1.351552795031056,
"grad_norm": 6.714157581329346,
"learning_rate": 0.00013245962732919255,
"loss": 1.2895,
"step": 5440
},
{
"epoch": 1.3540372670807455,
"grad_norm": 5.819688320159912,
"learning_rate": 0.00013233540372670807,
"loss": 1.0128,
"step": 5450
},
{
"epoch": 1.3565217391304347,
"grad_norm": 4.154235363006592,
"learning_rate": 0.00013221118012422359,
"loss": 1.0806,
"step": 5460
},
{
"epoch": 1.3590062111801242,
"grad_norm": 3.743555784225464,
"learning_rate": 0.00013208695652173916,
"loss": 1.0332,
"step": 5470
},
{
"epoch": 1.3614906832298137,
"grad_norm": 5.237468242645264,
"learning_rate": 0.00013196273291925467,
"loss": 0.8628,
"step": 5480
},
{
"epoch": 1.363975155279503,
"grad_norm": 9.270702362060547,
"learning_rate": 0.0001318385093167702,
"loss": 0.7336,
"step": 5490
},
{
"epoch": 1.3664596273291925,
"grad_norm": 6.079173564910889,
"learning_rate": 0.00013171428571428573,
"loss": 0.8319,
"step": 5500
},
{
"epoch": 1.3664596273291925,
"eval_accuracy": 0.755346299392766,
"eval_loss": 0.9442151784896851,
"eval_runtime": 88.6963,
"eval_samples_per_second": 128.111,
"eval_steps_per_second": 16.021,
"step": 5500
},
{
"epoch": 1.368944099378882,
"grad_norm": 6.590054035186768,
"learning_rate": 0.00013159006211180125,
"loss": 0.8682,
"step": 5510
},
{
"epoch": 1.3714285714285714,
"grad_norm": 8.657280921936035,
"learning_rate": 0.00013146583850931677,
"loss": 1.0832,
"step": 5520
},
{
"epoch": 1.373913043478261,
"grad_norm": 7.433463096618652,
"learning_rate": 0.0001313416149068323,
"loss": 1.0144,
"step": 5530
},
{
"epoch": 1.3763975155279504,
"grad_norm": 10.5570650100708,
"learning_rate": 0.00013121739130434783,
"loss": 1.0187,
"step": 5540
},
{
"epoch": 1.3788819875776397,
"grad_norm": 6.170913219451904,
"learning_rate": 0.00013109316770186334,
"loss": 0.9172,
"step": 5550
},
{
"epoch": 1.3813664596273292,
"grad_norm": 6.9560394287109375,
"learning_rate": 0.00013096894409937889,
"loss": 0.9233,
"step": 5560
},
{
"epoch": 1.3838509316770187,
"grad_norm": 5.400057315826416,
"learning_rate": 0.00013084472049689443,
"loss": 1.1142,
"step": 5570
},
{
"epoch": 1.386335403726708,
"grad_norm": 6.7998433113098145,
"learning_rate": 0.00013072049689440995,
"loss": 1.0297,
"step": 5580
},
{
"epoch": 1.3888198757763974,
"grad_norm": 6.90951681137085,
"learning_rate": 0.0001305962732919255,
"loss": 1.1061,
"step": 5590
},
{
"epoch": 1.391304347826087,
"grad_norm": 6.948334217071533,
"learning_rate": 0.000130472049689441,
"loss": 1.1286,
"step": 5600
},
{
"epoch": 1.391304347826087,
"eval_accuracy": 0.7532341811141424,
"eval_loss": 0.9619560837745667,
"eval_runtime": 87.4294,
"eval_samples_per_second": 129.968,
"eval_steps_per_second": 16.253,
"step": 5600
},
{
"epoch": 1.3937888198757764,
"grad_norm": 2.2225635051727295,
"learning_rate": 0.00013034782608695652,
"loss": 0.8869,
"step": 5610
},
{
"epoch": 1.396273291925466,
"grad_norm": 7.6301188468933105,
"learning_rate": 0.00013022360248447206,
"loss": 0.7048,
"step": 5620
},
{
"epoch": 1.3987577639751554,
"grad_norm": 6.9699506759643555,
"learning_rate": 0.00013009937888198758,
"loss": 1.059,
"step": 5630
},
{
"epoch": 1.4012422360248447,
"grad_norm": 8.951197624206543,
"learning_rate": 0.0001299751552795031,
"loss": 1.1901,
"step": 5640
},
{
"epoch": 1.4037267080745341,
"grad_norm": 7.2019877433776855,
"learning_rate": 0.00012985093167701864,
"loss": 0.9462,
"step": 5650
},
{
"epoch": 1.4062111801242236,
"grad_norm": 4.786462783813477,
"learning_rate": 0.00012972670807453418,
"loss": 1.0455,
"step": 5660
},
{
"epoch": 1.4086956521739131,
"grad_norm": 4.615877628326416,
"learning_rate": 0.0001296024844720497,
"loss": 0.9419,
"step": 5670
},
{
"epoch": 1.4111801242236024,
"grad_norm": 7.7541375160217285,
"learning_rate": 0.00012947826086956522,
"loss": 1.1388,
"step": 5680
},
{
"epoch": 1.4136645962732919,
"grad_norm": 10.098551750183105,
"learning_rate": 0.00012935403726708076,
"loss": 1.1869,
"step": 5690
},
{
"epoch": 1.4161490683229814,
"grad_norm": 6.00745964050293,
"learning_rate": 0.00012922981366459628,
"loss": 0.8228,
"step": 5700
},
{
"epoch": 1.4161490683229814,
"eval_accuracy": 0.755522309249318,
"eval_loss": 0.9329186081886292,
"eval_runtime": 87.4839,
"eval_samples_per_second": 129.887,
"eval_steps_per_second": 16.243,
"step": 5700
},
{
"epoch": 1.4186335403726709,
"grad_norm": 7.620040416717529,
"learning_rate": 0.0001291055900621118,
"loss": 0.8857,
"step": 5710
},
{
"epoch": 1.4211180124223604,
"grad_norm": 5.4932169914245605,
"learning_rate": 0.00012898136645962734,
"loss": 1.2403,
"step": 5720
},
{
"epoch": 1.4236024844720496,
"grad_norm": 6.197946071624756,
"learning_rate": 0.0001288695652173913,
"loss": 0.8465,
"step": 5730
},
{
"epoch": 1.4260869565217391,
"grad_norm": 6.2294087409973145,
"learning_rate": 0.00012874534161490684,
"loss": 0.9501,
"step": 5740
},
{
"epoch": 1.4285714285714286,
"grad_norm": 5.705041885375977,
"learning_rate": 0.00012862111801242236,
"loss": 1.1994,
"step": 5750
},
{
"epoch": 1.431055900621118,
"grad_norm": 6.058370113372803,
"learning_rate": 0.00012849689440993787,
"loss": 1.1482,
"step": 5760
},
{
"epoch": 1.4335403726708074,
"grad_norm": 8.761661529541016,
"learning_rate": 0.00012837267080745345,
"loss": 1.0147,
"step": 5770
},
{
"epoch": 1.4360248447204969,
"grad_norm": 5.797641754150391,
"learning_rate": 0.00012824844720496896,
"loss": 1.2052,
"step": 5780
},
{
"epoch": 1.4385093167701863,
"grad_norm": 5.235717296600342,
"learning_rate": 0.00012812422360248448,
"loss": 1.0181,
"step": 5790
},
{
"epoch": 1.4409937888198758,
"grad_norm": 6.6115875244140625,
"learning_rate": 0.00012800000000000002,
"loss": 1.3209,
"step": 5800
},
{
"epoch": 1.4409937888198758,
"eval_accuracy": 0.7542902402534541,
"eval_loss": 0.9402074217796326,
"eval_runtime": 86.5609,
"eval_samples_per_second": 131.272,
"eval_steps_per_second": 16.416,
"step": 5800
},
{
"epoch": 1.4434782608695653,
"grad_norm": 5.539206504821777,
"learning_rate": 0.00012787577639751554,
"loss": 0.8167,
"step": 5810
},
{
"epoch": 1.4459627329192546,
"grad_norm": 8.917939186096191,
"learning_rate": 0.00012775155279503105,
"loss": 0.8825,
"step": 5820
},
{
"epoch": 1.448447204968944,
"grad_norm": 8.370964050292969,
"learning_rate": 0.0001276273291925466,
"loss": 1.1812,
"step": 5830
},
{
"epoch": 1.4509316770186336,
"grad_norm": 8.157317161560059,
"learning_rate": 0.00012750310559006211,
"loss": 0.8365,
"step": 5840
},
{
"epoch": 1.453416149068323,
"grad_norm": 8.257402420043945,
"learning_rate": 0.00012737888198757763,
"loss": 0.9687,
"step": 5850
},
{
"epoch": 1.4559006211180123,
"grad_norm": 6.2165727615356445,
"learning_rate": 0.00012725465838509317,
"loss": 1.0794,
"step": 5860
},
{
"epoch": 1.4583850931677018,
"grad_norm": 6.8931565284729,
"learning_rate": 0.00012713043478260872,
"loss": 1.0139,
"step": 5870
},
{
"epoch": 1.4608695652173913,
"grad_norm": 6.232843399047852,
"learning_rate": 0.00012700621118012423,
"loss": 1.0135,
"step": 5880
},
{
"epoch": 1.4633540372670808,
"grad_norm": 9.0387544631958,
"learning_rate": 0.00012688198757763975,
"loss": 1.039,
"step": 5890
},
{
"epoch": 1.4658385093167703,
"grad_norm": 5.991683483123779,
"learning_rate": 0.0001267577639751553,
"loss": 0.7629,
"step": 5900
},
{
"epoch": 1.4658385093167703,
"eval_accuracy": 0.7547302648948341,
"eval_loss": 0.9496744275093079,
"eval_runtime": 86.9169,
"eval_samples_per_second": 130.734,
"eval_steps_per_second": 16.349,
"step": 5900
},
{
"epoch": 1.4683229813664596,
"grad_norm": 7.1583147048950195,
"learning_rate": 0.0001266335403726708,
"loss": 0.8985,
"step": 5910
},
{
"epoch": 1.470807453416149,
"grad_norm": 7.79310941696167,
"learning_rate": 0.00012650931677018633,
"loss": 1.1252,
"step": 5920
},
{
"epoch": 1.4732919254658385,
"grad_norm": 4.338858604431152,
"learning_rate": 0.00012638509316770187,
"loss": 0.9808,
"step": 5930
},
{
"epoch": 1.475776397515528,
"grad_norm": 3.2830729484558105,
"learning_rate": 0.00012626086956521739,
"loss": 0.9988,
"step": 5940
},
{
"epoch": 1.4782608695652173,
"grad_norm": 5.117250442504883,
"learning_rate": 0.00012613664596273293,
"loss": 0.9113,
"step": 5950
},
{
"epoch": 1.4807453416149068,
"grad_norm": 4.326136589050293,
"learning_rate": 0.00012601242236024847,
"loss": 1.0195,
"step": 5960
},
{
"epoch": 1.4832298136645963,
"grad_norm": 9.285099029541016,
"learning_rate": 0.000125888198757764,
"loss": 1.0247,
"step": 5970
},
{
"epoch": 1.4857142857142858,
"grad_norm": 9.194808006286621,
"learning_rate": 0.0001257639751552795,
"loss": 1.1631,
"step": 5980
},
{
"epoch": 1.4881987577639753,
"grad_norm": 4.7411885261535645,
"learning_rate": 0.00012563975155279505,
"loss": 0.8195,
"step": 5990
},
{
"epoch": 1.4906832298136645,
"grad_norm": 7.099352836608887,
"learning_rate": 0.00012551552795031057,
"loss": 0.9906,
"step": 6000
},
{
"epoch": 1.4906832298136645,
"eval_accuracy": 0.7588664965238053,
"eval_loss": 0.9361943602561951,
"eval_runtime": 87.6514,
"eval_samples_per_second": 129.639,
"eval_steps_per_second": 16.212,
"step": 6000
},
{
"epoch": 1.493167701863354,
"grad_norm": 8.118821144104004,
"learning_rate": 0.00012539130434782608,
"loss": 1.1247,
"step": 6010
},
{
"epoch": 1.4956521739130435,
"grad_norm": 10.393396377563477,
"learning_rate": 0.00012526708074534162,
"loss": 0.9778,
"step": 6020
},
{
"epoch": 1.498136645962733,
"grad_norm": 5.61733865737915,
"learning_rate": 0.00012514285714285714,
"loss": 1.0013,
"step": 6030
},
{
"epoch": 1.5006211180124223,
"grad_norm": 7.131757736206055,
"learning_rate": 0.00012501863354037268,
"loss": 0.7967,
"step": 6040
},
{
"epoch": 1.5031055900621118,
"grad_norm": 5.835470676422119,
"learning_rate": 0.0001248944099378882,
"loss": 0.9079,
"step": 6050
},
{
"epoch": 1.5055900621118012,
"grad_norm": 3.6993353366851807,
"learning_rate": 0.00012477018633540374,
"loss": 0.8018,
"step": 6060
},
{
"epoch": 1.5080745341614907,
"grad_norm": 4.835446834564209,
"learning_rate": 0.00012464596273291926,
"loss": 1.1568,
"step": 6070
},
{
"epoch": 1.5105590062111802,
"grad_norm": 4.084790229797363,
"learning_rate": 0.00012452173913043478,
"loss": 1.2725,
"step": 6080
},
{
"epoch": 1.5130434782608697,
"grad_norm": 4.596613883972168,
"learning_rate": 0.00012439751552795032,
"loss": 1.0996,
"step": 6090
},
{
"epoch": 1.515527950310559,
"grad_norm": 7.749314785003662,
"learning_rate": 0.00012427329192546584,
"loss": 0.9966,
"step": 6100
},
{
"epoch": 1.515527950310559,
"eval_accuracy": 0.7594825310217372,
"eval_loss": 0.9321704506874084,
"eval_runtime": 86.7196,
"eval_samples_per_second": 131.032,
"eval_steps_per_second": 16.386,
"step": 6100
},
{
"epoch": 1.5180124223602485,
"grad_norm": 5.206863880157471,
"learning_rate": 0.00012414906832298135,
"loss": 0.8907,
"step": 6110
},
{
"epoch": 1.5204968944099377,
"grad_norm": 3.3592071533203125,
"learning_rate": 0.0001240248447204969,
"loss": 0.7821,
"step": 6120
},
{
"epoch": 1.5229813664596272,
"grad_norm": 7.234273910522461,
"learning_rate": 0.00012390062111801244,
"loss": 1.0522,
"step": 6130
},
{
"epoch": 1.5254658385093167,
"grad_norm": 8.088465690612793,
"learning_rate": 0.00012377639751552796,
"loss": 1.146,
"step": 6140
},
{
"epoch": 1.5279503105590062,
"grad_norm": 6.445027828216553,
"learning_rate": 0.0001236521739130435,
"loss": 1.1889,
"step": 6150
},
{
"epoch": 1.5304347826086957,
"grad_norm": 8.097786903381348,
"learning_rate": 0.00012352795031055902,
"loss": 1.0494,
"step": 6160
},
{
"epoch": 1.5329192546583852,
"grad_norm": 7.564890384674072,
"learning_rate": 0.00012340372670807453,
"loss": 1.0297,
"step": 6170
},
{
"epoch": 1.5354037267080747,
"grad_norm": 7.270158767700195,
"learning_rate": 0.00012327950310559008,
"loss": 1.1366,
"step": 6180
},
{
"epoch": 1.537888198757764,
"grad_norm": 4.950170993804932,
"learning_rate": 0.0001231552795031056,
"loss": 0.9552,
"step": 6190
},
{
"epoch": 1.5403726708074534,
"grad_norm": 5.859093189239502,
"learning_rate": 0.0001230310559006211,
"loss": 0.8868,
"step": 6200
},
{
"epoch": 1.5403726708074534,
"eval_accuracy": 0.7505940332658629,
"eval_loss": 0.9613372087478638,
"eval_runtime": 87.5087,
"eval_samples_per_second": 129.85,
"eval_steps_per_second": 16.238,
"step": 6200
},
{
"epoch": 1.5428571428571427,
"grad_norm": 7.968153476715088,
"learning_rate": 0.00012290683229813665,
"loss": 1.2027,
"step": 6210
},
{
"epoch": 1.5453416149068322,
"grad_norm": 2.827946186065674,
"learning_rate": 0.0001227826086956522,
"loss": 0.7312,
"step": 6220
},
{
"epoch": 1.5478260869565217,
"grad_norm": 8.215697288513184,
"learning_rate": 0.0001226583850931677,
"loss": 0.9336,
"step": 6230
},
{
"epoch": 1.5503105590062112,
"grad_norm": 8.164762496948242,
"learning_rate": 0.00012253416149068323,
"loss": 0.782,
"step": 6240
},
{
"epoch": 1.5527950310559007,
"grad_norm": 6.815315246582031,
"learning_rate": 0.00012240993788819877,
"loss": 0.897,
"step": 6250
},
{
"epoch": 1.5552795031055902,
"grad_norm": 9.907848358154297,
"learning_rate": 0.0001222857142857143,
"loss": 1.0146,
"step": 6260
},
{
"epoch": 1.5577639751552796,
"grad_norm": 3.322430372238159,
"learning_rate": 0.0001221614906832298,
"loss": 1.1132,
"step": 6270
},
{
"epoch": 1.560248447204969,
"grad_norm": 5.496293067932129,
"learning_rate": 0.00012203726708074535,
"loss": 0.8865,
"step": 6280
},
{
"epoch": 1.5627329192546584,
"grad_norm": 4.975622177124023,
"learning_rate": 0.00012191304347826086,
"loss": 0.9737,
"step": 6290
},
{
"epoch": 1.5652173913043477,
"grad_norm": 10.409469604492188,
"learning_rate": 0.0001217888198757764,
"loss": 0.956,
"step": 6300
},
{
"epoch": 1.5652173913043477,
"eval_accuracy": 0.7567543782451818,
"eval_loss": 0.9370301365852356,
"eval_runtime": 87.3636,
"eval_samples_per_second": 130.066,
"eval_steps_per_second": 16.265,
"step": 6300
},
{
"epoch": 1.5677018633540372,
"grad_norm": 6.119087219238281,
"learning_rate": 0.00012166459627329194,
"loss": 0.8334,
"step": 6310
},
{
"epoch": 1.5701863354037267,
"grad_norm": 9.4066162109375,
"learning_rate": 0.00012154037267080747,
"loss": 1.0246,
"step": 6320
},
{
"epoch": 1.5726708074534161,
"grad_norm": 2.9001400470733643,
"learning_rate": 0.000121416149068323,
"loss": 1.1431,
"step": 6330
},
{
"epoch": 1.5751552795031056,
"grad_norm": 4.719793796539307,
"learning_rate": 0.00012129192546583851,
"loss": 0.9183,
"step": 6340
},
{
"epoch": 1.5776397515527951,
"grad_norm": 6.822214603424072,
"learning_rate": 0.00012116770186335404,
"loss": 1.0926,
"step": 6350
},
{
"epoch": 1.5801242236024846,
"grad_norm": 7.05217170715332,
"learning_rate": 0.00012104347826086957,
"loss": 0.9341,
"step": 6360
},
{
"epoch": 1.5826086956521739,
"grad_norm": 6.148478984832764,
"learning_rate": 0.00012091925465838509,
"loss": 0.9628,
"step": 6370
},
{
"epoch": 1.5850931677018634,
"grad_norm": 5.6752095222473145,
"learning_rate": 0.00012079503105590062,
"loss": 1.1237,
"step": 6380
},
{
"epoch": 1.5875776397515526,
"grad_norm": 6.509497165679932,
"learning_rate": 0.00012067080745341615,
"loss": 1.1021,
"step": 6390
},
{
"epoch": 1.5900621118012421,
"grad_norm": 6.627172470092773,
"learning_rate": 0.00012054658385093169,
"loss": 1.1833,
"step": 6400
},
{
"epoch": 1.5900621118012421,
"eval_accuracy": 0.7597465458065652,
"eval_loss": 0.9276845455169678,
"eval_runtime": 88.2091,
"eval_samples_per_second": 128.819,
"eval_steps_per_second": 16.109,
"step": 6400
},
{
"epoch": 1.5925465838509316,
"grad_norm": 7.526735305786133,
"learning_rate": 0.00012042236024844722,
"loss": 0.8029,
"step": 6410
},
{
"epoch": 1.595031055900621,
"grad_norm": 6.848104000091553,
"learning_rate": 0.00012031055900621117,
"loss": 1.1801,
"step": 6420
},
{
"epoch": 1.5975155279503106,
"grad_norm": 7.543861389160156,
"learning_rate": 0.00012018633540372673,
"loss": 0.794,
"step": 6430
},
{
"epoch": 1.6,
"grad_norm": 2.324418067932129,
"learning_rate": 0.00012006211180124224,
"loss": 1.0119,
"step": 6440
},
{
"epoch": 1.6024844720496896,
"grad_norm": 6.490159511566162,
"learning_rate": 0.00011993788819875777,
"loss": 0.8435,
"step": 6450
},
{
"epoch": 1.6049689440993788,
"grad_norm": 6.797852516174316,
"learning_rate": 0.0001198136645962733,
"loss": 0.9619,
"step": 6460
},
{
"epoch": 1.6074534161490683,
"grad_norm": 5.924860954284668,
"learning_rate": 0.00011968944099378882,
"loss": 1.0926,
"step": 6470
},
{
"epoch": 1.6099378881987576,
"grad_norm": 5.143548011779785,
"learning_rate": 0.00011956521739130435,
"loss": 0.9834,
"step": 6480
},
{
"epoch": 1.612422360248447,
"grad_norm": 2.3223421573638916,
"learning_rate": 0.00011944099378881988,
"loss": 0.7827,
"step": 6490
},
{
"epoch": 1.6149068322981366,
"grad_norm": 3.3075764179229736,
"learning_rate": 0.0001193167701863354,
"loss": 0.9747,
"step": 6500
},
{
"epoch": 1.6149068322981366,
"eval_accuracy": 0.7696030977734754,
"eval_loss": 0.8776896595954895,
"eval_runtime": 86.0614,
"eval_samples_per_second": 132.034,
"eval_steps_per_second": 16.511,
"step": 6500
},
{
"epoch": 1.617391304347826,
"grad_norm": 3.3240957260131836,
"learning_rate": 0.00011919254658385093,
"loss": 0.9756,
"step": 6510
},
{
"epoch": 1.6198757763975156,
"grad_norm": 6.321386814117432,
"learning_rate": 0.00011906832298136647,
"loss": 0.918,
"step": 6520
},
{
"epoch": 1.622360248447205,
"grad_norm": 6.500185012817383,
"learning_rate": 0.000118944099378882,
"loss": 0.9901,
"step": 6530
},
{
"epoch": 1.6248447204968945,
"grad_norm": 8.747745513916016,
"learning_rate": 0.00011881987577639753,
"loss": 0.9637,
"step": 6540
},
{
"epoch": 1.6273291925465838,
"grad_norm": 5.210270881652832,
"learning_rate": 0.00011869565217391305,
"loss": 0.921,
"step": 6550
},
{
"epoch": 1.6298136645962733,
"grad_norm": 5.422876358032227,
"learning_rate": 0.00011857142857142858,
"loss": 1.0392,
"step": 6560
},
{
"epoch": 1.6322981366459626,
"grad_norm": 7.760617733001709,
"learning_rate": 0.0001184472049689441,
"loss": 0.835,
"step": 6570
},
{
"epoch": 1.634782608695652,
"grad_norm": 5.978461265563965,
"learning_rate": 0.00011832298136645962,
"loss": 1.2663,
"step": 6580
},
{
"epoch": 1.6372670807453416,
"grad_norm": 4.057701587677002,
"learning_rate": 0.00011819875776397515,
"loss": 0.9839,
"step": 6590
},
{
"epoch": 1.639751552795031,
"grad_norm": 6.924076557159424,
"learning_rate": 0.00011807453416149068,
"loss": 1.0119,
"step": 6600
},
{
"epoch": 1.639751552795031,
"eval_accuracy": 0.7652908562879521,
"eval_loss": 0.8980146050453186,
"eval_runtime": 85.9497,
"eval_samples_per_second": 132.205,
"eval_steps_per_second": 16.533,
"step": 6600
},
{
"epoch": 1.6422360248447205,
"grad_norm": 6.758317470550537,
"learning_rate": 0.00011795031055900623,
"loss": 0.9603,
"step": 6610
},
{
"epoch": 1.64472049689441,
"grad_norm": 8.458471298217773,
"learning_rate": 0.00011782608695652176,
"loss": 1.0986,
"step": 6620
},
{
"epoch": 1.6472049689440995,
"grad_norm": 5.507945537567139,
"learning_rate": 0.00011770186335403727,
"loss": 0.9222,
"step": 6630
},
{
"epoch": 1.6496894409937888,
"grad_norm": 6.546318531036377,
"learning_rate": 0.0001175776397515528,
"loss": 0.735,
"step": 6640
},
{
"epoch": 1.6521739130434783,
"grad_norm": 7.688220500946045,
"learning_rate": 0.00011745341614906833,
"loss": 1.0007,
"step": 6650
},
{
"epoch": 1.6546583850931675,
"grad_norm": 8.641738891601562,
"learning_rate": 0.00011732919254658385,
"loss": 0.7686,
"step": 6660
},
{
"epoch": 1.657142857142857,
"grad_norm": 7.91213321685791,
"learning_rate": 0.00011720496894409938,
"loss": 0.9509,
"step": 6670
},
{
"epoch": 1.6596273291925465,
"grad_norm": 9.004672050476074,
"learning_rate": 0.00011708074534161491,
"loss": 0.7764,
"step": 6680
},
{
"epoch": 1.662111801242236,
"grad_norm": 7.412413120269775,
"learning_rate": 0.00011695652173913042,
"loss": 1.0701,
"step": 6690
},
{
"epoch": 1.6645962732919255,
"grad_norm": 5.0252885818481445,
"learning_rate": 0.00011683229813664598,
"loss": 0.9764,
"step": 6700
},
{
"epoch": 1.6645962732919255,
"eval_accuracy": 0.7641467922203643,
"eval_loss": 0.9070652723312378,
"eval_runtime": 88.0089,
"eval_samples_per_second": 129.112,
"eval_steps_per_second": 16.146,
"step": 6700
},
{
"epoch": 1.667080745341615,
"grad_norm": 6.071985244750977,
"learning_rate": 0.0001167080745341615,
"loss": 0.9533,
"step": 6710
},
{
"epoch": 1.6695652173913045,
"grad_norm": 7.6646809577941895,
"learning_rate": 0.00011658385093167703,
"loss": 0.888,
"step": 6720
},
{
"epoch": 1.6720496894409937,
"grad_norm": 7.314651012420654,
"learning_rate": 0.00011645962732919256,
"loss": 0.9252,
"step": 6730
},
{
"epoch": 1.6745341614906832,
"grad_norm": 5.55505895614624,
"learning_rate": 0.00011633540372670809,
"loss": 0.9717,
"step": 6740
},
{
"epoch": 1.6770186335403725,
"grad_norm": 6.546708583831787,
"learning_rate": 0.0001162111801242236,
"loss": 0.8291,
"step": 6750
},
{
"epoch": 1.679503105590062,
"grad_norm": 6.897370338439941,
"learning_rate": 0.00011608695652173913,
"loss": 1.0541,
"step": 6760
},
{
"epoch": 1.6819875776397515,
"grad_norm": 5.658356666564941,
"learning_rate": 0.00011596273291925466,
"loss": 1.2573,
"step": 6770
},
{
"epoch": 1.684472049689441,
"grad_norm": 9.185235977172852,
"learning_rate": 0.00011583850931677018,
"loss": 1.133,
"step": 6780
},
{
"epoch": 1.6869565217391305,
"grad_norm": 6.854763507843018,
"learning_rate": 0.00011571428571428574,
"loss": 0.9488,
"step": 6790
},
{
"epoch": 1.68944099378882,
"grad_norm": 6.5308990478515625,
"learning_rate": 0.00011559006211180125,
"loss": 1.0528,
"step": 6800
},
{
"epoch": 1.68944099378882,
"eval_accuracy": 0.7694270879169234,
"eval_loss": 0.8940765857696533,
"eval_runtime": 87.1629,
"eval_samples_per_second": 130.365,
"eval_steps_per_second": 16.303,
"step": 6800
},
{
"epoch": 1.6919254658385094,
"grad_norm": 4.403570652008057,
"learning_rate": 0.00011546583850931678,
"loss": 0.8713,
"step": 6810
},
{
"epoch": 1.6944099378881987,
"grad_norm": 6.358486175537109,
"learning_rate": 0.00011534161490683231,
"loss": 0.977,
"step": 6820
},
{
"epoch": 1.6968944099378882,
"grad_norm": 7.4040608406066895,
"learning_rate": 0.00011521739130434783,
"loss": 1.1085,
"step": 6830
},
{
"epoch": 1.6993788819875777,
"grad_norm": 6.154741287231445,
"learning_rate": 0.00011509316770186336,
"loss": 0.9678,
"step": 6840
},
{
"epoch": 1.701863354037267,
"grad_norm": 6.781441688537598,
"learning_rate": 0.00011496894409937889,
"loss": 0.8432,
"step": 6850
},
{
"epoch": 1.7043478260869565,
"grad_norm": 6.97227144241333,
"learning_rate": 0.0001148447204968944,
"loss": 0.7707,
"step": 6860
},
{
"epoch": 1.706832298136646,
"grad_norm": 8.75203800201416,
"learning_rate": 0.00011472049689440994,
"loss": 0.7618,
"step": 6870
},
{
"epoch": 1.7093167701863354,
"grad_norm": 8.073197364807129,
"learning_rate": 0.00011459627329192548,
"loss": 1.0681,
"step": 6880
},
{
"epoch": 1.711801242236025,
"grad_norm": 6.717360973358154,
"learning_rate": 0.00011447204968944101,
"loss": 0.9677,
"step": 6890
},
{
"epoch": 1.7142857142857144,
"grad_norm": 5.445791721343994,
"learning_rate": 0.00011434782608695654,
"loss": 0.942,
"step": 6900
},
{
"epoch": 1.7142857142857144,
"eval_accuracy": 0.7736513244741705,
"eval_loss": 0.8718106746673584,
"eval_runtime": 86.3638,
"eval_samples_per_second": 131.571,
"eval_steps_per_second": 16.454,
"step": 6900
},
{
"epoch": 1.7167701863354037,
"grad_norm": 5.544734954833984,
"learning_rate": 0.00011422360248447206,
"loss": 0.7708,
"step": 6910
},
{
"epoch": 1.7192546583850932,
"grad_norm": 4.751190662384033,
"learning_rate": 0.00011409937888198759,
"loss": 1.0393,
"step": 6920
},
{
"epoch": 1.7217391304347827,
"grad_norm": 4.869985580444336,
"learning_rate": 0.00011397515527950311,
"loss": 0.8267,
"step": 6930
},
{
"epoch": 1.724223602484472,
"grad_norm": 4.8316168785095215,
"learning_rate": 0.00011385093167701863,
"loss": 0.9154,
"step": 6940
},
{
"epoch": 1.7267080745341614,
"grad_norm": 5.959396839141846,
"learning_rate": 0.00011372670807453416,
"loss": 1.066,
"step": 6950
},
{
"epoch": 1.729192546583851,
"grad_norm": 2.427189826965332,
"learning_rate": 0.00011360248447204969,
"loss": 0.6803,
"step": 6960
},
{
"epoch": 1.7316770186335404,
"grad_norm": 6.201396942138672,
"learning_rate": 0.00011347826086956523,
"loss": 0.7596,
"step": 6970
},
{
"epoch": 1.73416149068323,
"grad_norm": 9.373711585998535,
"learning_rate": 0.00011335403726708076,
"loss": 0.8998,
"step": 6980
},
{
"epoch": 1.7366459627329194,
"grad_norm": 4.7054643630981445,
"learning_rate": 0.00011322981366459628,
"loss": 1.1068,
"step": 6990
},
{
"epoch": 1.7391304347826086,
"grad_norm": 7.425700664520264,
"learning_rate": 0.00011310559006211181,
"loss": 1.0387,
"step": 7000
},
{
"epoch": 1.7391304347826086,
"eval_accuracy": 0.7786676053859016,
"eval_loss": 0.8614795804023743,
"eval_runtime": 86.4009,
"eval_samples_per_second": 131.515,
"eval_steps_per_second": 16.447,
"step": 7000
},
{
"epoch": 1.7416149068322981,
"grad_norm": 5.01289176940918,
"learning_rate": 0.00011298136645962734,
"loss": 1.0977,
"step": 7010
},
{
"epoch": 1.7440993788819876,
"grad_norm": 7.544558048248291,
"learning_rate": 0.00011285714285714286,
"loss": 1.1391,
"step": 7020
},
{
"epoch": 1.746583850931677,
"grad_norm": 5.905050277709961,
"learning_rate": 0.00011273291925465839,
"loss": 0.9768,
"step": 7030
},
{
"epoch": 1.7490683229813664,
"grad_norm": 4.24083137512207,
"learning_rate": 0.00011260869565217392,
"loss": 1.0744,
"step": 7040
},
{
"epoch": 1.7515527950310559,
"grad_norm": 2.2467899322509766,
"learning_rate": 0.00011248447204968943,
"loss": 0.8104,
"step": 7050
},
{
"epoch": 1.7540372670807454,
"grad_norm": 6.543946266174316,
"learning_rate": 0.00011236024844720496,
"loss": 0.9234,
"step": 7060
},
{
"epoch": 1.7565217391304349,
"grad_norm": 5.305374622344971,
"learning_rate": 0.0001122360248447205,
"loss": 0.9713,
"step": 7070
},
{
"epoch": 1.7590062111801243,
"grad_norm": 7.800411224365234,
"learning_rate": 0.00011211180124223604,
"loss": 0.7504,
"step": 7080
},
{
"epoch": 1.7614906832298136,
"grad_norm": 7.4360432624816895,
"learning_rate": 0.00011198757763975157,
"loss": 1.0139,
"step": 7090
},
{
"epoch": 1.763975155279503,
"grad_norm": 6.3255934715271,
"learning_rate": 0.00011186335403726708,
"loss": 0.9054,
"step": 7100
},
{
"epoch": 1.763975155279503,
"eval_accuracy": 0.7734753146176185,
"eval_loss": 0.8689095973968506,
"eval_runtime": 87.8349,
"eval_samples_per_second": 129.368,
"eval_steps_per_second": 16.178,
"step": 7100
},
{
"epoch": 1.7664596273291926,
"grad_norm": 11.395488739013672,
"learning_rate": 0.00011173913043478261,
"loss": 1.1122,
"step": 7110
},
{
"epoch": 1.7689440993788819,
"grad_norm": 6.530506610870361,
"learning_rate": 0.00011161490683229814,
"loss": 0.9217,
"step": 7120
},
{
"epoch": 1.7714285714285714,
"grad_norm": 3.929171085357666,
"learning_rate": 0.00011149068322981366,
"loss": 0.9403,
"step": 7130
},
{
"epoch": 1.7739130434782608,
"grad_norm": 5.387374401092529,
"learning_rate": 0.00011136645962732919,
"loss": 0.8515,
"step": 7140
},
{
"epoch": 1.7763975155279503,
"grad_norm": 3.4766998291015625,
"learning_rate": 0.00011124223602484472,
"loss": 0.9208,
"step": 7150
},
{
"epoch": 1.7788819875776398,
"grad_norm": 6.483366012573242,
"learning_rate": 0.00011111801242236026,
"loss": 0.9254,
"step": 7160
},
{
"epoch": 1.7813664596273293,
"grad_norm": 3.7569687366485596,
"learning_rate": 0.00011099378881987579,
"loss": 0.9812,
"step": 7170
},
{
"epoch": 1.7838509316770186,
"grad_norm": 5.825034141540527,
"learning_rate": 0.00011086956521739131,
"loss": 0.9628,
"step": 7180
},
{
"epoch": 1.786335403726708,
"grad_norm": 9.814273834228516,
"learning_rate": 0.00011074534161490684,
"loss": 1.1503,
"step": 7190
},
{
"epoch": 1.7888198757763976,
"grad_norm": 6.026792526245117,
"learning_rate": 0.00011062111801242237,
"loss": 1.0327,
"step": 7200
},
{
"epoch": 1.7888198757763976,
"eval_accuracy": 0.7691630731320954,
"eval_loss": 0.8953230977058411,
"eval_runtime": 87.5399,
"eval_samples_per_second": 129.804,
"eval_steps_per_second": 16.233,
"step": 7200
},
{
"epoch": 1.7913043478260868,
"grad_norm": 8.353828430175781,
"learning_rate": 0.00011049689440993788,
"loss": 0.9956,
"step": 7210
},
{
"epoch": 1.7937888198757763,
"grad_norm": 4.231791019439697,
"learning_rate": 0.00011037267080745341,
"loss": 1.0019,
"step": 7220
},
{
"epoch": 1.7962732919254658,
"grad_norm": 6.863067626953125,
"learning_rate": 0.00011024844720496894,
"loss": 0.8933,
"step": 7230
},
{
"epoch": 1.7987577639751553,
"grad_norm": 5.806077003479004,
"learning_rate": 0.00011012422360248446,
"loss": 0.7849,
"step": 7240
},
{
"epoch": 1.8012422360248448,
"grad_norm": 4.928778648376465,
"learning_rate": 0.00011000000000000002,
"loss": 1.0724,
"step": 7250
},
{
"epoch": 1.8037267080745343,
"grad_norm": 4.490487098693848,
"learning_rate": 0.00010987577639751553,
"loss": 0.9406,
"step": 7260
},
{
"epoch": 1.8062111801242235,
"grad_norm": 5.663939952850342,
"learning_rate": 0.00010975155279503106,
"loss": 0.9368,
"step": 7270
},
{
"epoch": 1.808695652173913,
"grad_norm": 8.136780738830566,
"learning_rate": 0.0001096273291925466,
"loss": 0.8623,
"step": 7280
},
{
"epoch": 1.8111801242236025,
"grad_norm": 7.248380184173584,
"learning_rate": 0.00010950310559006211,
"loss": 1.2673,
"step": 7290
},
{
"epoch": 1.8136645962732918,
"grad_norm": 5.766163349151611,
"learning_rate": 0.00010937888198757764,
"loss": 0.8425,
"step": 7300
},
{
"epoch": 1.8136645962732918,
"eval_accuracy": 0.7761154624658981,
"eval_loss": 0.8532983064651489,
"eval_runtime": 86.6152,
"eval_samples_per_second": 131.189,
"eval_steps_per_second": 16.406,
"step": 7300
},
{
"epoch": 1.8161490683229813,
"grad_norm": 7.9946465492248535,
"learning_rate": 0.00010925465838509317,
"loss": 1.072,
"step": 7310
},
{
"epoch": 1.8186335403726708,
"grad_norm": 8.763626098632812,
"learning_rate": 0.00010913043478260869,
"loss": 0.925,
"step": 7320
},
{
"epoch": 1.8211180124223603,
"grad_norm": 8.264079093933105,
"learning_rate": 0.00010900621118012422,
"loss": 1.0853,
"step": 7330
},
{
"epoch": 1.8236024844720498,
"grad_norm": 5.349701404571533,
"learning_rate": 0.00010888198757763976,
"loss": 1.0933,
"step": 7340
},
{
"epoch": 1.8260869565217392,
"grad_norm": 4.295293807983398,
"learning_rate": 0.00010875776397515529,
"loss": 1.0202,
"step": 7350
},
{
"epoch": 1.8285714285714287,
"grad_norm": 5.092330455780029,
"learning_rate": 0.00010863354037267082,
"loss": 0.9496,
"step": 7360
},
{
"epoch": 1.831055900621118,
"grad_norm": 7.8343424797058105,
"learning_rate": 0.00010850931677018634,
"loss": 1.042,
"step": 7370
},
{
"epoch": 1.8335403726708075,
"grad_norm": 5.031234264373779,
"learning_rate": 0.00010838509316770187,
"loss": 0.9133,
"step": 7380
},
{
"epoch": 1.8360248447204968,
"grad_norm": 7.025552749633789,
"learning_rate": 0.0001082608695652174,
"loss": 0.78,
"step": 7390
},
{
"epoch": 1.8385093167701863,
"grad_norm": 3.6854496002197266,
"learning_rate": 0.00010813664596273293,
"loss": 0.9388,
"step": 7400
},
{
"epoch": 1.8385093167701863,
"eval_accuracy": 0.7687230484907155,
"eval_loss": 0.8771804571151733,
"eval_runtime": 88.2832,
"eval_samples_per_second": 128.711,
"eval_steps_per_second": 16.096,
"step": 7400
},
{
"epoch": 1.8409937888198757,
"grad_norm": 5.7331013679504395,
"learning_rate": 0.00010801242236024844,
"loss": 0.9818,
"step": 7410
},
{
"epoch": 1.8434782608695652,
"grad_norm": 6.12167501449585,
"learning_rate": 0.00010788819875776397,
"loss": 0.9954,
"step": 7420
},
{
"epoch": 1.8459627329192547,
"grad_norm": 8.437973022460938,
"learning_rate": 0.00010776397515527951,
"loss": 0.9886,
"step": 7430
},
{
"epoch": 1.8484472049689442,
"grad_norm": 7.553098201751709,
"learning_rate": 0.00010763975155279504,
"loss": 0.9144,
"step": 7440
},
{
"epoch": 1.8509316770186337,
"grad_norm": 7.748224258422852,
"learning_rate": 0.00010751552795031057,
"loss": 1.0153,
"step": 7450
},
{
"epoch": 1.853416149068323,
"grad_norm": 7.518005847930908,
"learning_rate": 0.00010739130434782609,
"loss": 0.8619,
"step": 7460
},
{
"epoch": 1.8559006211180125,
"grad_norm": 8.89167308807373,
"learning_rate": 0.00010726708074534162,
"loss": 1.0365,
"step": 7470
},
{
"epoch": 1.8583850931677017,
"grad_norm": 5.566318035125732,
"learning_rate": 0.00010714285714285715,
"loss": 1.1217,
"step": 7480
},
{
"epoch": 1.8608695652173912,
"grad_norm": 5.506089687347412,
"learning_rate": 0.00010701863354037267,
"loss": 1.107,
"step": 7490
},
{
"epoch": 1.8633540372670807,
"grad_norm": 4.13236141204834,
"learning_rate": 0.0001068944099378882,
"loss": 1.1037,
"step": 7500
},
{
"epoch": 1.8633540372670807,
"eval_accuracy": 0.7731232949045147,
"eval_loss": 0.8634147047996521,
"eval_runtime": 87.6771,
"eval_samples_per_second": 129.6,
"eval_steps_per_second": 16.207,
"step": 7500
},
{
"epoch": 1.8658385093167702,
"grad_norm": 3.6756432056427,
"learning_rate": 0.00010677018633540373,
"loss": 0.8018,
"step": 7510
},
{
"epoch": 1.8683229813664597,
"grad_norm": 3.4403350353240967,
"learning_rate": 0.00010664596273291927,
"loss": 0.8836,
"step": 7520
},
{
"epoch": 1.8708074534161492,
"grad_norm": 8.637625694274902,
"learning_rate": 0.0001065217391304348,
"loss": 0.9809,
"step": 7530
},
{
"epoch": 1.8732919254658387,
"grad_norm": 7.03044319152832,
"learning_rate": 0.00010639751552795032,
"loss": 0.9337,
"step": 7540
},
{
"epoch": 1.875776397515528,
"grad_norm": 5.361702919006348,
"learning_rate": 0.00010627329192546585,
"loss": 0.9817,
"step": 7550
},
{
"epoch": 1.8782608695652174,
"grad_norm": 5.379118919372559,
"learning_rate": 0.00010614906832298138,
"loss": 0.9618,
"step": 7560
},
{
"epoch": 1.8807453416149067,
"grad_norm": 6.078188896179199,
"learning_rate": 0.00010602484472049689,
"loss": 1.2285,
"step": 7570
},
{
"epoch": 1.8832298136645962,
"grad_norm": 7.805136680603027,
"learning_rate": 0.00010590062111801242,
"loss": 0.9148,
"step": 7580
},
{
"epoch": 1.8857142857142857,
"grad_norm": 8.38199234008789,
"learning_rate": 0.00010577639751552795,
"loss": 0.9053,
"step": 7590
},
{
"epoch": 1.8881987577639752,
"grad_norm": 8.421182632446289,
"learning_rate": 0.00010565217391304347,
"loss": 0.9659,
"step": 7600
},
{
"epoch": 1.8881987577639752,
"eval_accuracy": 0.7766434920355539,
"eval_loss": 0.8502032160758972,
"eval_runtime": 87.3847,
"eval_samples_per_second": 130.034,
"eval_steps_per_second": 16.261,
"step": 7600
},
{
"epoch": 1.8906832298136647,
"grad_norm": 7.435909271240234,
"learning_rate": 0.00010552795031055903,
"loss": 0.8987,
"step": 7610
},
{
"epoch": 1.8931677018633541,
"grad_norm": 5.804107189178467,
"learning_rate": 0.00010540372670807454,
"loss": 0.7558,
"step": 7620
},
{
"epoch": 1.8956521739130436,
"grad_norm": 9.431636810302734,
"learning_rate": 0.00010527950310559007,
"loss": 0.8512,
"step": 7630
},
{
"epoch": 1.898136645962733,
"grad_norm": 6.679006576538086,
"learning_rate": 0.0001051552795031056,
"loss": 0.7436,
"step": 7640
},
{
"epoch": 1.9006211180124224,
"grad_norm": 7.220990180969238,
"learning_rate": 0.00010503105590062112,
"loss": 1.1981,
"step": 7650
},
{
"epoch": 1.9031055900621117,
"grad_norm": 4.041493892669678,
"learning_rate": 0.00010490683229813665,
"loss": 0.7959,
"step": 7660
},
{
"epoch": 1.9055900621118012,
"grad_norm": 6.4974517822265625,
"learning_rate": 0.00010478260869565218,
"loss": 1.0786,
"step": 7670
},
{
"epoch": 1.9080745341614906,
"grad_norm": 5.594285488128662,
"learning_rate": 0.0001046583850931677,
"loss": 0.8194,
"step": 7680
},
{
"epoch": 1.9105590062111801,
"grad_norm": 13.586335182189941,
"learning_rate": 0.00010453416149068322,
"loss": 1.1679,
"step": 7690
},
{
"epoch": 1.9130434782608696,
"grad_norm": 9.138886451721191,
"learning_rate": 0.00010440993788819877,
"loss": 1.0133,
"step": 7700
},
{
"epoch": 1.9130434782608696,
"eval_accuracy": 0.7766434920355539,
"eval_loss": 0.847861111164093,
"eval_runtime": 87.2569,
"eval_samples_per_second": 130.225,
"eval_steps_per_second": 16.285,
"step": 7700
},
{
"epoch": 1.9155279503105591,
"grad_norm": 5.123132228851318,
"learning_rate": 0.0001042857142857143,
"loss": 0.8615,
"step": 7710
},
{
"epoch": 1.9180124223602486,
"grad_norm": 5.093189716339111,
"learning_rate": 0.00010416149068322983,
"loss": 0.8288,
"step": 7720
},
{
"epoch": 1.9204968944099379,
"grad_norm": 7.318862438201904,
"learning_rate": 0.00010403726708074534,
"loss": 1.0229,
"step": 7730
},
{
"epoch": 1.9229813664596274,
"grad_norm": 7.412812232971191,
"learning_rate": 0.00010391304347826087,
"loss": 1.0989,
"step": 7740
},
{
"epoch": 1.9254658385093166,
"grad_norm": 5.066961288452148,
"learning_rate": 0.0001037888198757764,
"loss": 0.9002,
"step": 7750
},
{
"epoch": 1.9279503105590061,
"grad_norm": 6.0254364013671875,
"learning_rate": 0.00010366459627329192,
"loss": 0.8101,
"step": 7760
},
{
"epoch": 1.9304347826086956,
"grad_norm": 7.5015716552734375,
"learning_rate": 0.00010354037267080745,
"loss": 1.0433,
"step": 7770
},
{
"epoch": 1.932919254658385,
"grad_norm": 6.577775955200195,
"learning_rate": 0.00010341614906832298,
"loss": 0.8738,
"step": 7780
},
{
"epoch": 1.9354037267080746,
"grad_norm": 6.867348670959473,
"learning_rate": 0.00010329192546583852,
"loss": 0.7594,
"step": 7790
},
{
"epoch": 1.937888198757764,
"grad_norm": 5.827150821685791,
"learning_rate": 0.00010316770186335405,
"loss": 0.8395,
"step": 7800
},
{
"epoch": 1.937888198757764,
"eval_accuracy": 0.7888761770659157,
"eval_loss": 0.8051999807357788,
"eval_runtime": 87.364,
"eval_samples_per_second": 130.065,
"eval_steps_per_second": 16.265,
"step": 7800
},
{
"epoch": 1.9403726708074536,
"grad_norm": 7.16851282119751,
"learning_rate": 0.00010304347826086957,
"loss": 0.8766,
"step": 7810
},
{
"epoch": 1.9428571428571428,
"grad_norm": 7.723792552947998,
"learning_rate": 0.0001029192546583851,
"loss": 1.0962,
"step": 7820
},
{
"epoch": 1.9453416149068323,
"grad_norm": 7.399579048156738,
"learning_rate": 0.00010279503105590063,
"loss": 1.3492,
"step": 7830
},
{
"epoch": 1.9478260869565216,
"grad_norm": 4.434156894683838,
"learning_rate": 0.00010267080745341615,
"loss": 0.9581,
"step": 7840
},
{
"epoch": 1.950310559006211,
"grad_norm": 2.9146640300750732,
"learning_rate": 0.00010254658385093168,
"loss": 0.7751,
"step": 7850
},
{
"epoch": 1.9527950310559006,
"grad_norm": 4.098471164703369,
"learning_rate": 0.0001024223602484472,
"loss": 0.9124,
"step": 7860
},
{
"epoch": 1.95527950310559,
"grad_norm": 6.989963054656982,
"learning_rate": 0.00010229813664596272,
"loss": 0.9057,
"step": 7870
},
{
"epoch": 1.9577639751552796,
"grad_norm": 5.746939659118652,
"learning_rate": 0.00010217391304347828,
"loss": 0.8356,
"step": 7880
},
{
"epoch": 1.960248447204969,
"grad_norm": 10.21794605255127,
"learning_rate": 0.0001020496894409938,
"loss": 0.8364,
"step": 7890
},
{
"epoch": 1.9627329192546585,
"grad_norm": 2.191908597946167,
"learning_rate": 0.00010192546583850933,
"loss": 0.8803,
"step": 7900
},
{
"epoch": 1.9627329192546585,
"eval_accuracy": 0.7775235413183138,
"eval_loss": 0.8379384875297546,
"eval_runtime": 87.2198,
"eval_samples_per_second": 130.28,
"eval_steps_per_second": 16.292,
"step": 7900
},
{
"epoch": 1.9652173913043478,
"grad_norm": 8.37902545928955,
"learning_rate": 0.00010180124223602486,
"loss": 0.972,
"step": 7910
},
{
"epoch": 1.9677018633540373,
"grad_norm": 6.292512893676758,
"learning_rate": 0.00010167701863354037,
"loss": 0.8397,
"step": 7920
},
{
"epoch": 1.9701863354037266,
"grad_norm": 2.5551600456237793,
"learning_rate": 0.0001015527950310559,
"loss": 0.7601,
"step": 7930
},
{
"epoch": 1.972670807453416,
"grad_norm": 6.245602607727051,
"learning_rate": 0.00010142857142857143,
"loss": 1.1527,
"step": 7940
},
{
"epoch": 1.9751552795031055,
"grad_norm": 6.054067611694336,
"learning_rate": 0.00010130434782608695,
"loss": 1.0931,
"step": 7950
},
{
"epoch": 1.977639751552795,
"grad_norm": 9.452044486999512,
"learning_rate": 0.00010118012422360248,
"loss": 1.0301,
"step": 7960
},
{
"epoch": 1.9801242236024845,
"grad_norm": 6.898012638092041,
"learning_rate": 0.00010105590062111802,
"loss": 0.9799,
"step": 7970
},
{
"epoch": 1.982608695652174,
"grad_norm": 6.751274108886719,
"learning_rate": 0.00010093167701863355,
"loss": 0.8214,
"step": 7980
},
{
"epoch": 1.9850931677018635,
"grad_norm": 5.453399658203125,
"learning_rate": 0.00010080745341614908,
"loss": 0.7934,
"step": 7990
},
{
"epoch": 1.9875776397515528,
"grad_norm": 6.991562366485596,
"learning_rate": 0.0001006832298136646,
"loss": 0.7866,
"step": 8000
},
{
"epoch": 1.9875776397515528,
"eval_accuracy": 0.7835078764410807,
"eval_loss": 0.8282920718193054,
"eval_runtime": 87.4848,
"eval_samples_per_second": 129.885,
"eval_steps_per_second": 16.243,
"step": 8000
},
{
"epoch": 1.9900621118012423,
"grad_norm": 9.726250648498535,
"learning_rate": 0.00010055900621118013,
"loss": 0.9478,
"step": 8010
},
{
"epoch": 1.9925465838509315,
"grad_norm": 7.002394676208496,
"learning_rate": 0.00010043478260869566,
"loss": 0.9265,
"step": 8020
},
{
"epoch": 1.995031055900621,
"grad_norm": 6.561404228210449,
"learning_rate": 0.00010031055900621117,
"loss": 0.9182,
"step": 8030
},
{
"epoch": 1.9975155279503105,
"grad_norm": 7.831599712371826,
"learning_rate": 0.0001001863354037267,
"loss": 0.9248,
"step": 8040
},
{
"epoch": 2.0,
"grad_norm": 0.11542998999357224,
"learning_rate": 0.00010006211180124223,
"loss": 0.763,
"step": 8050
},
{
"epoch": 2.0024844720496895,
"grad_norm": 6.781834602355957,
"learning_rate": 9.993788819875776e-05,
"loss": 0.8077,
"step": 8060
},
{
"epoch": 2.004968944099379,
"grad_norm": 7.08714485168457,
"learning_rate": 9.981366459627329e-05,
"loss": 0.6632,
"step": 8070
},
{
"epoch": 2.0074534161490685,
"grad_norm": 6.069121360778809,
"learning_rate": 9.968944099378884e-05,
"loss": 0.9374,
"step": 8080
},
{
"epoch": 2.009937888198758,
"grad_norm": 9.966570854187012,
"learning_rate": 9.956521739130435e-05,
"loss": 0.9113,
"step": 8090
},
{
"epoch": 2.012422360248447,
"grad_norm": 3.953974962234497,
"learning_rate": 9.944099378881988e-05,
"loss": 0.5067,
"step": 8100
},
{
"epoch": 2.012422360248447,
"eval_accuracy": 0.7835078764410807,
"eval_loss": 0.8207420110702515,
"eval_runtime": 87.7175,
"eval_samples_per_second": 129.541,
"eval_steps_per_second": 16.2,
"step": 8100
},
{
"epoch": 2.0149068322981365,
"grad_norm": 5.133342266082764,
"learning_rate": 9.931677018633541e-05,
"loss": 0.7078,
"step": 8110
},
{
"epoch": 2.017391304347826,
"grad_norm": 8.229430198669434,
"learning_rate": 9.919254658385093e-05,
"loss": 0.7699,
"step": 8120
},
{
"epoch": 2.0198757763975155,
"grad_norm": 3.4556453227996826,
"learning_rate": 9.906832298136647e-05,
"loss": 0.7699,
"step": 8130
},
{
"epoch": 2.022360248447205,
"grad_norm": 6.761761665344238,
"learning_rate": 9.894409937888199e-05,
"loss": 0.6424,
"step": 8140
},
{
"epoch": 2.0248447204968945,
"grad_norm": 8.987166404724121,
"learning_rate": 9.881987577639752e-05,
"loss": 0.9173,
"step": 8150
},
{
"epoch": 2.027329192546584,
"grad_norm": 9.56896686553955,
"learning_rate": 9.869565217391305e-05,
"loss": 0.9898,
"step": 8160
},
{
"epoch": 2.0298136645962734,
"grad_norm": 5.724196434020996,
"learning_rate": 9.857142857142858e-05,
"loss": 0.8861,
"step": 8170
},
{
"epoch": 2.032298136645963,
"grad_norm": 4.5643086433410645,
"learning_rate": 9.844720496894411e-05,
"loss": 0.6865,
"step": 8180
},
{
"epoch": 2.034782608695652,
"grad_norm": 7.3250627517700195,
"learning_rate": 9.832298136645964e-05,
"loss": 0.7533,
"step": 8190
},
{
"epoch": 2.0372670807453415,
"grad_norm": 4.573007106781006,
"learning_rate": 9.819875776397515e-05,
"loss": 0.7083,
"step": 8200
},
{
"epoch": 2.0372670807453415,
"eval_accuracy": 0.7803396990231453,
"eval_loss": 0.8320080637931824,
"eval_runtime": 87.9445,
"eval_samples_per_second": 129.206,
"eval_steps_per_second": 16.158,
"step": 8200
},
{
"epoch": 2.039751552795031,
"grad_norm": 5.410977363586426,
"learning_rate": 9.807453416149068e-05,
"loss": 0.8974,
"step": 8210
},
{
"epoch": 2.0422360248447204,
"grad_norm": 7.464397430419922,
"learning_rate": 9.795031055900621e-05,
"loss": 1.0127,
"step": 8220
},
{
"epoch": 2.04472049689441,
"grad_norm": 6.252601623535156,
"learning_rate": 9.782608695652174e-05,
"loss": 0.8233,
"step": 8230
},
{
"epoch": 2.0472049689440994,
"grad_norm": 6.8147454261779785,
"learning_rate": 9.770186335403727e-05,
"loss": 0.7511,
"step": 8240
},
{
"epoch": 2.049689440993789,
"grad_norm": 6.70554256439209,
"learning_rate": 9.757763975155279e-05,
"loss": 0.7293,
"step": 8250
},
{
"epoch": 2.0521739130434784,
"grad_norm": 7.078741073608398,
"learning_rate": 9.745341614906833e-05,
"loss": 0.7236,
"step": 8260
},
{
"epoch": 2.054658385093168,
"grad_norm": 5.513981819152832,
"learning_rate": 9.732919254658386e-05,
"loss": 0.6023,
"step": 8270
},
{
"epoch": 2.057142857142857,
"grad_norm": 1.8642979860305786,
"learning_rate": 9.720496894409938e-05,
"loss": 0.7036,
"step": 8280
},
{
"epoch": 2.0596273291925464,
"grad_norm": 4.278319358825684,
"learning_rate": 9.708074534161491e-05,
"loss": 0.9708,
"step": 8290
},
{
"epoch": 2.062111801242236,
"grad_norm": 4.464468479156494,
"learning_rate": 9.695652173913044e-05,
"loss": 0.6581,
"step": 8300
},
{
"epoch": 2.062111801242236,
"eval_accuracy": 0.786852063715568,
"eval_loss": 0.8161770701408386,
"eval_runtime": 86.2043,
"eval_samples_per_second": 131.815,
"eval_steps_per_second": 16.484,
"step": 8300
},
{
"epoch": 2.0645962732919254,
"grad_norm": 5.079864501953125,
"learning_rate": 9.683229813664597e-05,
"loss": 0.6639,
"step": 8310
},
{
"epoch": 2.067080745341615,
"grad_norm": 4.3528361320495605,
"learning_rate": 9.67080745341615e-05,
"loss": 0.6507,
"step": 8320
},
{
"epoch": 2.0695652173913044,
"grad_norm": 5.734859943389893,
"learning_rate": 9.658385093167702e-05,
"loss": 0.9273,
"step": 8330
},
{
"epoch": 2.072049689440994,
"grad_norm": 3.430791139602661,
"learning_rate": 9.645962732919255e-05,
"loss": 0.8294,
"step": 8340
},
{
"epoch": 2.0745341614906834,
"grad_norm": 7.763731479644775,
"learning_rate": 9.633540372670809e-05,
"loss": 0.892,
"step": 8350
},
{
"epoch": 2.077018633540373,
"grad_norm": 7.946462154388428,
"learning_rate": 9.62111801242236e-05,
"loss": 0.85,
"step": 8360
},
{
"epoch": 2.079503105590062,
"grad_norm": 5.0240607261657715,
"learning_rate": 9.608695652173914e-05,
"loss": 1.0335,
"step": 8370
},
{
"epoch": 2.0819875776397514,
"grad_norm": 9.682748794555664,
"learning_rate": 9.596273291925467e-05,
"loss": 0.9621,
"step": 8380
},
{
"epoch": 2.084472049689441,
"grad_norm": 6.340792655944824,
"learning_rate": 9.583850931677018e-05,
"loss": 0.7974,
"step": 8390
},
{
"epoch": 2.0869565217391304,
"grad_norm": 10.423264503479004,
"learning_rate": 9.571428571428573e-05,
"loss": 0.7376,
"step": 8400
},
{
"epoch": 2.0869565217391304,
"eval_accuracy": 0.787116078500396,
"eval_loss": 0.8222277164459229,
"eval_runtime": 88.2512,
"eval_samples_per_second": 128.757,
"eval_steps_per_second": 16.102,
"step": 8400
},
{
"epoch": 2.08944099378882,
"grad_norm": 4.946643352508545,
"learning_rate": 9.559006211180126e-05,
"loss": 0.8182,
"step": 8410
},
{
"epoch": 2.0919254658385094,
"grad_norm": 3.579709768295288,
"learning_rate": 9.546583850931677e-05,
"loss": 0.7695,
"step": 8420
},
{
"epoch": 2.094409937888199,
"grad_norm": 12.733490943908691,
"learning_rate": 9.53416149068323e-05,
"loss": 0.8773,
"step": 8430
},
{
"epoch": 2.0968944099378883,
"grad_norm": 6.666749000549316,
"learning_rate": 9.521739130434783e-05,
"loss": 0.8847,
"step": 8440
},
{
"epoch": 2.099378881987578,
"grad_norm": 4.09303092956543,
"learning_rate": 9.509316770186336e-05,
"loss": 0.8119,
"step": 8450
},
{
"epoch": 2.101863354037267,
"grad_norm": 6.840397357940674,
"learning_rate": 9.496894409937889e-05,
"loss": 0.7293,
"step": 8460
},
{
"epoch": 2.1043478260869564,
"grad_norm": 5.2310566902160645,
"learning_rate": 9.484472049689441e-05,
"loss": 0.767,
"step": 8470
},
{
"epoch": 2.106832298136646,
"grad_norm": 4.113173484802246,
"learning_rate": 9.472049689440994e-05,
"loss": 0.7956,
"step": 8480
},
{
"epoch": 2.1093167701863353,
"grad_norm": 7.647303104400635,
"learning_rate": 9.459627329192548e-05,
"loss": 0.8616,
"step": 8490
},
{
"epoch": 2.111801242236025,
"grad_norm": 5.392307281494141,
"learning_rate": 9.4472049689441e-05,
"loss": 0.6492,
"step": 8500
},
{
"epoch": 2.111801242236025,
"eval_accuracy": 0.786764058787292,
"eval_loss": 0.8152782320976257,
"eval_runtime": 87.0082,
"eval_samples_per_second": 130.597,
"eval_steps_per_second": 16.332,
"step": 8500
},
{
"epoch": 2.1142857142857143,
"grad_norm": 3.2599971294403076,
"learning_rate": 9.434782608695653e-05,
"loss": 0.7039,
"step": 8510
},
{
"epoch": 2.116770186335404,
"grad_norm": 3.6906332969665527,
"learning_rate": 9.422360248447206e-05,
"loss": 0.6559,
"step": 8520
},
{
"epoch": 2.1192546583850933,
"grad_norm": 9.140853881835938,
"learning_rate": 9.409937888198759e-05,
"loss": 0.9698,
"step": 8530
},
{
"epoch": 2.121739130434783,
"grad_norm": 4.56060791015625,
"learning_rate": 9.397515527950312e-05,
"loss": 0.663,
"step": 8540
},
{
"epoch": 2.124223602484472,
"grad_norm": 8.36341381072998,
"learning_rate": 9.385093167701863e-05,
"loss": 0.8096,
"step": 8550
},
{
"epoch": 2.1267080745341613,
"grad_norm": 9.586607933044434,
"learning_rate": 9.372670807453416e-05,
"loss": 0.9051,
"step": 8560
},
{
"epoch": 2.129192546583851,
"grad_norm": 7.692372798919678,
"learning_rate": 9.360248447204969e-05,
"loss": 0.8815,
"step": 8570
},
{
"epoch": 2.1316770186335403,
"grad_norm": 9.203356742858887,
"learning_rate": 9.347826086956522e-05,
"loss": 0.9408,
"step": 8580
},
{
"epoch": 2.13416149068323,
"grad_norm": 7.31281042098999,
"learning_rate": 9.335403726708075e-05,
"loss": 0.6291,
"step": 8590
},
{
"epoch": 2.1366459627329193,
"grad_norm": 8.940437316894531,
"learning_rate": 9.322981366459628e-05,
"loss": 0.6356,
"step": 8600
},
{
"epoch": 2.1366459627329193,
"eval_accuracy": 0.7929244037666109,
"eval_loss": 0.7929924726486206,
"eval_runtime": 87.3662,
"eval_samples_per_second": 130.062,
"eval_steps_per_second": 16.265,
"step": 8600
},
{
"epoch": 2.139130434782609,
"grad_norm": 3.0774142742156982,
"learning_rate": 9.31055900621118e-05,
"loss": 0.8358,
"step": 8610
},
{
"epoch": 2.1416149068322983,
"grad_norm": 7.764039993286133,
"learning_rate": 9.298136645962733e-05,
"loss": 0.6964,
"step": 8620
},
{
"epoch": 2.1440993788819878,
"grad_norm": 6.5316853523254395,
"learning_rate": 9.285714285714286e-05,
"loss": 0.7853,
"step": 8630
},
{
"epoch": 2.146583850931677,
"grad_norm": 5.1168928146362305,
"learning_rate": 9.273291925465839e-05,
"loss": 0.7643,
"step": 8640
},
{
"epoch": 2.1490683229813663,
"grad_norm": 7.292003154754639,
"learning_rate": 9.260869565217392e-05,
"loss": 0.8261,
"step": 8650
},
{
"epoch": 2.151552795031056,
"grad_norm": 5.8488240242004395,
"learning_rate": 9.248447204968943e-05,
"loss": 0.8137,
"step": 8660
},
{
"epoch": 2.1540372670807453,
"grad_norm": 5.164108753204346,
"learning_rate": 9.236024844720498e-05,
"loss": 0.6775,
"step": 8670
},
{
"epoch": 2.1565217391304348,
"grad_norm": 8.760250091552734,
"learning_rate": 9.223602484472051e-05,
"loss": 0.9372,
"step": 8680
},
{
"epoch": 2.1590062111801243,
"grad_norm": 2.324495315551758,
"learning_rate": 9.211180124223602e-05,
"loss": 0.6147,
"step": 8690
},
{
"epoch": 2.1614906832298137,
"grad_norm": 11.120918273925781,
"learning_rate": 9.198757763975155e-05,
"loss": 0.7626,
"step": 8700
},
{
"epoch": 2.1614906832298137,
"eval_accuracy": 0.787380093285224,
"eval_loss": 0.8167068958282471,
"eval_runtime": 87.706,
"eval_samples_per_second": 129.558,
"eval_steps_per_second": 16.202,
"step": 8700
},
{
"epoch": 2.1639751552795032,
"grad_norm": 4.185982704162598,
"learning_rate": 9.186335403726708e-05,
"loss": 1.0471,
"step": 8710
},
{
"epoch": 2.1664596273291927,
"grad_norm": 7.418622016906738,
"learning_rate": 9.173913043478261e-05,
"loss": 0.8076,
"step": 8720
},
{
"epoch": 2.1689440993788818,
"grad_norm": 6.697909832000732,
"learning_rate": 9.161490683229814e-05,
"loss": 0.9415,
"step": 8730
},
{
"epoch": 2.1714285714285713,
"grad_norm": 8.501760482788086,
"learning_rate": 9.149068322981367e-05,
"loss": 1.0257,
"step": 8740
},
{
"epoch": 2.1739130434782608,
"grad_norm": 3.7645459175109863,
"learning_rate": 9.136645962732919e-05,
"loss": 0.7609,
"step": 8750
},
{
"epoch": 2.1763975155279502,
"grad_norm": 7.28707218170166,
"learning_rate": 9.124223602484473e-05,
"loss": 0.8866,
"step": 8760
},
{
"epoch": 2.1788819875776397,
"grad_norm": 7.614325046539307,
"learning_rate": 9.111801242236025e-05,
"loss": 0.812,
"step": 8770
},
{
"epoch": 2.1813664596273292,
"grad_norm": 7.725882053375244,
"learning_rate": 9.099378881987578e-05,
"loss": 0.7487,
"step": 8780
},
{
"epoch": 2.1838509316770187,
"grad_norm": 6.1779255867004395,
"learning_rate": 9.086956521739131e-05,
"loss": 0.5971,
"step": 8790
},
{
"epoch": 2.186335403726708,
"grad_norm": 7.485067844390869,
"learning_rate": 9.074534161490683e-05,
"loss": 0.7389,
"step": 8800
},
{
"epoch": 2.186335403726708,
"eval_accuracy": 0.7888761770659157,
"eval_loss": 0.8076306581497192,
"eval_runtime": 86.0538,
"eval_samples_per_second": 132.045,
"eval_steps_per_second": 16.513,
"step": 8800
},
{
"epoch": 2.1888198757763977,
"grad_norm": 4.314478397369385,
"learning_rate": 9.062111801242237e-05,
"loss": 0.7447,
"step": 8810
},
{
"epoch": 2.1913043478260867,
"grad_norm": 4.1498236656188965,
"learning_rate": 9.04968944099379e-05,
"loss": 0.6338,
"step": 8820
},
{
"epoch": 2.1937888198757762,
"grad_norm": 6.881325721740723,
"learning_rate": 9.037267080745342e-05,
"loss": 1.0032,
"step": 8830
},
{
"epoch": 2.1962732919254657,
"grad_norm": 5.005446910858154,
"learning_rate": 9.024844720496895e-05,
"loss": 0.7338,
"step": 8840
},
{
"epoch": 2.198757763975155,
"grad_norm": 6.156917095184326,
"learning_rate": 9.012422360248448e-05,
"loss": 0.8672,
"step": 8850
},
{
"epoch": 2.2012422360248447,
"grad_norm": 7.660140037536621,
"learning_rate": 9e-05,
"loss": 0.7373,
"step": 8860
},
{
"epoch": 2.203726708074534,
"grad_norm": 6.808891296386719,
"learning_rate": 8.987577639751554e-05,
"loss": 0.9934,
"step": 8870
},
{
"epoch": 2.2062111801242237,
"grad_norm": 2.7845213413238525,
"learning_rate": 8.975155279503105e-05,
"loss": 0.6374,
"step": 8880
},
{
"epoch": 2.208695652173913,
"grad_norm": 4.146764278411865,
"learning_rate": 8.962732919254658e-05,
"loss": 0.7385,
"step": 8890
},
{
"epoch": 2.2111801242236027,
"grad_norm": 9.313486099243164,
"learning_rate": 8.950310559006213e-05,
"loss": 0.503,
"step": 8900
},
{
"epoch": 2.2111801242236027,
"eval_accuracy": 0.786940068643844,
"eval_loss": 0.8311988115310669,
"eval_runtime": 87.0983,
"eval_samples_per_second": 130.462,
"eval_steps_per_second": 16.315,
"step": 8900
},
{
"epoch": 2.2136645962732917,
"grad_norm": 2.938624858856201,
"learning_rate": 8.937888198757764e-05,
"loss": 0.4459,
"step": 8910
},
{
"epoch": 2.216149068322981,
"grad_norm": 5.409054756164551,
"learning_rate": 8.925465838509317e-05,
"loss": 0.6621,
"step": 8920
},
{
"epoch": 2.2186335403726707,
"grad_norm": 5.15172004699707,
"learning_rate": 8.91304347826087e-05,
"loss": 0.6624,
"step": 8930
},
{
"epoch": 2.22111801242236,
"grad_norm": 11.084473609924316,
"learning_rate": 8.900621118012423e-05,
"loss": 0.7716,
"step": 8940
},
{
"epoch": 2.2236024844720497,
"grad_norm": 10.487622261047363,
"learning_rate": 8.888198757763976e-05,
"loss": 0.773,
"step": 8950
},
{
"epoch": 2.226086956521739,
"grad_norm": 10.246448516845703,
"learning_rate": 8.875776397515528e-05,
"loss": 0.7211,
"step": 8960
},
{
"epoch": 2.2285714285714286,
"grad_norm": 9.63115406036377,
"learning_rate": 8.863354037267081e-05,
"loss": 0.7725,
"step": 8970
},
{
"epoch": 2.231055900621118,
"grad_norm": 9.392363548278809,
"learning_rate": 8.850931677018634e-05,
"loss": 0.55,
"step": 8980
},
{
"epoch": 2.2335403726708076,
"grad_norm": 6.782948017120361,
"learning_rate": 8.838509316770187e-05,
"loss": 0.8966,
"step": 8990
},
{
"epoch": 2.2360248447204967,
"grad_norm": 5.9813947677612305,
"learning_rate": 8.82608695652174e-05,
"loss": 0.7901,
"step": 9000
},
{
"epoch": 2.2360248447204967,
"eval_accuracy": 0.7900202411335034,
"eval_loss": 0.8137289881706238,
"eval_runtime": 87.5605,
"eval_samples_per_second": 129.773,
"eval_steps_per_second": 16.229,
"step": 9000
},
{
"epoch": 2.238509316770186,
"grad_norm": 6.50111722946167,
"learning_rate": 8.813664596273293e-05,
"loss": 0.7854,
"step": 9010
},
{
"epoch": 2.2409937888198757,
"grad_norm": 8.988317489624023,
"learning_rate": 8.801242236024844e-05,
"loss": 0.7795,
"step": 9020
},
{
"epoch": 2.243478260869565,
"grad_norm": 10.681255340576172,
"learning_rate": 8.788819875776399e-05,
"loss": 0.8802,
"step": 9030
},
{
"epoch": 2.2459627329192546,
"grad_norm": 8.849059104919434,
"learning_rate": 8.77639751552795e-05,
"loss": 0.6214,
"step": 9040
},
{
"epoch": 2.248447204968944,
"grad_norm": 6.764002799987793,
"learning_rate": 8.765217391304348e-05,
"loss": 0.9147,
"step": 9050
},
{
"epoch": 2.2509316770186336,
"grad_norm": 9.840096473693848,
"learning_rate": 8.752795031055901e-05,
"loss": 0.6492,
"step": 9060
},
{
"epoch": 2.253416149068323,
"grad_norm": 3.465550422668457,
"learning_rate": 8.740372670807454e-05,
"loss": 0.6186,
"step": 9070
},
{
"epoch": 2.2559006211180126,
"grad_norm": 3.6054742336273193,
"learning_rate": 8.727950310559007e-05,
"loss": 0.6631,
"step": 9080
},
{
"epoch": 2.2583850931677016,
"grad_norm": 10.837676048278809,
"learning_rate": 8.715527950310558e-05,
"loss": 0.7069,
"step": 9090
},
{
"epoch": 2.260869565217391,
"grad_norm": 3.7660045623779297,
"learning_rate": 8.703105590062111e-05,
"loss": 0.8387,
"step": 9100
},
{
"epoch": 2.260869565217391,
"eval_accuracy": 0.7831558567279767,
"eval_loss": 0.8207471370697021,
"eval_runtime": 86.53,
"eval_samples_per_second": 131.319,
"eval_steps_per_second": 16.422,
"step": 9100
},
{
"epoch": 2.2633540372670806,
"grad_norm": 5.137176036834717,
"learning_rate": 8.690683229813666e-05,
"loss": 0.7754,
"step": 9110
},
{
"epoch": 2.26583850931677,
"grad_norm": 4.615223407745361,
"learning_rate": 8.678260869565217e-05,
"loss": 0.588,
"step": 9120
},
{
"epoch": 2.2683229813664596,
"grad_norm": 4.302494525909424,
"learning_rate": 8.66583850931677e-05,
"loss": 0.8853,
"step": 9130
},
{
"epoch": 2.270807453416149,
"grad_norm": 5.601503372192383,
"learning_rate": 8.653416149068323e-05,
"loss": 0.7973,
"step": 9140
},
{
"epoch": 2.2732919254658386,
"grad_norm": 4.837513446807861,
"learning_rate": 8.640993788819876e-05,
"loss": 0.9177,
"step": 9150
},
{
"epoch": 2.275776397515528,
"grad_norm": 8.786465644836426,
"learning_rate": 8.62857142857143e-05,
"loss": 0.877,
"step": 9160
},
{
"epoch": 2.2782608695652176,
"grad_norm": 6.726296901702881,
"learning_rate": 8.616149068322982e-05,
"loss": 0.9089,
"step": 9170
},
{
"epoch": 2.2807453416149066,
"grad_norm": 9.3532075881958,
"learning_rate": 8.603726708074534e-05,
"loss": 0.6529,
"step": 9180
},
{
"epoch": 2.283229813664596,
"grad_norm": 9.594780921936035,
"learning_rate": 8.591304347826087e-05,
"loss": 0.5744,
"step": 9190
},
{
"epoch": 2.2857142857142856,
"grad_norm": 6.469969272613525,
"learning_rate": 8.57888198757764e-05,
"loss": 0.7048,
"step": 9200
},
{
"epoch": 2.2857142857142856,
"eval_accuracy": 0.7897562263486755,
"eval_loss": 0.8105459213256836,
"eval_runtime": 85.966,
"eval_samples_per_second": 132.18,
"eval_steps_per_second": 16.53,
"step": 9200
},
{
"epoch": 2.288198757763975,
"grad_norm": 3.212139368057251,
"learning_rate": 8.566459627329193e-05,
"loss": 0.69,
"step": 9210
},
{
"epoch": 2.2906832298136646,
"grad_norm": 8.069912910461426,
"learning_rate": 8.554037267080746e-05,
"loss": 0.7921,
"step": 9220
},
{
"epoch": 2.293167701863354,
"grad_norm": 4.6540985107421875,
"learning_rate": 8.541614906832298e-05,
"loss": 0.6708,
"step": 9230
},
{
"epoch": 2.2956521739130435,
"grad_norm": 3.3470239639282227,
"learning_rate": 8.529192546583852e-05,
"loss": 0.6245,
"step": 9240
},
{
"epoch": 2.298136645962733,
"grad_norm": 3.7410881519317627,
"learning_rate": 8.516770186335405e-05,
"loss": 0.6826,
"step": 9250
},
{
"epoch": 2.3006211180124225,
"grad_norm": 3.9942305088043213,
"learning_rate": 8.504347826086957e-05,
"loss": 0.6555,
"step": 9260
},
{
"epoch": 2.3031055900621116,
"grad_norm": 3.727818250656128,
"learning_rate": 8.49192546583851e-05,
"loss": 0.7326,
"step": 9270
},
{
"epoch": 2.305590062111801,
"grad_norm": 5.355185031890869,
"learning_rate": 8.479503105590063e-05,
"loss": 1.0129,
"step": 9280
},
{
"epoch": 2.3080745341614906,
"grad_norm": 3.256054639816284,
"learning_rate": 8.467080745341616e-05,
"loss": 0.5776,
"step": 9290
},
{
"epoch": 2.31055900621118,
"grad_norm": 5.470973968505859,
"learning_rate": 8.454658385093169e-05,
"loss": 0.6412,
"step": 9300
},
{
"epoch": 2.31055900621118,
"eval_accuracy": 0.7950365220452346,
"eval_loss": 0.7829346656799316,
"eval_runtime": 86.0629,
"eval_samples_per_second": 132.031,
"eval_steps_per_second": 16.511,
"step": 9300
},
{
"epoch": 2.3130434782608695,
"grad_norm": 4.965493679046631,
"learning_rate": 8.44223602484472e-05,
"loss": 0.8235,
"step": 9310
},
{
"epoch": 2.315527950310559,
"grad_norm": 6.479755401611328,
"learning_rate": 8.429813664596273e-05,
"loss": 0.6298,
"step": 9320
},
{
"epoch": 2.3180124223602485,
"grad_norm": 8.033920288085938,
"learning_rate": 8.417391304347828e-05,
"loss": 0.572,
"step": 9330
},
{
"epoch": 2.320496894409938,
"grad_norm": 8.532790184020996,
"learning_rate": 8.404968944099379e-05,
"loss": 0.7044,
"step": 9340
},
{
"epoch": 2.3229813664596275,
"grad_norm": 7.569856643676758,
"learning_rate": 8.392546583850932e-05,
"loss": 0.9142,
"step": 9350
},
{
"epoch": 2.3254658385093165,
"grad_norm": 3.2040038108825684,
"learning_rate": 8.380124223602485e-05,
"loss": 0.9008,
"step": 9360
},
{
"epoch": 2.327950310559006,
"grad_norm": 5.969919681549072,
"learning_rate": 8.367701863354037e-05,
"loss": 0.6898,
"step": 9370
},
{
"epoch": 2.3304347826086955,
"grad_norm": 8.508780479431152,
"learning_rate": 8.355279503105591e-05,
"loss": 0.6264,
"step": 9380
},
{
"epoch": 2.332919254658385,
"grad_norm": 3.9258530139923096,
"learning_rate": 8.342857142857143e-05,
"loss": 0.8541,
"step": 9390
},
{
"epoch": 2.3354037267080745,
"grad_norm": 5.126328468322754,
"learning_rate": 8.330434782608696e-05,
"loss": 0.6864,
"step": 9400
},
{
"epoch": 2.3354037267080745,
"eval_accuracy": 0.7940684678341987,
"eval_loss": 0.7850940227508545,
"eval_runtime": 85.298,
"eval_samples_per_second": 133.215,
"eval_steps_per_second": 16.659,
"step": 9400
},
{
"epoch": 2.337888198757764,
"grad_norm": 4.471742153167725,
"learning_rate": 8.318012422360249e-05,
"loss": 0.7995,
"step": 9410
},
{
"epoch": 2.3403726708074535,
"grad_norm": 3.8531105518341064,
"learning_rate": 8.305590062111802e-05,
"loss": 0.5166,
"step": 9420
},
{
"epoch": 2.342857142857143,
"grad_norm": 6.191071510314941,
"learning_rate": 8.293167701863355e-05,
"loss": 0.7302,
"step": 9430
},
{
"epoch": 2.3453416149068325,
"grad_norm": 4.34737491607666,
"learning_rate": 8.280745341614908e-05,
"loss": 0.8006,
"step": 9440
},
{
"epoch": 2.3478260869565215,
"grad_norm": 6.0214152336120605,
"learning_rate": 8.26832298136646e-05,
"loss": 0.6947,
"step": 9450
},
{
"epoch": 2.350310559006211,
"grad_norm": 5.802051544189453,
"learning_rate": 8.255900621118012e-05,
"loss": 0.8839,
"step": 9460
},
{
"epoch": 2.3527950310559005,
"grad_norm": 5.956132888793945,
"learning_rate": 8.243478260869565e-05,
"loss": 0.7843,
"step": 9470
},
{
"epoch": 2.35527950310559,
"grad_norm": 30.9941349029541,
"learning_rate": 8.231055900621118e-05,
"loss": 0.8446,
"step": 9480
},
{
"epoch": 2.3577639751552795,
"grad_norm": 6.255371570587158,
"learning_rate": 8.218633540372671e-05,
"loss": 0.6848,
"step": 9490
},
{
"epoch": 2.360248447204969,
"grad_norm": 5.857180595397949,
"learning_rate": 8.206211180124224e-05,
"loss": 0.7411,
"step": 9500
},
{
"epoch": 2.360248447204969,
"eval_accuracy": 0.803132975446625,
"eval_loss": 0.764218270778656,
"eval_runtime": 87.3203,
"eval_samples_per_second": 130.13,
"eval_steps_per_second": 16.273,
"step": 9500
},
{
"epoch": 2.3627329192546584,
"grad_norm": 7.176181316375732,
"learning_rate": 8.193788819875777e-05,
"loss": 0.5753,
"step": 9510
},
{
"epoch": 2.365217391304348,
"grad_norm": 8.681370735168457,
"learning_rate": 8.18136645962733e-05,
"loss": 0.7166,
"step": 9520
},
{
"epoch": 2.3677018633540374,
"grad_norm": 8.568154335021973,
"learning_rate": 8.168944099378882e-05,
"loss": 0.9307,
"step": 9530
},
{
"epoch": 2.3701863354037265,
"grad_norm": 2.1477255821228027,
"learning_rate": 8.156521739130435e-05,
"loss": 0.6876,
"step": 9540
},
{
"epoch": 2.372670807453416,
"grad_norm": 11.47255802154541,
"learning_rate": 8.144099378881988e-05,
"loss": 0.576,
"step": 9550
},
{
"epoch": 2.3751552795031055,
"grad_norm": 7.495718002319336,
"learning_rate": 8.131677018633541e-05,
"loss": 0.9377,
"step": 9560
},
{
"epoch": 2.377639751552795,
"grad_norm": 5.860555648803711,
"learning_rate": 8.119254658385094e-05,
"loss": 0.5258,
"step": 9570
},
{
"epoch": 2.3801242236024844,
"grad_norm": 6.226891994476318,
"learning_rate": 8.106832298136647e-05,
"loss": 0.8246,
"step": 9580
},
{
"epoch": 2.382608695652174,
"grad_norm": 7.560525894165039,
"learning_rate": 8.094409937888198e-05,
"loss": 0.7171,
"step": 9590
},
{
"epoch": 2.3850931677018634,
"grad_norm": 5.449308395385742,
"learning_rate": 8.081987577639753e-05,
"loss": 0.6221,
"step": 9600
},
{
"epoch": 2.3850931677018634,
"eval_accuracy": 0.802956965590073,
"eval_loss": 0.7602500915527344,
"eval_runtime": 87.7045,
"eval_samples_per_second": 129.56,
"eval_steps_per_second": 16.202,
"step": 9600
},
{
"epoch": 2.387577639751553,
"grad_norm": 7.059185981750488,
"learning_rate": 8.069565217391304e-05,
"loss": 0.8917,
"step": 9610
},
{
"epoch": 2.3900621118012424,
"grad_norm": 4.307859420776367,
"learning_rate": 8.057142857142857e-05,
"loss": 0.6865,
"step": 9620
},
{
"epoch": 2.3925465838509314,
"grad_norm": 8.636592864990234,
"learning_rate": 8.04472049689441e-05,
"loss": 0.825,
"step": 9630
},
{
"epoch": 2.395031055900621,
"grad_norm": 8.701264381408691,
"learning_rate": 8.032298136645962e-05,
"loss": 0.7943,
"step": 9640
},
{
"epoch": 2.3975155279503104,
"grad_norm": 6.308772563934326,
"learning_rate": 8.019875776397516e-05,
"loss": 0.6928,
"step": 9650
},
{
"epoch": 2.4,
"grad_norm": 8.055970191955566,
"learning_rate": 8.00745341614907e-05,
"loss": 0.7339,
"step": 9660
},
{
"epoch": 2.4024844720496894,
"grad_norm": 7.82169246673584,
"learning_rate": 7.995031055900621e-05,
"loss": 0.617,
"step": 9670
},
{
"epoch": 2.404968944099379,
"grad_norm": 5.849754333496094,
"learning_rate": 7.982608695652174e-05,
"loss": 0.6298,
"step": 9680
},
{
"epoch": 2.4074534161490684,
"grad_norm": 7.069714069366455,
"learning_rate": 7.970186335403727e-05,
"loss": 0.8778,
"step": 9690
},
{
"epoch": 2.409937888198758,
"grad_norm": 8.241842269897461,
"learning_rate": 7.95776397515528e-05,
"loss": 0.7769,
"step": 9700
},
{
"epoch": 2.409937888198758,
"eval_accuracy": 0.7975006600369621,
"eval_loss": 0.7845885157585144,
"eval_runtime": 88.9404,
"eval_samples_per_second": 127.76,
"eval_steps_per_second": 15.977,
"step": 9700
},
{
"epoch": 2.4124223602484474,
"grad_norm": 4.8985700607299805,
"learning_rate": 7.945341614906833e-05,
"loss": 0.5057,
"step": 9710
},
{
"epoch": 2.4149068322981364,
"grad_norm": 6.42218542098999,
"learning_rate": 7.932919254658385e-05,
"loss": 0.5966,
"step": 9720
},
{
"epoch": 2.417391304347826,
"grad_norm": 5.961623668670654,
"learning_rate": 7.920496894409938e-05,
"loss": 0.6385,
"step": 9730
},
{
"epoch": 2.4198757763975154,
"grad_norm": 10.123414993286133,
"learning_rate": 7.908074534161492e-05,
"loss": 0.8103,
"step": 9740
},
{
"epoch": 2.422360248447205,
"grad_norm": 8.706270217895508,
"learning_rate": 7.895652173913044e-05,
"loss": 0.7,
"step": 9750
},
{
"epoch": 2.4248447204968944,
"grad_norm": 5.495620250701904,
"learning_rate": 7.883229813664597e-05,
"loss": 0.6731,
"step": 9760
},
{
"epoch": 2.427329192546584,
"grad_norm": 7.219951152801514,
"learning_rate": 7.87080745341615e-05,
"loss": 0.5581,
"step": 9770
},
{
"epoch": 2.4298136645962733,
"grad_norm": 6.016363620758057,
"learning_rate": 7.858385093167703e-05,
"loss": 0.5895,
"step": 9780
},
{
"epoch": 2.432298136645963,
"grad_norm": 7.8357625007629395,
"learning_rate": 7.845962732919256e-05,
"loss": 0.7681,
"step": 9790
},
{
"epoch": 2.4347826086956523,
"grad_norm": 3.6328165531158447,
"learning_rate": 7.833540372670807e-05,
"loss": 0.7939,
"step": 9800
},
{
"epoch": 2.4347826086956523,
"eval_accuracy": 0.7932764234797148,
"eval_loss": 0.7914384603500366,
"eval_runtime": 88.7006,
"eval_samples_per_second": 128.105,
"eval_steps_per_second": 16.02,
"step": 9800
},
{
"epoch": 2.4372670807453414,
"grad_norm": 3.617049217224121,
"learning_rate": 7.82111801242236e-05,
"loss": 0.5236,
"step": 9810
},
{
"epoch": 2.439751552795031,
"grad_norm": 4.9923577308654785,
"learning_rate": 7.808695652173913e-05,
"loss": 0.6392,
"step": 9820
},
{
"epoch": 2.4422360248447204,
"grad_norm": 5.581326484680176,
"learning_rate": 7.796273291925466e-05,
"loss": 0.8614,
"step": 9830
},
{
"epoch": 2.44472049689441,
"grad_norm": 6.245087623596191,
"learning_rate": 7.783850931677019e-05,
"loss": 0.504,
"step": 9840
},
{
"epoch": 2.4472049689440993,
"grad_norm": 5.1908111572265625,
"learning_rate": 7.771428571428572e-05,
"loss": 0.827,
"step": 9850
},
{
"epoch": 2.449689440993789,
"grad_norm": 2.7695984840393066,
"learning_rate": 7.759006211180124e-05,
"loss": 0.6603,
"step": 9860
},
{
"epoch": 2.4521739130434783,
"grad_norm": 6.33609676361084,
"learning_rate": 7.746583850931678e-05,
"loss": 0.7115,
"step": 9870
},
{
"epoch": 2.454658385093168,
"grad_norm": 5.498477935791016,
"learning_rate": 7.734161490683231e-05,
"loss": 0.7111,
"step": 9880
},
{
"epoch": 2.4571428571428573,
"grad_norm": 10.293370246887207,
"learning_rate": 7.721739130434783e-05,
"loss": 0.8168,
"step": 9890
},
{
"epoch": 2.4596273291925463,
"grad_norm": 4.192574501037598,
"learning_rate": 7.709316770186336e-05,
"loss": 0.5641,
"step": 9900
},
{
"epoch": 2.4596273291925463,
"eval_accuracy": 0.7991727536742057,
"eval_loss": 0.7700155973434448,
"eval_runtime": 88.7034,
"eval_samples_per_second": 128.101,
"eval_steps_per_second": 16.02,
"step": 9900
},
{
"epoch": 2.462111801242236,
"grad_norm": 5.3772735595703125,
"learning_rate": 7.696894409937889e-05,
"loss": 0.8451,
"step": 9910
},
{
"epoch": 2.4645962732919253,
"grad_norm": 7.285436630249023,
"learning_rate": 7.684472049689442e-05,
"loss": 0.8242,
"step": 9920
},
{
"epoch": 2.467080745341615,
"grad_norm": 6.7737345695495605,
"learning_rate": 7.672049689440995e-05,
"loss": 0.927,
"step": 9930
},
{
"epoch": 2.4695652173913043,
"grad_norm": 4.772755146026611,
"learning_rate": 7.659627329192546e-05,
"loss": 0.9219,
"step": 9940
},
{
"epoch": 2.472049689440994,
"grad_norm": 4.947612762451172,
"learning_rate": 7.6472049689441e-05,
"loss": 0.6056,
"step": 9950
},
{
"epoch": 2.4745341614906833,
"grad_norm": 5.71645450592041,
"learning_rate": 7.634782608695654e-05,
"loss": 0.6751,
"step": 9960
},
{
"epoch": 2.4770186335403728,
"grad_norm": 7.68681526184082,
"learning_rate": 7.622360248447205e-05,
"loss": 0.4968,
"step": 9970
},
{
"epoch": 2.4795031055900623,
"grad_norm": 4.070769786834717,
"learning_rate": 7.609937888198758e-05,
"loss": 0.5075,
"step": 9980
},
{
"epoch": 2.4819875776397513,
"grad_norm": 28.193359375,
"learning_rate": 7.597515527950311e-05,
"loss": 0.7343,
"step": 9990
},
{
"epoch": 2.4844720496894412,
"grad_norm": 4.914248943328857,
"learning_rate": 7.585093167701863e-05,
"loss": 0.8009,
"step": 10000
},
{
"epoch": 2.4844720496894412,
"eval_accuracy": 0.8015488867376573,
"eval_loss": 0.7699164152145386,
"eval_runtime": 88.0937,
"eval_samples_per_second": 128.988,
"eval_steps_per_second": 16.131,
"step": 10000
},
{
"epoch": 2.4869565217391303,
"grad_norm": 10.814724922180176,
"learning_rate": 7.572670807453417e-05,
"loss": 0.7799,
"step": 10010
},
{
"epoch": 2.48944099378882,
"grad_norm": 10.952703475952148,
"learning_rate": 7.560248447204969e-05,
"loss": 0.7478,
"step": 10020
},
{
"epoch": 2.4919254658385093,
"grad_norm": 7.243926525115967,
"learning_rate": 7.547826086956522e-05,
"loss": 0.5972,
"step": 10030
},
{
"epoch": 2.4944099378881988,
"grad_norm": 5.8431010246276855,
"learning_rate": 7.535403726708075e-05,
"loss": 0.6964,
"step": 10040
},
{
"epoch": 2.4968944099378882,
"grad_norm": 6.788570880889893,
"learning_rate": 7.522981366459627e-05,
"loss": 0.6192,
"step": 10050
},
{
"epoch": 2.4993788819875777,
"grad_norm": 7.250670433044434,
"learning_rate": 7.510559006211181e-05,
"loss": 0.6746,
"step": 10060
},
{
"epoch": 2.5018633540372672,
"grad_norm": 5.413866996765137,
"learning_rate": 7.498136645962734e-05,
"loss": 0.827,
"step": 10070
},
{
"epoch": 2.5043478260869563,
"grad_norm": 5.322055816650391,
"learning_rate": 7.485714285714285e-05,
"loss": 0.5904,
"step": 10080
},
{
"epoch": 2.506832298136646,
"grad_norm": 7.097953796386719,
"learning_rate": 7.473291925465838e-05,
"loss": 0.6116,
"step": 10090
},
{
"epoch": 2.5093167701863353,
"grad_norm": 4.7179341316223145,
"learning_rate": 7.460869565217391e-05,
"loss": 0.6111,
"step": 10100
},
{
"epoch": 2.5093167701863353,
"eval_accuracy": 0.8035730000880049,
"eval_loss": 0.7602738738059998,
"eval_runtime": 87.8798,
"eval_samples_per_second": 129.302,
"eval_steps_per_second": 16.17,
"step": 10100
},
{
"epoch": 2.5118012422360247,
"grad_norm": 4.682028770446777,
"learning_rate": 7.448447204968944e-05,
"loss": 0.527,
"step": 10110
},
{
"epoch": 2.5142857142857142,
"grad_norm": 4.885335445404053,
"learning_rate": 7.436024844720497e-05,
"loss": 1.01,
"step": 10120
},
{
"epoch": 2.5167701863354037,
"grad_norm": 4.012519359588623,
"learning_rate": 7.42360248447205e-05,
"loss": 0.5805,
"step": 10130
},
{
"epoch": 2.519254658385093,
"grad_norm": 8.987902641296387,
"learning_rate": 7.411180124223602e-05,
"loss": 0.6547,
"step": 10140
},
{
"epoch": 2.5217391304347827,
"grad_norm": 7.08282995223999,
"learning_rate": 7.398757763975156e-05,
"loss": 0.8004,
"step": 10150
},
{
"epoch": 2.524223602484472,
"grad_norm": 5.9463396072387695,
"learning_rate": 7.386335403726708e-05,
"loss": 0.893,
"step": 10160
},
{
"epoch": 2.5267080745341612,
"grad_norm": 3.2586588859558105,
"learning_rate": 7.373913043478261e-05,
"loss": 0.6272,
"step": 10170
},
{
"epoch": 2.529192546583851,
"grad_norm": 5.880133628845215,
"learning_rate": 7.361490683229814e-05,
"loss": 0.6464,
"step": 10180
},
{
"epoch": 2.53167701863354,
"grad_norm": 10.840839385986328,
"learning_rate": 7.349068322981367e-05,
"loss": 0.7131,
"step": 10190
},
{
"epoch": 2.5341614906832297,
"grad_norm": 7.217662334442139,
"learning_rate": 7.33664596273292e-05,
"loss": 0.925,
"step": 10200
},
{
"epoch": 2.5341614906832297,
"eval_accuracy": 0.8003168177417935,
"eval_loss": 0.7727270126342773,
"eval_runtime": 87.6344,
"eval_samples_per_second": 129.664,
"eval_steps_per_second": 16.215,
"step": 10200
},
{
"epoch": 2.536645962732919,
"grad_norm": 3.556689500808716,
"learning_rate": 7.324223602484473e-05,
"loss": 0.6457,
"step": 10210
},
{
"epoch": 2.5391304347826087,
"grad_norm": 7.633065223693848,
"learning_rate": 7.311801242236025e-05,
"loss": 0.7647,
"step": 10220
},
{
"epoch": 2.541614906832298,
"grad_norm": 3.796308755874634,
"learning_rate": 7.299378881987578e-05,
"loss": 0.708,
"step": 10230
},
{
"epoch": 2.5440993788819877,
"grad_norm": 7.235866546630859,
"learning_rate": 7.28695652173913e-05,
"loss": 0.8837,
"step": 10240
},
{
"epoch": 2.546583850931677,
"grad_norm": 6.0912184715271,
"learning_rate": 7.274534161490684e-05,
"loss": 0.9866,
"step": 10250
},
{
"epoch": 2.549068322981366,
"grad_norm": 8.70725154876709,
"learning_rate": 7.262111801242237e-05,
"loss": 0.8456,
"step": 10260
},
{
"epoch": 2.551552795031056,
"grad_norm": 7.299804210662842,
"learning_rate": 7.249689440993788e-05,
"loss": 0.5935,
"step": 10270
},
{
"epoch": 2.554037267080745,
"grad_norm": 6.128955841064453,
"learning_rate": 7.237267080745343e-05,
"loss": 0.8323,
"step": 10280
},
{
"epoch": 2.5565217391304347,
"grad_norm": 2.351513624191284,
"learning_rate": 7.224844720496896e-05,
"loss": 0.6219,
"step": 10290
},
{
"epoch": 2.559006211180124,
"grad_norm": 4.556458473205566,
"learning_rate": 7.212422360248447e-05,
"loss": 0.6206,
"step": 10300
},
{
"epoch": 2.559006211180124,
"eval_accuracy": 0.7983807093197219,
"eval_loss": 0.7765286564826965,
"eval_runtime": 87.5463,
"eval_samples_per_second": 129.794,
"eval_steps_per_second": 16.231,
"step": 10300
},
{
"epoch": 2.5614906832298137,
"grad_norm": 5.282100200653076,
"learning_rate": 7.2e-05,
"loss": 0.8967,
"step": 10310
},
{
"epoch": 2.563975155279503,
"grad_norm": 5.501987457275391,
"learning_rate": 7.187577639751553e-05,
"loss": 0.9314,
"step": 10320
},
{
"epoch": 2.5664596273291926,
"grad_norm": 6.691750526428223,
"learning_rate": 7.175155279503106e-05,
"loss": 0.6248,
"step": 10330
},
{
"epoch": 2.568944099378882,
"grad_norm": 2.3620283603668213,
"learning_rate": 7.162732919254659e-05,
"loss": 0.6029,
"step": 10340
},
{
"epoch": 2.571428571428571,
"grad_norm": 9.769782066345215,
"learning_rate": 7.150310559006211e-05,
"loss": 0.8783,
"step": 10350
},
{
"epoch": 2.573913043478261,
"grad_norm": 7.0340681076049805,
"learning_rate": 7.137888198757764e-05,
"loss": 0.847,
"step": 10360
},
{
"epoch": 2.57639751552795,
"grad_norm": 6.227030277252197,
"learning_rate": 7.125465838509318e-05,
"loss": 0.5959,
"step": 10370
},
{
"epoch": 2.5788819875776396,
"grad_norm": 4.65595817565918,
"learning_rate": 7.11304347826087e-05,
"loss": 0.6842,
"step": 10380
},
{
"epoch": 2.581366459627329,
"grad_norm": 9.326735496520996,
"learning_rate": 7.100621118012423e-05,
"loss": 0.5908,
"step": 10390
},
{
"epoch": 2.5838509316770186,
"grad_norm": 6.663669109344482,
"learning_rate": 7.088198757763976e-05,
"loss": 0.5977,
"step": 10400
},
{
"epoch": 2.5838509316770186,
"eval_accuracy": 0.7960045762562703,
"eval_loss": 0.7793198823928833,
"eval_runtime": 87.3653,
"eval_samples_per_second": 130.063,
"eval_steps_per_second": 16.265,
"step": 10400
},
{
"epoch": 2.586335403726708,
"grad_norm": 6.158738136291504,
"learning_rate": 7.075776397515527e-05,
"loss": 0.7951,
"step": 10410
},
{
"epoch": 2.5888198757763976,
"grad_norm": 3.2913687229156494,
"learning_rate": 7.063354037267082e-05,
"loss": 0.8243,
"step": 10420
},
{
"epoch": 2.591304347826087,
"grad_norm": 10.81008529663086,
"learning_rate": 7.050931677018633e-05,
"loss": 0.8896,
"step": 10430
},
{
"epoch": 2.593788819875776,
"grad_norm": 5.766603469848633,
"learning_rate": 7.038509316770186e-05,
"loss": 0.7315,
"step": 10440
},
{
"epoch": 2.596273291925466,
"grad_norm": 6.073093414306641,
"learning_rate": 7.02608695652174e-05,
"loss": 0.7484,
"step": 10450
},
{
"epoch": 2.598757763975155,
"grad_norm": 1.5353639125823975,
"learning_rate": 7.013664596273292e-05,
"loss": 0.6251,
"step": 10460
},
{
"epoch": 2.6012422360248446,
"grad_norm": 4.442315101623535,
"learning_rate": 7.001242236024845e-05,
"loss": 0.7067,
"step": 10470
},
{
"epoch": 2.603726708074534,
"grad_norm": 1.1733781099319458,
"learning_rate": 6.988819875776398e-05,
"loss": 0.5883,
"step": 10480
},
{
"epoch": 2.6062111801242236,
"grad_norm": 5.4250712394714355,
"learning_rate": 6.97639751552795e-05,
"loss": 0.7153,
"step": 10490
},
{
"epoch": 2.608695652173913,
"grad_norm": 6.374954700469971,
"learning_rate": 6.963975155279503e-05,
"loss": 0.8146,
"step": 10500
},
{
"epoch": 2.608695652173913,
"eval_accuracy": 0.79776467482179,
"eval_loss": 0.7799441814422607,
"eval_runtime": 87.4711,
"eval_samples_per_second": 129.906,
"eval_steps_per_second": 16.245,
"step": 10500
},
{
"epoch": 2.6111801242236026,
"grad_norm": 5.935840129852295,
"learning_rate": 6.951552795031057e-05,
"loss": 0.7184,
"step": 10510
},
{
"epoch": 2.613664596273292,
"grad_norm": 1.9507098197937012,
"learning_rate": 6.939130434782609e-05,
"loss": 0.6237,
"step": 10520
},
{
"epoch": 2.616149068322981,
"grad_norm": 4.937575340270996,
"learning_rate": 6.926708074534162e-05,
"loss": 0.7694,
"step": 10530
},
{
"epoch": 2.618633540372671,
"grad_norm": 5.712149143218994,
"learning_rate": 6.914285714285715e-05,
"loss": 0.6623,
"step": 10540
},
{
"epoch": 2.62111801242236,
"grad_norm": 6.4136247634887695,
"learning_rate": 6.901863354037268e-05,
"loss": 0.6992,
"step": 10550
},
{
"epoch": 2.6236024844720496,
"grad_norm": 5.391094207763672,
"learning_rate": 6.889440993788821e-05,
"loss": 0.691,
"step": 10560
},
{
"epoch": 2.626086956521739,
"grad_norm": 7.592553615570068,
"learning_rate": 6.877018633540372e-05,
"loss": 0.5635,
"step": 10570
},
{
"epoch": 2.6285714285714286,
"grad_norm": 6.203282833099365,
"learning_rate": 6.864596273291925e-05,
"loss": 0.5702,
"step": 10580
},
{
"epoch": 2.631055900621118,
"grad_norm": 11.920433044433594,
"learning_rate": 6.852173913043478e-05,
"loss": 0.8267,
"step": 10590
},
{
"epoch": 2.6335403726708075,
"grad_norm": 7.057547092437744,
"learning_rate": 6.839751552795031e-05,
"loss": 0.7869,
"step": 10600
},
{
"epoch": 2.6335403726708075,
"eval_accuracy": 0.808677285928012,
"eval_loss": 0.739636242389679,
"eval_runtime": 86.958,
"eval_samples_per_second": 130.672,
"eval_steps_per_second": 16.341,
"step": 10600
},
{
"epoch": 2.636024844720497,
"grad_norm": 5.696042537689209,
"learning_rate": 6.827329192546584e-05,
"loss": 0.5901,
"step": 10610
},
{
"epoch": 2.638509316770186,
"grad_norm": 9.730021476745605,
"learning_rate": 6.814906832298137e-05,
"loss": 0.7449,
"step": 10620
},
{
"epoch": 2.640993788819876,
"grad_norm": 1.459912657737732,
"learning_rate": 6.802484472049689e-05,
"loss": 0.6211,
"step": 10630
},
{
"epoch": 2.643478260869565,
"grad_norm": 4.86639404296875,
"learning_rate": 6.790062111801243e-05,
"loss": 0.7677,
"step": 10640
},
{
"epoch": 2.6459627329192545,
"grad_norm": 2.849155902862549,
"learning_rate": 6.777639751552795e-05,
"loss": 0.7334,
"step": 10650
},
{
"epoch": 2.648447204968944,
"grad_norm": 6.500259876251221,
"learning_rate": 6.765217391304348e-05,
"loss": 0.821,
"step": 10660
},
{
"epoch": 2.6509316770186335,
"grad_norm": 3.8310985565185547,
"learning_rate": 6.752795031055901e-05,
"loss": 0.8068,
"step": 10670
},
{
"epoch": 2.653416149068323,
"grad_norm": 5.364236831665039,
"learning_rate": 6.740372670807453e-05,
"loss": 0.6021,
"step": 10680
},
{
"epoch": 2.6559006211180125,
"grad_norm": 3.1258809566497803,
"learning_rate": 6.727950310559007e-05,
"loss": 0.7372,
"step": 10690
},
{
"epoch": 2.658385093167702,
"grad_norm": 6.12645959854126,
"learning_rate": 6.71552795031056e-05,
"loss": 0.8966,
"step": 10700
},
{
"epoch": 2.658385093167702,
"eval_accuracy": 0.8070931972190443,
"eval_loss": 0.7386279702186584,
"eval_runtime": 87.2299,
"eval_samples_per_second": 130.265,
"eval_steps_per_second": 16.29,
"step": 10700
},
{
"epoch": 2.660869565217391,
"grad_norm": 7.923446178436279,
"learning_rate": 6.703105590062112e-05,
"loss": 0.7069,
"step": 10710
},
{
"epoch": 2.663354037267081,
"grad_norm": 8.067530632019043,
"learning_rate": 6.690683229813665e-05,
"loss": 0.6993,
"step": 10720
},
{
"epoch": 2.66583850931677,
"grad_norm": 2.588629722595215,
"learning_rate": 6.678260869565218e-05,
"loss": 0.6455,
"step": 10730
},
{
"epoch": 2.6683229813664595,
"grad_norm": 6.204483509063721,
"learning_rate": 6.66583850931677e-05,
"loss": 0.7036,
"step": 10740
},
{
"epoch": 2.670807453416149,
"grad_norm": 6.223699569702148,
"learning_rate": 6.653416149068324e-05,
"loss": 0.7665,
"step": 10750
},
{
"epoch": 2.6732919254658385,
"grad_norm": 5.856508255004883,
"learning_rate": 6.640993788819875e-05,
"loss": 0.7502,
"step": 10760
},
{
"epoch": 2.675776397515528,
"grad_norm": 4.8994293212890625,
"learning_rate": 6.628571428571428e-05,
"loss": 0.8523,
"step": 10770
},
{
"epoch": 2.6782608695652175,
"grad_norm": 12.497848510742188,
"learning_rate": 6.616149068322983e-05,
"loss": 0.7933,
"step": 10780
},
{
"epoch": 2.680745341614907,
"grad_norm": 5.682429790496826,
"learning_rate": 6.603726708074534e-05,
"loss": 0.4855,
"step": 10790
},
{
"epoch": 2.683229813664596,
"grad_norm": 6.263789176940918,
"learning_rate": 6.591304347826087e-05,
"loss": 0.6654,
"step": 10800
},
{
"epoch": 2.683229813664596,
"eval_accuracy": 0.8103493795652557,
"eval_loss": 0.7305024266242981,
"eval_runtime": 86.2303,
"eval_samples_per_second": 131.775,
"eval_steps_per_second": 16.479,
"step": 10800
},
{
"epoch": 2.685714285714286,
"grad_norm": 6.363834381103516,
"learning_rate": 6.57888198757764e-05,
"loss": 0.5354,
"step": 10810
},
{
"epoch": 2.688198757763975,
"grad_norm": 5.781926155090332,
"learning_rate": 6.566459627329193e-05,
"loss": 0.6147,
"step": 10820
},
{
"epoch": 2.6906832298136645,
"grad_norm": 3.1562442779541016,
"learning_rate": 6.554037267080746e-05,
"loss": 0.7169,
"step": 10830
},
{
"epoch": 2.693167701863354,
"grad_norm": 6.964587211608887,
"learning_rate": 6.541614906832299e-05,
"loss": 0.6797,
"step": 10840
},
{
"epoch": 2.6956521739130435,
"grad_norm": 4.136144638061523,
"learning_rate": 6.529192546583851e-05,
"loss": 0.9134,
"step": 10850
},
{
"epoch": 2.698136645962733,
"grad_norm": 2.366265296936035,
"learning_rate": 6.516770186335404e-05,
"loss": 0.5522,
"step": 10860
},
{
"epoch": 2.7006211180124224,
"grad_norm": 4.044836521148682,
"learning_rate": 6.504347826086957e-05,
"loss": 0.5896,
"step": 10870
},
{
"epoch": 2.703105590062112,
"grad_norm": 7.166288375854492,
"learning_rate": 6.49192546583851e-05,
"loss": 0.8243,
"step": 10880
},
{
"epoch": 2.705590062111801,
"grad_norm": 4.863167762756348,
"learning_rate": 6.479503105590063e-05,
"loss": 0.7812,
"step": 10890
},
{
"epoch": 2.708074534161491,
"grad_norm": 4.528777122497559,
"learning_rate": 6.467080745341614e-05,
"loss": 0.737,
"step": 10900
},
{
"epoch": 2.708074534161491,
"eval_accuracy": 0.8083252662149081,
"eval_loss": 0.7316586971282959,
"eval_runtime": 87.475,
"eval_samples_per_second": 129.9,
"eval_steps_per_second": 16.245,
"step": 10900
},
{
"epoch": 2.71055900621118,
"grad_norm": 4.942448139190674,
"learning_rate": 6.454658385093169e-05,
"loss": 0.6569,
"step": 10910
},
{
"epoch": 2.7130434782608694,
"grad_norm": 4.801420211791992,
"learning_rate": 6.442236024844722e-05,
"loss": 0.8062,
"step": 10920
},
{
"epoch": 2.715527950310559,
"grad_norm": 5.124699115753174,
"learning_rate": 6.429813664596273e-05,
"loss": 0.6353,
"step": 10930
},
{
"epoch": 2.7180124223602484,
"grad_norm": 7.245678901672363,
"learning_rate": 6.417391304347826e-05,
"loss": 0.8347,
"step": 10940
},
{
"epoch": 2.720496894409938,
"grad_norm": 5.200338363647461,
"learning_rate": 6.40496894409938e-05,
"loss": 0.7588,
"step": 10950
},
{
"epoch": 2.7229813664596274,
"grad_norm": 2.782305955886841,
"learning_rate": 6.392546583850932e-05,
"loss": 0.4884,
"step": 10960
},
{
"epoch": 2.725465838509317,
"grad_norm": 4.4365363121032715,
"learning_rate": 6.380124223602485e-05,
"loss": 0.7583,
"step": 10970
},
{
"epoch": 2.727950310559006,
"grad_norm": 8.139409065246582,
"learning_rate": 6.367701863354037e-05,
"loss": 0.8283,
"step": 10980
},
{
"epoch": 2.730434782608696,
"grad_norm": 3.3418803215026855,
"learning_rate": 6.35527950310559e-05,
"loss": 0.6336,
"step": 10990
},
{
"epoch": 2.732919254658385,
"grad_norm": 6.447763442993164,
"learning_rate": 6.342857142857143e-05,
"loss": 0.9283,
"step": 11000
},
{
"epoch": 2.732919254658385,
"eval_accuracy": 0.8071812021473203,
"eval_loss": 0.740921676158905,
"eval_runtime": 86.417,
"eval_samples_per_second": 131.49,
"eval_steps_per_second": 16.444,
"step": 11000
},
{
"epoch": 2.7354037267080744,
"grad_norm": 7.569089412689209,
"learning_rate": 6.330434782608696e-05,
"loss": 0.8814,
"step": 11010
},
{
"epoch": 2.737888198757764,
"grad_norm": 5.908865451812744,
"learning_rate": 6.318012422360249e-05,
"loss": 0.8493,
"step": 11020
},
{
"epoch": 2.7403726708074534,
"grad_norm": 5.812557697296143,
"learning_rate": 6.305590062111802e-05,
"loss": 0.6291,
"step": 11030
},
{
"epoch": 2.742857142857143,
"grad_norm": 4.550736904144287,
"learning_rate": 6.293167701863354e-05,
"loss": 0.7389,
"step": 11040
},
{
"epoch": 2.7453416149068324,
"grad_norm": 7.449479579925537,
"learning_rate": 6.280745341614908e-05,
"loss": 0.7533,
"step": 11050
},
{
"epoch": 2.747826086956522,
"grad_norm": 4.580323219299316,
"learning_rate": 6.26832298136646e-05,
"loss": 0.6832,
"step": 11060
},
{
"epoch": 2.750310559006211,
"grad_norm": 5.769420623779297,
"learning_rate": 6.255900621118012e-05,
"loss": 0.8311,
"step": 11070
},
{
"epoch": 2.752795031055901,
"grad_norm": 7.184681415557861,
"learning_rate": 6.243478260869565e-05,
"loss": 0.7232,
"step": 11080
},
{
"epoch": 2.75527950310559,
"grad_norm": 4.768852233886719,
"learning_rate": 6.231055900621117e-05,
"loss": 0.638,
"step": 11090
},
{
"epoch": 2.7577639751552794,
"grad_norm": 9.40058708190918,
"learning_rate": 6.218633540372671e-05,
"loss": 0.7491,
"step": 11100
},
{
"epoch": 2.7577639751552794,
"eval_accuracy": 0.8152776555487107,
"eval_loss": 0.7087730169296265,
"eval_runtime": 86.1576,
"eval_samples_per_second": 131.886,
"eval_steps_per_second": 16.493,
"step": 11100
},
{
"epoch": 2.760248447204969,
"grad_norm": 6.754823207855225,
"learning_rate": 6.206211180124224e-05,
"loss": 0.7061,
"step": 11110
},
{
"epoch": 2.7627329192546584,
"grad_norm": 5.724888801574707,
"learning_rate": 6.193788819875776e-05,
"loss": 0.5908,
"step": 11120
},
{
"epoch": 2.765217391304348,
"grad_norm": 5.33830451965332,
"learning_rate": 6.181366459627329e-05,
"loss": 0.9152,
"step": 11130
},
{
"epoch": 2.7677018633540373,
"grad_norm": 5.377154350280762,
"learning_rate": 6.168944099378882e-05,
"loss": 0.6783,
"step": 11140
},
{
"epoch": 2.770186335403727,
"grad_norm": 6.318910121917725,
"learning_rate": 6.156521739130435e-05,
"loss": 0.7599,
"step": 11150
},
{
"epoch": 2.772670807453416,
"grad_norm": 7.895182132720947,
"learning_rate": 6.144099378881988e-05,
"loss": 0.7931,
"step": 11160
},
{
"epoch": 2.775155279503106,
"grad_norm": 8.503508567810059,
"learning_rate": 6.131677018633541e-05,
"loss": 0.6652,
"step": 11170
},
{
"epoch": 2.777639751552795,
"grad_norm": 6.544893264770508,
"learning_rate": 6.119254658385093e-05,
"loss": 0.5642,
"step": 11180
},
{
"epoch": 2.7801242236024843,
"grad_norm": 5.325340270996094,
"learning_rate": 6.106832298136647e-05,
"loss": 0.6045,
"step": 11190
},
{
"epoch": 2.782608695652174,
"grad_norm": 8.904745101928711,
"learning_rate": 6.094409937888199e-05,
"loss": 0.6807,
"step": 11200
},
{
"epoch": 2.782608695652174,
"eval_accuracy": 0.8122854879873272,
"eval_loss": 0.715432345867157,
"eval_runtime": 87.227,
"eval_samples_per_second": 130.269,
"eval_steps_per_second": 16.291,
"step": 11200
},
{
"epoch": 2.7850931677018633,
"grad_norm": 5.014203071594238,
"learning_rate": 6.0819875776397516e-05,
"loss": 0.542,
"step": 11210
},
{
"epoch": 2.787577639751553,
"grad_norm": 6.621218681335449,
"learning_rate": 6.069565217391304e-05,
"loss": 0.524,
"step": 11220
},
{
"epoch": 2.7900621118012423,
"grad_norm": 5.968732833862305,
"learning_rate": 6.0571428571428576e-05,
"loss": 0.6332,
"step": 11230
},
{
"epoch": 2.792546583850932,
"grad_norm": 6.3051438331604,
"learning_rate": 6.0447204968944106e-05,
"loss": 0.5523,
"step": 11240
},
{
"epoch": 2.795031055900621,
"grad_norm": 3.917712450027466,
"learning_rate": 6.032298136645963e-05,
"loss": 0.8714,
"step": 11250
},
{
"epoch": 2.7975155279503108,
"grad_norm": 6.610170841217041,
"learning_rate": 6.019875776397515e-05,
"loss": 0.6222,
"step": 11260
},
{
"epoch": 2.8,
"grad_norm": 4.8922953605651855,
"learning_rate": 6.007453416149068e-05,
"loss": 0.8399,
"step": 11270
},
{
"epoch": 2.8024844720496893,
"grad_norm": 6.774288654327393,
"learning_rate": 5.995031055900622e-05,
"loss": 0.8241,
"step": 11280
},
{
"epoch": 2.804968944099379,
"grad_norm": 6.792983531951904,
"learning_rate": 5.982608695652174e-05,
"loss": 0.5947,
"step": 11290
},
{
"epoch": 2.8074534161490683,
"grad_norm": 5.0632734298706055,
"learning_rate": 5.9701863354037265e-05,
"loss": 0.4485,
"step": 11300
},
{
"epoch": 2.8074534161490683,
"eval_accuracy": 0.8180058083252663,
"eval_loss": 0.6984890103340149,
"eval_runtime": 86.6712,
"eval_samples_per_second": 131.105,
"eval_steps_per_second": 16.395,
"step": 11300
},
{
"epoch": 2.809937888198758,
"grad_norm": 6.2507123947143555,
"learning_rate": 5.9577639751552795e-05,
"loss": 0.704,
"step": 11310
},
{
"epoch": 2.8124223602484473,
"grad_norm": 5.285377025604248,
"learning_rate": 5.945341614906833e-05,
"loss": 0.5679,
"step": 11320
},
{
"epoch": 2.8149068322981368,
"grad_norm": 7.2304792404174805,
"learning_rate": 5.9329192546583855e-05,
"loss": 0.5063,
"step": 11330
},
{
"epoch": 2.8173913043478263,
"grad_norm": 6.580856800079346,
"learning_rate": 5.9204968944099385e-05,
"loss": 0.5677,
"step": 11340
},
{
"epoch": 2.8198757763975157,
"grad_norm": 5.679018497467041,
"learning_rate": 5.908074534161491e-05,
"loss": 0.5706,
"step": 11350
},
{
"epoch": 2.822360248447205,
"grad_norm": 5.586709499359131,
"learning_rate": 5.895652173913043e-05,
"loss": 0.6446,
"step": 11360
},
{
"epoch": 2.8248447204968943,
"grad_norm": 4.558923244476318,
"learning_rate": 5.883229813664597e-05,
"loss": 0.6804,
"step": 11370
},
{
"epoch": 2.8273291925465838,
"grad_norm": 9.596306800842285,
"learning_rate": 5.87080745341615e-05,
"loss": 0.6734,
"step": 11380
},
{
"epoch": 2.8298136645962733,
"grad_norm": 3.818284749984741,
"learning_rate": 5.858385093167702e-05,
"loss": 0.6011,
"step": 11390
},
{
"epoch": 2.8322981366459627,
"grad_norm": 4.609076023101807,
"learning_rate": 5.8459627329192544e-05,
"loss": 0.6694,
"step": 11400
},
{
"epoch": 2.8322981366459627,
"eval_accuracy": 0.8147496259790549,
"eval_loss": 0.7123826146125793,
"eval_runtime": 86.7222,
"eval_samples_per_second": 131.028,
"eval_steps_per_second": 16.386,
"step": 11400
},
{
"epoch": 2.8347826086956522,
"grad_norm": 6.28999137878418,
"learning_rate": 5.833540372670808e-05,
"loss": 0.6964,
"step": 11410
},
{
"epoch": 2.8372670807453417,
"grad_norm": 3.3696694374084473,
"learning_rate": 5.821118012422361e-05,
"loss": 0.722,
"step": 11420
},
{
"epoch": 2.839751552795031,
"grad_norm": 8.365155220031738,
"learning_rate": 5.8086956521739133e-05,
"loss": 0.5097,
"step": 11430
},
{
"epoch": 2.8422360248447207,
"grad_norm": 2.5981850624084473,
"learning_rate": 5.7962732919254657e-05,
"loss": 0.5728,
"step": 11440
},
{
"epoch": 2.8447204968944098,
"grad_norm": 4.385498523712158,
"learning_rate": 5.7838509316770186e-05,
"loss": 0.6647,
"step": 11450
},
{
"epoch": 2.8472049689440992,
"grad_norm": 7.318809986114502,
"learning_rate": 5.771428571428572e-05,
"loss": 0.7441,
"step": 11460
},
{
"epoch": 2.8496894409937887,
"grad_norm": 4.498103141784668,
"learning_rate": 5.7590062111801246e-05,
"loss": 0.7047,
"step": 11470
},
{
"epoch": 2.8521739130434782,
"grad_norm": 8.885876655578613,
"learning_rate": 5.746583850931677e-05,
"loss": 0.7089,
"step": 11480
},
{
"epoch": 2.8546583850931677,
"grad_norm": 9.858505249023438,
"learning_rate": 5.73416149068323e-05,
"loss": 0.7153,
"step": 11490
},
{
"epoch": 2.857142857142857,
"grad_norm": 5.05450439453125,
"learning_rate": 5.7217391304347836e-05,
"loss": 0.6661,
"step": 11500
},
{
"epoch": 2.857142857142857,
"eval_accuracy": 0.8152776555487107,
"eval_loss": 0.7075205445289612,
"eval_runtime": 87.0158,
"eval_samples_per_second": 130.586,
"eval_steps_per_second": 16.33,
"step": 11500
},
{
"epoch": 2.8596273291925467,
"grad_norm": 3.5484821796417236,
"learning_rate": 5.709316770186336e-05,
"loss": 0.6991,
"step": 11510
},
{
"epoch": 2.862111801242236,
"grad_norm": 3.2322356700897217,
"learning_rate": 5.696894409937888e-05,
"loss": 0.6749,
"step": 11520
},
{
"epoch": 2.8645962732919257,
"grad_norm": 5.108699798583984,
"learning_rate": 5.684472049689441e-05,
"loss": 0.7303,
"step": 11530
},
{
"epoch": 2.8670807453416147,
"grad_norm": 5.204659461975098,
"learning_rate": 5.6720496894409935e-05,
"loss": 0.6298,
"step": 11540
},
{
"epoch": 2.869565217391304,
"grad_norm": 2.617388963699341,
"learning_rate": 5.659627329192547e-05,
"loss": 0.6892,
"step": 11550
},
{
"epoch": 2.8720496894409937,
"grad_norm": 5.9790730476379395,
"learning_rate": 5.6472049689440995e-05,
"loss": 0.8314,
"step": 11560
},
{
"epoch": 2.874534161490683,
"grad_norm": 8.729573249816895,
"learning_rate": 5.6347826086956525e-05,
"loss": 0.5681,
"step": 11570
},
{
"epoch": 2.8770186335403727,
"grad_norm": 9.801512718200684,
"learning_rate": 5.622360248447205e-05,
"loss": 0.5574,
"step": 11580
},
{
"epoch": 2.879503105590062,
"grad_norm": 10.816731452941895,
"learning_rate": 5.6099378881987585e-05,
"loss": 0.6772,
"step": 11590
},
{
"epoch": 2.8819875776397517,
"grad_norm": 6.968757152557373,
"learning_rate": 5.597515527950311e-05,
"loss": 0.7971,
"step": 11600
},
{
"epoch": 2.8819875776397517,
"eval_accuracy": 0.8077972366452522,
"eval_loss": 0.7374622225761414,
"eval_runtime": 87.4478,
"eval_samples_per_second": 129.94,
"eval_steps_per_second": 16.25,
"step": 11600
},
{
"epoch": 2.884472049689441,
"grad_norm": 5.691667556762695,
"learning_rate": 5.585093167701864e-05,
"loss": 0.6013,
"step": 11610
},
{
"epoch": 2.8869565217391306,
"grad_norm": 6.217525482177734,
"learning_rate": 5.572670807453416e-05,
"loss": 0.5398,
"step": 11620
},
{
"epoch": 2.8894409937888197,
"grad_norm": 6.222617149353027,
"learning_rate": 5.5602484472049684e-05,
"loss": 0.7039,
"step": 11630
},
{
"epoch": 2.891925465838509,
"grad_norm": 6.754746437072754,
"learning_rate": 5.547826086956522e-05,
"loss": 0.4396,
"step": 11640
},
{
"epoch": 2.8944099378881987,
"grad_norm": 3.135385513305664,
"learning_rate": 5.535403726708075e-05,
"loss": 0.6041,
"step": 11650
},
{
"epoch": 2.896894409937888,
"grad_norm": 8.670600891113281,
"learning_rate": 5.5229813664596274e-05,
"loss": 0.6501,
"step": 11660
},
{
"epoch": 2.8993788819875776,
"grad_norm": 5.472225666046143,
"learning_rate": 5.5105590062111804e-05,
"loss": 0.6425,
"step": 11670
},
{
"epoch": 2.901863354037267,
"grad_norm": 6.564612865447998,
"learning_rate": 5.498136645962734e-05,
"loss": 0.597,
"step": 11680
},
{
"epoch": 2.9043478260869566,
"grad_norm": 4.676502227783203,
"learning_rate": 5.485714285714286e-05,
"loss": 0.8556,
"step": 11690
},
{
"epoch": 2.906832298136646,
"grad_norm": 5.459942817687988,
"learning_rate": 5.4732919254658386e-05,
"loss": 0.9771,
"step": 11700
},
{
"epoch": 2.906832298136646,
"eval_accuracy": 0.8132535421983631,
"eval_loss": 0.7133490443229675,
"eval_runtime": 87.3637,
"eval_samples_per_second": 130.065,
"eval_steps_per_second": 16.265,
"step": 11700
},
{
"epoch": 2.9093167701863356,
"grad_norm": 4.296738624572754,
"learning_rate": 5.4608695652173916e-05,
"loss": 0.6457,
"step": 11710
},
{
"epoch": 2.9118012422360247,
"grad_norm": 6.291906356811523,
"learning_rate": 5.448447204968944e-05,
"loss": 0.6148,
"step": 11720
},
{
"epoch": 2.914285714285714,
"grad_norm": 2.410308837890625,
"learning_rate": 5.4360248447204976e-05,
"loss": 0.5634,
"step": 11730
},
{
"epoch": 2.9167701863354036,
"grad_norm": 4.089565753936768,
"learning_rate": 5.42360248447205e-05,
"loss": 0.6921,
"step": 11740
},
{
"epoch": 2.919254658385093,
"grad_norm": 6.613698482513428,
"learning_rate": 5.411180124223603e-05,
"loss": 0.7421,
"step": 11750
},
{
"epoch": 2.9217391304347826,
"grad_norm": 6.556400775909424,
"learning_rate": 5.398757763975155e-05,
"loss": 0.7118,
"step": 11760
},
{
"epoch": 2.924223602484472,
"grad_norm": 7.922701358795166,
"learning_rate": 5.386335403726709e-05,
"loss": 0.7489,
"step": 11770
},
{
"epoch": 2.9267080745341616,
"grad_norm": 3.6202433109283447,
"learning_rate": 5.373913043478261e-05,
"loss": 0.3694,
"step": 11780
},
{
"epoch": 2.929192546583851,
"grad_norm": 9.018277168273926,
"learning_rate": 5.361490683229814e-05,
"loss": 0.5022,
"step": 11790
},
{
"epoch": 2.9316770186335406,
"grad_norm": 4.093759059906006,
"learning_rate": 5.3490683229813665e-05,
"loss": 0.5238,
"step": 11800
},
{
"epoch": 2.9316770186335406,
"eval_accuracy": 0.8157176801900906,
"eval_loss": 0.7077267169952393,
"eval_runtime": 87.0199,
"eval_samples_per_second": 130.579,
"eval_steps_per_second": 16.33,
"step": 11800
},
{
"epoch": 2.9341614906832296,
"grad_norm": 4.99535608291626,
"learning_rate": 5.336645962732919e-05,
"loss": 0.5953,
"step": 11810
},
{
"epoch": 2.936645962732919,
"grad_norm": 7.4504194259643555,
"learning_rate": 5.3242236024844725e-05,
"loss": 0.8386,
"step": 11820
},
{
"epoch": 2.9391304347826086,
"grad_norm": 6.058727741241455,
"learning_rate": 5.3118012422360255e-05,
"loss": 0.6208,
"step": 11830
},
{
"epoch": 2.941614906832298,
"grad_norm": 6.454775333404541,
"learning_rate": 5.299378881987578e-05,
"loss": 0.6312,
"step": 11840
},
{
"epoch": 2.9440993788819876,
"grad_norm": 5.638906478881836,
"learning_rate": 5.28695652173913e-05,
"loss": 0.6697,
"step": 11850
},
{
"epoch": 2.946583850931677,
"grad_norm": 4.841670036315918,
"learning_rate": 5.274534161490684e-05,
"loss": 0.6628,
"step": 11860
},
{
"epoch": 2.9490683229813666,
"grad_norm": 4.2036614418029785,
"learning_rate": 5.262111801242237e-05,
"loss": 0.5813,
"step": 11870
},
{
"epoch": 2.951552795031056,
"grad_norm": 6.559536933898926,
"learning_rate": 5.249689440993789e-05,
"loss": 0.6546,
"step": 11880
},
{
"epoch": 2.9540372670807455,
"grad_norm": 3.5744316577911377,
"learning_rate": 5.2372670807453414e-05,
"loss": 0.7345,
"step": 11890
},
{
"epoch": 2.9565217391304346,
"grad_norm": 5.031458377838135,
"learning_rate": 5.2248447204968944e-05,
"loss": 0.5636,
"step": 11900
},
{
"epoch": 2.9565217391304346,
"eval_accuracy": 0.802956965590073,
"eval_loss": 0.7418798208236694,
"eval_runtime": 87.6799,
"eval_samples_per_second": 129.596,
"eval_steps_per_second": 16.207,
"step": 11900
},
{
"epoch": 2.959006211180124,
"grad_norm": 4.476680755615234,
"learning_rate": 5.212422360248448e-05,
"loss": 0.7594,
"step": 11910
},
{
"epoch": 2.9614906832298136,
"grad_norm": 15.456870079040527,
"learning_rate": 5.2000000000000004e-05,
"loss": 0.8462,
"step": 11920
},
{
"epoch": 2.963975155279503,
"grad_norm": 6.276050567626953,
"learning_rate": 5.187577639751553e-05,
"loss": 0.5847,
"step": 11930
},
{
"epoch": 2.9664596273291925,
"grad_norm": 5.983313083648682,
"learning_rate": 5.1751552795031057e-05,
"loss": 0.7701,
"step": 11940
},
{
"epoch": 2.968944099378882,
"grad_norm": 7.4835662841796875,
"learning_rate": 5.162732919254659e-05,
"loss": 0.5382,
"step": 11950
},
{
"epoch": 2.9714285714285715,
"grad_norm": 5.3558831214904785,
"learning_rate": 5.1503105590062116e-05,
"loss": 0.672,
"step": 11960
},
{
"epoch": 2.973913043478261,
"grad_norm": 9.933943748474121,
"learning_rate": 5.137888198757764e-05,
"loss": 0.6792,
"step": 11970
},
{
"epoch": 2.9763975155279505,
"grad_norm": 3.512000799179077,
"learning_rate": 5.125465838509317e-05,
"loss": 0.6301,
"step": 11980
},
{
"epoch": 2.9788819875776396,
"grad_norm": 0.8877289295196533,
"learning_rate": 5.113043478260869e-05,
"loss": 0.4571,
"step": 11990
},
{
"epoch": 2.981366459627329,
"grad_norm": 10.120748519897461,
"learning_rate": 5.100621118012423e-05,
"loss": 0.8962,
"step": 12000
},
{
"epoch": 2.981366459627329,
"eval_accuracy": 0.8174777787556103,
"eval_loss": 0.7020727396011353,
"eval_runtime": 86.2234,
"eval_samples_per_second": 131.786,
"eval_steps_per_second": 16.48,
"step": 12000
},
{
"epoch": 2.9838509316770185,
"grad_norm": 6.098137855529785,
"learning_rate": 5.088198757763976e-05,
"loss": 0.7792,
"step": 12010
},
{
"epoch": 2.986335403726708,
"grad_norm": 6.321715354919434,
"learning_rate": 5.075776397515528e-05,
"loss": 0.6683,
"step": 12020
},
{
"epoch": 2.9888198757763975,
"grad_norm": 3.2365546226501465,
"learning_rate": 5.0633540372670805e-05,
"loss": 0.8028,
"step": 12030
},
{
"epoch": 2.991304347826087,
"grad_norm": 6.188086986541748,
"learning_rate": 5.0509316770186335e-05,
"loss": 0.8973,
"step": 12040
},
{
"epoch": 2.9937888198757765,
"grad_norm": 4.171976089477539,
"learning_rate": 5.038509316770187e-05,
"loss": 0.5392,
"step": 12050
},
{
"epoch": 2.996273291925466,
"grad_norm": 10.866338729858398,
"learning_rate": 5.0260869565217395e-05,
"loss": 0.6474,
"step": 12060
},
{
"epoch": 2.9987577639751555,
"grad_norm": 7.5085673332214355,
"learning_rate": 5.013664596273292e-05,
"loss": 0.5523,
"step": 12070
},
{
"epoch": 3.0012422360248445,
"grad_norm": 8.900304794311523,
"learning_rate": 5.001242236024845e-05,
"loss": 0.4688,
"step": 12080
},
{
"epoch": 3.003726708074534,
"grad_norm": 5.257197380065918,
"learning_rate": 4.988819875776398e-05,
"loss": 0.5883,
"step": 12090
},
{
"epoch": 3.0062111801242235,
"grad_norm": 6.265869140625,
"learning_rate": 4.976397515527951e-05,
"loss": 0.4561,
"step": 12100
},
{
"epoch": 3.0062111801242235,
"eval_accuracy": 0.8162457097597465,
"eval_loss": 0.7031123042106628,
"eval_runtime": 86.2703,
"eval_samples_per_second": 131.714,
"eval_steps_per_second": 16.471,
"step": 12100
},
{
"epoch": 3.008695652173913,
"grad_norm": 7.839663505554199,
"learning_rate": 4.963975155279503e-05,
"loss": 0.6235,
"step": 12110
},
{
"epoch": 3.0111801242236025,
"grad_norm": 2.760774850845337,
"learning_rate": 4.951552795031056e-05,
"loss": 0.4951,
"step": 12120
},
{
"epoch": 3.013664596273292,
"grad_norm": 5.036975383758545,
"learning_rate": 4.939130434782609e-05,
"loss": 0.5424,
"step": 12130
},
{
"epoch": 3.0161490683229815,
"grad_norm": 6.381801128387451,
"learning_rate": 4.9267080745341614e-05,
"loss": 0.4526,
"step": 12140
},
{
"epoch": 3.018633540372671,
"grad_norm": 5.3697686195373535,
"learning_rate": 4.9142857142857144e-05,
"loss": 0.6119,
"step": 12150
},
{
"epoch": 3.0211180124223604,
"grad_norm": 6.435357093811035,
"learning_rate": 4.9018633540372674e-05,
"loss": 0.5142,
"step": 12160
},
{
"epoch": 3.0236024844720495,
"grad_norm": 4.873701572418213,
"learning_rate": 4.8894409937888204e-05,
"loss": 0.5177,
"step": 12170
},
{
"epoch": 3.026086956521739,
"grad_norm": 2.1949551105499268,
"learning_rate": 4.877018633540373e-05,
"loss": 0.4267,
"step": 12180
},
{
"epoch": 3.0285714285714285,
"grad_norm": 7.51536226272583,
"learning_rate": 4.8645962732919257e-05,
"loss": 0.6561,
"step": 12190
},
{
"epoch": 3.031055900621118,
"grad_norm": 4.367460250854492,
"learning_rate": 4.8521739130434786e-05,
"loss": 0.4906,
"step": 12200
},
{
"epoch": 3.031055900621118,
"eval_accuracy": 0.8171257590425064,
"eval_loss": 0.710408627986908,
"eval_runtime": 85.9193,
"eval_samples_per_second": 132.252,
"eval_steps_per_second": 16.539,
"step": 12200
},
{
"epoch": 3.0335403726708075,
"grad_norm": 7.403229236602783,
"learning_rate": 4.8397515527950316e-05,
"loss": 0.5599,
"step": 12210
},
{
"epoch": 3.036024844720497,
"grad_norm": 3.5904605388641357,
"learning_rate": 4.827329192546584e-05,
"loss": 0.4379,
"step": 12220
},
{
"epoch": 3.0385093167701864,
"grad_norm": 7.364349842071533,
"learning_rate": 4.814906832298137e-05,
"loss": 0.5893,
"step": 12230
},
{
"epoch": 3.040993788819876,
"grad_norm": 3.0802817344665527,
"learning_rate": 4.80248447204969e-05,
"loss": 0.532,
"step": 12240
},
{
"epoch": 3.0434782608695654,
"grad_norm": 5.558223724365234,
"learning_rate": 4.790062111801242e-05,
"loss": 0.6785,
"step": 12250
},
{
"epoch": 3.0459627329192545,
"grad_norm": 5.504637241363525,
"learning_rate": 4.777639751552795e-05,
"loss": 0.5697,
"step": 12260
},
{
"epoch": 3.048447204968944,
"grad_norm": 3.261624574661255,
"learning_rate": 4.765217391304348e-05,
"loss": 0.4528,
"step": 12270
},
{
"epoch": 3.0509316770186334,
"grad_norm": 7.631359577178955,
"learning_rate": 4.752795031055901e-05,
"loss": 0.5807,
"step": 12280
},
{
"epoch": 3.053416149068323,
"grad_norm": 8.036623001098633,
"learning_rate": 4.7403726708074535e-05,
"loss": 0.7984,
"step": 12290
},
{
"epoch": 3.0559006211180124,
"grad_norm": 10.502141952514648,
"learning_rate": 4.727950310559006e-05,
"loss": 0.5422,
"step": 12300
},
{
"epoch": 3.0559006211180124,
"eval_accuracy": 0.8153656604769867,
"eval_loss": 0.7035276293754578,
"eval_runtime": 86.968,
"eval_samples_per_second": 130.657,
"eval_steps_per_second": 16.339,
"step": 12300
},
{
"epoch": 3.058385093167702,
"grad_norm": 2.4105753898620605,
"learning_rate": 4.7155279503105595e-05,
"loss": 0.4012,
"step": 12310
},
{
"epoch": 3.0608695652173914,
"grad_norm": 4.15570592880249,
"learning_rate": 4.703105590062112e-05,
"loss": 0.7022,
"step": 12320
},
{
"epoch": 3.063354037267081,
"grad_norm": 10.396677017211914,
"learning_rate": 4.690683229813665e-05,
"loss": 0.5633,
"step": 12330
},
{
"epoch": 3.0658385093167704,
"grad_norm": 3.672163963317871,
"learning_rate": 4.678260869565218e-05,
"loss": 0.5217,
"step": 12340
},
{
"epoch": 3.0683229813664594,
"grad_norm": 4.405937671661377,
"learning_rate": 4.665838509316771e-05,
"loss": 0.3619,
"step": 12350
},
{
"epoch": 3.070807453416149,
"grad_norm": 5.227725982666016,
"learning_rate": 4.653416149068323e-05,
"loss": 0.4803,
"step": 12360
},
{
"epoch": 3.0732919254658384,
"grad_norm": 6.511715412139893,
"learning_rate": 4.640993788819876e-05,
"loss": 0.4904,
"step": 12370
},
{
"epoch": 3.075776397515528,
"grad_norm": 2.1879351139068604,
"learning_rate": 4.628571428571429e-05,
"loss": 0.4648,
"step": 12380
},
{
"epoch": 3.0782608695652174,
"grad_norm": 7.1389479637146,
"learning_rate": 4.6161490683229814e-05,
"loss": 0.3893,
"step": 12390
},
{
"epoch": 3.080745341614907,
"grad_norm": 3.872439384460449,
"learning_rate": 4.6037267080745344e-05,
"loss": 0.5541,
"step": 12400
},
{
"epoch": 3.080745341614907,
"eval_accuracy": 0.8231980990935492,
"eval_loss": 0.6904828548431396,
"eval_runtime": 87.516,
"eval_samples_per_second": 129.839,
"eval_steps_per_second": 16.237,
"step": 12400
},
{
"epoch": 3.0832298136645964,
"grad_norm": 4.102145195007324,
"learning_rate": 4.591304347826087e-05,
"loss": 0.5671,
"step": 12410
},
{
"epoch": 3.085714285714286,
"grad_norm": 10.544522285461426,
"learning_rate": 4.5788819875776404e-05,
"loss": 0.4794,
"step": 12420
},
{
"epoch": 3.0881987577639753,
"grad_norm": 5.980569362640381,
"learning_rate": 4.566459627329193e-05,
"loss": 0.5564,
"step": 12430
},
{
"epoch": 3.0906832298136644,
"grad_norm": 10.677704811096191,
"learning_rate": 4.5540372670807457e-05,
"loss": 0.543,
"step": 12440
},
{
"epoch": 3.093167701863354,
"grad_norm": 5.909951686859131,
"learning_rate": 4.541614906832298e-05,
"loss": 0.5245,
"step": 12450
},
{
"epoch": 3.0956521739130434,
"grad_norm": 16.215694427490234,
"learning_rate": 4.5291925465838516e-05,
"loss": 0.603,
"step": 12460
},
{
"epoch": 3.098136645962733,
"grad_norm": 8.574531555175781,
"learning_rate": 4.516770186335404e-05,
"loss": 0.5718,
"step": 12470
},
{
"epoch": 3.1006211180124224,
"grad_norm": 2.035837411880493,
"learning_rate": 4.504347826086956e-05,
"loss": 0.4221,
"step": 12480
},
{
"epoch": 3.103105590062112,
"grad_norm": 8.264311790466309,
"learning_rate": 4.49192546583851e-05,
"loss": 0.6852,
"step": 12490
},
{
"epoch": 3.1055900621118013,
"grad_norm": 5.228878021240234,
"learning_rate": 4.479503105590062e-05,
"loss": 0.5009,
"step": 12500
},
{
"epoch": 3.1055900621118013,
"eval_accuracy": 0.8173017688990584,
"eval_loss": 0.6993664503097534,
"eval_runtime": 86.9481,
"eval_samples_per_second": 130.687,
"eval_steps_per_second": 16.343,
"step": 12500
},
{
"epoch": 3.108074534161491,
"grad_norm": 5.872660160064697,
"learning_rate": 4.467080745341615e-05,
"loss": 0.4279,
"step": 12510
},
{
"epoch": 3.1105590062111803,
"grad_norm": 2.8695497512817383,
"learning_rate": 4.4546583850931675e-05,
"loss": 0.4761,
"step": 12520
},
{
"epoch": 3.1130434782608694,
"grad_norm": 4.605323791503906,
"learning_rate": 4.442236024844721e-05,
"loss": 0.5106,
"step": 12530
},
{
"epoch": 3.115527950310559,
"grad_norm": 5.143415451049805,
"learning_rate": 4.4298136645962735e-05,
"loss": 0.5305,
"step": 12540
},
{
"epoch": 3.1180124223602483,
"grad_norm": 3.625460386276245,
"learning_rate": 4.4173913043478265e-05,
"loss": 0.7476,
"step": 12550
},
{
"epoch": 3.120496894409938,
"grad_norm": 4.011096954345703,
"learning_rate": 4.404968944099379e-05,
"loss": 0.543,
"step": 12560
},
{
"epoch": 3.1229813664596273,
"grad_norm": 7.04062032699585,
"learning_rate": 4.392546583850932e-05,
"loss": 0.5789,
"step": 12570
},
{
"epoch": 3.125465838509317,
"grad_norm": 7.262362003326416,
"learning_rate": 4.380124223602485e-05,
"loss": 0.6328,
"step": 12580
},
{
"epoch": 3.1279503105590063,
"grad_norm": 5.33003044128418,
"learning_rate": 4.367701863354037e-05,
"loss": 0.5202,
"step": 12590
},
{
"epoch": 3.130434782608696,
"grad_norm": 3.2615396976470947,
"learning_rate": 4.35527950310559e-05,
"loss": 0.4567,
"step": 12600
},
{
"epoch": 3.130434782608696,
"eval_accuracy": 0.8202939364604418,
"eval_loss": 0.6910972595214844,
"eval_runtime": 87.6801,
"eval_samples_per_second": 129.596,
"eval_steps_per_second": 16.207,
"step": 12600
},
{
"epoch": 3.1329192546583853,
"grad_norm": 5.849052906036377,
"learning_rate": 4.342857142857143e-05,
"loss": 0.6101,
"step": 12610
},
{
"epoch": 3.1354037267080743,
"grad_norm": 4.340888023376465,
"learning_rate": 4.330434782608696e-05,
"loss": 0.5785,
"step": 12620
},
{
"epoch": 3.137888198757764,
"grad_norm": 3.392591953277588,
"learning_rate": 4.3180124223602484e-05,
"loss": 0.5402,
"step": 12630
},
{
"epoch": 3.1403726708074533,
"grad_norm": 3.3317670822143555,
"learning_rate": 4.3055900621118014e-05,
"loss": 0.6271,
"step": 12640
},
{
"epoch": 3.142857142857143,
"grad_norm": 6.381196975708008,
"learning_rate": 4.2931677018633544e-05,
"loss": 0.3713,
"step": 12650
},
{
"epoch": 3.1453416149068323,
"grad_norm": 7.92520809173584,
"learning_rate": 4.280745341614907e-05,
"loss": 0.5309,
"step": 12660
},
{
"epoch": 3.1478260869565218,
"grad_norm": 3.4478583335876465,
"learning_rate": 4.26832298136646e-05,
"loss": 0.5995,
"step": 12670
},
{
"epoch": 3.1503105590062113,
"grad_norm": 8.44995403289795,
"learning_rate": 4.255900621118013e-05,
"loss": 0.5604,
"step": 12680
},
{
"epoch": 3.1527950310559008,
"grad_norm": 7.399325370788574,
"learning_rate": 4.2434782608695657e-05,
"loss": 0.685,
"step": 12690
},
{
"epoch": 3.1552795031055902,
"grad_norm": 9.787561416625977,
"learning_rate": 4.231055900621118e-05,
"loss": 0.4431,
"step": 12700
},
{
"epoch": 3.1552795031055902,
"eval_accuracy": 0.81923787732113,
"eval_loss": 0.6932592391967773,
"eval_runtime": 86.2789,
"eval_samples_per_second": 131.701,
"eval_steps_per_second": 16.47,
"step": 12700
},
{
"epoch": 3.1577639751552793,
"grad_norm": 7.563392639160156,
"learning_rate": 4.218633540372671e-05,
"loss": 0.4515,
"step": 12710
},
{
"epoch": 3.160248447204969,
"grad_norm": 2.8812592029571533,
"learning_rate": 4.206211180124224e-05,
"loss": 0.6153,
"step": 12720
},
{
"epoch": 3.1627329192546583,
"grad_norm": 4.970517158508301,
"learning_rate": 4.193788819875777e-05,
"loss": 0.5428,
"step": 12730
},
{
"epoch": 3.1652173913043478,
"grad_norm": 4.2496795654296875,
"learning_rate": 4.181366459627329e-05,
"loss": 0.5295,
"step": 12740
},
{
"epoch": 3.1677018633540373,
"grad_norm": 5.023710250854492,
"learning_rate": 4.168944099378882e-05,
"loss": 0.3807,
"step": 12750
},
{
"epoch": 3.1701863354037267,
"grad_norm": 3.99332594871521,
"learning_rate": 4.156521739130435e-05,
"loss": 0.3804,
"step": 12760
},
{
"epoch": 3.1726708074534162,
"grad_norm": 5.442420959472656,
"learning_rate": 4.1440993788819875e-05,
"loss": 0.4354,
"step": 12770
},
{
"epoch": 3.1751552795031057,
"grad_norm": 4.195496559143066,
"learning_rate": 4.1316770186335405e-05,
"loss": 0.4909,
"step": 12780
},
{
"epoch": 3.177639751552795,
"grad_norm": 4.506777286529541,
"learning_rate": 4.1192546583850935e-05,
"loss": 0.6455,
"step": 12790
},
{
"epoch": 3.1801242236024843,
"grad_norm": 8.970359802246094,
"learning_rate": 4.1068322981366465e-05,
"loss": 0.5915,
"step": 12800
},
{
"epoch": 3.1801242236024843,
"eval_accuracy": 0.8220540350259614,
"eval_loss": 0.6838474273681641,
"eval_runtime": 88.8487,
"eval_samples_per_second": 127.892,
"eval_steps_per_second": 15.993,
"step": 12800
},
{
"epoch": 3.1826086956521737,
"grad_norm": 8.059175491333008,
"learning_rate": 4.094409937888199e-05,
"loss": 0.5934,
"step": 12810
},
{
"epoch": 3.1850931677018632,
"grad_norm": 3.4588656425476074,
"learning_rate": 4.081987577639752e-05,
"loss": 0.5678,
"step": 12820
},
{
"epoch": 3.1875776397515527,
"grad_norm": 7.506095886230469,
"learning_rate": 4.069565217391305e-05,
"loss": 0.5356,
"step": 12830
},
{
"epoch": 3.190062111801242,
"grad_norm": 4.169441223144531,
"learning_rate": 4.057142857142857e-05,
"loss": 0.4775,
"step": 12840
},
{
"epoch": 3.1925465838509317,
"grad_norm": 4.875574111938477,
"learning_rate": 4.04472049689441e-05,
"loss": 0.4781,
"step": 12850
},
{
"epoch": 3.195031055900621,
"grad_norm": 5.139460563659668,
"learning_rate": 4.032298136645963e-05,
"loss": 0.6762,
"step": 12860
},
{
"epoch": 3.1975155279503107,
"grad_norm": 2.1224772930145264,
"learning_rate": 4.019875776397516e-05,
"loss": 0.4891,
"step": 12870
},
{
"epoch": 3.2,
"grad_norm": 2.8898327350616455,
"learning_rate": 4.0074534161490684e-05,
"loss": 0.4209,
"step": 12880
},
{
"epoch": 3.2024844720496892,
"grad_norm": 5.731484889984131,
"learning_rate": 3.9950310559006214e-05,
"loss": 0.5718,
"step": 12890
},
{
"epoch": 3.2049689440993787,
"grad_norm": 5.2934136390686035,
"learning_rate": 3.9826086956521744e-05,
"loss": 0.5551,
"step": 12900
},
{
"epoch": 3.2049689440993787,
"eval_accuracy": 0.8199419167473379,
"eval_loss": 0.6885837316513062,
"eval_runtime": 87.9526,
"eval_samples_per_second": 129.195,
"eval_steps_per_second": 16.156,
"step": 12900
},
{
"epoch": 3.207453416149068,
"grad_norm": 4.657090187072754,
"learning_rate": 3.970186335403727e-05,
"loss": 0.4785,
"step": 12910
},
{
"epoch": 3.2099378881987577,
"grad_norm": 7.804254531860352,
"learning_rate": 3.95776397515528e-05,
"loss": 0.7437,
"step": 12920
},
{
"epoch": 3.212422360248447,
"grad_norm": 2.897365093231201,
"learning_rate": 3.945341614906832e-05,
"loss": 0.4121,
"step": 12930
},
{
"epoch": 3.2149068322981367,
"grad_norm": 6.5088887214660645,
"learning_rate": 3.9329192546583857e-05,
"loss": 0.3793,
"step": 12940
},
{
"epoch": 3.217391304347826,
"grad_norm": 5.799808502197266,
"learning_rate": 3.920496894409938e-05,
"loss": 0.5948,
"step": 12950
},
{
"epoch": 3.2198757763975157,
"grad_norm": 2.5003743171691895,
"learning_rate": 3.908074534161491e-05,
"loss": 0.4539,
"step": 12960
},
{
"epoch": 3.222360248447205,
"grad_norm": 6.782368183135986,
"learning_rate": 3.895652173913043e-05,
"loss": 0.6168,
"step": 12970
},
{
"epoch": 3.224844720496894,
"grad_norm": 6.0730695724487305,
"learning_rate": 3.883229813664597e-05,
"loss": 0.7818,
"step": 12980
},
{
"epoch": 3.2273291925465837,
"grad_norm": 5.4586615562438965,
"learning_rate": 3.870807453416149e-05,
"loss": 0.3219,
"step": 12990
},
{
"epoch": 3.229813664596273,
"grad_norm": 5.29102087020874,
"learning_rate": 3.8583850931677016e-05,
"loss": 0.4528,
"step": 13000
},
{
"epoch": 3.229813664596273,
"eval_accuracy": 0.8211739857432017,
"eval_loss": 0.6882742047309875,
"eval_runtime": 86.885,
"eval_samples_per_second": 130.782,
"eval_steps_per_second": 16.355,
"step": 13000
},
{
"epoch": 3.2322981366459627,
"grad_norm": 9.615778923034668,
"learning_rate": 3.845962732919255e-05,
"loss": 0.7963,
"step": 13010
},
{
"epoch": 3.234782608695652,
"grad_norm": 6.507978439331055,
"learning_rate": 3.8335403726708075e-05,
"loss": 0.4032,
"step": 13020
},
{
"epoch": 3.2372670807453416,
"grad_norm": 7.837948322296143,
"learning_rate": 3.8211180124223605e-05,
"loss": 0.6404,
"step": 13030
},
{
"epoch": 3.239751552795031,
"grad_norm": 3.602900505065918,
"learning_rate": 3.808695652173913e-05,
"loss": 0.5245,
"step": 13040
},
{
"epoch": 3.2422360248447206,
"grad_norm": 5.966063976287842,
"learning_rate": 3.7962732919254665e-05,
"loss": 0.774,
"step": 13050
},
{
"epoch": 3.24472049689441,
"grad_norm": 4.69325065612793,
"learning_rate": 3.783850931677019e-05,
"loss": 0.5157,
"step": 13060
},
{
"epoch": 3.247204968944099,
"grad_norm": 6.513613700866699,
"learning_rate": 3.771428571428572e-05,
"loss": 0.5637,
"step": 13070
},
{
"epoch": 3.2496894409937886,
"grad_norm": 4.473712921142578,
"learning_rate": 3.759006211180124e-05,
"loss": 0.3706,
"step": 13080
},
{
"epoch": 3.252173913043478,
"grad_norm": 6.620151519775391,
"learning_rate": 3.746583850931677e-05,
"loss": 0.5956,
"step": 13090
},
{
"epoch": 3.2546583850931676,
"grad_norm": 6.897200584411621,
"learning_rate": 3.73416149068323e-05,
"loss": 0.5563,
"step": 13100
},
{
"epoch": 3.2546583850931676,
"eval_accuracy": 0.81923787732113,
"eval_loss": 0.6866790056228638,
"eval_runtime": 87.4328,
"eval_samples_per_second": 129.963,
"eval_steps_per_second": 16.252,
"step": 13100
},
{
"epoch": 3.257142857142857,
"grad_norm": 5.518016338348389,
"learning_rate": 3.7217391304347824e-05,
"loss": 0.4258,
"step": 13110
},
{
"epoch": 3.2596273291925466,
"grad_norm": 6.806578159332275,
"learning_rate": 3.7093167701863354e-05,
"loss": 0.5132,
"step": 13120
},
{
"epoch": 3.262111801242236,
"grad_norm": 1.4067715406417847,
"learning_rate": 3.6968944099378884e-05,
"loss": 0.4693,
"step": 13130
},
{
"epoch": 3.2645962732919256,
"grad_norm": 1.4255828857421875,
"learning_rate": 3.6844720496894414e-05,
"loss": 0.5003,
"step": 13140
},
{
"epoch": 3.267080745341615,
"grad_norm": 6.888153076171875,
"learning_rate": 3.672049689440994e-05,
"loss": 0.463,
"step": 13150
},
{
"epoch": 3.269565217391304,
"grad_norm": 6.642817974090576,
"learning_rate": 3.659627329192547e-05,
"loss": 0.4589,
"step": 13160
},
{
"epoch": 3.2720496894409936,
"grad_norm": 6.386394023895264,
"learning_rate": 3.6472049689441e-05,
"loss": 0.4738,
"step": 13170
},
{
"epoch": 3.274534161490683,
"grad_norm": 13.161245346069336,
"learning_rate": 3.634782608695652e-05,
"loss": 0.6596,
"step": 13180
},
{
"epoch": 3.2770186335403726,
"grad_norm": 11.36682415008545,
"learning_rate": 3.622360248447205e-05,
"loss": 0.7889,
"step": 13190
},
{
"epoch": 3.279503105590062,
"grad_norm": 2.1233813762664795,
"learning_rate": 3.609937888198758e-05,
"loss": 0.4836,
"step": 13200
},
{
"epoch": 3.279503105590062,
"eval_accuracy": 0.8253102173721728,
"eval_loss": 0.6771336793899536,
"eval_runtime": 86.9751,
"eval_samples_per_second": 130.647,
"eval_steps_per_second": 16.338,
"step": 13200
},
{
"epoch": 3.2819875776397516,
"grad_norm": 9.009103775024414,
"learning_rate": 3.597515527950311e-05,
"loss": 0.5785,
"step": 13210
},
{
"epoch": 3.284472049689441,
"grad_norm": 4.186812400817871,
"learning_rate": 3.585093167701863e-05,
"loss": 0.3961,
"step": 13220
},
{
"epoch": 3.2869565217391306,
"grad_norm": 4.9091901779174805,
"learning_rate": 3.572670807453416e-05,
"loss": 0.5125,
"step": 13230
},
{
"epoch": 3.28944099378882,
"grad_norm": 4.11280632019043,
"learning_rate": 3.560248447204969e-05,
"loss": 0.5678,
"step": 13240
},
{
"epoch": 3.291925465838509,
"grad_norm": 4.458592414855957,
"learning_rate": 3.5478260869565216e-05,
"loss": 0.4378,
"step": 13250
},
{
"epoch": 3.2944099378881986,
"grad_norm": 4.41200590133667,
"learning_rate": 3.5354037267080746e-05,
"loss": 0.4501,
"step": 13260
},
{
"epoch": 3.296894409937888,
"grad_norm": 9.820028305053711,
"learning_rate": 3.5229813664596275e-05,
"loss": 0.4385,
"step": 13270
},
{
"epoch": 3.2993788819875776,
"grad_norm": 6.210055351257324,
"learning_rate": 3.5105590062111805e-05,
"loss": 0.6382,
"step": 13280
},
{
"epoch": 3.301863354037267,
"grad_norm": 7.428834915161133,
"learning_rate": 3.498136645962733e-05,
"loss": 0.5374,
"step": 13290
},
{
"epoch": 3.3043478260869565,
"grad_norm": 2.4320147037506104,
"learning_rate": 3.485714285714286e-05,
"loss": 0.4535,
"step": 13300
},
{
"epoch": 3.3043478260869565,
"eval_accuracy": 0.8248701927307929,
"eval_loss": 0.6713078022003174,
"eval_runtime": 86.3323,
"eval_samples_per_second": 131.619,
"eval_steps_per_second": 16.46,
"step": 13300
},
{
"epoch": 3.306832298136646,
"grad_norm": 18.133155822753906,
"learning_rate": 3.473291925465839e-05,
"loss": 0.3095,
"step": 13310
},
{
"epoch": 3.3093167701863355,
"grad_norm": 6.6480393409729,
"learning_rate": 3.460869565217392e-05,
"loss": 0.3276,
"step": 13320
},
{
"epoch": 3.311801242236025,
"grad_norm": 5.606024265289307,
"learning_rate": 3.448447204968944e-05,
"loss": 0.5692,
"step": 13330
},
{
"epoch": 3.314285714285714,
"grad_norm": 3.627607822418213,
"learning_rate": 3.436024844720497e-05,
"loss": 0.5434,
"step": 13340
},
{
"epoch": 3.3167701863354035,
"grad_norm": 7.17358922958374,
"learning_rate": 3.42360248447205e-05,
"loss": 0.5071,
"step": 13350
},
{
"epoch": 3.319254658385093,
"grad_norm": 5.642586708068848,
"learning_rate": 3.4111801242236024e-05,
"loss": 0.4079,
"step": 13360
},
{
"epoch": 3.3217391304347825,
"grad_norm": 5.64650297164917,
"learning_rate": 3.3987577639751554e-05,
"loss": 0.434,
"step": 13370
},
{
"epoch": 3.324223602484472,
"grad_norm": 3.2044386863708496,
"learning_rate": 3.3863354037267084e-05,
"loss": 0.6493,
"step": 13380
},
{
"epoch": 3.3267080745341615,
"grad_norm": 3.279977321624756,
"learning_rate": 3.3739130434782614e-05,
"loss": 0.3453,
"step": 13390
},
{
"epoch": 3.329192546583851,
"grad_norm": 7.515082359313965,
"learning_rate": 3.361490683229814e-05,
"loss": 0.468,
"step": 13400
},
{
"epoch": 3.329192546583851,
"eval_accuracy": 0.8269823110094165,
"eval_loss": 0.6615992188453674,
"eval_runtime": 87.0347,
"eval_samples_per_second": 130.557,
"eval_steps_per_second": 16.327,
"step": 13400
},
{
"epoch": 3.3316770186335405,
"grad_norm": 1.8611090183258057,
"learning_rate": 3.349068322981367e-05,
"loss": 0.4831,
"step": 13410
},
{
"epoch": 3.33416149068323,
"grad_norm": 6.314669609069824,
"learning_rate": 3.33664596273292e-05,
"loss": 0.5625,
"step": 13420
},
{
"epoch": 3.336645962732919,
"grad_norm": 9.314018249511719,
"learning_rate": 3.324223602484472e-05,
"loss": 0.4882,
"step": 13430
},
{
"epoch": 3.3391304347826085,
"grad_norm": 6.195760726928711,
"learning_rate": 3.311801242236025e-05,
"loss": 0.505,
"step": 13440
},
{
"epoch": 3.341614906832298,
"grad_norm": 3.5561578273773193,
"learning_rate": 3.299378881987577e-05,
"loss": 0.485,
"step": 13450
},
{
"epoch": 3.3440993788819875,
"grad_norm": 8.28506088256836,
"learning_rate": 3.286956521739131e-05,
"loss": 0.5624,
"step": 13460
},
{
"epoch": 3.346583850931677,
"grad_norm": 3.2488527297973633,
"learning_rate": 3.274534161490683e-05,
"loss": 0.4358,
"step": 13470
},
{
"epoch": 3.3490683229813665,
"grad_norm": 1.8179543018341064,
"learning_rate": 3.262111801242236e-05,
"loss": 0.4578,
"step": 13480
},
{
"epoch": 3.351552795031056,
"grad_norm": 5.033318519592285,
"learning_rate": 3.249689440993789e-05,
"loss": 0.4818,
"step": 13490
},
{
"epoch": 3.3540372670807455,
"grad_norm": 7.270232200622559,
"learning_rate": 3.237267080745342e-05,
"loss": 0.4691,
"step": 13500
},
{
"epoch": 3.3540372670807455,
"eval_accuracy": 0.8261022617266567,
"eval_loss": 0.6706886291503906,
"eval_runtime": 87.6016,
"eval_samples_per_second": 129.712,
"eval_steps_per_second": 16.221,
"step": 13500
},
{
"epoch": 3.356521739130435,
"grad_norm": 4.949516773223877,
"learning_rate": 3.2248447204968946e-05,
"loss": 0.3803,
"step": 13510
},
{
"epoch": 3.359006211180124,
"grad_norm": 6.229318618774414,
"learning_rate": 3.212422360248447e-05,
"loss": 0.7245,
"step": 13520
},
{
"epoch": 3.3614906832298135,
"grad_norm": 5.414929389953613,
"learning_rate": 3.2000000000000005e-05,
"loss": 0.5406,
"step": 13530
},
{
"epoch": 3.363975155279503,
"grad_norm": 4.069797992706299,
"learning_rate": 3.187577639751553e-05,
"loss": 0.4012,
"step": 13540
},
{
"epoch": 3.3664596273291925,
"grad_norm": 5.728483200073242,
"learning_rate": 3.175155279503106e-05,
"loss": 0.5387,
"step": 13550
},
{
"epoch": 3.368944099378882,
"grad_norm": 3.4796948432922363,
"learning_rate": 3.162732919254658e-05,
"loss": 0.4261,
"step": 13560
},
{
"epoch": 3.3714285714285714,
"grad_norm": 8.10731029510498,
"learning_rate": 3.150310559006212e-05,
"loss": 0.5874,
"step": 13570
},
{
"epoch": 3.373913043478261,
"grad_norm": 5.234379291534424,
"learning_rate": 3.137888198757764e-05,
"loss": 0.5326,
"step": 13580
},
{
"epoch": 3.3763975155279504,
"grad_norm": 3.38866925239563,
"learning_rate": 3.125465838509317e-05,
"loss": 0.3288,
"step": 13590
},
{
"epoch": 3.37888198757764,
"grad_norm": 2.9035232067108154,
"learning_rate": 3.1130434782608694e-05,
"loss": 0.4784,
"step": 13600
},
{
"epoch": 3.37888198757764,
"eval_accuracy": 0.8240781483763091,
"eval_loss": 0.6732914447784424,
"eval_runtime": 86.5557,
"eval_samples_per_second": 131.28,
"eval_steps_per_second": 16.417,
"step": 13600
},
{
"epoch": 3.381366459627329,
"grad_norm": 4.350976467132568,
"learning_rate": 3.1006211180124224e-05,
"loss": 0.3132,
"step": 13610
},
{
"epoch": 3.3838509316770184,
"grad_norm": 3.3074676990509033,
"learning_rate": 3.0881987577639754e-05,
"loss": 0.5839,
"step": 13620
},
{
"epoch": 3.386335403726708,
"grad_norm": 2.9822394847869873,
"learning_rate": 3.075776397515528e-05,
"loss": 0.4328,
"step": 13630
},
{
"epoch": 3.3888198757763974,
"grad_norm": 3.2798781394958496,
"learning_rate": 3.063354037267081e-05,
"loss": 0.3691,
"step": 13640
},
{
"epoch": 3.391304347826087,
"grad_norm": 6.1266279220581055,
"learning_rate": 3.0509316770186337e-05,
"loss": 0.4765,
"step": 13650
},
{
"epoch": 3.3937888198757764,
"grad_norm": 5.225902080535889,
"learning_rate": 3.0385093167701867e-05,
"loss": 0.5248,
"step": 13660
},
{
"epoch": 3.396273291925466,
"grad_norm": 3.3516387939453125,
"learning_rate": 3.0260869565217393e-05,
"loss": 0.7746,
"step": 13670
},
{
"epoch": 3.3987577639751554,
"grad_norm": 5.730987071990967,
"learning_rate": 3.0136645962732923e-05,
"loss": 0.5716,
"step": 13680
},
{
"epoch": 3.401242236024845,
"grad_norm": 7.150260925292969,
"learning_rate": 3.001242236024845e-05,
"loss": 0.461,
"step": 13690
},
{
"epoch": 3.403726708074534,
"grad_norm": 5.765717029571533,
"learning_rate": 2.9888198757763973e-05,
"loss": 0.5187,
"step": 13700
},
{
"epoch": 3.403726708074534,
"eval_accuracy": 0.8251342075156208,
"eval_loss": 0.6657703518867493,
"eval_runtime": 86.2323,
"eval_samples_per_second": 131.772,
"eval_steps_per_second": 16.479,
"step": 13700
},
{
"epoch": 3.4062111801242234,
"grad_norm": 3.005549907684326,
"learning_rate": 2.9763975155279506e-05,
"loss": 0.5749,
"step": 13710
},
{
"epoch": 3.408695652173913,
"grad_norm": 8.730533599853516,
"learning_rate": 2.963975155279503e-05,
"loss": 0.6285,
"step": 13720
},
{
"epoch": 3.4111801242236024,
"grad_norm": 2.9770872592926025,
"learning_rate": 2.9515527950310563e-05,
"loss": 0.7003,
"step": 13730
},
{
"epoch": 3.413664596273292,
"grad_norm": 4.815559387207031,
"learning_rate": 2.939130434782609e-05,
"loss": 0.5325,
"step": 13740
},
{
"epoch": 3.4161490683229814,
"grad_norm": 4.2376298904418945,
"learning_rate": 2.926708074534162e-05,
"loss": 0.572,
"step": 13750
},
{
"epoch": 3.418633540372671,
"grad_norm": 5.942477226257324,
"learning_rate": 2.9142857142857146e-05,
"loss": 0.6795,
"step": 13760
},
{
"epoch": 3.4211180124223604,
"grad_norm": 5.977138042449951,
"learning_rate": 2.901863354037267e-05,
"loss": 0.4785,
"step": 13770
},
{
"epoch": 3.42360248447205,
"grad_norm": 3.4962573051452637,
"learning_rate": 2.8894409937888202e-05,
"loss": 0.4012,
"step": 13780
},
{
"epoch": 3.426086956521739,
"grad_norm": 0.6948124766349792,
"learning_rate": 2.8770186335403725e-05,
"loss": 0.5582,
"step": 13790
},
{
"epoch": 3.4285714285714284,
"grad_norm": 7.217972755432129,
"learning_rate": 2.864596273291926e-05,
"loss": 0.5105,
"step": 13800
},
{
"epoch": 3.4285714285714284,
"eval_accuracy": 0.8275103405790725,
"eval_loss": 0.6631360650062561,
"eval_runtime": 87.0123,
"eval_samples_per_second": 130.591,
"eval_steps_per_second": 16.331,
"step": 13800
},
{
"epoch": 3.431055900621118,
"grad_norm": 5.591545104980469,
"learning_rate": 2.852173913043478e-05,
"loss": 0.5408,
"step": 13810
},
{
"epoch": 3.4335403726708074,
"grad_norm": 5.493480682373047,
"learning_rate": 2.8397515527950315e-05,
"loss": 0.5014,
"step": 13820
},
{
"epoch": 3.436024844720497,
"grad_norm": 6.324045658111572,
"learning_rate": 2.8273291925465838e-05,
"loss": 0.5761,
"step": 13830
},
{
"epoch": 3.4385093167701863,
"grad_norm": 4.297603130340576,
"learning_rate": 2.814906832298137e-05,
"loss": 0.4817,
"step": 13840
},
{
"epoch": 3.440993788819876,
"grad_norm": 4.620813369750977,
"learning_rate": 2.8024844720496894e-05,
"loss": 0.4831,
"step": 13850
},
{
"epoch": 3.4434782608695653,
"grad_norm": 4.357455730438232,
"learning_rate": 2.790062111801242e-05,
"loss": 0.5194,
"step": 13860
},
{
"epoch": 3.445962732919255,
"grad_norm": 6.38654088973999,
"learning_rate": 2.777639751552795e-05,
"loss": 0.4436,
"step": 13870
},
{
"epoch": 3.448447204968944,
"grad_norm": 5.826173305511475,
"learning_rate": 2.7652173913043477e-05,
"loss": 0.4366,
"step": 13880
},
{
"epoch": 3.4509316770186333,
"grad_norm": 6.082293510437012,
"learning_rate": 2.7527950310559007e-05,
"loss": 0.4897,
"step": 13890
},
{
"epoch": 3.453416149068323,
"grad_norm": 6.084004878997803,
"learning_rate": 2.7416149068322983e-05,
"loss": 0.3935,
"step": 13900
},
{
"epoch": 3.453416149068323,
"eval_accuracy": 0.8283023849335562,
"eval_loss": 0.6656120419502258,
"eval_runtime": 85.6523,
"eval_samples_per_second": 132.664,
"eval_steps_per_second": 16.59,
"step": 13900
},
{
"epoch": 3.4559006211180123,
"grad_norm": 6.510132789611816,
"learning_rate": 2.729192546583851e-05,
"loss": 0.4582,
"step": 13910
},
{
"epoch": 3.458385093167702,
"grad_norm": 6.053948402404785,
"learning_rate": 2.716770186335404e-05,
"loss": 0.653,
"step": 13920
},
{
"epoch": 3.4608695652173913,
"grad_norm": 3.9080560207366943,
"learning_rate": 2.7043478260869566e-05,
"loss": 0.6322,
"step": 13930
},
{
"epoch": 3.463354037267081,
"grad_norm": 2.829498052597046,
"learning_rate": 2.6919254658385095e-05,
"loss": 0.3978,
"step": 13940
},
{
"epoch": 3.4658385093167703,
"grad_norm": 4.029519557952881,
"learning_rate": 2.6795031055900622e-05,
"loss": 0.3532,
"step": 13950
},
{
"epoch": 3.46832298136646,
"grad_norm": 8.106303215026855,
"learning_rate": 2.6670807453416152e-05,
"loss": 0.5056,
"step": 13960
},
{
"epoch": 3.470807453416149,
"grad_norm": 9.305558204650879,
"learning_rate": 2.654658385093168e-05,
"loss": 0.6274,
"step": 13970
},
{
"epoch": 3.4732919254658388,
"grad_norm": 6.586569786071777,
"learning_rate": 2.6422360248447208e-05,
"loss": 0.524,
"step": 13980
},
{
"epoch": 3.475776397515528,
"grad_norm": 4.757368087768555,
"learning_rate": 2.6298136645962735e-05,
"loss": 0.5058,
"step": 13990
},
{
"epoch": 3.4782608695652173,
"grad_norm": 6.857468128204346,
"learning_rate": 2.617391304347826e-05,
"loss": 0.463,
"step": 14000
},
{
"epoch": 3.4782608695652173,
"eval_accuracy": 0.830062483499076,
"eval_loss": 0.655392050743103,
"eval_runtime": 86.7827,
"eval_samples_per_second": 130.936,
"eval_steps_per_second": 16.374,
"step": 14000
},
{
"epoch": 3.480745341614907,
"grad_norm": 6.986089706420898,
"learning_rate": 2.604968944099379e-05,
"loss": 0.5948,
"step": 14010
},
{
"epoch": 3.4832298136645963,
"grad_norm": 7.034180641174316,
"learning_rate": 2.5925465838509318e-05,
"loss": 0.4492,
"step": 14020
},
{
"epoch": 3.4857142857142858,
"grad_norm": 2.2844438552856445,
"learning_rate": 2.5801242236024848e-05,
"loss": 0.4341,
"step": 14030
},
{
"epoch": 3.4881987577639753,
"grad_norm": 6.129580974578857,
"learning_rate": 2.5677018633540374e-05,
"loss": 0.4957,
"step": 14040
},
{
"epoch": 3.4906832298136647,
"grad_norm": 4.148270130157471,
"learning_rate": 2.5552795031055904e-05,
"loss": 0.4501,
"step": 14050
},
{
"epoch": 3.493167701863354,
"grad_norm": 8.753642082214355,
"learning_rate": 2.542857142857143e-05,
"loss": 0.7113,
"step": 14060
},
{
"epoch": 3.4956521739130437,
"grad_norm": 7.5100321769714355,
"learning_rate": 2.530434782608696e-05,
"loss": 0.4538,
"step": 14070
},
{
"epoch": 3.4981366459627328,
"grad_norm": 4.834388256072998,
"learning_rate": 2.5180124223602487e-05,
"loss": 0.429,
"step": 14080
},
{
"epoch": 3.5006211180124223,
"grad_norm": 3.708731174468994,
"learning_rate": 2.505590062111801e-05,
"loss": 0.4318,
"step": 14090
},
{
"epoch": 3.5031055900621118,
"grad_norm": 7.761505603790283,
"learning_rate": 2.4931677018633543e-05,
"loss": 0.3259,
"step": 14100
},
{
"epoch": 3.5031055900621118,
"eval_accuracy": 0.8291824342163161,
"eval_loss": 0.6640006899833679,
"eval_runtime": 85.8522,
"eval_samples_per_second": 132.355,
"eval_steps_per_second": 16.552,
"step": 14100
},
{
"epoch": 3.5055900621118012,
"grad_norm": 5.576478004455566,
"learning_rate": 2.480745341614907e-05,
"loss": 0.6021,
"step": 14110
},
{
"epoch": 3.5080745341614907,
"grad_norm": 2.4706974029541016,
"learning_rate": 2.4683229813664596e-05,
"loss": 0.3856,
"step": 14120
},
{
"epoch": 3.51055900621118,
"grad_norm": 1.1442434787750244,
"learning_rate": 2.4559006211180123e-05,
"loss": 0.6106,
"step": 14130
},
{
"epoch": 3.5130434782608697,
"grad_norm": 3.042475700378418,
"learning_rate": 2.4434782608695653e-05,
"loss": 0.4711,
"step": 14140
},
{
"epoch": 3.5155279503105588,
"grad_norm": 4.92565393447876,
"learning_rate": 2.4310559006211183e-05,
"loss": 0.6123,
"step": 14150
},
{
"epoch": 3.5180124223602487,
"grad_norm": 8.960134506225586,
"learning_rate": 2.418633540372671e-05,
"loss": 0.642,
"step": 14160
},
{
"epoch": 3.5204968944099377,
"grad_norm": 8.679351806640625,
"learning_rate": 2.406211180124224e-05,
"loss": 0.5592,
"step": 14170
},
{
"epoch": 3.5229813664596272,
"grad_norm": 10.795132637023926,
"learning_rate": 2.3937888198757766e-05,
"loss": 0.6998,
"step": 14180
},
{
"epoch": 3.5254658385093167,
"grad_norm": 3.723322629928589,
"learning_rate": 2.3813664596273295e-05,
"loss": 0.441,
"step": 14190
},
{
"epoch": 3.527950310559006,
"grad_norm": 5.73036003112793,
"learning_rate": 2.3689440993788822e-05,
"loss": 0.7286,
"step": 14200
},
{
"epoch": 3.527950310559006,
"eval_accuracy": 0.8307665229252839,
"eval_loss": 0.6500012278556824,
"eval_runtime": 86.0008,
"eval_samples_per_second": 132.127,
"eval_steps_per_second": 16.523,
"step": 14200
},
{
"epoch": 3.5304347826086957,
"grad_norm": 6.265992164611816,
"learning_rate": 2.356521739130435e-05,
"loss": 0.3616,
"step": 14210
},
{
"epoch": 3.532919254658385,
"grad_norm": 2.9732041358947754,
"learning_rate": 2.3440993788819875e-05,
"loss": 0.5564,
"step": 14220
},
{
"epoch": 3.5354037267080747,
"grad_norm": 4.713552474975586,
"learning_rate": 2.3316770186335405e-05,
"loss": 0.5345,
"step": 14230
},
{
"epoch": 3.5378881987577637,
"grad_norm": 3.708615779876709,
"learning_rate": 2.319254658385093e-05,
"loss": 0.383,
"step": 14240
},
{
"epoch": 3.5403726708074537,
"grad_norm": 3.2620787620544434,
"learning_rate": 2.306832298136646e-05,
"loss": 0.4484,
"step": 14250
},
{
"epoch": 3.5428571428571427,
"grad_norm": 4.0385823249816895,
"learning_rate": 2.2944099378881988e-05,
"loss": 0.4152,
"step": 14260
},
{
"epoch": 3.545341614906832,
"grad_norm": 5.182163238525391,
"learning_rate": 2.2819875776397518e-05,
"loss": 0.5693,
"step": 14270
},
{
"epoch": 3.5478260869565217,
"grad_norm": 4.178833961486816,
"learning_rate": 2.2695652173913044e-05,
"loss": 0.5311,
"step": 14280
},
{
"epoch": 3.550310559006211,
"grad_norm": 8.150431632995605,
"learning_rate": 2.257142857142857e-05,
"loss": 0.5083,
"step": 14290
},
{
"epoch": 3.5527950310559007,
"grad_norm": 6.455306053161621,
"learning_rate": 2.24472049689441e-05,
"loss": 0.4422,
"step": 14300
},
{
"epoch": 3.5527950310559007,
"eval_accuracy": 0.8312945524949397,
"eval_loss": 0.6539793014526367,
"eval_runtime": 85.8492,
"eval_samples_per_second": 132.36,
"eval_steps_per_second": 16.552,
"step": 14300
},
{
"epoch": 3.55527950310559,
"grad_norm": 5.034562110900879,
"learning_rate": 2.2322981366459627e-05,
"loss": 0.5845,
"step": 14310
},
{
"epoch": 3.5577639751552796,
"grad_norm": 0.6601377129554749,
"learning_rate": 2.2198757763975157e-05,
"loss": 0.3904,
"step": 14320
},
{
"epoch": 3.5602484472049687,
"grad_norm": 13.989871978759766,
"learning_rate": 2.2074534161490684e-05,
"loss": 0.5033,
"step": 14330
},
{
"epoch": 3.5627329192546586,
"grad_norm": 2.3294808864593506,
"learning_rate": 2.1950310559006213e-05,
"loss": 0.436,
"step": 14340
},
{
"epoch": 3.5652173913043477,
"grad_norm": 2.7858335971832275,
"learning_rate": 2.182608695652174e-05,
"loss": 0.5116,
"step": 14350
},
{
"epoch": 3.567701863354037,
"grad_norm": 6.121773719787598,
"learning_rate": 2.170186335403727e-05,
"loss": 0.3615,
"step": 14360
},
{
"epoch": 3.5701863354037267,
"grad_norm": 3.8832411766052246,
"learning_rate": 2.1577639751552796e-05,
"loss": 0.4784,
"step": 14370
},
{
"epoch": 3.572670807453416,
"grad_norm": 6.1436591148376465,
"learning_rate": 2.1453416149068323e-05,
"loss": 0.387,
"step": 14380
},
{
"epoch": 3.5751552795031056,
"grad_norm": 5.157639026641846,
"learning_rate": 2.132919254658385e-05,
"loss": 0.5088,
"step": 14390
},
{
"epoch": 3.577639751552795,
"grad_norm": 3.7850217819213867,
"learning_rate": 2.120496894409938e-05,
"loss": 0.4374,
"step": 14400
},
{
"epoch": 3.577639751552795,
"eval_accuracy": 0.8317345771363196,
"eval_loss": 0.6497304439544678,
"eval_runtime": 85.1252,
"eval_samples_per_second": 133.486,
"eval_steps_per_second": 16.693,
"step": 14400
},
{
"epoch": 3.5801242236024846,
"grad_norm": 3.594571113586426,
"learning_rate": 2.108074534161491e-05,
"loss": 0.6101,
"step": 14410
},
{
"epoch": 3.5826086956521737,
"grad_norm": 4.151157855987549,
"learning_rate": 2.0956521739130436e-05,
"loss": 0.5851,
"step": 14420
},
{
"epoch": 3.5850931677018636,
"grad_norm": 9.117693901062012,
"learning_rate": 2.0832298136645966e-05,
"loss": 0.3478,
"step": 14430
},
{
"epoch": 3.5875776397515526,
"grad_norm": 4.291843414306641,
"learning_rate": 2.0708074534161492e-05,
"loss": 0.3923,
"step": 14440
},
{
"epoch": 3.590062111801242,
"grad_norm": 6.3122358322143555,
"learning_rate": 2.0583850931677022e-05,
"loss": 0.4025,
"step": 14450
},
{
"epoch": 3.5925465838509316,
"grad_norm": 8.162814140319824,
"learning_rate": 2.045962732919255e-05,
"loss": 0.489,
"step": 14460
},
{
"epoch": 3.595031055900621,
"grad_norm": 7.5478057861328125,
"learning_rate": 2.0335403726708075e-05,
"loss": 0.5294,
"step": 14470
},
{
"epoch": 3.5975155279503106,
"grad_norm": 7.7503862380981445,
"learning_rate": 2.02111801242236e-05,
"loss": 0.7006,
"step": 14480
},
{
"epoch": 3.6,
"grad_norm": 4.4560956954956055,
"learning_rate": 2.008695652173913e-05,
"loss": 0.4768,
"step": 14490
},
{
"epoch": 3.6024844720496896,
"grad_norm": 12.04161548614502,
"learning_rate": 1.9962732919254658e-05,
"loss": 0.7962,
"step": 14500
},
{
"epoch": 3.6024844720496896,
"eval_accuracy": 0.8340227052714952,
"eval_loss": 0.6416128873825073,
"eval_runtime": 85.9635,
"eval_samples_per_second": 132.184,
"eval_steps_per_second": 16.53,
"step": 14500
},
{
"epoch": 3.6049689440993786,
"grad_norm": 4.408351898193359,
"learning_rate": 1.9838509316770188e-05,
"loss": 0.6468,
"step": 14510
},
{
"epoch": 3.6074534161490686,
"grad_norm": 2.5475428104400635,
"learning_rate": 1.9714285714285714e-05,
"loss": 0.5066,
"step": 14520
},
{
"epoch": 3.6099378881987576,
"grad_norm": 2.807896852493286,
"learning_rate": 1.9590062111801244e-05,
"loss": 0.5552,
"step": 14530
},
{
"epoch": 3.612422360248447,
"grad_norm": 9.001070976257324,
"learning_rate": 1.946583850931677e-05,
"loss": 0.5289,
"step": 14540
},
{
"epoch": 3.6149068322981366,
"grad_norm": 3.7283670902252197,
"learning_rate": 1.9341614906832297e-05,
"loss": 0.3566,
"step": 14550
},
{
"epoch": 3.617391304347826,
"grad_norm": 3.9144983291625977,
"learning_rate": 1.9217391304347827e-05,
"loss": 0.5467,
"step": 14560
},
{
"epoch": 3.6198757763975156,
"grad_norm": 3.974045515060425,
"learning_rate": 1.9093167701863354e-05,
"loss": 0.4297,
"step": 14570
},
{
"epoch": 3.622360248447205,
"grad_norm": 3.520359516143799,
"learning_rate": 1.8968944099378884e-05,
"loss": 0.4779,
"step": 14580
},
{
"epoch": 3.6248447204968945,
"grad_norm": 5.024179935455322,
"learning_rate": 1.884472049689441e-05,
"loss": 0.4766,
"step": 14590
},
{
"epoch": 3.6273291925465836,
"grad_norm": 5.152400493621826,
"learning_rate": 1.872049689440994e-05,
"loss": 0.6297,
"step": 14600
},
{
"epoch": 3.6273291925465836,
"eval_accuracy": 0.8339347003432193,
"eval_loss": 0.6392886638641357,
"eval_runtime": 85.5369,
"eval_samples_per_second": 132.843,
"eval_steps_per_second": 16.613,
"step": 14600
},
{
"epoch": 3.6298136645962735,
"grad_norm": 0.8217100501060486,
"learning_rate": 1.8596273291925466e-05,
"loss": 0.5714,
"step": 14610
},
{
"epoch": 3.6322981366459626,
"grad_norm": 6.355893611907959,
"learning_rate": 1.8472049689440996e-05,
"loss": 0.4674,
"step": 14620
},
{
"epoch": 3.634782608695652,
"grad_norm": 5.964326858520508,
"learning_rate": 1.8347826086956523e-05,
"loss": 0.6098,
"step": 14630
},
{
"epoch": 3.6372670807453416,
"grad_norm": 2.0514612197875977,
"learning_rate": 1.822360248447205e-05,
"loss": 0.5456,
"step": 14640
},
{
"epoch": 3.639751552795031,
"grad_norm": 3.857182025909424,
"learning_rate": 1.809937888198758e-05,
"loss": 0.5245,
"step": 14650
},
{
"epoch": 3.6422360248447205,
"grad_norm": 6.316091537475586,
"learning_rate": 1.7975155279503106e-05,
"loss": 0.6184,
"step": 14660
},
{
"epoch": 3.64472049689441,
"grad_norm": 11.116755485534668,
"learning_rate": 1.7850931677018636e-05,
"loss": 0.4855,
"step": 14670
},
{
"epoch": 3.6472049689440995,
"grad_norm": 0.28117311000823975,
"learning_rate": 1.7726708074534162e-05,
"loss": 0.4544,
"step": 14680
},
{
"epoch": 3.6496894409937886,
"grad_norm": 7.566733360290527,
"learning_rate": 1.7602484472049692e-05,
"loss": 0.2681,
"step": 14690
},
{
"epoch": 3.6521739130434785,
"grad_norm": 2.6107754707336426,
"learning_rate": 1.747826086956522e-05,
"loss": 0.4933,
"step": 14700
},
{
"epoch": 3.6521739130434785,
"eval_accuracy": 0.8335826806301153,
"eval_loss": 0.6379285454750061,
"eval_runtime": 86.7538,
"eval_samples_per_second": 130.98,
"eval_steps_per_second": 16.38,
"step": 14700
},
{
"epoch": 3.6546583850931675,
"grad_norm": 2.6673498153686523,
"learning_rate": 1.735403726708075e-05,
"loss": 0.4378,
"step": 14710
},
{
"epoch": 3.657142857142857,
"grad_norm": 2.3931283950805664,
"learning_rate": 1.7229813664596275e-05,
"loss": 0.3868,
"step": 14720
},
{
"epoch": 3.6596273291925465,
"grad_norm": 4.458917617797852,
"learning_rate": 1.71055900621118e-05,
"loss": 0.4633,
"step": 14730
},
{
"epoch": 3.662111801242236,
"grad_norm": 5.459697246551514,
"learning_rate": 1.6981366459627328e-05,
"loss": 0.5051,
"step": 14740
},
{
"epoch": 3.6645962732919255,
"grad_norm": 3.741152763366699,
"learning_rate": 1.6857142857142858e-05,
"loss": 0.5956,
"step": 14750
},
{
"epoch": 3.667080745341615,
"grad_norm": 13.998597145080566,
"learning_rate": 1.6732919254658384e-05,
"loss": 0.4515,
"step": 14760
},
{
"epoch": 3.6695652173913045,
"grad_norm": 4.710552215576172,
"learning_rate": 1.6608695652173914e-05,
"loss": 0.5572,
"step": 14770
},
{
"epoch": 3.6720496894409935,
"grad_norm": 8.206193923950195,
"learning_rate": 1.648447204968944e-05,
"loss": 0.4481,
"step": 14780
},
{
"epoch": 3.6745341614906835,
"grad_norm": 6.1793012619018555,
"learning_rate": 1.636024844720497e-05,
"loss": 0.4568,
"step": 14790
},
{
"epoch": 3.6770186335403725,
"grad_norm": 8.518237113952637,
"learning_rate": 1.6236024844720497e-05,
"loss": 0.5548,
"step": 14800
},
{
"epoch": 3.6770186335403725,
"eval_accuracy": 0.8356067939804629,
"eval_loss": 0.6300323009490967,
"eval_runtime": 86.6878,
"eval_samples_per_second": 131.08,
"eval_steps_per_second": 16.392,
"step": 14800
},
{
"epoch": 3.679503105590062,
"grad_norm": 8.760847091674805,
"learning_rate": 1.6111801242236024e-05,
"loss": 0.6173,
"step": 14810
},
{
"epoch": 3.6819875776397515,
"grad_norm": 4.6929802894592285,
"learning_rate": 1.5987577639751554e-05,
"loss": 0.5821,
"step": 14820
},
{
"epoch": 3.684472049689441,
"grad_norm": 7.2983927726745605,
"learning_rate": 1.586335403726708e-05,
"loss": 0.5957,
"step": 14830
},
{
"epoch": 3.6869565217391305,
"grad_norm": 8.686875343322754,
"learning_rate": 1.573913043478261e-05,
"loss": 0.4733,
"step": 14840
},
{
"epoch": 3.68944099378882,
"grad_norm": 3.881749153137207,
"learning_rate": 1.5614906832298137e-05,
"loss": 0.3509,
"step": 14850
},
{
"epoch": 3.6919254658385094,
"grad_norm": 5.879938125610352,
"learning_rate": 1.5490683229813666e-05,
"loss": 0.4898,
"step": 14860
},
{
"epoch": 3.6944099378881985,
"grad_norm": 2.1531667709350586,
"learning_rate": 1.5366459627329193e-05,
"loss": 0.5043,
"step": 14870
},
{
"epoch": 3.6968944099378884,
"grad_norm": 4.413904190063477,
"learning_rate": 1.5254658385093168e-05,
"loss": 0.5069,
"step": 14880
},
{
"epoch": 3.6993788819875775,
"grad_norm": 5.015860557556152,
"learning_rate": 1.5130434782608697e-05,
"loss": 0.6092,
"step": 14890
},
{
"epoch": 3.701863354037267,
"grad_norm": 7.194756984710693,
"learning_rate": 1.5006211180124225e-05,
"loss": 0.564,
"step": 14900
},
{
"epoch": 3.701863354037267,
"eval_accuracy": 0.835166769339083,
"eval_loss": 0.6283601522445679,
"eval_runtime": 85.4479,
"eval_samples_per_second": 132.982,
"eval_steps_per_second": 16.63,
"step": 14900
},
{
"epoch": 3.7043478260869565,
"grad_norm": 1.7463475465774536,
"learning_rate": 1.4881987577639753e-05,
"loss": 0.5327,
"step": 14910
},
{
"epoch": 3.706832298136646,
"grad_norm": 2.530923366546631,
"learning_rate": 1.4757763975155281e-05,
"loss": 0.3879,
"step": 14920
},
{
"epoch": 3.7093167701863354,
"grad_norm": 5.713317394256592,
"learning_rate": 1.463354037267081e-05,
"loss": 0.637,
"step": 14930
},
{
"epoch": 3.711801242236025,
"grad_norm": 5.655239582061768,
"learning_rate": 1.4509316770186334e-05,
"loss": 0.2572,
"step": 14940
},
{
"epoch": 3.7142857142857144,
"grad_norm": 3.9437196254730225,
"learning_rate": 1.4385093167701863e-05,
"loss": 0.4977,
"step": 14950
},
{
"epoch": 3.7167701863354035,
"grad_norm": 4.147866249084473,
"learning_rate": 1.426086956521739e-05,
"loss": 0.5557,
"step": 14960
},
{
"epoch": 3.7192546583850934,
"grad_norm": 9.1124906539917,
"learning_rate": 1.4136645962732919e-05,
"loss": 0.5664,
"step": 14970
},
{
"epoch": 3.7217391304347824,
"grad_norm": 6.563503265380859,
"learning_rate": 1.4012422360248447e-05,
"loss": 0.5156,
"step": 14980
},
{
"epoch": 3.724223602484472,
"grad_norm": 2.749929666519165,
"learning_rate": 1.3888198757763975e-05,
"loss": 0.3662,
"step": 14990
},
{
"epoch": 3.7267080745341614,
"grad_norm": 5.506071090698242,
"learning_rate": 1.3763975155279504e-05,
"loss": 0.2638,
"step": 15000
},
{
"epoch": 3.7267080745341614,
"eval_accuracy": 0.8337586904866673,
"eval_loss": 0.6299127340316772,
"eval_runtime": 85.7269,
"eval_samples_per_second": 132.549,
"eval_steps_per_second": 16.576,
"step": 15000
},
{
"epoch": 3.729192546583851,
"grad_norm": 4.335992336273193,
"learning_rate": 1.3639751552795032e-05,
"loss": 0.4352,
"step": 15010
},
{
"epoch": 3.7316770186335404,
"grad_norm": 5.460691928863525,
"learning_rate": 1.3515527950310562e-05,
"loss": 0.4618,
"step": 15020
},
{
"epoch": 3.73416149068323,
"grad_norm": 9.748331069946289,
"learning_rate": 1.3391304347826086e-05,
"loss": 0.5894,
"step": 15030
},
{
"epoch": 3.7366459627329194,
"grad_norm": 6.729307651519775,
"learning_rate": 1.3267080745341615e-05,
"loss": 0.5808,
"step": 15040
},
{
"epoch": 3.7391304347826084,
"grad_norm": 4.958307266235352,
"learning_rate": 1.3142857142857143e-05,
"loss": 0.4049,
"step": 15050
},
{
"epoch": 3.7416149068322984,
"grad_norm": 4.747241497039795,
"learning_rate": 1.3018633540372671e-05,
"loss": 0.3638,
"step": 15060
},
{
"epoch": 3.7440993788819874,
"grad_norm": 4.579631328582764,
"learning_rate": 1.28944099378882e-05,
"loss": 0.6736,
"step": 15070
},
{
"epoch": 3.746583850931677,
"grad_norm": 4.091526985168457,
"learning_rate": 1.2770186335403727e-05,
"loss": 0.4804,
"step": 15080
},
{
"epoch": 3.7490683229813664,
"grad_norm": 5.306528568267822,
"learning_rate": 1.2645962732919256e-05,
"loss": 0.3247,
"step": 15090
},
{
"epoch": 3.751552795031056,
"grad_norm": 4.789366722106934,
"learning_rate": 1.2521739130434784e-05,
"loss": 0.6129,
"step": 15100
},
{
"epoch": 3.751552795031056,
"eval_accuracy": 0.8373668925459826,
"eval_loss": 0.6253156661987305,
"eval_runtime": 85.345,
"eval_samples_per_second": 133.142,
"eval_steps_per_second": 16.65,
"step": 15100
},
{
"epoch": 3.7540372670807454,
"grad_norm": 4.639571189880371,
"learning_rate": 1.239751552795031e-05,
"loss": 0.5289,
"step": 15110
},
{
"epoch": 3.756521739130435,
"grad_norm": 5.007940292358398,
"learning_rate": 1.2273291925465839e-05,
"loss": 0.4025,
"step": 15120
},
{
"epoch": 3.7590062111801243,
"grad_norm": 9.492412567138672,
"learning_rate": 1.2149068322981367e-05,
"loss": 0.465,
"step": 15130
},
{
"epoch": 3.7614906832298134,
"grad_norm": 5.330755710601807,
"learning_rate": 1.2024844720496895e-05,
"loss": 0.4507,
"step": 15140
},
{
"epoch": 3.7639751552795033,
"grad_norm": 6.425350666046143,
"learning_rate": 1.1900621118012423e-05,
"loss": 0.4656,
"step": 15150
},
{
"epoch": 3.7664596273291924,
"grad_norm": 5.325112819671631,
"learning_rate": 1.1776397515527951e-05,
"loss": 0.4524,
"step": 15160
},
{
"epoch": 3.768944099378882,
"grad_norm": 5.342360973358154,
"learning_rate": 1.165217391304348e-05,
"loss": 0.4891,
"step": 15170
},
{
"epoch": 3.7714285714285714,
"grad_norm": 4.091293811798096,
"learning_rate": 1.1527950310559006e-05,
"loss": 0.5008,
"step": 15180
},
{
"epoch": 3.773913043478261,
"grad_norm": 7.995913505554199,
"learning_rate": 1.1403726708074534e-05,
"loss": 0.7318,
"step": 15190
},
{
"epoch": 3.7763975155279503,
"grad_norm": 5.437656402587891,
"learning_rate": 1.1279503105590063e-05,
"loss": 0.51,
"step": 15200
},
{
"epoch": 3.7763975155279503,
"eval_accuracy": 0.8389509812549503,
"eval_loss": 0.6205056309700012,
"eval_runtime": 85.0149,
"eval_samples_per_second": 133.659,
"eval_steps_per_second": 16.715,
"step": 15200
},
{
"epoch": 3.77888198757764,
"grad_norm": 3.89784574508667,
"learning_rate": 1.115527950310559e-05,
"loss": 0.3896,
"step": 15210
},
{
"epoch": 3.7813664596273293,
"grad_norm": 2.4498801231384277,
"learning_rate": 1.1031055900621119e-05,
"loss": 0.4979,
"step": 15220
},
{
"epoch": 3.7838509316770184,
"grad_norm": 8.071438789367676,
"learning_rate": 1.0906832298136645e-05,
"loss": 0.5893,
"step": 15230
},
{
"epoch": 3.7863354037267083,
"grad_norm": 7.249101161956787,
"learning_rate": 1.0782608695652174e-05,
"loss": 0.5271,
"step": 15240
},
{
"epoch": 3.7888198757763973,
"grad_norm": 9.257108688354492,
"learning_rate": 1.0658385093167702e-05,
"loss": 0.6586,
"step": 15250
},
{
"epoch": 3.791304347826087,
"grad_norm": 6.51657247543335,
"learning_rate": 1.053416149068323e-05,
"loss": 0.4949,
"step": 15260
},
{
"epoch": 3.7937888198757763,
"grad_norm": 8.859468460083008,
"learning_rate": 1.0409937888198758e-05,
"loss": 0.6531,
"step": 15270
},
{
"epoch": 3.796273291925466,
"grad_norm": 9.06107234954834,
"learning_rate": 1.0285714285714286e-05,
"loss": 0.4214,
"step": 15280
},
{
"epoch": 3.7987577639751553,
"grad_norm": 2.4932773113250732,
"learning_rate": 1.0161490683229815e-05,
"loss": 0.5662,
"step": 15290
},
{
"epoch": 3.801242236024845,
"grad_norm": 4.2591872215271,
"learning_rate": 1.0037267080745343e-05,
"loss": 0.4612,
"step": 15300
},
{
"epoch": 3.801242236024845,
"eval_accuracy": 0.8389509812549503,
"eval_loss": 0.6165159344673157,
"eval_runtime": 86.3041,
"eval_samples_per_second": 131.662,
"eval_steps_per_second": 16.465,
"step": 15300
},
{
"epoch": 3.8037267080745343,
"grad_norm": 3.7499098777770996,
"learning_rate": 9.91304347826087e-06,
"loss": 0.5474,
"step": 15310
},
{
"epoch": 3.8062111801242233,
"grad_norm": 7.90886926651001,
"learning_rate": 9.788819875776398e-06,
"loss": 0.3745,
"step": 15320
},
{
"epoch": 3.8086956521739133,
"grad_norm": 8.579766273498535,
"learning_rate": 9.664596273291926e-06,
"loss": 0.5731,
"step": 15330
},
{
"epoch": 3.8111801242236023,
"grad_norm": 5.433511734008789,
"learning_rate": 9.540372670807454e-06,
"loss": 0.4555,
"step": 15340
},
{
"epoch": 3.813664596273292,
"grad_norm": 6.867114543914795,
"learning_rate": 9.416149068322982e-06,
"loss": 0.6483,
"step": 15350
},
{
"epoch": 3.8161490683229813,
"grad_norm": 4.577269554138184,
"learning_rate": 9.291925465838509e-06,
"loss": 0.4513,
"step": 15360
},
{
"epoch": 3.8186335403726708,
"grad_norm": 3.5247273445129395,
"learning_rate": 9.167701863354037e-06,
"loss": 0.5172,
"step": 15370
},
{
"epoch": 3.8211180124223603,
"grad_norm": 4.862856864929199,
"learning_rate": 9.043478260869565e-06,
"loss": 0.4777,
"step": 15380
},
{
"epoch": 3.8236024844720498,
"grad_norm": 6.265756130218506,
"learning_rate": 8.919254658385095e-06,
"loss": 0.5164,
"step": 15390
},
{
"epoch": 3.8260869565217392,
"grad_norm": 6.9130754470825195,
"learning_rate": 8.795031055900622e-06,
"loss": 0.5304,
"step": 15400
},
{
"epoch": 3.8260869565217392,
"eval_accuracy": 0.8411511044618498,
"eval_loss": 0.6112430095672607,
"eval_runtime": 85.0608,
"eval_samples_per_second": 133.587,
"eval_steps_per_second": 16.706,
"step": 15400
},
{
"epoch": 3.8285714285714287,
"grad_norm": 5.0783233642578125,
"learning_rate": 8.67080745341615e-06,
"loss": 0.5357,
"step": 15410
},
{
"epoch": 3.8310559006211182,
"grad_norm": 7.3688154220581055,
"learning_rate": 8.546583850931678e-06,
"loss": 0.668,
"step": 15420
},
{
"epoch": 3.8335403726708073,
"grad_norm": 6.1275153160095215,
"learning_rate": 8.422360248447206e-06,
"loss": 0.3594,
"step": 15430
},
{
"epoch": 3.8360248447204968,
"grad_norm": 4.6164751052856445,
"learning_rate": 8.298136645962733e-06,
"loss": 0.3549,
"step": 15440
},
{
"epoch": 3.8385093167701863,
"grad_norm": 1.4796391725540161,
"learning_rate": 8.17391304347826e-06,
"loss": 0.3755,
"step": 15450
},
{
"epoch": 3.8409937888198757,
"grad_norm": 8.532491683959961,
"learning_rate": 8.049689440993789e-06,
"loss": 0.4853,
"step": 15460
},
{
"epoch": 3.8434782608695652,
"grad_norm": 7.3214616775512695,
"learning_rate": 7.925465838509317e-06,
"loss": 0.3734,
"step": 15470
},
{
"epoch": 3.8459627329192547,
"grad_norm": 9.121134757995605,
"learning_rate": 7.801242236024845e-06,
"loss": 0.3841,
"step": 15480
},
{
"epoch": 3.848447204968944,
"grad_norm": 7.52311372756958,
"learning_rate": 7.677018633540372e-06,
"loss": 0.3626,
"step": 15490
},
{
"epoch": 3.8509316770186337,
"grad_norm": 7.9005022048950195,
"learning_rate": 7.552795031055901e-06,
"loss": 0.4738,
"step": 15500
},
{
"epoch": 3.8509316770186337,
"eval_accuracy": 0.8387749713983983,
"eval_loss": 0.6148629784584045,
"eval_runtime": 85.04,
"eval_samples_per_second": 133.619,
"eval_steps_per_second": 16.71,
"step": 15500
},
{
"epoch": 3.853416149068323,
"grad_norm": 0.9077171683311462,
"learning_rate": 7.428571428571429e-06,
"loss": 0.5216,
"step": 15510
},
{
"epoch": 3.8559006211180122,
"grad_norm": 6.145358085632324,
"learning_rate": 7.304347826086957e-06,
"loss": 0.4544,
"step": 15520
},
{
"epoch": 3.8583850931677017,
"grad_norm": 4.223785877227783,
"learning_rate": 7.180124223602484e-06,
"loss": 0.7364,
"step": 15530
},
{
"epoch": 3.860869565217391,
"grad_norm": 3.089573383331299,
"learning_rate": 7.055900621118013e-06,
"loss": 0.4429,
"step": 15540
},
{
"epoch": 3.8633540372670807,
"grad_norm": 4.086426258087158,
"learning_rate": 6.931677018633541e-06,
"loss": 0.2988,
"step": 15550
},
{
"epoch": 3.86583850931677,
"grad_norm": 9.179378509521484,
"learning_rate": 6.807453416149069e-06,
"loss": 0.4351,
"step": 15560
},
{
"epoch": 3.8683229813664597,
"grad_norm": 2.9945521354675293,
"learning_rate": 6.683229813664596e-06,
"loss": 0.4504,
"step": 15570
},
{
"epoch": 3.870807453416149,
"grad_norm": 3.0713376998901367,
"learning_rate": 6.559006211180124e-06,
"loss": 0.5011,
"step": 15580
},
{
"epoch": 3.8732919254658387,
"grad_norm": 5.534846305847168,
"learning_rate": 6.434782608695652e-06,
"loss": 0.6831,
"step": 15590
},
{
"epoch": 3.875776397515528,
"grad_norm": 5.85855770111084,
"learning_rate": 6.3105590062111805e-06,
"loss": 0.3845,
"step": 15600
},
{
"epoch": 3.875776397515528,
"eval_accuracy": 0.8391269911115022,
"eval_loss": 0.6140738725662231,
"eval_runtime": 84.996,
"eval_samples_per_second": 133.689,
"eval_steps_per_second": 16.718,
"step": 15600
},
{
"epoch": 3.878260869565217,
"grad_norm": 8.211888313293457,
"learning_rate": 6.186335403726709e-06,
"loss": 0.552,
"step": 15610
},
{
"epoch": 3.8807453416149067,
"grad_norm": 3.7541515827178955,
"learning_rate": 6.062111801242237e-06,
"loss": 0.3499,
"step": 15620
},
{
"epoch": 3.883229813664596,
"grad_norm": 2.6869845390319824,
"learning_rate": 5.937888198757764e-06,
"loss": 0.4644,
"step": 15630
},
{
"epoch": 3.8857142857142857,
"grad_norm": 4.1416707038879395,
"learning_rate": 5.8136645962732925e-06,
"loss": 0.4497,
"step": 15640
},
{
"epoch": 3.888198757763975,
"grad_norm": 3.2766640186309814,
"learning_rate": 5.68944099378882e-06,
"loss": 0.381,
"step": 15650
},
{
"epoch": 3.8906832298136647,
"grad_norm": 9.587335586547852,
"learning_rate": 5.565217391304348e-06,
"loss": 0.5367,
"step": 15660
},
{
"epoch": 3.893167701863354,
"grad_norm": 8.829601287841797,
"learning_rate": 5.440993788819876e-06,
"loss": 0.5684,
"step": 15670
},
{
"epoch": 3.8956521739130436,
"grad_norm": 6.785938739776611,
"learning_rate": 5.316770186335404e-06,
"loss": 0.2842,
"step": 15680
},
{
"epoch": 3.898136645962733,
"grad_norm": 3.8636465072631836,
"learning_rate": 5.192546583850932e-06,
"loss": 0.46,
"step": 15690
},
{
"epoch": 3.900621118012422,
"grad_norm": 7.689055442810059,
"learning_rate": 5.06832298136646e-06,
"loss": 0.4533,
"step": 15700
},
{
"epoch": 3.900621118012422,
"eval_accuracy": 0.8399190354659861,
"eval_loss": 0.6139475703239441,
"eval_runtime": 85.0525,
"eval_samples_per_second": 133.6,
"eval_steps_per_second": 16.707,
"step": 15700
},
{
"epoch": 3.9031055900621117,
"grad_norm": 8.012325286865234,
"learning_rate": 4.944099378881987e-06,
"loss": 0.5585,
"step": 15710
},
{
"epoch": 3.905590062111801,
"grad_norm": 1.3264799118041992,
"learning_rate": 4.8198757763975155e-06,
"loss": 0.4654,
"step": 15720
},
{
"epoch": 3.9080745341614906,
"grad_norm": 3.987639904022217,
"learning_rate": 4.695652173913044e-06,
"loss": 0.4867,
"step": 15730
},
{
"epoch": 3.91055900621118,
"grad_norm": 6.421884536743164,
"learning_rate": 4.571428571428572e-06,
"loss": 0.5595,
"step": 15740
},
{
"epoch": 3.9130434782608696,
"grad_norm": 8.964715003967285,
"learning_rate": 4.4472049689441e-06,
"loss": 0.5024,
"step": 15750
},
{
"epoch": 3.915527950310559,
"grad_norm": 7.1650004386901855,
"learning_rate": 4.3229813664596275e-06,
"loss": 0.4552,
"step": 15760
},
{
"epoch": 3.9180124223602486,
"grad_norm": 3.3710427284240723,
"learning_rate": 4.198757763975156e-06,
"loss": 0.4063,
"step": 15770
},
{
"epoch": 3.920496894409938,
"grad_norm": 7.025265693664551,
"learning_rate": 4.074534161490683e-06,
"loss": 0.6082,
"step": 15780
},
{
"epoch": 3.922981366459627,
"grad_norm": 6.672760963439941,
"learning_rate": 3.950310559006211e-06,
"loss": 0.4398,
"step": 15790
},
{
"epoch": 3.9254658385093166,
"grad_norm": 9.175477027893066,
"learning_rate": 3.8260869565217395e-06,
"loss": 0.3539,
"step": 15800
},
{
"epoch": 3.9254658385093166,
"eval_accuracy": 0.8401830502508141,
"eval_loss": 0.6130595803260803,
"eval_runtime": 85.2127,
"eval_samples_per_second": 133.349,
"eval_steps_per_second": 16.676,
"step": 15800
},
{
"epoch": 3.927950310559006,
"grad_norm": 2.647934675216675,
"learning_rate": 3.7018633540372673e-06,
"loss": 0.2573,
"step": 15810
},
{
"epoch": 3.9304347826086956,
"grad_norm": 17.082826614379883,
"learning_rate": 3.577639751552795e-06,
"loss": 0.5785,
"step": 15820
},
{
"epoch": 3.932919254658385,
"grad_norm": 6.866117000579834,
"learning_rate": 3.4534161490683232e-06,
"loss": 0.637,
"step": 15830
},
{
"epoch": 3.9354037267080746,
"grad_norm": 8.402270317077637,
"learning_rate": 3.329192546583851e-06,
"loss": 0.6079,
"step": 15840
},
{
"epoch": 3.937888198757764,
"grad_norm": 4.975553512573242,
"learning_rate": 3.2049689440993792e-06,
"loss": 0.659,
"step": 15850
},
{
"epoch": 3.9403726708074536,
"grad_norm": 7.253668308258057,
"learning_rate": 3.080745341614907e-06,
"loss": 0.5316,
"step": 15860
},
{
"epoch": 3.942857142857143,
"grad_norm": 4.728071689605713,
"learning_rate": 2.9565217391304348e-06,
"loss": 0.3085,
"step": 15870
},
{
"epoch": 3.945341614906832,
"grad_norm": 3.6727304458618164,
"learning_rate": 2.832298136645963e-06,
"loss": 0.3978,
"step": 15880
},
{
"epoch": 3.9478260869565216,
"grad_norm": 7.217862129211426,
"learning_rate": 2.7080745341614908e-06,
"loss": 0.5929,
"step": 15890
},
{
"epoch": 3.950310559006211,
"grad_norm": 5.9662628173828125,
"learning_rate": 2.5838509316770185e-06,
"loss": 0.6485,
"step": 15900
},
{
"epoch": 3.950310559006211,
"eval_accuracy": 0.8396550206811582,
"eval_loss": 0.611811637878418,
"eval_runtime": 85.1765,
"eval_samples_per_second": 133.405,
"eval_steps_per_second": 16.683,
"step": 15900
},
{
"epoch": 3.9527950310559006,
"grad_norm": 3.825432777404785,
"learning_rate": 2.4596273291925467e-06,
"loss": 0.4889,
"step": 15910
},
{
"epoch": 3.95527950310559,
"grad_norm": 4.859676837921143,
"learning_rate": 2.3354037267080745e-06,
"loss": 0.5675,
"step": 15920
},
{
"epoch": 3.9577639751552796,
"grad_norm": 5.451256275177002,
"learning_rate": 2.2111801242236023e-06,
"loss": 0.4364,
"step": 15930
},
{
"epoch": 3.960248447204969,
"grad_norm": 6.4008612632751465,
"learning_rate": 2.0869565217391305e-06,
"loss": 0.4252,
"step": 15940
},
{
"epoch": 3.9627329192546585,
"grad_norm": 7.916716575622559,
"learning_rate": 1.9627329192546587e-06,
"loss": 0.4462,
"step": 15950
},
{
"epoch": 3.965217391304348,
"grad_norm": 7.608262538909912,
"learning_rate": 1.8385093167701865e-06,
"loss": 0.5672,
"step": 15960
},
{
"epoch": 3.967701863354037,
"grad_norm": 8.407822608947754,
"learning_rate": 1.7142857142857145e-06,
"loss": 0.4583,
"step": 15970
},
{
"epoch": 3.9701863354037266,
"grad_norm": 4.553814888000488,
"learning_rate": 1.5900621118012425e-06,
"loss": 0.4074,
"step": 15980
},
{
"epoch": 3.972670807453416,
"grad_norm": 3.75431752204895,
"learning_rate": 1.4658385093167703e-06,
"loss": 0.4336,
"step": 15990
},
{
"epoch": 3.9751552795031055,
"grad_norm": 5.175358295440674,
"learning_rate": 1.3416149068322982e-06,
"loss": 0.331,
"step": 16000
},
{
"epoch": 3.9751552795031055,
"eval_accuracy": 0.8396550206811582,
"eval_loss": 0.6108485460281372,
"eval_runtime": 87.4471,
"eval_samples_per_second": 129.941,
"eval_steps_per_second": 16.25,
"step": 16000
},
{
"epoch": 3.977639751552795,
"grad_norm": 9.12428092956543,
"learning_rate": 1.217391304347826e-06,
"loss": 0.4686,
"step": 16010
},
{
"epoch": 3.9801242236024845,
"grad_norm": 5.5283379554748535,
"learning_rate": 1.093167701863354e-06,
"loss": 0.4773,
"step": 16020
},
{
"epoch": 3.982608695652174,
"grad_norm": 7.850075721740723,
"learning_rate": 9.68944099378882e-07,
"loss": 0.4124,
"step": 16030
},
{
"epoch": 3.9850931677018635,
"grad_norm": 6.541348457336426,
"learning_rate": 8.447204968944101e-07,
"loss": 0.2801,
"step": 16040
},
{
"epoch": 3.987577639751553,
"grad_norm": 4.038955211639404,
"learning_rate": 7.204968944099379e-07,
"loss": 0.3776,
"step": 16050
},
{
"epoch": 3.990062111801242,
"grad_norm": 2.5451860427856445,
"learning_rate": 5.962732919254659e-07,
"loss": 0.5369,
"step": 16060
},
{
"epoch": 3.9925465838509315,
"grad_norm": 2.278172731399536,
"learning_rate": 4.720496894409938e-07,
"loss": 0.578,
"step": 16070
},
{
"epoch": 3.995031055900621,
"grad_norm": 11.714668273925781,
"learning_rate": 3.4782608695652175e-07,
"loss": 0.4875,
"step": 16080
},
{
"epoch": 3.9975155279503105,
"grad_norm": 8.900927543640137,
"learning_rate": 2.236024844720497e-07,
"loss": 0.4701,
"step": 16090
},
{
"epoch": 4.0,
"grad_norm": 0.3073888123035431,
"learning_rate": 9.937888198757765e-08,
"loss": 0.3582,
"step": 16100
},
{
"epoch": 4.0,
"eval_accuracy": 0.8400070403942621,
"eval_loss": 0.6105344295501709,
"eval_runtime": 85.9786,
"eval_samples_per_second": 132.161,
"eval_steps_per_second": 16.527,
"step": 16100
},
{
"epoch": 4.0,
"step": 16100,
"total_flos": 1.9975615705569485e+19,
"train_loss": 0.9840855360623473,
"train_runtime": 18351.2913,
"train_samples_per_second": 14.034,
"train_steps_per_second": 0.877
}
],
"logging_steps": 10,
"max_steps": 16100,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 100,
"total_flos": 1.9975615705569485e+19,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}