{ "best_metric": 0.6105344295501709, "best_model_checkpoint": "finetuned-food101/checkpoint-16100", "epoch": 4.0, "eval_steps": 100, "global_step": 16100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002484472049689441, "grad_norm": 2.018357992172241, "learning_rate": 0.00019987577639751553, "loss": 4.5969, "step": 10 }, { "epoch": 0.004968944099378882, "grad_norm": 1.9477064609527588, "learning_rate": 0.00019975155279503107, "loss": 4.5962, "step": 20 }, { "epoch": 0.007453416149068323, "grad_norm": 1.6431339979171753, "learning_rate": 0.00019962732919254659, "loss": 4.5714, "step": 30 }, { "epoch": 0.009937888198757764, "grad_norm": 1.9268441200256348, "learning_rate": 0.0001995031055900621, "loss": 4.5506, "step": 40 }, { "epoch": 0.012422360248447204, "grad_norm": 1.8745810985565186, "learning_rate": 0.00019937888198757767, "loss": 4.4664, "step": 50 }, { "epoch": 0.014906832298136646, "grad_norm": 1.825967788696289, "learning_rate": 0.0001992546583850932, "loss": 4.415, "step": 60 }, { "epoch": 0.017391304347826087, "grad_norm": 1.822075366973877, "learning_rate": 0.0001991304347826087, "loss": 4.3765, "step": 70 }, { "epoch": 0.01987577639751553, "grad_norm": 1.9246478080749512, "learning_rate": 0.00019900621118012425, "loss": 4.299, "step": 80 }, { "epoch": 0.02236024844720497, "grad_norm": 1.8662974834442139, "learning_rate": 0.00019888198757763977, "loss": 4.1782, "step": 90 }, { "epoch": 0.024844720496894408, "grad_norm": 2.1129419803619385, "learning_rate": 0.00019875776397515528, "loss": 4.1344, "step": 100 }, { "epoch": 0.024844720496894408, "eval_accuracy": 0.3063451553286984, "eval_loss": 4.030449867248535, "eval_runtime": 87.1659, "eval_samples_per_second": 130.361, "eval_steps_per_second": 16.302, "step": 100 }, { "epoch": 0.02732919254658385, "grad_norm": 1.8938136100769043, "learning_rate": 0.00019863354037267082, "loss": 4.0639, "step": 110 }, { "epoch": 0.02981366459627329, "grad_norm": 2.3493857383728027, "learning_rate": 0.00019850931677018634, "loss": 3.9159, "step": 120 }, { "epoch": 0.03229813664596273, "grad_norm": 2.3934977054595947, "learning_rate": 0.00019838509316770186, "loss": 3.9002, "step": 130 }, { "epoch": 0.034782608695652174, "grad_norm": 2.9848217964172363, "learning_rate": 0.0001982608695652174, "loss": 3.8664, "step": 140 }, { "epoch": 0.037267080745341616, "grad_norm": 2.182579755783081, "learning_rate": 0.00019813664596273294, "loss": 3.7589, "step": 150 }, { "epoch": 0.03975155279503106, "grad_norm": 2.37665057182312, "learning_rate": 0.00019801242236024846, "loss": 3.6747, "step": 160 }, { "epoch": 0.0422360248447205, "grad_norm": 2.528806447982788, "learning_rate": 0.00019788819875776398, "loss": 3.7115, "step": 170 }, { "epoch": 0.04472049689440994, "grad_norm": 2.4230544567108154, "learning_rate": 0.00019776397515527952, "loss": 3.6117, "step": 180 }, { "epoch": 0.04720496894409938, "grad_norm": 2.561897039413452, "learning_rate": 0.00019763975155279504, "loss": 3.5795, "step": 190 }, { "epoch": 0.049689440993788817, "grad_norm": 2.853154420852661, "learning_rate": 0.00019751552795031055, "loss": 3.5328, "step": 200 }, { "epoch": 0.049689440993788817, "eval_accuracy": 0.4409926955909531, "eval_loss": 3.3728513717651367, "eval_runtime": 88.2535, "eval_samples_per_second": 128.754, "eval_steps_per_second": 16.101, "step": 200 }, { "epoch": 0.05217391304347826, "grad_norm": 2.532111167907715, "learning_rate": 0.0001973913043478261, "loss": 3.387, "step": 210 }, { "epoch": 0.0546583850931677, "grad_norm": 2.5678958892822266, "learning_rate": 0.0001972670807453416, "loss": 3.3832, "step": 220 }, { "epoch": 0.05714285714285714, "grad_norm": 2.4794390201568604, "learning_rate": 0.0001971552795031056, "loss": 3.3311, "step": 230 }, { "epoch": 0.05962732919254658, "grad_norm": 3.4417531490325928, "learning_rate": 0.00019703105590062112, "loss": 3.2617, "step": 240 }, { "epoch": 0.062111801242236024, "grad_norm": 3.0144076347351074, "learning_rate": 0.00019690683229813663, "loss": 3.043, "step": 250 }, { "epoch": 0.06459627329192547, "grad_norm": 2.3258306980133057, "learning_rate": 0.0001967826086956522, "loss": 3.1299, "step": 260 }, { "epoch": 0.0670807453416149, "grad_norm": 3.9541103839874268, "learning_rate": 0.00019665838509316772, "loss": 3.2333, "step": 270 }, { "epoch": 0.06956521739130435, "grad_norm": 4.3033857345581055, "learning_rate": 0.00019653416149068324, "loss": 3.021, "step": 280 }, { "epoch": 0.07204968944099378, "grad_norm": 3.252000570297241, "learning_rate": 0.00019640993788819878, "loss": 3.0683, "step": 290 }, { "epoch": 0.07453416149068323, "grad_norm": 3.247220039367676, "learning_rate": 0.0001962857142857143, "loss": 2.9715, "step": 300 }, { "epoch": 0.07453416149068323, "eval_accuracy": 0.5135087564903634, "eval_loss": 2.8900182247161865, "eval_runtime": 86.8214, "eval_samples_per_second": 130.878, "eval_steps_per_second": 16.367, "step": 300 }, { "epoch": 0.07701863354037267, "grad_norm": 3.015491008758545, "learning_rate": 0.00019616149068322981, "loss": 2.8338, "step": 310 }, { "epoch": 0.07950310559006211, "grad_norm": 4.734148025512695, "learning_rate": 0.00019603726708074536, "loss": 2.9681, "step": 320 }, { "epoch": 0.08198757763975155, "grad_norm": 3.052933692932129, "learning_rate": 0.00019591304347826087, "loss": 2.8386, "step": 330 }, { "epoch": 0.084472049689441, "grad_norm": 4.703938007354736, "learning_rate": 0.0001957888198757764, "loss": 2.9725, "step": 340 }, { "epoch": 0.08695652173913043, "grad_norm": 2.9451019763946533, "learning_rate": 0.00019566459627329193, "loss": 2.8719, "step": 350 }, { "epoch": 0.08944099378881988, "grad_norm": 4.3831987380981445, "learning_rate": 0.00019554037267080748, "loss": 2.8716, "step": 360 }, { "epoch": 0.09192546583850932, "grad_norm": 3.833592176437378, "learning_rate": 0.000195416149068323, "loss": 2.9066, "step": 370 }, { "epoch": 0.09440993788819876, "grad_norm": 4.050900936126709, "learning_rate": 0.0001952919254658385, "loss": 2.6445, "step": 380 }, { "epoch": 0.0968944099378882, "grad_norm": 4.814563274383545, "learning_rate": 0.00019516770186335405, "loss": 2.6455, "step": 390 }, { "epoch": 0.09937888198757763, "grad_norm": 5.039762496948242, "learning_rate": 0.00019505590062111802, "loss": 2.724, "step": 400 }, { "epoch": 0.09937888198757763, "eval_accuracy": 0.5443104813869577, "eval_loss": 2.509587526321411, "eval_runtime": 87.6766, "eval_samples_per_second": 129.601, "eval_steps_per_second": 16.207, "step": 400 }, { "epoch": 0.10186335403726708, "grad_norm": 5.771543025970459, "learning_rate": 0.00019493167701863356, "loss": 2.6617, "step": 410 }, { "epoch": 0.10434782608695652, "grad_norm": 3.382282257080078, "learning_rate": 0.00019480745341614908, "loss": 2.6631, "step": 420 }, { "epoch": 0.10683229813664596, "grad_norm": 3.872953176498413, "learning_rate": 0.0001946832298136646, "loss": 2.5117, "step": 430 }, { "epoch": 0.1093167701863354, "grad_norm": 3.881727695465088, "learning_rate": 0.00019455900621118014, "loss": 2.4816, "step": 440 }, { "epoch": 0.11180124223602485, "grad_norm": 4.131108283996582, "learning_rate": 0.00019443478260869565, "loss": 2.534, "step": 450 }, { "epoch": 0.11428571428571428, "grad_norm": 3.308680772781372, "learning_rate": 0.00019431055900621117, "loss": 2.4314, "step": 460 }, { "epoch": 0.11677018633540373, "grad_norm": 7.087298393249512, "learning_rate": 0.00019418633540372674, "loss": 2.4269, "step": 470 }, { "epoch": 0.11925465838509317, "grad_norm": 5.214663505554199, "learning_rate": 0.00019406211180124225, "loss": 2.2572, "step": 480 }, { "epoch": 0.12173913043478261, "grad_norm": 5.976667881011963, "learning_rate": 0.00019393788819875777, "loss": 2.4425, "step": 490 }, { "epoch": 0.12422360248447205, "grad_norm": 5.982608795166016, "learning_rate": 0.00019381366459627331, "loss": 2.311, "step": 500 }, { "epoch": 0.12422360248447205, "eval_accuracy": 0.5894570095925372, "eval_loss": 2.1726009845733643, "eval_runtime": 87.1828, "eval_samples_per_second": 130.335, "eval_steps_per_second": 16.299, "step": 500 }, { "epoch": 0.1267080745341615, "grad_norm": 5.053837776184082, "learning_rate": 0.00019368944099378883, "loss": 2.2082, "step": 510 }, { "epoch": 0.12919254658385093, "grad_norm": 6.473962306976318, "learning_rate": 0.00019356521739130435, "loss": 2.2111, "step": 520 }, { "epoch": 0.13167701863354037, "grad_norm": 6.132943153381348, "learning_rate": 0.0001934409937888199, "loss": 2.356, "step": 530 }, { "epoch": 0.1341614906832298, "grad_norm": 3.197087287902832, "learning_rate": 0.0001933167701863354, "loss": 2.1868, "step": 540 }, { "epoch": 0.13664596273291926, "grad_norm": 6.199575901031494, "learning_rate": 0.00019319254658385092, "loss": 2.4575, "step": 550 }, { "epoch": 0.1391304347826087, "grad_norm": 4.699795722961426, "learning_rate": 0.00019306832298136647, "loss": 2.3983, "step": 560 }, { "epoch": 0.14161490683229813, "grad_norm": 5.361752510070801, "learning_rate": 0.000192944099378882, "loss": 2.218, "step": 570 }, { "epoch": 0.14409937888198757, "grad_norm": 4.245269775390625, "learning_rate": 0.00019281987577639753, "loss": 1.9794, "step": 580 }, { "epoch": 0.14658385093167703, "grad_norm": 2.9164280891418457, "learning_rate": 0.00019269565217391304, "loss": 2.1541, "step": 590 }, { "epoch": 0.14906832298136646, "grad_norm": 3.7694873809814453, "learning_rate": 0.00019257142857142859, "loss": 2.266, "step": 600 }, { "epoch": 0.14906832298136646, "eval_accuracy": 0.5879609258118454, "eval_loss": 2.0223026275634766, "eval_runtime": 88.2805, "eval_samples_per_second": 128.715, "eval_steps_per_second": 16.096, "step": 600 }, { "epoch": 0.1515527950310559, "grad_norm": 4.551809787750244, "learning_rate": 0.0001924472049689441, "loss": 2.1348, "step": 610 }, { "epoch": 0.15403726708074533, "grad_norm": 5.469175815582275, "learning_rate": 0.00019232298136645962, "loss": 2.0839, "step": 620 }, { "epoch": 0.1565217391304348, "grad_norm": 5.535090923309326, "learning_rate": 0.00019219875776397516, "loss": 2.0028, "step": 630 }, { "epoch": 0.15900621118012423, "grad_norm": 5.28466272354126, "learning_rate": 0.00019207453416149068, "loss": 2.3083, "step": 640 }, { "epoch": 0.16149068322981366, "grad_norm": 7.3980488777160645, "learning_rate": 0.00019195031055900622, "loss": 2.1914, "step": 650 }, { "epoch": 0.1639751552795031, "grad_norm": 5.99133825302124, "learning_rate": 0.00019182608695652177, "loss": 2.3663, "step": 660 }, { "epoch": 0.16645962732919253, "grad_norm": 4.15263032913208, "learning_rate": 0.00019170186335403728, "loss": 1.9666, "step": 670 }, { "epoch": 0.168944099378882, "grad_norm": 4.62333345413208, "learning_rate": 0.0001915776397515528, "loss": 2.1487, "step": 680 }, { "epoch": 0.17142857142857143, "grad_norm": 8.580528259277344, "learning_rate": 0.00019145341614906834, "loss": 2.0729, "step": 690 }, { "epoch": 0.17391304347826086, "grad_norm": 7.049954891204834, "learning_rate": 0.00019132919254658386, "loss": 1.9671, "step": 700 }, { "epoch": 0.17391304347826086, "eval_accuracy": 0.633019449089149, "eval_loss": 1.758486270904541, "eval_runtime": 88.0658, "eval_samples_per_second": 129.028, "eval_steps_per_second": 16.136, "step": 700 }, { "epoch": 0.1763975155279503, "grad_norm": 5.929836750030518, "learning_rate": 0.00019120496894409937, "loss": 1.9726, "step": 710 }, { "epoch": 0.17888198757763976, "grad_norm": 4.58709716796875, "learning_rate": 0.00019108074534161492, "loss": 1.9319, "step": 720 }, { "epoch": 0.1813664596273292, "grad_norm": 6.737441539764404, "learning_rate": 0.00019095652173913043, "loss": 2.0524, "step": 730 }, { "epoch": 0.18385093167701863, "grad_norm": 8.844467163085938, "learning_rate": 0.00019083229813664598, "loss": 2.1296, "step": 740 }, { "epoch": 0.18633540372670807, "grad_norm": 5.9616780281066895, "learning_rate": 0.0001907080745341615, "loss": 1.8757, "step": 750 }, { "epoch": 0.18881987577639753, "grad_norm": 7.684135437011719, "learning_rate": 0.00019058385093167704, "loss": 1.8596, "step": 760 }, { "epoch": 0.19130434782608696, "grad_norm": 4.873102188110352, "learning_rate": 0.00019045962732919255, "loss": 1.9921, "step": 770 }, { "epoch": 0.1937888198757764, "grad_norm": 3.7490782737731934, "learning_rate": 0.00019033540372670807, "loss": 2.0498, "step": 780 }, { "epoch": 0.19627329192546583, "grad_norm": 5.863892078399658, "learning_rate": 0.00019021118012422361, "loss": 1.7348, "step": 790 }, { "epoch": 0.19875776397515527, "grad_norm": 7.632678985595703, "learning_rate": 0.00019008695652173913, "loss": 1.8617, "step": 800 }, { "epoch": 0.19875776397515527, "eval_accuracy": 0.6212267887001672, "eval_loss": 1.7300000190734863, "eval_runtime": 88.4568, "eval_samples_per_second": 128.458, "eval_steps_per_second": 16.064, "step": 800 }, { "epoch": 0.20124223602484473, "grad_norm": 8.62378215789795, "learning_rate": 0.00018996273291925467, "loss": 1.7559, "step": 810 }, { "epoch": 0.20372670807453416, "grad_norm": 7.463620662689209, "learning_rate": 0.0001898385093167702, "loss": 2.0599, "step": 820 }, { "epoch": 0.2062111801242236, "grad_norm": 6.657968044281006, "learning_rate": 0.00018971428571428573, "loss": 1.6052, "step": 830 }, { "epoch": 0.20869565217391303, "grad_norm": 6.594502925872803, "learning_rate": 0.00018959006211180125, "loss": 1.6008, "step": 840 }, { "epoch": 0.2111801242236025, "grad_norm": 5.336763858795166, "learning_rate": 0.0001894658385093168, "loss": 1.8464, "step": 850 }, { "epoch": 0.21366459627329193, "grad_norm": 5.568216323852539, "learning_rate": 0.0001893416149068323, "loss": 1.8365, "step": 860 }, { "epoch": 0.21614906832298136, "grad_norm": 5.7065510749816895, "learning_rate": 0.00018921739130434783, "loss": 1.8583, "step": 870 }, { "epoch": 0.2186335403726708, "grad_norm": 6.466409206390381, "learning_rate": 0.00018909316770186337, "loss": 1.6582, "step": 880 }, { "epoch": 0.22111801242236026, "grad_norm": 5.712678909301758, "learning_rate": 0.00018896894409937889, "loss": 1.9344, "step": 890 }, { "epoch": 0.2236024844720497, "grad_norm": 4.358852863311768, "learning_rate": 0.0001888447204968944, "loss": 1.4694, "step": 900 }, { "epoch": 0.2236024844720497, "eval_accuracy": 0.6077620346739417, "eval_loss": 1.7506581544876099, "eval_runtime": 87.3994, "eval_samples_per_second": 130.012, "eval_steps_per_second": 16.259, "step": 900 }, { "epoch": 0.22608695652173913, "grad_norm": 7.161348342895508, "learning_rate": 0.00018872049689440995, "loss": 2.003, "step": 910 }, { "epoch": 0.22857142857142856, "grad_norm": 8.397992134094238, "learning_rate": 0.0001885962732919255, "loss": 1.7533, "step": 920 }, { "epoch": 0.231055900621118, "grad_norm": 8.75161075592041, "learning_rate": 0.000188472049689441, "loss": 1.7335, "step": 930 }, { "epoch": 0.23354037267080746, "grad_norm": 3.9503304958343506, "learning_rate": 0.00018834782608695655, "loss": 1.6272, "step": 940 }, { "epoch": 0.2360248447204969, "grad_norm": 9.528467178344727, "learning_rate": 0.00018822360248447206, "loss": 1.9007, "step": 950 }, { "epoch": 0.23850931677018633, "grad_norm": 10.89683723449707, "learning_rate": 0.00018809937888198758, "loss": 1.6834, "step": 960 }, { "epoch": 0.24099378881987576, "grad_norm": 5.9737629890441895, "learning_rate": 0.00018797515527950312, "loss": 1.9189, "step": 970 }, { "epoch": 0.24347826086956523, "grad_norm": 5.383342266082764, "learning_rate": 0.00018785093167701864, "loss": 1.8391, "step": 980 }, { "epoch": 0.24596273291925466, "grad_norm": 5.408697605133057, "learning_rate": 0.00018772670807453416, "loss": 1.7161, "step": 990 }, { "epoch": 0.2484472049689441, "grad_norm": 8.349679946899414, "learning_rate": 0.0001876024844720497, "loss": 1.7876, "step": 1000 }, { "epoch": 0.2484472049689441, "eval_accuracy": 0.6133063451553287, "eval_loss": 1.6519758701324463, "eval_runtime": 87.6336, "eval_samples_per_second": 129.665, "eval_steps_per_second": 16.215, "step": 1000 }, { "epoch": 0.25093167701863356, "grad_norm": 7.187140464782715, "learning_rate": 0.00018747826086956524, "loss": 1.8637, "step": 1010 }, { "epoch": 0.253416149068323, "grad_norm": 4.753952503204346, "learning_rate": 0.00018735403726708076, "loss": 1.9234, "step": 1020 }, { "epoch": 0.25590062111801243, "grad_norm": 5.245208740234375, "learning_rate": 0.00018722981366459628, "loss": 1.6968, "step": 1030 }, { "epoch": 0.25838509316770186, "grad_norm": 4.8791351318359375, "learning_rate": 0.00018710559006211182, "loss": 1.4784, "step": 1040 }, { "epoch": 0.2608695652173913, "grad_norm": 9.694734573364258, "learning_rate": 0.00018698136645962734, "loss": 1.6259, "step": 1050 }, { "epoch": 0.26335403726708073, "grad_norm": 9.020699501037598, "learning_rate": 0.00018685714285714285, "loss": 1.7696, "step": 1060 }, { "epoch": 0.26583850931677017, "grad_norm": 7.134639739990234, "learning_rate": 0.0001867329192546584, "loss": 1.8738, "step": 1070 }, { "epoch": 0.2683229813664596, "grad_norm": 6.925185680389404, "learning_rate": 0.0001866086956521739, "loss": 1.6153, "step": 1080 }, { "epoch": 0.2708074534161491, "grad_norm": 6.5511579513549805, "learning_rate": 0.00018648447204968943, "loss": 1.8047, "step": 1090 }, { "epoch": 0.2732919254658385, "grad_norm": 3.910539150238037, "learning_rate": 0.000186360248447205, "loss": 1.7647, "step": 1100 }, { "epoch": 0.2732919254658385, "eval_accuracy": 0.659772947285048, "eval_loss": 1.4576257467269897, "eval_runtime": 86.6742, "eval_samples_per_second": 131.1, "eval_steps_per_second": 16.395, "step": 1100 }, { "epoch": 0.27577639751552796, "grad_norm": 5.463332176208496, "learning_rate": 0.00018623602484472052, "loss": 1.6722, "step": 1110 }, { "epoch": 0.2782608695652174, "grad_norm": 5.566735744476318, "learning_rate": 0.00018611180124223603, "loss": 1.734, "step": 1120 }, { "epoch": 0.28074534161490683, "grad_norm": 8.45088005065918, "learning_rate": 0.00018598757763975158, "loss": 1.7612, "step": 1130 }, { "epoch": 0.28322981366459626, "grad_norm": 6.647975444793701, "learning_rate": 0.0001858633540372671, "loss": 1.6728, "step": 1140 }, { "epoch": 0.2857142857142857, "grad_norm": 5.041713714599609, "learning_rate": 0.0001857391304347826, "loss": 1.6758, "step": 1150 }, { "epoch": 0.28819875776397513, "grad_norm": 8.309142112731934, "learning_rate": 0.00018561490683229815, "loss": 1.5707, "step": 1160 }, { "epoch": 0.2906832298136646, "grad_norm": 8.672463417053223, "learning_rate": 0.00018549068322981367, "loss": 1.6847, "step": 1170 }, { "epoch": 0.29316770186335406, "grad_norm": 8.018989562988281, "learning_rate": 0.00018536645962732918, "loss": 1.3782, "step": 1180 }, { "epoch": 0.2956521739130435, "grad_norm": 6.475429058074951, "learning_rate": 0.00018524223602484473, "loss": 1.5442, "step": 1190 }, { "epoch": 0.2981366459627329, "grad_norm": 5.768404006958008, "learning_rate": 0.00018511801242236027, "loss": 1.7, "step": 1200 }, { "epoch": 0.2981366459627329, "eval_accuracy": 0.6576608290064243, "eval_loss": 1.4419533014297485, "eval_runtime": 86.3614, "eval_samples_per_second": 131.575, "eval_steps_per_second": 16.454, "step": 1200 }, { "epoch": 0.30062111801242236, "grad_norm": 4.549999713897705, "learning_rate": 0.0001849937888198758, "loss": 1.8302, "step": 1210 }, { "epoch": 0.3031055900621118, "grad_norm": 9.671154022216797, "learning_rate": 0.0001848695652173913, "loss": 1.5977, "step": 1220 }, { "epoch": 0.30559006211180123, "grad_norm": 5.3373494148254395, "learning_rate": 0.00018474534161490685, "loss": 1.541, "step": 1230 }, { "epoch": 0.30807453416149067, "grad_norm": 4.874505043029785, "learning_rate": 0.00018462111801242236, "loss": 1.6999, "step": 1240 }, { "epoch": 0.3105590062111801, "grad_norm": 7.157403945922852, "learning_rate": 0.00018449689440993788, "loss": 1.8442, "step": 1250 }, { "epoch": 0.3130434782608696, "grad_norm": 7.489334583282471, "learning_rate": 0.00018437267080745342, "loss": 1.7671, "step": 1260 }, { "epoch": 0.315527950310559, "grad_norm": 9.33269214630127, "learning_rate": 0.00018424844720496894, "loss": 1.6574, "step": 1270 }, { "epoch": 0.31801242236024846, "grad_norm": 4.2884697914123535, "learning_rate": 0.00018412422360248448, "loss": 1.5512, "step": 1280 }, { "epoch": 0.3204968944099379, "grad_norm": 8.707039833068848, "learning_rate": 0.00018400000000000003, "loss": 1.8651, "step": 1290 }, { "epoch": 0.32298136645962733, "grad_norm": 5.426664352416992, "learning_rate": 0.00018387577639751554, "loss": 1.533, "step": 1300 }, { "epoch": 0.32298136645962733, "eval_accuracy": 0.6537006072340051, "eval_loss": 1.4389325380325317, "eval_runtime": 86.5703, "eval_samples_per_second": 131.257, "eval_steps_per_second": 16.414, "step": 1300 }, { "epoch": 0.32546583850931676, "grad_norm": 6.7798171043396, "learning_rate": 0.00018375155279503106, "loss": 1.7068, "step": 1310 }, { "epoch": 0.3279503105590062, "grad_norm": 4.650680065155029, "learning_rate": 0.0001836273291925466, "loss": 1.3869, "step": 1320 }, { "epoch": 0.33043478260869563, "grad_norm": 7.123183250427246, "learning_rate": 0.00018350310559006212, "loss": 1.6407, "step": 1330 }, { "epoch": 0.33291925465838507, "grad_norm": 5.242658615112305, "learning_rate": 0.00018337888198757764, "loss": 1.5, "step": 1340 }, { "epoch": 0.33540372670807456, "grad_norm": 8.704155921936035, "learning_rate": 0.00018325465838509318, "loss": 1.5082, "step": 1350 }, { "epoch": 0.337888198757764, "grad_norm": 5.923374176025391, "learning_rate": 0.0001831304347826087, "loss": 1.5168, "step": 1360 }, { "epoch": 0.3403726708074534, "grad_norm": 7.103471279144287, "learning_rate": 0.00018300621118012424, "loss": 1.5021, "step": 1370 }, { "epoch": 0.34285714285714286, "grad_norm": 7.775028228759766, "learning_rate": 0.00018288198757763976, "loss": 1.5028, "step": 1380 }, { "epoch": 0.3453416149068323, "grad_norm": 5.6988606452941895, "learning_rate": 0.0001827577639751553, "loss": 1.556, "step": 1390 }, { "epoch": 0.34782608695652173, "grad_norm": 7.056687831878662, "learning_rate": 0.00018263354037267082, "loss": 1.3895, "step": 1400 }, { "epoch": 0.34782608695652173, "eval_accuracy": 0.6587168881457361, "eval_loss": 1.4178403615951538, "eval_runtime": 88.3555, "eval_samples_per_second": 128.606, "eval_steps_per_second": 16.083, "step": 1400 }, { "epoch": 0.35031055900621116, "grad_norm": 8.281564712524414, "learning_rate": 0.00018250931677018633, "loss": 1.5364, "step": 1410 }, { "epoch": 0.3527950310559006, "grad_norm": 6.474056243896484, "learning_rate": 0.00018238509316770188, "loss": 1.6628, "step": 1420 }, { "epoch": 0.3552795031055901, "grad_norm": 7.75063943862915, "learning_rate": 0.0001822608695652174, "loss": 1.4784, "step": 1430 }, { "epoch": 0.3577639751552795, "grad_norm": 6.833581447601318, "learning_rate": 0.0001821366459627329, "loss": 1.4988, "step": 1440 }, { "epoch": 0.36024844720496896, "grad_norm": 7.43401575088501, "learning_rate": 0.00018201242236024845, "loss": 1.4361, "step": 1450 }, { "epoch": 0.3627329192546584, "grad_norm": 5.032355308532715, "learning_rate": 0.000181888198757764, "loss": 1.3549, "step": 1460 }, { "epoch": 0.3652173913043478, "grad_norm": 9.350013732910156, "learning_rate": 0.0001817639751552795, "loss": 1.4264, "step": 1470 }, { "epoch": 0.36770186335403726, "grad_norm": 9.7288818359375, "learning_rate": 0.00018163975155279505, "loss": 1.5719, "step": 1480 }, { "epoch": 0.3701863354037267, "grad_norm": 9.518999099731445, "learning_rate": 0.00018151552795031057, "loss": 1.6384, "step": 1490 }, { "epoch": 0.37267080745341613, "grad_norm": NaN, "learning_rate": 0.00018140372670807456, "loss": 1.5497, "step": 1500 }, { "epoch": 0.37267080745341613, "eval_accuracy": 0.6860864208395671, "eval_loss": 1.304831624031067, "eval_runtime": 87.6832, "eval_samples_per_second": 129.592, "eval_steps_per_second": 16.206, "step": 1500 }, { "epoch": 0.37515527950310557, "grad_norm": 7.9868292808532715, "learning_rate": 0.00018127950310559008, "loss": 1.3945, "step": 1510 }, { "epoch": 0.37763975155279506, "grad_norm": 5.725738525390625, "learning_rate": 0.0001811552795031056, "loss": 1.7253, "step": 1520 }, { "epoch": 0.3801242236024845, "grad_norm": 7.441699028015137, "learning_rate": 0.00018103105590062114, "loss": 1.4803, "step": 1530 }, { "epoch": 0.3826086956521739, "grad_norm": 8.466215133666992, "learning_rate": 0.00018090683229813665, "loss": 1.4203, "step": 1540 }, { "epoch": 0.38509316770186336, "grad_norm": 6.456714630126953, "learning_rate": 0.00018078260869565217, "loss": 1.6594, "step": 1550 }, { "epoch": 0.3875776397515528, "grad_norm": 7.831303596496582, "learning_rate": 0.0001806583850931677, "loss": 1.4667, "step": 1560 }, { "epoch": 0.39006211180124223, "grad_norm": 5.758781909942627, "learning_rate": 0.00018053416149068323, "loss": 1.651, "step": 1570 }, { "epoch": 0.39254658385093166, "grad_norm": 8.013723373413086, "learning_rate": 0.00018040993788819877, "loss": 1.3823, "step": 1580 }, { "epoch": 0.3950310559006211, "grad_norm": 4.54691219329834, "learning_rate": 0.00018028571428571432, "loss": 1.6822, "step": 1590 }, { "epoch": 0.39751552795031053, "grad_norm": 5.699431419372559, "learning_rate": 0.00018016149068322983, "loss": 1.3327, "step": 1600 }, { "epoch": 0.39751552795031053, "eval_accuracy": 0.6713895978174778, "eval_loss": 1.3360953330993652, "eval_runtime": 87.1032, "eval_samples_per_second": 130.454, "eval_steps_per_second": 16.314, "step": 1600 }, { "epoch": 0.4, "grad_norm": 4.3417205810546875, "learning_rate": 0.00018003726708074535, "loss": 1.5109, "step": 1610 }, { "epoch": 0.40248447204968946, "grad_norm": 7.195901870727539, "learning_rate": 0.0001799130434782609, "loss": 1.4802, "step": 1620 }, { "epoch": 0.4049689440993789, "grad_norm": 8.806529998779297, "learning_rate": 0.0001797888198757764, "loss": 1.5731, "step": 1630 }, { "epoch": 0.4074534161490683, "grad_norm": 6.9273834228515625, "learning_rate": 0.00017966459627329192, "loss": 1.5988, "step": 1640 }, { "epoch": 0.40993788819875776, "grad_norm": 5.9617838859558105, "learning_rate": 0.00017954037267080747, "loss": 1.6041, "step": 1650 }, { "epoch": 0.4124223602484472, "grad_norm": 5.656233787536621, "learning_rate": 0.00017941614906832298, "loss": 1.6649, "step": 1660 }, { "epoch": 0.41490683229813663, "grad_norm": 5.794583797454834, "learning_rate": 0.00017929192546583853, "loss": 1.5536, "step": 1670 }, { "epoch": 0.41739130434782606, "grad_norm": 7.5949320793151855, "learning_rate": 0.00017916770186335404, "loss": 1.7431, "step": 1680 }, { "epoch": 0.41987577639751555, "grad_norm": 4.496397972106934, "learning_rate": 0.0001790434782608696, "loss": 1.6657, "step": 1690 }, { "epoch": 0.422360248447205, "grad_norm": 5.932600498199463, "learning_rate": 0.0001789192546583851, "loss": 1.53, "step": 1700 }, { "epoch": 0.422360248447205, "eval_accuracy": 0.6697175041802341, "eval_loss": 1.3424873352050781, "eval_runtime": 86.0547, "eval_samples_per_second": 132.044, "eval_steps_per_second": 16.513, "step": 1700 }, { "epoch": 0.4248447204968944, "grad_norm": 5.496968746185303, "learning_rate": 0.00017879503105590062, "loss": 1.5811, "step": 1710 }, { "epoch": 0.42732919254658386, "grad_norm": 5.838241100311279, "learning_rate": 0.00017867080745341616, "loss": 1.2809, "step": 1720 }, { "epoch": 0.4298136645962733, "grad_norm": 8.081803321838379, "learning_rate": 0.00017854658385093168, "loss": 1.5387, "step": 1730 }, { "epoch": 0.4322981366459627, "grad_norm": 5.952935218811035, "learning_rate": 0.0001784223602484472, "loss": 1.5652, "step": 1740 }, { "epoch": 0.43478260869565216, "grad_norm": 8.004572868347168, "learning_rate": 0.00017829813664596274, "loss": 1.4191, "step": 1750 }, { "epoch": 0.4372670807453416, "grad_norm": 7.268871784210205, "learning_rate": 0.00017817391304347828, "loss": 1.2636, "step": 1760 }, { "epoch": 0.43975155279503103, "grad_norm": 6.050431251525879, "learning_rate": 0.0001780496894409938, "loss": 1.3059, "step": 1770 }, { "epoch": 0.4422360248447205, "grad_norm": 6.983301639556885, "learning_rate": 0.00017792546583850934, "loss": 1.6516, "step": 1780 }, { "epoch": 0.44472049689440996, "grad_norm": 11.398016929626465, "learning_rate": 0.00017780124223602486, "loss": 1.3813, "step": 1790 }, { "epoch": 0.4472049689440994, "grad_norm": 7.321614742279053, "learning_rate": 0.00017767701863354038, "loss": 1.538, "step": 1800 }, { "epoch": 0.4472049689440994, "eval_accuracy": 0.6641731936988471, "eval_loss": 1.3452919721603394, "eval_runtime": 88.8223, "eval_samples_per_second": 127.93, "eval_steps_per_second": 15.998, "step": 1800 }, { "epoch": 0.4496894409937888, "grad_norm": 3.871507167816162, "learning_rate": 0.00017755279503105592, "loss": 1.2088, "step": 1810 }, { "epoch": 0.45217391304347826, "grad_norm": 5.824620723724365, "learning_rate": 0.00017742857142857144, "loss": 1.5872, "step": 1820 }, { "epoch": 0.4546583850931677, "grad_norm": 6.564426422119141, "learning_rate": 0.00017730434782608695, "loss": 1.3216, "step": 1830 }, { "epoch": 0.45714285714285713, "grad_norm": 6.470206260681152, "learning_rate": 0.0001771801242236025, "loss": 1.2494, "step": 1840 }, { "epoch": 0.45962732919254656, "grad_norm": 9.240300178527832, "learning_rate": 0.00017705590062111804, "loss": 1.7409, "step": 1850 }, { "epoch": 0.462111801242236, "grad_norm": 8.439705848693848, "learning_rate": 0.00017693167701863356, "loss": 1.5075, "step": 1860 }, { "epoch": 0.4645962732919255, "grad_norm": 6.919085502624512, "learning_rate": 0.00017680745341614907, "loss": 1.4267, "step": 1870 }, { "epoch": 0.4670807453416149, "grad_norm": 5.995780944824219, "learning_rate": 0.00017668322981366461, "loss": 1.5704, "step": 1880 }, { "epoch": 0.46956521739130436, "grad_norm": 6.788804531097412, "learning_rate": 0.00017655900621118013, "loss": 1.2365, "step": 1890 }, { "epoch": 0.4720496894409938, "grad_norm": 6.92108678817749, "learning_rate": 0.00017643478260869565, "loss": 1.5056, "step": 1900 }, { "epoch": 0.4720496894409938, "eval_accuracy": 0.6783419871512805, "eval_loss": 1.2742019891738892, "eval_runtime": 87.1221, "eval_samples_per_second": 130.426, "eval_steps_per_second": 16.31, "step": 1900 }, { "epoch": 0.4745341614906832, "grad_norm": 8.66635513305664, "learning_rate": 0.0001763105590062112, "loss": 1.547, "step": 1910 }, { "epoch": 0.47701863354037266, "grad_norm": 5.245086193084717, "learning_rate": 0.0001761863354037267, "loss": 1.441, "step": 1920 }, { "epoch": 0.4795031055900621, "grad_norm": 6.949382781982422, "learning_rate": 0.00017606211180124222, "loss": 1.5288, "step": 1930 }, { "epoch": 0.48198757763975153, "grad_norm": 9.583054542541504, "learning_rate": 0.0001759378881987578, "loss": 1.1384, "step": 1940 }, { "epoch": 0.484472049689441, "grad_norm": 5.83560037612915, "learning_rate": 0.0001758136645962733, "loss": 1.2672, "step": 1950 }, { "epoch": 0.48695652173913045, "grad_norm": 6.719588756561279, "learning_rate": 0.00017568944099378883, "loss": 1.4713, "step": 1960 }, { "epoch": 0.4894409937888199, "grad_norm": 5.651910781860352, "learning_rate": 0.00017556521739130437, "loss": 1.6415, "step": 1970 }, { "epoch": 0.4919254658385093, "grad_norm": 5.4755706787109375, "learning_rate": 0.0001754409937888199, "loss": 1.4491, "step": 1980 }, { "epoch": 0.49440993788819876, "grad_norm": 4.658782482147217, "learning_rate": 0.0001753167701863354, "loss": 1.379, "step": 1990 }, { "epoch": 0.4968944099378882, "grad_norm": 7.050572872161865, "learning_rate": 0.00017519254658385095, "loss": 1.2728, "step": 2000 }, { "epoch": 0.4968944099378882, "eval_accuracy": 0.7044794508492476, "eval_loss": 1.1779495477676392, "eval_runtime": 87.0589, "eval_samples_per_second": 130.521, "eval_steps_per_second": 16.322, "step": 2000 }, { "epoch": 0.4993788819875776, "grad_norm": 7.556181907653809, "learning_rate": 0.00017506832298136646, "loss": 1.5583, "step": 2010 }, { "epoch": 0.5018633540372671, "grad_norm": 7.117518901824951, "learning_rate": 0.00017494409937888198, "loss": 1.6017, "step": 2020 }, { "epoch": 0.5043478260869565, "grad_norm": 6.174365043640137, "learning_rate": 0.00017481987577639752, "loss": 1.4675, "step": 2030 }, { "epoch": 0.506832298136646, "grad_norm": 6.404329299926758, "learning_rate": 0.00017469565217391307, "loss": 1.5378, "step": 2040 }, { "epoch": 0.5093167701863354, "grad_norm": 8.110492706298828, "learning_rate": 0.00017457142857142858, "loss": 1.488, "step": 2050 }, { "epoch": 0.5118012422360249, "grad_norm": 3.424097776412964, "learning_rate": 0.0001744472049689441, "loss": 1.2121, "step": 2060 }, { "epoch": 0.5142857142857142, "grad_norm": 5.714499473571777, "learning_rate": 0.00017432298136645964, "loss": 1.2844, "step": 2070 }, { "epoch": 0.5167701863354037, "grad_norm": 8.632834434509277, "learning_rate": 0.00017419875776397516, "loss": 1.2707, "step": 2080 }, { "epoch": 0.5192546583850932, "grad_norm": 7.8250956535339355, "learning_rate": 0.00017407453416149067, "loss": 1.4057, "step": 2090 }, { "epoch": 0.5217391304347826, "grad_norm": 6.396978855133057, "learning_rate": 0.00017395031055900622, "loss": 1.1734, "step": 2100 }, { "epoch": 0.5217391304347826, "eval_accuracy": 0.680806125143008, "eval_loss": 1.2630212306976318, "eval_runtime": 87.1325, "eval_samples_per_second": 130.411, "eval_steps_per_second": 16.309, "step": 2100 }, { "epoch": 0.5242236024844721, "grad_norm": 4.478389739990234, "learning_rate": 0.00017382608695652173, "loss": 1.6825, "step": 2110 }, { "epoch": 0.5267080745341615, "grad_norm": 5.685409069061279, "learning_rate": 0.00017370186335403728, "loss": 1.1221, "step": 2120 }, { "epoch": 0.529192546583851, "grad_norm": 7.367899417877197, "learning_rate": 0.00017357763975155282, "loss": 1.537, "step": 2130 }, { "epoch": 0.5316770186335403, "grad_norm": 8.052840232849121, "learning_rate": 0.00017345341614906834, "loss": 1.4139, "step": 2140 }, { "epoch": 0.5341614906832298, "grad_norm": 6.265495777130127, "learning_rate": 0.00017332919254658385, "loss": 1.2073, "step": 2150 }, { "epoch": 0.5366459627329192, "grad_norm": 6.785367488861084, "learning_rate": 0.0001732049689440994, "loss": 1.4182, "step": 2160 }, { "epoch": 0.5391304347826087, "grad_norm": 7.20573091506958, "learning_rate": 0.00017308074534161491, "loss": 1.3468, "step": 2170 }, { "epoch": 0.5416149068322982, "grad_norm": 9.518648147583008, "learning_rate": 0.00017295652173913043, "loss": 1.393, "step": 2180 }, { "epoch": 0.5440993788819876, "grad_norm": 8.566499710083008, "learning_rate": 0.00017283229813664597, "loss": 1.414, "step": 2190 }, { "epoch": 0.546583850931677, "grad_norm": 9.845856666564941, "learning_rate": 0.0001727080745341615, "loss": 1.527, "step": 2200 }, { "epoch": 0.546583850931677, "eval_accuracy": 0.702279327642348, "eval_loss": 1.1809625625610352, "eval_runtime": 86.1061, "eval_samples_per_second": 131.965, "eval_steps_per_second": 16.503, "step": 2200 }, { "epoch": 0.5490683229813664, "grad_norm": 9.88825798034668, "learning_rate": 0.00017258385093167703, "loss": 1.3398, "step": 2210 }, { "epoch": 0.5515527950310559, "grad_norm": 4.545001029968262, "learning_rate": 0.00017245962732919255, "loss": 1.7528, "step": 2220 }, { "epoch": 0.5540372670807453, "grad_norm": 11.04814338684082, "learning_rate": 0.0001723354037267081, "loss": 1.2975, "step": 2230 }, { "epoch": 0.5565217391304348, "grad_norm": 6.28684139251709, "learning_rate": 0.0001722111801242236, "loss": 1.4086, "step": 2240 }, { "epoch": 0.5590062111801242, "grad_norm": 7.978612422943115, "learning_rate": 0.00017208695652173915, "loss": 1.4632, "step": 2250 }, { "epoch": 0.5614906832298137, "grad_norm": 5.173329830169678, "learning_rate": 0.00017196273291925467, "loss": 1.5102, "step": 2260 }, { "epoch": 0.5639751552795031, "grad_norm": 5.533884048461914, "learning_rate": 0.00017183850931677019, "loss": 1.4573, "step": 2270 }, { "epoch": 0.5664596273291925, "grad_norm": 7.535440444946289, "learning_rate": 0.00017171428571428573, "loss": 1.6981, "step": 2280 }, { "epoch": 0.568944099378882, "grad_norm": 7.52562952041626, "learning_rate": 0.00017159006211180125, "loss": 1.2332, "step": 2290 }, { "epoch": 0.5714285714285714, "grad_norm": 6.707581043243408, "learning_rate": 0.00017146583850931676, "loss": 1.3873, "step": 2300 }, { "epoch": 0.5714285714285714, "eval_accuracy": 0.7039514212795916, "eval_loss": 1.1831145286560059, "eval_runtime": 85.9731, "eval_samples_per_second": 132.169, "eval_steps_per_second": 16.528, "step": 2300 }, { "epoch": 0.5739130434782609, "grad_norm": 9.480440139770508, "learning_rate": 0.0001713416149068323, "loss": 1.576, "step": 2310 }, { "epoch": 0.5763975155279503, "grad_norm": 9.64328384399414, "learning_rate": 0.00017121739130434785, "loss": 1.4841, "step": 2320 }, { "epoch": 0.5788819875776398, "grad_norm": 6.3002610206604, "learning_rate": 0.00017109316770186337, "loss": 1.2611, "step": 2330 }, { "epoch": 0.5813664596273292, "grad_norm": 7.7264275550842285, "learning_rate": 0.00017096894409937888, "loss": 1.4146, "step": 2340 }, { "epoch": 0.5838509316770186, "grad_norm": 6.963201999664307, "learning_rate": 0.00017084472049689443, "loss": 1.4925, "step": 2350 }, { "epoch": 0.5863354037267081, "grad_norm": 6.235733985900879, "learning_rate": 0.00017072049689440994, "loss": 1.4015, "step": 2360 }, { "epoch": 0.5888198757763975, "grad_norm": 7.08598518371582, "learning_rate": 0.00017059627329192546, "loss": 1.3037, "step": 2370 }, { "epoch": 0.591304347826087, "grad_norm": 6.619434356689453, "learning_rate": 0.000170472049689441, "loss": 1.6309, "step": 2380 }, { "epoch": 0.5937888198757764, "grad_norm": 6.332421779632568, "learning_rate": 0.00017034782608695652, "loss": 1.3557, "step": 2390 }, { "epoch": 0.5962732919254659, "grad_norm": 6.135610580444336, "learning_rate": 0.00017022360248447206, "loss": 1.3545, "step": 2400 }, { "epoch": 0.5962732919254659, "eval_accuracy": 0.7001672093637243, "eval_loss": 1.1835651397705078, "eval_runtime": 86.0365, "eval_samples_per_second": 132.072, "eval_steps_per_second": 16.516, "step": 2400 }, { "epoch": 0.5987577639751552, "grad_norm": 9.877408981323242, "learning_rate": 0.0001700993788819876, "loss": 1.2388, "step": 2410 }, { "epoch": 0.6012422360248447, "grad_norm": 6.421914100646973, "learning_rate": 0.00016997515527950312, "loss": 1.4432, "step": 2420 }, { "epoch": 0.6037267080745342, "grad_norm": 5.323935508728027, "learning_rate": 0.00016985093167701864, "loss": 1.3144, "step": 2430 }, { "epoch": 0.6062111801242236, "grad_norm": 12.48570728302002, "learning_rate": 0.00016972670807453418, "loss": 1.5679, "step": 2440 }, { "epoch": 0.6086956521739131, "grad_norm": 6.593123912811279, "learning_rate": 0.0001696024844720497, "loss": 1.2275, "step": 2450 }, { "epoch": 0.6111801242236025, "grad_norm": 6.936142444610596, "learning_rate": 0.0001694782608695652, "loss": 1.1774, "step": 2460 }, { "epoch": 0.613664596273292, "grad_norm": 7.791112899780273, "learning_rate": 0.00016935403726708076, "loss": 1.6099, "step": 2470 }, { "epoch": 0.6161490683229813, "grad_norm": 6.408988952636719, "learning_rate": 0.00016922981366459627, "loss": 1.4584, "step": 2480 }, { "epoch": 0.6186335403726708, "grad_norm": 8.7936429977417, "learning_rate": 0.00016910559006211182, "loss": 1.3348, "step": 2490 }, { "epoch": 0.6211180124223602, "grad_norm": 4.882345676422119, "learning_rate": 0.00016898136645962733, "loss": 1.4842, "step": 2500 }, { "epoch": 0.6211180124223602, "eval_accuracy": 0.7129279239637419, "eval_loss": 1.1441054344177246, "eval_runtime": 87.2725, "eval_samples_per_second": 130.201, "eval_steps_per_second": 16.282, "step": 2500 }, { "epoch": 0.6236024844720497, "grad_norm": 7.860159873962402, "learning_rate": 0.00016885714285714288, "loss": 1.4621, "step": 2510 }, { "epoch": 0.6260869565217392, "grad_norm": 5.460740089416504, "learning_rate": 0.0001687329192546584, "loss": 1.4405, "step": 2520 }, { "epoch": 0.6285714285714286, "grad_norm": 9.96655559539795, "learning_rate": 0.0001686086956521739, "loss": 1.5311, "step": 2530 }, { "epoch": 0.631055900621118, "grad_norm": 7.057131767272949, "learning_rate": 0.00016848447204968945, "loss": 1.4878, "step": 2540 }, { "epoch": 0.6335403726708074, "grad_norm": 6.061126708984375, "learning_rate": 0.00016836024844720497, "loss": 1.2133, "step": 2550 }, { "epoch": 0.6360248447204969, "grad_norm": 7.528930187225342, "learning_rate": 0.00016823602484472049, "loss": 1.4039, "step": 2560 }, { "epoch": 0.6385093167701863, "grad_norm": 4.734296798706055, "learning_rate": 0.00016811180124223603, "loss": 1.3136, "step": 2570 }, { "epoch": 0.6409937888198758, "grad_norm": 10.213302612304688, "learning_rate": 0.00016798757763975157, "loss": 1.0263, "step": 2580 }, { "epoch": 0.6434782608695652, "grad_norm": 7.67819881439209, "learning_rate": 0.0001678633540372671, "loss": 1.5417, "step": 2590 }, { "epoch": 0.6459627329192547, "grad_norm": 10.029603958129883, "learning_rate": 0.00016773913043478263, "loss": 1.1974, "step": 2600 }, { "epoch": 0.6459627329192547, "eval_accuracy": 0.7154800668837454, "eval_loss": 1.1230041980743408, "eval_runtime": 86.065, "eval_samples_per_second": 132.028, "eval_steps_per_second": 16.511, "step": 2600 }, { "epoch": 0.6484472049689441, "grad_norm": 12.451225280761719, "learning_rate": 0.00016761490683229815, "loss": 1.3637, "step": 2610 }, { "epoch": 0.6509316770186335, "grad_norm": 8.255215644836426, "learning_rate": 0.00016749068322981366, "loss": 1.3378, "step": 2620 }, { "epoch": 0.653416149068323, "grad_norm": 5.389623165130615, "learning_rate": 0.0001673664596273292, "loss": 1.3536, "step": 2630 }, { "epoch": 0.6559006211180124, "grad_norm": 7.741150856018066, "learning_rate": 0.00016724223602484472, "loss": 1.3554, "step": 2640 }, { "epoch": 0.6583850931677019, "grad_norm": 5.791994094848633, "learning_rate": 0.00016711801242236024, "loss": 1.1869, "step": 2650 }, { "epoch": 0.6608695652173913, "grad_norm": 6.631389141082764, "learning_rate": 0.00016699378881987578, "loss": 1.2872, "step": 2660 }, { "epoch": 0.6633540372670808, "grad_norm": 89.58702087402344, "learning_rate": 0.00016686956521739133, "loss": 1.449, "step": 2670 }, { "epoch": 0.6658385093167701, "grad_norm": 9.893950462341309, "learning_rate": 0.00016674534161490684, "loss": 1.3797, "step": 2680 }, { "epoch": 0.6683229813664596, "grad_norm": 8.019680976867676, "learning_rate": 0.00016662111801242236, "loss": 1.659, "step": 2690 }, { "epoch": 0.6708074534161491, "grad_norm": 5.2843499183654785, "learning_rate": 0.0001664968944099379, "loss": 1.4204, "step": 2700 }, { "epoch": 0.6708074534161491, "eval_accuracy": 0.7001672093637243, "eval_loss": 1.1766126155853271, "eval_runtime": 86.8872, "eval_samples_per_second": 130.779, "eval_steps_per_second": 16.355, "step": 2700 }, { "epoch": 0.6732919254658385, "grad_norm": 7.297257423400879, "learning_rate": 0.00016637267080745342, "loss": 1.2366, "step": 2710 }, { "epoch": 0.675776397515528, "grad_norm": 6.853038787841797, "learning_rate": 0.00016624844720496894, "loss": 1.2613, "step": 2720 }, { "epoch": 0.6782608695652174, "grad_norm": 10.860264778137207, "learning_rate": 0.00016612422360248448, "loss": 1.4677, "step": 2730 }, { "epoch": 0.6807453416149069, "grad_norm": 7.402227878570557, "learning_rate": 0.000166, "loss": 1.324, "step": 2740 }, { "epoch": 0.6832298136645962, "grad_norm": 7.668711185455322, "learning_rate": 0.0001658757763975155, "loss": 1.3704, "step": 2750 }, { "epoch": 0.6857142857142857, "grad_norm": 7.363369464874268, "learning_rate": 0.00016575155279503108, "loss": 1.3618, "step": 2760 }, { "epoch": 0.6881987577639752, "grad_norm": 4.960102081298828, "learning_rate": 0.0001656273291925466, "loss": 1.2222, "step": 2770 }, { "epoch": 0.6906832298136646, "grad_norm": 6.821535110473633, "learning_rate": 0.00016550310559006212, "loss": 1.4079, "step": 2780 }, { "epoch": 0.6931677018633541, "grad_norm": 5.65289306640625, "learning_rate": 0.00016537888198757766, "loss": 1.4243, "step": 2790 }, { "epoch": 0.6956521739130435, "grad_norm": 6.178348064422607, "learning_rate": 0.00016525465838509318, "loss": 1.152, "step": 2800 }, { "epoch": 0.6956521739130435, "eval_accuracy": 0.6949749185954414, "eval_loss": 1.2165684700012207, "eval_runtime": 85.8436, "eval_samples_per_second": 132.369, "eval_steps_per_second": 16.553, "step": 2800 }, { "epoch": 0.698136645962733, "grad_norm": 6.465919494628906, "learning_rate": 0.0001651304347826087, "loss": 1.3611, "step": 2810 }, { "epoch": 0.7006211180124223, "grad_norm": 7.679103374481201, "learning_rate": 0.00016500621118012424, "loss": 1.1199, "step": 2820 }, { "epoch": 0.7031055900621118, "grad_norm": 4.632389545440674, "learning_rate": 0.00016488198757763975, "loss": 1.3998, "step": 2830 }, { "epoch": 0.7055900621118012, "grad_norm": 6.801785945892334, "learning_rate": 0.00016475776397515527, "loss": 1.2069, "step": 2840 }, { "epoch": 0.7080745341614907, "grad_norm": 9.706809997558594, "learning_rate": 0.0001646335403726708, "loss": 1.192, "step": 2850 }, { "epoch": 0.7105590062111802, "grad_norm": 4.336630344390869, "learning_rate": 0.00016450931677018636, "loss": 1.0797, "step": 2860 }, { "epoch": 0.7130434782608696, "grad_norm": 7.028838157653809, "learning_rate": 0.00016438509316770187, "loss": 1.3934, "step": 2870 }, { "epoch": 0.715527950310559, "grad_norm": 7.961177349090576, "learning_rate": 0.0001642608695652174, "loss": 1.4124, "step": 2880 }, { "epoch": 0.7180124223602484, "grad_norm": 8.568161964416504, "learning_rate": 0.00016413664596273293, "loss": 1.3617, "step": 2890 }, { "epoch": 0.7204968944099379, "grad_norm": 8.702705383300781, "learning_rate": 0.00016401242236024845, "loss": 1.162, "step": 2900 }, { "epoch": 0.7204968944099379, "eval_accuracy": 0.7002552142920003, "eval_loss": 1.167386531829834, "eval_runtime": 86.3186, "eval_samples_per_second": 131.64, "eval_steps_per_second": 16.462, "step": 2900 }, { "epoch": 0.7229813664596273, "grad_norm": 5.8269147872924805, "learning_rate": 0.000163888198757764, "loss": 1.4158, "step": 2910 }, { "epoch": 0.7254658385093168, "grad_norm": 7.1003899574279785, "learning_rate": 0.0001637639751552795, "loss": 1.174, "step": 2920 }, { "epoch": 0.7279503105590062, "grad_norm": 6.107857704162598, "learning_rate": 0.00016363975155279502, "loss": 1.2128, "step": 2930 }, { "epoch": 0.7304347826086957, "grad_norm": 6.136083126068115, "learning_rate": 0.00016351552795031057, "loss": 1.5222, "step": 2940 }, { "epoch": 0.7329192546583851, "grad_norm": 8.518939018249512, "learning_rate": 0.0001633913043478261, "loss": 1.4467, "step": 2950 }, { "epoch": 0.7354037267080745, "grad_norm": 8.945500373840332, "learning_rate": 0.00016326708074534163, "loss": 1.2919, "step": 2960 }, { "epoch": 0.737888198757764, "grad_norm": 5.567399978637695, "learning_rate": 0.00016314285714285714, "loss": 1.3656, "step": 2970 }, { "epoch": 0.7403726708074534, "grad_norm": 6.591121196746826, "learning_rate": 0.0001630186335403727, "loss": 1.3927, "step": 2980 }, { "epoch": 0.7428571428571429, "grad_norm": 7.108632564544678, "learning_rate": 0.0001628944099378882, "loss": 1.2373, "step": 2990 }, { "epoch": 0.7453416149068323, "grad_norm": 6.770077705383301, "learning_rate": 0.00016277018633540372, "loss": 1.4516, "step": 3000 }, { "epoch": 0.7453416149068323, "eval_accuracy": 0.7139839831030538, "eval_loss": 1.1207355260849, "eval_runtime": 86.4165, "eval_samples_per_second": 131.491, "eval_steps_per_second": 16.444, "step": 3000 }, { "epoch": 0.7478260869565218, "grad_norm": 5.914898872375488, "learning_rate": 0.00016264596273291926, "loss": 1.2147, "step": 3010 }, { "epoch": 0.7503105590062111, "grad_norm": 9.71444320678711, "learning_rate": 0.00016252173913043478, "loss": 1.411, "step": 3020 }, { "epoch": 0.7527950310559006, "grad_norm": 6.712387561798096, "learning_rate": 0.00016239751552795032, "loss": 1.4371, "step": 3030 }, { "epoch": 0.7552795031055901, "grad_norm": 4.184564113616943, "learning_rate": 0.00016227329192546587, "loss": 1.2996, "step": 3040 }, { "epoch": 0.7577639751552795, "grad_norm": 6.321875095367432, "learning_rate": 0.00016214906832298138, "loss": 1.2506, "step": 3050 }, { "epoch": 0.760248447204969, "grad_norm": 5.48466682434082, "learning_rate": 0.0001620248447204969, "loss": 1.1892, "step": 3060 }, { "epoch": 0.7627329192546584, "grad_norm": 8.954041481018066, "learning_rate": 0.00016190062111801244, "loss": 1.5073, "step": 3070 }, { "epoch": 0.7652173913043478, "grad_norm": 6.705496788024902, "learning_rate": 0.00016177639751552796, "loss": 1.3815, "step": 3080 }, { "epoch": 0.7677018633540372, "grad_norm": 9.638246536254883, "learning_rate": 0.00016165217391304347, "loss": 1.4076, "step": 3090 }, { "epoch": 0.7701863354037267, "grad_norm": 9.326358795166016, "learning_rate": 0.00016152795031055902, "loss": 1.2378, "step": 3100 }, { "epoch": 0.7701863354037267, "eval_accuracy": 0.6905746721816421, "eval_loss": 1.2071986198425293, "eval_runtime": 86.5208, "eval_samples_per_second": 131.333, "eval_steps_per_second": 16.424, "step": 3100 }, { "epoch": 0.7726708074534161, "grad_norm": 8.85179328918457, "learning_rate": 0.00016140372670807453, "loss": 1.5347, "step": 3110 }, { "epoch": 0.7751552795031056, "grad_norm": 6.758512020111084, "learning_rate": 0.00016127950310559008, "loss": 1.3171, "step": 3120 }, { "epoch": 0.7776397515527951, "grad_norm": 5.798080921173096, "learning_rate": 0.0001611552795031056, "loss": 1.2583, "step": 3130 }, { "epoch": 0.7801242236024845, "grad_norm": 5.800971984863281, "learning_rate": 0.00016103105590062114, "loss": 1.116, "step": 3140 }, { "epoch": 0.782608695652174, "grad_norm": 6.780196189880371, "learning_rate": 0.00016090683229813665, "loss": 1.3495, "step": 3150 }, { "epoch": 0.7850931677018633, "grad_norm": 6.8307719230651855, "learning_rate": 0.00016078260869565217, "loss": 1.1167, "step": 3160 }, { "epoch": 0.7875776397515528, "grad_norm": 10.045748710632324, "learning_rate": 0.00016065838509316771, "loss": 1.1134, "step": 3170 }, { "epoch": 0.7900621118012422, "grad_norm": 6.177084922790527, "learning_rate": 0.00016053416149068323, "loss": 1.206, "step": 3180 }, { "epoch": 0.7925465838509317, "grad_norm": 4.914190292358398, "learning_rate": 0.00016040993788819875, "loss": 1.3714, "step": 3190 }, { "epoch": 0.7950310559006211, "grad_norm": 7.478468894958496, "learning_rate": 0.0001602857142857143, "loss": 0.991, "step": 3200 }, { "epoch": 0.7950310559006211, "eval_accuracy": 0.7131039338202939, "eval_loss": 1.1121686697006226, "eval_runtime": 86.2088, "eval_samples_per_second": 131.808, "eval_steps_per_second": 16.483, "step": 3200 }, { "epoch": 0.7975155279503106, "grad_norm": 6.4600982666015625, "learning_rate": 0.00016016149068322983, "loss": 1.2865, "step": 3210 }, { "epoch": 0.8, "grad_norm": 5.785561561584473, "learning_rate": 0.00016003726708074535, "loss": 1.4614, "step": 3220 }, { "epoch": 0.8024844720496894, "grad_norm": 4.1848015785217285, "learning_rate": 0.0001599130434782609, "loss": 1.1712, "step": 3230 }, { "epoch": 0.8049689440993789, "grad_norm": 4.002833843231201, "learning_rate": 0.0001597888198757764, "loss": 1.3205, "step": 3240 }, { "epoch": 0.8074534161490683, "grad_norm": 4.33705997467041, "learning_rate": 0.00015966459627329193, "loss": 1.3718, "step": 3250 }, { "epoch": 0.8099378881987578, "grad_norm": 6.072953224182129, "learning_rate": 0.00015954037267080747, "loss": 1.4363, "step": 3260 }, { "epoch": 0.8124223602484472, "grad_norm": 5.311767578125, "learning_rate": 0.00015941614906832299, "loss": 1.3391, "step": 3270 }, { "epoch": 0.8149068322981367, "grad_norm": 6.9105024337768555, "learning_rate": 0.0001592919254658385, "loss": 1.2966, "step": 3280 }, { "epoch": 0.8173913043478261, "grad_norm": 5.310636043548584, "learning_rate": 0.00015916770186335405, "loss": 1.1282, "step": 3290 }, { "epoch": 0.8198757763975155, "grad_norm": 5.895457744598389, "learning_rate": 0.0001590434782608696, "loss": 1.3078, "step": 3300 }, { "epoch": 0.8198757763975155, "eval_accuracy": 0.7169761506644372, "eval_loss": 1.1206748485565186, "eval_runtime": 86.8832, "eval_samples_per_second": 130.785, "eval_steps_per_second": 16.355, "step": 3300 }, { "epoch": 0.822360248447205, "grad_norm": 5.530759334564209, "learning_rate": 0.0001589192546583851, "loss": 1.3002, "step": 3310 }, { "epoch": 0.8248447204968944, "grad_norm": 7.9369072914123535, "learning_rate": 0.00015879503105590062, "loss": 1.289, "step": 3320 }, { "epoch": 0.8273291925465839, "grad_norm": 7.3485426902771, "learning_rate": 0.00015867080745341617, "loss": 1.4236, "step": 3330 }, { "epoch": 0.8298136645962733, "grad_norm": 6.818698883056641, "learning_rate": 0.00015854658385093168, "loss": 1.2176, "step": 3340 }, { "epoch": 0.8322981366459627, "grad_norm": 6.358404159545898, "learning_rate": 0.0001584223602484472, "loss": 1.1425, "step": 3350 }, { "epoch": 0.8347826086956521, "grad_norm": 3.939678907394409, "learning_rate": 0.00015829813664596274, "loss": 1.5184, "step": 3360 }, { "epoch": 0.8372670807453416, "grad_norm": 7.679263114929199, "learning_rate": 0.00015817391304347826, "loss": 1.4098, "step": 3370 }, { "epoch": 0.8397515527950311, "grad_norm": 4.054044723510742, "learning_rate": 0.00015804968944099377, "loss": 1.2641, "step": 3380 }, { "epoch": 0.8422360248447205, "grad_norm": 8.686745643615723, "learning_rate": 0.00015792546583850934, "loss": 1.0001, "step": 3390 }, { "epoch": 0.84472049689441, "grad_norm": 4.359888076782227, "learning_rate": 0.00015780124223602486, "loss": 1.1483, "step": 3400 }, { "epoch": 0.84472049689441, "eval_accuracy": 0.7245445744961718, "eval_loss": 1.066516637802124, "eval_runtime": 85.9778, "eval_samples_per_second": 132.162, "eval_steps_per_second": 16.528, "step": 3400 }, { "epoch": 0.8472049689440994, "grad_norm": 6.710513591766357, "learning_rate": 0.00015767701863354038, "loss": 1.371, "step": 3410 }, { "epoch": 0.8496894409937888, "grad_norm": 5.640341281890869, "learning_rate": 0.00015755279503105592, "loss": 0.8962, "step": 3420 }, { "epoch": 0.8521739130434782, "grad_norm": 9.07288646697998, "learning_rate": 0.00015742857142857144, "loss": 1.1876, "step": 3430 }, { "epoch": 0.8546583850931677, "grad_norm": 6.409737586975098, "learning_rate": 0.00015730434782608695, "loss": 1.1879, "step": 3440 }, { "epoch": 0.8571428571428571, "grad_norm": 7.162034511566162, "learning_rate": 0.0001571801242236025, "loss": 1.1047, "step": 3450 }, { "epoch": 0.8596273291925466, "grad_norm": 10.321228981018066, "learning_rate": 0.000157055900621118, "loss": 1.3303, "step": 3460 }, { "epoch": 0.8621118012422361, "grad_norm": 7.930309772491455, "learning_rate": 0.00015693167701863353, "loss": 1.2688, "step": 3470 }, { "epoch": 0.8645962732919255, "grad_norm": 7.929530620574951, "learning_rate": 0.00015680745341614907, "loss": 1.0794, "step": 3480 }, { "epoch": 0.867080745341615, "grad_norm": 6.65020227432251, "learning_rate": 0.00015668322981366462, "loss": 1.1747, "step": 3490 }, { "epoch": 0.8695652173913043, "grad_norm": 7.833930969238281, "learning_rate": 0.00015655900621118013, "loss": 1.453, "step": 3500 }, { "epoch": 0.8695652173913043, "eval_accuracy": 0.7267446977030714, "eval_loss": 1.0639996528625488, "eval_runtime": 86.8259, "eval_samples_per_second": 130.871, "eval_steps_per_second": 16.366, "step": 3500 }, { "epoch": 0.8720496894409938, "grad_norm": 6.314217567443848, "learning_rate": 0.00015643478260869565, "loss": 1.3662, "step": 3510 }, { "epoch": 0.8745341614906832, "grad_norm": 6.935042381286621, "learning_rate": 0.0001563105590062112, "loss": 1.4166, "step": 3520 }, { "epoch": 0.8770186335403727, "grad_norm": 5.903131484985352, "learning_rate": 0.0001561863354037267, "loss": 1.3847, "step": 3530 }, { "epoch": 0.8795031055900621, "grad_norm": 5.503540515899658, "learning_rate": 0.00015606211180124223, "loss": 1.0824, "step": 3540 }, { "epoch": 0.8819875776397516, "grad_norm": 7.387447357177734, "learning_rate": 0.00015593788819875777, "loss": 1.3476, "step": 3550 }, { "epoch": 0.884472049689441, "grad_norm": 6.536509037017822, "learning_rate": 0.00015581366459627329, "loss": 1.2126, "step": 3560 }, { "epoch": 0.8869565217391304, "grad_norm": 4.404107093811035, "learning_rate": 0.00015568944099378883, "loss": 1.2508, "step": 3570 }, { "epoch": 0.8894409937888199, "grad_norm": 7.137818813323975, "learning_rate": 0.00015556521739130437, "loss": 1.1038, "step": 3580 }, { "epoch": 0.8919254658385093, "grad_norm": 3.9632694721221924, "learning_rate": 0.0001554409937888199, "loss": 1.2633, "step": 3590 }, { "epoch": 0.8944099378881988, "grad_norm": 7.339700222015381, "learning_rate": 0.0001553167701863354, "loss": 1.4457, "step": 3600 }, { "epoch": 0.8944099378881988, "eval_accuracy": 0.7321129983279063, "eval_loss": 1.0565322637557983, "eval_runtime": 85.6808, "eval_samples_per_second": 132.62, "eval_steps_per_second": 16.585, "step": 3600 }, { "epoch": 0.8968944099378882, "grad_norm": 6.658189296722412, "learning_rate": 0.00015519254658385095, "loss": 0.9933, "step": 3610 }, { "epoch": 0.8993788819875776, "grad_norm": 6.376084804534912, "learning_rate": 0.00015506832298136646, "loss": 1.2427, "step": 3620 }, { "epoch": 0.901863354037267, "grad_norm": 6.839380741119385, "learning_rate": 0.00015494409937888198, "loss": 1.2968, "step": 3630 }, { "epoch": 0.9043478260869565, "grad_norm": 6.3698601722717285, "learning_rate": 0.00015481987577639752, "loss": 1.3086, "step": 3640 }, { "epoch": 0.906832298136646, "grad_norm": 4.997156143188477, "learning_rate": 0.00015469565217391304, "loss": 1.3486, "step": 3650 }, { "epoch": 0.9093167701863354, "grad_norm": 6.0088701248168945, "learning_rate": 0.00015457142857142858, "loss": 1.235, "step": 3660 }, { "epoch": 0.9118012422360249, "grad_norm": 6.903764247894287, "learning_rate": 0.00015444720496894413, "loss": 1.2585, "step": 3670 }, { "epoch": 0.9142857142857143, "grad_norm": 7.442832946777344, "learning_rate": 0.00015432298136645964, "loss": 1.2756, "step": 3680 }, { "epoch": 0.9167701863354037, "grad_norm": 7.293776988983154, "learning_rate": 0.00015419875776397516, "loss": 1.2326, "step": 3690 }, { "epoch": 0.9192546583850931, "grad_norm": 2.9621481895446777, "learning_rate": 0.0001540745341614907, "loss": 1.1636, "step": 3700 }, { "epoch": 0.9192546583850931, "eval_accuracy": 0.7255126287072076, "eval_loss": 1.057629942893982, "eval_runtime": 86.1351, "eval_samples_per_second": 131.921, "eval_steps_per_second": 16.497, "step": 3700 }, { "epoch": 0.9217391304347826, "grad_norm": 10.847683906555176, "learning_rate": 0.00015395031055900622, "loss": 1.2353, "step": 3710 }, { "epoch": 0.924223602484472, "grad_norm": 5.985072135925293, "learning_rate": 0.00015382608695652174, "loss": 1.5326, "step": 3720 }, { "epoch": 0.9267080745341615, "grad_norm": 6.25619649887085, "learning_rate": 0.00015370186335403728, "loss": 1.2161, "step": 3730 }, { "epoch": 0.929192546583851, "grad_norm": 6.543466091156006, "learning_rate": 0.0001535776397515528, "loss": 1.4036, "step": 3740 }, { "epoch": 0.9316770186335404, "grad_norm": 5.6111555099487305, "learning_rate": 0.00015345341614906834, "loss": 1.2282, "step": 3750 }, { "epoch": 0.9341614906832298, "grad_norm": 6.730726718902588, "learning_rate": 0.00015332919254658386, "loss": 1.1281, "step": 3760 }, { "epoch": 0.9366459627329192, "grad_norm": 6.602107048034668, "learning_rate": 0.0001532049689440994, "loss": 1.1716, "step": 3770 }, { "epoch": 0.9391304347826087, "grad_norm": 2.737424612045288, "learning_rate": 0.00015308074534161492, "loss": 1.091, "step": 3780 }, { "epoch": 0.9416149068322981, "grad_norm": 6.844805717468262, "learning_rate": 0.00015295652173913043, "loss": 1.1411, "step": 3790 }, { "epoch": 0.9440993788819876, "grad_norm": 6.895637512207031, "learning_rate": 0.00015283229813664598, "loss": 1.157, "step": 3800 }, { "epoch": 0.9440993788819876, "eval_accuracy": 0.7261286632051395, "eval_loss": 1.0648393630981445, "eval_runtime": 86.8569, "eval_samples_per_second": 130.824, "eval_steps_per_second": 16.36, "step": 3800 }, { "epoch": 0.9465838509316771, "grad_norm": 6.659364223480225, "learning_rate": 0.0001527080745341615, "loss": 1.2882, "step": 3810 }, { "epoch": 0.9490683229813665, "grad_norm": 3.437624216079712, "learning_rate": 0.000152583850931677, "loss": 1.0992, "step": 3820 }, { "epoch": 0.9515527950310559, "grad_norm": 9.4873046875, "learning_rate": 0.00015245962732919255, "loss": 1.3628, "step": 3830 }, { "epoch": 0.9540372670807453, "grad_norm": 6.623880386352539, "learning_rate": 0.0001523354037267081, "loss": 1.2201, "step": 3840 }, { "epoch": 0.9565217391304348, "grad_norm": 5.347780227661133, "learning_rate": 0.0001522111801242236, "loss": 0.9752, "step": 3850 }, { "epoch": 0.9590062111801242, "grad_norm": 9.225540161132812, "learning_rate": 0.00015208695652173916, "loss": 1.2034, "step": 3860 }, { "epoch": 0.9614906832298137, "grad_norm": 5.735724925994873, "learning_rate": 0.00015196273291925467, "loss": 1.111, "step": 3870 }, { "epoch": 0.9639751552795031, "grad_norm": 5.543980598449707, "learning_rate": 0.0001518385093167702, "loss": 1.1442, "step": 3880 }, { "epoch": 0.9664596273291925, "grad_norm": 9.901732444763184, "learning_rate": 0.00015171428571428573, "loss": 1.299, "step": 3890 }, { "epoch": 0.968944099378882, "grad_norm": 8.65027141571045, "learning_rate": 0.00015159006211180125, "loss": 1.1923, "step": 3900 }, { "epoch": 0.968944099378882, "eval_accuracy": 0.7270967174161753, "eval_loss": 1.0472681522369385, "eval_runtime": 86.822, "eval_samples_per_second": 130.877, "eval_steps_per_second": 16.367, "step": 3900 }, { "epoch": 0.9714285714285714, "grad_norm": 5.825603008270264, "learning_rate": 0.00015146583850931676, "loss": 1.313, "step": 3910 }, { "epoch": 0.9739130434782609, "grad_norm": 5.283875942230225, "learning_rate": 0.0001513416149068323, "loss": 1.2346, "step": 3920 }, { "epoch": 0.9763975155279503, "grad_norm": 5.817853927612305, "learning_rate": 0.00015121739130434785, "loss": 1.3103, "step": 3930 }, { "epoch": 0.9788819875776398, "grad_norm": 8.483689308166504, "learning_rate": 0.00015109316770186337, "loss": 1.2589, "step": 3940 }, { "epoch": 0.9813664596273292, "grad_norm": 6.321104526519775, "learning_rate": 0.00015096894409937888, "loss": 1.5437, "step": 3950 }, { "epoch": 0.9838509316770186, "grad_norm": 7.132662296295166, "learning_rate": 0.00015084472049689443, "loss": 1.1178, "step": 3960 }, { "epoch": 0.986335403726708, "grad_norm": 6.257715702056885, "learning_rate": 0.00015072049689440994, "loss": 1.1324, "step": 3970 }, { "epoch": 0.9888198757763975, "grad_norm": 7.432724952697754, "learning_rate": 0.00015059627329192546, "loss": 1.2156, "step": 3980 }, { "epoch": 0.991304347826087, "grad_norm": 6.6837158203125, "learning_rate": 0.000150472049689441, "loss": 1.2655, "step": 3990 }, { "epoch": 0.9937888198757764, "grad_norm": 8.731260299682617, "learning_rate": 0.00015034782608695652, "loss": 1.2325, "step": 4000 }, { "epoch": 0.9937888198757764, "eval_accuracy": 0.7298248701927308, "eval_loss": 1.050094723701477, "eval_runtime": 87.0386, "eval_samples_per_second": 130.551, "eval_steps_per_second": 16.326, "step": 4000 }, { "epoch": 0.9962732919254659, "grad_norm": 7.174413681030273, "learning_rate": 0.00015022360248447204, "loss": 1.4024, "step": 4010 }, { "epoch": 0.9987577639751553, "grad_norm": 9.296140670776367, "learning_rate": 0.0001500993788819876, "loss": 1.292, "step": 4020 }, { "epoch": 1.0012422360248447, "grad_norm": 7.022974014282227, "learning_rate": 0.00014997515527950312, "loss": 1.1833, "step": 4030 }, { "epoch": 1.0037267080745342, "grad_norm": 7.05012321472168, "learning_rate": 0.00014985093167701864, "loss": 1.0308, "step": 4040 }, { "epoch": 1.0062111801242235, "grad_norm": 6.042240142822266, "learning_rate": 0.00014972670807453418, "loss": 0.8708, "step": 4050 }, { "epoch": 1.008695652173913, "grad_norm": 4.938986301422119, "learning_rate": 0.0001496024844720497, "loss": 1.0892, "step": 4060 }, { "epoch": 1.0111801242236025, "grad_norm": 6.403342247009277, "learning_rate": 0.00014947826086956522, "loss": 1.1606, "step": 4070 }, { "epoch": 1.013664596273292, "grad_norm": 3.8224756717681885, "learning_rate": 0.00014935403726708076, "loss": 1.0617, "step": 4080 }, { "epoch": 1.0161490683229815, "grad_norm": 7.42360782623291, "learning_rate": 0.00014922981366459627, "loss": 0.9664, "step": 4090 }, { "epoch": 1.0186335403726707, "grad_norm": 4.1559529304504395, "learning_rate": 0.0001491055900621118, "loss": 1.1503, "step": 4100 }, { "epoch": 1.0186335403726707, "eval_accuracy": 0.7242805597113439, "eval_loss": 1.0565658807754517, "eval_runtime": 86.6402, "eval_samples_per_second": 131.152, "eval_steps_per_second": 16.401, "step": 4100 }, { "epoch": 1.0211180124223602, "grad_norm": 6.328678131103516, "learning_rate": 0.00014898136645962733, "loss": 1.025, "step": 4110 }, { "epoch": 1.0236024844720497, "grad_norm": 7.9734787940979, "learning_rate": 0.00014885714285714288, "loss": 1.2318, "step": 4120 }, { "epoch": 1.0260869565217392, "grad_norm": 5.027238845825195, "learning_rate": 0.0001487329192546584, "loss": 1.2616, "step": 4130 }, { "epoch": 1.0285714285714285, "grad_norm": 7.277949810028076, "learning_rate": 0.0001486086956521739, "loss": 1.1206, "step": 4140 }, { "epoch": 1.031055900621118, "grad_norm": 7.472249984741211, "learning_rate": 0.00014848447204968945, "loss": 1.1375, "step": 4150 }, { "epoch": 1.0335403726708075, "grad_norm": 4.62937068939209, "learning_rate": 0.00014836024844720497, "loss": 0.9969, "step": 4160 }, { "epoch": 1.036024844720497, "grad_norm": 6.158135414123535, "learning_rate": 0.0001482360248447205, "loss": 1.0945, "step": 4170 }, { "epoch": 1.0385093167701864, "grad_norm": 6.552846908569336, "learning_rate": 0.00014811180124223603, "loss": 1.1422, "step": 4180 }, { "epoch": 1.0409937888198757, "grad_norm": 7.865995407104492, "learning_rate": 0.00014798757763975155, "loss": 1.0421, "step": 4190 }, { "epoch": 1.0434782608695652, "grad_norm": 6.623953819274902, "learning_rate": 0.0001478633540372671, "loss": 1.0633, "step": 4200 }, { "epoch": 1.0434782608695652, "eval_accuracy": 0.744433688286544, "eval_loss": 1.0004760026931763, "eval_runtime": 87.3833, "eval_samples_per_second": 130.036, "eval_steps_per_second": 16.262, "step": 4200 }, { "epoch": 1.0459627329192547, "grad_norm": 2.9450221061706543, "learning_rate": 0.00014773913043478263, "loss": 1.0158, "step": 4210 }, { "epoch": 1.0484472049689442, "grad_norm": 4.293970584869385, "learning_rate": 0.00014761490683229815, "loss": 0.9092, "step": 4220 }, { "epoch": 1.0509316770186334, "grad_norm": 3.9722843170166016, "learning_rate": 0.00014749068322981367, "loss": 0.9706, "step": 4230 }, { "epoch": 1.053416149068323, "grad_norm": 4.5669779777526855, "learning_rate": 0.0001473664596273292, "loss": 0.9828, "step": 4240 }, { "epoch": 1.0559006211180124, "grad_norm": 5.340195178985596, "learning_rate": 0.00014724223602484473, "loss": 0.9847, "step": 4250 }, { "epoch": 1.058385093167702, "grad_norm": 6.1555304527282715, "learning_rate": 0.00014711801242236024, "loss": 0.9667, "step": 4260 }, { "epoch": 1.0608695652173914, "grad_norm": 6.872910499572754, "learning_rate": 0.00014699378881987579, "loss": 1.1049, "step": 4270 }, { "epoch": 1.0633540372670807, "grad_norm": 6.4988861083984375, "learning_rate": 0.0001468695652173913, "loss": 1.1562, "step": 4280 }, { "epoch": 1.0658385093167702, "grad_norm": 5.785723686218262, "learning_rate": 0.00014674534161490682, "loss": 0.9364, "step": 4290 }, { "epoch": 1.0683229813664596, "grad_norm": 9.51654052734375, "learning_rate": 0.0001466211180124224, "loss": 1.2061, "step": 4300 }, { "epoch": 1.0683229813664596, "eval_accuracy": 0.7376573088092934, "eval_loss": 1.0195673704147339, "eval_runtime": 85.368, "eval_samples_per_second": 133.106, "eval_steps_per_second": 16.646, "step": 4300 }, { "epoch": 1.0708074534161491, "grad_norm": 6.055525302886963, "learning_rate": 0.0001464968944099379, "loss": 1.0418, "step": 4310 }, { "epoch": 1.0732919254658384, "grad_norm": 5.421204566955566, "learning_rate": 0.00014637267080745342, "loss": 1.0929, "step": 4320 }, { "epoch": 1.075776397515528, "grad_norm": 9.280656814575195, "learning_rate": 0.00014624844720496897, "loss": 1.2286, "step": 4330 }, { "epoch": 1.0782608695652174, "grad_norm": 4.315008640289307, "learning_rate": 0.00014612422360248448, "loss": 1.2768, "step": 4340 }, { "epoch": 1.0807453416149069, "grad_norm": 7.510447025299072, "learning_rate": 0.000146, "loss": 1.0406, "step": 4350 }, { "epoch": 1.0832298136645964, "grad_norm": 8.884886741638184, "learning_rate": 0.00014587577639751554, "loss": 1.158, "step": 4360 }, { "epoch": 1.0857142857142856, "grad_norm": 6.407387733459473, "learning_rate": 0.00014575155279503106, "loss": 1.0883, "step": 4370 }, { "epoch": 1.0881987577639751, "grad_norm": 8.888128280639648, "learning_rate": 0.00014562732919254657, "loss": 1.0214, "step": 4380 }, { "epoch": 1.0906832298136646, "grad_norm": 5.50847864151001, "learning_rate": 0.00014550310559006212, "loss": 1.0415, "step": 4390 }, { "epoch": 1.093167701863354, "grad_norm": 7.724440097808838, "learning_rate": 0.00014537888198757766, "loss": 1.0315, "step": 4400 }, { "epoch": 1.093167701863354, "eval_accuracy": 0.739153392589985, "eval_loss": 1.0139085054397583, "eval_runtime": 85.7532, "eval_samples_per_second": 132.508, "eval_steps_per_second": 16.571, "step": 4400 }, { "epoch": 1.0956521739130434, "grad_norm": 9.034687995910645, "learning_rate": 0.00014525465838509318, "loss": 0.934, "step": 4410 }, { "epoch": 1.0981366459627329, "grad_norm": 4.125546932220459, "learning_rate": 0.0001451304347826087, "loss": 0.9062, "step": 4420 }, { "epoch": 1.1006211180124224, "grad_norm": 12.423514366149902, "learning_rate": 0.00014500621118012424, "loss": 1.2444, "step": 4430 }, { "epoch": 1.1031055900621118, "grad_norm": 6.781725883483887, "learning_rate": 0.00014488198757763975, "loss": 1.1755, "step": 4440 }, { "epoch": 1.1055900621118013, "grad_norm": 3.974307060241699, "learning_rate": 0.00014475776397515527, "loss": 0.9203, "step": 4450 }, { "epoch": 1.1080745341614906, "grad_norm": 6.652670383453369, "learning_rate": 0.0001446335403726708, "loss": 0.8479, "step": 4460 }, { "epoch": 1.11055900621118, "grad_norm": 7.944617748260498, "learning_rate": 0.00014450931677018633, "loss": 1.2384, "step": 4470 }, { "epoch": 1.1130434782608696, "grad_norm": 4.334497928619385, "learning_rate": 0.00014438509316770187, "loss": 0.9322, "step": 4480 }, { "epoch": 1.115527950310559, "grad_norm": 6.265549659729004, "learning_rate": 0.00014426086956521742, "loss": 1.1439, "step": 4490 }, { "epoch": 1.1180124223602483, "grad_norm": 5.482172012329102, "learning_rate": 0.00014413664596273293, "loss": 1.038, "step": 4500 }, { "epoch": 1.1180124223602483, "eval_accuracy": 0.7317609786148024, "eval_loss": 1.029909610748291, "eval_runtime": 86.1317, "eval_samples_per_second": 131.926, "eval_steps_per_second": 16.498, "step": 4500 }, { "epoch": 1.1204968944099378, "grad_norm": 4.223867416381836, "learning_rate": 0.00014401242236024845, "loss": 1.0135, "step": 4510 }, { "epoch": 1.1229813664596273, "grad_norm": 8.013762474060059, "learning_rate": 0.000143888198757764, "loss": 1.2437, "step": 4520 }, { "epoch": 1.1254658385093168, "grad_norm": 1.782776951789856, "learning_rate": 0.0001437639751552795, "loss": 0.9916, "step": 4530 }, { "epoch": 1.1279503105590063, "grad_norm": 5.063310623168945, "learning_rate": 0.00014363975155279503, "loss": 1.0833, "step": 4540 }, { "epoch": 1.1304347826086956, "grad_norm": 5.764039516448975, "learning_rate": 0.00014351552795031057, "loss": 1.0594, "step": 4550 }, { "epoch": 1.132919254658385, "grad_norm": 8.462092399597168, "learning_rate": 0.00014339130434782609, "loss": 0.9592, "step": 4560 }, { "epoch": 1.1354037267080745, "grad_norm": 4.34237813949585, "learning_rate": 0.00014326708074534163, "loss": 0.928, "step": 4570 }, { "epoch": 1.137888198757764, "grad_norm": 7.203433036804199, "learning_rate": 0.00014314285714285715, "loss": 1.063, "step": 4580 }, { "epoch": 1.1403726708074533, "grad_norm": 7.482883930206299, "learning_rate": 0.0001430186335403727, "loss": 1.2297, "step": 4590 }, { "epoch": 1.1428571428571428, "grad_norm": 7.640567779541016, "learning_rate": 0.0001428944099378882, "loss": 0.7728, "step": 4600 }, { "epoch": 1.1428571428571428, "eval_accuracy": 0.7256886385637595, "eval_loss": 1.0522042512893677, "eval_runtime": 85.4611, "eval_samples_per_second": 132.961, "eval_steps_per_second": 16.627, "step": 4600 }, { "epoch": 1.1453416149068323, "grad_norm": 8.734424591064453, "learning_rate": 0.00014277018633540372, "loss": 0.9011, "step": 4610 }, { "epoch": 1.1478260869565218, "grad_norm": 5.528824806213379, "learning_rate": 0.00014264596273291926, "loss": 1.2915, "step": 4620 }, { "epoch": 1.1503105590062113, "grad_norm": 8.432668685913086, "learning_rate": 0.00014252173913043478, "loss": 1.0122, "step": 4630 }, { "epoch": 1.1527950310559005, "grad_norm": 5.736224174499512, "learning_rate": 0.0001423975155279503, "loss": 0.9787, "step": 4640 }, { "epoch": 1.15527950310559, "grad_norm": 9.182514190673828, "learning_rate": 0.00014227329192546584, "loss": 0.9586, "step": 4650 }, { "epoch": 1.1577639751552795, "grad_norm": 8.18057918548584, "learning_rate": 0.00014214906832298138, "loss": 1.0702, "step": 4660 }, { "epoch": 1.160248447204969, "grad_norm": 7.330738067626953, "learning_rate": 0.0001420248447204969, "loss": 0.9131, "step": 4670 }, { "epoch": 1.1627329192546583, "grad_norm": 4.894416332244873, "learning_rate": 0.00014190062111801244, "loss": 0.9788, "step": 4680 }, { "epoch": 1.1652173913043478, "grad_norm": 7.602725028991699, "learning_rate": 0.00014177639751552796, "loss": 0.9594, "step": 4690 }, { "epoch": 1.1677018633540373, "grad_norm": 4.91877555847168, "learning_rate": 0.00014165217391304348, "loss": 0.9302, "step": 4700 }, { "epoch": 1.1677018633540373, "eval_accuracy": 0.7362492299568776, "eval_loss": 1.0218663215637207, "eval_runtime": 85.3252, "eval_samples_per_second": 133.173, "eval_steps_per_second": 16.654, "step": 4700 }, { "epoch": 1.1701863354037267, "grad_norm": 5.2337422370910645, "learning_rate": 0.00014152795031055902, "loss": 1.1092, "step": 4710 }, { "epoch": 1.1726708074534162, "grad_norm": 8.629744529724121, "learning_rate": 0.00014140372670807454, "loss": 1.028, "step": 4720 }, { "epoch": 1.1751552795031055, "grad_norm": 6.914172172546387, "learning_rate": 0.00014127950310559005, "loss": 1.0481, "step": 4730 }, { "epoch": 1.177639751552795, "grad_norm": 5.989754676818848, "learning_rate": 0.0001411552795031056, "loss": 1.0034, "step": 4740 }, { "epoch": 1.1801242236024845, "grad_norm": 5.203980922698975, "learning_rate": 0.00014103105590062114, "loss": 1.1532, "step": 4750 }, { "epoch": 1.182608695652174, "grad_norm": 4.077994346618652, "learning_rate": 0.00014090683229813666, "loss": 1.064, "step": 4760 }, { "epoch": 1.1850931677018632, "grad_norm": 7.052755355834961, "learning_rate": 0.00014078260869565217, "loss": 1.194, "step": 4770 }, { "epoch": 1.1875776397515527, "grad_norm": 9.312969207763672, "learning_rate": 0.00014065838509316772, "loss": 1.0624, "step": 4780 }, { "epoch": 1.1900621118012422, "grad_norm": 6.245819568634033, "learning_rate": 0.00014053416149068323, "loss": 1.0172, "step": 4790 }, { "epoch": 1.1925465838509317, "grad_norm": 7.503792762756348, "learning_rate": 0.00014040993788819875, "loss": 1.1084, "step": 4800 }, { "epoch": 1.1925465838509317, "eval_accuracy": 0.7349291560327378, "eval_loss": 0.9940283894538879, "eval_runtime": 85.5561, "eval_samples_per_second": 132.813, "eval_steps_per_second": 16.609, "step": 4800 }, { "epoch": 1.1950310559006212, "grad_norm": 6.583471298217773, "learning_rate": 0.0001402857142857143, "loss": 1.2656, "step": 4810 }, { "epoch": 1.1975155279503105, "grad_norm": 3.8363754749298096, "learning_rate": 0.0001401614906832298, "loss": 0.7829, "step": 4820 }, { "epoch": 1.2, "grad_norm": 7.965066909790039, "learning_rate": 0.00014003726708074532, "loss": 0.9891, "step": 4830 }, { "epoch": 1.2024844720496894, "grad_norm": 3.270879030227661, "learning_rate": 0.0001399130434782609, "loss": 0.9665, "step": 4840 }, { "epoch": 1.204968944099379, "grad_norm": 7.581824779510498, "learning_rate": 0.0001397888198757764, "loss": 1.3112, "step": 4850 }, { "epoch": 1.2074534161490682, "grad_norm": 7.508520603179932, "learning_rate": 0.00013966459627329193, "loss": 1.0786, "step": 4860 }, { "epoch": 1.2099378881987577, "grad_norm": 2.655932664871216, "learning_rate": 0.00013954037267080747, "loss": 0.8918, "step": 4870 }, { "epoch": 1.2124223602484472, "grad_norm": 3.294532537460327, "learning_rate": 0.000139416149068323, "loss": 0.9471, "step": 4880 }, { "epoch": 1.2149068322981367, "grad_norm": 10.930632591247559, "learning_rate": 0.0001392919254658385, "loss": 0.9158, "step": 4890 }, { "epoch": 1.2173913043478262, "grad_norm": 6.163077354431152, "learning_rate": 0.00013916770186335405, "loss": 1.0345, "step": 4900 }, { "epoch": 1.2173913043478262, "eval_accuracy": 0.744609698143096, "eval_loss": 0.9774972200393677, "eval_runtime": 87.4405, "eval_samples_per_second": 129.951, "eval_steps_per_second": 16.251, "step": 4900 }, { "epoch": 1.2198757763975154, "grad_norm": 7.32708215713501, "learning_rate": 0.00013904347826086956, "loss": 0.9395, "step": 4910 }, { "epoch": 1.222360248447205, "grad_norm": 7.354382038116455, "learning_rate": 0.00013891925465838508, "loss": 1.0895, "step": 4920 }, { "epoch": 1.2248447204968944, "grad_norm": 7.127068996429443, "learning_rate": 0.00013879503105590065, "loss": 1.1379, "step": 4930 }, { "epoch": 1.227329192546584, "grad_norm": 9.56634521484375, "learning_rate": 0.00013867080745341617, "loss": 1.1754, "step": 4940 }, { "epoch": 1.2298136645962732, "grad_norm": 4.587943077087402, "learning_rate": 0.00013854658385093168, "loss": 1.2066, "step": 4950 }, { "epoch": 1.2322981366459627, "grad_norm": 4.837312698364258, "learning_rate": 0.00013842236024844723, "loss": 1.0871, "step": 4960 }, { "epoch": 1.2347826086956522, "grad_norm": 6.6595916748046875, "learning_rate": 0.00013829813664596274, "loss": 0.9062, "step": 4970 }, { "epoch": 1.2372670807453416, "grad_norm": 5.565141201019287, "learning_rate": 0.00013817391304347826, "loss": 1.2128, "step": 4980 }, { "epoch": 1.2397515527950311, "grad_norm": 5.343240261077881, "learning_rate": 0.0001380496894409938, "loss": 0.9812, "step": 4990 }, { "epoch": 1.2422360248447206, "grad_norm": 8.496342658996582, "learning_rate": 0.00013792546583850932, "loss": 1.0541, "step": 5000 }, { "epoch": 1.2422360248447206, "eval_accuracy": 0.7366012496699815, "eval_loss": 1.0075589418411255, "eval_runtime": 87.0565, "eval_samples_per_second": 130.524, "eval_steps_per_second": 16.323, "step": 5000 }, { "epoch": 1.24472049689441, "grad_norm": 5.603249549865723, "learning_rate": 0.00013780124223602484, "loss": 1.0875, "step": 5010 }, { "epoch": 1.2472049689440994, "grad_norm": 7.066832065582275, "learning_rate": 0.00013767701863354038, "loss": 0.9288, "step": 5020 }, { "epoch": 1.2496894409937889, "grad_norm": 7.90041971206665, "learning_rate": 0.00013755279503105592, "loss": 0.9789, "step": 5030 }, { "epoch": 1.2521739130434781, "grad_norm": 9.516698837280273, "learning_rate": 0.00013742857142857144, "loss": 0.9999, "step": 5040 }, { "epoch": 1.2546583850931676, "grad_norm": 7.783109188079834, "learning_rate": 0.00013730434782608696, "loss": 1.0498, "step": 5050 }, { "epoch": 1.2571428571428571, "grad_norm": 9.297592163085938, "learning_rate": 0.0001371801242236025, "loss": 1.066, "step": 5060 }, { "epoch": 1.2596273291925466, "grad_norm": 6.5852885246276855, "learning_rate": 0.00013705590062111802, "loss": 1.1248, "step": 5070 }, { "epoch": 1.262111801242236, "grad_norm": 6.009893417358398, "learning_rate": 0.00013693167701863353, "loss": 1.0595, "step": 5080 }, { "epoch": 1.2645962732919256, "grad_norm": 10.027131080627441, "learning_rate": 0.00013680745341614907, "loss": 1.193, "step": 5090 }, { "epoch": 1.2670807453416149, "grad_norm": 4.742192268371582, "learning_rate": 0.0001366832298136646, "loss": 0.9345, "step": 5100 }, { "epoch": 1.2670807453416149, "eval_accuracy": 0.7397694270879169, "eval_loss": 1.0074650049209595, "eval_runtime": 85.8817, "eval_samples_per_second": 132.31, "eval_steps_per_second": 16.546, "step": 5100 }, { "epoch": 1.2695652173913043, "grad_norm": 6.307586193084717, "learning_rate": 0.00013655900621118013, "loss": 0.8882, "step": 5110 }, { "epoch": 1.2720496894409938, "grad_norm": 5.385798454284668, "learning_rate": 0.00013643478260869568, "loss": 1.1246, "step": 5120 }, { "epoch": 1.274534161490683, "grad_norm": 10.382954597473145, "learning_rate": 0.0001363105590062112, "loss": 1.2195, "step": 5130 }, { "epoch": 1.2770186335403726, "grad_norm": 8.333847045898438, "learning_rate": 0.0001361863354037267, "loss": 1.0761, "step": 5140 }, { "epoch": 1.279503105590062, "grad_norm": 6.926821708679199, "learning_rate": 0.00013606211180124225, "loss": 1.151, "step": 5150 }, { "epoch": 1.2819875776397516, "grad_norm": 5.247950553894043, "learning_rate": 0.00013593788819875777, "loss": 0.9743, "step": 5160 }, { "epoch": 1.284472049689441, "grad_norm": 6.131479263305664, "learning_rate": 0.0001358136645962733, "loss": 0.982, "step": 5170 }, { "epoch": 1.2869565217391306, "grad_norm": 9.793872833251953, "learning_rate": 0.00013568944099378883, "loss": 1.2012, "step": 5180 }, { "epoch": 1.2894409937888198, "grad_norm": 6.260509014129639, "learning_rate": 0.00013556521739130435, "loss": 1.1532, "step": 5190 }, { "epoch": 1.2919254658385093, "grad_norm": 7.997650146484375, "learning_rate": 0.0001354409937888199, "loss": 0.9149, "step": 5200 }, { "epoch": 1.2919254658385093, "eval_accuracy": 0.7261286632051395, "eval_loss": 1.0558042526245117, "eval_runtime": 85.877, "eval_samples_per_second": 132.317, "eval_steps_per_second": 16.547, "step": 5200 }, { "epoch": 1.2944099378881988, "grad_norm": 5.47863245010376, "learning_rate": 0.0001353167701863354, "loss": 0.9028, "step": 5210 }, { "epoch": 1.296894409937888, "grad_norm": 8.695116996765137, "learning_rate": 0.00013519254658385095, "loss": 1.0238, "step": 5220 }, { "epoch": 1.2993788819875776, "grad_norm": 4.540287017822266, "learning_rate": 0.00013506832298136647, "loss": 1.2833, "step": 5230 }, { "epoch": 1.301863354037267, "grad_norm": 6.292470932006836, "learning_rate": 0.00013494409937888198, "loss": 1.1346, "step": 5240 }, { "epoch": 1.3043478260869565, "grad_norm": 11.708168983459473, "learning_rate": 0.00013481987577639753, "loss": 0.9925, "step": 5250 }, { "epoch": 1.306832298136646, "grad_norm": 7.93981409072876, "learning_rate": 0.00013469565217391304, "loss": 1.1607, "step": 5260 }, { "epoch": 1.3093167701863355, "grad_norm": 5.9505767822265625, "learning_rate": 0.00013457142857142856, "loss": 1.1483, "step": 5270 }, { "epoch": 1.3118012422360248, "grad_norm": 6.372278690338135, "learning_rate": 0.0001344472049689441, "loss": 0.9704, "step": 5280 }, { "epoch": 1.3142857142857143, "grad_norm": 5.066626071929932, "learning_rate": 0.00013432298136645965, "loss": 1.219, "step": 5290 }, { "epoch": 1.3167701863354038, "grad_norm": 7.538371562957764, "learning_rate": 0.00013419875776397516, "loss": 1.2583, "step": 5300 }, { "epoch": 1.3167701863354038, "eval_accuracy": 0.7476018657044794, "eval_loss": 0.97026127576828, "eval_runtime": 87.7379, "eval_samples_per_second": 129.511, "eval_steps_per_second": 16.196, "step": 5300 }, { "epoch": 1.319254658385093, "grad_norm": 6.197633266448975, "learning_rate": 0.0001340745341614907, "loss": 0.9438, "step": 5310 }, { "epoch": 1.3217391304347825, "grad_norm": 4.5123982429504395, "learning_rate": 0.00013395031055900622, "loss": 1.0034, "step": 5320 }, { "epoch": 1.324223602484472, "grad_norm": 9.826772689819336, "learning_rate": 0.00013382608695652174, "loss": 0.9244, "step": 5330 }, { "epoch": 1.3267080745341615, "grad_norm": 7.484212398529053, "learning_rate": 0.00013370186335403728, "loss": 1.1137, "step": 5340 }, { "epoch": 1.329192546583851, "grad_norm": 9.522153854370117, "learning_rate": 0.0001335776397515528, "loss": 1.075, "step": 5350 }, { "epoch": 1.3316770186335405, "grad_norm": 7.441765785217285, "learning_rate": 0.00013345341614906831, "loss": 1.2174, "step": 5360 }, { "epoch": 1.3341614906832298, "grad_norm": 6.224626064300537, "learning_rate": 0.00013332919254658386, "loss": 1.122, "step": 5370 }, { "epoch": 1.3366459627329192, "grad_norm": 14.881075859069824, "learning_rate": 0.0001332049689440994, "loss": 1.1255, "step": 5380 }, { "epoch": 1.3391304347826087, "grad_norm": 4.68292236328125, "learning_rate": 0.00013308074534161492, "loss": 1.2162, "step": 5390 }, { "epoch": 1.341614906832298, "grad_norm": 10.786056518554688, "learning_rate": 0.00013295652173913043, "loss": 1.0745, "step": 5400 }, { "epoch": 1.341614906832298, "eval_accuracy": 0.7424975798644724, "eval_loss": 0.9902403950691223, "eval_runtime": 87.4227, "eval_samples_per_second": 129.978, "eval_steps_per_second": 16.254, "step": 5400 }, { "epoch": 1.3440993788819875, "grad_norm": 6.61173152923584, "learning_rate": 0.00013283229813664598, "loss": 0.9695, "step": 5410 }, { "epoch": 1.346583850931677, "grad_norm": 5.859536170959473, "learning_rate": 0.0001327080745341615, "loss": 0.9959, "step": 5420 }, { "epoch": 1.3490683229813665, "grad_norm": 5.674126148223877, "learning_rate": 0.000132583850931677, "loss": 0.8, "step": 5430 }, { "epoch": 1.351552795031056, "grad_norm": 6.714157581329346, "learning_rate": 0.00013245962732919255, "loss": 1.2895, "step": 5440 }, { "epoch": 1.3540372670807455, "grad_norm": 5.819688320159912, "learning_rate": 0.00013233540372670807, "loss": 1.0128, "step": 5450 }, { "epoch": 1.3565217391304347, "grad_norm": 4.154235363006592, "learning_rate": 0.00013221118012422359, "loss": 1.0806, "step": 5460 }, { "epoch": 1.3590062111801242, "grad_norm": 3.743555784225464, "learning_rate": 0.00013208695652173916, "loss": 1.0332, "step": 5470 }, { "epoch": 1.3614906832298137, "grad_norm": 5.237468242645264, "learning_rate": 0.00013196273291925467, "loss": 0.8628, "step": 5480 }, { "epoch": 1.363975155279503, "grad_norm": 9.270702362060547, "learning_rate": 0.0001318385093167702, "loss": 0.7336, "step": 5490 }, { "epoch": 1.3664596273291925, "grad_norm": 6.079173564910889, "learning_rate": 0.00013171428571428573, "loss": 0.8319, "step": 5500 }, { "epoch": 1.3664596273291925, "eval_accuracy": 0.755346299392766, "eval_loss": 0.9442151784896851, "eval_runtime": 88.6963, "eval_samples_per_second": 128.111, "eval_steps_per_second": 16.021, "step": 5500 }, { "epoch": 1.368944099378882, "grad_norm": 6.590054035186768, "learning_rate": 0.00013159006211180125, "loss": 0.8682, "step": 5510 }, { "epoch": 1.3714285714285714, "grad_norm": 8.657280921936035, "learning_rate": 0.00013146583850931677, "loss": 1.0832, "step": 5520 }, { "epoch": 1.373913043478261, "grad_norm": 7.433463096618652, "learning_rate": 0.0001313416149068323, "loss": 1.0144, "step": 5530 }, { "epoch": 1.3763975155279504, "grad_norm": 10.5570650100708, "learning_rate": 0.00013121739130434783, "loss": 1.0187, "step": 5540 }, { "epoch": 1.3788819875776397, "grad_norm": 6.170913219451904, "learning_rate": 0.00013109316770186334, "loss": 0.9172, "step": 5550 }, { "epoch": 1.3813664596273292, "grad_norm": 6.9560394287109375, "learning_rate": 0.00013096894409937889, "loss": 0.9233, "step": 5560 }, { "epoch": 1.3838509316770187, "grad_norm": 5.400057315826416, "learning_rate": 0.00013084472049689443, "loss": 1.1142, "step": 5570 }, { "epoch": 1.386335403726708, "grad_norm": 6.7998433113098145, "learning_rate": 0.00013072049689440995, "loss": 1.0297, "step": 5580 }, { "epoch": 1.3888198757763974, "grad_norm": 6.90951681137085, "learning_rate": 0.0001305962732919255, "loss": 1.1061, "step": 5590 }, { "epoch": 1.391304347826087, "grad_norm": 6.948334217071533, "learning_rate": 0.000130472049689441, "loss": 1.1286, "step": 5600 }, { "epoch": 1.391304347826087, "eval_accuracy": 0.7532341811141424, "eval_loss": 0.9619560837745667, "eval_runtime": 87.4294, "eval_samples_per_second": 129.968, "eval_steps_per_second": 16.253, "step": 5600 }, { "epoch": 1.3937888198757764, "grad_norm": 2.2225635051727295, "learning_rate": 0.00013034782608695652, "loss": 0.8869, "step": 5610 }, { "epoch": 1.396273291925466, "grad_norm": 7.6301188468933105, "learning_rate": 0.00013022360248447206, "loss": 0.7048, "step": 5620 }, { "epoch": 1.3987577639751554, "grad_norm": 6.9699506759643555, "learning_rate": 0.00013009937888198758, "loss": 1.059, "step": 5630 }, { "epoch": 1.4012422360248447, "grad_norm": 8.951197624206543, "learning_rate": 0.0001299751552795031, "loss": 1.1901, "step": 5640 }, { "epoch": 1.4037267080745341, "grad_norm": 7.2019877433776855, "learning_rate": 0.00012985093167701864, "loss": 0.9462, "step": 5650 }, { "epoch": 1.4062111801242236, "grad_norm": 4.786462783813477, "learning_rate": 0.00012972670807453418, "loss": 1.0455, "step": 5660 }, { "epoch": 1.4086956521739131, "grad_norm": 4.615877628326416, "learning_rate": 0.0001296024844720497, "loss": 0.9419, "step": 5670 }, { "epoch": 1.4111801242236024, "grad_norm": 7.7541375160217285, "learning_rate": 0.00012947826086956522, "loss": 1.1388, "step": 5680 }, { "epoch": 1.4136645962732919, "grad_norm": 10.098551750183105, "learning_rate": 0.00012935403726708076, "loss": 1.1869, "step": 5690 }, { "epoch": 1.4161490683229814, "grad_norm": 6.00745964050293, "learning_rate": 0.00012922981366459628, "loss": 0.8228, "step": 5700 }, { "epoch": 1.4161490683229814, "eval_accuracy": 0.755522309249318, "eval_loss": 0.9329186081886292, "eval_runtime": 87.4839, "eval_samples_per_second": 129.887, "eval_steps_per_second": 16.243, "step": 5700 }, { "epoch": 1.4186335403726709, "grad_norm": 7.620040416717529, "learning_rate": 0.0001291055900621118, "loss": 0.8857, "step": 5710 }, { "epoch": 1.4211180124223604, "grad_norm": 5.4932169914245605, "learning_rate": 0.00012898136645962734, "loss": 1.2403, "step": 5720 }, { "epoch": 1.4236024844720496, "grad_norm": 6.197946071624756, "learning_rate": 0.0001288695652173913, "loss": 0.8465, "step": 5730 }, { "epoch": 1.4260869565217391, "grad_norm": 6.2294087409973145, "learning_rate": 0.00012874534161490684, "loss": 0.9501, "step": 5740 }, { "epoch": 1.4285714285714286, "grad_norm": 5.705041885375977, "learning_rate": 0.00012862111801242236, "loss": 1.1994, "step": 5750 }, { "epoch": 1.431055900621118, "grad_norm": 6.058370113372803, "learning_rate": 0.00012849689440993787, "loss": 1.1482, "step": 5760 }, { "epoch": 1.4335403726708074, "grad_norm": 8.761661529541016, "learning_rate": 0.00012837267080745345, "loss": 1.0147, "step": 5770 }, { "epoch": 1.4360248447204969, "grad_norm": 5.797641754150391, "learning_rate": 0.00012824844720496896, "loss": 1.2052, "step": 5780 }, { "epoch": 1.4385093167701863, "grad_norm": 5.235717296600342, "learning_rate": 0.00012812422360248448, "loss": 1.0181, "step": 5790 }, { "epoch": 1.4409937888198758, "grad_norm": 6.6115875244140625, "learning_rate": 0.00012800000000000002, "loss": 1.3209, "step": 5800 }, { "epoch": 1.4409937888198758, "eval_accuracy": 0.7542902402534541, "eval_loss": 0.9402074217796326, "eval_runtime": 86.5609, "eval_samples_per_second": 131.272, "eval_steps_per_second": 16.416, "step": 5800 }, { "epoch": 1.4434782608695653, "grad_norm": 5.539206504821777, "learning_rate": 0.00012787577639751554, "loss": 0.8167, "step": 5810 }, { "epoch": 1.4459627329192546, "grad_norm": 8.917939186096191, "learning_rate": 0.00012775155279503105, "loss": 0.8825, "step": 5820 }, { "epoch": 1.448447204968944, "grad_norm": 8.370964050292969, "learning_rate": 0.0001276273291925466, "loss": 1.1812, "step": 5830 }, { "epoch": 1.4509316770186336, "grad_norm": 8.157317161560059, "learning_rate": 0.00012750310559006211, "loss": 0.8365, "step": 5840 }, { "epoch": 1.453416149068323, "grad_norm": 8.257402420043945, "learning_rate": 0.00012737888198757763, "loss": 0.9687, "step": 5850 }, { "epoch": 1.4559006211180123, "grad_norm": 6.2165727615356445, "learning_rate": 0.00012725465838509317, "loss": 1.0794, "step": 5860 }, { "epoch": 1.4583850931677018, "grad_norm": 6.8931565284729, "learning_rate": 0.00012713043478260872, "loss": 1.0139, "step": 5870 }, { "epoch": 1.4608695652173913, "grad_norm": 6.232843399047852, "learning_rate": 0.00012700621118012423, "loss": 1.0135, "step": 5880 }, { "epoch": 1.4633540372670808, "grad_norm": 9.0387544631958, "learning_rate": 0.00012688198757763975, "loss": 1.039, "step": 5890 }, { "epoch": 1.4658385093167703, "grad_norm": 5.991683483123779, "learning_rate": 0.0001267577639751553, "loss": 0.7629, "step": 5900 }, { "epoch": 1.4658385093167703, "eval_accuracy": 0.7547302648948341, "eval_loss": 0.9496744275093079, "eval_runtime": 86.9169, "eval_samples_per_second": 130.734, "eval_steps_per_second": 16.349, "step": 5900 }, { "epoch": 1.4683229813664596, "grad_norm": 7.1583147048950195, "learning_rate": 0.0001266335403726708, "loss": 0.8985, "step": 5910 }, { "epoch": 1.470807453416149, "grad_norm": 7.79310941696167, "learning_rate": 0.00012650931677018633, "loss": 1.1252, "step": 5920 }, { "epoch": 1.4732919254658385, "grad_norm": 4.338858604431152, "learning_rate": 0.00012638509316770187, "loss": 0.9808, "step": 5930 }, { "epoch": 1.475776397515528, "grad_norm": 3.2830729484558105, "learning_rate": 0.00012626086956521739, "loss": 0.9988, "step": 5940 }, { "epoch": 1.4782608695652173, "grad_norm": 5.117250442504883, "learning_rate": 0.00012613664596273293, "loss": 0.9113, "step": 5950 }, { "epoch": 1.4807453416149068, "grad_norm": 4.326136589050293, "learning_rate": 0.00012601242236024847, "loss": 1.0195, "step": 5960 }, { "epoch": 1.4832298136645963, "grad_norm": 9.285099029541016, "learning_rate": 0.000125888198757764, "loss": 1.0247, "step": 5970 }, { "epoch": 1.4857142857142858, "grad_norm": 9.194808006286621, "learning_rate": 0.0001257639751552795, "loss": 1.1631, "step": 5980 }, { "epoch": 1.4881987577639753, "grad_norm": 4.7411885261535645, "learning_rate": 0.00012563975155279505, "loss": 0.8195, "step": 5990 }, { "epoch": 1.4906832298136645, "grad_norm": 7.099352836608887, "learning_rate": 0.00012551552795031057, "loss": 0.9906, "step": 6000 }, { "epoch": 1.4906832298136645, "eval_accuracy": 0.7588664965238053, "eval_loss": 0.9361943602561951, "eval_runtime": 87.6514, "eval_samples_per_second": 129.639, "eval_steps_per_second": 16.212, "step": 6000 }, { "epoch": 1.493167701863354, "grad_norm": 8.118821144104004, "learning_rate": 0.00012539130434782608, "loss": 1.1247, "step": 6010 }, { "epoch": 1.4956521739130435, "grad_norm": 10.393396377563477, "learning_rate": 0.00012526708074534162, "loss": 0.9778, "step": 6020 }, { "epoch": 1.498136645962733, "grad_norm": 5.61733865737915, "learning_rate": 0.00012514285714285714, "loss": 1.0013, "step": 6030 }, { "epoch": 1.5006211180124223, "grad_norm": 7.131757736206055, "learning_rate": 0.00012501863354037268, "loss": 0.7967, "step": 6040 }, { "epoch": 1.5031055900621118, "grad_norm": 5.835470676422119, "learning_rate": 0.0001248944099378882, "loss": 0.9079, "step": 6050 }, { "epoch": 1.5055900621118012, "grad_norm": 3.6993353366851807, "learning_rate": 0.00012477018633540374, "loss": 0.8018, "step": 6060 }, { "epoch": 1.5080745341614907, "grad_norm": 4.835446834564209, "learning_rate": 0.00012464596273291926, "loss": 1.1568, "step": 6070 }, { "epoch": 1.5105590062111802, "grad_norm": 4.084790229797363, "learning_rate": 0.00012452173913043478, "loss": 1.2725, "step": 6080 }, { "epoch": 1.5130434782608697, "grad_norm": 4.596613883972168, "learning_rate": 0.00012439751552795032, "loss": 1.0996, "step": 6090 }, { "epoch": 1.515527950310559, "grad_norm": 7.749314785003662, "learning_rate": 0.00012427329192546584, "loss": 0.9966, "step": 6100 }, { "epoch": 1.515527950310559, "eval_accuracy": 0.7594825310217372, "eval_loss": 0.9321704506874084, "eval_runtime": 86.7196, "eval_samples_per_second": 131.032, "eval_steps_per_second": 16.386, "step": 6100 }, { "epoch": 1.5180124223602485, "grad_norm": 5.206863880157471, "learning_rate": 0.00012414906832298135, "loss": 0.8907, "step": 6110 }, { "epoch": 1.5204968944099377, "grad_norm": 3.3592071533203125, "learning_rate": 0.0001240248447204969, "loss": 0.7821, "step": 6120 }, { "epoch": 1.5229813664596272, "grad_norm": 7.234273910522461, "learning_rate": 0.00012390062111801244, "loss": 1.0522, "step": 6130 }, { "epoch": 1.5254658385093167, "grad_norm": 8.088465690612793, "learning_rate": 0.00012377639751552796, "loss": 1.146, "step": 6140 }, { "epoch": 1.5279503105590062, "grad_norm": 6.445027828216553, "learning_rate": 0.0001236521739130435, "loss": 1.1889, "step": 6150 }, { "epoch": 1.5304347826086957, "grad_norm": 8.097786903381348, "learning_rate": 0.00012352795031055902, "loss": 1.0494, "step": 6160 }, { "epoch": 1.5329192546583852, "grad_norm": 7.564890384674072, "learning_rate": 0.00012340372670807453, "loss": 1.0297, "step": 6170 }, { "epoch": 1.5354037267080747, "grad_norm": 7.270158767700195, "learning_rate": 0.00012327950310559008, "loss": 1.1366, "step": 6180 }, { "epoch": 1.537888198757764, "grad_norm": 4.950170993804932, "learning_rate": 0.0001231552795031056, "loss": 0.9552, "step": 6190 }, { "epoch": 1.5403726708074534, "grad_norm": 5.859093189239502, "learning_rate": 0.0001230310559006211, "loss": 0.8868, "step": 6200 }, { "epoch": 1.5403726708074534, "eval_accuracy": 0.7505940332658629, "eval_loss": 0.9613372087478638, "eval_runtime": 87.5087, "eval_samples_per_second": 129.85, "eval_steps_per_second": 16.238, "step": 6200 }, { "epoch": 1.5428571428571427, "grad_norm": 7.968153476715088, "learning_rate": 0.00012290683229813665, "loss": 1.2027, "step": 6210 }, { "epoch": 1.5453416149068322, "grad_norm": 2.827946186065674, "learning_rate": 0.0001227826086956522, "loss": 0.7312, "step": 6220 }, { "epoch": 1.5478260869565217, "grad_norm": 8.215697288513184, "learning_rate": 0.0001226583850931677, "loss": 0.9336, "step": 6230 }, { "epoch": 1.5503105590062112, "grad_norm": 8.164762496948242, "learning_rate": 0.00012253416149068323, "loss": 0.782, "step": 6240 }, { "epoch": 1.5527950310559007, "grad_norm": 6.815315246582031, "learning_rate": 0.00012240993788819877, "loss": 0.897, "step": 6250 }, { "epoch": 1.5552795031055902, "grad_norm": 9.907848358154297, "learning_rate": 0.0001222857142857143, "loss": 1.0146, "step": 6260 }, { "epoch": 1.5577639751552796, "grad_norm": 3.322430372238159, "learning_rate": 0.0001221614906832298, "loss": 1.1132, "step": 6270 }, { "epoch": 1.560248447204969, "grad_norm": 5.496293067932129, "learning_rate": 0.00012203726708074535, "loss": 0.8865, "step": 6280 }, { "epoch": 1.5627329192546584, "grad_norm": 4.975622177124023, "learning_rate": 0.00012191304347826086, "loss": 0.9737, "step": 6290 }, { "epoch": 1.5652173913043477, "grad_norm": 10.409469604492188, "learning_rate": 0.0001217888198757764, "loss": 0.956, "step": 6300 }, { "epoch": 1.5652173913043477, "eval_accuracy": 0.7567543782451818, "eval_loss": 0.9370301365852356, "eval_runtime": 87.3636, "eval_samples_per_second": 130.066, "eval_steps_per_second": 16.265, "step": 6300 }, { "epoch": 1.5677018633540372, "grad_norm": 6.119087219238281, "learning_rate": 0.00012166459627329194, "loss": 0.8334, "step": 6310 }, { "epoch": 1.5701863354037267, "grad_norm": 9.4066162109375, "learning_rate": 0.00012154037267080747, "loss": 1.0246, "step": 6320 }, { "epoch": 1.5726708074534161, "grad_norm": 2.9001400470733643, "learning_rate": 0.000121416149068323, "loss": 1.1431, "step": 6330 }, { "epoch": 1.5751552795031056, "grad_norm": 4.719793796539307, "learning_rate": 0.00012129192546583851, "loss": 0.9183, "step": 6340 }, { "epoch": 1.5776397515527951, "grad_norm": 6.822214603424072, "learning_rate": 0.00012116770186335404, "loss": 1.0926, "step": 6350 }, { "epoch": 1.5801242236024846, "grad_norm": 7.05217170715332, "learning_rate": 0.00012104347826086957, "loss": 0.9341, "step": 6360 }, { "epoch": 1.5826086956521739, "grad_norm": 6.148478984832764, "learning_rate": 0.00012091925465838509, "loss": 0.9628, "step": 6370 }, { "epoch": 1.5850931677018634, "grad_norm": 5.6752095222473145, "learning_rate": 0.00012079503105590062, "loss": 1.1237, "step": 6380 }, { "epoch": 1.5875776397515526, "grad_norm": 6.509497165679932, "learning_rate": 0.00012067080745341615, "loss": 1.1021, "step": 6390 }, { "epoch": 1.5900621118012421, "grad_norm": 6.627172470092773, "learning_rate": 0.00012054658385093169, "loss": 1.1833, "step": 6400 }, { "epoch": 1.5900621118012421, "eval_accuracy": 0.7597465458065652, "eval_loss": 0.9276845455169678, "eval_runtime": 88.2091, "eval_samples_per_second": 128.819, "eval_steps_per_second": 16.109, "step": 6400 }, { "epoch": 1.5925465838509316, "grad_norm": 7.526735305786133, "learning_rate": 0.00012042236024844722, "loss": 0.8029, "step": 6410 }, { "epoch": 1.595031055900621, "grad_norm": 6.848104000091553, "learning_rate": 0.00012031055900621117, "loss": 1.1801, "step": 6420 }, { "epoch": 1.5975155279503106, "grad_norm": 7.543861389160156, "learning_rate": 0.00012018633540372673, "loss": 0.794, "step": 6430 }, { "epoch": 1.6, "grad_norm": 2.324418067932129, "learning_rate": 0.00012006211180124224, "loss": 1.0119, "step": 6440 }, { "epoch": 1.6024844720496896, "grad_norm": 6.490159511566162, "learning_rate": 0.00011993788819875777, "loss": 0.8435, "step": 6450 }, { "epoch": 1.6049689440993788, "grad_norm": 6.797852516174316, "learning_rate": 0.0001198136645962733, "loss": 0.9619, "step": 6460 }, { "epoch": 1.6074534161490683, "grad_norm": 5.924860954284668, "learning_rate": 0.00011968944099378882, "loss": 1.0926, "step": 6470 }, { "epoch": 1.6099378881987576, "grad_norm": 5.143548011779785, "learning_rate": 0.00011956521739130435, "loss": 0.9834, "step": 6480 }, { "epoch": 1.612422360248447, "grad_norm": 2.3223421573638916, "learning_rate": 0.00011944099378881988, "loss": 0.7827, "step": 6490 }, { "epoch": 1.6149068322981366, "grad_norm": 3.3075764179229736, "learning_rate": 0.0001193167701863354, "loss": 0.9747, "step": 6500 }, { "epoch": 1.6149068322981366, "eval_accuracy": 0.7696030977734754, "eval_loss": 0.8776896595954895, "eval_runtime": 86.0614, "eval_samples_per_second": 132.034, "eval_steps_per_second": 16.511, "step": 6500 }, { "epoch": 1.617391304347826, "grad_norm": 3.3240957260131836, "learning_rate": 0.00011919254658385093, "loss": 0.9756, "step": 6510 }, { "epoch": 1.6198757763975156, "grad_norm": 6.321386814117432, "learning_rate": 0.00011906832298136647, "loss": 0.918, "step": 6520 }, { "epoch": 1.622360248447205, "grad_norm": 6.500185012817383, "learning_rate": 0.000118944099378882, "loss": 0.9901, "step": 6530 }, { "epoch": 1.6248447204968945, "grad_norm": 8.747745513916016, "learning_rate": 0.00011881987577639753, "loss": 0.9637, "step": 6540 }, { "epoch": 1.6273291925465838, "grad_norm": 5.210270881652832, "learning_rate": 0.00011869565217391305, "loss": 0.921, "step": 6550 }, { "epoch": 1.6298136645962733, "grad_norm": 5.422876358032227, "learning_rate": 0.00011857142857142858, "loss": 1.0392, "step": 6560 }, { "epoch": 1.6322981366459626, "grad_norm": 7.760617733001709, "learning_rate": 0.0001184472049689441, "loss": 0.835, "step": 6570 }, { "epoch": 1.634782608695652, "grad_norm": 5.978461265563965, "learning_rate": 0.00011832298136645962, "loss": 1.2663, "step": 6580 }, { "epoch": 1.6372670807453416, "grad_norm": 4.057701587677002, "learning_rate": 0.00011819875776397515, "loss": 0.9839, "step": 6590 }, { "epoch": 1.639751552795031, "grad_norm": 6.924076557159424, "learning_rate": 0.00011807453416149068, "loss": 1.0119, "step": 6600 }, { "epoch": 1.639751552795031, "eval_accuracy": 0.7652908562879521, "eval_loss": 0.8980146050453186, "eval_runtime": 85.9497, "eval_samples_per_second": 132.205, "eval_steps_per_second": 16.533, "step": 6600 }, { "epoch": 1.6422360248447205, "grad_norm": 6.758317470550537, "learning_rate": 0.00011795031055900623, "loss": 0.9603, "step": 6610 }, { "epoch": 1.64472049689441, "grad_norm": 8.458471298217773, "learning_rate": 0.00011782608695652176, "loss": 1.0986, "step": 6620 }, { "epoch": 1.6472049689440995, "grad_norm": 5.507945537567139, "learning_rate": 0.00011770186335403727, "loss": 0.9222, "step": 6630 }, { "epoch": 1.6496894409937888, "grad_norm": 6.546318531036377, "learning_rate": 0.0001175776397515528, "loss": 0.735, "step": 6640 }, { "epoch": 1.6521739130434783, "grad_norm": 7.688220500946045, "learning_rate": 0.00011745341614906833, "loss": 1.0007, "step": 6650 }, { "epoch": 1.6546583850931675, "grad_norm": 8.641738891601562, "learning_rate": 0.00011732919254658385, "loss": 0.7686, "step": 6660 }, { "epoch": 1.657142857142857, "grad_norm": 7.91213321685791, "learning_rate": 0.00011720496894409938, "loss": 0.9509, "step": 6670 }, { "epoch": 1.6596273291925465, "grad_norm": 9.004672050476074, "learning_rate": 0.00011708074534161491, "loss": 0.7764, "step": 6680 }, { "epoch": 1.662111801242236, "grad_norm": 7.412413120269775, "learning_rate": 0.00011695652173913042, "loss": 1.0701, "step": 6690 }, { "epoch": 1.6645962732919255, "grad_norm": 5.0252885818481445, "learning_rate": 0.00011683229813664598, "loss": 0.9764, "step": 6700 }, { "epoch": 1.6645962732919255, "eval_accuracy": 0.7641467922203643, "eval_loss": 0.9070652723312378, "eval_runtime": 88.0089, "eval_samples_per_second": 129.112, "eval_steps_per_second": 16.146, "step": 6700 }, { "epoch": 1.667080745341615, "grad_norm": 6.071985244750977, "learning_rate": 0.0001167080745341615, "loss": 0.9533, "step": 6710 }, { "epoch": 1.6695652173913045, "grad_norm": 7.6646809577941895, "learning_rate": 0.00011658385093167703, "loss": 0.888, "step": 6720 }, { "epoch": 1.6720496894409937, "grad_norm": 7.314651012420654, "learning_rate": 0.00011645962732919256, "loss": 0.9252, "step": 6730 }, { "epoch": 1.6745341614906832, "grad_norm": 5.55505895614624, "learning_rate": 0.00011633540372670809, "loss": 0.9717, "step": 6740 }, { "epoch": 1.6770186335403725, "grad_norm": 6.546708583831787, "learning_rate": 0.0001162111801242236, "loss": 0.8291, "step": 6750 }, { "epoch": 1.679503105590062, "grad_norm": 6.897370338439941, "learning_rate": 0.00011608695652173913, "loss": 1.0541, "step": 6760 }, { "epoch": 1.6819875776397515, "grad_norm": 5.658356666564941, "learning_rate": 0.00011596273291925466, "loss": 1.2573, "step": 6770 }, { "epoch": 1.684472049689441, "grad_norm": 9.185235977172852, "learning_rate": 0.00011583850931677018, "loss": 1.133, "step": 6780 }, { "epoch": 1.6869565217391305, "grad_norm": 6.854763507843018, "learning_rate": 0.00011571428571428574, "loss": 0.9488, "step": 6790 }, { "epoch": 1.68944099378882, "grad_norm": 6.5308990478515625, "learning_rate": 0.00011559006211180125, "loss": 1.0528, "step": 6800 }, { "epoch": 1.68944099378882, "eval_accuracy": 0.7694270879169234, "eval_loss": 0.8940765857696533, "eval_runtime": 87.1629, "eval_samples_per_second": 130.365, "eval_steps_per_second": 16.303, "step": 6800 }, { "epoch": 1.6919254658385094, "grad_norm": 4.403570652008057, "learning_rate": 0.00011546583850931678, "loss": 0.8713, "step": 6810 }, { "epoch": 1.6944099378881987, "grad_norm": 6.358486175537109, "learning_rate": 0.00011534161490683231, "loss": 0.977, "step": 6820 }, { "epoch": 1.6968944099378882, "grad_norm": 7.4040608406066895, "learning_rate": 0.00011521739130434783, "loss": 1.1085, "step": 6830 }, { "epoch": 1.6993788819875777, "grad_norm": 6.154741287231445, "learning_rate": 0.00011509316770186336, "loss": 0.9678, "step": 6840 }, { "epoch": 1.701863354037267, "grad_norm": 6.781441688537598, "learning_rate": 0.00011496894409937889, "loss": 0.8432, "step": 6850 }, { "epoch": 1.7043478260869565, "grad_norm": 6.97227144241333, "learning_rate": 0.0001148447204968944, "loss": 0.7707, "step": 6860 }, { "epoch": 1.706832298136646, "grad_norm": 8.75203800201416, "learning_rate": 0.00011472049689440994, "loss": 0.7618, "step": 6870 }, { "epoch": 1.7093167701863354, "grad_norm": 8.073197364807129, "learning_rate": 0.00011459627329192548, "loss": 1.0681, "step": 6880 }, { "epoch": 1.711801242236025, "grad_norm": 6.717360973358154, "learning_rate": 0.00011447204968944101, "loss": 0.9677, "step": 6890 }, { "epoch": 1.7142857142857144, "grad_norm": 5.445791721343994, "learning_rate": 0.00011434782608695654, "loss": 0.942, "step": 6900 }, { "epoch": 1.7142857142857144, "eval_accuracy": 0.7736513244741705, "eval_loss": 0.8718106746673584, "eval_runtime": 86.3638, "eval_samples_per_second": 131.571, "eval_steps_per_second": 16.454, "step": 6900 }, { "epoch": 1.7167701863354037, "grad_norm": 5.544734954833984, "learning_rate": 0.00011422360248447206, "loss": 0.7708, "step": 6910 }, { "epoch": 1.7192546583850932, "grad_norm": 4.751190662384033, "learning_rate": 0.00011409937888198759, "loss": 1.0393, "step": 6920 }, { "epoch": 1.7217391304347827, "grad_norm": 4.869985580444336, "learning_rate": 0.00011397515527950311, "loss": 0.8267, "step": 6930 }, { "epoch": 1.724223602484472, "grad_norm": 4.8316168785095215, "learning_rate": 0.00011385093167701863, "loss": 0.9154, "step": 6940 }, { "epoch": 1.7267080745341614, "grad_norm": 5.959396839141846, "learning_rate": 0.00011372670807453416, "loss": 1.066, "step": 6950 }, { "epoch": 1.729192546583851, "grad_norm": 2.427189826965332, "learning_rate": 0.00011360248447204969, "loss": 0.6803, "step": 6960 }, { "epoch": 1.7316770186335404, "grad_norm": 6.201396942138672, "learning_rate": 0.00011347826086956523, "loss": 0.7596, "step": 6970 }, { "epoch": 1.73416149068323, "grad_norm": 9.373711585998535, "learning_rate": 0.00011335403726708076, "loss": 0.8998, "step": 6980 }, { "epoch": 1.7366459627329194, "grad_norm": 4.7054643630981445, "learning_rate": 0.00011322981366459628, "loss": 1.1068, "step": 6990 }, { "epoch": 1.7391304347826086, "grad_norm": 7.425700664520264, "learning_rate": 0.00011310559006211181, "loss": 1.0387, "step": 7000 }, { "epoch": 1.7391304347826086, "eval_accuracy": 0.7786676053859016, "eval_loss": 0.8614795804023743, "eval_runtime": 86.4009, "eval_samples_per_second": 131.515, "eval_steps_per_second": 16.447, "step": 7000 }, { "epoch": 1.7416149068322981, "grad_norm": 5.01289176940918, "learning_rate": 0.00011298136645962734, "loss": 1.0977, "step": 7010 }, { "epoch": 1.7440993788819876, "grad_norm": 7.544558048248291, "learning_rate": 0.00011285714285714286, "loss": 1.1391, "step": 7020 }, { "epoch": 1.746583850931677, "grad_norm": 5.905050277709961, "learning_rate": 0.00011273291925465839, "loss": 0.9768, "step": 7030 }, { "epoch": 1.7490683229813664, "grad_norm": 4.24083137512207, "learning_rate": 0.00011260869565217392, "loss": 1.0744, "step": 7040 }, { "epoch": 1.7515527950310559, "grad_norm": 2.2467899322509766, "learning_rate": 0.00011248447204968943, "loss": 0.8104, "step": 7050 }, { "epoch": 1.7540372670807454, "grad_norm": 6.543946266174316, "learning_rate": 0.00011236024844720496, "loss": 0.9234, "step": 7060 }, { "epoch": 1.7565217391304349, "grad_norm": 5.305374622344971, "learning_rate": 0.0001122360248447205, "loss": 0.9713, "step": 7070 }, { "epoch": 1.7590062111801243, "grad_norm": 7.800411224365234, "learning_rate": 0.00011211180124223604, "loss": 0.7504, "step": 7080 }, { "epoch": 1.7614906832298136, "grad_norm": 7.4360432624816895, "learning_rate": 0.00011198757763975157, "loss": 1.0139, "step": 7090 }, { "epoch": 1.763975155279503, "grad_norm": 6.3255934715271, "learning_rate": 0.00011186335403726708, "loss": 0.9054, "step": 7100 }, { "epoch": 1.763975155279503, "eval_accuracy": 0.7734753146176185, "eval_loss": 0.8689095973968506, "eval_runtime": 87.8349, "eval_samples_per_second": 129.368, "eval_steps_per_second": 16.178, "step": 7100 }, { "epoch": 1.7664596273291926, "grad_norm": 11.395488739013672, "learning_rate": 0.00011173913043478261, "loss": 1.1122, "step": 7110 }, { "epoch": 1.7689440993788819, "grad_norm": 6.530506610870361, "learning_rate": 0.00011161490683229814, "loss": 0.9217, "step": 7120 }, { "epoch": 1.7714285714285714, "grad_norm": 3.929171085357666, "learning_rate": 0.00011149068322981366, "loss": 0.9403, "step": 7130 }, { "epoch": 1.7739130434782608, "grad_norm": 5.387374401092529, "learning_rate": 0.00011136645962732919, "loss": 0.8515, "step": 7140 }, { "epoch": 1.7763975155279503, "grad_norm": 3.4766998291015625, "learning_rate": 0.00011124223602484472, "loss": 0.9208, "step": 7150 }, { "epoch": 1.7788819875776398, "grad_norm": 6.483366012573242, "learning_rate": 0.00011111801242236026, "loss": 0.9254, "step": 7160 }, { "epoch": 1.7813664596273293, "grad_norm": 3.7569687366485596, "learning_rate": 0.00011099378881987579, "loss": 0.9812, "step": 7170 }, { "epoch": 1.7838509316770186, "grad_norm": 5.825034141540527, "learning_rate": 0.00011086956521739131, "loss": 0.9628, "step": 7180 }, { "epoch": 1.786335403726708, "grad_norm": 9.814273834228516, "learning_rate": 0.00011074534161490684, "loss": 1.1503, "step": 7190 }, { "epoch": 1.7888198757763976, "grad_norm": 6.026792526245117, "learning_rate": 0.00011062111801242237, "loss": 1.0327, "step": 7200 }, { "epoch": 1.7888198757763976, "eval_accuracy": 0.7691630731320954, "eval_loss": 0.8953230977058411, "eval_runtime": 87.5399, "eval_samples_per_second": 129.804, "eval_steps_per_second": 16.233, "step": 7200 }, { "epoch": 1.7913043478260868, "grad_norm": 8.353828430175781, "learning_rate": 0.00011049689440993788, "loss": 0.9956, "step": 7210 }, { "epoch": 1.7937888198757763, "grad_norm": 4.231791019439697, "learning_rate": 0.00011037267080745341, "loss": 1.0019, "step": 7220 }, { "epoch": 1.7962732919254658, "grad_norm": 6.863067626953125, "learning_rate": 0.00011024844720496894, "loss": 0.8933, "step": 7230 }, { "epoch": 1.7987577639751553, "grad_norm": 5.806077003479004, "learning_rate": 0.00011012422360248446, "loss": 0.7849, "step": 7240 }, { "epoch": 1.8012422360248448, "grad_norm": 4.928778648376465, "learning_rate": 0.00011000000000000002, "loss": 1.0724, "step": 7250 }, { "epoch": 1.8037267080745343, "grad_norm": 4.490487098693848, "learning_rate": 0.00010987577639751553, "loss": 0.9406, "step": 7260 }, { "epoch": 1.8062111801242235, "grad_norm": 5.663939952850342, "learning_rate": 0.00010975155279503106, "loss": 0.9368, "step": 7270 }, { "epoch": 1.808695652173913, "grad_norm": 8.136780738830566, "learning_rate": 0.0001096273291925466, "loss": 0.8623, "step": 7280 }, { "epoch": 1.8111801242236025, "grad_norm": 7.248380184173584, "learning_rate": 0.00010950310559006211, "loss": 1.2673, "step": 7290 }, { "epoch": 1.8136645962732918, "grad_norm": 5.766163349151611, "learning_rate": 0.00010937888198757764, "loss": 0.8425, "step": 7300 }, { "epoch": 1.8136645962732918, "eval_accuracy": 0.7761154624658981, "eval_loss": 0.8532983064651489, "eval_runtime": 86.6152, "eval_samples_per_second": 131.189, "eval_steps_per_second": 16.406, "step": 7300 }, { "epoch": 1.8161490683229813, "grad_norm": 7.9946465492248535, "learning_rate": 0.00010925465838509317, "loss": 1.072, "step": 7310 }, { "epoch": 1.8186335403726708, "grad_norm": 8.763626098632812, "learning_rate": 0.00010913043478260869, "loss": 0.925, "step": 7320 }, { "epoch": 1.8211180124223603, "grad_norm": 8.264079093933105, "learning_rate": 0.00010900621118012422, "loss": 1.0853, "step": 7330 }, { "epoch": 1.8236024844720498, "grad_norm": 5.349701404571533, "learning_rate": 0.00010888198757763976, "loss": 1.0933, "step": 7340 }, { "epoch": 1.8260869565217392, "grad_norm": 4.295293807983398, "learning_rate": 0.00010875776397515529, "loss": 1.0202, "step": 7350 }, { "epoch": 1.8285714285714287, "grad_norm": 5.092330455780029, "learning_rate": 0.00010863354037267082, "loss": 0.9496, "step": 7360 }, { "epoch": 1.831055900621118, "grad_norm": 7.8343424797058105, "learning_rate": 0.00010850931677018634, "loss": 1.042, "step": 7370 }, { "epoch": 1.8335403726708075, "grad_norm": 5.031234264373779, "learning_rate": 0.00010838509316770187, "loss": 0.9133, "step": 7380 }, { "epoch": 1.8360248447204968, "grad_norm": 7.025552749633789, "learning_rate": 0.0001082608695652174, "loss": 0.78, "step": 7390 }, { "epoch": 1.8385093167701863, "grad_norm": 3.6854496002197266, "learning_rate": 0.00010813664596273293, "loss": 0.9388, "step": 7400 }, { "epoch": 1.8385093167701863, "eval_accuracy": 0.7687230484907155, "eval_loss": 0.8771804571151733, "eval_runtime": 88.2832, "eval_samples_per_second": 128.711, "eval_steps_per_second": 16.096, "step": 7400 }, { "epoch": 1.8409937888198757, "grad_norm": 5.7331013679504395, "learning_rate": 0.00010801242236024844, "loss": 0.9818, "step": 7410 }, { "epoch": 1.8434782608695652, "grad_norm": 6.12167501449585, "learning_rate": 0.00010788819875776397, "loss": 0.9954, "step": 7420 }, { "epoch": 1.8459627329192547, "grad_norm": 8.437973022460938, "learning_rate": 0.00010776397515527951, "loss": 0.9886, "step": 7430 }, { "epoch": 1.8484472049689442, "grad_norm": 7.553098201751709, "learning_rate": 0.00010763975155279504, "loss": 0.9144, "step": 7440 }, { "epoch": 1.8509316770186337, "grad_norm": 7.748224258422852, "learning_rate": 0.00010751552795031057, "loss": 1.0153, "step": 7450 }, { "epoch": 1.853416149068323, "grad_norm": 7.518005847930908, "learning_rate": 0.00010739130434782609, "loss": 0.8619, "step": 7460 }, { "epoch": 1.8559006211180125, "grad_norm": 8.89167308807373, "learning_rate": 0.00010726708074534162, "loss": 1.0365, "step": 7470 }, { "epoch": 1.8583850931677017, "grad_norm": 5.566318035125732, "learning_rate": 0.00010714285714285715, "loss": 1.1217, "step": 7480 }, { "epoch": 1.8608695652173912, "grad_norm": 5.506089687347412, "learning_rate": 0.00010701863354037267, "loss": 1.107, "step": 7490 }, { "epoch": 1.8633540372670807, "grad_norm": 4.13236141204834, "learning_rate": 0.0001068944099378882, "loss": 1.1037, "step": 7500 }, { "epoch": 1.8633540372670807, "eval_accuracy": 0.7731232949045147, "eval_loss": 0.8634147047996521, "eval_runtime": 87.6771, "eval_samples_per_second": 129.6, "eval_steps_per_second": 16.207, "step": 7500 }, { "epoch": 1.8658385093167702, "grad_norm": 3.6756432056427, "learning_rate": 0.00010677018633540373, "loss": 0.8018, "step": 7510 }, { "epoch": 1.8683229813664597, "grad_norm": 3.4403350353240967, "learning_rate": 0.00010664596273291927, "loss": 0.8836, "step": 7520 }, { "epoch": 1.8708074534161492, "grad_norm": 8.637625694274902, "learning_rate": 0.0001065217391304348, "loss": 0.9809, "step": 7530 }, { "epoch": 1.8732919254658387, "grad_norm": 7.03044319152832, "learning_rate": 0.00010639751552795032, "loss": 0.9337, "step": 7540 }, { "epoch": 1.875776397515528, "grad_norm": 5.361702919006348, "learning_rate": 0.00010627329192546585, "loss": 0.9817, "step": 7550 }, { "epoch": 1.8782608695652174, "grad_norm": 5.379118919372559, "learning_rate": 0.00010614906832298138, "loss": 0.9618, "step": 7560 }, { "epoch": 1.8807453416149067, "grad_norm": 6.078188896179199, "learning_rate": 0.00010602484472049689, "loss": 1.2285, "step": 7570 }, { "epoch": 1.8832298136645962, "grad_norm": 7.805136680603027, "learning_rate": 0.00010590062111801242, "loss": 0.9148, "step": 7580 }, { "epoch": 1.8857142857142857, "grad_norm": 8.38199234008789, "learning_rate": 0.00010577639751552795, "loss": 0.9053, "step": 7590 }, { "epoch": 1.8881987577639752, "grad_norm": 8.421182632446289, "learning_rate": 0.00010565217391304347, "loss": 0.9659, "step": 7600 }, { "epoch": 1.8881987577639752, "eval_accuracy": 0.7766434920355539, "eval_loss": 0.8502032160758972, "eval_runtime": 87.3847, "eval_samples_per_second": 130.034, "eval_steps_per_second": 16.261, "step": 7600 }, { "epoch": 1.8906832298136647, "grad_norm": 7.435909271240234, "learning_rate": 0.00010552795031055903, "loss": 0.8987, "step": 7610 }, { "epoch": 1.8931677018633541, "grad_norm": 5.804107189178467, "learning_rate": 0.00010540372670807454, "loss": 0.7558, "step": 7620 }, { "epoch": 1.8956521739130436, "grad_norm": 9.431636810302734, "learning_rate": 0.00010527950310559007, "loss": 0.8512, "step": 7630 }, { "epoch": 1.898136645962733, "grad_norm": 6.679006576538086, "learning_rate": 0.0001051552795031056, "loss": 0.7436, "step": 7640 }, { "epoch": 1.9006211180124224, "grad_norm": 7.220990180969238, "learning_rate": 0.00010503105590062112, "loss": 1.1981, "step": 7650 }, { "epoch": 1.9031055900621117, "grad_norm": 4.041493892669678, "learning_rate": 0.00010490683229813665, "loss": 0.7959, "step": 7660 }, { "epoch": 1.9055900621118012, "grad_norm": 6.4974517822265625, "learning_rate": 0.00010478260869565218, "loss": 1.0786, "step": 7670 }, { "epoch": 1.9080745341614906, "grad_norm": 5.594285488128662, "learning_rate": 0.0001046583850931677, "loss": 0.8194, "step": 7680 }, { "epoch": 1.9105590062111801, "grad_norm": 13.586335182189941, "learning_rate": 0.00010453416149068322, "loss": 1.1679, "step": 7690 }, { "epoch": 1.9130434782608696, "grad_norm": 9.138886451721191, "learning_rate": 0.00010440993788819877, "loss": 1.0133, "step": 7700 }, { "epoch": 1.9130434782608696, "eval_accuracy": 0.7766434920355539, "eval_loss": 0.847861111164093, "eval_runtime": 87.2569, "eval_samples_per_second": 130.225, "eval_steps_per_second": 16.285, "step": 7700 }, { "epoch": 1.9155279503105591, "grad_norm": 5.123132228851318, "learning_rate": 0.0001042857142857143, "loss": 0.8615, "step": 7710 }, { "epoch": 1.9180124223602486, "grad_norm": 5.093189716339111, "learning_rate": 0.00010416149068322983, "loss": 0.8288, "step": 7720 }, { "epoch": 1.9204968944099379, "grad_norm": 7.318862438201904, "learning_rate": 0.00010403726708074534, "loss": 1.0229, "step": 7730 }, { "epoch": 1.9229813664596274, "grad_norm": 7.412812232971191, "learning_rate": 0.00010391304347826087, "loss": 1.0989, "step": 7740 }, { "epoch": 1.9254658385093166, "grad_norm": 5.066961288452148, "learning_rate": 0.0001037888198757764, "loss": 0.9002, "step": 7750 }, { "epoch": 1.9279503105590061, "grad_norm": 6.0254364013671875, "learning_rate": 0.00010366459627329192, "loss": 0.8101, "step": 7760 }, { "epoch": 1.9304347826086956, "grad_norm": 7.5015716552734375, "learning_rate": 0.00010354037267080745, "loss": 1.0433, "step": 7770 }, { "epoch": 1.932919254658385, "grad_norm": 6.577775955200195, "learning_rate": 0.00010341614906832298, "loss": 0.8738, "step": 7780 }, { "epoch": 1.9354037267080746, "grad_norm": 6.867348670959473, "learning_rate": 0.00010329192546583852, "loss": 0.7594, "step": 7790 }, { "epoch": 1.937888198757764, "grad_norm": 5.827150821685791, "learning_rate": 0.00010316770186335405, "loss": 0.8395, "step": 7800 }, { "epoch": 1.937888198757764, "eval_accuracy": 0.7888761770659157, "eval_loss": 0.8051999807357788, "eval_runtime": 87.364, "eval_samples_per_second": 130.065, "eval_steps_per_second": 16.265, "step": 7800 }, { "epoch": 1.9403726708074536, "grad_norm": 7.16851282119751, "learning_rate": 0.00010304347826086957, "loss": 0.8766, "step": 7810 }, { "epoch": 1.9428571428571428, "grad_norm": 7.723792552947998, "learning_rate": 0.0001029192546583851, "loss": 1.0962, "step": 7820 }, { "epoch": 1.9453416149068323, "grad_norm": 7.399579048156738, "learning_rate": 0.00010279503105590063, "loss": 1.3492, "step": 7830 }, { "epoch": 1.9478260869565216, "grad_norm": 4.434156894683838, "learning_rate": 0.00010267080745341615, "loss": 0.9581, "step": 7840 }, { "epoch": 1.950310559006211, "grad_norm": 2.9146640300750732, "learning_rate": 0.00010254658385093168, "loss": 0.7751, "step": 7850 }, { "epoch": 1.9527950310559006, "grad_norm": 4.098471164703369, "learning_rate": 0.0001024223602484472, "loss": 0.9124, "step": 7860 }, { "epoch": 1.95527950310559, "grad_norm": 6.989963054656982, "learning_rate": 0.00010229813664596272, "loss": 0.9057, "step": 7870 }, { "epoch": 1.9577639751552796, "grad_norm": 5.746939659118652, "learning_rate": 0.00010217391304347828, "loss": 0.8356, "step": 7880 }, { "epoch": 1.960248447204969, "grad_norm": 10.21794605255127, "learning_rate": 0.0001020496894409938, "loss": 0.8364, "step": 7890 }, { "epoch": 1.9627329192546585, "grad_norm": 2.191908597946167, "learning_rate": 0.00010192546583850933, "loss": 0.8803, "step": 7900 }, { "epoch": 1.9627329192546585, "eval_accuracy": 0.7775235413183138, "eval_loss": 0.8379384875297546, "eval_runtime": 87.2198, "eval_samples_per_second": 130.28, "eval_steps_per_second": 16.292, "step": 7900 }, { "epoch": 1.9652173913043478, "grad_norm": 8.37902545928955, "learning_rate": 0.00010180124223602486, "loss": 0.972, "step": 7910 }, { "epoch": 1.9677018633540373, "grad_norm": 6.292512893676758, "learning_rate": 0.00010167701863354037, "loss": 0.8397, "step": 7920 }, { "epoch": 1.9701863354037266, "grad_norm": 2.5551600456237793, "learning_rate": 0.0001015527950310559, "loss": 0.7601, "step": 7930 }, { "epoch": 1.972670807453416, "grad_norm": 6.245602607727051, "learning_rate": 0.00010142857142857143, "loss": 1.1527, "step": 7940 }, { "epoch": 1.9751552795031055, "grad_norm": 6.054067611694336, "learning_rate": 0.00010130434782608695, "loss": 1.0931, "step": 7950 }, { "epoch": 1.977639751552795, "grad_norm": 9.452044486999512, "learning_rate": 0.00010118012422360248, "loss": 1.0301, "step": 7960 }, { "epoch": 1.9801242236024845, "grad_norm": 6.898012638092041, "learning_rate": 0.00010105590062111802, "loss": 0.9799, "step": 7970 }, { "epoch": 1.982608695652174, "grad_norm": 6.751274108886719, "learning_rate": 0.00010093167701863355, "loss": 0.8214, "step": 7980 }, { "epoch": 1.9850931677018635, "grad_norm": 5.453399658203125, "learning_rate": 0.00010080745341614908, "loss": 0.7934, "step": 7990 }, { "epoch": 1.9875776397515528, "grad_norm": 6.991562366485596, "learning_rate": 0.0001006832298136646, "loss": 0.7866, "step": 8000 }, { "epoch": 1.9875776397515528, "eval_accuracy": 0.7835078764410807, "eval_loss": 0.8282920718193054, "eval_runtime": 87.4848, "eval_samples_per_second": 129.885, "eval_steps_per_second": 16.243, "step": 8000 }, { "epoch": 1.9900621118012423, "grad_norm": 9.726250648498535, "learning_rate": 0.00010055900621118013, "loss": 0.9478, "step": 8010 }, { "epoch": 1.9925465838509315, "grad_norm": 7.002394676208496, "learning_rate": 0.00010043478260869566, "loss": 0.9265, "step": 8020 }, { "epoch": 1.995031055900621, "grad_norm": 6.561404228210449, "learning_rate": 0.00010031055900621117, "loss": 0.9182, "step": 8030 }, { "epoch": 1.9975155279503105, "grad_norm": 7.831599712371826, "learning_rate": 0.0001001863354037267, "loss": 0.9248, "step": 8040 }, { "epoch": 2.0, "grad_norm": 0.11542998999357224, "learning_rate": 0.00010006211180124223, "loss": 0.763, "step": 8050 }, { "epoch": 2.0024844720496895, "grad_norm": 6.781834602355957, "learning_rate": 9.993788819875776e-05, "loss": 0.8077, "step": 8060 }, { "epoch": 2.004968944099379, "grad_norm": 7.08714485168457, "learning_rate": 9.981366459627329e-05, "loss": 0.6632, "step": 8070 }, { "epoch": 2.0074534161490685, "grad_norm": 6.069121360778809, "learning_rate": 9.968944099378884e-05, "loss": 0.9374, "step": 8080 }, { "epoch": 2.009937888198758, "grad_norm": 9.966570854187012, "learning_rate": 9.956521739130435e-05, "loss": 0.9113, "step": 8090 }, { "epoch": 2.012422360248447, "grad_norm": 3.953974962234497, "learning_rate": 9.944099378881988e-05, "loss": 0.5067, "step": 8100 }, { "epoch": 2.012422360248447, "eval_accuracy": 0.7835078764410807, "eval_loss": 0.8207420110702515, "eval_runtime": 87.7175, "eval_samples_per_second": 129.541, "eval_steps_per_second": 16.2, "step": 8100 }, { "epoch": 2.0149068322981365, "grad_norm": 5.133342266082764, "learning_rate": 9.931677018633541e-05, "loss": 0.7078, "step": 8110 }, { "epoch": 2.017391304347826, "grad_norm": 8.229430198669434, "learning_rate": 9.919254658385093e-05, "loss": 0.7699, "step": 8120 }, { "epoch": 2.0198757763975155, "grad_norm": 3.4556453227996826, "learning_rate": 9.906832298136647e-05, "loss": 0.7699, "step": 8130 }, { "epoch": 2.022360248447205, "grad_norm": 6.761761665344238, "learning_rate": 9.894409937888199e-05, "loss": 0.6424, "step": 8140 }, { "epoch": 2.0248447204968945, "grad_norm": 8.987166404724121, "learning_rate": 9.881987577639752e-05, "loss": 0.9173, "step": 8150 }, { "epoch": 2.027329192546584, "grad_norm": 9.56896686553955, "learning_rate": 9.869565217391305e-05, "loss": 0.9898, "step": 8160 }, { "epoch": 2.0298136645962734, "grad_norm": 5.724196434020996, "learning_rate": 9.857142857142858e-05, "loss": 0.8861, "step": 8170 }, { "epoch": 2.032298136645963, "grad_norm": 4.5643086433410645, "learning_rate": 9.844720496894411e-05, "loss": 0.6865, "step": 8180 }, { "epoch": 2.034782608695652, "grad_norm": 7.3250627517700195, "learning_rate": 9.832298136645964e-05, "loss": 0.7533, "step": 8190 }, { "epoch": 2.0372670807453415, "grad_norm": 4.573007106781006, "learning_rate": 9.819875776397515e-05, "loss": 0.7083, "step": 8200 }, { "epoch": 2.0372670807453415, "eval_accuracy": 0.7803396990231453, "eval_loss": 0.8320080637931824, "eval_runtime": 87.9445, "eval_samples_per_second": 129.206, "eval_steps_per_second": 16.158, "step": 8200 }, { "epoch": 2.039751552795031, "grad_norm": 5.410977363586426, "learning_rate": 9.807453416149068e-05, "loss": 0.8974, "step": 8210 }, { "epoch": 2.0422360248447204, "grad_norm": 7.464397430419922, "learning_rate": 9.795031055900621e-05, "loss": 1.0127, "step": 8220 }, { "epoch": 2.04472049689441, "grad_norm": 6.252601623535156, "learning_rate": 9.782608695652174e-05, "loss": 0.8233, "step": 8230 }, { "epoch": 2.0472049689440994, "grad_norm": 6.8147454261779785, "learning_rate": 9.770186335403727e-05, "loss": 0.7511, "step": 8240 }, { "epoch": 2.049689440993789, "grad_norm": 6.70554256439209, "learning_rate": 9.757763975155279e-05, "loss": 0.7293, "step": 8250 }, { "epoch": 2.0521739130434784, "grad_norm": 7.078741073608398, "learning_rate": 9.745341614906833e-05, "loss": 0.7236, "step": 8260 }, { "epoch": 2.054658385093168, "grad_norm": 5.513981819152832, "learning_rate": 9.732919254658386e-05, "loss": 0.6023, "step": 8270 }, { "epoch": 2.057142857142857, "grad_norm": 1.8642979860305786, "learning_rate": 9.720496894409938e-05, "loss": 0.7036, "step": 8280 }, { "epoch": 2.0596273291925464, "grad_norm": 4.278319358825684, "learning_rate": 9.708074534161491e-05, "loss": 0.9708, "step": 8290 }, { "epoch": 2.062111801242236, "grad_norm": 4.464468479156494, "learning_rate": 9.695652173913044e-05, "loss": 0.6581, "step": 8300 }, { "epoch": 2.062111801242236, "eval_accuracy": 0.786852063715568, "eval_loss": 0.8161770701408386, "eval_runtime": 86.2043, "eval_samples_per_second": 131.815, "eval_steps_per_second": 16.484, "step": 8300 }, { "epoch": 2.0645962732919254, "grad_norm": 5.079864501953125, "learning_rate": 9.683229813664597e-05, "loss": 0.6639, "step": 8310 }, { "epoch": 2.067080745341615, "grad_norm": 4.3528361320495605, "learning_rate": 9.67080745341615e-05, "loss": 0.6507, "step": 8320 }, { "epoch": 2.0695652173913044, "grad_norm": 5.734859943389893, "learning_rate": 9.658385093167702e-05, "loss": 0.9273, "step": 8330 }, { "epoch": 2.072049689440994, "grad_norm": 3.430791139602661, "learning_rate": 9.645962732919255e-05, "loss": 0.8294, "step": 8340 }, { "epoch": 2.0745341614906834, "grad_norm": 7.763731479644775, "learning_rate": 9.633540372670809e-05, "loss": 0.892, "step": 8350 }, { "epoch": 2.077018633540373, "grad_norm": 7.946462154388428, "learning_rate": 9.62111801242236e-05, "loss": 0.85, "step": 8360 }, { "epoch": 2.079503105590062, "grad_norm": 5.0240607261657715, "learning_rate": 9.608695652173914e-05, "loss": 1.0335, "step": 8370 }, { "epoch": 2.0819875776397514, "grad_norm": 9.682748794555664, "learning_rate": 9.596273291925467e-05, "loss": 0.9621, "step": 8380 }, { "epoch": 2.084472049689441, "grad_norm": 6.340792655944824, "learning_rate": 9.583850931677018e-05, "loss": 0.7974, "step": 8390 }, { "epoch": 2.0869565217391304, "grad_norm": 10.423264503479004, "learning_rate": 9.571428571428573e-05, "loss": 0.7376, "step": 8400 }, { "epoch": 2.0869565217391304, "eval_accuracy": 0.787116078500396, "eval_loss": 0.8222277164459229, "eval_runtime": 88.2512, "eval_samples_per_second": 128.757, "eval_steps_per_second": 16.102, "step": 8400 }, { "epoch": 2.08944099378882, "grad_norm": 4.946643352508545, "learning_rate": 9.559006211180126e-05, "loss": 0.8182, "step": 8410 }, { "epoch": 2.0919254658385094, "grad_norm": 3.579709768295288, "learning_rate": 9.546583850931677e-05, "loss": 0.7695, "step": 8420 }, { "epoch": 2.094409937888199, "grad_norm": 12.733490943908691, "learning_rate": 9.53416149068323e-05, "loss": 0.8773, "step": 8430 }, { "epoch": 2.0968944099378883, "grad_norm": 6.666749000549316, "learning_rate": 9.521739130434783e-05, "loss": 0.8847, "step": 8440 }, { "epoch": 2.099378881987578, "grad_norm": 4.09303092956543, "learning_rate": 9.509316770186336e-05, "loss": 0.8119, "step": 8450 }, { "epoch": 2.101863354037267, "grad_norm": 6.840397357940674, "learning_rate": 9.496894409937889e-05, "loss": 0.7293, "step": 8460 }, { "epoch": 2.1043478260869564, "grad_norm": 5.2310566902160645, "learning_rate": 9.484472049689441e-05, "loss": 0.767, "step": 8470 }, { "epoch": 2.106832298136646, "grad_norm": 4.113173484802246, "learning_rate": 9.472049689440994e-05, "loss": 0.7956, "step": 8480 }, { "epoch": 2.1093167701863353, "grad_norm": 7.647303104400635, "learning_rate": 9.459627329192548e-05, "loss": 0.8616, "step": 8490 }, { "epoch": 2.111801242236025, "grad_norm": 5.392307281494141, "learning_rate": 9.4472049689441e-05, "loss": 0.6492, "step": 8500 }, { "epoch": 2.111801242236025, "eval_accuracy": 0.786764058787292, "eval_loss": 0.8152782320976257, "eval_runtime": 87.0082, "eval_samples_per_second": 130.597, "eval_steps_per_second": 16.332, "step": 8500 }, { "epoch": 2.1142857142857143, "grad_norm": 3.2599971294403076, "learning_rate": 9.434782608695653e-05, "loss": 0.7039, "step": 8510 }, { "epoch": 2.116770186335404, "grad_norm": 3.6906332969665527, "learning_rate": 9.422360248447206e-05, "loss": 0.6559, "step": 8520 }, { "epoch": 2.1192546583850933, "grad_norm": 9.140853881835938, "learning_rate": 9.409937888198759e-05, "loss": 0.9698, "step": 8530 }, { "epoch": 2.121739130434783, "grad_norm": 4.56060791015625, "learning_rate": 9.397515527950312e-05, "loss": 0.663, "step": 8540 }, { "epoch": 2.124223602484472, "grad_norm": 8.36341381072998, "learning_rate": 9.385093167701863e-05, "loss": 0.8096, "step": 8550 }, { "epoch": 2.1267080745341613, "grad_norm": 9.586607933044434, "learning_rate": 9.372670807453416e-05, "loss": 0.9051, "step": 8560 }, { "epoch": 2.129192546583851, "grad_norm": 7.692372798919678, "learning_rate": 9.360248447204969e-05, "loss": 0.8815, "step": 8570 }, { "epoch": 2.1316770186335403, "grad_norm": 9.203356742858887, "learning_rate": 9.347826086956522e-05, "loss": 0.9408, "step": 8580 }, { "epoch": 2.13416149068323, "grad_norm": 7.31281042098999, "learning_rate": 9.335403726708075e-05, "loss": 0.6291, "step": 8590 }, { "epoch": 2.1366459627329193, "grad_norm": 8.940437316894531, "learning_rate": 9.322981366459628e-05, "loss": 0.6356, "step": 8600 }, { "epoch": 2.1366459627329193, "eval_accuracy": 0.7929244037666109, "eval_loss": 0.7929924726486206, "eval_runtime": 87.3662, "eval_samples_per_second": 130.062, "eval_steps_per_second": 16.265, "step": 8600 }, { "epoch": 2.139130434782609, "grad_norm": 3.0774142742156982, "learning_rate": 9.31055900621118e-05, "loss": 0.8358, "step": 8610 }, { "epoch": 2.1416149068322983, "grad_norm": 7.764039993286133, "learning_rate": 9.298136645962733e-05, "loss": 0.6964, "step": 8620 }, { "epoch": 2.1440993788819878, "grad_norm": 6.5316853523254395, "learning_rate": 9.285714285714286e-05, "loss": 0.7853, "step": 8630 }, { "epoch": 2.146583850931677, "grad_norm": 5.1168928146362305, "learning_rate": 9.273291925465839e-05, "loss": 0.7643, "step": 8640 }, { "epoch": 2.1490683229813663, "grad_norm": 7.292003154754639, "learning_rate": 9.260869565217392e-05, "loss": 0.8261, "step": 8650 }, { "epoch": 2.151552795031056, "grad_norm": 5.8488240242004395, "learning_rate": 9.248447204968943e-05, "loss": 0.8137, "step": 8660 }, { "epoch": 2.1540372670807453, "grad_norm": 5.164108753204346, "learning_rate": 9.236024844720498e-05, "loss": 0.6775, "step": 8670 }, { "epoch": 2.1565217391304348, "grad_norm": 8.760250091552734, "learning_rate": 9.223602484472051e-05, "loss": 0.9372, "step": 8680 }, { "epoch": 2.1590062111801243, "grad_norm": 2.324495315551758, "learning_rate": 9.211180124223602e-05, "loss": 0.6147, "step": 8690 }, { "epoch": 2.1614906832298137, "grad_norm": 11.120918273925781, "learning_rate": 9.198757763975155e-05, "loss": 0.7626, "step": 8700 }, { "epoch": 2.1614906832298137, "eval_accuracy": 0.787380093285224, "eval_loss": 0.8167068958282471, "eval_runtime": 87.706, "eval_samples_per_second": 129.558, "eval_steps_per_second": 16.202, "step": 8700 }, { "epoch": 2.1639751552795032, "grad_norm": 4.185982704162598, "learning_rate": 9.186335403726708e-05, "loss": 1.0471, "step": 8710 }, { "epoch": 2.1664596273291927, "grad_norm": 7.418622016906738, "learning_rate": 9.173913043478261e-05, "loss": 0.8076, "step": 8720 }, { "epoch": 2.1689440993788818, "grad_norm": 6.697909832000732, "learning_rate": 9.161490683229814e-05, "loss": 0.9415, "step": 8730 }, { "epoch": 2.1714285714285713, "grad_norm": 8.501760482788086, "learning_rate": 9.149068322981367e-05, "loss": 1.0257, "step": 8740 }, { "epoch": 2.1739130434782608, "grad_norm": 3.7645459175109863, "learning_rate": 9.136645962732919e-05, "loss": 0.7609, "step": 8750 }, { "epoch": 2.1763975155279502, "grad_norm": 7.28707218170166, "learning_rate": 9.124223602484473e-05, "loss": 0.8866, "step": 8760 }, { "epoch": 2.1788819875776397, "grad_norm": 7.614325046539307, "learning_rate": 9.111801242236025e-05, "loss": 0.812, "step": 8770 }, { "epoch": 2.1813664596273292, "grad_norm": 7.725882053375244, "learning_rate": 9.099378881987578e-05, "loss": 0.7487, "step": 8780 }, { "epoch": 2.1838509316770187, "grad_norm": 6.1779255867004395, "learning_rate": 9.086956521739131e-05, "loss": 0.5971, "step": 8790 }, { "epoch": 2.186335403726708, "grad_norm": 7.485067844390869, "learning_rate": 9.074534161490683e-05, "loss": 0.7389, "step": 8800 }, { "epoch": 2.186335403726708, "eval_accuracy": 0.7888761770659157, "eval_loss": 0.8076306581497192, "eval_runtime": 86.0538, "eval_samples_per_second": 132.045, "eval_steps_per_second": 16.513, "step": 8800 }, { "epoch": 2.1888198757763977, "grad_norm": 4.314478397369385, "learning_rate": 9.062111801242237e-05, "loss": 0.7447, "step": 8810 }, { "epoch": 2.1913043478260867, "grad_norm": 4.1498236656188965, "learning_rate": 9.04968944099379e-05, "loss": 0.6338, "step": 8820 }, { "epoch": 2.1937888198757762, "grad_norm": 6.881325721740723, "learning_rate": 9.037267080745342e-05, "loss": 1.0032, "step": 8830 }, { "epoch": 2.1962732919254657, "grad_norm": 5.005446910858154, "learning_rate": 9.024844720496895e-05, "loss": 0.7338, "step": 8840 }, { "epoch": 2.198757763975155, "grad_norm": 6.156917095184326, "learning_rate": 9.012422360248448e-05, "loss": 0.8672, "step": 8850 }, { "epoch": 2.2012422360248447, "grad_norm": 7.660140037536621, "learning_rate": 9e-05, "loss": 0.7373, "step": 8860 }, { "epoch": 2.203726708074534, "grad_norm": 6.808891296386719, "learning_rate": 8.987577639751554e-05, "loss": 0.9934, "step": 8870 }, { "epoch": 2.2062111801242237, "grad_norm": 2.7845213413238525, "learning_rate": 8.975155279503105e-05, "loss": 0.6374, "step": 8880 }, { "epoch": 2.208695652173913, "grad_norm": 4.146764278411865, "learning_rate": 8.962732919254658e-05, "loss": 0.7385, "step": 8890 }, { "epoch": 2.2111801242236027, "grad_norm": 9.313486099243164, "learning_rate": 8.950310559006213e-05, "loss": 0.503, "step": 8900 }, { "epoch": 2.2111801242236027, "eval_accuracy": 0.786940068643844, "eval_loss": 0.8311988115310669, "eval_runtime": 87.0983, "eval_samples_per_second": 130.462, "eval_steps_per_second": 16.315, "step": 8900 }, { "epoch": 2.2136645962732917, "grad_norm": 2.938624858856201, "learning_rate": 8.937888198757764e-05, "loss": 0.4459, "step": 8910 }, { "epoch": 2.216149068322981, "grad_norm": 5.409054756164551, "learning_rate": 8.925465838509317e-05, "loss": 0.6621, "step": 8920 }, { "epoch": 2.2186335403726707, "grad_norm": 5.15172004699707, "learning_rate": 8.91304347826087e-05, "loss": 0.6624, "step": 8930 }, { "epoch": 2.22111801242236, "grad_norm": 11.084473609924316, "learning_rate": 8.900621118012423e-05, "loss": 0.7716, "step": 8940 }, { "epoch": 2.2236024844720497, "grad_norm": 10.487622261047363, "learning_rate": 8.888198757763976e-05, "loss": 0.773, "step": 8950 }, { "epoch": 2.226086956521739, "grad_norm": 10.246448516845703, "learning_rate": 8.875776397515528e-05, "loss": 0.7211, "step": 8960 }, { "epoch": 2.2285714285714286, "grad_norm": 9.63115406036377, "learning_rate": 8.863354037267081e-05, "loss": 0.7725, "step": 8970 }, { "epoch": 2.231055900621118, "grad_norm": 9.392363548278809, "learning_rate": 8.850931677018634e-05, "loss": 0.55, "step": 8980 }, { "epoch": 2.2335403726708076, "grad_norm": 6.782948017120361, "learning_rate": 8.838509316770187e-05, "loss": 0.8966, "step": 8990 }, { "epoch": 2.2360248447204967, "grad_norm": 5.9813947677612305, "learning_rate": 8.82608695652174e-05, "loss": 0.7901, "step": 9000 }, { "epoch": 2.2360248447204967, "eval_accuracy": 0.7900202411335034, "eval_loss": 0.8137289881706238, "eval_runtime": 87.5605, "eval_samples_per_second": 129.773, "eval_steps_per_second": 16.229, "step": 9000 }, { "epoch": 2.238509316770186, "grad_norm": 6.50111722946167, "learning_rate": 8.813664596273293e-05, "loss": 0.7854, "step": 9010 }, { "epoch": 2.2409937888198757, "grad_norm": 8.988317489624023, "learning_rate": 8.801242236024844e-05, "loss": 0.7795, "step": 9020 }, { "epoch": 2.243478260869565, "grad_norm": 10.681255340576172, "learning_rate": 8.788819875776399e-05, "loss": 0.8802, "step": 9030 }, { "epoch": 2.2459627329192546, "grad_norm": 8.849059104919434, "learning_rate": 8.77639751552795e-05, "loss": 0.6214, "step": 9040 }, { "epoch": 2.248447204968944, "grad_norm": 6.764002799987793, "learning_rate": 8.765217391304348e-05, "loss": 0.9147, "step": 9050 }, { "epoch": 2.2509316770186336, "grad_norm": 9.840096473693848, "learning_rate": 8.752795031055901e-05, "loss": 0.6492, "step": 9060 }, { "epoch": 2.253416149068323, "grad_norm": 3.465550422668457, "learning_rate": 8.740372670807454e-05, "loss": 0.6186, "step": 9070 }, { "epoch": 2.2559006211180126, "grad_norm": 3.6054742336273193, "learning_rate": 8.727950310559007e-05, "loss": 0.6631, "step": 9080 }, { "epoch": 2.2583850931677016, "grad_norm": 10.837676048278809, "learning_rate": 8.715527950310558e-05, "loss": 0.7069, "step": 9090 }, { "epoch": 2.260869565217391, "grad_norm": 3.7660045623779297, "learning_rate": 8.703105590062111e-05, "loss": 0.8387, "step": 9100 }, { "epoch": 2.260869565217391, "eval_accuracy": 0.7831558567279767, "eval_loss": 0.8207471370697021, "eval_runtime": 86.53, "eval_samples_per_second": 131.319, "eval_steps_per_second": 16.422, "step": 9100 }, { "epoch": 2.2633540372670806, "grad_norm": 5.137176036834717, "learning_rate": 8.690683229813666e-05, "loss": 0.7754, "step": 9110 }, { "epoch": 2.26583850931677, "grad_norm": 4.615223407745361, "learning_rate": 8.678260869565217e-05, "loss": 0.588, "step": 9120 }, { "epoch": 2.2683229813664596, "grad_norm": 4.302494525909424, "learning_rate": 8.66583850931677e-05, "loss": 0.8853, "step": 9130 }, { "epoch": 2.270807453416149, "grad_norm": 5.601503372192383, "learning_rate": 8.653416149068323e-05, "loss": 0.7973, "step": 9140 }, { "epoch": 2.2732919254658386, "grad_norm": 4.837513446807861, "learning_rate": 8.640993788819876e-05, "loss": 0.9177, "step": 9150 }, { "epoch": 2.275776397515528, "grad_norm": 8.786465644836426, "learning_rate": 8.62857142857143e-05, "loss": 0.877, "step": 9160 }, { "epoch": 2.2782608695652176, "grad_norm": 6.726296901702881, "learning_rate": 8.616149068322982e-05, "loss": 0.9089, "step": 9170 }, { "epoch": 2.2807453416149066, "grad_norm": 9.3532075881958, "learning_rate": 8.603726708074534e-05, "loss": 0.6529, "step": 9180 }, { "epoch": 2.283229813664596, "grad_norm": 9.594780921936035, "learning_rate": 8.591304347826087e-05, "loss": 0.5744, "step": 9190 }, { "epoch": 2.2857142857142856, "grad_norm": 6.469969272613525, "learning_rate": 8.57888198757764e-05, "loss": 0.7048, "step": 9200 }, { "epoch": 2.2857142857142856, "eval_accuracy": 0.7897562263486755, "eval_loss": 0.8105459213256836, "eval_runtime": 85.966, "eval_samples_per_second": 132.18, "eval_steps_per_second": 16.53, "step": 9200 }, { "epoch": 2.288198757763975, "grad_norm": 3.212139368057251, "learning_rate": 8.566459627329193e-05, "loss": 0.69, "step": 9210 }, { "epoch": 2.2906832298136646, "grad_norm": 8.069912910461426, "learning_rate": 8.554037267080746e-05, "loss": 0.7921, "step": 9220 }, { "epoch": 2.293167701863354, "grad_norm": 4.6540985107421875, "learning_rate": 8.541614906832298e-05, "loss": 0.6708, "step": 9230 }, { "epoch": 2.2956521739130435, "grad_norm": 3.3470239639282227, "learning_rate": 8.529192546583852e-05, "loss": 0.6245, "step": 9240 }, { "epoch": 2.298136645962733, "grad_norm": 3.7410881519317627, "learning_rate": 8.516770186335405e-05, "loss": 0.6826, "step": 9250 }, { "epoch": 2.3006211180124225, "grad_norm": 3.9942305088043213, "learning_rate": 8.504347826086957e-05, "loss": 0.6555, "step": 9260 }, { "epoch": 2.3031055900621116, "grad_norm": 3.727818250656128, "learning_rate": 8.49192546583851e-05, "loss": 0.7326, "step": 9270 }, { "epoch": 2.305590062111801, "grad_norm": 5.355185031890869, "learning_rate": 8.479503105590063e-05, "loss": 1.0129, "step": 9280 }, { "epoch": 2.3080745341614906, "grad_norm": 3.256054639816284, "learning_rate": 8.467080745341616e-05, "loss": 0.5776, "step": 9290 }, { "epoch": 2.31055900621118, "grad_norm": 5.470973968505859, "learning_rate": 8.454658385093169e-05, "loss": 0.6412, "step": 9300 }, { "epoch": 2.31055900621118, "eval_accuracy": 0.7950365220452346, "eval_loss": 0.7829346656799316, "eval_runtime": 86.0629, "eval_samples_per_second": 132.031, "eval_steps_per_second": 16.511, "step": 9300 }, { "epoch": 2.3130434782608695, "grad_norm": 4.965493679046631, "learning_rate": 8.44223602484472e-05, "loss": 0.8235, "step": 9310 }, { "epoch": 2.315527950310559, "grad_norm": 6.479755401611328, "learning_rate": 8.429813664596273e-05, "loss": 0.6298, "step": 9320 }, { "epoch": 2.3180124223602485, "grad_norm": 8.033920288085938, "learning_rate": 8.417391304347828e-05, "loss": 0.572, "step": 9330 }, { "epoch": 2.320496894409938, "grad_norm": 8.532790184020996, "learning_rate": 8.404968944099379e-05, "loss": 0.7044, "step": 9340 }, { "epoch": 2.3229813664596275, "grad_norm": 7.569856643676758, "learning_rate": 8.392546583850932e-05, "loss": 0.9142, "step": 9350 }, { "epoch": 2.3254658385093165, "grad_norm": 3.2040038108825684, "learning_rate": 8.380124223602485e-05, "loss": 0.9008, "step": 9360 }, { "epoch": 2.327950310559006, "grad_norm": 5.969919681549072, "learning_rate": 8.367701863354037e-05, "loss": 0.6898, "step": 9370 }, { "epoch": 2.3304347826086955, "grad_norm": 8.508780479431152, "learning_rate": 8.355279503105591e-05, "loss": 0.6264, "step": 9380 }, { "epoch": 2.332919254658385, "grad_norm": 3.9258530139923096, "learning_rate": 8.342857142857143e-05, "loss": 0.8541, "step": 9390 }, { "epoch": 2.3354037267080745, "grad_norm": 5.126328468322754, "learning_rate": 8.330434782608696e-05, "loss": 0.6864, "step": 9400 }, { "epoch": 2.3354037267080745, "eval_accuracy": 0.7940684678341987, "eval_loss": 0.7850940227508545, "eval_runtime": 85.298, "eval_samples_per_second": 133.215, "eval_steps_per_second": 16.659, "step": 9400 }, { "epoch": 2.337888198757764, "grad_norm": 4.471742153167725, "learning_rate": 8.318012422360249e-05, "loss": 0.7995, "step": 9410 }, { "epoch": 2.3403726708074535, "grad_norm": 3.8531105518341064, "learning_rate": 8.305590062111802e-05, "loss": 0.5166, "step": 9420 }, { "epoch": 2.342857142857143, "grad_norm": 6.191071510314941, "learning_rate": 8.293167701863355e-05, "loss": 0.7302, "step": 9430 }, { "epoch": 2.3453416149068325, "grad_norm": 4.34737491607666, "learning_rate": 8.280745341614908e-05, "loss": 0.8006, "step": 9440 }, { "epoch": 2.3478260869565215, "grad_norm": 6.0214152336120605, "learning_rate": 8.26832298136646e-05, "loss": 0.6947, "step": 9450 }, { "epoch": 2.350310559006211, "grad_norm": 5.802051544189453, "learning_rate": 8.255900621118012e-05, "loss": 0.8839, "step": 9460 }, { "epoch": 2.3527950310559005, "grad_norm": 5.956132888793945, "learning_rate": 8.243478260869565e-05, "loss": 0.7843, "step": 9470 }, { "epoch": 2.35527950310559, "grad_norm": 30.9941349029541, "learning_rate": 8.231055900621118e-05, "loss": 0.8446, "step": 9480 }, { "epoch": 2.3577639751552795, "grad_norm": 6.255371570587158, "learning_rate": 8.218633540372671e-05, "loss": 0.6848, "step": 9490 }, { "epoch": 2.360248447204969, "grad_norm": 5.857180595397949, "learning_rate": 8.206211180124224e-05, "loss": 0.7411, "step": 9500 }, { "epoch": 2.360248447204969, "eval_accuracy": 0.803132975446625, "eval_loss": 0.764218270778656, "eval_runtime": 87.3203, "eval_samples_per_second": 130.13, "eval_steps_per_second": 16.273, "step": 9500 }, { "epoch": 2.3627329192546584, "grad_norm": 7.176181316375732, "learning_rate": 8.193788819875777e-05, "loss": 0.5753, "step": 9510 }, { "epoch": 2.365217391304348, "grad_norm": 8.681370735168457, "learning_rate": 8.18136645962733e-05, "loss": 0.7166, "step": 9520 }, { "epoch": 2.3677018633540374, "grad_norm": 8.568154335021973, "learning_rate": 8.168944099378882e-05, "loss": 0.9307, "step": 9530 }, { "epoch": 2.3701863354037265, "grad_norm": 2.1477255821228027, "learning_rate": 8.156521739130435e-05, "loss": 0.6876, "step": 9540 }, { "epoch": 2.372670807453416, "grad_norm": 11.47255802154541, "learning_rate": 8.144099378881988e-05, "loss": 0.576, "step": 9550 }, { "epoch": 2.3751552795031055, "grad_norm": 7.495718002319336, "learning_rate": 8.131677018633541e-05, "loss": 0.9377, "step": 9560 }, { "epoch": 2.377639751552795, "grad_norm": 5.860555648803711, "learning_rate": 8.119254658385094e-05, "loss": 0.5258, "step": 9570 }, { "epoch": 2.3801242236024844, "grad_norm": 6.226891994476318, "learning_rate": 8.106832298136647e-05, "loss": 0.8246, "step": 9580 }, { "epoch": 2.382608695652174, "grad_norm": 7.560525894165039, "learning_rate": 8.094409937888198e-05, "loss": 0.7171, "step": 9590 }, { "epoch": 2.3850931677018634, "grad_norm": 5.449308395385742, "learning_rate": 8.081987577639753e-05, "loss": 0.6221, "step": 9600 }, { "epoch": 2.3850931677018634, "eval_accuracy": 0.802956965590073, "eval_loss": 0.7602500915527344, "eval_runtime": 87.7045, "eval_samples_per_second": 129.56, "eval_steps_per_second": 16.202, "step": 9600 }, { "epoch": 2.387577639751553, "grad_norm": 7.059185981750488, "learning_rate": 8.069565217391304e-05, "loss": 0.8917, "step": 9610 }, { "epoch": 2.3900621118012424, "grad_norm": 4.307859420776367, "learning_rate": 8.057142857142857e-05, "loss": 0.6865, "step": 9620 }, { "epoch": 2.3925465838509314, "grad_norm": 8.636592864990234, "learning_rate": 8.04472049689441e-05, "loss": 0.825, "step": 9630 }, { "epoch": 2.395031055900621, "grad_norm": 8.701264381408691, "learning_rate": 8.032298136645962e-05, "loss": 0.7943, "step": 9640 }, { "epoch": 2.3975155279503104, "grad_norm": 6.308772563934326, "learning_rate": 8.019875776397516e-05, "loss": 0.6928, "step": 9650 }, { "epoch": 2.4, "grad_norm": 8.055970191955566, "learning_rate": 8.00745341614907e-05, "loss": 0.7339, "step": 9660 }, { "epoch": 2.4024844720496894, "grad_norm": 7.82169246673584, "learning_rate": 7.995031055900621e-05, "loss": 0.617, "step": 9670 }, { "epoch": 2.404968944099379, "grad_norm": 5.849754333496094, "learning_rate": 7.982608695652174e-05, "loss": 0.6298, "step": 9680 }, { "epoch": 2.4074534161490684, "grad_norm": 7.069714069366455, "learning_rate": 7.970186335403727e-05, "loss": 0.8778, "step": 9690 }, { "epoch": 2.409937888198758, "grad_norm": 8.241842269897461, "learning_rate": 7.95776397515528e-05, "loss": 0.7769, "step": 9700 }, { "epoch": 2.409937888198758, "eval_accuracy": 0.7975006600369621, "eval_loss": 0.7845885157585144, "eval_runtime": 88.9404, "eval_samples_per_second": 127.76, "eval_steps_per_second": 15.977, "step": 9700 }, { "epoch": 2.4124223602484474, "grad_norm": 4.8985700607299805, "learning_rate": 7.945341614906833e-05, "loss": 0.5057, "step": 9710 }, { "epoch": 2.4149068322981364, "grad_norm": 6.42218542098999, "learning_rate": 7.932919254658385e-05, "loss": 0.5966, "step": 9720 }, { "epoch": 2.417391304347826, "grad_norm": 5.961623668670654, "learning_rate": 7.920496894409938e-05, "loss": 0.6385, "step": 9730 }, { "epoch": 2.4198757763975154, "grad_norm": 10.123414993286133, "learning_rate": 7.908074534161492e-05, "loss": 0.8103, "step": 9740 }, { "epoch": 2.422360248447205, "grad_norm": 8.706270217895508, "learning_rate": 7.895652173913044e-05, "loss": 0.7, "step": 9750 }, { "epoch": 2.4248447204968944, "grad_norm": 5.495620250701904, "learning_rate": 7.883229813664597e-05, "loss": 0.6731, "step": 9760 }, { "epoch": 2.427329192546584, "grad_norm": 7.219951152801514, "learning_rate": 7.87080745341615e-05, "loss": 0.5581, "step": 9770 }, { "epoch": 2.4298136645962733, "grad_norm": 6.016363620758057, "learning_rate": 7.858385093167703e-05, "loss": 0.5895, "step": 9780 }, { "epoch": 2.432298136645963, "grad_norm": 7.8357625007629395, "learning_rate": 7.845962732919256e-05, "loss": 0.7681, "step": 9790 }, { "epoch": 2.4347826086956523, "grad_norm": 3.6328165531158447, "learning_rate": 7.833540372670807e-05, "loss": 0.7939, "step": 9800 }, { "epoch": 2.4347826086956523, "eval_accuracy": 0.7932764234797148, "eval_loss": 0.7914384603500366, "eval_runtime": 88.7006, "eval_samples_per_second": 128.105, "eval_steps_per_second": 16.02, "step": 9800 }, { "epoch": 2.4372670807453414, "grad_norm": 3.617049217224121, "learning_rate": 7.82111801242236e-05, "loss": 0.5236, "step": 9810 }, { "epoch": 2.439751552795031, "grad_norm": 4.9923577308654785, "learning_rate": 7.808695652173913e-05, "loss": 0.6392, "step": 9820 }, { "epoch": 2.4422360248447204, "grad_norm": 5.581326484680176, "learning_rate": 7.796273291925466e-05, "loss": 0.8614, "step": 9830 }, { "epoch": 2.44472049689441, "grad_norm": 6.245087623596191, "learning_rate": 7.783850931677019e-05, "loss": 0.504, "step": 9840 }, { "epoch": 2.4472049689440993, "grad_norm": 5.1908111572265625, "learning_rate": 7.771428571428572e-05, "loss": 0.827, "step": 9850 }, { "epoch": 2.449689440993789, "grad_norm": 2.7695984840393066, "learning_rate": 7.759006211180124e-05, "loss": 0.6603, "step": 9860 }, { "epoch": 2.4521739130434783, "grad_norm": 6.33609676361084, "learning_rate": 7.746583850931678e-05, "loss": 0.7115, "step": 9870 }, { "epoch": 2.454658385093168, "grad_norm": 5.498477935791016, "learning_rate": 7.734161490683231e-05, "loss": 0.7111, "step": 9880 }, { "epoch": 2.4571428571428573, "grad_norm": 10.293370246887207, "learning_rate": 7.721739130434783e-05, "loss": 0.8168, "step": 9890 }, { "epoch": 2.4596273291925463, "grad_norm": 4.192574501037598, "learning_rate": 7.709316770186336e-05, "loss": 0.5641, "step": 9900 }, { "epoch": 2.4596273291925463, "eval_accuracy": 0.7991727536742057, "eval_loss": 0.7700155973434448, "eval_runtime": 88.7034, "eval_samples_per_second": 128.101, "eval_steps_per_second": 16.02, "step": 9900 }, { "epoch": 2.462111801242236, "grad_norm": 5.3772735595703125, "learning_rate": 7.696894409937889e-05, "loss": 0.8451, "step": 9910 }, { "epoch": 2.4645962732919253, "grad_norm": 7.285436630249023, "learning_rate": 7.684472049689442e-05, "loss": 0.8242, "step": 9920 }, { "epoch": 2.467080745341615, "grad_norm": 6.7737345695495605, "learning_rate": 7.672049689440995e-05, "loss": 0.927, "step": 9930 }, { "epoch": 2.4695652173913043, "grad_norm": 4.772755146026611, "learning_rate": 7.659627329192546e-05, "loss": 0.9219, "step": 9940 }, { "epoch": 2.472049689440994, "grad_norm": 4.947612762451172, "learning_rate": 7.6472049689441e-05, "loss": 0.6056, "step": 9950 }, { "epoch": 2.4745341614906833, "grad_norm": 5.71645450592041, "learning_rate": 7.634782608695654e-05, "loss": 0.6751, "step": 9960 }, { "epoch": 2.4770186335403728, "grad_norm": 7.68681526184082, "learning_rate": 7.622360248447205e-05, "loss": 0.4968, "step": 9970 }, { "epoch": 2.4795031055900623, "grad_norm": 4.070769786834717, "learning_rate": 7.609937888198758e-05, "loss": 0.5075, "step": 9980 }, { "epoch": 2.4819875776397513, "grad_norm": 28.193359375, "learning_rate": 7.597515527950311e-05, "loss": 0.7343, "step": 9990 }, { "epoch": 2.4844720496894412, "grad_norm": 4.914248943328857, "learning_rate": 7.585093167701863e-05, "loss": 0.8009, "step": 10000 }, { "epoch": 2.4844720496894412, "eval_accuracy": 0.8015488867376573, "eval_loss": 0.7699164152145386, "eval_runtime": 88.0937, "eval_samples_per_second": 128.988, "eval_steps_per_second": 16.131, "step": 10000 }, { "epoch": 2.4869565217391303, "grad_norm": 10.814724922180176, "learning_rate": 7.572670807453417e-05, "loss": 0.7799, "step": 10010 }, { "epoch": 2.48944099378882, "grad_norm": 10.952703475952148, "learning_rate": 7.560248447204969e-05, "loss": 0.7478, "step": 10020 }, { "epoch": 2.4919254658385093, "grad_norm": 7.243926525115967, "learning_rate": 7.547826086956522e-05, "loss": 0.5972, "step": 10030 }, { "epoch": 2.4944099378881988, "grad_norm": 5.8431010246276855, "learning_rate": 7.535403726708075e-05, "loss": 0.6964, "step": 10040 }, { "epoch": 2.4968944099378882, "grad_norm": 6.788570880889893, "learning_rate": 7.522981366459627e-05, "loss": 0.6192, "step": 10050 }, { "epoch": 2.4993788819875777, "grad_norm": 7.250670433044434, "learning_rate": 7.510559006211181e-05, "loss": 0.6746, "step": 10060 }, { "epoch": 2.5018633540372672, "grad_norm": 5.413866996765137, "learning_rate": 7.498136645962734e-05, "loss": 0.827, "step": 10070 }, { "epoch": 2.5043478260869563, "grad_norm": 5.322055816650391, "learning_rate": 7.485714285714285e-05, "loss": 0.5904, "step": 10080 }, { "epoch": 2.506832298136646, "grad_norm": 7.097953796386719, "learning_rate": 7.473291925465838e-05, "loss": 0.6116, "step": 10090 }, { "epoch": 2.5093167701863353, "grad_norm": 4.7179341316223145, "learning_rate": 7.460869565217391e-05, "loss": 0.6111, "step": 10100 }, { "epoch": 2.5093167701863353, "eval_accuracy": 0.8035730000880049, "eval_loss": 0.7602738738059998, "eval_runtime": 87.8798, "eval_samples_per_second": 129.302, "eval_steps_per_second": 16.17, "step": 10100 }, { "epoch": 2.5118012422360247, "grad_norm": 4.682028770446777, "learning_rate": 7.448447204968944e-05, "loss": 0.527, "step": 10110 }, { "epoch": 2.5142857142857142, "grad_norm": 4.885335445404053, "learning_rate": 7.436024844720497e-05, "loss": 1.01, "step": 10120 }, { "epoch": 2.5167701863354037, "grad_norm": 4.012519359588623, "learning_rate": 7.42360248447205e-05, "loss": 0.5805, "step": 10130 }, { "epoch": 2.519254658385093, "grad_norm": 8.987902641296387, "learning_rate": 7.411180124223602e-05, "loss": 0.6547, "step": 10140 }, { "epoch": 2.5217391304347827, "grad_norm": 7.08282995223999, "learning_rate": 7.398757763975156e-05, "loss": 0.8004, "step": 10150 }, { "epoch": 2.524223602484472, "grad_norm": 5.9463396072387695, "learning_rate": 7.386335403726708e-05, "loss": 0.893, "step": 10160 }, { "epoch": 2.5267080745341612, "grad_norm": 3.2586588859558105, "learning_rate": 7.373913043478261e-05, "loss": 0.6272, "step": 10170 }, { "epoch": 2.529192546583851, "grad_norm": 5.880133628845215, "learning_rate": 7.361490683229814e-05, "loss": 0.6464, "step": 10180 }, { "epoch": 2.53167701863354, "grad_norm": 10.840839385986328, "learning_rate": 7.349068322981367e-05, "loss": 0.7131, "step": 10190 }, { "epoch": 2.5341614906832297, "grad_norm": 7.217662334442139, "learning_rate": 7.33664596273292e-05, "loss": 0.925, "step": 10200 }, { "epoch": 2.5341614906832297, "eval_accuracy": 0.8003168177417935, "eval_loss": 0.7727270126342773, "eval_runtime": 87.6344, "eval_samples_per_second": 129.664, "eval_steps_per_second": 16.215, "step": 10200 }, { "epoch": 2.536645962732919, "grad_norm": 3.556689500808716, "learning_rate": 7.324223602484473e-05, "loss": 0.6457, "step": 10210 }, { "epoch": 2.5391304347826087, "grad_norm": 7.633065223693848, "learning_rate": 7.311801242236025e-05, "loss": 0.7647, "step": 10220 }, { "epoch": 2.541614906832298, "grad_norm": 3.796308755874634, "learning_rate": 7.299378881987578e-05, "loss": 0.708, "step": 10230 }, { "epoch": 2.5440993788819877, "grad_norm": 7.235866546630859, "learning_rate": 7.28695652173913e-05, "loss": 0.8837, "step": 10240 }, { "epoch": 2.546583850931677, "grad_norm": 6.0912184715271, "learning_rate": 7.274534161490684e-05, "loss": 0.9866, "step": 10250 }, { "epoch": 2.549068322981366, "grad_norm": 8.70725154876709, "learning_rate": 7.262111801242237e-05, "loss": 0.8456, "step": 10260 }, { "epoch": 2.551552795031056, "grad_norm": 7.299804210662842, "learning_rate": 7.249689440993788e-05, "loss": 0.5935, "step": 10270 }, { "epoch": 2.554037267080745, "grad_norm": 6.128955841064453, "learning_rate": 7.237267080745343e-05, "loss": 0.8323, "step": 10280 }, { "epoch": 2.5565217391304347, "grad_norm": 2.351513624191284, "learning_rate": 7.224844720496896e-05, "loss": 0.6219, "step": 10290 }, { "epoch": 2.559006211180124, "grad_norm": 4.556458473205566, "learning_rate": 7.212422360248447e-05, "loss": 0.6206, "step": 10300 }, { "epoch": 2.559006211180124, "eval_accuracy": 0.7983807093197219, "eval_loss": 0.7765286564826965, "eval_runtime": 87.5463, "eval_samples_per_second": 129.794, "eval_steps_per_second": 16.231, "step": 10300 }, { "epoch": 2.5614906832298137, "grad_norm": 5.282100200653076, "learning_rate": 7.2e-05, "loss": 0.8967, "step": 10310 }, { "epoch": 2.563975155279503, "grad_norm": 5.501987457275391, "learning_rate": 7.187577639751553e-05, "loss": 0.9314, "step": 10320 }, { "epoch": 2.5664596273291926, "grad_norm": 6.691750526428223, "learning_rate": 7.175155279503106e-05, "loss": 0.6248, "step": 10330 }, { "epoch": 2.568944099378882, "grad_norm": 2.3620283603668213, "learning_rate": 7.162732919254659e-05, "loss": 0.6029, "step": 10340 }, { "epoch": 2.571428571428571, "grad_norm": 9.769782066345215, "learning_rate": 7.150310559006211e-05, "loss": 0.8783, "step": 10350 }, { "epoch": 2.573913043478261, "grad_norm": 7.0340681076049805, "learning_rate": 7.137888198757764e-05, "loss": 0.847, "step": 10360 }, { "epoch": 2.57639751552795, "grad_norm": 6.227030277252197, "learning_rate": 7.125465838509318e-05, "loss": 0.5959, "step": 10370 }, { "epoch": 2.5788819875776396, "grad_norm": 4.65595817565918, "learning_rate": 7.11304347826087e-05, "loss": 0.6842, "step": 10380 }, { "epoch": 2.581366459627329, "grad_norm": 9.326735496520996, "learning_rate": 7.100621118012423e-05, "loss": 0.5908, "step": 10390 }, { "epoch": 2.5838509316770186, "grad_norm": 6.663669109344482, "learning_rate": 7.088198757763976e-05, "loss": 0.5977, "step": 10400 }, { "epoch": 2.5838509316770186, "eval_accuracy": 0.7960045762562703, "eval_loss": 0.7793198823928833, "eval_runtime": 87.3653, "eval_samples_per_second": 130.063, "eval_steps_per_second": 16.265, "step": 10400 }, { "epoch": 2.586335403726708, "grad_norm": 6.158738136291504, "learning_rate": 7.075776397515527e-05, "loss": 0.7951, "step": 10410 }, { "epoch": 2.5888198757763976, "grad_norm": 3.2913687229156494, "learning_rate": 7.063354037267082e-05, "loss": 0.8243, "step": 10420 }, { "epoch": 2.591304347826087, "grad_norm": 10.81008529663086, "learning_rate": 7.050931677018633e-05, "loss": 0.8896, "step": 10430 }, { "epoch": 2.593788819875776, "grad_norm": 5.766603469848633, "learning_rate": 7.038509316770186e-05, "loss": 0.7315, "step": 10440 }, { "epoch": 2.596273291925466, "grad_norm": 6.073093414306641, "learning_rate": 7.02608695652174e-05, "loss": 0.7484, "step": 10450 }, { "epoch": 2.598757763975155, "grad_norm": 1.5353639125823975, "learning_rate": 7.013664596273292e-05, "loss": 0.6251, "step": 10460 }, { "epoch": 2.6012422360248446, "grad_norm": 4.442315101623535, "learning_rate": 7.001242236024845e-05, "loss": 0.7067, "step": 10470 }, { "epoch": 2.603726708074534, "grad_norm": 1.1733781099319458, "learning_rate": 6.988819875776398e-05, "loss": 0.5883, "step": 10480 }, { "epoch": 2.6062111801242236, "grad_norm": 5.4250712394714355, "learning_rate": 6.97639751552795e-05, "loss": 0.7153, "step": 10490 }, { "epoch": 2.608695652173913, "grad_norm": 6.374954700469971, "learning_rate": 6.963975155279503e-05, "loss": 0.8146, "step": 10500 }, { "epoch": 2.608695652173913, "eval_accuracy": 0.79776467482179, "eval_loss": 0.7799441814422607, "eval_runtime": 87.4711, "eval_samples_per_second": 129.906, "eval_steps_per_second": 16.245, "step": 10500 }, { "epoch": 2.6111801242236026, "grad_norm": 5.935840129852295, "learning_rate": 6.951552795031057e-05, "loss": 0.7184, "step": 10510 }, { "epoch": 2.613664596273292, "grad_norm": 1.9507098197937012, "learning_rate": 6.939130434782609e-05, "loss": 0.6237, "step": 10520 }, { "epoch": 2.616149068322981, "grad_norm": 4.937575340270996, "learning_rate": 6.926708074534162e-05, "loss": 0.7694, "step": 10530 }, { "epoch": 2.618633540372671, "grad_norm": 5.712149143218994, "learning_rate": 6.914285714285715e-05, "loss": 0.6623, "step": 10540 }, { "epoch": 2.62111801242236, "grad_norm": 6.4136247634887695, "learning_rate": 6.901863354037268e-05, "loss": 0.6992, "step": 10550 }, { "epoch": 2.6236024844720496, "grad_norm": 5.391094207763672, "learning_rate": 6.889440993788821e-05, "loss": 0.691, "step": 10560 }, { "epoch": 2.626086956521739, "grad_norm": 7.592553615570068, "learning_rate": 6.877018633540372e-05, "loss": 0.5635, "step": 10570 }, { "epoch": 2.6285714285714286, "grad_norm": 6.203282833099365, "learning_rate": 6.864596273291925e-05, "loss": 0.5702, "step": 10580 }, { "epoch": 2.631055900621118, "grad_norm": 11.920433044433594, "learning_rate": 6.852173913043478e-05, "loss": 0.8267, "step": 10590 }, { "epoch": 2.6335403726708075, "grad_norm": 7.057547092437744, "learning_rate": 6.839751552795031e-05, "loss": 0.7869, "step": 10600 }, { "epoch": 2.6335403726708075, "eval_accuracy": 0.808677285928012, "eval_loss": 0.739636242389679, "eval_runtime": 86.958, "eval_samples_per_second": 130.672, "eval_steps_per_second": 16.341, "step": 10600 }, { "epoch": 2.636024844720497, "grad_norm": 5.696042537689209, "learning_rate": 6.827329192546584e-05, "loss": 0.5901, "step": 10610 }, { "epoch": 2.638509316770186, "grad_norm": 9.730021476745605, "learning_rate": 6.814906832298137e-05, "loss": 0.7449, "step": 10620 }, { "epoch": 2.640993788819876, "grad_norm": 1.459912657737732, "learning_rate": 6.802484472049689e-05, "loss": 0.6211, "step": 10630 }, { "epoch": 2.643478260869565, "grad_norm": 4.86639404296875, "learning_rate": 6.790062111801243e-05, "loss": 0.7677, "step": 10640 }, { "epoch": 2.6459627329192545, "grad_norm": 2.849155902862549, "learning_rate": 6.777639751552795e-05, "loss": 0.7334, "step": 10650 }, { "epoch": 2.648447204968944, "grad_norm": 6.500259876251221, "learning_rate": 6.765217391304348e-05, "loss": 0.821, "step": 10660 }, { "epoch": 2.6509316770186335, "grad_norm": 3.8310985565185547, "learning_rate": 6.752795031055901e-05, "loss": 0.8068, "step": 10670 }, { "epoch": 2.653416149068323, "grad_norm": 5.364236831665039, "learning_rate": 6.740372670807453e-05, "loss": 0.6021, "step": 10680 }, { "epoch": 2.6559006211180125, "grad_norm": 3.1258809566497803, "learning_rate": 6.727950310559007e-05, "loss": 0.7372, "step": 10690 }, { "epoch": 2.658385093167702, "grad_norm": 6.12645959854126, "learning_rate": 6.71552795031056e-05, "loss": 0.8966, "step": 10700 }, { "epoch": 2.658385093167702, "eval_accuracy": 0.8070931972190443, "eval_loss": 0.7386279702186584, "eval_runtime": 87.2299, "eval_samples_per_second": 130.265, "eval_steps_per_second": 16.29, "step": 10700 }, { "epoch": 2.660869565217391, "grad_norm": 7.923446178436279, "learning_rate": 6.703105590062112e-05, "loss": 0.7069, "step": 10710 }, { "epoch": 2.663354037267081, "grad_norm": 8.067530632019043, "learning_rate": 6.690683229813665e-05, "loss": 0.6993, "step": 10720 }, { "epoch": 2.66583850931677, "grad_norm": 2.588629722595215, "learning_rate": 6.678260869565218e-05, "loss": 0.6455, "step": 10730 }, { "epoch": 2.6683229813664595, "grad_norm": 6.204483509063721, "learning_rate": 6.66583850931677e-05, "loss": 0.7036, "step": 10740 }, { "epoch": 2.670807453416149, "grad_norm": 6.223699569702148, "learning_rate": 6.653416149068324e-05, "loss": 0.7665, "step": 10750 }, { "epoch": 2.6732919254658385, "grad_norm": 5.856508255004883, "learning_rate": 6.640993788819875e-05, "loss": 0.7502, "step": 10760 }, { "epoch": 2.675776397515528, "grad_norm": 4.8994293212890625, "learning_rate": 6.628571428571428e-05, "loss": 0.8523, "step": 10770 }, { "epoch": 2.6782608695652175, "grad_norm": 12.497848510742188, "learning_rate": 6.616149068322983e-05, "loss": 0.7933, "step": 10780 }, { "epoch": 2.680745341614907, "grad_norm": 5.682429790496826, "learning_rate": 6.603726708074534e-05, "loss": 0.4855, "step": 10790 }, { "epoch": 2.683229813664596, "grad_norm": 6.263789176940918, "learning_rate": 6.591304347826087e-05, "loss": 0.6654, "step": 10800 }, { "epoch": 2.683229813664596, "eval_accuracy": 0.8103493795652557, "eval_loss": 0.7305024266242981, "eval_runtime": 86.2303, "eval_samples_per_second": 131.775, "eval_steps_per_second": 16.479, "step": 10800 }, { "epoch": 2.685714285714286, "grad_norm": 6.363834381103516, "learning_rate": 6.57888198757764e-05, "loss": 0.5354, "step": 10810 }, { "epoch": 2.688198757763975, "grad_norm": 5.781926155090332, "learning_rate": 6.566459627329193e-05, "loss": 0.6147, "step": 10820 }, { "epoch": 2.6906832298136645, "grad_norm": 3.1562442779541016, "learning_rate": 6.554037267080746e-05, "loss": 0.7169, "step": 10830 }, { "epoch": 2.693167701863354, "grad_norm": 6.964587211608887, "learning_rate": 6.541614906832299e-05, "loss": 0.6797, "step": 10840 }, { "epoch": 2.6956521739130435, "grad_norm": 4.136144638061523, "learning_rate": 6.529192546583851e-05, "loss": 0.9134, "step": 10850 }, { "epoch": 2.698136645962733, "grad_norm": 2.366265296936035, "learning_rate": 6.516770186335404e-05, "loss": 0.5522, "step": 10860 }, { "epoch": 2.7006211180124224, "grad_norm": 4.044836521148682, "learning_rate": 6.504347826086957e-05, "loss": 0.5896, "step": 10870 }, { "epoch": 2.703105590062112, "grad_norm": 7.166288375854492, "learning_rate": 6.49192546583851e-05, "loss": 0.8243, "step": 10880 }, { "epoch": 2.705590062111801, "grad_norm": 4.863167762756348, "learning_rate": 6.479503105590063e-05, "loss": 0.7812, "step": 10890 }, { "epoch": 2.708074534161491, "grad_norm": 4.528777122497559, "learning_rate": 6.467080745341614e-05, "loss": 0.737, "step": 10900 }, { "epoch": 2.708074534161491, "eval_accuracy": 0.8083252662149081, "eval_loss": 0.7316586971282959, "eval_runtime": 87.475, "eval_samples_per_second": 129.9, "eval_steps_per_second": 16.245, "step": 10900 }, { "epoch": 2.71055900621118, "grad_norm": 4.942448139190674, "learning_rate": 6.454658385093169e-05, "loss": 0.6569, "step": 10910 }, { "epoch": 2.7130434782608694, "grad_norm": 4.801420211791992, "learning_rate": 6.442236024844722e-05, "loss": 0.8062, "step": 10920 }, { "epoch": 2.715527950310559, "grad_norm": 5.124699115753174, "learning_rate": 6.429813664596273e-05, "loss": 0.6353, "step": 10930 }, { "epoch": 2.7180124223602484, "grad_norm": 7.245678901672363, "learning_rate": 6.417391304347826e-05, "loss": 0.8347, "step": 10940 }, { "epoch": 2.720496894409938, "grad_norm": 5.200338363647461, "learning_rate": 6.40496894409938e-05, "loss": 0.7588, "step": 10950 }, { "epoch": 2.7229813664596274, "grad_norm": 2.782305955886841, "learning_rate": 6.392546583850932e-05, "loss": 0.4884, "step": 10960 }, { "epoch": 2.725465838509317, "grad_norm": 4.4365363121032715, "learning_rate": 6.380124223602485e-05, "loss": 0.7583, "step": 10970 }, { "epoch": 2.727950310559006, "grad_norm": 8.139409065246582, "learning_rate": 6.367701863354037e-05, "loss": 0.8283, "step": 10980 }, { "epoch": 2.730434782608696, "grad_norm": 3.3418803215026855, "learning_rate": 6.35527950310559e-05, "loss": 0.6336, "step": 10990 }, { "epoch": 2.732919254658385, "grad_norm": 6.447763442993164, "learning_rate": 6.342857142857143e-05, "loss": 0.9283, "step": 11000 }, { "epoch": 2.732919254658385, "eval_accuracy": 0.8071812021473203, "eval_loss": 0.740921676158905, "eval_runtime": 86.417, "eval_samples_per_second": 131.49, "eval_steps_per_second": 16.444, "step": 11000 }, { "epoch": 2.7354037267080744, "grad_norm": 7.569089412689209, "learning_rate": 6.330434782608696e-05, "loss": 0.8814, "step": 11010 }, { "epoch": 2.737888198757764, "grad_norm": 5.908865451812744, "learning_rate": 6.318012422360249e-05, "loss": 0.8493, "step": 11020 }, { "epoch": 2.7403726708074534, "grad_norm": 5.812557697296143, "learning_rate": 6.305590062111802e-05, "loss": 0.6291, "step": 11030 }, { "epoch": 2.742857142857143, "grad_norm": 4.550736904144287, "learning_rate": 6.293167701863354e-05, "loss": 0.7389, "step": 11040 }, { "epoch": 2.7453416149068324, "grad_norm": 7.449479579925537, "learning_rate": 6.280745341614908e-05, "loss": 0.7533, "step": 11050 }, { "epoch": 2.747826086956522, "grad_norm": 4.580323219299316, "learning_rate": 6.26832298136646e-05, "loss": 0.6832, "step": 11060 }, { "epoch": 2.750310559006211, "grad_norm": 5.769420623779297, "learning_rate": 6.255900621118012e-05, "loss": 0.8311, "step": 11070 }, { "epoch": 2.752795031055901, "grad_norm": 7.184681415557861, "learning_rate": 6.243478260869565e-05, "loss": 0.7232, "step": 11080 }, { "epoch": 2.75527950310559, "grad_norm": 4.768852233886719, "learning_rate": 6.231055900621117e-05, "loss": 0.638, "step": 11090 }, { "epoch": 2.7577639751552794, "grad_norm": 9.40058708190918, "learning_rate": 6.218633540372671e-05, "loss": 0.7491, "step": 11100 }, { "epoch": 2.7577639751552794, "eval_accuracy": 0.8152776555487107, "eval_loss": 0.7087730169296265, "eval_runtime": 86.1576, "eval_samples_per_second": 131.886, "eval_steps_per_second": 16.493, "step": 11100 }, { "epoch": 2.760248447204969, "grad_norm": 6.754823207855225, "learning_rate": 6.206211180124224e-05, "loss": 0.7061, "step": 11110 }, { "epoch": 2.7627329192546584, "grad_norm": 5.724888801574707, "learning_rate": 6.193788819875776e-05, "loss": 0.5908, "step": 11120 }, { "epoch": 2.765217391304348, "grad_norm": 5.33830451965332, "learning_rate": 6.181366459627329e-05, "loss": 0.9152, "step": 11130 }, { "epoch": 2.7677018633540373, "grad_norm": 5.377154350280762, "learning_rate": 6.168944099378882e-05, "loss": 0.6783, "step": 11140 }, { "epoch": 2.770186335403727, "grad_norm": 6.318910121917725, "learning_rate": 6.156521739130435e-05, "loss": 0.7599, "step": 11150 }, { "epoch": 2.772670807453416, "grad_norm": 7.895182132720947, "learning_rate": 6.144099378881988e-05, "loss": 0.7931, "step": 11160 }, { "epoch": 2.775155279503106, "grad_norm": 8.503508567810059, "learning_rate": 6.131677018633541e-05, "loss": 0.6652, "step": 11170 }, { "epoch": 2.777639751552795, "grad_norm": 6.544893264770508, "learning_rate": 6.119254658385093e-05, "loss": 0.5642, "step": 11180 }, { "epoch": 2.7801242236024843, "grad_norm": 5.325340270996094, "learning_rate": 6.106832298136647e-05, "loss": 0.6045, "step": 11190 }, { "epoch": 2.782608695652174, "grad_norm": 8.904745101928711, "learning_rate": 6.094409937888199e-05, "loss": 0.6807, "step": 11200 }, { "epoch": 2.782608695652174, "eval_accuracy": 0.8122854879873272, "eval_loss": 0.715432345867157, "eval_runtime": 87.227, "eval_samples_per_second": 130.269, "eval_steps_per_second": 16.291, "step": 11200 }, { "epoch": 2.7850931677018633, "grad_norm": 5.014203071594238, "learning_rate": 6.0819875776397516e-05, "loss": 0.542, "step": 11210 }, { "epoch": 2.787577639751553, "grad_norm": 6.621218681335449, "learning_rate": 6.069565217391304e-05, "loss": 0.524, "step": 11220 }, { "epoch": 2.7900621118012423, "grad_norm": 5.968732833862305, "learning_rate": 6.0571428571428576e-05, "loss": 0.6332, "step": 11230 }, { "epoch": 2.792546583850932, "grad_norm": 6.3051438331604, "learning_rate": 6.0447204968944106e-05, "loss": 0.5523, "step": 11240 }, { "epoch": 2.795031055900621, "grad_norm": 3.917712450027466, "learning_rate": 6.032298136645963e-05, "loss": 0.8714, "step": 11250 }, { "epoch": 2.7975155279503108, "grad_norm": 6.610170841217041, "learning_rate": 6.019875776397515e-05, "loss": 0.6222, "step": 11260 }, { "epoch": 2.8, "grad_norm": 4.8922953605651855, "learning_rate": 6.007453416149068e-05, "loss": 0.8399, "step": 11270 }, { "epoch": 2.8024844720496893, "grad_norm": 6.774288654327393, "learning_rate": 5.995031055900622e-05, "loss": 0.8241, "step": 11280 }, { "epoch": 2.804968944099379, "grad_norm": 6.792983531951904, "learning_rate": 5.982608695652174e-05, "loss": 0.5947, "step": 11290 }, { "epoch": 2.8074534161490683, "grad_norm": 5.0632734298706055, "learning_rate": 5.9701863354037265e-05, "loss": 0.4485, "step": 11300 }, { "epoch": 2.8074534161490683, "eval_accuracy": 0.8180058083252663, "eval_loss": 0.6984890103340149, "eval_runtime": 86.6712, "eval_samples_per_second": 131.105, "eval_steps_per_second": 16.395, "step": 11300 }, { "epoch": 2.809937888198758, "grad_norm": 6.2507123947143555, "learning_rate": 5.9577639751552795e-05, "loss": 0.704, "step": 11310 }, { "epoch": 2.8124223602484473, "grad_norm": 5.285377025604248, "learning_rate": 5.945341614906833e-05, "loss": 0.5679, "step": 11320 }, { "epoch": 2.8149068322981368, "grad_norm": 7.2304792404174805, "learning_rate": 5.9329192546583855e-05, "loss": 0.5063, "step": 11330 }, { "epoch": 2.8173913043478263, "grad_norm": 6.580856800079346, "learning_rate": 5.9204968944099385e-05, "loss": 0.5677, "step": 11340 }, { "epoch": 2.8198757763975157, "grad_norm": 5.679018497467041, "learning_rate": 5.908074534161491e-05, "loss": 0.5706, "step": 11350 }, { "epoch": 2.822360248447205, "grad_norm": 5.586709499359131, "learning_rate": 5.895652173913043e-05, "loss": 0.6446, "step": 11360 }, { "epoch": 2.8248447204968943, "grad_norm": 4.558923244476318, "learning_rate": 5.883229813664597e-05, "loss": 0.6804, "step": 11370 }, { "epoch": 2.8273291925465838, "grad_norm": 9.596306800842285, "learning_rate": 5.87080745341615e-05, "loss": 0.6734, "step": 11380 }, { "epoch": 2.8298136645962733, "grad_norm": 3.818284749984741, "learning_rate": 5.858385093167702e-05, "loss": 0.6011, "step": 11390 }, { "epoch": 2.8322981366459627, "grad_norm": 4.609076023101807, "learning_rate": 5.8459627329192544e-05, "loss": 0.6694, "step": 11400 }, { "epoch": 2.8322981366459627, "eval_accuracy": 0.8147496259790549, "eval_loss": 0.7123826146125793, "eval_runtime": 86.7222, "eval_samples_per_second": 131.028, "eval_steps_per_second": 16.386, "step": 11400 }, { "epoch": 2.8347826086956522, "grad_norm": 6.28999137878418, "learning_rate": 5.833540372670808e-05, "loss": 0.6964, "step": 11410 }, { "epoch": 2.8372670807453417, "grad_norm": 3.3696694374084473, "learning_rate": 5.821118012422361e-05, "loss": 0.722, "step": 11420 }, { "epoch": 2.839751552795031, "grad_norm": 8.365155220031738, "learning_rate": 5.8086956521739133e-05, "loss": 0.5097, "step": 11430 }, { "epoch": 2.8422360248447207, "grad_norm": 2.5981850624084473, "learning_rate": 5.7962732919254657e-05, "loss": 0.5728, "step": 11440 }, { "epoch": 2.8447204968944098, "grad_norm": 4.385498523712158, "learning_rate": 5.7838509316770186e-05, "loss": 0.6647, "step": 11450 }, { "epoch": 2.8472049689440992, "grad_norm": 7.318809986114502, "learning_rate": 5.771428571428572e-05, "loss": 0.7441, "step": 11460 }, { "epoch": 2.8496894409937887, "grad_norm": 4.498103141784668, "learning_rate": 5.7590062111801246e-05, "loss": 0.7047, "step": 11470 }, { "epoch": 2.8521739130434782, "grad_norm": 8.885876655578613, "learning_rate": 5.746583850931677e-05, "loss": 0.7089, "step": 11480 }, { "epoch": 2.8546583850931677, "grad_norm": 9.858505249023438, "learning_rate": 5.73416149068323e-05, "loss": 0.7153, "step": 11490 }, { "epoch": 2.857142857142857, "grad_norm": 5.05450439453125, "learning_rate": 5.7217391304347836e-05, "loss": 0.6661, "step": 11500 }, { "epoch": 2.857142857142857, "eval_accuracy": 0.8152776555487107, "eval_loss": 0.7075205445289612, "eval_runtime": 87.0158, "eval_samples_per_second": 130.586, "eval_steps_per_second": 16.33, "step": 11500 }, { "epoch": 2.8596273291925467, "grad_norm": 3.5484821796417236, "learning_rate": 5.709316770186336e-05, "loss": 0.6991, "step": 11510 }, { "epoch": 2.862111801242236, "grad_norm": 3.2322356700897217, "learning_rate": 5.696894409937888e-05, "loss": 0.6749, "step": 11520 }, { "epoch": 2.8645962732919257, "grad_norm": 5.108699798583984, "learning_rate": 5.684472049689441e-05, "loss": 0.7303, "step": 11530 }, { "epoch": 2.8670807453416147, "grad_norm": 5.204659461975098, "learning_rate": 5.6720496894409935e-05, "loss": 0.6298, "step": 11540 }, { "epoch": 2.869565217391304, "grad_norm": 2.617388963699341, "learning_rate": 5.659627329192547e-05, "loss": 0.6892, "step": 11550 }, { "epoch": 2.8720496894409937, "grad_norm": 5.9790730476379395, "learning_rate": 5.6472049689440995e-05, "loss": 0.8314, "step": 11560 }, { "epoch": 2.874534161490683, "grad_norm": 8.729573249816895, "learning_rate": 5.6347826086956525e-05, "loss": 0.5681, "step": 11570 }, { "epoch": 2.8770186335403727, "grad_norm": 9.801512718200684, "learning_rate": 5.622360248447205e-05, "loss": 0.5574, "step": 11580 }, { "epoch": 2.879503105590062, "grad_norm": 10.816731452941895, "learning_rate": 5.6099378881987585e-05, "loss": 0.6772, "step": 11590 }, { "epoch": 2.8819875776397517, "grad_norm": 6.968757152557373, "learning_rate": 5.597515527950311e-05, "loss": 0.7971, "step": 11600 }, { "epoch": 2.8819875776397517, "eval_accuracy": 0.8077972366452522, "eval_loss": 0.7374622225761414, "eval_runtime": 87.4478, "eval_samples_per_second": 129.94, "eval_steps_per_second": 16.25, "step": 11600 }, { "epoch": 2.884472049689441, "grad_norm": 5.691667556762695, "learning_rate": 5.585093167701864e-05, "loss": 0.6013, "step": 11610 }, { "epoch": 2.8869565217391306, "grad_norm": 6.217525482177734, "learning_rate": 5.572670807453416e-05, "loss": 0.5398, "step": 11620 }, { "epoch": 2.8894409937888197, "grad_norm": 6.222617149353027, "learning_rate": 5.5602484472049684e-05, "loss": 0.7039, "step": 11630 }, { "epoch": 2.891925465838509, "grad_norm": 6.754746437072754, "learning_rate": 5.547826086956522e-05, "loss": 0.4396, "step": 11640 }, { "epoch": 2.8944099378881987, "grad_norm": 3.135385513305664, "learning_rate": 5.535403726708075e-05, "loss": 0.6041, "step": 11650 }, { "epoch": 2.896894409937888, "grad_norm": 8.670600891113281, "learning_rate": 5.5229813664596274e-05, "loss": 0.6501, "step": 11660 }, { "epoch": 2.8993788819875776, "grad_norm": 5.472225666046143, "learning_rate": 5.5105590062111804e-05, "loss": 0.6425, "step": 11670 }, { "epoch": 2.901863354037267, "grad_norm": 6.564612865447998, "learning_rate": 5.498136645962734e-05, "loss": 0.597, "step": 11680 }, { "epoch": 2.9043478260869566, "grad_norm": 4.676502227783203, "learning_rate": 5.485714285714286e-05, "loss": 0.8556, "step": 11690 }, { "epoch": 2.906832298136646, "grad_norm": 5.459942817687988, "learning_rate": 5.4732919254658386e-05, "loss": 0.9771, "step": 11700 }, { "epoch": 2.906832298136646, "eval_accuracy": 0.8132535421983631, "eval_loss": 0.7133490443229675, "eval_runtime": 87.3637, "eval_samples_per_second": 130.065, "eval_steps_per_second": 16.265, "step": 11700 }, { "epoch": 2.9093167701863356, "grad_norm": 4.296738624572754, "learning_rate": 5.4608695652173916e-05, "loss": 0.6457, "step": 11710 }, { "epoch": 2.9118012422360247, "grad_norm": 6.291906356811523, "learning_rate": 5.448447204968944e-05, "loss": 0.6148, "step": 11720 }, { "epoch": 2.914285714285714, "grad_norm": 2.410308837890625, "learning_rate": 5.4360248447204976e-05, "loss": 0.5634, "step": 11730 }, { "epoch": 2.9167701863354036, "grad_norm": 4.089565753936768, "learning_rate": 5.42360248447205e-05, "loss": 0.6921, "step": 11740 }, { "epoch": 2.919254658385093, "grad_norm": 6.613698482513428, "learning_rate": 5.411180124223603e-05, "loss": 0.7421, "step": 11750 }, { "epoch": 2.9217391304347826, "grad_norm": 6.556400775909424, "learning_rate": 5.398757763975155e-05, "loss": 0.7118, "step": 11760 }, { "epoch": 2.924223602484472, "grad_norm": 7.922701358795166, "learning_rate": 5.386335403726709e-05, "loss": 0.7489, "step": 11770 }, { "epoch": 2.9267080745341616, "grad_norm": 3.6202433109283447, "learning_rate": 5.373913043478261e-05, "loss": 0.3694, "step": 11780 }, { "epoch": 2.929192546583851, "grad_norm": 9.018277168273926, "learning_rate": 5.361490683229814e-05, "loss": 0.5022, "step": 11790 }, { "epoch": 2.9316770186335406, "grad_norm": 4.093759059906006, "learning_rate": 5.3490683229813665e-05, "loss": 0.5238, "step": 11800 }, { "epoch": 2.9316770186335406, "eval_accuracy": 0.8157176801900906, "eval_loss": 0.7077267169952393, "eval_runtime": 87.0199, "eval_samples_per_second": 130.579, "eval_steps_per_second": 16.33, "step": 11800 }, { "epoch": 2.9341614906832296, "grad_norm": 4.99535608291626, "learning_rate": 5.336645962732919e-05, "loss": 0.5953, "step": 11810 }, { "epoch": 2.936645962732919, "grad_norm": 7.4504194259643555, "learning_rate": 5.3242236024844725e-05, "loss": 0.8386, "step": 11820 }, { "epoch": 2.9391304347826086, "grad_norm": 6.058727741241455, "learning_rate": 5.3118012422360255e-05, "loss": 0.6208, "step": 11830 }, { "epoch": 2.941614906832298, "grad_norm": 6.454775333404541, "learning_rate": 5.299378881987578e-05, "loss": 0.6312, "step": 11840 }, { "epoch": 2.9440993788819876, "grad_norm": 5.638906478881836, "learning_rate": 5.28695652173913e-05, "loss": 0.6697, "step": 11850 }, { "epoch": 2.946583850931677, "grad_norm": 4.841670036315918, "learning_rate": 5.274534161490684e-05, "loss": 0.6628, "step": 11860 }, { "epoch": 2.9490683229813666, "grad_norm": 4.2036614418029785, "learning_rate": 5.262111801242237e-05, "loss": 0.5813, "step": 11870 }, { "epoch": 2.951552795031056, "grad_norm": 6.559536933898926, "learning_rate": 5.249689440993789e-05, "loss": 0.6546, "step": 11880 }, { "epoch": 2.9540372670807455, "grad_norm": 3.5744316577911377, "learning_rate": 5.2372670807453414e-05, "loss": 0.7345, "step": 11890 }, { "epoch": 2.9565217391304346, "grad_norm": 5.031458377838135, "learning_rate": 5.2248447204968944e-05, "loss": 0.5636, "step": 11900 }, { "epoch": 2.9565217391304346, "eval_accuracy": 0.802956965590073, "eval_loss": 0.7418798208236694, "eval_runtime": 87.6799, "eval_samples_per_second": 129.596, "eval_steps_per_second": 16.207, "step": 11900 }, { "epoch": 2.959006211180124, "grad_norm": 4.476680755615234, "learning_rate": 5.212422360248448e-05, "loss": 0.7594, "step": 11910 }, { "epoch": 2.9614906832298136, "grad_norm": 15.456870079040527, "learning_rate": 5.2000000000000004e-05, "loss": 0.8462, "step": 11920 }, { "epoch": 2.963975155279503, "grad_norm": 6.276050567626953, "learning_rate": 5.187577639751553e-05, "loss": 0.5847, "step": 11930 }, { "epoch": 2.9664596273291925, "grad_norm": 5.983313083648682, "learning_rate": 5.1751552795031057e-05, "loss": 0.7701, "step": 11940 }, { "epoch": 2.968944099378882, "grad_norm": 7.4835662841796875, "learning_rate": 5.162732919254659e-05, "loss": 0.5382, "step": 11950 }, { "epoch": 2.9714285714285715, "grad_norm": 5.3558831214904785, "learning_rate": 5.1503105590062116e-05, "loss": 0.672, "step": 11960 }, { "epoch": 2.973913043478261, "grad_norm": 9.933943748474121, "learning_rate": 5.137888198757764e-05, "loss": 0.6792, "step": 11970 }, { "epoch": 2.9763975155279505, "grad_norm": 3.512000799179077, "learning_rate": 5.125465838509317e-05, "loss": 0.6301, "step": 11980 }, { "epoch": 2.9788819875776396, "grad_norm": 0.8877289295196533, "learning_rate": 5.113043478260869e-05, "loss": 0.4571, "step": 11990 }, { "epoch": 2.981366459627329, "grad_norm": 10.120748519897461, "learning_rate": 5.100621118012423e-05, "loss": 0.8962, "step": 12000 }, { "epoch": 2.981366459627329, "eval_accuracy": 0.8174777787556103, "eval_loss": 0.7020727396011353, "eval_runtime": 86.2234, "eval_samples_per_second": 131.786, "eval_steps_per_second": 16.48, "step": 12000 }, { "epoch": 2.9838509316770185, "grad_norm": 6.098137855529785, "learning_rate": 5.088198757763976e-05, "loss": 0.7792, "step": 12010 }, { "epoch": 2.986335403726708, "grad_norm": 6.321715354919434, "learning_rate": 5.075776397515528e-05, "loss": 0.6683, "step": 12020 }, { "epoch": 2.9888198757763975, "grad_norm": 3.2365546226501465, "learning_rate": 5.0633540372670805e-05, "loss": 0.8028, "step": 12030 }, { "epoch": 2.991304347826087, "grad_norm": 6.188086986541748, "learning_rate": 5.0509316770186335e-05, "loss": 0.8973, "step": 12040 }, { "epoch": 2.9937888198757765, "grad_norm": 4.171976089477539, "learning_rate": 5.038509316770187e-05, "loss": 0.5392, "step": 12050 }, { "epoch": 2.996273291925466, "grad_norm": 10.866338729858398, "learning_rate": 5.0260869565217395e-05, "loss": 0.6474, "step": 12060 }, { "epoch": 2.9987577639751555, "grad_norm": 7.5085673332214355, "learning_rate": 5.013664596273292e-05, "loss": 0.5523, "step": 12070 }, { "epoch": 3.0012422360248445, "grad_norm": 8.900304794311523, "learning_rate": 5.001242236024845e-05, "loss": 0.4688, "step": 12080 }, { "epoch": 3.003726708074534, "grad_norm": 5.257197380065918, "learning_rate": 4.988819875776398e-05, "loss": 0.5883, "step": 12090 }, { "epoch": 3.0062111801242235, "grad_norm": 6.265869140625, "learning_rate": 4.976397515527951e-05, "loss": 0.4561, "step": 12100 }, { "epoch": 3.0062111801242235, "eval_accuracy": 0.8162457097597465, "eval_loss": 0.7031123042106628, "eval_runtime": 86.2703, "eval_samples_per_second": 131.714, "eval_steps_per_second": 16.471, "step": 12100 }, { "epoch": 3.008695652173913, "grad_norm": 7.839663505554199, "learning_rate": 4.963975155279503e-05, "loss": 0.6235, "step": 12110 }, { "epoch": 3.0111801242236025, "grad_norm": 2.760774850845337, "learning_rate": 4.951552795031056e-05, "loss": 0.4951, "step": 12120 }, { "epoch": 3.013664596273292, "grad_norm": 5.036975383758545, "learning_rate": 4.939130434782609e-05, "loss": 0.5424, "step": 12130 }, { "epoch": 3.0161490683229815, "grad_norm": 6.381801128387451, "learning_rate": 4.9267080745341614e-05, "loss": 0.4526, "step": 12140 }, { "epoch": 3.018633540372671, "grad_norm": 5.3697686195373535, "learning_rate": 4.9142857142857144e-05, "loss": 0.6119, "step": 12150 }, { "epoch": 3.0211180124223604, "grad_norm": 6.435357093811035, "learning_rate": 4.9018633540372674e-05, "loss": 0.5142, "step": 12160 }, { "epoch": 3.0236024844720495, "grad_norm": 4.873701572418213, "learning_rate": 4.8894409937888204e-05, "loss": 0.5177, "step": 12170 }, { "epoch": 3.026086956521739, "grad_norm": 2.1949551105499268, "learning_rate": 4.877018633540373e-05, "loss": 0.4267, "step": 12180 }, { "epoch": 3.0285714285714285, "grad_norm": 7.51536226272583, "learning_rate": 4.8645962732919257e-05, "loss": 0.6561, "step": 12190 }, { "epoch": 3.031055900621118, "grad_norm": 4.367460250854492, "learning_rate": 4.8521739130434786e-05, "loss": 0.4906, "step": 12200 }, { "epoch": 3.031055900621118, "eval_accuracy": 0.8171257590425064, "eval_loss": 0.710408627986908, "eval_runtime": 85.9193, "eval_samples_per_second": 132.252, "eval_steps_per_second": 16.539, "step": 12200 }, { "epoch": 3.0335403726708075, "grad_norm": 7.403229236602783, "learning_rate": 4.8397515527950316e-05, "loss": 0.5599, "step": 12210 }, { "epoch": 3.036024844720497, "grad_norm": 3.5904605388641357, "learning_rate": 4.827329192546584e-05, "loss": 0.4379, "step": 12220 }, { "epoch": 3.0385093167701864, "grad_norm": 7.364349842071533, "learning_rate": 4.814906832298137e-05, "loss": 0.5893, "step": 12230 }, { "epoch": 3.040993788819876, "grad_norm": 3.0802817344665527, "learning_rate": 4.80248447204969e-05, "loss": 0.532, "step": 12240 }, { "epoch": 3.0434782608695654, "grad_norm": 5.558223724365234, "learning_rate": 4.790062111801242e-05, "loss": 0.6785, "step": 12250 }, { "epoch": 3.0459627329192545, "grad_norm": 5.504637241363525, "learning_rate": 4.777639751552795e-05, "loss": 0.5697, "step": 12260 }, { "epoch": 3.048447204968944, "grad_norm": 3.261624574661255, "learning_rate": 4.765217391304348e-05, "loss": 0.4528, "step": 12270 }, { "epoch": 3.0509316770186334, "grad_norm": 7.631359577178955, "learning_rate": 4.752795031055901e-05, "loss": 0.5807, "step": 12280 }, { "epoch": 3.053416149068323, "grad_norm": 8.036623001098633, "learning_rate": 4.7403726708074535e-05, "loss": 0.7984, "step": 12290 }, { "epoch": 3.0559006211180124, "grad_norm": 10.502141952514648, "learning_rate": 4.727950310559006e-05, "loss": 0.5422, "step": 12300 }, { "epoch": 3.0559006211180124, "eval_accuracy": 0.8153656604769867, "eval_loss": 0.7035276293754578, "eval_runtime": 86.968, "eval_samples_per_second": 130.657, "eval_steps_per_second": 16.339, "step": 12300 }, { "epoch": 3.058385093167702, "grad_norm": 2.4105753898620605, "learning_rate": 4.7155279503105595e-05, "loss": 0.4012, "step": 12310 }, { "epoch": 3.0608695652173914, "grad_norm": 4.15570592880249, "learning_rate": 4.703105590062112e-05, "loss": 0.7022, "step": 12320 }, { "epoch": 3.063354037267081, "grad_norm": 10.396677017211914, "learning_rate": 4.690683229813665e-05, "loss": 0.5633, "step": 12330 }, { "epoch": 3.0658385093167704, "grad_norm": 3.672163963317871, "learning_rate": 4.678260869565218e-05, "loss": 0.5217, "step": 12340 }, { "epoch": 3.0683229813664594, "grad_norm": 4.405937671661377, "learning_rate": 4.665838509316771e-05, "loss": 0.3619, "step": 12350 }, { "epoch": 3.070807453416149, "grad_norm": 5.227725982666016, "learning_rate": 4.653416149068323e-05, "loss": 0.4803, "step": 12360 }, { "epoch": 3.0732919254658384, "grad_norm": 6.511715412139893, "learning_rate": 4.640993788819876e-05, "loss": 0.4904, "step": 12370 }, { "epoch": 3.075776397515528, "grad_norm": 2.1879351139068604, "learning_rate": 4.628571428571429e-05, "loss": 0.4648, "step": 12380 }, { "epoch": 3.0782608695652174, "grad_norm": 7.1389479637146, "learning_rate": 4.6161490683229814e-05, "loss": 0.3893, "step": 12390 }, { "epoch": 3.080745341614907, "grad_norm": 3.872439384460449, "learning_rate": 4.6037267080745344e-05, "loss": 0.5541, "step": 12400 }, { "epoch": 3.080745341614907, "eval_accuracy": 0.8231980990935492, "eval_loss": 0.6904828548431396, "eval_runtime": 87.516, "eval_samples_per_second": 129.839, "eval_steps_per_second": 16.237, "step": 12400 }, { "epoch": 3.0832298136645964, "grad_norm": 4.102145195007324, "learning_rate": 4.591304347826087e-05, "loss": 0.5671, "step": 12410 }, { "epoch": 3.085714285714286, "grad_norm": 10.544522285461426, "learning_rate": 4.5788819875776404e-05, "loss": 0.4794, "step": 12420 }, { "epoch": 3.0881987577639753, "grad_norm": 5.980569362640381, "learning_rate": 4.566459627329193e-05, "loss": 0.5564, "step": 12430 }, { "epoch": 3.0906832298136644, "grad_norm": 10.677704811096191, "learning_rate": 4.5540372670807457e-05, "loss": 0.543, "step": 12440 }, { "epoch": 3.093167701863354, "grad_norm": 5.909951686859131, "learning_rate": 4.541614906832298e-05, "loss": 0.5245, "step": 12450 }, { "epoch": 3.0956521739130434, "grad_norm": 16.215694427490234, "learning_rate": 4.5291925465838516e-05, "loss": 0.603, "step": 12460 }, { "epoch": 3.098136645962733, "grad_norm": 8.574531555175781, "learning_rate": 4.516770186335404e-05, "loss": 0.5718, "step": 12470 }, { "epoch": 3.1006211180124224, "grad_norm": 2.035837411880493, "learning_rate": 4.504347826086956e-05, "loss": 0.4221, "step": 12480 }, { "epoch": 3.103105590062112, "grad_norm": 8.264311790466309, "learning_rate": 4.49192546583851e-05, "loss": 0.6852, "step": 12490 }, { "epoch": 3.1055900621118013, "grad_norm": 5.228878021240234, "learning_rate": 4.479503105590062e-05, "loss": 0.5009, "step": 12500 }, { "epoch": 3.1055900621118013, "eval_accuracy": 0.8173017688990584, "eval_loss": 0.6993664503097534, "eval_runtime": 86.9481, "eval_samples_per_second": 130.687, "eval_steps_per_second": 16.343, "step": 12500 }, { "epoch": 3.108074534161491, "grad_norm": 5.872660160064697, "learning_rate": 4.467080745341615e-05, "loss": 0.4279, "step": 12510 }, { "epoch": 3.1105590062111803, "grad_norm": 2.8695497512817383, "learning_rate": 4.4546583850931675e-05, "loss": 0.4761, "step": 12520 }, { "epoch": 3.1130434782608694, "grad_norm": 4.605323791503906, "learning_rate": 4.442236024844721e-05, "loss": 0.5106, "step": 12530 }, { "epoch": 3.115527950310559, "grad_norm": 5.143415451049805, "learning_rate": 4.4298136645962735e-05, "loss": 0.5305, "step": 12540 }, { "epoch": 3.1180124223602483, "grad_norm": 3.625460386276245, "learning_rate": 4.4173913043478265e-05, "loss": 0.7476, "step": 12550 }, { "epoch": 3.120496894409938, "grad_norm": 4.011096954345703, "learning_rate": 4.404968944099379e-05, "loss": 0.543, "step": 12560 }, { "epoch": 3.1229813664596273, "grad_norm": 7.04062032699585, "learning_rate": 4.392546583850932e-05, "loss": 0.5789, "step": 12570 }, { "epoch": 3.125465838509317, "grad_norm": 7.262362003326416, "learning_rate": 4.380124223602485e-05, "loss": 0.6328, "step": 12580 }, { "epoch": 3.1279503105590063, "grad_norm": 5.33003044128418, "learning_rate": 4.367701863354037e-05, "loss": 0.5202, "step": 12590 }, { "epoch": 3.130434782608696, "grad_norm": 3.2615396976470947, "learning_rate": 4.35527950310559e-05, "loss": 0.4567, "step": 12600 }, { "epoch": 3.130434782608696, "eval_accuracy": 0.8202939364604418, "eval_loss": 0.6910972595214844, "eval_runtime": 87.6801, "eval_samples_per_second": 129.596, "eval_steps_per_second": 16.207, "step": 12600 }, { "epoch": 3.1329192546583853, "grad_norm": 5.849052906036377, "learning_rate": 4.342857142857143e-05, "loss": 0.6101, "step": 12610 }, { "epoch": 3.1354037267080743, "grad_norm": 4.340888023376465, "learning_rate": 4.330434782608696e-05, "loss": 0.5785, "step": 12620 }, { "epoch": 3.137888198757764, "grad_norm": 3.392591953277588, "learning_rate": 4.3180124223602484e-05, "loss": 0.5402, "step": 12630 }, { "epoch": 3.1403726708074533, "grad_norm": 3.3317670822143555, "learning_rate": 4.3055900621118014e-05, "loss": 0.6271, "step": 12640 }, { "epoch": 3.142857142857143, "grad_norm": 6.381196975708008, "learning_rate": 4.2931677018633544e-05, "loss": 0.3713, "step": 12650 }, { "epoch": 3.1453416149068323, "grad_norm": 7.92520809173584, "learning_rate": 4.280745341614907e-05, "loss": 0.5309, "step": 12660 }, { "epoch": 3.1478260869565218, "grad_norm": 3.4478583335876465, "learning_rate": 4.26832298136646e-05, "loss": 0.5995, "step": 12670 }, { "epoch": 3.1503105590062113, "grad_norm": 8.44995403289795, "learning_rate": 4.255900621118013e-05, "loss": 0.5604, "step": 12680 }, { "epoch": 3.1527950310559008, "grad_norm": 7.399325370788574, "learning_rate": 4.2434782608695657e-05, "loss": 0.685, "step": 12690 }, { "epoch": 3.1552795031055902, "grad_norm": 9.787561416625977, "learning_rate": 4.231055900621118e-05, "loss": 0.4431, "step": 12700 }, { "epoch": 3.1552795031055902, "eval_accuracy": 0.81923787732113, "eval_loss": 0.6932592391967773, "eval_runtime": 86.2789, "eval_samples_per_second": 131.701, "eval_steps_per_second": 16.47, "step": 12700 }, { "epoch": 3.1577639751552793, "grad_norm": 7.563392639160156, "learning_rate": 4.218633540372671e-05, "loss": 0.4515, "step": 12710 }, { "epoch": 3.160248447204969, "grad_norm": 2.8812592029571533, "learning_rate": 4.206211180124224e-05, "loss": 0.6153, "step": 12720 }, { "epoch": 3.1627329192546583, "grad_norm": 4.970517158508301, "learning_rate": 4.193788819875777e-05, "loss": 0.5428, "step": 12730 }, { "epoch": 3.1652173913043478, "grad_norm": 4.2496795654296875, "learning_rate": 4.181366459627329e-05, "loss": 0.5295, "step": 12740 }, { "epoch": 3.1677018633540373, "grad_norm": 5.023710250854492, "learning_rate": 4.168944099378882e-05, "loss": 0.3807, "step": 12750 }, { "epoch": 3.1701863354037267, "grad_norm": 3.99332594871521, "learning_rate": 4.156521739130435e-05, "loss": 0.3804, "step": 12760 }, { "epoch": 3.1726708074534162, "grad_norm": 5.442420959472656, "learning_rate": 4.1440993788819875e-05, "loss": 0.4354, "step": 12770 }, { "epoch": 3.1751552795031057, "grad_norm": 4.195496559143066, "learning_rate": 4.1316770186335405e-05, "loss": 0.4909, "step": 12780 }, { "epoch": 3.177639751552795, "grad_norm": 4.506777286529541, "learning_rate": 4.1192546583850935e-05, "loss": 0.6455, "step": 12790 }, { "epoch": 3.1801242236024843, "grad_norm": 8.970359802246094, "learning_rate": 4.1068322981366465e-05, "loss": 0.5915, "step": 12800 }, { "epoch": 3.1801242236024843, "eval_accuracy": 0.8220540350259614, "eval_loss": 0.6838474273681641, "eval_runtime": 88.8487, "eval_samples_per_second": 127.892, "eval_steps_per_second": 15.993, "step": 12800 }, { "epoch": 3.1826086956521737, "grad_norm": 8.059175491333008, "learning_rate": 4.094409937888199e-05, "loss": 0.5934, "step": 12810 }, { "epoch": 3.1850931677018632, "grad_norm": 3.4588656425476074, "learning_rate": 4.081987577639752e-05, "loss": 0.5678, "step": 12820 }, { "epoch": 3.1875776397515527, "grad_norm": 7.506095886230469, "learning_rate": 4.069565217391305e-05, "loss": 0.5356, "step": 12830 }, { "epoch": 3.190062111801242, "grad_norm": 4.169441223144531, "learning_rate": 4.057142857142857e-05, "loss": 0.4775, "step": 12840 }, { "epoch": 3.1925465838509317, "grad_norm": 4.875574111938477, "learning_rate": 4.04472049689441e-05, "loss": 0.4781, "step": 12850 }, { "epoch": 3.195031055900621, "grad_norm": 5.139460563659668, "learning_rate": 4.032298136645963e-05, "loss": 0.6762, "step": 12860 }, { "epoch": 3.1975155279503107, "grad_norm": 2.1224772930145264, "learning_rate": 4.019875776397516e-05, "loss": 0.4891, "step": 12870 }, { "epoch": 3.2, "grad_norm": 2.8898327350616455, "learning_rate": 4.0074534161490684e-05, "loss": 0.4209, "step": 12880 }, { "epoch": 3.2024844720496892, "grad_norm": 5.731484889984131, "learning_rate": 3.9950310559006214e-05, "loss": 0.5718, "step": 12890 }, { "epoch": 3.2049689440993787, "grad_norm": 5.2934136390686035, "learning_rate": 3.9826086956521744e-05, "loss": 0.5551, "step": 12900 }, { "epoch": 3.2049689440993787, "eval_accuracy": 0.8199419167473379, "eval_loss": 0.6885837316513062, "eval_runtime": 87.9526, "eval_samples_per_second": 129.195, "eval_steps_per_second": 16.156, "step": 12900 }, { "epoch": 3.207453416149068, "grad_norm": 4.657090187072754, "learning_rate": 3.970186335403727e-05, "loss": 0.4785, "step": 12910 }, { "epoch": 3.2099378881987577, "grad_norm": 7.804254531860352, "learning_rate": 3.95776397515528e-05, "loss": 0.7437, "step": 12920 }, { "epoch": 3.212422360248447, "grad_norm": 2.897365093231201, "learning_rate": 3.945341614906832e-05, "loss": 0.4121, "step": 12930 }, { "epoch": 3.2149068322981367, "grad_norm": 6.5088887214660645, "learning_rate": 3.9329192546583857e-05, "loss": 0.3793, "step": 12940 }, { "epoch": 3.217391304347826, "grad_norm": 5.799808502197266, "learning_rate": 3.920496894409938e-05, "loss": 0.5948, "step": 12950 }, { "epoch": 3.2198757763975157, "grad_norm": 2.5003743171691895, "learning_rate": 3.908074534161491e-05, "loss": 0.4539, "step": 12960 }, { "epoch": 3.222360248447205, "grad_norm": 6.782368183135986, "learning_rate": 3.895652173913043e-05, "loss": 0.6168, "step": 12970 }, { "epoch": 3.224844720496894, "grad_norm": 6.0730695724487305, "learning_rate": 3.883229813664597e-05, "loss": 0.7818, "step": 12980 }, { "epoch": 3.2273291925465837, "grad_norm": 5.4586615562438965, "learning_rate": 3.870807453416149e-05, "loss": 0.3219, "step": 12990 }, { "epoch": 3.229813664596273, "grad_norm": 5.29102087020874, "learning_rate": 3.8583850931677016e-05, "loss": 0.4528, "step": 13000 }, { "epoch": 3.229813664596273, "eval_accuracy": 0.8211739857432017, "eval_loss": 0.6882742047309875, "eval_runtime": 86.885, "eval_samples_per_second": 130.782, "eval_steps_per_second": 16.355, "step": 13000 }, { "epoch": 3.2322981366459627, "grad_norm": 9.615778923034668, "learning_rate": 3.845962732919255e-05, "loss": 0.7963, "step": 13010 }, { "epoch": 3.234782608695652, "grad_norm": 6.507978439331055, "learning_rate": 3.8335403726708075e-05, "loss": 0.4032, "step": 13020 }, { "epoch": 3.2372670807453416, "grad_norm": 7.837948322296143, "learning_rate": 3.8211180124223605e-05, "loss": 0.6404, "step": 13030 }, { "epoch": 3.239751552795031, "grad_norm": 3.602900505065918, "learning_rate": 3.808695652173913e-05, "loss": 0.5245, "step": 13040 }, { "epoch": 3.2422360248447206, "grad_norm": 5.966063976287842, "learning_rate": 3.7962732919254665e-05, "loss": 0.774, "step": 13050 }, { "epoch": 3.24472049689441, "grad_norm": 4.69325065612793, "learning_rate": 3.783850931677019e-05, "loss": 0.5157, "step": 13060 }, { "epoch": 3.247204968944099, "grad_norm": 6.513613700866699, "learning_rate": 3.771428571428572e-05, "loss": 0.5637, "step": 13070 }, { "epoch": 3.2496894409937886, "grad_norm": 4.473712921142578, "learning_rate": 3.759006211180124e-05, "loss": 0.3706, "step": 13080 }, { "epoch": 3.252173913043478, "grad_norm": 6.620151519775391, "learning_rate": 3.746583850931677e-05, "loss": 0.5956, "step": 13090 }, { "epoch": 3.2546583850931676, "grad_norm": 6.897200584411621, "learning_rate": 3.73416149068323e-05, "loss": 0.5563, "step": 13100 }, { "epoch": 3.2546583850931676, "eval_accuracy": 0.81923787732113, "eval_loss": 0.6866790056228638, "eval_runtime": 87.4328, "eval_samples_per_second": 129.963, "eval_steps_per_second": 16.252, "step": 13100 }, { "epoch": 3.257142857142857, "grad_norm": 5.518016338348389, "learning_rate": 3.7217391304347824e-05, "loss": 0.4258, "step": 13110 }, { "epoch": 3.2596273291925466, "grad_norm": 6.806578159332275, "learning_rate": 3.7093167701863354e-05, "loss": 0.5132, "step": 13120 }, { "epoch": 3.262111801242236, "grad_norm": 1.4067715406417847, "learning_rate": 3.6968944099378884e-05, "loss": 0.4693, "step": 13130 }, { "epoch": 3.2645962732919256, "grad_norm": 1.4255828857421875, "learning_rate": 3.6844720496894414e-05, "loss": 0.5003, "step": 13140 }, { "epoch": 3.267080745341615, "grad_norm": 6.888153076171875, "learning_rate": 3.672049689440994e-05, "loss": 0.463, "step": 13150 }, { "epoch": 3.269565217391304, "grad_norm": 6.642817974090576, "learning_rate": 3.659627329192547e-05, "loss": 0.4589, "step": 13160 }, { "epoch": 3.2720496894409936, "grad_norm": 6.386394023895264, "learning_rate": 3.6472049689441e-05, "loss": 0.4738, "step": 13170 }, { "epoch": 3.274534161490683, "grad_norm": 13.161245346069336, "learning_rate": 3.634782608695652e-05, "loss": 0.6596, "step": 13180 }, { "epoch": 3.2770186335403726, "grad_norm": 11.36682415008545, "learning_rate": 3.622360248447205e-05, "loss": 0.7889, "step": 13190 }, { "epoch": 3.279503105590062, "grad_norm": 2.1233813762664795, "learning_rate": 3.609937888198758e-05, "loss": 0.4836, "step": 13200 }, { "epoch": 3.279503105590062, "eval_accuracy": 0.8253102173721728, "eval_loss": 0.6771336793899536, "eval_runtime": 86.9751, "eval_samples_per_second": 130.647, "eval_steps_per_second": 16.338, "step": 13200 }, { "epoch": 3.2819875776397516, "grad_norm": 9.009103775024414, "learning_rate": 3.597515527950311e-05, "loss": 0.5785, "step": 13210 }, { "epoch": 3.284472049689441, "grad_norm": 4.186812400817871, "learning_rate": 3.585093167701863e-05, "loss": 0.3961, "step": 13220 }, { "epoch": 3.2869565217391306, "grad_norm": 4.9091901779174805, "learning_rate": 3.572670807453416e-05, "loss": 0.5125, "step": 13230 }, { "epoch": 3.28944099378882, "grad_norm": 4.11280632019043, "learning_rate": 3.560248447204969e-05, "loss": 0.5678, "step": 13240 }, { "epoch": 3.291925465838509, "grad_norm": 4.458592414855957, "learning_rate": 3.5478260869565216e-05, "loss": 0.4378, "step": 13250 }, { "epoch": 3.2944099378881986, "grad_norm": 4.41200590133667, "learning_rate": 3.5354037267080746e-05, "loss": 0.4501, "step": 13260 }, { "epoch": 3.296894409937888, "grad_norm": 9.820028305053711, "learning_rate": 3.5229813664596275e-05, "loss": 0.4385, "step": 13270 }, { "epoch": 3.2993788819875776, "grad_norm": 6.210055351257324, "learning_rate": 3.5105590062111805e-05, "loss": 0.6382, "step": 13280 }, { "epoch": 3.301863354037267, "grad_norm": 7.428834915161133, "learning_rate": 3.498136645962733e-05, "loss": 0.5374, "step": 13290 }, { "epoch": 3.3043478260869565, "grad_norm": 2.4320147037506104, "learning_rate": 3.485714285714286e-05, "loss": 0.4535, "step": 13300 }, { "epoch": 3.3043478260869565, "eval_accuracy": 0.8248701927307929, "eval_loss": 0.6713078022003174, "eval_runtime": 86.3323, "eval_samples_per_second": 131.619, "eval_steps_per_second": 16.46, "step": 13300 }, { "epoch": 3.306832298136646, "grad_norm": 18.133155822753906, "learning_rate": 3.473291925465839e-05, "loss": 0.3095, "step": 13310 }, { "epoch": 3.3093167701863355, "grad_norm": 6.6480393409729, "learning_rate": 3.460869565217392e-05, "loss": 0.3276, "step": 13320 }, { "epoch": 3.311801242236025, "grad_norm": 5.606024265289307, "learning_rate": 3.448447204968944e-05, "loss": 0.5692, "step": 13330 }, { "epoch": 3.314285714285714, "grad_norm": 3.627607822418213, "learning_rate": 3.436024844720497e-05, "loss": 0.5434, "step": 13340 }, { "epoch": 3.3167701863354035, "grad_norm": 7.17358922958374, "learning_rate": 3.42360248447205e-05, "loss": 0.5071, "step": 13350 }, { "epoch": 3.319254658385093, "grad_norm": 5.642586708068848, "learning_rate": 3.4111801242236024e-05, "loss": 0.4079, "step": 13360 }, { "epoch": 3.3217391304347825, "grad_norm": 5.64650297164917, "learning_rate": 3.3987577639751554e-05, "loss": 0.434, "step": 13370 }, { "epoch": 3.324223602484472, "grad_norm": 3.2044386863708496, "learning_rate": 3.3863354037267084e-05, "loss": 0.6493, "step": 13380 }, { "epoch": 3.3267080745341615, "grad_norm": 3.279977321624756, "learning_rate": 3.3739130434782614e-05, "loss": 0.3453, "step": 13390 }, { "epoch": 3.329192546583851, "grad_norm": 7.515082359313965, "learning_rate": 3.361490683229814e-05, "loss": 0.468, "step": 13400 }, { "epoch": 3.329192546583851, "eval_accuracy": 0.8269823110094165, "eval_loss": 0.6615992188453674, "eval_runtime": 87.0347, "eval_samples_per_second": 130.557, "eval_steps_per_second": 16.327, "step": 13400 }, { "epoch": 3.3316770186335405, "grad_norm": 1.8611090183258057, "learning_rate": 3.349068322981367e-05, "loss": 0.4831, "step": 13410 }, { "epoch": 3.33416149068323, "grad_norm": 6.314669609069824, "learning_rate": 3.33664596273292e-05, "loss": 0.5625, "step": 13420 }, { "epoch": 3.336645962732919, "grad_norm": 9.314018249511719, "learning_rate": 3.324223602484472e-05, "loss": 0.4882, "step": 13430 }, { "epoch": 3.3391304347826085, "grad_norm": 6.195760726928711, "learning_rate": 3.311801242236025e-05, "loss": 0.505, "step": 13440 }, { "epoch": 3.341614906832298, "grad_norm": 3.5561578273773193, "learning_rate": 3.299378881987577e-05, "loss": 0.485, "step": 13450 }, { "epoch": 3.3440993788819875, "grad_norm": 8.28506088256836, "learning_rate": 3.286956521739131e-05, "loss": 0.5624, "step": 13460 }, { "epoch": 3.346583850931677, "grad_norm": 3.2488527297973633, "learning_rate": 3.274534161490683e-05, "loss": 0.4358, "step": 13470 }, { "epoch": 3.3490683229813665, "grad_norm": 1.8179543018341064, "learning_rate": 3.262111801242236e-05, "loss": 0.4578, "step": 13480 }, { "epoch": 3.351552795031056, "grad_norm": 5.033318519592285, "learning_rate": 3.249689440993789e-05, "loss": 0.4818, "step": 13490 }, { "epoch": 3.3540372670807455, "grad_norm": 7.270232200622559, "learning_rate": 3.237267080745342e-05, "loss": 0.4691, "step": 13500 }, { "epoch": 3.3540372670807455, "eval_accuracy": 0.8261022617266567, "eval_loss": 0.6706886291503906, "eval_runtime": 87.6016, "eval_samples_per_second": 129.712, "eval_steps_per_second": 16.221, "step": 13500 }, { "epoch": 3.356521739130435, "grad_norm": 4.949516773223877, "learning_rate": 3.2248447204968946e-05, "loss": 0.3803, "step": 13510 }, { "epoch": 3.359006211180124, "grad_norm": 6.229318618774414, "learning_rate": 3.212422360248447e-05, "loss": 0.7245, "step": 13520 }, { "epoch": 3.3614906832298135, "grad_norm": 5.414929389953613, "learning_rate": 3.2000000000000005e-05, "loss": 0.5406, "step": 13530 }, { "epoch": 3.363975155279503, "grad_norm": 4.069797992706299, "learning_rate": 3.187577639751553e-05, "loss": 0.4012, "step": 13540 }, { "epoch": 3.3664596273291925, "grad_norm": 5.728483200073242, "learning_rate": 3.175155279503106e-05, "loss": 0.5387, "step": 13550 }, { "epoch": 3.368944099378882, "grad_norm": 3.4796948432922363, "learning_rate": 3.162732919254658e-05, "loss": 0.4261, "step": 13560 }, { "epoch": 3.3714285714285714, "grad_norm": 8.10731029510498, "learning_rate": 3.150310559006212e-05, "loss": 0.5874, "step": 13570 }, { "epoch": 3.373913043478261, "grad_norm": 5.234379291534424, "learning_rate": 3.137888198757764e-05, "loss": 0.5326, "step": 13580 }, { "epoch": 3.3763975155279504, "grad_norm": 3.38866925239563, "learning_rate": 3.125465838509317e-05, "loss": 0.3288, "step": 13590 }, { "epoch": 3.37888198757764, "grad_norm": 2.9035232067108154, "learning_rate": 3.1130434782608694e-05, "loss": 0.4784, "step": 13600 }, { "epoch": 3.37888198757764, "eval_accuracy": 0.8240781483763091, "eval_loss": 0.6732914447784424, "eval_runtime": 86.5557, "eval_samples_per_second": 131.28, "eval_steps_per_second": 16.417, "step": 13600 }, { "epoch": 3.381366459627329, "grad_norm": 4.350976467132568, "learning_rate": 3.1006211180124224e-05, "loss": 0.3132, "step": 13610 }, { "epoch": 3.3838509316770184, "grad_norm": 3.3074676990509033, "learning_rate": 3.0881987577639754e-05, "loss": 0.5839, "step": 13620 }, { "epoch": 3.386335403726708, "grad_norm": 2.9822394847869873, "learning_rate": 3.075776397515528e-05, "loss": 0.4328, "step": 13630 }, { "epoch": 3.3888198757763974, "grad_norm": 3.2798781394958496, "learning_rate": 3.063354037267081e-05, "loss": 0.3691, "step": 13640 }, { "epoch": 3.391304347826087, "grad_norm": 6.1266279220581055, "learning_rate": 3.0509316770186337e-05, "loss": 0.4765, "step": 13650 }, { "epoch": 3.3937888198757764, "grad_norm": 5.225902080535889, "learning_rate": 3.0385093167701867e-05, "loss": 0.5248, "step": 13660 }, { "epoch": 3.396273291925466, "grad_norm": 3.3516387939453125, "learning_rate": 3.0260869565217393e-05, "loss": 0.7746, "step": 13670 }, { "epoch": 3.3987577639751554, "grad_norm": 5.730987071990967, "learning_rate": 3.0136645962732923e-05, "loss": 0.5716, "step": 13680 }, { "epoch": 3.401242236024845, "grad_norm": 7.150260925292969, "learning_rate": 3.001242236024845e-05, "loss": 0.461, "step": 13690 }, { "epoch": 3.403726708074534, "grad_norm": 5.765717029571533, "learning_rate": 2.9888198757763973e-05, "loss": 0.5187, "step": 13700 }, { "epoch": 3.403726708074534, "eval_accuracy": 0.8251342075156208, "eval_loss": 0.6657703518867493, "eval_runtime": 86.2323, "eval_samples_per_second": 131.772, "eval_steps_per_second": 16.479, "step": 13700 }, { "epoch": 3.4062111801242234, "grad_norm": 3.005549907684326, "learning_rate": 2.9763975155279506e-05, "loss": 0.5749, "step": 13710 }, { "epoch": 3.408695652173913, "grad_norm": 8.730533599853516, "learning_rate": 2.963975155279503e-05, "loss": 0.6285, "step": 13720 }, { "epoch": 3.4111801242236024, "grad_norm": 2.9770872592926025, "learning_rate": 2.9515527950310563e-05, "loss": 0.7003, "step": 13730 }, { "epoch": 3.413664596273292, "grad_norm": 4.815559387207031, "learning_rate": 2.939130434782609e-05, "loss": 0.5325, "step": 13740 }, { "epoch": 3.4161490683229814, "grad_norm": 4.2376298904418945, "learning_rate": 2.926708074534162e-05, "loss": 0.572, "step": 13750 }, { "epoch": 3.418633540372671, "grad_norm": 5.942477226257324, "learning_rate": 2.9142857142857146e-05, "loss": 0.6795, "step": 13760 }, { "epoch": 3.4211180124223604, "grad_norm": 5.977138042449951, "learning_rate": 2.901863354037267e-05, "loss": 0.4785, "step": 13770 }, { "epoch": 3.42360248447205, "grad_norm": 3.4962573051452637, "learning_rate": 2.8894409937888202e-05, "loss": 0.4012, "step": 13780 }, { "epoch": 3.426086956521739, "grad_norm": 0.6948124766349792, "learning_rate": 2.8770186335403725e-05, "loss": 0.5582, "step": 13790 }, { "epoch": 3.4285714285714284, "grad_norm": 7.217972755432129, "learning_rate": 2.864596273291926e-05, "loss": 0.5105, "step": 13800 }, { "epoch": 3.4285714285714284, "eval_accuracy": 0.8275103405790725, "eval_loss": 0.6631360650062561, "eval_runtime": 87.0123, "eval_samples_per_second": 130.591, "eval_steps_per_second": 16.331, "step": 13800 }, { "epoch": 3.431055900621118, "grad_norm": 5.591545104980469, "learning_rate": 2.852173913043478e-05, "loss": 0.5408, "step": 13810 }, { "epoch": 3.4335403726708074, "grad_norm": 5.493480682373047, "learning_rate": 2.8397515527950315e-05, "loss": 0.5014, "step": 13820 }, { "epoch": 3.436024844720497, "grad_norm": 6.324045658111572, "learning_rate": 2.8273291925465838e-05, "loss": 0.5761, "step": 13830 }, { "epoch": 3.4385093167701863, "grad_norm": 4.297603130340576, "learning_rate": 2.814906832298137e-05, "loss": 0.4817, "step": 13840 }, { "epoch": 3.440993788819876, "grad_norm": 4.620813369750977, "learning_rate": 2.8024844720496894e-05, "loss": 0.4831, "step": 13850 }, { "epoch": 3.4434782608695653, "grad_norm": 4.357455730438232, "learning_rate": 2.790062111801242e-05, "loss": 0.5194, "step": 13860 }, { "epoch": 3.445962732919255, "grad_norm": 6.38654088973999, "learning_rate": 2.777639751552795e-05, "loss": 0.4436, "step": 13870 }, { "epoch": 3.448447204968944, "grad_norm": 5.826173305511475, "learning_rate": 2.7652173913043477e-05, "loss": 0.4366, "step": 13880 }, { "epoch": 3.4509316770186333, "grad_norm": 6.082293510437012, "learning_rate": 2.7527950310559007e-05, "loss": 0.4897, "step": 13890 }, { "epoch": 3.453416149068323, "grad_norm": 6.084004878997803, "learning_rate": 2.7416149068322983e-05, "loss": 0.3935, "step": 13900 }, { "epoch": 3.453416149068323, "eval_accuracy": 0.8283023849335562, "eval_loss": 0.6656120419502258, "eval_runtime": 85.6523, "eval_samples_per_second": 132.664, "eval_steps_per_second": 16.59, "step": 13900 }, { "epoch": 3.4559006211180123, "grad_norm": 6.510132789611816, "learning_rate": 2.729192546583851e-05, "loss": 0.4582, "step": 13910 }, { "epoch": 3.458385093167702, "grad_norm": 6.053948402404785, "learning_rate": 2.716770186335404e-05, "loss": 0.653, "step": 13920 }, { "epoch": 3.4608695652173913, "grad_norm": 3.9080560207366943, "learning_rate": 2.7043478260869566e-05, "loss": 0.6322, "step": 13930 }, { "epoch": 3.463354037267081, "grad_norm": 2.829498052597046, "learning_rate": 2.6919254658385095e-05, "loss": 0.3978, "step": 13940 }, { "epoch": 3.4658385093167703, "grad_norm": 4.029519557952881, "learning_rate": 2.6795031055900622e-05, "loss": 0.3532, "step": 13950 }, { "epoch": 3.46832298136646, "grad_norm": 8.106303215026855, "learning_rate": 2.6670807453416152e-05, "loss": 0.5056, "step": 13960 }, { "epoch": 3.470807453416149, "grad_norm": 9.305558204650879, "learning_rate": 2.654658385093168e-05, "loss": 0.6274, "step": 13970 }, { "epoch": 3.4732919254658388, "grad_norm": 6.586569786071777, "learning_rate": 2.6422360248447208e-05, "loss": 0.524, "step": 13980 }, { "epoch": 3.475776397515528, "grad_norm": 4.757368087768555, "learning_rate": 2.6298136645962735e-05, "loss": 0.5058, "step": 13990 }, { "epoch": 3.4782608695652173, "grad_norm": 6.857468128204346, "learning_rate": 2.617391304347826e-05, "loss": 0.463, "step": 14000 }, { "epoch": 3.4782608695652173, "eval_accuracy": 0.830062483499076, "eval_loss": 0.655392050743103, "eval_runtime": 86.7827, "eval_samples_per_second": 130.936, "eval_steps_per_second": 16.374, "step": 14000 }, { "epoch": 3.480745341614907, "grad_norm": 6.986089706420898, "learning_rate": 2.604968944099379e-05, "loss": 0.5948, "step": 14010 }, { "epoch": 3.4832298136645963, "grad_norm": 7.034180641174316, "learning_rate": 2.5925465838509318e-05, "loss": 0.4492, "step": 14020 }, { "epoch": 3.4857142857142858, "grad_norm": 2.2844438552856445, "learning_rate": 2.5801242236024848e-05, "loss": 0.4341, "step": 14030 }, { "epoch": 3.4881987577639753, "grad_norm": 6.129580974578857, "learning_rate": 2.5677018633540374e-05, "loss": 0.4957, "step": 14040 }, { "epoch": 3.4906832298136647, "grad_norm": 4.148270130157471, "learning_rate": 2.5552795031055904e-05, "loss": 0.4501, "step": 14050 }, { "epoch": 3.493167701863354, "grad_norm": 8.753642082214355, "learning_rate": 2.542857142857143e-05, "loss": 0.7113, "step": 14060 }, { "epoch": 3.4956521739130437, "grad_norm": 7.5100321769714355, "learning_rate": 2.530434782608696e-05, "loss": 0.4538, "step": 14070 }, { "epoch": 3.4981366459627328, "grad_norm": 4.834388256072998, "learning_rate": 2.5180124223602487e-05, "loss": 0.429, "step": 14080 }, { "epoch": 3.5006211180124223, "grad_norm": 3.708731174468994, "learning_rate": 2.505590062111801e-05, "loss": 0.4318, "step": 14090 }, { "epoch": 3.5031055900621118, "grad_norm": 7.761505603790283, "learning_rate": 2.4931677018633543e-05, "loss": 0.3259, "step": 14100 }, { "epoch": 3.5031055900621118, "eval_accuracy": 0.8291824342163161, "eval_loss": 0.6640006899833679, "eval_runtime": 85.8522, "eval_samples_per_second": 132.355, "eval_steps_per_second": 16.552, "step": 14100 }, { "epoch": 3.5055900621118012, "grad_norm": 5.576478004455566, "learning_rate": 2.480745341614907e-05, "loss": 0.6021, "step": 14110 }, { "epoch": 3.5080745341614907, "grad_norm": 2.4706974029541016, "learning_rate": 2.4683229813664596e-05, "loss": 0.3856, "step": 14120 }, { "epoch": 3.51055900621118, "grad_norm": 1.1442434787750244, "learning_rate": 2.4559006211180123e-05, "loss": 0.6106, "step": 14130 }, { "epoch": 3.5130434782608697, "grad_norm": 3.042475700378418, "learning_rate": 2.4434782608695653e-05, "loss": 0.4711, "step": 14140 }, { "epoch": 3.5155279503105588, "grad_norm": 4.92565393447876, "learning_rate": 2.4310559006211183e-05, "loss": 0.6123, "step": 14150 }, { "epoch": 3.5180124223602487, "grad_norm": 8.960134506225586, "learning_rate": 2.418633540372671e-05, "loss": 0.642, "step": 14160 }, { "epoch": 3.5204968944099377, "grad_norm": 8.679351806640625, "learning_rate": 2.406211180124224e-05, "loss": 0.5592, "step": 14170 }, { "epoch": 3.5229813664596272, "grad_norm": 10.795132637023926, "learning_rate": 2.3937888198757766e-05, "loss": 0.6998, "step": 14180 }, { "epoch": 3.5254658385093167, "grad_norm": 3.723322629928589, "learning_rate": 2.3813664596273295e-05, "loss": 0.441, "step": 14190 }, { "epoch": 3.527950310559006, "grad_norm": 5.73036003112793, "learning_rate": 2.3689440993788822e-05, "loss": 0.7286, "step": 14200 }, { "epoch": 3.527950310559006, "eval_accuracy": 0.8307665229252839, "eval_loss": 0.6500012278556824, "eval_runtime": 86.0008, "eval_samples_per_second": 132.127, "eval_steps_per_second": 16.523, "step": 14200 }, { "epoch": 3.5304347826086957, "grad_norm": 6.265992164611816, "learning_rate": 2.356521739130435e-05, "loss": 0.3616, "step": 14210 }, { "epoch": 3.532919254658385, "grad_norm": 2.9732041358947754, "learning_rate": 2.3440993788819875e-05, "loss": 0.5564, "step": 14220 }, { "epoch": 3.5354037267080747, "grad_norm": 4.713552474975586, "learning_rate": 2.3316770186335405e-05, "loss": 0.5345, "step": 14230 }, { "epoch": 3.5378881987577637, "grad_norm": 3.708615779876709, "learning_rate": 2.319254658385093e-05, "loss": 0.383, "step": 14240 }, { "epoch": 3.5403726708074537, "grad_norm": 3.2620787620544434, "learning_rate": 2.306832298136646e-05, "loss": 0.4484, "step": 14250 }, { "epoch": 3.5428571428571427, "grad_norm": 4.0385823249816895, "learning_rate": 2.2944099378881988e-05, "loss": 0.4152, "step": 14260 }, { "epoch": 3.545341614906832, "grad_norm": 5.182163238525391, "learning_rate": 2.2819875776397518e-05, "loss": 0.5693, "step": 14270 }, { "epoch": 3.5478260869565217, "grad_norm": 4.178833961486816, "learning_rate": 2.2695652173913044e-05, "loss": 0.5311, "step": 14280 }, { "epoch": 3.550310559006211, "grad_norm": 8.150431632995605, "learning_rate": 2.257142857142857e-05, "loss": 0.5083, "step": 14290 }, { "epoch": 3.5527950310559007, "grad_norm": 6.455306053161621, "learning_rate": 2.24472049689441e-05, "loss": 0.4422, "step": 14300 }, { "epoch": 3.5527950310559007, "eval_accuracy": 0.8312945524949397, "eval_loss": 0.6539793014526367, "eval_runtime": 85.8492, "eval_samples_per_second": 132.36, "eval_steps_per_second": 16.552, "step": 14300 }, { "epoch": 3.55527950310559, "grad_norm": 5.034562110900879, "learning_rate": 2.2322981366459627e-05, "loss": 0.5845, "step": 14310 }, { "epoch": 3.5577639751552796, "grad_norm": 0.6601377129554749, "learning_rate": 2.2198757763975157e-05, "loss": 0.3904, "step": 14320 }, { "epoch": 3.5602484472049687, "grad_norm": 13.989871978759766, "learning_rate": 2.2074534161490684e-05, "loss": 0.5033, "step": 14330 }, { "epoch": 3.5627329192546586, "grad_norm": 2.3294808864593506, "learning_rate": 2.1950310559006213e-05, "loss": 0.436, "step": 14340 }, { "epoch": 3.5652173913043477, "grad_norm": 2.7858335971832275, "learning_rate": 2.182608695652174e-05, "loss": 0.5116, "step": 14350 }, { "epoch": 3.567701863354037, "grad_norm": 6.121773719787598, "learning_rate": 2.170186335403727e-05, "loss": 0.3615, "step": 14360 }, { "epoch": 3.5701863354037267, "grad_norm": 3.8832411766052246, "learning_rate": 2.1577639751552796e-05, "loss": 0.4784, "step": 14370 }, { "epoch": 3.572670807453416, "grad_norm": 6.1436591148376465, "learning_rate": 2.1453416149068323e-05, "loss": 0.387, "step": 14380 }, { "epoch": 3.5751552795031056, "grad_norm": 5.157639026641846, "learning_rate": 2.132919254658385e-05, "loss": 0.5088, "step": 14390 }, { "epoch": 3.577639751552795, "grad_norm": 3.7850217819213867, "learning_rate": 2.120496894409938e-05, "loss": 0.4374, "step": 14400 }, { "epoch": 3.577639751552795, "eval_accuracy": 0.8317345771363196, "eval_loss": 0.6497304439544678, "eval_runtime": 85.1252, "eval_samples_per_second": 133.486, "eval_steps_per_second": 16.693, "step": 14400 }, { "epoch": 3.5801242236024846, "grad_norm": 3.594571113586426, "learning_rate": 2.108074534161491e-05, "loss": 0.6101, "step": 14410 }, { "epoch": 3.5826086956521737, "grad_norm": 4.151157855987549, "learning_rate": 2.0956521739130436e-05, "loss": 0.5851, "step": 14420 }, { "epoch": 3.5850931677018636, "grad_norm": 9.117693901062012, "learning_rate": 2.0832298136645966e-05, "loss": 0.3478, "step": 14430 }, { "epoch": 3.5875776397515526, "grad_norm": 4.291843414306641, "learning_rate": 2.0708074534161492e-05, "loss": 0.3923, "step": 14440 }, { "epoch": 3.590062111801242, "grad_norm": 6.3122358322143555, "learning_rate": 2.0583850931677022e-05, "loss": 0.4025, "step": 14450 }, { "epoch": 3.5925465838509316, "grad_norm": 8.162814140319824, "learning_rate": 2.045962732919255e-05, "loss": 0.489, "step": 14460 }, { "epoch": 3.595031055900621, "grad_norm": 7.5478057861328125, "learning_rate": 2.0335403726708075e-05, "loss": 0.5294, "step": 14470 }, { "epoch": 3.5975155279503106, "grad_norm": 7.7503862380981445, "learning_rate": 2.02111801242236e-05, "loss": 0.7006, "step": 14480 }, { "epoch": 3.6, "grad_norm": 4.4560956954956055, "learning_rate": 2.008695652173913e-05, "loss": 0.4768, "step": 14490 }, { "epoch": 3.6024844720496896, "grad_norm": 12.04161548614502, "learning_rate": 1.9962732919254658e-05, "loss": 0.7962, "step": 14500 }, { "epoch": 3.6024844720496896, "eval_accuracy": 0.8340227052714952, "eval_loss": 0.6416128873825073, "eval_runtime": 85.9635, "eval_samples_per_second": 132.184, "eval_steps_per_second": 16.53, "step": 14500 }, { "epoch": 3.6049689440993786, "grad_norm": 4.408351898193359, "learning_rate": 1.9838509316770188e-05, "loss": 0.6468, "step": 14510 }, { "epoch": 3.6074534161490686, "grad_norm": 2.5475428104400635, "learning_rate": 1.9714285714285714e-05, "loss": 0.5066, "step": 14520 }, { "epoch": 3.6099378881987576, "grad_norm": 2.807896852493286, "learning_rate": 1.9590062111801244e-05, "loss": 0.5552, "step": 14530 }, { "epoch": 3.612422360248447, "grad_norm": 9.001070976257324, "learning_rate": 1.946583850931677e-05, "loss": 0.5289, "step": 14540 }, { "epoch": 3.6149068322981366, "grad_norm": 3.7283670902252197, "learning_rate": 1.9341614906832297e-05, "loss": 0.3566, "step": 14550 }, { "epoch": 3.617391304347826, "grad_norm": 3.9144983291625977, "learning_rate": 1.9217391304347827e-05, "loss": 0.5467, "step": 14560 }, { "epoch": 3.6198757763975156, "grad_norm": 3.974045515060425, "learning_rate": 1.9093167701863354e-05, "loss": 0.4297, "step": 14570 }, { "epoch": 3.622360248447205, "grad_norm": 3.520359516143799, "learning_rate": 1.8968944099378884e-05, "loss": 0.4779, "step": 14580 }, { "epoch": 3.6248447204968945, "grad_norm": 5.024179935455322, "learning_rate": 1.884472049689441e-05, "loss": 0.4766, "step": 14590 }, { "epoch": 3.6273291925465836, "grad_norm": 5.152400493621826, "learning_rate": 1.872049689440994e-05, "loss": 0.6297, "step": 14600 }, { "epoch": 3.6273291925465836, "eval_accuracy": 0.8339347003432193, "eval_loss": 0.6392886638641357, "eval_runtime": 85.5369, "eval_samples_per_second": 132.843, "eval_steps_per_second": 16.613, "step": 14600 }, { "epoch": 3.6298136645962735, "grad_norm": 0.8217100501060486, "learning_rate": 1.8596273291925466e-05, "loss": 0.5714, "step": 14610 }, { "epoch": 3.6322981366459626, "grad_norm": 6.355893611907959, "learning_rate": 1.8472049689440996e-05, "loss": 0.4674, "step": 14620 }, { "epoch": 3.634782608695652, "grad_norm": 5.964326858520508, "learning_rate": 1.8347826086956523e-05, "loss": 0.6098, "step": 14630 }, { "epoch": 3.6372670807453416, "grad_norm": 2.0514612197875977, "learning_rate": 1.822360248447205e-05, "loss": 0.5456, "step": 14640 }, { "epoch": 3.639751552795031, "grad_norm": 3.857182025909424, "learning_rate": 1.809937888198758e-05, "loss": 0.5245, "step": 14650 }, { "epoch": 3.6422360248447205, "grad_norm": 6.316091537475586, "learning_rate": 1.7975155279503106e-05, "loss": 0.6184, "step": 14660 }, { "epoch": 3.64472049689441, "grad_norm": 11.116755485534668, "learning_rate": 1.7850931677018636e-05, "loss": 0.4855, "step": 14670 }, { "epoch": 3.6472049689440995, "grad_norm": 0.28117311000823975, "learning_rate": 1.7726708074534162e-05, "loss": 0.4544, "step": 14680 }, { "epoch": 3.6496894409937886, "grad_norm": 7.566733360290527, "learning_rate": 1.7602484472049692e-05, "loss": 0.2681, "step": 14690 }, { "epoch": 3.6521739130434785, "grad_norm": 2.6107754707336426, "learning_rate": 1.747826086956522e-05, "loss": 0.4933, "step": 14700 }, { "epoch": 3.6521739130434785, "eval_accuracy": 0.8335826806301153, "eval_loss": 0.6379285454750061, "eval_runtime": 86.7538, "eval_samples_per_second": 130.98, "eval_steps_per_second": 16.38, "step": 14700 }, { "epoch": 3.6546583850931675, "grad_norm": 2.6673498153686523, "learning_rate": 1.735403726708075e-05, "loss": 0.4378, "step": 14710 }, { "epoch": 3.657142857142857, "grad_norm": 2.3931283950805664, "learning_rate": 1.7229813664596275e-05, "loss": 0.3868, "step": 14720 }, { "epoch": 3.6596273291925465, "grad_norm": 4.458917617797852, "learning_rate": 1.71055900621118e-05, "loss": 0.4633, "step": 14730 }, { "epoch": 3.662111801242236, "grad_norm": 5.459697246551514, "learning_rate": 1.6981366459627328e-05, "loss": 0.5051, "step": 14740 }, { "epoch": 3.6645962732919255, "grad_norm": 3.741152763366699, "learning_rate": 1.6857142857142858e-05, "loss": 0.5956, "step": 14750 }, { "epoch": 3.667080745341615, "grad_norm": 13.998597145080566, "learning_rate": 1.6732919254658384e-05, "loss": 0.4515, "step": 14760 }, { "epoch": 3.6695652173913045, "grad_norm": 4.710552215576172, "learning_rate": 1.6608695652173914e-05, "loss": 0.5572, "step": 14770 }, { "epoch": 3.6720496894409935, "grad_norm": 8.206193923950195, "learning_rate": 1.648447204968944e-05, "loss": 0.4481, "step": 14780 }, { "epoch": 3.6745341614906835, "grad_norm": 6.1793012619018555, "learning_rate": 1.636024844720497e-05, "loss": 0.4568, "step": 14790 }, { "epoch": 3.6770186335403725, "grad_norm": 8.518237113952637, "learning_rate": 1.6236024844720497e-05, "loss": 0.5548, "step": 14800 }, { "epoch": 3.6770186335403725, "eval_accuracy": 0.8356067939804629, "eval_loss": 0.6300323009490967, "eval_runtime": 86.6878, "eval_samples_per_second": 131.08, "eval_steps_per_second": 16.392, "step": 14800 }, { "epoch": 3.679503105590062, "grad_norm": 8.760847091674805, "learning_rate": 1.6111801242236024e-05, "loss": 0.6173, "step": 14810 }, { "epoch": 3.6819875776397515, "grad_norm": 4.6929802894592285, "learning_rate": 1.5987577639751554e-05, "loss": 0.5821, "step": 14820 }, { "epoch": 3.684472049689441, "grad_norm": 7.2983927726745605, "learning_rate": 1.586335403726708e-05, "loss": 0.5957, "step": 14830 }, { "epoch": 3.6869565217391305, "grad_norm": 8.686875343322754, "learning_rate": 1.573913043478261e-05, "loss": 0.4733, "step": 14840 }, { "epoch": 3.68944099378882, "grad_norm": 3.881749153137207, "learning_rate": 1.5614906832298137e-05, "loss": 0.3509, "step": 14850 }, { "epoch": 3.6919254658385094, "grad_norm": 5.879938125610352, "learning_rate": 1.5490683229813666e-05, "loss": 0.4898, "step": 14860 }, { "epoch": 3.6944099378881985, "grad_norm": 2.1531667709350586, "learning_rate": 1.5366459627329193e-05, "loss": 0.5043, "step": 14870 }, { "epoch": 3.6968944099378884, "grad_norm": 4.413904190063477, "learning_rate": 1.5254658385093168e-05, "loss": 0.5069, "step": 14880 }, { "epoch": 3.6993788819875775, "grad_norm": 5.015860557556152, "learning_rate": 1.5130434782608697e-05, "loss": 0.6092, "step": 14890 }, { "epoch": 3.701863354037267, "grad_norm": 7.194756984710693, "learning_rate": 1.5006211180124225e-05, "loss": 0.564, "step": 14900 }, { "epoch": 3.701863354037267, "eval_accuracy": 0.835166769339083, "eval_loss": 0.6283601522445679, "eval_runtime": 85.4479, "eval_samples_per_second": 132.982, "eval_steps_per_second": 16.63, "step": 14900 }, { "epoch": 3.7043478260869565, "grad_norm": 1.7463475465774536, "learning_rate": 1.4881987577639753e-05, "loss": 0.5327, "step": 14910 }, { "epoch": 3.706832298136646, "grad_norm": 2.530923366546631, "learning_rate": 1.4757763975155281e-05, "loss": 0.3879, "step": 14920 }, { "epoch": 3.7093167701863354, "grad_norm": 5.713317394256592, "learning_rate": 1.463354037267081e-05, "loss": 0.637, "step": 14930 }, { "epoch": 3.711801242236025, "grad_norm": 5.655239582061768, "learning_rate": 1.4509316770186334e-05, "loss": 0.2572, "step": 14940 }, { "epoch": 3.7142857142857144, "grad_norm": 3.9437196254730225, "learning_rate": 1.4385093167701863e-05, "loss": 0.4977, "step": 14950 }, { "epoch": 3.7167701863354035, "grad_norm": 4.147866249084473, "learning_rate": 1.426086956521739e-05, "loss": 0.5557, "step": 14960 }, { "epoch": 3.7192546583850934, "grad_norm": 9.1124906539917, "learning_rate": 1.4136645962732919e-05, "loss": 0.5664, "step": 14970 }, { "epoch": 3.7217391304347824, "grad_norm": 6.563503265380859, "learning_rate": 1.4012422360248447e-05, "loss": 0.5156, "step": 14980 }, { "epoch": 3.724223602484472, "grad_norm": 2.749929666519165, "learning_rate": 1.3888198757763975e-05, "loss": 0.3662, "step": 14990 }, { "epoch": 3.7267080745341614, "grad_norm": 5.506071090698242, "learning_rate": 1.3763975155279504e-05, "loss": 0.2638, "step": 15000 }, { "epoch": 3.7267080745341614, "eval_accuracy": 0.8337586904866673, "eval_loss": 0.6299127340316772, "eval_runtime": 85.7269, "eval_samples_per_second": 132.549, "eval_steps_per_second": 16.576, "step": 15000 }, { "epoch": 3.729192546583851, "grad_norm": 4.335992336273193, "learning_rate": 1.3639751552795032e-05, "loss": 0.4352, "step": 15010 }, { "epoch": 3.7316770186335404, "grad_norm": 5.460691928863525, "learning_rate": 1.3515527950310562e-05, "loss": 0.4618, "step": 15020 }, { "epoch": 3.73416149068323, "grad_norm": 9.748331069946289, "learning_rate": 1.3391304347826086e-05, "loss": 0.5894, "step": 15030 }, { "epoch": 3.7366459627329194, "grad_norm": 6.729307651519775, "learning_rate": 1.3267080745341615e-05, "loss": 0.5808, "step": 15040 }, { "epoch": 3.7391304347826084, "grad_norm": 4.958307266235352, "learning_rate": 1.3142857142857143e-05, "loss": 0.4049, "step": 15050 }, { "epoch": 3.7416149068322984, "grad_norm": 4.747241497039795, "learning_rate": 1.3018633540372671e-05, "loss": 0.3638, "step": 15060 }, { "epoch": 3.7440993788819874, "grad_norm": 4.579631328582764, "learning_rate": 1.28944099378882e-05, "loss": 0.6736, "step": 15070 }, { "epoch": 3.746583850931677, "grad_norm": 4.091526985168457, "learning_rate": 1.2770186335403727e-05, "loss": 0.4804, "step": 15080 }, { "epoch": 3.7490683229813664, "grad_norm": 5.306528568267822, "learning_rate": 1.2645962732919256e-05, "loss": 0.3247, "step": 15090 }, { "epoch": 3.751552795031056, "grad_norm": 4.789366722106934, "learning_rate": 1.2521739130434784e-05, "loss": 0.6129, "step": 15100 }, { "epoch": 3.751552795031056, "eval_accuracy": 0.8373668925459826, "eval_loss": 0.6253156661987305, "eval_runtime": 85.345, "eval_samples_per_second": 133.142, "eval_steps_per_second": 16.65, "step": 15100 }, { "epoch": 3.7540372670807454, "grad_norm": 4.639571189880371, "learning_rate": 1.239751552795031e-05, "loss": 0.5289, "step": 15110 }, { "epoch": 3.756521739130435, "grad_norm": 5.007940292358398, "learning_rate": 1.2273291925465839e-05, "loss": 0.4025, "step": 15120 }, { "epoch": 3.7590062111801243, "grad_norm": 9.492412567138672, "learning_rate": 1.2149068322981367e-05, "loss": 0.465, "step": 15130 }, { "epoch": 3.7614906832298134, "grad_norm": 5.330755710601807, "learning_rate": 1.2024844720496895e-05, "loss": 0.4507, "step": 15140 }, { "epoch": 3.7639751552795033, "grad_norm": 6.425350666046143, "learning_rate": 1.1900621118012423e-05, "loss": 0.4656, "step": 15150 }, { "epoch": 3.7664596273291924, "grad_norm": 5.325112819671631, "learning_rate": 1.1776397515527951e-05, "loss": 0.4524, "step": 15160 }, { "epoch": 3.768944099378882, "grad_norm": 5.342360973358154, "learning_rate": 1.165217391304348e-05, "loss": 0.4891, "step": 15170 }, { "epoch": 3.7714285714285714, "grad_norm": 4.091293811798096, "learning_rate": 1.1527950310559006e-05, "loss": 0.5008, "step": 15180 }, { "epoch": 3.773913043478261, "grad_norm": 7.995913505554199, "learning_rate": 1.1403726708074534e-05, "loss": 0.7318, "step": 15190 }, { "epoch": 3.7763975155279503, "grad_norm": 5.437656402587891, "learning_rate": 1.1279503105590063e-05, "loss": 0.51, "step": 15200 }, { "epoch": 3.7763975155279503, "eval_accuracy": 0.8389509812549503, "eval_loss": 0.6205056309700012, "eval_runtime": 85.0149, "eval_samples_per_second": 133.659, "eval_steps_per_second": 16.715, "step": 15200 }, { "epoch": 3.77888198757764, "grad_norm": 3.89784574508667, "learning_rate": 1.115527950310559e-05, "loss": 0.3896, "step": 15210 }, { "epoch": 3.7813664596273293, "grad_norm": 2.4498801231384277, "learning_rate": 1.1031055900621119e-05, "loss": 0.4979, "step": 15220 }, { "epoch": 3.7838509316770184, "grad_norm": 8.071438789367676, "learning_rate": 1.0906832298136645e-05, "loss": 0.5893, "step": 15230 }, { "epoch": 3.7863354037267083, "grad_norm": 7.249101161956787, "learning_rate": 1.0782608695652174e-05, "loss": 0.5271, "step": 15240 }, { "epoch": 3.7888198757763973, "grad_norm": 9.257108688354492, "learning_rate": 1.0658385093167702e-05, "loss": 0.6586, "step": 15250 }, { "epoch": 3.791304347826087, "grad_norm": 6.51657247543335, "learning_rate": 1.053416149068323e-05, "loss": 0.4949, "step": 15260 }, { "epoch": 3.7937888198757763, "grad_norm": 8.859468460083008, "learning_rate": 1.0409937888198758e-05, "loss": 0.6531, "step": 15270 }, { "epoch": 3.796273291925466, "grad_norm": 9.06107234954834, "learning_rate": 1.0285714285714286e-05, "loss": 0.4214, "step": 15280 }, { "epoch": 3.7987577639751553, "grad_norm": 2.4932773113250732, "learning_rate": 1.0161490683229815e-05, "loss": 0.5662, "step": 15290 }, { "epoch": 3.801242236024845, "grad_norm": 4.2591872215271, "learning_rate": 1.0037267080745343e-05, "loss": 0.4612, "step": 15300 }, { "epoch": 3.801242236024845, "eval_accuracy": 0.8389509812549503, "eval_loss": 0.6165159344673157, "eval_runtime": 86.3041, "eval_samples_per_second": 131.662, "eval_steps_per_second": 16.465, "step": 15300 }, { "epoch": 3.8037267080745343, "grad_norm": 3.7499098777770996, "learning_rate": 9.91304347826087e-06, "loss": 0.5474, "step": 15310 }, { "epoch": 3.8062111801242233, "grad_norm": 7.90886926651001, "learning_rate": 9.788819875776398e-06, "loss": 0.3745, "step": 15320 }, { "epoch": 3.8086956521739133, "grad_norm": 8.579766273498535, "learning_rate": 9.664596273291926e-06, "loss": 0.5731, "step": 15330 }, { "epoch": 3.8111801242236023, "grad_norm": 5.433511734008789, "learning_rate": 9.540372670807454e-06, "loss": 0.4555, "step": 15340 }, { "epoch": 3.813664596273292, "grad_norm": 6.867114543914795, "learning_rate": 9.416149068322982e-06, "loss": 0.6483, "step": 15350 }, { "epoch": 3.8161490683229813, "grad_norm": 4.577269554138184, "learning_rate": 9.291925465838509e-06, "loss": 0.4513, "step": 15360 }, { "epoch": 3.8186335403726708, "grad_norm": 3.5247273445129395, "learning_rate": 9.167701863354037e-06, "loss": 0.5172, "step": 15370 }, { "epoch": 3.8211180124223603, "grad_norm": 4.862856864929199, "learning_rate": 9.043478260869565e-06, "loss": 0.4777, "step": 15380 }, { "epoch": 3.8236024844720498, "grad_norm": 6.265756130218506, "learning_rate": 8.919254658385095e-06, "loss": 0.5164, "step": 15390 }, { "epoch": 3.8260869565217392, "grad_norm": 6.9130754470825195, "learning_rate": 8.795031055900622e-06, "loss": 0.5304, "step": 15400 }, { "epoch": 3.8260869565217392, "eval_accuracy": 0.8411511044618498, "eval_loss": 0.6112430095672607, "eval_runtime": 85.0608, "eval_samples_per_second": 133.587, "eval_steps_per_second": 16.706, "step": 15400 }, { "epoch": 3.8285714285714287, "grad_norm": 5.0783233642578125, "learning_rate": 8.67080745341615e-06, "loss": 0.5357, "step": 15410 }, { "epoch": 3.8310559006211182, "grad_norm": 7.3688154220581055, "learning_rate": 8.546583850931678e-06, "loss": 0.668, "step": 15420 }, { "epoch": 3.8335403726708073, "grad_norm": 6.1275153160095215, "learning_rate": 8.422360248447206e-06, "loss": 0.3594, "step": 15430 }, { "epoch": 3.8360248447204968, "grad_norm": 4.6164751052856445, "learning_rate": 8.298136645962733e-06, "loss": 0.3549, "step": 15440 }, { "epoch": 3.8385093167701863, "grad_norm": 1.4796391725540161, "learning_rate": 8.17391304347826e-06, "loss": 0.3755, "step": 15450 }, { "epoch": 3.8409937888198757, "grad_norm": 8.532491683959961, "learning_rate": 8.049689440993789e-06, "loss": 0.4853, "step": 15460 }, { "epoch": 3.8434782608695652, "grad_norm": 7.3214616775512695, "learning_rate": 7.925465838509317e-06, "loss": 0.3734, "step": 15470 }, { "epoch": 3.8459627329192547, "grad_norm": 9.121134757995605, "learning_rate": 7.801242236024845e-06, "loss": 0.3841, "step": 15480 }, { "epoch": 3.848447204968944, "grad_norm": 7.52311372756958, "learning_rate": 7.677018633540372e-06, "loss": 0.3626, "step": 15490 }, { "epoch": 3.8509316770186337, "grad_norm": 7.9005022048950195, "learning_rate": 7.552795031055901e-06, "loss": 0.4738, "step": 15500 }, { "epoch": 3.8509316770186337, "eval_accuracy": 0.8387749713983983, "eval_loss": 0.6148629784584045, "eval_runtime": 85.04, "eval_samples_per_second": 133.619, "eval_steps_per_second": 16.71, "step": 15500 }, { "epoch": 3.853416149068323, "grad_norm": 0.9077171683311462, "learning_rate": 7.428571428571429e-06, "loss": 0.5216, "step": 15510 }, { "epoch": 3.8559006211180122, "grad_norm": 6.145358085632324, "learning_rate": 7.304347826086957e-06, "loss": 0.4544, "step": 15520 }, { "epoch": 3.8583850931677017, "grad_norm": 4.223785877227783, "learning_rate": 7.180124223602484e-06, "loss": 0.7364, "step": 15530 }, { "epoch": 3.860869565217391, "grad_norm": 3.089573383331299, "learning_rate": 7.055900621118013e-06, "loss": 0.4429, "step": 15540 }, { "epoch": 3.8633540372670807, "grad_norm": 4.086426258087158, "learning_rate": 6.931677018633541e-06, "loss": 0.2988, "step": 15550 }, { "epoch": 3.86583850931677, "grad_norm": 9.179378509521484, "learning_rate": 6.807453416149069e-06, "loss": 0.4351, "step": 15560 }, { "epoch": 3.8683229813664597, "grad_norm": 2.9945521354675293, "learning_rate": 6.683229813664596e-06, "loss": 0.4504, "step": 15570 }, { "epoch": 3.870807453416149, "grad_norm": 3.0713376998901367, "learning_rate": 6.559006211180124e-06, "loss": 0.5011, "step": 15580 }, { "epoch": 3.8732919254658387, "grad_norm": 5.534846305847168, "learning_rate": 6.434782608695652e-06, "loss": 0.6831, "step": 15590 }, { "epoch": 3.875776397515528, "grad_norm": 5.85855770111084, "learning_rate": 6.3105590062111805e-06, "loss": 0.3845, "step": 15600 }, { "epoch": 3.875776397515528, "eval_accuracy": 0.8391269911115022, "eval_loss": 0.6140738725662231, "eval_runtime": 84.996, "eval_samples_per_second": 133.689, "eval_steps_per_second": 16.718, "step": 15600 }, { "epoch": 3.878260869565217, "grad_norm": 8.211888313293457, "learning_rate": 6.186335403726709e-06, "loss": 0.552, "step": 15610 }, { "epoch": 3.8807453416149067, "grad_norm": 3.7541515827178955, "learning_rate": 6.062111801242237e-06, "loss": 0.3499, "step": 15620 }, { "epoch": 3.883229813664596, "grad_norm": 2.6869845390319824, "learning_rate": 5.937888198757764e-06, "loss": 0.4644, "step": 15630 }, { "epoch": 3.8857142857142857, "grad_norm": 4.1416707038879395, "learning_rate": 5.8136645962732925e-06, "loss": 0.4497, "step": 15640 }, { "epoch": 3.888198757763975, "grad_norm": 3.2766640186309814, "learning_rate": 5.68944099378882e-06, "loss": 0.381, "step": 15650 }, { "epoch": 3.8906832298136647, "grad_norm": 9.587335586547852, "learning_rate": 5.565217391304348e-06, "loss": 0.5367, "step": 15660 }, { "epoch": 3.893167701863354, "grad_norm": 8.829601287841797, "learning_rate": 5.440993788819876e-06, "loss": 0.5684, "step": 15670 }, { "epoch": 3.8956521739130436, "grad_norm": 6.785938739776611, "learning_rate": 5.316770186335404e-06, "loss": 0.2842, "step": 15680 }, { "epoch": 3.898136645962733, "grad_norm": 3.8636465072631836, "learning_rate": 5.192546583850932e-06, "loss": 0.46, "step": 15690 }, { "epoch": 3.900621118012422, "grad_norm": 7.689055442810059, "learning_rate": 5.06832298136646e-06, "loss": 0.4533, "step": 15700 }, { "epoch": 3.900621118012422, "eval_accuracy": 0.8399190354659861, "eval_loss": 0.6139475703239441, "eval_runtime": 85.0525, "eval_samples_per_second": 133.6, "eval_steps_per_second": 16.707, "step": 15700 }, { "epoch": 3.9031055900621117, "grad_norm": 8.012325286865234, "learning_rate": 4.944099378881987e-06, "loss": 0.5585, "step": 15710 }, { "epoch": 3.905590062111801, "grad_norm": 1.3264799118041992, "learning_rate": 4.8198757763975155e-06, "loss": 0.4654, "step": 15720 }, { "epoch": 3.9080745341614906, "grad_norm": 3.987639904022217, "learning_rate": 4.695652173913044e-06, "loss": 0.4867, "step": 15730 }, { "epoch": 3.91055900621118, "grad_norm": 6.421884536743164, "learning_rate": 4.571428571428572e-06, "loss": 0.5595, "step": 15740 }, { "epoch": 3.9130434782608696, "grad_norm": 8.964715003967285, "learning_rate": 4.4472049689441e-06, "loss": 0.5024, "step": 15750 }, { "epoch": 3.915527950310559, "grad_norm": 7.1650004386901855, "learning_rate": 4.3229813664596275e-06, "loss": 0.4552, "step": 15760 }, { "epoch": 3.9180124223602486, "grad_norm": 3.3710427284240723, "learning_rate": 4.198757763975156e-06, "loss": 0.4063, "step": 15770 }, { "epoch": 3.920496894409938, "grad_norm": 7.025265693664551, "learning_rate": 4.074534161490683e-06, "loss": 0.6082, "step": 15780 }, { "epoch": 3.922981366459627, "grad_norm": 6.672760963439941, "learning_rate": 3.950310559006211e-06, "loss": 0.4398, "step": 15790 }, { "epoch": 3.9254658385093166, "grad_norm": 9.175477027893066, "learning_rate": 3.8260869565217395e-06, "loss": 0.3539, "step": 15800 }, { "epoch": 3.9254658385093166, "eval_accuracy": 0.8401830502508141, "eval_loss": 0.6130595803260803, "eval_runtime": 85.2127, "eval_samples_per_second": 133.349, "eval_steps_per_second": 16.676, "step": 15800 }, { "epoch": 3.927950310559006, "grad_norm": 2.647934675216675, "learning_rate": 3.7018633540372673e-06, "loss": 0.2573, "step": 15810 }, { "epoch": 3.9304347826086956, "grad_norm": 17.082826614379883, "learning_rate": 3.577639751552795e-06, "loss": 0.5785, "step": 15820 }, { "epoch": 3.932919254658385, "grad_norm": 6.866117000579834, "learning_rate": 3.4534161490683232e-06, "loss": 0.637, "step": 15830 }, { "epoch": 3.9354037267080746, "grad_norm": 8.402270317077637, "learning_rate": 3.329192546583851e-06, "loss": 0.6079, "step": 15840 }, { "epoch": 3.937888198757764, "grad_norm": 4.975553512573242, "learning_rate": 3.2049689440993792e-06, "loss": 0.659, "step": 15850 }, { "epoch": 3.9403726708074536, "grad_norm": 7.253668308258057, "learning_rate": 3.080745341614907e-06, "loss": 0.5316, "step": 15860 }, { "epoch": 3.942857142857143, "grad_norm": 4.728071689605713, "learning_rate": 2.9565217391304348e-06, "loss": 0.3085, "step": 15870 }, { "epoch": 3.945341614906832, "grad_norm": 3.6727304458618164, "learning_rate": 2.832298136645963e-06, "loss": 0.3978, "step": 15880 }, { "epoch": 3.9478260869565216, "grad_norm": 7.217862129211426, "learning_rate": 2.7080745341614908e-06, "loss": 0.5929, "step": 15890 }, { "epoch": 3.950310559006211, "grad_norm": 5.9662628173828125, "learning_rate": 2.5838509316770185e-06, "loss": 0.6485, "step": 15900 }, { "epoch": 3.950310559006211, "eval_accuracy": 0.8396550206811582, "eval_loss": 0.611811637878418, "eval_runtime": 85.1765, "eval_samples_per_second": 133.405, "eval_steps_per_second": 16.683, "step": 15900 }, { "epoch": 3.9527950310559006, "grad_norm": 3.825432777404785, "learning_rate": 2.4596273291925467e-06, "loss": 0.4889, "step": 15910 }, { "epoch": 3.95527950310559, "grad_norm": 4.859676837921143, "learning_rate": 2.3354037267080745e-06, "loss": 0.5675, "step": 15920 }, { "epoch": 3.9577639751552796, "grad_norm": 5.451256275177002, "learning_rate": 2.2111801242236023e-06, "loss": 0.4364, "step": 15930 }, { "epoch": 3.960248447204969, "grad_norm": 6.4008612632751465, "learning_rate": 2.0869565217391305e-06, "loss": 0.4252, "step": 15940 }, { "epoch": 3.9627329192546585, "grad_norm": 7.916716575622559, "learning_rate": 1.9627329192546587e-06, "loss": 0.4462, "step": 15950 }, { "epoch": 3.965217391304348, "grad_norm": 7.608262538909912, "learning_rate": 1.8385093167701865e-06, "loss": 0.5672, "step": 15960 }, { "epoch": 3.967701863354037, "grad_norm": 8.407822608947754, "learning_rate": 1.7142857142857145e-06, "loss": 0.4583, "step": 15970 }, { "epoch": 3.9701863354037266, "grad_norm": 4.553814888000488, "learning_rate": 1.5900621118012425e-06, "loss": 0.4074, "step": 15980 }, { "epoch": 3.972670807453416, "grad_norm": 3.75431752204895, "learning_rate": 1.4658385093167703e-06, "loss": 0.4336, "step": 15990 }, { "epoch": 3.9751552795031055, "grad_norm": 5.175358295440674, "learning_rate": 1.3416149068322982e-06, "loss": 0.331, "step": 16000 }, { "epoch": 3.9751552795031055, "eval_accuracy": 0.8396550206811582, "eval_loss": 0.6108485460281372, "eval_runtime": 87.4471, "eval_samples_per_second": 129.941, "eval_steps_per_second": 16.25, "step": 16000 }, { "epoch": 3.977639751552795, "grad_norm": 9.12428092956543, "learning_rate": 1.217391304347826e-06, "loss": 0.4686, "step": 16010 }, { "epoch": 3.9801242236024845, "grad_norm": 5.5283379554748535, "learning_rate": 1.093167701863354e-06, "loss": 0.4773, "step": 16020 }, { "epoch": 3.982608695652174, "grad_norm": 7.850075721740723, "learning_rate": 9.68944099378882e-07, "loss": 0.4124, "step": 16030 }, { "epoch": 3.9850931677018635, "grad_norm": 6.541348457336426, "learning_rate": 8.447204968944101e-07, "loss": 0.2801, "step": 16040 }, { "epoch": 3.987577639751553, "grad_norm": 4.038955211639404, "learning_rate": 7.204968944099379e-07, "loss": 0.3776, "step": 16050 }, { "epoch": 3.990062111801242, "grad_norm": 2.5451860427856445, "learning_rate": 5.962732919254659e-07, "loss": 0.5369, "step": 16060 }, { "epoch": 3.9925465838509315, "grad_norm": 2.278172731399536, "learning_rate": 4.720496894409938e-07, "loss": 0.578, "step": 16070 }, { "epoch": 3.995031055900621, "grad_norm": 11.714668273925781, "learning_rate": 3.4782608695652175e-07, "loss": 0.4875, "step": 16080 }, { "epoch": 3.9975155279503105, "grad_norm": 8.900927543640137, "learning_rate": 2.236024844720497e-07, "loss": 0.4701, "step": 16090 }, { "epoch": 4.0, "grad_norm": 0.3073888123035431, "learning_rate": 9.937888198757765e-08, "loss": 0.3582, "step": 16100 }, { "epoch": 4.0, "eval_accuracy": 0.8400070403942621, "eval_loss": 0.6105344295501709, "eval_runtime": 85.9786, "eval_samples_per_second": 132.161, "eval_steps_per_second": 16.527, "step": 16100 }, { "epoch": 4.0, "step": 16100, "total_flos": 1.9975615705569485e+19, "train_loss": 0.9840855360623473, "train_runtime": 18351.2913, "train_samples_per_second": 14.034, "train_steps_per_second": 0.877 } ], "logging_steps": 10, "max_steps": 16100, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 100, "total_flos": 1.9975615705569485e+19, "train_batch_size": 16, "trial_name": null, "trial_params": null }