diff --git "a/checkpoint-2500/trainer_state.json" "b/checkpoint-2500/trainer_state.json" new file mode 100644--- /dev/null +++ "b/checkpoint-2500/trainer_state.json" @@ -0,0 +1,5034 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.0676818950930626, + "eval_steps": 500, + "global_step": 2500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 10.69194974899292, + "epoch": 0.00013536379018612522, + "grad_norm": 12.5, + "learning_rate": 2e-06, + "loss": 10.8777, + "mean_token_accuracy": 5.577245028689504e-05, + "num_tokens": 15054.0, + "step": 5 + }, + { + "entropy": 10.691948223114014, + "epoch": 0.00027072758037225043, + "grad_norm": 12.0625, + "learning_rate": 4.5e-06, + "loss": 10.8153, + "mean_token_accuracy": 0.00044745010090991856, + "num_tokens": 28250.0, + "step": 10 + }, + { + "entropy": 10.691227531433105, + "epoch": 0.0004060913705583756, + "grad_norm": 9.1875, + "learning_rate": 7e-06, + "loss": 10.5817, + "mean_token_accuracy": 0.0174422716954723, + "num_tokens": 41527.0, + "step": 15 + }, + { + "entropy": 10.685559177398682, + "epoch": 0.0005414551607445009, + "grad_norm": 5.9375, + "learning_rate": 9.5e-06, + "loss": 10.2793, + "mean_token_accuracy": 0.034390256740152836, + "num_tokens": 54285.0, + "step": 20 + }, + { + "entropy": 10.661216259002686, + "epoch": 0.0006768189509306261, + "grad_norm": 3.640625, + "learning_rate": 1.2e-05, + "loss": 10.0155, + "mean_token_accuracy": 0.031836986914277075, + "num_tokens": 69833.0, + "step": 25 + }, + { + "entropy": 10.635576629638672, + "epoch": 0.0008121827411167512, + "grad_norm": 2.9375, + "learning_rate": 1.4500000000000002e-05, + "loss": 9.8988, + "mean_token_accuracy": 0.033391524106264114, + "num_tokens": 84065.0, + "step": 30 + }, + { + "entropy": 10.61604061126709, + "epoch": 0.0009475465313028764, + "grad_norm": 2.375, + "learning_rate": 1.7000000000000003e-05, + "loss": 9.7824, + "mean_token_accuracy": 0.035429037548601626, + "num_tokens": 97347.0, + "step": 35 + }, + { + "entropy": 10.616745281219483, + "epoch": 0.0010829103214890017, + "grad_norm": 2.5, + "learning_rate": 1.95e-05, + "loss": 9.722, + "mean_token_accuracy": 0.034273325465619564, + "num_tokens": 110883.0, + "step": 40 + }, + { + "entropy": 10.620021438598632, + "epoch": 0.001218274111675127, + "grad_norm": 2.1875, + "learning_rate": 2.2e-05, + "loss": 9.7299, + "mean_token_accuracy": 0.031383275240659717, + "num_tokens": 125407.0, + "step": 45 + }, + { + "entropy": 10.61033935546875, + "epoch": 0.0013536379018612521, + "grad_norm": 2.390625, + "learning_rate": 2.4500000000000003e-05, + "loss": 9.6781, + "mean_token_accuracy": 0.03162609338760376, + "num_tokens": 138221.0, + "step": 50 + }, + { + "entropy": 10.609558010101319, + "epoch": 0.0014890016920473773, + "grad_norm": 2.21875, + "learning_rate": 2.7e-05, + "loss": 9.6075, + "mean_token_accuracy": 0.037006295286118984, + "num_tokens": 150716.0, + "step": 55 + }, + { + "entropy": 10.592256355285645, + "epoch": 0.0016243654822335025, + "grad_norm": 2.15625, + "learning_rate": 2.95e-05, + "loss": 9.5363, + "mean_token_accuracy": 0.033432438410818575, + "num_tokens": 167084.0, + "step": 60 + }, + { + "entropy": 10.596331214904785, + "epoch": 0.0017597292724196277, + "grad_norm": 2.125, + "learning_rate": 3.2e-05, + "loss": 9.5357, + "mean_token_accuracy": 0.028936176747083663, + "num_tokens": 181029.0, + "step": 65 + }, + { + "entropy": 10.597533226013184, + "epoch": 0.0018950930626057529, + "grad_norm": 2.09375, + "learning_rate": 3.4500000000000005e-05, + "loss": 9.3621, + "mean_token_accuracy": 0.03304864317178726, + "num_tokens": 194629.0, + "step": 70 + }, + { + "entropy": 10.554742336273193, + "epoch": 0.0020304568527918783, + "grad_norm": 2.0625, + "learning_rate": 3.7e-05, + "loss": 9.2827, + "mean_token_accuracy": 0.029723377712070943, + "num_tokens": 207367.0, + "step": 75 + }, + { + "entropy": 10.533198165893555, + "epoch": 0.0021658206429780035, + "grad_norm": 1.9453125, + "learning_rate": 3.95e-05, + "loss": 9.1578, + "mean_token_accuracy": 0.029196519777178763, + "num_tokens": 221208.0, + "step": 80 + }, + { + "entropy": 10.477063274383545, + "epoch": 0.0023011844331641287, + "grad_norm": 2.015625, + "learning_rate": 4.2000000000000004e-05, + "loss": 9.0349, + "mean_token_accuracy": 0.03920750468969345, + "num_tokens": 233176.0, + "step": 85 + }, + { + "entropy": 10.465512084960938, + "epoch": 0.002436548223350254, + "grad_norm": 2.015625, + "learning_rate": 4.45e-05, + "loss": 8.9479, + "mean_token_accuracy": 0.037744084000587465, + "num_tokens": 247745.0, + "step": 90 + }, + { + "entropy": 10.410159492492676, + "epoch": 0.002571912013536379, + "grad_norm": 2.578125, + "learning_rate": 4.7000000000000004e-05, + "loss": 8.8433, + "mean_token_accuracy": 0.037843816168606284, + "num_tokens": 262129.0, + "step": 95 + }, + { + "entropy": 10.357386016845703, + "epoch": 0.0027072758037225042, + "grad_norm": 2.03125, + "learning_rate": 4.9500000000000004e-05, + "loss": 8.7074, + "mean_token_accuracy": 0.042482448555529115, + "num_tokens": 275500.0, + "step": 100 + }, + { + "entropy": 10.285986518859863, + "epoch": 0.0028426395939086294, + "grad_norm": 1.875, + "learning_rate": 5.2e-05, + "loss": 8.6332, + "mean_token_accuracy": 0.04186442382633686, + "num_tokens": 290437.0, + "step": 105 + }, + { + "entropy": 10.227664184570312, + "epoch": 0.0029780033840947546, + "grad_norm": 1.90625, + "learning_rate": 5.45e-05, + "loss": 8.4353, + "mean_token_accuracy": 0.0504638671875, + "num_tokens": 304615.0, + "step": 110 + }, + { + "entropy": 10.08832664489746, + "epoch": 0.00311336717428088, + "grad_norm": 1.8671875, + "learning_rate": 5.7e-05, + "loss": 8.263, + "mean_token_accuracy": 0.05822908580303192, + "num_tokens": 318560.0, + "step": 115 + }, + { + "entropy": 9.972474098205566, + "epoch": 0.003248730964467005, + "grad_norm": 2.03125, + "learning_rate": 5.9499999999999996e-05, + "loss": 8.1931, + "mean_token_accuracy": 0.05676005966961384, + "num_tokens": 332748.0, + "step": 120 + }, + { + "entropy": 9.847494888305665, + "epoch": 0.00338409475465313, + "grad_norm": 2.125, + "learning_rate": 6.2e-05, + "loss": 7.9947, + "mean_token_accuracy": 0.06220810636878014, + "num_tokens": 347127.0, + "step": 125 + }, + { + "entropy": 9.678038311004638, + "epoch": 0.0035194585448392554, + "grad_norm": 1.6171875, + "learning_rate": 6.450000000000001e-05, + "loss": 7.9391, + "mean_token_accuracy": 0.058373385295271876, + "num_tokens": 359407.0, + "step": 130 + }, + { + "entropy": 9.540247344970703, + "epoch": 0.0036548223350253805, + "grad_norm": 1.4375, + "learning_rate": 6.7e-05, + "loss": 7.7636, + "mean_token_accuracy": 0.061562583222985266, + "num_tokens": 375021.0, + "step": 135 + }, + { + "entropy": 9.30407886505127, + "epoch": 0.0037901861252115057, + "grad_norm": 1.484375, + "learning_rate": 6.950000000000001e-05, + "loss": 7.5962, + "mean_token_accuracy": 0.070381173864007, + "num_tokens": 389496.0, + "step": 140 + }, + { + "entropy": 9.132857418060302, + "epoch": 0.003925549915397631, + "grad_norm": 1.5703125, + "learning_rate": 7.2e-05, + "loss": 7.6112, + "mean_token_accuracy": 0.06686735302209854, + "num_tokens": 402465.0, + "step": 145 + }, + { + "entropy": 8.873841571807862, + "epoch": 0.0040609137055837565, + "grad_norm": 1.515625, + "learning_rate": 7.45e-05, + "loss": 7.502, + "mean_token_accuracy": 0.0693404596298933, + "num_tokens": 415980.0, + "step": 150 + }, + { + "entropy": 8.732354259490966, + "epoch": 0.004196277495769882, + "grad_norm": 1.3515625, + "learning_rate": 7.7e-05, + "loss": 7.4634, + "mean_token_accuracy": 0.07001067139208317, + "num_tokens": 428623.0, + "step": 155 + }, + { + "entropy": 8.544918155670166, + "epoch": 0.004331641285956007, + "grad_norm": 1.5859375, + "learning_rate": 7.950000000000001e-05, + "loss": 7.4298, + "mean_token_accuracy": 0.06541897803544998, + "num_tokens": 441999.0, + "step": 160 + }, + { + "entropy": 8.378799533843994, + "epoch": 0.004467005076142132, + "grad_norm": 1.5, + "learning_rate": 8.2e-05, + "loss": 7.3005, + "mean_token_accuracy": 0.07170183844864368, + "num_tokens": 455098.0, + "step": 165 + }, + { + "entropy": 8.280582523345947, + "epoch": 0.004602368866328257, + "grad_norm": 1.9375, + "learning_rate": 8.450000000000001e-05, + "loss": 7.2898, + "mean_token_accuracy": 0.07008971199393273, + "num_tokens": 468506.0, + "step": 170 + }, + { + "entropy": 8.127180671691894, + "epoch": 0.0047377326565143825, + "grad_norm": 1.421875, + "learning_rate": 8.7e-05, + "loss": 7.3215, + "mean_token_accuracy": 0.06721526682376862, + "num_tokens": 482795.0, + "step": 175 + }, + { + "entropy": 8.071395254135131, + "epoch": 0.004873096446700508, + "grad_norm": 1.7109375, + "learning_rate": 8.95e-05, + "loss": 7.2161, + "mean_token_accuracy": 0.07408471405506134, + "num_tokens": 497102.0, + "step": 180 + }, + { + "entropy": 8.015200138092041, + "epoch": 0.005008460236886633, + "grad_norm": 1.3203125, + "learning_rate": 9.2e-05, + "loss": 7.236, + "mean_token_accuracy": 0.07463390305638314, + "num_tokens": 511777.0, + "step": 185 + }, + { + "entropy": 8.013217878341674, + "epoch": 0.005143824027072758, + "grad_norm": 1.5234375, + "learning_rate": 9.45e-05, + "loss": 7.2509, + "mean_token_accuracy": 0.07550472915172576, + "num_tokens": 525855.0, + "step": 190 + }, + { + "entropy": 7.909638738632202, + "epoch": 0.005279187817258883, + "grad_norm": 1.84375, + "learning_rate": 9.7e-05, + "loss": 7.1878, + "mean_token_accuracy": 0.0701899241656065, + "num_tokens": 541364.0, + "step": 195 + }, + { + "entropy": 7.90043454170227, + "epoch": 0.0054145516074450084, + "grad_norm": 1.546875, + "learning_rate": 9.95e-05, + "loss": 7.1873, + "mean_token_accuracy": 0.0761424608528614, + "num_tokens": 555489.0, + "step": 200 + }, + { + "entropy": 7.926745128631592, + "epoch": 0.005549915397631134, + "grad_norm": 1.71875, + "learning_rate": 0.000102, + "loss": 7.2169, + "mean_token_accuracy": 0.07424422949552537, + "num_tokens": 569207.0, + "step": 205 + }, + { + "entropy": 7.8149010181427006, + "epoch": 0.005685279187817259, + "grad_norm": 1.2890625, + "learning_rate": 0.00010449999999999999, + "loss": 7.1699, + "mean_token_accuracy": 0.07592894844710826, + "num_tokens": 583689.0, + "step": 210 + }, + { + "entropy": 7.787826442718506, + "epoch": 0.005820642978003384, + "grad_norm": 1.5625, + "learning_rate": 0.000107, + "loss": 7.1253, + "mean_token_accuracy": 0.0805364765226841, + "num_tokens": 597729.0, + "step": 215 + }, + { + "entropy": 7.7665050506591795, + "epoch": 0.005956006768189509, + "grad_norm": 1.453125, + "learning_rate": 0.0001095, + "loss": 7.1149, + "mean_token_accuracy": 0.08125128298997879, + "num_tokens": 610354.0, + "step": 220 + }, + { + "entropy": 7.738793563842774, + "epoch": 0.006091370558375634, + "grad_norm": 1.34375, + "learning_rate": 0.000112, + "loss": 6.9965, + "mean_token_accuracy": 0.08436518236994743, + "num_tokens": 625591.0, + "step": 225 + }, + { + "entropy": 7.677218818664551, + "epoch": 0.00622673434856176, + "grad_norm": 1.2578125, + "learning_rate": 0.0001145, + "loss": 7.1185, + "mean_token_accuracy": 0.08086443841457366, + "num_tokens": 640936.0, + "step": 230 + }, + { + "entropy": 7.736022233963013, + "epoch": 0.006362098138747885, + "grad_norm": 1.4765625, + "learning_rate": 0.00011700000000000001, + "loss": 7.0841, + "mean_token_accuracy": 0.0765869714319706, + "num_tokens": 655949.0, + "step": 235 + }, + { + "entropy": 7.609257936477661, + "epoch": 0.00649746192893401, + "grad_norm": 1.390625, + "learning_rate": 0.00011949999999999999, + "loss": 6.948, + "mean_token_accuracy": 0.08549271896481514, + "num_tokens": 669357.0, + "step": 240 + }, + { + "entropy": 7.508241319656372, + "epoch": 0.006632825719120135, + "grad_norm": 1.3359375, + "learning_rate": 0.000122, + "loss": 6.8378, + "mean_token_accuracy": 0.08860795795917512, + "num_tokens": 683906.0, + "step": 245 + }, + { + "entropy": 7.5739704132080075, + "epoch": 0.00676818950930626, + "grad_norm": 1.3828125, + "learning_rate": 0.0001245, + "loss": 6.9511, + "mean_token_accuracy": 0.0863402545452118, + "num_tokens": 700467.0, + "step": 250 + }, + { + "entropy": 7.5351649761199955, + "epoch": 0.0069035532994923855, + "grad_norm": 1.578125, + "learning_rate": 0.000127, + "loss": 6.9582, + "mean_token_accuracy": 0.09148906618356704, + "num_tokens": 711779.0, + "step": 255 + }, + { + "entropy": 7.530111169815063, + "epoch": 0.007038917089678511, + "grad_norm": 1.4453125, + "learning_rate": 0.0001295, + "loss": 6.9595, + "mean_token_accuracy": 0.08548436611890793, + "num_tokens": 725455.0, + "step": 260 + }, + { + "entropy": 7.483809947967529, + "epoch": 0.007174280879864636, + "grad_norm": 1.34375, + "learning_rate": 0.000132, + "loss": 6.8334, + "mean_token_accuracy": 0.08580193966627121, + "num_tokens": 740428.0, + "step": 265 + }, + { + "entropy": 7.460272359848022, + "epoch": 0.007309644670050761, + "grad_norm": 1.34375, + "learning_rate": 0.00013450000000000002, + "loss": 6.8215, + "mean_token_accuracy": 0.09169955775141717, + "num_tokens": 755327.0, + "step": 270 + }, + { + "entropy": 7.53057975769043, + "epoch": 0.007445008460236886, + "grad_norm": 1.3125, + "learning_rate": 0.00013700000000000002, + "loss": 6.9262, + "mean_token_accuracy": 0.09086679890751839, + "num_tokens": 768335.0, + "step": 275 + }, + { + "entropy": 7.381830310821533, + "epoch": 0.0075803722504230115, + "grad_norm": 1.2734375, + "learning_rate": 0.0001395, + "loss": 6.9661, + "mean_token_accuracy": 0.08472498953342437, + "num_tokens": 781500.0, + "step": 280 + }, + { + "entropy": 7.446859312057495, + "epoch": 0.007715736040609137, + "grad_norm": 1.1484375, + "learning_rate": 0.00014199999999999998, + "loss": 6.8651, + "mean_token_accuracy": 0.09278287589550019, + "num_tokens": 794859.0, + "step": 285 + }, + { + "entropy": 7.3814451694488525, + "epoch": 0.007851099830795263, + "grad_norm": 1.390625, + "learning_rate": 0.0001445, + "loss": 6.8369, + "mean_token_accuracy": 0.09373516142368317, + "num_tokens": 808653.0, + "step": 290 + }, + { + "entropy": 7.418990850448608, + "epoch": 0.007986463620981387, + "grad_norm": 1.3828125, + "learning_rate": 0.000147, + "loss": 6.8866, + "mean_token_accuracy": 0.08324785232543945, + "num_tokens": 824876.0, + "step": 295 + }, + { + "entropy": 7.358400630950928, + "epoch": 0.008121827411167513, + "grad_norm": 1.25, + "learning_rate": 0.0001495, + "loss": 6.8195, + "mean_token_accuracy": 0.09909781068563461, + "num_tokens": 838065.0, + "step": 300 + }, + { + "entropy": 7.24797306060791, + "epoch": 0.008257191201353637, + "grad_norm": 1.375, + "learning_rate": 0.000152, + "loss": 6.7376, + "mean_token_accuracy": 0.09417691752314568, + "num_tokens": 850591.0, + "step": 305 + }, + { + "entropy": 7.293615865707397, + "epoch": 0.008392554991539763, + "grad_norm": 1.171875, + "learning_rate": 0.00015450000000000001, + "loss": 6.8553, + "mean_token_accuracy": 0.09107527285814285, + "num_tokens": 865254.0, + "step": 310 + }, + { + "entropy": 7.388335704803467, + "epoch": 0.008527918781725888, + "grad_norm": 1.3125, + "learning_rate": 0.000157, + "loss": 6.8402, + "mean_token_accuracy": 0.08597931787371635, + "num_tokens": 879791.0, + "step": 315 + }, + { + "entropy": 7.291468143463135, + "epoch": 0.008663282571912014, + "grad_norm": 1.2421875, + "learning_rate": 0.0001595, + "loss": 6.8454, + "mean_token_accuracy": 0.09367485567927361, + "num_tokens": 891708.0, + "step": 320 + }, + { + "entropy": 7.272171115875244, + "epoch": 0.008798646362098138, + "grad_norm": 1.1953125, + "learning_rate": 0.000162, + "loss": 6.7682, + "mean_token_accuracy": 0.09533382132649422, + "num_tokens": 905454.0, + "step": 325 + }, + { + "entropy": 7.248970413208008, + "epoch": 0.008934010152284264, + "grad_norm": 1.359375, + "learning_rate": 0.00016450000000000001, + "loss": 6.7542, + "mean_token_accuracy": 0.09669646397233009, + "num_tokens": 919080.0, + "step": 330 + }, + { + "entropy": 7.180841302871704, + "epoch": 0.009069373942470389, + "grad_norm": 1.1640625, + "learning_rate": 0.00016700000000000002, + "loss": 6.6389, + "mean_token_accuracy": 0.09361326694488525, + "num_tokens": 932145.0, + "step": 335 + }, + { + "entropy": 7.175373554229736, + "epoch": 0.009204737732656515, + "grad_norm": 1.3359375, + "learning_rate": 0.00016950000000000003, + "loss": 6.7554, + "mean_token_accuracy": 0.09223678484559059, + "num_tokens": 946502.0, + "step": 340 + }, + { + "entropy": 7.258382320404053, + "epoch": 0.009340101522842639, + "grad_norm": 1.21875, + "learning_rate": 0.00017199999999999998, + "loss": 6.7061, + "mean_token_accuracy": 0.09237500727176666, + "num_tokens": 959414.0, + "step": 345 + }, + { + "entropy": 7.242776870727539, + "epoch": 0.009475465313028765, + "grad_norm": 1.9140625, + "learning_rate": 0.00017449999999999999, + "loss": 6.7714, + "mean_token_accuracy": 0.09881808012723922, + "num_tokens": 972868.0, + "step": 350 + }, + { + "entropy": 7.061698722839355, + "epoch": 0.00961082910321489, + "grad_norm": 1.2109375, + "learning_rate": 0.000177, + "loss": 6.6902, + "mean_token_accuracy": 0.09196390882134438, + "num_tokens": 987469.0, + "step": 355 + }, + { + "entropy": 7.158710718154907, + "epoch": 0.009746192893401015, + "grad_norm": 1.2578125, + "learning_rate": 0.0001795, + "loss": 6.693, + "mean_token_accuracy": 0.09573714062571526, + "num_tokens": 1001797.0, + "step": 360 + }, + { + "entropy": 7.105884790420532, + "epoch": 0.00988155668358714, + "grad_norm": 1.4375, + "learning_rate": 0.000182, + "loss": 6.6582, + "mean_token_accuracy": 0.09512505084276199, + "num_tokens": 1016034.0, + "step": 365 + }, + { + "entropy": 7.184845685958862, + "epoch": 0.010016920473773266, + "grad_norm": 2.125, + "learning_rate": 0.0001845, + "loss": 6.7164, + "mean_token_accuracy": 0.09947735443711281, + "num_tokens": 1030566.0, + "step": 370 + }, + { + "entropy": 7.0832836627960205, + "epoch": 0.01015228426395939, + "grad_norm": 1.3125, + "learning_rate": 0.000187, + "loss": 6.763, + "mean_token_accuracy": 0.09124055355787278, + "num_tokens": 1044735.0, + "step": 375 + }, + { + "entropy": 7.09069504737854, + "epoch": 0.010287648054145516, + "grad_norm": 1.359375, + "learning_rate": 0.0001895, + "loss": 6.7385, + "mean_token_accuracy": 0.0939220942556858, + "num_tokens": 1059567.0, + "step": 380 + }, + { + "entropy": 7.149837684631348, + "epoch": 0.01042301184433164, + "grad_norm": 1.4140625, + "learning_rate": 0.000192, + "loss": 6.6309, + "mean_token_accuracy": 0.1013464093208313, + "num_tokens": 1074612.0, + "step": 385 + }, + { + "entropy": 7.109938526153565, + "epoch": 0.010558375634517767, + "grad_norm": 1.3984375, + "learning_rate": 0.0001945, + "loss": 6.6941, + "mean_token_accuracy": 0.09540026187896729, + "num_tokens": 1087092.0, + "step": 390 + }, + { + "entropy": 6.9963634490966795, + "epoch": 0.010693739424703893, + "grad_norm": 1.484375, + "learning_rate": 0.00019700000000000002, + "loss": 6.6652, + "mean_token_accuracy": 0.09614972546696662, + "num_tokens": 1101966.0, + "step": 395 + }, + { + "entropy": 7.059049797058106, + "epoch": 0.010829103214890017, + "grad_norm": 1.1171875, + "learning_rate": 0.00019950000000000002, + "loss": 6.6127, + "mean_token_accuracy": 0.10141809433698654, + "num_tokens": 1116287.0, + "step": 400 + }, + { + "entropy": 7.021635675430298, + "epoch": 0.010964467005076143, + "grad_norm": 1.2109375, + "learning_rate": 0.000202, + "loss": 6.5773, + "mean_token_accuracy": 0.10086113512516022, + "num_tokens": 1132775.0, + "step": 405 + }, + { + "entropy": 6.978186845779419, + "epoch": 0.011099830795262267, + "grad_norm": 1.0859375, + "learning_rate": 0.00020449999999999998, + "loss": 6.6211, + "mean_token_accuracy": 0.09556624442338943, + "num_tokens": 1149372.0, + "step": 410 + }, + { + "entropy": 7.039114618301392, + "epoch": 0.011235194585448393, + "grad_norm": 1.4140625, + "learning_rate": 0.000207, + "loss": 6.7039, + "mean_token_accuracy": 0.09624231159687043, + "num_tokens": 1163772.0, + "step": 415 + }, + { + "entropy": 6.965072917938232, + "epoch": 0.011370558375634518, + "grad_norm": 1.2578125, + "learning_rate": 0.0002095, + "loss": 6.5853, + "mean_token_accuracy": 0.09794198945164681, + "num_tokens": 1176056.0, + "step": 420 + }, + { + "entropy": 7.030379724502564, + "epoch": 0.011505922165820644, + "grad_norm": 1.2578125, + "learning_rate": 0.000212, + "loss": 6.5365, + "mean_token_accuracy": 0.10276012122631073, + "num_tokens": 1189759.0, + "step": 425 + }, + { + "entropy": 7.0084771633148195, + "epoch": 0.011641285956006768, + "grad_norm": 1.234375, + "learning_rate": 0.0002145, + "loss": 6.591, + "mean_token_accuracy": 0.10040640980005264, + "num_tokens": 1203142.0, + "step": 430 + }, + { + "entropy": 6.9573570728302006, + "epoch": 0.011776649746192894, + "grad_norm": 1.2578125, + "learning_rate": 0.00021700000000000002, + "loss": 6.5819, + "mean_token_accuracy": 0.10083244740962982, + "num_tokens": 1217924.0, + "step": 435 + }, + { + "entropy": 7.0246354103088375, + "epoch": 0.011912013536379018, + "grad_norm": 1.3984375, + "learning_rate": 0.0002195, + "loss": 6.6666, + "mean_token_accuracy": 0.10064776018261909, + "num_tokens": 1231713.0, + "step": 440 + }, + { + "entropy": 6.966695070266724, + "epoch": 0.012047377326565144, + "grad_norm": 1.6015625, + "learning_rate": 0.000222, + "loss": 6.56, + "mean_token_accuracy": 0.0989975780248642, + "num_tokens": 1245538.0, + "step": 445 + }, + { + "entropy": 6.837519836425781, + "epoch": 0.012182741116751269, + "grad_norm": 1.1015625, + "learning_rate": 0.0002245, + "loss": 6.574, + "mean_token_accuracy": 0.10176394879817963, + "num_tokens": 1262574.0, + "step": 450 + }, + { + "entropy": 6.953103399276733, + "epoch": 0.012318104906937395, + "grad_norm": 1.3046875, + "learning_rate": 0.00022700000000000002, + "loss": 6.4812, + "mean_token_accuracy": 0.10641162097454071, + "num_tokens": 1276727.0, + "step": 455 + }, + { + "entropy": 6.89174976348877, + "epoch": 0.01245346869712352, + "grad_norm": 1.3359375, + "learning_rate": 0.00022950000000000002, + "loss": 6.4861, + "mean_token_accuracy": 0.10931641608476639, + "num_tokens": 1291029.0, + "step": 460 + }, + { + "entropy": 6.775276374816895, + "epoch": 0.012588832487309645, + "grad_norm": 1.4296875, + "learning_rate": 0.00023200000000000003, + "loss": 6.4553, + "mean_token_accuracy": 0.1023554228246212, + "num_tokens": 1305720.0, + "step": 465 + }, + { + "entropy": 6.879015350341797, + "epoch": 0.01272419627749577, + "grad_norm": 1.3984375, + "learning_rate": 0.00023449999999999998, + "loss": 6.4732, + "mean_token_accuracy": 0.10401393547654152, + "num_tokens": 1321681.0, + "step": 470 + }, + { + "entropy": 6.755443096160889, + "epoch": 0.012859560067681896, + "grad_norm": 1.328125, + "learning_rate": 0.000237, + "loss": 6.4114, + "mean_token_accuracy": 0.11262697726488113, + "num_tokens": 1334960.0, + "step": 475 + }, + { + "entropy": 6.846341848373413, + "epoch": 0.01299492385786802, + "grad_norm": 1.1953125, + "learning_rate": 0.0002395, + "loss": 6.58, + "mean_token_accuracy": 0.10540890470147132, + "num_tokens": 1349479.0, + "step": 480 + }, + { + "entropy": 6.880573081970215, + "epoch": 0.013130287648054146, + "grad_norm": 1.328125, + "learning_rate": 0.000242, + "loss": 6.4669, + "mean_token_accuracy": 0.10141590088605881, + "num_tokens": 1363240.0, + "step": 485 + }, + { + "entropy": 6.843642616271973, + "epoch": 0.01326565143824027, + "grad_norm": 1.1875, + "learning_rate": 0.0002445, + "loss": 6.5119, + "mean_token_accuracy": 0.09850463718175888, + "num_tokens": 1375568.0, + "step": 490 + }, + { + "entropy": 6.877911949157715, + "epoch": 0.013401015228426396, + "grad_norm": 1.0859375, + "learning_rate": 0.000247, + "loss": 6.5538, + "mean_token_accuracy": 0.10284689888358116, + "num_tokens": 1389099.0, + "step": 495 + }, + { + "entropy": 6.875770854949951, + "epoch": 0.01353637901861252, + "grad_norm": 1.3046875, + "learning_rate": 0.0002495, + "loss": 6.5636, + "mean_token_accuracy": 0.09843793138861656, + "num_tokens": 1402107.0, + "step": 500 + }, + { + "entropy": 6.843701934814453, + "epoch": 0.013671742808798647, + "grad_norm": 1.3203125, + "learning_rate": 0.000252, + "loss": 6.537, + "mean_token_accuracy": 0.10457578748464584, + "num_tokens": 1417644.0, + "step": 505 + }, + { + "entropy": 6.870151567459106, + "epoch": 0.013807106598984771, + "grad_norm": 1.1484375, + "learning_rate": 0.0002545, + "loss": 6.5303, + "mean_token_accuracy": 0.09835479706525803, + "num_tokens": 1433103.0, + "step": 510 + }, + { + "entropy": 6.636357831954956, + "epoch": 0.013942470389170897, + "grad_norm": 1.3671875, + "learning_rate": 0.000257, + "loss": 6.3019, + "mean_token_accuracy": 0.10845862105488777, + "num_tokens": 1445449.0, + "step": 515 + }, + { + "entropy": 6.858165597915649, + "epoch": 0.014077834179357021, + "grad_norm": 1.546875, + "learning_rate": 0.0002595, + "loss": 6.4757, + "mean_token_accuracy": 0.11344253048300743, + "num_tokens": 1458077.0, + "step": 520 + }, + { + "entropy": 6.699763393402099, + "epoch": 0.014213197969543147, + "grad_norm": 1.296875, + "learning_rate": 0.000262, + "loss": 6.4336, + "mean_token_accuracy": 0.10050448402762413, + "num_tokens": 1471773.0, + "step": 525 + }, + { + "entropy": 6.785126543045044, + "epoch": 0.014348561759729272, + "grad_norm": 1.375, + "learning_rate": 0.00026450000000000003, + "loss": 6.4653, + "mean_token_accuracy": 0.1011991024017334, + "num_tokens": 1486826.0, + "step": 530 + }, + { + "entropy": 6.653678703308105, + "epoch": 0.014483925549915398, + "grad_norm": 1.140625, + "learning_rate": 0.00026700000000000004, + "loss": 6.392, + "mean_token_accuracy": 0.1090740442276001, + "num_tokens": 1501027.0, + "step": 535 + }, + { + "entropy": 6.773468685150147, + "epoch": 0.014619289340101522, + "grad_norm": 1.3984375, + "learning_rate": 0.00026950000000000005, + "loss": 6.3659, + "mean_token_accuracy": 0.10750545933842659, + "num_tokens": 1512547.0, + "step": 540 + }, + { + "entropy": 6.705225276947021, + "epoch": 0.014754653130287648, + "grad_norm": 1.2265625, + "learning_rate": 0.00027200000000000005, + "loss": 6.3975, + "mean_token_accuracy": 0.11041399985551834, + "num_tokens": 1525485.0, + "step": 545 + }, + { + "entropy": 6.779332685470581, + "epoch": 0.014890016920473773, + "grad_norm": 1.375, + "learning_rate": 0.0002745, + "loss": 6.3915, + "mean_token_accuracy": 0.11499902307987213, + "num_tokens": 1538824.0, + "step": 550 + }, + { + "entropy": 6.653468084335327, + "epoch": 0.015025380710659899, + "grad_norm": 1.21875, + "learning_rate": 0.000277, + "loss": 6.4215, + "mean_token_accuracy": 0.10652948096394539, + "num_tokens": 1553913.0, + "step": 555 + }, + { + "entropy": 6.714767408370972, + "epoch": 0.015160744500846023, + "grad_norm": 1.1953125, + "learning_rate": 0.0002795, + "loss": 6.4351, + "mean_token_accuracy": 0.10829391852021217, + "num_tokens": 1567865.0, + "step": 560 + }, + { + "entropy": 6.673421001434326, + "epoch": 0.015296108291032149, + "grad_norm": 1.5, + "learning_rate": 0.00028199999999999997, + "loss": 6.393, + "mean_token_accuracy": 0.10847804918885232, + "num_tokens": 1581334.0, + "step": 565 + }, + { + "entropy": 6.721217823028565, + "epoch": 0.015431472081218273, + "grad_norm": 1.2109375, + "learning_rate": 0.0002845, + "loss": 6.3429, + "mean_token_accuracy": 0.1096364676952362, + "num_tokens": 1595181.0, + "step": 570 + }, + { + "entropy": 6.660063457489014, + "epoch": 0.0155668358714044, + "grad_norm": 1.3984375, + "learning_rate": 0.000287, + "loss": 6.3849, + "mean_token_accuracy": 0.11193926930427552, + "num_tokens": 1609117.0, + "step": 575 + }, + { + "entropy": 6.630877065658569, + "epoch": 0.015702199661590525, + "grad_norm": 1.03125, + "learning_rate": 0.0002895, + "loss": 6.3853, + "mean_token_accuracy": 0.10854767486453057, + "num_tokens": 1623200.0, + "step": 580 + }, + { + "entropy": 6.59787392616272, + "epoch": 0.01583756345177665, + "grad_norm": 1.171875, + "learning_rate": 0.000292, + "loss": 6.2754, + "mean_token_accuracy": 0.11524961069226265, + "num_tokens": 1637372.0, + "step": 585 + }, + { + "entropy": 6.6487486362457275, + "epoch": 0.015972927241962774, + "grad_norm": 1.1484375, + "learning_rate": 0.0002945, + "loss": 6.292, + "mean_token_accuracy": 0.10983927696943283, + "num_tokens": 1651853.0, + "step": 590 + }, + { + "entropy": 6.589022636413574, + "epoch": 0.016108291032148902, + "grad_norm": 1.203125, + "learning_rate": 0.000297, + "loss": 6.3127, + "mean_token_accuracy": 0.11347366273403167, + "num_tokens": 1664889.0, + "step": 595 + }, + { + "entropy": 6.664232492446899, + "epoch": 0.016243654822335026, + "grad_norm": 1.21875, + "learning_rate": 0.0002995, + "loss": 6.3829, + "mean_token_accuracy": 0.10112749561667442, + "num_tokens": 1679357.0, + "step": 600 + }, + { + "entropy": 6.555701160430909, + "epoch": 0.01637901861252115, + "grad_norm": 1.171875, + "learning_rate": 0.000302, + "loss": 6.2406, + "mean_token_accuracy": 0.11562057062983513, + "num_tokens": 1693179.0, + "step": 605 + }, + { + "entropy": 6.557049798965454, + "epoch": 0.016514382402707275, + "grad_norm": 1.2265625, + "learning_rate": 0.0003045, + "loss": 6.2925, + "mean_token_accuracy": 0.1144544430077076, + "num_tokens": 1706554.0, + "step": 610 + }, + { + "entropy": 6.619402074813843, + "epoch": 0.016649746192893403, + "grad_norm": 1.34375, + "learning_rate": 0.000307, + "loss": 6.39, + "mean_token_accuracy": 0.1108802892267704, + "num_tokens": 1720010.0, + "step": 615 + }, + { + "entropy": 6.585338306427002, + "epoch": 0.016785109983079527, + "grad_norm": 1.1953125, + "learning_rate": 0.0003095, + "loss": 6.3556, + "mean_token_accuracy": 0.10875253900885581, + "num_tokens": 1733041.0, + "step": 620 + }, + { + "entropy": 6.681243371963501, + "epoch": 0.01692047377326565, + "grad_norm": 1.2734375, + "learning_rate": 0.000312, + "loss": 6.3521, + "mean_token_accuracy": 0.10595379248261452, + "num_tokens": 1747324.0, + "step": 625 + }, + { + "entropy": 6.517426633834839, + "epoch": 0.017055837563451776, + "grad_norm": 1.21875, + "learning_rate": 0.0003145, + "loss": 6.2758, + "mean_token_accuracy": 0.11371921375393867, + "num_tokens": 1760321.0, + "step": 630 + }, + { + "entropy": 6.659466218948364, + "epoch": 0.017191201353637903, + "grad_norm": 1.25, + "learning_rate": 0.000317, + "loss": 6.4047, + "mean_token_accuracy": 0.10822949036955834, + "num_tokens": 1775552.0, + "step": 635 + }, + { + "entropy": 6.524487066268921, + "epoch": 0.017326565143824028, + "grad_norm": 1.2578125, + "learning_rate": 0.0003195, + "loss": 6.3124, + "mean_token_accuracy": 0.11699947118759155, + "num_tokens": 1788698.0, + "step": 640 + }, + { + "entropy": 6.539701795578003, + "epoch": 0.017461928934010152, + "grad_norm": 1.15625, + "learning_rate": 0.000322, + "loss": 6.3669, + "mean_token_accuracy": 0.1119937926530838, + "num_tokens": 1803775.0, + "step": 645 + }, + { + "entropy": 6.564684867858887, + "epoch": 0.017597292724196276, + "grad_norm": 1.0078125, + "learning_rate": 0.00032450000000000003, + "loss": 6.3122, + "mean_token_accuracy": 0.1049906738102436, + "num_tokens": 1817010.0, + "step": 650 + }, + { + "entropy": 6.499929475784302, + "epoch": 0.017732656514382404, + "grad_norm": 1.3203125, + "learning_rate": 0.00032700000000000003, + "loss": 6.2747, + "mean_token_accuracy": 0.10665653720498085, + "num_tokens": 1831788.0, + "step": 655 + }, + { + "entropy": 6.599995756149292, + "epoch": 0.01786802030456853, + "grad_norm": 1.390625, + "learning_rate": 0.00032950000000000004, + "loss": 6.2993, + "mean_token_accuracy": 0.10768605694174767, + "num_tokens": 1846624.0, + "step": 660 + }, + { + "entropy": 6.432188606262207, + "epoch": 0.018003384094754653, + "grad_norm": 1.0078125, + "learning_rate": 0.00033200000000000005, + "loss": 6.2798, + "mean_token_accuracy": 0.1103129394352436, + "num_tokens": 1863033.0, + "step": 665 + }, + { + "entropy": 6.561399269104004, + "epoch": 0.018138747884940777, + "grad_norm": 1.0703125, + "learning_rate": 0.00033450000000000005, + "loss": 6.3231, + "mean_token_accuracy": 0.109639373421669, + "num_tokens": 1877067.0, + "step": 670 + }, + { + "entropy": 6.520267629623413, + "epoch": 0.018274111675126905, + "grad_norm": 1.1328125, + "learning_rate": 0.000337, + "loss": 6.1885, + "mean_token_accuracy": 0.1139417678117752, + "num_tokens": 1890950.0, + "step": 675 + }, + { + "entropy": 6.526244306564331, + "epoch": 0.01840947546531303, + "grad_norm": 1.140625, + "learning_rate": 0.0003395, + "loss": 6.3383, + "mean_token_accuracy": 0.111404038220644, + "num_tokens": 1904091.0, + "step": 680 + }, + { + "entropy": 6.561566352844238, + "epoch": 0.018544839255499154, + "grad_norm": 1.28125, + "learning_rate": 0.000342, + "loss": 6.2958, + "mean_token_accuracy": 0.10963592603802681, + "num_tokens": 1917469.0, + "step": 685 + }, + { + "entropy": 6.326075553894043, + "epoch": 0.018680203045685278, + "grad_norm": 1.0859375, + "learning_rate": 0.00034449999999999997, + "loss": 6.1969, + "mean_token_accuracy": 0.11997934058308601, + "num_tokens": 1932512.0, + "step": 690 + }, + { + "entropy": 6.496285247802734, + "epoch": 0.018815566835871406, + "grad_norm": 1.2265625, + "learning_rate": 0.000347, + "loss": 6.2037, + "mean_token_accuracy": 0.11709487736225128, + "num_tokens": 1946953.0, + "step": 695 + }, + { + "entropy": 6.45741024017334, + "epoch": 0.01895093062605753, + "grad_norm": 1.1875, + "learning_rate": 0.0003495, + "loss": 6.2194, + "mean_token_accuracy": 0.11923639252781867, + "num_tokens": 1959479.0, + "step": 700 + }, + { + "entropy": 6.558106708526611, + "epoch": 0.019086294416243654, + "grad_norm": 1.1796875, + "learning_rate": 0.000352, + "loss": 6.2801, + "mean_token_accuracy": 0.10900771766901016, + "num_tokens": 1973683.0, + "step": 705 + }, + { + "entropy": 6.336573648452759, + "epoch": 0.01922165820642978, + "grad_norm": 1.21875, + "learning_rate": 0.0003545, + "loss": 6.2242, + "mean_token_accuracy": 0.11210474893450736, + "num_tokens": 1988255.0, + "step": 710 + }, + { + "entropy": 6.4287889957427975, + "epoch": 0.019357021996615906, + "grad_norm": 1.15625, + "learning_rate": 0.000357, + "loss": 6.2052, + "mean_token_accuracy": 0.11728888675570488, + "num_tokens": 2003306.0, + "step": 715 + }, + { + "entropy": 6.432671117782593, + "epoch": 0.01949238578680203, + "grad_norm": 1.1171875, + "learning_rate": 0.0003595, + "loss": 6.2291, + "mean_token_accuracy": 0.11440798714756965, + "num_tokens": 2015810.0, + "step": 720 + }, + { + "entropy": 6.465086364746094, + "epoch": 0.019627749576988155, + "grad_norm": 1.140625, + "learning_rate": 0.000362, + "loss": 6.2413, + "mean_token_accuracy": 0.11951256170868874, + "num_tokens": 2029477.0, + "step": 725 + }, + { + "entropy": 6.478774738311768, + "epoch": 0.01976311336717428, + "grad_norm": 1.0859375, + "learning_rate": 0.0003645, + "loss": 6.2714, + "mean_token_accuracy": 0.1068502850830555, + "num_tokens": 2044779.0, + "step": 730 + }, + { + "entropy": 6.394287252426148, + "epoch": 0.019898477157360407, + "grad_norm": 1.0234375, + "learning_rate": 0.000367, + "loss": 6.2824, + "mean_token_accuracy": 0.11770006865262986, + "num_tokens": 2059640.0, + "step": 735 + }, + { + "entropy": 6.4458049774169925, + "epoch": 0.02003384094754653, + "grad_norm": 1.1015625, + "learning_rate": 0.0003695, + "loss": 6.2743, + "mean_token_accuracy": 0.11187923103570938, + "num_tokens": 2073378.0, + "step": 740 + }, + { + "entropy": 6.440818643569946, + "epoch": 0.020169204737732656, + "grad_norm": 1.1796875, + "learning_rate": 0.000372, + "loss": 6.1675, + "mean_token_accuracy": 0.11438429951667786, + "num_tokens": 2087484.0, + "step": 745 + }, + { + "entropy": 6.520938920974731, + "epoch": 0.02030456852791878, + "grad_norm": 1.109375, + "learning_rate": 0.0003745, + "loss": 6.3903, + "mean_token_accuracy": 0.10714041441679001, + "num_tokens": 2103186.0, + "step": 750 + }, + { + "entropy": 6.335501766204834, + "epoch": 0.020439932318104908, + "grad_norm": 1.3203125, + "learning_rate": 0.000377, + "loss": 6.1203, + "mean_token_accuracy": 0.1230811521410942, + "num_tokens": 2117578.0, + "step": 755 + }, + { + "entropy": 6.347048139572143, + "epoch": 0.020575296108291032, + "grad_norm": 1.046875, + "learning_rate": 0.0003795, + "loss": 6.2012, + "mean_token_accuracy": 0.11709161922335624, + "num_tokens": 2133742.0, + "step": 760 + }, + { + "entropy": 6.374935579299927, + "epoch": 0.020710659898477157, + "grad_norm": 1.1953125, + "learning_rate": 0.000382, + "loss": 6.2038, + "mean_token_accuracy": 0.11305479407310486, + "num_tokens": 2147709.0, + "step": 765 + }, + { + "entropy": 6.456587076187134, + "epoch": 0.02084602368866328, + "grad_norm": 1.0703125, + "learning_rate": 0.0003845, + "loss": 6.1872, + "mean_token_accuracy": 0.11732911616563797, + "num_tokens": 2161898.0, + "step": 770 + }, + { + "entropy": 6.387871885299683, + "epoch": 0.02098138747884941, + "grad_norm": 1.1328125, + "learning_rate": 0.00038700000000000003, + "loss": 6.2099, + "mean_token_accuracy": 0.11243800446391106, + "num_tokens": 2177720.0, + "step": 775 + }, + { + "entropy": 6.285234069824218, + "epoch": 0.021116751269035533, + "grad_norm": 1.046875, + "learning_rate": 0.00038950000000000003, + "loss": 6.0929, + "mean_token_accuracy": 0.12101836651563644, + "num_tokens": 2191675.0, + "step": 780 + }, + { + "entropy": 6.226907634735108, + "epoch": 0.021252115059221657, + "grad_norm": 1.171875, + "learning_rate": 0.00039200000000000004, + "loss": 6.0661, + "mean_token_accuracy": 0.12149770706892013, + "num_tokens": 2205366.0, + "step": 785 + }, + { + "entropy": 6.322827768325806, + "epoch": 0.021387478849407785, + "grad_norm": 1.0859375, + "learning_rate": 0.00039450000000000005, + "loss": 6.165, + "mean_token_accuracy": 0.11490083187818527, + "num_tokens": 2219062.0, + "step": 790 + }, + { + "entropy": 6.354215955734253, + "epoch": 0.02152284263959391, + "grad_norm": 1.078125, + "learning_rate": 0.00039700000000000005, + "loss": 6.1218, + "mean_token_accuracy": 0.12039542272686958, + "num_tokens": 2232700.0, + "step": 795 + }, + { + "entropy": 6.188680410385132, + "epoch": 0.021658206429780034, + "grad_norm": 1.046875, + "learning_rate": 0.0003995, + "loss": 6.0871, + "mean_token_accuracy": 0.12226910442113877, + "num_tokens": 2246944.0, + "step": 800 + }, + { + "entropy": 6.37126350402832, + "epoch": 0.021793570219966158, + "grad_norm": 1.0390625, + "learning_rate": 0.000402, + "loss": 6.1353, + "mean_token_accuracy": 0.12089133262634277, + "num_tokens": 2260988.0, + "step": 805 + }, + { + "entropy": 6.415036964416504, + "epoch": 0.021928934010152286, + "grad_norm": 1.2421875, + "learning_rate": 0.0004045, + "loss": 6.208, + "mean_token_accuracy": 0.1159418523311615, + "num_tokens": 2275403.0, + "step": 810 + }, + { + "entropy": 6.222449016571045, + "epoch": 0.02206429780033841, + "grad_norm": 1.2421875, + "learning_rate": 0.00040699999999999997, + "loss": 6.1736, + "mean_token_accuracy": 0.11669653207063675, + "num_tokens": 2290861.0, + "step": 815 + }, + { + "entropy": 6.282603788375854, + "epoch": 0.022199661590524535, + "grad_norm": 1.1796875, + "learning_rate": 0.0004095, + "loss": 6.1153, + "mean_token_accuracy": 0.12357514351606369, + "num_tokens": 2304171.0, + "step": 820 + }, + { + "entropy": 6.458443546295166, + "epoch": 0.02233502538071066, + "grad_norm": 1.140625, + "learning_rate": 0.000412, + "loss": 6.2533, + "mean_token_accuracy": 0.11721441000699998, + "num_tokens": 2318805.0, + "step": 825 + }, + { + "entropy": 6.250155591964722, + "epoch": 0.022470389170896787, + "grad_norm": 1.09375, + "learning_rate": 0.0004145, + "loss": 6.1643, + "mean_token_accuracy": 0.12117116153240204, + "num_tokens": 2332894.0, + "step": 830 + }, + { + "entropy": 6.294081735610962, + "epoch": 0.02260575296108291, + "grad_norm": 1.1015625, + "learning_rate": 0.000417, + "loss": 6.1301, + "mean_token_accuracy": 0.11678448617458344, + "num_tokens": 2346718.0, + "step": 835 + }, + { + "entropy": 6.230988359451294, + "epoch": 0.022741116751269035, + "grad_norm": 0.9921875, + "learning_rate": 0.0004195, + "loss": 6.1202, + "mean_token_accuracy": 0.11509295254945755, + "num_tokens": 2359480.0, + "step": 840 + }, + { + "entropy": 6.359671497344971, + "epoch": 0.02287648054145516, + "grad_norm": 1.0625, + "learning_rate": 0.000422, + "loss": 6.2173, + "mean_token_accuracy": 0.11525185033679008, + "num_tokens": 2373095.0, + "step": 845 + }, + { + "entropy": 6.199200820922852, + "epoch": 0.023011844331641287, + "grad_norm": 0.99609375, + "learning_rate": 0.0004245, + "loss": 6.0346, + "mean_token_accuracy": 0.12598701417446137, + "num_tokens": 2386224.0, + "step": 850 + }, + { + "entropy": 6.216959381103516, + "epoch": 0.02314720812182741, + "grad_norm": 0.97265625, + "learning_rate": 0.000427, + "loss": 6.1023, + "mean_token_accuracy": 0.12083085179328919, + "num_tokens": 2402813.0, + "step": 855 + }, + { + "entropy": 6.328297233581543, + "epoch": 0.023282571912013536, + "grad_norm": 1.09375, + "learning_rate": 0.0004295, + "loss": 6.097, + "mean_token_accuracy": 0.12417078986763955, + "num_tokens": 2415423.0, + "step": 860 + }, + { + "entropy": 6.259360122680664, + "epoch": 0.02341793570219966, + "grad_norm": 1.2109375, + "learning_rate": 0.000432, + "loss": 6.1033, + "mean_token_accuracy": 0.11193115115165711, + "num_tokens": 2427845.0, + "step": 865 + }, + { + "entropy": 6.251777505874633, + "epoch": 0.023553299492385788, + "grad_norm": 1.0546875, + "learning_rate": 0.0004345, + "loss": 6.0958, + "mean_token_accuracy": 0.11671509072184563, + "num_tokens": 2442498.0, + "step": 870 + }, + { + "entropy": 6.154549264907837, + "epoch": 0.023688663282571912, + "grad_norm": 1.1796875, + "learning_rate": 0.000437, + "loss": 6.094, + "mean_token_accuracy": 0.11765043288469315, + "num_tokens": 2455483.0, + "step": 875 + }, + { + "entropy": 6.1775672912597654, + "epoch": 0.023824027072758037, + "grad_norm": 1.1328125, + "learning_rate": 0.0004395, + "loss": 6.0294, + "mean_token_accuracy": 0.125057340413332, + "num_tokens": 2469133.0, + "step": 880 + }, + { + "entropy": 6.341091442108154, + "epoch": 0.02395939086294416, + "grad_norm": 1.0625, + "learning_rate": 0.000442, + "loss": 6.12, + "mean_token_accuracy": 0.11728312373161316, + "num_tokens": 2484060.0, + "step": 885 + }, + { + "entropy": 6.137259387969971, + "epoch": 0.02409475465313029, + "grad_norm": 1.09375, + "learning_rate": 0.0004445, + "loss": 5.9998, + "mean_token_accuracy": 0.1305142655968666, + "num_tokens": 2497132.0, + "step": 890 + }, + { + "entropy": 6.238704776763916, + "epoch": 0.024230118443316413, + "grad_norm": 1.2109375, + "learning_rate": 0.000447, + "loss": 6.1717, + "mean_token_accuracy": 0.11579567641019821, + "num_tokens": 2511285.0, + "step": 895 + }, + { + "entropy": 6.297119235992431, + "epoch": 0.024365482233502538, + "grad_norm": 1.1640625, + "learning_rate": 0.00044950000000000003, + "loss": 6.1921, + "mean_token_accuracy": 0.12004831880331039, + "num_tokens": 2524660.0, + "step": 900 + }, + { + "entropy": 6.38506498336792, + "epoch": 0.024500846023688662, + "grad_norm": 1.2890625, + "learning_rate": 0.00045200000000000004, + "loss": 6.153, + "mean_token_accuracy": 0.12265655994415284, + "num_tokens": 2536944.0, + "step": 905 + }, + { + "entropy": 6.106860065460205, + "epoch": 0.02463620981387479, + "grad_norm": 0.99609375, + "learning_rate": 0.00045450000000000004, + "loss": 6.113, + "mean_token_accuracy": 0.1159572497010231, + "num_tokens": 2552167.0, + "step": 910 + }, + { + "entropy": 6.307010126113892, + "epoch": 0.024771573604060914, + "grad_norm": 1.109375, + "learning_rate": 0.00045700000000000005, + "loss": 6.1229, + "mean_token_accuracy": 0.1155533254146576, + "num_tokens": 2565263.0, + "step": 915 + }, + { + "entropy": 6.212118196487427, + "epoch": 0.02490693739424704, + "grad_norm": 0.99609375, + "learning_rate": 0.00045950000000000006, + "loss": 6.0779, + "mean_token_accuracy": 0.12355258241295815, + "num_tokens": 2579209.0, + "step": 920 + }, + { + "entropy": 6.278075122833252, + "epoch": 0.025042301184433163, + "grad_norm": 1.171875, + "learning_rate": 0.000462, + "loss": 6.127, + "mean_token_accuracy": 0.12122250273823738, + "num_tokens": 2594162.0, + "step": 925 + }, + { + "entropy": 6.144100475311279, + "epoch": 0.02517766497461929, + "grad_norm": 1.078125, + "learning_rate": 0.0004645, + "loss": 6.1096, + "mean_token_accuracy": 0.11865596175193786, + "num_tokens": 2608748.0, + "step": 930 + }, + { + "entropy": 6.206922101974487, + "epoch": 0.025313028764805415, + "grad_norm": 1.0234375, + "learning_rate": 0.000467, + "loss": 6.0455, + "mean_token_accuracy": 0.11540281772613525, + "num_tokens": 2625671.0, + "step": 935 + }, + { + "entropy": 6.185919237136841, + "epoch": 0.02544839255499154, + "grad_norm": 0.9609375, + "learning_rate": 0.0004695, + "loss": 6.0258, + "mean_token_accuracy": 0.13033671155571938, + "num_tokens": 2640156.0, + "step": 940 + }, + { + "entropy": 6.142274999618531, + "epoch": 0.025583756345177663, + "grad_norm": 1.0546875, + "learning_rate": 0.000472, + "loss": 6.0462, + "mean_token_accuracy": 0.12545183822512626, + "num_tokens": 2655609.0, + "step": 945 + }, + { + "entropy": 6.160119819641113, + "epoch": 0.02571912013536379, + "grad_norm": 1.15625, + "learning_rate": 0.0004745, + "loss": 6.0096, + "mean_token_accuracy": 0.12306903898715973, + "num_tokens": 2668473.0, + "step": 950 + }, + { + "entropy": 6.120021915435791, + "epoch": 0.025854483925549916, + "grad_norm": 1.125, + "learning_rate": 0.000477, + "loss": 6.0944, + "mean_token_accuracy": 0.1181985966861248, + "num_tokens": 2681997.0, + "step": 955 + }, + { + "entropy": 6.164200687408448, + "epoch": 0.02598984771573604, + "grad_norm": 0.953125, + "learning_rate": 0.0004795, + "loss": 6.0733, + "mean_token_accuracy": 0.12185675352811813, + "num_tokens": 2697502.0, + "step": 960 + }, + { + "entropy": 6.162236452102661, + "epoch": 0.026125211505922164, + "grad_norm": 1.0625, + "learning_rate": 0.000482, + "loss": 6.024, + "mean_token_accuracy": 0.12753638476133347, + "num_tokens": 2710780.0, + "step": 965 + }, + { + "entropy": 6.187419700622558, + "epoch": 0.026260575296108292, + "grad_norm": 1.15625, + "learning_rate": 0.0004845, + "loss": 6.0861, + "mean_token_accuracy": 0.12425143718719482, + "num_tokens": 2725643.0, + "step": 970 + }, + { + "entropy": 6.1629087924957275, + "epoch": 0.026395939086294416, + "grad_norm": 0.9453125, + "learning_rate": 0.000487, + "loss": 6.0179, + "mean_token_accuracy": 0.12270609810948371, + "num_tokens": 2738610.0, + "step": 975 + }, + { + "entropy": 6.142755031585693, + "epoch": 0.02653130287648054, + "grad_norm": 1.125, + "learning_rate": 0.0004895, + "loss": 6.0373, + "mean_token_accuracy": 0.1201431192457676, + "num_tokens": 2752765.0, + "step": 980 + }, + { + "entropy": 6.1001872539520265, + "epoch": 0.02666666666666667, + "grad_norm": 1.0859375, + "learning_rate": 0.000492, + "loss": 5.9777, + "mean_token_accuracy": 0.12657394856214524, + "num_tokens": 2765355.0, + "step": 985 + }, + { + "entropy": 6.141935205459594, + "epoch": 0.026802030456852793, + "grad_norm": 1.015625, + "learning_rate": 0.0004945, + "loss": 6.0975, + "mean_token_accuracy": 0.12246641293168067, + "num_tokens": 2781318.0, + "step": 990 + }, + { + "entropy": 6.18066816329956, + "epoch": 0.026937394247038917, + "grad_norm": 1.0859375, + "learning_rate": 0.000497, + "loss": 6.0927, + "mean_token_accuracy": 0.11901046261191368, + "num_tokens": 2794329.0, + "step": 995 + }, + { + "entropy": 6.097706031799317, + "epoch": 0.02707275803722504, + "grad_norm": 1.125, + "learning_rate": 0.0004995, + "loss": 6.0651, + "mean_token_accuracy": 0.12499085217714309, + "num_tokens": 2807743.0, + "step": 1000 + }, + { + "entropy": 6.1797788619995115, + "epoch": 0.02720812182741117, + "grad_norm": 1.0546875, + "learning_rate": 0.000499998026082006, + "loss": 6.0732, + "mean_token_accuracy": 0.12034357115626335, + "num_tokens": 2821700.0, + "step": 1005 + }, + { + "entropy": 6.11210823059082, + "epoch": 0.027343485617597293, + "grad_norm": 1.0, + "learning_rate": 0.0004999900070995136, + "loss": 6.1228, + "mean_token_accuracy": 0.12435722276568413, + "num_tokens": 2836110.0, + "step": 1010 + }, + { + "entropy": 6.177678155899048, + "epoch": 0.027478849407783418, + "grad_norm": 0.95703125, + "learning_rate": 0.0004999758199023239, + "loss": 6.0535, + "mean_token_accuracy": 0.12844400405883788, + "num_tokens": 2850084.0, + "step": 1015 + }, + { + "entropy": 6.247022819519043, + "epoch": 0.027614213197969542, + "grad_norm": 1.234375, + "learning_rate": 0.0004999554648793858, + "loss": 6.1175, + "mean_token_accuracy": 0.12100091725587844, + "num_tokens": 2864286.0, + "step": 1020 + }, + { + "entropy": 6.0084270477294925, + "epoch": 0.02774957698815567, + "grad_norm": 0.953125, + "learning_rate": 0.0004999289425887425, + "loss": 5.9948, + "mean_token_accuracy": 0.12859246730804444, + "num_tokens": 2878742.0, + "step": 1025 + }, + { + "entropy": 6.1349043369293215, + "epoch": 0.027884940778341794, + "grad_norm": 1.046875, + "learning_rate": 0.0004998962537575161, + "loss": 5.9836, + "mean_token_accuracy": 0.1273471213877201, + "num_tokens": 2891855.0, + "step": 1030 + }, + { + "entropy": 5.931607675552368, + "epoch": 0.02802030456852792, + "grad_norm": 1.078125, + "learning_rate": 0.0004998573992818874, + "loss": 5.9324, + "mean_token_accuracy": 0.1273692585527897, + "num_tokens": 2905629.0, + "step": 1035 + }, + { + "entropy": 6.158669471740723, + "epoch": 0.028155668358714043, + "grad_norm": 1.109375, + "learning_rate": 0.0004998123802270715, + "loss": 6.0355, + "mean_token_accuracy": 0.12390008270740509, + "num_tokens": 2918358.0, + "step": 1040 + }, + { + "entropy": 6.0347072124481205, + "epoch": 0.02829103214890017, + "grad_norm": 1.234375, + "learning_rate": 0.0004997611978272886, + "loss": 5.9851, + "mean_token_accuracy": 0.12076426520943642, + "num_tokens": 2931814.0, + "step": 1045 + }, + { + "entropy": 6.025428819656372, + "epoch": 0.028426395939086295, + "grad_norm": 0.97265625, + "learning_rate": 0.0004997038534857298, + "loss": 5.9487, + "mean_token_accuracy": 0.12540491446852683, + "num_tokens": 2945457.0, + "step": 1050 + }, + { + "entropy": 6.2262214660644535, + "epoch": 0.02856175972927242, + "grad_norm": 1.0546875, + "learning_rate": 0.0004996403487745194, + "loss": 6.0524, + "mean_token_accuracy": 0.12540149614214896, + "num_tokens": 2960790.0, + "step": 1055 + }, + { + "entropy": 6.016364479064942, + "epoch": 0.028697123519458544, + "grad_norm": 1.2265625, + "learning_rate": 0.000499570685434671, + "loss": 5.9462, + "mean_token_accuracy": 0.12737049981951715, + "num_tokens": 2972851.0, + "step": 1060 + }, + { + "entropy": 6.061508703231811, + "epoch": 0.02883248730964467, + "grad_norm": 1.03125, + "learning_rate": 0.0004994948653760405, + "loss": 6.0193, + "mean_token_accuracy": 0.12827756106853486, + "num_tokens": 2986167.0, + "step": 1065 + }, + { + "entropy": 6.138202476501465, + "epoch": 0.028967851099830796, + "grad_norm": 1.0234375, + "learning_rate": 0.0004994128906772729, + "loss": 6.0747, + "mean_token_accuracy": 0.11862326189875602, + "num_tokens": 3001051.0, + "step": 1070 + }, + { + "entropy": 6.000337219238281, + "epoch": 0.02910321489001692, + "grad_norm": 1.0, + "learning_rate": 0.000499324763585746, + "loss": 5.8905, + "mean_token_accuracy": 0.1284564033150673, + "num_tokens": 3014393.0, + "step": 1075 + }, + { + "entropy": 5.964756202697754, + "epoch": 0.029238578680203044, + "grad_norm": 1.1640625, + "learning_rate": 0.0004992304865175085, + "loss": 5.9813, + "mean_token_accuracy": 0.12596782818436622, + "num_tokens": 3029072.0, + "step": 1080 + }, + { + "entropy": 6.101922702789307, + "epoch": 0.029373942470389172, + "grad_norm": 1.09375, + "learning_rate": 0.0004991300620572138, + "loss": 5.9816, + "mean_token_accuracy": 0.12776771411299706, + "num_tokens": 3041844.0, + "step": 1085 + }, + { + "entropy": 6.014832973480225, + "epoch": 0.029509306260575296, + "grad_norm": 0.953125, + "learning_rate": 0.0004990234929580494, + "loss": 6.0048, + "mean_token_accuracy": 0.12292343974113465, + "num_tokens": 3056570.0, + "step": 1090 + }, + { + "entropy": 6.118423938751221, + "epoch": 0.02964467005076142, + "grad_norm": 0.90234375, + "learning_rate": 0.0004989107821416609, + "loss": 6.0251, + "mean_token_accuracy": 0.12079276815056801, + "num_tokens": 3070407.0, + "step": 1095 + }, + { + "entropy": 6.080052423477173, + "epoch": 0.029780033840947545, + "grad_norm": 1.0, + "learning_rate": 0.0004987919326980723, + "loss": 5.9603, + "mean_token_accuracy": 0.1254470780491829, + "num_tokens": 3083845.0, + "step": 1100 + }, + { + "entropy": 6.030987882614136, + "epoch": 0.029915397631133673, + "grad_norm": 0.9453125, + "learning_rate": 0.0004986669478856011, + "loss": 6.0241, + "mean_token_accuracy": 0.12584121003746987, + "num_tokens": 3097637.0, + "step": 1105 + }, + { + "entropy": 6.138483095169067, + "epoch": 0.030050761421319797, + "grad_norm": 1.140625, + "learning_rate": 0.0004985358311307688, + "loss": 6.0386, + "mean_token_accuracy": 0.12023792713880539, + "num_tokens": 3112788.0, + "step": 1110 + }, + { + "entropy": 6.025177240371704, + "epoch": 0.03018612521150592, + "grad_norm": 1.140625, + "learning_rate": 0.0004983985860282081, + "loss": 6.0024, + "mean_token_accuracy": 0.12313967794179917, + "num_tokens": 3125927.0, + "step": 1115 + }, + { + "entropy": 6.122660446166992, + "epoch": 0.030321489001692046, + "grad_norm": 1.0078125, + "learning_rate": 0.0004982552163405623, + "loss": 6.0601, + "mean_token_accuracy": 0.12063769325613975, + "num_tokens": 3141294.0, + "step": 1120 + }, + { + "entropy": 5.91901388168335, + "epoch": 0.030456852791878174, + "grad_norm": 1.015625, + "learning_rate": 0.0004981057259983839, + "loss": 5.8293, + "mean_token_accuracy": 0.1289824903011322, + "num_tokens": 3154662.0, + "step": 1125 + }, + { + "entropy": 6.029631614685059, + "epoch": 0.030592216582064298, + "grad_norm": 1.09375, + "learning_rate": 0.0004979501191000262, + "loss": 5.9944, + "mean_token_accuracy": 0.1223167359828949, + "num_tokens": 3169356.0, + "step": 1130 + }, + { + "entropy": 6.0573914527893065, + "epoch": 0.030727580372250422, + "grad_norm": 1.0234375, + "learning_rate": 0.0004977883999115311, + "loss": 5.9411, + "mean_token_accuracy": 0.12958179041743279, + "num_tokens": 3183432.0, + "step": 1135 + }, + { + "entropy": 5.989719247817993, + "epoch": 0.030862944162436547, + "grad_norm": 0.984375, + "learning_rate": 0.0004976205728665113, + "loss": 5.96, + "mean_token_accuracy": 0.13433775156736374, + "num_tokens": 3197440.0, + "step": 1140 + }, + { + "entropy": 5.956574392318726, + "epoch": 0.030998307952622674, + "grad_norm": 0.98046875, + "learning_rate": 0.0004974466425660307, + "loss": 5.9362, + "mean_token_accuracy": 0.12498937547206879, + "num_tokens": 3213348.0, + "step": 1145 + }, + { + "entropy": 6.026212120056153, + "epoch": 0.0311336717428088, + "grad_norm": 0.96484375, + "learning_rate": 0.0004972666137784759, + "loss": 5.9483, + "mean_token_accuracy": 0.1215012364089489, + "num_tokens": 3226835.0, + "step": 1150 + }, + { + "entropy": 5.991872882843017, + "epoch": 0.03126903553299493, + "grad_norm": 1.0234375, + "learning_rate": 0.0004970804914394271, + "loss": 5.9253, + "mean_token_accuracy": 0.1271298736333847, + "num_tokens": 3240815.0, + "step": 1155 + }, + { + "entropy": 5.99332070350647, + "epoch": 0.03140439932318105, + "grad_norm": 1.09375, + "learning_rate": 0.0004968882806515225, + "loss": 5.9465, + "mean_token_accuracy": 0.13174123987555503, + "num_tokens": 3254567.0, + "step": 1160 + }, + { + "entropy": 5.977180242538452, + "epoch": 0.031539763113367175, + "grad_norm": 1.078125, + "learning_rate": 0.0004966899866843177, + "loss": 5.871, + "mean_token_accuracy": 0.13577421456575395, + "num_tokens": 3268802.0, + "step": 1165 + }, + { + "entropy": 6.024600458145142, + "epoch": 0.0316751269035533, + "grad_norm": 1.046875, + "learning_rate": 0.000496485614974142, + "loss": 5.9607, + "mean_token_accuracy": 0.12890158146619796, + "num_tokens": 3284215.0, + "step": 1170 + }, + { + "entropy": 5.917850065231323, + "epoch": 0.031810490693739424, + "grad_norm": 1.0625, + "learning_rate": 0.0004962751711239492, + "loss": 5.9356, + "mean_token_accuracy": 0.12962086424231528, + "num_tokens": 3300179.0, + "step": 1175 + }, + { + "entropy": 6.076095533370972, + "epoch": 0.03194585448392555, + "grad_norm": 1.1171875, + "learning_rate": 0.0004960586609031636, + "loss": 5.9531, + "mean_token_accuracy": 0.12908913493156432, + "num_tokens": 3314282.0, + "step": 1180 + }, + { + "entropy": 5.97105712890625, + "epoch": 0.03208121827411167, + "grad_norm": 1.109375, + "learning_rate": 0.0004958360902475224, + "loss": 6.0269, + "mean_token_accuracy": 0.12777508646249772, + "num_tokens": 3328343.0, + "step": 1185 + }, + { + "entropy": 6.013218975067138, + "epoch": 0.032216582064297804, + "grad_norm": 0.88671875, + "learning_rate": 0.0004956074652589125, + "loss": 5.8409, + "mean_token_accuracy": 0.13359294980764388, + "num_tokens": 3342751.0, + "step": 1190 + }, + { + "entropy": 5.94380931854248, + "epoch": 0.03235194585448393, + "grad_norm": 0.984375, + "learning_rate": 0.0004953727922052035, + "loss": 5.8721, + "mean_token_accuracy": 0.1346684418618679, + "num_tokens": 3357406.0, + "step": 1195 + }, + { + "entropy": 6.028680276870728, + "epoch": 0.03248730964467005, + "grad_norm": 0.92578125, + "learning_rate": 0.0004951320775200756, + "loss": 5.9773, + "mean_token_accuracy": 0.12906075417995452, + "num_tokens": 3372090.0, + "step": 1200 + }, + { + "entropy": 6.016203355789185, + "epoch": 0.03262267343485618, + "grad_norm": 1.0546875, + "learning_rate": 0.0004948853278028436, + "loss": 5.9553, + "mean_token_accuracy": 0.1359055757522583, + "num_tokens": 3384007.0, + "step": 1205 + }, + { + "entropy": 5.911950778961182, + "epoch": 0.0327580372250423, + "grad_norm": 1.0859375, + "learning_rate": 0.0004946325498182755, + "loss": 5.9622, + "mean_token_accuracy": 0.12463960498571396, + "num_tokens": 3398653.0, + "step": 1210 + }, + { + "entropy": 6.000537252426147, + "epoch": 0.032893401015228425, + "grad_norm": 1.015625, + "learning_rate": 0.0004943737504964076, + "loss": 5.8577, + "mean_token_accuracy": 0.13106542453169823, + "num_tokens": 3412892.0, + "step": 1215 + }, + { + "entropy": 5.9030508518219, + "epoch": 0.03302876480541455, + "grad_norm": 1.0390625, + "learning_rate": 0.000494108936932354, + "loss": 5.7772, + "mean_token_accuracy": 0.14335963129997253, + "num_tokens": 3427162.0, + "step": 1220 + }, + { + "entropy": 5.881168079376221, + "epoch": 0.033164128595600674, + "grad_norm": 1.1015625, + "learning_rate": 0.0004938381163861124, + "loss": 5.8865, + "mean_token_accuracy": 0.1323596365749836, + "num_tokens": 3440402.0, + "step": 1225 + }, + { + "entropy": 5.966072845458984, + "epoch": 0.033299492385786805, + "grad_norm": 1.109375, + "learning_rate": 0.0004935612962823645, + "loss": 5.9626, + "mean_token_accuracy": 0.12719930335879326, + "num_tokens": 3453989.0, + "step": 1230 + }, + { + "entropy": 6.010539197921753, + "epoch": 0.03343485617597293, + "grad_norm": 0.98828125, + "learning_rate": 0.0004932784842102739, + "loss": 5.9214, + "mean_token_accuracy": 0.12816225066781045, + "num_tokens": 3468962.0, + "step": 1235 + }, + { + "entropy": 5.930458641052246, + "epoch": 0.033570219966159054, + "grad_norm": 1.15625, + "learning_rate": 0.0004929896879232758, + "loss": 5.7972, + "mean_token_accuracy": 0.1380744606256485, + "num_tokens": 3481385.0, + "step": 1240 + }, + { + "entropy": 5.931494283676147, + "epoch": 0.03370558375634518, + "grad_norm": 0.92578125, + "learning_rate": 0.0004926949153388668, + "loss": 5.8538, + "mean_token_accuracy": 0.13487453013658524, + "num_tokens": 3495904.0, + "step": 1245 + }, + { + "entropy": 5.931593751907348, + "epoch": 0.0338409475465313, + "grad_norm": 0.96875, + "learning_rate": 0.0004923941745383859, + "loss": 5.8606, + "mean_token_accuracy": 0.12867458090186118, + "num_tokens": 3511946.0, + "step": 1250 + }, + { + "entropy": 5.901215839385986, + "epoch": 0.03397631133671743, + "grad_norm": 1.234375, + "learning_rate": 0.000492087473766794, + "loss": 5.8359, + "mean_token_accuracy": 0.13469822704792023, + "num_tokens": 3524470.0, + "step": 1255 + }, + { + "entropy": 5.945947980880737, + "epoch": 0.03411167512690355, + "grad_norm": 1.078125, + "learning_rate": 0.000491774821432448, + "loss": 5.9056, + "mean_token_accuracy": 0.13596510142087936, + "num_tokens": 3537444.0, + "step": 1260 + }, + { + "entropy": 6.070478630065918, + "epoch": 0.034247038917089676, + "grad_norm": 1.0625, + "learning_rate": 0.0004914562261068693, + "loss": 6.0304, + "mean_token_accuracy": 0.12992693334817887, + "num_tokens": 3551171.0, + "step": 1265 + }, + { + "entropy": 5.8572030544281, + "epoch": 0.03438240270727581, + "grad_norm": 0.98046875, + "learning_rate": 0.0004911316965245098, + "loss": 5.8561, + "mean_token_accuracy": 0.13198562785983087, + "num_tokens": 3565608.0, + "step": 1270 + }, + { + "entropy": 5.899595928192139, + "epoch": 0.03451776649746193, + "grad_norm": 1.0546875, + "learning_rate": 0.000490801241582512, + "loss": 5.8328, + "mean_token_accuracy": 0.1360912725329399, + "num_tokens": 3580423.0, + "step": 1275 + }, + { + "entropy": 5.88170690536499, + "epoch": 0.034653130287648055, + "grad_norm": 1.1171875, + "learning_rate": 0.000490464870340465, + "loss": 5.8666, + "mean_token_accuracy": 0.1351574994623661, + "num_tokens": 3594068.0, + "step": 1280 + }, + { + "entropy": 5.838206243515015, + "epoch": 0.03478849407783418, + "grad_norm": 0.9609375, + "learning_rate": 0.0004901225920201563, + "loss": 5.8293, + "mean_token_accuracy": 0.13220815882086753, + "num_tokens": 3607978.0, + "step": 1285 + }, + { + "entropy": 5.945906925201416, + "epoch": 0.034923857868020304, + "grad_norm": 1.0078125, + "learning_rate": 0.000489774416005319, + "loss": 5.9087, + "mean_token_accuracy": 0.1275140456855297, + "num_tokens": 3621091.0, + "step": 1290 + }, + { + "entropy": 5.873530435562134, + "epoch": 0.03505922165820643, + "grad_norm": 0.96484375, + "learning_rate": 0.0004894203518413742, + "loss": 5.8965, + "mean_token_accuracy": 0.13213202804327012, + "num_tokens": 3634615.0, + "step": 1295 + }, + { + "entropy": 5.950916433334351, + "epoch": 0.03519458544839255, + "grad_norm": 0.9296875, + "learning_rate": 0.0004890604092351701, + "loss": 5.8203, + "mean_token_accuracy": 0.1343979686498642, + "num_tokens": 3648952.0, + "step": 1300 + }, + { + "entropy": 5.9373682022094725, + "epoch": 0.03532994923857868, + "grad_norm": 1.03125, + "learning_rate": 0.000488694598054715, + "loss": 5.9016, + "mean_token_accuracy": 0.1337265945971012, + "num_tokens": 3662631.0, + "step": 1305 + }, + { + "entropy": 5.8529746532440186, + "epoch": 0.03546531302876481, + "grad_norm": 1.0, + "learning_rate": 0.0004883229283289071, + "loss": 5.8703, + "mean_token_accuracy": 0.13501393496990205, + "num_tokens": 3677762.0, + "step": 1310 + }, + { + "entropy": 5.979293251037598, + "epoch": 0.03560067681895093, + "grad_norm": 0.96484375, + "learning_rate": 0.00048794541024725993, + "loss": 5.8974, + "mean_token_accuracy": 0.12559727132320403, + "num_tokens": 3692657.0, + "step": 1315 + }, + { + "entropy": 5.79110279083252, + "epoch": 0.03573604060913706, + "grad_norm": 1.0390625, + "learning_rate": 0.0004875620541596221, + "loss": 5.7665, + "mean_token_accuracy": 0.13931511640548705, + "num_tokens": 3706615.0, + "step": 1320 + }, + { + "entropy": 5.879328918457031, + "epoch": 0.03587140439932318, + "grad_norm": 0.96875, + "learning_rate": 0.00048717287057589454, + "loss": 5.7665, + "mean_token_accuracy": 0.13615642935037614, + "num_tokens": 3720054.0, + "step": 1325 + }, + { + "entropy": 5.7798095703125, + "epoch": 0.036006768189509306, + "grad_norm": 1.0390625, + "learning_rate": 0.0004867778701657417, + "loss": 5.8004, + "mean_token_accuracy": 0.13352179080247878, + "num_tokens": 3732578.0, + "step": 1330 + }, + { + "entropy": 5.896574926376343, + "epoch": 0.03614213197969543, + "grad_norm": 0.8671875, + "learning_rate": 0.00048637706375829955, + "loss": 5.8389, + "mean_token_accuracy": 0.13618992641568184, + "num_tokens": 3747745.0, + "step": 1335 + }, + { + "entropy": 5.925070810317993, + "epoch": 0.036277495769881554, + "grad_norm": 1.15625, + "learning_rate": 0.000485970462341878, + "loss": 5.8093, + "mean_token_accuracy": 0.1370240181684494, + "num_tokens": 3760715.0, + "step": 1340 + }, + { + "entropy": 5.853664588928223, + "epoch": 0.03641285956006768, + "grad_norm": 1.0234375, + "learning_rate": 0.00048555807706366044, + "loss": 5.8601, + "mean_token_accuracy": 0.13756127581000327, + "num_tokens": 3773670.0, + "step": 1345 + }, + { + "entropy": 5.945131015777588, + "epoch": 0.03654822335025381, + "grad_norm": 0.9453125, + "learning_rate": 0.00048513991922939756, + "loss": 5.7907, + "mean_token_accuracy": 0.14311188608407974, + "num_tokens": 3786738.0, + "step": 1350 + }, + { + "entropy": 5.859251689910889, + "epoch": 0.036683587140439934, + "grad_norm": 1.078125, + "learning_rate": 0.00048471600030309744, + "loss": 5.7949, + "mean_token_accuracy": 0.14019912704825402, + "num_tokens": 3800536.0, + "step": 1355 + }, + { + "entropy": 5.906093645095825, + "epoch": 0.03681895093062606, + "grad_norm": 1.046875, + "learning_rate": 0.00048428633190671186, + "loss": 5.917, + "mean_token_accuracy": 0.13591600805521012, + "num_tokens": 3813241.0, + "step": 1360 + }, + { + "entropy": 5.841483879089355, + "epoch": 0.03695431472081218, + "grad_norm": 1.0703125, + "learning_rate": 0.0004838509258198167, + "loss": 5.8021, + "mean_token_accuracy": 0.14016170799732208, + "num_tokens": 3827311.0, + "step": 1365 + }, + { + "entropy": 5.877211189270019, + "epoch": 0.03708967851099831, + "grad_norm": 1.0859375, + "learning_rate": 0.00048340979397929, + "loss": 5.867, + "mean_token_accuracy": 0.13220226317644118, + "num_tokens": 3841034.0, + "step": 1370 + }, + { + "entropy": 5.83872618675232, + "epoch": 0.03722504230118443, + "grad_norm": 1.0234375, + "learning_rate": 0.00048296294847898386, + "loss": 5.6653, + "mean_token_accuracy": 0.13773941323161126, + "num_tokens": 3853559.0, + "step": 1375 + }, + { + "entropy": 5.855471277236939, + "epoch": 0.037360406091370556, + "grad_norm": 0.96484375, + "learning_rate": 0.0004825104015693934, + "loss": 5.864, + "mean_token_accuracy": 0.12592799887061118, + "num_tokens": 3868327.0, + "step": 1380 + }, + { + "entropy": 5.8454270362854, + "epoch": 0.03749576988155669, + "grad_norm": 0.9296875, + "learning_rate": 0.0004820521656573208, + "loss": 5.8182, + "mean_token_accuracy": 0.13926773220300676, + "num_tokens": 3881981.0, + "step": 1385 + }, + { + "entropy": 5.975482940673828, + "epoch": 0.03763113367174281, + "grad_norm": 0.92578125, + "learning_rate": 0.00048158825330553505, + "loss": 5.8992, + "mean_token_accuracy": 0.13271776139736174, + "num_tokens": 3895911.0, + "step": 1390 + }, + { + "entropy": 5.823576545715332, + "epoch": 0.037766497461928936, + "grad_norm": 0.97265625, + "learning_rate": 0.00048111867723242763, + "loss": 5.797, + "mean_token_accuracy": 0.1352679081261158, + "num_tokens": 3910179.0, + "step": 1395 + }, + { + "entropy": 5.880249977111816, + "epoch": 0.03790186125211506, + "grad_norm": 0.85546875, + "learning_rate": 0.0004806434503116637, + "loss": 5.8109, + "mean_token_accuracy": 0.13052432835102082, + "num_tokens": 3925053.0, + "step": 1400 + }, + { + "entropy": 5.788560056686402, + "epoch": 0.038037225042301184, + "grad_norm": 1.0859375, + "learning_rate": 0.0004801625855718296, + "loss": 5.8081, + "mean_token_accuracy": 0.13492835760116578, + "num_tokens": 3938544.0, + "step": 1405 + }, + { + "entropy": 5.931741094589233, + "epoch": 0.03817258883248731, + "grad_norm": 0.91796875, + "learning_rate": 0.00047967609619607477, + "loss": 5.9446, + "mean_token_accuracy": 0.12690417915582658, + "num_tokens": 3953088.0, + "step": 1410 + }, + { + "entropy": 5.938955354690552, + "epoch": 0.03830795262267343, + "grad_norm": 0.84765625, + "learning_rate": 0.0004791839955217513, + "loss": 5.9114, + "mean_token_accuracy": 0.13125399351119996, + "num_tokens": 3970136.0, + "step": 1415 + }, + { + "entropy": 5.8262474060058596, + "epoch": 0.03844331641285956, + "grad_norm": 1.109375, + "learning_rate": 0.00047868629704004786, + "loss": 5.7126, + "mean_token_accuracy": 0.14028473943471909, + "num_tokens": 3984170.0, + "step": 1420 + }, + { + "entropy": 5.777353525161743, + "epoch": 0.03857868020304569, + "grad_norm": 0.90625, + "learning_rate": 0.00047818301439561965, + "loss": 5.7676, + "mean_token_accuracy": 0.14551205635070802, + "num_tokens": 3998030.0, + "step": 1425 + }, + { + "entropy": 5.755202388763427, + "epoch": 0.03871404399323181, + "grad_norm": 1.0078125, + "learning_rate": 0.00047767416138621454, + "loss": 5.6717, + "mean_token_accuracy": 0.13998118191957473, + "num_tokens": 4013158.0, + "step": 1430 + }, + { + "entropy": 5.910610723495483, + "epoch": 0.03884940778341794, + "grad_norm": 0.87890625, + "learning_rate": 0.000477159751962295, + "loss": 5.8218, + "mean_token_accuracy": 0.13360931798815728, + "num_tokens": 4028147.0, + "step": 1435 + }, + { + "entropy": 5.76572093963623, + "epoch": 0.03898477157360406, + "grad_norm": 0.9765625, + "learning_rate": 0.00047663980022665507, + "loss": 5.6998, + "mean_token_accuracy": 0.14273363947868348, + "num_tokens": 4043039.0, + "step": 1440 + }, + { + "entropy": 5.883444166183471, + "epoch": 0.039120135363790186, + "grad_norm": 1.0390625, + "learning_rate": 0.00047611432043403437, + "loss": 5.8944, + "mean_token_accuracy": 0.13942254111170768, + "num_tokens": 4056414.0, + "step": 1445 + }, + { + "entropy": 5.877360773086548, + "epoch": 0.03925549915397631, + "grad_norm": 0.92578125, + "learning_rate": 0.0004755833269907267, + "loss": 5.8143, + "mean_token_accuracy": 0.1393973112106323, + "num_tokens": 4071776.0, + "step": 1450 + }, + { + "entropy": 5.851318216323852, + "epoch": 0.039390862944162434, + "grad_norm": 0.95703125, + "learning_rate": 0.0004750468344541857, + "loss": 5.7161, + "mean_token_accuracy": 0.13444317877292633, + "num_tokens": 4085216.0, + "step": 1455 + }, + { + "entropy": 5.749738121032715, + "epoch": 0.03952622673434856, + "grad_norm": 1.1328125, + "learning_rate": 0.00047450485753262525, + "loss": 5.8215, + "mean_token_accuracy": 0.14175896048545839, + "num_tokens": 4098523.0, + "step": 1460 + }, + { + "entropy": 5.883940315246582, + "epoch": 0.03966159052453469, + "grad_norm": 0.97265625, + "learning_rate": 0.00047395741108461633, + "loss": 5.7887, + "mean_token_accuracy": 0.13734084963798524, + "num_tokens": 4112383.0, + "step": 1465 + }, + { + "entropy": 5.746815729141235, + "epoch": 0.039796954314720814, + "grad_norm": 0.9765625, + "learning_rate": 0.00047340451011867985, + "loss": 5.8546, + "mean_token_accuracy": 0.1313462048768997, + "num_tokens": 4125524.0, + "step": 1470 + }, + { + "entropy": 5.8694652080535885, + "epoch": 0.03993231810490694, + "grad_norm": 1.1171875, + "learning_rate": 0.00047284616979287515, + "loss": 5.7026, + "mean_token_accuracy": 0.14162963032722473, + "num_tokens": 4138946.0, + "step": 1475 + }, + { + "entropy": 5.773919725418091, + "epoch": 0.04006768189509306, + "grad_norm": 0.93359375, + "learning_rate": 0.00047228240541438433, + "loss": 5.7453, + "mean_token_accuracy": 0.14252977669239045, + "num_tokens": 4152066.0, + "step": 1480 + }, + { + "entropy": 5.838653135299682, + "epoch": 0.04020304568527919, + "grad_norm": 0.96875, + "learning_rate": 0.00047171323243909257, + "loss": 5.7556, + "mean_token_accuracy": 0.1399710148572922, + "num_tokens": 4166171.0, + "step": 1485 + }, + { + "entropy": 5.763364934921265, + "epoch": 0.04033840947546531, + "grad_norm": 1.0234375, + "learning_rate": 0.00047113866647116457, + "loss": 5.7782, + "mean_token_accuracy": 0.14722683578729628, + "num_tokens": 4178809.0, + "step": 1490 + }, + { + "entropy": 5.734166765213013, + "epoch": 0.040473773265651436, + "grad_norm": 1.0546875, + "learning_rate": 0.0004705587232626164, + "loss": 5.7097, + "mean_token_accuracy": 0.1362159803509712, + "num_tokens": 4192211.0, + "step": 1495 + }, + { + "entropy": 5.872725915908814, + "epoch": 0.04060913705583756, + "grad_norm": 0.94921875, + "learning_rate": 0.00046997341871288424, + "loss": 5.7196, + "mean_token_accuracy": 0.14548214226961137, + "num_tokens": 4206310.0, + "step": 1500 + }, + { + "entropy": 5.856945276260376, + "epoch": 0.04074450084602369, + "grad_norm": 1.1015625, + "learning_rate": 0.0004693827688683879, + "loss": 5.8553, + "mean_token_accuracy": 0.14121681377291678, + "num_tokens": 4219479.0, + "step": 1505 + }, + { + "entropy": 5.895747375488281, + "epoch": 0.040879864636209816, + "grad_norm": 0.93359375, + "learning_rate": 0.0004687867899220914, + "loss": 5.8104, + "mean_token_accuracy": 0.1397186741232872, + "num_tokens": 4234129.0, + "step": 1510 + }, + { + "entropy": 5.804001092910767, + "epoch": 0.04101522842639594, + "grad_norm": 1.171875, + "learning_rate": 0.00046818549821305846, + "loss": 5.7749, + "mean_token_accuracy": 0.13784123361110687, + "num_tokens": 4247785.0, + "step": 1515 + }, + { + "entropy": 5.728389310836792, + "epoch": 0.041150592216582065, + "grad_norm": 0.91015625, + "learning_rate": 0.00046757891022600494, + "loss": 5.6397, + "mean_token_accuracy": 0.14299456030130386, + "num_tokens": 4262983.0, + "step": 1520 + }, + { + "entropy": 5.9353930950164795, + "epoch": 0.04128595600676819, + "grad_norm": 0.87890625, + "learning_rate": 0.0004669670425908471, + "loss": 5.9331, + "mean_token_accuracy": 0.1264545239508152, + "num_tokens": 4278373.0, + "step": 1525 + }, + { + "entropy": 5.817500162124634, + "epoch": 0.04142131979695431, + "grad_norm": 0.94921875, + "learning_rate": 0.0004663499120822451, + "loss": 5.6499, + "mean_token_accuracy": 0.14248120337724685, + "num_tokens": 4293058.0, + "step": 1530 + }, + { + "entropy": 5.697978162765503, + "epoch": 0.04155668358714044, + "grad_norm": 1.0859375, + "learning_rate": 0.0004657275356191437, + "loss": 5.7497, + "mean_token_accuracy": 0.14827215373516084, + "num_tokens": 4305107.0, + "step": 1535 + }, + { + "entropy": 5.7474280834198, + "epoch": 0.04169204737732656, + "grad_norm": 0.875, + "learning_rate": 0.00046509993026430804, + "loss": 5.7442, + "mean_token_accuracy": 0.14127848967909812, + "num_tokens": 4320791.0, + "step": 1540 + }, + { + "entropy": 5.863645458221436, + "epoch": 0.04182741116751269, + "grad_norm": 0.859375, + "learning_rate": 0.0004644671132238558, + "loss": 5.7167, + "mean_token_accuracy": 0.13956723287701606, + "num_tokens": 4336989.0, + "step": 1545 + }, + { + "entropy": 5.8170019626617435, + "epoch": 0.04196277495769882, + "grad_norm": 0.984375, + "learning_rate": 0.00046382910184678585, + "loss": 5.6923, + "mean_token_accuracy": 0.1433095797896385, + "num_tokens": 4350286.0, + "step": 1550 + }, + { + "entropy": 5.611237478256226, + "epoch": 0.04209813874788494, + "grad_norm": 0.98828125, + "learning_rate": 0.0004631859136245025, + "loss": 5.6368, + "mean_token_accuracy": 0.14433954954147338, + "num_tokens": 4366115.0, + "step": 1555 + }, + { + "entropy": 5.8419585704803465, + "epoch": 0.042233502538071066, + "grad_norm": 1.0390625, + "learning_rate": 0.0004625375661903357, + "loss": 5.8694, + "mean_token_accuracy": 0.13394705951213837, + "num_tokens": 4381538.0, + "step": 1560 + }, + { + "entropy": 5.869414138793945, + "epoch": 0.04236886632825719, + "grad_norm": 1.03125, + "learning_rate": 0.00046188407731905787, + "loss": 5.8672, + "mean_token_accuracy": 0.13035987243056296, + "num_tokens": 4395460.0, + "step": 1565 + }, + { + "entropy": 5.894603872299195, + "epoch": 0.042504230118443315, + "grad_norm": 0.97265625, + "learning_rate": 0.00046122546492639643, + "loss": 5.6597, + "mean_token_accuracy": 0.14258980005979538, + "num_tokens": 4411841.0, + "step": 1570 + }, + { + "entropy": 5.751853179931641, + "epoch": 0.04263959390862944, + "grad_norm": 1.046875, + "learning_rate": 0.000460561747068543, + "loss": 5.7583, + "mean_token_accuracy": 0.138499815762043, + "num_tokens": 4425555.0, + "step": 1575 + }, + { + "entropy": 5.86604118347168, + "epoch": 0.04277495769881557, + "grad_norm": 1.1171875, + "learning_rate": 0.0004598929419416578, + "loss": 5.6867, + "mean_token_accuracy": 0.14240610525012015, + "num_tokens": 4437822.0, + "step": 1580 + }, + { + "entropy": 5.737030029296875, + "epoch": 0.042910321489001695, + "grad_norm": 0.890625, + "learning_rate": 0.00045921906788137123, + "loss": 5.7327, + "mean_token_accuracy": 0.14339831471443176, + "num_tokens": 4452974.0, + "step": 1585 + }, + { + "entropy": 5.74243483543396, + "epoch": 0.04304568527918782, + "grad_norm": 0.96875, + "learning_rate": 0.00045854014336228115, + "loss": 5.6716, + "mean_token_accuracy": 0.1469262346625328, + "num_tokens": 4465057.0, + "step": 1590 + }, + { + "entropy": 5.721040344238281, + "epoch": 0.04318104906937394, + "grad_norm": 0.984375, + "learning_rate": 0.00045785618699744615, + "loss": 5.6387, + "mean_token_accuracy": 0.14491022154688835, + "num_tokens": 4479131.0, + "step": 1595 + }, + { + "entropy": 5.748002433776856, + "epoch": 0.04331641285956007, + "grad_norm": 1.140625, + "learning_rate": 0.00045716721753787543, + "loss": 5.7572, + "mean_token_accuracy": 0.14127787053585053, + "num_tokens": 4495131.0, + "step": 1600 + }, + { + "entropy": 5.711660146713257, + "epoch": 0.04345177664974619, + "grad_norm": 0.95703125, + "learning_rate": 0.0004564732538720148, + "loss": 5.7059, + "mean_token_accuracy": 0.14483382552862167, + "num_tokens": 4508267.0, + "step": 1605 + }, + { + "entropy": 5.848050451278686, + "epoch": 0.043587140439932316, + "grad_norm": 1.0625, + "learning_rate": 0.00045577431502522877, + "loss": 5.7053, + "mean_token_accuracy": 0.14630670472979546, + "num_tokens": 4522298.0, + "step": 1610 + }, + { + "entropy": 5.725667428970337, + "epoch": 0.04372250423011844, + "grad_norm": 1.09375, + "learning_rate": 0.0004550704201592787, + "loss": 5.7321, + "mean_token_accuracy": 0.1426356054842472, + "num_tokens": 4536509.0, + "step": 1615 + }, + { + "entropy": 5.708344316482544, + "epoch": 0.04385786802030457, + "grad_norm": 0.98828125, + "learning_rate": 0.0004543615885717981, + "loss": 5.5904, + "mean_token_accuracy": 0.1510692059993744, + "num_tokens": 4548164.0, + "step": 1620 + }, + { + "entropy": 5.699061918258667, + "epoch": 0.043993231810490696, + "grad_norm": 0.90625, + "learning_rate": 0.00045364783969576296, + "loss": 5.6169, + "mean_token_accuracy": 0.14389338046312333, + "num_tokens": 4562588.0, + "step": 1625 + }, + { + "entropy": 5.745128536224366, + "epoch": 0.04412859560067682, + "grad_norm": 0.9375, + "learning_rate": 0.0004529291930989592, + "loss": 5.7788, + "mean_token_accuracy": 0.14362882375717162, + "num_tokens": 4575607.0, + "step": 1630 + }, + { + "entropy": 5.842718124389648, + "epoch": 0.044263959390862945, + "grad_norm": 0.9375, + "learning_rate": 0.0004522056684834464, + "loss": 5.6764, + "mean_token_accuracy": 0.1434960126876831, + "num_tokens": 4590102.0, + "step": 1635 + }, + { + "entropy": 5.678610563278198, + "epoch": 0.04439932318104907, + "grad_norm": 0.94921875, + "learning_rate": 0.0004514772856850173, + "loss": 5.7023, + "mean_token_accuracy": 0.14198361933231354, + "num_tokens": 4604192.0, + "step": 1640 + }, + { + "entropy": 5.788250541687011, + "epoch": 0.04453468697123519, + "grad_norm": 1.078125, + "learning_rate": 0.0004507440646726542, + "loss": 5.6749, + "mean_token_accuracy": 0.14550164267420768, + "num_tokens": 4617643.0, + "step": 1645 + }, + { + "entropy": 5.704812479019165, + "epoch": 0.04467005076142132, + "grad_norm": 0.890625, + "learning_rate": 0.0004500060255479818, + "loss": 5.7478, + "mean_token_accuracy": 0.139235407859087, + "num_tokens": 4633818.0, + "step": 1650 + }, + { + "entropy": 5.7535816669464115, + "epoch": 0.04480541455160744, + "grad_norm": 0.82421875, + "learning_rate": 0.0004492631885447151, + "loss": 5.7359, + "mean_token_accuracy": 0.13843510597944259, + "num_tokens": 4648527.0, + "step": 1655 + }, + { + "entropy": 5.807849359512329, + "epoch": 0.04494077834179357, + "grad_norm": 1.0234375, + "learning_rate": 0.00044851557402810616, + "loss": 5.6926, + "mean_token_accuracy": 0.1437424451112747, + "num_tokens": 4661545.0, + "step": 1660 + }, + { + "entropy": 5.759947490692139, + "epoch": 0.0450761421319797, + "grad_norm": 0.93359375, + "learning_rate": 0.00044776320249438444, + "loss": 5.7466, + "mean_token_accuracy": 0.14138651117682458, + "num_tokens": 4675255.0, + "step": 1665 + }, + { + "entropy": 5.719445466995239, + "epoch": 0.04521150592216582, + "grad_norm": 0.94921875, + "learning_rate": 0.00044700609457019565, + "loss": 5.5664, + "mean_token_accuracy": 0.15053462088108063, + "num_tokens": 4688863.0, + "step": 1670 + }, + { + "entropy": 5.777239894866943, + "epoch": 0.045346869712351946, + "grad_norm": 1.0, + "learning_rate": 0.0004462442710120359, + "loss": 5.73, + "mean_token_accuracy": 0.14415158182382584, + "num_tokens": 4702336.0, + "step": 1675 + }, + { + "entropy": 5.72534589767456, + "epoch": 0.04548223350253807, + "grad_norm": 1.03125, + "learning_rate": 0.000445477752705683, + "loss": 5.5325, + "mean_token_accuracy": 0.14911517053842543, + "num_tokens": 4716433.0, + "step": 1680 + }, + { + "entropy": 5.71527886390686, + "epoch": 0.045617597292724195, + "grad_norm": 0.95703125, + "learning_rate": 0.00044470656066562336, + "loss": 5.7004, + "mean_token_accuracy": 0.14622605815529824, + "num_tokens": 4730458.0, + "step": 1685 + }, + { + "entropy": 5.669246053695678, + "epoch": 0.04575296108291032, + "grad_norm": 1.0546875, + "learning_rate": 0.0004439307160344765, + "loss": 5.6398, + "mean_token_accuracy": 0.14573194235563278, + "num_tokens": 4744262.0, + "step": 1690 + }, + { + "entropy": 5.70993275642395, + "epoch": 0.045888324873096444, + "grad_norm": 1.046875, + "learning_rate": 0.00044315024008241473, + "loss": 5.6693, + "mean_token_accuracy": 0.14355338960886002, + "num_tokens": 4758673.0, + "step": 1695 + }, + { + "entropy": 5.847352313995361, + "epoch": 0.046023688663282575, + "grad_norm": 0.9609375, + "learning_rate": 0.0004423651542065806, + "loss": 5.6926, + "mean_token_accuracy": 0.14469362199306487, + "num_tokens": 4772220.0, + "step": 1700 + }, + { + "entropy": 5.645872116088867, + "epoch": 0.0461590524534687, + "grad_norm": 1.0625, + "learning_rate": 0.00044157547993050006, + "loss": 5.5701, + "mean_token_accuracy": 0.1518155261874199, + "num_tokens": 4785273.0, + "step": 1705 + }, + { + "entropy": 5.716040754318238, + "epoch": 0.04629441624365482, + "grad_norm": 0.97265625, + "learning_rate": 0.00044078123890349227, + "loss": 5.6269, + "mean_token_accuracy": 0.1508127622306347, + "num_tokens": 4799530.0, + "step": 1710 + }, + { + "entropy": 5.730141544342041, + "epoch": 0.04642978003384095, + "grad_norm": 1.046875, + "learning_rate": 0.00043998245290007606, + "loss": 5.6882, + "mean_token_accuracy": 0.141463815420866, + "num_tokens": 4813985.0, + "step": 1715 + }, + { + "entropy": 5.686599445343018, + "epoch": 0.04656514382402707, + "grad_norm": 0.94140625, + "learning_rate": 0.00043917914381937323, + "loss": 5.6193, + "mean_token_accuracy": 0.14998584240674973, + "num_tokens": 4826131.0, + "step": 1720 + }, + { + "entropy": 5.733201026916504, + "epoch": 0.046700507614213196, + "grad_norm": 0.9609375, + "learning_rate": 0.00043837133368450815, + "loss": 5.6939, + "mean_token_accuracy": 0.1447956845164299, + "num_tokens": 4840854.0, + "step": 1725 + }, + { + "entropy": 5.695008659362793, + "epoch": 0.04683587140439932, + "grad_norm": 0.9765625, + "learning_rate": 0.0004375590446420037, + "loss": 5.6338, + "mean_token_accuracy": 0.146064093708992, + "num_tokens": 4855690.0, + "step": 1730 + }, + { + "entropy": 5.772643423080444, + "epoch": 0.046971235194585445, + "grad_norm": 0.9375, + "learning_rate": 0.0004367422989611743, + "loss": 5.6561, + "mean_token_accuracy": 0.15210988670587539, + "num_tokens": 4868909.0, + "step": 1735 + }, + { + "entropy": 5.729992532730103, + "epoch": 0.047106598984771576, + "grad_norm": 1.0546875, + "learning_rate": 0.0004359211190335153, + "loss": 5.6925, + "mean_token_accuracy": 0.1468656025826931, + "num_tokens": 4883021.0, + "step": 1740 + }, + { + "entropy": 5.736793279647827, + "epoch": 0.0472419627749577, + "grad_norm": 1.0, + "learning_rate": 0.00043509552737208923, + "loss": 5.6105, + "mean_token_accuracy": 0.14630509316921234, + "num_tokens": 4897056.0, + "step": 1745 + }, + { + "entropy": 5.618852758407593, + "epoch": 0.047377326565143825, + "grad_norm": 0.984375, + "learning_rate": 0.00043426554661090853, + "loss": 5.6044, + "mean_token_accuracy": 0.14477996677160263, + "num_tokens": 4910514.0, + "step": 1750 + }, + { + "entropy": 5.719070625305176, + "epoch": 0.04751269035532995, + "grad_norm": 1.0, + "learning_rate": 0.00043343119950431516, + "loss": 5.6632, + "mean_token_accuracy": 0.14679592475295067, + "num_tokens": 4923888.0, + "step": 1755 + }, + { + "entropy": 5.694540119171142, + "epoch": 0.047648054145516074, + "grad_norm": 0.94921875, + "learning_rate": 0.00043259250892635644, + "loss": 5.7051, + "mean_token_accuracy": 0.1482004776597023, + "num_tokens": 4939282.0, + "step": 1760 + }, + { + "entropy": 5.804504442214966, + "epoch": 0.0477834179357022, + "grad_norm": 0.87890625, + "learning_rate": 0.0004317494978701582, + "loss": 5.6336, + "mean_token_accuracy": 0.14055619165301322, + "num_tokens": 4954903.0, + "step": 1765 + }, + { + "entropy": 5.703070640563965, + "epoch": 0.04791878172588832, + "grad_norm": 0.9296875, + "learning_rate": 0.0004309021894472943, + "loss": 5.6719, + "mean_token_accuracy": 0.15038193613290787, + "num_tokens": 4969840.0, + "step": 1770 + }, + { + "entropy": 5.734935092926025, + "epoch": 0.048054145516074454, + "grad_norm": 0.89453125, + "learning_rate": 0.0004300506068871534, + "loss": 5.6401, + "mean_token_accuracy": 0.14663783758878707, + "num_tokens": 4984608.0, + "step": 1775 + }, + { + "entropy": 5.63493800163269, + "epoch": 0.04818950930626058, + "grad_norm": 0.8125, + "learning_rate": 0.00042919477353630135, + "loss": 5.5685, + "mean_token_accuracy": 0.1455909326672554, + "num_tokens": 5000369.0, + "step": 1780 + }, + { + "entropy": 5.715186595916748, + "epoch": 0.0483248730964467, + "grad_norm": 0.91015625, + "learning_rate": 0.000428334712857842, + "loss": 5.5859, + "mean_token_accuracy": 0.14593576341867448, + "num_tokens": 5014858.0, + "step": 1785 + }, + { + "entropy": 5.569622945785523, + "epoch": 0.048460236886632826, + "grad_norm": 0.87890625, + "learning_rate": 0.00042747044843077304, + "loss": 5.6116, + "mean_token_accuracy": 0.1430406704545021, + "num_tokens": 5029339.0, + "step": 1790 + }, + { + "entropy": 5.745399045944214, + "epoch": 0.04859560067681895, + "grad_norm": 1.0078125, + "learning_rate": 0.00042660200394934047, + "loss": 5.6182, + "mean_token_accuracy": 0.14943531677126884, + "num_tokens": 5043065.0, + "step": 1795 + }, + { + "entropy": 5.723861646652222, + "epoch": 0.048730964467005075, + "grad_norm": 0.87890625, + "learning_rate": 0.00042572940322238844, + "loss": 5.6695, + "mean_token_accuracy": 0.14552638530731202, + "num_tokens": 5057186.0, + "step": 1800 + }, + { + "entropy": 5.697584199905395, + "epoch": 0.0488663282571912, + "grad_norm": 1.0, + "learning_rate": 0.00042485267017270664, + "loss": 5.6677, + "mean_token_accuracy": 0.14745727330446243, + "num_tokens": 5070656.0, + "step": 1805 + }, + { + "entropy": 5.696168994903564, + "epoch": 0.049001692047377324, + "grad_norm": 0.90625, + "learning_rate": 0.0004239718288363745, + "loss": 5.5746, + "mean_token_accuracy": 0.15220395475625992, + "num_tokens": 5084586.0, + "step": 1810 + }, + { + "entropy": 5.629924297332764, + "epoch": 0.049137055837563455, + "grad_norm": 0.89453125, + "learning_rate": 0.0004230869033621023, + "loss": 5.5757, + "mean_token_accuracy": 0.14787699431180953, + "num_tokens": 5098994.0, + "step": 1815 + }, + { + "entropy": 5.748041343688965, + "epoch": 0.04927241962774958, + "grad_norm": 1.046875, + "learning_rate": 0.0004221979180105688, + "loss": 5.6422, + "mean_token_accuracy": 0.14642422050237655, + "num_tokens": 5112063.0, + "step": 1820 + }, + { + "entropy": 5.589199495315552, + "epoch": 0.049407783417935704, + "grad_norm": 1.0703125, + "learning_rate": 0.00042130489715375645, + "loss": 5.5928, + "mean_token_accuracy": 0.14088452607393265, + "num_tokens": 5125114.0, + "step": 1825 + }, + { + "entropy": 5.657587385177612, + "epoch": 0.04954314720812183, + "grad_norm": 1.0390625, + "learning_rate": 0.00042040786527428335, + "loss": 5.5843, + "mean_token_accuracy": 0.1488766610622406, + "num_tokens": 5137439.0, + "step": 1830 + }, + { + "entropy": 5.620833206176758, + "epoch": 0.04967851099830795, + "grad_norm": 0.9921875, + "learning_rate": 0.0004195068469647315, + "loss": 5.5275, + "mean_token_accuracy": 0.15381399989128114, + "num_tokens": 5151456.0, + "step": 1835 + }, + { + "entropy": 5.56364073753357, + "epoch": 0.04981387478849408, + "grad_norm": 0.921875, + "learning_rate": 0.00041860186692697297, + "loss": 5.5334, + "mean_token_accuracy": 0.1509672984480858, + "num_tokens": 5166494.0, + "step": 1840 + }, + { + "entropy": 5.724608564376831, + "epoch": 0.0499492385786802, + "grad_norm": 0.921875, + "learning_rate": 0.00041769294997149264, + "loss": 5.6809, + "mean_token_accuracy": 0.1437281422317028, + "num_tokens": 5182077.0, + "step": 1845 + }, + { + "entropy": 5.814406871795654, + "epoch": 0.050084602368866325, + "grad_norm": 0.953125, + "learning_rate": 0.0004167801210167081, + "loss": 5.7406, + "mean_token_accuracy": 0.14046868160367013, + "num_tokens": 5195702.0, + "step": 1850 + }, + { + "entropy": 5.645143127441406, + "epoch": 0.05021996615905246, + "grad_norm": 1.0078125, + "learning_rate": 0.0004158634050882861, + "loss": 5.5753, + "mean_token_accuracy": 0.149927581846714, + "num_tokens": 5209855.0, + "step": 1855 + }, + { + "entropy": 5.817540025711059, + "epoch": 0.05035532994923858, + "grad_norm": 1.03125, + "learning_rate": 0.0004149428273184569, + "loss": 5.6542, + "mean_token_accuracy": 0.14699074774980544, + "num_tokens": 5224585.0, + "step": 1860 + }, + { + "entropy": 5.497271156311035, + "epoch": 0.050490693739424705, + "grad_norm": 0.95703125, + "learning_rate": 0.0004140184129453253, + "loss": 5.4861, + "mean_token_accuracy": 0.1623205564916134, + "num_tokens": 5238681.0, + "step": 1865 + }, + { + "entropy": 5.642212295532227, + "epoch": 0.05062605752961083, + "grad_norm": 0.87109375, + "learning_rate": 0.000413090187312178, + "loss": 5.6379, + "mean_token_accuracy": 0.14622695744037628, + "num_tokens": 5253380.0, + "step": 1870 + }, + { + "entropy": 5.752071571350098, + "epoch": 0.050761421319796954, + "grad_norm": 0.953125, + "learning_rate": 0.0004121581758667898, + "loss": 5.5888, + "mean_token_accuracy": 0.14917353242635728, + "num_tokens": 5266227.0, + "step": 1875 + }, + { + "entropy": 5.602586889266968, + "epoch": 0.05089678510998308, + "grad_norm": 1.0, + "learning_rate": 0.00041122240416072533, + "loss": 5.5358, + "mean_token_accuracy": 0.14778123795986176, + "num_tokens": 5280582.0, + "step": 1880 + }, + { + "entropy": 5.582650089263916, + "epoch": 0.0510321489001692, + "grad_norm": 1.0546875, + "learning_rate": 0.0004102828978486385, + "loss": 5.6277, + "mean_token_accuracy": 0.14625633805990218, + "num_tokens": 5293588.0, + "step": 1885 + }, + { + "entropy": 5.778658056259156, + "epoch": 0.05116751269035533, + "grad_norm": 0.921875, + "learning_rate": 0.0004093396826875695, + "loss": 5.6307, + "mean_token_accuracy": 0.15253614038228988, + "num_tokens": 5306660.0, + "step": 1890 + }, + { + "entropy": 5.693345212936402, + "epoch": 0.05130287648054146, + "grad_norm": 1.0390625, + "learning_rate": 0.00040839278453623837, + "loss": 5.6564, + "mean_token_accuracy": 0.14705868065357208, + "num_tokens": 5321213.0, + "step": 1895 + }, + { + "entropy": 5.5740069389343265, + "epoch": 0.05143824027072758, + "grad_norm": 1.0625, + "learning_rate": 0.0004074422293543363, + "loss": 5.4629, + "mean_token_accuracy": 0.1561117112636566, + "num_tokens": 5333388.0, + "step": 1900 + }, + { + "entropy": 5.731689023971557, + "epoch": 0.05157360406091371, + "grad_norm": 0.91796875, + "learning_rate": 0.0004064880432018137, + "loss": 5.6677, + "mean_token_accuracy": 0.1454417496919632, + "num_tokens": 5347818.0, + "step": 1905 + }, + { + "entropy": 5.6437784194946286, + "epoch": 0.05170896785109983, + "grad_norm": 0.84375, + "learning_rate": 0.00040553025223816615, + "loss": 5.5623, + "mean_token_accuracy": 0.15110951960086821, + "num_tokens": 5361113.0, + "step": 1910 + }, + { + "entropy": 5.6192018508911135, + "epoch": 0.051844331641285955, + "grad_norm": 1.046875, + "learning_rate": 0.00040456888272171653, + "loss": 5.514, + "mean_token_accuracy": 0.15319421291351318, + "num_tokens": 5374588.0, + "step": 1915 + }, + { + "entropy": 5.594708824157715, + "epoch": 0.05197969543147208, + "grad_norm": 1.2890625, + "learning_rate": 0.00040360396100889577, + "loss": 5.4534, + "mean_token_accuracy": 0.1579025626182556, + "num_tokens": 5387947.0, + "step": 1920 + }, + { + "entropy": 5.686883783340454, + "epoch": 0.052115059221658204, + "grad_norm": 0.953125, + "learning_rate": 0.0004026355135535202, + "loss": 5.5768, + "mean_token_accuracy": 0.14642110466957092, + "num_tokens": 5401973.0, + "step": 1925 + }, + { + "entropy": 5.65032434463501, + "epoch": 0.05225042301184433, + "grad_norm": 1.140625, + "learning_rate": 0.000401663566906066, + "loss": 5.6805, + "mean_token_accuracy": 0.14293227344751358, + "num_tokens": 5414320.0, + "step": 1930 + }, + { + "entropy": 5.6758674621582035, + "epoch": 0.05238578680203046, + "grad_norm": 0.90625, + "learning_rate": 0.00040068814771294134, + "loss": 5.5703, + "mean_token_accuracy": 0.15153372585773467, + "num_tokens": 5428566.0, + "step": 1935 + }, + { + "entropy": 5.69721827507019, + "epoch": 0.052521150592216584, + "grad_norm": 1.0546875, + "learning_rate": 0.0003997092827157562, + "loss": 5.5449, + "mean_token_accuracy": 0.15088408589363098, + "num_tokens": 5442237.0, + "step": 1940 + }, + { + "entropy": 5.631793069839477, + "epoch": 0.05265651438240271, + "grad_norm": 0.984375, + "learning_rate": 0.000398726998750589, + "loss": 5.555, + "mean_token_accuracy": 0.14634450227022172, + "num_tokens": 5456123.0, + "step": 1945 + }, + { + "entropy": 5.550398159027099, + "epoch": 0.05279187817258883, + "grad_norm": 0.93359375, + "learning_rate": 0.00039774132274725076, + "loss": 5.4601, + "mean_token_accuracy": 0.15713558942079545, + "num_tokens": 5469958.0, + "step": 1950 + }, + { + "entropy": 5.612749671936035, + "epoch": 0.05292724196277496, + "grad_norm": 0.9453125, + "learning_rate": 0.00039675228172854707, + "loss": 5.5706, + "mean_token_accuracy": 0.1515437036752701, + "num_tokens": 5483537.0, + "step": 1955 + }, + { + "entropy": 5.541254329681396, + "epoch": 0.05306260575296108, + "grad_norm": 0.98828125, + "learning_rate": 0.0003957599028095371, + "loss": 5.52, + "mean_token_accuracy": 0.15656681656837462, + "num_tokens": 5496113.0, + "step": 1960 + }, + { + "entropy": 5.681048393249512, + "epoch": 0.053197969543147205, + "grad_norm": 0.9453125, + "learning_rate": 0.00039476421319679017, + "loss": 5.5984, + "mean_token_accuracy": 0.14592843279242515, + "num_tokens": 5510774.0, + "step": 1965 + }, + { + "entropy": 5.631022214889526, + "epoch": 0.05333333333333334, + "grad_norm": 0.90234375, + "learning_rate": 0.00039376524018764, + "loss": 5.5633, + "mean_token_accuracy": 0.15251765251159669, + "num_tokens": 5524804.0, + "step": 1970 + }, + { + "entropy": 5.578512382507324, + "epoch": 0.05346869712351946, + "grad_norm": 0.9453125, + "learning_rate": 0.00039276301116943616, + "loss": 5.5762, + "mean_token_accuracy": 0.14840420782566072, + "num_tokens": 5538080.0, + "step": 1975 + }, + { + "entropy": 5.642090654373169, + "epoch": 0.053604060913705585, + "grad_norm": 1.09375, + "learning_rate": 0.0003917575536187936, + "loss": 5.4796, + "mean_token_accuracy": 0.15499964654445647, + "num_tokens": 5551163.0, + "step": 1980 + }, + { + "entropy": 5.6105047225952145, + "epoch": 0.05373942470389171, + "grad_norm": 1.0390625, + "learning_rate": 0.00039074889510083894, + "loss": 5.5321, + "mean_token_accuracy": 0.14916370213031768, + "num_tokens": 5563033.0, + "step": 1985 + }, + { + "entropy": 5.6050855159759525, + "epoch": 0.053874788494077834, + "grad_norm": 0.8359375, + "learning_rate": 0.00038973706326845495, + "loss": 5.5097, + "mean_token_accuracy": 0.14798914641141891, + "num_tokens": 5578003.0, + "step": 1990 + }, + { + "entropy": 5.528244829177856, + "epoch": 0.05401015228426396, + "grad_norm": 1.0234375, + "learning_rate": 0.0003887220858615225, + "loss": 5.4304, + "mean_token_accuracy": 0.1600724771618843, + "num_tokens": 5590105.0, + "step": 1995 + }, + { + "entropy": 5.6911087989807125, + "epoch": 0.05414551607445008, + "grad_norm": 1.0234375, + "learning_rate": 0.0003877039907061597, + "loss": 5.6708, + "mean_token_accuracy": 0.14893444925546645, + "num_tokens": 5604410.0, + "step": 2000 + }, + { + "entropy": 5.698815584182739, + "epoch": 0.05428087986463621, + "grad_norm": 0.8828125, + "learning_rate": 0.0003866828057139598, + "loss": 5.5792, + "mean_token_accuracy": 0.15375161916017532, + "num_tokens": 5619735.0, + "step": 2005 + }, + { + "entropy": 5.719092321395874, + "epoch": 0.05441624365482234, + "grad_norm": 1.125, + "learning_rate": 0.00038565855888122503, + "loss": 5.6744, + "mean_token_accuracy": 0.14042194560170174, + "num_tokens": 5634119.0, + "step": 2010 + }, + { + "entropy": 5.584566402435303, + "epoch": 0.05455160744500846, + "grad_norm": 1.0703125, + "learning_rate": 0.00038463127828819975, + "loss": 5.4887, + "mean_token_accuracy": 0.1561438649892807, + "num_tokens": 5648254.0, + "step": 2015 + }, + { + "entropy": 5.588643312454224, + "epoch": 0.05468697123519459, + "grad_norm": 0.95703125, + "learning_rate": 0.00038360099209830043, + "loss": 5.5368, + "mean_token_accuracy": 0.1553065925836563, + "num_tokens": 5662954.0, + "step": 2020 + }, + { + "entropy": 5.600089883804321, + "epoch": 0.05482233502538071, + "grad_norm": 1.0234375, + "learning_rate": 0.0003825677285573433, + "loss": 5.4919, + "mean_token_accuracy": 0.15998355746269227, + "num_tokens": 5677230.0, + "step": 2025 + }, + { + "entropy": 5.567089080810547, + "epoch": 0.054957698815566836, + "grad_norm": 0.91015625, + "learning_rate": 0.00038153151599277027, + "loss": 5.5599, + "mean_token_accuracy": 0.1493852972984314, + "num_tokens": 5691909.0, + "step": 2030 + }, + { + "entropy": 5.523836088180542, + "epoch": 0.05509306260575296, + "grad_norm": 1.0078125, + "learning_rate": 0.0003804923828128723, + "loss": 5.4634, + "mean_token_accuracy": 0.15521894842386247, + "num_tokens": 5704644.0, + "step": 2035 + }, + { + "entropy": 5.595105218887329, + "epoch": 0.055228426395939084, + "grad_norm": 0.9375, + "learning_rate": 0.0003794503575060104, + "loss": 5.4873, + "mean_token_accuracy": 0.15124136358499526, + "num_tokens": 5719314.0, + "step": 2040 + }, + { + "entropy": 5.615251255035401, + "epoch": 0.05536379018612521, + "grad_norm": 1.09375, + "learning_rate": 0.00037840546863983484, + "loss": 5.6091, + "mean_token_accuracy": 0.15352071672677994, + "num_tokens": 5733464.0, + "step": 2045 + }, + { + "entropy": 5.596045446395874, + "epoch": 0.05549915397631134, + "grad_norm": 0.953125, + "learning_rate": 0.0003773577448605015, + "loss": 5.4564, + "mean_token_accuracy": 0.1583792507648468, + "num_tokens": 5747934.0, + "step": 2050 + }, + { + "entropy": 5.621100521087646, + "epoch": 0.055634517766497464, + "grad_norm": 1.0078125, + "learning_rate": 0.0003763072148918872, + "loss": 5.595, + "mean_token_accuracy": 0.14875475019216539, + "num_tokens": 5763152.0, + "step": 2055 + }, + { + "entropy": 5.664612340927124, + "epoch": 0.05576988155668359, + "grad_norm": 0.953125, + "learning_rate": 0.0003752539075348017, + "loss": 5.621, + "mean_token_accuracy": 0.1492762856185436, + "num_tokens": 5777125.0, + "step": 2060 + }, + { + "entropy": 5.5557661056518555, + "epoch": 0.05590524534686971, + "grad_norm": 1.0, + "learning_rate": 0.00037419785166619817, + "loss": 5.4585, + "mean_token_accuracy": 0.15448152869939805, + "num_tokens": 5790844.0, + "step": 2065 + }, + { + "entropy": 5.711333417892456, + "epoch": 0.05604060913705584, + "grad_norm": 1.0234375, + "learning_rate": 0.0003731390762383818, + "loss": 5.6297, + "mean_token_accuracy": 0.15116460025310516, + "num_tokens": 5804419.0, + "step": 2070 + }, + { + "entropy": 5.697661542892456, + "epoch": 0.05617597292724196, + "grad_norm": 0.97265625, + "learning_rate": 0.0003720776102782158, + "loss": 5.5238, + "mean_token_accuracy": 0.15059797763824462, + "num_tokens": 5818710.0, + "step": 2075 + }, + { + "entropy": 5.481573247909546, + "epoch": 0.056311336717428086, + "grad_norm": 0.90234375, + "learning_rate": 0.00037101348288632555, + "loss": 5.4792, + "mean_token_accuracy": 0.15036241486668586, + "num_tokens": 5832986.0, + "step": 2080 + }, + { + "entropy": 5.6798604965209964, + "epoch": 0.05644670050761421, + "grad_norm": 1.09375, + "learning_rate": 0.0003699467232363012, + "loss": 5.6005, + "mean_token_accuracy": 0.14628931134939194, + "num_tokens": 5847273.0, + "step": 2085 + }, + { + "entropy": 5.626612424850464, + "epoch": 0.05658206429780034, + "grad_norm": 0.97265625, + "learning_rate": 0.0003688773605738973, + "loss": 5.4952, + "mean_token_accuracy": 0.15603184401988984, + "num_tokens": 5860585.0, + "step": 2090 + }, + { + "entropy": 5.655035018920898, + "epoch": 0.056717428087986466, + "grad_norm": 0.93359375, + "learning_rate": 0.00036780542421623134, + "loss": 5.6352, + "mean_token_accuracy": 0.15595826059579848, + "num_tokens": 5874305.0, + "step": 2095 + }, + { + "entropy": 5.631872653961182, + "epoch": 0.05685279187817259, + "grad_norm": 0.93359375, + "learning_rate": 0.0003667309435509802, + "loss": 5.5025, + "mean_token_accuracy": 0.15525192618370057, + "num_tokens": 5888975.0, + "step": 2100 + }, + { + "entropy": 5.599838733673096, + "epoch": 0.056988155668358714, + "grad_norm": 1.1015625, + "learning_rate": 0.0003656539480355741, + "loss": 5.4398, + "mean_token_accuracy": 0.15944063067436218, + "num_tokens": 5902132.0, + "step": 2105 + }, + { + "entropy": 5.597221994400025, + "epoch": 0.05712351945854484, + "grad_norm": 1.03125, + "learning_rate": 0.0003645744671963891, + "loss": 5.4945, + "mean_token_accuracy": 0.15443069338798524, + "num_tokens": 5916030.0, + "step": 2110 + }, + { + "entropy": 5.598980569839478, + "epoch": 0.05725888324873096, + "grad_norm": 1.0625, + "learning_rate": 0.0003634925306279376, + "loss": 5.4403, + "mean_token_accuracy": 0.15974231958389282, + "num_tokens": 5928290.0, + "step": 2115 + }, + { + "entropy": 5.579548406600952, + "epoch": 0.05739424703891709, + "grad_norm": 1.046875, + "learning_rate": 0.0003624081679920574, + "loss": 5.5052, + "mean_token_accuracy": 0.1567055270075798, + "num_tokens": 5940463.0, + "step": 2120 + }, + { + "entropy": 5.538625049591064, + "epoch": 0.05752961082910321, + "grad_norm": 1.078125, + "learning_rate": 0.0003613214090170977, + "loss": 5.4353, + "mean_token_accuracy": 0.1593435138463974, + "num_tokens": 5954114.0, + "step": 2125 + }, + { + "entropy": 5.529782009124756, + "epoch": 0.05766497461928934, + "grad_norm": 1.0546875, + "learning_rate": 0.0003602322834971048, + "loss": 5.4826, + "mean_token_accuracy": 0.16051046177744865, + "num_tokens": 5968004.0, + "step": 2130 + }, + { + "entropy": 5.56360445022583, + "epoch": 0.05780033840947547, + "grad_norm": 0.95703125, + "learning_rate": 0.0003591408212910051, + "loss": 5.4107, + "mean_token_accuracy": 0.15503834784030915, + "num_tokens": 5981749.0, + "step": 2135 + }, + { + "entropy": 5.674638128280639, + "epoch": 0.05793570219966159, + "grad_norm": 1.0546875, + "learning_rate": 0.0003580470523217863, + "loss": 5.6603, + "mean_token_accuracy": 0.1459052950143814, + "num_tokens": 5995872.0, + "step": 2140 + }, + { + "entropy": 5.516640329360962, + "epoch": 0.058071065989847716, + "grad_norm": 1.015625, + "learning_rate": 0.0003569510065756771, + "loss": 5.4613, + "mean_token_accuracy": 0.159725384414196, + "num_tokens": 6010511.0, + "step": 2145 + }, + { + "entropy": 5.602073812484742, + "epoch": 0.05820642978003384, + "grad_norm": 0.96484375, + "learning_rate": 0.0003558527141013254, + "loss": 5.5, + "mean_token_accuracy": 0.15657427310943603, + "num_tokens": 6024122.0, + "step": 2150 + }, + { + "entropy": 5.603561973571777, + "epoch": 0.058341793570219964, + "grad_norm": 0.95703125, + "learning_rate": 0.0003547522050089742, + "loss": 5.4806, + "mean_token_accuracy": 0.16240517124533654, + "num_tokens": 6038779.0, + "step": 2155 + }, + { + "entropy": 5.605594062805176, + "epoch": 0.05847715736040609, + "grad_norm": 0.9140625, + "learning_rate": 0.00035364950946963606, + "loss": 5.4582, + "mean_token_accuracy": 0.155762480199337, + "num_tokens": 6052030.0, + "step": 2160 + }, + { + "entropy": 5.573745393753052, + "epoch": 0.05861252115059222, + "grad_norm": 0.921875, + "learning_rate": 0.0003525446577142663, + "loss": 5.5071, + "mean_token_accuracy": 0.1532558962702751, + "num_tokens": 6066580.0, + "step": 2165 + }, + { + "entropy": 5.605597829818725, + "epoch": 0.058747884940778344, + "grad_norm": 0.921875, + "learning_rate": 0.00035143768003293395, + "loss": 5.5391, + "mean_token_accuracy": 0.15521732419729234, + "num_tokens": 6081902.0, + "step": 2170 + }, + { + "entropy": 5.6139661312103275, + "epoch": 0.05888324873096447, + "grad_norm": 0.9375, + "learning_rate": 0.0003503286067739913, + "loss": 5.5386, + "mean_token_accuracy": 0.1476532280445099, + "num_tokens": 6096694.0, + "step": 2175 + }, + { + "entropy": 5.541563320159912, + "epoch": 0.05901861252115059, + "grad_norm": 0.96875, + "learning_rate": 0.00034921746834324193, + "loss": 5.4467, + "mean_token_accuracy": 0.1517432898283005, + "num_tokens": 6112894.0, + "step": 2180 + }, + { + "entropy": 5.5798078060150145, + "epoch": 0.05915397631133672, + "grad_norm": 0.98828125, + "learning_rate": 0.0003481042952031072, + "loss": 5.499, + "mean_token_accuracy": 0.16076818704605103, + "num_tokens": 6125753.0, + "step": 2185 + }, + { + "entropy": 5.762272024154663, + "epoch": 0.05928934010152284, + "grad_norm": 0.91796875, + "learning_rate": 0.0003469891178717911, + "loss": 5.6864, + "mean_token_accuracy": 0.14467110186815263, + "num_tokens": 6139487.0, + "step": 2190 + }, + { + "entropy": 5.568824195861817, + "epoch": 0.059424703891708966, + "grad_norm": 0.84765625, + "learning_rate": 0.0003458719669224436, + "loss": 5.4139, + "mean_token_accuracy": 0.15835953801870345, + "num_tokens": 6155195.0, + "step": 2195 + }, + { + "entropy": 5.551574659347534, + "epoch": 0.05956006768189509, + "grad_norm": 1.0390625, + "learning_rate": 0.0003447528729823221, + "loss": 5.5192, + "mean_token_accuracy": 0.15438710078597068, + "num_tokens": 6168836.0, + "step": 2200 + }, + { + "entropy": 5.640334033966065, + "epoch": 0.05969543147208122, + "grad_norm": 0.9921875, + "learning_rate": 0.0003436318667319525, + "loss": 5.522, + "mean_token_accuracy": 0.16132964789867402, + "num_tokens": 6182513.0, + "step": 2205 + }, + { + "entropy": 5.578224229812622, + "epoch": 0.059830795262267346, + "grad_norm": 1.015625, + "learning_rate": 0.00034250897890428716, + "loss": 5.4526, + "mean_token_accuracy": 0.15591600388288498, + "num_tokens": 6196641.0, + "step": 2210 + }, + { + "entropy": 5.471917009353637, + "epoch": 0.05996615905245347, + "grad_norm": 0.96484375, + "learning_rate": 0.0003413842402838633, + "loss": 5.3832, + "mean_token_accuracy": 0.16338237076997758, + "num_tokens": 6210446.0, + "step": 2215 + }, + { + "entropy": 5.558266496658325, + "epoch": 0.060101522842639594, + "grad_norm": 1.0, + "learning_rate": 0.00034025768170595834, + "loss": 5.4801, + "mean_token_accuracy": 0.15260896682739258, + "num_tokens": 6223168.0, + "step": 2220 + }, + { + "entropy": 5.594317674636841, + "epoch": 0.06023688663282572, + "grad_norm": 1.0703125, + "learning_rate": 0.0003391293340557446, + "loss": 5.5317, + "mean_token_accuracy": 0.15804025083780288, + "num_tokens": 6236136.0, + "step": 2225 + }, + { + "entropy": 5.661670207977295, + "epoch": 0.06037225042301184, + "grad_norm": 0.92578125, + "learning_rate": 0.0003379992282674431, + "loss": 5.6567, + "mean_token_accuracy": 0.14315905719995498, + "num_tokens": 6250260.0, + "step": 2230 + }, + { + "entropy": 5.584939670562744, + "epoch": 0.06050761421319797, + "grad_norm": 1.125, + "learning_rate": 0.0003368673953234749, + "loss": 5.4497, + "mean_token_accuracy": 0.1615369811654091, + "num_tokens": 6264510.0, + "step": 2235 + }, + { + "entropy": 5.551972198486328, + "epoch": 0.06064297800338409, + "grad_norm": 0.83203125, + "learning_rate": 0.00033573386625361176, + "loss": 5.3992, + "mean_token_accuracy": 0.15868130326271057, + "num_tokens": 6280784.0, + "step": 2240 + }, + { + "entropy": 5.652569103240967, + "epoch": 0.06077834179357022, + "grad_norm": 1.0078125, + "learning_rate": 0.00033459867213412567, + "loss": 5.5289, + "mean_token_accuracy": 0.15628519803285598, + "num_tokens": 6294819.0, + "step": 2245 + }, + { + "entropy": 5.400842475891113, + "epoch": 0.06091370558375635, + "grad_norm": 0.96875, + "learning_rate": 0.000333461844086937, + "loss": 5.3094, + "mean_token_accuracy": 0.16555650681257247, + "num_tokens": 6309654.0, + "step": 2250 + }, + { + "entropy": 5.477272796630859, + "epoch": 0.06104906937394247, + "grad_norm": 1.0390625, + "learning_rate": 0.00033232341327876097, + "loss": 5.4673, + "mean_token_accuracy": 0.16471943408250808, + "num_tokens": 6322804.0, + "step": 2255 + }, + { + "entropy": 5.658356094360352, + "epoch": 0.061184433164128596, + "grad_norm": 1.046875, + "learning_rate": 0.0003311834109202531, + "loss": 5.5506, + "mean_token_accuracy": 0.1548818677663803, + "num_tokens": 6336513.0, + "step": 2260 + }, + { + "entropy": 5.56692852973938, + "epoch": 0.06131979695431472, + "grad_norm": 1.0390625, + "learning_rate": 0.00033004186826515416, + "loss": 5.5298, + "mean_token_accuracy": 0.15601305216550826, + "num_tokens": 6349883.0, + "step": 2265 + }, + { + "entropy": 5.621473360061645, + "epoch": 0.061455160744500845, + "grad_norm": 1.0625, + "learning_rate": 0.0003288988166094324, + "loss": 5.5471, + "mean_token_accuracy": 0.15290187150239945, + "num_tokens": 6363163.0, + "step": 2270 + }, + { + "entropy": 5.6147716522216795, + "epoch": 0.06159052453468697, + "grad_norm": 1.0078125, + "learning_rate": 0.00032775428729042656, + "loss": 5.4855, + "mean_token_accuracy": 0.15710740610957147, + "num_tokens": 6377689.0, + "step": 2275 + }, + { + "entropy": 5.543179178237915, + "epoch": 0.06172588832487309, + "grad_norm": 0.98828125, + "learning_rate": 0.000326608311685986, + "loss": 5.3916, + "mean_token_accuracy": 0.15376305133104323, + "num_tokens": 6391921.0, + "step": 2280 + }, + { + "entropy": 5.585430002212524, + "epoch": 0.061861252115059225, + "grad_norm": 0.98828125, + "learning_rate": 0.0003254609212136108, + "loss": 5.5179, + "mean_token_accuracy": 0.1545792117714882, + "num_tokens": 6406731.0, + "step": 2285 + }, + { + "entropy": 5.570159673690796, + "epoch": 0.06199661590524535, + "grad_norm": 0.91796875, + "learning_rate": 0.00032431214732959036, + "loss": 5.5019, + "mean_token_accuracy": 0.15775589048862457, + "num_tokens": 6420403.0, + "step": 2290 + }, + { + "entropy": 5.589111185073852, + "epoch": 0.06213197969543147, + "grad_norm": 0.92578125, + "learning_rate": 0.000323162021528141, + "loss": 5.496, + "mean_token_accuracy": 0.153490050137043, + "num_tokens": 6434852.0, + "step": 2295 + }, + { + "entropy": 5.513012456893921, + "epoch": 0.0622673434856176, + "grad_norm": 1.0625, + "learning_rate": 0.00032201057534054264, + "loss": 5.4013, + "mean_token_accuracy": 0.16139222010970117, + "num_tokens": 6448481.0, + "step": 2300 + }, + { + "entropy": 5.525697946548462, + "epoch": 0.06240270727580372, + "grad_norm": 0.93359375, + "learning_rate": 0.00032085784033427414, + "loss": 5.4119, + "mean_token_accuracy": 0.15614687353372575, + "num_tokens": 6462149.0, + "step": 2305 + }, + { + "entropy": 5.631346750259399, + "epoch": 0.06253807106598985, + "grad_norm": 1.0, + "learning_rate": 0.0003197038481121478, + "loss": 5.57, + "mean_token_accuracy": 0.15901135355234147, + "num_tokens": 6475847.0, + "step": 2310 + }, + { + "entropy": 5.519312572479248, + "epoch": 0.06267343485617598, + "grad_norm": 1.171875, + "learning_rate": 0.0003185486303114436, + "loss": 5.4104, + "mean_token_accuracy": 0.15896950513124466, + "num_tokens": 6488881.0, + "step": 2315 + }, + { + "entropy": 5.459926891326904, + "epoch": 0.0628087986463621, + "grad_norm": 0.9921875, + "learning_rate": 0.0003173922186030409, + "loss": 5.3378, + "mean_token_accuracy": 0.16899482160806656, + "num_tokens": 6502019.0, + "step": 2320 + }, + { + "entropy": 5.500802850723266, + "epoch": 0.06294416243654823, + "grad_norm": 1.03125, + "learning_rate": 0.000316234644690551, + "loss": 5.4286, + "mean_token_accuracy": 0.1598815768957138, + "num_tokens": 6516025.0, + "step": 2325 + }, + { + "entropy": 5.611294984817505, + "epoch": 0.06307952622673435, + "grad_norm": 0.99609375, + "learning_rate": 0.0003150759403094473, + "loss": 5.5137, + "mean_token_accuracy": 0.15525443553924562, + "num_tokens": 6532164.0, + "step": 2330 + }, + { + "entropy": 5.551161003112793, + "epoch": 0.06321489001692047, + "grad_norm": 1.03125, + "learning_rate": 0.00031391613722619587, + "loss": 5.3971, + "mean_token_accuracy": 0.15851665437221527, + "num_tokens": 6545729.0, + "step": 2335 + }, + { + "entropy": 5.541462421417236, + "epoch": 0.0633502538071066, + "grad_norm": 0.953125, + "learning_rate": 0.000312755267237384, + "loss": 5.3707, + "mean_token_accuracy": 0.15949714332818984, + "num_tokens": 6559398.0, + "step": 2340 + }, + { + "entropy": 5.5119524002075195, + "epoch": 0.06348561759729272, + "grad_norm": 0.9453125, + "learning_rate": 0.0003115933621688488, + "loss": 5.481, + "mean_token_accuracy": 0.15978508144617082, + "num_tokens": 6575516.0, + "step": 2345 + }, + { + "entropy": 5.600857067108154, + "epoch": 0.06362098138747885, + "grad_norm": 1.046875, + "learning_rate": 0.00031043045387480487, + "loss": 5.4257, + "mean_token_accuracy": 0.15539521276950835, + "num_tokens": 6587894.0, + "step": 2350 + }, + { + "entropy": 5.5432634353637695, + "epoch": 0.06375634517766497, + "grad_norm": 0.9609375, + "learning_rate": 0.0003092665742369703, + "loss": 5.4473, + "mean_token_accuracy": 0.16352478563785552, + "num_tokens": 6603355.0, + "step": 2355 + }, + { + "entropy": 5.5917826175689695, + "epoch": 0.0638917089678511, + "grad_norm": 1.0078125, + "learning_rate": 0.00030810175516369343, + "loss": 5.5569, + "mean_token_accuracy": 0.152334725856781, + "num_tokens": 6618677.0, + "step": 2360 + }, + { + "entropy": 5.666406059265137, + "epoch": 0.06402707275803722, + "grad_norm": 0.98828125, + "learning_rate": 0.0003069360285890775, + "loss": 5.5159, + "mean_token_accuracy": 0.15209025740623475, + "num_tokens": 6635415.0, + "step": 2365 + }, + { + "entropy": 5.668917846679688, + "epoch": 0.06416243654822334, + "grad_norm": 1.0546875, + "learning_rate": 0.00030576942647210547, + "loss": 5.6671, + "mean_token_accuracy": 0.15406512916088105, + "num_tokens": 6650605.0, + "step": 2370 + }, + { + "entropy": 5.528806543350219, + "epoch": 0.06429780033840947, + "grad_norm": 0.953125, + "learning_rate": 0.00030460198079576355, + "loss": 5.3962, + "mean_token_accuracy": 0.16389574855566025, + "num_tokens": 6664430.0, + "step": 2375 + }, + { + "entropy": 5.590758180618286, + "epoch": 0.06443316412859561, + "grad_norm": 1.015625, + "learning_rate": 0.0003034337235661648, + "loss": 5.3776, + "mean_token_accuracy": 0.16676643639802932, + "num_tokens": 6677763.0, + "step": 2380 + }, + { + "entropy": 5.4963232517242435, + "epoch": 0.06456852791878173, + "grad_norm": 0.984375, + "learning_rate": 0.0003022646868116714, + "loss": 5.3369, + "mean_token_accuracy": 0.1656413570046425, + "num_tokens": 6691694.0, + "step": 2385 + }, + { + "entropy": 5.495297574996949, + "epoch": 0.06470389170896786, + "grad_norm": 0.9921875, + "learning_rate": 0.0003010949025820163, + "loss": 5.4282, + "mean_token_accuracy": 0.16844454854726792, + "num_tokens": 6707451.0, + "step": 2390 + }, + { + "entropy": 5.507102966308594, + "epoch": 0.06483925549915398, + "grad_norm": 1.0, + "learning_rate": 0.0002999244029474252, + "loss": 5.3812, + "mean_token_accuracy": 0.16256919205188752, + "num_tokens": 6721556.0, + "step": 2395 + }, + { + "entropy": 5.582904243469239, + "epoch": 0.0649746192893401, + "grad_norm": 0.99609375, + "learning_rate": 0.00029875321999773684, + "loss": 5.4365, + "mean_token_accuracy": 0.1632665753364563, + "num_tokens": 6734588.0, + "step": 2400 + }, + { + "entropy": 5.4878991603851315, + "epoch": 0.06510998307952623, + "grad_norm": 0.96875, + "learning_rate": 0.00029758138584152333, + "loss": 5.4356, + "mean_token_accuracy": 0.16168006360530854, + "num_tokens": 6747712.0, + "step": 2405 + }, + { + "entropy": 5.454759693145752, + "epoch": 0.06524534686971235, + "grad_norm": 1.046875, + "learning_rate": 0.0002964089326052102, + "loss": 5.3916, + "mean_token_accuracy": 0.16523440480232238, + "num_tokens": 6761410.0, + "step": 2410 + }, + { + "entropy": 5.61132550239563, + "epoch": 0.06538071065989848, + "grad_norm": 0.91796875, + "learning_rate": 0.0002952358924321949, + "loss": 5.518, + "mean_token_accuracy": 0.1567309945821762, + "num_tokens": 6776003.0, + "step": 2415 + }, + { + "entropy": 5.593502044677734, + "epoch": 0.0655160744500846, + "grad_norm": 0.97265625, + "learning_rate": 0.00029406229748196657, + "loss": 5.4497, + "mean_token_accuracy": 0.16475784331560134, + "num_tokens": 6790709.0, + "step": 2420 + }, + { + "entropy": 5.519558477401733, + "epoch": 0.06565143824027073, + "grad_norm": 0.99609375, + "learning_rate": 0.0002928881799292235, + "loss": 5.4502, + "mean_token_accuracy": 0.15292711034417153, + "num_tokens": 6804682.0, + "step": 2425 + }, + { + "entropy": 5.496097755432129, + "epoch": 0.06578680203045685, + "grad_norm": 1.078125, + "learning_rate": 0.00029171357196299154, + "loss": 5.3023, + "mean_token_accuracy": 0.1671382039785385, + "num_tokens": 6816787.0, + "step": 2430 + }, + { + "entropy": 5.5248020648956295, + "epoch": 0.06592216582064298, + "grad_norm": 0.8984375, + "learning_rate": 0.0002905385057857414, + "loss": 5.3747, + "mean_token_accuracy": 0.16119658052921296, + "num_tokens": 6832773.0, + "step": 2435 + }, + { + "entropy": 5.525621557235718, + "epoch": 0.0660575296108291, + "grad_norm": 1.078125, + "learning_rate": 0.0002893630136125058, + "loss": 5.4688, + "mean_token_accuracy": 0.15827736407518386, + "num_tokens": 6847640.0, + "step": 2440 + }, + { + "entropy": 5.430527544021606, + "epoch": 0.06619289340101522, + "grad_norm": 0.97265625, + "learning_rate": 0.0002881871276699967, + "loss": 5.3552, + "mean_token_accuracy": 0.16867494881153106, + "num_tokens": 6860824.0, + "step": 2445 + }, + { + "entropy": 5.561198711395264, + "epoch": 0.06632825719120135, + "grad_norm": 0.9375, + "learning_rate": 0.00028701088019572114, + "loss": 5.4154, + "mean_token_accuracy": 0.16522417813539506, + "num_tokens": 6875275.0, + "step": 2450 + }, + { + "entropy": 5.504469585418701, + "epoch": 0.06646362098138747, + "grad_norm": 0.90625, + "learning_rate": 0.0002858343034370977, + "loss": 5.4315, + "mean_token_accuracy": 0.16247233897447586, + "num_tokens": 6889204.0, + "step": 2455 + }, + { + "entropy": 5.62698335647583, + "epoch": 0.06659898477157361, + "grad_norm": 0.87109375, + "learning_rate": 0.00028465742965057267, + "loss": 5.4637, + "mean_token_accuracy": 0.15535432547330857, + "num_tokens": 6904921.0, + "step": 2460 + }, + { + "entropy": 5.487014389038086, + "epoch": 0.06673434856175973, + "grad_norm": 0.9921875, + "learning_rate": 0.00028348029110073533, + "loss": 5.4044, + "mean_token_accuracy": 0.16557617038488387, + "num_tokens": 6918655.0, + "step": 2465 + }, + { + "entropy": 5.577527332305908, + "epoch": 0.06686971235194586, + "grad_norm": 1.015625, + "learning_rate": 0.00028230292005943365, + "loss": 5.4711, + "mean_token_accuracy": 0.16226180791854858, + "num_tokens": 6932828.0, + "step": 2470 + }, + { + "entropy": 5.516256475448609, + "epoch": 0.06700507614213198, + "grad_norm": 0.953125, + "learning_rate": 0.00028112534880488945, + "loss": 5.3411, + "mean_token_accuracy": 0.16999999433755875, + "num_tokens": 6945109.0, + "step": 2475 + }, + { + "entropy": 5.428887033462525, + "epoch": 0.06714043993231811, + "grad_norm": 1.0625, + "learning_rate": 0.0002799476096208137, + "loss": 5.3381, + "mean_token_accuracy": 0.16663481295108795, + "num_tokens": 6958474.0, + "step": 2480 + }, + { + "entropy": 5.509528636932373, + "epoch": 0.06727580372250423, + "grad_norm": 0.99609375, + "learning_rate": 0.00027876973479552087, + "loss": 5.4112, + "mean_token_accuracy": 0.16581467241048814, + "num_tokens": 6971847.0, + "step": 2485 + }, + { + "entropy": 5.571677732467651, + "epoch": 0.06741116751269036, + "grad_norm": 0.91796875, + "learning_rate": 0.00027759175662104424, + "loss": 5.3789, + "mean_token_accuracy": 0.16470448225736617, + "num_tokens": 6985637.0, + "step": 2490 + }, + { + "entropy": 5.432705068588257, + "epoch": 0.06754653130287648, + "grad_norm": 1.0390625, + "learning_rate": 0.0002764137073922508, + "loss": 5.3402, + "mean_token_accuracy": 0.17244728654623032, + "num_tokens": 6999074.0, + "step": 2495 + }, + { + "entropy": 5.488432264328003, + "epoch": 0.0676818950930626, + "grad_norm": 1.0078125, + "learning_rate": 0.00027523561940595505, + "loss": 5.2963, + "mean_token_accuracy": 0.17337176203727722, + "num_tokens": 7012184.0, + "step": 2500 + } + ], + "logging_steps": 5, + "max_steps": 4000, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2391276529664e+16, + "train_batch_size": 16, + "trial_name": null, + "trial_params": null +}