{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.16, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692202186584472, "epoch": 0.0005333333333333334, "grad_norm": 15.75, "learning_rate": 2e-06, "loss": 11.0362, "mean_token_accuracy": 7.338551804423333e-05, "num_tokens": 81920.0, "step": 5 }, { "entropy": 10.69208927154541, "epoch": 0.0010666666666666667, "grad_norm": 15.0, "learning_rate": 4.5e-06, "loss": 10.9165, "mean_token_accuracy": 0.0003424657508730888, "num_tokens": 163840.0, "step": 10 }, { "entropy": 10.690902614593506, "epoch": 0.0016, "grad_norm": 10.0625, "learning_rate": 7e-06, "loss": 10.5112, "mean_token_accuracy": 0.04739481443539262, "num_tokens": 245760.0, "step": 15 }, { "entropy": 10.675402927398682, "epoch": 0.0021333333333333334, "grad_norm": 5.65625, "learning_rate": 9.5e-06, "loss": 10.0191, "mean_token_accuracy": 0.06303815953433514, "num_tokens": 327680.0, "step": 20 }, { "entropy": 10.631837749481202, "epoch": 0.0026666666666666666, "grad_norm": 3.546875, "learning_rate": 1.2e-05, "loss": 9.6081, "mean_token_accuracy": 0.0619618397206068, "num_tokens": 409600.0, "step": 25 }, { "entropy": 10.630702686309814, "epoch": 0.0032, "grad_norm": 3.03125, "learning_rate": 1.4500000000000002e-05, "loss": 9.3958, "mean_token_accuracy": 0.06272015646100045, "num_tokens": 491520.0, "step": 30 }, { "entropy": 10.616136837005616, "epoch": 0.0037333333333333333, "grad_norm": 3.046875, "learning_rate": 1.7000000000000003e-05, "loss": 9.2705, "mean_token_accuracy": 0.06243884563446045, "num_tokens": 573440.0, "step": 35 }, { "entropy": 10.615250396728516, "epoch": 0.004266666666666667, "grad_norm": 2.96875, "learning_rate": 1.95e-05, "loss": 9.0997, "mean_token_accuracy": 0.06679305247962475, "num_tokens": 655360.0, "step": 40 }, { "entropy": 10.601798248291015, "epoch": 0.0048, "grad_norm": 2.90625, "learning_rate": 2.2e-05, "loss": 8.9015, "mean_token_accuracy": 0.08314579203724862, "num_tokens": 737280.0, "step": 45 }, { "entropy": 10.51156063079834, "epoch": 0.005333333333333333, "grad_norm": 2.71875, "learning_rate": 2.4500000000000003e-05, "loss": 8.7423, "mean_token_accuracy": 0.08902886360883713, "num_tokens": 819200.0, "step": 50 }, { "entropy": 10.398311328887939, "epoch": 0.005866666666666667, "grad_norm": 2.625, "learning_rate": 2.7e-05, "loss": 8.604, "mean_token_accuracy": 0.09022749587893486, "num_tokens": 901120.0, "step": 55 }, { "entropy": 10.375072383880616, "epoch": 0.0064, "grad_norm": 2.6875, "learning_rate": 2.95e-05, "loss": 8.4781, "mean_token_accuracy": 0.08942025527358055, "num_tokens": 983040.0, "step": 60 }, { "entropy": 10.373117828369141, "epoch": 0.006933333333333333, "grad_norm": 2.59375, "learning_rate": 3.2e-05, "loss": 8.3278, "mean_token_accuracy": 0.09103473573923111, "num_tokens": 1064960.0, "step": 65 }, { "entropy": 10.389276027679443, "epoch": 0.007466666666666667, "grad_norm": 2.65625, "learning_rate": 3.4500000000000005e-05, "loss": 8.1902, "mean_token_accuracy": 0.08838062658905983, "num_tokens": 1146880.0, "step": 70 }, { "entropy": 10.346378612518311, "epoch": 0.008, "grad_norm": 2.53125, "learning_rate": 3.7e-05, "loss": 8.0119, "mean_token_accuracy": 0.09025195613503456, "num_tokens": 1228800.0, "step": 75 }, { "entropy": 10.33881072998047, "epoch": 0.008533333333333334, "grad_norm": 2.515625, "learning_rate": 3.95e-05, "loss": 7.8607, "mean_token_accuracy": 0.08929794505238534, "num_tokens": 1310720.0, "step": 80 }, { "entropy": 10.319882678985596, "epoch": 0.009066666666666667, "grad_norm": 2.578125, "learning_rate": 4.2000000000000004e-05, "loss": 7.6599, "mean_token_accuracy": 0.09436154589056969, "num_tokens": 1392640.0, "step": 85 }, { "entropy": 10.274563980102538, "epoch": 0.0096, "grad_norm": 2.484375, "learning_rate": 4.45e-05, "loss": 7.4498, "mean_token_accuracy": 0.09596379622817039, "num_tokens": 1474560.0, "step": 90 }, { "entropy": 10.254796314239503, "epoch": 0.010133333333333333, "grad_norm": 2.484375, "learning_rate": 4.7000000000000004e-05, "loss": 7.2388, "mean_token_accuracy": 0.09705234840512275, "num_tokens": 1556480.0, "step": 95 }, { "entropy": 10.20362606048584, "epoch": 0.010666666666666666, "grad_norm": 2.453125, "learning_rate": 4.9500000000000004e-05, "loss": 6.9913, "mean_token_accuracy": 0.10337573289871216, "num_tokens": 1638400.0, "step": 100 }, { "entropy": 10.102453422546386, "epoch": 0.0112, "grad_norm": 2.8125, "learning_rate": 5.2e-05, "loss": 6.7199, "mean_token_accuracy": 0.11284246444702148, "num_tokens": 1720320.0, "step": 105 }, { "entropy": 10.014357852935792, "epoch": 0.011733333333333333, "grad_norm": 3.171875, "learning_rate": 5.45e-05, "loss": 6.4546, "mean_token_accuracy": 0.12188111543655396, "num_tokens": 1802240.0, "step": 110 }, { "entropy": 9.865539932250977, "epoch": 0.012266666666666667, "grad_norm": 2.234375, "learning_rate": 5.7e-05, "loss": 6.1614, "mean_token_accuracy": 0.12569716200232506, "num_tokens": 1884160.0, "step": 115 }, { "entropy": 9.654939365386962, "epoch": 0.0128, "grad_norm": 2.140625, "learning_rate": 5.9499999999999996e-05, "loss": 5.8674, "mean_token_accuracy": 0.1292685903608799, "num_tokens": 1966080.0, "step": 120 }, { "entropy": 9.285263824462891, "epoch": 0.013333333333333334, "grad_norm": 2.125, "learning_rate": 6.2e-05, "loss": 5.5809, "mean_token_accuracy": 0.13335371538996696, "num_tokens": 2048000.0, "step": 125 }, { "entropy": 8.893216991424561, "epoch": 0.013866666666666666, "grad_norm": 1.84375, "learning_rate": 6.450000000000001e-05, "loss": 5.3149, "mean_token_accuracy": 0.13040606752038003, "num_tokens": 2129920.0, "step": 130 }, { "entropy": 8.3220458984375, "epoch": 0.0144, "grad_norm": 2.171875, "learning_rate": 6.7e-05, "loss": 5.0512, "mean_token_accuracy": 0.13522505015134811, "num_tokens": 2211840.0, "step": 135 }, { "entropy": 7.719539833068848, "epoch": 0.014933333333333333, "grad_norm": 1.359375, "learning_rate": 6.950000000000001e-05, "loss": 4.8233, "mean_token_accuracy": 0.13852739930152894, "num_tokens": 2293760.0, "step": 140 }, { "entropy": 7.1180624008178714, "epoch": 0.015466666666666667, "grad_norm": 1.265625, "learning_rate": 7.2e-05, "loss": 4.6641, "mean_token_accuracy": 0.13579990416765214, "num_tokens": 2375680.0, "step": 145 }, { "entropy": 6.465722370147705, "epoch": 0.016, "grad_norm": 0.9765625, "learning_rate": 7.45e-05, "loss": 4.5133, "mean_token_accuracy": 0.13872309327125548, "num_tokens": 2457600.0, "step": 150 }, { "entropy": 5.973577833175659, "epoch": 0.016533333333333334, "grad_norm": 1.125, "learning_rate": 7.7e-05, "loss": 4.4339, "mean_token_accuracy": 0.13631360232830048, "num_tokens": 2539520.0, "step": 155 }, { "entropy": 5.60869870185852, "epoch": 0.017066666666666667, "grad_norm": 1.1484375, "learning_rate": 7.950000000000001e-05, "loss": 4.3677, "mean_token_accuracy": 0.13697406873106957, "num_tokens": 2621440.0, "step": 160 }, { "entropy": 5.379635667800903, "epoch": 0.0176, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 4.3299, "mean_token_accuracy": 0.13913894593715667, "num_tokens": 2703360.0, "step": 165 }, { "entropy": 5.209587240219117, "epoch": 0.018133333333333335, "grad_norm": 0.734375, "learning_rate": 8.450000000000001e-05, "loss": 4.3036, "mean_token_accuracy": 0.1401174172759056, "num_tokens": 2785280.0, "step": 170 }, { "entropy": 5.061366176605224, "epoch": 0.018666666666666668, "grad_norm": 0.73046875, "learning_rate": 8.7e-05, "loss": 4.2876, "mean_token_accuracy": 0.13740215301513672, "num_tokens": 2867200.0, "step": 175 }, { "entropy": 4.979794216156006, "epoch": 0.0192, "grad_norm": 0.6015625, "learning_rate": 8.95e-05, "loss": 4.2709, "mean_token_accuracy": 0.13915117383003234, "num_tokens": 2949120.0, "step": 180 }, { "entropy": 4.908948373794556, "epoch": 0.019733333333333332, "grad_norm": 0.609375, "learning_rate": 9.2e-05, "loss": 4.2632, "mean_token_accuracy": 0.14059442281723022, "num_tokens": 3031040.0, "step": 185 }, { "entropy": 4.850634813308716, "epoch": 0.020266666666666665, "grad_norm": 0.79296875, "learning_rate": 9.45e-05, "loss": 4.2582, "mean_token_accuracy": 0.13990949243307113, "num_tokens": 3112960.0, "step": 190 }, { "entropy": 4.786648368835449, "epoch": 0.0208, "grad_norm": 1.0625, "learning_rate": 9.7e-05, "loss": 4.2419, "mean_token_accuracy": 0.14218444079160691, "num_tokens": 3194880.0, "step": 195 }, { "entropy": 4.758226346969605, "epoch": 0.021333333333333333, "grad_norm": 0.8359375, "learning_rate": 9.95e-05, "loss": 4.2357, "mean_token_accuracy": 0.14488747715950012, "num_tokens": 3276800.0, "step": 200 }, { "entropy": 4.722541952133179, "epoch": 0.021866666666666666, "grad_norm": 0.60546875, "learning_rate": 0.000102, "loss": 4.2313, "mean_token_accuracy": 0.14301614165306092, "num_tokens": 3358720.0, "step": 205 }, { "entropy": 4.7076897621154785, "epoch": 0.0224, "grad_norm": 0.71875, "learning_rate": 0.00010449999999999999, "loss": 4.2287, "mean_token_accuracy": 0.1454378679394722, "num_tokens": 3440640.0, "step": 210 }, { "entropy": 4.667892217636108, "epoch": 0.022933333333333333, "grad_norm": 0.62890625, "learning_rate": 0.000107, "loss": 4.2144, "mean_token_accuracy": 0.14744373708963393, "num_tokens": 3522560.0, "step": 215 }, { "entropy": 4.640421724319458, "epoch": 0.023466666666666667, "grad_norm": 0.625, "learning_rate": 0.0001095, "loss": 4.1981, "mean_token_accuracy": 0.15086839497089385, "num_tokens": 3604480.0, "step": 220 }, { "entropy": 4.632302331924438, "epoch": 0.024, "grad_norm": 0.796875, "learning_rate": 0.000112, "loss": 4.2028, "mean_token_accuracy": 0.1504770040512085, "num_tokens": 3686400.0, "step": 225 }, { "entropy": 4.586120748519898, "epoch": 0.024533333333333334, "grad_norm": 0.87890625, "learning_rate": 0.0001145, "loss": 4.1824, "mean_token_accuracy": 0.15565068572759627, "num_tokens": 3768320.0, "step": 230 }, { "entropy": 4.5880763053894045, "epoch": 0.025066666666666668, "grad_norm": 0.67578125, "learning_rate": 0.00011700000000000001, "loss": 4.1709, "mean_token_accuracy": 0.15836594849824906, "num_tokens": 3850240.0, "step": 235 }, { "entropy": 4.547198820114136, "epoch": 0.0256, "grad_norm": 1.484375, "learning_rate": 0.00011949999999999999, "loss": 4.1814, "mean_token_accuracy": 0.1539872795343399, "num_tokens": 3932160.0, "step": 240 }, { "entropy": 4.554472780227661, "epoch": 0.026133333333333335, "grad_norm": 0.85546875, "learning_rate": 0.000122, "loss": 4.1648, "mean_token_accuracy": 0.15847602784633635, "num_tokens": 4014080.0, "step": 245 }, { "entropy": 4.515098428726196, "epoch": 0.02666666666666667, "grad_norm": 0.91796875, "learning_rate": 0.0001245, "loss": 4.1435, "mean_token_accuracy": 0.16312377899885178, "num_tokens": 4096000.0, "step": 250 }, { "entropy": 4.485965967178345, "epoch": 0.0272, "grad_norm": 0.87890625, "learning_rate": 0.000127, "loss": 4.1324, "mean_token_accuracy": 0.16243884563446045, "num_tokens": 4177920.0, "step": 255 }, { "entropy": 4.493349647521972, "epoch": 0.027733333333333332, "grad_norm": 0.94921875, "learning_rate": 0.0001295, "loss": 4.127, "mean_token_accuracy": 0.16493395268917083, "num_tokens": 4259840.0, "step": 260 }, { "entropy": 4.452348852157593, "epoch": 0.028266666666666666, "grad_norm": 0.74609375, "learning_rate": 0.000132, "loss": 4.1071, "mean_token_accuracy": 0.16856653690338136, "num_tokens": 4341760.0, "step": 265 }, { "entropy": 4.4304321765899655, "epoch": 0.0288, "grad_norm": 0.7265625, "learning_rate": 0.00013450000000000002, "loss": 4.0844, "mean_token_accuracy": 0.17174657434225082, "num_tokens": 4423680.0, "step": 270 }, { "entropy": 4.423278045654297, "epoch": 0.029333333333333333, "grad_norm": 1.8359375, "learning_rate": 0.00013700000000000002, "loss": 4.0609, "mean_token_accuracy": 0.1772749528288841, "num_tokens": 4505600.0, "step": 275 }, { "entropy": 4.391708183288574, "epoch": 0.029866666666666666, "grad_norm": 1.1484375, "learning_rate": 0.0001395, "loss": 4.0314, "mean_token_accuracy": 0.1812133088707924, "num_tokens": 4587520.0, "step": 280 }, { "entropy": 4.36551685333252, "epoch": 0.0304, "grad_norm": 1.015625, "learning_rate": 0.00014199999999999998, "loss": 4.001, "mean_token_accuracy": 0.1842098817229271, "num_tokens": 4669440.0, "step": 285 }, { "entropy": 4.3382508754730225, "epoch": 0.030933333333333334, "grad_norm": 1.15625, "learning_rate": 0.0001445, "loss": 3.9539, "mean_token_accuracy": 0.19268591105937957, "num_tokens": 4751360.0, "step": 290 }, { "entropy": 4.313802337646484, "epoch": 0.031466666666666664, "grad_norm": 0.8671875, "learning_rate": 0.000147, "loss": 3.9225, "mean_token_accuracy": 0.19373776912689208, "num_tokens": 4833280.0, "step": 295 }, { "entropy": 4.288891696929932, "epoch": 0.032, "grad_norm": 0.953125, "learning_rate": 0.0001495, "loss": 3.8903, "mean_token_accuracy": 0.19465508908033372, "num_tokens": 4915200.0, "step": 300 }, { "entropy": 4.258247137069702, "epoch": 0.03253333333333333, "grad_norm": 0.94921875, "learning_rate": 0.000152, "loss": 3.8566, "mean_token_accuracy": 0.19915606528520585, "num_tokens": 4997120.0, "step": 305 }, { "entropy": 4.232576513290406, "epoch": 0.03306666666666667, "grad_norm": 1.0078125, "learning_rate": 0.00015450000000000001, "loss": 3.8529, "mean_token_accuracy": 0.19697896540164947, "num_tokens": 5079040.0, "step": 310 }, { "entropy": 4.207263469696045, "epoch": 0.0336, "grad_norm": 1.0078125, "learning_rate": 0.000157, "loss": 3.8227, "mean_token_accuracy": 0.19991438388824462, "num_tokens": 5160960.0, "step": 315 }, { "entropy": 4.1795470237731935, "epoch": 0.034133333333333335, "grad_norm": 1.28125, "learning_rate": 0.0001595, "loss": 3.8027, "mean_token_accuracy": 0.20426859110593795, "num_tokens": 5242880.0, "step": 320 }, { "entropy": 4.1533502578735355, "epoch": 0.034666666666666665, "grad_norm": 1.046875, "learning_rate": 0.000162, "loss": 3.7818, "mean_token_accuracy": 0.2062255397439003, "num_tokens": 5324800.0, "step": 325 }, { "entropy": 4.1572949409484865, "epoch": 0.0352, "grad_norm": 1.2265625, "learning_rate": 0.00016450000000000001, "loss": 3.7669, "mean_token_accuracy": 0.2083047956228256, "num_tokens": 5406720.0, "step": 330 }, { "entropy": 4.130109024047852, "epoch": 0.03573333333333333, "grad_norm": 1.015625, "learning_rate": 0.00016700000000000002, "loss": 3.747, "mean_token_accuracy": 0.20991927534341812, "num_tokens": 5488640.0, "step": 335 }, { "entropy": 4.128541278839111, "epoch": 0.03626666666666667, "grad_norm": 1.5859375, "learning_rate": 0.00016950000000000003, "loss": 3.7415, "mean_token_accuracy": 0.20881849378347397, "num_tokens": 5570560.0, "step": 340 }, { "entropy": 4.096694231033325, "epoch": 0.0368, "grad_norm": 1.7578125, "learning_rate": 0.00017199999999999998, "loss": 3.713, "mean_token_accuracy": 0.2130993127822876, "num_tokens": 5652480.0, "step": 345 }, { "entropy": 4.0859273910522464, "epoch": 0.037333333333333336, "grad_norm": 1.6015625, "learning_rate": 0.00017449999999999999, "loss": 3.689, "mean_token_accuracy": 0.21895792782306672, "num_tokens": 5734400.0, "step": 350 }, { "entropy": 4.069272518157959, "epoch": 0.037866666666666667, "grad_norm": 1.21875, "learning_rate": 0.000177, "loss": 3.6817, "mean_token_accuracy": 0.21903131008148194, "num_tokens": 5816320.0, "step": 355 }, { "entropy": 4.05731840133667, "epoch": 0.0384, "grad_norm": 1.421875, "learning_rate": 0.0001795, "loss": 3.6675, "mean_token_accuracy": 0.21892123222351073, "num_tokens": 5898240.0, "step": 360 }, { "entropy": 4.031953763961792, "epoch": 0.038933333333333334, "grad_norm": 1.328125, "learning_rate": 0.000182, "loss": 3.6507, "mean_token_accuracy": 0.2229207456111908, "num_tokens": 5980160.0, "step": 365 }, { "entropy": 4.035226678848266, "epoch": 0.039466666666666664, "grad_norm": 1.4453125, "learning_rate": 0.0001845, "loss": 3.6486, "mean_token_accuracy": 0.22133072316646576, "num_tokens": 6062080.0, "step": 370 }, { "entropy": 4.009369921684265, "epoch": 0.04, "grad_norm": 1.625, "learning_rate": 0.000187, "loss": 3.6404, "mean_token_accuracy": 0.2208047941327095, "num_tokens": 6144000.0, "step": 375 }, { "entropy": 4.010466837882996, "epoch": 0.04053333333333333, "grad_norm": 1.5078125, "learning_rate": 0.0001895, "loss": 3.625, "mean_token_accuracy": 0.2228473573923111, "num_tokens": 6225920.0, "step": 380 }, { "entropy": 3.9951345205307005, "epoch": 0.04106666666666667, "grad_norm": 1.359375, "learning_rate": 0.000192, "loss": 3.6282, "mean_token_accuracy": 0.22034001648426055, "num_tokens": 6307840.0, "step": 385 }, { "entropy": 3.9747177362442017, "epoch": 0.0416, "grad_norm": 1.890625, "learning_rate": 0.0001945, "loss": 3.5954, "mean_token_accuracy": 0.22756849527359008, "num_tokens": 6389760.0, "step": 390 }, { "entropy": 3.97040593624115, "epoch": 0.042133333333333335, "grad_norm": 1.4140625, "learning_rate": 0.00019700000000000002, "loss": 3.5895, "mean_token_accuracy": 0.23017368018627166, "num_tokens": 6471680.0, "step": 395 }, { "entropy": 3.9500073432922362, "epoch": 0.042666666666666665, "grad_norm": 1.8046875, "learning_rate": 0.00019950000000000002, "loss": 3.5823, "mean_token_accuracy": 0.22897505015134811, "num_tokens": 6553600.0, "step": 400 }, { "entropy": 3.9455363273620607, "epoch": 0.0432, "grad_norm": 1.296875, "learning_rate": 0.000202, "loss": 3.5793, "mean_token_accuracy": 0.2271648719906807, "num_tokens": 6635520.0, "step": 405 }, { "entropy": 3.9388590335845945, "epoch": 0.04373333333333333, "grad_norm": 1.484375, "learning_rate": 0.00020449999999999998, "loss": 3.5722, "mean_token_accuracy": 0.22818004041910173, "num_tokens": 6717440.0, "step": 410 }, { "entropy": 3.921509313583374, "epoch": 0.04426666666666667, "grad_norm": 1.671875, "learning_rate": 0.000207, "loss": 3.5599, "mean_token_accuracy": 0.22937866896390915, "num_tokens": 6799360.0, "step": 415 }, { "entropy": 3.93716356754303, "epoch": 0.0448, "grad_norm": 1.4140625, "learning_rate": 0.0002095, "loss": 3.5664, "mean_token_accuracy": 0.2296355187892914, "num_tokens": 6881280.0, "step": 420 }, { "entropy": 3.9049474239349364, "epoch": 0.04533333333333334, "grad_norm": 1.3671875, "learning_rate": 0.000212, "loss": 3.5563, "mean_token_accuracy": 0.22797211408615112, "num_tokens": 6963200.0, "step": 425 }, { "entropy": 3.9092701196670534, "epoch": 0.04586666666666667, "grad_norm": 1.7421875, "learning_rate": 0.0002145, "loss": 3.5386, "mean_token_accuracy": 0.23233855217695237, "num_tokens": 7045120.0, "step": 430 }, { "entropy": 3.8930064916610716, "epoch": 0.0464, "grad_norm": 1.3515625, "learning_rate": 0.00021700000000000002, "loss": 3.5333, "mean_token_accuracy": 0.23288894146680833, "num_tokens": 7127040.0, "step": 435 }, { "entropy": 3.8910942554473875, "epoch": 0.046933333333333334, "grad_norm": 1.2109375, "learning_rate": 0.0002195, "loss": 3.5452, "mean_token_accuracy": 0.229415363073349, "num_tokens": 7208960.0, "step": 440 }, { "entropy": 3.8705926656723024, "epoch": 0.047466666666666664, "grad_norm": 1.3671875, "learning_rate": 0.000222, "loss": 3.5283, "mean_token_accuracy": 0.2326076328754425, "num_tokens": 7290880.0, "step": 445 }, { "entropy": 3.8792372226715086, "epoch": 0.048, "grad_norm": 1.6796875, "learning_rate": 0.0002245, "loss": 3.5378, "mean_token_accuracy": 0.2297945201396942, "num_tokens": 7372800.0, "step": 450 }, { "entropy": 3.86421058177948, "epoch": 0.04853333333333333, "grad_norm": 1.53125, "learning_rate": 0.00022700000000000002, "loss": 3.5131, "mean_token_accuracy": 0.23609344363212587, "num_tokens": 7454720.0, "step": 455 }, { "entropy": 3.8421786546707155, "epoch": 0.04906666666666667, "grad_norm": 1.5078125, "learning_rate": 0.00022950000000000002, "loss": 3.4924, "mean_token_accuracy": 0.23913894295692445, "num_tokens": 7536640.0, "step": 460 }, { "entropy": 3.8420616388320923, "epoch": 0.0496, "grad_norm": 1.46875, "learning_rate": 0.00023200000000000003, "loss": 3.5053, "mean_token_accuracy": 0.23378180116415023, "num_tokens": 7618560.0, "step": 465 }, { "entropy": 3.833560061454773, "epoch": 0.050133333333333335, "grad_norm": 1.46875, "learning_rate": 0.00023449999999999998, "loss": 3.4973, "mean_token_accuracy": 0.23490704447031022, "num_tokens": 7700480.0, "step": 470 }, { "entropy": 3.8142281055450438, "epoch": 0.050666666666666665, "grad_norm": 1.546875, "learning_rate": 0.000237, "loss": 3.4899, "mean_token_accuracy": 0.2363869845867157, "num_tokens": 7782400.0, "step": 475 }, { "entropy": 3.8285669088363647, "epoch": 0.0512, "grad_norm": 1.5546875, "learning_rate": 0.0002395, "loss": 3.4914, "mean_token_accuracy": 0.23606898188591002, "num_tokens": 7864320.0, "step": 480 }, { "entropy": 3.8081378698349, "epoch": 0.05173333333333333, "grad_norm": 1.2578125, "learning_rate": 0.000242, "loss": 3.4818, "mean_token_accuracy": 0.2354941263794899, "num_tokens": 7946240.0, "step": 485 }, { "entropy": 3.8174705028533937, "epoch": 0.05226666666666667, "grad_norm": 1.359375, "learning_rate": 0.0002445, "loss": 3.4804, "mean_token_accuracy": 0.23588551729917526, "num_tokens": 8028160.0, "step": 490 }, { "entropy": 3.807200789451599, "epoch": 0.0528, "grad_norm": 2.140625, "learning_rate": 0.000247, "loss": 3.48, "mean_token_accuracy": 0.23435665369033815, "num_tokens": 8110080.0, "step": 495 }, { "entropy": 3.79546959400177, "epoch": 0.05333333333333334, "grad_norm": 1.4609375, "learning_rate": 0.0002495, "loss": 3.4675, "mean_token_accuracy": 0.2389554798603058, "num_tokens": 8192000.0, "step": 500 }, { "entropy": 3.7889782667160032, "epoch": 0.05386666666666667, "grad_norm": 1.765625, "learning_rate": 0.000252, "loss": 3.4667, "mean_token_accuracy": 0.23646037131547928, "num_tokens": 8273920.0, "step": 505 }, { "entropy": 3.785716485977173, "epoch": 0.0544, "grad_norm": 1.7265625, "learning_rate": 0.0002545, "loss": 3.455, "mean_token_accuracy": 0.24015410989522934, "num_tokens": 8355840.0, "step": 510 }, { "entropy": 3.764500856399536, "epoch": 0.054933333333333334, "grad_norm": 2.6875, "learning_rate": 0.000257, "loss": 3.4532, "mean_token_accuracy": 0.23701076358556747, "num_tokens": 8437760.0, "step": 515 }, { "entropy": 3.758707785606384, "epoch": 0.055466666666666664, "grad_norm": 1.4375, "learning_rate": 0.0002595, "loss": 3.4453, "mean_token_accuracy": 0.23972602486610411, "num_tokens": 8519680.0, "step": 520 }, { "entropy": 3.770280122756958, "epoch": 0.056, "grad_norm": 1.515625, "learning_rate": 0.000262, "loss": 3.4543, "mean_token_accuracy": 0.23757338523864746, "num_tokens": 8601600.0, "step": 525 }, { "entropy": 3.7545013189315797, "epoch": 0.05653333333333333, "grad_norm": 1.28125, "learning_rate": 0.00026450000000000003, "loss": 3.4479, "mean_token_accuracy": 0.2368272989988327, "num_tokens": 8683520.0, "step": 530 }, { "entropy": 3.737969398498535, "epoch": 0.05706666666666667, "grad_norm": 1.5859375, "learning_rate": 0.00026700000000000004, "loss": 3.4376, "mean_token_accuracy": 0.24004403203725816, "num_tokens": 8765440.0, "step": 535 }, { "entropy": 3.7428213119506837, "epoch": 0.0576, "grad_norm": 1.9765625, "learning_rate": 0.00026950000000000005, "loss": 3.4349, "mean_token_accuracy": 0.24008072465658187, "num_tokens": 8847360.0, "step": 540 }, { "entropy": 3.735646629333496, "epoch": 0.058133333333333335, "grad_norm": 1.59375, "learning_rate": 0.00027200000000000005, "loss": 3.4296, "mean_token_accuracy": 0.24118150919675826, "num_tokens": 8929280.0, "step": 545 }, { "entropy": 3.7235782146453857, "epoch": 0.058666666666666666, "grad_norm": 1.21875, "learning_rate": 0.0002745, "loss": 3.4253, "mean_token_accuracy": 0.24175636172294618, "num_tokens": 9011200.0, "step": 550 }, { "entropy": 3.7225298404693605, "epoch": 0.0592, "grad_norm": 1.609375, "learning_rate": 0.000277, "loss": 3.42, "mean_token_accuracy": 0.24081458002328873, "num_tokens": 9093120.0, "step": 555 }, { "entropy": 3.7187859535217287, "epoch": 0.05973333333333333, "grad_norm": 1.8125, "learning_rate": 0.0002795, "loss": 3.4261, "mean_token_accuracy": 0.24001957178115846, "num_tokens": 9175040.0, "step": 560 }, { "entropy": 3.713302421569824, "epoch": 0.06026666666666667, "grad_norm": 1.5, "learning_rate": 0.00028199999999999997, "loss": 3.4172, "mean_token_accuracy": 0.24145058691501617, "num_tokens": 9256960.0, "step": 565 }, { "entropy": 3.7087379932403564, "epoch": 0.0608, "grad_norm": 1.59375, "learning_rate": 0.0002845, "loss": 3.4322, "mean_token_accuracy": 0.2365582212805748, "num_tokens": 9338880.0, "step": 570 }, { "entropy": 3.694662022590637, "epoch": 0.06133333333333333, "grad_norm": 1.5859375, "learning_rate": 0.000287, "loss": 3.4108, "mean_token_accuracy": 0.24277152717113495, "num_tokens": 9420800.0, "step": 575 }, { "entropy": 3.7138469219207764, "epoch": 0.06186666666666667, "grad_norm": 1.65625, "learning_rate": 0.0002895, "loss": 3.4101, "mean_token_accuracy": 0.24241682887077332, "num_tokens": 9502720.0, "step": 580 }, { "entropy": 3.7062520503997805, "epoch": 0.0624, "grad_norm": 1.8515625, "learning_rate": 0.000292, "loss": 3.4279, "mean_token_accuracy": 0.23463796377182006, "num_tokens": 9584640.0, "step": 585 }, { "entropy": 3.68607177734375, "epoch": 0.06293333333333333, "grad_norm": 1.484375, "learning_rate": 0.0002945, "loss": 3.407, "mean_token_accuracy": 0.24049657732248306, "num_tokens": 9666560.0, "step": 590 }, { "entropy": 3.689913105964661, "epoch": 0.06346666666666667, "grad_norm": 1.6328125, "learning_rate": 0.000297, "loss": 3.4047, "mean_token_accuracy": 0.24015410542488097, "num_tokens": 9748480.0, "step": 595 }, { "entropy": 3.6928848028182983, "epoch": 0.064, "grad_norm": 1.6796875, "learning_rate": 0.0002995, "loss": 3.417, "mean_token_accuracy": 0.23721868842840194, "num_tokens": 9830400.0, "step": 600 }, { "entropy": 3.677217197418213, "epoch": 0.06453333333333333, "grad_norm": 1.8046875, "learning_rate": 0.000302, "loss": 3.398, "mean_token_accuracy": 0.23994618356227876, "num_tokens": 9912320.0, "step": 605 }, { "entropy": 3.673366165161133, "epoch": 0.06506666666666666, "grad_norm": 1.515625, "learning_rate": 0.0003045, "loss": 3.391, "mean_token_accuracy": 0.24338307231664658, "num_tokens": 9994240.0, "step": 610 }, { "entropy": 3.6597073078155518, "epoch": 0.0656, "grad_norm": 1.3984375, "learning_rate": 0.000307, "loss": 3.3986, "mean_token_accuracy": 0.24030087888240814, "num_tokens": 10076160.0, "step": 615 }, { "entropy": 3.661817741394043, "epoch": 0.06613333333333334, "grad_norm": 1.3671875, "learning_rate": 0.0003095, "loss": 3.3877, "mean_token_accuracy": 0.24142612367868424, "num_tokens": 10158080.0, "step": 620 }, { "entropy": 3.6684417009353636, "epoch": 0.06666666666666667, "grad_norm": 1.5, "learning_rate": 0.000312, "loss": 3.3958, "mean_token_accuracy": 0.24153620302677153, "num_tokens": 10240000.0, "step": 625 }, { "entropy": 3.655338168144226, "epoch": 0.0672, "grad_norm": 2.140625, "learning_rate": 0.0003145, "loss": 3.3992, "mean_token_accuracy": 0.2351272001862526, "num_tokens": 10321920.0, "step": 630 }, { "entropy": 3.652760720252991, "epoch": 0.06773333333333334, "grad_norm": 1.96875, "learning_rate": 0.000317, "loss": 3.3781, "mean_token_accuracy": 0.24770058542490006, "num_tokens": 10403840.0, "step": 635 }, { "entropy": 3.6520917892456053, "epoch": 0.06826666666666667, "grad_norm": 1.578125, "learning_rate": 0.0003195, "loss": 3.3817, "mean_token_accuracy": 0.24147504866123198, "num_tokens": 10485760.0, "step": 640 }, { "entropy": 3.645389986038208, "epoch": 0.0688, "grad_norm": 1.296875, "learning_rate": 0.000322, "loss": 3.3778, "mean_token_accuracy": 0.2417563572525978, "num_tokens": 10567680.0, "step": 645 }, { "entropy": 3.6351272106170653, "epoch": 0.06933333333333333, "grad_norm": 1.7734375, "learning_rate": 0.00032450000000000003, "loss": 3.3924, "mean_token_accuracy": 0.23959148526191712, "num_tokens": 10649600.0, "step": 650 }, { "entropy": 3.6490575313568114, "epoch": 0.06986666666666666, "grad_norm": 1.8125, "learning_rate": 0.00032700000000000003, "loss": 3.3816, "mean_token_accuracy": 0.23831947147846222, "num_tokens": 10731520.0, "step": 655 }, { "entropy": 3.643259358406067, "epoch": 0.0704, "grad_norm": 1.953125, "learning_rate": 0.00032950000000000004, "loss": 3.3803, "mean_token_accuracy": 0.23961594849824905, "num_tokens": 10813440.0, "step": 660 }, { "entropy": 3.6322882652282713, "epoch": 0.07093333333333333, "grad_norm": 1.578125, "learning_rate": 0.00033200000000000005, "loss": 3.3763, "mean_token_accuracy": 0.241169273853302, "num_tokens": 10895360.0, "step": 665 }, { "entropy": 3.6224374532699586, "epoch": 0.07146666666666666, "grad_norm": 1.625, "learning_rate": 0.00033450000000000005, "loss": 3.3591, "mean_token_accuracy": 0.24379892349243165, "num_tokens": 10977280.0, "step": 670 }, { "entropy": 3.6074854850769045, "epoch": 0.072, "grad_norm": 1.3828125, "learning_rate": 0.000337, "loss": 3.3701, "mean_token_accuracy": 0.2412426620721817, "num_tokens": 11059200.0, "step": 675 }, { "entropy": 3.628856587409973, "epoch": 0.07253333333333334, "grad_norm": 1.4765625, "learning_rate": 0.0003395, "loss": 3.3693, "mean_token_accuracy": 0.2422822892665863, "num_tokens": 11141120.0, "step": 680 }, { "entropy": 3.6110815525054933, "epoch": 0.07306666666666667, "grad_norm": 1.625, "learning_rate": 0.000342, "loss": 3.3677, "mean_token_accuracy": 0.23987279683351517, "num_tokens": 11223040.0, "step": 685 }, { "entropy": 3.6009220361709593, "epoch": 0.0736, "grad_norm": 1.234375, "learning_rate": 0.00034449999999999997, "loss": 3.3547, "mean_token_accuracy": 0.24192759543657302, "num_tokens": 11304960.0, "step": 690 }, { "entropy": 3.5970619678497315, "epoch": 0.07413333333333333, "grad_norm": 1.8125, "learning_rate": 0.000347, "loss": 3.3463, "mean_token_accuracy": 0.24505870640277863, "num_tokens": 11386880.0, "step": 695 }, { "entropy": 3.587267446517944, "epoch": 0.07466666666666667, "grad_norm": 2.3125, "learning_rate": 0.0003495, "loss": 3.3419, "mean_token_accuracy": 0.24344422668218613, "num_tokens": 11468800.0, "step": 700 }, { "entropy": 3.5908786058425903, "epoch": 0.0752, "grad_norm": 1.2578125, "learning_rate": 0.000352, "loss": 3.3509, "mean_token_accuracy": 0.24026418775320052, "num_tokens": 11550720.0, "step": 705 }, { "entropy": 3.5929071426391603, "epoch": 0.07573333333333333, "grad_norm": 1.296875, "learning_rate": 0.0003545, "loss": 3.3355, "mean_token_accuracy": 0.24363992214202881, "num_tokens": 11632640.0, "step": 710 }, { "entropy": 3.583715867996216, "epoch": 0.07626666666666666, "grad_norm": 1.9296875, "learning_rate": 0.000357, "loss": 3.3393, "mean_token_accuracy": 0.2459515631198883, "num_tokens": 11714560.0, "step": 715 }, { "entropy": 3.589143085479736, "epoch": 0.0768, "grad_norm": 1.7265625, "learning_rate": 0.0003595, "loss": 3.3369, "mean_token_accuracy": 0.24209882467985153, "num_tokens": 11796480.0, "step": 720 }, { "entropy": 3.5867936611175537, "epoch": 0.07733333333333334, "grad_norm": 3.03125, "learning_rate": 0.000362, "loss": 3.3431, "mean_token_accuracy": 0.24129158407449722, "num_tokens": 11878400.0, "step": 725 }, { "entropy": 3.59276020526886, "epoch": 0.07786666666666667, "grad_norm": 1.796875, "learning_rate": 0.0003645, "loss": 3.3434, "mean_token_accuracy": 0.24174412786960603, "num_tokens": 11960320.0, "step": 730 }, { "entropy": 3.5778300762176514, "epoch": 0.0784, "grad_norm": 1.71875, "learning_rate": 0.000367, "loss": 3.3414, "mean_token_accuracy": 0.24065557718276978, "num_tokens": 12042240.0, "step": 735 }, { "entropy": 3.597053050994873, "epoch": 0.07893333333333333, "grad_norm": 1.7265625, "learning_rate": 0.0003695, "loss": 3.3516, "mean_token_accuracy": 0.2385273978114128, "num_tokens": 12124160.0, "step": 740 }, { "entropy": 3.5768983364105225, "epoch": 0.07946666666666667, "grad_norm": 1.5625, "learning_rate": 0.000372, "loss": 3.3231, "mean_token_accuracy": 0.2470768079161644, "num_tokens": 12206080.0, "step": 745 }, { "entropy": 3.5772984266281127, "epoch": 0.08, "grad_norm": 1.7734375, "learning_rate": 0.0003745, "loss": 3.3338, "mean_token_accuracy": 0.24061888456344604, "num_tokens": 12288000.0, "step": 750 }, { "entropy": 3.566642928123474, "epoch": 0.08053333333333333, "grad_norm": 1.59375, "learning_rate": 0.000377, "loss": 3.3082, "mean_token_accuracy": 0.24603718072175979, "num_tokens": 12369920.0, "step": 755 }, { "entropy": 3.5493921518325804, "epoch": 0.08106666666666666, "grad_norm": 1.8515625, "learning_rate": 0.0003795, "loss": 3.3097, "mean_token_accuracy": 0.24467954486608506, "num_tokens": 12451840.0, "step": 760 }, { "entropy": 3.563185977935791, "epoch": 0.0816, "grad_norm": 1.4140625, "learning_rate": 0.000382, "loss": 3.3099, "mean_token_accuracy": 0.243309685587883, "num_tokens": 12533760.0, "step": 765 }, { "entropy": 3.5411034345626833, "epoch": 0.08213333333333334, "grad_norm": 1.6328125, "learning_rate": 0.0003845, "loss": 3.3144, "mean_token_accuracy": 0.24328522235155106, "num_tokens": 12615680.0, "step": 770 }, { "entropy": 3.5681350946426393, "epoch": 0.08266666666666667, "grad_norm": 2.578125, "learning_rate": 0.00038700000000000003, "loss": 3.3221, "mean_token_accuracy": 0.24020303338766097, "num_tokens": 12697600.0, "step": 775 }, { "entropy": 3.5270207643508913, "epoch": 0.0832, "grad_norm": 1.328125, "learning_rate": 0.00038950000000000003, "loss": 3.2966, "mean_token_accuracy": 0.2470645785331726, "num_tokens": 12779520.0, "step": 780 }, { "entropy": 3.5338781118392943, "epoch": 0.08373333333333334, "grad_norm": 5.625, "learning_rate": 0.00039200000000000004, "loss": 3.2976, "mean_token_accuracy": 0.24847113937139512, "num_tokens": 12861440.0, "step": 785 }, { "entropy": 3.5563634634017944, "epoch": 0.08426666666666667, "grad_norm": 2.1875, "learning_rate": 0.00039450000000000005, "loss": 3.3168, "mean_token_accuracy": 0.24625733941793443, "num_tokens": 12943360.0, "step": 790 }, { "entropy": 3.523889255523682, "epoch": 0.0848, "grad_norm": 1.3515625, "learning_rate": 0.00039700000000000005, "loss": 3.3121, "mean_token_accuracy": 0.24505870789289474, "num_tokens": 13025280.0, "step": 795 }, { "entropy": 3.5672359466552734, "epoch": 0.08533333333333333, "grad_norm": 3.5625, "learning_rate": 0.0003995, "loss": 3.3124, "mean_token_accuracy": 0.24388453960418702, "num_tokens": 13107200.0, "step": 800 }, { "entropy": 3.524198603630066, "epoch": 0.08586666666666666, "grad_norm": 1.6484375, "learning_rate": 0.000402, "loss": 3.3066, "mean_token_accuracy": 0.24294275790452957, "num_tokens": 13189120.0, "step": 805 }, { "entropy": 3.535692071914673, "epoch": 0.0864, "grad_norm": 1.4609375, "learning_rate": 0.0004045, "loss": 3.299, "mean_token_accuracy": 0.24140166342258454, "num_tokens": 13271040.0, "step": 810 }, { "entropy": 3.5244675397872927, "epoch": 0.08693333333333333, "grad_norm": 1.5546875, "learning_rate": 0.00040699999999999997, "loss": 3.2988, "mean_token_accuracy": 0.24274706244468688, "num_tokens": 13352960.0, "step": 815 }, { "entropy": 3.5047380208969114, "epoch": 0.08746666666666666, "grad_norm": 3.625, "learning_rate": 0.0004095, "loss": 3.2758, "mean_token_accuracy": 0.24700342416763305, "num_tokens": 13434880.0, "step": 820 }, { "entropy": 3.5343822240829468, "epoch": 0.088, "grad_norm": 1.5703125, "learning_rate": 0.000412, "loss": 3.2917, "mean_token_accuracy": 0.2418297454714775, "num_tokens": 13516800.0, "step": 825 }, { "entropy": 3.5038384437561034, "epoch": 0.08853333333333334, "grad_norm": 1.4296875, "learning_rate": 0.0004145, "loss": 3.2755, "mean_token_accuracy": 0.24538894444704057, "num_tokens": 13598720.0, "step": 830 }, { "entropy": 3.486983823776245, "epoch": 0.08906666666666667, "grad_norm": 1.5625, "learning_rate": 0.000417, "loss": 3.2778, "mean_token_accuracy": 0.24581702351570128, "num_tokens": 13680640.0, "step": 835 }, { "entropy": 3.516296362876892, "epoch": 0.0896, "grad_norm": 1.6875, "learning_rate": 0.0004195, "loss": 3.2707, "mean_token_accuracy": 0.24487524032592772, "num_tokens": 13762560.0, "step": 840 }, { "entropy": 3.5094950437545775, "epoch": 0.09013333333333333, "grad_norm": 1.765625, "learning_rate": 0.000422, "loss": 3.2893, "mean_token_accuracy": 0.24033757150173188, "num_tokens": 13844480.0, "step": 845 }, { "entropy": 3.4691035747528076, "epoch": 0.09066666666666667, "grad_norm": 1.2734375, "learning_rate": 0.0004245, "loss": 3.2601, "mean_token_accuracy": 0.24925391525030136, "num_tokens": 13926400.0, "step": 850 }, { "entropy": 3.5137253999710083, "epoch": 0.0912, "grad_norm": 2.015625, "learning_rate": 0.000427, "loss": 3.2983, "mean_token_accuracy": 0.24137720018625258, "num_tokens": 14008320.0, "step": 855 }, { "entropy": 3.4819485664367678, "epoch": 0.09173333333333333, "grad_norm": 1.3046875, "learning_rate": 0.0004295, "loss": 3.2709, "mean_token_accuracy": 0.24374999701976777, "num_tokens": 14090240.0, "step": 860 }, { "entropy": 3.4891334533691407, "epoch": 0.09226666666666666, "grad_norm": 1.609375, "learning_rate": 0.000432, "loss": 3.2745, "mean_token_accuracy": 0.2452421709895134, "num_tokens": 14172160.0, "step": 865 }, { "entropy": 3.4707372188568115, "epoch": 0.0928, "grad_norm": 1.421875, "learning_rate": 0.0004345, "loss": 3.2686, "mean_token_accuracy": 0.24537671208381653, "num_tokens": 14254080.0, "step": 870 }, { "entropy": 3.4907490968704225, "epoch": 0.09333333333333334, "grad_norm": 1.765625, "learning_rate": 0.000437, "loss": 3.2725, "mean_token_accuracy": 0.24230675101280214, "num_tokens": 14336000.0, "step": 875 }, { "entropy": 3.470463490486145, "epoch": 0.09386666666666667, "grad_norm": 1.9765625, "learning_rate": 0.0004395, "loss": 3.2667, "mean_token_accuracy": 0.24382338672876358, "num_tokens": 14417920.0, "step": 880 }, { "entropy": 3.458239459991455, "epoch": 0.0944, "grad_norm": 2.71875, "learning_rate": 0.000442, "loss": 3.2557, "mean_token_accuracy": 0.24576810002326965, "num_tokens": 14499840.0, "step": 885 }, { "entropy": 3.44415397644043, "epoch": 0.09493333333333333, "grad_norm": 1.1484375, "learning_rate": 0.0004445, "loss": 3.2588, "mean_token_accuracy": 0.24496086090803146, "num_tokens": 14581760.0, "step": 890 }, { "entropy": 3.490961694717407, "epoch": 0.09546666666666667, "grad_norm": 2.140625, "learning_rate": 0.000447, "loss": 3.2802, "mean_token_accuracy": 0.2430283769965172, "num_tokens": 14663680.0, "step": 895 }, { "entropy": 3.4478488683700563, "epoch": 0.096, "grad_norm": 1.328125, "learning_rate": 0.00044950000000000003, "loss": 3.2655, "mean_token_accuracy": 0.24223336577415466, "num_tokens": 14745600.0, "step": 900 }, { "entropy": 3.433678936958313, "epoch": 0.09653333333333333, "grad_norm": 1.265625, "learning_rate": 0.00045200000000000004, "loss": 3.2531, "mean_token_accuracy": 0.2459760308265686, "num_tokens": 14827520.0, "step": 905 }, { "entropy": 3.4747411966323853, "epoch": 0.09706666666666666, "grad_norm": 4.15625, "learning_rate": 0.00045450000000000004, "loss": 3.2898, "mean_token_accuracy": 0.24159735888242723, "num_tokens": 14909440.0, "step": 910 }, { "entropy": 3.4487999200820925, "epoch": 0.0976, "grad_norm": 1.8515625, "learning_rate": 0.00045700000000000005, "loss": 3.2673, "mean_token_accuracy": 0.24547455757856368, "num_tokens": 14991360.0, "step": 915 }, { "entropy": 3.4375893115997314, "epoch": 0.09813333333333334, "grad_norm": 2.390625, "learning_rate": 0.00045950000000000006, "loss": 3.2549, "mean_token_accuracy": 0.24494863152503968, "num_tokens": 15073280.0, "step": 920 }, { "entropy": 3.4646376848220823, "epoch": 0.09866666666666667, "grad_norm": 3.78125, "learning_rate": 0.000462, "loss": 3.2728, "mean_token_accuracy": 0.24405577182769775, "num_tokens": 15155200.0, "step": 925 }, { "entropy": 3.445885944366455, "epoch": 0.0992, "grad_norm": 1.5703125, "learning_rate": 0.0004645, "loss": 3.2696, "mean_token_accuracy": 0.24417808204889296, "num_tokens": 15237120.0, "step": 930 }, { "entropy": 3.439109373092651, "epoch": 0.09973333333333333, "grad_norm": 1.2734375, "learning_rate": 0.000467, "loss": 3.2607, "mean_token_accuracy": 0.24268590956926345, "num_tokens": 15319040.0, "step": 935 }, { "entropy": 3.443026566505432, "epoch": 0.10026666666666667, "grad_norm": 1.5625, "learning_rate": 0.0004695, "loss": 3.2566, "mean_token_accuracy": 0.24390900284051895, "num_tokens": 15400960.0, "step": 940 }, { "entropy": 3.4182130336761474, "epoch": 0.1008, "grad_norm": 1.5859375, "learning_rate": 0.000472, "loss": 3.2598, "mean_token_accuracy": 0.24549902081489564, "num_tokens": 15482880.0, "step": 945 }, { "entropy": 3.4506216049194336, "epoch": 0.10133333333333333, "grad_norm": 1.6328125, "learning_rate": 0.0004745, "loss": 3.2705, "mean_token_accuracy": 0.24322407245635985, "num_tokens": 15564800.0, "step": 950 }, { "entropy": 3.4289287090301515, "epoch": 0.10186666666666666, "grad_norm": 2.046875, "learning_rate": 0.000477, "loss": 3.2487, "mean_token_accuracy": 0.245193250477314, "num_tokens": 15646720.0, "step": 955 }, { "entropy": 3.391101622581482, "epoch": 0.1024, "grad_norm": 2.078125, "learning_rate": 0.0004795, "loss": 3.2481, "mean_token_accuracy": 0.24557240456342697, "num_tokens": 15728640.0, "step": 960 }, { "entropy": 3.4241345167160033, "epoch": 0.10293333333333334, "grad_norm": 2.671875, "learning_rate": 0.000482, "loss": 3.2734, "mean_token_accuracy": 0.24163405001163482, "num_tokens": 15810560.0, "step": 965 }, { "entropy": 3.4429741144180297, "epoch": 0.10346666666666667, "grad_norm": 1.46875, "learning_rate": 0.0004845, "loss": 3.2746, "mean_token_accuracy": 0.2399951085448265, "num_tokens": 15892480.0, "step": 970 }, { "entropy": 3.415851044654846, "epoch": 0.104, "grad_norm": 1.6796875, "learning_rate": 0.000487, "loss": 3.2572, "mean_token_accuracy": 0.24127935618162155, "num_tokens": 15974400.0, "step": 975 }, { "entropy": 3.3974807024002076, "epoch": 0.10453333333333334, "grad_norm": 1.5546875, "learning_rate": 0.0004895, "loss": 3.2386, "mean_token_accuracy": 0.2478840485215187, "num_tokens": 16056320.0, "step": 980 }, { "entropy": 3.4176392793655395, "epoch": 0.10506666666666667, "grad_norm": 1.671875, "learning_rate": 0.000492, "loss": 3.2544, "mean_token_accuracy": 0.24623287618160247, "num_tokens": 16138240.0, "step": 985 }, { "entropy": 3.3827028274536133, "epoch": 0.1056, "grad_norm": 1.375, "learning_rate": 0.0004945, "loss": 3.2418, "mean_token_accuracy": 0.24362768977880478, "num_tokens": 16220160.0, "step": 990 }, { "entropy": 3.3921529054641724, "epoch": 0.10613333333333333, "grad_norm": 2.578125, "learning_rate": 0.000497, "loss": 3.2305, "mean_token_accuracy": 0.2463918760418892, "num_tokens": 16302080.0, "step": 995 }, { "entropy": 3.3886776208877563, "epoch": 0.10666666666666667, "grad_norm": 1.359375, "learning_rate": 0.0004995, "loss": 3.2352, "mean_token_accuracy": 0.24684442281723024, "num_tokens": 16384000.0, "step": 1000 }, { "entropy": 3.3688613176345825, "epoch": 0.1072, "grad_norm": 1.3515625, "learning_rate": 0.000499998026082006, "loss": 3.2335, "mean_token_accuracy": 0.243615460395813, "num_tokens": 16465920.0, "step": 1005 }, { "entropy": 3.3817806243896484, "epoch": 0.10773333333333333, "grad_norm": 1.5703125, "learning_rate": 0.0004999900070995136, "loss": 3.2333, "mean_token_accuracy": 0.24441046714782716, "num_tokens": 16547840.0, "step": 1010 }, { "entropy": 3.36424081325531, "epoch": 0.10826666666666666, "grad_norm": 1.34375, "learning_rate": 0.0004999758199023239, "loss": 3.2249, "mean_token_accuracy": 0.244019079208374, "num_tokens": 16629760.0, "step": 1015 }, { "entropy": 3.381114053726196, "epoch": 0.1088, "grad_norm": 1.9296875, "learning_rate": 0.0004999554648793858, "loss": 3.2317, "mean_token_accuracy": 0.24527886658906936, "num_tokens": 16711680.0, "step": 1020 }, { "entropy": 3.3893242359161375, "epoch": 0.10933333333333334, "grad_norm": 1.921875, "learning_rate": 0.0004999289425887425, "loss": 3.2447, "mean_token_accuracy": 0.24214774817228318, "num_tokens": 16793600.0, "step": 1025 }, { "entropy": 3.356892943382263, "epoch": 0.10986666666666667, "grad_norm": 1.84375, "learning_rate": 0.0004998962537575161, "loss": 3.2355, "mean_token_accuracy": 0.24450831413269042, "num_tokens": 16875520.0, "step": 1030 }, { "entropy": 3.3502973079681397, "epoch": 0.1104, "grad_norm": 1.6484375, "learning_rate": 0.0004998573992818874, "loss": 3.2217, "mean_token_accuracy": 0.24554794579744338, "num_tokens": 16957440.0, "step": 1035 }, { "entropy": 3.371893858909607, "epoch": 0.11093333333333333, "grad_norm": 1.453125, "learning_rate": 0.0004998123802270715, "loss": 3.2305, "mean_token_accuracy": 0.24557240754365922, "num_tokens": 17039360.0, "step": 1040 }, { "entropy": 3.380908799171448, "epoch": 0.11146666666666667, "grad_norm": 1.1953125, "learning_rate": 0.0004997611978272886, "loss": 3.254, "mean_token_accuracy": 0.23850293606519699, "num_tokens": 17121280.0, "step": 1045 }, { "entropy": 3.369134211540222, "epoch": 0.112, "grad_norm": 1.625, "learning_rate": 0.0004997038534857298, "loss": 3.225, "mean_token_accuracy": 0.24552348107099534, "num_tokens": 17203200.0, "step": 1050 }, { "entropy": 3.374810314178467, "epoch": 0.11253333333333333, "grad_norm": 1.046875, "learning_rate": 0.0004996403487745194, "loss": 3.2274, "mean_token_accuracy": 0.24568248689174652, "num_tokens": 17285120.0, "step": 1055 }, { "entropy": 3.3373070478439333, "epoch": 0.11306666666666666, "grad_norm": 1.09375, "learning_rate": 0.000499570685434671, "loss": 3.224, "mean_token_accuracy": 0.24245352447032928, "num_tokens": 17367040.0, "step": 1060 }, { "entropy": 3.3667542695999146, "epoch": 0.1136, "grad_norm": 1.703125, "learning_rate": 0.0004994948653760405, "loss": 3.2327, "mean_token_accuracy": 0.24299168288707734, "num_tokens": 17448960.0, "step": 1065 }, { "entropy": 3.3659775018692017, "epoch": 0.11413333333333334, "grad_norm": 2.0, "learning_rate": 0.0004994128906772729, "loss": 3.2345, "mean_token_accuracy": 0.2416829749941826, "num_tokens": 17530880.0, "step": 1070 }, { "entropy": 3.3636478424072265, "epoch": 0.11466666666666667, "grad_norm": 1.703125, "learning_rate": 0.000499324763585746, "loss": 3.2322, "mean_token_accuracy": 0.24304060637950897, "num_tokens": 17612800.0, "step": 1075 }, { "entropy": 3.347209930419922, "epoch": 0.1152, "grad_norm": 1.359375, "learning_rate": 0.0004992304865175085, "loss": 3.2187, "mean_token_accuracy": 0.24414139091968537, "num_tokens": 17694720.0, "step": 1080 }, { "entropy": 3.3256459712982176, "epoch": 0.11573333333333333, "grad_norm": 1.546875, "learning_rate": 0.0004991300620572138, "loss": 3.2122, "mean_token_accuracy": 0.2480919763445854, "num_tokens": 17776640.0, "step": 1085 }, { "entropy": 3.3572380781173705, "epoch": 0.11626666666666667, "grad_norm": 1.1640625, "learning_rate": 0.0004990234929580494, "loss": 3.2218, "mean_token_accuracy": 0.24530332982540132, "num_tokens": 17858560.0, "step": 1090 }, { "entropy": 3.3488968133926393, "epoch": 0.1168, "grad_norm": 1.4921875, "learning_rate": 0.0004989107821416609, "loss": 3.22, "mean_token_accuracy": 0.24153620153665542, "num_tokens": 17940480.0, "step": 1095 }, { "entropy": 3.3309558391571046, "epoch": 0.11733333333333333, "grad_norm": 1.8046875, "learning_rate": 0.0004987919326980723, "loss": 3.2169, "mean_token_accuracy": 0.24518101513385773, "num_tokens": 18022400.0, "step": 1100 }, { "entropy": 3.332407236099243, "epoch": 0.11786666666666666, "grad_norm": 1.390625, "learning_rate": 0.0004986669478856011, "loss": 3.2205, "mean_token_accuracy": 0.24242906123399735, "num_tokens": 18104320.0, "step": 1105 }, { "entropy": 3.349472188949585, "epoch": 0.1184, "grad_norm": 1.2265625, "learning_rate": 0.0004985358311307688, "loss": 3.2266, "mean_token_accuracy": 0.2414628192782402, "num_tokens": 18186240.0, "step": 1110 }, { "entropy": 3.331104302406311, "epoch": 0.11893333333333334, "grad_norm": 1.453125, "learning_rate": 0.0004983985860282081, "loss": 3.2127, "mean_token_accuracy": 0.24697896242141723, "num_tokens": 18268160.0, "step": 1115 }, { "entropy": 3.319834756851196, "epoch": 0.11946666666666667, "grad_norm": 1.2421875, "learning_rate": 0.0004982552163405623, "loss": 3.2088, "mean_token_accuracy": 0.24534002393484117, "num_tokens": 18350080.0, "step": 1120 }, { "entropy": 3.317161226272583, "epoch": 0.12, "grad_norm": 1.203125, "learning_rate": 0.0004981057259983839, "loss": 3.1988, "mean_token_accuracy": 0.2484955981373787, "num_tokens": 18432000.0, "step": 1125 }, { "entropy": 3.314718413352966, "epoch": 0.12053333333333334, "grad_norm": 1.0234375, "learning_rate": 0.0004979501191000262, "loss": 3.2039, "mean_token_accuracy": 0.2452421709895134, "num_tokens": 18513920.0, "step": 1130 }, { "entropy": 3.3259057283401487, "epoch": 0.12106666666666667, "grad_norm": 1.2109375, "learning_rate": 0.0004977883999115311, "loss": 3.209, "mean_token_accuracy": 0.24386007934808732, "num_tokens": 18595840.0, "step": 1135 }, { "entropy": 3.31879608631134, "epoch": 0.1216, "grad_norm": 1.25, "learning_rate": 0.0004976205728665113, "loss": 3.2092, "mean_token_accuracy": 0.2425880625844002, "num_tokens": 18677760.0, "step": 1140 }, { "entropy": 3.326778697967529, "epoch": 0.12213333333333333, "grad_norm": 1.1015625, "learning_rate": 0.0004974466425660307, "loss": 3.2106, "mean_token_accuracy": 0.24189089983701706, "num_tokens": 18759680.0, "step": 1145 }, { "entropy": 3.3221657514572143, "epoch": 0.12266666666666666, "grad_norm": 1.25, "learning_rate": 0.0004972666137784759, "loss": 3.2046, "mean_token_accuracy": 0.2446428582072258, "num_tokens": 18841600.0, "step": 1150 }, { "entropy": 3.311302924156189, "epoch": 0.1232, "grad_norm": 1.4296875, "learning_rate": 0.0004970804914394271, "loss": 3.2044, "mean_token_accuracy": 0.2443126231431961, "num_tokens": 18923520.0, "step": 1155 }, { "entropy": 3.3029479503631594, "epoch": 0.12373333333333333, "grad_norm": 1.3359375, "learning_rate": 0.0004968882806515225, "loss": 3.195, "mean_token_accuracy": 0.24726027250289917, "num_tokens": 19005440.0, "step": 1160 }, { "entropy": 3.306261348724365, "epoch": 0.12426666666666666, "grad_norm": 1.09375, "learning_rate": 0.0004966899866843177, "loss": 3.21, "mean_token_accuracy": 0.24412915855646133, "num_tokens": 19087360.0, "step": 1165 }, { "entropy": 3.3145808219909667, "epoch": 0.1248, "grad_norm": 1.0703125, "learning_rate": 0.000496485614974142, "loss": 3.2126, "mean_token_accuracy": 0.24129158407449722, "num_tokens": 19169280.0, "step": 1170 }, { "entropy": 3.314248561859131, "epoch": 0.12533333333333332, "grad_norm": 1.265625, "learning_rate": 0.0004962751711239492, "loss": 3.1896, "mean_token_accuracy": 0.24520548284053803, "num_tokens": 19251200.0, "step": 1175 }, { "entropy": 3.296343231201172, "epoch": 0.12586666666666665, "grad_norm": 1.3359375, "learning_rate": 0.0004960586609031636, "loss": 3.2084, "mean_token_accuracy": 0.24050880819559098, "num_tokens": 19333120.0, "step": 1180 }, { "entropy": 3.2957814216613768, "epoch": 0.1264, "grad_norm": 1.1015625, "learning_rate": 0.0004958360902475224, "loss": 3.1944, "mean_token_accuracy": 0.2450220137834549, "num_tokens": 19415040.0, "step": 1185 }, { "entropy": 3.2972240924835203, "epoch": 0.12693333333333334, "grad_norm": 1.75, "learning_rate": 0.0004956074652589125, "loss": 3.1947, "mean_token_accuracy": 0.2469055771827698, "num_tokens": 19496960.0, "step": 1190 }, { "entropy": 3.302608609199524, "epoch": 0.12746666666666667, "grad_norm": 1.2265625, "learning_rate": 0.0004953727922052035, "loss": 3.1965, "mean_token_accuracy": 0.24475293457508088, "num_tokens": 19578880.0, "step": 1195 }, { "entropy": 3.2857021570205687, "epoch": 0.128, "grad_norm": 1.71875, "learning_rate": 0.0004951320775200756, "loss": 3.1931, "mean_token_accuracy": 0.2490949109196663, "num_tokens": 19660800.0, "step": 1200 }, { "entropy": 3.2887937784194947, "epoch": 0.12853333333333333, "grad_norm": 1.046875, "learning_rate": 0.0004948853278028436, "loss": 3.1823, "mean_token_accuracy": 0.24741927534341812, "num_tokens": 19742720.0, "step": 1205 }, { "entropy": 3.2885008096694945, "epoch": 0.12906666666666666, "grad_norm": 1.546875, "learning_rate": 0.0004946325498182755, "loss": 3.2001, "mean_token_accuracy": 0.24372553527355195, "num_tokens": 19824640.0, "step": 1210 }, { "entropy": 3.285250186920166, "epoch": 0.1296, "grad_norm": 2.484375, "learning_rate": 0.0004943737504964076, "loss": 3.1976, "mean_token_accuracy": 0.24319960922002792, "num_tokens": 19906560.0, "step": 1215 }, { "entropy": 3.285680651664734, "epoch": 0.13013333333333332, "grad_norm": 1.140625, "learning_rate": 0.000494108936932354, "loss": 3.1927, "mean_token_accuracy": 0.24404354393482208, "num_tokens": 19988480.0, "step": 1220 }, { "entropy": 3.2831942081451415, "epoch": 0.13066666666666665, "grad_norm": 1.15625, "learning_rate": 0.0004938381163861124, "loss": 3.1895, "mean_token_accuracy": 0.24496086239814757, "num_tokens": 20070400.0, "step": 1225 }, { "entropy": 3.3090481758117676, "epoch": 0.1312, "grad_norm": 1.171875, "learning_rate": 0.0004935612962823645, "loss": 3.199, "mean_token_accuracy": 0.2423801377415657, "num_tokens": 20152320.0, "step": 1230 }, { "entropy": 3.279662609100342, "epoch": 0.13173333333333334, "grad_norm": 1.2890625, "learning_rate": 0.0004932784842102739, "loss": 3.1845, "mean_token_accuracy": 0.24876467883586884, "num_tokens": 20234240.0, "step": 1235 }, { "entropy": 3.2735153436660767, "epoch": 0.13226666666666667, "grad_norm": 1.0859375, "learning_rate": 0.0004929896879232758, "loss": 3.1864, "mean_token_accuracy": 0.24636741429567338, "num_tokens": 20316160.0, "step": 1240 }, { "entropy": 3.2701792240142824, "epoch": 0.1328, "grad_norm": 0.94921875, "learning_rate": 0.0004926949153388668, "loss": 3.1827, "mean_token_accuracy": 0.24416584968566896, "num_tokens": 20398080.0, "step": 1245 }, { "entropy": 3.2787445068359373, "epoch": 0.13333333333333333, "grad_norm": 1.078125, "learning_rate": 0.0004923941745383859, "loss": 3.177, "mean_token_accuracy": 0.24897260069847107, "num_tokens": 20480000.0, "step": 1250 }, { "entropy": 3.2674917697906496, "epoch": 0.13386666666666666, "grad_norm": 1.125, "learning_rate": 0.000492087473766794, "loss": 3.174, "mean_token_accuracy": 0.2497064560651779, "num_tokens": 20561920.0, "step": 1255 }, { "entropy": 3.2698441982269286, "epoch": 0.1344, "grad_norm": 1.4921875, "learning_rate": 0.000491774821432448, "loss": 3.1754, "mean_token_accuracy": 0.24757827669382096, "num_tokens": 20643840.0, "step": 1260 }, { "entropy": 3.2541027069091797, "epoch": 0.13493333333333332, "grad_norm": 0.984375, "learning_rate": 0.0004914562261068693, "loss": 3.1745, "mean_token_accuracy": 0.24631849080324172, "num_tokens": 20725760.0, "step": 1265 }, { "entropy": 3.2766933679580688, "epoch": 0.13546666666666668, "grad_norm": 1.2734375, "learning_rate": 0.0004911316965245098, "loss": 3.1727, "mean_token_accuracy": 0.24894814044237137, "num_tokens": 20807680.0, "step": 1270 }, { "entropy": 3.2813777208328245, "epoch": 0.136, "grad_norm": 0.98828125, "learning_rate": 0.000490801241582512, "loss": 3.1915, "mean_token_accuracy": 0.2451198622584343, "num_tokens": 20889600.0, "step": 1275 }, { "entropy": 3.2646867990493775, "epoch": 0.13653333333333334, "grad_norm": 1.1171875, "learning_rate": 0.000490464870340465, "loss": 3.1757, "mean_token_accuracy": 0.24669765084981918, "num_tokens": 20971520.0, "step": 1280 }, { "entropy": 3.2562508583068848, "epoch": 0.13706666666666667, "grad_norm": 1.0703125, "learning_rate": 0.0004901225920201563, "loss": 3.1728, "mean_token_accuracy": 0.24716242402791977, "num_tokens": 21053440.0, "step": 1285 }, { "entropy": 3.253575849533081, "epoch": 0.1376, "grad_norm": 1.765625, "learning_rate": 0.000489774416005319, "loss": 3.1774, "mean_token_accuracy": 0.2478595867753029, "num_tokens": 21135360.0, "step": 1290 }, { "entropy": 3.2708191871643066, "epoch": 0.13813333333333333, "grad_norm": 1.6015625, "learning_rate": 0.0004894203518413742, "loss": 3.1756, "mean_token_accuracy": 0.2494618386030197, "num_tokens": 21217280.0, "step": 1295 }, { "entropy": 3.259015607833862, "epoch": 0.13866666666666666, "grad_norm": 1.0, "learning_rate": 0.0004890604092351701, "loss": 3.1755, "mean_token_accuracy": 0.24667318910360336, "num_tokens": 21299200.0, "step": 1300 }, { "entropy": 3.251534938812256, "epoch": 0.1392, "grad_norm": 1.8359375, "learning_rate": 0.000488694598054715, "loss": 3.172, "mean_token_accuracy": 0.24642856866121293, "num_tokens": 21381120.0, "step": 1305 }, { "entropy": 3.2675605535507204, "epoch": 0.13973333333333332, "grad_norm": 1.21875, "learning_rate": 0.0004883229283289071, "loss": 3.182, "mean_token_accuracy": 0.24386007934808732, "num_tokens": 21463040.0, "step": 1310 }, { "entropy": 3.25923867225647, "epoch": 0.14026666666666668, "grad_norm": 1.09375, "learning_rate": 0.00048794541024725993, "loss": 3.1757, "mean_token_accuracy": 0.2474315032362938, "num_tokens": 21544960.0, "step": 1315 }, { "entropy": 3.250070834159851, "epoch": 0.1408, "grad_norm": 1.7421875, "learning_rate": 0.0004875620541596221, "loss": 3.1563, "mean_token_accuracy": 0.25125978142023087, "num_tokens": 21626880.0, "step": 1320 }, { "entropy": 3.247203159332275, "epoch": 0.14133333333333334, "grad_norm": 1.5234375, "learning_rate": 0.00048717287057589454, "loss": 3.1715, "mean_token_accuracy": 0.24865460246801377, "num_tokens": 21708800.0, "step": 1325 }, { "entropy": 3.259696698188782, "epoch": 0.14186666666666667, "grad_norm": 1.3984375, "learning_rate": 0.0004867778701657417, "loss": 3.1756, "mean_token_accuracy": 0.24743150621652604, "num_tokens": 21790720.0, "step": 1330 }, { "entropy": 3.2434436321258544, "epoch": 0.1424, "grad_norm": 1.15625, "learning_rate": 0.00048637706375829955, "loss": 3.1706, "mean_token_accuracy": 0.24798190146684645, "num_tokens": 21872640.0, "step": 1335 }, { "entropy": 3.2555607080459597, "epoch": 0.14293333333333333, "grad_norm": 1.0546875, "learning_rate": 0.000485970462341878, "loss": 3.1817, "mean_token_accuracy": 0.24480185955762862, "num_tokens": 21954560.0, "step": 1340 }, { "entropy": 3.2555992364883424, "epoch": 0.14346666666666666, "grad_norm": 1.15625, "learning_rate": 0.00048555807706366044, "loss": 3.1661, "mean_token_accuracy": 0.24701565653085708, "num_tokens": 22036480.0, "step": 1345 }, { "entropy": 3.2635560274124145, "epoch": 0.144, "grad_norm": 1.078125, "learning_rate": 0.00048513991922939756, "loss": 3.1719, "mean_token_accuracy": 0.2476638972759247, "num_tokens": 22118400.0, "step": 1350 }, { "entropy": 3.2353002548217775, "epoch": 0.14453333333333335, "grad_norm": 1.015625, "learning_rate": 0.00048471600030309744, "loss": 3.1687, "mean_token_accuracy": 0.24576810002326965, "num_tokens": 22200320.0, "step": 1355 }, { "entropy": 3.2604353427886963, "epoch": 0.14506666666666668, "grad_norm": 1.203125, "learning_rate": 0.00048428633190671186, "loss": 3.1833, "mean_token_accuracy": 0.24412915706634522, "num_tokens": 22282240.0, "step": 1360 }, { "entropy": 3.250130367279053, "epoch": 0.1456, "grad_norm": 0.99609375, "learning_rate": 0.0004838509258198167, "loss": 3.1613, "mean_token_accuracy": 0.24606164395809174, "num_tokens": 22364160.0, "step": 1365 }, { "entropy": 3.239962911605835, "epoch": 0.14613333333333334, "grad_norm": 0.9296875, "learning_rate": 0.00048340979397929, "loss": 3.1646, "mean_token_accuracy": 0.24450831711292267, "num_tokens": 22446080.0, "step": 1370 }, { "entropy": 3.2506635189056396, "epoch": 0.14666666666666667, "grad_norm": 1.140625, "learning_rate": 0.00048296294847898386, "loss": 3.1618, "mean_token_accuracy": 0.2475171208381653, "num_tokens": 22528000.0, "step": 1375 }, { "entropy": 3.238317131996155, "epoch": 0.1472, "grad_norm": 1.0234375, "learning_rate": 0.0004825104015693934, "loss": 3.1581, "mean_token_accuracy": 0.2483855202794075, "num_tokens": 22609920.0, "step": 1380 }, { "entropy": 3.2297689437866213, "epoch": 0.14773333333333333, "grad_norm": 1.921875, "learning_rate": 0.0004820521656573208, "loss": 3.1523, "mean_token_accuracy": 0.24914383441209792, "num_tokens": 22691840.0, "step": 1385 }, { "entropy": 3.226832556724548, "epoch": 0.14826666666666666, "grad_norm": 1.0, "learning_rate": 0.00048158825330553505, "loss": 3.161, "mean_token_accuracy": 0.2477372795343399, "num_tokens": 22773760.0, "step": 1390 }, { "entropy": 3.241289162635803, "epoch": 0.1488, "grad_norm": 0.9921875, "learning_rate": 0.00048111867723242763, "loss": 3.1622, "mean_token_accuracy": 0.24646526277065278, "num_tokens": 22855680.0, "step": 1395 }, { "entropy": 3.230481195449829, "epoch": 0.14933333333333335, "grad_norm": 0.91015625, "learning_rate": 0.0004806434503116637, "loss": 3.1512, "mean_token_accuracy": 0.2504525452852249, "num_tokens": 22937600.0, "step": 1400 }, { "entropy": 3.239303541183472, "epoch": 0.14986666666666668, "grad_norm": 0.87109375, "learning_rate": 0.0004801625855718296, "loss": 3.1624, "mean_token_accuracy": 0.2447773963212967, "num_tokens": 23019520.0, "step": 1405 }, { "entropy": 3.2366477489471435, "epoch": 0.1504, "grad_norm": 1.0234375, "learning_rate": 0.00047967609619607477, "loss": 3.164, "mean_token_accuracy": 0.24387230724096298, "num_tokens": 23101440.0, "step": 1410 }, { "entropy": 3.23808913230896, "epoch": 0.15093333333333334, "grad_norm": 1.6015625, "learning_rate": 0.0004791839955217513, "loss": 3.1671, "mean_token_accuracy": 0.24540117383003235, "num_tokens": 23183360.0, "step": 1415 }, { "entropy": 3.2244601249694824, "epoch": 0.15146666666666667, "grad_norm": 1.3046875, "learning_rate": 0.00047868629704004786, "loss": 3.1429, "mean_token_accuracy": 0.2505626201629639, "num_tokens": 23265280.0, "step": 1420 }, { "entropy": 3.2507676601409914, "epoch": 0.152, "grad_norm": 1.5390625, "learning_rate": 0.00047818301439561965, "loss": 3.169, "mean_token_accuracy": 0.2452421724796295, "num_tokens": 23347200.0, "step": 1425 }, { "entropy": 3.2121356248855593, "epoch": 0.15253333333333333, "grad_norm": 1.1640625, "learning_rate": 0.00047767416138621454, "loss": 3.1471, "mean_token_accuracy": 0.25017123073339465, "num_tokens": 23429120.0, "step": 1430 }, { "entropy": 3.218046474456787, "epoch": 0.15306666666666666, "grad_norm": 0.953125, "learning_rate": 0.000477159751962295, "loss": 3.1436, "mean_token_accuracy": 0.25108855217695236, "num_tokens": 23511040.0, "step": 1435 }, { "entropy": 3.2176970481872558, "epoch": 0.1536, "grad_norm": 1.671875, "learning_rate": 0.00047663980022665507, "loss": 3.1525, "mean_token_accuracy": 0.2482999011874199, "num_tokens": 23592960.0, "step": 1440 }, { "entropy": 3.2244531154632567, "epoch": 0.15413333333333334, "grad_norm": 0.8515625, "learning_rate": 0.00047611432043403437, "loss": 3.1472, "mean_token_accuracy": 0.24842221140861512, "num_tokens": 23674880.0, "step": 1445 }, { "entropy": 3.2204693078994753, "epoch": 0.15466666666666667, "grad_norm": 1.03125, "learning_rate": 0.0004755833269907267, "loss": 3.1497, "mean_token_accuracy": 0.24949852973222733, "num_tokens": 23756800.0, "step": 1450 }, { "entropy": 3.2204687356948853, "epoch": 0.1552, "grad_norm": 1.0546875, "learning_rate": 0.0004750468344541857, "loss": 3.1528, "mean_token_accuracy": 0.24694227129220964, "num_tokens": 23838720.0, "step": 1455 }, { "entropy": 3.2242907762527464, "epoch": 0.15573333333333333, "grad_norm": 0.859375, "learning_rate": 0.00047450485753262525, "loss": 3.1501, "mean_token_accuracy": 0.24770058542490006, "num_tokens": 23920640.0, "step": 1460 }, { "entropy": 3.208418536186218, "epoch": 0.15626666666666666, "grad_norm": 0.89453125, "learning_rate": 0.00047395741108461633, "loss": 3.1442, "mean_token_accuracy": 0.24839774817228316, "num_tokens": 24002560.0, "step": 1465 }, { "entropy": 3.2096371412277223, "epoch": 0.1568, "grad_norm": 1.09375, "learning_rate": 0.00047340451011867985, "loss": 3.1389, "mean_token_accuracy": 0.2509784743189812, "num_tokens": 24084480.0, "step": 1470 }, { "entropy": 3.207978129386902, "epoch": 0.15733333333333333, "grad_norm": 1.234375, "learning_rate": 0.00047284616979287515, "loss": 3.1386, "mean_token_accuracy": 0.2520303353667259, "num_tokens": 24166400.0, "step": 1475 }, { "entropy": 3.2250426769256593, "epoch": 0.15786666666666666, "grad_norm": 0.765625, "learning_rate": 0.00047228240541438433, "loss": 3.1525, "mean_token_accuracy": 0.24716242402791977, "num_tokens": 24248320.0, "step": 1480 }, { "entropy": 3.216737985610962, "epoch": 0.1584, "grad_norm": 0.8515625, "learning_rate": 0.00047171323243909257, "loss": 3.1438, "mean_token_accuracy": 0.24896036833524704, "num_tokens": 24330240.0, "step": 1485 }, { "entropy": 3.216948318481445, "epoch": 0.15893333333333334, "grad_norm": 1.171875, "learning_rate": 0.00047113866647116457, "loss": 3.1477, "mean_token_accuracy": 0.24820205420255662, "num_tokens": 24412160.0, "step": 1490 }, { "entropy": 3.215489459037781, "epoch": 0.15946666666666667, "grad_norm": 1.0078125, "learning_rate": 0.0004705587232626164, "loss": 3.1494, "mean_token_accuracy": 0.24653865098953248, "num_tokens": 24494080.0, "step": 1495 }, { "entropy": 3.216701889038086, "epoch": 0.16, "grad_norm": 0.8046875, "learning_rate": 0.00046997341871288424, "loss": 3.1436, "mean_token_accuracy": 0.24893590807914734, "num_tokens": 24576000.0, "step": 1500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.2542017536e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }