{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.10829103214890017, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69199342727661, "epoch": 0.00013536379018612522, "grad_norm": 11.5625, "learning_rate": 2e-06, "loss": 10.8479, "mean_token_accuracy": 0.0, "num_tokens": 12791.0, "step": 5 }, { "entropy": 10.691878128051759, "epoch": 0.00027072758037225043, "grad_norm": 11.0, "learning_rate": 4.5e-06, "loss": 10.8142, "mean_token_accuracy": 0.0, "num_tokens": 26683.0, "step": 10 }, { "entropy": 10.691429710388183, "epoch": 0.0004060913705583756, "grad_norm": 9.3125, "learning_rate": 7e-06, "loss": 10.5672, "mean_token_accuracy": 0.011101403925567865, "num_tokens": 39347.0, "step": 15 }, { "entropy": 10.686277675628663, "epoch": 0.0005414551607445009, "grad_norm": 5.375, "learning_rate": 9.5e-06, "loss": 10.3174, "mean_token_accuracy": 0.030114291980862618, "num_tokens": 54329.0, "step": 20 }, { "entropy": 10.660668087005615, "epoch": 0.0006768189509306261, "grad_norm": 4.09375, "learning_rate": 1.2e-05, "loss": 10.0145, "mean_token_accuracy": 0.032822173461318015, "num_tokens": 67393.0, "step": 25 }, { "entropy": 10.637198734283448, "epoch": 0.0008121827411167512, "grad_norm": 3.0625, "learning_rate": 1.4500000000000002e-05, "loss": 9.8798, "mean_token_accuracy": 0.03450996596366167, "num_tokens": 81383.0, "step": 30 }, { "entropy": 10.631521320343017, "epoch": 0.0009475465313028764, "grad_norm": 2.515625, "learning_rate": 1.7000000000000003e-05, "loss": 9.8183, "mean_token_accuracy": 0.03217146322131157, "num_tokens": 95991.0, "step": 35 }, { "entropy": 10.626516151428223, "epoch": 0.0010829103214890017, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.7088, "mean_token_accuracy": 0.03352573178708553, "num_tokens": 108504.0, "step": 40 }, { "entropy": 10.627447319030761, "epoch": 0.001218274111675127, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 9.7785, "mean_token_accuracy": 0.030551478266716003, "num_tokens": 123286.0, "step": 45 }, { "entropy": 10.629091835021972, "epoch": 0.0013536379018612521, "grad_norm": 2.296875, "learning_rate": 2.4500000000000003e-05, "loss": 9.6538, "mean_token_accuracy": 0.03104141727089882, "num_tokens": 135493.0, "step": 50 }, { "entropy": 10.618868160247803, "epoch": 0.0014890016920473773, "grad_norm": 2.078125, "learning_rate": 2.7e-05, "loss": 9.6537, "mean_token_accuracy": 0.03736583907157183, "num_tokens": 150376.0, "step": 55 }, { "entropy": 10.596181201934815, "epoch": 0.0016243654822335025, "grad_norm": 2.109375, "learning_rate": 2.95e-05, "loss": 9.5976, "mean_token_accuracy": 0.03170219026505947, "num_tokens": 165805.0, "step": 60 }, { "entropy": 10.606531143188477, "epoch": 0.0017597292724196277, "grad_norm": 2.09375, "learning_rate": 3.2e-05, "loss": 9.4608, "mean_token_accuracy": 0.03743585981428623, "num_tokens": 179043.0, "step": 65 }, { "entropy": 10.577856731414794, "epoch": 0.0018950930626057529, "grad_norm": 2.09375, "learning_rate": 3.4500000000000005e-05, "loss": 9.3947, "mean_token_accuracy": 0.03445138856768608, "num_tokens": 191847.0, "step": 70 }, { "entropy": 10.561034107208252, "epoch": 0.0020304568527918783, "grad_norm": 2.125, "learning_rate": 3.7e-05, "loss": 9.2778, "mean_token_accuracy": 0.03577356971800327, "num_tokens": 207116.0, "step": 75 }, { "entropy": 10.546807861328125, "epoch": 0.0021658206429780035, "grad_norm": 2.03125, "learning_rate": 3.95e-05, "loss": 9.2156, "mean_token_accuracy": 0.03288109693676233, "num_tokens": 219651.0, "step": 80 }, { "entropy": 10.532037448883056, "epoch": 0.0023011844331641287, "grad_norm": 2.015625, "learning_rate": 4.2000000000000004e-05, "loss": 9.16, "mean_token_accuracy": 0.03139570262283087, "num_tokens": 233183.0, "step": 85 }, { "entropy": 10.499158573150634, "epoch": 0.002436548223350254, "grad_norm": 2.0625, "learning_rate": 4.45e-05, "loss": 8.9864, "mean_token_accuracy": 0.0376906756311655, "num_tokens": 246291.0, "step": 90 }, { "entropy": 10.423231887817384, "epoch": 0.002571912013536379, "grad_norm": 2.15625, "learning_rate": 4.7000000000000004e-05, "loss": 8.8533, "mean_token_accuracy": 0.04000245779752731, "num_tokens": 259606.0, "step": 95 }, { "entropy": 10.371912956237793, "epoch": 0.0027072758037225042, "grad_norm": 2.0, "learning_rate": 4.9500000000000004e-05, "loss": 8.7521, "mean_token_accuracy": 0.04012820441275835, "num_tokens": 275174.0, "step": 100 }, { "entropy": 10.304845333099365, "epoch": 0.0028426395939086294, "grad_norm": 2.25, "learning_rate": 5.2e-05, "loss": 8.5952, "mean_token_accuracy": 0.04803745746612549, "num_tokens": 287873.0, "step": 105 }, { "entropy": 10.202454662322998, "epoch": 0.0029780033840947546, "grad_norm": 1.9453125, "learning_rate": 5.45e-05, "loss": 8.4264, "mean_token_accuracy": 0.052891625463962554, "num_tokens": 301243.0, "step": 110 }, { "entropy": 10.146648788452149, "epoch": 0.00311336717428088, "grad_norm": 2.140625, "learning_rate": 5.7e-05, "loss": 8.3599, "mean_token_accuracy": 0.04921769984066486, "num_tokens": 314246.0, "step": 115 }, { "entropy": 9.991413021087647, "epoch": 0.003248730964467005, "grad_norm": 1.671875, "learning_rate": 5.9499999999999996e-05, "loss": 8.1824, "mean_token_accuracy": 0.05792190656065941, "num_tokens": 327131.0, "step": 120 }, { "entropy": 9.899451637268067, "epoch": 0.00338409475465313, "grad_norm": 1.7734375, "learning_rate": 6.2e-05, "loss": 8.0577, "mean_token_accuracy": 0.054864197969436646, "num_tokens": 340932.0, "step": 125 }, { "entropy": 9.722916507720948, "epoch": 0.0035194585448392554, "grad_norm": 1.671875, "learning_rate": 6.450000000000001e-05, "loss": 7.9419, "mean_token_accuracy": 0.05465308241546154, "num_tokens": 355280.0, "step": 130 }, { "entropy": 9.517075347900391, "epoch": 0.0036548223350253805, "grad_norm": 1.546875, "learning_rate": 6.7e-05, "loss": 7.863, "mean_token_accuracy": 0.06392355933785439, "num_tokens": 370159.0, "step": 135 }, { "entropy": 9.312166881561279, "epoch": 0.0037901861252115057, "grad_norm": 1.4609375, "learning_rate": 6.950000000000001e-05, "loss": 7.7284, "mean_token_accuracy": 0.060528535023331644, "num_tokens": 385660.0, "step": 140 }, { "entropy": 9.113211154937744, "epoch": 0.003925549915397631, "grad_norm": 1.3359375, "learning_rate": 7.2e-05, "loss": 7.6437, "mean_token_accuracy": 0.05836181789636612, "num_tokens": 401147.0, "step": 145 }, { "entropy": 8.787345790863037, "epoch": 0.0040609137055837565, "grad_norm": 1.5625, "learning_rate": 7.45e-05, "loss": 7.4136, "mean_token_accuracy": 0.07278152294456959, "num_tokens": 413888.0, "step": 150 }, { "entropy": 8.64449052810669, "epoch": 0.004196277495769882, "grad_norm": 1.40625, "learning_rate": 7.7e-05, "loss": 7.3884, "mean_token_accuracy": 0.06653538607060909, "num_tokens": 427538.0, "step": 155 }, { "entropy": 8.441664218902588, "epoch": 0.004331641285956007, "grad_norm": 2.125, "learning_rate": 7.950000000000001e-05, "loss": 7.3251, "mean_token_accuracy": 0.069814383238554, "num_tokens": 441236.0, "step": 160 }, { "entropy": 8.356950950622558, "epoch": 0.004467005076142132, "grad_norm": 1.3984375, "learning_rate": 8.2e-05, "loss": 7.4254, "mean_token_accuracy": 0.0740208551287651, "num_tokens": 454231.0, "step": 165 }, { "entropy": 8.19385576248169, "epoch": 0.004602368866328257, "grad_norm": 1.5234375, "learning_rate": 8.450000000000001e-05, "loss": 7.2457, "mean_token_accuracy": 0.07566015087068081, "num_tokens": 468791.0, "step": 170 }, { "entropy": 8.173048114776611, "epoch": 0.0047377326565143825, "grad_norm": 1.6328125, "learning_rate": 8.7e-05, "loss": 7.3934, "mean_token_accuracy": 0.06828283667564392, "num_tokens": 481866.0, "step": 175 }, { "entropy": 8.059328603744508, "epoch": 0.004873096446700508, "grad_norm": 1.4296875, "learning_rate": 8.95e-05, "loss": 7.2376, "mean_token_accuracy": 0.07703411132097245, "num_tokens": 495060.0, "step": 180 }, { "entropy": 8.006558561325074, "epoch": 0.005008460236886633, "grad_norm": 1.2890625, "learning_rate": 9.2e-05, "loss": 7.1953, "mean_token_accuracy": 0.07884187921881676, "num_tokens": 508485.0, "step": 185 }, { "entropy": 7.988453817367554, "epoch": 0.005143824027072758, "grad_norm": 1.3984375, "learning_rate": 9.45e-05, "loss": 7.2074, "mean_token_accuracy": 0.07364003024995328, "num_tokens": 522642.0, "step": 190 }, { "entropy": 7.911316013336181, "epoch": 0.005279187817258883, "grad_norm": 1.234375, "learning_rate": 9.7e-05, "loss": 7.1742, "mean_token_accuracy": 0.07427211254835128, "num_tokens": 536967.0, "step": 195 }, { "entropy": 7.899316692352295, "epoch": 0.0054145516074450084, "grad_norm": 1.4296875, "learning_rate": 9.95e-05, "loss": 7.1728, "mean_token_accuracy": 0.0805082306265831, "num_tokens": 548389.0, "step": 200 }, { "entropy": 7.799197435379028, "epoch": 0.005549915397631134, "grad_norm": 1.296875, "learning_rate": 0.000102, "loss": 7.1509, "mean_token_accuracy": 0.07738717347383499, "num_tokens": 560609.0, "step": 205 }, { "entropy": 7.819343090057373, "epoch": 0.005685279187817259, "grad_norm": 1.3046875, "learning_rate": 0.00010449999999999999, "loss": 7.1254, "mean_token_accuracy": 0.07640378400683404, "num_tokens": 574689.0, "step": 210 }, { "entropy": 7.777826452255249, "epoch": 0.005820642978003384, "grad_norm": 1.3515625, "learning_rate": 0.000107, "loss": 7.0691, "mean_token_accuracy": 0.07349300533533096, "num_tokens": 588789.0, "step": 215 }, { "entropy": 7.698786115646362, "epoch": 0.005956006768189509, "grad_norm": 1.3125, "learning_rate": 0.0001095, "loss": 7.1439, "mean_token_accuracy": 0.07730361446738243, "num_tokens": 603609.0, "step": 220 }, { "entropy": 7.7466569423675535, "epoch": 0.006091370558375634, "grad_norm": 1.4453125, "learning_rate": 0.000112, "loss": 7.0113, "mean_token_accuracy": 0.07942908927798271, "num_tokens": 616403.0, "step": 225 }, { "entropy": 7.682626628875733, "epoch": 0.00622673434856176, "grad_norm": 1.09375, "learning_rate": 0.0001145, "loss": 7.1202, "mean_token_accuracy": 0.08443130478262902, "num_tokens": 630831.0, "step": 230 }, { "entropy": 7.731028842926025, "epoch": 0.006362098138747885, "grad_norm": 1.5078125, "learning_rate": 0.00011700000000000001, "loss": 7.0225, "mean_token_accuracy": 0.08779790177941323, "num_tokens": 646501.0, "step": 235 }, { "entropy": 7.661398029327392, "epoch": 0.00649746192893401, "grad_norm": 1.8671875, "learning_rate": 0.00011949999999999999, "loss": 7.0941, "mean_token_accuracy": 0.08079206757247448, "num_tokens": 661193.0, "step": 240 }, { "entropy": 7.572637605667114, "epoch": 0.006632825719120135, "grad_norm": 1.734375, "learning_rate": 0.000122, "loss": 7.0787, "mean_token_accuracy": 0.08005881682038307, "num_tokens": 675523.0, "step": 245 }, { "entropy": 7.636332321166992, "epoch": 0.00676818950930626, "grad_norm": 1.5859375, "learning_rate": 0.0001245, "loss": 7.0674, "mean_token_accuracy": 0.07794632315635681, "num_tokens": 691106.0, "step": 250 }, { "entropy": 7.519766235351563, "epoch": 0.0069035532994923855, "grad_norm": 1.3671875, "learning_rate": 0.000127, "loss": 6.9381, "mean_token_accuracy": 0.08541512936353683, "num_tokens": 704312.0, "step": 255 }, { "entropy": 7.561954641342163, "epoch": 0.007038917089678511, "grad_norm": 1.4375, "learning_rate": 0.0001295, "loss": 6.9601, "mean_token_accuracy": 0.0883929617702961, "num_tokens": 717026.0, "step": 260 }, { "entropy": 7.570081567764282, "epoch": 0.007174280879864636, "grad_norm": 1.328125, "learning_rate": 0.000132, "loss": 6.9123, "mean_token_accuracy": 0.08829773366451263, "num_tokens": 729605.0, "step": 265 }, { "entropy": 7.463983678817749, "epoch": 0.007309644670050761, "grad_norm": 1.2421875, "learning_rate": 0.00013450000000000002, "loss": 6.9353, "mean_token_accuracy": 0.09122553616762161, "num_tokens": 743208.0, "step": 270 }, { "entropy": 7.550097227096558, "epoch": 0.007445008460236886, "grad_norm": 1.2578125, "learning_rate": 0.00013700000000000002, "loss": 6.9287, "mean_token_accuracy": 0.08519787713885307, "num_tokens": 755127.0, "step": 275 }, { "entropy": 7.398041200637818, "epoch": 0.0075803722504230115, "grad_norm": 1.53125, "learning_rate": 0.0001395, "loss": 6.8231, "mean_token_accuracy": 0.08911917060613632, "num_tokens": 769725.0, "step": 280 }, { "entropy": 7.364175844192505, "epoch": 0.007715736040609137, "grad_norm": 1.2109375, "learning_rate": 0.00014199999999999998, "loss": 6.7527, "mean_token_accuracy": 0.09069294035434723, "num_tokens": 783788.0, "step": 285 }, { "entropy": 7.450532627105713, "epoch": 0.007851099830795263, "grad_norm": 1.171875, "learning_rate": 0.0001445, "loss": 6.934, "mean_token_accuracy": 0.08614907264709473, "num_tokens": 797214.0, "step": 290 }, { "entropy": 7.43695821762085, "epoch": 0.007986463620981387, "grad_norm": 1.6328125, "learning_rate": 0.000147, "loss": 6.897, "mean_token_accuracy": 0.09108028039336205, "num_tokens": 809731.0, "step": 295 }, { "entropy": 7.286933469772339, "epoch": 0.008121827411167513, "grad_norm": 1.4296875, "learning_rate": 0.0001495, "loss": 6.8591, "mean_token_accuracy": 0.09137310981750488, "num_tokens": 825021.0, "step": 300 }, { "entropy": 7.2696253776550295, "epoch": 0.008257191201353637, "grad_norm": 1.40625, "learning_rate": 0.000152, "loss": 6.9029, "mean_token_accuracy": 0.09101672545075416, "num_tokens": 839153.0, "step": 305 }, { "entropy": 7.386481237411499, "epoch": 0.008392554991539763, "grad_norm": 1.3984375, "learning_rate": 0.00015450000000000001, "loss": 6.8276, "mean_token_accuracy": 0.08859616219997406, "num_tokens": 853120.0, "step": 310 }, { "entropy": 7.337709522247314, "epoch": 0.008527918781725888, "grad_norm": 1.21875, "learning_rate": 0.000157, "loss": 6.8448, "mean_token_accuracy": 0.08571028485894203, "num_tokens": 867268.0, "step": 315 }, { "entropy": 7.340923023223877, "epoch": 0.008663282571912014, "grad_norm": 1.3515625, "learning_rate": 0.0001595, "loss": 6.8255, "mean_token_accuracy": 0.09267906844615936, "num_tokens": 879062.0, "step": 320 }, { "entropy": 7.282296800613404, "epoch": 0.008798646362098138, "grad_norm": 1.4140625, "learning_rate": 0.000162, "loss": 6.7932, "mean_token_accuracy": 0.09626845642924309, "num_tokens": 892178.0, "step": 325 }, { "entropy": 7.201563024520874, "epoch": 0.008934010152284264, "grad_norm": 1.3125, "learning_rate": 0.00016450000000000001, "loss": 6.671, "mean_token_accuracy": 0.09671695902943611, "num_tokens": 904809.0, "step": 330 }, { "entropy": 7.275315999984741, "epoch": 0.009069373942470389, "grad_norm": 1.2734375, "learning_rate": 0.00016700000000000002, "loss": 6.8034, "mean_token_accuracy": 0.09026706293225288, "num_tokens": 917660.0, "step": 335 }, { "entropy": 7.179704904556274, "epoch": 0.009204737732656515, "grad_norm": 1.328125, "learning_rate": 0.00016950000000000003, "loss": 6.6849, "mean_token_accuracy": 0.09763308465480805, "num_tokens": 932773.0, "step": 340 }, { "entropy": 7.1569760799407955, "epoch": 0.009340101522842639, "grad_norm": 1.3359375, "learning_rate": 0.00017199999999999998, "loss": 6.707, "mean_token_accuracy": 0.09705711230635643, "num_tokens": 946688.0, "step": 345 }, { "entropy": 7.123394393920899, "epoch": 0.009475465313028765, "grad_norm": 1.3671875, "learning_rate": 0.00017449999999999999, "loss": 6.6188, "mean_token_accuracy": 0.10255519598722458, "num_tokens": 960621.0, "step": 350 }, { "entropy": 7.114657831192017, "epoch": 0.00961082910321489, "grad_norm": 1.2734375, "learning_rate": 0.000177, "loss": 6.7525, "mean_token_accuracy": 0.0939077839255333, "num_tokens": 976705.0, "step": 355 }, { "entropy": 7.13629846572876, "epoch": 0.009746192893401015, "grad_norm": 1.234375, "learning_rate": 0.0001795, "loss": 6.6798, "mean_token_accuracy": 0.09904273673892021, "num_tokens": 989175.0, "step": 360 }, { "entropy": 7.18667254447937, "epoch": 0.00988155668358714, "grad_norm": 1.25, "learning_rate": 0.000182, "loss": 6.7875, "mean_token_accuracy": 0.095027344673872, "num_tokens": 1003899.0, "step": 365 }, { "entropy": 7.018054962158203, "epoch": 0.010016920473773266, "grad_norm": 1.4765625, "learning_rate": 0.0001845, "loss": 6.6248, "mean_token_accuracy": 0.09302543699741364, "num_tokens": 1017823.0, "step": 370 }, { "entropy": 7.214749193191528, "epoch": 0.01015228426395939, "grad_norm": 1.234375, "learning_rate": 0.000187, "loss": 6.8025, "mean_token_accuracy": 0.0944581039249897, "num_tokens": 1031556.0, "step": 375 }, { "entropy": 7.06955304145813, "epoch": 0.010287648054145516, "grad_norm": 1.375, "learning_rate": 0.0001895, "loss": 6.6582, "mean_token_accuracy": 0.10281435176730155, "num_tokens": 1044245.0, "step": 380 }, { "entropy": 7.121717023849487, "epoch": 0.01042301184433164, "grad_norm": 1.3671875, "learning_rate": 0.000192, "loss": 6.6908, "mean_token_accuracy": 0.09887115061283111, "num_tokens": 1058288.0, "step": 385 }, { "entropy": 7.069799566268921, "epoch": 0.010558375634517767, "grad_norm": 1.546875, "learning_rate": 0.0001945, "loss": 6.623, "mean_token_accuracy": 0.09829980209469795, "num_tokens": 1072234.0, "step": 390 }, { "entropy": 7.062967205047608, "epoch": 0.010693739424703893, "grad_norm": 1.484375, "learning_rate": 0.00019700000000000002, "loss": 6.6287, "mean_token_accuracy": 0.0978606753051281, "num_tokens": 1085463.0, "step": 395 }, { "entropy": 6.952229833602905, "epoch": 0.010829103214890017, "grad_norm": 1.4375, "learning_rate": 0.00019950000000000002, "loss": 6.6629, "mean_token_accuracy": 0.09642241895198822, "num_tokens": 1101393.0, "step": 400 }, { "entropy": 7.105423212051392, "epoch": 0.010964467005076143, "grad_norm": 1.1171875, "learning_rate": 0.000202, "loss": 6.6263, "mean_token_accuracy": 0.09685642644762993, "num_tokens": 1117150.0, "step": 405 }, { "entropy": 6.972289943695069, "epoch": 0.011099830795262267, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 6.6594, "mean_token_accuracy": 0.10496844202280045, "num_tokens": 1130674.0, "step": 410 }, { "entropy": 7.087021827697754, "epoch": 0.011235194585448393, "grad_norm": 1.171875, "learning_rate": 0.000207, "loss": 6.6508, "mean_token_accuracy": 0.09535380229353904, "num_tokens": 1144016.0, "step": 415 }, { "entropy": 6.9751802444458, "epoch": 0.011370558375634518, "grad_norm": 1.1484375, "learning_rate": 0.0002095, "loss": 6.646, "mean_token_accuracy": 0.09546661153435707, "num_tokens": 1160200.0, "step": 420 }, { "entropy": 7.048429536819458, "epoch": 0.011505922165820644, "grad_norm": 1.484375, "learning_rate": 0.000212, "loss": 6.5651, "mean_token_accuracy": 0.1022900827229023, "num_tokens": 1173266.0, "step": 425 }, { "entropy": 6.974373769760132, "epoch": 0.011641285956006768, "grad_norm": 1.1171875, "learning_rate": 0.0002145, "loss": 6.6353, "mean_token_accuracy": 0.09445997178554535, "num_tokens": 1187977.0, "step": 430 }, { "entropy": 6.9971846580505375, "epoch": 0.011776649746192894, "grad_norm": 1.21875, "learning_rate": 0.00021700000000000002, "loss": 6.6389, "mean_token_accuracy": 0.09972369968891144, "num_tokens": 1202369.0, "step": 435 }, { "entropy": 6.966669607162475, "epoch": 0.011912013536379018, "grad_norm": 1.3203125, "learning_rate": 0.0002195, "loss": 6.5354, "mean_token_accuracy": 0.09552454426884652, "num_tokens": 1216956.0, "step": 440 }, { "entropy": 6.981910848617554, "epoch": 0.012047377326565144, "grad_norm": 1.1796875, "learning_rate": 0.000222, "loss": 6.6403, "mean_token_accuracy": 0.09657183811068534, "num_tokens": 1230958.0, "step": 445 }, { "entropy": 6.972163391113281, "epoch": 0.012182741116751269, "grad_norm": 1.3671875, "learning_rate": 0.0002245, "loss": 6.5568, "mean_token_accuracy": 0.1032287061214447, "num_tokens": 1244512.0, "step": 450 }, { "entropy": 6.940069246292114, "epoch": 0.012318104906937395, "grad_norm": 1.5078125, "learning_rate": 0.00022700000000000002, "loss": 6.4972, "mean_token_accuracy": 0.10796320661902428, "num_tokens": 1257469.0, "step": 455 }, { "entropy": 6.870718479156494, "epoch": 0.01245346869712352, "grad_norm": 1.203125, "learning_rate": 0.00022950000000000002, "loss": 6.5861, "mean_token_accuracy": 0.10574530512094497, "num_tokens": 1273533.0, "step": 460 }, { "entropy": 6.932940578460693, "epoch": 0.012588832487309645, "grad_norm": 1.25, "learning_rate": 0.00023200000000000003, "loss": 6.5387, "mean_token_accuracy": 0.10031782239675521, "num_tokens": 1288385.0, "step": 465 }, { "entropy": 6.920595693588257, "epoch": 0.01272419627749577, "grad_norm": 1.3203125, "learning_rate": 0.00023449999999999998, "loss": 6.6012, "mean_token_accuracy": 0.10496116429567337, "num_tokens": 1300721.0, "step": 470 }, { "entropy": 6.878480577468872, "epoch": 0.012859560067681896, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 6.4915, "mean_token_accuracy": 0.1057609498500824, "num_tokens": 1313125.0, "step": 475 }, { "entropy": 6.905995321273804, "epoch": 0.01299492385786802, "grad_norm": 1.296875, "learning_rate": 0.0002395, "loss": 6.5534, "mean_token_accuracy": 0.09937024191021919, "num_tokens": 1326226.0, "step": 480 }, { "entropy": 6.928886890411377, "epoch": 0.013130287648054146, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.4614, "mean_token_accuracy": 0.10791765451431275, "num_tokens": 1339932.0, "step": 485 }, { "entropy": 6.82708158493042, "epoch": 0.01326565143824027, "grad_norm": 1.3359375, "learning_rate": 0.0002445, "loss": 6.5553, "mean_token_accuracy": 0.09961838722229004, "num_tokens": 1354015.0, "step": 490 }, { "entropy": 6.846263122558594, "epoch": 0.013401015228426396, "grad_norm": 1.2734375, "learning_rate": 0.000247, "loss": 6.5473, "mean_token_accuracy": 0.100076574832201, "num_tokens": 1369333.0, "step": 495 }, { "entropy": 6.777434158325195, "epoch": 0.01353637901861252, "grad_norm": 1.2734375, "learning_rate": 0.0002495, "loss": 6.5092, "mean_token_accuracy": 0.10239997878670692, "num_tokens": 1383141.0, "step": 500 }, { "entropy": 6.814955854415894, "epoch": 0.013671742808798647, "grad_norm": 1.2890625, "learning_rate": 0.000252, "loss": 6.5148, "mean_token_accuracy": 0.10957075208425522, "num_tokens": 1398273.0, "step": 505 }, { "entropy": 6.813977956771851, "epoch": 0.013807106598984771, "grad_norm": 1.21875, "learning_rate": 0.0002545, "loss": 6.4406, "mean_token_accuracy": 0.10602880343794822, "num_tokens": 1412562.0, "step": 510 }, { "entropy": 6.782559490203857, "epoch": 0.013942470389170897, "grad_norm": 1.203125, "learning_rate": 0.000257, "loss": 6.4008, "mean_token_accuracy": 0.1101540595293045, "num_tokens": 1426024.0, "step": 515 }, { "entropy": 6.743443441390991, "epoch": 0.014077834179357021, "grad_norm": 1.171875, "learning_rate": 0.0002595, "loss": 6.4539, "mean_token_accuracy": 0.10084594711661339, "num_tokens": 1439774.0, "step": 520 }, { "entropy": 6.744311380386352, "epoch": 0.014213197969543147, "grad_norm": 1.296875, "learning_rate": 0.000262, "loss": 6.386, "mean_token_accuracy": 0.11141050532460213, "num_tokens": 1453041.0, "step": 525 }, { "entropy": 6.779989385604859, "epoch": 0.014348561759729272, "grad_norm": 1.25, "learning_rate": 0.00026450000000000003, "loss": 6.3421, "mean_token_accuracy": 0.10815011188387871, "num_tokens": 1466487.0, "step": 530 }, { "entropy": 6.666443109512329, "epoch": 0.014483925549915398, "grad_norm": 1.140625, "learning_rate": 0.00026700000000000004, "loss": 6.4193, "mean_token_accuracy": 0.107712272554636, "num_tokens": 1480142.0, "step": 535 }, { "entropy": 6.692905330657959, "epoch": 0.014619289340101522, "grad_norm": 1.2109375, "learning_rate": 0.00026950000000000005, "loss": 6.3428, "mean_token_accuracy": 0.1036965548992157, "num_tokens": 1493427.0, "step": 540 }, { "entropy": 6.6241538524627686, "epoch": 0.014754653130287648, "grad_norm": 1.21875, "learning_rate": 0.00027200000000000005, "loss": 6.3301, "mean_token_accuracy": 0.11499745398759842, "num_tokens": 1506055.0, "step": 545 }, { "entropy": 6.726637983322144, "epoch": 0.014890016920473773, "grad_norm": 1.15625, "learning_rate": 0.0002745, "loss": 6.4916, "mean_token_accuracy": 0.10548164397478103, "num_tokens": 1519239.0, "step": 550 }, { "entropy": 6.79321608543396, "epoch": 0.015025380710659899, "grad_norm": 1.2109375, "learning_rate": 0.000277, "loss": 6.4433, "mean_token_accuracy": 0.10511932224035263, "num_tokens": 1533630.0, "step": 555 }, { "entropy": 6.68529486656189, "epoch": 0.015160744500846023, "grad_norm": 1.4375, "learning_rate": 0.0002795, "loss": 6.3701, "mean_token_accuracy": 0.11614254266023635, "num_tokens": 1546749.0, "step": 560 }, { "entropy": 6.61783242225647, "epoch": 0.015296108291032149, "grad_norm": 1.1796875, "learning_rate": 0.00028199999999999997, "loss": 6.3126, "mean_token_accuracy": 0.11469681560993195, "num_tokens": 1560568.0, "step": 565 }, { "entropy": 6.697822999954224, "epoch": 0.015431472081218273, "grad_norm": 1.2734375, "learning_rate": 0.0002845, "loss": 6.383, "mean_token_accuracy": 0.10437465310096741, "num_tokens": 1574414.0, "step": 570 }, { "entropy": 6.622760200500489, "epoch": 0.0155668358714044, "grad_norm": 1.0625, "learning_rate": 0.000287, "loss": 6.3839, "mean_token_accuracy": 0.10195678994059562, "num_tokens": 1588906.0, "step": 575 }, { "entropy": 6.643900966644287, "epoch": 0.015702199661590525, "grad_norm": 1.0390625, "learning_rate": 0.0002895, "loss": 6.3656, "mean_token_accuracy": 0.11110272482037545, "num_tokens": 1603181.0, "step": 580 }, { "entropy": 6.722048425674439, "epoch": 0.01583756345177665, "grad_norm": 1.109375, "learning_rate": 0.000292, "loss": 6.365, "mean_token_accuracy": 0.1083282358944416, "num_tokens": 1617262.0, "step": 585 }, { "entropy": 6.704953336715699, "epoch": 0.015972927241962774, "grad_norm": 1.21875, "learning_rate": 0.0002945, "loss": 6.4147, "mean_token_accuracy": 0.10933435037732124, "num_tokens": 1631618.0, "step": 590 }, { "entropy": 6.532735300064087, "epoch": 0.016108291032148902, "grad_norm": 1.28125, "learning_rate": 0.000297, "loss": 6.1685, "mean_token_accuracy": 0.11916324943304062, "num_tokens": 1644717.0, "step": 595 }, { "entropy": 6.565193223953247, "epoch": 0.016243654822335026, "grad_norm": 1.0625, "learning_rate": 0.0002995, "loss": 6.3201, "mean_token_accuracy": 0.1078986182808876, "num_tokens": 1661888.0, "step": 600 }, { "entropy": 6.5602422714233395, "epoch": 0.01637901861252115, "grad_norm": 1.3203125, "learning_rate": 0.000302, "loss": 6.3369, "mean_token_accuracy": 0.11532969921827316, "num_tokens": 1676103.0, "step": 605 }, { "entropy": 6.621259689331055, "epoch": 0.016514382402707275, "grad_norm": 1.1796875, "learning_rate": 0.0003045, "loss": 6.3879, "mean_token_accuracy": 0.10770049318671227, "num_tokens": 1690902.0, "step": 610 }, { "entropy": 6.530938911437988, "epoch": 0.016649746192893403, "grad_norm": 1.140625, "learning_rate": 0.000307, "loss": 6.3262, "mean_token_accuracy": 0.11129384264349937, "num_tokens": 1705861.0, "step": 615 }, { "entropy": 6.601020479202271, "epoch": 0.016785109983079527, "grad_norm": 1.1796875, "learning_rate": 0.0003095, "loss": 6.2688, "mean_token_accuracy": 0.1109300784766674, "num_tokens": 1719893.0, "step": 620 }, { "entropy": 6.542957210540772, "epoch": 0.01692047377326565, "grad_norm": 1.2109375, "learning_rate": 0.000312, "loss": 6.2874, "mean_token_accuracy": 0.10827434211969375, "num_tokens": 1733411.0, "step": 625 }, { "entropy": 6.561354637145996, "epoch": 0.017055837563451776, "grad_norm": 1.2421875, "learning_rate": 0.0003145, "loss": 6.2397, "mean_token_accuracy": 0.11391478329896927, "num_tokens": 1747374.0, "step": 630 }, { "entropy": 6.587129735946656, "epoch": 0.017191201353637903, "grad_norm": 1.0546875, "learning_rate": 0.000317, "loss": 6.3487, "mean_token_accuracy": 0.11469378024339676, "num_tokens": 1761520.0, "step": 635 }, { "entropy": 6.594478893280029, "epoch": 0.017326565143824028, "grad_norm": 1.1796875, "learning_rate": 0.0003195, "loss": 6.3577, "mean_token_accuracy": 0.10972927659749984, "num_tokens": 1777499.0, "step": 640 }, { "entropy": 6.581266975402832, "epoch": 0.017461928934010152, "grad_norm": 1.1015625, "learning_rate": 0.000322, "loss": 6.2463, "mean_token_accuracy": 0.12096798866987228, "num_tokens": 1791308.0, "step": 645 }, { "entropy": 6.4111003398895265, "epoch": 0.017597292724196276, "grad_norm": 1.25, "learning_rate": 0.00032450000000000003, "loss": 6.1953, "mean_token_accuracy": 0.11683537811040878, "num_tokens": 1804545.0, "step": 650 }, { "entropy": 6.54813027381897, "epoch": 0.017732656514382404, "grad_norm": 1.2421875, "learning_rate": 0.00032700000000000003, "loss": 6.2866, "mean_token_accuracy": 0.11415853798389435, "num_tokens": 1818499.0, "step": 655 }, { "entropy": 6.5606420040130615, "epoch": 0.01786802030456853, "grad_norm": 1.125, "learning_rate": 0.00032950000000000004, "loss": 6.2876, "mean_token_accuracy": 0.10897349566221237, "num_tokens": 1833582.0, "step": 660 }, { "entropy": 6.524020147323609, "epoch": 0.018003384094754653, "grad_norm": 1.296875, "learning_rate": 0.00033200000000000005, "loss": 6.26, "mean_token_accuracy": 0.11666257977485657, "num_tokens": 1847514.0, "step": 665 }, { "entropy": 6.450877380371094, "epoch": 0.018138747884940777, "grad_norm": 1.2109375, "learning_rate": 0.00033450000000000005, "loss": 6.2948, "mean_token_accuracy": 0.11785768866539001, "num_tokens": 1860177.0, "step": 670 }, { "entropy": 6.518109226226807, "epoch": 0.018274111675126905, "grad_norm": 1.21875, "learning_rate": 0.000337, "loss": 6.3086, "mean_token_accuracy": 0.11776039749383926, "num_tokens": 1873317.0, "step": 675 }, { "entropy": 6.405819511413574, "epoch": 0.01840947546531303, "grad_norm": 1.1640625, "learning_rate": 0.0003395, "loss": 6.1447, "mean_token_accuracy": 0.11899075359106064, "num_tokens": 1885974.0, "step": 680 }, { "entropy": 6.473683166503906, "epoch": 0.018544839255499154, "grad_norm": 1.125, "learning_rate": 0.000342, "loss": 6.3167, "mean_token_accuracy": 0.11156651675701142, "num_tokens": 1901894.0, "step": 685 }, { "entropy": 6.5223006248474125, "epoch": 0.018680203045685278, "grad_norm": 1.234375, "learning_rate": 0.00034449999999999997, "loss": 6.2982, "mean_token_accuracy": 0.11568359285593033, "num_tokens": 1916276.0, "step": 690 }, { "entropy": 6.437406921386719, "epoch": 0.018815566835871406, "grad_norm": 1.09375, "learning_rate": 0.000347, "loss": 6.3, "mean_token_accuracy": 0.10904626250267029, "num_tokens": 1929574.0, "step": 695 }, { "entropy": 6.493116617202759, "epoch": 0.01895093062605753, "grad_norm": 1.2265625, "learning_rate": 0.0003495, "loss": 6.2389, "mean_token_accuracy": 0.10819176211953163, "num_tokens": 1943220.0, "step": 700 }, { "entropy": 6.54621901512146, "epoch": 0.019086294416243654, "grad_norm": 1.2265625, "learning_rate": 0.000352, "loss": 6.2556, "mean_token_accuracy": 0.10982774049043656, "num_tokens": 1957834.0, "step": 705 }, { "entropy": 6.512110996246338, "epoch": 0.01922165820642978, "grad_norm": 1.1015625, "learning_rate": 0.0003545, "loss": 6.3302, "mean_token_accuracy": 0.11116872280836106, "num_tokens": 1972649.0, "step": 710 }, { "entropy": 6.418754625320434, "epoch": 0.019357021996615906, "grad_norm": 1.265625, "learning_rate": 0.000357, "loss": 6.1538, "mean_token_accuracy": 0.12162703573703766, "num_tokens": 1984181.0, "step": 715 }, { "entropy": 6.399659919738769, "epoch": 0.01949238578680203, "grad_norm": 0.92578125, "learning_rate": 0.0003595, "loss": 6.2047, "mean_token_accuracy": 0.11393127739429473, "num_tokens": 2000616.0, "step": 720 }, { "entropy": 6.4549713134765625, "epoch": 0.019627749576988155, "grad_norm": 1.109375, "learning_rate": 0.000362, "loss": 6.1698, "mean_token_accuracy": 0.11860272511839867, "num_tokens": 2015344.0, "step": 725 }, { "entropy": 6.458272075653076, "epoch": 0.01976311336717428, "grad_norm": 1.15625, "learning_rate": 0.0003645, "loss": 6.2536, "mean_token_accuracy": 0.11021775305271149, "num_tokens": 2029823.0, "step": 730 }, { "entropy": 6.360110950469971, "epoch": 0.019898477157360407, "grad_norm": 1.234375, "learning_rate": 0.000367, "loss": 6.1363, "mean_token_accuracy": 0.11379259899258613, "num_tokens": 2043680.0, "step": 735 }, { "entropy": 6.4546263217926025, "epoch": 0.02003384094754653, "grad_norm": 1.2890625, "learning_rate": 0.0003695, "loss": 6.2118, "mean_token_accuracy": 0.11678453311324119, "num_tokens": 2056211.0, "step": 740 }, { "entropy": 6.301215696334839, "epoch": 0.020169204737732656, "grad_norm": 1.3125, "learning_rate": 0.000372, "loss": 6.2223, "mean_token_accuracy": 0.11474345549941063, "num_tokens": 2069775.0, "step": 745 }, { "entropy": 6.343719387054444, "epoch": 0.02030456852791878, "grad_norm": 1.2109375, "learning_rate": 0.0003745, "loss": 6.0669, "mean_token_accuracy": 0.12363717705011368, "num_tokens": 2084423.0, "step": 750 }, { "entropy": 6.379573202133178, "epoch": 0.020439932318104908, "grad_norm": 1.03125, "learning_rate": 0.000377, "loss": 6.2006, "mean_token_accuracy": 0.11517359465360641, "num_tokens": 2099702.0, "step": 755 }, { "entropy": 6.35660948753357, "epoch": 0.020575296108291032, "grad_norm": 0.98046875, "learning_rate": 0.0003795, "loss": 6.1424, "mean_token_accuracy": 0.116712386906147, "num_tokens": 2114938.0, "step": 760 }, { "entropy": 6.33174843788147, "epoch": 0.020710659898477157, "grad_norm": 1.09375, "learning_rate": 0.000382, "loss": 6.0715, "mean_token_accuracy": 0.12017848417162895, "num_tokens": 2128039.0, "step": 765 }, { "entropy": 6.483924388885498, "epoch": 0.02084602368866328, "grad_norm": 1.109375, "learning_rate": 0.0003845, "loss": 6.2675, "mean_token_accuracy": 0.11350229382514954, "num_tokens": 2144244.0, "step": 770 }, { "entropy": 6.299388790130616, "epoch": 0.02098138747884941, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 6.0745, "mean_token_accuracy": 0.12214050814509392, "num_tokens": 2156050.0, "step": 775 }, { "entropy": 6.339807558059692, "epoch": 0.021116751269035533, "grad_norm": 1.0703125, "learning_rate": 0.00038950000000000003, "loss": 6.1324, "mean_token_accuracy": 0.11614297851920127, "num_tokens": 2170083.0, "step": 780 }, { "entropy": 6.346547555923462, "epoch": 0.021252115059221657, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.1194, "mean_token_accuracy": 0.12128575146198273, "num_tokens": 2184536.0, "step": 785 }, { "entropy": 6.332412433624268, "epoch": 0.021387478849407785, "grad_norm": 0.94140625, "learning_rate": 0.00039450000000000005, "loss": 6.1629, "mean_token_accuracy": 0.11224813610315323, "num_tokens": 2199324.0, "step": 790 }, { "entropy": 6.236615514755249, "epoch": 0.02152284263959391, "grad_norm": 1.0390625, "learning_rate": 0.00039700000000000005, "loss": 6.1244, "mean_token_accuracy": 0.1139693059027195, "num_tokens": 2215191.0, "step": 795 }, { "entropy": 6.423162221908569, "epoch": 0.021658206429780034, "grad_norm": 1.2109375, "learning_rate": 0.0003995, "loss": 6.1789, "mean_token_accuracy": 0.11178024560213089, "num_tokens": 2229354.0, "step": 800 }, { "entropy": 6.281933403015136, "epoch": 0.021793570219966158, "grad_norm": 1.0, "learning_rate": 0.000402, "loss": 6.1912, "mean_token_accuracy": 0.11805299371480941, "num_tokens": 2243804.0, "step": 805 }, { "entropy": 6.288844728469849, "epoch": 0.021928934010152286, "grad_norm": 1.140625, "learning_rate": 0.0004045, "loss": 6.0841, "mean_token_accuracy": 0.11569216102361679, "num_tokens": 2258267.0, "step": 810 }, { "entropy": 6.315207052230835, "epoch": 0.02206429780033841, "grad_norm": 1.0078125, "learning_rate": 0.00040699999999999997, "loss": 6.1319, "mean_token_accuracy": 0.12272850275039673, "num_tokens": 2271854.0, "step": 815 }, { "entropy": 6.263217782974243, "epoch": 0.022199661590524535, "grad_norm": 1.1484375, "learning_rate": 0.0004095, "loss": 6.1651, "mean_token_accuracy": 0.11350240483880043, "num_tokens": 2285897.0, "step": 820 }, { "entropy": 6.2891233444213865, "epoch": 0.02233502538071066, "grad_norm": 1.0703125, "learning_rate": 0.000412, "loss": 6.1208, "mean_token_accuracy": 0.11810638681054116, "num_tokens": 2299354.0, "step": 825 }, { "entropy": 6.323483896255493, "epoch": 0.022470389170896787, "grad_norm": 1.1171875, "learning_rate": 0.0004145, "loss": 6.1693, "mean_token_accuracy": 0.1183534987270832, "num_tokens": 2313111.0, "step": 830 }, { "entropy": 6.299751424789429, "epoch": 0.02260575296108291, "grad_norm": 1.21875, "learning_rate": 0.000417, "loss": 6.1459, "mean_token_accuracy": 0.12177513241767883, "num_tokens": 2325556.0, "step": 835 }, { "entropy": 6.354130220413208, "epoch": 0.022741116751269035, "grad_norm": 1.03125, "learning_rate": 0.0004195, "loss": 6.1991, "mean_token_accuracy": 0.11779833287000656, "num_tokens": 2340033.0, "step": 840 }, { "entropy": 6.290956926345825, "epoch": 0.02287648054145516, "grad_norm": 1.1015625, "learning_rate": 0.000422, "loss": 6.1439, "mean_token_accuracy": 0.12168726176023484, "num_tokens": 2353916.0, "step": 845 }, { "entropy": 6.26514630317688, "epoch": 0.023011844331641287, "grad_norm": 1.125, "learning_rate": 0.0004245, "loss": 6.1255, "mean_token_accuracy": 0.12298965677618981, "num_tokens": 2367161.0, "step": 850 }, { "entropy": 6.297455596923828, "epoch": 0.02314720812182741, "grad_norm": 1.0390625, "learning_rate": 0.000427, "loss": 6.1707, "mean_token_accuracy": 0.11453822180628777, "num_tokens": 2382562.0, "step": 855 }, { "entropy": 6.278497695922852, "epoch": 0.023282571912013536, "grad_norm": 1.21875, "learning_rate": 0.0004295, "loss": 6.084, "mean_token_accuracy": 0.12197378650307655, "num_tokens": 2395671.0, "step": 860 }, { "entropy": 6.201052713394165, "epoch": 0.02341793570219966, "grad_norm": 1.03125, "learning_rate": 0.000432, "loss": 6.1328, "mean_token_accuracy": 0.11925875097513199, "num_tokens": 2409902.0, "step": 865 }, { "entropy": 6.319374704360962, "epoch": 0.023553299492385788, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 6.1155, "mean_token_accuracy": 0.11418568938970566, "num_tokens": 2424405.0, "step": 870 }, { "entropy": 6.211519432067871, "epoch": 0.023688663282571912, "grad_norm": 1.0078125, "learning_rate": 0.000437, "loss": 6.0401, "mean_token_accuracy": 0.11908271163702011, "num_tokens": 2440256.0, "step": 875 }, { "entropy": 6.258747959136963, "epoch": 0.023824027072758037, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 6.1066, "mean_token_accuracy": 0.11787782683968544, "num_tokens": 2453224.0, "step": 880 }, { "entropy": 6.132023286819458, "epoch": 0.02395939086294416, "grad_norm": 1.0703125, "learning_rate": 0.000442, "loss": 5.9843, "mean_token_accuracy": 0.1226534366607666, "num_tokens": 2468101.0, "step": 885 }, { "entropy": 6.3332679271698, "epoch": 0.02409475465313029, "grad_norm": 0.99609375, "learning_rate": 0.0004445, "loss": 6.2065, "mean_token_accuracy": 0.12027881368994713, "num_tokens": 2483221.0, "step": 890 }, { "entropy": 6.218679809570313, "epoch": 0.024230118443316413, "grad_norm": 1.1796875, "learning_rate": 0.000447, "loss": 6.0992, "mean_token_accuracy": 0.11610312834382057, "num_tokens": 2496389.0, "step": 895 }, { "entropy": 6.1929422378540036, "epoch": 0.024365482233502538, "grad_norm": 1.1015625, "learning_rate": 0.00044950000000000003, "loss": 6.0435, "mean_token_accuracy": 0.11607689782977104, "num_tokens": 2510988.0, "step": 900 }, { "entropy": 6.248309087753296, "epoch": 0.024500846023688662, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 6.1425, "mean_token_accuracy": 0.12013140320777893, "num_tokens": 2525341.0, "step": 905 }, { "entropy": 6.198721647262573, "epoch": 0.02463620981387479, "grad_norm": 1.0859375, "learning_rate": 0.00045450000000000004, "loss": 6.1277, "mean_token_accuracy": 0.11830744370818139, "num_tokens": 2538706.0, "step": 910 }, { "entropy": 6.277400732040405, "epoch": 0.024771573604060914, "grad_norm": 1.0625, "learning_rate": 0.00045700000000000005, "loss": 6.1407, "mean_token_accuracy": 0.1180431790649891, "num_tokens": 2554056.0, "step": 915 }, { "entropy": 6.122376012802124, "epoch": 0.02490693739424704, "grad_norm": 1.2109375, "learning_rate": 0.00045950000000000006, "loss": 6.0363, "mean_token_accuracy": 0.12817837595939635, "num_tokens": 2569073.0, "step": 920 }, { "entropy": 6.23994255065918, "epoch": 0.025042301184433163, "grad_norm": 1.1328125, "learning_rate": 0.000462, "loss": 6.0807, "mean_token_accuracy": 0.12659804597496987, "num_tokens": 2582519.0, "step": 925 }, { "entropy": 6.254793930053711, "epoch": 0.02517766497461929, "grad_norm": 1.0390625, "learning_rate": 0.0004645, "loss": 6.138, "mean_token_accuracy": 0.11910348609089852, "num_tokens": 2597308.0, "step": 930 }, { "entropy": 6.186693382263184, "epoch": 0.025313028764805415, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 6.1146, "mean_token_accuracy": 0.12513377815485, "num_tokens": 2610388.0, "step": 935 }, { "entropy": 6.133151054382324, "epoch": 0.02544839255499154, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 5.9744, "mean_token_accuracy": 0.1229440450668335, "num_tokens": 2624701.0, "step": 940 }, { "entropy": 6.227858448028565, "epoch": 0.025583756345177663, "grad_norm": 1.1328125, "learning_rate": 0.000472, "loss": 6.1629, "mean_token_accuracy": 0.11275116056203842, "num_tokens": 2639582.0, "step": 945 }, { "entropy": 6.088177108764649, "epoch": 0.02571912013536379, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 5.9973, "mean_token_accuracy": 0.12648221775889396, "num_tokens": 2653808.0, "step": 950 }, { "entropy": 6.13272876739502, "epoch": 0.025854483925549916, "grad_norm": 1.0859375, "learning_rate": 0.000477, "loss": 6.001, "mean_token_accuracy": 0.12153996378183365, "num_tokens": 2667423.0, "step": 955 }, { "entropy": 6.150818300247193, "epoch": 0.02598984771573604, "grad_norm": 1.0625, "learning_rate": 0.0004795, "loss": 6.0237, "mean_token_accuracy": 0.12148027569055557, "num_tokens": 2683296.0, "step": 960 }, { "entropy": 6.043711376190186, "epoch": 0.026125211505922164, "grad_norm": 1.1640625, "learning_rate": 0.000482, "loss": 5.9768, "mean_token_accuracy": 0.13035187423229216, "num_tokens": 2697230.0, "step": 965 }, { "entropy": 6.165330123901367, "epoch": 0.026260575296108292, "grad_norm": 1.140625, "learning_rate": 0.0004845, "loss": 5.9685, "mean_token_accuracy": 0.1219008818268776, "num_tokens": 2711689.0, "step": 970 }, { "entropy": 6.072505140304566, "epoch": 0.026395939086294416, "grad_norm": 1.0234375, "learning_rate": 0.000487, "loss": 6.0051, "mean_token_accuracy": 0.12370155230164528, "num_tokens": 2725786.0, "step": 975 }, { "entropy": 6.097587728500367, "epoch": 0.02653130287648054, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 6.0078, "mean_token_accuracy": 0.12946900948882104, "num_tokens": 2739444.0, "step": 980 }, { "entropy": 6.165721845626831, "epoch": 0.02666666666666667, "grad_norm": 0.9140625, "learning_rate": 0.000492, "loss": 5.9966, "mean_token_accuracy": 0.12653872296214103, "num_tokens": 2754692.0, "step": 985 }, { "entropy": 6.010534715652466, "epoch": 0.026802030456852793, "grad_norm": 1.0625, "learning_rate": 0.0004945, "loss": 5.9195, "mean_token_accuracy": 0.1301392510533333, "num_tokens": 2767847.0, "step": 990 }, { "entropy": 6.176916885375976, "epoch": 0.026937394247038917, "grad_norm": 0.984375, "learning_rate": 0.000497, "loss": 6.147, "mean_token_accuracy": 0.11529367789626122, "num_tokens": 2783919.0, "step": 995 }, { "entropy": 6.178207778930664, "epoch": 0.02707275803722504, "grad_norm": 1.0390625, "learning_rate": 0.0004995, "loss": 6.049, "mean_token_accuracy": 0.11618730947375297, "num_tokens": 2797758.0, "step": 1000 }, { "entropy": 6.0772298812866214, "epoch": 0.02720812182741117, "grad_norm": 1.1640625, "learning_rate": 0.000499998026082006, "loss": 5.9816, "mean_token_accuracy": 0.12454243823885917, "num_tokens": 2811266.0, "step": 1005 }, { "entropy": 6.178618955612182, "epoch": 0.027343485617597293, "grad_norm": 1.0234375, "learning_rate": 0.0004999900070995136, "loss": 6.1008, "mean_token_accuracy": 0.12391449511051178, "num_tokens": 2825546.0, "step": 1010 }, { "entropy": 6.09156231880188, "epoch": 0.027478849407783418, "grad_norm": 1.1484375, "learning_rate": 0.0004999758199023239, "loss": 6.0494, "mean_token_accuracy": 0.12795282825827597, "num_tokens": 2840284.0, "step": 1015 }, { "entropy": 6.100447702407837, "epoch": 0.027614213197969542, "grad_norm": 1.1875, "learning_rate": 0.0004999554648793858, "loss": 6.0469, "mean_token_accuracy": 0.12443553805351257, "num_tokens": 2851891.0, "step": 1020 }, { "entropy": 6.141157817840576, "epoch": 0.02774957698815567, "grad_norm": 1.203125, "learning_rate": 0.0004999289425887425, "loss": 5.9993, "mean_token_accuracy": 0.12068658322095871, "num_tokens": 2864393.0, "step": 1025 }, { "entropy": 6.0899200439453125, "epoch": 0.027884940778341794, "grad_norm": 1.0390625, "learning_rate": 0.0004998962537575161, "loss": 6.0697, "mean_token_accuracy": 0.12269674092531205, "num_tokens": 2878581.0, "step": 1030 }, { "entropy": 6.183287048339844, "epoch": 0.02802030456852792, "grad_norm": 1.0234375, "learning_rate": 0.0004998573992818874, "loss": 6.1252, "mean_token_accuracy": 0.12084309384226799, "num_tokens": 2891217.0, "step": 1035 }, { "entropy": 6.048014736175537, "epoch": 0.028155668358714043, "grad_norm": 1.140625, "learning_rate": 0.0004998123802270715, "loss": 5.9877, "mean_token_accuracy": 0.1275292307138443, "num_tokens": 2902261.0, "step": 1040 }, { "entropy": 6.180945777893067, "epoch": 0.02829103214890017, "grad_norm": 1.15625, "learning_rate": 0.0004997611978272886, "loss": 6.0715, "mean_token_accuracy": 0.1172533318400383, "num_tokens": 2915455.0, "step": 1045 }, { "entropy": 6.057958126068115, "epoch": 0.028426395939086295, "grad_norm": 1.0546875, "learning_rate": 0.0004997038534857298, "loss": 6.0513, "mean_token_accuracy": 0.11567913889884948, "num_tokens": 2930873.0, "step": 1050 }, { "entropy": 6.126917505264283, "epoch": 0.02856175972927242, "grad_norm": 1.0390625, "learning_rate": 0.0004996403487745194, "loss": 6.0191, "mean_token_accuracy": 0.12455897256731988, "num_tokens": 2945768.0, "step": 1055 }, { "entropy": 6.160192489624023, "epoch": 0.028697123519458544, "grad_norm": 1.1015625, "learning_rate": 0.000499570685434671, "loss": 6.0718, "mean_token_accuracy": 0.12326753437519074, "num_tokens": 2960052.0, "step": 1060 }, { "entropy": 6.049477672576904, "epoch": 0.02883248730964467, "grad_norm": 1.1484375, "learning_rate": 0.0004994948653760405, "loss": 5.907, "mean_token_accuracy": 0.12975608184933662, "num_tokens": 2974252.0, "step": 1065 }, { "entropy": 5.922494602203369, "epoch": 0.028967851099830796, "grad_norm": 1.03125, "learning_rate": 0.0004994128906772729, "loss": 5.9723, "mean_token_accuracy": 0.12408508732914925, "num_tokens": 2988414.0, "step": 1070 }, { "entropy": 6.076635503768921, "epoch": 0.02910321489001692, "grad_norm": 0.94140625, "learning_rate": 0.000499324763585746, "loss": 6.0159, "mean_token_accuracy": 0.12376472353935242, "num_tokens": 3005833.0, "step": 1075 }, { "entropy": 6.0643566131591795, "epoch": 0.029238578680203044, "grad_norm": 0.91796875, "learning_rate": 0.0004992304865175085, "loss": 6.0162, "mean_token_accuracy": 0.11739084795117379, "num_tokens": 3019722.0, "step": 1080 }, { "entropy": 6.0612537384033205, "epoch": 0.029373942470389172, "grad_norm": 1.015625, "learning_rate": 0.0004991300620572138, "loss": 5.9597, "mean_token_accuracy": 0.12137619629502297, "num_tokens": 3033643.0, "step": 1085 }, { "entropy": 6.003667545318604, "epoch": 0.029509306260575296, "grad_norm": 1.0234375, "learning_rate": 0.0004990234929580494, "loss": 5.9007, "mean_token_accuracy": 0.12919754460453986, "num_tokens": 3047311.0, "step": 1090 }, { "entropy": 6.16131591796875, "epoch": 0.02964467005076142, "grad_norm": 1.1875, "learning_rate": 0.0004989107821416609, "loss": 6.0886, "mean_token_accuracy": 0.12004212662577629, "num_tokens": 3062823.0, "step": 1095 }, { "entropy": 6.068430328369141, "epoch": 0.029780033840947545, "grad_norm": 1.0625, "learning_rate": 0.0004987919326980723, "loss": 5.9748, "mean_token_accuracy": 0.13052917644381523, "num_tokens": 3076828.0, "step": 1100 }, { "entropy": 5.9808131694793705, "epoch": 0.029915397631133673, "grad_norm": 1.1796875, "learning_rate": 0.0004986669478856011, "loss": 5.9151, "mean_token_accuracy": 0.132940074801445, "num_tokens": 3089369.0, "step": 1105 }, { "entropy": 6.049989414215088, "epoch": 0.030050761421319797, "grad_norm": 1.1484375, "learning_rate": 0.0004985358311307688, "loss": 6.0077, "mean_token_accuracy": 0.13002250343561172, "num_tokens": 3100518.0, "step": 1110 }, { "entropy": 6.067233991622925, "epoch": 0.03018612521150592, "grad_norm": 1.1484375, "learning_rate": 0.0004983985860282081, "loss": 5.9342, "mean_token_accuracy": 0.1303796499967575, "num_tokens": 3113599.0, "step": 1115 }, { "entropy": 5.986032724380493, "epoch": 0.030321489001692046, "grad_norm": 0.9765625, "learning_rate": 0.0004982552163405623, "loss": 5.9344, "mean_token_accuracy": 0.13099692836403848, "num_tokens": 3126725.0, "step": 1120 }, { "entropy": 6.01772027015686, "epoch": 0.030456852791878174, "grad_norm": 1.1171875, "learning_rate": 0.0004981057259983839, "loss": 5.9407, "mean_token_accuracy": 0.13005468547344207, "num_tokens": 3140170.0, "step": 1125 }, { "entropy": 5.947785377502441, "epoch": 0.030592216582064298, "grad_norm": 0.953125, "learning_rate": 0.0004979501191000262, "loss": 5.9137, "mean_token_accuracy": 0.12703290432691575, "num_tokens": 3154154.0, "step": 1130 }, { "entropy": 6.0017212390899655, "epoch": 0.030727580372250422, "grad_norm": 0.98046875, "learning_rate": 0.0004977883999115311, "loss": 5.9814, "mean_token_accuracy": 0.12780916765332223, "num_tokens": 3170061.0, "step": 1135 }, { "entropy": 6.102719736099243, "epoch": 0.030862944162436547, "grad_norm": 1.1875, "learning_rate": 0.0004976205728665113, "loss": 6.0419, "mean_token_accuracy": 0.12874573692679406, "num_tokens": 3183167.0, "step": 1140 }, { "entropy": 5.993436717987061, "epoch": 0.030998307952622674, "grad_norm": 1.046875, "learning_rate": 0.0004974466425660307, "loss": 6.1286, "mean_token_accuracy": 0.1163134016096592, "num_tokens": 3197764.0, "step": 1145 }, { "entropy": 6.101684427261352, "epoch": 0.0311336717428088, "grad_norm": 0.9375, "learning_rate": 0.0004972666137784759, "loss": 5.8899, "mean_token_accuracy": 0.12967644035816192, "num_tokens": 3212909.0, "step": 1150 }, { "entropy": 6.056351280212402, "epoch": 0.03126903553299493, "grad_norm": 1.1640625, "learning_rate": 0.0004970804914394271, "loss": 6.0213, "mean_token_accuracy": 0.12962342649698258, "num_tokens": 3224140.0, "step": 1155 }, { "entropy": 5.998062562942505, "epoch": 0.03140439932318105, "grad_norm": 1.15625, "learning_rate": 0.0004968882806515225, "loss": 5.959, "mean_token_accuracy": 0.13079651519656182, "num_tokens": 3237827.0, "step": 1160 }, { "entropy": 6.0129087448120115, "epoch": 0.031539763113367175, "grad_norm": 1.1015625, "learning_rate": 0.0004966899866843177, "loss": 5.9242, "mean_token_accuracy": 0.12941501662135124, "num_tokens": 3250552.0, "step": 1165 }, { "entropy": 5.929322099685669, "epoch": 0.0316751269035533, "grad_norm": 1.1171875, "learning_rate": 0.000496485614974142, "loss": 5.9082, "mean_token_accuracy": 0.13116575181484222, "num_tokens": 3265108.0, "step": 1170 }, { "entropy": 5.910490798950195, "epoch": 0.031810490693739424, "grad_norm": 1.1171875, "learning_rate": 0.0004962751711239492, "loss": 5.8957, "mean_token_accuracy": 0.13716685473918916, "num_tokens": 3277399.0, "step": 1175 }, { "entropy": 5.90950288772583, "epoch": 0.03194585448392555, "grad_norm": 0.96875, "learning_rate": 0.0004960586609031636, "loss": 5.8656, "mean_token_accuracy": 0.13133470267057418, "num_tokens": 3292261.0, "step": 1180 }, { "entropy": 6.02558069229126, "epoch": 0.03208121827411167, "grad_norm": 1.015625, "learning_rate": 0.0004958360902475224, "loss": 5.9481, "mean_token_accuracy": 0.12776122540235518, "num_tokens": 3305914.0, "step": 1185 }, { "entropy": 5.877729225158691, "epoch": 0.032216582064297804, "grad_norm": 1.046875, "learning_rate": 0.0004956074652589125, "loss": 5.8461, "mean_token_accuracy": 0.13402740731835366, "num_tokens": 3319731.0, "step": 1190 }, { "entropy": 5.983613348007202, "epoch": 0.03235194585448393, "grad_norm": 0.91796875, "learning_rate": 0.0004953727922052035, "loss": 5.9026, "mean_token_accuracy": 0.1287564866244793, "num_tokens": 3335865.0, "step": 1195 }, { "entropy": 5.955887413024902, "epoch": 0.03248730964467005, "grad_norm": 1.0, "learning_rate": 0.0004951320775200756, "loss": 5.8795, "mean_token_accuracy": 0.13347595036029816, "num_tokens": 3350692.0, "step": 1200 }, { "entropy": 5.869665241241455, "epoch": 0.03262267343485618, "grad_norm": 1.0625, "learning_rate": 0.0004948853278028436, "loss": 5.8414, "mean_token_accuracy": 0.1349584087729454, "num_tokens": 3364477.0, "step": 1205 }, { "entropy": 6.077768468856812, "epoch": 0.0327580372250423, "grad_norm": 1.015625, "learning_rate": 0.0004946325498182755, "loss": 6.0202, "mean_token_accuracy": 0.13227369338274003, "num_tokens": 3377976.0, "step": 1210 }, { "entropy": 5.928851127624512, "epoch": 0.032893401015228425, "grad_norm": 1.1328125, "learning_rate": 0.0004943737504964076, "loss": 5.8941, "mean_token_accuracy": 0.13219523280858994, "num_tokens": 3391797.0, "step": 1215 }, { "entropy": 5.968907499313355, "epoch": 0.03302876480541455, "grad_norm": 1.046875, "learning_rate": 0.000494108936932354, "loss": 5.904, "mean_token_accuracy": 0.1308644212782383, "num_tokens": 3406175.0, "step": 1220 }, { "entropy": 5.953116321563721, "epoch": 0.033164128595600674, "grad_norm": 1.0078125, "learning_rate": 0.0004938381163861124, "loss": 5.8953, "mean_token_accuracy": 0.13571116998791694, "num_tokens": 3419314.0, "step": 1225 }, { "entropy": 5.968687200546265, "epoch": 0.033299492385786805, "grad_norm": 0.91015625, "learning_rate": 0.0004935612962823645, "loss": 5.9639, "mean_token_accuracy": 0.12865443304181098, "num_tokens": 3436286.0, "step": 1230 }, { "entropy": 5.994656372070312, "epoch": 0.03343485617597293, "grad_norm": 1.046875, "learning_rate": 0.0004932784842102739, "loss": 5.9152, "mean_token_accuracy": 0.13279383033514022, "num_tokens": 3450743.0, "step": 1235 }, { "entropy": 5.880604553222656, "epoch": 0.033570219966159054, "grad_norm": 0.96484375, "learning_rate": 0.0004929896879232758, "loss": 5.9593, "mean_token_accuracy": 0.1276319444179535, "num_tokens": 3465265.0, "step": 1240 }, { "entropy": 6.054373121261596, "epoch": 0.03370558375634518, "grad_norm": 1.046875, "learning_rate": 0.0004926949153388668, "loss": 5.9635, "mean_token_accuracy": 0.13033603355288506, "num_tokens": 3479850.0, "step": 1245 }, { "entropy": 6.004738473892212, "epoch": 0.0338409475465313, "grad_norm": 0.93359375, "learning_rate": 0.0004923941745383859, "loss": 6.0149, "mean_token_accuracy": 0.12755341306328774, "num_tokens": 3494388.0, "step": 1250 }, { "entropy": 6.05593056678772, "epoch": 0.03397631133671743, "grad_norm": 1.0234375, "learning_rate": 0.000492087473766794, "loss": 5.9944, "mean_token_accuracy": 0.129459198564291, "num_tokens": 3508609.0, "step": 1255 }, { "entropy": 5.989010000228882, "epoch": 0.03411167512690355, "grad_norm": 0.84765625, "learning_rate": 0.000491774821432448, "loss": 5.9484, "mean_token_accuracy": 0.12573069110512733, "num_tokens": 3524252.0, "step": 1260 }, { "entropy": 5.86044340133667, "epoch": 0.034247038917089676, "grad_norm": 0.91796875, "learning_rate": 0.0004914562261068693, "loss": 5.8538, "mean_token_accuracy": 0.13299454674124717, "num_tokens": 3540431.0, "step": 1265 }, { "entropy": 5.977858638763427, "epoch": 0.03438240270727581, "grad_norm": 1.0234375, "learning_rate": 0.0004911316965245098, "loss": 5.936, "mean_token_accuracy": 0.1308388702571392, "num_tokens": 3555452.0, "step": 1270 }, { "entropy": 5.904463481903076, "epoch": 0.03451776649746193, "grad_norm": 0.94921875, "learning_rate": 0.000490801241582512, "loss": 5.8326, "mean_token_accuracy": 0.13622485026717185, "num_tokens": 3569414.0, "step": 1275 }, { "entropy": 5.986747741699219, "epoch": 0.034653130287648055, "grad_norm": 1.1484375, "learning_rate": 0.000490464870340465, "loss": 6.0092, "mean_token_accuracy": 0.12418872565031051, "num_tokens": 3585926.0, "step": 1280 }, { "entropy": 5.979127502441406, "epoch": 0.03478849407783418, "grad_norm": 1.0703125, "learning_rate": 0.0004901225920201563, "loss": 5.8517, "mean_token_accuracy": 0.12628912925720215, "num_tokens": 3598692.0, "step": 1285 }, { "entropy": 5.866104936599731, "epoch": 0.034923857868020304, "grad_norm": 1.1015625, "learning_rate": 0.000489774416005319, "loss": 5.8145, "mean_token_accuracy": 0.13827023953199385, "num_tokens": 3610579.0, "step": 1290 }, { "entropy": 5.940866851806641, "epoch": 0.03505922165820643, "grad_norm": 1.0, "learning_rate": 0.0004894203518413742, "loss": 5.8967, "mean_token_accuracy": 0.13155581057071686, "num_tokens": 3622955.0, "step": 1295 }, { "entropy": 5.965740633010864, "epoch": 0.03519458544839255, "grad_norm": 1.1328125, "learning_rate": 0.0004890604092351701, "loss": 5.848, "mean_token_accuracy": 0.13300148025155067, "num_tokens": 3636465.0, "step": 1300 }, { "entropy": 5.9097521781921385, "epoch": 0.03532994923857868, "grad_norm": 0.93359375, "learning_rate": 0.000488694598054715, "loss": 5.8418, "mean_token_accuracy": 0.13007594645023346, "num_tokens": 3650490.0, "step": 1305 }, { "entropy": 5.989442920684814, "epoch": 0.03546531302876481, "grad_norm": 0.96484375, "learning_rate": 0.0004883229283289071, "loss": 5.9325, "mean_token_accuracy": 0.13511626422405243, "num_tokens": 3666952.0, "step": 1310 }, { "entropy": 5.868106698989868, "epoch": 0.03560067681895093, "grad_norm": 0.88671875, "learning_rate": 0.00048794541024725993, "loss": 5.8828, "mean_token_accuracy": 0.13127233758568763, "num_tokens": 3681741.0, "step": 1315 }, { "entropy": 6.05716724395752, "epoch": 0.03573604060913706, "grad_norm": 0.98046875, "learning_rate": 0.0004875620541596221, "loss": 6.0203, "mean_token_accuracy": 0.12015189900994301, "num_tokens": 3696309.0, "step": 1320 }, { "entropy": 5.87901759147644, "epoch": 0.03587140439932318, "grad_norm": 1.0, "learning_rate": 0.00048717287057589454, "loss": 5.8183, "mean_token_accuracy": 0.13341830670833588, "num_tokens": 3710972.0, "step": 1325 }, { "entropy": 5.910233020782471, "epoch": 0.036006768189509306, "grad_norm": 1.046875, "learning_rate": 0.0004867778701657417, "loss": 5.8272, "mean_token_accuracy": 0.1385295033454895, "num_tokens": 3723619.0, "step": 1330 }, { "entropy": 5.879352235794068, "epoch": 0.03614213197969543, "grad_norm": 0.984375, "learning_rate": 0.00048637706375829955, "loss": 5.8317, "mean_token_accuracy": 0.13691574931144715, "num_tokens": 3736947.0, "step": 1335 }, { "entropy": 5.879655885696411, "epoch": 0.036277495769881554, "grad_norm": 1.0234375, "learning_rate": 0.000485970462341878, "loss": 5.8283, "mean_token_accuracy": 0.13367267698049545, "num_tokens": 3751488.0, "step": 1340 }, { "entropy": 5.861524868011474, "epoch": 0.03641285956006768, "grad_norm": 1.1015625, "learning_rate": 0.00048555807706366044, "loss": 5.8149, "mean_token_accuracy": 0.12982808873057367, "num_tokens": 3764169.0, "step": 1345 }, { "entropy": 5.923907041549683, "epoch": 0.03654822335025381, "grad_norm": 1.0390625, "learning_rate": 0.00048513991922939756, "loss": 5.8853, "mean_token_accuracy": 0.1327181950211525, "num_tokens": 3777786.0, "step": 1350 }, { "entropy": 5.872652530670166, "epoch": 0.036683587140439934, "grad_norm": 0.984375, "learning_rate": 0.00048471600030309744, "loss": 5.7489, "mean_token_accuracy": 0.13938361927866935, "num_tokens": 3793618.0, "step": 1355 }, { "entropy": 5.832516002655029, "epoch": 0.03681895093062606, "grad_norm": 0.953125, "learning_rate": 0.00048428633190671186, "loss": 5.7986, "mean_token_accuracy": 0.13645398393273353, "num_tokens": 3807477.0, "step": 1360 }, { "entropy": 5.874223041534424, "epoch": 0.03695431472081218, "grad_norm": 0.921875, "learning_rate": 0.0004838509258198167, "loss": 5.7628, "mean_token_accuracy": 0.1414404109120369, "num_tokens": 3821423.0, "step": 1365 }, { "entropy": 5.7999297142028805, "epoch": 0.03708967851099831, "grad_norm": 1.0703125, "learning_rate": 0.00048340979397929, "loss": 5.8377, "mean_token_accuracy": 0.13525271713733672, "num_tokens": 3835023.0, "step": 1370 }, { "entropy": 5.952495384216308, "epoch": 0.03722504230118443, "grad_norm": 0.98828125, "learning_rate": 0.00048296294847898386, "loss": 5.8599, "mean_token_accuracy": 0.13231865540146828, "num_tokens": 3849230.0, "step": 1375 }, { "entropy": 5.886288738250732, "epoch": 0.037360406091370556, "grad_norm": 1.09375, "learning_rate": 0.0004825104015693934, "loss": 5.8341, "mean_token_accuracy": 0.1299556814134121, "num_tokens": 3863884.0, "step": 1380 }, { "entropy": 5.7548364162445065, "epoch": 0.03749576988155669, "grad_norm": 1.1796875, "learning_rate": 0.0004820521656573208, "loss": 5.6259, "mean_token_accuracy": 0.14474526271224022, "num_tokens": 3875444.0, "step": 1385 }, { "entropy": 5.954405307769775, "epoch": 0.03763113367174281, "grad_norm": 1.046875, "learning_rate": 0.00048158825330553505, "loss": 5.9888, "mean_token_accuracy": 0.132489612698555, "num_tokens": 3888875.0, "step": 1390 }, { "entropy": 5.784528350830078, "epoch": 0.037766497461928936, "grad_norm": 1.0, "learning_rate": 0.00048111867723242763, "loss": 5.7374, "mean_token_accuracy": 0.13683436438441277, "num_tokens": 3904124.0, "step": 1395 }, { "entropy": 5.800213289260864, "epoch": 0.03790186125211506, "grad_norm": 0.99609375, "learning_rate": 0.0004806434503116637, "loss": 5.7543, "mean_token_accuracy": 0.1421910360455513, "num_tokens": 3917976.0, "step": 1400 }, { "entropy": 5.8708749294281, "epoch": 0.038037225042301184, "grad_norm": 0.98046875, "learning_rate": 0.0004801625855718296, "loss": 5.8518, "mean_token_accuracy": 0.13218354880809785, "num_tokens": 3932835.0, "step": 1405 }, { "entropy": 5.92179274559021, "epoch": 0.03817258883248731, "grad_norm": 0.95703125, "learning_rate": 0.00047967609619607477, "loss": 5.7986, "mean_token_accuracy": 0.14245062917470933, "num_tokens": 3945938.0, "step": 1410 }, { "entropy": 5.76557936668396, "epoch": 0.03830795262267343, "grad_norm": 1.1484375, "learning_rate": 0.0004791839955217513, "loss": 5.7599, "mean_token_accuracy": 0.14098661318421363, "num_tokens": 3958447.0, "step": 1415 }, { "entropy": 5.868845748901367, "epoch": 0.03844331641285956, "grad_norm": 1.015625, "learning_rate": 0.00047868629704004786, "loss": 5.871, "mean_token_accuracy": 0.13354070782661437, "num_tokens": 3972105.0, "step": 1420 }, { "entropy": 5.96793303489685, "epoch": 0.03857868020304569, "grad_norm": 1.0234375, "learning_rate": 0.00047818301439561965, "loss": 5.835, "mean_token_accuracy": 0.13661837428808213, "num_tokens": 3984935.0, "step": 1425 }, { "entropy": 5.800432634353638, "epoch": 0.03871404399323181, "grad_norm": 0.984375, "learning_rate": 0.00047767416138621454, "loss": 5.8082, "mean_token_accuracy": 0.13442106992006303, "num_tokens": 3998223.0, "step": 1430 }, { "entropy": 5.826992130279541, "epoch": 0.03884940778341794, "grad_norm": 0.953125, "learning_rate": 0.000477159751962295, "loss": 5.7446, "mean_token_accuracy": 0.14261322766542434, "num_tokens": 4012876.0, "step": 1435 }, { "entropy": 5.842947864532471, "epoch": 0.03898477157360406, "grad_norm": 1.015625, "learning_rate": 0.00047663980022665507, "loss": 5.7954, "mean_token_accuracy": 0.1379825048148632, "num_tokens": 4025607.0, "step": 1440 }, { "entropy": 5.807746267318725, "epoch": 0.039120135363790186, "grad_norm": 0.984375, "learning_rate": 0.00047611432043403437, "loss": 5.7896, "mean_token_accuracy": 0.13704527392983437, "num_tokens": 4038093.0, "step": 1445 }, { "entropy": 5.849174070358276, "epoch": 0.03925549915397631, "grad_norm": 0.92578125, "learning_rate": 0.0004755833269907267, "loss": 5.8395, "mean_token_accuracy": 0.13505658283829688, "num_tokens": 4052159.0, "step": 1450 }, { "entropy": 5.945993661880493, "epoch": 0.039390862944162434, "grad_norm": 1.0859375, "learning_rate": 0.0004750468344541857, "loss": 5.8492, "mean_token_accuracy": 0.1315135531127453, "num_tokens": 4065893.0, "step": 1455 }, { "entropy": 5.7644538402557375, "epoch": 0.03952622673434856, "grad_norm": 0.96875, "learning_rate": 0.00047450485753262525, "loss": 5.8021, "mean_token_accuracy": 0.1386327899992466, "num_tokens": 4079274.0, "step": 1460 }, { "entropy": 5.907123756408692, "epoch": 0.03966159052453469, "grad_norm": 1.046875, "learning_rate": 0.00047395741108461633, "loss": 5.8496, "mean_token_accuracy": 0.1314863942563534, "num_tokens": 4092579.0, "step": 1465 }, { "entropy": 5.845654916763306, "epoch": 0.039796954314720814, "grad_norm": 0.91015625, "learning_rate": 0.00047340451011867985, "loss": 5.7645, "mean_token_accuracy": 0.13576920554041863, "num_tokens": 4106484.0, "step": 1470 }, { "entropy": 5.8357702732086185, "epoch": 0.03993231810490694, "grad_norm": 1.046875, "learning_rate": 0.00047284616979287515, "loss": 5.7565, "mean_token_accuracy": 0.14051191210746766, "num_tokens": 4120600.0, "step": 1475 }, { "entropy": 5.734717130661011, "epoch": 0.04006768189509306, "grad_norm": 0.9296875, "learning_rate": 0.00047228240541438433, "loss": 5.6607, "mean_token_accuracy": 0.14902638792991638, "num_tokens": 4134962.0, "step": 1480 }, { "entropy": 5.739231395721435, "epoch": 0.04020304568527919, "grad_norm": 0.921875, "learning_rate": 0.00047171323243909257, "loss": 5.7377, "mean_token_accuracy": 0.1390654683113098, "num_tokens": 4148876.0, "step": 1485 }, { "entropy": 5.851029348373413, "epoch": 0.04033840947546531, "grad_norm": 1.015625, "learning_rate": 0.00047113866647116457, "loss": 5.8167, "mean_token_accuracy": 0.13390154615044594, "num_tokens": 4163566.0, "step": 1490 }, { "entropy": 5.882148790359497, "epoch": 0.040473773265651436, "grad_norm": 0.92578125, "learning_rate": 0.0004705587232626164, "loss": 5.7981, "mean_token_accuracy": 0.1364994041621685, "num_tokens": 4179057.0, "step": 1495 }, { "entropy": 5.747499704360962, "epoch": 0.04060913705583756, "grad_norm": 1.0078125, "learning_rate": 0.00046997341871288424, "loss": 5.737, "mean_token_accuracy": 0.14035099148750305, "num_tokens": 4192277.0, "step": 1500 }, { "entropy": 5.826932811737061, "epoch": 0.04074450084602369, "grad_norm": 1.0234375, "learning_rate": 0.0004693827688683879, "loss": 5.7834, "mean_token_accuracy": 0.1409361645579338, "num_tokens": 4206481.0, "step": 1505 }, { "entropy": 5.8263192653656, "epoch": 0.040879864636209816, "grad_norm": 0.95703125, "learning_rate": 0.0004687867899220914, "loss": 5.7582, "mean_token_accuracy": 0.14131638035178185, "num_tokens": 4220498.0, "step": 1510 }, { "entropy": 5.7734416961669925, "epoch": 0.04101522842639594, "grad_norm": 0.9921875, "learning_rate": 0.00046818549821305846, "loss": 5.7781, "mean_token_accuracy": 0.13451047241687775, "num_tokens": 4234718.0, "step": 1515 }, { "entropy": 5.835545301437378, "epoch": 0.041150592216582065, "grad_norm": 0.9765625, "learning_rate": 0.00046757891022600494, "loss": 5.7595, "mean_token_accuracy": 0.1417396955192089, "num_tokens": 4247333.0, "step": 1520 }, { "entropy": 5.764037847518921, "epoch": 0.04128595600676819, "grad_norm": 1.0, "learning_rate": 0.0004669670425908471, "loss": 5.745, "mean_token_accuracy": 0.14303724765777587, "num_tokens": 4261059.0, "step": 1525 }, { "entropy": 5.744110727310181, "epoch": 0.04142131979695431, "grad_norm": 1.0078125, "learning_rate": 0.0004663499120822451, "loss": 5.7091, "mean_token_accuracy": 0.13828182518482207, "num_tokens": 4273500.0, "step": 1530 }, { "entropy": 5.809609127044678, "epoch": 0.04155668358714044, "grad_norm": 0.97265625, "learning_rate": 0.0004657275356191437, "loss": 5.8712, "mean_token_accuracy": 0.1299389272928238, "num_tokens": 4288422.0, "step": 1535 }, { "entropy": 5.870568370819091, "epoch": 0.04169204737732656, "grad_norm": 0.87890625, "learning_rate": 0.00046509993026430804, "loss": 5.71, "mean_token_accuracy": 0.13911089226603507, "num_tokens": 4303700.0, "step": 1540 }, { "entropy": 5.763344049453735, "epoch": 0.04182741116751269, "grad_norm": 1.0078125, "learning_rate": 0.0004644671132238558, "loss": 5.7506, "mean_token_accuracy": 0.1399180144071579, "num_tokens": 4317887.0, "step": 1545 }, { "entropy": 5.775641632080078, "epoch": 0.04196277495769882, "grad_norm": 0.9765625, "learning_rate": 0.00046382910184678585, "loss": 5.6546, "mean_token_accuracy": 0.14635862186551094, "num_tokens": 4332834.0, "step": 1550 }, { "entropy": 5.7155317783355715, "epoch": 0.04209813874788494, "grad_norm": 0.98046875, "learning_rate": 0.0004631859136245025, "loss": 5.7051, "mean_token_accuracy": 0.1462951496243477, "num_tokens": 4347341.0, "step": 1555 }, { "entropy": 5.828639984130859, "epoch": 0.042233502538071066, "grad_norm": 0.97265625, "learning_rate": 0.0004625375661903357, "loss": 5.7721, "mean_token_accuracy": 0.13997872620821, "num_tokens": 4361359.0, "step": 1560 }, { "entropy": 5.7016510486602785, "epoch": 0.04236886632825719, "grad_norm": 0.8984375, "learning_rate": 0.00046188407731905787, "loss": 5.6941, "mean_token_accuracy": 0.14500250071287155, "num_tokens": 4376677.0, "step": 1565 }, { "entropy": 5.75781831741333, "epoch": 0.042504230118443315, "grad_norm": 1.1328125, "learning_rate": 0.00046122546492639643, "loss": 5.6234, "mean_token_accuracy": 0.14894023090600966, "num_tokens": 4389507.0, "step": 1570 }, { "entropy": 5.712439489364624, "epoch": 0.04263959390862944, "grad_norm": 0.83203125, "learning_rate": 0.000460561747068543, "loss": 5.7554, "mean_token_accuracy": 0.1388566166162491, "num_tokens": 4406626.0, "step": 1575 }, { "entropy": 5.756133127212524, "epoch": 0.04277495769881557, "grad_norm": 0.88671875, "learning_rate": 0.0004598929419416578, "loss": 5.7679, "mean_token_accuracy": 0.13815426528453828, "num_tokens": 4421131.0, "step": 1580 }, { "entropy": 5.868128299713135, "epoch": 0.042910321489001695, "grad_norm": 0.95703125, "learning_rate": 0.00045921906788137123, "loss": 5.76, "mean_token_accuracy": 0.14222174808382987, "num_tokens": 4435107.0, "step": 1585 }, { "entropy": 5.801052570343018, "epoch": 0.04304568527918782, "grad_norm": 0.984375, "learning_rate": 0.00045854014336228115, "loss": 5.7288, "mean_token_accuracy": 0.14501179829239846, "num_tokens": 4449294.0, "step": 1590 }, { "entropy": 5.750652313232422, "epoch": 0.04318104906937394, "grad_norm": 0.98046875, "learning_rate": 0.00045785618699744615, "loss": 5.6444, "mean_token_accuracy": 0.14286767169833184, "num_tokens": 4462731.0, "step": 1595 }, { "entropy": 5.717151927947998, "epoch": 0.04331641285956007, "grad_norm": 1.1015625, "learning_rate": 0.00045716721753787543, "loss": 5.7299, "mean_token_accuracy": 0.1389971673488617, "num_tokens": 4476956.0, "step": 1600 }, { "entropy": 5.819956731796265, "epoch": 0.04345177664974619, "grad_norm": 1.0, "learning_rate": 0.0004564732538720148, "loss": 5.7267, "mean_token_accuracy": 0.14786600917577744, "num_tokens": 4491356.0, "step": 1605 }, { "entropy": 5.665336084365845, "epoch": 0.043587140439932316, "grad_norm": 1.0, "learning_rate": 0.00045577431502522877, "loss": 5.7028, "mean_token_accuracy": 0.14309961274266242, "num_tokens": 4504900.0, "step": 1610 }, { "entropy": 5.760229158401489, "epoch": 0.04372250423011844, "grad_norm": 0.94921875, "learning_rate": 0.0004550704201592787, "loss": 5.688, "mean_token_accuracy": 0.14546218365430832, "num_tokens": 4517879.0, "step": 1615 }, { "entropy": 5.720965814590454, "epoch": 0.04385786802030457, "grad_norm": 1.046875, "learning_rate": 0.0004543615885717981, "loss": 5.7713, "mean_token_accuracy": 0.14266854301095008, "num_tokens": 4531356.0, "step": 1620 }, { "entropy": 5.802320337295532, "epoch": 0.043993231810490696, "grad_norm": 0.984375, "learning_rate": 0.00045364783969576296, "loss": 5.6383, "mean_token_accuracy": 0.14731594622135163, "num_tokens": 4545262.0, "step": 1625 }, { "entropy": 5.625383090972901, "epoch": 0.04412859560067682, "grad_norm": 1.046875, "learning_rate": 0.0004529291930989592, "loss": 5.6253, "mean_token_accuracy": 0.14481477811932564, "num_tokens": 4558713.0, "step": 1630 }, { "entropy": 5.767266464233399, "epoch": 0.044263959390862945, "grad_norm": 0.921875, "learning_rate": 0.0004522056684834464, "loss": 5.6935, "mean_token_accuracy": 0.14441011399030684, "num_tokens": 4571891.0, "step": 1635 }, { "entropy": 5.778782510757447, "epoch": 0.04439932318104907, "grad_norm": 0.953125, "learning_rate": 0.0004514772856850173, "loss": 5.6935, "mean_token_accuracy": 0.14748022928833962, "num_tokens": 4585822.0, "step": 1640 }, { "entropy": 5.753904867172241, "epoch": 0.04453468697123519, "grad_norm": 0.9453125, "learning_rate": 0.0004507440646726542, "loss": 5.6979, "mean_token_accuracy": 0.14199129566550256, "num_tokens": 4600023.0, "step": 1645 }, { "entropy": 5.6777363300323485, "epoch": 0.04467005076142132, "grad_norm": 1.1328125, "learning_rate": 0.0004500060255479818, "loss": 5.5957, "mean_token_accuracy": 0.15256337970495223, "num_tokens": 4611259.0, "step": 1650 }, { "entropy": 5.784216976165771, "epoch": 0.04480541455160744, "grad_norm": 0.9609375, "learning_rate": 0.0004492631885447151, "loss": 5.6981, "mean_token_accuracy": 0.13937234207987786, "num_tokens": 4625195.0, "step": 1655 }, { "entropy": 5.828709125518799, "epoch": 0.04494077834179357, "grad_norm": 1.0546875, "learning_rate": 0.00044851557402810616, "loss": 5.6685, "mean_token_accuracy": 0.1433462306857109, "num_tokens": 4639159.0, "step": 1660 }, { "entropy": 5.694344997406006, "epoch": 0.0450761421319797, "grad_norm": 1.09375, "learning_rate": 0.00044776320249438444, "loss": 5.7065, "mean_token_accuracy": 0.143716399371624, "num_tokens": 4650967.0, "step": 1665 }, { "entropy": 5.757909107208252, "epoch": 0.04521150592216582, "grad_norm": 0.8828125, "learning_rate": 0.00044700609457019565, "loss": 5.6969, "mean_token_accuracy": 0.14098843336105346, "num_tokens": 4667107.0, "step": 1670 }, { "entropy": 5.704726076126098, "epoch": 0.045346869712351946, "grad_norm": 0.94921875, "learning_rate": 0.0004462442710120359, "loss": 5.6458, "mean_token_accuracy": 0.15384480953216553, "num_tokens": 4680966.0, "step": 1675 }, { "entropy": 5.788536548614502, "epoch": 0.04548223350253807, "grad_norm": 0.86328125, "learning_rate": 0.000445477752705683, "loss": 5.715, "mean_token_accuracy": 0.14432019889354705, "num_tokens": 4696365.0, "step": 1680 }, { "entropy": 5.778404951095581, "epoch": 0.045617597292724195, "grad_norm": 1.0, "learning_rate": 0.00044470656066562336, "loss": 5.7505, "mean_token_accuracy": 0.14002010300755502, "num_tokens": 4709059.0, "step": 1685 }, { "entropy": 5.779723358154297, "epoch": 0.04575296108291032, "grad_norm": 0.8828125, "learning_rate": 0.0004439307160344765, "loss": 5.6813, "mean_token_accuracy": 0.1479523077607155, "num_tokens": 4722922.0, "step": 1690 }, { "entropy": 5.69294548034668, "epoch": 0.045888324873096444, "grad_norm": 0.921875, "learning_rate": 0.00044315024008241473, "loss": 5.5964, "mean_token_accuracy": 0.15145878940820695, "num_tokens": 4737204.0, "step": 1695 }, { "entropy": 5.7257462501525875, "epoch": 0.046023688663282575, "grad_norm": 0.92578125, "learning_rate": 0.0004423651542065806, "loss": 5.6956, "mean_token_accuracy": 0.14550104588270188, "num_tokens": 4752111.0, "step": 1700 }, { "entropy": 5.752708816528321, "epoch": 0.0461590524534687, "grad_norm": 1.0, "learning_rate": 0.00044157547993050006, "loss": 5.6762, "mean_token_accuracy": 0.14675524830818176, "num_tokens": 4766353.0, "step": 1705 }, { "entropy": 5.750765705108643, "epoch": 0.04629441624365482, "grad_norm": 1.0078125, "learning_rate": 0.00044078123890349227, "loss": 5.7321, "mean_token_accuracy": 0.14695569574832917, "num_tokens": 4779551.0, "step": 1710 }, { "entropy": 5.675897407531738, "epoch": 0.04642978003384095, "grad_norm": 0.94140625, "learning_rate": 0.00043998245290007606, "loss": 5.6578, "mean_token_accuracy": 0.14759555011987685, "num_tokens": 4794073.0, "step": 1715 }, { "entropy": 5.697209167480469, "epoch": 0.04656514382402707, "grad_norm": 0.97265625, "learning_rate": 0.00043917914381937323, "loss": 5.5765, "mean_token_accuracy": 0.15185517072677612, "num_tokens": 4806855.0, "step": 1720 }, { "entropy": 5.63714861869812, "epoch": 0.046700507614213196, "grad_norm": 0.984375, "learning_rate": 0.00043837133368450815, "loss": 5.681, "mean_token_accuracy": 0.138708233833313, "num_tokens": 4820880.0, "step": 1725 }, { "entropy": 5.834238338470459, "epoch": 0.04683587140439932, "grad_norm": 0.96484375, "learning_rate": 0.0004375590446420037, "loss": 5.6772, "mean_token_accuracy": 0.14852887466549874, "num_tokens": 4833906.0, "step": 1730 }, { "entropy": 5.651483774185181, "epoch": 0.046971235194585445, "grad_norm": 0.99609375, "learning_rate": 0.0004367422989611743, "loss": 5.6429, "mean_token_accuracy": 0.15046416074037552, "num_tokens": 4849251.0, "step": 1735 }, { "entropy": 5.713845062255859, "epoch": 0.047106598984771576, "grad_norm": 0.91015625, "learning_rate": 0.0004359211190335153, "loss": 5.6968, "mean_token_accuracy": 0.14156146496534347, "num_tokens": 4863896.0, "step": 1740 }, { "entropy": 5.769553709030151, "epoch": 0.0472419627749577, "grad_norm": 1.0, "learning_rate": 0.00043509552737208923, "loss": 5.655, "mean_token_accuracy": 0.15236809402704238, "num_tokens": 4876392.0, "step": 1745 }, { "entropy": 5.665567684173584, "epoch": 0.047377326565143825, "grad_norm": 0.890625, "learning_rate": 0.00043426554661090853, "loss": 5.6206, "mean_token_accuracy": 0.15215253382921218, "num_tokens": 4889803.0, "step": 1750 }, { "entropy": 5.653515958786011, "epoch": 0.04751269035532995, "grad_norm": 0.91796875, "learning_rate": 0.00043343119950431516, "loss": 5.5148, "mean_token_accuracy": 0.1512528494000435, "num_tokens": 4903975.0, "step": 1755 }, { "entropy": 5.731270265579224, "epoch": 0.047648054145516074, "grad_norm": 1.0625, "learning_rate": 0.00043259250892635644, "loss": 5.7402, "mean_token_accuracy": 0.14076657742261886, "num_tokens": 4916667.0, "step": 1760 }, { "entropy": 5.772264051437378, "epoch": 0.0477834179357022, "grad_norm": 0.984375, "learning_rate": 0.0004317494978701582, "loss": 5.6871, "mean_token_accuracy": 0.15338942259550095, "num_tokens": 4929908.0, "step": 1765 }, { "entropy": 5.600496244430542, "epoch": 0.04791878172588832, "grad_norm": 0.97265625, "learning_rate": 0.0004309021894472943, "loss": 5.5895, "mean_token_accuracy": 0.1531106323003769, "num_tokens": 4943685.0, "step": 1770 }, { "entropy": 5.86819052696228, "epoch": 0.048054145516074454, "grad_norm": 1.078125, "learning_rate": 0.0004300506068871534, "loss": 5.7578, "mean_token_accuracy": 0.13543773368000983, "num_tokens": 4959796.0, "step": 1775 }, { "entropy": 5.58793797492981, "epoch": 0.04818950930626058, "grad_norm": 1.015625, "learning_rate": 0.00042919477353630135, "loss": 5.5691, "mean_token_accuracy": 0.15354569405317306, "num_tokens": 4973208.0, "step": 1780 }, { "entropy": 5.736422824859619, "epoch": 0.0483248730964467, "grad_norm": 0.8671875, "learning_rate": 0.000428334712857842, "loss": 5.6892, "mean_token_accuracy": 0.14086781814694405, "num_tokens": 4989755.0, "step": 1785 }, { "entropy": 5.694100475311279, "epoch": 0.048460236886632826, "grad_norm": 1.0703125, "learning_rate": 0.00042747044843077304, "loss": 5.6608, "mean_token_accuracy": 0.14808935225009917, "num_tokens": 5003501.0, "step": 1790 }, { "entropy": 5.70287938117981, "epoch": 0.04859560067681895, "grad_norm": 0.93359375, "learning_rate": 0.00042660200394934047, "loss": 5.691, "mean_token_accuracy": 0.1464019276201725, "num_tokens": 5016657.0, "step": 1795 }, { "entropy": 5.6858762264251705, "epoch": 0.048730964467005075, "grad_norm": 0.93359375, "learning_rate": 0.00042572940322238844, "loss": 5.6081, "mean_token_accuracy": 0.1505765825510025, "num_tokens": 5029741.0, "step": 1800 }, { "entropy": 5.6079450130462645, "epoch": 0.0488663282571912, "grad_norm": 1.015625, "learning_rate": 0.00042485267017270664, "loss": 5.5026, "mean_token_accuracy": 0.15048226863145828, "num_tokens": 5042973.0, "step": 1805 }, { "entropy": 5.652156972885132, "epoch": 0.049001692047377324, "grad_norm": 0.98828125, "learning_rate": 0.0004239718288363745, "loss": 5.5519, "mean_token_accuracy": 0.151530858874321, "num_tokens": 5057981.0, "step": 1810 }, { "entropy": 5.653716611862182, "epoch": 0.049137055837563455, "grad_norm": 0.89453125, "learning_rate": 0.0004230869033621023, "loss": 5.6339, "mean_token_accuracy": 0.13919498771429062, "num_tokens": 5072832.0, "step": 1815 }, { "entropy": 5.74049973487854, "epoch": 0.04927241962774958, "grad_norm": 0.89453125, "learning_rate": 0.0004221979180105688, "loss": 5.6291, "mean_token_accuracy": 0.14582021906971931, "num_tokens": 5086141.0, "step": 1820 }, { "entropy": 5.67672643661499, "epoch": 0.049407783417935704, "grad_norm": 0.98046875, "learning_rate": 0.00042130489715375645, "loss": 5.6638, "mean_token_accuracy": 0.146046045422554, "num_tokens": 5100480.0, "step": 1825 }, { "entropy": 5.680028295516967, "epoch": 0.04954314720812183, "grad_norm": 0.89453125, "learning_rate": 0.00042040786527428335, "loss": 5.5843, "mean_token_accuracy": 0.14439646974205972, "num_tokens": 5117197.0, "step": 1830 }, { "entropy": 5.5879209518432615, "epoch": 0.04967851099830795, "grad_norm": 0.90625, "learning_rate": 0.0004195068469647315, "loss": 5.5534, "mean_token_accuracy": 0.1488366484642029, "num_tokens": 5132561.0, "step": 1835 }, { "entropy": 5.6617508888244625, "epoch": 0.04981387478849408, "grad_norm": 0.93359375, "learning_rate": 0.00041860186692697297, "loss": 5.7145, "mean_token_accuracy": 0.1438066452741623, "num_tokens": 5146905.0, "step": 1840 }, { "entropy": 5.724303245544434, "epoch": 0.0499492385786802, "grad_norm": 1.0390625, "learning_rate": 0.00041769294997149264, "loss": 5.5646, "mean_token_accuracy": 0.15083335638046264, "num_tokens": 5161581.0, "step": 1845 }, { "entropy": 5.6070271015167235, "epoch": 0.050084602368866325, "grad_norm": 0.9609375, "learning_rate": 0.0004167801210167081, "loss": 5.5805, "mean_token_accuracy": 0.1544129729270935, "num_tokens": 5176317.0, "step": 1850 }, { "entropy": 5.684096813201904, "epoch": 0.05021996615905246, "grad_norm": 1.046875, "learning_rate": 0.0004158634050882861, "loss": 5.5168, "mean_token_accuracy": 0.15208376348018646, "num_tokens": 5188651.0, "step": 1855 }, { "entropy": 5.55376296043396, "epoch": 0.05035532994923858, "grad_norm": 0.9296875, "learning_rate": 0.0004149428273184569, "loss": 5.5148, "mean_token_accuracy": 0.15063736736774444, "num_tokens": 5202035.0, "step": 1860 }, { "entropy": 5.612833023071289, "epoch": 0.050490693739424705, "grad_norm": 1.09375, "learning_rate": 0.0004140184129453253, "loss": 5.486, "mean_token_accuracy": 0.1544868603348732, "num_tokens": 5215471.0, "step": 1865 }, { "entropy": 5.704241132736206, "epoch": 0.05062605752961083, "grad_norm": 1.15625, "learning_rate": 0.000413090187312178, "loss": 5.6414, "mean_token_accuracy": 0.1538958489894867, "num_tokens": 5228328.0, "step": 1870 }, { "entropy": 5.698283338546753, "epoch": 0.050761421319796954, "grad_norm": 0.97265625, "learning_rate": 0.0004121581758667898, "loss": 5.6058, "mean_token_accuracy": 0.1486688494682312, "num_tokens": 5240586.0, "step": 1875 }, { "entropy": 5.515977621078491, "epoch": 0.05089678510998308, "grad_norm": 1.015625, "learning_rate": 0.00041122240416072533, "loss": 5.4453, "mean_token_accuracy": 0.15285620093345642, "num_tokens": 5252569.0, "step": 1880 }, { "entropy": 5.644832372665405, "epoch": 0.0510321489001692, "grad_norm": 1.09375, "learning_rate": 0.0004102828978486385, "loss": 5.6534, "mean_token_accuracy": 0.14334431514143944, "num_tokens": 5264975.0, "step": 1885 }, { "entropy": 5.681633806228637, "epoch": 0.05116751269035533, "grad_norm": 0.9296875, "learning_rate": 0.0004093396826875695, "loss": 5.527, "mean_token_accuracy": 0.15328461825847625, "num_tokens": 5279688.0, "step": 1890 }, { "entropy": 5.622284603118897, "epoch": 0.05130287648054146, "grad_norm": 0.9609375, "learning_rate": 0.00040839278453623837, "loss": 5.5739, "mean_token_accuracy": 0.15425852686166763, "num_tokens": 5294266.0, "step": 1895 }, { "entropy": 5.633177900314331, "epoch": 0.05143824027072758, "grad_norm": 0.9453125, "learning_rate": 0.0004074422293543363, "loss": 5.5835, "mean_token_accuracy": 0.14945923388004304, "num_tokens": 5308719.0, "step": 1900 }, { "entropy": 5.672901391983032, "epoch": 0.05157360406091371, "grad_norm": 0.890625, "learning_rate": 0.0004064880432018137, "loss": 5.6778, "mean_token_accuracy": 0.1480257421731949, "num_tokens": 5324227.0, "step": 1905 }, { "entropy": 5.7078780174255375, "epoch": 0.05170896785109983, "grad_norm": 1.015625, "learning_rate": 0.00040553025223816615, "loss": 5.603, "mean_token_accuracy": 0.153351391851902, "num_tokens": 5338353.0, "step": 1910 }, { "entropy": 5.629157209396363, "epoch": 0.051844331641285955, "grad_norm": 0.8828125, "learning_rate": 0.00040456888272171653, "loss": 5.4822, "mean_token_accuracy": 0.1563638061285019, "num_tokens": 5354182.0, "step": 1915 }, { "entropy": 5.617384052276611, "epoch": 0.05197969543147208, "grad_norm": 1.046875, "learning_rate": 0.00040360396100889577, "loss": 5.6056, "mean_token_accuracy": 0.14689816236495973, "num_tokens": 5366448.0, "step": 1920 }, { "entropy": 5.651615858078003, "epoch": 0.052115059221658204, "grad_norm": 0.87109375, "learning_rate": 0.0004026355135535202, "loss": 5.5636, "mean_token_accuracy": 0.1531040221452713, "num_tokens": 5381430.0, "step": 1925 }, { "entropy": 5.6194452285766605, "epoch": 0.05225042301184433, "grad_norm": 1.03125, "learning_rate": 0.000401663566906066, "loss": 5.5743, "mean_token_accuracy": 0.15186812579631806, "num_tokens": 5393626.0, "step": 1930 }, { "entropy": 5.7036806583404545, "epoch": 0.05238578680203046, "grad_norm": 0.9375, "learning_rate": 0.00040068814771294134, "loss": 5.5539, "mean_token_accuracy": 0.15736090689897536, "num_tokens": 5407257.0, "step": 1935 }, { "entropy": 5.583117723464966, "epoch": 0.052521150592216584, "grad_norm": 0.90234375, "learning_rate": 0.0003997092827157562, "loss": 5.5588, "mean_token_accuracy": 0.14819036424160004, "num_tokens": 5421798.0, "step": 1940 }, { "entropy": 5.655210685729981, "epoch": 0.05265651438240271, "grad_norm": 0.91796875, "learning_rate": 0.000398726998750589, "loss": 5.5823, "mean_token_accuracy": 0.1502937689423561, "num_tokens": 5437455.0, "step": 1945 }, { "entropy": 5.628138160705566, "epoch": 0.05279187817258883, "grad_norm": 0.828125, "learning_rate": 0.00039774132274725076, "loss": 5.508, "mean_token_accuracy": 0.15878963768482207, "num_tokens": 5451593.0, "step": 1950 }, { "entropy": 5.5857048511505125, "epoch": 0.05292724196277496, "grad_norm": 1.0234375, "learning_rate": 0.00039675228172854707, "loss": 5.5671, "mean_token_accuracy": 0.15036417841911315, "num_tokens": 5466807.0, "step": 1955 }, { "entropy": 5.578492784500122, "epoch": 0.05306260575296108, "grad_norm": 1.0703125, "learning_rate": 0.0003957599028095371, "loss": 5.472, "mean_token_accuracy": 0.15736704617738723, "num_tokens": 5480113.0, "step": 1960 }, { "entropy": 5.58995213508606, "epoch": 0.053197969543147205, "grad_norm": 0.98046875, "learning_rate": 0.00039476421319679017, "loss": 5.576, "mean_token_accuracy": 0.14943182319402695, "num_tokens": 5494694.0, "step": 1965 }, { "entropy": 5.649091339111328, "epoch": 0.05333333333333334, "grad_norm": 0.9609375, "learning_rate": 0.00039376524018764, "loss": 5.5204, "mean_token_accuracy": 0.15763673931360245, "num_tokens": 5508858.0, "step": 1970 }, { "entropy": 5.544556760787964, "epoch": 0.05346869712351946, "grad_norm": 0.9765625, "learning_rate": 0.00039276301116943616, "loss": 5.4916, "mean_token_accuracy": 0.1559601128101349, "num_tokens": 5523142.0, "step": 1975 }, { "entropy": 5.637435817718506, "epoch": 0.053604060913705585, "grad_norm": 1.1015625, "learning_rate": 0.0003917575536187936, "loss": 5.5495, "mean_token_accuracy": 0.1537593424320221, "num_tokens": 5536882.0, "step": 1980 }, { "entropy": 5.666303062438965, "epoch": 0.05373942470389171, "grad_norm": 0.98828125, "learning_rate": 0.00039074889510083894, "loss": 5.5746, "mean_token_accuracy": 0.14690756425261497, "num_tokens": 5550882.0, "step": 1985 }, { "entropy": 5.601831579208374, "epoch": 0.053874788494077834, "grad_norm": 0.90625, "learning_rate": 0.00038973706326845495, "loss": 5.5869, "mean_token_accuracy": 0.14608050435781478, "num_tokens": 5566187.0, "step": 1990 }, { "entropy": 5.604721736907959, "epoch": 0.05401015228426396, "grad_norm": 0.87890625, "learning_rate": 0.0003887220858615225, "loss": 5.5083, "mean_token_accuracy": 0.1559429183602333, "num_tokens": 5580568.0, "step": 1995 }, { "entropy": 5.609822750091553, "epoch": 0.05414551607445008, "grad_norm": 0.96484375, "learning_rate": 0.0003877039907061597, "loss": 5.5986, "mean_token_accuracy": 0.15086540579795837, "num_tokens": 5594827.0, "step": 2000 }, { "entropy": 5.6352800846099855, "epoch": 0.05428087986463621, "grad_norm": 1.078125, "learning_rate": 0.0003866828057139598, "loss": 5.5726, "mean_token_accuracy": 0.14980787187814712, "num_tokens": 5607643.0, "step": 2005 }, { "entropy": 5.583590316772461, "epoch": 0.05441624365482234, "grad_norm": 1.015625, "learning_rate": 0.00038565855888122503, "loss": 5.5041, "mean_token_accuracy": 0.1583167791366577, "num_tokens": 5619178.0, "step": 2010 }, { "entropy": 5.708728361129761, "epoch": 0.05455160744500846, "grad_norm": 0.91796875, "learning_rate": 0.00038463127828819975, "loss": 5.5384, "mean_token_accuracy": 0.15386256724596023, "num_tokens": 5632724.0, "step": 2015 }, { "entropy": 5.479742050170898, "epoch": 0.05468697123519459, "grad_norm": 1.0234375, "learning_rate": 0.00038360099209830043, "loss": 5.5745, "mean_token_accuracy": 0.15379853323101997, "num_tokens": 5646090.0, "step": 2020 }, { "entropy": 5.633185243606567, "epoch": 0.05482233502538071, "grad_norm": 0.93359375, "learning_rate": 0.0003825677285573433, "loss": 5.507, "mean_token_accuracy": 0.15375496149063111, "num_tokens": 5660734.0, "step": 2025 }, { "entropy": 5.631849336624145, "epoch": 0.054957698815566836, "grad_norm": 1.078125, "learning_rate": 0.00038153151599277027, "loss": 5.5224, "mean_token_accuracy": 0.15756209194660187, "num_tokens": 5674885.0, "step": 2030 }, { "entropy": 5.569233798980713, "epoch": 0.05509306260575296, "grad_norm": 0.96875, "learning_rate": 0.0003804923828128723, "loss": 5.4979, "mean_token_accuracy": 0.15912836641073227, "num_tokens": 5687464.0, "step": 2035 }, { "entropy": 5.671593904495239, "epoch": 0.055228426395939084, "grad_norm": 0.91015625, "learning_rate": 0.0003794503575060104, "loss": 5.5796, "mean_token_accuracy": 0.15338214933872224, "num_tokens": 5701569.0, "step": 2040 }, { "entropy": 5.604352951049805, "epoch": 0.05536379018612521, "grad_norm": 0.92578125, "learning_rate": 0.00037840546863983484, "loss": 5.5662, "mean_token_accuracy": 0.14921343475580215, "num_tokens": 5716021.0, "step": 2045 }, { "entropy": 5.676676845550537, "epoch": 0.05549915397631134, "grad_norm": 0.96484375, "learning_rate": 0.0003773577448605015, "loss": 5.4733, "mean_token_accuracy": 0.1577136844396591, "num_tokens": 5731219.0, "step": 2050 }, { "entropy": 5.5694435119628904, "epoch": 0.055634517766497464, "grad_norm": 1.015625, "learning_rate": 0.0003763072148918872, "loss": 5.566, "mean_token_accuracy": 0.15062549114227294, "num_tokens": 5745864.0, "step": 2055 }, { "entropy": 5.537994909286499, "epoch": 0.05576988155668359, "grad_norm": 1.078125, "learning_rate": 0.0003752539075348017, "loss": 5.4265, "mean_token_accuracy": 0.16346251368522643, "num_tokens": 5758852.0, "step": 2060 }, { "entropy": 5.655580282211304, "epoch": 0.05590524534686971, "grad_norm": 0.98046875, "learning_rate": 0.00037419785166619817, "loss": 5.5961, "mean_token_accuracy": 0.1531015492975712, "num_tokens": 5774474.0, "step": 2065 }, { "entropy": 5.5935293674469, "epoch": 0.05604060913705584, "grad_norm": 0.96875, "learning_rate": 0.0003731390762383818, "loss": 5.4934, "mean_token_accuracy": 0.15586720108985902, "num_tokens": 5788077.0, "step": 2070 }, { "entropy": 5.6637038230896, "epoch": 0.05617597292724196, "grad_norm": 0.953125, "learning_rate": 0.0003720776102782158, "loss": 5.6647, "mean_token_accuracy": 0.1455085203051567, "num_tokens": 5805257.0, "step": 2075 }, { "entropy": 5.570231914520264, "epoch": 0.056311336717428086, "grad_norm": 0.9765625, "learning_rate": 0.00037101348288632555, "loss": 5.431, "mean_token_accuracy": 0.1498264342546463, "num_tokens": 5819518.0, "step": 2080 }, { "entropy": 5.5381348609924315, "epoch": 0.05644670050761421, "grad_norm": 0.9375, "learning_rate": 0.0003699467232363012, "loss": 5.3706, "mean_token_accuracy": 0.16544263809919357, "num_tokens": 5833228.0, "step": 2085 }, { "entropy": 5.588838815689087, "epoch": 0.05658206429780034, "grad_norm": 1.0, "learning_rate": 0.0003688773605738973, "loss": 5.4515, "mean_token_accuracy": 0.15661462396383286, "num_tokens": 5847714.0, "step": 2090 }, { "entropy": 5.516980886459351, "epoch": 0.056717428087986466, "grad_norm": 0.95703125, "learning_rate": 0.00036780542421623134, "loss": 5.4794, "mean_token_accuracy": 0.15581640005111694, "num_tokens": 5861775.0, "step": 2095 }, { "entropy": 5.556796646118164, "epoch": 0.05685279187817259, "grad_norm": 0.9296875, "learning_rate": 0.0003667309435509802, "loss": 5.5511, "mean_token_accuracy": 0.15586237907409667, "num_tokens": 5875679.0, "step": 2100 }, { "entropy": 5.692843914031982, "epoch": 0.056988155668358714, "grad_norm": 0.94921875, "learning_rate": 0.0003656539480355741, "loss": 5.6027, "mean_token_accuracy": 0.15197229087352754, "num_tokens": 5889127.0, "step": 2105 }, { "entropy": 5.658493995666504, "epoch": 0.05712351945854484, "grad_norm": 1.0078125, "learning_rate": 0.0003645744671963891, "loss": 5.5212, "mean_token_accuracy": 0.16027260273694993, "num_tokens": 5902710.0, "step": 2110 }, { "entropy": 5.55581750869751, "epoch": 0.05725888324873096, "grad_norm": 1.0546875, "learning_rate": 0.0003634925306279376, "loss": 5.5784, "mean_token_accuracy": 0.1552097924053669, "num_tokens": 5914823.0, "step": 2115 }, { "entropy": 5.566669940948486, "epoch": 0.05739424703891709, "grad_norm": 0.890625, "learning_rate": 0.0003624081679920574, "loss": 5.5149, "mean_token_accuracy": 0.15782447010278702, "num_tokens": 5929553.0, "step": 2120 }, { "entropy": 5.509809684753418, "epoch": 0.05752961082910321, "grad_norm": 0.9140625, "learning_rate": 0.0003613214090170977, "loss": 5.416, "mean_token_accuracy": 0.16114599555730819, "num_tokens": 5942364.0, "step": 2125 }, { "entropy": 5.570280456542969, "epoch": 0.05766497461928934, "grad_norm": 0.98046875, "learning_rate": 0.0003602322834971048, "loss": 5.5507, "mean_token_accuracy": 0.15223699808120728, "num_tokens": 5954874.0, "step": 2130 }, { "entropy": 5.599170875549317, "epoch": 0.05780033840947547, "grad_norm": 0.95703125, "learning_rate": 0.0003591408212910051, "loss": 5.4627, "mean_token_accuracy": 0.15489756017923356, "num_tokens": 5968635.0, "step": 2135 }, { "entropy": 5.590338897705078, "epoch": 0.05793570219966159, "grad_norm": 0.9765625, "learning_rate": 0.0003580470523217863, "loss": 5.559, "mean_token_accuracy": 0.1588521420955658, "num_tokens": 5983887.0, "step": 2140 }, { "entropy": 5.656904172897339, "epoch": 0.058071065989847716, "grad_norm": 0.9296875, "learning_rate": 0.0003569510065756771, "loss": 5.5177, "mean_token_accuracy": 0.14795053601264954, "num_tokens": 5998996.0, "step": 2145 }, { "entropy": 5.560834264755249, "epoch": 0.05820642978003384, "grad_norm": 0.9140625, "learning_rate": 0.0003558527141013254, "loss": 5.4962, "mean_token_accuracy": 0.1533253774046898, "num_tokens": 6013399.0, "step": 2150 }, { "entropy": 5.6488504886627195, "epoch": 0.058341793570219964, "grad_norm": 1.0546875, "learning_rate": 0.0003547522050089742, "loss": 5.5268, "mean_token_accuracy": 0.154144811630249, "num_tokens": 6025858.0, "step": 2155 }, { "entropy": 5.50015172958374, "epoch": 0.05847715736040609, "grad_norm": 0.8828125, "learning_rate": 0.00035364950946963606, "loss": 5.4178, "mean_token_accuracy": 0.1639969304203987, "num_tokens": 6040129.0, "step": 2160 }, { "entropy": 5.572449398040772, "epoch": 0.05861252115059222, "grad_norm": 0.9375, "learning_rate": 0.0003525446577142663, "loss": 5.5237, "mean_token_accuracy": 0.15481064915657045, "num_tokens": 6052988.0, "step": 2165 }, { "entropy": 5.599097108840942, "epoch": 0.058747884940778344, "grad_norm": 0.97265625, "learning_rate": 0.00035143768003293395, "loss": 5.4731, "mean_token_accuracy": 0.16200729161500932, "num_tokens": 6066901.0, "step": 2170 }, { "entropy": 5.604894495010376, "epoch": 0.05888324873096447, "grad_norm": 1.03125, "learning_rate": 0.0003503286067739913, "loss": 5.4809, "mean_token_accuracy": 0.15721836537122727, "num_tokens": 6080221.0, "step": 2175 }, { "entropy": 5.617720413208008, "epoch": 0.05901861252115059, "grad_norm": 1.03125, "learning_rate": 0.00034921746834324193, "loss": 5.5341, "mean_token_accuracy": 0.14920639246702194, "num_tokens": 6093591.0, "step": 2180 }, { "entropy": 5.5153953552246096, "epoch": 0.05915397631133672, "grad_norm": 0.91796875, "learning_rate": 0.0003481042952031072, "loss": 5.4102, "mean_token_accuracy": 0.15838973969221115, "num_tokens": 6107427.0, "step": 2185 }, { "entropy": 5.622984933853149, "epoch": 0.05928934010152284, "grad_norm": 0.984375, "learning_rate": 0.0003469891178717911, "loss": 5.5577, "mean_token_accuracy": 0.15597878992557526, "num_tokens": 6121355.0, "step": 2190 }, { "entropy": 5.5580566883087155, "epoch": 0.059424703891708966, "grad_norm": 1.0390625, "learning_rate": 0.0003458719669224436, "loss": 5.5422, "mean_token_accuracy": 0.15654557049274445, "num_tokens": 6133328.0, "step": 2195 }, { "entropy": 5.6222865104675295, "epoch": 0.05956006768189509, "grad_norm": 0.9296875, "learning_rate": 0.0003447528729823221, "loss": 5.4815, "mean_token_accuracy": 0.15166250467300416, "num_tokens": 6149486.0, "step": 2200 }, { "entropy": 5.561207914352417, "epoch": 0.05969543147208122, "grad_norm": 1.0234375, "learning_rate": 0.0003436318667319525, "loss": 5.4912, "mean_token_accuracy": 0.1630606085062027, "num_tokens": 6161447.0, "step": 2205 }, { "entropy": 5.557836532592773, "epoch": 0.059830795262267346, "grad_norm": 0.99609375, "learning_rate": 0.00034250897890428716, "loss": 5.5187, "mean_token_accuracy": 0.15890539884567262, "num_tokens": 6176368.0, "step": 2210 }, { "entropy": 5.5497699737548825, "epoch": 0.05996615905245347, "grad_norm": 0.9296875, "learning_rate": 0.0003413842402838633, "loss": 5.4567, "mean_token_accuracy": 0.1620472937822342, "num_tokens": 6190248.0, "step": 2215 }, { "entropy": 5.514479446411133, "epoch": 0.060101522842639594, "grad_norm": 0.97265625, "learning_rate": 0.00034025768170595834, "loss": 5.3753, "mean_token_accuracy": 0.16145753711462021, "num_tokens": 6205507.0, "step": 2220 }, { "entropy": 5.512839603424072, "epoch": 0.06023688663282572, "grad_norm": 0.875, "learning_rate": 0.0003391293340557446, "loss": 5.4593, "mean_token_accuracy": 0.15989638343453408, "num_tokens": 6218970.0, "step": 2225 }, { "entropy": 5.630588674545288, "epoch": 0.06037225042301184, "grad_norm": 1.0078125, "learning_rate": 0.0003379992282674431, "loss": 5.5762, "mean_token_accuracy": 0.15546667575836182, "num_tokens": 6232095.0, "step": 2230 }, { "entropy": 5.60104660987854, "epoch": 0.06050761421319797, "grad_norm": 0.8203125, "learning_rate": 0.0003368673953234749, "loss": 5.4843, "mean_token_accuracy": 0.16127849221229554, "num_tokens": 6247195.0, "step": 2235 }, { "entropy": 5.5306642055511475, "epoch": 0.06064297800338409, "grad_norm": 0.953125, "learning_rate": 0.00033573386625361176, "loss": 5.5001, "mean_token_accuracy": 0.15367966145277023, "num_tokens": 6262704.0, "step": 2240 }, { "entropy": 5.612587547302246, "epoch": 0.06077834179357022, "grad_norm": 0.92578125, "learning_rate": 0.00033459867213412567, "loss": 5.5317, "mean_token_accuracy": 0.15857135504484177, "num_tokens": 6277115.0, "step": 2245 }, { "entropy": 5.64555606842041, "epoch": 0.06091370558375635, "grad_norm": 0.9453125, "learning_rate": 0.000333461844086937, "loss": 5.5412, "mean_token_accuracy": 0.15073265060782431, "num_tokens": 6291597.0, "step": 2250 }, { "entropy": 5.520713806152344, "epoch": 0.06104906937394247, "grad_norm": 0.90234375, "learning_rate": 0.00033232341327876097, "loss": 5.4102, "mean_token_accuracy": 0.16134743243455887, "num_tokens": 6306256.0, "step": 2255 }, { "entropy": 5.444108724594116, "epoch": 0.061184433164128596, "grad_norm": 0.98828125, "learning_rate": 0.0003311834109202531, "loss": 5.4201, "mean_token_accuracy": 0.16176949292421341, "num_tokens": 6320853.0, "step": 2260 }, { "entropy": 5.6139593601226805, "epoch": 0.06131979695431472, "grad_norm": 0.95703125, "learning_rate": 0.00033004186826515416, "loss": 5.4732, "mean_token_accuracy": 0.15738911405205727, "num_tokens": 6334681.0, "step": 2265 }, { "entropy": 5.526891708374023, "epoch": 0.061455160744500845, "grad_norm": 0.9140625, "learning_rate": 0.0003288988166094324, "loss": 5.4956, "mean_token_accuracy": 0.15784757435321808, "num_tokens": 6350426.0, "step": 2270 }, { "entropy": 5.58657021522522, "epoch": 0.06159052453468697, "grad_norm": 0.921875, "learning_rate": 0.00032775428729042656, "loss": 5.4416, "mean_token_accuracy": 0.16237595677375793, "num_tokens": 6364646.0, "step": 2275 }, { "entropy": 5.508593463897705, "epoch": 0.06172588832487309, "grad_norm": 0.94140625, "learning_rate": 0.000326608311685986, "loss": 5.4866, "mean_token_accuracy": 0.16056797206401824, "num_tokens": 6380020.0, "step": 2280 }, { "entropy": 5.6077048778533936, "epoch": 0.061861252115059225, "grad_norm": 0.91015625, "learning_rate": 0.0003254609212136108, "loss": 5.4236, "mean_token_accuracy": 0.16293450444936752, "num_tokens": 6393124.0, "step": 2285 }, { "entropy": 5.595155477523804, "epoch": 0.06199661590524535, "grad_norm": 0.890625, "learning_rate": 0.00032431214732959036, "loss": 5.5536, "mean_token_accuracy": 0.1563761591911316, "num_tokens": 6409125.0, "step": 2290 }, { "entropy": 5.585239553451538, "epoch": 0.06213197969543147, "grad_norm": 0.8828125, "learning_rate": 0.000323162021528141, "loss": 5.4177, "mean_token_accuracy": 0.16349790394306182, "num_tokens": 6423597.0, "step": 2295 }, { "entropy": 5.47139458656311, "epoch": 0.0622673434856176, "grad_norm": 0.86328125, "learning_rate": 0.00032201057534054264, "loss": 5.349, "mean_token_accuracy": 0.16430194079875945, "num_tokens": 6437897.0, "step": 2300 }, { "entropy": 5.547074794769287, "epoch": 0.06240270727580372, "grad_norm": 0.91015625, "learning_rate": 0.00032085784033427414, "loss": 5.5022, "mean_token_accuracy": 0.15308141559362412, "num_tokens": 6451760.0, "step": 2305 }, { "entropy": 5.511609315872192, "epoch": 0.06253807106598985, "grad_norm": 1.03125, "learning_rate": 0.0003197038481121478, "loss": 5.3525, "mean_token_accuracy": 0.16880294680595398, "num_tokens": 6465182.0, "step": 2310 }, { "entropy": 5.574721622467041, "epoch": 0.06267343485617598, "grad_norm": 0.890625, "learning_rate": 0.0003185486303114436, "loss": 5.4606, "mean_token_accuracy": 0.15778982043266296, "num_tokens": 6479146.0, "step": 2315 }, { "entropy": 5.50466685295105, "epoch": 0.0628087986463621, "grad_norm": 0.984375, "learning_rate": 0.0003173922186030409, "loss": 5.3229, "mean_token_accuracy": 0.16876034587621688, "num_tokens": 6492562.0, "step": 2320 }, { "entropy": 5.41968674659729, "epoch": 0.06294416243654823, "grad_norm": 1.03125, "learning_rate": 0.000316234644690551, "loss": 5.38, "mean_token_accuracy": 0.16006240993738174, "num_tokens": 6506530.0, "step": 2325 }, { "entropy": 5.528688192367554, "epoch": 0.06307952622673435, "grad_norm": 0.9921875, "learning_rate": 0.0003150759403094473, "loss": 5.434, "mean_token_accuracy": 0.16276055127382277, "num_tokens": 6521676.0, "step": 2330 }, { "entropy": 5.513411903381348, "epoch": 0.06321489001692047, "grad_norm": 0.98828125, "learning_rate": 0.00031391613722619587, "loss": 5.3759, "mean_token_accuracy": 0.1745678424835205, "num_tokens": 6532997.0, "step": 2335 }, { "entropy": 5.529337978363037, "epoch": 0.0633502538071066, "grad_norm": 0.97265625, "learning_rate": 0.000312755267237384, "loss": 5.4224, "mean_token_accuracy": 0.16465317010879515, "num_tokens": 6548174.0, "step": 2340 }, { "entropy": 5.6073933124542235, "epoch": 0.06348561759729272, "grad_norm": 0.953125, "learning_rate": 0.0003115933621688488, "loss": 5.5427, "mean_token_accuracy": 0.15725521594285966, "num_tokens": 6563064.0, "step": 2345 }, { "entropy": 5.537544775009155, "epoch": 0.06362098138747885, "grad_norm": 1.0390625, "learning_rate": 0.00031043045387480487, "loss": 5.5134, "mean_token_accuracy": 0.15672265142202377, "num_tokens": 6576582.0, "step": 2350 }, { "entropy": 5.655880641937256, "epoch": 0.06375634517766497, "grad_norm": 0.90234375, "learning_rate": 0.0003092665742369703, "loss": 5.4981, "mean_token_accuracy": 0.153935007750988, "num_tokens": 6592583.0, "step": 2355 }, { "entropy": 5.640050649642944, "epoch": 0.0638917089678511, "grad_norm": 0.8984375, "learning_rate": 0.00030810175516369343, "loss": 5.5216, "mean_token_accuracy": 0.1580222949385643, "num_tokens": 6608513.0, "step": 2360 }, { "entropy": 5.569810676574707, "epoch": 0.06402707275803722, "grad_norm": 0.890625, "learning_rate": 0.0003069360285890775, "loss": 5.4921, "mean_token_accuracy": 0.15731192976236344, "num_tokens": 6622427.0, "step": 2365 }, { "entropy": 5.60255537033081, "epoch": 0.06416243654822334, "grad_norm": 0.96484375, "learning_rate": 0.00030576942647210547, "loss": 5.4613, "mean_token_accuracy": 0.16770876348018646, "num_tokens": 6636196.0, "step": 2370 }, { "entropy": 5.543747758865356, "epoch": 0.06429780033840947, "grad_norm": 1.046875, "learning_rate": 0.00030460198079576355, "loss": 5.4506, "mean_token_accuracy": 0.16442616730928422, "num_tokens": 6648393.0, "step": 2375 }, { "entropy": 5.5761157989501955, "epoch": 0.06443316412859561, "grad_norm": 0.97265625, "learning_rate": 0.0003034337235661648, "loss": 5.4201, "mean_token_accuracy": 0.16427001357078552, "num_tokens": 6662062.0, "step": 2380 }, { "entropy": 5.5971932888031, "epoch": 0.06456852791878173, "grad_norm": 0.94921875, "learning_rate": 0.0003022646868116714, "loss": 5.4853, "mean_token_accuracy": 0.1576756104826927, "num_tokens": 6677299.0, "step": 2385 }, { "entropy": 5.595594882965088, "epoch": 0.06470389170896786, "grad_norm": 1.046875, "learning_rate": 0.0003010949025820163, "loss": 5.5071, "mean_token_accuracy": 0.15385562032461167, "num_tokens": 6692573.0, "step": 2390 }, { "entropy": 5.709032297134399, "epoch": 0.06483925549915398, "grad_norm": 0.9453125, "learning_rate": 0.0002999244029474252, "loss": 5.5817, "mean_token_accuracy": 0.15576104819774628, "num_tokens": 6706081.0, "step": 2395 }, { "entropy": 5.572895097732544, "epoch": 0.0649746192893401, "grad_norm": 0.8515625, "learning_rate": 0.00029875321999773684, "loss": 5.4139, "mean_token_accuracy": 0.1568359524011612, "num_tokens": 6721662.0, "step": 2400 }, { "entropy": 5.530266189575196, "epoch": 0.06510998307952623, "grad_norm": 1.046875, "learning_rate": 0.00029758138584152333, "loss": 5.5371, "mean_token_accuracy": 0.15827345550060273, "num_tokens": 6735226.0, "step": 2405 }, { "entropy": 5.741498231887817, "epoch": 0.06524534686971235, "grad_norm": 0.87890625, "learning_rate": 0.0002964089326052102, "loss": 5.61, "mean_token_accuracy": 0.1486797995865345, "num_tokens": 6750351.0, "step": 2410 }, { "entropy": 5.482465362548828, "epoch": 0.06538071065989848, "grad_norm": 1.0546875, "learning_rate": 0.0002952358924321949, "loss": 5.343, "mean_token_accuracy": 0.1717396318912506, "num_tokens": 6762285.0, "step": 2415 }, { "entropy": 5.579564380645752, "epoch": 0.0655160744500846, "grad_norm": 0.9453125, "learning_rate": 0.00029406229748196657, "loss": 5.5056, "mean_token_accuracy": 0.15708825439214708, "num_tokens": 6778866.0, "step": 2420 }, { "entropy": 5.575643253326416, "epoch": 0.06565143824027073, "grad_norm": 0.9140625, "learning_rate": 0.0002928881799292235, "loss": 5.3694, "mean_token_accuracy": 0.16926451921463012, "num_tokens": 6792127.0, "step": 2425 }, { "entropy": 5.550977325439453, "epoch": 0.06578680203045685, "grad_norm": 0.94140625, "learning_rate": 0.00029171357196299154, "loss": 5.5019, "mean_token_accuracy": 0.15696292817592622, "num_tokens": 6805692.0, "step": 2430 }, { "entropy": 5.502995109558105, "epoch": 0.06592216582064298, "grad_norm": 0.86328125, "learning_rate": 0.0002905385057857414, "loss": 5.4826, "mean_token_accuracy": 0.15718090236186982, "num_tokens": 6820533.0, "step": 2435 }, { "entropy": 5.5539785861969, "epoch": 0.0660575296108291, "grad_norm": 0.8671875, "learning_rate": 0.0002893630136125058, "loss": 5.38, "mean_token_accuracy": 0.1642708361148834, "num_tokens": 6834746.0, "step": 2440 }, { "entropy": 5.579140996932983, "epoch": 0.06619289340101522, "grad_norm": 0.9375, "learning_rate": 0.0002881871276699967, "loss": 5.432, "mean_token_accuracy": 0.1649514243006706, "num_tokens": 6848480.0, "step": 2445 }, { "entropy": 5.482105016708374, "epoch": 0.06632825719120135, "grad_norm": 0.875, "learning_rate": 0.00028701088019572114, "loss": 5.4089, "mean_token_accuracy": 0.16585078686475754, "num_tokens": 6863817.0, "step": 2450 }, { "entropy": 5.485904407501221, "epoch": 0.06646362098138747, "grad_norm": 0.953125, "learning_rate": 0.0002858343034370977, "loss": 5.3672, "mean_token_accuracy": 0.1629736080765724, "num_tokens": 6879028.0, "step": 2455 }, { "entropy": 5.567845058441162, "epoch": 0.06659898477157361, "grad_norm": 1.0, "learning_rate": 0.00028465742965057267, "loss": 5.4993, "mean_token_accuracy": 0.1671033576130867, "num_tokens": 6892582.0, "step": 2460 }, { "entropy": 5.588065147399902, "epoch": 0.06673434856175973, "grad_norm": 0.98046875, "learning_rate": 0.00028348029110073533, "loss": 5.3907, "mean_token_accuracy": 0.15922013744711877, "num_tokens": 6905716.0, "step": 2465 }, { "entropy": 5.482119083404541, "epoch": 0.06686971235194586, "grad_norm": 1.0625, "learning_rate": 0.00028230292005943365, "loss": 5.3633, "mean_token_accuracy": 0.17306406795978546, "num_tokens": 6920266.0, "step": 2470 }, { "entropy": 5.454979324340821, "epoch": 0.06700507614213198, "grad_norm": 0.83984375, "learning_rate": 0.00028112534880488945, "loss": 5.4226, "mean_token_accuracy": 0.16642075926065444, "num_tokens": 6934274.0, "step": 2475 }, { "entropy": 5.539786052703858, "epoch": 0.06714043993231811, "grad_norm": 0.8984375, "learning_rate": 0.0002799476096208137, "loss": 5.4063, "mean_token_accuracy": 0.16389644294977188, "num_tokens": 6949020.0, "step": 2480 }, { "entropy": 5.504109811782837, "epoch": 0.06727580372250423, "grad_norm": 0.98828125, "learning_rate": 0.00027876973479552087, "loss": 5.3474, "mean_token_accuracy": 0.16669356375932692, "num_tokens": 6962687.0, "step": 2485 }, { "entropy": 5.562744235992431, "epoch": 0.06741116751269036, "grad_norm": 0.87890625, "learning_rate": 0.00027759175662104424, "loss": 5.5178, "mean_token_accuracy": 0.15945329070091246, "num_tokens": 6977877.0, "step": 2490 }, { "entropy": 5.653814268112183, "epoch": 0.06754653130287648, "grad_norm": 0.98046875, "learning_rate": 0.0002764137073922508, "loss": 5.561, "mean_token_accuracy": 0.15105569660663604, "num_tokens": 6992784.0, "step": 2495 }, { "entropy": 5.4771082401275635, "epoch": 0.0676818950930626, "grad_norm": 1.0078125, "learning_rate": 0.00027523561940595505, "loss": 5.3698, "mean_token_accuracy": 0.17183669209480285, "num_tokens": 7007496.0, "step": 2500 }, { "entropy": 5.495787239074707, "epoch": 0.06781725888324873, "grad_norm": 0.875, "learning_rate": 0.0002740575249600342, "loss": 5.3815, "mean_token_accuracy": 0.16253670752048494, "num_tokens": 7020482.0, "step": 2505 }, { "entropy": 5.591378307342529, "epoch": 0.06795262267343485, "grad_norm": 0.9921875, "learning_rate": 0.00027287945635254263, "loss": 5.4631, "mean_token_accuracy": 0.15494969636201858, "num_tokens": 7034021.0, "step": 2510 }, { "entropy": 5.639207792282105, "epoch": 0.06808798646362098, "grad_norm": 1.0234375, "learning_rate": 0.00027170144588082635, "loss": 5.4504, "mean_token_accuracy": 0.156061589717865, "num_tokens": 7046897.0, "step": 2515 }, { "entropy": 5.4708277702331545, "epoch": 0.0682233502538071, "grad_norm": 1.0, "learning_rate": 0.00027052352584063763, "loss": 5.3641, "mean_token_accuracy": 0.16388892978429795, "num_tokens": 7060916.0, "step": 2520 }, { "entropy": 5.4516136169433596, "epoch": 0.06835871404399323, "grad_norm": 1.0546875, "learning_rate": 0.00026934572852524907, "loss": 5.3295, "mean_token_accuracy": 0.1627664878964424, "num_tokens": 7074298.0, "step": 2525 }, { "entropy": 5.521515798568726, "epoch": 0.06849407783417935, "grad_norm": 1.03125, "learning_rate": 0.00026816808622456937, "loss": 5.3544, "mean_token_accuracy": 0.16788979172706603, "num_tokens": 7088716.0, "step": 2530 }, { "entropy": 5.494029998779297, "epoch": 0.06862944162436548, "grad_norm": 0.91796875, "learning_rate": 0.0002669906312242569, "loss": 5.346, "mean_token_accuracy": 0.17190950810909272, "num_tokens": 7103508.0, "step": 2535 }, { "entropy": 5.537734889984131, "epoch": 0.06876480541455161, "grad_norm": 1.0078125, "learning_rate": 0.00026581339580483525, "loss": 5.4624, "mean_token_accuracy": 0.161481374502182, "num_tokens": 7117534.0, "step": 2540 }, { "entropy": 5.570920372009278, "epoch": 0.06890016920473774, "grad_norm": 1.0390625, "learning_rate": 0.0002646364122408082, "loss": 5.4882, "mean_token_accuracy": 0.15791051536798478, "num_tokens": 7130707.0, "step": 2545 }, { "entropy": 5.582677364349365, "epoch": 0.06903553299492386, "grad_norm": 0.9453125, "learning_rate": 0.0002634597127997749, "loss": 5.482, "mean_token_accuracy": 0.16266081035137175, "num_tokens": 7146298.0, "step": 2550 }, { "entropy": 5.409732484817505, "epoch": 0.06917089678510999, "grad_norm": 0.84375, "learning_rate": 0.0002622833297415445, "loss": 5.2559, "mean_token_accuracy": 0.17082736790180206, "num_tokens": 7161266.0, "step": 2555 }, { "entropy": 5.504514932632446, "epoch": 0.06930626057529611, "grad_norm": 0.875, "learning_rate": 0.0002611072953172531, "loss": 5.3892, "mean_token_accuracy": 0.16824420988559724, "num_tokens": 7175543.0, "step": 2560 }, { "entropy": 5.419651794433594, "epoch": 0.06944162436548224, "grad_norm": 1.015625, "learning_rate": 0.00025993164176847845, "loss": 5.3044, "mean_token_accuracy": 0.17822718918323516, "num_tokens": 7189617.0, "step": 2565 }, { "entropy": 5.537864732742309, "epoch": 0.06957698815566836, "grad_norm": 1.0078125, "learning_rate": 0.0002587564013263564, "loss": 5.3945, "mean_token_accuracy": 0.1665595144033432, "num_tokens": 7203722.0, "step": 2570 }, { "entropy": 5.484334468841553, "epoch": 0.06971235194585448, "grad_norm": 0.953125, "learning_rate": 0.0002575816062106974, "loss": 5.3907, "mean_token_accuracy": 0.1719420000910759, "num_tokens": 7215988.0, "step": 2575 }, { "entropy": 5.398307371139526, "epoch": 0.06984771573604061, "grad_norm": 0.8828125, "learning_rate": 0.00025640728862910293, "loss": 5.2727, "mean_token_accuracy": 0.16697476506233216, "num_tokens": 7231974.0, "step": 2580 }, { "entropy": 5.451391649246216, "epoch": 0.06998307952622673, "grad_norm": 0.94140625, "learning_rate": 0.00025523348077608285, "loss": 5.334, "mean_token_accuracy": 0.16734268814325332, "num_tokens": 7247564.0, "step": 2585 }, { "entropy": 5.557687759399414, "epoch": 0.07011844331641286, "grad_norm": 0.97265625, "learning_rate": 0.00025406021483217225, "loss": 5.3802, "mean_token_accuracy": 0.16443277895450592, "num_tokens": 7262757.0, "step": 2590 }, { "entropy": 5.511172676086426, "epoch": 0.07025380710659898, "grad_norm": 0.95703125, "learning_rate": 0.00025288752296304963, "loss": 5.4948, "mean_token_accuracy": 0.15715145468711852, "num_tokens": 7277354.0, "step": 2595 }, { "entropy": 5.5072393894195555, "epoch": 0.0703891708967851, "grad_norm": 0.9296875, "learning_rate": 0.000251715437318655, "loss": 5.3905, "mean_token_accuracy": 0.1723044529557228, "num_tokens": 7291468.0, "step": 2600 }, { "entropy": 5.505620288848877, "epoch": 0.07052453468697123, "grad_norm": 1.0, "learning_rate": 0.0002505439900323084, "loss": 5.2772, "mean_token_accuracy": 0.17259037345647812, "num_tokens": 7304480.0, "step": 2605 }, { "entropy": 5.533134651184082, "epoch": 0.07065989847715735, "grad_norm": 0.94140625, "learning_rate": 0.00024937321321982894, "loss": 5.388, "mean_token_accuracy": 0.15711098909378052, "num_tokens": 7318827.0, "step": 2610 }, { "entropy": 5.462842607498169, "epoch": 0.07079526226734349, "grad_norm": 0.95703125, "learning_rate": 0.00024820313897865433, "loss": 5.4047, "mean_token_accuracy": 0.16648803055286407, "num_tokens": 7331988.0, "step": 2615 }, { "entropy": 5.606928825378418, "epoch": 0.07093062605752962, "grad_norm": 0.90625, "learning_rate": 0.00024703379938696105, "loss": 5.3909, "mean_token_accuracy": 0.16330956071615219, "num_tokens": 7345740.0, "step": 2620 }, { "entropy": 5.496723222732544, "epoch": 0.07106598984771574, "grad_norm": 0.86328125, "learning_rate": 0.00024586522650278447, "loss": 5.3324, "mean_token_accuracy": 0.1629031166434288, "num_tokens": 7359100.0, "step": 2625 }, { "entropy": 5.492794418334961, "epoch": 0.07120135363790187, "grad_norm": 0.96484375, "learning_rate": 0.00024469745236314064, "loss": 5.4332, "mean_token_accuracy": 0.16518517211079597, "num_tokens": 7373261.0, "step": 2630 }, { "entropy": 5.497795438766479, "epoch": 0.07133671742808799, "grad_norm": 1.0546875, "learning_rate": 0.00024353050898314767, "loss": 5.3778, "mean_token_accuracy": 0.16042957752943038, "num_tokens": 7386125.0, "step": 2635 }, { "entropy": 5.579156875610352, "epoch": 0.07147208121827411, "grad_norm": 0.94140625, "learning_rate": 0.00024236442835514743, "loss": 5.4228, "mean_token_accuracy": 0.16269408017396927, "num_tokens": 7400206.0, "step": 2640 }, { "entropy": 5.575217056274414, "epoch": 0.07160744500846024, "grad_norm": 0.94921875, "learning_rate": 0.00024119924244782965, "loss": 5.3759, "mean_token_accuracy": 0.16886017620563507, "num_tokens": 7414133.0, "step": 2645 }, { "entropy": 5.414534330368042, "epoch": 0.07174280879864636, "grad_norm": 0.92578125, "learning_rate": 0.00024003498320535462, "loss": 5.2814, "mean_token_accuracy": 0.17329987585544587, "num_tokens": 7428976.0, "step": 2650 }, { "entropy": 5.428465366363525, "epoch": 0.07187817258883249, "grad_norm": 0.94921875, "learning_rate": 0.00023887168254647727, "loss": 5.2716, "mean_token_accuracy": 0.16944997161626815, "num_tokens": 7442821.0, "step": 2655 }, { "entropy": 5.4997495174407955, "epoch": 0.07201353637901861, "grad_norm": 0.90625, "learning_rate": 0.00023770937236367308, "loss": 5.3966, "mean_token_accuracy": 0.16241525560617448, "num_tokens": 7459447.0, "step": 2660 }, { "entropy": 5.482759618759156, "epoch": 0.07214890016920474, "grad_norm": 0.89453125, "learning_rate": 0.00023654808452226278, "loss": 5.3326, "mean_token_accuracy": 0.17035989910364152, "num_tokens": 7474103.0, "step": 2665 }, { "entropy": 5.577449703216553, "epoch": 0.07228426395939086, "grad_norm": 1.015625, "learning_rate": 0.00023538785085953912, "loss": 5.4343, "mean_token_accuracy": 0.16333755105733871, "num_tokens": 7487976.0, "step": 2670 }, { "entropy": 5.547738122940063, "epoch": 0.07241962774957698, "grad_norm": 0.953125, "learning_rate": 0.00023422870318389404, "loss": 5.4574, "mean_token_accuracy": 0.15718373358249665, "num_tokens": 7501915.0, "step": 2675 }, { "entropy": 5.518865013122559, "epoch": 0.07255499153976311, "grad_norm": 1.0078125, "learning_rate": 0.0002330706732739468, "loss": 5.4122, "mean_token_accuracy": 0.16701352149248122, "num_tokens": 7514901.0, "step": 2680 }, { "entropy": 5.494342899322509, "epoch": 0.07269035532994923, "grad_norm": 0.859375, "learning_rate": 0.00023191379287767211, "loss": 5.3231, "mean_token_accuracy": 0.16684457957744597, "num_tokens": 7528840.0, "step": 2685 }, { "entropy": 5.474505853652954, "epoch": 0.07282571912013536, "grad_norm": 0.96484375, "learning_rate": 0.0002307580937115305, "loss": 5.3626, "mean_token_accuracy": 0.16770108044147491, "num_tokens": 7543417.0, "step": 2690 }, { "entropy": 5.518067264556885, "epoch": 0.0729610829103215, "grad_norm": 0.91015625, "learning_rate": 0.00022960360745959846, "loss": 5.3038, "mean_token_accuracy": 0.1747143894433975, "num_tokens": 7556468.0, "step": 2695 }, { "entropy": 5.466390228271484, "epoch": 0.07309644670050762, "grad_norm": 0.9296875, "learning_rate": 0.00022845036577269972, "loss": 5.4043, "mean_token_accuracy": 0.16157454401254653, "num_tokens": 7570917.0, "step": 2700 }, { "entropy": 5.378308916091919, "epoch": 0.07323181049069374, "grad_norm": 0.92578125, "learning_rate": 0.00022729840026753777, "loss": 5.2936, "mean_token_accuracy": 0.17287229299545287, "num_tokens": 7585650.0, "step": 2705 }, { "entropy": 5.49935736656189, "epoch": 0.07336717428087987, "grad_norm": 0.90625, "learning_rate": 0.0002261477425258287, "loss": 5.3034, "mean_token_accuracy": 0.16764113306999207, "num_tokens": 7599526.0, "step": 2710 }, { "entropy": 5.5813967227935795, "epoch": 0.07350253807106599, "grad_norm": 1.0390625, "learning_rate": 0.0002249984240934358, "loss": 5.373, "mean_token_accuracy": 0.16482538282871245, "num_tokens": 7612788.0, "step": 2715 }, { "entropy": 5.462430143356324, "epoch": 0.07363790186125212, "grad_norm": 0.95703125, "learning_rate": 0.00022385047647950464, "loss": 5.3176, "mean_token_accuracy": 0.1712317556142807, "num_tokens": 7626130.0, "step": 2720 }, { "entropy": 5.512141418457031, "epoch": 0.07377326565143824, "grad_norm": 0.91796875, "learning_rate": 0.0002227039311555986, "loss": 5.4048, "mean_token_accuracy": 0.16659581065177917, "num_tokens": 7641082.0, "step": 2725 }, { "entropy": 5.458144950866699, "epoch": 0.07390862944162437, "grad_norm": 0.88671875, "learning_rate": 0.0002215588195548372, "loss": 5.279, "mean_token_accuracy": 0.17415901124477387, "num_tokens": 7656106.0, "step": 2730 }, { "entropy": 5.5800501823425295, "epoch": 0.07404399323181049, "grad_norm": 0.984375, "learning_rate": 0.00022041517307103337, "loss": 5.4972, "mean_token_accuracy": 0.1576918765902519, "num_tokens": 7669987.0, "step": 2735 }, { "entropy": 5.4527280807495115, "epoch": 0.07417935702199661, "grad_norm": 1.0546875, "learning_rate": 0.0002192730230578331, "loss": 5.254, "mean_token_accuracy": 0.17619728147983552, "num_tokens": 7684919.0, "step": 2740 }, { "entropy": 5.430622720718384, "epoch": 0.07431472081218274, "grad_norm": 0.96875, "learning_rate": 0.0002181324008278559, "loss": 5.2826, "mean_token_accuracy": 0.17135830372571945, "num_tokens": 7696787.0, "step": 2745 }, { "entropy": 5.481793308258057, "epoch": 0.07445008460236886, "grad_norm": 0.875, "learning_rate": 0.00021699333765183655, "loss": 5.3837, "mean_token_accuracy": 0.16583613455295562, "num_tokens": 7709630.0, "step": 2750 }, { "entropy": 5.461789512634278, "epoch": 0.07458544839255499, "grad_norm": 0.87890625, "learning_rate": 0.0002158558647577673, "loss": 5.343, "mean_token_accuracy": 0.16185439378023148, "num_tokens": 7724842.0, "step": 2755 }, { "entropy": 5.428160953521728, "epoch": 0.07472081218274111, "grad_norm": 1.0390625, "learning_rate": 0.00021472001333004215, "loss": 5.1693, "mean_token_accuracy": 0.17251513451337813, "num_tokens": 7739569.0, "step": 2760 }, { "entropy": 5.427040004730225, "epoch": 0.07485617597292724, "grad_norm": 0.96875, "learning_rate": 0.00021358581450860186, "loss": 5.207, "mean_token_accuracy": 0.17038764506578447, "num_tokens": 7753711.0, "step": 2765 }, { "entropy": 5.465088510513306, "epoch": 0.07499153976311337, "grad_norm": 0.98828125, "learning_rate": 0.0002124532993880799, "loss": 5.3172, "mean_token_accuracy": 0.16422780603170395, "num_tokens": 7768388.0, "step": 2770 }, { "entropy": 5.467406845092773, "epoch": 0.0751269035532995, "grad_norm": 0.890625, "learning_rate": 0.00021132249901695044, "loss": 5.3397, "mean_token_accuracy": 0.1675926923751831, "num_tokens": 7783723.0, "step": 2775 }, { "entropy": 5.510707998275757, "epoch": 0.07526226734348562, "grad_norm": 0.87890625, "learning_rate": 0.00021019344439667705, "loss": 5.3986, "mean_token_accuracy": 0.16413299441337587, "num_tokens": 7799084.0, "step": 2780 }, { "entropy": 5.533675479888916, "epoch": 0.07539763113367175, "grad_norm": 0.84765625, "learning_rate": 0.00020906616648086213, "loss": 5.3946, "mean_token_accuracy": 0.1620550975203514, "num_tokens": 7814644.0, "step": 2785 }, { "entropy": 5.467060947418213, "epoch": 0.07553299492385787, "grad_norm": 0.98828125, "learning_rate": 0.00020794069617439942, "loss": 5.2889, "mean_token_accuracy": 0.17744391411542892, "num_tokens": 7829458.0, "step": 2790 }, { "entropy": 5.52356595993042, "epoch": 0.075668358714044, "grad_norm": 1.0, "learning_rate": 0.00020681706433262593, "loss": 5.3376, "mean_token_accuracy": 0.17330960631370546, "num_tokens": 7844811.0, "step": 2795 }, { "entropy": 5.436047220230103, "epoch": 0.07580372250423012, "grad_norm": 0.98046875, "learning_rate": 0.00020569530176047602, "loss": 5.245, "mean_token_accuracy": 0.17710321843624116, "num_tokens": 7857008.0, "step": 2800 }, { "entropy": 5.451122379302978, "epoch": 0.07593908629441624, "grad_norm": 0.890625, "learning_rate": 0.0002045754392116374, "loss": 5.3629, "mean_token_accuracy": 0.17095964550971984, "num_tokens": 7871976.0, "step": 2805 }, { "entropy": 5.513166713714599, "epoch": 0.07607445008460237, "grad_norm": 1.015625, "learning_rate": 0.00020345750738770757, "loss": 5.2591, "mean_token_accuracy": 0.16977263540029525, "num_tokens": 7885961.0, "step": 2810 }, { "entropy": 5.454839134216309, "epoch": 0.07620981387478849, "grad_norm": 0.828125, "learning_rate": 0.00020234153693735214, "loss": 5.2422, "mean_token_accuracy": 0.18533623367547988, "num_tokens": 7900771.0, "step": 2815 }, { "entropy": 5.501101541519165, "epoch": 0.07634517766497462, "grad_norm": 0.92578125, "learning_rate": 0.0002012275584554647, "loss": 5.3521, "mean_token_accuracy": 0.16500504612922667, "num_tokens": 7914177.0, "step": 2820 }, { "entropy": 5.530455732345581, "epoch": 0.07648054145516074, "grad_norm": 0.97265625, "learning_rate": 0.00020011560248232803, "loss": 5.3338, "mean_token_accuracy": 0.17148594111204146, "num_tokens": 7926304.0, "step": 2825 }, { "entropy": 5.51822681427002, "epoch": 0.07661590524534687, "grad_norm": 0.875, "learning_rate": 0.00019900569950277692, "loss": 5.3958, "mean_token_accuracy": 0.17159417718648912, "num_tokens": 7940643.0, "step": 2830 }, { "entropy": 5.498433589935303, "epoch": 0.07675126903553299, "grad_norm": 0.984375, "learning_rate": 0.00019789787994536228, "loss": 5.3133, "mean_token_accuracy": 0.1724165916442871, "num_tokens": 7953973.0, "step": 2835 }, { "entropy": 5.487789058685303, "epoch": 0.07688663282571911, "grad_norm": 0.96875, "learning_rate": 0.00019679217418151667, "loss": 5.2822, "mean_token_accuracy": 0.175179585814476, "num_tokens": 7968097.0, "step": 2840 }, { "entropy": 5.485777091979981, "epoch": 0.07702199661590524, "grad_norm": 1.0078125, "learning_rate": 0.00019568861252472236, "loss": 5.4075, "mean_token_accuracy": 0.17055005431175232, "num_tokens": 7981377.0, "step": 2845 }, { "entropy": 5.480043888092041, "epoch": 0.07715736040609138, "grad_norm": 0.8984375, "learning_rate": 0.00019458722522967952, "loss": 5.2816, "mean_token_accuracy": 0.17032997757196428, "num_tokens": 7996347.0, "step": 2850 }, { "entropy": 5.440441513061524, "epoch": 0.0772927241962775, "grad_norm": 1.0390625, "learning_rate": 0.00019348804249147723, "loss": 5.2801, "mean_token_accuracy": 0.16763708293437957, "num_tokens": 8009085.0, "step": 2855 }, { "entropy": 5.496013021469116, "epoch": 0.07742808798646363, "grad_norm": 0.9453125, "learning_rate": 0.0001923910944447655, "loss": 5.3578, "mean_token_accuracy": 0.1683908924460411, "num_tokens": 8022972.0, "step": 2860 }, { "entropy": 5.463598155975342, "epoch": 0.07756345177664975, "grad_norm": 1.0, "learning_rate": 0.00019129641116292928, "loss": 5.2517, "mean_token_accuracy": 0.17301710844039916, "num_tokens": 8036721.0, "step": 2865 }, { "entropy": 5.497069406509399, "epoch": 0.07769881556683587, "grad_norm": 0.96484375, "learning_rate": 0.00019020402265726343, "loss": 5.3642, "mean_token_accuracy": 0.17259056568145753, "num_tokens": 8051907.0, "step": 2870 }, { "entropy": 5.599059247970581, "epoch": 0.077834179357022, "grad_norm": 0.83984375, "learning_rate": 0.0001891139588761509, "loss": 5.4207, "mean_token_accuracy": 0.15925686806440353, "num_tokens": 8067550.0, "step": 2875 }, { "entropy": 5.518371534347534, "epoch": 0.07796954314720812, "grad_norm": 0.96875, "learning_rate": 0.00018802624970424076, "loss": 5.3844, "mean_token_accuracy": 0.17436740100383757, "num_tokens": 8081188.0, "step": 2880 }, { "entropy": 5.424393129348755, "epoch": 0.07810490693739425, "grad_norm": 0.98828125, "learning_rate": 0.00018694092496162945, "loss": 5.2155, "mean_token_accuracy": 0.17726275324821472, "num_tokens": 8095991.0, "step": 2885 }, { "entropy": 5.458485412597656, "epoch": 0.07824027072758037, "grad_norm": 0.9765625, "learning_rate": 0.00018585801440304306, "loss": 5.3427, "mean_token_accuracy": 0.16206988841295242, "num_tokens": 8110424.0, "step": 2890 }, { "entropy": 5.579003047943115, "epoch": 0.0783756345177665, "grad_norm": 0.80859375, "learning_rate": 0.00018477754771702165, "loss": 5.4071, "mean_token_accuracy": 0.16417887508869172, "num_tokens": 8127483.0, "step": 2895 }, { "entropy": 5.4810065746307375, "epoch": 0.07851099830795262, "grad_norm": 0.8671875, "learning_rate": 0.00018369955452510506, "loss": 5.2518, "mean_token_accuracy": 0.16933856457471846, "num_tokens": 8144871.0, "step": 2900 }, { "entropy": 5.363333082199096, "epoch": 0.07864636209813874, "grad_norm": 1.03125, "learning_rate": 0.0001826240643810212, "loss": 5.2339, "mean_token_accuracy": 0.18072881251573564, "num_tokens": 8159166.0, "step": 2905 }, { "entropy": 5.459006214141846, "epoch": 0.07878172588832487, "grad_norm": 0.96484375, "learning_rate": 0.0001815511067698758, "loss": 5.3428, "mean_token_accuracy": 0.1761472001671791, "num_tokens": 8173679.0, "step": 2910 }, { "entropy": 5.487945318222046, "epoch": 0.078917089678511, "grad_norm": 0.84375, "learning_rate": 0.0001804807111073436, "loss": 5.3272, "mean_token_accuracy": 0.1742970734834671, "num_tokens": 8189905.0, "step": 2915 }, { "entropy": 5.556151533126831, "epoch": 0.07905245346869712, "grad_norm": 0.89453125, "learning_rate": 0.0001794129067388625, "loss": 5.3454, "mean_token_accuracy": 0.16954322308301925, "num_tokens": 8204091.0, "step": 2920 }, { "entropy": 5.4311378479003904, "epoch": 0.07918781725888324, "grad_norm": 0.94140625, "learning_rate": 0.00017834772293882868, "loss": 5.271, "mean_token_accuracy": 0.1795088216662407, "num_tokens": 8217298.0, "step": 2925 }, { "entropy": 5.476504468917847, "epoch": 0.07932318104906938, "grad_norm": 1.0078125, "learning_rate": 0.000177285188909794, "loss": 5.3071, "mean_token_accuracy": 0.1695019334554672, "num_tokens": 8231131.0, "step": 2930 }, { "entropy": 5.490973567962646, "epoch": 0.0794585448392555, "grad_norm": 1.0859375, "learning_rate": 0.0001762253337816656, "loss": 5.3456, "mean_token_accuracy": 0.1681083619594574, "num_tokens": 8245409.0, "step": 2935 }, { "entropy": 5.53462929725647, "epoch": 0.07959390862944163, "grad_norm": 0.9765625, "learning_rate": 0.00017516818661090738, "loss": 5.3796, "mean_token_accuracy": 0.16535060852766037, "num_tokens": 8259802.0, "step": 2940 }, { "entropy": 5.458170461654663, "epoch": 0.07972927241962775, "grad_norm": 0.90625, "learning_rate": 0.0001741137763797428, "loss": 5.2636, "mean_token_accuracy": 0.1764928162097931, "num_tokens": 8273833.0, "step": 2945 }, { "entropy": 5.407339096069336, "epoch": 0.07986463620981388, "grad_norm": 1.0234375, "learning_rate": 0.00017306213199536115, "loss": 5.2234, "mean_token_accuracy": 0.176323065161705, "num_tokens": 8287181.0, "step": 2950 }, { "entropy": 5.467682838439941, "epoch": 0.08, "grad_norm": 0.94921875, "learning_rate": 0.0001720132822891243, "loss": 5.2588, "mean_token_accuracy": 0.16995817869901658, "num_tokens": 8300432.0, "step": 2955 }, { "entropy": 5.419669437408447, "epoch": 0.08013536379018613, "grad_norm": 0.9921875, "learning_rate": 0.0001709672560157769, "loss": 5.2418, "mean_token_accuracy": 0.18255811035633088, "num_tokens": 8313873.0, "step": 2960 }, { "entropy": 5.462170553207398, "epoch": 0.08027072758037225, "grad_norm": 0.97265625, "learning_rate": 0.00016992408185265758, "loss": 5.3659, "mean_token_accuracy": 0.16571080684661865, "num_tokens": 8329781.0, "step": 2965 }, { "entropy": 5.4735033988952635, "epoch": 0.08040609137055837, "grad_norm": 0.86328125, "learning_rate": 0.00016888378839891298, "loss": 5.3732, "mean_token_accuracy": 0.16627077162265777, "num_tokens": 8346691.0, "step": 2970 }, { "entropy": 5.496302556991577, "epoch": 0.0805414551607445, "grad_norm": 0.89453125, "learning_rate": 0.0001678464041747137, "loss": 5.323, "mean_token_accuracy": 0.1704434260725975, "num_tokens": 8361779.0, "step": 2975 }, { "entropy": 5.521384286880493, "epoch": 0.08067681895093062, "grad_norm": 1.015625, "learning_rate": 0.00016681195762047223, "loss": 5.3293, "mean_token_accuracy": 0.16714472323656082, "num_tokens": 8376285.0, "step": 2980 }, { "entropy": 5.463702249526977, "epoch": 0.08081218274111675, "grad_norm": 0.96484375, "learning_rate": 0.00016578047709606337, "loss": 5.2956, "mean_token_accuracy": 0.1701137751340866, "num_tokens": 8389645.0, "step": 2985 }, { "entropy": 5.453202438354492, "epoch": 0.08094754653130287, "grad_norm": 1.0, "learning_rate": 0.00016475199088004678, "loss": 5.2889, "mean_token_accuracy": 0.17482130378484725, "num_tokens": 8401728.0, "step": 2990 }, { "entropy": 5.434600925445556, "epoch": 0.081082910321489, "grad_norm": 0.9921875, "learning_rate": 0.00016372652716889163, "loss": 5.2305, "mean_token_accuracy": 0.1778161495923996, "num_tokens": 8416862.0, "step": 2995 }, { "entropy": 5.486732912063599, "epoch": 0.08121827411167512, "grad_norm": 1.0, "learning_rate": 0.0001627041140762035, "loss": 5.3317, "mean_token_accuracy": 0.17365986555814744, "num_tokens": 8430674.0, "step": 3000 }, { "entropy": 5.424360466003418, "epoch": 0.08135363790186126, "grad_norm": 0.9609375, "learning_rate": 0.00016168477963195382, "loss": 5.2288, "mean_token_accuracy": 0.1797449544072151, "num_tokens": 8443736.0, "step": 3005 }, { "entropy": 5.399167108535766, "epoch": 0.08148900169204738, "grad_norm": 0.8359375, "learning_rate": 0.0001606685517817114, "loss": 5.2675, "mean_token_accuracy": 0.17130256146192552, "num_tokens": 8458551.0, "step": 3010 }, { "entropy": 5.441774988174439, "epoch": 0.08162436548223351, "grad_norm": 0.84375, "learning_rate": 0.00015965545838587592, "loss": 5.2618, "mean_token_accuracy": 0.16794567108154296, "num_tokens": 8473802.0, "step": 3015 }, { "entropy": 5.47581901550293, "epoch": 0.08175972927241963, "grad_norm": 0.87109375, "learning_rate": 0.00015864552721891467, "loss": 5.3247, "mean_token_accuracy": 0.16786827743053437, "num_tokens": 8488927.0, "step": 3020 }, { "entropy": 5.440992641448974, "epoch": 0.08189509306260576, "grad_norm": 0.9453125, "learning_rate": 0.00015763878596860076, "loss": 5.1973, "mean_token_accuracy": 0.16612706929445267, "num_tokens": 8501604.0, "step": 3025 }, { "entropy": 5.433175420761108, "epoch": 0.08203045685279188, "grad_norm": 1.1015625, "learning_rate": 0.00015663526223525412, "loss": 5.2937, "mean_token_accuracy": 0.1712185561656952, "num_tokens": 8514228.0, "step": 3030 }, { "entropy": 5.443940877914429, "epoch": 0.082165820642978, "grad_norm": 0.9921875, "learning_rate": 0.0001556349835309848, "loss": 5.2669, "mean_token_accuracy": 0.16782645732164383, "num_tokens": 8528327.0, "step": 3035 }, { "entropy": 5.410441637039185, "epoch": 0.08230118443316413, "grad_norm": 0.99609375, "learning_rate": 0.0001546379772789389, "loss": 5.2322, "mean_token_accuracy": 0.17801001518964768, "num_tokens": 8542672.0, "step": 3040 }, { "entropy": 5.466415166854858, "epoch": 0.08243654822335025, "grad_norm": 0.91796875, "learning_rate": 0.00015364427081254622, "loss": 5.2928, "mean_token_accuracy": 0.16680212169885636, "num_tokens": 8556950.0, "step": 3045 }, { "entropy": 5.480651140213013, "epoch": 0.08257191201353638, "grad_norm": 1.0625, "learning_rate": 0.00015265389137477165, "loss": 5.3176, "mean_token_accuracy": 0.16717551946640014, "num_tokens": 8568976.0, "step": 3050 }, { "entropy": 5.471415328979492, "epoch": 0.0827072758037225, "grad_norm": 0.99609375, "learning_rate": 0.00015166686611736786, "loss": 5.279, "mean_token_accuracy": 0.16722955107688903, "num_tokens": 8582972.0, "step": 3055 }, { "entropy": 5.384100437164307, "epoch": 0.08284263959390863, "grad_norm": 0.96484375, "learning_rate": 0.00015068322210013064, "loss": 5.1654, "mean_token_accuracy": 0.18055080026388168, "num_tokens": 8595513.0, "step": 3060 }, { "entropy": 5.395313358306884, "epoch": 0.08297800338409475, "grad_norm": 1.0234375, "learning_rate": 0.0001497029862901578, "loss": 5.3037, "mean_token_accuracy": 0.17951921373605728, "num_tokens": 8608918.0, "step": 3065 }, { "entropy": 5.4258056640625, "epoch": 0.08311336717428087, "grad_norm": 0.9296875, "learning_rate": 0.00014872618556110905, "loss": 5.205, "mean_token_accuracy": 0.17827895432710647, "num_tokens": 8622730.0, "step": 3070 }, { "entropy": 5.463824796676636, "epoch": 0.083248730964467, "grad_norm": 1.015625, "learning_rate": 0.00014775284669246992, "loss": 5.2471, "mean_token_accuracy": 0.17934898436069488, "num_tokens": 8635412.0, "step": 3075 }, { "entropy": 5.453006887435913, "epoch": 0.08338409475465312, "grad_norm": 0.9609375, "learning_rate": 0.00014678299636881716, "loss": 5.3157, "mean_token_accuracy": 0.17817512452602385, "num_tokens": 8648105.0, "step": 3080 }, { "entropy": 5.489534902572632, "epoch": 0.08351945854483926, "grad_norm": 1.09375, "learning_rate": 0.0001458166611790873, "loss": 5.3456, "mean_token_accuracy": 0.16926711797714233, "num_tokens": 8660690.0, "step": 3085 }, { "entropy": 5.469047117233276, "epoch": 0.08365482233502539, "grad_norm": 0.93359375, "learning_rate": 0.00014485386761584773, "loss": 5.226, "mean_token_accuracy": 0.17681361138820648, "num_tokens": 8674585.0, "step": 3090 }, { "entropy": 5.430918836593628, "epoch": 0.08379018612521151, "grad_norm": 0.96875, "learning_rate": 0.00014389464207457042, "loss": 5.2677, "mean_token_accuracy": 0.17809636294841766, "num_tokens": 8689490.0, "step": 3095 }, { "entropy": 5.406502294540405, "epoch": 0.08392554991539763, "grad_norm": 0.890625, "learning_rate": 0.00014293901085290795, "loss": 5.2227, "mean_token_accuracy": 0.17613164633512496, "num_tokens": 8704597.0, "step": 3100 }, { "entropy": 5.466963195800782, "epoch": 0.08406091370558376, "grad_norm": 0.92578125, "learning_rate": 0.00014198700014997307, "loss": 5.2596, "mean_token_accuracy": 0.17903373539447784, "num_tokens": 8718430.0, "step": 3105 }, { "entropy": 5.424066495895386, "epoch": 0.08419627749576988, "grad_norm": 1.0078125, "learning_rate": 0.00014103863606562016, "loss": 5.2084, "mean_token_accuracy": 0.17104987502098085, "num_tokens": 8733983.0, "step": 3110 }, { "entropy": 5.4510743618011475, "epoch": 0.08433164128595601, "grad_norm": 0.9296875, "learning_rate": 0.00014009394459972964, "loss": 5.2121, "mean_token_accuracy": 0.177804896235466, "num_tokens": 8747359.0, "step": 3115 }, { "entropy": 5.4852707862854, "epoch": 0.08446700507614213, "grad_norm": 0.96875, "learning_rate": 0.00013915295165149513, "loss": 5.2506, "mean_token_accuracy": 0.17922114282846452, "num_tokens": 8759625.0, "step": 3120 }, { "entropy": 5.454599332809448, "epoch": 0.08460236886632826, "grad_norm": 1.1015625, "learning_rate": 0.00013821568301871384, "loss": 5.2401, "mean_token_accuracy": 0.17472292929887773, "num_tokens": 8772700.0, "step": 3125 }, { "entropy": 5.432861709594727, "epoch": 0.08473773265651438, "grad_norm": 0.953125, "learning_rate": 0.00013728216439707862, "loss": 5.2968, "mean_token_accuracy": 0.17653030455112456, "num_tokens": 8784952.0, "step": 3130 }, { "entropy": 5.500757789611816, "epoch": 0.0848730964467005, "grad_norm": 0.92578125, "learning_rate": 0.00013635242137947419, "loss": 5.3983, "mean_token_accuracy": 0.16601879745721818, "num_tokens": 8798983.0, "step": 3135 }, { "entropy": 5.466593456268311, "epoch": 0.08500846023688663, "grad_norm": 0.8671875, "learning_rate": 0.00013542647945527498, "loss": 5.2634, "mean_token_accuracy": 0.178488627076149, "num_tokens": 8812987.0, "step": 3140 }, { "entropy": 5.500957775115967, "epoch": 0.08514382402707275, "grad_norm": 0.8984375, "learning_rate": 0.0001345043640096465, "loss": 5.377, "mean_token_accuracy": 0.17290503680706024, "num_tokens": 8827359.0, "step": 3145 }, { "entropy": 5.442121982574463, "epoch": 0.08527918781725888, "grad_norm": 0.91796875, "learning_rate": 0.00013358610032284957, "loss": 5.1985, "mean_token_accuracy": 0.18115333914756776, "num_tokens": 8841025.0, "step": 3150 }, { "entropy": 5.534852075576782, "epoch": 0.085414551607445, "grad_norm": 1.0, "learning_rate": 0.000132671713569547, "loss": 5.3334, "mean_token_accuracy": 0.16925936341285705, "num_tokens": 8855062.0, "step": 3155 }, { "entropy": 5.458619165420532, "epoch": 0.08554991539763114, "grad_norm": 0.96875, "learning_rate": 0.0001317612288181136, "loss": 5.2077, "mean_token_accuracy": 0.17451809644699096, "num_tokens": 8869516.0, "step": 3160 }, { "entropy": 5.454307651519775, "epoch": 0.08568527918781726, "grad_norm": 0.875, "learning_rate": 0.00013085467102994864, "loss": 5.3441, "mean_token_accuracy": 0.1724272206425667, "num_tokens": 8883758.0, "step": 3165 }, { "entropy": 5.4530314922332765, "epoch": 0.08582064297800339, "grad_norm": 1.03125, "learning_rate": 0.00012995206505879198, "loss": 5.2512, "mean_token_accuracy": 0.17589752674102782, "num_tokens": 8898484.0, "step": 3170 }, { "entropy": 5.444612312316894, "epoch": 0.08595600676818951, "grad_norm": 0.88671875, "learning_rate": 0.0001290534356500421, "loss": 5.2609, "mean_token_accuracy": 0.1797889545559883, "num_tokens": 8912852.0, "step": 3175 }, { "entropy": 5.440249586105347, "epoch": 0.08609137055837564, "grad_norm": 0.94921875, "learning_rate": 0.00012815880744007827, "loss": 5.2379, "mean_token_accuracy": 0.17183031737804413, "num_tokens": 8927714.0, "step": 3180 }, { "entropy": 5.478732442855835, "epoch": 0.08622673434856176, "grad_norm": 1.0390625, "learning_rate": 0.00012726820495558483, "loss": 5.2562, "mean_token_accuracy": 0.17183429449796678, "num_tokens": 8941572.0, "step": 3185 }, { "entropy": 5.467626094818115, "epoch": 0.08636209813874789, "grad_norm": 1.078125, "learning_rate": 0.00012638165261287868, "loss": 5.2982, "mean_token_accuracy": 0.17230871319770813, "num_tokens": 8956091.0, "step": 3190 }, { "entropy": 5.453297138214111, "epoch": 0.08649746192893401, "grad_norm": 0.91796875, "learning_rate": 0.0001254991747172402, "loss": 5.2286, "mean_token_accuracy": 0.1784089371562004, "num_tokens": 8970743.0, "step": 3195 }, { "entropy": 5.512088012695313, "epoch": 0.08663282571912014, "grad_norm": 0.90234375, "learning_rate": 0.00012462079546224662, "loss": 5.3266, "mean_token_accuracy": 0.16639686971902848, "num_tokens": 8986444.0, "step": 3200 }, { "entropy": 5.445282125473023, "epoch": 0.08676818950930626, "grad_norm": 0.90234375, "learning_rate": 0.00012374653892910896, "loss": 5.2591, "mean_token_accuracy": 0.17210991233587264, "num_tokens": 9001382.0, "step": 3205 }, { "entropy": 5.500101709365845, "epoch": 0.08690355329949238, "grad_norm": 1.1328125, "learning_rate": 0.00012287642908601166, "loss": 5.3364, "mean_token_accuracy": 0.17057666778564454, "num_tokens": 9013719.0, "step": 3210 }, { "entropy": 5.416972064971924, "epoch": 0.08703891708967851, "grad_norm": 1.0234375, "learning_rate": 0.00012201048978745569, "loss": 5.2549, "mean_token_accuracy": 0.1811564639210701, "num_tokens": 9027790.0, "step": 3215 }, { "entropy": 5.453947591781616, "epoch": 0.08717428087986463, "grad_norm": 0.98828125, "learning_rate": 0.00012114874477360427, "loss": 5.242, "mean_token_accuracy": 0.17207376956939696, "num_tokens": 9041632.0, "step": 3220 }, { "entropy": 5.452928781509399, "epoch": 0.08730964467005076, "grad_norm": 0.9296875, "learning_rate": 0.00012029121766963236, "loss": 5.3083, "mean_token_accuracy": 0.16890519112348557, "num_tokens": 9055562.0, "step": 3225 }, { "entropy": 5.4277173519134525, "epoch": 0.08744500846023688, "grad_norm": 0.99609375, "learning_rate": 0.00011943793198507858, "loss": 5.1347, "mean_token_accuracy": 0.181647826731205, "num_tokens": 9068872.0, "step": 3230 }, { "entropy": 5.400438642501831, "epoch": 0.087580372250423, "grad_norm": 0.828125, "learning_rate": 0.00011858891111320104, "loss": 5.1768, "mean_token_accuracy": 0.17398682236671448, "num_tokens": 9083206.0, "step": 3235 }, { "entropy": 5.3835385799407955, "epoch": 0.08771573604060914, "grad_norm": 0.96875, "learning_rate": 0.0001177441783303359, "loss": 5.1512, "mean_token_accuracy": 0.1808776617050171, "num_tokens": 9097034.0, "step": 3240 }, { "entropy": 5.417808389663696, "epoch": 0.08785109983079527, "grad_norm": 1.1796875, "learning_rate": 0.00011690375679525896, "loss": 5.2195, "mean_token_accuracy": 0.17991944402456284, "num_tokens": 9110326.0, "step": 3245 }, { "entropy": 5.3836017608642575, "epoch": 0.08798646362098139, "grad_norm": 0.8984375, "learning_rate": 0.00011606766954855124, "loss": 5.1837, "mean_token_accuracy": 0.17912977635860444, "num_tokens": 9124025.0, "step": 3250 }, { "entropy": 5.433529281616211, "epoch": 0.08812182741116752, "grad_norm": 0.93359375, "learning_rate": 0.00011523593951196702, "loss": 5.1581, "mean_token_accuracy": 0.1803836077451706, "num_tokens": 9137357.0, "step": 3255 }, { "entropy": 5.4744508266448975, "epoch": 0.08825719120135364, "grad_norm": 0.96484375, "learning_rate": 0.00011440858948780523, "loss": 5.3428, "mean_token_accuracy": 0.16637975126504898, "num_tokens": 9152364.0, "step": 3260 }, { "entropy": 5.516168022155762, "epoch": 0.08839255499153977, "grad_norm": 0.8515625, "learning_rate": 0.00011358564215828484, "loss": 5.32, "mean_token_accuracy": 0.17344362288713455, "num_tokens": 9167182.0, "step": 3265 }, { "entropy": 5.532025480270386, "epoch": 0.08852791878172589, "grad_norm": 0.9296875, "learning_rate": 0.00011276712008492254, "loss": 5.3615, "mean_token_accuracy": 0.1667541205883026, "num_tokens": 9181427.0, "step": 3270 }, { "entropy": 5.429120492935181, "epoch": 0.08866328257191201, "grad_norm": 0.92578125, "learning_rate": 0.00011195304570791451, "loss": 5.1506, "mean_token_accuracy": 0.18498873859643936, "num_tokens": 9194525.0, "step": 3275 }, { "entropy": 5.465721178054809, "epoch": 0.08879864636209814, "grad_norm": 0.9296875, "learning_rate": 0.00011114344134552094, "loss": 5.2907, "mean_token_accuracy": 0.1747796967625618, "num_tokens": 9209100.0, "step": 3280 }, { "entropy": 5.464006948471069, "epoch": 0.08893401015228426, "grad_norm": 0.90625, "learning_rate": 0.0001103383291934545, "loss": 5.2596, "mean_token_accuracy": 0.17388538867235184, "num_tokens": 9222821.0, "step": 3285 }, { "entropy": 5.484611940383911, "epoch": 0.08906937394247039, "grad_norm": 1.0078125, "learning_rate": 0.00010953773132427141, "loss": 5.2351, "mean_token_accuracy": 0.17779595404863358, "num_tokens": 9234861.0, "step": 3290 }, { "entropy": 5.528689193725586, "epoch": 0.08920473773265651, "grad_norm": 0.91796875, "learning_rate": 0.00010874166968676677, "loss": 5.3835, "mean_token_accuracy": 0.16561046987771988, "num_tokens": 9249083.0, "step": 3295 }, { "entropy": 5.44285945892334, "epoch": 0.08934010152284264, "grad_norm": 0.91015625, "learning_rate": 0.00010795016610537251, "loss": 5.2817, "mean_token_accuracy": 0.16983783692121507, "num_tokens": 9264952.0, "step": 3300 }, { "entropy": 5.4330676078796385, "epoch": 0.08947546531302876, "grad_norm": 0.921875, "learning_rate": 0.00010716324227955904, "loss": 5.216, "mean_token_accuracy": 0.17587786316871643, "num_tokens": 9280403.0, "step": 3305 }, { "entropy": 5.457645463943481, "epoch": 0.08961082910321488, "grad_norm": 0.859375, "learning_rate": 0.0001063809197832406, "loss": 5.2906, "mean_token_accuracy": 0.17256036549806594, "num_tokens": 9295280.0, "step": 3310 }, { "entropy": 5.43573489189148, "epoch": 0.08974619289340101, "grad_norm": 1.0703125, "learning_rate": 0.00010560322006418368, "loss": 5.2939, "mean_token_accuracy": 0.17864404022693633, "num_tokens": 9307588.0, "step": 3315 }, { "entropy": 5.478760576248169, "epoch": 0.08988155668358715, "grad_norm": 0.9609375, "learning_rate": 0.00010483016444341887, "loss": 5.2257, "mean_token_accuracy": 0.17621223032474517, "num_tokens": 9323057.0, "step": 3320 }, { "entropy": 5.40908203125, "epoch": 0.09001692047377327, "grad_norm": 0.9296875, "learning_rate": 0.00010406177411465654, "loss": 5.1673, "mean_token_accuracy": 0.17435249239206313, "num_tokens": 9337031.0, "step": 3325 }, { "entropy": 5.4669163703918455, "epoch": 0.0901522842639594, "grad_norm": 1.03125, "learning_rate": 0.00010329807014370562, "loss": 5.2439, "mean_token_accuracy": 0.17599764615297317, "num_tokens": 9351241.0, "step": 3330 }, { "entropy": 5.4449389457702635, "epoch": 0.09028764805414552, "grad_norm": 0.94140625, "learning_rate": 0.00010253907346789632, "loss": 5.2455, "mean_token_accuracy": 0.1750466227531433, "num_tokens": 9365191.0, "step": 3335 }, { "entropy": 5.429995393753051, "epoch": 0.09042301184433164, "grad_norm": 0.90234375, "learning_rate": 0.00010178480489550596, "loss": 5.2899, "mean_token_accuracy": 0.1745767444372177, "num_tokens": 9380472.0, "step": 3340 }, { "entropy": 5.522990751266479, "epoch": 0.09055837563451777, "grad_norm": 0.87109375, "learning_rate": 0.00010103528510518836, "loss": 5.3416, "mean_token_accuracy": 0.16517020910978317, "num_tokens": 9397192.0, "step": 3345 }, { "entropy": 5.44988055229187, "epoch": 0.09069373942470389, "grad_norm": 1.0546875, "learning_rate": 0.0001002905346454073, "loss": 5.2139, "mean_token_accuracy": 0.1854239895939827, "num_tokens": 9408900.0, "step": 3350 }, { "entropy": 5.466029644012451, "epoch": 0.09082910321489002, "grad_norm": 0.88671875, "learning_rate": 9.955057393387285e-05, "loss": 5.2705, "mean_token_accuracy": 0.177003213763237, "num_tokens": 9423048.0, "step": 3355 }, { "entropy": 5.428363418579101, "epoch": 0.09096446700507614, "grad_norm": 0.953125, "learning_rate": 9.88154232569816e-05, "loss": 5.2474, "mean_token_accuracy": 0.17786458134651184, "num_tokens": 9435378.0, "step": 3360 }, { "entropy": 5.495788192749023, "epoch": 0.09109983079526227, "grad_norm": 0.9765625, "learning_rate": 9.808510276926075e-05, "loss": 5.2937, "mean_token_accuracy": 0.17255342304706572, "num_tokens": 9449534.0, "step": 3365 }, { "entropy": 5.452598905563354, "epoch": 0.09123519458544839, "grad_norm": 0.9921875, "learning_rate": 9.735963249281549e-05, "loss": 5.2001, "mean_token_accuracy": 0.17846726328134538, "num_tokens": 9462970.0, "step": 3370 }, { "entropy": 5.47204852104187, "epoch": 0.09137055837563451, "grad_norm": 0.953125, "learning_rate": 9.663903231677974e-05, "loss": 5.2927, "mean_token_accuracy": 0.1703501284122467, "num_tokens": 9475539.0, "step": 3375 }, { "entropy": 5.42021541595459, "epoch": 0.09150592216582064, "grad_norm": 1.0625, "learning_rate": 9.592332199677145e-05, "loss": 5.2138, "mean_token_accuracy": 0.18433151245117188, "num_tokens": 9490219.0, "step": 3380 }, { "entropy": 5.477157497406006, "epoch": 0.09164128595600676, "grad_norm": 0.99609375, "learning_rate": 9.521252115435061e-05, "loss": 5.2509, "mean_token_accuracy": 0.17215492874383925, "num_tokens": 9503304.0, "step": 3385 }, { "entropy": 5.442840576171875, "epoch": 0.09177664974619289, "grad_norm": 1.2265625, "learning_rate": 9.450664927648126e-05, "loss": 5.2477, "mean_token_accuracy": 0.17944649904966353, "num_tokens": 9514721.0, "step": 3390 }, { "entropy": 5.427846240997314, "epoch": 0.09191201353637903, "grad_norm": 0.98828125, "learning_rate": 9.380572571499758e-05, "loss": 5.2161, "mean_token_accuracy": 0.17255792617797852, "num_tokens": 9529360.0, "step": 3395 }, { "entropy": 5.546936416625977, "epoch": 0.09204737732656515, "grad_norm": 0.8359375, "learning_rate": 9.310976968607307e-05, "loss": 5.2605, "mean_token_accuracy": 0.1750967487692833, "num_tokens": 9543512.0, "step": 3400 }, { "entropy": 5.449555110931397, "epoch": 0.09218274111675127, "grad_norm": 1.1015625, "learning_rate": 9.241880026969381e-05, "loss": 5.2019, "mean_token_accuracy": 0.1844763919711113, "num_tokens": 9556305.0, "step": 3405 }, { "entropy": 5.465081453323364, "epoch": 0.0923181049069374, "grad_norm": 0.96484375, "learning_rate": 9.173283640913537e-05, "loss": 5.2264, "mean_token_accuracy": 0.17751589566469192, "num_tokens": 9569304.0, "step": 3410 }, { "entropy": 5.456621789932251, "epoch": 0.09245346869712352, "grad_norm": 1.0, "learning_rate": 9.10518969104436e-05, "loss": 5.2101, "mean_token_accuracy": 0.18279945403337478, "num_tokens": 9582470.0, "step": 3415 }, { "entropy": 5.4090142250061035, "epoch": 0.09258883248730965, "grad_norm": 0.99609375, "learning_rate": 9.037600044191868e-05, "loss": 5.2236, "mean_token_accuracy": 0.17098118364810944, "num_tokens": 9595990.0, "step": 3420 }, { "entropy": 5.401455307006836, "epoch": 0.09272419627749577, "grad_norm": 0.9296875, "learning_rate": 8.970516553360383e-05, "loss": 5.1762, "mean_token_accuracy": 0.17664928287267684, "num_tokens": 9610814.0, "step": 3425 }, { "entropy": 5.409914445877075, "epoch": 0.0928595600676819, "grad_norm": 0.95703125, "learning_rate": 8.903941057677692e-05, "loss": 5.1037, "mean_token_accuracy": 0.17462638914585113, "num_tokens": 9625206.0, "step": 3430 }, { "entropy": 5.535821390151978, "epoch": 0.09299492385786802, "grad_norm": 1.0, "learning_rate": 8.837875382344635e-05, "loss": 5.3614, "mean_token_accuracy": 0.17211337238550187, "num_tokens": 9641154.0, "step": 3435 }, { "entropy": 5.494901990890503, "epoch": 0.09313028764805414, "grad_norm": 0.99609375, "learning_rate": 8.772321338585076e-05, "loss": 5.3006, "mean_token_accuracy": 0.1777035564184189, "num_tokens": 9655099.0, "step": 3440 }, { "entropy": 5.447452878952026, "epoch": 0.09326565143824027, "grad_norm": 1.0, "learning_rate": 8.707280723596242e-05, "loss": 5.2329, "mean_token_accuracy": 0.179787740111351, "num_tokens": 9668329.0, "step": 3445 }, { "entropy": 5.473836851119995, "epoch": 0.09340101522842639, "grad_norm": 0.94140625, "learning_rate": 8.64275532049944e-05, "loss": 5.2943, "mean_token_accuracy": 0.1728879228234291, "num_tokens": 9681972.0, "step": 3450 }, { "entropy": 5.432269954681397, "epoch": 0.09353637901861252, "grad_norm": 0.98046875, "learning_rate": 8.578746898291198e-05, "loss": 5.2292, "mean_token_accuracy": 0.18144699335098266, "num_tokens": 9695989.0, "step": 3455 }, { "entropy": 5.46670126914978, "epoch": 0.09367174280879864, "grad_norm": 0.8203125, "learning_rate": 8.515257211794742e-05, "loss": 5.2274, "mean_token_accuracy": 0.1761029839515686, "num_tokens": 9710769.0, "step": 3460 }, { "entropy": 5.407367706298828, "epoch": 0.09380710659898477, "grad_norm": 0.953125, "learning_rate": 8.452288001611896e-05, "loss": 5.1674, "mean_token_accuracy": 0.1863648325204849, "num_tokens": 9724251.0, "step": 3465 }, { "entropy": 5.461634397506714, "epoch": 0.09394247038917089, "grad_norm": 0.890625, "learning_rate": 8.389840994075379e-05, "loss": 5.2588, "mean_token_accuracy": 0.17784644812345504, "num_tokens": 9738229.0, "step": 3470 }, { "entropy": 5.495303535461426, "epoch": 0.09407783417935703, "grad_norm": 0.82421875, "learning_rate": 8.327917901201435e-05, "loss": 5.3132, "mean_token_accuracy": 0.17286971658468248, "num_tokens": 9752971.0, "step": 3475 }, { "entropy": 5.416939926147461, "epoch": 0.09421319796954315, "grad_norm": 0.89453125, "learning_rate": 8.266520420642931e-05, "loss": 5.1684, "mean_token_accuracy": 0.18302588760852814, "num_tokens": 9766579.0, "step": 3480 }, { "entropy": 5.4572412967681885, "epoch": 0.09434856175972928, "grad_norm": 0.984375, "learning_rate": 8.205650235642828e-05, "loss": 5.2161, "mean_token_accuracy": 0.18117392659187317, "num_tokens": 9778847.0, "step": 3485 }, { "entropy": 5.548181772232056, "epoch": 0.0944839255499154, "grad_norm": 0.83984375, "learning_rate": 8.145309014987978e-05, "loss": 5.3412, "mean_token_accuracy": 0.16816486120224, "num_tokens": 9794524.0, "step": 3490 }, { "entropy": 5.509027767181396, "epoch": 0.09461928934010153, "grad_norm": 0.96875, "learning_rate": 8.085498412963437e-05, "loss": 5.2257, "mean_token_accuracy": 0.17833439260721207, "num_tokens": 9808447.0, "step": 3495 }, { "entropy": 5.419754076004028, "epoch": 0.09475465313028765, "grad_norm": 1.0078125, "learning_rate": 8.026220069307078e-05, "loss": 5.2201, "mean_token_accuracy": 0.17646121084690095, "num_tokens": 9822690.0, "step": 3500 }, { "entropy": 5.4755147933959964, "epoch": 0.09489001692047377, "grad_norm": 0.88671875, "learning_rate": 7.967475609164621e-05, "loss": 5.2813, "mean_token_accuracy": 0.17337468415498733, "num_tokens": 9838460.0, "step": 3505 }, { "entropy": 5.434066534042358, "epoch": 0.0950253807106599, "grad_norm": 0.9375, "learning_rate": 7.909266643045124e-05, "loss": 5.218, "mean_token_accuracy": 0.17817495465278627, "num_tokens": 9852301.0, "step": 3510 }, { "entropy": 5.470828866958618, "epoch": 0.09516074450084602, "grad_norm": 0.99609375, "learning_rate": 7.851594766776802e-05, "loss": 5.2477, "mean_token_accuracy": 0.1855323702096939, "num_tokens": 9867281.0, "step": 3515 }, { "entropy": 5.4018556594848635, "epoch": 0.09529610829103215, "grad_norm": 0.87890625, "learning_rate": 7.794461561463265e-05, "loss": 5.1356, "mean_token_accuracy": 0.1820910558104515, "num_tokens": 9881523.0, "step": 3520 }, { "entropy": 5.3998528003692625, "epoch": 0.09543147208121827, "grad_norm": 1.046875, "learning_rate": 7.7378685934402e-05, "loss": 5.1708, "mean_token_accuracy": 0.18137171864509583, "num_tokens": 9894865.0, "step": 3525 }, { "entropy": 5.467069101333618, "epoch": 0.0955668358714044, "grad_norm": 0.96484375, "learning_rate": 7.68181741423242e-05, "loss": 5.2332, "mean_token_accuracy": 0.1749477729201317, "num_tokens": 9910598.0, "step": 3530 }, { "entropy": 5.46595401763916, "epoch": 0.09570219966159052, "grad_norm": 1.0625, "learning_rate": 7.626309560511313e-05, "loss": 5.3158, "mean_token_accuracy": 0.1718402922153473, "num_tokens": 9924811.0, "step": 3535 }, { "entropy": 5.37374210357666, "epoch": 0.09583756345177664, "grad_norm": 0.921875, "learning_rate": 7.571346554052724e-05, "loss": 5.1803, "mean_token_accuracy": 0.1788783609867096, "num_tokens": 9939839.0, "step": 3540 }, { "entropy": 5.477428960800171, "epoch": 0.09597292724196277, "grad_norm": 0.9453125, "learning_rate": 7.516929901695249e-05, "loss": 5.2214, "mean_token_accuracy": 0.18248335421085357, "num_tokens": 9952556.0, "step": 3545 }, { "entropy": 5.493585300445557, "epoch": 0.09610829103214891, "grad_norm": 0.9140625, "learning_rate": 7.463061095298893e-05, "loss": 5.2934, "mean_token_accuracy": 0.17488276362419128, "num_tokens": 9968060.0, "step": 3550 }, { "entropy": 5.420634984970093, "epoch": 0.09624365482233503, "grad_norm": 1.0078125, "learning_rate": 7.409741611704198e-05, "loss": 5.1702, "mean_token_accuracy": 0.18496295660734177, "num_tokens": 9982607.0, "step": 3555 }, { "entropy": 5.412036561965943, "epoch": 0.09637901861252116, "grad_norm": 1.0078125, "learning_rate": 7.35697291269174e-05, "loss": 5.1884, "mean_token_accuracy": 0.1730993464589119, "num_tokens": 9997447.0, "step": 3560 }, { "entropy": 5.38278169631958, "epoch": 0.09651438240270728, "grad_norm": 1.046875, "learning_rate": 7.304756444942056e-05, "loss": 5.1539, "mean_token_accuracy": 0.1781917095184326, "num_tokens": 10010124.0, "step": 3565 }, { "entropy": 5.462849140167236, "epoch": 0.0966497461928934, "grad_norm": 0.93359375, "learning_rate": 7.253093639995994e-05, "loss": 5.2831, "mean_token_accuracy": 0.17512934952974318, "num_tokens": 10024441.0, "step": 3570 }, { "entropy": 5.478954744338989, "epoch": 0.09678510998307953, "grad_norm": 0.94140625, "learning_rate": 7.20198591421544e-05, "loss": 5.2943, "mean_token_accuracy": 0.171660877764225, "num_tokens": 10038886.0, "step": 3575 }, { "entropy": 5.500023937225341, "epoch": 0.09692047377326565, "grad_norm": 0.9296875, "learning_rate": 7.151434668744517e-05, "loss": 5.3161, "mean_token_accuracy": 0.17876716703176498, "num_tokens": 10052929.0, "step": 3580 }, { "entropy": 5.483731269836426, "epoch": 0.09705583756345178, "grad_norm": 1.0625, "learning_rate": 7.101441289471153e-05, "loss": 5.2905, "mean_token_accuracy": 0.17570538371801375, "num_tokens": 10066239.0, "step": 3585 }, { "entropy": 5.421175622940064, "epoch": 0.0971912013536379, "grad_norm": 1.046875, "learning_rate": 7.052007146989098e-05, "loss": 5.1395, "mean_token_accuracy": 0.179901522397995, "num_tokens": 10079525.0, "step": 3590 }, { "entropy": 5.384795904159546, "epoch": 0.09732656514382403, "grad_norm": 0.96484375, "learning_rate": 7.003133596560341e-05, "loss": 5.1582, "mean_token_accuracy": 0.18871900141239167, "num_tokens": 10093915.0, "step": 3595 }, { "entropy": 5.387734842300415, "epoch": 0.09746192893401015, "grad_norm": 0.92578125, "learning_rate": 6.954821978077952e-05, "loss": 5.1844, "mean_token_accuracy": 0.18447159379720687, "num_tokens": 10108406.0, "step": 3600 }, { "entropy": 5.421917963027954, "epoch": 0.09759729272419627, "grad_norm": 0.87890625, "learning_rate": 6.907073616029356e-05, "loss": 5.2285, "mean_token_accuracy": 0.17513605952262878, "num_tokens": 10122768.0, "step": 3605 }, { "entropy": 5.47025580406189, "epoch": 0.0977326565143824, "grad_norm": 0.96875, "learning_rate": 6.85988981946002e-05, "loss": 5.317, "mean_token_accuracy": 0.16671132892370225, "num_tokens": 10137705.0, "step": 3610 }, { "entropy": 5.41975588798523, "epoch": 0.09786802030456852, "grad_norm": 0.94921875, "learning_rate": 6.813271881937564e-05, "loss": 5.1786, "mean_token_accuracy": 0.1797885350883007, "num_tokens": 10153065.0, "step": 3615 }, { "entropy": 5.474036645889282, "epoch": 0.09800338409475465, "grad_norm": 0.921875, "learning_rate": 6.767221081516286e-05, "loss": 5.2658, "mean_token_accuracy": 0.17338726818561553, "num_tokens": 10168430.0, "step": 3620 }, { "entropy": 5.443027448654175, "epoch": 0.09813874788494077, "grad_norm": 0.93359375, "learning_rate": 6.72173868070215e-05, "loss": 5.1754, "mean_token_accuracy": 0.1833331510424614, "num_tokens": 10182222.0, "step": 3625 }, { "entropy": 5.503278112411499, "epoch": 0.09827411167512691, "grad_norm": 0.86328125, "learning_rate": 6.676825926418149e-05, "loss": 5.2927, "mean_token_accuracy": 0.17598096579313277, "num_tokens": 10198470.0, "step": 3630 }, { "entropy": 5.457680559158325, "epoch": 0.09840947546531303, "grad_norm": 0.91015625, "learning_rate": 6.632484049970122e-05, "loss": 5.2838, "mean_token_accuracy": 0.17474121153354644, "num_tokens": 10212676.0, "step": 3635 }, { "entropy": 5.431332063674927, "epoch": 0.09854483925549916, "grad_norm": 0.99609375, "learning_rate": 6.588714267013019e-05, "loss": 5.2276, "mean_token_accuracy": 0.17433813363313674, "num_tokens": 10224893.0, "step": 3640 }, { "entropy": 5.483983039855957, "epoch": 0.09868020304568528, "grad_norm": 0.8984375, "learning_rate": 6.545517777517544e-05, "loss": 5.2464, "mean_token_accuracy": 0.1813598617911339, "num_tokens": 10238786.0, "step": 3645 }, { "entropy": 5.4722819328308105, "epoch": 0.09881556683587141, "grad_norm": 0.92578125, "learning_rate": 6.502895765737281e-05, "loss": 5.252, "mean_token_accuracy": 0.16823621690273285, "num_tokens": 10252831.0, "step": 3650 }, { "entropy": 5.427985715866089, "epoch": 0.09895093062605753, "grad_norm": 0.84375, "learning_rate": 6.460849400176212e-05, "loss": 5.2286, "mean_token_accuracy": 0.1749664455652237, "num_tokens": 10268886.0, "step": 3655 }, { "entropy": 5.503793334960937, "epoch": 0.09908629441624366, "grad_norm": 1.0546875, "learning_rate": 6.419379833556694e-05, "loss": 5.3155, "mean_token_accuracy": 0.17741915136575698, "num_tokens": 10282332.0, "step": 3660 }, { "entropy": 5.452091121673584, "epoch": 0.09922165820642978, "grad_norm": 1.0078125, "learning_rate": 6.378488202787835e-05, "loss": 5.2168, "mean_token_accuracy": 0.17554211616516113, "num_tokens": 10295262.0, "step": 3665 }, { "entropy": 5.445429563522339, "epoch": 0.0993570219966159, "grad_norm": 0.92578125, "learning_rate": 6.33817562893435e-05, "loss": 5.2164, "mean_token_accuracy": 0.18022813349962236, "num_tokens": 10310202.0, "step": 3670 }, { "entropy": 5.478223133087158, "epoch": 0.09949238578680203, "grad_norm": 0.93359375, "learning_rate": 6.29844321718582e-05, "loss": 5.2857, "mean_token_accuracy": 0.17693584710359572, "num_tokens": 10322581.0, "step": 3675 }, { "entropy": 5.501222801208496, "epoch": 0.09962774957698815, "grad_norm": 1.046875, "learning_rate": 6.259292056826383e-05, "loss": 5.3048, "mean_token_accuracy": 0.17106766849756241, "num_tokens": 10335451.0, "step": 3680 }, { "entropy": 5.453751420974731, "epoch": 0.09976311336717428, "grad_norm": 0.921875, "learning_rate": 6.220723221204873e-05, "loss": 5.1911, "mean_token_accuracy": 0.18236185610294342, "num_tokens": 10349664.0, "step": 3685 }, { "entropy": 5.482261371612549, "epoch": 0.0998984771573604, "grad_norm": 1.078125, "learning_rate": 6.182737767705406e-05, "loss": 5.2385, "mean_token_accuracy": 0.17836161702871323, "num_tokens": 10363222.0, "step": 3690 }, { "entropy": 5.414063405990601, "epoch": 0.10003384094754653, "grad_norm": 0.984375, "learning_rate": 6.145336737718375e-05, "loss": 5.2521, "mean_token_accuracy": 0.1778153583407402, "num_tokens": 10377084.0, "step": 3695 }, { "entropy": 5.439861106872558, "epoch": 0.10016920473773265, "grad_norm": 0.96875, "learning_rate": 6.10852115661191e-05, "loss": 5.2042, "mean_token_accuracy": 0.1773260474205017, "num_tokens": 10391151.0, "step": 3700 }, { "entropy": 5.38260555267334, "epoch": 0.10030456852791877, "grad_norm": 0.85546875, "learning_rate": 6.072292033703766e-05, "loss": 5.1476, "mean_token_accuracy": 0.18702121675014496, "num_tokens": 10404601.0, "step": 3705 }, { "entropy": 5.455022859573364, "epoch": 0.10043993231810491, "grad_norm": 1.015625, "learning_rate": 6.036650362233648e-05, "loss": 5.3161, "mean_token_accuracy": 0.16847151815891265, "num_tokens": 10418201.0, "step": 3710 }, { "entropy": 5.4407267570495605, "epoch": 0.10057529610829104, "grad_norm": 1.03125, "learning_rate": 6.0015971193359824e-05, "loss": 5.1724, "mean_token_accuracy": 0.18162354379892348, "num_tokens": 10431030.0, "step": 3715 }, { "entropy": 5.465402412414551, "epoch": 0.10071065989847716, "grad_norm": 1.015625, "learning_rate": 5.9671332660131306e-05, "loss": 5.2411, "mean_token_accuracy": 0.17822658121585847, "num_tokens": 10444470.0, "step": 3720 }, { "entropy": 5.4923155307769775, "epoch": 0.10084602368866329, "grad_norm": 1.015625, "learning_rate": 5.933259747109042e-05, "loss": 5.2845, "mean_token_accuracy": 0.17237729281187059, "num_tokens": 10457686.0, "step": 3725 }, { "entropy": 5.421149730682373, "epoch": 0.10098138747884941, "grad_norm": 0.91015625, "learning_rate": 5.899977491283351e-05, "loss": 5.1355, "mean_token_accuracy": 0.18317325860261918, "num_tokens": 10472039.0, "step": 3730 }, { "entropy": 5.476395988464356, "epoch": 0.10111675126903553, "grad_norm": 0.91796875, "learning_rate": 5.867287410985908e-05, "loss": 5.1902, "mean_token_accuracy": 0.17925067692995073, "num_tokens": 10485161.0, "step": 3735 }, { "entropy": 5.387272596359253, "epoch": 0.10125211505922166, "grad_norm": 0.92578125, "learning_rate": 5.835190402431779e-05, "loss": 5.2151, "mean_token_accuracy": 0.18368397653102875, "num_tokens": 10499106.0, "step": 3740 }, { "entropy": 5.504530429840088, "epoch": 0.10138747884940778, "grad_norm": 1.0078125, "learning_rate": 5.803687345576673e-05, "loss": 5.2795, "mean_token_accuracy": 0.1814903661608696, "num_tokens": 10513209.0, "step": 3745 }, { "entropy": 5.465247631072998, "epoch": 0.10152284263959391, "grad_norm": 0.99609375, "learning_rate": 5.7727791040927977e-05, "loss": 5.2493, "mean_token_accuracy": 0.17284207046031952, "num_tokens": 10527883.0, "step": 3750 }, { "entropy": 5.473253870010376, "epoch": 0.10165820642978003, "grad_norm": 0.921875, "learning_rate": 5.742466525345213e-05, "loss": 5.1674, "mean_token_accuracy": 0.1791956305503845, "num_tokens": 10541871.0, "step": 3755 }, { "entropy": 5.41374135017395, "epoch": 0.10179357021996616, "grad_norm": 0.87890625, "learning_rate": 5.7127504403685775e-05, "loss": 5.1771, "mean_token_accuracy": 0.17775085270404817, "num_tokens": 10556322.0, "step": 3760 }, { "entropy": 5.441633033752441, "epoch": 0.10192893401015228, "grad_norm": 0.96875, "learning_rate": 5.6836316638443664e-05, "loss": 5.1265, "mean_token_accuracy": 0.18571407794952394, "num_tokens": 10569399.0, "step": 3765 }, { "entropy": 5.494030094146728, "epoch": 0.1020642978003384, "grad_norm": 0.94921875, "learning_rate": 5.655110994078553e-05, "loss": 5.2973, "mean_token_accuracy": 0.17363038361072541, "num_tokens": 10583481.0, "step": 3770 }, { "entropy": 5.452342128753662, "epoch": 0.10219966159052453, "grad_norm": 0.9375, "learning_rate": 5.6271892129797056e-05, "loss": 5.1813, "mean_token_accuracy": 0.17757375687360763, "num_tokens": 10597706.0, "step": 3775 }, { "entropy": 5.386959171295166, "epoch": 0.10233502538071065, "grad_norm": 0.94921875, "learning_rate": 5.599867086037556e-05, "loss": 5.0745, "mean_token_accuracy": 0.18331465721130372, "num_tokens": 10611437.0, "step": 3780 }, { "entropy": 5.468786334991455, "epoch": 0.10247038917089679, "grad_norm": 0.94140625, "learning_rate": 5.573145362302012e-05, "loss": 5.3312, "mean_token_accuracy": 0.17515545785427095, "num_tokens": 10624076.0, "step": 3785 }, { "entropy": 5.486022806167602, "epoch": 0.10260575296108292, "grad_norm": 0.9609375, "learning_rate": 5.5470247743626404e-05, "loss": 5.3145, "mean_token_accuracy": 0.16346433609724045, "num_tokens": 10639696.0, "step": 3790 }, { "entropy": 5.462622547149659, "epoch": 0.10274111675126904, "grad_norm": 1.0234375, "learning_rate": 5.5215060383285414e-05, "loss": 5.2871, "mean_token_accuracy": 0.17402675300836562, "num_tokens": 10652098.0, "step": 3795 }, { "entropy": 5.46808557510376, "epoch": 0.10287648054145516, "grad_norm": 1.0546875, "learning_rate": 5.496589853808759e-05, "loss": 5.2574, "mean_token_accuracy": 0.17415528744459152, "num_tokens": 10666968.0, "step": 3800 }, { "entropy": 5.4186664581298825, "epoch": 0.10301184433164129, "grad_norm": 1.0546875, "learning_rate": 5.47227690389308e-05, "loss": 5.1148, "mean_token_accuracy": 0.1816213309764862, "num_tokens": 10679663.0, "step": 3805 }, { "entropy": 5.4264075756073, "epoch": 0.10314720812182741, "grad_norm": 0.9453125, "learning_rate": 5.448567855133306e-05, "loss": 5.1901, "mean_token_accuracy": 0.17645768374204635, "num_tokens": 10692660.0, "step": 3810 }, { "entropy": 5.4301145553588865, "epoch": 0.10328257191201354, "grad_norm": 0.984375, "learning_rate": 5.425463357524986e-05, "loss": 5.2028, "mean_token_accuracy": 0.18301489800214768, "num_tokens": 10705806.0, "step": 3815 }, { "entropy": 5.47904863357544, "epoch": 0.10341793570219966, "grad_norm": 0.875, "learning_rate": 5.402964044489591e-05, "loss": 5.2943, "mean_token_accuracy": 0.1806845486164093, "num_tokens": 10720408.0, "step": 3820 }, { "entropy": 5.505579853057862, "epoch": 0.10355329949238579, "grad_norm": 0.90234375, "learning_rate": 5.381070532857153e-05, "loss": 5.2817, "mean_token_accuracy": 0.17546553611755372, "num_tokens": 10737031.0, "step": 3825 }, { "entropy": 5.478611946105957, "epoch": 0.10368866328257191, "grad_norm": 1.03125, "learning_rate": 5.359783422849357e-05, "loss": 5.2734, "mean_token_accuracy": 0.17541965693235398, "num_tokens": 10750669.0, "step": 3830 }, { "entropy": 5.435742044448853, "epoch": 0.10382402707275803, "grad_norm": 0.94921875, "learning_rate": 5.3391032980630736e-05, "loss": 5.2713, "mean_token_accuracy": 0.17451788634061813, "num_tokens": 10766303.0, "step": 3835 }, { "entropy": 5.460405540466309, "epoch": 0.10395939086294416, "grad_norm": 1.09375, "learning_rate": 5.31903072545437e-05, "loss": 5.2081, "mean_token_accuracy": 0.18736861348152162, "num_tokens": 10780288.0, "step": 3840 }, { "entropy": 5.429828453063965, "epoch": 0.10409475465313028, "grad_norm": 0.984375, "learning_rate": 5.29956625532297e-05, "loss": 5.2529, "mean_token_accuracy": 0.1730156198143959, "num_tokens": 10793844.0, "step": 3845 }, { "entropy": 5.420657110214234, "epoch": 0.10423011844331641, "grad_norm": 1.046875, "learning_rate": 5.280710421297146e-05, "loss": 5.2018, "mean_token_accuracy": 0.18210601955652236, "num_tokens": 10808050.0, "step": 3850 }, { "entropy": 5.409189033508301, "epoch": 0.10436548223350253, "grad_norm": 0.91015625, "learning_rate": 5.2624637403191165e-05, "loss": 5.1812, "mean_token_accuracy": 0.18174512237310408, "num_tokens": 10822598.0, "step": 3855 }, { "entropy": 5.432131004333496, "epoch": 0.10450084602368866, "grad_norm": 0.953125, "learning_rate": 5.2448267126308605e-05, "loss": 5.1928, "mean_token_accuracy": 0.17888483554124832, "num_tokens": 10835679.0, "step": 3860 }, { "entropy": 5.4485198020935055, "epoch": 0.1046362098138748, "grad_norm": 1.1015625, "learning_rate": 5.2277998217603954e-05, "loss": 5.1937, "mean_token_accuracy": 0.17868861109018325, "num_tokens": 10848896.0, "step": 3865 }, { "entropy": 5.490707921981811, "epoch": 0.10477157360406092, "grad_norm": 1.03125, "learning_rate": 5.211383534508541e-05, "loss": 5.212, "mean_token_accuracy": 0.1784048408269882, "num_tokens": 10861562.0, "step": 3870 }, { "entropy": 5.42482328414917, "epoch": 0.10490693739424704, "grad_norm": 0.9921875, "learning_rate": 5.1955783009361044e-05, "loss": 5.1451, "mean_token_accuracy": 0.18526836186647416, "num_tokens": 10873483.0, "step": 3875 }, { "entropy": 5.435460948944092, "epoch": 0.10504230118443317, "grad_norm": 0.95703125, "learning_rate": 5.180384554351543e-05, "loss": 5.2047, "mean_token_accuracy": 0.17779654264450073, "num_tokens": 10887788.0, "step": 3880 }, { "entropy": 5.426501941680908, "epoch": 0.10517766497461929, "grad_norm": 0.953125, "learning_rate": 5.1658027112990976e-05, "loss": 5.1484, "mean_token_accuracy": 0.17941227555274963, "num_tokens": 10901017.0, "step": 3885 }, { "entropy": 5.390911626815796, "epoch": 0.10531302876480542, "grad_norm": 0.84375, "learning_rate": 5.151833171547365e-05, "loss": 5.1484, "mean_token_accuracy": 0.1830310583114624, "num_tokens": 10914480.0, "step": 3890 }, { "entropy": 5.433801603317261, "epoch": 0.10544839255499154, "grad_norm": 1.0, "learning_rate": 5.1384763180783274e-05, "loss": 5.2588, "mean_token_accuracy": 0.1759231224656105, "num_tokens": 10929732.0, "step": 3895 }, { "entropy": 5.408439302444458, "epoch": 0.10558375634517767, "grad_norm": 0.96484375, "learning_rate": 5.125732517076876e-05, "loss": 5.1889, "mean_token_accuracy": 0.18901487439870834, "num_tokens": 10942125.0, "step": 3900 }, { "entropy": 5.334071922302246, "epoch": 0.10571912013536379, "grad_norm": 1.015625, "learning_rate": 5.113602117920747e-05, "loss": 5.072, "mean_token_accuracy": 0.1919448718428612, "num_tokens": 10954469.0, "step": 3905 }, { "entropy": 5.39621148109436, "epoch": 0.10585448392554991, "grad_norm": 0.8671875, "learning_rate": 5.102085453170966e-05, "loss": 5.1551, "mean_token_accuracy": 0.18375782817602157, "num_tokens": 10969401.0, "step": 3910 }, { "entropy": 5.453270816802979, "epoch": 0.10598984771573604, "grad_norm": 1.0625, "learning_rate": 5.091182838562709e-05, "loss": 5.2563, "mean_token_accuracy": 0.17768552899360657, "num_tokens": 10984192.0, "step": 3915 }, { "entropy": 5.491350603103638, "epoch": 0.10612521150592216, "grad_norm": 0.85546875, "learning_rate": 5.0808945729966716e-05, "loss": 5.2631, "mean_token_accuracy": 0.17394644767045975, "num_tokens": 10999855.0, "step": 3920 }, { "entropy": 5.465265512466431, "epoch": 0.10626057529610829, "grad_norm": 1.015625, "learning_rate": 5.071220938530844e-05, "loss": 5.2407, "mean_token_accuracy": 0.17272032648324967, "num_tokens": 11011371.0, "step": 3925 }, { "entropy": 5.422465705871582, "epoch": 0.10639593908629441, "grad_norm": 0.97265625, "learning_rate": 5.0621622003728026e-05, "loss": 5.2047, "mean_token_accuracy": 0.18466399610042572, "num_tokens": 11025141.0, "step": 3930 }, { "entropy": 5.506776142120361, "epoch": 0.10653130287648054, "grad_norm": 0.9296875, "learning_rate": 5.053718606872433e-05, "loss": 5.3006, "mean_token_accuracy": 0.178793703019619, "num_tokens": 11038750.0, "step": 3935 }, { "entropy": 5.444697284698487, "epoch": 0.10666666666666667, "grad_norm": 0.93359375, "learning_rate": 5.0458903895151134e-05, "loss": 5.2158, "mean_token_accuracy": 0.17911358028650284, "num_tokens": 11052146.0, "step": 3940 }, { "entropy": 5.430838108062744, "epoch": 0.1068020304568528, "grad_norm": 0.98828125, "learning_rate": 5.038677762915381e-05, "loss": 5.1231, "mean_token_accuracy": 0.1867231696844101, "num_tokens": 11065091.0, "step": 3945 }, { "entropy": 5.3946521282196045, "epoch": 0.10693739424703892, "grad_norm": 0.94140625, "learning_rate": 5.032080924811033e-05, "loss": 5.2273, "mean_token_accuracy": 0.1766382023692131, "num_tokens": 11081124.0, "step": 3950 }, { "entropy": 5.479502820968628, "epoch": 0.10707275803722505, "grad_norm": 1.0234375, "learning_rate": 5.026100056057718e-05, "loss": 5.283, "mean_token_accuracy": 0.17816594392061233, "num_tokens": 11093540.0, "step": 3955 }, { "entropy": 5.48756160736084, "epoch": 0.10720812182741117, "grad_norm": 0.859375, "learning_rate": 5.0207353206239764e-05, "loss": 5.2695, "mean_token_accuracy": 0.17074304521083833, "num_tokens": 11108039.0, "step": 3960 }, { "entropy": 5.424608612060547, "epoch": 0.1073434856175973, "grad_norm": 0.828125, "learning_rate": 5.0159868655867436e-05, "loss": 5.2348, "mean_token_accuracy": 0.1750531792640686, "num_tokens": 11123472.0, "step": 3965 }, { "entropy": 5.406925106048584, "epoch": 0.10747884940778342, "grad_norm": 0.8828125, "learning_rate": 5.011854821127305e-05, "loss": 5.141, "mean_token_accuracy": 0.1887975424528122, "num_tokens": 11136791.0, "step": 3970 }, { "entropy": 5.442727184295654, "epoch": 0.10761421319796954, "grad_norm": 0.91015625, "learning_rate": 5.008339300527755e-05, "loss": 5.1939, "mean_token_accuracy": 0.18285703808069229, "num_tokens": 11149103.0, "step": 3975 }, { "entropy": 5.368607807159424, "epoch": 0.10774957698815567, "grad_norm": 0.87109375, "learning_rate": 5.005440400167859e-05, "loss": 5.0833, "mean_token_accuracy": 0.19177746623754502, "num_tokens": 11163824.0, "step": 3980 }, { "entropy": 5.486799526214599, "epoch": 0.10788494077834179, "grad_norm": 0.96484375, "learning_rate": 5.003158199522442e-05, "loss": 5.241, "mean_token_accuracy": 0.17701994627714157, "num_tokens": 11177750.0, "step": 3985 }, { "entropy": 5.478089284896851, "epoch": 0.10802030456852792, "grad_norm": 0.859375, "learning_rate": 5.0014927611591806e-05, "loss": 5.2495, "mean_token_accuracy": 0.17373744398355484, "num_tokens": 11192089.0, "step": 3990 }, { "entropy": 5.414667749404908, "epoch": 0.10815566835871404, "grad_norm": 0.95703125, "learning_rate": 5.000444130736916e-05, "loss": 5.1754, "mean_token_accuracy": 0.17795276492834092, "num_tokens": 11206240.0, "step": 3995 }, { "entropy": 5.448756742477417, "epoch": 0.10829103214890017, "grad_norm": 0.84765625, "learning_rate": 5.0000123370043736e-05, "loss": 5.2278, "mean_token_accuracy": 0.18019841909408568, "num_tokens": 11219972.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.9961559926784e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }