{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.08121827411167512, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69199342727661, "epoch": 0.00013536379018612522, "grad_norm": 11.5625, "learning_rate": 2e-06, "loss": 10.8479, "mean_token_accuracy": 0.0, "num_tokens": 12791.0, "step": 5 }, { "entropy": 10.691878128051759, "epoch": 0.00027072758037225043, "grad_norm": 11.0, "learning_rate": 4.5e-06, "loss": 10.8142, "mean_token_accuracy": 0.0, "num_tokens": 26683.0, "step": 10 }, { "entropy": 10.691429710388183, "epoch": 0.0004060913705583756, "grad_norm": 9.3125, "learning_rate": 7e-06, "loss": 10.5672, "mean_token_accuracy": 0.011101403925567865, "num_tokens": 39347.0, "step": 15 }, { "entropy": 10.686277675628663, "epoch": 0.0005414551607445009, "grad_norm": 5.375, "learning_rate": 9.5e-06, "loss": 10.3174, "mean_token_accuracy": 0.030114291980862618, "num_tokens": 54329.0, "step": 20 }, { "entropy": 10.660668087005615, "epoch": 0.0006768189509306261, "grad_norm": 4.09375, "learning_rate": 1.2e-05, "loss": 10.0145, "mean_token_accuracy": 0.032822173461318015, "num_tokens": 67393.0, "step": 25 }, { "entropy": 10.637198734283448, "epoch": 0.0008121827411167512, "grad_norm": 3.0625, "learning_rate": 1.4500000000000002e-05, "loss": 9.8798, "mean_token_accuracy": 0.03450996596366167, "num_tokens": 81383.0, "step": 30 }, { "entropy": 10.631521320343017, "epoch": 0.0009475465313028764, "grad_norm": 2.515625, "learning_rate": 1.7000000000000003e-05, "loss": 9.8183, "mean_token_accuracy": 0.03217146322131157, "num_tokens": 95991.0, "step": 35 }, { "entropy": 10.626516151428223, "epoch": 0.0010829103214890017, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.7088, "mean_token_accuracy": 0.03352573178708553, "num_tokens": 108504.0, "step": 40 }, { "entropy": 10.627447319030761, "epoch": 0.001218274111675127, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 9.7785, "mean_token_accuracy": 0.030551478266716003, "num_tokens": 123286.0, "step": 45 }, { "entropy": 10.629091835021972, "epoch": 0.0013536379018612521, "grad_norm": 2.296875, "learning_rate": 2.4500000000000003e-05, "loss": 9.6538, "mean_token_accuracy": 0.03104141727089882, "num_tokens": 135493.0, "step": 50 }, { "entropy": 10.618868160247803, "epoch": 0.0014890016920473773, "grad_norm": 2.078125, "learning_rate": 2.7e-05, "loss": 9.6537, "mean_token_accuracy": 0.03736583907157183, "num_tokens": 150376.0, "step": 55 }, { "entropy": 10.596181201934815, "epoch": 0.0016243654822335025, "grad_norm": 2.109375, "learning_rate": 2.95e-05, "loss": 9.5976, "mean_token_accuracy": 0.03170219026505947, "num_tokens": 165805.0, "step": 60 }, { "entropy": 10.606531143188477, "epoch": 0.0017597292724196277, "grad_norm": 2.09375, "learning_rate": 3.2e-05, "loss": 9.4608, "mean_token_accuracy": 0.03743585981428623, "num_tokens": 179043.0, "step": 65 }, { "entropy": 10.577856731414794, "epoch": 0.0018950930626057529, "grad_norm": 2.09375, "learning_rate": 3.4500000000000005e-05, "loss": 9.3947, "mean_token_accuracy": 0.03445138856768608, "num_tokens": 191847.0, "step": 70 }, { "entropy": 10.561034107208252, "epoch": 0.0020304568527918783, "grad_norm": 2.125, "learning_rate": 3.7e-05, "loss": 9.2778, "mean_token_accuracy": 0.03577356971800327, "num_tokens": 207116.0, "step": 75 }, { "entropy": 10.546807861328125, "epoch": 0.0021658206429780035, "grad_norm": 2.03125, "learning_rate": 3.95e-05, "loss": 9.2156, "mean_token_accuracy": 0.03288109693676233, "num_tokens": 219651.0, "step": 80 }, { "entropy": 10.532037448883056, "epoch": 0.0023011844331641287, "grad_norm": 2.015625, "learning_rate": 4.2000000000000004e-05, "loss": 9.16, "mean_token_accuracy": 0.03139570262283087, "num_tokens": 233183.0, "step": 85 }, { "entropy": 10.499158573150634, "epoch": 0.002436548223350254, "grad_norm": 2.0625, "learning_rate": 4.45e-05, "loss": 8.9864, "mean_token_accuracy": 0.0376906756311655, "num_tokens": 246291.0, "step": 90 }, { "entropy": 10.423231887817384, "epoch": 0.002571912013536379, "grad_norm": 2.15625, "learning_rate": 4.7000000000000004e-05, "loss": 8.8533, "mean_token_accuracy": 0.04000245779752731, "num_tokens": 259606.0, "step": 95 }, { "entropy": 10.371912956237793, "epoch": 0.0027072758037225042, "grad_norm": 2.0, "learning_rate": 4.9500000000000004e-05, "loss": 8.7521, "mean_token_accuracy": 0.04012820441275835, "num_tokens": 275174.0, "step": 100 }, { "entropy": 10.304845333099365, "epoch": 0.0028426395939086294, "grad_norm": 2.25, "learning_rate": 5.2e-05, "loss": 8.5952, "mean_token_accuracy": 0.04803745746612549, "num_tokens": 287873.0, "step": 105 }, { "entropy": 10.202454662322998, "epoch": 0.0029780033840947546, "grad_norm": 1.9453125, "learning_rate": 5.45e-05, "loss": 8.4264, "mean_token_accuracy": 0.052891625463962554, "num_tokens": 301243.0, "step": 110 }, { "entropy": 10.146648788452149, "epoch": 0.00311336717428088, "grad_norm": 2.140625, "learning_rate": 5.7e-05, "loss": 8.3599, "mean_token_accuracy": 0.04921769984066486, "num_tokens": 314246.0, "step": 115 }, { "entropy": 9.991413021087647, "epoch": 0.003248730964467005, "grad_norm": 1.671875, "learning_rate": 5.9499999999999996e-05, "loss": 8.1824, "mean_token_accuracy": 0.05792190656065941, "num_tokens": 327131.0, "step": 120 }, { "entropy": 9.899451637268067, "epoch": 0.00338409475465313, "grad_norm": 1.7734375, "learning_rate": 6.2e-05, "loss": 8.0577, "mean_token_accuracy": 0.054864197969436646, "num_tokens": 340932.0, "step": 125 }, { "entropy": 9.722916507720948, "epoch": 0.0035194585448392554, "grad_norm": 1.671875, "learning_rate": 6.450000000000001e-05, "loss": 7.9419, "mean_token_accuracy": 0.05465308241546154, "num_tokens": 355280.0, "step": 130 }, { "entropy": 9.517075347900391, "epoch": 0.0036548223350253805, "grad_norm": 1.546875, "learning_rate": 6.7e-05, "loss": 7.863, "mean_token_accuracy": 0.06392355933785439, "num_tokens": 370159.0, "step": 135 }, { "entropy": 9.312166881561279, "epoch": 0.0037901861252115057, "grad_norm": 1.4609375, "learning_rate": 6.950000000000001e-05, "loss": 7.7284, "mean_token_accuracy": 0.060528535023331644, "num_tokens": 385660.0, "step": 140 }, { "entropy": 9.113211154937744, "epoch": 0.003925549915397631, "grad_norm": 1.3359375, "learning_rate": 7.2e-05, "loss": 7.6437, "mean_token_accuracy": 0.05836181789636612, "num_tokens": 401147.0, "step": 145 }, { "entropy": 8.787345790863037, "epoch": 0.0040609137055837565, "grad_norm": 1.5625, "learning_rate": 7.45e-05, "loss": 7.4136, "mean_token_accuracy": 0.07278152294456959, "num_tokens": 413888.0, "step": 150 }, { "entropy": 8.64449052810669, "epoch": 0.004196277495769882, "grad_norm": 1.40625, "learning_rate": 7.7e-05, "loss": 7.3884, "mean_token_accuracy": 0.06653538607060909, "num_tokens": 427538.0, "step": 155 }, { "entropy": 8.441664218902588, "epoch": 0.004331641285956007, "grad_norm": 2.125, "learning_rate": 7.950000000000001e-05, "loss": 7.3251, "mean_token_accuracy": 0.069814383238554, "num_tokens": 441236.0, "step": 160 }, { "entropy": 8.356950950622558, "epoch": 0.004467005076142132, "grad_norm": 1.3984375, "learning_rate": 8.2e-05, "loss": 7.4254, "mean_token_accuracy": 0.0740208551287651, "num_tokens": 454231.0, "step": 165 }, { "entropy": 8.19385576248169, "epoch": 0.004602368866328257, "grad_norm": 1.5234375, "learning_rate": 8.450000000000001e-05, "loss": 7.2457, "mean_token_accuracy": 0.07566015087068081, "num_tokens": 468791.0, "step": 170 }, { "entropy": 8.173048114776611, "epoch": 0.0047377326565143825, "grad_norm": 1.6328125, "learning_rate": 8.7e-05, "loss": 7.3934, "mean_token_accuracy": 0.06828283667564392, "num_tokens": 481866.0, "step": 175 }, { "entropy": 8.059328603744508, "epoch": 0.004873096446700508, "grad_norm": 1.4296875, "learning_rate": 8.95e-05, "loss": 7.2376, "mean_token_accuracy": 0.07703411132097245, "num_tokens": 495060.0, "step": 180 }, { "entropy": 8.006558561325074, "epoch": 0.005008460236886633, "grad_norm": 1.2890625, "learning_rate": 9.2e-05, "loss": 7.1953, "mean_token_accuracy": 0.07884187921881676, "num_tokens": 508485.0, "step": 185 }, { "entropy": 7.988453817367554, "epoch": 0.005143824027072758, "grad_norm": 1.3984375, "learning_rate": 9.45e-05, "loss": 7.2074, "mean_token_accuracy": 0.07364003024995328, "num_tokens": 522642.0, "step": 190 }, { "entropy": 7.911316013336181, "epoch": 0.005279187817258883, "grad_norm": 1.234375, "learning_rate": 9.7e-05, "loss": 7.1742, "mean_token_accuracy": 0.07427211254835128, "num_tokens": 536967.0, "step": 195 }, { "entropy": 7.899316692352295, "epoch": 0.0054145516074450084, "grad_norm": 1.4296875, "learning_rate": 9.95e-05, "loss": 7.1728, "mean_token_accuracy": 0.0805082306265831, "num_tokens": 548389.0, "step": 200 }, { "entropy": 7.799197435379028, "epoch": 0.005549915397631134, "grad_norm": 1.296875, "learning_rate": 0.000102, "loss": 7.1509, "mean_token_accuracy": 0.07738717347383499, "num_tokens": 560609.0, "step": 205 }, { "entropy": 7.819343090057373, "epoch": 0.005685279187817259, "grad_norm": 1.3046875, "learning_rate": 0.00010449999999999999, "loss": 7.1254, "mean_token_accuracy": 0.07640378400683404, "num_tokens": 574689.0, "step": 210 }, { "entropy": 7.777826452255249, "epoch": 0.005820642978003384, "grad_norm": 1.3515625, "learning_rate": 0.000107, "loss": 7.0691, "mean_token_accuracy": 0.07349300533533096, "num_tokens": 588789.0, "step": 215 }, { "entropy": 7.698786115646362, "epoch": 0.005956006768189509, "grad_norm": 1.3125, "learning_rate": 0.0001095, "loss": 7.1439, "mean_token_accuracy": 0.07730361446738243, "num_tokens": 603609.0, "step": 220 }, { "entropy": 7.7466569423675535, "epoch": 0.006091370558375634, "grad_norm": 1.4453125, "learning_rate": 0.000112, "loss": 7.0113, "mean_token_accuracy": 0.07942908927798271, "num_tokens": 616403.0, "step": 225 }, { "entropy": 7.682626628875733, "epoch": 0.00622673434856176, "grad_norm": 1.09375, "learning_rate": 0.0001145, "loss": 7.1202, "mean_token_accuracy": 0.08443130478262902, "num_tokens": 630831.0, "step": 230 }, { "entropy": 7.731028842926025, "epoch": 0.006362098138747885, "grad_norm": 1.5078125, "learning_rate": 0.00011700000000000001, "loss": 7.0225, "mean_token_accuracy": 0.08779790177941323, "num_tokens": 646501.0, "step": 235 }, { "entropy": 7.661398029327392, "epoch": 0.00649746192893401, "grad_norm": 1.8671875, "learning_rate": 0.00011949999999999999, "loss": 7.0941, "mean_token_accuracy": 0.08079206757247448, "num_tokens": 661193.0, "step": 240 }, { "entropy": 7.572637605667114, "epoch": 0.006632825719120135, "grad_norm": 1.734375, "learning_rate": 0.000122, "loss": 7.0787, "mean_token_accuracy": 0.08005881682038307, "num_tokens": 675523.0, "step": 245 }, { "entropy": 7.636332321166992, "epoch": 0.00676818950930626, "grad_norm": 1.5859375, "learning_rate": 0.0001245, "loss": 7.0674, "mean_token_accuracy": 0.07794632315635681, "num_tokens": 691106.0, "step": 250 }, { "entropy": 7.519766235351563, "epoch": 0.0069035532994923855, "grad_norm": 1.3671875, "learning_rate": 0.000127, "loss": 6.9381, "mean_token_accuracy": 0.08541512936353683, "num_tokens": 704312.0, "step": 255 }, { "entropy": 7.561954641342163, "epoch": 0.007038917089678511, "grad_norm": 1.4375, "learning_rate": 0.0001295, "loss": 6.9601, "mean_token_accuracy": 0.0883929617702961, "num_tokens": 717026.0, "step": 260 }, { "entropy": 7.570081567764282, "epoch": 0.007174280879864636, "grad_norm": 1.328125, "learning_rate": 0.000132, "loss": 6.9123, "mean_token_accuracy": 0.08829773366451263, "num_tokens": 729605.0, "step": 265 }, { "entropy": 7.463983678817749, "epoch": 0.007309644670050761, "grad_norm": 1.2421875, "learning_rate": 0.00013450000000000002, "loss": 6.9353, "mean_token_accuracy": 0.09122553616762161, "num_tokens": 743208.0, "step": 270 }, { "entropy": 7.550097227096558, "epoch": 0.007445008460236886, "grad_norm": 1.2578125, "learning_rate": 0.00013700000000000002, "loss": 6.9287, "mean_token_accuracy": 0.08519787713885307, "num_tokens": 755127.0, "step": 275 }, { "entropy": 7.398041200637818, "epoch": 0.0075803722504230115, "grad_norm": 1.53125, "learning_rate": 0.0001395, "loss": 6.8231, "mean_token_accuracy": 0.08911917060613632, "num_tokens": 769725.0, "step": 280 }, { "entropy": 7.364175844192505, "epoch": 0.007715736040609137, "grad_norm": 1.2109375, "learning_rate": 0.00014199999999999998, "loss": 6.7527, "mean_token_accuracy": 0.09069294035434723, "num_tokens": 783788.0, "step": 285 }, { "entropy": 7.450532627105713, "epoch": 0.007851099830795263, "grad_norm": 1.171875, "learning_rate": 0.0001445, "loss": 6.934, "mean_token_accuracy": 0.08614907264709473, "num_tokens": 797214.0, "step": 290 }, { "entropy": 7.43695821762085, "epoch": 0.007986463620981387, "grad_norm": 1.6328125, "learning_rate": 0.000147, "loss": 6.897, "mean_token_accuracy": 0.09108028039336205, "num_tokens": 809731.0, "step": 295 }, { "entropy": 7.286933469772339, "epoch": 0.008121827411167513, "grad_norm": 1.4296875, "learning_rate": 0.0001495, "loss": 6.8591, "mean_token_accuracy": 0.09137310981750488, "num_tokens": 825021.0, "step": 300 }, { "entropy": 7.2696253776550295, "epoch": 0.008257191201353637, "grad_norm": 1.40625, "learning_rate": 0.000152, "loss": 6.9029, "mean_token_accuracy": 0.09101672545075416, "num_tokens": 839153.0, "step": 305 }, { "entropy": 7.386481237411499, "epoch": 0.008392554991539763, "grad_norm": 1.3984375, "learning_rate": 0.00015450000000000001, "loss": 6.8276, "mean_token_accuracy": 0.08859616219997406, "num_tokens": 853120.0, "step": 310 }, { "entropy": 7.337709522247314, "epoch": 0.008527918781725888, "grad_norm": 1.21875, "learning_rate": 0.000157, "loss": 6.8448, "mean_token_accuracy": 0.08571028485894203, "num_tokens": 867268.0, "step": 315 }, { "entropy": 7.340923023223877, "epoch": 0.008663282571912014, "grad_norm": 1.3515625, "learning_rate": 0.0001595, "loss": 6.8255, "mean_token_accuracy": 0.09267906844615936, "num_tokens": 879062.0, "step": 320 }, { "entropy": 7.282296800613404, "epoch": 0.008798646362098138, "grad_norm": 1.4140625, "learning_rate": 0.000162, "loss": 6.7932, "mean_token_accuracy": 0.09626845642924309, "num_tokens": 892178.0, "step": 325 }, { "entropy": 7.201563024520874, "epoch": 0.008934010152284264, "grad_norm": 1.3125, "learning_rate": 0.00016450000000000001, "loss": 6.671, "mean_token_accuracy": 0.09671695902943611, "num_tokens": 904809.0, "step": 330 }, { "entropy": 7.275315999984741, "epoch": 0.009069373942470389, "grad_norm": 1.2734375, "learning_rate": 0.00016700000000000002, "loss": 6.8034, "mean_token_accuracy": 0.09026706293225288, "num_tokens": 917660.0, "step": 335 }, { "entropy": 7.179704904556274, "epoch": 0.009204737732656515, "grad_norm": 1.328125, "learning_rate": 0.00016950000000000003, "loss": 6.6849, "mean_token_accuracy": 0.09763308465480805, "num_tokens": 932773.0, "step": 340 }, { "entropy": 7.1569760799407955, "epoch": 0.009340101522842639, "grad_norm": 1.3359375, "learning_rate": 0.00017199999999999998, "loss": 6.707, "mean_token_accuracy": 0.09705711230635643, "num_tokens": 946688.0, "step": 345 }, { "entropy": 7.123394393920899, "epoch": 0.009475465313028765, "grad_norm": 1.3671875, "learning_rate": 0.00017449999999999999, "loss": 6.6188, "mean_token_accuracy": 0.10255519598722458, "num_tokens": 960621.0, "step": 350 }, { "entropy": 7.114657831192017, "epoch": 0.00961082910321489, "grad_norm": 1.2734375, "learning_rate": 0.000177, "loss": 6.7525, "mean_token_accuracy": 0.0939077839255333, "num_tokens": 976705.0, "step": 355 }, { "entropy": 7.13629846572876, "epoch": 0.009746192893401015, "grad_norm": 1.234375, "learning_rate": 0.0001795, "loss": 6.6798, "mean_token_accuracy": 0.09904273673892021, "num_tokens": 989175.0, "step": 360 }, { "entropy": 7.18667254447937, "epoch": 0.00988155668358714, "grad_norm": 1.25, "learning_rate": 0.000182, "loss": 6.7875, "mean_token_accuracy": 0.095027344673872, "num_tokens": 1003899.0, "step": 365 }, { "entropy": 7.018054962158203, "epoch": 0.010016920473773266, "grad_norm": 1.4765625, "learning_rate": 0.0001845, "loss": 6.6248, "mean_token_accuracy": 0.09302543699741364, "num_tokens": 1017823.0, "step": 370 }, { "entropy": 7.214749193191528, "epoch": 0.01015228426395939, "grad_norm": 1.234375, "learning_rate": 0.000187, "loss": 6.8025, "mean_token_accuracy": 0.0944581039249897, "num_tokens": 1031556.0, "step": 375 }, { "entropy": 7.06955304145813, "epoch": 0.010287648054145516, "grad_norm": 1.375, "learning_rate": 0.0001895, "loss": 6.6582, "mean_token_accuracy": 0.10281435176730155, "num_tokens": 1044245.0, "step": 380 }, { "entropy": 7.121717023849487, "epoch": 0.01042301184433164, "grad_norm": 1.3671875, "learning_rate": 0.000192, "loss": 6.6908, "mean_token_accuracy": 0.09887115061283111, "num_tokens": 1058288.0, "step": 385 }, { "entropy": 7.069799566268921, "epoch": 0.010558375634517767, "grad_norm": 1.546875, "learning_rate": 0.0001945, "loss": 6.623, "mean_token_accuracy": 0.09829980209469795, "num_tokens": 1072234.0, "step": 390 }, { "entropy": 7.062967205047608, "epoch": 0.010693739424703893, "grad_norm": 1.484375, "learning_rate": 0.00019700000000000002, "loss": 6.6287, "mean_token_accuracy": 0.0978606753051281, "num_tokens": 1085463.0, "step": 395 }, { "entropy": 6.952229833602905, "epoch": 0.010829103214890017, "grad_norm": 1.4375, "learning_rate": 0.00019950000000000002, "loss": 6.6629, "mean_token_accuracy": 0.09642241895198822, "num_tokens": 1101393.0, "step": 400 }, { "entropy": 7.105423212051392, "epoch": 0.010964467005076143, "grad_norm": 1.1171875, "learning_rate": 0.000202, "loss": 6.6263, "mean_token_accuracy": 0.09685642644762993, "num_tokens": 1117150.0, "step": 405 }, { "entropy": 6.972289943695069, "epoch": 0.011099830795262267, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 6.6594, "mean_token_accuracy": 0.10496844202280045, "num_tokens": 1130674.0, "step": 410 }, { "entropy": 7.087021827697754, "epoch": 0.011235194585448393, "grad_norm": 1.171875, "learning_rate": 0.000207, "loss": 6.6508, "mean_token_accuracy": 0.09535380229353904, "num_tokens": 1144016.0, "step": 415 }, { "entropy": 6.9751802444458, "epoch": 0.011370558375634518, "grad_norm": 1.1484375, "learning_rate": 0.0002095, "loss": 6.646, "mean_token_accuracy": 0.09546661153435707, "num_tokens": 1160200.0, "step": 420 }, { "entropy": 7.048429536819458, "epoch": 0.011505922165820644, "grad_norm": 1.484375, "learning_rate": 0.000212, "loss": 6.5651, "mean_token_accuracy": 0.1022900827229023, "num_tokens": 1173266.0, "step": 425 }, { "entropy": 6.974373769760132, "epoch": 0.011641285956006768, "grad_norm": 1.1171875, "learning_rate": 0.0002145, "loss": 6.6353, "mean_token_accuracy": 0.09445997178554535, "num_tokens": 1187977.0, "step": 430 }, { "entropy": 6.9971846580505375, "epoch": 0.011776649746192894, "grad_norm": 1.21875, "learning_rate": 0.00021700000000000002, "loss": 6.6389, "mean_token_accuracy": 0.09972369968891144, "num_tokens": 1202369.0, "step": 435 }, { "entropy": 6.966669607162475, "epoch": 0.011912013536379018, "grad_norm": 1.3203125, "learning_rate": 0.0002195, "loss": 6.5354, "mean_token_accuracy": 0.09552454426884652, "num_tokens": 1216956.0, "step": 440 }, { "entropy": 6.981910848617554, "epoch": 0.012047377326565144, "grad_norm": 1.1796875, "learning_rate": 0.000222, "loss": 6.6403, "mean_token_accuracy": 0.09657183811068534, "num_tokens": 1230958.0, "step": 445 }, { "entropy": 6.972163391113281, "epoch": 0.012182741116751269, "grad_norm": 1.3671875, "learning_rate": 0.0002245, "loss": 6.5568, "mean_token_accuracy": 0.1032287061214447, "num_tokens": 1244512.0, "step": 450 }, { "entropy": 6.940069246292114, "epoch": 0.012318104906937395, "grad_norm": 1.5078125, "learning_rate": 0.00022700000000000002, "loss": 6.4972, "mean_token_accuracy": 0.10796320661902428, "num_tokens": 1257469.0, "step": 455 }, { "entropy": 6.870718479156494, "epoch": 0.01245346869712352, "grad_norm": 1.203125, "learning_rate": 0.00022950000000000002, "loss": 6.5861, "mean_token_accuracy": 0.10574530512094497, "num_tokens": 1273533.0, "step": 460 }, { "entropy": 6.932940578460693, "epoch": 0.012588832487309645, "grad_norm": 1.25, "learning_rate": 0.00023200000000000003, "loss": 6.5387, "mean_token_accuracy": 0.10031782239675521, "num_tokens": 1288385.0, "step": 465 }, { "entropy": 6.920595693588257, "epoch": 0.01272419627749577, "grad_norm": 1.3203125, "learning_rate": 0.00023449999999999998, "loss": 6.6012, "mean_token_accuracy": 0.10496116429567337, "num_tokens": 1300721.0, "step": 470 }, { "entropy": 6.878480577468872, "epoch": 0.012859560067681896, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 6.4915, "mean_token_accuracy": 0.1057609498500824, "num_tokens": 1313125.0, "step": 475 }, { "entropy": 6.905995321273804, "epoch": 0.01299492385786802, "grad_norm": 1.296875, "learning_rate": 0.0002395, "loss": 6.5534, "mean_token_accuracy": 0.09937024191021919, "num_tokens": 1326226.0, "step": 480 }, { "entropy": 6.928886890411377, "epoch": 0.013130287648054146, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.4614, "mean_token_accuracy": 0.10791765451431275, "num_tokens": 1339932.0, "step": 485 }, { "entropy": 6.82708158493042, "epoch": 0.01326565143824027, "grad_norm": 1.3359375, "learning_rate": 0.0002445, "loss": 6.5553, "mean_token_accuracy": 0.09961838722229004, "num_tokens": 1354015.0, "step": 490 }, { "entropy": 6.846263122558594, "epoch": 0.013401015228426396, "grad_norm": 1.2734375, "learning_rate": 0.000247, "loss": 6.5473, "mean_token_accuracy": 0.100076574832201, "num_tokens": 1369333.0, "step": 495 }, { "entropy": 6.777434158325195, "epoch": 0.01353637901861252, "grad_norm": 1.2734375, "learning_rate": 0.0002495, "loss": 6.5092, "mean_token_accuracy": 0.10239997878670692, "num_tokens": 1383141.0, "step": 500 }, { "entropy": 6.814955854415894, "epoch": 0.013671742808798647, "grad_norm": 1.2890625, "learning_rate": 0.000252, "loss": 6.5148, "mean_token_accuracy": 0.10957075208425522, "num_tokens": 1398273.0, "step": 505 }, { "entropy": 6.813977956771851, "epoch": 0.013807106598984771, "grad_norm": 1.21875, "learning_rate": 0.0002545, "loss": 6.4406, "mean_token_accuracy": 0.10602880343794822, "num_tokens": 1412562.0, "step": 510 }, { "entropy": 6.782559490203857, "epoch": 0.013942470389170897, "grad_norm": 1.203125, "learning_rate": 0.000257, "loss": 6.4008, "mean_token_accuracy": 0.1101540595293045, "num_tokens": 1426024.0, "step": 515 }, { "entropy": 6.743443441390991, "epoch": 0.014077834179357021, "grad_norm": 1.171875, "learning_rate": 0.0002595, "loss": 6.4539, "mean_token_accuracy": 0.10084594711661339, "num_tokens": 1439774.0, "step": 520 }, { "entropy": 6.744311380386352, "epoch": 0.014213197969543147, "grad_norm": 1.296875, "learning_rate": 0.000262, "loss": 6.386, "mean_token_accuracy": 0.11141050532460213, "num_tokens": 1453041.0, "step": 525 }, { "entropy": 6.779989385604859, "epoch": 0.014348561759729272, "grad_norm": 1.25, "learning_rate": 0.00026450000000000003, "loss": 6.3421, "mean_token_accuracy": 0.10815011188387871, "num_tokens": 1466487.0, "step": 530 }, { "entropy": 6.666443109512329, "epoch": 0.014483925549915398, "grad_norm": 1.140625, "learning_rate": 0.00026700000000000004, "loss": 6.4193, "mean_token_accuracy": 0.107712272554636, "num_tokens": 1480142.0, "step": 535 }, { "entropy": 6.692905330657959, "epoch": 0.014619289340101522, "grad_norm": 1.2109375, "learning_rate": 0.00026950000000000005, "loss": 6.3428, "mean_token_accuracy": 0.1036965548992157, "num_tokens": 1493427.0, "step": 540 }, { "entropy": 6.6241538524627686, "epoch": 0.014754653130287648, "grad_norm": 1.21875, "learning_rate": 0.00027200000000000005, "loss": 6.3301, "mean_token_accuracy": 0.11499745398759842, "num_tokens": 1506055.0, "step": 545 }, { "entropy": 6.726637983322144, "epoch": 0.014890016920473773, "grad_norm": 1.15625, "learning_rate": 0.0002745, "loss": 6.4916, "mean_token_accuracy": 0.10548164397478103, "num_tokens": 1519239.0, "step": 550 }, { "entropy": 6.79321608543396, "epoch": 0.015025380710659899, "grad_norm": 1.2109375, "learning_rate": 0.000277, "loss": 6.4433, "mean_token_accuracy": 0.10511932224035263, "num_tokens": 1533630.0, "step": 555 }, { "entropy": 6.68529486656189, "epoch": 0.015160744500846023, "grad_norm": 1.4375, "learning_rate": 0.0002795, "loss": 6.3701, "mean_token_accuracy": 0.11614254266023635, "num_tokens": 1546749.0, "step": 560 }, { "entropy": 6.61783242225647, "epoch": 0.015296108291032149, "grad_norm": 1.1796875, "learning_rate": 0.00028199999999999997, "loss": 6.3126, "mean_token_accuracy": 0.11469681560993195, "num_tokens": 1560568.0, "step": 565 }, { "entropy": 6.697822999954224, "epoch": 0.015431472081218273, "grad_norm": 1.2734375, "learning_rate": 0.0002845, "loss": 6.383, "mean_token_accuracy": 0.10437465310096741, "num_tokens": 1574414.0, "step": 570 }, { "entropy": 6.622760200500489, "epoch": 0.0155668358714044, "grad_norm": 1.0625, "learning_rate": 0.000287, "loss": 6.3839, "mean_token_accuracy": 0.10195678994059562, "num_tokens": 1588906.0, "step": 575 }, { "entropy": 6.643900966644287, "epoch": 0.015702199661590525, "grad_norm": 1.0390625, "learning_rate": 0.0002895, "loss": 6.3656, "mean_token_accuracy": 0.11110272482037545, "num_tokens": 1603181.0, "step": 580 }, { "entropy": 6.722048425674439, "epoch": 0.01583756345177665, "grad_norm": 1.109375, "learning_rate": 0.000292, "loss": 6.365, "mean_token_accuracy": 0.1083282358944416, "num_tokens": 1617262.0, "step": 585 }, { "entropy": 6.704953336715699, "epoch": 0.015972927241962774, "grad_norm": 1.21875, "learning_rate": 0.0002945, "loss": 6.4147, "mean_token_accuracy": 0.10933435037732124, "num_tokens": 1631618.0, "step": 590 }, { "entropy": 6.532735300064087, "epoch": 0.016108291032148902, "grad_norm": 1.28125, "learning_rate": 0.000297, "loss": 6.1685, "mean_token_accuracy": 0.11916324943304062, "num_tokens": 1644717.0, "step": 595 }, { "entropy": 6.565193223953247, "epoch": 0.016243654822335026, "grad_norm": 1.0625, "learning_rate": 0.0002995, "loss": 6.3201, "mean_token_accuracy": 0.1078986182808876, "num_tokens": 1661888.0, "step": 600 }, { "entropy": 6.5602422714233395, "epoch": 0.01637901861252115, "grad_norm": 1.3203125, "learning_rate": 0.000302, "loss": 6.3369, "mean_token_accuracy": 0.11532969921827316, "num_tokens": 1676103.0, "step": 605 }, { "entropy": 6.621259689331055, "epoch": 0.016514382402707275, "grad_norm": 1.1796875, "learning_rate": 0.0003045, "loss": 6.3879, "mean_token_accuracy": 0.10770049318671227, "num_tokens": 1690902.0, "step": 610 }, { "entropy": 6.530938911437988, "epoch": 0.016649746192893403, "grad_norm": 1.140625, "learning_rate": 0.000307, "loss": 6.3262, "mean_token_accuracy": 0.11129384264349937, "num_tokens": 1705861.0, "step": 615 }, { "entropy": 6.601020479202271, "epoch": 0.016785109983079527, "grad_norm": 1.1796875, "learning_rate": 0.0003095, "loss": 6.2688, "mean_token_accuracy": 0.1109300784766674, "num_tokens": 1719893.0, "step": 620 }, { "entropy": 6.542957210540772, "epoch": 0.01692047377326565, "grad_norm": 1.2109375, "learning_rate": 0.000312, "loss": 6.2874, "mean_token_accuracy": 0.10827434211969375, "num_tokens": 1733411.0, "step": 625 }, { "entropy": 6.561354637145996, "epoch": 0.017055837563451776, "grad_norm": 1.2421875, "learning_rate": 0.0003145, "loss": 6.2397, "mean_token_accuracy": 0.11391478329896927, "num_tokens": 1747374.0, "step": 630 }, { "entropy": 6.587129735946656, "epoch": 0.017191201353637903, "grad_norm": 1.0546875, "learning_rate": 0.000317, "loss": 6.3487, "mean_token_accuracy": 0.11469378024339676, "num_tokens": 1761520.0, "step": 635 }, { "entropy": 6.594478893280029, "epoch": 0.017326565143824028, "grad_norm": 1.1796875, "learning_rate": 0.0003195, "loss": 6.3577, "mean_token_accuracy": 0.10972927659749984, "num_tokens": 1777499.0, "step": 640 }, { "entropy": 6.581266975402832, "epoch": 0.017461928934010152, "grad_norm": 1.1015625, "learning_rate": 0.000322, "loss": 6.2463, "mean_token_accuracy": 0.12096798866987228, "num_tokens": 1791308.0, "step": 645 }, { "entropy": 6.4111003398895265, "epoch": 0.017597292724196276, "grad_norm": 1.25, "learning_rate": 0.00032450000000000003, "loss": 6.1953, "mean_token_accuracy": 0.11683537811040878, "num_tokens": 1804545.0, "step": 650 }, { "entropy": 6.54813027381897, "epoch": 0.017732656514382404, "grad_norm": 1.2421875, "learning_rate": 0.00032700000000000003, "loss": 6.2866, "mean_token_accuracy": 0.11415853798389435, "num_tokens": 1818499.0, "step": 655 }, { "entropy": 6.5606420040130615, "epoch": 0.01786802030456853, "grad_norm": 1.125, "learning_rate": 0.00032950000000000004, "loss": 6.2876, "mean_token_accuracy": 0.10897349566221237, "num_tokens": 1833582.0, "step": 660 }, { "entropy": 6.524020147323609, "epoch": 0.018003384094754653, "grad_norm": 1.296875, "learning_rate": 0.00033200000000000005, "loss": 6.26, "mean_token_accuracy": 0.11666257977485657, "num_tokens": 1847514.0, "step": 665 }, { "entropy": 6.450877380371094, "epoch": 0.018138747884940777, "grad_norm": 1.2109375, "learning_rate": 0.00033450000000000005, "loss": 6.2948, "mean_token_accuracy": 0.11785768866539001, "num_tokens": 1860177.0, "step": 670 }, { "entropy": 6.518109226226807, "epoch": 0.018274111675126905, "grad_norm": 1.21875, "learning_rate": 0.000337, "loss": 6.3086, "mean_token_accuracy": 0.11776039749383926, "num_tokens": 1873317.0, "step": 675 }, { "entropy": 6.405819511413574, "epoch": 0.01840947546531303, "grad_norm": 1.1640625, "learning_rate": 0.0003395, "loss": 6.1447, "mean_token_accuracy": 0.11899075359106064, "num_tokens": 1885974.0, "step": 680 }, { "entropy": 6.473683166503906, "epoch": 0.018544839255499154, "grad_norm": 1.125, "learning_rate": 0.000342, "loss": 6.3167, "mean_token_accuracy": 0.11156651675701142, "num_tokens": 1901894.0, "step": 685 }, { "entropy": 6.5223006248474125, "epoch": 0.018680203045685278, "grad_norm": 1.234375, "learning_rate": 0.00034449999999999997, "loss": 6.2982, "mean_token_accuracy": 0.11568359285593033, "num_tokens": 1916276.0, "step": 690 }, { "entropy": 6.437406921386719, "epoch": 0.018815566835871406, "grad_norm": 1.09375, "learning_rate": 0.000347, "loss": 6.3, "mean_token_accuracy": 0.10904626250267029, "num_tokens": 1929574.0, "step": 695 }, { "entropy": 6.493116617202759, "epoch": 0.01895093062605753, "grad_norm": 1.2265625, "learning_rate": 0.0003495, "loss": 6.2389, "mean_token_accuracy": 0.10819176211953163, "num_tokens": 1943220.0, "step": 700 }, { "entropy": 6.54621901512146, "epoch": 0.019086294416243654, "grad_norm": 1.2265625, "learning_rate": 0.000352, "loss": 6.2556, "mean_token_accuracy": 0.10982774049043656, "num_tokens": 1957834.0, "step": 705 }, { "entropy": 6.512110996246338, "epoch": 0.01922165820642978, "grad_norm": 1.1015625, "learning_rate": 0.0003545, "loss": 6.3302, "mean_token_accuracy": 0.11116872280836106, "num_tokens": 1972649.0, "step": 710 }, { "entropy": 6.418754625320434, "epoch": 0.019357021996615906, "grad_norm": 1.265625, "learning_rate": 0.000357, "loss": 6.1538, "mean_token_accuracy": 0.12162703573703766, "num_tokens": 1984181.0, "step": 715 }, { "entropy": 6.399659919738769, "epoch": 0.01949238578680203, "grad_norm": 0.92578125, "learning_rate": 0.0003595, "loss": 6.2047, "mean_token_accuracy": 0.11393127739429473, "num_tokens": 2000616.0, "step": 720 }, { "entropy": 6.4549713134765625, "epoch": 0.019627749576988155, "grad_norm": 1.109375, "learning_rate": 0.000362, "loss": 6.1698, "mean_token_accuracy": 0.11860272511839867, "num_tokens": 2015344.0, "step": 725 }, { "entropy": 6.458272075653076, "epoch": 0.01976311336717428, "grad_norm": 1.15625, "learning_rate": 0.0003645, "loss": 6.2536, "mean_token_accuracy": 0.11021775305271149, "num_tokens": 2029823.0, "step": 730 }, { "entropy": 6.360110950469971, "epoch": 0.019898477157360407, "grad_norm": 1.234375, "learning_rate": 0.000367, "loss": 6.1363, "mean_token_accuracy": 0.11379259899258613, "num_tokens": 2043680.0, "step": 735 }, { "entropy": 6.4546263217926025, "epoch": 0.02003384094754653, "grad_norm": 1.2890625, "learning_rate": 0.0003695, "loss": 6.2118, "mean_token_accuracy": 0.11678453311324119, "num_tokens": 2056211.0, "step": 740 }, { "entropy": 6.301215696334839, "epoch": 0.020169204737732656, "grad_norm": 1.3125, "learning_rate": 0.000372, "loss": 6.2223, "mean_token_accuracy": 0.11474345549941063, "num_tokens": 2069775.0, "step": 745 }, { "entropy": 6.343719387054444, "epoch": 0.02030456852791878, "grad_norm": 1.2109375, "learning_rate": 0.0003745, "loss": 6.0669, "mean_token_accuracy": 0.12363717705011368, "num_tokens": 2084423.0, "step": 750 }, { "entropy": 6.379573202133178, "epoch": 0.020439932318104908, "grad_norm": 1.03125, "learning_rate": 0.000377, "loss": 6.2006, "mean_token_accuracy": 0.11517359465360641, "num_tokens": 2099702.0, "step": 755 }, { "entropy": 6.35660948753357, "epoch": 0.020575296108291032, "grad_norm": 0.98046875, "learning_rate": 0.0003795, "loss": 6.1424, "mean_token_accuracy": 0.116712386906147, "num_tokens": 2114938.0, "step": 760 }, { "entropy": 6.33174843788147, "epoch": 0.020710659898477157, "grad_norm": 1.09375, "learning_rate": 0.000382, "loss": 6.0715, "mean_token_accuracy": 0.12017848417162895, "num_tokens": 2128039.0, "step": 765 }, { "entropy": 6.483924388885498, "epoch": 0.02084602368866328, "grad_norm": 1.109375, "learning_rate": 0.0003845, "loss": 6.2675, "mean_token_accuracy": 0.11350229382514954, "num_tokens": 2144244.0, "step": 770 }, { "entropy": 6.299388790130616, "epoch": 0.02098138747884941, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 6.0745, "mean_token_accuracy": 0.12214050814509392, "num_tokens": 2156050.0, "step": 775 }, { "entropy": 6.339807558059692, "epoch": 0.021116751269035533, "grad_norm": 1.0703125, "learning_rate": 0.00038950000000000003, "loss": 6.1324, "mean_token_accuracy": 0.11614297851920127, "num_tokens": 2170083.0, "step": 780 }, { "entropy": 6.346547555923462, "epoch": 0.021252115059221657, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.1194, "mean_token_accuracy": 0.12128575146198273, "num_tokens": 2184536.0, "step": 785 }, { "entropy": 6.332412433624268, "epoch": 0.021387478849407785, "grad_norm": 0.94140625, "learning_rate": 0.00039450000000000005, "loss": 6.1629, "mean_token_accuracy": 0.11224813610315323, "num_tokens": 2199324.0, "step": 790 }, { "entropy": 6.236615514755249, "epoch": 0.02152284263959391, "grad_norm": 1.0390625, "learning_rate": 0.00039700000000000005, "loss": 6.1244, "mean_token_accuracy": 0.1139693059027195, "num_tokens": 2215191.0, "step": 795 }, { "entropy": 6.423162221908569, "epoch": 0.021658206429780034, "grad_norm": 1.2109375, "learning_rate": 0.0003995, "loss": 6.1789, "mean_token_accuracy": 0.11178024560213089, "num_tokens": 2229354.0, "step": 800 }, { "entropy": 6.281933403015136, "epoch": 0.021793570219966158, "grad_norm": 1.0, "learning_rate": 0.000402, "loss": 6.1912, "mean_token_accuracy": 0.11805299371480941, "num_tokens": 2243804.0, "step": 805 }, { "entropy": 6.288844728469849, "epoch": 0.021928934010152286, "grad_norm": 1.140625, "learning_rate": 0.0004045, "loss": 6.0841, "mean_token_accuracy": 0.11569216102361679, "num_tokens": 2258267.0, "step": 810 }, { "entropy": 6.315207052230835, "epoch": 0.02206429780033841, "grad_norm": 1.0078125, "learning_rate": 0.00040699999999999997, "loss": 6.1319, "mean_token_accuracy": 0.12272850275039673, "num_tokens": 2271854.0, "step": 815 }, { "entropy": 6.263217782974243, "epoch": 0.022199661590524535, "grad_norm": 1.1484375, "learning_rate": 0.0004095, "loss": 6.1651, "mean_token_accuracy": 0.11350240483880043, "num_tokens": 2285897.0, "step": 820 }, { "entropy": 6.2891233444213865, "epoch": 0.02233502538071066, "grad_norm": 1.0703125, "learning_rate": 0.000412, "loss": 6.1208, "mean_token_accuracy": 0.11810638681054116, "num_tokens": 2299354.0, "step": 825 }, { "entropy": 6.323483896255493, "epoch": 0.022470389170896787, "grad_norm": 1.1171875, "learning_rate": 0.0004145, "loss": 6.1693, "mean_token_accuracy": 0.1183534987270832, "num_tokens": 2313111.0, "step": 830 }, { "entropy": 6.299751424789429, "epoch": 0.02260575296108291, "grad_norm": 1.21875, "learning_rate": 0.000417, "loss": 6.1459, "mean_token_accuracy": 0.12177513241767883, "num_tokens": 2325556.0, "step": 835 }, { "entropy": 6.354130220413208, "epoch": 0.022741116751269035, "grad_norm": 1.03125, "learning_rate": 0.0004195, "loss": 6.1991, "mean_token_accuracy": 0.11779833287000656, "num_tokens": 2340033.0, "step": 840 }, { "entropy": 6.290956926345825, "epoch": 0.02287648054145516, "grad_norm": 1.1015625, "learning_rate": 0.000422, "loss": 6.1439, "mean_token_accuracy": 0.12168726176023484, "num_tokens": 2353916.0, "step": 845 }, { "entropy": 6.26514630317688, "epoch": 0.023011844331641287, "grad_norm": 1.125, "learning_rate": 0.0004245, "loss": 6.1255, "mean_token_accuracy": 0.12298965677618981, "num_tokens": 2367161.0, "step": 850 }, { "entropy": 6.297455596923828, "epoch": 0.02314720812182741, "grad_norm": 1.0390625, "learning_rate": 0.000427, "loss": 6.1707, "mean_token_accuracy": 0.11453822180628777, "num_tokens": 2382562.0, "step": 855 }, { "entropy": 6.278497695922852, "epoch": 0.023282571912013536, "grad_norm": 1.21875, "learning_rate": 0.0004295, "loss": 6.084, "mean_token_accuracy": 0.12197378650307655, "num_tokens": 2395671.0, "step": 860 }, { "entropy": 6.201052713394165, "epoch": 0.02341793570219966, "grad_norm": 1.03125, "learning_rate": 0.000432, "loss": 6.1328, "mean_token_accuracy": 0.11925875097513199, "num_tokens": 2409902.0, "step": 865 }, { "entropy": 6.319374704360962, "epoch": 0.023553299492385788, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 6.1155, "mean_token_accuracy": 0.11418568938970566, "num_tokens": 2424405.0, "step": 870 }, { "entropy": 6.211519432067871, "epoch": 0.023688663282571912, "grad_norm": 1.0078125, "learning_rate": 0.000437, "loss": 6.0401, "mean_token_accuracy": 0.11908271163702011, "num_tokens": 2440256.0, "step": 875 }, { "entropy": 6.258747959136963, "epoch": 0.023824027072758037, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 6.1066, "mean_token_accuracy": 0.11787782683968544, "num_tokens": 2453224.0, "step": 880 }, { "entropy": 6.132023286819458, "epoch": 0.02395939086294416, "grad_norm": 1.0703125, "learning_rate": 0.000442, "loss": 5.9843, "mean_token_accuracy": 0.1226534366607666, "num_tokens": 2468101.0, "step": 885 }, { "entropy": 6.3332679271698, "epoch": 0.02409475465313029, "grad_norm": 0.99609375, "learning_rate": 0.0004445, "loss": 6.2065, "mean_token_accuracy": 0.12027881368994713, "num_tokens": 2483221.0, "step": 890 }, { "entropy": 6.218679809570313, "epoch": 0.024230118443316413, "grad_norm": 1.1796875, "learning_rate": 0.000447, "loss": 6.0992, "mean_token_accuracy": 0.11610312834382057, "num_tokens": 2496389.0, "step": 895 }, { "entropy": 6.1929422378540036, "epoch": 0.024365482233502538, "grad_norm": 1.1015625, "learning_rate": 0.00044950000000000003, "loss": 6.0435, "mean_token_accuracy": 0.11607689782977104, "num_tokens": 2510988.0, "step": 900 }, { "entropy": 6.248309087753296, "epoch": 0.024500846023688662, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 6.1425, "mean_token_accuracy": 0.12013140320777893, "num_tokens": 2525341.0, "step": 905 }, { "entropy": 6.198721647262573, "epoch": 0.02463620981387479, "grad_norm": 1.0859375, "learning_rate": 0.00045450000000000004, "loss": 6.1277, "mean_token_accuracy": 0.11830744370818139, "num_tokens": 2538706.0, "step": 910 }, { "entropy": 6.277400732040405, "epoch": 0.024771573604060914, "grad_norm": 1.0625, "learning_rate": 0.00045700000000000005, "loss": 6.1407, "mean_token_accuracy": 0.1180431790649891, "num_tokens": 2554056.0, "step": 915 }, { "entropy": 6.122376012802124, "epoch": 0.02490693739424704, "grad_norm": 1.2109375, "learning_rate": 0.00045950000000000006, "loss": 6.0363, "mean_token_accuracy": 0.12817837595939635, "num_tokens": 2569073.0, "step": 920 }, { "entropy": 6.23994255065918, "epoch": 0.025042301184433163, "grad_norm": 1.1328125, "learning_rate": 0.000462, "loss": 6.0807, "mean_token_accuracy": 0.12659804597496987, "num_tokens": 2582519.0, "step": 925 }, { "entropy": 6.254793930053711, "epoch": 0.02517766497461929, "grad_norm": 1.0390625, "learning_rate": 0.0004645, "loss": 6.138, "mean_token_accuracy": 0.11910348609089852, "num_tokens": 2597308.0, "step": 930 }, { "entropy": 6.186693382263184, "epoch": 0.025313028764805415, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 6.1146, "mean_token_accuracy": 0.12513377815485, "num_tokens": 2610388.0, "step": 935 }, { "entropy": 6.133151054382324, "epoch": 0.02544839255499154, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 5.9744, "mean_token_accuracy": 0.1229440450668335, "num_tokens": 2624701.0, "step": 940 }, { "entropy": 6.227858448028565, "epoch": 0.025583756345177663, "grad_norm": 1.1328125, "learning_rate": 0.000472, "loss": 6.1629, "mean_token_accuracy": 0.11275116056203842, "num_tokens": 2639582.0, "step": 945 }, { "entropy": 6.088177108764649, "epoch": 0.02571912013536379, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 5.9973, "mean_token_accuracy": 0.12648221775889396, "num_tokens": 2653808.0, "step": 950 }, { "entropy": 6.13272876739502, "epoch": 0.025854483925549916, "grad_norm": 1.0859375, "learning_rate": 0.000477, "loss": 6.001, "mean_token_accuracy": 0.12153996378183365, "num_tokens": 2667423.0, "step": 955 }, { "entropy": 6.150818300247193, "epoch": 0.02598984771573604, "grad_norm": 1.0625, "learning_rate": 0.0004795, "loss": 6.0237, "mean_token_accuracy": 0.12148027569055557, "num_tokens": 2683296.0, "step": 960 }, { "entropy": 6.043711376190186, "epoch": 0.026125211505922164, "grad_norm": 1.1640625, "learning_rate": 0.000482, "loss": 5.9768, "mean_token_accuracy": 0.13035187423229216, "num_tokens": 2697230.0, "step": 965 }, { "entropy": 6.165330123901367, "epoch": 0.026260575296108292, "grad_norm": 1.140625, "learning_rate": 0.0004845, "loss": 5.9685, "mean_token_accuracy": 0.1219008818268776, "num_tokens": 2711689.0, "step": 970 }, { "entropy": 6.072505140304566, "epoch": 0.026395939086294416, "grad_norm": 1.0234375, "learning_rate": 0.000487, "loss": 6.0051, "mean_token_accuracy": 0.12370155230164528, "num_tokens": 2725786.0, "step": 975 }, { "entropy": 6.097587728500367, "epoch": 0.02653130287648054, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 6.0078, "mean_token_accuracy": 0.12946900948882104, "num_tokens": 2739444.0, "step": 980 }, { "entropy": 6.165721845626831, "epoch": 0.02666666666666667, "grad_norm": 0.9140625, "learning_rate": 0.000492, "loss": 5.9966, "mean_token_accuracy": 0.12653872296214103, "num_tokens": 2754692.0, "step": 985 }, { "entropy": 6.010534715652466, "epoch": 0.026802030456852793, "grad_norm": 1.0625, "learning_rate": 0.0004945, "loss": 5.9195, "mean_token_accuracy": 0.1301392510533333, "num_tokens": 2767847.0, "step": 990 }, { "entropy": 6.176916885375976, "epoch": 0.026937394247038917, "grad_norm": 0.984375, "learning_rate": 0.000497, "loss": 6.147, "mean_token_accuracy": 0.11529367789626122, "num_tokens": 2783919.0, "step": 995 }, { "entropy": 6.178207778930664, "epoch": 0.02707275803722504, "grad_norm": 1.0390625, "learning_rate": 0.0004995, "loss": 6.049, "mean_token_accuracy": 0.11618730947375297, "num_tokens": 2797758.0, "step": 1000 }, { "entropy": 6.0772298812866214, "epoch": 0.02720812182741117, "grad_norm": 1.1640625, "learning_rate": 0.000499998026082006, "loss": 5.9816, "mean_token_accuracy": 0.12454243823885917, "num_tokens": 2811266.0, "step": 1005 }, { "entropy": 6.178618955612182, "epoch": 0.027343485617597293, "grad_norm": 1.0234375, "learning_rate": 0.0004999900070995136, "loss": 6.1008, "mean_token_accuracy": 0.12391449511051178, "num_tokens": 2825546.0, "step": 1010 }, { "entropy": 6.09156231880188, "epoch": 0.027478849407783418, "grad_norm": 1.1484375, "learning_rate": 0.0004999758199023239, "loss": 6.0494, "mean_token_accuracy": 0.12795282825827597, "num_tokens": 2840284.0, "step": 1015 }, { "entropy": 6.100447702407837, "epoch": 0.027614213197969542, "grad_norm": 1.1875, "learning_rate": 0.0004999554648793858, "loss": 6.0469, "mean_token_accuracy": 0.12443553805351257, "num_tokens": 2851891.0, "step": 1020 }, { "entropy": 6.141157817840576, "epoch": 0.02774957698815567, "grad_norm": 1.203125, "learning_rate": 0.0004999289425887425, "loss": 5.9993, "mean_token_accuracy": 0.12068658322095871, "num_tokens": 2864393.0, "step": 1025 }, { "entropy": 6.0899200439453125, "epoch": 0.027884940778341794, "grad_norm": 1.0390625, "learning_rate": 0.0004998962537575161, "loss": 6.0697, "mean_token_accuracy": 0.12269674092531205, "num_tokens": 2878581.0, "step": 1030 }, { "entropy": 6.183287048339844, "epoch": 0.02802030456852792, "grad_norm": 1.0234375, "learning_rate": 0.0004998573992818874, "loss": 6.1252, "mean_token_accuracy": 0.12084309384226799, "num_tokens": 2891217.0, "step": 1035 }, { "entropy": 6.048014736175537, "epoch": 0.028155668358714043, "grad_norm": 1.140625, "learning_rate": 0.0004998123802270715, "loss": 5.9877, "mean_token_accuracy": 0.1275292307138443, "num_tokens": 2902261.0, "step": 1040 }, { "entropy": 6.180945777893067, "epoch": 0.02829103214890017, "grad_norm": 1.15625, "learning_rate": 0.0004997611978272886, "loss": 6.0715, "mean_token_accuracy": 0.1172533318400383, "num_tokens": 2915455.0, "step": 1045 }, { "entropy": 6.057958126068115, "epoch": 0.028426395939086295, "grad_norm": 1.0546875, "learning_rate": 0.0004997038534857298, "loss": 6.0513, "mean_token_accuracy": 0.11567913889884948, "num_tokens": 2930873.0, "step": 1050 }, { "entropy": 6.126917505264283, "epoch": 0.02856175972927242, "grad_norm": 1.0390625, "learning_rate": 0.0004996403487745194, "loss": 6.0191, "mean_token_accuracy": 0.12455897256731988, "num_tokens": 2945768.0, "step": 1055 }, { "entropy": 6.160192489624023, "epoch": 0.028697123519458544, "grad_norm": 1.1015625, "learning_rate": 0.000499570685434671, "loss": 6.0718, "mean_token_accuracy": 0.12326753437519074, "num_tokens": 2960052.0, "step": 1060 }, { "entropy": 6.049477672576904, "epoch": 0.02883248730964467, "grad_norm": 1.1484375, "learning_rate": 0.0004994948653760405, "loss": 5.907, "mean_token_accuracy": 0.12975608184933662, "num_tokens": 2974252.0, "step": 1065 }, { "entropy": 5.922494602203369, "epoch": 0.028967851099830796, "grad_norm": 1.03125, "learning_rate": 0.0004994128906772729, "loss": 5.9723, "mean_token_accuracy": 0.12408508732914925, "num_tokens": 2988414.0, "step": 1070 }, { "entropy": 6.076635503768921, "epoch": 0.02910321489001692, "grad_norm": 0.94140625, "learning_rate": 0.000499324763585746, "loss": 6.0159, "mean_token_accuracy": 0.12376472353935242, "num_tokens": 3005833.0, "step": 1075 }, { "entropy": 6.0643566131591795, "epoch": 0.029238578680203044, "grad_norm": 0.91796875, "learning_rate": 0.0004992304865175085, "loss": 6.0162, "mean_token_accuracy": 0.11739084795117379, "num_tokens": 3019722.0, "step": 1080 }, { "entropy": 6.0612537384033205, "epoch": 0.029373942470389172, "grad_norm": 1.015625, "learning_rate": 0.0004991300620572138, "loss": 5.9597, "mean_token_accuracy": 0.12137619629502297, "num_tokens": 3033643.0, "step": 1085 }, { "entropy": 6.003667545318604, "epoch": 0.029509306260575296, "grad_norm": 1.0234375, "learning_rate": 0.0004990234929580494, "loss": 5.9007, "mean_token_accuracy": 0.12919754460453986, "num_tokens": 3047311.0, "step": 1090 }, { "entropy": 6.16131591796875, "epoch": 0.02964467005076142, "grad_norm": 1.1875, "learning_rate": 0.0004989107821416609, "loss": 6.0886, "mean_token_accuracy": 0.12004212662577629, "num_tokens": 3062823.0, "step": 1095 }, { "entropy": 6.068430328369141, "epoch": 0.029780033840947545, "grad_norm": 1.0625, "learning_rate": 0.0004987919326980723, "loss": 5.9748, "mean_token_accuracy": 0.13052917644381523, "num_tokens": 3076828.0, "step": 1100 }, { "entropy": 5.9808131694793705, "epoch": 0.029915397631133673, "grad_norm": 1.1796875, "learning_rate": 0.0004986669478856011, "loss": 5.9151, "mean_token_accuracy": 0.132940074801445, "num_tokens": 3089369.0, "step": 1105 }, { "entropy": 6.049989414215088, "epoch": 0.030050761421319797, "grad_norm": 1.1484375, "learning_rate": 0.0004985358311307688, "loss": 6.0077, "mean_token_accuracy": 0.13002250343561172, "num_tokens": 3100518.0, "step": 1110 }, { "entropy": 6.067233991622925, "epoch": 0.03018612521150592, "grad_norm": 1.1484375, "learning_rate": 0.0004983985860282081, "loss": 5.9342, "mean_token_accuracy": 0.1303796499967575, "num_tokens": 3113599.0, "step": 1115 }, { "entropy": 5.986032724380493, "epoch": 0.030321489001692046, "grad_norm": 0.9765625, "learning_rate": 0.0004982552163405623, "loss": 5.9344, "mean_token_accuracy": 0.13099692836403848, "num_tokens": 3126725.0, "step": 1120 }, { "entropy": 6.01772027015686, "epoch": 0.030456852791878174, "grad_norm": 1.1171875, "learning_rate": 0.0004981057259983839, "loss": 5.9407, "mean_token_accuracy": 0.13005468547344207, "num_tokens": 3140170.0, "step": 1125 }, { "entropy": 5.947785377502441, "epoch": 0.030592216582064298, "grad_norm": 0.953125, "learning_rate": 0.0004979501191000262, "loss": 5.9137, "mean_token_accuracy": 0.12703290432691575, "num_tokens": 3154154.0, "step": 1130 }, { "entropy": 6.0017212390899655, "epoch": 0.030727580372250422, "grad_norm": 0.98046875, "learning_rate": 0.0004977883999115311, "loss": 5.9814, "mean_token_accuracy": 0.12780916765332223, "num_tokens": 3170061.0, "step": 1135 }, { "entropy": 6.102719736099243, "epoch": 0.030862944162436547, "grad_norm": 1.1875, "learning_rate": 0.0004976205728665113, "loss": 6.0419, "mean_token_accuracy": 0.12874573692679406, "num_tokens": 3183167.0, "step": 1140 }, { "entropy": 5.993436717987061, "epoch": 0.030998307952622674, "grad_norm": 1.046875, "learning_rate": 0.0004974466425660307, "loss": 6.1286, "mean_token_accuracy": 0.1163134016096592, "num_tokens": 3197764.0, "step": 1145 }, { "entropy": 6.101684427261352, "epoch": 0.0311336717428088, "grad_norm": 0.9375, "learning_rate": 0.0004972666137784759, "loss": 5.8899, "mean_token_accuracy": 0.12967644035816192, "num_tokens": 3212909.0, "step": 1150 }, { "entropy": 6.056351280212402, "epoch": 0.03126903553299493, "grad_norm": 1.1640625, "learning_rate": 0.0004970804914394271, "loss": 6.0213, "mean_token_accuracy": 0.12962342649698258, "num_tokens": 3224140.0, "step": 1155 }, { "entropy": 5.998062562942505, "epoch": 0.03140439932318105, "grad_norm": 1.15625, "learning_rate": 0.0004968882806515225, "loss": 5.959, "mean_token_accuracy": 0.13079651519656182, "num_tokens": 3237827.0, "step": 1160 }, { "entropy": 6.0129087448120115, "epoch": 0.031539763113367175, "grad_norm": 1.1015625, "learning_rate": 0.0004966899866843177, "loss": 5.9242, "mean_token_accuracy": 0.12941501662135124, "num_tokens": 3250552.0, "step": 1165 }, { "entropy": 5.929322099685669, "epoch": 0.0316751269035533, "grad_norm": 1.1171875, "learning_rate": 0.000496485614974142, "loss": 5.9082, "mean_token_accuracy": 0.13116575181484222, "num_tokens": 3265108.0, "step": 1170 }, { "entropy": 5.910490798950195, "epoch": 0.031810490693739424, "grad_norm": 1.1171875, "learning_rate": 0.0004962751711239492, "loss": 5.8957, "mean_token_accuracy": 0.13716685473918916, "num_tokens": 3277399.0, "step": 1175 }, { "entropy": 5.90950288772583, "epoch": 0.03194585448392555, "grad_norm": 0.96875, "learning_rate": 0.0004960586609031636, "loss": 5.8656, "mean_token_accuracy": 0.13133470267057418, "num_tokens": 3292261.0, "step": 1180 }, { "entropy": 6.02558069229126, "epoch": 0.03208121827411167, "grad_norm": 1.015625, "learning_rate": 0.0004958360902475224, "loss": 5.9481, "mean_token_accuracy": 0.12776122540235518, "num_tokens": 3305914.0, "step": 1185 }, { "entropy": 5.877729225158691, "epoch": 0.032216582064297804, "grad_norm": 1.046875, "learning_rate": 0.0004956074652589125, "loss": 5.8461, "mean_token_accuracy": 0.13402740731835366, "num_tokens": 3319731.0, "step": 1190 }, { "entropy": 5.983613348007202, "epoch": 0.03235194585448393, "grad_norm": 0.91796875, "learning_rate": 0.0004953727922052035, "loss": 5.9026, "mean_token_accuracy": 0.1287564866244793, "num_tokens": 3335865.0, "step": 1195 }, { "entropy": 5.955887413024902, "epoch": 0.03248730964467005, "grad_norm": 1.0, "learning_rate": 0.0004951320775200756, "loss": 5.8795, "mean_token_accuracy": 0.13347595036029816, "num_tokens": 3350692.0, "step": 1200 }, { "entropy": 5.869665241241455, "epoch": 0.03262267343485618, "grad_norm": 1.0625, "learning_rate": 0.0004948853278028436, "loss": 5.8414, "mean_token_accuracy": 0.1349584087729454, "num_tokens": 3364477.0, "step": 1205 }, { "entropy": 6.077768468856812, "epoch": 0.0327580372250423, "grad_norm": 1.015625, "learning_rate": 0.0004946325498182755, "loss": 6.0202, "mean_token_accuracy": 0.13227369338274003, "num_tokens": 3377976.0, "step": 1210 }, { "entropy": 5.928851127624512, "epoch": 0.032893401015228425, "grad_norm": 1.1328125, "learning_rate": 0.0004943737504964076, "loss": 5.8941, "mean_token_accuracy": 0.13219523280858994, "num_tokens": 3391797.0, "step": 1215 }, { "entropy": 5.968907499313355, "epoch": 0.03302876480541455, "grad_norm": 1.046875, "learning_rate": 0.000494108936932354, "loss": 5.904, "mean_token_accuracy": 0.1308644212782383, "num_tokens": 3406175.0, "step": 1220 }, { "entropy": 5.953116321563721, "epoch": 0.033164128595600674, "grad_norm": 1.0078125, "learning_rate": 0.0004938381163861124, "loss": 5.8953, "mean_token_accuracy": 0.13571116998791694, "num_tokens": 3419314.0, "step": 1225 }, { "entropy": 5.968687200546265, "epoch": 0.033299492385786805, "grad_norm": 0.91015625, "learning_rate": 0.0004935612962823645, "loss": 5.9639, "mean_token_accuracy": 0.12865443304181098, "num_tokens": 3436286.0, "step": 1230 }, { "entropy": 5.994656372070312, "epoch": 0.03343485617597293, "grad_norm": 1.046875, "learning_rate": 0.0004932784842102739, "loss": 5.9152, "mean_token_accuracy": 0.13279383033514022, "num_tokens": 3450743.0, "step": 1235 }, { "entropy": 5.880604553222656, "epoch": 0.033570219966159054, "grad_norm": 0.96484375, "learning_rate": 0.0004929896879232758, "loss": 5.9593, "mean_token_accuracy": 0.1276319444179535, "num_tokens": 3465265.0, "step": 1240 }, { "entropy": 6.054373121261596, "epoch": 0.03370558375634518, "grad_norm": 1.046875, "learning_rate": 0.0004926949153388668, "loss": 5.9635, "mean_token_accuracy": 0.13033603355288506, "num_tokens": 3479850.0, "step": 1245 }, { "entropy": 6.004738473892212, "epoch": 0.0338409475465313, "grad_norm": 0.93359375, "learning_rate": 0.0004923941745383859, "loss": 6.0149, "mean_token_accuracy": 0.12755341306328774, "num_tokens": 3494388.0, "step": 1250 }, { "entropy": 6.05593056678772, "epoch": 0.03397631133671743, "grad_norm": 1.0234375, "learning_rate": 0.000492087473766794, "loss": 5.9944, "mean_token_accuracy": 0.129459198564291, "num_tokens": 3508609.0, "step": 1255 }, { "entropy": 5.989010000228882, "epoch": 0.03411167512690355, "grad_norm": 0.84765625, "learning_rate": 0.000491774821432448, "loss": 5.9484, "mean_token_accuracy": 0.12573069110512733, "num_tokens": 3524252.0, "step": 1260 }, { "entropy": 5.86044340133667, "epoch": 0.034247038917089676, "grad_norm": 0.91796875, "learning_rate": 0.0004914562261068693, "loss": 5.8538, "mean_token_accuracy": 0.13299454674124717, "num_tokens": 3540431.0, "step": 1265 }, { "entropy": 5.977858638763427, "epoch": 0.03438240270727581, "grad_norm": 1.0234375, "learning_rate": 0.0004911316965245098, "loss": 5.936, "mean_token_accuracy": 0.1308388702571392, "num_tokens": 3555452.0, "step": 1270 }, { "entropy": 5.904463481903076, "epoch": 0.03451776649746193, "grad_norm": 0.94921875, "learning_rate": 0.000490801241582512, "loss": 5.8326, "mean_token_accuracy": 0.13622485026717185, "num_tokens": 3569414.0, "step": 1275 }, { "entropy": 5.986747741699219, "epoch": 0.034653130287648055, "grad_norm": 1.1484375, "learning_rate": 0.000490464870340465, "loss": 6.0092, "mean_token_accuracy": 0.12418872565031051, "num_tokens": 3585926.0, "step": 1280 }, { "entropy": 5.979127502441406, "epoch": 0.03478849407783418, "grad_norm": 1.0703125, "learning_rate": 0.0004901225920201563, "loss": 5.8517, "mean_token_accuracy": 0.12628912925720215, "num_tokens": 3598692.0, "step": 1285 }, { "entropy": 5.866104936599731, "epoch": 0.034923857868020304, "grad_norm": 1.1015625, "learning_rate": 0.000489774416005319, "loss": 5.8145, "mean_token_accuracy": 0.13827023953199385, "num_tokens": 3610579.0, "step": 1290 }, { "entropy": 5.940866851806641, "epoch": 0.03505922165820643, "grad_norm": 1.0, "learning_rate": 0.0004894203518413742, "loss": 5.8967, "mean_token_accuracy": 0.13155581057071686, "num_tokens": 3622955.0, "step": 1295 }, { "entropy": 5.965740633010864, "epoch": 0.03519458544839255, "grad_norm": 1.1328125, "learning_rate": 0.0004890604092351701, "loss": 5.848, "mean_token_accuracy": 0.13300148025155067, "num_tokens": 3636465.0, "step": 1300 }, { "entropy": 5.9097521781921385, "epoch": 0.03532994923857868, "grad_norm": 0.93359375, "learning_rate": 0.000488694598054715, "loss": 5.8418, "mean_token_accuracy": 0.13007594645023346, "num_tokens": 3650490.0, "step": 1305 }, { "entropy": 5.989442920684814, "epoch": 0.03546531302876481, "grad_norm": 0.96484375, "learning_rate": 0.0004883229283289071, "loss": 5.9325, "mean_token_accuracy": 0.13511626422405243, "num_tokens": 3666952.0, "step": 1310 }, { "entropy": 5.868106698989868, "epoch": 0.03560067681895093, "grad_norm": 0.88671875, "learning_rate": 0.00048794541024725993, "loss": 5.8828, "mean_token_accuracy": 0.13127233758568763, "num_tokens": 3681741.0, "step": 1315 }, { "entropy": 6.05716724395752, "epoch": 0.03573604060913706, "grad_norm": 0.98046875, "learning_rate": 0.0004875620541596221, "loss": 6.0203, "mean_token_accuracy": 0.12015189900994301, "num_tokens": 3696309.0, "step": 1320 }, { "entropy": 5.87901759147644, "epoch": 0.03587140439932318, "grad_norm": 1.0, "learning_rate": 0.00048717287057589454, "loss": 5.8183, "mean_token_accuracy": 0.13341830670833588, "num_tokens": 3710972.0, "step": 1325 }, { "entropy": 5.910233020782471, "epoch": 0.036006768189509306, "grad_norm": 1.046875, "learning_rate": 0.0004867778701657417, "loss": 5.8272, "mean_token_accuracy": 0.1385295033454895, "num_tokens": 3723619.0, "step": 1330 }, { "entropy": 5.879352235794068, "epoch": 0.03614213197969543, "grad_norm": 0.984375, "learning_rate": 0.00048637706375829955, "loss": 5.8317, "mean_token_accuracy": 0.13691574931144715, "num_tokens": 3736947.0, "step": 1335 }, { "entropy": 5.879655885696411, "epoch": 0.036277495769881554, "grad_norm": 1.0234375, "learning_rate": 0.000485970462341878, "loss": 5.8283, "mean_token_accuracy": 0.13367267698049545, "num_tokens": 3751488.0, "step": 1340 }, { "entropy": 5.861524868011474, "epoch": 0.03641285956006768, "grad_norm": 1.1015625, "learning_rate": 0.00048555807706366044, "loss": 5.8149, "mean_token_accuracy": 0.12982808873057367, "num_tokens": 3764169.0, "step": 1345 }, { "entropy": 5.923907041549683, "epoch": 0.03654822335025381, "grad_norm": 1.0390625, "learning_rate": 0.00048513991922939756, "loss": 5.8853, "mean_token_accuracy": 0.1327181950211525, "num_tokens": 3777786.0, "step": 1350 }, { "entropy": 5.872652530670166, "epoch": 0.036683587140439934, "grad_norm": 0.984375, "learning_rate": 0.00048471600030309744, "loss": 5.7489, "mean_token_accuracy": 0.13938361927866935, "num_tokens": 3793618.0, "step": 1355 }, { "entropy": 5.832516002655029, "epoch": 0.03681895093062606, "grad_norm": 0.953125, "learning_rate": 0.00048428633190671186, "loss": 5.7986, "mean_token_accuracy": 0.13645398393273353, "num_tokens": 3807477.0, "step": 1360 }, { "entropy": 5.874223041534424, "epoch": 0.03695431472081218, "grad_norm": 0.921875, "learning_rate": 0.0004838509258198167, "loss": 5.7628, "mean_token_accuracy": 0.1414404109120369, "num_tokens": 3821423.0, "step": 1365 }, { "entropy": 5.7999297142028805, "epoch": 0.03708967851099831, "grad_norm": 1.0703125, "learning_rate": 0.00048340979397929, "loss": 5.8377, "mean_token_accuracy": 0.13525271713733672, "num_tokens": 3835023.0, "step": 1370 }, { "entropy": 5.952495384216308, "epoch": 0.03722504230118443, "grad_norm": 0.98828125, "learning_rate": 0.00048296294847898386, "loss": 5.8599, "mean_token_accuracy": 0.13231865540146828, "num_tokens": 3849230.0, "step": 1375 }, { "entropy": 5.886288738250732, "epoch": 0.037360406091370556, "grad_norm": 1.09375, "learning_rate": 0.0004825104015693934, "loss": 5.8341, "mean_token_accuracy": 0.1299556814134121, "num_tokens": 3863884.0, "step": 1380 }, { "entropy": 5.7548364162445065, "epoch": 0.03749576988155669, "grad_norm": 1.1796875, "learning_rate": 0.0004820521656573208, "loss": 5.6259, "mean_token_accuracy": 0.14474526271224022, "num_tokens": 3875444.0, "step": 1385 }, { "entropy": 5.954405307769775, "epoch": 0.03763113367174281, "grad_norm": 1.046875, "learning_rate": 0.00048158825330553505, "loss": 5.9888, "mean_token_accuracy": 0.132489612698555, "num_tokens": 3888875.0, "step": 1390 }, { "entropy": 5.784528350830078, "epoch": 0.037766497461928936, "grad_norm": 1.0, "learning_rate": 0.00048111867723242763, "loss": 5.7374, "mean_token_accuracy": 0.13683436438441277, "num_tokens": 3904124.0, "step": 1395 }, { "entropy": 5.800213289260864, "epoch": 0.03790186125211506, "grad_norm": 0.99609375, "learning_rate": 0.0004806434503116637, "loss": 5.7543, "mean_token_accuracy": 0.1421910360455513, "num_tokens": 3917976.0, "step": 1400 }, { "entropy": 5.8708749294281, "epoch": 0.038037225042301184, "grad_norm": 0.98046875, "learning_rate": 0.0004801625855718296, "loss": 5.8518, "mean_token_accuracy": 0.13218354880809785, "num_tokens": 3932835.0, "step": 1405 }, { "entropy": 5.92179274559021, "epoch": 0.03817258883248731, "grad_norm": 0.95703125, "learning_rate": 0.00047967609619607477, "loss": 5.7986, "mean_token_accuracy": 0.14245062917470933, "num_tokens": 3945938.0, "step": 1410 }, { "entropy": 5.76557936668396, "epoch": 0.03830795262267343, "grad_norm": 1.1484375, "learning_rate": 0.0004791839955217513, "loss": 5.7599, "mean_token_accuracy": 0.14098661318421363, "num_tokens": 3958447.0, "step": 1415 }, { "entropy": 5.868845748901367, "epoch": 0.03844331641285956, "grad_norm": 1.015625, "learning_rate": 0.00047868629704004786, "loss": 5.871, "mean_token_accuracy": 0.13354070782661437, "num_tokens": 3972105.0, "step": 1420 }, { "entropy": 5.96793303489685, "epoch": 0.03857868020304569, "grad_norm": 1.0234375, "learning_rate": 0.00047818301439561965, "loss": 5.835, "mean_token_accuracy": 0.13661837428808213, "num_tokens": 3984935.0, "step": 1425 }, { "entropy": 5.800432634353638, "epoch": 0.03871404399323181, "grad_norm": 0.984375, "learning_rate": 0.00047767416138621454, "loss": 5.8082, "mean_token_accuracy": 0.13442106992006303, "num_tokens": 3998223.0, "step": 1430 }, { "entropy": 5.826992130279541, "epoch": 0.03884940778341794, "grad_norm": 0.953125, "learning_rate": 0.000477159751962295, "loss": 5.7446, "mean_token_accuracy": 0.14261322766542434, "num_tokens": 4012876.0, "step": 1435 }, { "entropy": 5.842947864532471, "epoch": 0.03898477157360406, "grad_norm": 1.015625, "learning_rate": 0.00047663980022665507, "loss": 5.7954, "mean_token_accuracy": 0.1379825048148632, "num_tokens": 4025607.0, "step": 1440 }, { "entropy": 5.807746267318725, "epoch": 0.039120135363790186, "grad_norm": 0.984375, "learning_rate": 0.00047611432043403437, "loss": 5.7896, "mean_token_accuracy": 0.13704527392983437, "num_tokens": 4038093.0, "step": 1445 }, { "entropy": 5.849174070358276, "epoch": 0.03925549915397631, "grad_norm": 0.92578125, "learning_rate": 0.0004755833269907267, "loss": 5.8395, "mean_token_accuracy": 0.13505658283829688, "num_tokens": 4052159.0, "step": 1450 }, { "entropy": 5.945993661880493, "epoch": 0.039390862944162434, "grad_norm": 1.0859375, "learning_rate": 0.0004750468344541857, "loss": 5.8492, "mean_token_accuracy": 0.1315135531127453, "num_tokens": 4065893.0, "step": 1455 }, { "entropy": 5.7644538402557375, "epoch": 0.03952622673434856, "grad_norm": 0.96875, "learning_rate": 0.00047450485753262525, "loss": 5.8021, "mean_token_accuracy": 0.1386327899992466, "num_tokens": 4079274.0, "step": 1460 }, { "entropy": 5.907123756408692, "epoch": 0.03966159052453469, "grad_norm": 1.046875, "learning_rate": 0.00047395741108461633, "loss": 5.8496, "mean_token_accuracy": 0.1314863942563534, "num_tokens": 4092579.0, "step": 1465 }, { "entropy": 5.845654916763306, "epoch": 0.039796954314720814, "grad_norm": 0.91015625, "learning_rate": 0.00047340451011867985, "loss": 5.7645, "mean_token_accuracy": 0.13576920554041863, "num_tokens": 4106484.0, "step": 1470 }, { "entropy": 5.8357702732086185, "epoch": 0.03993231810490694, "grad_norm": 1.046875, "learning_rate": 0.00047284616979287515, "loss": 5.7565, "mean_token_accuracy": 0.14051191210746766, "num_tokens": 4120600.0, "step": 1475 }, { "entropy": 5.734717130661011, "epoch": 0.04006768189509306, "grad_norm": 0.9296875, "learning_rate": 0.00047228240541438433, "loss": 5.6607, "mean_token_accuracy": 0.14902638792991638, "num_tokens": 4134962.0, "step": 1480 }, { "entropy": 5.739231395721435, "epoch": 0.04020304568527919, "grad_norm": 0.921875, "learning_rate": 0.00047171323243909257, "loss": 5.7377, "mean_token_accuracy": 0.1390654683113098, "num_tokens": 4148876.0, "step": 1485 }, { "entropy": 5.851029348373413, "epoch": 0.04033840947546531, "grad_norm": 1.015625, "learning_rate": 0.00047113866647116457, "loss": 5.8167, "mean_token_accuracy": 0.13390154615044594, "num_tokens": 4163566.0, "step": 1490 }, { "entropy": 5.882148790359497, "epoch": 0.040473773265651436, "grad_norm": 0.92578125, "learning_rate": 0.0004705587232626164, "loss": 5.7981, "mean_token_accuracy": 0.1364994041621685, "num_tokens": 4179057.0, "step": 1495 }, { "entropy": 5.747499704360962, "epoch": 0.04060913705583756, "grad_norm": 1.0078125, "learning_rate": 0.00046997341871288424, "loss": 5.737, "mean_token_accuracy": 0.14035099148750305, "num_tokens": 4192277.0, "step": 1500 }, { "entropy": 5.826932811737061, "epoch": 0.04074450084602369, "grad_norm": 1.0234375, "learning_rate": 0.0004693827688683879, "loss": 5.7834, "mean_token_accuracy": 0.1409361645579338, "num_tokens": 4206481.0, "step": 1505 }, { "entropy": 5.8263192653656, "epoch": 0.040879864636209816, "grad_norm": 0.95703125, "learning_rate": 0.0004687867899220914, "loss": 5.7582, "mean_token_accuracy": 0.14131638035178185, "num_tokens": 4220498.0, "step": 1510 }, { "entropy": 5.7734416961669925, "epoch": 0.04101522842639594, "grad_norm": 0.9921875, "learning_rate": 0.00046818549821305846, "loss": 5.7781, "mean_token_accuracy": 0.13451047241687775, "num_tokens": 4234718.0, "step": 1515 }, { "entropy": 5.835545301437378, "epoch": 0.041150592216582065, "grad_norm": 0.9765625, "learning_rate": 0.00046757891022600494, "loss": 5.7595, "mean_token_accuracy": 0.1417396955192089, "num_tokens": 4247333.0, "step": 1520 }, { "entropy": 5.764037847518921, "epoch": 0.04128595600676819, "grad_norm": 1.0, "learning_rate": 0.0004669670425908471, "loss": 5.745, "mean_token_accuracy": 0.14303724765777587, "num_tokens": 4261059.0, "step": 1525 }, { "entropy": 5.744110727310181, "epoch": 0.04142131979695431, "grad_norm": 1.0078125, "learning_rate": 0.0004663499120822451, "loss": 5.7091, "mean_token_accuracy": 0.13828182518482207, "num_tokens": 4273500.0, "step": 1530 }, { "entropy": 5.809609127044678, "epoch": 0.04155668358714044, "grad_norm": 0.97265625, "learning_rate": 0.0004657275356191437, "loss": 5.8712, "mean_token_accuracy": 0.1299389272928238, "num_tokens": 4288422.0, "step": 1535 }, { "entropy": 5.870568370819091, "epoch": 0.04169204737732656, "grad_norm": 0.87890625, "learning_rate": 0.00046509993026430804, "loss": 5.71, "mean_token_accuracy": 0.13911089226603507, "num_tokens": 4303700.0, "step": 1540 }, { "entropy": 5.763344049453735, "epoch": 0.04182741116751269, "grad_norm": 1.0078125, "learning_rate": 0.0004644671132238558, "loss": 5.7506, "mean_token_accuracy": 0.1399180144071579, "num_tokens": 4317887.0, "step": 1545 }, { "entropy": 5.775641632080078, "epoch": 0.04196277495769882, "grad_norm": 0.9765625, "learning_rate": 0.00046382910184678585, "loss": 5.6546, "mean_token_accuracy": 0.14635862186551094, "num_tokens": 4332834.0, "step": 1550 }, { "entropy": 5.7155317783355715, "epoch": 0.04209813874788494, "grad_norm": 0.98046875, "learning_rate": 0.0004631859136245025, "loss": 5.7051, "mean_token_accuracy": 0.1462951496243477, "num_tokens": 4347341.0, "step": 1555 }, { "entropy": 5.828639984130859, "epoch": 0.042233502538071066, "grad_norm": 0.97265625, "learning_rate": 0.0004625375661903357, "loss": 5.7721, "mean_token_accuracy": 0.13997872620821, "num_tokens": 4361359.0, "step": 1560 }, { "entropy": 5.7016510486602785, "epoch": 0.04236886632825719, "grad_norm": 0.8984375, "learning_rate": 0.00046188407731905787, "loss": 5.6941, "mean_token_accuracy": 0.14500250071287155, "num_tokens": 4376677.0, "step": 1565 }, { "entropy": 5.75781831741333, "epoch": 0.042504230118443315, "grad_norm": 1.1328125, "learning_rate": 0.00046122546492639643, "loss": 5.6234, "mean_token_accuracy": 0.14894023090600966, "num_tokens": 4389507.0, "step": 1570 }, { "entropy": 5.712439489364624, "epoch": 0.04263959390862944, "grad_norm": 0.83203125, "learning_rate": 0.000460561747068543, "loss": 5.7554, "mean_token_accuracy": 0.1388566166162491, "num_tokens": 4406626.0, "step": 1575 }, { "entropy": 5.756133127212524, "epoch": 0.04277495769881557, "grad_norm": 0.88671875, "learning_rate": 0.0004598929419416578, "loss": 5.7679, "mean_token_accuracy": 0.13815426528453828, "num_tokens": 4421131.0, "step": 1580 }, { "entropy": 5.868128299713135, "epoch": 0.042910321489001695, "grad_norm": 0.95703125, "learning_rate": 0.00045921906788137123, "loss": 5.76, "mean_token_accuracy": 0.14222174808382987, "num_tokens": 4435107.0, "step": 1585 }, { "entropy": 5.801052570343018, "epoch": 0.04304568527918782, "grad_norm": 0.984375, "learning_rate": 0.00045854014336228115, "loss": 5.7288, "mean_token_accuracy": 0.14501179829239846, "num_tokens": 4449294.0, "step": 1590 }, { "entropy": 5.750652313232422, "epoch": 0.04318104906937394, "grad_norm": 0.98046875, "learning_rate": 0.00045785618699744615, "loss": 5.6444, "mean_token_accuracy": 0.14286767169833184, "num_tokens": 4462731.0, "step": 1595 }, { "entropy": 5.717151927947998, "epoch": 0.04331641285956007, "grad_norm": 1.1015625, "learning_rate": 0.00045716721753787543, "loss": 5.7299, "mean_token_accuracy": 0.1389971673488617, "num_tokens": 4476956.0, "step": 1600 }, { "entropy": 5.819956731796265, "epoch": 0.04345177664974619, "grad_norm": 1.0, "learning_rate": 0.0004564732538720148, "loss": 5.7267, "mean_token_accuracy": 0.14786600917577744, "num_tokens": 4491356.0, "step": 1605 }, { "entropy": 5.665336084365845, "epoch": 0.043587140439932316, "grad_norm": 1.0, "learning_rate": 0.00045577431502522877, "loss": 5.7028, "mean_token_accuracy": 0.14309961274266242, "num_tokens": 4504900.0, "step": 1610 }, { "entropy": 5.760229158401489, "epoch": 0.04372250423011844, "grad_norm": 0.94921875, "learning_rate": 0.0004550704201592787, "loss": 5.688, "mean_token_accuracy": 0.14546218365430832, "num_tokens": 4517879.0, "step": 1615 }, { "entropy": 5.720965814590454, "epoch": 0.04385786802030457, "grad_norm": 1.046875, "learning_rate": 0.0004543615885717981, "loss": 5.7713, "mean_token_accuracy": 0.14266854301095008, "num_tokens": 4531356.0, "step": 1620 }, { "entropy": 5.802320337295532, "epoch": 0.043993231810490696, "grad_norm": 0.984375, "learning_rate": 0.00045364783969576296, "loss": 5.6383, "mean_token_accuracy": 0.14731594622135163, "num_tokens": 4545262.0, "step": 1625 }, { "entropy": 5.625383090972901, "epoch": 0.04412859560067682, "grad_norm": 1.046875, "learning_rate": 0.0004529291930989592, "loss": 5.6253, "mean_token_accuracy": 0.14481477811932564, "num_tokens": 4558713.0, "step": 1630 }, { "entropy": 5.767266464233399, "epoch": 0.044263959390862945, "grad_norm": 0.921875, "learning_rate": 0.0004522056684834464, "loss": 5.6935, "mean_token_accuracy": 0.14441011399030684, "num_tokens": 4571891.0, "step": 1635 }, { "entropy": 5.778782510757447, "epoch": 0.04439932318104907, "grad_norm": 0.953125, "learning_rate": 0.0004514772856850173, "loss": 5.6935, "mean_token_accuracy": 0.14748022928833962, "num_tokens": 4585822.0, "step": 1640 }, { "entropy": 5.753904867172241, "epoch": 0.04453468697123519, "grad_norm": 0.9453125, "learning_rate": 0.0004507440646726542, "loss": 5.6979, "mean_token_accuracy": 0.14199129566550256, "num_tokens": 4600023.0, "step": 1645 }, { "entropy": 5.6777363300323485, "epoch": 0.04467005076142132, "grad_norm": 1.1328125, "learning_rate": 0.0004500060255479818, "loss": 5.5957, "mean_token_accuracy": 0.15256337970495223, "num_tokens": 4611259.0, "step": 1650 }, { "entropy": 5.784216976165771, "epoch": 0.04480541455160744, "grad_norm": 0.9609375, "learning_rate": 0.0004492631885447151, "loss": 5.6981, "mean_token_accuracy": 0.13937234207987786, "num_tokens": 4625195.0, "step": 1655 }, { "entropy": 5.828709125518799, "epoch": 0.04494077834179357, "grad_norm": 1.0546875, "learning_rate": 0.00044851557402810616, "loss": 5.6685, "mean_token_accuracy": 0.1433462306857109, "num_tokens": 4639159.0, "step": 1660 }, { "entropy": 5.694344997406006, "epoch": 0.0450761421319797, "grad_norm": 1.09375, "learning_rate": 0.00044776320249438444, "loss": 5.7065, "mean_token_accuracy": 0.143716399371624, "num_tokens": 4650967.0, "step": 1665 }, { "entropy": 5.757909107208252, "epoch": 0.04521150592216582, "grad_norm": 0.8828125, "learning_rate": 0.00044700609457019565, "loss": 5.6969, "mean_token_accuracy": 0.14098843336105346, "num_tokens": 4667107.0, "step": 1670 }, { "entropy": 5.704726076126098, "epoch": 0.045346869712351946, "grad_norm": 0.94921875, "learning_rate": 0.0004462442710120359, "loss": 5.6458, "mean_token_accuracy": 0.15384480953216553, "num_tokens": 4680966.0, "step": 1675 }, { "entropy": 5.788536548614502, "epoch": 0.04548223350253807, "grad_norm": 0.86328125, "learning_rate": 0.000445477752705683, "loss": 5.715, "mean_token_accuracy": 0.14432019889354705, "num_tokens": 4696365.0, "step": 1680 }, { "entropy": 5.778404951095581, "epoch": 0.045617597292724195, "grad_norm": 1.0, "learning_rate": 0.00044470656066562336, "loss": 5.7505, "mean_token_accuracy": 0.14002010300755502, "num_tokens": 4709059.0, "step": 1685 }, { "entropy": 5.779723358154297, "epoch": 0.04575296108291032, "grad_norm": 0.8828125, "learning_rate": 0.0004439307160344765, "loss": 5.6813, "mean_token_accuracy": 0.1479523077607155, "num_tokens": 4722922.0, "step": 1690 }, { "entropy": 5.69294548034668, "epoch": 0.045888324873096444, "grad_norm": 0.921875, "learning_rate": 0.00044315024008241473, "loss": 5.5964, "mean_token_accuracy": 0.15145878940820695, "num_tokens": 4737204.0, "step": 1695 }, { "entropy": 5.7257462501525875, "epoch": 0.046023688663282575, "grad_norm": 0.92578125, "learning_rate": 0.0004423651542065806, "loss": 5.6956, "mean_token_accuracy": 0.14550104588270188, "num_tokens": 4752111.0, "step": 1700 }, { "entropy": 5.752708816528321, "epoch": 0.0461590524534687, "grad_norm": 1.0, "learning_rate": 0.00044157547993050006, "loss": 5.6762, "mean_token_accuracy": 0.14675524830818176, "num_tokens": 4766353.0, "step": 1705 }, { "entropy": 5.750765705108643, "epoch": 0.04629441624365482, "grad_norm": 1.0078125, "learning_rate": 0.00044078123890349227, "loss": 5.7321, "mean_token_accuracy": 0.14695569574832917, "num_tokens": 4779551.0, "step": 1710 }, { "entropy": 5.675897407531738, "epoch": 0.04642978003384095, "grad_norm": 0.94140625, "learning_rate": 0.00043998245290007606, "loss": 5.6578, "mean_token_accuracy": 0.14759555011987685, "num_tokens": 4794073.0, "step": 1715 }, { "entropy": 5.697209167480469, "epoch": 0.04656514382402707, "grad_norm": 0.97265625, "learning_rate": 0.00043917914381937323, "loss": 5.5765, "mean_token_accuracy": 0.15185517072677612, "num_tokens": 4806855.0, "step": 1720 }, { "entropy": 5.63714861869812, "epoch": 0.046700507614213196, "grad_norm": 0.984375, "learning_rate": 0.00043837133368450815, "loss": 5.681, "mean_token_accuracy": 0.138708233833313, "num_tokens": 4820880.0, "step": 1725 }, { "entropy": 5.834238338470459, "epoch": 0.04683587140439932, "grad_norm": 0.96484375, "learning_rate": 0.0004375590446420037, "loss": 5.6772, "mean_token_accuracy": 0.14852887466549874, "num_tokens": 4833906.0, "step": 1730 }, { "entropy": 5.651483774185181, "epoch": 0.046971235194585445, "grad_norm": 0.99609375, "learning_rate": 0.0004367422989611743, "loss": 5.6429, "mean_token_accuracy": 0.15046416074037552, "num_tokens": 4849251.0, "step": 1735 }, { "entropy": 5.713845062255859, "epoch": 0.047106598984771576, "grad_norm": 0.91015625, "learning_rate": 0.0004359211190335153, "loss": 5.6968, "mean_token_accuracy": 0.14156146496534347, "num_tokens": 4863896.0, "step": 1740 }, { "entropy": 5.769553709030151, "epoch": 0.0472419627749577, "grad_norm": 1.0, "learning_rate": 0.00043509552737208923, "loss": 5.655, "mean_token_accuracy": 0.15236809402704238, "num_tokens": 4876392.0, "step": 1745 }, { "entropy": 5.665567684173584, "epoch": 0.047377326565143825, "grad_norm": 0.890625, "learning_rate": 0.00043426554661090853, "loss": 5.6206, "mean_token_accuracy": 0.15215253382921218, "num_tokens": 4889803.0, "step": 1750 }, { "entropy": 5.653515958786011, "epoch": 0.04751269035532995, "grad_norm": 0.91796875, "learning_rate": 0.00043343119950431516, "loss": 5.5148, "mean_token_accuracy": 0.1512528494000435, "num_tokens": 4903975.0, "step": 1755 }, { "entropy": 5.731270265579224, "epoch": 0.047648054145516074, "grad_norm": 1.0625, "learning_rate": 0.00043259250892635644, "loss": 5.7402, "mean_token_accuracy": 0.14076657742261886, "num_tokens": 4916667.0, "step": 1760 }, { "entropy": 5.772264051437378, "epoch": 0.0477834179357022, "grad_norm": 0.984375, "learning_rate": 0.0004317494978701582, "loss": 5.6871, "mean_token_accuracy": 0.15338942259550095, "num_tokens": 4929908.0, "step": 1765 }, { "entropy": 5.600496244430542, "epoch": 0.04791878172588832, "grad_norm": 0.97265625, "learning_rate": 0.0004309021894472943, "loss": 5.5895, "mean_token_accuracy": 0.1531106323003769, "num_tokens": 4943685.0, "step": 1770 }, { "entropy": 5.86819052696228, "epoch": 0.048054145516074454, "grad_norm": 1.078125, "learning_rate": 0.0004300506068871534, "loss": 5.7578, "mean_token_accuracy": 0.13543773368000983, "num_tokens": 4959796.0, "step": 1775 }, { "entropy": 5.58793797492981, "epoch": 0.04818950930626058, "grad_norm": 1.015625, "learning_rate": 0.00042919477353630135, "loss": 5.5691, "mean_token_accuracy": 0.15354569405317306, "num_tokens": 4973208.0, "step": 1780 }, { "entropy": 5.736422824859619, "epoch": 0.0483248730964467, "grad_norm": 0.8671875, "learning_rate": 0.000428334712857842, "loss": 5.6892, "mean_token_accuracy": 0.14086781814694405, "num_tokens": 4989755.0, "step": 1785 }, { "entropy": 5.694100475311279, "epoch": 0.048460236886632826, "grad_norm": 1.0703125, "learning_rate": 0.00042747044843077304, "loss": 5.6608, "mean_token_accuracy": 0.14808935225009917, "num_tokens": 5003501.0, "step": 1790 }, { "entropy": 5.70287938117981, "epoch": 0.04859560067681895, "grad_norm": 0.93359375, "learning_rate": 0.00042660200394934047, "loss": 5.691, "mean_token_accuracy": 0.1464019276201725, "num_tokens": 5016657.0, "step": 1795 }, { "entropy": 5.6858762264251705, "epoch": 0.048730964467005075, "grad_norm": 0.93359375, "learning_rate": 0.00042572940322238844, "loss": 5.6081, "mean_token_accuracy": 0.1505765825510025, "num_tokens": 5029741.0, "step": 1800 }, { "entropy": 5.6079450130462645, "epoch": 0.0488663282571912, "grad_norm": 1.015625, "learning_rate": 0.00042485267017270664, "loss": 5.5026, "mean_token_accuracy": 0.15048226863145828, "num_tokens": 5042973.0, "step": 1805 }, { "entropy": 5.652156972885132, "epoch": 0.049001692047377324, "grad_norm": 0.98828125, "learning_rate": 0.0004239718288363745, "loss": 5.5519, "mean_token_accuracy": 0.151530858874321, "num_tokens": 5057981.0, "step": 1810 }, { "entropy": 5.653716611862182, "epoch": 0.049137055837563455, "grad_norm": 0.89453125, "learning_rate": 0.0004230869033621023, "loss": 5.6339, "mean_token_accuracy": 0.13919498771429062, "num_tokens": 5072832.0, "step": 1815 }, { "entropy": 5.74049973487854, "epoch": 0.04927241962774958, "grad_norm": 0.89453125, "learning_rate": 0.0004221979180105688, "loss": 5.6291, "mean_token_accuracy": 0.14582021906971931, "num_tokens": 5086141.0, "step": 1820 }, { "entropy": 5.67672643661499, "epoch": 0.049407783417935704, "grad_norm": 0.98046875, "learning_rate": 0.00042130489715375645, "loss": 5.6638, "mean_token_accuracy": 0.146046045422554, "num_tokens": 5100480.0, "step": 1825 }, { "entropy": 5.680028295516967, "epoch": 0.04954314720812183, "grad_norm": 0.89453125, "learning_rate": 0.00042040786527428335, "loss": 5.5843, "mean_token_accuracy": 0.14439646974205972, "num_tokens": 5117197.0, "step": 1830 }, { "entropy": 5.5879209518432615, "epoch": 0.04967851099830795, "grad_norm": 0.90625, "learning_rate": 0.0004195068469647315, "loss": 5.5534, "mean_token_accuracy": 0.1488366484642029, "num_tokens": 5132561.0, "step": 1835 }, { "entropy": 5.6617508888244625, "epoch": 0.04981387478849408, "grad_norm": 0.93359375, "learning_rate": 0.00041860186692697297, "loss": 5.7145, "mean_token_accuracy": 0.1438066452741623, "num_tokens": 5146905.0, "step": 1840 }, { "entropy": 5.724303245544434, "epoch": 0.0499492385786802, "grad_norm": 1.0390625, "learning_rate": 0.00041769294997149264, "loss": 5.5646, "mean_token_accuracy": 0.15083335638046264, "num_tokens": 5161581.0, "step": 1845 }, { "entropy": 5.6070271015167235, "epoch": 0.050084602368866325, "grad_norm": 0.9609375, "learning_rate": 0.0004167801210167081, "loss": 5.5805, "mean_token_accuracy": 0.1544129729270935, "num_tokens": 5176317.0, "step": 1850 }, { "entropy": 5.684096813201904, "epoch": 0.05021996615905246, "grad_norm": 1.046875, "learning_rate": 0.0004158634050882861, "loss": 5.5168, "mean_token_accuracy": 0.15208376348018646, "num_tokens": 5188651.0, "step": 1855 }, { "entropy": 5.55376296043396, "epoch": 0.05035532994923858, "grad_norm": 0.9296875, "learning_rate": 0.0004149428273184569, "loss": 5.5148, "mean_token_accuracy": 0.15063736736774444, "num_tokens": 5202035.0, "step": 1860 }, { "entropy": 5.612833023071289, "epoch": 0.050490693739424705, "grad_norm": 1.09375, "learning_rate": 0.0004140184129453253, "loss": 5.486, "mean_token_accuracy": 0.1544868603348732, "num_tokens": 5215471.0, "step": 1865 }, { "entropy": 5.704241132736206, "epoch": 0.05062605752961083, "grad_norm": 1.15625, "learning_rate": 0.000413090187312178, "loss": 5.6414, "mean_token_accuracy": 0.1538958489894867, "num_tokens": 5228328.0, "step": 1870 }, { "entropy": 5.698283338546753, "epoch": 0.050761421319796954, "grad_norm": 0.97265625, "learning_rate": 0.0004121581758667898, "loss": 5.6058, "mean_token_accuracy": 0.1486688494682312, "num_tokens": 5240586.0, "step": 1875 }, { "entropy": 5.515977621078491, "epoch": 0.05089678510998308, "grad_norm": 1.015625, "learning_rate": 0.00041122240416072533, "loss": 5.4453, "mean_token_accuracy": 0.15285620093345642, "num_tokens": 5252569.0, "step": 1880 }, { "entropy": 5.644832372665405, "epoch": 0.0510321489001692, "grad_norm": 1.09375, "learning_rate": 0.0004102828978486385, "loss": 5.6534, "mean_token_accuracy": 0.14334431514143944, "num_tokens": 5264975.0, "step": 1885 }, { "entropy": 5.681633806228637, "epoch": 0.05116751269035533, "grad_norm": 0.9296875, "learning_rate": 0.0004093396826875695, "loss": 5.527, "mean_token_accuracy": 0.15328461825847625, "num_tokens": 5279688.0, "step": 1890 }, { "entropy": 5.622284603118897, "epoch": 0.05130287648054146, "grad_norm": 0.9609375, "learning_rate": 0.00040839278453623837, "loss": 5.5739, "mean_token_accuracy": 0.15425852686166763, "num_tokens": 5294266.0, "step": 1895 }, { "entropy": 5.633177900314331, "epoch": 0.05143824027072758, "grad_norm": 0.9453125, "learning_rate": 0.0004074422293543363, "loss": 5.5835, "mean_token_accuracy": 0.14945923388004304, "num_tokens": 5308719.0, "step": 1900 }, { "entropy": 5.672901391983032, "epoch": 0.05157360406091371, "grad_norm": 0.890625, "learning_rate": 0.0004064880432018137, "loss": 5.6778, "mean_token_accuracy": 0.1480257421731949, "num_tokens": 5324227.0, "step": 1905 }, { "entropy": 5.7078780174255375, "epoch": 0.05170896785109983, "grad_norm": 1.015625, "learning_rate": 0.00040553025223816615, "loss": 5.603, "mean_token_accuracy": 0.153351391851902, "num_tokens": 5338353.0, "step": 1910 }, { "entropy": 5.629157209396363, "epoch": 0.051844331641285955, "grad_norm": 0.8828125, "learning_rate": 0.00040456888272171653, "loss": 5.4822, "mean_token_accuracy": 0.1563638061285019, "num_tokens": 5354182.0, "step": 1915 }, { "entropy": 5.617384052276611, "epoch": 0.05197969543147208, "grad_norm": 1.046875, "learning_rate": 0.00040360396100889577, "loss": 5.6056, "mean_token_accuracy": 0.14689816236495973, "num_tokens": 5366448.0, "step": 1920 }, { "entropy": 5.651615858078003, "epoch": 0.052115059221658204, "grad_norm": 0.87109375, "learning_rate": 0.0004026355135535202, "loss": 5.5636, "mean_token_accuracy": 0.1531040221452713, "num_tokens": 5381430.0, "step": 1925 }, { "entropy": 5.6194452285766605, "epoch": 0.05225042301184433, "grad_norm": 1.03125, "learning_rate": 0.000401663566906066, "loss": 5.5743, "mean_token_accuracy": 0.15186812579631806, "num_tokens": 5393626.0, "step": 1930 }, { "entropy": 5.7036806583404545, "epoch": 0.05238578680203046, "grad_norm": 0.9375, "learning_rate": 0.00040068814771294134, "loss": 5.5539, "mean_token_accuracy": 0.15736090689897536, "num_tokens": 5407257.0, "step": 1935 }, { "entropy": 5.583117723464966, "epoch": 0.052521150592216584, "grad_norm": 0.90234375, "learning_rate": 0.0003997092827157562, "loss": 5.5588, "mean_token_accuracy": 0.14819036424160004, "num_tokens": 5421798.0, "step": 1940 }, { "entropy": 5.655210685729981, "epoch": 0.05265651438240271, "grad_norm": 0.91796875, "learning_rate": 0.000398726998750589, "loss": 5.5823, "mean_token_accuracy": 0.1502937689423561, "num_tokens": 5437455.0, "step": 1945 }, { "entropy": 5.628138160705566, "epoch": 0.05279187817258883, "grad_norm": 0.828125, "learning_rate": 0.00039774132274725076, "loss": 5.508, "mean_token_accuracy": 0.15878963768482207, "num_tokens": 5451593.0, "step": 1950 }, { "entropy": 5.5857048511505125, "epoch": 0.05292724196277496, "grad_norm": 1.0234375, "learning_rate": 0.00039675228172854707, "loss": 5.5671, "mean_token_accuracy": 0.15036417841911315, "num_tokens": 5466807.0, "step": 1955 }, { "entropy": 5.578492784500122, "epoch": 0.05306260575296108, "grad_norm": 1.0703125, "learning_rate": 0.0003957599028095371, "loss": 5.472, "mean_token_accuracy": 0.15736704617738723, "num_tokens": 5480113.0, "step": 1960 }, { "entropy": 5.58995213508606, "epoch": 0.053197969543147205, "grad_norm": 0.98046875, "learning_rate": 0.00039476421319679017, "loss": 5.576, "mean_token_accuracy": 0.14943182319402695, "num_tokens": 5494694.0, "step": 1965 }, { "entropy": 5.649091339111328, "epoch": 0.05333333333333334, "grad_norm": 0.9609375, "learning_rate": 0.00039376524018764, "loss": 5.5204, "mean_token_accuracy": 0.15763673931360245, "num_tokens": 5508858.0, "step": 1970 }, { "entropy": 5.544556760787964, "epoch": 0.05346869712351946, "grad_norm": 0.9765625, "learning_rate": 0.00039276301116943616, "loss": 5.4916, "mean_token_accuracy": 0.1559601128101349, "num_tokens": 5523142.0, "step": 1975 }, { "entropy": 5.637435817718506, "epoch": 0.053604060913705585, "grad_norm": 1.1015625, "learning_rate": 0.0003917575536187936, "loss": 5.5495, "mean_token_accuracy": 0.1537593424320221, "num_tokens": 5536882.0, "step": 1980 }, { "entropy": 5.666303062438965, "epoch": 0.05373942470389171, "grad_norm": 0.98828125, "learning_rate": 0.00039074889510083894, "loss": 5.5746, "mean_token_accuracy": 0.14690756425261497, "num_tokens": 5550882.0, "step": 1985 }, { "entropy": 5.601831579208374, "epoch": 0.053874788494077834, "grad_norm": 0.90625, "learning_rate": 0.00038973706326845495, "loss": 5.5869, "mean_token_accuracy": 0.14608050435781478, "num_tokens": 5566187.0, "step": 1990 }, { "entropy": 5.604721736907959, "epoch": 0.05401015228426396, "grad_norm": 0.87890625, "learning_rate": 0.0003887220858615225, "loss": 5.5083, "mean_token_accuracy": 0.1559429183602333, "num_tokens": 5580568.0, "step": 1995 }, { "entropy": 5.609822750091553, "epoch": 0.05414551607445008, "grad_norm": 0.96484375, "learning_rate": 0.0003877039907061597, "loss": 5.5986, "mean_token_accuracy": 0.15086540579795837, "num_tokens": 5594827.0, "step": 2000 }, { "entropy": 5.6352800846099855, "epoch": 0.05428087986463621, "grad_norm": 1.078125, "learning_rate": 0.0003866828057139598, "loss": 5.5726, "mean_token_accuracy": 0.14980787187814712, "num_tokens": 5607643.0, "step": 2005 }, { "entropy": 5.583590316772461, "epoch": 0.05441624365482234, "grad_norm": 1.015625, "learning_rate": 0.00038565855888122503, "loss": 5.5041, "mean_token_accuracy": 0.1583167791366577, "num_tokens": 5619178.0, "step": 2010 }, { "entropy": 5.708728361129761, "epoch": 0.05455160744500846, "grad_norm": 0.91796875, "learning_rate": 0.00038463127828819975, "loss": 5.5384, "mean_token_accuracy": 0.15386256724596023, "num_tokens": 5632724.0, "step": 2015 }, { "entropy": 5.479742050170898, "epoch": 0.05468697123519459, "grad_norm": 1.0234375, "learning_rate": 0.00038360099209830043, "loss": 5.5745, "mean_token_accuracy": 0.15379853323101997, "num_tokens": 5646090.0, "step": 2020 }, { "entropy": 5.633185243606567, "epoch": 0.05482233502538071, "grad_norm": 0.93359375, "learning_rate": 0.0003825677285573433, "loss": 5.507, "mean_token_accuracy": 0.15375496149063111, "num_tokens": 5660734.0, "step": 2025 }, { "entropy": 5.631849336624145, "epoch": 0.054957698815566836, "grad_norm": 1.078125, "learning_rate": 0.00038153151599277027, "loss": 5.5224, "mean_token_accuracy": 0.15756209194660187, "num_tokens": 5674885.0, "step": 2030 }, { "entropy": 5.569233798980713, "epoch": 0.05509306260575296, "grad_norm": 0.96875, "learning_rate": 0.0003804923828128723, "loss": 5.4979, "mean_token_accuracy": 0.15912836641073227, "num_tokens": 5687464.0, "step": 2035 }, { "entropy": 5.671593904495239, "epoch": 0.055228426395939084, "grad_norm": 0.91015625, "learning_rate": 0.0003794503575060104, "loss": 5.5796, "mean_token_accuracy": 0.15338214933872224, "num_tokens": 5701569.0, "step": 2040 }, { "entropy": 5.604352951049805, "epoch": 0.05536379018612521, "grad_norm": 0.92578125, "learning_rate": 0.00037840546863983484, "loss": 5.5662, "mean_token_accuracy": 0.14921343475580215, "num_tokens": 5716021.0, "step": 2045 }, { "entropy": 5.676676845550537, "epoch": 0.05549915397631134, "grad_norm": 0.96484375, "learning_rate": 0.0003773577448605015, "loss": 5.4733, "mean_token_accuracy": 0.1577136844396591, "num_tokens": 5731219.0, "step": 2050 }, { "entropy": 5.5694435119628904, "epoch": 0.055634517766497464, "grad_norm": 1.015625, "learning_rate": 0.0003763072148918872, "loss": 5.566, "mean_token_accuracy": 0.15062549114227294, "num_tokens": 5745864.0, "step": 2055 }, { "entropy": 5.537994909286499, "epoch": 0.05576988155668359, "grad_norm": 1.078125, "learning_rate": 0.0003752539075348017, "loss": 5.4265, "mean_token_accuracy": 0.16346251368522643, "num_tokens": 5758852.0, "step": 2060 }, { "entropy": 5.655580282211304, "epoch": 0.05590524534686971, "grad_norm": 0.98046875, "learning_rate": 0.00037419785166619817, "loss": 5.5961, "mean_token_accuracy": 0.1531015492975712, "num_tokens": 5774474.0, "step": 2065 }, { "entropy": 5.5935293674469, "epoch": 0.05604060913705584, "grad_norm": 0.96875, "learning_rate": 0.0003731390762383818, "loss": 5.4934, "mean_token_accuracy": 0.15586720108985902, "num_tokens": 5788077.0, "step": 2070 }, { "entropy": 5.6637038230896, "epoch": 0.05617597292724196, "grad_norm": 0.953125, "learning_rate": 0.0003720776102782158, "loss": 5.6647, "mean_token_accuracy": 0.1455085203051567, "num_tokens": 5805257.0, "step": 2075 }, { "entropy": 5.570231914520264, "epoch": 0.056311336717428086, "grad_norm": 0.9765625, "learning_rate": 0.00037101348288632555, "loss": 5.431, "mean_token_accuracy": 0.1498264342546463, "num_tokens": 5819518.0, "step": 2080 }, { "entropy": 5.5381348609924315, "epoch": 0.05644670050761421, "grad_norm": 0.9375, "learning_rate": 0.0003699467232363012, "loss": 5.3706, "mean_token_accuracy": 0.16544263809919357, "num_tokens": 5833228.0, "step": 2085 }, { "entropy": 5.588838815689087, "epoch": 0.05658206429780034, "grad_norm": 1.0, "learning_rate": 0.0003688773605738973, "loss": 5.4515, "mean_token_accuracy": 0.15661462396383286, "num_tokens": 5847714.0, "step": 2090 }, { "entropy": 5.516980886459351, "epoch": 0.056717428087986466, "grad_norm": 0.95703125, "learning_rate": 0.00036780542421623134, "loss": 5.4794, "mean_token_accuracy": 0.15581640005111694, "num_tokens": 5861775.0, "step": 2095 }, { "entropy": 5.556796646118164, "epoch": 0.05685279187817259, "grad_norm": 0.9296875, "learning_rate": 0.0003667309435509802, "loss": 5.5511, "mean_token_accuracy": 0.15586237907409667, "num_tokens": 5875679.0, "step": 2100 }, { "entropy": 5.692843914031982, "epoch": 0.056988155668358714, "grad_norm": 0.94921875, "learning_rate": 0.0003656539480355741, "loss": 5.6027, "mean_token_accuracy": 0.15197229087352754, "num_tokens": 5889127.0, "step": 2105 }, { "entropy": 5.658493995666504, "epoch": 0.05712351945854484, "grad_norm": 1.0078125, "learning_rate": 0.0003645744671963891, "loss": 5.5212, "mean_token_accuracy": 0.16027260273694993, "num_tokens": 5902710.0, "step": 2110 }, { "entropy": 5.55581750869751, "epoch": 0.05725888324873096, "grad_norm": 1.0546875, "learning_rate": 0.0003634925306279376, "loss": 5.5784, "mean_token_accuracy": 0.1552097924053669, "num_tokens": 5914823.0, "step": 2115 }, { "entropy": 5.566669940948486, "epoch": 0.05739424703891709, "grad_norm": 0.890625, "learning_rate": 0.0003624081679920574, "loss": 5.5149, "mean_token_accuracy": 0.15782447010278702, "num_tokens": 5929553.0, "step": 2120 }, { "entropy": 5.509809684753418, "epoch": 0.05752961082910321, "grad_norm": 0.9140625, "learning_rate": 0.0003613214090170977, "loss": 5.416, "mean_token_accuracy": 0.16114599555730819, "num_tokens": 5942364.0, "step": 2125 }, { "entropy": 5.570280456542969, "epoch": 0.05766497461928934, "grad_norm": 0.98046875, "learning_rate": 0.0003602322834971048, "loss": 5.5507, "mean_token_accuracy": 0.15223699808120728, "num_tokens": 5954874.0, "step": 2130 }, { "entropy": 5.599170875549317, "epoch": 0.05780033840947547, "grad_norm": 0.95703125, "learning_rate": 0.0003591408212910051, "loss": 5.4627, "mean_token_accuracy": 0.15489756017923356, "num_tokens": 5968635.0, "step": 2135 }, { "entropy": 5.590338897705078, "epoch": 0.05793570219966159, "grad_norm": 0.9765625, "learning_rate": 0.0003580470523217863, "loss": 5.559, "mean_token_accuracy": 0.1588521420955658, "num_tokens": 5983887.0, "step": 2140 }, { "entropy": 5.656904172897339, "epoch": 0.058071065989847716, "grad_norm": 0.9296875, "learning_rate": 0.0003569510065756771, "loss": 5.5177, "mean_token_accuracy": 0.14795053601264954, "num_tokens": 5998996.0, "step": 2145 }, { "entropy": 5.560834264755249, "epoch": 0.05820642978003384, "grad_norm": 0.9140625, "learning_rate": 0.0003558527141013254, "loss": 5.4962, "mean_token_accuracy": 0.1533253774046898, "num_tokens": 6013399.0, "step": 2150 }, { "entropy": 5.6488504886627195, "epoch": 0.058341793570219964, "grad_norm": 1.0546875, "learning_rate": 0.0003547522050089742, "loss": 5.5268, "mean_token_accuracy": 0.154144811630249, "num_tokens": 6025858.0, "step": 2155 }, { "entropy": 5.50015172958374, "epoch": 0.05847715736040609, "grad_norm": 0.8828125, "learning_rate": 0.00035364950946963606, "loss": 5.4178, "mean_token_accuracy": 0.1639969304203987, "num_tokens": 6040129.0, "step": 2160 }, { "entropy": 5.572449398040772, "epoch": 0.05861252115059222, "grad_norm": 0.9375, "learning_rate": 0.0003525446577142663, "loss": 5.5237, "mean_token_accuracy": 0.15481064915657045, "num_tokens": 6052988.0, "step": 2165 }, { "entropy": 5.599097108840942, "epoch": 0.058747884940778344, "grad_norm": 0.97265625, "learning_rate": 0.00035143768003293395, "loss": 5.4731, "mean_token_accuracy": 0.16200729161500932, "num_tokens": 6066901.0, "step": 2170 }, { "entropy": 5.604894495010376, "epoch": 0.05888324873096447, "grad_norm": 1.03125, "learning_rate": 0.0003503286067739913, "loss": 5.4809, "mean_token_accuracy": 0.15721836537122727, "num_tokens": 6080221.0, "step": 2175 }, { "entropy": 5.617720413208008, "epoch": 0.05901861252115059, "grad_norm": 1.03125, "learning_rate": 0.00034921746834324193, "loss": 5.5341, "mean_token_accuracy": 0.14920639246702194, "num_tokens": 6093591.0, "step": 2180 }, { "entropy": 5.5153953552246096, "epoch": 0.05915397631133672, "grad_norm": 0.91796875, "learning_rate": 0.0003481042952031072, "loss": 5.4102, "mean_token_accuracy": 0.15838973969221115, "num_tokens": 6107427.0, "step": 2185 }, { "entropy": 5.622984933853149, "epoch": 0.05928934010152284, "grad_norm": 0.984375, "learning_rate": 0.0003469891178717911, "loss": 5.5577, "mean_token_accuracy": 0.15597878992557526, "num_tokens": 6121355.0, "step": 2190 }, { "entropy": 5.5580566883087155, "epoch": 0.059424703891708966, "grad_norm": 1.0390625, "learning_rate": 0.0003458719669224436, "loss": 5.5422, "mean_token_accuracy": 0.15654557049274445, "num_tokens": 6133328.0, "step": 2195 }, { "entropy": 5.6222865104675295, "epoch": 0.05956006768189509, "grad_norm": 0.9296875, "learning_rate": 0.0003447528729823221, "loss": 5.4815, "mean_token_accuracy": 0.15166250467300416, "num_tokens": 6149486.0, "step": 2200 }, { "entropy": 5.561207914352417, "epoch": 0.05969543147208122, "grad_norm": 1.0234375, "learning_rate": 0.0003436318667319525, "loss": 5.4912, "mean_token_accuracy": 0.1630606085062027, "num_tokens": 6161447.0, "step": 2205 }, { "entropy": 5.557836532592773, "epoch": 0.059830795262267346, "grad_norm": 0.99609375, "learning_rate": 0.00034250897890428716, "loss": 5.5187, "mean_token_accuracy": 0.15890539884567262, "num_tokens": 6176368.0, "step": 2210 }, { "entropy": 5.5497699737548825, "epoch": 0.05996615905245347, "grad_norm": 0.9296875, "learning_rate": 0.0003413842402838633, "loss": 5.4567, "mean_token_accuracy": 0.1620472937822342, "num_tokens": 6190248.0, "step": 2215 }, { "entropy": 5.514479446411133, "epoch": 0.060101522842639594, "grad_norm": 0.97265625, "learning_rate": 0.00034025768170595834, "loss": 5.3753, "mean_token_accuracy": 0.16145753711462021, "num_tokens": 6205507.0, "step": 2220 }, { "entropy": 5.512839603424072, "epoch": 0.06023688663282572, "grad_norm": 0.875, "learning_rate": 0.0003391293340557446, "loss": 5.4593, "mean_token_accuracy": 0.15989638343453408, "num_tokens": 6218970.0, "step": 2225 }, { "entropy": 5.630588674545288, "epoch": 0.06037225042301184, "grad_norm": 1.0078125, "learning_rate": 0.0003379992282674431, "loss": 5.5762, "mean_token_accuracy": 0.15546667575836182, "num_tokens": 6232095.0, "step": 2230 }, { "entropy": 5.60104660987854, "epoch": 0.06050761421319797, "grad_norm": 0.8203125, "learning_rate": 0.0003368673953234749, "loss": 5.4843, "mean_token_accuracy": 0.16127849221229554, "num_tokens": 6247195.0, "step": 2235 }, { "entropy": 5.5306642055511475, "epoch": 0.06064297800338409, "grad_norm": 0.953125, "learning_rate": 0.00033573386625361176, "loss": 5.5001, "mean_token_accuracy": 0.15367966145277023, "num_tokens": 6262704.0, "step": 2240 }, { "entropy": 5.612587547302246, "epoch": 0.06077834179357022, "grad_norm": 0.92578125, "learning_rate": 0.00033459867213412567, "loss": 5.5317, "mean_token_accuracy": 0.15857135504484177, "num_tokens": 6277115.0, "step": 2245 }, { "entropy": 5.64555606842041, "epoch": 0.06091370558375635, "grad_norm": 0.9453125, "learning_rate": 0.000333461844086937, "loss": 5.5412, "mean_token_accuracy": 0.15073265060782431, "num_tokens": 6291597.0, "step": 2250 }, { "entropy": 5.520713806152344, "epoch": 0.06104906937394247, "grad_norm": 0.90234375, "learning_rate": 0.00033232341327876097, "loss": 5.4102, "mean_token_accuracy": 0.16134743243455887, "num_tokens": 6306256.0, "step": 2255 }, { "entropy": 5.444108724594116, "epoch": 0.061184433164128596, "grad_norm": 0.98828125, "learning_rate": 0.0003311834109202531, "loss": 5.4201, "mean_token_accuracy": 0.16176949292421341, "num_tokens": 6320853.0, "step": 2260 }, { "entropy": 5.6139593601226805, "epoch": 0.06131979695431472, "grad_norm": 0.95703125, "learning_rate": 0.00033004186826515416, "loss": 5.4732, "mean_token_accuracy": 0.15738911405205727, "num_tokens": 6334681.0, "step": 2265 }, { "entropy": 5.526891708374023, "epoch": 0.061455160744500845, "grad_norm": 0.9140625, "learning_rate": 0.0003288988166094324, "loss": 5.4956, "mean_token_accuracy": 0.15784757435321808, "num_tokens": 6350426.0, "step": 2270 }, { "entropy": 5.58657021522522, "epoch": 0.06159052453468697, "grad_norm": 0.921875, "learning_rate": 0.00032775428729042656, "loss": 5.4416, "mean_token_accuracy": 0.16237595677375793, "num_tokens": 6364646.0, "step": 2275 }, { "entropy": 5.508593463897705, "epoch": 0.06172588832487309, "grad_norm": 0.94140625, "learning_rate": 0.000326608311685986, "loss": 5.4866, "mean_token_accuracy": 0.16056797206401824, "num_tokens": 6380020.0, "step": 2280 }, { "entropy": 5.6077048778533936, "epoch": 0.061861252115059225, "grad_norm": 0.91015625, "learning_rate": 0.0003254609212136108, "loss": 5.4236, "mean_token_accuracy": 0.16293450444936752, "num_tokens": 6393124.0, "step": 2285 }, { "entropy": 5.595155477523804, "epoch": 0.06199661590524535, "grad_norm": 0.890625, "learning_rate": 0.00032431214732959036, "loss": 5.5536, "mean_token_accuracy": 0.1563761591911316, "num_tokens": 6409125.0, "step": 2290 }, { "entropy": 5.585239553451538, "epoch": 0.06213197969543147, "grad_norm": 0.8828125, "learning_rate": 0.000323162021528141, "loss": 5.4177, "mean_token_accuracy": 0.16349790394306182, "num_tokens": 6423597.0, "step": 2295 }, { "entropy": 5.47139458656311, "epoch": 0.0622673434856176, "grad_norm": 0.86328125, "learning_rate": 0.00032201057534054264, "loss": 5.349, "mean_token_accuracy": 0.16430194079875945, "num_tokens": 6437897.0, "step": 2300 }, { "entropy": 5.547074794769287, "epoch": 0.06240270727580372, "grad_norm": 0.91015625, "learning_rate": 0.00032085784033427414, "loss": 5.5022, "mean_token_accuracy": 0.15308141559362412, "num_tokens": 6451760.0, "step": 2305 }, { "entropy": 5.511609315872192, "epoch": 0.06253807106598985, "grad_norm": 1.03125, "learning_rate": 0.0003197038481121478, "loss": 5.3525, "mean_token_accuracy": 0.16880294680595398, "num_tokens": 6465182.0, "step": 2310 }, { "entropy": 5.574721622467041, "epoch": 0.06267343485617598, "grad_norm": 0.890625, "learning_rate": 0.0003185486303114436, "loss": 5.4606, "mean_token_accuracy": 0.15778982043266296, "num_tokens": 6479146.0, "step": 2315 }, { "entropy": 5.50466685295105, "epoch": 0.0628087986463621, "grad_norm": 0.984375, "learning_rate": 0.0003173922186030409, "loss": 5.3229, "mean_token_accuracy": 0.16876034587621688, "num_tokens": 6492562.0, "step": 2320 }, { "entropy": 5.41968674659729, "epoch": 0.06294416243654823, "grad_norm": 1.03125, "learning_rate": 0.000316234644690551, "loss": 5.38, "mean_token_accuracy": 0.16006240993738174, "num_tokens": 6506530.0, "step": 2325 }, { "entropy": 5.528688192367554, "epoch": 0.06307952622673435, "grad_norm": 0.9921875, "learning_rate": 0.0003150759403094473, "loss": 5.434, "mean_token_accuracy": 0.16276055127382277, "num_tokens": 6521676.0, "step": 2330 }, { "entropy": 5.513411903381348, "epoch": 0.06321489001692047, "grad_norm": 0.98828125, "learning_rate": 0.00031391613722619587, "loss": 5.3759, "mean_token_accuracy": 0.1745678424835205, "num_tokens": 6532997.0, "step": 2335 }, { "entropy": 5.529337978363037, "epoch": 0.0633502538071066, "grad_norm": 0.97265625, "learning_rate": 0.000312755267237384, "loss": 5.4224, "mean_token_accuracy": 0.16465317010879515, "num_tokens": 6548174.0, "step": 2340 }, { "entropy": 5.6073933124542235, "epoch": 0.06348561759729272, "grad_norm": 0.953125, "learning_rate": 0.0003115933621688488, "loss": 5.5427, "mean_token_accuracy": 0.15725521594285966, "num_tokens": 6563064.0, "step": 2345 }, { "entropy": 5.537544775009155, "epoch": 0.06362098138747885, "grad_norm": 1.0390625, "learning_rate": 0.00031043045387480487, "loss": 5.5134, "mean_token_accuracy": 0.15672265142202377, "num_tokens": 6576582.0, "step": 2350 }, { "entropy": 5.655880641937256, "epoch": 0.06375634517766497, "grad_norm": 0.90234375, "learning_rate": 0.0003092665742369703, "loss": 5.4981, "mean_token_accuracy": 0.153935007750988, "num_tokens": 6592583.0, "step": 2355 }, { "entropy": 5.640050649642944, "epoch": 0.0638917089678511, "grad_norm": 0.8984375, "learning_rate": 0.00030810175516369343, "loss": 5.5216, "mean_token_accuracy": 0.1580222949385643, "num_tokens": 6608513.0, "step": 2360 }, { "entropy": 5.569810676574707, "epoch": 0.06402707275803722, "grad_norm": 0.890625, "learning_rate": 0.0003069360285890775, "loss": 5.4921, "mean_token_accuracy": 0.15731192976236344, "num_tokens": 6622427.0, "step": 2365 }, { "entropy": 5.60255537033081, "epoch": 0.06416243654822334, "grad_norm": 0.96484375, "learning_rate": 0.00030576942647210547, "loss": 5.4613, "mean_token_accuracy": 0.16770876348018646, "num_tokens": 6636196.0, "step": 2370 }, { "entropy": 5.543747758865356, "epoch": 0.06429780033840947, "grad_norm": 1.046875, "learning_rate": 0.00030460198079576355, "loss": 5.4506, "mean_token_accuracy": 0.16442616730928422, "num_tokens": 6648393.0, "step": 2375 }, { "entropy": 5.5761157989501955, "epoch": 0.06443316412859561, "grad_norm": 0.97265625, "learning_rate": 0.0003034337235661648, "loss": 5.4201, "mean_token_accuracy": 0.16427001357078552, "num_tokens": 6662062.0, "step": 2380 }, { "entropy": 5.5971932888031, "epoch": 0.06456852791878173, "grad_norm": 0.94921875, "learning_rate": 0.0003022646868116714, "loss": 5.4853, "mean_token_accuracy": 0.1576756104826927, "num_tokens": 6677299.0, "step": 2385 }, { "entropy": 5.595594882965088, "epoch": 0.06470389170896786, "grad_norm": 1.046875, "learning_rate": 0.0003010949025820163, "loss": 5.5071, "mean_token_accuracy": 0.15385562032461167, "num_tokens": 6692573.0, "step": 2390 }, { "entropy": 5.709032297134399, "epoch": 0.06483925549915398, "grad_norm": 0.9453125, "learning_rate": 0.0002999244029474252, "loss": 5.5817, "mean_token_accuracy": 0.15576104819774628, "num_tokens": 6706081.0, "step": 2395 }, { "entropy": 5.572895097732544, "epoch": 0.0649746192893401, "grad_norm": 0.8515625, "learning_rate": 0.00029875321999773684, "loss": 5.4139, "mean_token_accuracy": 0.1568359524011612, "num_tokens": 6721662.0, "step": 2400 }, { "entropy": 5.530266189575196, "epoch": 0.06510998307952623, "grad_norm": 1.046875, "learning_rate": 0.00029758138584152333, "loss": 5.5371, "mean_token_accuracy": 0.15827345550060273, "num_tokens": 6735226.0, "step": 2405 }, { "entropy": 5.741498231887817, "epoch": 0.06524534686971235, "grad_norm": 0.87890625, "learning_rate": 0.0002964089326052102, "loss": 5.61, "mean_token_accuracy": 0.1486797995865345, "num_tokens": 6750351.0, "step": 2410 }, { "entropy": 5.482465362548828, "epoch": 0.06538071065989848, "grad_norm": 1.0546875, "learning_rate": 0.0002952358924321949, "loss": 5.343, "mean_token_accuracy": 0.1717396318912506, "num_tokens": 6762285.0, "step": 2415 }, { "entropy": 5.579564380645752, "epoch": 0.0655160744500846, "grad_norm": 0.9453125, "learning_rate": 0.00029406229748196657, "loss": 5.5056, "mean_token_accuracy": 0.15708825439214708, "num_tokens": 6778866.0, "step": 2420 }, { "entropy": 5.575643253326416, "epoch": 0.06565143824027073, "grad_norm": 0.9140625, "learning_rate": 0.0002928881799292235, "loss": 5.3694, "mean_token_accuracy": 0.16926451921463012, "num_tokens": 6792127.0, "step": 2425 }, { "entropy": 5.550977325439453, "epoch": 0.06578680203045685, "grad_norm": 0.94140625, "learning_rate": 0.00029171357196299154, "loss": 5.5019, "mean_token_accuracy": 0.15696292817592622, "num_tokens": 6805692.0, "step": 2430 }, { "entropy": 5.502995109558105, "epoch": 0.06592216582064298, "grad_norm": 0.86328125, "learning_rate": 0.0002905385057857414, "loss": 5.4826, "mean_token_accuracy": 0.15718090236186982, "num_tokens": 6820533.0, "step": 2435 }, { "entropy": 5.5539785861969, "epoch": 0.0660575296108291, "grad_norm": 0.8671875, "learning_rate": 0.0002893630136125058, "loss": 5.38, "mean_token_accuracy": 0.1642708361148834, "num_tokens": 6834746.0, "step": 2440 }, { "entropy": 5.579140996932983, "epoch": 0.06619289340101522, "grad_norm": 0.9375, "learning_rate": 0.0002881871276699967, "loss": 5.432, "mean_token_accuracy": 0.1649514243006706, "num_tokens": 6848480.0, "step": 2445 }, { "entropy": 5.482105016708374, "epoch": 0.06632825719120135, "grad_norm": 0.875, "learning_rate": 0.00028701088019572114, "loss": 5.4089, "mean_token_accuracy": 0.16585078686475754, "num_tokens": 6863817.0, "step": 2450 }, { "entropy": 5.485904407501221, "epoch": 0.06646362098138747, "grad_norm": 0.953125, "learning_rate": 0.0002858343034370977, "loss": 5.3672, "mean_token_accuracy": 0.1629736080765724, "num_tokens": 6879028.0, "step": 2455 }, { "entropy": 5.567845058441162, "epoch": 0.06659898477157361, "grad_norm": 1.0, "learning_rate": 0.00028465742965057267, "loss": 5.4993, "mean_token_accuracy": 0.1671033576130867, "num_tokens": 6892582.0, "step": 2460 }, { "entropy": 5.588065147399902, "epoch": 0.06673434856175973, "grad_norm": 0.98046875, "learning_rate": 0.00028348029110073533, "loss": 5.3907, "mean_token_accuracy": 0.15922013744711877, "num_tokens": 6905716.0, "step": 2465 }, { "entropy": 5.482119083404541, "epoch": 0.06686971235194586, "grad_norm": 1.0625, "learning_rate": 0.00028230292005943365, "loss": 5.3633, "mean_token_accuracy": 0.17306406795978546, "num_tokens": 6920266.0, "step": 2470 }, { "entropy": 5.454979324340821, "epoch": 0.06700507614213198, "grad_norm": 0.83984375, "learning_rate": 0.00028112534880488945, "loss": 5.4226, "mean_token_accuracy": 0.16642075926065444, "num_tokens": 6934274.0, "step": 2475 }, { "entropy": 5.539786052703858, "epoch": 0.06714043993231811, "grad_norm": 0.8984375, "learning_rate": 0.0002799476096208137, "loss": 5.4063, "mean_token_accuracy": 0.16389644294977188, "num_tokens": 6949020.0, "step": 2480 }, { "entropy": 5.504109811782837, "epoch": 0.06727580372250423, "grad_norm": 0.98828125, "learning_rate": 0.00027876973479552087, "loss": 5.3474, "mean_token_accuracy": 0.16669356375932692, "num_tokens": 6962687.0, "step": 2485 }, { "entropy": 5.562744235992431, "epoch": 0.06741116751269036, "grad_norm": 0.87890625, "learning_rate": 0.00027759175662104424, "loss": 5.5178, "mean_token_accuracy": 0.15945329070091246, "num_tokens": 6977877.0, "step": 2490 }, { "entropy": 5.653814268112183, "epoch": 0.06754653130287648, "grad_norm": 0.98046875, "learning_rate": 0.0002764137073922508, "loss": 5.561, "mean_token_accuracy": 0.15105569660663604, "num_tokens": 6992784.0, "step": 2495 }, { "entropy": 5.4771082401275635, "epoch": 0.0676818950930626, "grad_norm": 1.0078125, "learning_rate": 0.00027523561940595505, "loss": 5.3698, "mean_token_accuracy": 0.17183669209480285, "num_tokens": 7007496.0, "step": 2500 }, { "entropy": 5.495787239074707, "epoch": 0.06781725888324873, "grad_norm": 0.875, "learning_rate": 0.0002740575249600342, "loss": 5.3815, "mean_token_accuracy": 0.16253670752048494, "num_tokens": 7020482.0, "step": 2505 }, { "entropy": 5.591378307342529, "epoch": 0.06795262267343485, "grad_norm": 0.9921875, "learning_rate": 0.00027287945635254263, "loss": 5.4631, "mean_token_accuracy": 0.15494969636201858, "num_tokens": 7034021.0, "step": 2510 }, { "entropy": 5.639207792282105, "epoch": 0.06808798646362098, "grad_norm": 1.0234375, "learning_rate": 0.00027170144588082635, "loss": 5.4504, "mean_token_accuracy": 0.156061589717865, "num_tokens": 7046897.0, "step": 2515 }, { "entropy": 5.4708277702331545, "epoch": 0.0682233502538071, "grad_norm": 1.0, "learning_rate": 0.00027052352584063763, "loss": 5.3641, "mean_token_accuracy": 0.16388892978429795, "num_tokens": 7060916.0, "step": 2520 }, { "entropy": 5.4516136169433596, "epoch": 0.06835871404399323, "grad_norm": 1.0546875, "learning_rate": 0.00026934572852524907, "loss": 5.3295, "mean_token_accuracy": 0.1627664878964424, "num_tokens": 7074298.0, "step": 2525 }, { "entropy": 5.521515798568726, "epoch": 0.06849407783417935, "grad_norm": 1.03125, "learning_rate": 0.00026816808622456937, "loss": 5.3544, "mean_token_accuracy": 0.16788979172706603, "num_tokens": 7088716.0, "step": 2530 }, { "entropy": 5.494029998779297, "epoch": 0.06862944162436548, "grad_norm": 0.91796875, "learning_rate": 0.0002669906312242569, "loss": 5.346, "mean_token_accuracy": 0.17190950810909272, "num_tokens": 7103508.0, "step": 2535 }, { "entropy": 5.537734889984131, "epoch": 0.06876480541455161, "grad_norm": 1.0078125, "learning_rate": 0.00026581339580483525, "loss": 5.4624, "mean_token_accuracy": 0.161481374502182, "num_tokens": 7117534.0, "step": 2540 }, { "entropy": 5.570920372009278, "epoch": 0.06890016920473774, "grad_norm": 1.0390625, "learning_rate": 0.0002646364122408082, "loss": 5.4882, "mean_token_accuracy": 0.15791051536798478, "num_tokens": 7130707.0, "step": 2545 }, { "entropy": 5.582677364349365, "epoch": 0.06903553299492386, "grad_norm": 0.9453125, "learning_rate": 0.0002634597127997749, "loss": 5.482, "mean_token_accuracy": 0.16266081035137175, "num_tokens": 7146298.0, "step": 2550 }, { "entropy": 5.409732484817505, "epoch": 0.06917089678510999, "grad_norm": 0.84375, "learning_rate": 0.0002622833297415445, "loss": 5.2559, "mean_token_accuracy": 0.17082736790180206, "num_tokens": 7161266.0, "step": 2555 }, { "entropy": 5.504514932632446, "epoch": 0.06930626057529611, "grad_norm": 0.875, "learning_rate": 0.0002611072953172531, "loss": 5.3892, "mean_token_accuracy": 0.16824420988559724, "num_tokens": 7175543.0, "step": 2560 }, { "entropy": 5.419651794433594, "epoch": 0.06944162436548224, "grad_norm": 1.015625, "learning_rate": 0.00025993164176847845, "loss": 5.3044, "mean_token_accuracy": 0.17822718918323516, "num_tokens": 7189617.0, "step": 2565 }, { "entropy": 5.537864732742309, "epoch": 0.06957698815566836, "grad_norm": 1.0078125, "learning_rate": 0.0002587564013263564, "loss": 5.3945, "mean_token_accuracy": 0.1665595144033432, "num_tokens": 7203722.0, "step": 2570 }, { "entropy": 5.484334468841553, "epoch": 0.06971235194585448, "grad_norm": 0.953125, "learning_rate": 0.0002575816062106974, "loss": 5.3907, "mean_token_accuracy": 0.1719420000910759, "num_tokens": 7215988.0, "step": 2575 }, { "entropy": 5.398307371139526, "epoch": 0.06984771573604061, "grad_norm": 0.8828125, "learning_rate": 0.00025640728862910293, "loss": 5.2727, "mean_token_accuracy": 0.16697476506233216, "num_tokens": 7231974.0, "step": 2580 }, { "entropy": 5.451391649246216, "epoch": 0.06998307952622673, "grad_norm": 0.94140625, "learning_rate": 0.00025523348077608285, "loss": 5.334, "mean_token_accuracy": 0.16734268814325332, "num_tokens": 7247564.0, "step": 2585 }, { "entropy": 5.557687759399414, "epoch": 0.07011844331641286, "grad_norm": 0.97265625, "learning_rate": 0.00025406021483217225, "loss": 5.3802, "mean_token_accuracy": 0.16443277895450592, "num_tokens": 7262757.0, "step": 2590 }, { "entropy": 5.511172676086426, "epoch": 0.07025380710659898, "grad_norm": 0.95703125, "learning_rate": 0.00025288752296304963, "loss": 5.4948, "mean_token_accuracy": 0.15715145468711852, "num_tokens": 7277354.0, "step": 2595 }, { "entropy": 5.5072393894195555, "epoch": 0.0703891708967851, "grad_norm": 0.9296875, "learning_rate": 0.000251715437318655, "loss": 5.3905, "mean_token_accuracy": 0.1723044529557228, "num_tokens": 7291468.0, "step": 2600 }, { "entropy": 5.505620288848877, "epoch": 0.07052453468697123, "grad_norm": 1.0, "learning_rate": 0.0002505439900323084, "loss": 5.2772, "mean_token_accuracy": 0.17259037345647812, "num_tokens": 7304480.0, "step": 2605 }, { "entropy": 5.533134651184082, "epoch": 0.07065989847715735, "grad_norm": 0.94140625, "learning_rate": 0.00024937321321982894, "loss": 5.388, "mean_token_accuracy": 0.15711098909378052, "num_tokens": 7318827.0, "step": 2610 }, { "entropy": 5.462842607498169, "epoch": 0.07079526226734349, "grad_norm": 0.95703125, "learning_rate": 0.00024820313897865433, "loss": 5.4047, "mean_token_accuracy": 0.16648803055286407, "num_tokens": 7331988.0, "step": 2615 }, { "entropy": 5.606928825378418, "epoch": 0.07093062605752962, "grad_norm": 0.90625, "learning_rate": 0.00024703379938696105, "loss": 5.3909, "mean_token_accuracy": 0.16330956071615219, "num_tokens": 7345740.0, "step": 2620 }, { "entropy": 5.496723222732544, "epoch": 0.07106598984771574, "grad_norm": 0.86328125, "learning_rate": 0.00024586522650278447, "loss": 5.3324, "mean_token_accuracy": 0.1629031166434288, "num_tokens": 7359100.0, "step": 2625 }, { "entropy": 5.492794418334961, "epoch": 0.07120135363790187, "grad_norm": 0.96484375, "learning_rate": 0.00024469745236314064, "loss": 5.4332, "mean_token_accuracy": 0.16518517211079597, "num_tokens": 7373261.0, "step": 2630 }, { "entropy": 5.497795438766479, "epoch": 0.07133671742808799, "grad_norm": 1.0546875, "learning_rate": 0.00024353050898314767, "loss": 5.3778, "mean_token_accuracy": 0.16042957752943038, "num_tokens": 7386125.0, "step": 2635 }, { "entropy": 5.579156875610352, "epoch": 0.07147208121827411, "grad_norm": 0.94140625, "learning_rate": 0.00024236442835514743, "loss": 5.4228, "mean_token_accuracy": 0.16269408017396927, "num_tokens": 7400206.0, "step": 2640 }, { "entropy": 5.575217056274414, "epoch": 0.07160744500846024, "grad_norm": 0.94921875, "learning_rate": 0.00024119924244782965, "loss": 5.3759, "mean_token_accuracy": 0.16886017620563507, "num_tokens": 7414133.0, "step": 2645 }, { "entropy": 5.414534330368042, "epoch": 0.07174280879864636, "grad_norm": 0.92578125, "learning_rate": 0.00024003498320535462, "loss": 5.2814, "mean_token_accuracy": 0.17329987585544587, "num_tokens": 7428976.0, "step": 2650 }, { "entropy": 5.428465366363525, "epoch": 0.07187817258883249, "grad_norm": 0.94921875, "learning_rate": 0.00023887168254647727, "loss": 5.2716, "mean_token_accuracy": 0.16944997161626815, "num_tokens": 7442821.0, "step": 2655 }, { "entropy": 5.4997495174407955, "epoch": 0.07201353637901861, "grad_norm": 0.90625, "learning_rate": 0.00023770937236367308, "loss": 5.3966, "mean_token_accuracy": 0.16241525560617448, "num_tokens": 7459447.0, "step": 2660 }, { "entropy": 5.482759618759156, "epoch": 0.07214890016920474, "grad_norm": 0.89453125, "learning_rate": 0.00023654808452226278, "loss": 5.3326, "mean_token_accuracy": 0.17035989910364152, "num_tokens": 7474103.0, "step": 2665 }, { "entropy": 5.577449703216553, "epoch": 0.07228426395939086, "grad_norm": 1.015625, "learning_rate": 0.00023538785085953912, "loss": 5.4343, "mean_token_accuracy": 0.16333755105733871, "num_tokens": 7487976.0, "step": 2670 }, { "entropy": 5.547738122940063, "epoch": 0.07241962774957698, "grad_norm": 0.953125, "learning_rate": 0.00023422870318389404, "loss": 5.4574, "mean_token_accuracy": 0.15718373358249665, "num_tokens": 7501915.0, "step": 2675 }, { "entropy": 5.518865013122559, "epoch": 0.07255499153976311, "grad_norm": 1.0078125, "learning_rate": 0.0002330706732739468, "loss": 5.4122, "mean_token_accuracy": 0.16701352149248122, "num_tokens": 7514901.0, "step": 2680 }, { "entropy": 5.494342899322509, "epoch": 0.07269035532994923, "grad_norm": 0.859375, "learning_rate": 0.00023191379287767211, "loss": 5.3231, "mean_token_accuracy": 0.16684457957744597, "num_tokens": 7528840.0, "step": 2685 }, { "entropy": 5.474505853652954, "epoch": 0.07282571912013536, "grad_norm": 0.96484375, "learning_rate": 0.0002307580937115305, "loss": 5.3626, "mean_token_accuracy": 0.16770108044147491, "num_tokens": 7543417.0, "step": 2690 }, { "entropy": 5.518067264556885, "epoch": 0.0729610829103215, "grad_norm": 0.91015625, "learning_rate": 0.00022960360745959846, "loss": 5.3038, "mean_token_accuracy": 0.1747143894433975, "num_tokens": 7556468.0, "step": 2695 }, { "entropy": 5.466390228271484, "epoch": 0.07309644670050762, "grad_norm": 0.9296875, "learning_rate": 0.00022845036577269972, "loss": 5.4043, "mean_token_accuracy": 0.16157454401254653, "num_tokens": 7570917.0, "step": 2700 }, { "entropy": 5.378308916091919, "epoch": 0.07323181049069374, "grad_norm": 0.92578125, "learning_rate": 0.00022729840026753777, "loss": 5.2936, "mean_token_accuracy": 0.17287229299545287, "num_tokens": 7585650.0, "step": 2705 }, { "entropy": 5.49935736656189, "epoch": 0.07336717428087987, "grad_norm": 0.90625, "learning_rate": 0.0002261477425258287, "loss": 5.3034, "mean_token_accuracy": 0.16764113306999207, "num_tokens": 7599526.0, "step": 2710 }, { "entropy": 5.5813967227935795, "epoch": 0.07350253807106599, "grad_norm": 1.0390625, "learning_rate": 0.0002249984240934358, "loss": 5.373, "mean_token_accuracy": 0.16482538282871245, "num_tokens": 7612788.0, "step": 2715 }, { "entropy": 5.462430143356324, "epoch": 0.07363790186125212, "grad_norm": 0.95703125, "learning_rate": 0.00022385047647950464, "loss": 5.3176, "mean_token_accuracy": 0.1712317556142807, "num_tokens": 7626130.0, "step": 2720 }, { "entropy": 5.512141418457031, "epoch": 0.07377326565143824, "grad_norm": 0.91796875, "learning_rate": 0.0002227039311555986, "loss": 5.4048, "mean_token_accuracy": 0.16659581065177917, "num_tokens": 7641082.0, "step": 2725 }, { "entropy": 5.458144950866699, "epoch": 0.07390862944162437, "grad_norm": 0.88671875, "learning_rate": 0.0002215588195548372, "loss": 5.279, "mean_token_accuracy": 0.17415901124477387, "num_tokens": 7656106.0, "step": 2730 }, { "entropy": 5.5800501823425295, "epoch": 0.07404399323181049, "grad_norm": 0.984375, "learning_rate": 0.00022041517307103337, "loss": 5.4972, "mean_token_accuracy": 0.1576918765902519, "num_tokens": 7669987.0, "step": 2735 }, { "entropy": 5.4527280807495115, "epoch": 0.07417935702199661, "grad_norm": 1.0546875, "learning_rate": 0.0002192730230578331, "loss": 5.254, "mean_token_accuracy": 0.17619728147983552, "num_tokens": 7684919.0, "step": 2740 }, { "entropy": 5.430622720718384, "epoch": 0.07431472081218274, "grad_norm": 0.96875, "learning_rate": 0.0002181324008278559, "loss": 5.2826, "mean_token_accuracy": 0.17135830372571945, "num_tokens": 7696787.0, "step": 2745 }, { "entropy": 5.481793308258057, "epoch": 0.07445008460236886, "grad_norm": 0.875, "learning_rate": 0.00021699333765183655, "loss": 5.3837, "mean_token_accuracy": 0.16583613455295562, "num_tokens": 7709630.0, "step": 2750 }, { "entropy": 5.461789512634278, "epoch": 0.07458544839255499, "grad_norm": 0.87890625, "learning_rate": 0.0002158558647577673, "loss": 5.343, "mean_token_accuracy": 0.16185439378023148, "num_tokens": 7724842.0, "step": 2755 }, { "entropy": 5.428160953521728, "epoch": 0.07472081218274111, "grad_norm": 1.0390625, "learning_rate": 0.00021472001333004215, "loss": 5.1693, "mean_token_accuracy": 0.17251513451337813, "num_tokens": 7739569.0, "step": 2760 }, { "entropy": 5.427040004730225, "epoch": 0.07485617597292724, "grad_norm": 0.96875, "learning_rate": 0.00021358581450860186, "loss": 5.207, "mean_token_accuracy": 0.17038764506578447, "num_tokens": 7753711.0, "step": 2765 }, { "entropy": 5.465088510513306, "epoch": 0.07499153976311337, "grad_norm": 0.98828125, "learning_rate": 0.0002124532993880799, "loss": 5.3172, "mean_token_accuracy": 0.16422780603170395, "num_tokens": 7768388.0, "step": 2770 }, { "entropy": 5.467406845092773, "epoch": 0.0751269035532995, "grad_norm": 0.890625, "learning_rate": 0.00021132249901695044, "loss": 5.3397, "mean_token_accuracy": 0.1675926923751831, "num_tokens": 7783723.0, "step": 2775 }, { "entropy": 5.510707998275757, "epoch": 0.07526226734348562, "grad_norm": 0.87890625, "learning_rate": 0.00021019344439667705, "loss": 5.3986, "mean_token_accuracy": 0.16413299441337587, "num_tokens": 7799084.0, "step": 2780 }, { "entropy": 5.533675479888916, "epoch": 0.07539763113367175, "grad_norm": 0.84765625, "learning_rate": 0.00020906616648086213, "loss": 5.3946, "mean_token_accuracy": 0.1620550975203514, "num_tokens": 7814644.0, "step": 2785 }, { "entropy": 5.467060947418213, "epoch": 0.07553299492385787, "grad_norm": 0.98828125, "learning_rate": 0.00020794069617439942, "loss": 5.2889, "mean_token_accuracy": 0.17744391411542892, "num_tokens": 7829458.0, "step": 2790 }, { "entropy": 5.52356595993042, "epoch": 0.075668358714044, "grad_norm": 1.0, "learning_rate": 0.00020681706433262593, "loss": 5.3376, "mean_token_accuracy": 0.17330960631370546, "num_tokens": 7844811.0, "step": 2795 }, { "entropy": 5.436047220230103, "epoch": 0.07580372250423012, "grad_norm": 0.98046875, "learning_rate": 0.00020569530176047602, "loss": 5.245, "mean_token_accuracy": 0.17710321843624116, "num_tokens": 7857008.0, "step": 2800 }, { "entropy": 5.451122379302978, "epoch": 0.07593908629441624, "grad_norm": 0.890625, "learning_rate": 0.0002045754392116374, "loss": 5.3629, "mean_token_accuracy": 0.17095964550971984, "num_tokens": 7871976.0, "step": 2805 }, { "entropy": 5.513166713714599, "epoch": 0.07607445008460237, "grad_norm": 1.015625, "learning_rate": 0.00020345750738770757, "loss": 5.2591, "mean_token_accuracy": 0.16977263540029525, "num_tokens": 7885961.0, "step": 2810 }, { "entropy": 5.454839134216309, "epoch": 0.07620981387478849, "grad_norm": 0.828125, "learning_rate": 0.00020234153693735214, "loss": 5.2422, "mean_token_accuracy": 0.18533623367547988, "num_tokens": 7900771.0, "step": 2815 }, { "entropy": 5.501101541519165, "epoch": 0.07634517766497462, "grad_norm": 0.92578125, "learning_rate": 0.0002012275584554647, "loss": 5.3521, "mean_token_accuracy": 0.16500504612922667, "num_tokens": 7914177.0, "step": 2820 }, { "entropy": 5.530455732345581, "epoch": 0.07648054145516074, "grad_norm": 0.97265625, "learning_rate": 0.00020011560248232803, "loss": 5.3338, "mean_token_accuracy": 0.17148594111204146, "num_tokens": 7926304.0, "step": 2825 }, { "entropy": 5.51822681427002, "epoch": 0.07661590524534687, "grad_norm": 0.875, "learning_rate": 0.00019900569950277692, "loss": 5.3958, "mean_token_accuracy": 0.17159417718648912, "num_tokens": 7940643.0, "step": 2830 }, { "entropy": 5.498433589935303, "epoch": 0.07675126903553299, "grad_norm": 0.984375, "learning_rate": 0.00019789787994536228, "loss": 5.3133, "mean_token_accuracy": 0.1724165916442871, "num_tokens": 7953973.0, "step": 2835 }, { "entropy": 5.487789058685303, "epoch": 0.07688663282571911, "grad_norm": 0.96875, "learning_rate": 0.00019679217418151667, "loss": 5.2822, "mean_token_accuracy": 0.175179585814476, "num_tokens": 7968097.0, "step": 2840 }, { "entropy": 5.485777091979981, "epoch": 0.07702199661590524, "grad_norm": 1.0078125, "learning_rate": 0.00019568861252472236, "loss": 5.4075, "mean_token_accuracy": 0.17055005431175232, "num_tokens": 7981377.0, "step": 2845 }, { "entropy": 5.480043888092041, "epoch": 0.07715736040609138, "grad_norm": 0.8984375, "learning_rate": 0.00019458722522967952, "loss": 5.2816, "mean_token_accuracy": 0.17032997757196428, "num_tokens": 7996347.0, "step": 2850 }, { "entropy": 5.440441513061524, "epoch": 0.0772927241962775, "grad_norm": 1.0390625, "learning_rate": 0.00019348804249147723, "loss": 5.2801, "mean_token_accuracy": 0.16763708293437957, "num_tokens": 8009085.0, "step": 2855 }, { "entropy": 5.496013021469116, "epoch": 0.07742808798646363, "grad_norm": 0.9453125, "learning_rate": 0.0001923910944447655, "loss": 5.3578, "mean_token_accuracy": 0.1683908924460411, "num_tokens": 8022972.0, "step": 2860 }, { "entropy": 5.463598155975342, "epoch": 0.07756345177664975, "grad_norm": 1.0, "learning_rate": 0.00019129641116292928, "loss": 5.2517, "mean_token_accuracy": 0.17301710844039916, "num_tokens": 8036721.0, "step": 2865 }, { "entropy": 5.497069406509399, "epoch": 0.07769881556683587, "grad_norm": 0.96484375, "learning_rate": 0.00019020402265726343, "loss": 5.3642, "mean_token_accuracy": 0.17259056568145753, "num_tokens": 8051907.0, "step": 2870 }, { "entropy": 5.599059247970581, "epoch": 0.077834179357022, "grad_norm": 0.83984375, "learning_rate": 0.0001891139588761509, "loss": 5.4207, "mean_token_accuracy": 0.15925686806440353, "num_tokens": 8067550.0, "step": 2875 }, { "entropy": 5.518371534347534, "epoch": 0.07796954314720812, "grad_norm": 0.96875, "learning_rate": 0.00018802624970424076, "loss": 5.3844, "mean_token_accuracy": 0.17436740100383757, "num_tokens": 8081188.0, "step": 2880 }, { "entropy": 5.424393129348755, "epoch": 0.07810490693739425, "grad_norm": 0.98828125, "learning_rate": 0.00018694092496162945, "loss": 5.2155, "mean_token_accuracy": 0.17726275324821472, "num_tokens": 8095991.0, "step": 2885 }, { "entropy": 5.458485412597656, "epoch": 0.07824027072758037, "grad_norm": 0.9765625, "learning_rate": 0.00018585801440304306, "loss": 5.3427, "mean_token_accuracy": 0.16206988841295242, "num_tokens": 8110424.0, "step": 2890 }, { "entropy": 5.579003047943115, "epoch": 0.0783756345177665, "grad_norm": 0.80859375, "learning_rate": 0.00018477754771702165, "loss": 5.4071, "mean_token_accuracy": 0.16417887508869172, "num_tokens": 8127483.0, "step": 2895 }, { "entropy": 5.4810065746307375, "epoch": 0.07851099830795262, "grad_norm": 0.8671875, "learning_rate": 0.00018369955452510506, "loss": 5.2518, "mean_token_accuracy": 0.16933856457471846, "num_tokens": 8144871.0, "step": 2900 }, { "entropy": 5.363333082199096, "epoch": 0.07864636209813874, "grad_norm": 1.03125, "learning_rate": 0.0001826240643810212, "loss": 5.2339, "mean_token_accuracy": 0.18072881251573564, "num_tokens": 8159166.0, "step": 2905 }, { "entropy": 5.459006214141846, "epoch": 0.07878172588832487, "grad_norm": 0.96484375, "learning_rate": 0.0001815511067698758, "loss": 5.3428, "mean_token_accuracy": 0.1761472001671791, "num_tokens": 8173679.0, "step": 2910 }, { "entropy": 5.487945318222046, "epoch": 0.078917089678511, "grad_norm": 0.84375, "learning_rate": 0.0001804807111073436, "loss": 5.3272, "mean_token_accuracy": 0.1742970734834671, "num_tokens": 8189905.0, "step": 2915 }, { "entropy": 5.556151533126831, "epoch": 0.07905245346869712, "grad_norm": 0.89453125, "learning_rate": 0.0001794129067388625, "loss": 5.3454, "mean_token_accuracy": 0.16954322308301925, "num_tokens": 8204091.0, "step": 2920 }, { "entropy": 5.4311378479003904, "epoch": 0.07918781725888324, "grad_norm": 0.94140625, "learning_rate": 0.00017834772293882868, "loss": 5.271, "mean_token_accuracy": 0.1795088216662407, "num_tokens": 8217298.0, "step": 2925 }, { "entropy": 5.476504468917847, "epoch": 0.07932318104906938, "grad_norm": 1.0078125, "learning_rate": 0.000177285188909794, "loss": 5.3071, "mean_token_accuracy": 0.1695019334554672, "num_tokens": 8231131.0, "step": 2930 }, { "entropy": 5.490973567962646, "epoch": 0.0794585448392555, "grad_norm": 1.0859375, "learning_rate": 0.0001762253337816656, "loss": 5.3456, "mean_token_accuracy": 0.1681083619594574, "num_tokens": 8245409.0, "step": 2935 }, { "entropy": 5.53462929725647, "epoch": 0.07959390862944163, "grad_norm": 0.9765625, "learning_rate": 0.00017516818661090738, "loss": 5.3796, "mean_token_accuracy": 0.16535060852766037, "num_tokens": 8259802.0, "step": 2940 }, { "entropy": 5.458170461654663, "epoch": 0.07972927241962775, "grad_norm": 0.90625, "learning_rate": 0.0001741137763797428, "loss": 5.2636, "mean_token_accuracy": 0.1764928162097931, "num_tokens": 8273833.0, "step": 2945 }, { "entropy": 5.407339096069336, "epoch": 0.07986463620981388, "grad_norm": 1.0234375, "learning_rate": 0.00017306213199536115, "loss": 5.2234, "mean_token_accuracy": 0.176323065161705, "num_tokens": 8287181.0, "step": 2950 }, { "entropy": 5.467682838439941, "epoch": 0.08, "grad_norm": 0.94921875, "learning_rate": 0.0001720132822891243, "loss": 5.2588, "mean_token_accuracy": 0.16995817869901658, "num_tokens": 8300432.0, "step": 2955 }, { "entropy": 5.419669437408447, "epoch": 0.08013536379018613, "grad_norm": 0.9921875, "learning_rate": 0.0001709672560157769, "loss": 5.2418, "mean_token_accuracy": 0.18255811035633088, "num_tokens": 8313873.0, "step": 2960 }, { "entropy": 5.462170553207398, "epoch": 0.08027072758037225, "grad_norm": 0.97265625, "learning_rate": 0.00016992408185265758, "loss": 5.3659, "mean_token_accuracy": 0.16571080684661865, "num_tokens": 8329781.0, "step": 2965 }, { "entropy": 5.4735033988952635, "epoch": 0.08040609137055837, "grad_norm": 0.86328125, "learning_rate": 0.00016888378839891298, "loss": 5.3732, "mean_token_accuracy": 0.16627077162265777, "num_tokens": 8346691.0, "step": 2970 }, { "entropy": 5.496302556991577, "epoch": 0.0805414551607445, "grad_norm": 0.89453125, "learning_rate": 0.0001678464041747137, "loss": 5.323, "mean_token_accuracy": 0.1704434260725975, "num_tokens": 8361779.0, "step": 2975 }, { "entropy": 5.521384286880493, "epoch": 0.08067681895093062, "grad_norm": 1.015625, "learning_rate": 0.00016681195762047223, "loss": 5.3293, "mean_token_accuracy": 0.16714472323656082, "num_tokens": 8376285.0, "step": 2980 }, { "entropy": 5.463702249526977, "epoch": 0.08081218274111675, "grad_norm": 0.96484375, "learning_rate": 0.00016578047709606337, "loss": 5.2956, "mean_token_accuracy": 0.1701137751340866, "num_tokens": 8389645.0, "step": 2985 }, { "entropy": 5.453202438354492, "epoch": 0.08094754653130287, "grad_norm": 1.0, "learning_rate": 0.00016475199088004678, "loss": 5.2889, "mean_token_accuracy": 0.17482130378484725, "num_tokens": 8401728.0, "step": 2990 }, { "entropy": 5.434600925445556, "epoch": 0.081082910321489, "grad_norm": 0.9921875, "learning_rate": 0.00016372652716889163, "loss": 5.2305, "mean_token_accuracy": 0.1778161495923996, "num_tokens": 8416862.0, "step": 2995 }, { "entropy": 5.486732912063599, "epoch": 0.08121827411167512, "grad_norm": 1.0, "learning_rate": 0.0001627041140762035, "loss": 5.3317, "mean_token_accuracy": 0.17365986555814744, "num_tokens": 8430674.0, "step": 3000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.499967323136e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }