{ "best_global_step": 6000, "best_metric": 0.8987749218940735, "best_model_checkpoint": "/output/checkpoint-6000", "epoch": 1.0, "eval_steps": 1000, "global_step": 6875, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.9659422233700752, "epoch": 0.0014545454545454545, "grad_norm": 4.090943813323975, "learning_rate": 3.0000000000000004e-07, "loss": 3.0094, "mean_token_accuracy": 0.5692892394959926, "num_tokens": 77676.0, "step": 10 }, { "entropy": 1.9524168580770493, "epoch": 0.002909090909090909, "grad_norm": 3.8272783756256104, "learning_rate": 6.333333333333333e-07, "loss": 3.0425, "mean_token_accuracy": 0.5691409226506948, "num_tokens": 152469.0, "step": 20 }, { "entropy": 1.9598139539361, "epoch": 0.004363636363636364, "grad_norm": 3.7499046325683594, "learning_rate": 9.666666666666668e-07, "loss": 2.9915, "mean_token_accuracy": 0.5720876976847649, "num_tokens": 229946.0, "step": 30 }, { "entropy": 1.9616472586989402, "epoch": 0.005818181818181818, "grad_norm": 3.472123622894287, "learning_rate": 1.3e-06, "loss": 2.9656, "mean_token_accuracy": 0.5695729449391365, "num_tokens": 306785.0, "step": 40 }, { "entropy": 1.983330498635769, "epoch": 0.007272727272727273, "grad_norm": 3.5334620475769043, "learning_rate": 1.6333333333333333e-06, "loss": 2.8909, "mean_token_accuracy": 0.569761898368597, "num_tokens": 384553.0, "step": 50 }, { "entropy": 1.9984836801886559, "epoch": 0.008727272727272728, "grad_norm": 3.185563087463379, "learning_rate": 1.9666666666666668e-06, "loss": 2.7998, "mean_token_accuracy": 0.5736399229615927, "num_tokens": 461373.0, "step": 60 }, { "entropy": 1.979162333905697, "epoch": 0.010181818181818183, "grad_norm": 2.248973846435547, "learning_rate": 2.3e-06, "loss": 2.6071, "mean_token_accuracy": 0.5999085880815983, "num_tokens": 538377.0, "step": 70 }, { "entropy": 1.9361985102295876, "epoch": 0.011636363636363636, "grad_norm": 1.7401518821716309, "learning_rate": 2.6333333333333337e-06, "loss": 2.4549, "mean_token_accuracy": 0.6177365817129612, "num_tokens": 615542.0, "step": 80 }, { "entropy": 1.8896187946200371, "epoch": 0.01309090909090909, "grad_norm": 1.7699965238571167, "learning_rate": 2.966666666666667e-06, "loss": 2.3215, "mean_token_accuracy": 0.6456378914415837, "num_tokens": 692214.0, "step": 90 }, { "entropy": 1.837496855854988, "epoch": 0.014545454545454545, "grad_norm": 1.7701467275619507, "learning_rate": 3.3e-06, "loss": 2.1539, "mean_token_accuracy": 0.6737071752548218, "num_tokens": 768454.0, "step": 100 }, { "entropy": 1.7528666377067565, "epoch": 0.016, "grad_norm": 1.9286140203475952, "learning_rate": 3.633333333333334e-06, "loss": 1.9427, "mean_token_accuracy": 0.7077549912035466, "num_tokens": 844867.0, "step": 110 }, { "entropy": 1.6664264917373657, "epoch": 0.017454545454545455, "grad_norm": 1.7424260377883911, "learning_rate": 3.966666666666667e-06, "loss": 1.7671, "mean_token_accuracy": 0.7324294425547123, "num_tokens": 922240.0, "step": 120 }, { "entropy": 1.4373633116483688, "epoch": 0.01890909090909091, "grad_norm": 1.6519197225570679, "learning_rate": 4.2999999999999995e-06, "loss": 1.5648, "mean_token_accuracy": 0.7576472572982311, "num_tokens": 995800.0, "step": 130 }, { "entropy": 1.2589309319853783, "epoch": 0.020363636363636365, "grad_norm": 0.7197794318199158, "learning_rate": 4.633333333333334e-06, "loss": 1.4726, "mean_token_accuracy": 0.7749086625874042, "num_tokens": 1071953.0, "step": 140 }, { "entropy": 1.1532729104161263, "epoch": 0.02181818181818182, "grad_norm": 0.5631716847419739, "learning_rate": 4.966666666666667e-06, "loss": 1.3865, "mean_token_accuracy": 0.7834423221647739, "num_tokens": 1148106.0, "step": 150 }, { "entropy": 1.1569199711084366, "epoch": 0.02327272727272727, "grad_norm": 0.6042912602424622, "learning_rate": 5.3e-06, "loss": 1.3816, "mean_token_accuracy": 0.7809078678488731, "num_tokens": 1226497.0, "step": 160 }, { "entropy": 1.135782204568386, "epoch": 0.024727272727272726, "grad_norm": 0.5481341481208801, "learning_rate": 5.633333333333333e-06, "loss": 1.3305, "mean_token_accuracy": 0.7899107336997986, "num_tokens": 1302834.0, "step": 170 }, { "entropy": 1.1304984226822854, "epoch": 0.02618181818181818, "grad_norm": 0.6024408936500549, "learning_rate": 5.9666666666666666e-06, "loss": 1.3141, "mean_token_accuracy": 0.791486781835556, "num_tokens": 1380407.0, "step": 180 }, { "entropy": 1.1483597584068774, "epoch": 0.027636363636363636, "grad_norm": 0.6185842752456665, "learning_rate": 6.300000000000001e-06, "loss": 1.3088, "mean_token_accuracy": 0.7890688091516495, "num_tokens": 1455335.0, "step": 190 }, { "entropy": 1.1483107447624206, "epoch": 0.02909090909090909, "grad_norm": 0.5758558511734009, "learning_rate": 6.633333333333333e-06, "loss": 1.3201, "mean_token_accuracy": 0.7872945092618465, "num_tokens": 1531470.0, "step": 200 }, { "entropy": 1.1816094659268856, "epoch": 0.030545454545454546, "grad_norm": 0.6477853655815125, "learning_rate": 6.966666666666667e-06, "loss": 1.3675, "mean_token_accuracy": 0.7840658474713564, "num_tokens": 1610425.0, "step": 210 }, { "entropy": 1.1367807120084763, "epoch": 0.032, "grad_norm": 0.6259286999702454, "learning_rate": 7.2999999999999996e-06, "loss": 1.2578, "mean_token_accuracy": 0.7919471129775048, "num_tokens": 1688549.0, "step": 220 }, { "entropy": 1.1455395191907882, "epoch": 0.03345454545454545, "grad_norm": 0.6879440546035767, "learning_rate": 7.633333333333334e-06, "loss": 1.2376, "mean_token_accuracy": 0.7930837780237198, "num_tokens": 1764440.0, "step": 230 }, { "entropy": 1.1699098110198975, "epoch": 0.03490909090909091, "grad_norm": 0.7712326645851135, "learning_rate": 7.966666666666666e-06, "loss": 1.2593, "mean_token_accuracy": 0.7901124738156795, "num_tokens": 1838579.0, "step": 240 }, { "entropy": 1.1891434825956821, "epoch": 0.03636363636363636, "grad_norm": 0.8381406664848328, "learning_rate": 8.3e-06, "loss": 1.1957, "mean_token_accuracy": 0.7920134104788303, "num_tokens": 1917117.0, "step": 250 }, { "entropy": 1.2279200583696366, "epoch": 0.03781818181818182, "grad_norm": 0.6233083605766296, "learning_rate": 8.633333333333334e-06, "loss": 1.1274, "mean_token_accuracy": 0.796196486800909, "num_tokens": 1992506.0, "step": 260 }, { "entropy": 1.2140305921435357, "epoch": 0.03927272727272727, "grad_norm": 0.5732085108757019, "learning_rate": 8.966666666666668e-06, "loss": 1.1105, "mean_token_accuracy": 0.8027118250727654, "num_tokens": 2069283.0, "step": 270 }, { "entropy": 1.2301497504115104, "epoch": 0.04072727272727273, "grad_norm": 0.6894718408584595, "learning_rate": 9.3e-06, "loss": 1.1371, "mean_token_accuracy": 0.7968612916767597, "num_tokens": 2146174.0, "step": 280 }, { "entropy": 1.1968476533889771, "epoch": 0.04218181818181818, "grad_norm": 0.583967387676239, "learning_rate": 9.633333333333335e-06, "loss": 1.0555, "mean_token_accuracy": 0.8039177753031254, "num_tokens": 2221425.0, "step": 290 }, { "entropy": 1.2118824765086174, "epoch": 0.04363636363636364, "grad_norm": 0.601884126663208, "learning_rate": 9.966666666666667e-06, "loss": 1.0708, "mean_token_accuracy": 0.799370014667511, "num_tokens": 2299095.0, "step": 300 }, { "entropy": 1.1940646573901177, "epoch": 0.04509090909090909, "grad_norm": 0.6982355713844299, "learning_rate": 1.03e-05, "loss": 1.0547, "mean_token_accuracy": 0.7977800592780113, "num_tokens": 2378075.0, "step": 310 }, { "entropy": 1.1546141751110555, "epoch": 0.04654545454545454, "grad_norm": 0.4953351616859436, "learning_rate": 1.0633333333333334e-05, "loss": 1.0335, "mean_token_accuracy": 0.7998595416545868, "num_tokens": 2455113.0, "step": 320 }, { "entropy": 1.1033454038202763, "epoch": 0.048, "grad_norm": 0.44239360094070435, "learning_rate": 1.0966666666666666e-05, "loss": 0.9985, "mean_token_accuracy": 0.8006901569664479, "num_tokens": 2531303.0, "step": 330 }, { "entropy": 1.0396368399262428, "epoch": 0.04945454545454545, "grad_norm": 0.42604953050613403, "learning_rate": 1.13e-05, "loss": 0.9764, "mean_token_accuracy": 0.8035364523530006, "num_tokens": 2608824.0, "step": 340 }, { "entropy": 1.0469321973621846, "epoch": 0.05090909090909091, "grad_norm": 0.49078768491744995, "learning_rate": 1.1633333333333334e-05, "loss": 1.019, "mean_token_accuracy": 0.7943111263215542, "num_tokens": 2686701.0, "step": 350 }, { "entropy": 1.0321501083672047, "epoch": 0.05236363636363636, "grad_norm": 0.5576013922691345, "learning_rate": 1.1966666666666668e-05, "loss": 1.005, "mean_token_accuracy": 0.7979445092380046, "num_tokens": 2764773.0, "step": 360 }, { "entropy": 0.990199426561594, "epoch": 0.05381818181818182, "grad_norm": 0.47645217180252075, "learning_rate": 1.23e-05, "loss": 0.9538, "mean_token_accuracy": 0.8067440554499626, "num_tokens": 2839781.0, "step": 370 }, { "entropy": 1.019500917941332, "epoch": 0.05527272727272727, "grad_norm": 0.4222368896007538, "learning_rate": 1.2633333333333333e-05, "loss": 0.9798, "mean_token_accuracy": 0.8025607392191887, "num_tokens": 2917887.0, "step": 380 }, { "entropy": 0.9895624630153179, "epoch": 0.05672727272727273, "grad_norm": 0.4202658236026764, "learning_rate": 1.2966666666666669e-05, "loss": 0.9658, "mean_token_accuracy": 0.8041856609284878, "num_tokens": 2996429.0, "step": 390 }, { "entropy": 1.0076496340334415, "epoch": 0.05818181818181818, "grad_norm": 0.42250972986221313, "learning_rate": 1.3300000000000001e-05, "loss": 0.9883, "mean_token_accuracy": 0.8030573949217796, "num_tokens": 3072279.0, "step": 400 }, { "entropy": 1.0123522110283374, "epoch": 0.05963636363636363, "grad_norm": 0.47815120220184326, "learning_rate": 1.3633333333333334e-05, "loss": 0.9774, "mean_token_accuracy": 0.8001051150262356, "num_tokens": 3151158.0, "step": 410 }, { "entropy": 1.0093131870031358, "epoch": 0.06109090909090909, "grad_norm": 0.5531169772148132, "learning_rate": 1.3966666666666666e-05, "loss": 0.9863, "mean_token_accuracy": 0.8017294406890869, "num_tokens": 3229828.0, "step": 420 }, { "entropy": 0.9861496143043041, "epoch": 0.06254545454545454, "grad_norm": 0.4163675308227539, "learning_rate": 1.43e-05, "loss": 0.9567, "mean_token_accuracy": 0.8050003960728646, "num_tokens": 3306024.0, "step": 430 }, { "entropy": 0.9772120468318463, "epoch": 0.064, "grad_norm": 0.46380943059921265, "learning_rate": 1.4633333333333334e-05, "loss": 0.9416, "mean_token_accuracy": 0.8080964677035809, "num_tokens": 3380727.0, "step": 440 }, { "entropy": 1.007182703912258, "epoch": 0.06545454545454546, "grad_norm": 0.5575771927833557, "learning_rate": 1.4966666666666668e-05, "loss": 0.9776, "mean_token_accuracy": 0.8016268402338028, "num_tokens": 3458256.0, "step": 450 }, { "entropy": 1.0141797795891763, "epoch": 0.0669090909090909, "grad_norm": 0.4321994483470917, "learning_rate": 1.53e-05, "loss": 0.9744, "mean_token_accuracy": 0.803185262531042, "num_tokens": 3535663.0, "step": 460 }, { "entropy": 0.9918124876916409, "epoch": 0.06836363636363636, "grad_norm": 0.435546338558197, "learning_rate": 1.563333333333333e-05, "loss": 0.967, "mean_token_accuracy": 0.8032719291746616, "num_tokens": 3614253.0, "step": 470 }, { "entropy": 0.9891813933849335, "epoch": 0.06981818181818182, "grad_norm": 0.4258497357368469, "learning_rate": 1.5966666666666667e-05, "loss": 0.9618, "mean_token_accuracy": 0.8035177089273929, "num_tokens": 3690297.0, "step": 480 }, { "entropy": 1.006697028875351, "epoch": 0.07127272727272728, "grad_norm": 0.43594589829444885, "learning_rate": 1.63e-05, "loss": 0.9726, "mean_token_accuracy": 0.8012183904647827, "num_tokens": 3769149.0, "step": 490 }, { "entropy": 1.0048870131373406, "epoch": 0.07272727272727272, "grad_norm": 0.415245920419693, "learning_rate": 1.6633333333333336e-05, "loss": 0.9933, "mean_token_accuracy": 0.8001591399312019, "num_tokens": 3846637.0, "step": 500 }, { "entropy": 1.005825261026621, "epoch": 0.07418181818181818, "grad_norm": 0.4039178788661957, "learning_rate": 1.6966666666666668e-05, "loss": 0.9723, "mean_token_accuracy": 0.8034198030829429, "num_tokens": 3924639.0, "step": 510 }, { "entropy": 1.0154225043952465, "epoch": 0.07563636363636364, "grad_norm": 0.44846075773239136, "learning_rate": 1.73e-05, "loss": 0.9906, "mean_token_accuracy": 0.8011446699500084, "num_tokens": 4000254.0, "step": 520 }, { "entropy": 0.9866499230265617, "epoch": 0.07709090909090908, "grad_norm": 0.4658671021461487, "learning_rate": 1.7633333333333336e-05, "loss": 0.9539, "mean_token_accuracy": 0.8053110785782337, "num_tokens": 4075047.0, "step": 530 }, { "entropy": 0.9868831895291805, "epoch": 0.07854545454545454, "grad_norm": 0.5777063965797424, "learning_rate": 1.796666666666667e-05, "loss": 0.9586, "mean_token_accuracy": 0.8030114769935608, "num_tokens": 4150280.0, "step": 540 }, { "entropy": 0.9865054927766324, "epoch": 0.08, "grad_norm": 0.48241281509399414, "learning_rate": 1.83e-05, "loss": 0.9674, "mean_token_accuracy": 0.804360181838274, "num_tokens": 4227448.0, "step": 550 }, { "entropy": 0.9722688443958759, "epoch": 0.08145454545454546, "grad_norm": 0.41982826590538025, "learning_rate": 1.8633333333333333e-05, "loss": 0.9522, "mean_token_accuracy": 0.8053691528737545, "num_tokens": 4303006.0, "step": 560 }, { "entropy": 0.9883188255131244, "epoch": 0.0829090909090909, "grad_norm": 0.5174263119697571, "learning_rate": 1.896666666666667e-05, "loss": 0.96, "mean_token_accuracy": 0.8065396010875702, "num_tokens": 4377210.0, "step": 570 }, { "entropy": 0.9758467309176921, "epoch": 0.08436363636363636, "grad_norm": 0.4374963343143463, "learning_rate": 1.93e-05, "loss": 0.9476, "mean_token_accuracy": 0.8069633848965168, "num_tokens": 4452563.0, "step": 580 }, { "entropy": 0.9731172017753125, "epoch": 0.08581818181818182, "grad_norm": 0.4287698268890381, "learning_rate": 1.9633333333333334e-05, "loss": 0.957, "mean_token_accuracy": 0.8069525636732578, "num_tokens": 4529201.0, "step": 590 }, { "entropy": 1.0023035056889058, "epoch": 0.08727272727272728, "grad_norm": 0.4412376880645752, "learning_rate": 1.9966666666666666e-05, "loss": 0.9748, "mean_token_accuracy": 0.8018463432788849, "num_tokens": 4607606.0, "step": 600 }, { "entropy": 1.0000741586089135, "epoch": 0.08872727272727272, "grad_norm": 0.452994704246521, "learning_rate": 2.0300000000000002e-05, "loss": 0.9684, "mean_token_accuracy": 0.804426409304142, "num_tokens": 4684814.0, "step": 610 }, { "entropy": 1.003422600775957, "epoch": 0.09018181818181818, "grad_norm": 0.5886366367340088, "learning_rate": 2.0633333333333335e-05, "loss": 0.9772, "mean_token_accuracy": 0.8043254964053631, "num_tokens": 4762034.0, "step": 620 }, { "entropy": 0.971302555501461, "epoch": 0.09163636363636364, "grad_norm": 0.5860087871551514, "learning_rate": 2.0966666666666667e-05, "loss": 0.9572, "mean_token_accuracy": 0.8045364588499069, "num_tokens": 4839421.0, "step": 630 }, { "entropy": 1.0108731143176555, "epoch": 0.09309090909090909, "grad_norm": 0.47347405552864075, "learning_rate": 2.13e-05, "loss": 0.9706, "mean_token_accuracy": 0.8029872097074986, "num_tokens": 4915456.0, "step": 640 }, { "entropy": 1.0099310785531999, "epoch": 0.09454545454545454, "grad_norm": 0.5390433669090271, "learning_rate": 2.1633333333333332e-05, "loss": 0.9743, "mean_token_accuracy": 0.8021445274353027, "num_tokens": 4991780.0, "step": 650 }, { "entropy": 1.006123662739992, "epoch": 0.096, "grad_norm": 0.4339490532875061, "learning_rate": 2.1966666666666668e-05, "loss": 0.9833, "mean_token_accuracy": 0.8044153302907944, "num_tokens": 5066164.0, "step": 660 }, { "entropy": 0.9823346547782421, "epoch": 0.09745454545454546, "grad_norm": 0.4419339597225189, "learning_rate": 2.23e-05, "loss": 0.9593, "mean_token_accuracy": 0.8065159559249878, "num_tokens": 5141318.0, "step": 670 }, { "entropy": 0.9649036668241024, "epoch": 0.0989090909090909, "grad_norm": 0.5108367204666138, "learning_rate": 2.2633333333333336e-05, "loss": 0.9377, "mean_token_accuracy": 0.8067274354398251, "num_tokens": 5217622.0, "step": 680 }, { "entropy": 0.976323938369751, "epoch": 0.10036363636363636, "grad_norm": 0.4640137553215027, "learning_rate": 2.2966666666666668e-05, "loss": 0.9438, "mean_token_accuracy": 0.8051302477717399, "num_tokens": 5295472.0, "step": 690 }, { "entropy": 0.9709480322897435, "epoch": 0.10181818181818182, "grad_norm": 0.5125411152839661, "learning_rate": 2.3300000000000004e-05, "loss": 0.9338, "mean_token_accuracy": 0.8084210947155952, "num_tokens": 5370567.0, "step": 700 }, { "entropy": 0.9817489549517632, "epoch": 0.10327272727272727, "grad_norm": 0.43162453174591064, "learning_rate": 2.3633333333333336e-05, "loss": 0.9532, "mean_token_accuracy": 0.8055648073554039, "num_tokens": 5448305.0, "step": 710 }, { "entropy": 0.9898195452988148, "epoch": 0.10472727272727272, "grad_norm": 0.4311891496181488, "learning_rate": 2.396666666666667e-05, "loss": 0.9598, "mean_token_accuracy": 0.8042900271713733, "num_tokens": 5526145.0, "step": 720 }, { "entropy": 0.9635106429457665, "epoch": 0.10618181818181818, "grad_norm": 0.41602715849876404, "learning_rate": 2.43e-05, "loss": 0.9278, "mean_token_accuracy": 0.8106991343200207, "num_tokens": 5601880.0, "step": 730 }, { "entropy": 0.9739560626447201, "epoch": 0.10763636363636364, "grad_norm": 0.48207396268844604, "learning_rate": 2.4633333333333334e-05, "loss": 0.9408, "mean_token_accuracy": 0.8064304023981095, "num_tokens": 5678740.0, "step": 740 }, { "entropy": 0.9841963745653629, "epoch": 0.10909090909090909, "grad_norm": 0.4250541031360626, "learning_rate": 2.496666666666667e-05, "loss": 0.9615, "mean_token_accuracy": 0.8043922528624534, "num_tokens": 5757834.0, "step": 750 }, { "entropy": 0.9840492263436318, "epoch": 0.11054545454545454, "grad_norm": 0.42034247517585754, "learning_rate": 2.5300000000000002e-05, "loss": 0.9545, "mean_token_accuracy": 0.8051097564399242, "num_tokens": 5835143.0, "step": 760 }, { "entropy": 0.9977390602231025, "epoch": 0.112, "grad_norm": 0.4027940630912781, "learning_rate": 2.5633333333333338e-05, "loss": 0.9693, "mean_token_accuracy": 0.8035439133644104, "num_tokens": 5914748.0, "step": 770 }, { "entropy": 0.9808847881853581, "epoch": 0.11345454545454546, "grad_norm": 0.40575113892555237, "learning_rate": 2.5966666666666667e-05, "loss": 0.9457, "mean_token_accuracy": 0.8073798060417176, "num_tokens": 5989838.0, "step": 780 }, { "entropy": 0.9797362260520458, "epoch": 0.1149090909090909, "grad_norm": 0.4026121199131012, "learning_rate": 2.6300000000000002e-05, "loss": 0.9467, "mean_token_accuracy": 0.8068944476544857, "num_tokens": 6064792.0, "step": 790 }, { "entropy": 0.9880223348736763, "epoch": 0.11636363636363636, "grad_norm": 0.42550402879714966, "learning_rate": 2.663333333333333e-05, "loss": 0.971, "mean_token_accuracy": 0.8018131107091904, "num_tokens": 6143005.0, "step": 800 }, { "entropy": 0.9746092438697815, "epoch": 0.11781818181818182, "grad_norm": 0.3958792984485626, "learning_rate": 2.6966666666666667e-05, "loss": 0.9256, "mean_token_accuracy": 0.8095438420772553, "num_tokens": 6216947.0, "step": 810 }, { "entropy": 0.9785576783120632, "epoch": 0.11927272727272727, "grad_norm": 0.46700361371040344, "learning_rate": 2.7300000000000003e-05, "loss": 0.9592, "mean_token_accuracy": 0.8056280180811882, "num_tokens": 6292720.0, "step": 820 }, { "entropy": 0.9925856553018093, "epoch": 0.12072727272727272, "grad_norm": 0.4162468910217285, "learning_rate": 2.7633333333333332e-05, "loss": 0.9684, "mean_token_accuracy": 0.8065006777644157, "num_tokens": 6369195.0, "step": 830 }, { "entropy": 0.9815856114029884, "epoch": 0.12218181818181818, "grad_norm": 0.4176236391067505, "learning_rate": 2.7966666666666668e-05, "loss": 0.9417, "mean_token_accuracy": 0.806631051003933, "num_tokens": 6444477.0, "step": 840 }, { "entropy": 0.9838737137615681, "epoch": 0.12363636363636364, "grad_norm": 0.5555691123008728, "learning_rate": 2.83e-05, "loss": 0.9631, "mean_token_accuracy": 0.8037988044321537, "num_tokens": 6524429.0, "step": 850 }, { "entropy": 0.9618504159152508, "epoch": 0.12509090909090909, "grad_norm": 0.41715553402900696, "learning_rate": 2.8633333333333336e-05, "loss": 0.9111, "mean_token_accuracy": 0.8102175794541836, "num_tokens": 6598540.0, "step": 860 }, { "entropy": 0.9729882068932056, "epoch": 0.12654545454545454, "grad_norm": 0.43373847007751465, "learning_rate": 2.8966666666666668e-05, "loss": 0.9406, "mean_token_accuracy": 0.8060924611985684, "num_tokens": 6675725.0, "step": 870 }, { "entropy": 0.9947902150452137, "epoch": 0.128, "grad_norm": 0.43133389949798584, "learning_rate": 2.93e-05, "loss": 0.9728, "mean_token_accuracy": 0.8022032633423806, "num_tokens": 6754713.0, "step": 880 }, { "entropy": 0.995215217769146, "epoch": 0.12945454545454546, "grad_norm": 0.604076087474823, "learning_rate": 2.9633333333333336e-05, "loss": 0.9482, "mean_token_accuracy": 0.8048032231628894, "num_tokens": 6830667.0, "step": 890 }, { "entropy": 0.9664588801562786, "epoch": 0.13090909090909092, "grad_norm": 0.4081405997276306, "learning_rate": 2.9966666666666672e-05, "loss": 0.9472, "mean_token_accuracy": 0.8069540120661258, "num_tokens": 6905611.0, "step": 900 }, { "entropy": 0.994405622035265, "epoch": 0.13236363636363635, "grad_norm": 0.5211614966392517, "learning_rate": 3.03e-05, "loss": 0.9581, "mean_token_accuracy": 0.8033522762358188, "num_tokens": 6985193.0, "step": 910 }, { "entropy": 0.9925968185067177, "epoch": 0.1338181818181818, "grad_norm": 0.4536610543727875, "learning_rate": 3.063333333333334e-05, "loss": 0.99, "mean_token_accuracy": 0.8044977240264416, "num_tokens": 7061179.0, "step": 920 }, { "entropy": 0.9665735505521298, "epoch": 0.13527272727272727, "grad_norm": 0.4118134677410126, "learning_rate": 3.096666666666666e-05, "loss": 0.9331, "mean_token_accuracy": 0.8096266977488995, "num_tokens": 7136176.0, "step": 930 }, { "entropy": 0.9744052506983281, "epoch": 0.13672727272727273, "grad_norm": 0.5332080125808716, "learning_rate": 3.13e-05, "loss": 0.9528, "mean_token_accuracy": 0.8053979344666005, "num_tokens": 7213493.0, "step": 940 }, { "entropy": 0.9805201821029186, "epoch": 0.13818181818181818, "grad_norm": 0.4272365868091583, "learning_rate": 3.1633333333333334e-05, "loss": 0.9382, "mean_token_accuracy": 0.8079843915998935, "num_tokens": 7289917.0, "step": 950 }, { "entropy": 0.9595341965556144, "epoch": 0.13963636363636364, "grad_norm": 0.4467701017856598, "learning_rate": 3.196666666666667e-05, "loss": 0.9312, "mean_token_accuracy": 0.8084880888462067, "num_tokens": 7367477.0, "step": 960 }, { "entropy": 0.9859929539263248, "epoch": 0.1410909090909091, "grad_norm": 0.462103933095932, "learning_rate": 3.2300000000000006e-05, "loss": 0.9524, "mean_token_accuracy": 0.804368419200182, "num_tokens": 7444578.0, "step": 970 }, { "entropy": 0.9547855578362942, "epoch": 0.14254545454545456, "grad_norm": 0.432309091091156, "learning_rate": 3.263333333333333e-05, "loss": 0.9258, "mean_token_accuracy": 0.8119194991886616, "num_tokens": 7517378.0, "step": 980 }, { "entropy": 0.9911278739571572, "epoch": 0.144, "grad_norm": 0.40271005034446716, "learning_rate": 3.296666666666667e-05, "loss": 0.9613, "mean_token_accuracy": 0.8036044925451279, "num_tokens": 7595008.0, "step": 990 }, { "entropy": 0.9437328346073628, "epoch": 0.14545454545454545, "grad_norm": 0.4583914875984192, "learning_rate": 3.33e-05, "loss": 0.9148, "mean_token_accuracy": 0.8127484254539012, "num_tokens": 7669624.0, "step": 1000 }, { "epoch": 0.14545454545454545, "eval_entropy": 0.9819960155487061, "eval_loss": 0.930533230304718, "eval_mean_token_accuracy": 0.8069609030723571, "eval_num_tokens": 7669624.0, "eval_runtime": 77.1409, "eval_samples_per_second": 64.816, "eval_steps_per_second": 8.102, "step": 1000 }, { "entropy": 0.9614314928650856, "epoch": 0.1469090909090909, "grad_norm": 0.41151049733161926, "learning_rate": 3.3633333333333335e-05, "loss": 0.928, "mean_token_accuracy": 0.8098596774041653, "num_tokens": 7745451.0, "step": 1010 }, { "entropy": 0.9788591407239438, "epoch": 0.14836363636363636, "grad_norm": 0.46174564957618713, "learning_rate": 3.396666666666667e-05, "loss": 0.9353, "mean_token_accuracy": 0.8068431109189987, "num_tokens": 7824306.0, "step": 1020 }, { "entropy": 0.9697593882679939, "epoch": 0.14981818181818182, "grad_norm": 0.41812098026275635, "learning_rate": 3.430000000000001e-05, "loss": 0.9549, "mean_token_accuracy": 0.8075274929404259, "num_tokens": 7900392.0, "step": 1030 }, { "entropy": 0.983103808760643, "epoch": 0.15127272727272728, "grad_norm": 0.4310772120952606, "learning_rate": 3.463333333333333e-05, "loss": 0.9581, "mean_token_accuracy": 0.8044828698039055, "num_tokens": 7977471.0, "step": 1040 }, { "entropy": 0.9643499620258809, "epoch": 0.15272727272727274, "grad_norm": 0.4172477126121521, "learning_rate": 3.496666666666667e-05, "loss": 0.9328, "mean_token_accuracy": 0.8084025174379349, "num_tokens": 8054025.0, "step": 1050 }, { "entropy": 0.9781779557466507, "epoch": 0.15418181818181817, "grad_norm": 0.4708545506000519, "learning_rate": 3.53e-05, "loss": 0.9375, "mean_token_accuracy": 0.8080290637910366, "num_tokens": 8129830.0, "step": 1060 }, { "entropy": 0.97263238504529, "epoch": 0.15563636363636363, "grad_norm": 0.4220433533191681, "learning_rate": 3.563333333333334e-05, "loss": 0.9523, "mean_token_accuracy": 0.8069098271429539, "num_tokens": 8208871.0, "step": 1070 }, { "entropy": 0.9988827370107174, "epoch": 0.1570909090909091, "grad_norm": 0.4833963215351105, "learning_rate": 3.596666666666667e-05, "loss": 0.9781, "mean_token_accuracy": 0.8028389126062393, "num_tokens": 8285421.0, "step": 1080 }, { "entropy": 0.981606388837099, "epoch": 0.15854545454545454, "grad_norm": 0.4167567491531372, "learning_rate": 3.63e-05, "loss": 0.9592, "mean_token_accuracy": 0.8043723694980145, "num_tokens": 8364166.0, "step": 1090 }, { "entropy": 0.972727719694376, "epoch": 0.16, "grad_norm": 0.41988062858581543, "learning_rate": 3.6633333333333334e-05, "loss": 0.9582, "mean_token_accuracy": 0.8055802926421165, "num_tokens": 8441165.0, "step": 1100 }, { "entropy": 0.9736937612295151, "epoch": 0.16145454545454546, "grad_norm": 0.3738587498664856, "learning_rate": 3.6966666666666666e-05, "loss": 0.9332, "mean_token_accuracy": 0.8084321849048137, "num_tokens": 8517287.0, "step": 1110 }, { "entropy": 0.9818037033081055, "epoch": 0.16290909090909092, "grad_norm": 0.39459410309791565, "learning_rate": 3.73e-05, "loss": 0.9535, "mean_token_accuracy": 0.8051852092146874, "num_tokens": 8594226.0, "step": 1120 }, { "entropy": 0.9724020875990391, "epoch": 0.16436363636363635, "grad_norm": 0.3696468770503998, "learning_rate": 3.763333333333334e-05, "loss": 0.9481, "mean_token_accuracy": 0.8077612824738025, "num_tokens": 8670364.0, "step": 1130 }, { "entropy": 0.9997089162468911, "epoch": 0.1658181818181818, "grad_norm": 0.3834758400917053, "learning_rate": 3.796666666666667e-05, "loss": 0.9674, "mean_token_accuracy": 0.8061671704053879, "num_tokens": 8746754.0, "step": 1140 }, { "entropy": 0.9531174071133137, "epoch": 0.16727272727272727, "grad_norm": 0.41454288363456726, "learning_rate": 3.83e-05, "loss": 0.9294, "mean_token_accuracy": 0.8093575298786163, "num_tokens": 8822823.0, "step": 1150 }, { "entropy": 0.9577366463840008, "epoch": 0.16872727272727273, "grad_norm": 0.392678439617157, "learning_rate": 3.8633333333333335e-05, "loss": 0.9257, "mean_token_accuracy": 0.8099003352224827, "num_tokens": 8899652.0, "step": 1160 }, { "entropy": 0.9818715266883373, "epoch": 0.17018181818181818, "grad_norm": 0.42063838243484497, "learning_rate": 3.896666666666667e-05, "loss": 0.9707, "mean_token_accuracy": 0.8053286999464035, "num_tokens": 8973918.0, "step": 1170 }, { "entropy": 0.9495494857430458, "epoch": 0.17163636363636364, "grad_norm": 0.4945516586303711, "learning_rate": 3.9300000000000007e-05, "loss": 0.9105, "mean_token_accuracy": 0.8125501699745655, "num_tokens": 9047774.0, "step": 1180 }, { "entropy": 0.9826383985579014, "epoch": 0.1730909090909091, "grad_norm": 0.4486415386199951, "learning_rate": 3.963333333333333e-05, "loss": 0.9821, "mean_token_accuracy": 0.8069185055792332, "num_tokens": 9124562.0, "step": 1190 }, { "entropy": 0.9851367242634297, "epoch": 0.17454545454545456, "grad_norm": 0.40190815925598145, "learning_rate": 3.996666666666667e-05, "loss": 0.962, "mean_token_accuracy": 0.8029212132096291, "num_tokens": 9204050.0, "step": 1200 }, { "entropy": 0.9761835239827633, "epoch": 0.176, "grad_norm": 0.3759288489818573, "learning_rate": 4.0300000000000004e-05, "loss": 0.9456, "mean_token_accuracy": 0.8066259518265724, "num_tokens": 9279622.0, "step": 1210 }, { "entropy": 0.9822940185666085, "epoch": 0.17745454545454545, "grad_norm": 0.4097426235675812, "learning_rate": 4.0633333333333336e-05, "loss": 0.9627, "mean_token_accuracy": 0.8040494129061699, "num_tokens": 9356777.0, "step": 1220 }, { "entropy": 0.9587647147476673, "epoch": 0.1789090909090909, "grad_norm": 0.4142778813838959, "learning_rate": 4.096666666666667e-05, "loss": 0.9318, "mean_token_accuracy": 0.8084065370261669, "num_tokens": 9436024.0, "step": 1230 }, { "entropy": 0.9789021521806717, "epoch": 0.18036363636363636, "grad_norm": 0.3709389269351959, "learning_rate": 4.13e-05, "loss": 0.9486, "mean_token_accuracy": 0.8077368602156639, "num_tokens": 9511885.0, "step": 1240 }, { "entropy": 0.9523784570395947, "epoch": 0.18181818181818182, "grad_norm": 0.400603324174881, "learning_rate": 4.1633333333333333e-05, "loss": 0.9218, "mean_token_accuracy": 0.8094192072749138, "num_tokens": 9587513.0, "step": 1250 }, { "entropy": 0.9448994480073452, "epoch": 0.18327272727272728, "grad_norm": 0.4005239009857178, "learning_rate": 4.196666666666667e-05, "loss": 0.9146, "mean_token_accuracy": 0.811667163670063, "num_tokens": 9661338.0, "step": 1260 }, { "entropy": 0.9539985828101635, "epoch": 0.18472727272727274, "grad_norm": 0.38217607140541077, "learning_rate": 4.23e-05, "loss": 0.9269, "mean_token_accuracy": 0.811439736187458, "num_tokens": 9737921.0, "step": 1270 }, { "entropy": 0.9687586560845375, "epoch": 0.18618181818181817, "grad_norm": 0.41379278898239136, "learning_rate": 4.263333333333334e-05, "loss": 0.9489, "mean_token_accuracy": 0.8053133375942707, "num_tokens": 9815704.0, "step": 1280 }, { "entropy": 0.9803968369960785, "epoch": 0.18763636363636363, "grad_norm": 0.40967634320259094, "learning_rate": 4.296666666666666e-05, "loss": 0.9468, "mean_token_accuracy": 0.8058573313057422, "num_tokens": 9894635.0, "step": 1290 }, { "entropy": 0.9675418928265571, "epoch": 0.1890909090909091, "grad_norm": 0.398711621761322, "learning_rate": 4.33e-05, "loss": 0.9453, "mean_token_accuracy": 0.8056280307471753, "num_tokens": 9972662.0, "step": 1300 }, { "entropy": 0.9511002562940121, "epoch": 0.19054545454545455, "grad_norm": 0.3831891417503357, "learning_rate": 4.3633333333333335e-05, "loss": 0.9275, "mean_token_accuracy": 0.8103599421679973, "num_tokens": 10049277.0, "step": 1310 }, { "entropy": 0.9432598523795604, "epoch": 0.192, "grad_norm": 0.3834156095981598, "learning_rate": 4.396666666666667e-05, "loss": 0.9216, "mean_token_accuracy": 0.811466021835804, "num_tokens": 10125383.0, "step": 1320 }, { "entropy": 0.9695509068667889, "epoch": 0.19345454545454546, "grad_norm": 0.35917171835899353, "learning_rate": 4.43e-05, "loss": 0.9382, "mean_token_accuracy": 0.8076730266213417, "num_tokens": 10201809.0, "step": 1330 }, { "entropy": 0.9703869722783566, "epoch": 0.19490909090909092, "grad_norm": 0.423606812953949, "learning_rate": 4.463333333333334e-05, "loss": 0.9389, "mean_token_accuracy": 0.8067005030810833, "num_tokens": 10278795.0, "step": 1340 }, { "entropy": 0.9651624113321304, "epoch": 0.19636363636363635, "grad_norm": 0.3861379325389862, "learning_rate": 4.496666666666667e-05, "loss": 0.947, "mean_token_accuracy": 0.806987015902996, "num_tokens": 10356816.0, "step": 1350 }, { "entropy": 0.9701198406517506, "epoch": 0.1978181818181818, "grad_norm": 0.3669825792312622, "learning_rate": 4.53e-05, "loss": 0.9555, "mean_token_accuracy": 0.8069166608154774, "num_tokens": 10433476.0, "step": 1360 }, { "entropy": 0.9480470046401024, "epoch": 0.19927272727272727, "grad_norm": 0.5006280541419983, "learning_rate": 4.5633333333333336e-05, "loss": 0.9147, "mean_token_accuracy": 0.8121759042143821, "num_tokens": 10509912.0, "step": 1370 }, { "entropy": 0.9768481604754925, "epoch": 0.20072727272727273, "grad_norm": 0.35172003507614136, "learning_rate": 4.596666666666667e-05, "loss": 0.9552, "mean_token_accuracy": 0.8053648866713047, "num_tokens": 10588749.0, "step": 1380 }, { "entropy": 0.9502091735601426, "epoch": 0.20218181818181818, "grad_norm": 0.4971792697906494, "learning_rate": 4.630000000000001e-05, "loss": 0.9283, "mean_token_accuracy": 0.8122193835675716, "num_tokens": 10664262.0, "step": 1390 }, { "entropy": 0.9593991063535213, "epoch": 0.20363636363636364, "grad_norm": 0.3790259063243866, "learning_rate": 4.663333333333333e-05, "loss": 0.9229, "mean_token_accuracy": 0.8104354314506054, "num_tokens": 10739818.0, "step": 1400 }, { "entropy": 0.9550940081477165, "epoch": 0.2050909090909091, "grad_norm": 0.4480496644973755, "learning_rate": 4.696666666666667e-05, "loss": 0.937, "mean_token_accuracy": 0.8094347164034843, "num_tokens": 10815065.0, "step": 1410 }, { "entropy": 0.952402526885271, "epoch": 0.20654545454545453, "grad_norm": 0.3347347378730774, "learning_rate": 4.73e-05, "loss": 0.9277, "mean_token_accuracy": 0.8107926152646542, "num_tokens": 10892502.0, "step": 1420 }, { "entropy": 0.9966687709093094, "epoch": 0.208, "grad_norm": 0.39030221104621887, "learning_rate": 4.763333333333334e-05, "loss": 0.9658, "mean_token_accuracy": 0.8048013903200626, "num_tokens": 10969083.0, "step": 1430 }, { "entropy": 0.9894838415086269, "epoch": 0.20945454545454545, "grad_norm": 0.3712361454963684, "learning_rate": 4.796666666666667e-05, "loss": 0.9615, "mean_token_accuracy": 0.8025919504463672, "num_tokens": 11044803.0, "step": 1440 }, { "entropy": 0.9651565335690975, "epoch": 0.2109090909090909, "grad_norm": 0.38604411482810974, "learning_rate": 4.83e-05, "loss": 0.9367, "mean_token_accuracy": 0.8086418233811855, "num_tokens": 11118299.0, "step": 1450 }, { "entropy": 0.981209859997034, "epoch": 0.21236363636363637, "grad_norm": 0.37849947810173035, "learning_rate": 4.8633333333333334e-05, "loss": 0.9573, "mean_token_accuracy": 0.8040041103959084, "num_tokens": 11196762.0, "step": 1460 }, { "entropy": 0.9578036166727543, "epoch": 0.21381818181818182, "grad_norm": 0.4023977518081665, "learning_rate": 4.8966666666666667e-05, "loss": 0.9327, "mean_token_accuracy": 0.809338016808033, "num_tokens": 11271543.0, "step": 1470 }, { "entropy": 0.9572117276489734, "epoch": 0.21527272727272728, "grad_norm": 0.5094729661941528, "learning_rate": 4.93e-05, "loss": 0.9195, "mean_token_accuracy": 0.8115039594471455, "num_tokens": 11346972.0, "step": 1480 }, { "entropy": 0.9531163774430752, "epoch": 0.21672727272727274, "grad_norm": 0.37371397018432617, "learning_rate": 4.963333333333334e-05, "loss": 0.9373, "mean_token_accuracy": 0.8089435353875161, "num_tokens": 11424829.0, "step": 1490 }, { "entropy": 0.9597573406994343, "epoch": 0.21818181818181817, "grad_norm": 0.3477155864238739, "learning_rate": 4.996666666666667e-05, "loss": 0.9251, "mean_token_accuracy": 0.810747179389, "num_tokens": 11501054.0, "step": 1500 }, { "entropy": 0.9775046378374099, "epoch": 0.21963636363636363, "grad_norm": 0.402798056602478, "learning_rate": 4.999965480270814e-05, "loss": 0.9481, "mean_token_accuracy": 0.8051461532711983, "num_tokens": 11580117.0, "step": 1510 }, { "entropy": 0.9834331803023815, "epoch": 0.2210909090909091, "grad_norm": 0.368505597114563, "learning_rate": 4.9998461540382306e-05, "loss": 0.9489, "mean_token_accuracy": 0.8037358179688454, "num_tokens": 11657739.0, "step": 1520 }, { "entropy": 0.9874706588685512, "epoch": 0.22254545454545455, "grad_norm": 0.3849066495895386, "learning_rate": 4.999641599208191e-05, "loss": 0.9668, "mean_token_accuracy": 0.8038628540933133, "num_tokens": 11737453.0, "step": 1530 }, { "entropy": 0.9514814570546151, "epoch": 0.224, "grad_norm": 0.34791556000709534, "learning_rate": 4.9993518227686675e-05, "loss": 0.9257, "mean_token_accuracy": 0.8099611721932888, "num_tokens": 11813293.0, "step": 1540 }, { "entropy": 0.9615619413554668, "epoch": 0.22545454545454546, "grad_norm": 0.387060284614563, "learning_rate": 4.998976834618965e-05, "loss": 0.9317, "mean_token_accuracy": 0.8071263432502747, "num_tokens": 11889932.0, "step": 1550 }, { "entropy": 0.9558730646967888, "epoch": 0.22690909090909092, "grad_norm": 0.47426292300224304, "learning_rate": 4.998516647569379e-05, "loss": 0.9249, "mean_token_accuracy": 0.8095598690211773, "num_tokens": 11968281.0, "step": 1560 }, { "entropy": 0.9359629921615124, "epoch": 0.22836363636363635, "grad_norm": 0.35277876257896423, "learning_rate": 4.9979712773407554e-05, "loss": 0.9262, "mean_token_accuracy": 0.8103468790650368, "num_tokens": 12044028.0, "step": 1570 }, { "entropy": 0.9580157190561295, "epoch": 0.2298181818181818, "grad_norm": 0.37145012617111206, "learning_rate": 4.9973407425639596e-05, "loss": 0.9232, "mean_token_accuracy": 0.8107329845428467, "num_tokens": 12116626.0, "step": 1580 }, { "entropy": 0.9677141040563584, "epoch": 0.23127272727272727, "grad_norm": 0.3671353757381439, "learning_rate": 4.996625064779235e-05, "loss": 0.946, "mean_token_accuracy": 0.8072254911065102, "num_tokens": 12193513.0, "step": 1590 }, { "entropy": 0.9686196386814118, "epoch": 0.23272727272727273, "grad_norm": 0.35971471667289734, "learning_rate": 4.99582426843547e-05, "loss": 0.9481, "mean_token_accuracy": 0.8071218743920326, "num_tokens": 12270596.0, "step": 1600 }, { "entropy": 0.9497562602162362, "epoch": 0.23418181818181819, "grad_norm": 0.3752904534339905, "learning_rate": 4.994938380889361e-05, "loss": 0.9153, "mean_token_accuracy": 0.8122536353766918, "num_tokens": 12345573.0, "step": 1610 }, { "entropy": 0.9516720153391361, "epoch": 0.23563636363636364, "grad_norm": 0.39580070972442627, "learning_rate": 4.9939674324044774e-05, "loss": 0.9286, "mean_token_accuracy": 0.8101835794746876, "num_tokens": 12420887.0, "step": 1620 }, { "entropy": 0.9540682218968868, "epoch": 0.2370909090909091, "grad_norm": 0.38636210560798645, "learning_rate": 4.9929114561502316e-05, "loss": 0.9416, "mean_token_accuracy": 0.8087294958531857, "num_tokens": 12497505.0, "step": 1630 }, { "entropy": 0.974821624904871, "epoch": 0.23854545454545453, "grad_norm": 0.39139118790626526, "learning_rate": 4.991770488200743e-05, "loss": 0.941, "mean_token_accuracy": 0.8072389960289001, "num_tokens": 12573715.0, "step": 1640 }, { "entropy": 0.9520889095962047, "epoch": 0.24, "grad_norm": 0.3420006334781647, "learning_rate": 4.990544567533601e-05, "loss": 0.9301, "mean_token_accuracy": 0.8097614191472531, "num_tokens": 12650432.0, "step": 1650 }, { "entropy": 0.9789438024163246, "epoch": 0.24145454545454545, "grad_norm": 0.3620925545692444, "learning_rate": 4.9892337360285455e-05, "loss": 0.9684, "mean_token_accuracy": 0.8048036694526672, "num_tokens": 12729021.0, "step": 1660 }, { "entropy": 0.9667664721608162, "epoch": 0.2429090909090909, "grad_norm": 0.3239378035068512, "learning_rate": 4.987838038466024e-05, "loss": 0.9406, "mean_token_accuracy": 0.8075184918940067, "num_tokens": 12805720.0, "step": 1670 }, { "entropy": 0.9742927253246307, "epoch": 0.24436363636363637, "grad_norm": 0.3850766718387604, "learning_rate": 4.9863575225256676e-05, "loss": 0.9454, "mean_token_accuracy": 0.8060403868556023, "num_tokens": 12883299.0, "step": 1680 }, { "entropy": 0.9463119588792324, "epoch": 0.24581818181818182, "grad_norm": 0.37080949544906616, "learning_rate": 4.984792238784663e-05, "loss": 0.9237, "mean_token_accuracy": 0.8102991424500943, "num_tokens": 12959320.0, "step": 1690 }, { "entropy": 0.9709216229617595, "epoch": 0.24727272727272728, "grad_norm": 0.3962990343570709, "learning_rate": 4.983142240716021e-05, "loss": 0.9365, "mean_token_accuracy": 0.8095202818512917, "num_tokens": 13035585.0, "step": 1700 }, { "entropy": 0.9721660941839219, "epoch": 0.2487272727272727, "grad_norm": 0.4943894147872925, "learning_rate": 4.9814075846867545e-05, "loss": 0.9522, "mean_token_accuracy": 0.8075993709266186, "num_tokens": 13112084.0, "step": 1710 }, { "entropy": 0.9542104244232178, "epoch": 0.25018181818181817, "grad_norm": 0.35401037335395813, "learning_rate": 4.9795883299559465e-05, "loss": 0.9274, "mean_token_accuracy": 0.8096915259957314, "num_tokens": 13188680.0, "step": 1720 }, { "entropy": 0.9506775386631489, "epoch": 0.25163636363636366, "grad_norm": 0.3483401834964752, "learning_rate": 4.977684538672732e-05, "loss": 0.9339, "mean_token_accuracy": 0.8106581576168537, "num_tokens": 13264460.0, "step": 1730 }, { "entropy": 0.9490490764379501, "epoch": 0.2530909090909091, "grad_norm": 0.3306885063648224, "learning_rate": 4.975696275874173e-05, "loss": 0.9208, "mean_token_accuracy": 0.8103131666779518, "num_tokens": 13340847.0, "step": 1740 }, { "entropy": 0.9423711940646171, "epoch": 0.2545454545454545, "grad_norm": 0.31907522678375244, "learning_rate": 4.973623609483034e-05, "loss": 0.9281, "mean_token_accuracy": 0.8098199367523193, "num_tokens": 13416747.0, "step": 1750 }, { "entropy": 0.9571038953959942, "epoch": 0.256, "grad_norm": 0.3257800042629242, "learning_rate": 4.971466610305464e-05, "loss": 0.9321, "mean_token_accuracy": 0.808480229228735, "num_tokens": 13495344.0, "step": 1760 }, { "entropy": 0.9668020732700825, "epoch": 0.25745454545454544, "grad_norm": 0.38670650124549866, "learning_rate": 4.9692253520285776e-05, "loss": 0.9388, "mean_token_accuracy": 0.8080372959375381, "num_tokens": 13572767.0, "step": 1770 }, { "entropy": 0.9665816195309163, "epoch": 0.2589090909090909, "grad_norm": 0.3654588758945465, "learning_rate": 4.966899911217938e-05, "loss": 0.9538, "mean_token_accuracy": 0.8079737424850464, "num_tokens": 13648876.0, "step": 1780 }, { "entropy": 0.9419120058417321, "epoch": 0.26036363636363635, "grad_norm": 0.3396640419960022, "learning_rate": 4.9644903673149414e-05, "loss": 0.9216, "mean_token_accuracy": 0.809430719166994, "num_tokens": 13728286.0, "step": 1790 }, { "entropy": 0.9564610227942467, "epoch": 0.26181818181818184, "grad_norm": 0.3665502667427063, "learning_rate": 4.9619968026340985e-05, "loss": 0.9273, "mean_token_accuracy": 0.8096649095416069, "num_tokens": 13804065.0, "step": 1800 }, { "entropy": 0.9598980963230133, "epoch": 0.26327272727272727, "grad_norm": 0.3303588330745697, "learning_rate": 4.959419302360231e-05, "loss": 0.9411, "mean_token_accuracy": 0.8076228819787502, "num_tokens": 13880540.0, "step": 1810 }, { "entropy": 1.006081961095333, "epoch": 0.2647272727272727, "grad_norm": 0.3581242859363556, "learning_rate": 4.9567579545455546e-05, "loss": 0.9989, "mean_token_accuracy": 0.8009657979011535, "num_tokens": 13960083.0, "step": 1820 }, { "entropy": 0.9628503814339637, "epoch": 0.2661818181818182, "grad_norm": 0.32779112458229065, "learning_rate": 4.9540128501066745e-05, "loss": 0.9338, "mean_token_accuracy": 0.8094890132546425, "num_tokens": 14037453.0, "step": 1830 }, { "entropy": 0.9735031522810459, "epoch": 0.2676363636363636, "grad_norm": 0.37286221981048584, "learning_rate": 4.951184082821478e-05, "loss": 0.9717, "mean_token_accuracy": 0.80675984993577, "num_tokens": 14114568.0, "step": 1840 }, { "entropy": 0.9624778412282466, "epoch": 0.2690909090909091, "grad_norm": 0.33689644932746887, "learning_rate": 4.948271749325931e-05, "loss": 0.9329, "mean_token_accuracy": 0.8100909695029259, "num_tokens": 14191206.0, "step": 1850 }, { "entropy": 0.9402816690504551, "epoch": 0.27054545454545453, "grad_norm": 0.43606722354888916, "learning_rate": 4.945275949110776e-05, "loss": 0.9176, "mean_token_accuracy": 0.8115701250731945, "num_tokens": 14267843.0, "step": 1860 }, { "entropy": 0.9536763995885849, "epoch": 0.272, "grad_norm": 0.36859753727912903, "learning_rate": 4.942196784518137e-05, "loss": 0.9325, "mean_token_accuracy": 0.8102965012192727, "num_tokens": 14343772.0, "step": 1870 }, { "entropy": 0.9411172643303871, "epoch": 0.27345454545454545, "grad_norm": 0.31749650835990906, "learning_rate": 4.939034360738019e-05, "loss": 0.9409, "mean_token_accuracy": 0.8114774063229561, "num_tokens": 14420089.0, "step": 1880 }, { "entropy": 0.9489653743803501, "epoch": 0.27490909090909094, "grad_norm": 0.32358062267303467, "learning_rate": 4.935788785804715e-05, "loss": 0.9194, "mean_token_accuracy": 0.8125798895955085, "num_tokens": 14495945.0, "step": 1890 }, { "entropy": 0.9492652073502541, "epoch": 0.27636363636363637, "grad_norm": 0.34433141350746155, "learning_rate": 4.932460170593119e-05, "loss": 0.9282, "mean_token_accuracy": 0.8116157680749894, "num_tokens": 14570699.0, "step": 1900 }, { "entropy": 0.9683300837874412, "epoch": 0.2778181818181818, "grad_norm": 0.3886536657810211, "learning_rate": 4.929048628814933e-05, "loss": 0.9391, "mean_token_accuracy": 0.8086844593286514, "num_tokens": 14646642.0, "step": 1910 }, { "entropy": 0.9709325604140758, "epoch": 0.2792727272727273, "grad_norm": 0.39230605959892273, "learning_rate": 4.925554277014788e-05, "loss": 0.9506, "mean_token_accuracy": 0.8078415438532829, "num_tokens": 14723663.0, "step": 1920 }, { "entropy": 0.9794384993612766, "epoch": 0.2807272727272727, "grad_norm": 0.3203677833080292, "learning_rate": 4.9219772345662575e-05, "loss": 0.9504, "mean_token_accuracy": 0.8059118509292602, "num_tokens": 14801605.0, "step": 1930 }, { "entropy": 0.9421239554882049, "epoch": 0.2821818181818182, "grad_norm": 0.3160009980201721, "learning_rate": 4.918317623667783e-05, "loss": 0.9169, "mean_token_accuracy": 0.8127878844738007, "num_tokens": 14877660.0, "step": 1940 }, { "entropy": 0.9400995798408985, "epoch": 0.28363636363636363, "grad_norm": 0.3499312400817871, "learning_rate": 4.9145755693384975e-05, "loss": 0.9175, "mean_token_accuracy": 0.8117764830589295, "num_tokens": 14955540.0, "step": 1950 }, { "entropy": 0.9481630109250545, "epoch": 0.2850909090909091, "grad_norm": 0.36080819368362427, "learning_rate": 4.910751199413956e-05, "loss": 0.9239, "mean_token_accuracy": 0.8113817647099495, "num_tokens": 15032507.0, "step": 1960 }, { "entropy": 0.9711731873452664, "epoch": 0.28654545454545455, "grad_norm": 0.34929078817367554, "learning_rate": 4.9068446445417674e-05, "loss": 0.9517, "mean_token_accuracy": 0.8062169618904591, "num_tokens": 15111260.0, "step": 1970 }, { "entropy": 0.9310999117791653, "epoch": 0.288, "grad_norm": 0.3529198169708252, "learning_rate": 4.902856038177132e-05, "loss": 0.8995, "mean_token_accuracy": 0.8154916487634182, "num_tokens": 15187148.0, "step": 1980 }, { "entropy": 0.9400709681212902, "epoch": 0.28945454545454546, "grad_norm": 0.38182997703552246, "learning_rate": 4.898785516578282e-05, "loss": 0.9329, "mean_token_accuracy": 0.8103081896901131, "num_tokens": 15262960.0, "step": 1990 }, { "entropy": 0.9691479153931141, "epoch": 0.2909090909090909, "grad_norm": 0.4837636947631836, "learning_rate": 4.8946332188018265e-05, "loss": 0.94, "mean_token_accuracy": 0.8090752199292183, "num_tokens": 15340217.0, "step": 2000 }, { "epoch": 0.2909090909090909, "eval_entropy": 0.9552994007110596, "eval_loss": 0.9162204265594482, "eval_mean_token_accuracy": 0.8091625803947449, "eval_num_tokens": 15340217.0, "eval_runtime": 77.5949, "eval_samples_per_second": 64.437, "eval_steps_per_second": 8.055, "step": 2000 }, { "entropy": 0.9568299718201161, "epoch": 0.2923636363636364, "grad_norm": 0.45410582423210144, "learning_rate": 4.890399286698002e-05, "loss": 0.958, "mean_token_accuracy": 0.8088321089744568, "num_tokens": 15417075.0, "step": 2010 }, { "entropy": 0.9500932864844799, "epoch": 0.2938181818181818, "grad_norm": 0.3521057665348053, "learning_rate": 4.8860838649058236e-05, "loss": 0.9156, "mean_token_accuracy": 0.8119934909045696, "num_tokens": 15492696.0, "step": 2020 }, { "entropy": 0.9271357983350754, "epoch": 0.2952727272727273, "grad_norm": 0.34188908338546753, "learning_rate": 4.8816871008481494e-05, "loss": 0.9133, "mean_token_accuracy": 0.8133960500359535, "num_tokens": 15569060.0, "step": 2030 }, { "entropy": 0.9351197473704815, "epoch": 0.29672727272727273, "grad_norm": 0.3230991065502167, "learning_rate": 4.87720914472664e-05, "loss": 0.9083, "mean_token_accuracy": 0.8133096255362033, "num_tokens": 15645189.0, "step": 2040 }, { "entropy": 0.9560852214694023, "epoch": 0.29818181818181816, "grad_norm": 0.42373934388160706, "learning_rate": 4.872650149516626e-05, "loss": 0.9272, "mean_token_accuracy": 0.8098875015974045, "num_tokens": 15722425.0, "step": 2050 }, { "entropy": 0.9704909332096576, "epoch": 0.29963636363636365, "grad_norm": 0.2958741784095764, "learning_rate": 4.8680102709618874e-05, "loss": 0.974, "mean_token_accuracy": 0.8073359347879887, "num_tokens": 15800614.0, "step": 2060 }, { "entropy": 0.9467493839561939, "epoch": 0.3010909090909091, "grad_norm": 0.3630009591579437, "learning_rate": 4.863289667569328e-05, "loss": 0.9285, "mean_token_accuracy": 0.8092270664870739, "num_tokens": 15877885.0, "step": 2070 }, { "entropy": 0.9440895996987819, "epoch": 0.30254545454545456, "grad_norm": 0.3074013590812683, "learning_rate": 4.8584885006035654e-05, "loss": 0.9179, "mean_token_accuracy": 0.8130018509924412, "num_tokens": 15954449.0, "step": 2080 }, { "entropy": 0.9428293339908123, "epoch": 0.304, "grad_norm": 0.32661521434783936, "learning_rate": 4.853606934081415e-05, "loss": 0.9303, "mean_token_accuracy": 0.8101019099354744, "num_tokens": 16032223.0, "step": 2090 }, { "entropy": 0.9483884163200855, "epoch": 0.3054545454545455, "grad_norm": 0.3456633388996124, "learning_rate": 4.8486451347662955e-05, "loss": 0.9278, "mean_token_accuracy": 0.8105225287377834, "num_tokens": 16109007.0, "step": 2100 }, { "entropy": 0.9410559803247451, "epoch": 0.3069090909090909, "grad_norm": 0.3802877366542816, "learning_rate": 4.843603272162522e-05, "loss": 0.9153, "mean_token_accuracy": 0.8141518786549569, "num_tokens": 16186233.0, "step": 2110 }, { "entropy": 0.9398015670478344, "epoch": 0.30836363636363634, "grad_norm": 0.370561808347702, "learning_rate": 4.838481518509527e-05, "loss": 0.9145, "mean_token_accuracy": 0.8143410183489322, "num_tokens": 16262660.0, "step": 2120 }, { "entropy": 0.9372091844677926, "epoch": 0.3098181818181818, "grad_norm": 0.35077038407325745, "learning_rate": 4.8332800487759666e-05, "loss": 0.9266, "mean_token_accuracy": 0.8107892982661724, "num_tokens": 16338493.0, "step": 2130 }, { "entropy": 0.923904549330473, "epoch": 0.31127272727272726, "grad_norm": 0.3715773820877075, "learning_rate": 4.8279990406537466e-05, "loss": 0.9024, "mean_token_accuracy": 0.8144333988428116, "num_tokens": 16413438.0, "step": 2140 }, { "entropy": 0.9547001197934151, "epoch": 0.31272727272727274, "grad_norm": 0.33229219913482666, "learning_rate": 4.8226386745519536e-05, "loss": 0.9287, "mean_token_accuracy": 0.8108532302081585, "num_tokens": 16489851.0, "step": 2150 }, { "entropy": 0.9539036385715007, "epoch": 0.3141818181818182, "grad_norm": 0.4329231083393097, "learning_rate": 4.8171991335906915e-05, "loss": 0.9358, "mean_token_accuracy": 0.8108682915568352, "num_tokens": 16566105.0, "step": 2160 }, { "entropy": 0.9734240360558033, "epoch": 0.31563636363636366, "grad_norm": 0.38508152961730957, "learning_rate": 4.8116806035948224e-05, "loss": 0.9546, "mean_token_accuracy": 0.8067123219370842, "num_tokens": 16644769.0, "step": 2170 }, { "entropy": 0.949046066403389, "epoch": 0.3170909090909091, "grad_norm": 0.35903850197792053, "learning_rate": 4.8060832730876256e-05, "loss": 0.9279, "mean_token_accuracy": 0.810236643254757, "num_tokens": 16720786.0, "step": 2180 }, { "entropy": 0.9580598846077919, "epoch": 0.3185454545454545, "grad_norm": 0.3273390829563141, "learning_rate": 4.800407333284348e-05, "loss": 0.9408, "mean_token_accuracy": 0.8102932535111904, "num_tokens": 16796483.0, "step": 2190 }, { "entropy": 0.9703283801674842, "epoch": 0.32, "grad_norm": 0.3284286856651306, "learning_rate": 4.794652978085679e-05, "loss": 0.9662, "mean_token_accuracy": 0.8069152064621449, "num_tokens": 16875079.0, "step": 2200 }, { "entropy": 0.9524148769676686, "epoch": 0.32145454545454544, "grad_norm": 0.31296366453170776, "learning_rate": 4.788820404071125e-05, "loss": 0.9355, "mean_token_accuracy": 0.8084697395563125, "num_tokens": 16953792.0, "step": 2210 }, { "entropy": 0.9396099261939526, "epoch": 0.3229090909090909, "grad_norm": 0.34159210324287415, "learning_rate": 4.782909810492291e-05, "loss": 0.9103, "mean_token_accuracy": 0.8125396214425564, "num_tokens": 17029630.0, "step": 2220 }, { "entropy": 0.9276422686874867, "epoch": 0.32436363636363635, "grad_norm": 0.3081703186035156, "learning_rate": 4.776921399266076e-05, "loss": 0.9259, "mean_token_accuracy": 0.8100886262953282, "num_tokens": 17105834.0, "step": 2230 }, { "entropy": 0.965707752853632, "epoch": 0.32581818181818184, "grad_norm": 0.5014197826385498, "learning_rate": 4.770855374967778e-05, "loss": 0.9398, "mean_token_accuracy": 0.8066871888935566, "num_tokens": 17185155.0, "step": 2240 }, { "entropy": 0.9296950966119766, "epoch": 0.32727272727272727, "grad_norm": 0.3334687352180481, "learning_rate": 4.7647119448240984e-05, "loss": 0.9069, "mean_token_accuracy": 0.8139915406703949, "num_tokens": 17261055.0, "step": 2250 }, { "entropy": 0.9424406073987484, "epoch": 0.3287272727272727, "grad_norm": 0.30235975980758667, "learning_rate": 4.7584913187060695e-05, "loss": 0.9335, "mean_token_accuracy": 0.8098909392952919, "num_tokens": 17338769.0, "step": 2260 }, { "entropy": 0.958009808510542, "epoch": 0.3301818181818182, "grad_norm": 0.41258761286735535, "learning_rate": 4.752193709121879e-05, "loss": 0.9745, "mean_token_accuracy": 0.8083416305482387, "num_tokens": 17414642.0, "step": 2270 }, { "entropy": 0.9475978955626487, "epoch": 0.3316363636363636, "grad_norm": 0.39095503091812134, "learning_rate": 4.745819331209617e-05, "loss": 0.9313, "mean_token_accuracy": 0.8099818773567676, "num_tokens": 17493365.0, "step": 2280 }, { "entropy": 0.9432621687650681, "epoch": 0.3330909090909091, "grad_norm": 0.3390606939792633, "learning_rate": 4.73936840272992e-05, "loss": 0.9171, "mean_token_accuracy": 0.8123437277972698, "num_tokens": 17569404.0, "step": 2290 }, { "entropy": 0.958767655491829, "epoch": 0.33454545454545453, "grad_norm": 0.41404950618743896, "learning_rate": 4.7328411440585356e-05, "loss": 0.938, "mean_token_accuracy": 0.8085070058703423, "num_tokens": 17648132.0, "step": 2300 }, { "entropy": 0.9349784903228283, "epoch": 0.336, "grad_norm": 0.43275147676467896, "learning_rate": 4.726237778178794e-05, "loss": 0.9089, "mean_token_accuracy": 0.8132195100188255, "num_tokens": 17723536.0, "step": 2310 }, { "entropy": 0.9718450345098972, "epoch": 0.33745454545454545, "grad_norm": 0.31931039690971375, "learning_rate": 4.7195585306739875e-05, "loss": 0.9637, "mean_token_accuracy": 0.8050491996109486, "num_tokens": 17801793.0, "step": 2320 }, { "entropy": 0.9561341628432274, "epoch": 0.3389090909090909, "grad_norm": 0.3197164237499237, "learning_rate": 4.71280362971967e-05, "loss": 0.9233, "mean_token_accuracy": 0.8104301512241363, "num_tokens": 17880055.0, "step": 2330 }, { "entropy": 0.9318038932979107, "epoch": 0.34036363636363637, "grad_norm": 0.3325251042842865, "learning_rate": 4.7059733060758544e-05, "loss": 0.9091, "mean_token_accuracy": 0.811470115184784, "num_tokens": 17956799.0, "step": 2340 }, { "entropy": 0.978094021230936, "epoch": 0.3418181818181818, "grad_norm": 0.30171552300453186, "learning_rate": 4.6990677930791334e-05, "loss": 0.97, "mean_token_accuracy": 0.8068195424973965, "num_tokens": 18034021.0, "step": 2350 }, { "entropy": 0.9303769364953041, "epoch": 0.3432727272727273, "grad_norm": 0.359419584274292, "learning_rate": 4.692087326634711e-05, "loss": 0.9088, "mean_token_accuracy": 0.814723651856184, "num_tokens": 18109871.0, "step": 2360 }, { "entropy": 0.9502622775733471, "epoch": 0.3447272727272727, "grad_norm": 0.580029308795929, "learning_rate": 4.6850321452083404e-05, "loss": 0.9298, "mean_token_accuracy": 0.8113038286566734, "num_tokens": 18184703.0, "step": 2370 }, { "entropy": 0.9524484679102898, "epoch": 0.3461818181818182, "grad_norm": 0.37079447507858276, "learning_rate": 4.677902489818175e-05, "loss": 0.938, "mean_token_accuracy": 0.8087799564003945, "num_tokens": 18261506.0, "step": 2380 }, { "entropy": 0.9275636874139309, "epoch": 0.34763636363636363, "grad_norm": 0.38261520862579346, "learning_rate": 4.67069860402654e-05, "loss": 0.9015, "mean_token_accuracy": 0.8157583817839622, "num_tokens": 18335664.0, "step": 2390 }, { "entropy": 0.9545292399823666, "epoch": 0.3490909090909091, "grad_norm": 0.32832345366477966, "learning_rate": 4.66342073393161e-05, "loss": 0.9329, "mean_token_accuracy": 0.8100977629423142, "num_tokens": 18412936.0, "step": 2400 }, { "entropy": 0.9629996709525586, "epoch": 0.35054545454545455, "grad_norm": 0.3800794780254364, "learning_rate": 4.6560691281589996e-05, "loss": 0.9491, "mean_token_accuracy": 0.8075961828231811, "num_tokens": 18492236.0, "step": 2410 }, { "entropy": 0.9659391663968563, "epoch": 0.352, "grad_norm": 0.5112242698669434, "learning_rate": 4.6486440378532734e-05, "loss": 0.9387, "mean_token_accuracy": 0.8073771148920059, "num_tokens": 18569666.0, "step": 2420 }, { "entropy": 0.9221311785280705, "epoch": 0.35345454545454547, "grad_norm": 0.40865597128868103, "learning_rate": 4.641145716669363e-05, "loss": 0.8972, "mean_token_accuracy": 0.8154647730290889, "num_tokens": 18644378.0, "step": 2430 }, { "entropy": 0.9529199428856373, "epoch": 0.3549090909090909, "grad_norm": 0.4366351068019867, "learning_rate": 4.6335744207639046e-05, "loss": 0.9296, "mean_token_accuracy": 0.8110525794327259, "num_tokens": 18720972.0, "step": 2440 }, { "entropy": 0.938295865058899, "epoch": 0.3563636363636364, "grad_norm": 0.3744116425514221, "learning_rate": 4.6259304087864866e-05, "loss": 0.9209, "mean_token_accuracy": 0.8117184430360794, "num_tokens": 18798212.0, "step": 2450 }, { "entropy": 0.9459369130432606, "epoch": 0.3578181818181818, "grad_norm": 0.3553162217140198, "learning_rate": 4.618213941870815e-05, "loss": 0.9292, "mean_token_accuracy": 0.8086876280605793, "num_tokens": 18877752.0, "step": 2460 }, { "entropy": 0.9362581737339497, "epoch": 0.3592727272727273, "grad_norm": 0.349174827337265, "learning_rate": 4.6104252836257896e-05, "loss": 0.9158, "mean_token_accuracy": 0.8127870723605156, "num_tokens": 18953448.0, "step": 2470 }, { "entropy": 0.9538705930113792, "epoch": 0.36072727272727273, "grad_norm": 0.32221290469169617, "learning_rate": 4.602564700126502e-05, "loss": 0.9232, "mean_token_accuracy": 0.8129294320940972, "num_tokens": 19030937.0, "step": 2480 }, { "entropy": 0.9399419300258159, "epoch": 0.36218181818181816, "grad_norm": 0.3328811824321747, "learning_rate": 4.5946324599051445e-05, "loss": 0.9293, "mean_token_accuracy": 0.8096531957387925, "num_tokens": 19109004.0, "step": 2490 }, { "entropy": 0.9541197009384632, "epoch": 0.36363636363636365, "grad_norm": 0.2997928261756897, "learning_rate": 4.586628833941835e-05, "loss": 0.9206, "mean_token_accuracy": 0.8126299031078815, "num_tokens": 19184351.0, "step": 2500 }, { "entropy": 0.944844014197588, "epoch": 0.3650909090909091, "grad_norm": 0.38323697447776794, "learning_rate": 4.578554095655366e-05, "loss": 0.9363, "mean_token_accuracy": 0.809072308242321, "num_tokens": 19261014.0, "step": 2510 }, { "entropy": 0.9703416049480438, "epoch": 0.36654545454545456, "grad_norm": 0.31747499108314514, "learning_rate": 4.570408520893854e-05, "loss": 0.9407, "mean_token_accuracy": 0.8093077220022679, "num_tokens": 19337470.0, "step": 2520 }, { "entropy": 0.9435131579637528, "epoch": 0.368, "grad_norm": 0.3520627021789551, "learning_rate": 4.562192387925326e-05, "loss": 0.9226, "mean_token_accuracy": 0.8121565252542495, "num_tokens": 19413364.0, "step": 2530 }, { "entropy": 0.9352571688592434, "epoch": 0.3694545454545455, "grad_norm": 0.34164953231811523, "learning_rate": 4.5539059774282053e-05, "loss": 0.9121, "mean_token_accuracy": 0.8150348752737046, "num_tokens": 19488149.0, "step": 2540 }, { "entropy": 0.9180795967578887, "epoch": 0.3709090909090909, "grad_norm": 0.30217695236206055, "learning_rate": 4.5455495724817306e-05, "loss": 0.8977, "mean_token_accuracy": 0.8154868699610234, "num_tokens": 19562468.0, "step": 2550 }, { "entropy": 0.9273349486291409, "epoch": 0.37236363636363634, "grad_norm": 0.3009410500526428, "learning_rate": 4.537123458556277e-05, "loss": 0.9118, "mean_token_accuracy": 0.8138667806982994, "num_tokens": 19639234.0, "step": 2560 }, { "entropy": 0.9390451267361641, "epoch": 0.3738181818181818, "grad_norm": 0.34551864862442017, "learning_rate": 4.5286279235036135e-05, "loss": 0.9104, "mean_token_accuracy": 0.8139432102441788, "num_tokens": 19715023.0, "step": 2570 }, { "entropy": 0.9297771051526069, "epoch": 0.37527272727272726, "grad_norm": 0.3966526985168457, "learning_rate": 4.520063257547058e-05, "loss": 0.9146, "mean_token_accuracy": 0.8128842279314995, "num_tokens": 19789823.0, "step": 2580 }, { "entropy": 0.9290238834917546, "epoch": 0.37672727272727274, "grad_norm": 0.5094491839408875, "learning_rate": 4.511429753271575e-05, "loss": 0.9127, "mean_token_accuracy": 0.8136251755058765, "num_tokens": 19866350.0, "step": 2590 }, { "entropy": 0.9276151649653912, "epoch": 0.3781818181818182, "grad_norm": 0.3241227865219116, "learning_rate": 4.502727705613773e-05, "loss": 0.9165, "mean_token_accuracy": 0.8133880697190762, "num_tokens": 19940099.0, "step": 2600 }, { "entropy": 0.9553582802414894, "epoch": 0.37963636363636366, "grad_norm": 0.4422711133956909, "learning_rate": 4.4939574118518254e-05, "loss": 0.9313, "mean_token_accuracy": 0.8098856434226036, "num_tokens": 20017376.0, "step": 2610 }, { "entropy": 0.966649767756462, "epoch": 0.3810909090909091, "grad_norm": 0.35644596815109253, "learning_rate": 4.485119171595326e-05, "loss": 0.9559, "mean_token_accuracy": 0.807817342877388, "num_tokens": 20096134.0, "step": 2620 }, { "entropy": 0.9594257563352585, "epoch": 0.3825454545454545, "grad_norm": 0.3995525538921356, "learning_rate": 4.476213286775044e-05, "loss": 0.9286, "mean_token_accuracy": 0.8108187094330788, "num_tokens": 20175183.0, "step": 2630 }, { "entropy": 0.9350139319896698, "epoch": 0.384, "grad_norm": 0.4301507771015167, "learning_rate": 4.4672400616326166e-05, "loss": 0.9323, "mean_token_accuracy": 0.8119172587990761, "num_tokens": 20252274.0, "step": 2640 }, { "entropy": 0.9751557812094689, "epoch": 0.38545454545454544, "grad_norm": 0.3629772961139679, "learning_rate": 4.4581998027101465e-05, "loss": 0.9579, "mean_token_accuracy": 0.8065298214554787, "num_tokens": 20331794.0, "step": 2650 }, { "entropy": 0.9497589774429798, "epoch": 0.3869090909090909, "grad_norm": 0.5881274938583374, "learning_rate": 4.4490928188397395e-05, "loss": 0.9266, "mean_token_accuracy": 0.811337610334158, "num_tokens": 20409223.0, "step": 2660 }, { "entropy": 0.9513171821832657, "epoch": 0.38836363636363636, "grad_norm": 0.40529772639274597, "learning_rate": 4.43991942113295e-05, "loss": 0.9326, "mean_token_accuracy": 0.8086440213024616, "num_tokens": 20488388.0, "step": 2670 }, { "entropy": 0.931061378121376, "epoch": 0.38981818181818184, "grad_norm": 0.3018703758716583, "learning_rate": 4.4306799229701496e-05, "loss": 0.9021, "mean_token_accuracy": 0.8149745658040046, "num_tokens": 20563678.0, "step": 2680 }, { "entropy": 0.9159508943557739, "epoch": 0.39127272727272727, "grad_norm": 0.31962108612060547, "learning_rate": 4.421374639989829e-05, "loss": 0.8959, "mean_token_accuracy": 0.8160949237644672, "num_tokens": 20638007.0, "step": 2690 }, { "entropy": 0.951894699037075, "epoch": 0.3927272727272727, "grad_norm": 0.6005260944366455, "learning_rate": 4.412003890077808e-05, "loss": 0.9379, "mean_token_accuracy": 0.8094079531729221, "num_tokens": 20714574.0, "step": 2700 }, { "entropy": 0.9519496828317642, "epoch": 0.3941818181818182, "grad_norm": 0.29477086663246155, "learning_rate": 4.40256799335638e-05, "loss": 0.9234, "mean_token_accuracy": 0.8126239985227585, "num_tokens": 20790166.0, "step": 2710 }, { "entropy": 0.9489260002970695, "epoch": 0.3956363636363636, "grad_norm": 0.3043905794620514, "learning_rate": 4.393067272173375e-05, "loss": 0.9302, "mean_token_accuracy": 0.8110754653811455, "num_tokens": 20867119.0, "step": 2720 }, { "entropy": 0.9309591136872768, "epoch": 0.3970909090909091, "grad_norm": 0.37266799807548523, "learning_rate": 4.3835020510911474e-05, "loss": 0.8999, "mean_token_accuracy": 0.8145073987543583, "num_tokens": 20941673.0, "step": 2730 }, { "entropy": 0.9514899291098118, "epoch": 0.39854545454545454, "grad_norm": 0.33977237343788147, "learning_rate": 4.3738726568754875e-05, "loss": 0.9485, "mean_token_accuracy": 0.8062153734266758, "num_tokens": 21021527.0, "step": 2740 }, { "entropy": 0.9509587049484253, "epoch": 0.4, "grad_norm": 0.34360271692276, "learning_rate": 4.364179418484461e-05, "loss": 0.9284, "mean_token_accuracy": 0.8108667440712451, "num_tokens": 21100206.0, "step": 2750 }, { "entropy": 0.9193227373063564, "epoch": 0.40145454545454545, "grad_norm": 0.3559633195400238, "learning_rate": 4.354422667057169e-05, "loss": 0.8994, "mean_token_accuracy": 0.8140523225069046, "num_tokens": 21175327.0, "step": 2760 }, { "entropy": 0.9564199469983578, "epoch": 0.4029090909090909, "grad_norm": 0.4009409546852112, "learning_rate": 4.344602735902436e-05, "loss": 0.9339, "mean_token_accuracy": 0.8101021826267243, "num_tokens": 21252732.0, "step": 2770 }, { "entropy": 0.9387026049196721, "epoch": 0.40436363636363637, "grad_norm": 0.32919296622276306, "learning_rate": 4.334719960487425e-05, "loss": 0.9224, "mean_token_accuracy": 0.8106619887053966, "num_tokens": 21329936.0, "step": 2780 }, { "entropy": 0.9394312173128128, "epoch": 0.4058181818181818, "grad_norm": 0.3113020360469818, "learning_rate": 4.3247746784261736e-05, "loss": 0.916, "mean_token_accuracy": 0.8107848934829235, "num_tokens": 21406701.0, "step": 2790 }, { "entropy": 0.9433960065245628, "epoch": 0.4072727272727273, "grad_norm": 0.3280106484889984, "learning_rate": 4.314767229468067e-05, "loss": 0.9233, "mean_token_accuracy": 0.8092322021722793, "num_tokens": 21483787.0, "step": 2800 }, { "entropy": 0.9473354913294315, "epoch": 0.4087272727272727, "grad_norm": 0.3314054012298584, "learning_rate": 4.3046979554862246e-05, "loss": 0.9265, "mean_token_accuracy": 0.813962434977293, "num_tokens": 21561130.0, "step": 2810 }, { "entropy": 0.9354553163051605, "epoch": 0.4101818181818182, "grad_norm": 0.3385145664215088, "learning_rate": 4.2945672004658235e-05, "loss": 0.9178, "mean_token_accuracy": 0.8126618385314941, "num_tokens": 21637505.0, "step": 2820 }, { "entropy": 0.9360568217933178, "epoch": 0.41163636363636363, "grad_norm": 0.3262713551521301, "learning_rate": 4.28437531049235e-05, "loss": 0.9107, "mean_token_accuracy": 0.8125479564070701, "num_tokens": 21715070.0, "step": 2830 }, { "entropy": 0.9339744850993157, "epoch": 0.41309090909090906, "grad_norm": 0.37787461280822754, "learning_rate": 4.274122633739772e-05, "loss": 0.9051, "mean_token_accuracy": 0.8136063523590564, "num_tokens": 21790607.0, "step": 2840 }, { "entropy": 0.9209459543228149, "epoch": 0.41454545454545455, "grad_norm": 0.3270346522331238, "learning_rate": 4.263809520458651e-05, "loss": 0.9028, "mean_token_accuracy": 0.8154242433607578, "num_tokens": 21865036.0, "step": 2850 }, { "entropy": 0.9485324196517467, "epoch": 0.416, "grad_norm": 0.35406219959259033, "learning_rate": 4.253436322964167e-05, "loss": 0.9377, "mean_token_accuracy": 0.8116884425282478, "num_tokens": 21941174.0, "step": 2860 }, { "entropy": 0.9417855083942414, "epoch": 0.41745454545454547, "grad_norm": 0.32201579213142395, "learning_rate": 4.243003395624094e-05, "loss": 0.914, "mean_token_accuracy": 0.8134081222116947, "num_tokens": 22015943.0, "step": 2870 }, { "entropy": 0.9514484673738479, "epoch": 0.4189090909090909, "grad_norm": 0.30800074338912964, "learning_rate": 4.232511094846687e-05, "loss": 0.9274, "mean_token_accuracy": 0.8104920752346516, "num_tokens": 22096053.0, "step": 2880 }, { "entropy": 0.9354054771363736, "epoch": 0.4203636363636364, "grad_norm": 0.3503027856349945, "learning_rate": 4.221959779068509e-05, "loss": 0.9115, "mean_token_accuracy": 0.8127908557653427, "num_tokens": 22171394.0, "step": 2890 }, { "entropy": 0.9206963747739791, "epoch": 0.4218181818181818, "grad_norm": 0.2915414571762085, "learning_rate": 4.211349808742184e-05, "loss": 0.9021, "mean_token_accuracy": 0.8156040996313095, "num_tokens": 22247511.0, "step": 2900 }, { "entropy": 0.9469660073518753, "epoch": 0.4232727272727273, "grad_norm": 0.30320265889167786, "learning_rate": 4.200681546324087e-05, "loss": 0.9361, "mean_token_accuracy": 0.8108836710453033, "num_tokens": 22323687.0, "step": 2910 }, { "entropy": 0.9925447411835193, "epoch": 0.42472727272727273, "grad_norm": 0.287954717874527, "learning_rate": 4.189955356261956e-05, "loss": 0.9683, "mean_token_accuracy": 0.8058648020029068, "num_tokens": 22402528.0, "step": 2920 }, { "entropy": 0.9799452804028987, "epoch": 0.42618181818181816, "grad_norm": 0.5119282007217407, "learning_rate": 4.1791716049824496e-05, "loss": 0.992, "mean_token_accuracy": 0.8043662630021572, "num_tokens": 22481118.0, "step": 2930 }, { "entropy": 0.9636691868305206, "epoch": 0.42763636363636365, "grad_norm": 0.30673807859420776, "learning_rate": 4.168330660878623e-05, "loss": 0.9516, "mean_token_accuracy": 0.8084825851023197, "num_tokens": 22558803.0, "step": 2940 }, { "entropy": 0.9445181660354137, "epoch": 0.4290909090909091, "grad_norm": 0.42131251096725464, "learning_rate": 4.1574328942973445e-05, "loss": 0.9266, "mean_token_accuracy": 0.810728045552969, "num_tokens": 22635681.0, "step": 2950 }, { "entropy": 0.9450175166130066, "epoch": 0.43054545454545456, "grad_norm": 0.30848971009254456, "learning_rate": 4.146478677526644e-05, "loss": 0.9439, "mean_token_accuracy": 0.8095552891492843, "num_tokens": 22711102.0, "step": 2960 }, { "entropy": 0.9384726583957672, "epoch": 0.432, "grad_norm": 0.321064293384552, "learning_rate": 4.135468384782996e-05, "loss": 0.9135, "mean_token_accuracy": 0.8127228446304798, "num_tokens": 22787605.0, "step": 2970 }, { "entropy": 0.9518445454537868, "epoch": 0.4334545454545455, "grad_norm": 0.3238827586174011, "learning_rate": 4.1244023921985344e-05, "loss": 0.9378, "mean_token_accuracy": 0.8076546937227249, "num_tokens": 22865947.0, "step": 2980 }, { "entropy": 0.943280752748251, "epoch": 0.4349090909090909, "grad_norm": 0.330661416053772, "learning_rate": 4.1132810778082054e-05, "loss": 0.9578, "mean_token_accuracy": 0.8113200690597295, "num_tokens": 22943810.0, "step": 2990 }, { "entropy": 0.9362864792346954, "epoch": 0.43636363636363634, "grad_norm": 0.3080872595310211, "learning_rate": 4.102104821536848e-05, "loss": 0.92, "mean_token_accuracy": 0.8104663982987403, "num_tokens": 23021690.0, "step": 3000 }, { "epoch": 0.43636363636363634, "eval_entropy": 0.9390125914573669, "eval_loss": 0.9096689224243164, "eval_mean_token_accuracy": 0.8104583250045776, "eval_num_tokens": 23021690.0, "eval_runtime": 77.2691, "eval_samples_per_second": 64.709, "eval_steps_per_second": 8.089, "step": 3000 }, { "entropy": 0.949031674861908, "epoch": 0.43781818181818183, "grad_norm": 0.35485225915908813, "learning_rate": 4.0908740051862194e-05, "loss": 0.9337, "mean_token_accuracy": 0.8110528267920017, "num_tokens": 23098757.0, "step": 3010 }, { "entropy": 0.9277644000947476, "epoch": 0.43927272727272726, "grad_norm": 0.3260344862937927, "learning_rate": 4.079589012421953e-05, "loss": 0.9086, "mean_token_accuracy": 0.8140561677515507, "num_tokens": 23174179.0, "step": 3020 }, { "entropy": 0.9273935034871101, "epoch": 0.44072727272727275, "grad_norm": 0.30524784326553345, "learning_rate": 4.068250228760447e-05, "loss": 0.9336, "mean_token_accuracy": 0.8133032880723476, "num_tokens": 23248956.0, "step": 3030 }, { "entropy": 0.9435071803629398, "epoch": 0.4421818181818182, "grad_norm": 0.37396615743637085, "learning_rate": 4.056858041555698e-05, "loss": 0.9155, "mean_token_accuracy": 0.8119289055466652, "num_tokens": 23326368.0, "step": 3040 }, { "entropy": 0.9278220035135746, "epoch": 0.44363636363636366, "grad_norm": 0.3182052969932556, "learning_rate": 4.045412839986067e-05, "loss": 0.9144, "mean_token_accuracy": 0.8117367446422576, "num_tokens": 23401650.0, "step": 3050 }, { "entropy": 0.9288572505116462, "epoch": 0.4450909090909091, "grad_norm": 0.39195388555526733, "learning_rate": 4.033915015040984e-05, "loss": 0.9185, "mean_token_accuracy": 0.8136234790086746, "num_tokens": 23477886.0, "step": 3060 }, { "entropy": 0.9454001143574715, "epoch": 0.4465454545454545, "grad_norm": 0.3858128786087036, "learning_rate": 4.022364959507595e-05, "loss": 0.9246, "mean_token_accuracy": 0.8114547491073608, "num_tokens": 23554655.0, "step": 3070 }, { "entropy": 0.9290557987987995, "epoch": 0.448, "grad_norm": 0.32388290762901306, "learning_rate": 4.0107630679573345e-05, "loss": 0.9083, "mean_token_accuracy": 0.8145299278199672, "num_tokens": 23631947.0, "step": 3080 }, { "entropy": 0.9243955463171005, "epoch": 0.44945454545454544, "grad_norm": 0.37549296021461487, "learning_rate": 3.999109736732456e-05, "loss": 0.9141, "mean_token_accuracy": 0.8141500823199749, "num_tokens": 23707907.0, "step": 3090 }, { "entropy": 0.9421398542821408, "epoch": 0.4509090909090909, "grad_norm": 0.34024038910865784, "learning_rate": 3.987405363932488e-05, "loss": 0.9153, "mean_token_accuracy": 0.8122914619743824, "num_tokens": 23784020.0, "step": 3100 }, { "entropy": 0.9259913168847561, "epoch": 0.45236363636363636, "grad_norm": 0.3002021014690399, "learning_rate": 3.9756503494006345e-05, "loss": 0.9104, "mean_token_accuracy": 0.8137310676276683, "num_tokens": 23861070.0, "step": 3110 }, { "entropy": 0.9394382186233997, "epoch": 0.45381818181818184, "grad_norm": 0.32609429955482483, "learning_rate": 3.963845094710113e-05, "loss": 0.9334, "mean_token_accuracy": 0.8116750314831733, "num_tokens": 23937344.0, "step": 3120 }, { "entropy": 0.9637476593255997, "epoch": 0.4552727272727273, "grad_norm": 0.3102467954158783, "learning_rate": 3.95199000315044e-05, "loss": 0.9483, "mean_token_accuracy": 0.807917469739914, "num_tokens": 24016141.0, "step": 3130 }, { "entropy": 0.9454035952687263, "epoch": 0.4567272727272727, "grad_norm": 0.291983425617218, "learning_rate": 3.940085479713655e-05, "loss": 0.9478, "mean_token_accuracy": 0.812795314192772, "num_tokens": 24091590.0, "step": 3140 }, { "entropy": 0.9189323402941227, "epoch": 0.4581818181818182, "grad_norm": 0.3117421865463257, "learning_rate": 3.928131931080479e-05, "loss": 0.9037, "mean_token_accuracy": 0.8151950173079967, "num_tokens": 24167519.0, "step": 3150 }, { "entropy": 0.9363495454192161, "epoch": 0.4596363636363636, "grad_norm": 0.34000906348228455, "learning_rate": 3.9161297656064266e-05, "loss": 0.9246, "mean_token_accuracy": 0.8120167836546898, "num_tokens": 24246228.0, "step": 3160 }, { "entropy": 0.9339604489505291, "epoch": 0.4610909090909091, "grad_norm": 0.3630552589893341, "learning_rate": 3.9040793933078526e-05, "loss": 0.9156, "mean_token_accuracy": 0.8135395906865597, "num_tokens": 24322463.0, "step": 3170 }, { "entropy": 0.9174147740006446, "epoch": 0.46254545454545454, "grad_norm": 0.3118632733821869, "learning_rate": 3.89198122584795e-05, "loss": 0.9055, "mean_token_accuracy": 0.8144961826503276, "num_tokens": 24396716.0, "step": 3180 }, { "entropy": 0.9205701947212219, "epoch": 0.464, "grad_norm": 0.36817336082458496, "learning_rate": 3.8798356765226835e-05, "loss": 0.9009, "mean_token_accuracy": 0.8156480133533478, "num_tokens": 24473065.0, "step": 3190 }, { "entropy": 0.937190480530262, "epoch": 0.46545454545454545, "grad_norm": 0.31383636593818665, "learning_rate": 3.8676431602466664e-05, "loss": 0.9317, "mean_token_accuracy": 0.8110474929213524, "num_tokens": 24552959.0, "step": 3200 }, { "entropy": 0.9277811951935291, "epoch": 0.4669090909090909, "grad_norm": 0.37277960777282715, "learning_rate": 3.855404093538994e-05, "loss": 0.9132, "mean_token_accuracy": 0.8147149369120598, "num_tokens": 24629697.0, "step": 3210 }, { "entropy": 0.939825527369976, "epoch": 0.46836363636363637, "grad_norm": 0.37860503792762756, "learning_rate": 3.843118894509012e-05, "loss": 0.9191, "mean_token_accuracy": 0.8115852467715741, "num_tokens": 24707230.0, "step": 3220 }, { "entropy": 0.9355527043342591, "epoch": 0.4698181818181818, "grad_norm": 0.40541505813598633, "learning_rate": 3.83078798284203e-05, "loss": 0.9193, "mean_token_accuracy": 0.8121265314519406, "num_tokens": 24784950.0, "step": 3230 }, { "entropy": 0.9393999978899956, "epoch": 0.4712727272727273, "grad_norm": 0.31179094314575195, "learning_rate": 3.818411779784988e-05, "loss": 0.927, "mean_token_accuracy": 0.8106306716799736, "num_tokens": 24861205.0, "step": 3240 }, { "entropy": 0.9308439895510674, "epoch": 0.4727272727272727, "grad_norm": 0.3248290419578552, "learning_rate": 3.805990708132064e-05, "loss": 0.9101, "mean_token_accuracy": 0.8138051718473435, "num_tokens": 24937478.0, "step": 3250 }, { "entropy": 0.9559439294040203, "epoch": 0.4741818181818182, "grad_norm": 0.3539363145828247, "learning_rate": 3.7935251922102294e-05, "loss": 0.9429, "mean_token_accuracy": 0.8100346833467483, "num_tokens": 25014666.0, "step": 3260 }, { "entropy": 0.9356847994029522, "epoch": 0.47563636363636363, "grad_norm": 0.3429943323135376, "learning_rate": 3.781015657864757e-05, "loss": 0.9387, "mean_token_accuracy": 0.8129906997084617, "num_tokens": 25090445.0, "step": 3270 }, { "entropy": 0.9545519553124905, "epoch": 0.47709090909090907, "grad_norm": 0.34916821122169495, "learning_rate": 3.768462532444669e-05, "loss": 0.9261, "mean_token_accuracy": 0.8117854639887809, "num_tokens": 25167108.0, "step": 3280 }, { "entropy": 0.9233941897749901, "epoch": 0.47854545454545455, "grad_norm": 0.35967811942100525, "learning_rate": 3.755866244788143e-05, "loss": 0.9086, "mean_token_accuracy": 0.8152607150375843, "num_tokens": 25240549.0, "step": 3290 }, { "entropy": 0.9435656048357487, "epoch": 0.48, "grad_norm": 0.34135791659355164, "learning_rate": 3.743227225207855e-05, "loss": 0.9281, "mean_token_accuracy": 0.8106845133006573, "num_tokens": 25318449.0, "step": 3300 }, { "entropy": 0.9465586185455322, "epoch": 0.48145454545454547, "grad_norm": 0.3166083097457886, "learning_rate": 3.730545905476286e-05, "loss": 0.9275, "mean_token_accuracy": 0.8122962072491646, "num_tokens": 25397039.0, "step": 3310 }, { "entropy": 0.937959486246109, "epoch": 0.4829090909090909, "grad_norm": 0.3031077980995178, "learning_rate": 3.71782271881097e-05, "loss": 0.9299, "mean_token_accuracy": 0.8110368713736534, "num_tokens": 25473863.0, "step": 3320 }, { "entropy": 0.9503463953733444, "epoch": 0.4843636363636364, "grad_norm": 0.3423995077610016, "learning_rate": 3.70505809985969e-05, "loss": 0.9321, "mean_token_accuracy": 0.810620927810669, "num_tokens": 25550661.0, "step": 3330 }, { "entropy": 0.9261522769927979, "epoch": 0.4858181818181818, "grad_norm": 0.3627229332923889, "learning_rate": 3.692252484685637e-05, "loss": 0.9108, "mean_token_accuracy": 0.8140110865235328, "num_tokens": 25626970.0, "step": 3340 }, { "entropy": 0.9232843138277531, "epoch": 0.48727272727272725, "grad_norm": 0.35451003909111023, "learning_rate": 3.679406310752506e-05, "loss": 0.912, "mean_token_accuracy": 0.8130640156567097, "num_tokens": 25702592.0, "step": 3350 }, { "entropy": 0.9272889249026776, "epoch": 0.48872727272727273, "grad_norm": 0.31371548771858215, "learning_rate": 3.6665200169095555e-05, "loss": 0.9111, "mean_token_accuracy": 0.8153925858438015, "num_tokens": 25778382.0, "step": 3360 }, { "entropy": 0.9283372424542904, "epoch": 0.49018181818181816, "grad_norm": 0.35514751076698303, "learning_rate": 3.653594043376618e-05, "loss": 0.9305, "mean_token_accuracy": 0.811019615828991, "num_tokens": 25856942.0, "step": 3370 }, { "entropy": 0.9131379060447216, "epoch": 0.49163636363636365, "grad_norm": 0.4405730962753296, "learning_rate": 3.640628831729055e-05, "loss": 0.9011, "mean_token_accuracy": 0.8163982145488262, "num_tokens": 25932344.0, "step": 3380 }, { "entropy": 0.9400516137480736, "epoch": 0.4930909090909091, "grad_norm": 0.2962123453617096, "learning_rate": 3.627624824882676e-05, "loss": 0.9219, "mean_token_accuracy": 0.8115826070308685, "num_tokens": 26009940.0, "step": 3390 }, { "entropy": 0.9201727285981178, "epoch": 0.49454545454545457, "grad_norm": 0.3848011791706085, "learning_rate": 3.6145824670786094e-05, "loss": 0.9069, "mean_token_accuracy": 0.813917699456215, "num_tokens": 26087646.0, "step": 3400 }, { "entropy": 0.9200171507894993, "epoch": 0.496, "grad_norm": 0.36265838146209717, "learning_rate": 3.6015022038681176e-05, "loss": 0.9159, "mean_token_accuracy": 0.8137690626084805, "num_tokens": 26164658.0, "step": 3410 }, { "entropy": 0.9186624906957149, "epoch": 0.4974545454545454, "grad_norm": 0.3266400098800659, "learning_rate": 3.588384482097389e-05, "loss": 0.9082, "mean_token_accuracy": 0.8157230131328106, "num_tokens": 26239949.0, "step": 3420 }, { "entropy": 0.9403476119041443, "epoch": 0.4989090909090909, "grad_norm": 0.3292923867702484, "learning_rate": 3.575229749892263e-05, "loss": 0.9266, "mean_token_accuracy": 0.8107123725116253, "num_tokens": 26318213.0, "step": 3430 }, { "entropy": 0.9599842190742492, "epoch": 0.5003636363636363, "grad_norm": 0.30845844745635986, "learning_rate": 3.5620384566429246e-05, "loss": 0.9916, "mean_token_accuracy": 0.8076838113367557, "num_tokens": 26394324.0, "step": 3440 }, { "entropy": 0.9396763563156127, "epoch": 0.5018181818181818, "grad_norm": 0.30212074518203735, "learning_rate": 3.5488110529885533e-05, "loss": 0.9253, "mean_token_accuracy": 0.8118289895355701, "num_tokens": 26470681.0, "step": 3450 }, { "entropy": 0.930367311090231, "epoch": 0.5032727272727273, "grad_norm": 0.2892606854438782, "learning_rate": 3.5355479908019265e-05, "loss": 0.9076, "mean_token_accuracy": 0.8147512383759021, "num_tokens": 26548509.0, "step": 3460 }, { "entropy": 0.9388787277042866, "epoch": 0.5047272727272727, "grad_norm": 0.3451310396194458, "learning_rate": 3.5222497231739834e-05, "loss": 0.927, "mean_token_accuracy": 0.8111469961702824, "num_tokens": 26627444.0, "step": 3470 }, { "entropy": 0.9242687962949276, "epoch": 0.5061818181818182, "grad_norm": 0.3954116702079773, "learning_rate": 3.508916704398348e-05, "loss": 0.9081, "mean_token_accuracy": 0.8125782743096351, "num_tokens": 26704031.0, "step": 3480 }, { "entropy": 0.913933489471674, "epoch": 0.5076363636363637, "grad_norm": 0.33013808727264404, "learning_rate": 3.495549389955806e-05, "loss": 0.9086, "mean_token_accuracy": 0.8151891089975833, "num_tokens": 26780389.0, "step": 3490 }, { "entropy": 0.9393781751394272, "epoch": 0.509090909090909, "grad_norm": 0.3132812976837158, "learning_rate": 3.482148236498751e-05, "loss": 0.9255, "mean_token_accuracy": 0.8121484272181988, "num_tokens": 26856489.0, "step": 3500 }, { "entropy": 0.9314693167805672, "epoch": 0.5105454545454545, "grad_norm": 0.36915311217308044, "learning_rate": 3.468713701835575e-05, "loss": 0.9101, "mean_token_accuracy": 0.8132783479988575, "num_tokens": 26930832.0, "step": 3510 }, { "entropy": 0.915811663120985, "epoch": 0.512, "grad_norm": 0.33095115423202515, "learning_rate": 3.455246244915039e-05, "loss": 0.9013, "mean_token_accuracy": 0.8143532752990723, "num_tokens": 27005645.0, "step": 3520 }, { "entropy": 0.9287936054170132, "epoch": 0.5134545454545455, "grad_norm": 0.3176046311855316, "learning_rate": 3.441746325810587e-05, "loss": 0.9234, "mean_token_accuracy": 0.8127094700932502, "num_tokens": 27082589.0, "step": 3530 }, { "entropy": 0.9292538709938526, "epoch": 0.5149090909090909, "grad_norm": 0.4348084628582001, "learning_rate": 3.428214405704634e-05, "loss": 0.9212, "mean_token_accuracy": 0.8118156298995018, "num_tokens": 27158602.0, "step": 3540 }, { "entropy": 0.9403552688658238, "epoch": 0.5163636363636364, "grad_norm": 0.29724040627479553, "learning_rate": 3.414650946872807e-05, "loss": 0.9223, "mean_token_accuracy": 0.8112016417086124, "num_tokens": 27234799.0, "step": 3550 }, { "entropy": 0.9113413311541081, "epoch": 0.5178181818181818, "grad_norm": 0.3209291994571686, "learning_rate": 3.4010564126681554e-05, "loss": 0.8956, "mean_token_accuracy": 0.8150275580585002, "num_tokens": 27310411.0, "step": 3560 }, { "entropy": 0.9307005263864994, "epoch": 0.5192727272727272, "grad_norm": 0.33619439601898193, "learning_rate": 3.38743126750532e-05, "loss": 0.9278, "mean_token_accuracy": 0.8099561981856823, "num_tokens": 27387609.0, "step": 3570 }, { "entropy": 0.9498361259698868, "epoch": 0.5207272727272727, "grad_norm": 0.3329075574874878, "learning_rate": 3.3737759768446716e-05, "loss": 0.9246, "mean_token_accuracy": 0.8113810978829861, "num_tokens": 27464690.0, "step": 3580 }, { "entropy": 0.9319490067660808, "epoch": 0.5221818181818182, "grad_norm": 0.2935169041156769, "learning_rate": 3.360091007176405e-05, "loss": 0.9231, "mean_token_accuracy": 0.8126781105995178, "num_tokens": 27542426.0, "step": 3590 }, { "entropy": 0.9247090421617031, "epoch": 0.5236363636363637, "grad_norm": 0.3140055537223816, "learning_rate": 3.346376826004607e-05, "loss": 0.9169, "mean_token_accuracy": 0.8137174978852272, "num_tokens": 27618489.0, "step": 3600 }, { "entropy": 0.9323613822460175, "epoch": 0.525090909090909, "grad_norm": 0.3542056083679199, "learning_rate": 3.3326339018312825e-05, "loss": 0.9169, "mean_token_accuracy": 0.8120187312364578, "num_tokens": 27693540.0, "step": 3610 }, { "entropy": 0.9273739039897919, "epoch": 0.5265454545454545, "grad_norm": 0.3772445023059845, "learning_rate": 3.318862704140352e-05, "loss": 0.9018, "mean_token_accuracy": 0.8152659721672535, "num_tokens": 27768991.0, "step": 3620 }, { "entropy": 0.9225555047392845, "epoch": 0.528, "grad_norm": 0.30556240677833557, "learning_rate": 3.305063703381611e-05, "loss": 0.914, "mean_token_accuracy": 0.8134266242384911, "num_tokens": 27847456.0, "step": 3630 }, { "entropy": 0.9254167668521405, "epoch": 0.5294545454545454, "grad_norm": 0.3305240273475647, "learning_rate": 3.291237370954661e-05, "loss": 0.9133, "mean_token_accuracy": 0.8138591662049294, "num_tokens": 27922870.0, "step": 3640 }, { "entropy": 0.9333068393170834, "epoch": 0.5309090909090909, "grad_norm": 0.4308319389820099, "learning_rate": 3.2773841791928026e-05, "loss": 0.9195, "mean_token_accuracy": 0.8125985987484455, "num_tokens": 27999197.0, "step": 3650 }, { "entropy": 0.9453266486525536, "epoch": 0.5323636363636364, "grad_norm": 0.35205429792404175, "learning_rate": 3.263504601346904e-05, "loss": 0.9364, "mean_token_accuracy": 0.8111186057329178, "num_tokens": 28075063.0, "step": 3660 }, { "entropy": 0.9272417090833187, "epoch": 0.5338181818181819, "grad_norm": 0.2925795912742615, "learning_rate": 3.249599111569227e-05, "loss": 0.915, "mean_token_accuracy": 0.8154182583093643, "num_tokens": 28151467.0, "step": 3670 }, { "entropy": 0.9294666975736618, "epoch": 0.5352727272727272, "grad_norm": 0.3383394777774811, "learning_rate": 3.2356681848972384e-05, "loss": 0.9129, "mean_token_accuracy": 0.8128080390393734, "num_tokens": 28228643.0, "step": 3680 }, { "entropy": 0.9178059481084346, "epoch": 0.5367272727272727, "grad_norm": 0.4347728192806244, "learning_rate": 3.221712297237372e-05, "loss": 0.9097, "mean_token_accuracy": 0.8125108242034912, "num_tokens": 28304443.0, "step": 3690 }, { "entropy": 0.9356210947036743, "epoch": 0.5381818181818182, "grad_norm": 0.3118355870246887, "learning_rate": 3.207731925348779e-05, "loss": 0.9301, "mean_token_accuracy": 0.81150324344635, "num_tokens": 28381759.0, "step": 3700 }, { "entropy": 0.9528975121676921, "epoch": 0.5396363636363637, "grad_norm": 0.30240732431411743, "learning_rate": 3.193727546827037e-05, "loss": 0.9445, "mean_token_accuracy": 0.8085363268852234, "num_tokens": 28460963.0, "step": 3710 }, { "entropy": 0.9330151177942753, "epoch": 0.5410909090909091, "grad_norm": 0.3076750338077545, "learning_rate": 3.1796996400878315e-05, "loss": 0.9237, "mean_token_accuracy": 0.812045356631279, "num_tokens": 28538470.0, "step": 3720 }, { "entropy": 0.9240581601858139, "epoch": 0.5425454545454546, "grad_norm": 0.3159777522087097, "learning_rate": 3.165648684350621e-05, "loss": 0.9348, "mean_token_accuracy": 0.8137698240578175, "num_tokens": 28613263.0, "step": 3730 }, { "entropy": 0.9310328140854836, "epoch": 0.544, "grad_norm": 0.3062320053577423, "learning_rate": 3.151575159622257e-05, "loss": 0.9294, "mean_token_accuracy": 0.8146270386874676, "num_tokens": 28687810.0, "step": 3740 }, { "entropy": 0.9495957009494305, "epoch": 0.5454545454545454, "grad_norm": 0.33293402194976807, "learning_rate": 3.137479546680592e-05, "loss": 0.9326, "mean_token_accuracy": 0.8113441608846188, "num_tokens": 28764721.0, "step": 3750 }, { "entropy": 0.9448008291423321, "epoch": 0.5469090909090909, "grad_norm": 0.29420945048332214, "learning_rate": 3.123362327058051e-05, "loss": 0.93, "mean_token_accuracy": 0.8090423189103604, "num_tokens": 28841296.0, "step": 3760 }, { "entropy": 0.9217709936201572, "epoch": 0.5483636363636364, "grad_norm": 0.3123224377632141, "learning_rate": 3.109223983025184e-05, "loss": 0.9071, "mean_token_accuracy": 0.8159178838133812, "num_tokens": 28915919.0, "step": 3770 }, { "entropy": 0.9265149988234043, "epoch": 0.5498181818181819, "grad_norm": 0.34357714653015137, "learning_rate": 3.095064997574194e-05, "loss": 0.9121, "mean_token_accuracy": 0.8129103809595108, "num_tokens": 28993630.0, "step": 3780 }, { "entropy": 0.9530934929847718, "epoch": 0.5512727272727272, "grad_norm": 0.3064063489437103, "learning_rate": 3.080885854402426e-05, "loss": 0.9261, "mean_token_accuracy": 0.8121055580675602, "num_tokens": 29070598.0, "step": 3790 }, { "entropy": 0.9290414094924927, "epoch": 0.5527272727272727, "grad_norm": 0.30586880445480347, "learning_rate": 3.066687037895858e-05, "loss": 0.9143, "mean_token_accuracy": 0.8123991221189499, "num_tokens": 29149139.0, "step": 3800 }, { "entropy": 0.9213745802640915, "epoch": 0.5541818181818182, "grad_norm": 0.31518247723579407, "learning_rate": 3.052469033112541e-05, "loss": 0.9126, "mean_token_accuracy": 0.8130135543644428, "num_tokens": 29224329.0, "step": 3810 }, { "entropy": 0.9490518577396869, "epoch": 0.5556363636363636, "grad_norm": 0.38361936807632446, "learning_rate": 3.0382323257660343e-05, "loss": 0.9322, "mean_token_accuracy": 0.8099796429276467, "num_tokens": 29298869.0, "step": 3820 }, { "entropy": 0.9164307072758675, "epoch": 0.5570909090909091, "grad_norm": 0.3322400748729706, "learning_rate": 3.023977402208813e-05, "loss": 0.9017, "mean_token_accuracy": 0.8168147139251232, "num_tokens": 29374649.0, "step": 3830 }, { "entropy": 0.9352445684373378, "epoch": 0.5585454545454546, "grad_norm": 0.3158262372016907, "learning_rate": 3.0097047494156492e-05, "loss": 0.9155, "mean_token_accuracy": 0.8125953778624535, "num_tokens": 29450368.0, "step": 3840 }, { "entropy": 0.9447495467960835, "epoch": 0.56, "grad_norm": 0.4749705195426941, "learning_rate": 2.995414854966983e-05, "loss": 0.9305, "mean_token_accuracy": 0.8096226342022419, "num_tokens": 29528900.0, "step": 3850 }, { "entropy": 0.9433772042393684, "epoch": 0.5614545454545454, "grad_norm": 0.30530375242233276, "learning_rate": 2.981108207032257e-05, "loss": 0.9351, "mean_token_accuracy": 0.8102800861001015, "num_tokens": 29606098.0, "step": 3860 }, { "entropy": 0.9182851135730743, "epoch": 0.5629090909090909, "grad_norm": 0.3289918005466461, "learning_rate": 2.966785294353248e-05, "loss": 0.9045, "mean_token_accuracy": 0.8157595112919808, "num_tokens": 29683042.0, "step": 3870 }, { "entropy": 0.940113590657711, "epoch": 0.5643636363636364, "grad_norm": 0.3084245026111603, "learning_rate": 2.9524466062273637e-05, "loss": 0.9618, "mean_token_accuracy": 0.80933144018054, "num_tokens": 29761341.0, "step": 3880 }, { "entropy": 0.9369757734239101, "epoch": 0.5658181818181818, "grad_norm": 0.3422188460826874, "learning_rate": 2.9380926324909326e-05, "loss": 0.9148, "mean_token_accuracy": 0.8134120874106884, "num_tokens": 29838964.0, "step": 3890 }, { "entropy": 0.920634201169014, "epoch": 0.5672727272727273, "grad_norm": 0.315481960773468, "learning_rate": 2.9237238635024655e-05, "loss": 0.9019, "mean_token_accuracy": 0.8159717105329036, "num_tokens": 29913008.0, "step": 3900 }, { "entropy": 0.926985715329647, "epoch": 0.5687272727272727, "grad_norm": 0.31134775280952454, "learning_rate": 2.9093407901259113e-05, "loss": 0.9133, "mean_token_accuracy": 0.8131841793656349, "num_tokens": 29989402.0, "step": 3910 }, { "entropy": 0.9281412333250045, "epoch": 0.5701818181818182, "grad_norm": 0.30873990058898926, "learning_rate": 2.8949439037138787e-05, "loss": 0.9139, "mean_token_accuracy": 0.8122556217014789, "num_tokens": 30066188.0, "step": 3920 }, { "entropy": 0.9479538016021252, "epoch": 0.5716363636363636, "grad_norm": 0.29268190264701843, "learning_rate": 2.880533696090858e-05, "loss": 0.9255, "mean_token_accuracy": 0.8109686590731144, "num_tokens": 30145885.0, "step": 3930 }, { "entropy": 0.9348795086145401, "epoch": 0.5730909090909091, "grad_norm": 0.2962764799594879, "learning_rate": 2.866110659536418e-05, "loss": 0.9204, "mean_token_accuracy": 0.8116168014705181, "num_tokens": 30221980.0, "step": 3940 }, { "entropy": 0.9421909719705581, "epoch": 0.5745454545454546, "grad_norm": 0.37171006202697754, "learning_rate": 2.8516752867683834e-05, "loss": 0.9345, "mean_token_accuracy": 0.809541080147028, "num_tokens": 30298060.0, "step": 3950 }, { "entropy": 0.9366579465568066, "epoch": 0.576, "grad_norm": 0.3353271484375, "learning_rate": 2.8372280709260112e-05, "loss": 0.9193, "mean_token_accuracy": 0.8101016081869602, "num_tokens": 30375772.0, "step": 3960 }, { "entropy": 0.9318700306117534, "epoch": 0.5774545454545454, "grad_norm": 0.30664509534835815, "learning_rate": 2.8227695055531372e-05, "loss": 0.9232, "mean_token_accuracy": 0.811845350265503, "num_tokens": 30453404.0, "step": 3970 }, { "entropy": 0.9198355250060558, "epoch": 0.5789090909090909, "grad_norm": 0.3414006233215332, "learning_rate": 2.80830008458132e-05, "loss": 0.9084, "mean_token_accuracy": 0.8146342925727368, "num_tokens": 30531652.0, "step": 3980 }, { "entropy": 0.9534987896680832, "epoch": 0.5803636363636364, "grad_norm": 0.3388223648071289, "learning_rate": 2.7938203023129655e-05, "loss": 0.9357, "mean_token_accuracy": 0.8100730545818806, "num_tokens": 30608793.0, "step": 3990 }, { "entropy": 0.9408224396407604, "epoch": 0.5818181818181818, "grad_norm": 0.4285614788532257, "learning_rate": 2.7793306534044407e-05, "loss": 0.9233, "mean_token_accuracy": 0.8130472995340824, "num_tokens": 30684417.0, "step": 4000 }, { "epoch": 0.5818181818181818, "eval_entropy": 0.9120176056861877, "eval_loss": 0.9038572311401367, "eval_mean_token_accuracy": 0.8106667428016663, "eval_num_tokens": 30684417.0, "eval_runtime": 77.2157, "eval_samples_per_second": 64.754, "eval_steps_per_second": 8.094, "step": 4000 }, { "entropy": 0.9213396511971951, "epoch": 0.5832727272727273, "grad_norm": 0.30884382128715515, "learning_rate": 2.764831632849174e-05, "loss": 0.9105, "mean_token_accuracy": 0.8138939343392849, "num_tokens": 30758705.0, "step": 4010 }, { "entropy": 0.9280633635818958, "epoch": 0.5847272727272728, "grad_norm": 0.3091529607772827, "learning_rate": 2.750323735960749e-05, "loss": 0.9153, "mean_token_accuracy": 0.8144114501774311, "num_tokens": 30836054.0, "step": 4020 }, { "entropy": 0.9196830488741398, "epoch": 0.5861818181818181, "grad_norm": 0.34157034754753113, "learning_rate": 2.7358074583559805e-05, "loss": 0.896, "mean_token_accuracy": 0.8160037316381932, "num_tokens": 30910893.0, "step": 4030 }, { "entropy": 0.9281592950224876, "epoch": 0.5876363636363636, "grad_norm": 0.32032203674316406, "learning_rate": 2.7212832959379832e-05, "loss": 0.913, "mean_token_accuracy": 0.8135712184011936, "num_tokens": 30985770.0, "step": 4040 }, { "entropy": 0.9192128323018551, "epoch": 0.5890909090909091, "grad_norm": 0.30986231565475464, "learning_rate": 2.7067517448792328e-05, "loss": 0.9043, "mean_token_accuracy": 0.8159645989537239, "num_tokens": 31062009.0, "step": 4050 }, { "entropy": 0.9104260437190532, "epoch": 0.5905454545454546, "grad_norm": 0.2997622489929199, "learning_rate": 2.6922133016046153e-05, "loss": 0.9021, "mean_token_accuracy": 0.8168829850852489, "num_tokens": 31136291.0, "step": 4060 }, { "entropy": 0.9366477951407433, "epoch": 0.592, "grad_norm": 0.3440490961074829, "learning_rate": 2.6776684627744652e-05, "loss": 0.9097, "mean_token_accuracy": 0.8135413631796837, "num_tokens": 31211763.0, "step": 4070 }, { "entropy": 0.9435247026383877, "epoch": 0.5934545454545455, "grad_norm": 0.3243034780025482, "learning_rate": 2.6631177252676037e-05, "loss": 0.9552, "mean_token_accuracy": 0.8111616026610136, "num_tokens": 31290765.0, "step": 4080 }, { "entropy": 0.9122216440737247, "epoch": 0.5949090909090909, "grad_norm": 0.3088412582874298, "learning_rate": 2.6485615861643615e-05, "loss": 0.8996, "mean_token_accuracy": 0.8152236327528953, "num_tokens": 31365328.0, "step": 4090 }, { "entropy": 0.9196409486234188, "epoch": 0.5963636363636363, "grad_norm": 0.30076760053634644, "learning_rate": 2.6340005427295967e-05, "loss": 0.8972, "mean_token_accuracy": 0.8156254440546036, "num_tokens": 31438526.0, "step": 4100 }, { "entropy": 0.9299661487340927, "epoch": 0.5978181818181818, "grad_norm": 0.3447272479534149, "learning_rate": 2.619435092395708e-05, "loss": 0.9164, "mean_token_accuracy": 0.8133956313133239, "num_tokens": 31514224.0, "step": 4110 }, { "entropy": 0.9186855144798756, "epoch": 0.5992727272727273, "grad_norm": 0.2987687587738037, "learning_rate": 2.604865732745645e-05, "loss": 0.9055, "mean_token_accuracy": 0.8139917500317096, "num_tokens": 31591033.0, "step": 4120 }, { "entropy": 0.9176096372306347, "epoch": 0.6007272727272728, "grad_norm": 0.304896742105484, "learning_rate": 2.590292961495903e-05, "loss": 0.8979, "mean_token_accuracy": 0.8159045994281768, "num_tokens": 31666674.0, "step": 4130 }, { "entropy": 0.9512632295489312, "epoch": 0.6021818181818182, "grad_norm": 0.3454456627368927, "learning_rate": 2.5757172764795272e-05, "loss": 0.965, "mean_token_accuracy": 0.8078057669103146, "num_tokens": 31742137.0, "step": 4140 }, { "entropy": 0.933166479319334, "epoch": 0.6036363636363636, "grad_norm": 0.4448087215423584, "learning_rate": 2.5611391756291015e-05, "loss": 0.915, "mean_token_accuracy": 0.8134665213525295, "num_tokens": 31819369.0, "step": 4150 }, { "entropy": 0.9195875227451324, "epoch": 0.6050909090909091, "grad_norm": 0.4040326774120331, "learning_rate": 2.5465591569597376e-05, "loss": 0.9083, "mean_token_accuracy": 0.8156167544424534, "num_tokens": 31894986.0, "step": 4160 }, { "entropy": 0.9244043946266174, "epoch": 0.6065454545454545, "grad_norm": 0.31537356972694397, "learning_rate": 2.5319777185520637e-05, "loss": 0.9157, "mean_token_accuracy": 0.8129312485456467, "num_tokens": 31970758.0, "step": 4170 }, { "entropy": 0.9341804251074791, "epoch": 0.608, "grad_norm": 0.30743053555488586, "learning_rate": 2.517395358535212e-05, "loss": 0.9069, "mean_token_accuracy": 0.8125176221132279, "num_tokens": 32046461.0, "step": 4180 }, { "entropy": 0.9229583241045475, "epoch": 0.6094545454545455, "grad_norm": 0.2892451584339142, "learning_rate": 2.5028125750697956e-05, "loss": 0.9167, "mean_token_accuracy": 0.8145610079169273, "num_tokens": 32124401.0, "step": 4190 }, { "entropy": 0.9227637097239494, "epoch": 0.610909090909091, "grad_norm": 0.34083735942840576, "learning_rate": 2.4882298663308938e-05, "loss": 0.9095, "mean_token_accuracy": 0.8163429066538811, "num_tokens": 32198279.0, "step": 4200 }, { "entropy": 0.9213042184710503, "epoch": 0.6123636363636363, "grad_norm": 0.31918326020240784, "learning_rate": 2.4736477304910353e-05, "loss": 0.9113, "mean_token_accuracy": 0.8158605769276619, "num_tokens": 32274861.0, "step": 4210 }, { "entropy": 0.9200929164886474, "epoch": 0.6138181818181818, "grad_norm": 0.3179524540901184, "learning_rate": 2.459066665703174e-05, "loss": 0.8979, "mean_token_accuracy": 0.8158435106277466, "num_tokens": 32351403.0, "step": 4220 }, { "entropy": 0.9181513540446758, "epoch": 0.6152727272727273, "grad_norm": 0.3022609353065491, "learning_rate": 2.4444871700836773e-05, "loss": 0.8922, "mean_token_accuracy": 0.8171645559370517, "num_tokens": 32426917.0, "step": 4230 }, { "entropy": 0.9327409908175468, "epoch": 0.6167272727272727, "grad_norm": 0.3763042390346527, "learning_rate": 2.4299097416953057e-05, "loss": 0.9288, "mean_token_accuracy": 0.8123154416680336, "num_tokens": 32505611.0, "step": 4240 }, { "entropy": 0.9272146694362163, "epoch": 0.6181818181818182, "grad_norm": 0.31237301230430603, "learning_rate": 2.415334878530198e-05, "loss": 0.9159, "mean_token_accuracy": 0.8113645888864994, "num_tokens": 32584298.0, "step": 4250 }, { "entropy": 0.9192642048001289, "epoch": 0.6196363636363637, "grad_norm": 0.40542471408843994, "learning_rate": 2.400763078492865e-05, "loss": 0.9064, "mean_token_accuracy": 0.8155330330133438, "num_tokens": 32662584.0, "step": 4260 }, { "entropy": 0.9455889090895653, "epoch": 0.6210909090909091, "grad_norm": 0.3466758131980896, "learning_rate": 2.3861948393831693e-05, "loss": 0.9806, "mean_token_accuracy": 0.8104759208858013, "num_tokens": 32739409.0, "step": 4270 }, { "entropy": 0.93989123031497, "epoch": 0.6225454545454545, "grad_norm": 0.367541640996933, "learning_rate": 2.3716306588793298e-05, "loss": 0.9274, "mean_token_accuracy": 0.8119640313088894, "num_tokens": 32816667.0, "step": 4280 }, { "entropy": 0.931169830262661, "epoch": 0.624, "grad_norm": 0.3801480233669281, "learning_rate": 2.357071034520914e-05, "loss": 0.9083, "mean_token_accuracy": 0.8134308315813541, "num_tokens": 32892144.0, "step": 4290 }, { "entropy": 0.926163075864315, "epoch": 0.6254545454545455, "grad_norm": 0.3418377637863159, "learning_rate": 2.342516463691844e-05, "loss": 0.9163, "mean_token_accuracy": 0.8127011097967625, "num_tokens": 32968698.0, "step": 4300 }, { "entropy": 0.958393444865942, "epoch": 0.6269090909090909, "grad_norm": 0.31486940383911133, "learning_rate": 2.327967443603402e-05, "loss": 0.9388, "mean_token_accuracy": 0.8094369448721409, "num_tokens": 33047170.0, "step": 4310 }, { "entropy": 0.9316714957356453, "epoch": 0.6283636363636363, "grad_norm": 0.5651655197143555, "learning_rate": 2.313424471277248e-05, "loss": 0.9221, "mean_token_accuracy": 0.8118502162396908, "num_tokens": 33126959.0, "step": 4320 }, { "entropy": 0.9491320624947548, "epoch": 0.6298181818181818, "grad_norm": 0.29574310779571533, "learning_rate": 2.2988880435284402e-05, "loss": 0.946, "mean_token_accuracy": 0.8098831824958325, "num_tokens": 33209043.0, "step": 4330 }, { "entropy": 0.9107597202062607, "epoch": 0.6312727272727273, "grad_norm": 0.3819224536418915, "learning_rate": 2.2843586569484592e-05, "loss": 0.9164, "mean_token_accuracy": 0.8156860545277596, "num_tokens": 33286119.0, "step": 4340 }, { "entropy": 0.9466536194086075, "epoch": 0.6327272727272727, "grad_norm": 0.36104846000671387, "learning_rate": 2.269836807888249e-05, "loss": 0.9356, "mean_token_accuracy": 0.8103018321096898, "num_tokens": 33365064.0, "step": 4350 }, { "entropy": 0.9229753375053406, "epoch": 0.6341818181818182, "grad_norm": 0.4024662375450134, "learning_rate": 2.2553229924412553e-05, "loss": 0.908, "mean_token_accuracy": 0.8140193805098533, "num_tokens": 33440374.0, "step": 4360 }, { "entropy": 0.9263255707919598, "epoch": 0.6356363636363637, "grad_norm": 0.4088100492954254, "learning_rate": 2.2408177064264824e-05, "loss": 0.9084, "mean_token_accuracy": 0.8131275482475757, "num_tokens": 33516998.0, "step": 4370 }, { "entropy": 0.9208009012043477, "epoch": 0.637090909090909, "grad_norm": 0.2979762554168701, "learning_rate": 2.2263214453715518e-05, "loss": 0.9037, "mean_token_accuracy": 0.8130398415029049, "num_tokens": 33597009.0, "step": 4380 }, { "entropy": 0.9229357041418552, "epoch": 0.6385454545454545, "grad_norm": 0.3448769748210907, "learning_rate": 2.2118347044957774e-05, "loss": 0.9173, "mean_token_accuracy": 0.8124949038028717, "num_tokens": 33674601.0, "step": 4390 }, { "entropy": 0.9393012635409832, "epoch": 0.64, "grad_norm": 0.33367374539375305, "learning_rate": 2.1973579786932434e-05, "loss": 0.92, "mean_token_accuracy": 0.8117619611322879, "num_tokens": 33752265.0, "step": 4400 }, { "entropy": 0.9376168206334115, "epoch": 0.6414545454545455, "grad_norm": 0.32508036494255066, "learning_rate": 2.1828917625159047e-05, "loss": 0.9162, "mean_token_accuracy": 0.8128947488963604, "num_tokens": 33827985.0, "step": 4410 }, { "entropy": 0.9196195363998413, "epoch": 0.6429090909090909, "grad_norm": 0.3176663815975189, "learning_rate": 2.1684365501566832e-05, "loss": 0.8974, "mean_token_accuracy": 0.8134889304637909, "num_tokens": 33904188.0, "step": 4420 }, { "entropy": 0.9178881429135799, "epoch": 0.6443636363636364, "grad_norm": 0.36815205216407776, "learning_rate": 2.1539928354325917e-05, "loss": 0.9106, "mean_token_accuracy": 0.8146425768733024, "num_tokens": 33980757.0, "step": 4430 }, { "entropy": 0.9099920958280563, "epoch": 0.6458181818181818, "grad_norm": 0.3318701386451721, "learning_rate": 2.1395611117678632e-05, "loss": 0.8932, "mean_token_accuracy": 0.8180915333330632, "num_tokens": 34055905.0, "step": 4440 }, { "entropy": 0.9483034580945968, "epoch": 0.6472727272727272, "grad_norm": 0.3110158145427704, "learning_rate": 2.1251418721770917e-05, "loss": 0.9315, "mean_token_accuracy": 0.8075625628232956, "num_tokens": 34133393.0, "step": 4450 }, { "entropy": 0.9322702303528786, "epoch": 0.6487272727272727, "grad_norm": 0.4107281565666199, "learning_rate": 2.1107356092483943e-05, "loss": 0.9174, "mean_token_accuracy": 0.8124357827007771, "num_tokens": 34211203.0, "step": 4460 }, { "entropy": 0.9236367382109165, "epoch": 0.6501818181818182, "grad_norm": 0.3252826929092407, "learning_rate": 2.0963428151265793e-05, "loss": 0.9173, "mean_token_accuracy": 0.8112751476466655, "num_tokens": 34288790.0, "step": 4470 }, { "entropy": 0.939553078263998, "epoch": 0.6516363636363637, "grad_norm": 0.3687044084072113, "learning_rate": 2.0819639814963375e-05, "loss": 0.9276, "mean_token_accuracy": 0.8118774957954884, "num_tokens": 34365549.0, "step": 4480 }, { "entropy": 0.9295577295124531, "epoch": 0.653090909090909, "grad_norm": 0.28752341866493225, "learning_rate": 2.0675995995654405e-05, "loss": 0.913, "mean_token_accuracy": 0.8133269488811493, "num_tokens": 34440923.0, "step": 4490 }, { "entropy": 0.9382489174604416, "epoch": 0.6545454545454545, "grad_norm": 0.3165334165096283, "learning_rate": 2.0532501600479647e-05, "loss": 0.9301, "mean_token_accuracy": 0.8110613726079464, "num_tokens": 34518649.0, "step": 4500 }, { "entropy": 0.9152321480214596, "epoch": 0.656, "grad_norm": 0.29478880763053894, "learning_rate": 2.0389161531475262e-05, "loss": 0.9068, "mean_token_accuracy": 0.8136940069496632, "num_tokens": 34595637.0, "step": 4510 }, { "entropy": 0.9248601853847503, "epoch": 0.6574545454545454, "grad_norm": 0.32419294118881226, "learning_rate": 2.0245980685405313e-05, "loss": 0.9107, "mean_token_accuracy": 0.8130759067833424, "num_tokens": 34672428.0, "step": 4520 }, { "entropy": 0.9113852202892303, "epoch": 0.6589090909090909, "grad_norm": 0.365728497505188, "learning_rate": 2.010296395359456e-05, "loss": 0.9063, "mean_token_accuracy": 0.8161646939814091, "num_tokens": 34748433.0, "step": 4530 }, { "entropy": 0.9144539162516594, "epoch": 0.6603636363636364, "grad_norm": 0.31549787521362305, "learning_rate": 1.9960116221761258e-05, "loss": 0.9131, "mean_token_accuracy": 0.8138697162270546, "num_tokens": 34825874.0, "step": 4540 }, { "entropy": 0.9262143172323704, "epoch": 0.6618181818181819, "grad_norm": 0.3173759877681732, "learning_rate": 1.9817442369850353e-05, "loss": 0.9081, "mean_token_accuracy": 0.8120600923895835, "num_tokens": 34904254.0, "step": 4550 }, { "entropy": 0.9321594141423702, "epoch": 0.6632727272727272, "grad_norm": 0.32515621185302734, "learning_rate": 1.96749472718667e-05, "loss": 0.9168, "mean_token_accuracy": 0.8133991360664368, "num_tokens": 34981283.0, "step": 4560 }, { "entropy": 0.9301972724497318, "epoch": 0.6647272727272727, "grad_norm": 0.3155202269554138, "learning_rate": 1.9532635795708604e-05, "loss": 0.9121, "mean_token_accuracy": 0.8124547980725765, "num_tokens": 35058109.0, "step": 4570 }, { "entropy": 0.9356323592364788, "epoch": 0.6661818181818182, "grad_norm": 0.33614522218704224, "learning_rate": 1.939051280300148e-05, "loss": 0.9175, "mean_token_accuracy": 0.812773285806179, "num_tokens": 35135740.0, "step": 4580 }, { "entropy": 0.927642934024334, "epoch": 0.6676363636363636, "grad_norm": 0.31026774644851685, "learning_rate": 1.9248583148931846e-05, "loss": 0.9079, "mean_token_accuracy": 0.8145812973380089, "num_tokens": 35211772.0, "step": 4590 }, { "entropy": 0.9314297124743461, "epoch": 0.6690909090909091, "grad_norm": 0.32177138328552246, "learning_rate": 1.910685168208135e-05, "loss": 0.9151, "mean_token_accuracy": 0.8127957999706268, "num_tokens": 35291233.0, "step": 4600 }, { "entropy": 0.9267405033111572, "epoch": 0.6705454545454546, "grad_norm": 0.3147774636745453, "learning_rate": 1.896532324426125e-05, "loss": 0.9262, "mean_token_accuracy": 0.8127358593046665, "num_tokens": 35367300.0, "step": 4610 }, { "entropy": 0.9300662837922573, "epoch": 0.672, "grad_norm": 0.30565381050109863, "learning_rate": 1.8824002670346923e-05, "loss": 0.9164, "mean_token_accuracy": 0.8130706764757634, "num_tokens": 35445684.0, "step": 4620 }, { "entropy": 0.9152273058891296, "epoch": 0.6734545454545454, "grad_norm": 0.30101245641708374, "learning_rate": 1.868289478811272e-05, "loss": 0.9025, "mean_token_accuracy": 0.8156548984348774, "num_tokens": 35522237.0, "step": 4630 }, { "entropy": 0.9321424387395382, "epoch": 0.6749090909090909, "grad_norm": 0.3155101537704468, "learning_rate": 1.854200441806708e-05, "loss": 0.9206, "mean_token_accuracy": 0.81043586358428, "num_tokens": 35601986.0, "step": 4640 }, { "entropy": 0.9121891938149929, "epoch": 0.6763636363636364, "grad_norm": 0.3027799129486084, "learning_rate": 1.840133637328778e-05, "loss": 0.889, "mean_token_accuracy": 0.816604009270668, "num_tokens": 35678707.0, "step": 4650 }, { "entropy": 0.9230089358985424, "epoch": 0.6778181818181818, "grad_norm": 0.3036416172981262, "learning_rate": 1.8260895459257594e-05, "loss": 0.9062, "mean_token_accuracy": 0.8145593546330929, "num_tokens": 35752636.0, "step": 4660 }, { "entropy": 0.9228417217731476, "epoch": 0.6792727272727273, "grad_norm": 0.3162209391593933, "learning_rate": 1.812068647370005e-05, "loss": 0.9125, "mean_token_accuracy": 0.814147113263607, "num_tokens": 35828700.0, "step": 4670 }, { "entropy": 0.9207356870174408, "epoch": 0.6807272727272727, "grad_norm": 0.30621933937072754, "learning_rate": 1.7980714206415594e-05, "loss": 0.9039, "mean_token_accuracy": 0.8144191935658455, "num_tokens": 35905856.0, "step": 4680 }, { "entropy": 0.9312183283269405, "epoch": 0.6821818181818182, "grad_norm": 0.3484281599521637, "learning_rate": 1.7840983439117913e-05, "loss": 0.9061, "mean_token_accuracy": 0.8130019463598728, "num_tokens": 35984612.0, "step": 4690 }, { "entropy": 0.9221517466008663, "epoch": 0.6836363636363636, "grad_norm": 0.31173935532569885, "learning_rate": 1.7701498945270617e-05, "loss": 0.9086, "mean_token_accuracy": 0.8135214596986771, "num_tokens": 36062136.0, "step": 4700 }, { "entropy": 0.9280834481120109, "epoch": 0.6850909090909091, "grad_norm": 0.30636629462242126, "learning_rate": 1.7562265489924152e-05, "loss": 0.9117, "mean_token_accuracy": 0.8145467966794968, "num_tokens": 36138870.0, "step": 4710 }, { "entropy": 0.916886804997921, "epoch": 0.6865454545454546, "grad_norm": 0.2903667986392975, "learning_rate": 1.7423287829553007e-05, "loss": 0.9037, "mean_token_accuracy": 0.8137389704585075, "num_tokens": 36215545.0, "step": 4720 }, { "entropy": 0.9208665400743484, "epoch": 0.688, "grad_norm": 0.330870121717453, "learning_rate": 1.728457071189327e-05, "loss": 0.9113, "mean_token_accuracy": 0.8159119389951229, "num_tokens": 36289626.0, "step": 4730 }, { "entropy": 0.9310987628996372, "epoch": 0.6894545454545454, "grad_norm": 0.31531065702438354, "learning_rate": 1.7146118875780366e-05, "loss": 0.9106, "mean_token_accuracy": 0.8122837901115417, "num_tokens": 36368248.0, "step": 4740 }, { "entropy": 0.9374513991177083, "epoch": 0.6909090909090909, "grad_norm": 0.2993552088737488, "learning_rate": 1.7007937050987248e-05, "loss": 0.9147, "mean_token_accuracy": 0.8125071600079536, "num_tokens": 36444504.0, "step": 4750 }, { "entropy": 0.9231074757874012, "epoch": 0.6923636363636364, "grad_norm": 0.3486793637275696, "learning_rate": 1.6870029958062736e-05, "loss": 0.9172, "mean_token_accuracy": 0.8129670150578022, "num_tokens": 36520449.0, "step": 4760 }, { "entropy": 0.9267033264040947, "epoch": 0.6938181818181818, "grad_norm": 0.2960473597049713, "learning_rate": 1.6732402308170334e-05, "loss": 0.9095, "mean_token_accuracy": 0.8121006153523922, "num_tokens": 36596976.0, "step": 4770 }, { "entropy": 0.930424588918686, "epoch": 0.6952727272727273, "grad_norm": 0.3184972405433655, "learning_rate": 1.6595058802927218e-05, "loss": 0.9215, "mean_token_accuracy": 0.8138814494013786, "num_tokens": 36675808.0, "step": 4780 }, { "entropy": 0.9042963065207005, "epoch": 0.6967272727272728, "grad_norm": 0.3160466253757477, "learning_rate": 1.645800413424369e-05, "loss": 0.8805, "mean_token_accuracy": 0.8197195284068585, "num_tokens": 36749873.0, "step": 4790 }, { "entropy": 0.9051633194088936, "epoch": 0.6981818181818182, "grad_norm": 0.3440122902393341, "learning_rate": 1.6321242984162818e-05, "loss": 0.9007, "mean_token_accuracy": 0.8161387205123901, "num_tokens": 36827728.0, "step": 4800 }, { "entropy": 0.9146598286926746, "epoch": 0.6996363636363636, "grad_norm": 0.3145407736301422, "learning_rate": 1.6184780024700565e-05, "loss": 0.9016, "mean_token_accuracy": 0.814163988828659, "num_tokens": 36906330.0, "step": 4810 }, { "entropy": 0.9468378983438015, "epoch": 0.7010909090909091, "grad_norm": 0.2996998429298401, "learning_rate": 1.6048619917686113e-05, "loss": 0.9359, "mean_token_accuracy": 0.8094095788896084, "num_tokens": 36985047.0, "step": 4820 }, { "entropy": 0.9358403541147708, "epoch": 0.7025454545454546, "grad_norm": 0.3024042546749115, "learning_rate": 1.591276731460265e-05, "loss": 0.919, "mean_token_accuracy": 0.8127869322896004, "num_tokens": 37065350.0, "step": 4830 }, { "entropy": 0.9225737951695919, "epoch": 0.704, "grad_norm": 0.3492467403411865, "learning_rate": 1.5777226856428474e-05, "loss": 0.911, "mean_token_accuracy": 0.814387359470129, "num_tokens": 37143676.0, "step": 4840 }, { "entropy": 0.9143257580697537, "epoch": 0.7054545454545454, "grad_norm": 0.31178757548332214, "learning_rate": 1.5642003173478397e-05, "loss": 0.9005, "mean_token_accuracy": 0.8143624864518643, "num_tokens": 37220127.0, "step": 4850 }, { "entropy": 0.939749064296484, "epoch": 0.7069090909090909, "grad_norm": 0.32759299874305725, "learning_rate": 1.550710088524564e-05, "loss": 0.9352, "mean_token_accuracy": 0.8100519716739655, "num_tokens": 37299479.0, "step": 4860 }, { "entropy": 0.918349402397871, "epoch": 0.7083636363636364, "grad_norm": 0.32404211163520813, "learning_rate": 1.5372524600243933e-05, "loss": 0.9063, "mean_token_accuracy": 0.8145528778433799, "num_tokens": 37377354.0, "step": 4870 }, { "entropy": 0.9249159656465054, "epoch": 0.7098181818181818, "grad_norm": 0.306998074054718, "learning_rate": 1.5238278915850179e-05, "loss": 0.9132, "mean_token_accuracy": 0.8122608505189419, "num_tokens": 37453558.0, "step": 4880 }, { "entropy": 0.9320059776306152, "epoch": 0.7112727272727273, "grad_norm": 0.35612940788269043, "learning_rate": 1.5104368418147308e-05, "loss": 0.9192, "mean_token_accuracy": 0.8133574321866035, "num_tokens": 37529895.0, "step": 4890 }, { "entropy": 0.9335394233465195, "epoch": 0.7127272727272728, "grad_norm": 0.35255157947540283, "learning_rate": 1.497079768176767e-05, "loss": 0.9292, "mean_token_accuracy": 0.81116853505373, "num_tokens": 37608124.0, "step": 4900 }, { "entropy": 0.9473002113401889, "epoch": 0.7141818181818181, "grad_norm": 0.37226906418800354, "learning_rate": 1.4837571269736716e-05, "loss": 0.9384, "mean_token_accuracy": 0.8106353215873241, "num_tokens": 37685482.0, "step": 4910 }, { "entropy": 0.9388401240110398, "epoch": 0.7156363636363636, "grad_norm": 0.3105103671550751, "learning_rate": 1.4704693733317152e-05, "loss": 0.9147, "mean_token_accuracy": 0.8120019629597663, "num_tokens": 37763552.0, "step": 4920 }, { "entropy": 0.9257414855062962, "epoch": 0.7170909090909091, "grad_norm": 0.3366066515445709, "learning_rate": 1.4572169611853437e-05, "loss": 0.9009, "mean_token_accuracy": 0.8152667842805386, "num_tokens": 37840526.0, "step": 4930 }, { "entropy": 0.9142756037414074, "epoch": 0.7185454545454546, "grad_norm": 0.29677334427833557, "learning_rate": 1.4440003432616713e-05, "loss": 0.8997, "mean_token_accuracy": 0.81498968526721, "num_tokens": 37914807.0, "step": 4940 }, { "entropy": 0.9175783574581147, "epoch": 0.72, "grad_norm": 0.32036203145980835, "learning_rate": 1.4308199710650153e-05, "loss": 0.9059, "mean_token_accuracy": 0.8153199687600136, "num_tokens": 37990579.0, "step": 4950 }, { "entropy": 0.9218224361538887, "epoch": 0.7214545454545455, "grad_norm": 0.3067290782928467, "learning_rate": 1.4176762948614697e-05, "loss": 0.8976, "mean_token_accuracy": 0.8162059687077999, "num_tokens": 38065673.0, "step": 4960 }, { "entropy": 0.9500917561352253, "epoch": 0.722909090909091, "grad_norm": 0.3111895024776459, "learning_rate": 1.4045697636635283e-05, "loss": 0.9362, "mean_token_accuracy": 0.8087316453456879, "num_tokens": 38143782.0, "step": 4970 }, { "entropy": 0.9383980259299278, "epoch": 0.7243636363636363, "grad_norm": 0.3183054029941559, "learning_rate": 1.391500825214738e-05, "loss": 0.9191, "mean_token_accuracy": 0.8115313574671745, "num_tokens": 38223280.0, "step": 4980 }, { "entropy": 0.9261168956756591, "epoch": 0.7258181818181818, "grad_norm": 0.30299633741378784, "learning_rate": 1.378469925974412e-05, "loss": 0.9299, "mean_token_accuracy": 0.8118037767708302, "num_tokens": 38302455.0, "step": 4990 }, { "entropy": 0.910749813914299, "epoch": 0.7272727272727273, "grad_norm": 0.33091458678245544, "learning_rate": 1.3654775111023681e-05, "loss": 0.9022, "mean_token_accuracy": 0.8166116662323475, "num_tokens": 38380992.0, "step": 5000 }, { "epoch": 0.7272727272727273, "eval_entropy": 0.9231304630279541, "eval_loss": 0.8997952342033386, "eval_mean_token_accuracy": 0.811289277935028, "eval_num_tokens": 38380992.0, "eval_runtime": 77.91, "eval_samples_per_second": 64.177, "eval_steps_per_second": 8.022, "step": 5000 }, { "entropy": 0.9267726093530655, "epoch": 0.7287272727272728, "grad_norm": 0.31813424825668335, "learning_rate": 1.3525240244437315e-05, "loss": 0.9266, "mean_token_accuracy": 0.8130132332444191, "num_tokens": 38457879.0, "step": 5010 }, { "entropy": 0.9128262452781201, "epoch": 0.7301818181818182, "grad_norm": 0.38921618461608887, "learning_rate": 1.3396099085137629e-05, "loss": 0.8976, "mean_token_accuracy": 0.8168335042893886, "num_tokens": 38532295.0, "step": 5020 }, { "entropy": 0.9510353311896325, "epoch": 0.7316363636363636, "grad_norm": 0.3156704604625702, "learning_rate": 1.3267356044827464e-05, "loss": 0.9732, "mean_token_accuracy": 0.8092717811465263, "num_tokens": 38610836.0, "step": 5030 }, { "entropy": 0.9076557137072087, "epoch": 0.7330909090909091, "grad_norm": 0.3028537631034851, "learning_rate": 1.3139015521609203e-05, "loss": 0.8993, "mean_token_accuracy": 0.8164118349552154, "num_tokens": 38687664.0, "step": 5040 }, { "entropy": 0.9417129889130592, "epoch": 0.7345454545454545, "grad_norm": 0.30686843395233154, "learning_rate": 1.3011081899834443e-05, "loss": 0.9302, "mean_token_accuracy": 0.8112225525081158, "num_tokens": 38766894.0, "step": 5050 }, { "entropy": 0.9178734488785267, "epoch": 0.736, "grad_norm": 0.3113689124584198, "learning_rate": 1.2883559549954321e-05, "loss": 0.9046, "mean_token_accuracy": 0.8157093286514282, "num_tokens": 38844280.0, "step": 5060 }, { "entropy": 0.922054061293602, "epoch": 0.7374545454545455, "grad_norm": 0.3138102889060974, "learning_rate": 1.275645282837013e-05, "loss": 0.9071, "mean_token_accuracy": 0.814234309643507, "num_tokens": 38921783.0, "step": 5070 }, { "entropy": 0.9010880179703236, "epoch": 0.738909090909091, "grad_norm": 0.2947777211666107, "learning_rate": 1.2629766077284524e-05, "loss": 0.8823, "mean_token_accuracy": 0.8186369761824608, "num_tokens": 38998093.0, "step": 5080 }, { "entropy": 0.9084647111594677, "epoch": 0.7403636363636363, "grad_norm": 0.4752785861492157, "learning_rate": 1.250350362455318e-05, "loss": 0.8925, "mean_token_accuracy": 0.8168115198612214, "num_tokens": 39075179.0, "step": 5090 }, { "entropy": 0.9198925085365772, "epoch": 0.7418181818181818, "grad_norm": 0.309291809797287, "learning_rate": 1.2377669783536986e-05, "loss": 0.9024, "mean_token_accuracy": 0.814837496727705, "num_tokens": 39152927.0, "step": 5100 }, { "entropy": 0.9089493103325367, "epoch": 0.7432727272727273, "grad_norm": 0.3210631310939789, "learning_rate": 1.225226885295461e-05, "loss": 0.9023, "mean_token_accuracy": 0.8153677061200142, "num_tokens": 39228412.0, "step": 5110 }, { "entropy": 0.9285098657011985, "epoch": 0.7447272727272727, "grad_norm": 0.37961098551750183, "learning_rate": 1.2127305116735708e-05, "loss": 0.9171, "mean_token_accuracy": 0.8129767127335071, "num_tokens": 39305265.0, "step": 5120 }, { "entropy": 0.92706044241786, "epoch": 0.7461818181818182, "grad_norm": 0.2997186779975891, "learning_rate": 1.2002782843874574e-05, "loss": 0.9073, "mean_token_accuracy": 0.81295927464962, "num_tokens": 39382407.0, "step": 5130 }, { "entropy": 0.9154023215174675, "epoch": 0.7476363636363637, "grad_norm": 0.31855660676956177, "learning_rate": 1.1878706288284272e-05, "loss": 0.8967, "mean_token_accuracy": 0.817341311275959, "num_tokens": 39458813.0, "step": 5140 }, { "entropy": 0.9350193403661251, "epoch": 0.7490909090909091, "grad_norm": 0.31996530294418335, "learning_rate": 1.1755079688651353e-05, "loss": 0.926, "mean_token_accuracy": 0.8099291563034058, "num_tokens": 39537349.0, "step": 5150 }, { "entropy": 0.9326572187244893, "epoch": 0.7505454545454545, "grad_norm": 0.30809709429740906, "learning_rate": 1.1631907268291008e-05, "loss": 0.9197, "mean_token_accuracy": 0.8114828899502754, "num_tokens": 39615186.0, "step": 5160 }, { "entropy": 0.9393107175827027, "epoch": 0.752, "grad_norm": 0.3391665518283844, "learning_rate": 1.1509193235002843e-05, "loss": 0.927, "mean_token_accuracy": 0.8121741153299809, "num_tokens": 39694700.0, "step": 5170 }, { "entropy": 0.948701660335064, "epoch": 0.7534545454545455, "grad_norm": 0.3133850395679474, "learning_rate": 1.1386941780927079e-05, "loss": 0.9397, "mean_token_accuracy": 0.8088832281529903, "num_tokens": 39771680.0, "step": 5180 }, { "entropy": 0.9011263348162174, "epoch": 0.7549090909090909, "grad_norm": 0.3303625285625458, "learning_rate": 1.1265157082401404e-05, "loss": 0.8786, "mean_token_accuracy": 0.8216502912342548, "num_tokens": 39843328.0, "step": 5190 }, { "entropy": 0.9218214929103852, "epoch": 0.7563636363636363, "grad_norm": 0.3165566921234131, "learning_rate": 1.114384329981823e-05, "loss": 0.9143, "mean_token_accuracy": 0.8160425268113614, "num_tokens": 39920612.0, "step": 5200 }, { "entropy": 0.9363315224647522, "epoch": 0.7578181818181818, "grad_norm": 0.3346816897392273, "learning_rate": 1.1023004577482625e-05, "loss": 0.9155, "mean_token_accuracy": 0.8121711872518063, "num_tokens": 39995562.0, "step": 5210 }, { "entropy": 0.9151855200529099, "epoch": 0.7592727272727273, "grad_norm": 0.3320513069629669, "learning_rate": 1.0902645043470701e-05, "loss": 0.9058, "mean_token_accuracy": 0.8149781577289105, "num_tokens": 40071662.0, "step": 5220 }, { "entropy": 0.9302772752940655, "epoch": 0.7607272727272727, "grad_norm": 0.31996816396713257, "learning_rate": 1.0782768809488602e-05, "loss": 0.9047, "mean_token_accuracy": 0.8155157797038555, "num_tokens": 40148712.0, "step": 5230 }, { "entropy": 0.9082226067781448, "epoch": 0.7621818181818182, "grad_norm": 0.3083097040653229, "learning_rate": 1.0663379970732061e-05, "loss": 0.9028, "mean_token_accuracy": 0.8169299229979515, "num_tokens": 40223661.0, "step": 5240 }, { "entropy": 0.9109638199210167, "epoch": 0.7636363636363637, "grad_norm": 0.3519935607910156, "learning_rate": 1.0544482605746455e-05, "loss": 0.8945, "mean_token_accuracy": 0.818182872980833, "num_tokens": 40299756.0, "step": 5250 }, { "entropy": 0.9138317100703717, "epoch": 0.765090909090909, "grad_norm": 0.322620153427124, "learning_rate": 1.0426080776287528e-05, "loss": 0.8896, "mean_token_accuracy": 0.816927520930767, "num_tokens": 40373317.0, "step": 5260 }, { "entropy": 0.9338168516755104, "epoch": 0.7665454545454545, "grad_norm": 0.3295387029647827, "learning_rate": 1.0308178527182572e-05, "loss": 0.9173, "mean_token_accuracy": 0.812485358864069, "num_tokens": 40452850.0, "step": 5270 }, { "entropy": 0.9220724381506443, "epoch": 0.768, "grad_norm": 0.30471867322921753, "learning_rate": 1.019077988619232e-05, "loss": 0.9134, "mean_token_accuracy": 0.8132412627339363, "num_tokens": 40528672.0, "step": 5280 }, { "entropy": 0.9006679959595203, "epoch": 0.7694545454545455, "grad_norm": 0.3501948118209839, "learning_rate": 1.0073888863873281e-05, "loss": 0.884, "mean_token_accuracy": 0.8187536239624024, "num_tokens": 40603405.0, "step": 5290 }, { "entropy": 0.9375061370432377, "epoch": 0.7709090909090909, "grad_norm": 0.4156853258609772, "learning_rate": 9.957509453440788e-06, "loss": 0.9187, "mean_token_accuracy": 0.8133987367153168, "num_tokens": 40680296.0, "step": 5300 }, { "entropy": 0.9344054982066154, "epoch": 0.7723636363636364, "grad_norm": 0.3439910113811493, "learning_rate": 9.84164563063254e-06, "loss": 0.9292, "mean_token_accuracy": 0.8120204225182533, "num_tokens": 40759619.0, "step": 5310 }, { "entropy": 0.949238508939743, "epoch": 0.7738181818181818, "grad_norm": 0.3470531105995178, "learning_rate": 9.7263013535728e-06, "loss": 0.9667, "mean_token_accuracy": 0.8093096021562814, "num_tokens": 40835342.0, "step": 5320 }, { "entropy": 0.9372798420488835, "epoch": 0.7752727272727272, "grad_norm": 0.37672653794288635, "learning_rate": 9.611480562637207e-06, "loss": 0.9112, "mean_token_accuracy": 0.8122121192514896, "num_tokens": 40913392.0, "step": 5330 }, { "entropy": 0.9161439433693885, "epoch": 0.7767272727272727, "grad_norm": 0.3224441707134247, "learning_rate": 9.4971871803181e-06, "loss": 0.8972, "mean_token_accuracy": 0.8151120066642761, "num_tokens": 40988136.0, "step": 5340 }, { "entropy": 0.9237129762768745, "epoch": 0.7781818181818182, "grad_norm": 0.3345123529434204, "learning_rate": 9.383425111090586e-06, "loss": 0.923, "mean_token_accuracy": 0.8145867928862571, "num_tokens": 41062502.0, "step": 5350 }, { "entropy": 0.9012173816561699, "epoch": 0.7796363636363637, "grad_norm": 0.32990553975105286, "learning_rate": 9.270198241279093e-06, "loss": 0.8865, "mean_token_accuracy": 0.8177733510732651, "num_tokens": 41136820.0, "step": 5360 }, { "entropy": 0.9296848550438881, "epoch": 0.7810909090909091, "grad_norm": 0.32448163628578186, "learning_rate": 9.157510438924686e-06, "loss": 0.9188, "mean_token_accuracy": 0.8128324948251248, "num_tokens": 41212913.0, "step": 5370 }, { "entropy": 0.9221142314374446, "epoch": 0.7825454545454545, "grad_norm": 0.33526450395584106, "learning_rate": 9.045365553652833e-06, "loss": 0.901, "mean_token_accuracy": 0.8145244039595128, "num_tokens": 41289724.0, "step": 5380 }, { "entropy": 0.9362643413245678, "epoch": 0.784, "grad_norm": 0.3785208761692047, "learning_rate": 8.933767416541978e-06, "loss": 0.9243, "mean_token_accuracy": 0.8105296589434147, "num_tokens": 41370085.0, "step": 5390 }, { "entropy": 0.9407142043113709, "epoch": 0.7854545454545454, "grad_norm": 0.34329891204833984, "learning_rate": 8.822719839992597e-06, "loss": 0.9366, "mean_token_accuracy": 0.8094825424253941, "num_tokens": 41447850.0, "step": 5400 }, { "entropy": 0.924130903929472, "epoch": 0.7869090909090909, "grad_norm": 0.32263872027397156, "learning_rate": 8.712226617597028e-06, "loss": 0.9176, "mean_token_accuracy": 0.8136730268597603, "num_tokens": 41524404.0, "step": 5410 }, { "entropy": 0.9223329506814479, "epoch": 0.7883636363636364, "grad_norm": 0.3371281325817108, "learning_rate": 8.6022915240098e-06, "loss": 0.9104, "mean_token_accuracy": 0.8147990137338639, "num_tokens": 41597942.0, "step": 5420 }, { "entropy": 0.924953754991293, "epoch": 0.7898181818181819, "grad_norm": 0.3209916651248932, "learning_rate": 8.49291831481873e-06, "loss": 0.9151, "mean_token_accuracy": 0.8145290650427341, "num_tokens": 41675038.0, "step": 5430 }, { "entropy": 0.907654071599245, "epoch": 0.7912727272727272, "grad_norm": 0.3175525963306427, "learning_rate": 8.384110726416642e-06, "loss": 0.8971, "mean_token_accuracy": 0.8170280657708645, "num_tokens": 41750100.0, "step": 5440 }, { "entropy": 0.9338749371469021, "epoch": 0.7927272727272727, "grad_norm": 0.309807151556015, "learning_rate": 8.275872475873662e-06, "loss": 0.9112, "mean_token_accuracy": 0.8137181624770164, "num_tokens": 41828144.0, "step": 5450 }, { "entropy": 0.9331824757158756, "epoch": 0.7941818181818182, "grad_norm": 0.6010003089904785, "learning_rate": 8.16820726081031e-06, "loss": 0.9261, "mean_token_accuracy": 0.813402933627367, "num_tokens": 41905473.0, "step": 5460 }, { "entropy": 0.9054892651736737, "epoch": 0.7956363636363636, "grad_norm": 0.3187941014766693, "learning_rate": 8.06111875927111e-06, "loss": 0.8861, "mean_token_accuracy": 0.8182264745235444, "num_tokens": 41981650.0, "step": 5470 }, { "entropy": 0.9242243312299252, "epoch": 0.7970909090909091, "grad_norm": 0.3306691348552704, "learning_rate": 7.954610629598996e-06, "loss": 0.9252, "mean_token_accuracy": 0.8116098716855049, "num_tokens": 42059323.0, "step": 5480 }, { "entropy": 0.9288264907896518, "epoch": 0.7985454545454546, "grad_norm": 0.3101803660392761, "learning_rate": 7.848686510310307e-06, "loss": 0.9264, "mean_token_accuracy": 0.8119940876960754, "num_tokens": 42135684.0, "step": 5490 }, { "entropy": 0.9204266957938672, "epoch": 0.8, "grad_norm": 0.32018566131591797, "learning_rate": 7.74335001997052e-06, "loss": 0.9086, "mean_token_accuracy": 0.8140264257788659, "num_tokens": 42212157.0, "step": 5500 }, { "entropy": 0.9341423124074936, "epoch": 0.8014545454545454, "grad_norm": 0.30274590849876404, "learning_rate": 7.638604757070585e-06, "loss": 0.9178, "mean_token_accuracy": 0.8140484564006328, "num_tokens": 42289342.0, "step": 5510 }, { "entropy": 0.9244139701128006, "epoch": 0.8029090909090909, "grad_norm": 0.2957451343536377, "learning_rate": 7.5344542999040255e-06, "loss": 0.9046, "mean_token_accuracy": 0.8142490774393082, "num_tokens": 42366646.0, "step": 5520 }, { "entropy": 0.9261615209281444, "epoch": 0.8043636363636364, "grad_norm": 0.3075684905052185, "learning_rate": 7.430902206444711e-06, "loss": 0.9171, "mean_token_accuracy": 0.8156520687043667, "num_tokens": 42442815.0, "step": 5530 }, { "entropy": 0.9371460095047951, "epoch": 0.8058181818181818, "grad_norm": 0.3488467037677765, "learning_rate": 7.327952014225259e-06, "loss": 0.9259, "mean_token_accuracy": 0.8112338967621326, "num_tokens": 42522857.0, "step": 5540 }, { "entropy": 0.9135711878538132, "epoch": 0.8072727272727273, "grad_norm": 0.3251098692417145, "learning_rate": 7.225607240216253e-06, "loss": 0.9053, "mean_token_accuracy": 0.8151080518960953, "num_tokens": 42598873.0, "step": 5550 }, { "entropy": 0.9226764656603337, "epoch": 0.8087272727272727, "grad_norm": 0.3301449120044708, "learning_rate": 7.123871380706026e-06, "loss": 0.9059, "mean_token_accuracy": 0.8157884009182453, "num_tokens": 42676099.0, "step": 5560 }, { "entropy": 0.9240290597081184, "epoch": 0.8101818181818182, "grad_norm": 0.33067309856414795, "learning_rate": 7.022747911181295e-06, "loss": 0.9127, "mean_token_accuracy": 0.8157339677214622, "num_tokens": 42752810.0, "step": 5570 }, { "entropy": 0.9300024129450322, "epoch": 0.8116363636363636, "grad_norm": 0.3276396095752716, "learning_rate": 6.9222402862083525e-06, "loss": 0.9297, "mean_token_accuracy": 0.8102625668048858, "num_tokens": 42830186.0, "step": 5580 }, { "entropy": 0.9295799404382705, "epoch": 0.8130909090909091, "grad_norm": 0.3359651267528534, "learning_rate": 6.822351939315129e-06, "loss": 0.9165, "mean_token_accuracy": 0.813194601982832, "num_tokens": 42905771.0, "step": 5590 }, { "entropy": 0.9260146826505661, "epoch": 0.8145454545454546, "grad_norm": 0.3210604190826416, "learning_rate": 6.723086282873835e-06, "loss": 0.9019, "mean_token_accuracy": 0.8183946497738361, "num_tokens": 42981816.0, "step": 5600 }, { "entropy": 0.9256181947886943, "epoch": 0.816, "grad_norm": 0.3306752145290375, "learning_rate": 6.624446707984416e-06, "loss": 0.9133, "mean_token_accuracy": 0.8128662265837192, "num_tokens": 43059336.0, "step": 5610 }, { "entropy": 0.9192026577889919, "epoch": 0.8174545454545454, "grad_norm": 0.35311999917030334, "learning_rate": 6.5264365843587265e-06, "loss": 0.9047, "mean_token_accuracy": 0.8151163265109063, "num_tokens": 43136391.0, "step": 5620 }, { "entropy": 0.9239639192819595, "epoch": 0.8189090909090909, "grad_norm": 0.3081344962120056, "learning_rate": 6.4290592602053665e-06, "loss": 0.9135, "mean_token_accuracy": 0.8140504479408264, "num_tokens": 43214113.0, "step": 5630 }, { "entropy": 0.9212824292480946, "epoch": 0.8203636363636364, "grad_norm": 0.3152661919593811, "learning_rate": 6.332318062115341e-06, "loss": 0.9101, "mean_token_accuracy": 0.8138195432722568, "num_tokens": 43291551.0, "step": 5640 }, { "entropy": 0.9230553589761257, "epoch": 0.8218181818181818, "grad_norm": 0.31583520770072937, "learning_rate": 6.236216294948384e-06, "loss": 0.8995, "mean_token_accuracy": 0.8151654459536075, "num_tokens": 43369496.0, "step": 5650 }, { "entropy": 0.901103076338768, "epoch": 0.8232727272727273, "grad_norm": 0.33287662267684937, "learning_rate": 6.14075724172011e-06, "loss": 0.8962, "mean_token_accuracy": 0.8168199427425862, "num_tokens": 43443535.0, "step": 5660 }, { "entropy": 0.9405964225530624, "epoch": 0.8247272727272728, "grad_norm": 0.40133121609687805, "learning_rate": 6.045944163489785e-06, "loss": 0.9241, "mean_token_accuracy": 0.8112705871462822, "num_tokens": 43522587.0, "step": 5670 }, { "entropy": 0.9063078582286834, "epoch": 0.8261818181818181, "grad_norm": 0.34281712770462036, "learning_rate": 5.951780299249006e-06, "loss": 0.8985, "mean_token_accuracy": 0.8165899373590946, "num_tokens": 43597778.0, "step": 5680 }, { "entropy": 0.9149762600660324, "epoch": 0.8276363636363636, "grad_norm": 0.3659612536430359, "learning_rate": 5.85826886581097e-06, "loss": 0.9258, "mean_token_accuracy": 0.8148726306855678, "num_tokens": 43673314.0, "step": 5690 }, { "entropy": 0.9137645930051803, "epoch": 0.8290909090909091, "grad_norm": 0.36775919795036316, "learning_rate": 5.765413057700659e-06, "loss": 0.9152, "mean_token_accuracy": 0.8137751542031765, "num_tokens": 43752330.0, "step": 5700 }, { "entropy": 0.9262564107775688, "epoch": 0.8305454545454546, "grad_norm": 0.3278714418411255, "learning_rate": 5.673216047045637e-06, "loss": 0.9042, "mean_token_accuracy": 0.8133993491530418, "num_tokens": 43827542.0, "step": 5710 }, { "entropy": 0.9020561717450619, "epoch": 0.832, "grad_norm": 0.3041229844093323, "learning_rate": 5.581680983467746e-06, "loss": 0.8723, "mean_token_accuracy": 0.8194869726896286, "num_tokens": 43903331.0, "step": 5720 }, { "entropy": 0.9359213314950466, "epoch": 0.8334545454545454, "grad_norm": 0.33220741152763367, "learning_rate": 5.4908109939754605e-06, "loss": 0.9153, "mean_token_accuracy": 0.8136885397136211, "num_tokens": 43980944.0, "step": 5730 }, { "entropy": 0.9343759462237358, "epoch": 0.8349090909090909, "grad_norm": 0.31812480092048645, "learning_rate": 5.400609182857086e-06, "loss": 0.9269, "mean_token_accuracy": 0.8123717658221722, "num_tokens": 44059217.0, "step": 5740 }, { "entropy": 0.9189955502748489, "epoch": 0.8363636363636363, "grad_norm": 0.30972015857696533, "learning_rate": 5.31107863157473e-06, "loss": 0.9087, "mean_token_accuracy": 0.8125043779611587, "num_tokens": 44137764.0, "step": 5750 }, { "entropy": 0.9185071147978305, "epoch": 0.8378181818181818, "grad_norm": 0.30130535364151, "learning_rate": 5.2222223986589915e-06, "loss": 0.8974, "mean_token_accuracy": 0.815995067358017, "num_tokens": 44215864.0, "step": 5760 }, { "entropy": 0.9070168405771255, "epoch": 0.8392727272727273, "grad_norm": 0.33926618099212646, "learning_rate": 5.134043519604497e-06, "loss": 0.8987, "mean_token_accuracy": 0.8166046671569347, "num_tokens": 44291835.0, "step": 5770 }, { "entropy": 0.9173299342393875, "epoch": 0.8407272727272728, "grad_norm": 0.3847213089466095, "learning_rate": 5.046545006766206e-06, "loss": 0.9077, "mean_token_accuracy": 0.8146868884563446, "num_tokens": 44368202.0, "step": 5780 }, { "entropy": 0.9102527864277363, "epoch": 0.8421818181818181, "grad_norm": 0.36913734674453735, "learning_rate": 4.9597298492565064e-06, "loss": 0.9026, "mean_token_accuracy": 0.8161390721797943, "num_tokens": 44444116.0, "step": 5790 }, { "entropy": 0.9258656144142151, "epoch": 0.8436363636363636, "grad_norm": 0.31458625197410583, "learning_rate": 4.8736010128430825e-06, "loss": 0.9195, "mean_token_accuracy": 0.8141199484467506, "num_tokens": 44521118.0, "step": 5800 }, { "entropy": 0.933140229433775, "epoch": 0.8450909090909091, "grad_norm": 0.32843664288520813, "learning_rate": 4.788161439847618e-06, "loss": 0.9172, "mean_token_accuracy": 0.8115513384342193, "num_tokens": 44600130.0, "step": 5810 }, { "entropy": 0.9227162197232246, "epoch": 0.8465454545454546, "grad_norm": 0.3127104640007019, "learning_rate": 4.703414049045271e-06, "loss": 0.9023, "mean_token_accuracy": 0.8162086643278599, "num_tokens": 44677422.0, "step": 5820 }, { "entropy": 0.9307225309312344, "epoch": 0.848, "grad_norm": 0.3314415514469147, "learning_rate": 4.619361735564954e-06, "loss": 0.9228, "mean_token_accuracy": 0.8109805166721344, "num_tokens": 44756418.0, "step": 5830 }, { "entropy": 0.9122442126274108, "epoch": 0.8494545454545455, "grad_norm": 0.33934876322746277, "learning_rate": 4.536007370790463e-06, "loss": 0.8962, "mean_token_accuracy": 0.815778373926878, "num_tokens": 44833645.0, "step": 5840 }, { "entropy": 0.9105288550257683, "epoch": 0.850909090909091, "grad_norm": 0.31422221660614014, "learning_rate": 4.453353802262341e-06, "loss": 0.9018, "mean_token_accuracy": 0.817198246717453, "num_tokens": 44910482.0, "step": 5850 }, { "entropy": 0.8946401551365852, "epoch": 0.8523636363636363, "grad_norm": 0.3195045292377472, "learning_rate": 4.371403853580646e-06, "loss": 0.8744, "mean_token_accuracy": 0.820909558236599, "num_tokens": 44983955.0, "step": 5860 }, { "entropy": 0.8876437328755855, "epoch": 0.8538181818181818, "grad_norm": 0.39258408546447754, "learning_rate": 4.290160324308453e-06, "loss": 0.8768, "mean_token_accuracy": 0.8214518509805202, "num_tokens": 45056876.0, "step": 5870 }, { "entropy": 0.9040459990501404, "epoch": 0.8552727272727273, "grad_norm": 0.31693005561828613, "learning_rate": 4.2096259898762484e-06, "loss": 0.8934, "mean_token_accuracy": 0.816833870112896, "num_tokens": 45132382.0, "step": 5880 }, { "entropy": 0.9187272481620312, "epoch": 0.8567272727272728, "grad_norm": 0.3108614385128021, "learning_rate": 4.129803601487085e-06, "loss": 0.9093, "mean_token_accuracy": 0.8157303839921951, "num_tokens": 45207136.0, "step": 5890 }, { "entropy": 0.9228496827185154, "epoch": 0.8581818181818182, "grad_norm": 0.31431129574775696, "learning_rate": 4.05069588602262e-06, "loss": 0.9211, "mean_token_accuracy": 0.8127873703837395, "num_tokens": 45284545.0, "step": 5900 }, { "entropy": 0.9108579710125924, "epoch": 0.8596363636363636, "grad_norm": 0.35750770568847656, "learning_rate": 3.972305545949937e-06, "loss": 0.9018, "mean_token_accuracy": 0.8170554347336292, "num_tokens": 45360575.0, "step": 5910 }, { "entropy": 0.9355661682784557, "epoch": 0.8610909090909091, "grad_norm": 0.36121928691864014, "learning_rate": 3.894635259229265e-06, "loss": 0.9268, "mean_token_accuracy": 0.8105575621128083, "num_tokens": 45439579.0, "step": 5920 }, { "entropy": 0.961587718129158, "epoch": 0.8625454545454545, "grad_norm": 0.31216803193092346, "learning_rate": 3.817687679222442e-06, "loss": 0.9521, "mean_token_accuracy": 0.807161021232605, "num_tokens": 45522968.0, "step": 5930 }, { "entropy": 0.9307756863534451, "epoch": 0.864, "grad_norm": 0.34104517102241516, "learning_rate": 3.741465434602306e-06, "loss": 0.9165, "mean_token_accuracy": 0.814553914219141, "num_tokens": 45598073.0, "step": 5940 }, { "entropy": 0.9234868161380291, "epoch": 0.8654545454545455, "grad_norm": 0.34115663170814514, "learning_rate": 3.6659711292628956e-06, "loss": 0.9063, "mean_token_accuracy": 0.8158062770962715, "num_tokens": 45675032.0, "step": 5950 }, { "entropy": 0.9477932959794998, "epoch": 0.866909090909091, "grad_norm": 0.3255559504032135, "learning_rate": 3.5912073422304626e-06, "loss": 0.9264, "mean_token_accuracy": 0.8109208598732949, "num_tokens": 45753692.0, "step": 5960 }, { "entropy": 0.9064127787947655, "epoch": 0.8683636363636363, "grad_norm": 0.3285483419895172, "learning_rate": 3.5171766275754187e-06, "loss": 0.8953, "mean_token_accuracy": 0.8159914433956146, "num_tokens": 45831343.0, "step": 5970 }, { "entropy": 0.9151718072593212, "epoch": 0.8698181818181818, "grad_norm": 0.31288042664527893, "learning_rate": 3.4438815143250314e-06, "loss": 0.8918, "mean_token_accuracy": 0.8162871718406677, "num_tokens": 45907964.0, "step": 5980 }, { "entropy": 0.9252648554742336, "epoch": 0.8712727272727273, "grad_norm": 0.37754347920417786, "learning_rate": 3.3713245063770745e-06, "loss": 0.9441, "mean_token_accuracy": 0.8124652244150639, "num_tokens": 45984483.0, "step": 5990 }, { "entropy": 0.897750299423933, "epoch": 0.8727272727272727, "grad_norm": 0.33970126509666443, "learning_rate": 3.2995080824142425e-06, "loss": 0.8851, "mean_token_accuracy": 0.819002702832222, "num_tokens": 46061634.0, "step": 6000 }, { "epoch": 0.8727272727272727, "eval_entropy": 0.9209443353652954, "eval_loss": 0.8987749218940735, "eval_mean_token_accuracy": 0.8116296404838562, "eval_num_tokens": 46061634.0, "eval_runtime": 77.8817, "eval_samples_per_second": 64.2, "eval_steps_per_second": 8.025, "step": 6000 }, { "entropy": 0.9322944730520248, "epoch": 0.8741818181818182, "grad_norm": 0.3368423283100128, "learning_rate": 3.228434695819528e-06, "loss": 0.9194, "mean_token_accuracy": 0.8112942822277546, "num_tokens": 46139299.0, "step": 6010 }, { "entropy": 0.9085685111582279, "epoch": 0.8756363636363637, "grad_norm": 0.3252302408218384, "learning_rate": 3.15810677459236e-06, "loss": 0.8893, "mean_token_accuracy": 0.8170065075159073, "num_tokens": 46215455.0, "step": 6020 }, { "entropy": 0.9145600602030755, "epoch": 0.8770909090909091, "grad_norm": 0.3287157416343689, "learning_rate": 3.0885267212656892e-06, "loss": 0.9011, "mean_token_accuracy": 0.8160723358392715, "num_tokens": 46291495.0, "step": 6030 }, { "entropy": 0.9285273037850856, "epoch": 0.8785454545454545, "grad_norm": 0.31994038820266724, "learning_rate": 3.019696912823903e-06, "loss": 0.9203, "mean_token_accuracy": 0.8141358248889446, "num_tokens": 46370221.0, "step": 6040 }, { "entropy": 0.9345873408019543, "epoch": 0.88, "grad_norm": 0.37476661801338196, "learning_rate": 2.9516197006216194e-06, "loss": 0.9389, "mean_token_accuracy": 0.8111633822321892, "num_tokens": 46449245.0, "step": 6050 }, { "entropy": 0.9355661444365978, "epoch": 0.8814545454545455, "grad_norm": 0.3263081908226013, "learning_rate": 2.8842974103033773e-06, "loss": 0.9157, "mean_token_accuracy": 0.8130726262927055, "num_tokens": 46524841.0, "step": 6060 }, { "entropy": 0.9101524129509926, "epoch": 0.8829090909090909, "grad_norm": 0.3230786919593811, "learning_rate": 2.817732341724158e-06, "loss": 0.8942, "mean_token_accuracy": 0.8166044473648071, "num_tokens": 46598955.0, "step": 6070 }, { "entropy": 0.9097373388707638, "epoch": 0.8843636363636364, "grad_norm": 0.3022027611732483, "learning_rate": 2.7519267688708604e-06, "loss": 0.898, "mean_token_accuracy": 0.8170449204742909, "num_tokens": 46674399.0, "step": 6080 }, { "entropy": 0.9250694133341313, "epoch": 0.8858181818181818, "grad_norm": 0.34704554080963135, "learning_rate": 2.6868829397845656e-06, "loss": 0.9124, "mean_token_accuracy": 0.8141155697405338, "num_tokens": 46752826.0, "step": 6090 }, { "entropy": 0.9141334019601345, "epoch": 0.8872727272727273, "grad_norm": 0.338782399892807, "learning_rate": 2.6226030764837945e-06, "loss": 0.9261, "mean_token_accuracy": 0.8140919879078865, "num_tokens": 46828411.0, "step": 6100 }, { "entropy": 0.9200235098600388, "epoch": 0.8887272727272727, "grad_norm": 0.33723023533821106, "learning_rate": 2.559089374888545e-06, "loss": 0.9096, "mean_token_accuracy": 0.8156822443008422, "num_tokens": 46904972.0, "step": 6110 }, { "entropy": 0.9146118760108948, "epoch": 0.8901818181818182, "grad_norm": 0.31707334518432617, "learning_rate": 2.496344004745324e-06, "loss": 0.8998, "mean_token_accuracy": 0.816555169224739, "num_tokens": 46981629.0, "step": 6120 }, { "entropy": 0.9358232043683529, "epoch": 0.8916363636363637, "grad_norm": 0.31498560309410095, "learning_rate": 2.434369109552993e-06, "loss": 0.919, "mean_token_accuracy": 0.8128682546317577, "num_tokens": 47058559.0, "step": 6130 }, { "entropy": 0.9056357733905316, "epoch": 0.893090909090909, "grad_norm": 0.353083997964859, "learning_rate": 2.373166806489546e-06, "loss": 0.89, "mean_token_accuracy": 0.8196616470813751, "num_tokens": 47133139.0, "step": 6140 }, { "entropy": 0.9217743061482906, "epoch": 0.8945454545454545, "grad_norm": 0.3720227777957916, "learning_rate": 2.312739186339809e-06, "loss": 0.9191, "mean_token_accuracy": 0.8154807358980178, "num_tokens": 47208884.0, "step": 6150 }, { "entropy": 0.9359294772148132, "epoch": 0.896, "grad_norm": 0.3200484812259674, "learning_rate": 2.2530883134239742e-06, "loss": 0.9249, "mean_token_accuracy": 0.8138979524374008, "num_tokens": 47284079.0, "step": 6160 }, { "entropy": 0.9157271198928356, "epoch": 0.8974545454545455, "grad_norm": 0.30511274933815, "learning_rate": 2.1942162255271132e-06, "loss": 0.9046, "mean_token_accuracy": 0.8142931953072547, "num_tokens": 47359251.0, "step": 6170 }, { "entropy": 0.9222023263573647, "epoch": 0.8989090909090909, "grad_norm": 0.3218860924243927, "learning_rate": 2.1361249338295327e-06, "loss": 0.9076, "mean_token_accuracy": 0.8148991748690605, "num_tokens": 47435112.0, "step": 6180 }, { "entropy": 0.9072126895189285, "epoch": 0.9003636363636364, "grad_norm": 0.3221643567085266, "learning_rate": 2.078816422838109e-06, "loss": 0.8986, "mean_token_accuracy": 0.8161638289690017, "num_tokens": 47510845.0, "step": 6190 }, { "entropy": 0.9256663709878922, "epoch": 0.9018181818181819, "grad_norm": 0.311989426612854, "learning_rate": 2.022292650318451e-06, "loss": 0.9365, "mean_token_accuracy": 0.8134777262806893, "num_tokens": 47588720.0, "step": 6200 }, { "entropy": 0.9273410558700561, "epoch": 0.9032727272727272, "grad_norm": 0.31235963106155396, "learning_rate": 1.966555547228044e-06, "loss": 0.9101, "mean_token_accuracy": 0.8141037151217461, "num_tokens": 47666849.0, "step": 6210 }, { "entropy": 0.920647069811821, "epoch": 0.9047272727272727, "grad_norm": 0.3313010632991791, "learning_rate": 1.9116070176502807e-06, "loss": 0.9013, "mean_token_accuracy": 0.8138377077877521, "num_tokens": 47743639.0, "step": 6220 }, { "entropy": 0.9163322940468788, "epoch": 0.9061818181818182, "grad_norm": 0.31483882665634155, "learning_rate": 1.8574489387294034e-06, "loss": 0.907, "mean_token_accuracy": 0.8146905891597271, "num_tokens": 47821434.0, "step": 6230 }, { "entropy": 0.9224201649427414, "epoch": 0.9076363636363637, "grad_norm": 0.30767881870269775, "learning_rate": 1.8040831606063967e-06, "loss": 0.9118, "mean_token_accuracy": 0.8155392311513424, "num_tokens": 47899203.0, "step": 6240 }, { "entropy": 0.8979198761284352, "epoch": 0.9090909090909091, "grad_norm": 0.310153603553772, "learning_rate": 1.7515115063557652e-06, "loss": 0.8839, "mean_token_accuracy": 0.819090685993433, "num_tokens": 47972742.0, "step": 6250 }, { "entropy": 0.9100939020514488, "epoch": 0.9105454545454545, "grad_norm": 0.34032052755355835, "learning_rate": 1.6997357719232662e-06, "loss": 0.8999, "mean_token_accuracy": 0.8160591490566731, "num_tokens": 48049075.0, "step": 6260 }, { "entropy": 0.9030675068497658, "epoch": 0.912, "grad_norm": 0.32921066880226135, "learning_rate": 1.6487577260645411e-06, "loss": 0.8838, "mean_token_accuracy": 0.8187085382640362, "num_tokens": 48126883.0, "step": 6270 }, { "entropy": 0.9277480982244015, "epoch": 0.9134545454545454, "grad_norm": 0.3190605938434601, "learning_rate": 1.5985791102847185e-06, "loss": 0.9225, "mean_token_accuracy": 0.8141351498663425, "num_tokens": 48203971.0, "step": 6280 }, { "entropy": 0.9353076785802841, "epoch": 0.9149090909090909, "grad_norm": 0.303288996219635, "learning_rate": 1.5492016387788944e-06, "loss": 0.9444, "mean_token_accuracy": 0.8119538478553295, "num_tokens": 48282198.0, "step": 6290 }, { "entropy": 0.9261584036052227, "epoch": 0.9163636363636364, "grad_norm": 0.32700851559638977, "learning_rate": 1.5006269983735794e-06, "loss": 0.9153, "mean_token_accuracy": 0.812885682284832, "num_tokens": 48360686.0, "step": 6300 }, { "entropy": 0.9366669520735741, "epoch": 0.9178181818181819, "grad_norm": 0.33134371042251587, "learning_rate": 1.4528568484690765e-06, "loss": 0.9374, "mean_token_accuracy": 0.8110633857548237, "num_tokens": 48438891.0, "step": 6310 }, { "entropy": 0.9129975132644177, "epoch": 0.9192727272727272, "grad_norm": 0.3131563067436218, "learning_rate": 1.4058928209828066e-06, "loss": 0.9163, "mean_token_accuracy": 0.8145956374704838, "num_tokens": 48516417.0, "step": 6320 }, { "entropy": 0.9178128764033318, "epoch": 0.9207272727272727, "grad_norm": 0.3282724916934967, "learning_rate": 1.3597365202935283e-06, "loss": 0.8925, "mean_token_accuracy": 0.8164288327097893, "num_tokens": 48591332.0, "step": 6330 }, { "entropy": 0.9109235092997551, "epoch": 0.9221818181818182, "grad_norm": 0.30869513750076294, "learning_rate": 1.3143895231865565e-06, "loss": 0.8895, "mean_token_accuracy": 0.8177370443940163, "num_tokens": 48665701.0, "step": 6340 }, { "entropy": 0.9241031289100647, "epoch": 0.9236363636363636, "grad_norm": 0.36920541524887085, "learning_rate": 1.2698533787998822e-06, "loss": 0.9163, "mean_token_accuracy": 0.8146472811698914, "num_tokens": 48742926.0, "step": 6350 }, { "entropy": 0.9276870623230934, "epoch": 0.9250909090909091, "grad_norm": 0.3207862377166748, "learning_rate": 1.2261296085712583e-06, "loss": 0.9151, "mean_token_accuracy": 0.8119709461927413, "num_tokens": 48822553.0, "step": 6360 }, { "entropy": 0.925787340849638, "epoch": 0.9265454545454546, "grad_norm": 0.31634289026260376, "learning_rate": 1.1832197061862213e-06, "loss": 0.9126, "mean_token_accuracy": 0.8139682069420815, "num_tokens": 48901887.0, "step": 6370 }, { "entropy": 0.9347988933324813, "epoch": 0.928, "grad_norm": 0.3287469446659088, "learning_rate": 1.1411251375270554e-06, "loss": 0.9197, "mean_token_accuracy": 0.8132240571081638, "num_tokens": 48979966.0, "step": 6380 }, { "entropy": 0.9178888291120529, "epoch": 0.9294545454545454, "grad_norm": 0.33060967922210693, "learning_rate": 1.099847340622741e-06, "loss": 0.9089, "mean_token_accuracy": 0.8142723865807057, "num_tokens": 49057484.0, "step": 6390 }, { "entropy": 0.9371354281902313, "epoch": 0.9309090909090909, "grad_norm": 0.31378334760665894, "learning_rate": 1.0593877255997946e-06, "loss": 0.9311, "mean_token_accuracy": 0.812279848754406, "num_tokens": 49137700.0, "step": 6400 }, { "entropy": 0.917350922524929, "epoch": 0.9323636363636364, "grad_norm": 0.30465006828308105, "learning_rate": 1.0197476746341303e-06, "loss": 0.9027, "mean_token_accuracy": 0.8145864970982075, "num_tokens": 49214269.0, "step": 6410 }, { "entropy": 0.9150080628693104, "epoch": 0.9338181818181818, "grad_norm": 0.3422051966190338, "learning_rate": 9.8092854190381e-07, "loss": 0.9056, "mean_token_accuracy": 0.813194676488638, "num_tokens": 49290198.0, "step": 6420 }, { "entropy": 0.9078165777027607, "epoch": 0.9352727272727273, "grad_norm": 0.3076263964176178, "learning_rate": 9.429316535428057e-07, "loss": 0.8903, "mean_token_accuracy": 0.8160121709108352, "num_tokens": 49368361.0, "step": 6430 }, { "entropy": 0.9192823156714439, "epoch": 0.9367272727272727, "grad_norm": 0.32441800832748413, "learning_rate": 9.057583075956887e-07, "loss": 0.901, "mean_token_accuracy": 0.8145803168416024, "num_tokens": 49445497.0, "step": 6440 }, { "entropy": 0.9385962396860122, "epoch": 0.9381818181818182, "grad_norm": 0.34090206027030945, "learning_rate": 8.694097739732798e-07, "loss": 0.9291, "mean_token_accuracy": 0.8106141477823258, "num_tokens": 49523114.0, "step": 6450 }, { "entropy": 0.9091130934655667, "epoch": 0.9396363636363636, "grad_norm": 0.3067343831062317, "learning_rate": 8.338872944092852e-07, "loss": 0.8978, "mean_token_accuracy": 0.8167271681129933, "num_tokens": 49599066.0, "step": 6460 }, { "entropy": 0.923352313041687, "epoch": 0.9410909090909091, "grad_norm": 0.34588825702667236, "learning_rate": 7.991920824178455e-07, "loss": 0.908, "mean_token_accuracy": 0.812999901920557, "num_tokens": 49676403.0, "step": 6470 }, { "entropy": 0.9061731100082397, "epoch": 0.9425454545454546, "grad_norm": 0.3114166855812073, "learning_rate": 7.653253232521162e-07, "loss": 0.8886, "mean_token_accuracy": 0.8181905202567578, "num_tokens": 49748740.0, "step": 6480 }, { "entropy": 0.9442753471434117, "epoch": 0.944, "grad_norm": 0.3027520477771759, "learning_rate": 7.322881738637479e-07, "loss": 0.9392, "mean_token_accuracy": 0.8092067658901214, "num_tokens": 49828347.0, "step": 6490 }, { "entropy": 0.909515468031168, "epoch": 0.9454545454545454, "grad_norm": 0.31182175874710083, "learning_rate": 7.000817628633776e-07, "loss": 0.9053, "mean_token_accuracy": 0.8153221309185028, "num_tokens": 49905096.0, "step": 6500 }, { "entropy": 0.9085680104792118, "epoch": 0.9469090909090909, "grad_norm": 0.33979618549346924, "learning_rate": 6.687071904820677e-07, "loss": 0.8953, "mean_token_accuracy": 0.8190076671540737, "num_tokens": 49981386.0, "step": 6510 }, { "entropy": 0.9074861466884613, "epoch": 0.9483636363636364, "grad_norm": 0.3361256420612335, "learning_rate": 6.381655285337279e-07, "loss": 0.8951, "mean_token_accuracy": 0.816261338442564, "num_tokens": 50057245.0, "step": 6520 }, { "entropy": 0.9325119577348232, "epoch": 0.9498181818181818, "grad_norm": 0.36365851759910583, "learning_rate": 6.084578203784874e-07, "loss": 0.9214, "mean_token_accuracy": 0.8115631319582463, "num_tokens": 50133281.0, "step": 6530 }, { "entropy": 0.9262050181627274, "epoch": 0.9512727272727273, "grad_norm": 0.31893861293792725, "learning_rate": 5.795850808870589e-07, "loss": 0.9183, "mean_token_accuracy": 0.8127511434257031, "num_tokens": 50209580.0, "step": 6540 }, { "entropy": 0.9360543221235276, "epoch": 0.9527272727272728, "grad_norm": 0.3180423974990845, "learning_rate": 5.515482964060745e-07, "loss": 0.937, "mean_token_accuracy": 0.8129704773426056, "num_tokens": 50285252.0, "step": 6550 }, { "entropy": 0.9206071726977825, "epoch": 0.9541818181818181, "grad_norm": 0.3428179621696472, "learning_rate": 5.243484247243779e-07, "loss": 0.9134, "mean_token_accuracy": 0.8148298509418964, "num_tokens": 50362033.0, "step": 6560 }, { "entropy": 0.9003576777875424, "epoch": 0.9556363636363636, "grad_norm": 0.31086480617523193, "learning_rate": 4.979863950403129e-07, "loss": 0.8885, "mean_token_accuracy": 0.8173546336591244, "num_tokens": 50436962.0, "step": 6570 }, { "entropy": 0.9236943081021309, "epoch": 0.9570909090909091, "grad_norm": 0.31479397416114807, "learning_rate": 4.7246310792997683e-07, "loss": 0.9093, "mean_token_accuracy": 0.8160760276019573, "num_tokens": 50513406.0, "step": 6580 }, { "entropy": 0.934125005453825, "epoch": 0.9585454545454546, "grad_norm": 0.3748307526111603, "learning_rate": 4.4777943531646196e-07, "loss": 0.9291, "mean_token_accuracy": 0.8114527925848961, "num_tokens": 50591962.0, "step": 6590 }, { "entropy": 0.9182382963597775, "epoch": 0.96, "grad_norm": 0.3080226480960846, "learning_rate": 4.2393622044005333e-07, "loss": 0.9065, "mean_token_accuracy": 0.8157414674758912, "num_tokens": 50668724.0, "step": 6600 }, { "entropy": 0.9102472327649593, "epoch": 0.9614545454545455, "grad_norm": 0.3206920325756073, "learning_rate": 4.0093427782944265e-07, "loss": 0.9043, "mean_token_accuracy": 0.8165704101324082, "num_tokens": 50744450.0, "step": 6610 }, { "entropy": 0.927041707187891, "epoch": 0.9629090909090909, "grad_norm": 0.3061367869377136, "learning_rate": 3.787743932738898e-07, "loss": 0.906, "mean_token_accuracy": 0.8148591019213199, "num_tokens": 50821886.0, "step": 6620 }, { "entropy": 0.9167927749454975, "epoch": 0.9643636363636363, "grad_norm": 0.3160494565963745, "learning_rate": 3.5745732379637053e-07, "loss": 0.8901, "mean_token_accuracy": 0.8175670191645622, "num_tokens": 50897361.0, "step": 6630 }, { "entropy": 0.91978540122509, "epoch": 0.9658181818181818, "grad_norm": 0.31838276982307434, "learning_rate": 3.369837976277431e-07, "loss": 0.9123, "mean_token_accuracy": 0.8131505504250527, "num_tokens": 50976682.0, "step": 6640 }, { "entropy": 0.9417281582951545, "epoch": 0.9672727272727273, "grad_norm": 0.3298901915550232, "learning_rate": 3.173545141818379e-07, "loss": 0.9281, "mean_token_accuracy": 0.8116386346518993, "num_tokens": 51053043.0, "step": 6650 }, { "entropy": 0.9071712777018547, "epoch": 0.9687272727272728, "grad_norm": 0.31101104617118835, "learning_rate": 2.9857014403158787e-07, "loss": 0.9025, "mean_token_accuracy": 0.816408134251833, "num_tokens": 51129073.0, "step": 6660 }, { "entropy": 0.9059986241161824, "epoch": 0.9701818181818181, "grad_norm": 0.30451127886772156, "learning_rate": 2.8063132888611017e-07, "loss": 0.8866, "mean_token_accuracy": 0.8188144057989121, "num_tokens": 51203044.0, "step": 6670 }, { "entropy": 0.9010291390120984, "epoch": 0.9716363636363636, "grad_norm": 0.31770607829093933, "learning_rate": 2.6353868156878635e-07, "loss": 0.8896, "mean_token_accuracy": 0.8195660427212715, "num_tokens": 51277927.0, "step": 6680 }, { "entropy": 0.9211806155741215, "epoch": 0.9730909090909091, "grad_norm": 0.30818912386894226, "learning_rate": 2.472927859963272e-07, "loss": 0.9006, "mean_token_accuracy": 0.8144206136465073, "num_tokens": 51355111.0, "step": 6690 }, { "entropy": 0.9047483175992965, "epoch": 0.9745454545454545, "grad_norm": 0.3617713153362274, "learning_rate": 2.3189419715881735e-07, "loss": 0.8907, "mean_token_accuracy": 0.8167600952088833, "num_tokens": 51430620.0, "step": 6700 }, { "entropy": 0.8989372082054615, "epoch": 0.976, "grad_norm": 0.31459614634513855, "learning_rate": 2.173434411007767e-07, "loss": 0.8799, "mean_token_accuracy": 0.8186790086328983, "num_tokens": 51504902.0, "step": 6710 }, { "entropy": 0.9168683797121048, "epoch": 0.9774545454545455, "grad_norm": 0.33197900652885437, "learning_rate": 2.036410149031669e-07, "loss": 0.8963, "mean_token_accuracy": 0.8159121349453926, "num_tokens": 51579884.0, "step": 6720 }, { "entropy": 0.9148142851889134, "epoch": 0.978909090909091, "grad_norm": 0.3526170551776886, "learning_rate": 1.907873866664188e-07, "loss": 0.8994, "mean_token_accuracy": 0.8167805947363377, "num_tokens": 51655972.0, "step": 6730 }, { "entropy": 0.8993205860257149, "epoch": 0.9803636363636363, "grad_norm": 0.3287599980831146, "learning_rate": 1.7878299549444739e-07, "loss": 0.8829, "mean_token_accuracy": 0.8196272850036621, "num_tokens": 51733439.0, "step": 6740 }, { "entropy": 0.9057880103588104, "epoch": 0.9818181818181818, "grad_norm": 0.30253535509109497, "learning_rate": 1.6762825147964345e-07, "loss": 0.8909, "mean_token_accuracy": 0.818729893118143, "num_tokens": 51807602.0, "step": 6750 }, { "entropy": 0.9042447462677956, "epoch": 0.9832727272727273, "grad_norm": 0.32170674204826355, "learning_rate": 1.5732353568886325e-07, "loss": 0.8988, "mean_token_accuracy": 0.8172514781355857, "num_tokens": 51882868.0, "step": 6760 }, { "entropy": 0.9321618229150772, "epoch": 0.9847272727272727, "grad_norm": 0.33762219548225403, "learning_rate": 1.4786920015042024e-07, "loss": 0.9191, "mean_token_accuracy": 0.812790434062481, "num_tokens": 51960042.0, "step": 6770 }, { "entropy": 0.9293069154024124, "epoch": 0.9861818181818182, "grad_norm": 0.318977952003479, "learning_rate": 1.3926556784204404e-07, "loss": 0.921, "mean_token_accuracy": 0.8137647397816181, "num_tokens": 52035665.0, "step": 6780 }, { "entropy": 0.9178681053221226, "epoch": 0.9876363636363636, "grad_norm": 0.339473694562912, "learning_rate": 1.3151293267986418e-07, "loss": 0.9104, "mean_token_accuracy": 0.8139139614999295, "num_tokens": 52111485.0, "step": 6790 }, { "entropy": 0.9090309455990792, "epoch": 0.9890909090909091, "grad_norm": 0.31843292713165283, "learning_rate": 1.2461155950835192e-07, "loss": 0.9014, "mean_token_accuracy": 0.8167950376868248, "num_tokens": 52188521.0, "step": 6800 }, { "entropy": 0.9286883376538754, "epoch": 0.9905454545454545, "grad_norm": 0.3196488320827484, "learning_rate": 1.1856168409129034e-07, "loss": 0.922, "mean_token_accuracy": 0.8129499651491642, "num_tokens": 52264651.0, "step": 6810 }, { "entropy": 0.9294882476329803, "epoch": 0.992, "grad_norm": 0.3718339502811432, "learning_rate": 1.1336351310370239e-07, "loss": 0.9114, "mean_token_accuracy": 0.8124035835266114, "num_tokens": 52341010.0, "step": 6820 }, { "entropy": 0.9305678024888039, "epoch": 0.9934545454545455, "grad_norm": 0.34219232201576233, "learning_rate": 1.0901722412480678e-07, "loss": 0.9258, "mean_token_accuracy": 0.8104947313666344, "num_tokens": 52419005.0, "step": 6830 }, { "entropy": 0.9108941599726676, "epoch": 0.9949090909090909, "grad_norm": 0.32488080859184265, "learning_rate": 1.0552296563194055e-07, "loss": 0.899, "mean_token_accuracy": 0.8151013270020485, "num_tokens": 52497112.0, "step": 6840 }, { "entropy": 0.9331740163266659, "epoch": 0.9963636363636363, "grad_norm": 0.31630396842956543, "learning_rate": 1.0288085699548733e-07, "loss": 0.9185, "mean_token_accuracy": 0.8122143365442753, "num_tokens": 52575897.0, "step": 6850 }, { "entropy": 0.9373132646083832, "epoch": 0.9978181818181818, "grad_norm": 0.3261500895023346, "learning_rate": 1.01090988474808e-07, "loss": 0.929, "mean_token_accuracy": 0.812446454167366, "num_tokens": 52653425.0, "step": 6860 }, { "entropy": 0.9317662589251995, "epoch": 0.9992727272727273, "grad_norm": 0.32642170786857605, "learning_rate": 1.0015342121514953e-07, "loss": 0.9138, "mean_token_accuracy": 0.8126379199326038, "num_tokens": 52733879.0, "step": 6870 } ], "logging_steps": 10, "max_steps": 6875, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.344753466386416e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }