{ "best_global_step": 14000, "best_metric": 0.2339961975812912, "best_model_checkpoint": "/output/checkpoint-14000", "epoch": 1.0, "eval_steps": 1000, "global_step": 14973, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.9760674737393855, "epoch": 0.0006678967097738335, "grad_norm": 1.4888298511505127, "learning_rate": 3.0000000000000004e-07, "loss": 0.5752, "mean_token_accuracy": 0.8778422638773918, "num_tokens": 73872.0, "step": 10 }, { "entropy": 1.9662065237760544, "epoch": 0.001335793419547667, "grad_norm": 1.5005749464035034, "learning_rate": 6.333333333333333e-07, "loss": 0.584, "mean_token_accuracy": 0.8795657966285944, "num_tokens": 149660.0, "step": 20 }, { "entropy": 1.9851406954228878, "epoch": 0.0020036901293215004, "grad_norm": 1.6113650798797607, "learning_rate": 9.666666666666668e-07, "loss": 0.583, "mean_token_accuracy": 0.875131793692708, "num_tokens": 224839.0, "step": 30 }, { "entropy": 1.9667830072343349, "epoch": 0.002671586839095334, "grad_norm": 1.4257019758224487, "learning_rate": 1.3e-06, "loss": 0.5784, "mean_token_accuracy": 0.8770494349300861, "num_tokens": 299436.0, "step": 40 }, { "entropy": 1.9775025263428687, "epoch": 0.0033394835488691674, "grad_norm": 1.5861653089523315, "learning_rate": 1.6333333333333333e-06, "loss": 0.5535, "mean_token_accuracy": 0.877307004109025, "num_tokens": 371307.0, "step": 50 }, { "entropy": 1.9649440452456475, "epoch": 0.004007380258643001, "grad_norm": 1.2340285778045654, "learning_rate": 1.9666666666666668e-06, "loss": 0.5128, "mean_token_accuracy": 0.8859475124627352, "num_tokens": 445488.0, "step": 60 }, { "entropy": 1.9546820975840091, "epoch": 0.0046752769684168345, "grad_norm": 0.6933176517486572, "learning_rate": 2.3e-06, "loss": 0.4616, "mean_token_accuracy": 0.9024042788892984, "num_tokens": 519666.0, "step": 70 }, { "entropy": 1.966797484457493, "epoch": 0.005343173678190668, "grad_norm": 0.5129616260528564, "learning_rate": 2.6333333333333337e-06, "loss": 0.4088, "mean_token_accuracy": 0.9164085119962693, "num_tokens": 596205.0, "step": 80 }, { "entropy": 1.9509434498846532, "epoch": 0.006011070387964501, "grad_norm": 0.5326862335205078, "learning_rate": 2.966666666666667e-06, "loss": 0.3999, "mean_token_accuracy": 0.9183030348271132, "num_tokens": 669801.0, "step": 90 }, { "entropy": 1.9310075022280215, "epoch": 0.006678967097738335, "grad_norm": 0.44036024808883667, "learning_rate": 3.3e-06, "loss": 0.3727, "mean_token_accuracy": 0.9235392130911351, "num_tokens": 743229.0, "step": 100 }, { "entropy": 1.9586247511208057, "epoch": 0.007346863807512169, "grad_norm": 0.38791316747665405, "learning_rate": 3.633333333333334e-06, "loss": 0.3721, "mean_token_accuracy": 0.9228693630546332, "num_tokens": 818798.0, "step": 110 }, { "entropy": 1.9791630908846856, "epoch": 0.008014760517286001, "grad_norm": 0.38443174958229065, "learning_rate": 3.966666666666667e-06, "loss": 0.3739, "mean_token_accuracy": 0.9218462239950895, "num_tokens": 891493.0, "step": 120 }, { "entropy": 1.9667378969490528, "epoch": 0.008682657227059834, "grad_norm": 0.4603234827518463, "learning_rate": 4.2999999999999995e-06, "loss": 0.3531, "mean_token_accuracy": 0.9221717469394207, "num_tokens": 967318.0, "step": 130 }, { "entropy": 1.958837092667818, "epoch": 0.009350553936833669, "grad_norm": 0.4569478929042816, "learning_rate": 4.633333333333334e-06, "loss": 0.3269, "mean_token_accuracy": 0.9262894965708256, "num_tokens": 1044796.0, "step": 140 }, { "entropy": 1.9429421983659267, "epoch": 0.010018450646607502, "grad_norm": 0.3992716670036316, "learning_rate": 4.966666666666667e-06, "loss": 0.3248, "mean_token_accuracy": 0.9276390682905913, "num_tokens": 1120596.0, "step": 150 }, { "entropy": 1.9479005947709083, "epoch": 0.010686347356381336, "grad_norm": 0.5025230646133423, "learning_rate": 5.3e-06, "loss": 0.3388, "mean_token_accuracy": 0.9234297219663858, "num_tokens": 1195637.0, "step": 160 }, { "entropy": 1.9376395657658576, "epoch": 0.01135424406615517, "grad_norm": 0.39437243342399597, "learning_rate": 5.633333333333333e-06, "loss": 0.3201, "mean_token_accuracy": 0.9296781037002801, "num_tokens": 1270664.0, "step": 170 }, { "entropy": 1.906531110405922, "epoch": 0.012022140775929002, "grad_norm": 0.5597942471504211, "learning_rate": 5.9666666666666666e-06, "loss": 0.3072, "mean_token_accuracy": 0.9306742526590824, "num_tokens": 1346257.0, "step": 180 }, { "entropy": 1.9218647584319115, "epoch": 0.012690037485702837, "grad_norm": 0.4542200267314911, "learning_rate": 6.300000000000001e-06, "loss": 0.3236, "mean_token_accuracy": 0.9245744608342648, "num_tokens": 1420995.0, "step": 190 }, { "entropy": 1.9272994086146356, "epoch": 0.01335793419547667, "grad_norm": 0.48947060108184814, "learning_rate": 6.633333333333333e-06, "loss": 0.3015, "mean_token_accuracy": 0.9292313981801271, "num_tokens": 1494673.0, "step": 200 }, { "entropy": 1.907231931388378, "epoch": 0.014025830905250503, "grad_norm": 0.43454205989837646, "learning_rate": 6.966666666666667e-06, "loss": 0.2854, "mean_token_accuracy": 0.9343169935047626, "num_tokens": 1571582.0, "step": 210 }, { "entropy": 1.921570435166359, "epoch": 0.014693727615024337, "grad_norm": 2.662630081176758, "learning_rate": 7.2999999999999996e-06, "loss": 0.2966, "mean_token_accuracy": 0.9321486636996269, "num_tokens": 1647109.0, "step": 220 }, { "entropy": 1.9276616074144841, "epoch": 0.01536162432479817, "grad_norm": 0.8096469640731812, "learning_rate": 7.633333333333334e-06, "loss": 0.307, "mean_token_accuracy": 0.9320836074650287, "num_tokens": 1721663.0, "step": 230 }, { "entropy": 1.9333215937018395, "epoch": 0.016029521034572003, "grad_norm": 0.39333871006965637, "learning_rate": 7.966666666666666e-06, "loss": 0.2976, "mean_token_accuracy": 0.9332765292376279, "num_tokens": 1796477.0, "step": 240 }, { "entropy": 1.95228513777256, "epoch": 0.016697417744345838, "grad_norm": 0.42003384232521057, "learning_rate": 8.3e-06, "loss": 0.3032, "mean_token_accuracy": 0.9320260498672723, "num_tokens": 1872998.0, "step": 250 }, { "entropy": 1.9603711016476155, "epoch": 0.01736531445411967, "grad_norm": 0.3542785942554474, "learning_rate": 8.633333333333334e-06, "loss": 0.2961, "mean_token_accuracy": 0.9334841158241034, "num_tokens": 1948525.0, "step": 260 }, { "entropy": 1.9958221301436425, "epoch": 0.018033211163893503, "grad_norm": 0.5043424963951111, "learning_rate": 8.966666666666668e-06, "loss": 0.3278, "mean_token_accuracy": 0.927190800011158, "num_tokens": 2024886.0, "step": 270 }, { "entropy": 1.9348272271454334, "epoch": 0.018701107873667338, "grad_norm": 0.4625996947288513, "learning_rate": 9.3e-06, "loss": 0.3055, "mean_token_accuracy": 0.9334663469344378, "num_tokens": 2098633.0, "step": 280 }, { "entropy": 1.9415634967386723, "epoch": 0.019369004583441173, "grad_norm": 0.5108323693275452, "learning_rate": 9.633333333333335e-06, "loss": 0.3031, "mean_token_accuracy": 0.9323569741100073, "num_tokens": 2174388.0, "step": 290 }, { "entropy": 1.995333632081747, "epoch": 0.020036901293215004, "grad_norm": 0.6340155601501465, "learning_rate": 9.966666666666667e-06, "loss": 0.3065, "mean_token_accuracy": 0.9304188545793295, "num_tokens": 2249364.0, "step": 300 }, { "entropy": 2.0197862409055234, "epoch": 0.02070479800298884, "grad_norm": 0.4793742299079895, "learning_rate": 1.03e-05, "loss": 0.2886, "mean_token_accuracy": 0.9361212570220232, "num_tokens": 2322460.0, "step": 310 }, { "entropy": 1.9583041921257973, "epoch": 0.021372694712762673, "grad_norm": 0.5382503867149353, "learning_rate": 1.0633333333333334e-05, "loss": 0.2705, "mean_token_accuracy": 0.9373382680118084, "num_tokens": 2396574.0, "step": 320 }, { "entropy": 1.952714692056179, "epoch": 0.022040591422536504, "grad_norm": 0.6508220434188843, "learning_rate": 1.0966666666666666e-05, "loss": 0.2799, "mean_token_accuracy": 0.9333360385149717, "num_tokens": 2470852.0, "step": 330 }, { "entropy": 1.9514575116336346, "epoch": 0.02270848813231034, "grad_norm": 0.6904004216194153, "learning_rate": 1.13e-05, "loss": 0.2869, "mean_token_accuracy": 0.9336731854826212, "num_tokens": 2546716.0, "step": 340 }, { "entropy": 1.976607009768486, "epoch": 0.023376384842084173, "grad_norm": 0.5232467651367188, "learning_rate": 1.1633333333333334e-05, "loss": 0.3064, "mean_token_accuracy": 0.9295540764927864, "num_tokens": 2620754.0, "step": 350 }, { "entropy": 1.9353629119694233, "epoch": 0.024044281551858004, "grad_norm": 0.5086498856544495, "learning_rate": 1.1966666666666668e-05, "loss": 0.2768, "mean_token_accuracy": 0.9334879882633687, "num_tokens": 2696812.0, "step": 360 }, { "entropy": 1.931234911084175, "epoch": 0.02471217826163184, "grad_norm": 0.49109113216400146, "learning_rate": 1.23e-05, "loss": 0.2681, "mean_token_accuracy": 0.9392643854022026, "num_tokens": 2773201.0, "step": 370 }, { "entropy": 1.9188028134405613, "epoch": 0.025380074971405674, "grad_norm": 0.5545594692230225, "learning_rate": 1.2633333333333333e-05, "loss": 0.2727, "mean_token_accuracy": 0.9355106376111507, "num_tokens": 2847967.0, "step": 380 }, { "entropy": 1.9422715984284877, "epoch": 0.026047971681179505, "grad_norm": 0.6035627126693726, "learning_rate": 1.2966666666666669e-05, "loss": 0.274, "mean_token_accuracy": 0.9372076652944088, "num_tokens": 2923598.0, "step": 390 }, { "entropy": 1.927716436982155, "epoch": 0.02671586839095334, "grad_norm": 0.5023415684700012, "learning_rate": 1.3300000000000001e-05, "loss": 0.2971, "mean_token_accuracy": 0.9322077054530382, "num_tokens": 2998451.0, "step": 400 }, { "entropy": 1.9238519445061684, "epoch": 0.027383765100727174, "grad_norm": 0.7115201950073242, "learning_rate": 1.3633333333333334e-05, "loss": 0.2635, "mean_token_accuracy": 0.937430489063263, "num_tokens": 3073826.0, "step": 410 }, { "entropy": 1.9112761169672012, "epoch": 0.028051661810501005, "grad_norm": 0.5181813836097717, "learning_rate": 1.3966666666666666e-05, "loss": 0.2711, "mean_token_accuracy": 0.9371557362377644, "num_tokens": 3147042.0, "step": 420 }, { "entropy": 1.9072541758418082, "epoch": 0.02871955852027484, "grad_norm": 0.5583788752555847, "learning_rate": 1.43e-05, "loss": 0.2909, "mean_token_accuracy": 0.9292095638811588, "num_tokens": 3221391.0, "step": 430 }, { "entropy": 1.929425187408924, "epoch": 0.029387455230048674, "grad_norm": 0.5658089518547058, "learning_rate": 1.4633333333333334e-05, "loss": 0.2773, "mean_token_accuracy": 0.9358743727207184, "num_tokens": 3297391.0, "step": 440 }, { "entropy": 1.9186258763074875, "epoch": 0.030055351939822506, "grad_norm": 0.5475177764892578, "learning_rate": 1.4966666666666668e-05, "loss": 0.2611, "mean_token_accuracy": 0.9375769957900048, "num_tokens": 3370044.0, "step": 450 }, { "entropy": 1.961367942392826, "epoch": 0.03072324864959634, "grad_norm": 0.6251649260520935, "learning_rate": 1.53e-05, "loss": 0.2749, "mean_token_accuracy": 0.9348032645881176, "num_tokens": 3443720.0, "step": 460 }, { "entropy": 1.9164916306734086, "epoch": 0.031391145359370175, "grad_norm": 0.6629922986030579, "learning_rate": 1.563333333333333e-05, "loss": 0.2599, "mean_token_accuracy": 0.9388559281826019, "num_tokens": 3518739.0, "step": 470 }, { "entropy": 1.9666702941060066, "epoch": 0.032059042069144006, "grad_norm": 0.5181350111961365, "learning_rate": 1.5966666666666667e-05, "loss": 0.2754, "mean_token_accuracy": 0.9346308093518019, "num_tokens": 3591893.0, "step": 480 }, { "entropy": 1.9497105732560158, "epoch": 0.03272693877891784, "grad_norm": 0.4939156770706177, "learning_rate": 1.63e-05, "loss": 0.2661, "mean_token_accuracy": 0.9378727618604898, "num_tokens": 3666092.0, "step": 490 }, { "entropy": 1.9019627816975118, "epoch": 0.033394835488691675, "grad_norm": 0.5023748278617859, "learning_rate": 1.6633333333333336e-05, "loss": 0.2801, "mean_token_accuracy": 0.937250430509448, "num_tokens": 3741532.0, "step": 500 }, { "entropy": 1.9006634928286075, "epoch": 0.034062732198465506, "grad_norm": 0.49872279167175293, "learning_rate": 1.6966666666666668e-05, "loss": 0.2745, "mean_token_accuracy": 0.9351544339209795, "num_tokens": 3818222.0, "step": 510 }, { "entropy": 1.953433834016323, "epoch": 0.03473062890823934, "grad_norm": 0.6907939314842224, "learning_rate": 1.73e-05, "loss": 0.2841, "mean_token_accuracy": 0.9363411076366901, "num_tokens": 3889013.0, "step": 520 }, { "entropy": 1.8758891873061656, "epoch": 0.035398525618013175, "grad_norm": 0.597548246383667, "learning_rate": 1.7633333333333336e-05, "loss": 0.2726, "mean_token_accuracy": 0.9369025427848101, "num_tokens": 3966179.0, "step": 530 }, { "entropy": 1.9165897980332374, "epoch": 0.03606642232778701, "grad_norm": 0.5589783787727356, "learning_rate": 1.796666666666667e-05, "loss": 0.2448, "mean_token_accuracy": 0.9418925859034062, "num_tokens": 4043207.0, "step": 540 }, { "entropy": 1.940786676108837, "epoch": 0.03673431903756084, "grad_norm": 0.5549450516700745, "learning_rate": 1.83e-05, "loss": 0.2697, "mean_token_accuracy": 0.937014838308096, "num_tokens": 4117563.0, "step": 550 }, { "entropy": 1.8771196544170379, "epoch": 0.037402215747334676, "grad_norm": 0.49763694405555725, "learning_rate": 1.8633333333333333e-05, "loss": 0.2544, "mean_token_accuracy": 0.9363558165729046, "num_tokens": 4192004.0, "step": 560 }, { "entropy": 1.8844777837395668, "epoch": 0.03807011245710851, "grad_norm": 0.43477630615234375, "learning_rate": 1.896666666666667e-05, "loss": 0.2664, "mean_token_accuracy": 0.9387191701680422, "num_tokens": 4267951.0, "step": 570 }, { "entropy": 1.896211576461792, "epoch": 0.038738009166882345, "grad_norm": 0.4881097376346588, "learning_rate": 1.93e-05, "loss": 0.2718, "mean_token_accuracy": 0.936591349542141, "num_tokens": 4342071.0, "step": 580 }, { "entropy": 1.8810176849365234, "epoch": 0.039405905876656176, "grad_norm": 0.5791126489639282, "learning_rate": 1.9633333333333334e-05, "loss": 0.2556, "mean_token_accuracy": 0.9391982112079859, "num_tokens": 4416234.0, "step": 590 }, { "entropy": 1.8867235787212848, "epoch": 0.04007380258643001, "grad_norm": 0.560542106628418, "learning_rate": 1.9966666666666666e-05, "loss": 0.2718, "mean_token_accuracy": 0.9353368133306503, "num_tokens": 4491695.0, "step": 600 }, { "entropy": 1.8580191478133201, "epoch": 0.040741699296203845, "grad_norm": 0.43044254183769226, "learning_rate": 2.0300000000000002e-05, "loss": 0.2425, "mean_token_accuracy": 0.9416664239019156, "num_tokens": 4567521.0, "step": 610 }, { "entropy": 1.9017898730933667, "epoch": 0.04140959600597768, "grad_norm": 0.4845420718193054, "learning_rate": 2.0633333333333335e-05, "loss": 0.2562, "mean_token_accuracy": 0.942466263845563, "num_tokens": 4641373.0, "step": 620 }, { "entropy": 1.8724591456353665, "epoch": 0.04207749271575151, "grad_norm": 0.5080016255378723, "learning_rate": 2.0966666666666667e-05, "loss": 0.2822, "mean_token_accuracy": 0.9362268142402173, "num_tokens": 4716043.0, "step": 630 }, { "entropy": 1.8777315124869347, "epoch": 0.042745389425525346, "grad_norm": 0.46452513337135315, "learning_rate": 2.13e-05, "loss": 0.2653, "mean_token_accuracy": 0.9359228540211916, "num_tokens": 4792781.0, "step": 640 }, { "entropy": 1.8617530040442944, "epoch": 0.04341328613529918, "grad_norm": 0.6030691862106323, "learning_rate": 2.1633333333333332e-05, "loss": 0.2568, "mean_token_accuracy": 0.9388835299760103, "num_tokens": 4868270.0, "step": 650 }, { "entropy": 1.8857033200562001, "epoch": 0.04408118284507301, "grad_norm": 0.4643787443637848, "learning_rate": 2.1966666666666668e-05, "loss": 0.2634, "mean_token_accuracy": 0.9371110614389181, "num_tokens": 4942605.0, "step": 660 }, { "entropy": 1.840136867761612, "epoch": 0.044749079554846846, "grad_norm": 0.45097482204437256, "learning_rate": 2.23e-05, "loss": 0.2742, "mean_token_accuracy": 0.9363797027617693, "num_tokens": 5018019.0, "step": 670 }, { "entropy": 1.834625767916441, "epoch": 0.04541697626462068, "grad_norm": 0.47868287563323975, "learning_rate": 2.2633333333333336e-05, "loss": 0.272, "mean_token_accuracy": 0.938065306097269, "num_tokens": 5092429.0, "step": 680 }, { "entropy": 1.84593363404274, "epoch": 0.04608487297439451, "grad_norm": 0.4770377278327942, "learning_rate": 2.2966666666666668e-05, "loss": 0.2561, "mean_token_accuracy": 0.9369400054216385, "num_tokens": 5167616.0, "step": 690 }, { "entropy": 1.8952500484883785, "epoch": 0.04675276968416835, "grad_norm": 0.47353577613830566, "learning_rate": 2.3300000000000004e-05, "loss": 0.2912, "mean_token_accuracy": 0.9355636093765497, "num_tokens": 5240137.0, "step": 700 }, { "entropy": 1.8826350688934326, "epoch": 0.04742066639394218, "grad_norm": 0.4633476138114929, "learning_rate": 2.3633333333333336e-05, "loss": 0.2736, "mean_token_accuracy": 0.935032133758068, "num_tokens": 5314092.0, "step": 710 }, { "entropy": 1.904780062288046, "epoch": 0.04808856310371601, "grad_norm": 0.49474969506263733, "learning_rate": 2.396666666666667e-05, "loss": 0.2557, "mean_token_accuracy": 0.9400186624377966, "num_tokens": 5390094.0, "step": 720 }, { "entropy": 1.8624416716396808, "epoch": 0.04875645981348985, "grad_norm": 0.5992990136146545, "learning_rate": 2.43e-05, "loss": 0.2588, "mean_token_accuracy": 0.939788530766964, "num_tokens": 5463761.0, "step": 730 }, { "entropy": 1.8350231386721134, "epoch": 0.04942435652326368, "grad_norm": 0.43471571803092957, "learning_rate": 2.4633333333333334e-05, "loss": 0.2559, "mean_token_accuracy": 0.9391793996095658, "num_tokens": 5539989.0, "step": 740 }, { "entropy": 1.895322470366955, "epoch": 0.05009225323303751, "grad_norm": 0.4460161030292511, "learning_rate": 2.496666666666667e-05, "loss": 0.2667, "mean_token_accuracy": 0.9358015276491642, "num_tokens": 5612816.0, "step": 750 }, { "entropy": 1.8648789323866368, "epoch": 0.05076014994281135, "grad_norm": 0.367523193359375, "learning_rate": 2.5300000000000002e-05, "loss": 0.2606, "mean_token_accuracy": 0.9388170868158341, "num_tokens": 5686591.0, "step": 760 }, { "entropy": 1.8876647353172302, "epoch": 0.05142804665258518, "grad_norm": 0.5680462718009949, "learning_rate": 2.5633333333333338e-05, "loss": 0.2845, "mean_token_accuracy": 0.9361521992832422, "num_tokens": 5757603.0, "step": 770 }, { "entropy": 1.8878997050225734, "epoch": 0.05209594336235901, "grad_norm": 0.4175680875778198, "learning_rate": 2.5966666666666667e-05, "loss": 0.2531, "mean_token_accuracy": 0.9397067219018936, "num_tokens": 5834420.0, "step": 780 }, { "entropy": 1.8271722830832005, "epoch": 0.05276384007213285, "grad_norm": 0.5116245746612549, "learning_rate": 2.6300000000000002e-05, "loss": 0.251, "mean_token_accuracy": 0.9420883610844613, "num_tokens": 5909083.0, "step": 790 }, { "entropy": 1.8641077525913716, "epoch": 0.05343173678190668, "grad_norm": 0.4581059515476227, "learning_rate": 2.663333333333333e-05, "loss": 0.2723, "mean_token_accuracy": 0.9368813514709473, "num_tokens": 5983992.0, "step": 800 }, { "entropy": 1.857724067568779, "epoch": 0.05409963349168051, "grad_norm": 0.43746429681777954, "learning_rate": 2.6966666666666667e-05, "loss": 0.2347, "mean_token_accuracy": 0.9450010515749454, "num_tokens": 6062463.0, "step": 810 }, { "entropy": 1.8728003606200219, "epoch": 0.05476753020145435, "grad_norm": 0.38662680983543396, "learning_rate": 2.7300000000000003e-05, "loss": 0.247, "mean_token_accuracy": 0.9403760474175215, "num_tokens": 6136824.0, "step": 820 }, { "entropy": 1.898129551112652, "epoch": 0.05543542691122818, "grad_norm": 0.556283175945282, "learning_rate": 2.7633333333333332e-05, "loss": 0.2743, "mean_token_accuracy": 0.9356398023664951, "num_tokens": 6210464.0, "step": 830 }, { "entropy": 1.880861686170101, "epoch": 0.05610332362100201, "grad_norm": 0.4746190309524536, "learning_rate": 2.7966666666666668e-05, "loss": 0.265, "mean_token_accuracy": 0.936080627143383, "num_tokens": 6283597.0, "step": 840 }, { "entropy": 1.854306884109974, "epoch": 0.05677122033077585, "grad_norm": 0.4764083921909332, "learning_rate": 2.83e-05, "loss": 0.2639, "mean_token_accuracy": 0.9392316583544016, "num_tokens": 6357784.0, "step": 850 }, { "entropy": 1.8325285643339158, "epoch": 0.05743911704054968, "grad_norm": 0.4434099793434143, "learning_rate": 2.8633333333333336e-05, "loss": 0.2573, "mean_token_accuracy": 0.9396443590521812, "num_tokens": 6431639.0, "step": 860 }, { "entropy": 1.8051417395472527, "epoch": 0.05810701375032351, "grad_norm": 0.4234469532966614, "learning_rate": 2.8966666666666668e-05, "loss": 0.2565, "mean_token_accuracy": 0.941559237241745, "num_tokens": 6508365.0, "step": 870 }, { "entropy": 1.8686822913587093, "epoch": 0.05877491046009735, "grad_norm": 0.5077882409095764, "learning_rate": 2.93e-05, "loss": 0.2659, "mean_token_accuracy": 0.9374727483838796, "num_tokens": 6582801.0, "step": 880 }, { "entropy": 1.8479201644659042, "epoch": 0.05944280716987118, "grad_norm": 0.47870588302612305, "learning_rate": 2.9633333333333336e-05, "loss": 0.2788, "mean_token_accuracy": 0.9344479534775019, "num_tokens": 6656807.0, "step": 890 }, { "entropy": 1.7955858707427979, "epoch": 0.06011070387964501, "grad_norm": 0.4300808012485504, "learning_rate": 2.9966666666666672e-05, "loss": 0.252, "mean_token_accuracy": 0.941497677192092, "num_tokens": 6732485.0, "step": 900 }, { "entropy": 1.7755248837172986, "epoch": 0.06077860058941885, "grad_norm": 0.4369029402732849, "learning_rate": 3.03e-05, "loss": 0.2473, "mean_token_accuracy": 0.939782527461648, "num_tokens": 6809791.0, "step": 910 }, { "entropy": 1.7887912310659886, "epoch": 0.06144649729919268, "grad_norm": 0.4319849908351898, "learning_rate": 3.063333333333334e-05, "loss": 0.2496, "mean_token_accuracy": 0.939714727923274, "num_tokens": 6886872.0, "step": 920 }, { "entropy": 1.7954976260662079, "epoch": 0.06211439400896651, "grad_norm": 0.4967508018016815, "learning_rate": 3.096666666666666e-05, "loss": 0.2511, "mean_token_accuracy": 0.9389847174286843, "num_tokens": 6960501.0, "step": 930 }, { "entropy": 1.8278648495674132, "epoch": 0.06278229071874035, "grad_norm": 0.48559603095054626, "learning_rate": 3.13e-05, "loss": 0.2664, "mean_token_accuracy": 0.9423621110618114, "num_tokens": 7034210.0, "step": 940 }, { "entropy": 1.9057058945298195, "epoch": 0.06345018742851417, "grad_norm": 0.4104534685611725, "learning_rate": 3.1633333333333334e-05, "loss": 0.2665, "mean_token_accuracy": 0.9355318166315556, "num_tokens": 7107489.0, "step": 950 }, { "entropy": 1.8848116263747214, "epoch": 0.06411808413828801, "grad_norm": 0.41475149989128113, "learning_rate": 3.196666666666667e-05, "loss": 0.2457, "mean_token_accuracy": 0.9418462350964546, "num_tokens": 7182362.0, "step": 960 }, { "entropy": 1.8569753460586071, "epoch": 0.06478598084806185, "grad_norm": 0.4193580448627472, "learning_rate": 3.2300000000000006e-05, "loss": 0.2525, "mean_token_accuracy": 0.940886041894555, "num_tokens": 7259091.0, "step": 970 }, { "entropy": 1.846326508373022, "epoch": 0.06545387755783567, "grad_norm": 0.4658212661743164, "learning_rate": 3.263333333333333e-05, "loss": 0.2583, "mean_token_accuracy": 0.9409648180007935, "num_tokens": 7334380.0, "step": 980 }, { "entropy": 1.851350438594818, "epoch": 0.06612177426760951, "grad_norm": 0.43780967593193054, "learning_rate": 3.296666666666667e-05, "loss": 0.2501, "mean_token_accuracy": 0.9397942151874303, "num_tokens": 7411056.0, "step": 990 }, { "entropy": 1.853810054063797, "epoch": 0.06678967097738335, "grad_norm": 0.42440807819366455, "learning_rate": 3.33e-05, "loss": 0.2659, "mean_token_accuracy": 0.9382550328969955, "num_tokens": 7486847.0, "step": 1000 }, { "epoch": 0.06678967097738335, "eval_entropy": 1.8648166310548782, "eval_loss": 0.2746169865131378, "eval_mean_token_accuracy": 0.9396639612078667, "eval_num_tokens": 7486847.0, "eval_runtime": 549.5366, "eval_samples_per_second": 36.394, "eval_steps_per_second": 9.099, "step": 1000 }, { "entropy": 1.8722092419862748, "epoch": 0.06745756768715717, "grad_norm": 0.414480060338974, "learning_rate": 3.3633333333333335e-05, "loss": 0.2446, "mean_token_accuracy": 0.9428178198635578, "num_tokens": 7560292.0, "step": 1010 }, { "entropy": 1.8885526061058044, "epoch": 0.06812546439693101, "grad_norm": 0.39335963129997253, "learning_rate": 3.396666666666667e-05, "loss": 0.2707, "mean_token_accuracy": 0.9378925491124391, "num_tokens": 7635193.0, "step": 1020 }, { "entropy": 1.903367231041193, "epoch": 0.06879336110670485, "grad_norm": 0.5621363520622253, "learning_rate": 3.430000000000001e-05, "loss": 0.2653, "mean_token_accuracy": 0.9378355484455824, "num_tokens": 7709282.0, "step": 1030 }, { "entropy": 1.8545162931084633, "epoch": 0.06946125781647867, "grad_norm": 0.4494113624095917, "learning_rate": 3.463333333333333e-05, "loss": 0.2433, "mean_token_accuracy": 0.9431285582482815, "num_tokens": 7787510.0, "step": 1040 }, { "entropy": 1.8824216805398464, "epoch": 0.07012915452625251, "grad_norm": 0.34349653124809265, "learning_rate": 3.496666666666667e-05, "loss": 0.2519, "mean_token_accuracy": 0.9404412806034088, "num_tokens": 7859430.0, "step": 1050 }, { "entropy": 1.8358929216861726, "epoch": 0.07079705123602635, "grad_norm": 0.4624893069267273, "learning_rate": 3.53e-05, "loss": 0.282, "mean_token_accuracy": 0.934838455170393, "num_tokens": 7933964.0, "step": 1060 }, { "entropy": 1.9042016871273517, "epoch": 0.07146494794580018, "grad_norm": 0.4160533547401428, "learning_rate": 3.563333333333334e-05, "loss": 0.2736, "mean_token_accuracy": 0.9366271026432514, "num_tokens": 8008810.0, "step": 1070 }, { "entropy": 1.8691378943622112, "epoch": 0.07213284465557401, "grad_norm": 0.5466485619544983, "learning_rate": 3.596666666666667e-05, "loss": 0.2518, "mean_token_accuracy": 0.9419682942330837, "num_tokens": 8081971.0, "step": 1080 }, { "entropy": 1.8676304399967194, "epoch": 0.07280074136534785, "grad_norm": 0.45920252799987793, "learning_rate": 3.63e-05, "loss": 0.2669, "mean_token_accuracy": 0.9384940352290869, "num_tokens": 8160031.0, "step": 1090 }, { "entropy": 1.8852659337222577, "epoch": 0.07346863807512168, "grad_norm": 0.39921435713768005, "learning_rate": 3.6633333333333334e-05, "loss": 0.2448, "mean_token_accuracy": 0.9403918713331223, "num_tokens": 8238983.0, "step": 1100 }, { "entropy": 1.8415560849010943, "epoch": 0.07413653478489551, "grad_norm": 0.40769678354263306, "learning_rate": 3.6966666666666666e-05, "loss": 0.245, "mean_token_accuracy": 0.9413307942450047, "num_tokens": 8313284.0, "step": 1110 }, { "entropy": 1.8405307993292808, "epoch": 0.07480443149466935, "grad_norm": 0.39178162813186646, "learning_rate": 3.73e-05, "loss": 0.2448, "mean_token_accuracy": 0.9406428840011358, "num_tokens": 8387088.0, "step": 1120 }, { "entropy": 1.8549068100750445, "epoch": 0.07547232820444319, "grad_norm": 0.4287874400615692, "learning_rate": 3.763333333333334e-05, "loss": 0.2463, "mean_token_accuracy": 0.9380009301006794, "num_tokens": 8461174.0, "step": 1130 }, { "entropy": 1.863625731319189, "epoch": 0.07614022491421701, "grad_norm": 0.3632742166519165, "learning_rate": 3.796666666666667e-05, "loss": 0.2375, "mean_token_accuracy": 0.9424182560294867, "num_tokens": 8537462.0, "step": 1140 }, { "entropy": 1.8476528838276862, "epoch": 0.07680812162399085, "grad_norm": 0.3408449590206146, "learning_rate": 3.83e-05, "loss": 0.2393, "mean_token_accuracy": 0.9426622208207845, "num_tokens": 8613005.0, "step": 1150 }, { "entropy": 1.8576123289763928, "epoch": 0.07747601833376469, "grad_norm": 0.3981676995754242, "learning_rate": 3.8633333333333335e-05, "loss": 0.2516, "mean_token_accuracy": 0.9414995286613703, "num_tokens": 8689743.0, "step": 1160 }, { "entropy": 1.8964253507554532, "epoch": 0.07814391504353851, "grad_norm": 0.40773627161979675, "learning_rate": 3.896666666666667e-05, "loss": 0.2459, "mean_token_accuracy": 0.9434265218675136, "num_tokens": 8761752.0, "step": 1170 }, { "entropy": 1.8615813329815865, "epoch": 0.07881181175331235, "grad_norm": 0.34091347455978394, "learning_rate": 3.9300000000000007e-05, "loss": 0.2639, "mean_token_accuracy": 0.9368136961013078, "num_tokens": 8835914.0, "step": 1180 }, { "entropy": 1.8253806605935097, "epoch": 0.07947970846308619, "grad_norm": 0.32698726654052734, "learning_rate": 3.963333333333333e-05, "loss": 0.2554, "mean_token_accuracy": 0.9404144994914532, "num_tokens": 8910566.0, "step": 1190 }, { "entropy": 1.8871965758502482, "epoch": 0.08014760517286001, "grad_norm": 0.32207944989204407, "learning_rate": 3.996666666666667e-05, "loss": 0.2593, "mean_token_accuracy": 0.9369674678891897, "num_tokens": 8987453.0, "step": 1200 }, { "entropy": 1.8854286082088947, "epoch": 0.08081550188263385, "grad_norm": 0.40935617685317993, "learning_rate": 4.0300000000000004e-05, "loss": 0.2691, "mean_token_accuracy": 0.9358607489615679, "num_tokens": 9061161.0, "step": 1210 }, { "entropy": 1.8666034035384655, "epoch": 0.08148339859240769, "grad_norm": 0.40217721462249756, "learning_rate": 4.0633333333333336e-05, "loss": 0.2474, "mean_token_accuracy": 0.9405681319534779, "num_tokens": 9135309.0, "step": 1220 }, { "entropy": 1.8529215894639492, "epoch": 0.08215129530218152, "grad_norm": 0.3745631277561188, "learning_rate": 4.096666666666667e-05, "loss": 0.2383, "mean_token_accuracy": 0.9417877610772848, "num_tokens": 9206268.0, "step": 1230 }, { "entropy": 1.8744257062673568, "epoch": 0.08281919201195535, "grad_norm": 0.41536879539489746, "learning_rate": 4.13e-05, "loss": 0.2558, "mean_token_accuracy": 0.9366620749235153, "num_tokens": 9280551.0, "step": 1240 }, { "entropy": 1.860572198778391, "epoch": 0.08348708872172919, "grad_norm": 0.38959744572639465, "learning_rate": 4.1633333333333333e-05, "loss": 0.2545, "mean_token_accuracy": 0.9395768508315087, "num_tokens": 9355255.0, "step": 1250 }, { "entropy": 1.8331671096384525, "epoch": 0.08415498543150302, "grad_norm": 0.38928812742233276, "learning_rate": 4.196666666666667e-05, "loss": 0.2547, "mean_token_accuracy": 0.9387797378003597, "num_tokens": 9430504.0, "step": 1260 }, { "entropy": 1.8536636359989642, "epoch": 0.08482288214127685, "grad_norm": 0.33527395129203796, "learning_rate": 4.23e-05, "loss": 0.2446, "mean_token_accuracy": 0.9408517919480801, "num_tokens": 9506407.0, "step": 1270 }, { "entropy": 1.8080134324729442, "epoch": 0.08549077885105069, "grad_norm": 0.420559287071228, "learning_rate": 4.263333333333334e-05, "loss": 0.2545, "mean_token_accuracy": 0.9404942344874143, "num_tokens": 9582031.0, "step": 1280 }, { "entropy": 1.8781551785767079, "epoch": 0.08615867556082452, "grad_norm": 0.487653911113739, "learning_rate": 4.296666666666666e-05, "loss": 0.2578, "mean_token_accuracy": 0.935891279578209, "num_tokens": 9656802.0, "step": 1290 }, { "entropy": 1.852930338680744, "epoch": 0.08682657227059835, "grad_norm": 0.33225956559181213, "learning_rate": 4.33e-05, "loss": 0.253, "mean_token_accuracy": 0.9419618722051382, "num_tokens": 9730623.0, "step": 1300 }, { "entropy": 1.8633646860718727, "epoch": 0.08749446898037219, "grad_norm": 0.39087024331092834, "learning_rate": 4.3633333333333335e-05, "loss": 0.2464, "mean_token_accuracy": 0.9423338647931814, "num_tokens": 9803462.0, "step": 1310 }, { "entropy": 1.808484634757042, "epoch": 0.08816236569014602, "grad_norm": 0.3942349851131439, "learning_rate": 4.396666666666667e-05, "loss": 0.2413, "mean_token_accuracy": 0.9396913766860961, "num_tokens": 9879104.0, "step": 1320 }, { "entropy": 1.8243934623897076, "epoch": 0.08883026239991985, "grad_norm": 0.4019410014152527, "learning_rate": 4.43e-05, "loss": 0.2474, "mean_token_accuracy": 0.9448523435741663, "num_tokens": 9954180.0, "step": 1330 }, { "entropy": 1.8570265740156173, "epoch": 0.08949815910969369, "grad_norm": 0.357666015625, "learning_rate": 4.463333333333334e-05, "loss": 0.2558, "mean_token_accuracy": 0.9409103903919458, "num_tokens": 10028028.0, "step": 1340 }, { "entropy": 1.8285759411752225, "epoch": 0.09016605581946752, "grad_norm": 0.4638359248638153, "learning_rate": 4.496666666666667e-05, "loss": 0.2386, "mean_token_accuracy": 0.9455917440354824, "num_tokens": 10103949.0, "step": 1350 }, { "entropy": 1.8921574287116527, "epoch": 0.09083395252924135, "grad_norm": 0.3664829730987549, "learning_rate": 4.53e-05, "loss": 0.2514, "mean_token_accuracy": 0.9409088790416718, "num_tokens": 10179965.0, "step": 1360 }, { "entropy": 1.909767533838749, "epoch": 0.09150184923901519, "grad_norm": 0.3954828679561615, "learning_rate": 4.5633333333333336e-05, "loss": 0.2641, "mean_token_accuracy": 0.9392028257250786, "num_tokens": 10253031.0, "step": 1370 }, { "entropy": 1.897636280953884, "epoch": 0.09216974594878902, "grad_norm": 0.3309478461742401, "learning_rate": 4.596666666666667e-05, "loss": 0.2536, "mean_token_accuracy": 0.9406967829912901, "num_tokens": 10327483.0, "step": 1380 }, { "entropy": 1.8735629595816135, "epoch": 0.09283764265856286, "grad_norm": 0.3709751069545746, "learning_rate": 4.630000000000001e-05, "loss": 0.2559, "mean_token_accuracy": 0.9381070993840694, "num_tokens": 10400671.0, "step": 1390 }, { "entropy": 1.8461422972381114, "epoch": 0.0935055393683367, "grad_norm": 0.34269604086875916, "learning_rate": 4.663333333333333e-05, "loss": 0.2486, "mean_token_accuracy": 0.9399528317153454, "num_tokens": 10475441.0, "step": 1400 }, { "entropy": 1.8211704172194003, "epoch": 0.09417343607811052, "grad_norm": 0.401239275932312, "learning_rate": 4.696666666666667e-05, "loss": 0.248, "mean_token_accuracy": 0.9393475376069546, "num_tokens": 10550394.0, "step": 1410 }, { "entropy": 1.892047306150198, "epoch": 0.09484133278788436, "grad_norm": 0.39942097663879395, "learning_rate": 4.73e-05, "loss": 0.2635, "mean_token_accuracy": 0.9364817954599858, "num_tokens": 10628054.0, "step": 1420 }, { "entropy": 1.8521707750856877, "epoch": 0.0955092294976582, "grad_norm": 0.4278346598148346, "learning_rate": 4.763333333333334e-05, "loss": 0.2323, "mean_token_accuracy": 0.9443262364715338, "num_tokens": 10701626.0, "step": 1430 }, { "entropy": 1.8943075209856033, "epoch": 0.09617712620743202, "grad_norm": 0.3699016869068146, "learning_rate": 4.796666666666667e-05, "loss": 0.2737, "mean_token_accuracy": 0.9367077428847551, "num_tokens": 10774072.0, "step": 1440 }, { "entropy": 1.8664367534220219, "epoch": 0.09684502291720586, "grad_norm": 0.3882374167442322, "learning_rate": 4.83e-05, "loss": 0.2576, "mean_token_accuracy": 0.9367181625217199, "num_tokens": 10847357.0, "step": 1450 }, { "entropy": 1.7965730026364326, "epoch": 0.0975129196269797, "grad_norm": 0.32984229922294617, "learning_rate": 4.8633333333333334e-05, "loss": 0.2264, "mean_token_accuracy": 0.9448713529855013, "num_tokens": 10924525.0, "step": 1460 }, { "entropy": 1.8047875829041005, "epoch": 0.09818081633675352, "grad_norm": 0.4185302257537842, "learning_rate": 4.8966666666666667e-05, "loss": 0.2462, "mean_token_accuracy": 0.9445567015558481, "num_tokens": 10997448.0, "step": 1470 }, { "entropy": 1.8770555928349495, "epoch": 0.09884871304652736, "grad_norm": 0.34383824467658997, "learning_rate": 4.93e-05, "loss": 0.2565, "mean_token_accuracy": 0.9404840290546417, "num_tokens": 11073389.0, "step": 1480 }, { "entropy": 1.843934503942728, "epoch": 0.0995166097563012, "grad_norm": 0.3678169846534729, "learning_rate": 4.963333333333334e-05, "loss": 0.2416, "mean_token_accuracy": 0.9416554532945156, "num_tokens": 11147812.0, "step": 1490 }, { "entropy": 1.837416634708643, "epoch": 0.10018450646607502, "grad_norm": 0.372890830039978, "learning_rate": 4.996666666666667e-05, "loss": 0.2605, "mean_token_accuracy": 0.9366992872208357, "num_tokens": 11222157.0, "step": 1500 }, { "entropy": 1.804855602234602, "epoch": 0.10085240317584886, "grad_norm": 0.40893515944480896, "learning_rate": 4.9999945059002565e-05, "loss": 0.2549, "mean_token_accuracy": 0.940057422220707, "num_tokens": 11295930.0, "step": 1510 }, { "entropy": 1.7543303154408931, "epoch": 0.1015202998856227, "grad_norm": 0.3919351398944855, "learning_rate": 4.999975513981592e-05, "loss": 0.2164, "mean_token_accuracy": 0.9464322041720152, "num_tokens": 11370899.0, "step": 1520 }, { "entropy": 1.8050099305808545, "epoch": 0.10218819659539652, "grad_norm": 0.3314148187637329, "learning_rate": 4.99994295651885e-05, "loss": 0.2334, "mean_token_accuracy": 0.9432413805276155, "num_tokens": 11447828.0, "step": 1530 }, { "entropy": 1.8214650124311447, "epoch": 0.10285609330517036, "grad_norm": 0.316817045211792, "learning_rate": 4.999896833689051e-05, "loss": 0.2443, "mean_token_accuracy": 0.9421243309974671, "num_tokens": 11520817.0, "step": 1540 }, { "entropy": 1.8117822676897049, "epoch": 0.1035239900149442, "grad_norm": 0.33268994092941284, "learning_rate": 4.999837145742971e-05, "loss": 0.2618, "mean_token_accuracy": 0.9390293166041375, "num_tokens": 11594522.0, "step": 1550 }, { "entropy": 1.8389830827713012, "epoch": 0.10419188672471802, "grad_norm": 0.4531651735305786, "learning_rate": 4.9997638930051434e-05, "loss": 0.2413, "mean_token_accuracy": 0.9419956561177969, "num_tokens": 11668587.0, "step": 1560 }, { "entropy": 1.7972249872982502, "epoch": 0.10485978343449186, "grad_norm": 0.35895809531211853, "learning_rate": 4.999677075873853e-05, "loss": 0.2458, "mean_token_accuracy": 0.9400338169187308, "num_tokens": 11745785.0, "step": 1570 }, { "entropy": 1.8368936344981193, "epoch": 0.1055276801442657, "grad_norm": 0.37567827105522156, "learning_rate": 4.999576694821137e-05, "loss": 0.2593, "mean_token_accuracy": 0.9367735404521227, "num_tokens": 11819941.0, "step": 1580 }, { "entropy": 1.7924836911261082, "epoch": 0.10619557685403952, "grad_norm": 0.3485127091407776, "learning_rate": 4.999462750392782e-05, "loss": 0.252, "mean_token_accuracy": 0.9390415012836456, "num_tokens": 11894898.0, "step": 1590 }, { "entropy": 1.7923610121011735, "epoch": 0.10686347356381336, "grad_norm": 0.4060329496860504, "learning_rate": 4.9993352432083206e-05, "loss": 0.2386, "mean_token_accuracy": 0.9422769341617823, "num_tokens": 11971167.0, "step": 1600 }, { "entropy": 1.8334701210260391, "epoch": 0.1075313702735872, "grad_norm": 0.36048150062561035, "learning_rate": 4.999194173961028e-05, "loss": 0.2367, "mean_token_accuracy": 0.9419048838317394, "num_tokens": 12045417.0, "step": 1610 }, { "entropy": 1.7842422433197498, "epoch": 0.10819926698336102, "grad_norm": 0.36341556906700134, "learning_rate": 4.9990395434179176e-05, "loss": 0.2528, "mean_token_accuracy": 0.9400053527206182, "num_tokens": 12120969.0, "step": 1620 }, { "entropy": 1.8372097842395305, "epoch": 0.10886716369313486, "grad_norm": 0.35848885774612427, "learning_rate": 4.998871352419739e-05, "loss": 0.2706, "mean_token_accuracy": 0.9359296333044768, "num_tokens": 12194830.0, "step": 1630 }, { "entropy": 1.8942107573151588, "epoch": 0.1095350604029087, "grad_norm": 0.37302595376968384, "learning_rate": 4.998689601880969e-05, "loss": 0.252, "mean_token_accuracy": 0.9393172737210989, "num_tokens": 12268478.0, "step": 1640 }, { "entropy": 1.846186748892069, "epoch": 0.11020295711268252, "grad_norm": 0.36369460821151733, "learning_rate": 4.998494292789814e-05, "loss": 0.2571, "mean_token_accuracy": 0.9378128115087747, "num_tokens": 12341656.0, "step": 1650 }, { "entropy": 1.8226500421762466, "epoch": 0.11087085382245636, "grad_norm": 0.35995057225227356, "learning_rate": 4.998285426208197e-05, "loss": 0.2593, "mean_token_accuracy": 0.9392500806599855, "num_tokens": 12417077.0, "step": 1660 }, { "entropy": 1.7849808871746062, "epoch": 0.1115387505322302, "grad_norm": 0.31248095631599426, "learning_rate": 4.998063003271756e-05, "loss": 0.2382, "mean_token_accuracy": 0.9415343657135964, "num_tokens": 12494685.0, "step": 1670 }, { "entropy": 1.8088674053549767, "epoch": 0.11220664724200402, "grad_norm": 0.3842123746871948, "learning_rate": 4.997827025189837e-05, "loss": 0.261, "mean_token_accuracy": 0.9392439745366573, "num_tokens": 12568525.0, "step": 1680 }, { "entropy": 1.7959242567420006, "epoch": 0.11287454395177786, "grad_norm": 0.40647968649864197, "learning_rate": 4.997577493245486e-05, "loss": 0.2695, "mean_token_accuracy": 0.9369698017835617, "num_tokens": 12642491.0, "step": 1690 }, { "entropy": 1.829491986334324, "epoch": 0.1135424406615517, "grad_norm": 0.32783016562461853, "learning_rate": 4.997314408795446e-05, "loss": 0.2409, "mean_token_accuracy": 0.9426718652248383, "num_tokens": 12715799.0, "step": 1700 }, { "entropy": 1.7980324625968933, "epoch": 0.11421033737132552, "grad_norm": 0.38863658905029297, "learning_rate": 4.997037773270143e-05, "loss": 0.2246, "mean_token_accuracy": 0.9470432173460722, "num_tokens": 12791044.0, "step": 1710 }, { "entropy": 1.780588860809803, "epoch": 0.11487823408109936, "grad_norm": 0.36860790848731995, "learning_rate": 4.996747588173688e-05, "loss": 0.2704, "mean_token_accuracy": 0.9387739099562168, "num_tokens": 12864717.0, "step": 1720 }, { "entropy": 1.8167456299066544, "epoch": 0.1155461307908732, "grad_norm": 0.40437668561935425, "learning_rate": 4.9964438550838566e-05, "loss": 0.2482, "mean_token_accuracy": 0.9406302180141211, "num_tokens": 12936931.0, "step": 1730 }, { "entropy": 1.7739999622106553, "epoch": 0.11621402750064702, "grad_norm": 0.42025813460350037, "learning_rate": 4.9961265756520914e-05, "loss": 0.2621, "mean_token_accuracy": 0.9397819988429547, "num_tokens": 13009783.0, "step": 1740 }, { "entropy": 1.8471427731215955, "epoch": 0.11688192421042086, "grad_norm": 0.24152179062366486, "learning_rate": 4.9957957516034854e-05, "loss": 0.2583, "mean_token_accuracy": 0.9385230287909507, "num_tokens": 13087594.0, "step": 1750 }, { "entropy": 1.829470805078745, "epoch": 0.1175498209201947, "grad_norm": 0.3349377512931824, "learning_rate": 4.995451384736778e-05, "loss": 0.2385, "mean_token_accuracy": 0.942843297868967, "num_tokens": 13162846.0, "step": 1760 }, { "entropy": 1.8083517365157604, "epoch": 0.11821771762996852, "grad_norm": 0.33394306898117065, "learning_rate": 4.995093476924341e-05, "loss": 0.268, "mean_token_accuracy": 0.9358123634010553, "num_tokens": 13235219.0, "step": 1770 }, { "entropy": 1.8390862189233304, "epoch": 0.11888561433974236, "grad_norm": 0.2808772623538971, "learning_rate": 4.9947220301121714e-05, "loss": 0.2561, "mean_token_accuracy": 0.9398859009146691, "num_tokens": 13309921.0, "step": 1780 }, { "entropy": 1.8172144912183286, "epoch": 0.1195535110495162, "grad_norm": 0.29831817746162415, "learning_rate": 4.994337046319881e-05, "loss": 0.2499, "mean_token_accuracy": 0.9418265763670206, "num_tokens": 13383573.0, "step": 1790 }, { "entropy": 1.7965184792876243, "epoch": 0.12022140775929002, "grad_norm": 0.34291186928749084, "learning_rate": 4.9939385276406804e-05, "loss": 0.2532, "mean_token_accuracy": 0.9384090960025787, "num_tokens": 13459808.0, "step": 1800 }, { "entropy": 1.7756263740360736, "epoch": 0.12088930446906386, "grad_norm": 0.3427332639694214, "learning_rate": 4.9935264762413744e-05, "loss": 0.2329, "mean_token_accuracy": 0.9460334207862615, "num_tokens": 13534986.0, "step": 1810 }, { "entropy": 1.7850582242012023, "epoch": 0.1215572011788377, "grad_norm": 0.4083283841609955, "learning_rate": 4.993100894362345e-05, "loss": 0.23, "mean_token_accuracy": 0.9445747293531894, "num_tokens": 13611445.0, "step": 1820 }, { "entropy": 1.810771866887808, "epoch": 0.12222509788861152, "grad_norm": 0.3793506324291229, "learning_rate": 4.992661784317545e-05, "loss": 0.2515, "mean_token_accuracy": 0.9381474364548922, "num_tokens": 13686160.0, "step": 1830 }, { "entropy": 1.772794821858406, "epoch": 0.12289299459838536, "grad_norm": 0.41430842876434326, "learning_rate": 4.9922091484944776e-05, "loss": 0.2567, "mean_token_accuracy": 0.9369965393096209, "num_tokens": 13760446.0, "step": 1840 }, { "entropy": 1.8180281892418861, "epoch": 0.1235608913081592, "grad_norm": 0.4711560904979706, "learning_rate": 4.991742989354192e-05, "loss": 0.2548, "mean_token_accuracy": 0.9408668961375952, "num_tokens": 13834551.0, "step": 1850 }, { "entropy": 1.7984913356602192, "epoch": 0.12422878801793302, "grad_norm": 0.33564695715904236, "learning_rate": 4.991263309431259e-05, "loss": 0.2328, "mean_token_accuracy": 0.9441933192312717, "num_tokens": 13910991.0, "step": 1860 }, { "entropy": 1.7778552062809467, "epoch": 0.12489668472770686, "grad_norm": 0.32167258858680725, "learning_rate": 4.990770111333772e-05, "loss": 0.2361, "mean_token_accuracy": 0.9451872866600752, "num_tokens": 13985904.0, "step": 1870 }, { "entropy": 1.77905383259058, "epoch": 0.1255645814374807, "grad_norm": 0.3849715292453766, "learning_rate": 4.990263397743318e-05, "loss": 0.2402, "mean_token_accuracy": 0.9438797861337662, "num_tokens": 14061330.0, "step": 1880 }, { "entropy": 1.85131838619709, "epoch": 0.12623247814725452, "grad_norm": 0.3501381576061249, "learning_rate": 4.989743171414973e-05, "loss": 0.2627, "mean_token_accuracy": 0.9393126614391804, "num_tokens": 14133348.0, "step": 1890 }, { "entropy": 1.7933654822409153, "epoch": 0.12690037485702835, "grad_norm": 0.3642660677433014, "learning_rate": 4.9892094351772844e-05, "loss": 0.2389, "mean_token_accuracy": 0.9438054759055376, "num_tokens": 14207435.0, "step": 1900 }, { "entropy": 1.8201318435370921, "epoch": 0.1275682715668022, "grad_norm": 0.35850223898887634, "learning_rate": 4.9886621919322515e-05, "loss": 0.2629, "mean_token_accuracy": 0.9394240003079176, "num_tokens": 14282314.0, "step": 1910 }, { "entropy": 1.8730139046907426, "epoch": 0.12823616827657602, "grad_norm": 0.3666210174560547, "learning_rate": 4.9881014446553165e-05, "loss": 0.243, "mean_token_accuracy": 0.9434024095535278, "num_tokens": 14356840.0, "step": 1920 }, { "entropy": 1.8122118309140205, "epoch": 0.12890406498634985, "grad_norm": 0.2802065312862396, "learning_rate": 4.9875271963953446e-05, "loss": 0.2275, "mean_token_accuracy": 0.9431390129029751, "num_tokens": 14431012.0, "step": 1930 }, { "entropy": 1.806647739559412, "epoch": 0.1295719616961237, "grad_norm": 0.3309171795845032, "learning_rate": 4.9869394502746056e-05, "loss": 0.2593, "mean_token_accuracy": 0.9391654759645462, "num_tokens": 14505496.0, "step": 1940 }, { "entropy": 1.836927954852581, "epoch": 0.13023985840589752, "grad_norm": 0.26602479815483093, "learning_rate": 4.9863382094887604e-05, "loss": 0.2564, "mean_token_accuracy": 0.9381305709481239, "num_tokens": 14580129.0, "step": 1950 }, { "entropy": 1.8698457337915897, "epoch": 0.13090775511567135, "grad_norm": 0.2941421866416931, "learning_rate": 4.9857234773068425e-05, "loss": 0.2503, "mean_token_accuracy": 0.939929100498557, "num_tokens": 14656073.0, "step": 1960 }, { "entropy": 1.8299203373491764, "epoch": 0.1315756518254452, "grad_norm": 0.34756720066070557, "learning_rate": 4.985095257071241e-05, "loss": 0.2369, "mean_token_accuracy": 0.9416007433086634, "num_tokens": 14729935.0, "step": 1970 }, { "entropy": 1.8041098691523074, "epoch": 0.13224354853521902, "grad_norm": 0.3420882523059845, "learning_rate": 4.98445355219768e-05, "loss": 0.2276, "mean_token_accuracy": 0.9446675062179566, "num_tokens": 14804005.0, "step": 1980 }, { "entropy": 1.7574528865516186, "epoch": 0.13291144524499285, "grad_norm": 0.31510859727859497, "learning_rate": 4.983798366175202e-05, "loss": 0.2476, "mean_token_accuracy": 0.9438613794744015, "num_tokens": 14879452.0, "step": 1990 }, { "entropy": 1.8129021555185318, "epoch": 0.1335793419547667, "grad_norm": 0.31414422392845154, "learning_rate": 4.9831297025661483e-05, "loss": 0.2398, "mean_token_accuracy": 0.9419260278344155, "num_tokens": 14956825.0, "step": 2000 }, { "epoch": 0.1335793419547667, "eval_entropy": 1.7998176928043366, "eval_loss": 0.2604806125164032, "eval_mean_token_accuracy": 0.9421368992447853, "eval_num_tokens": 14956825.0, "eval_runtime": 553.5898, "eval_samples_per_second": 36.128, "eval_steps_per_second": 9.032, "step": 2000 }, { "entropy": 1.7944769166409968, "epoch": 0.13424723866454052, "grad_norm": 0.4020504355430603, "learning_rate": 4.98244756500614e-05, "loss": 0.2509, "mean_token_accuracy": 0.9413325522094965, "num_tokens": 15031758.0, "step": 2010 }, { "entropy": 1.7625232838094234, "epoch": 0.13491513537431435, "grad_norm": 0.35861051082611084, "learning_rate": 4.9817519572040584e-05, "loss": 0.2421, "mean_token_accuracy": 0.9444488797336816, "num_tokens": 15106692.0, "step": 2020 }, { "entropy": 1.8512812927365303, "epoch": 0.1355830320840882, "grad_norm": 0.2726729214191437, "learning_rate": 4.981042882942024e-05, "loss": 0.2524, "mean_token_accuracy": 0.9382127381861209, "num_tokens": 15179306.0, "step": 2030 }, { "entropy": 1.80864247828722, "epoch": 0.13625092879386203, "grad_norm": 0.3192000985145569, "learning_rate": 4.980320346075376e-05, "loss": 0.2513, "mean_token_accuracy": 0.9387617770582437, "num_tokens": 15254467.0, "step": 2040 }, { "entropy": 1.77226110547781, "epoch": 0.13691882550363585, "grad_norm": 0.39089086651802063, "learning_rate": 4.9795843505326534e-05, "loss": 0.2376, "mean_token_accuracy": 0.9425041008740663, "num_tokens": 15325693.0, "step": 2050 }, { "entropy": 1.744492419809103, "epoch": 0.1375867222134097, "grad_norm": 0.29420822858810425, "learning_rate": 4.97883490031557e-05, "loss": 0.2298, "mean_token_accuracy": 0.9479223694652319, "num_tokens": 15400502.0, "step": 2060 }, { "entropy": 1.7660885341465473, "epoch": 0.13825461892318353, "grad_norm": 0.36348381638526917, "learning_rate": 4.9780719994989946e-05, "loss": 0.2366, "mean_token_accuracy": 0.9435297749936581, "num_tokens": 15473805.0, "step": 2070 }, { "entropy": 1.780941829830408, "epoch": 0.13892251563295735, "grad_norm": 0.3287426233291626, "learning_rate": 4.977295652230931e-05, "loss": 0.2607, "mean_token_accuracy": 0.9359222516417504, "num_tokens": 15548685.0, "step": 2080 }, { "entropy": 1.8226717375218868, "epoch": 0.1395904123427312, "grad_norm": 0.4171643555164337, "learning_rate": 4.976505862732493e-05, "loss": 0.2607, "mean_token_accuracy": 0.9392563026398421, "num_tokens": 15621589.0, "step": 2090 }, { "entropy": 1.7729314967989922, "epoch": 0.14025830905250503, "grad_norm": 0.359145849943161, "learning_rate": 4.9757026352978784e-05, "loss": 0.2248, "mean_token_accuracy": 0.9455544374883175, "num_tokens": 15695417.0, "step": 2100 }, { "entropy": 1.7612593069672584, "epoch": 0.14092620576227885, "grad_norm": 0.3510279655456543, "learning_rate": 4.974885974294352e-05, "loss": 0.244, "mean_token_accuracy": 0.9400189932435751, "num_tokens": 15769288.0, "step": 2110 }, { "entropy": 1.737210039794445, "epoch": 0.1415941024720527, "grad_norm": 0.2984858751296997, "learning_rate": 4.97405588416222e-05, "loss": 0.2305, "mean_token_accuracy": 0.9429280549287796, "num_tokens": 15845511.0, "step": 2120 }, { "entropy": 1.737841621041298, "epoch": 0.14226199918182653, "grad_norm": 0.3221711814403534, "learning_rate": 4.9732123694147994e-05, "loss": 0.2396, "mean_token_accuracy": 0.9418632112443447, "num_tokens": 15920447.0, "step": 2130 }, { "entropy": 1.770331757515669, "epoch": 0.14292989589160035, "grad_norm": 0.5877280235290527, "learning_rate": 4.972355434638406e-05, "loss": 0.2596, "mean_token_accuracy": 0.938718581944704, "num_tokens": 15994725.0, "step": 2140 }, { "entropy": 1.8453688018023968, "epoch": 0.1435977926013742, "grad_norm": 0.34415510296821594, "learning_rate": 4.971485084492317e-05, "loss": 0.2594, "mean_token_accuracy": 0.9379322212189436, "num_tokens": 16069197.0, "step": 2150 }, { "entropy": 1.7769900791347026, "epoch": 0.14426568931114803, "grad_norm": 0.3126566708087921, "learning_rate": 4.970601323708752e-05, "loss": 0.2408, "mean_token_accuracy": 0.9445823833346367, "num_tokens": 16146214.0, "step": 2160 }, { "entropy": 1.738958951085806, "epoch": 0.14493358602092185, "grad_norm": 0.30899330973625183, "learning_rate": 4.969704157092848e-05, "loss": 0.2358, "mean_token_accuracy": 0.9447852328419686, "num_tokens": 16221287.0, "step": 2170 }, { "entropy": 1.746282958239317, "epoch": 0.1456014827306957, "grad_norm": 0.32895487546920776, "learning_rate": 4.968793589522628e-05, "loss": 0.2484, "mean_token_accuracy": 0.9414300579577685, "num_tokens": 16295465.0, "step": 2180 }, { "entropy": 1.7455839931964874, "epoch": 0.14626937944046953, "grad_norm": 0.3615387976169586, "learning_rate": 4.967869625948983e-05, "loss": 0.2491, "mean_token_accuracy": 0.9379068542271852, "num_tokens": 16368543.0, "step": 2190 }, { "entropy": 1.7793588049709796, "epoch": 0.14693727615024335, "grad_norm": 0.33342647552490234, "learning_rate": 4.966932271395635e-05, "loss": 0.234, "mean_token_accuracy": 0.94397107437253, "num_tokens": 16442099.0, "step": 2200 }, { "entropy": 1.7409492023289204, "epoch": 0.1476051728600172, "grad_norm": 0.3483268916606903, "learning_rate": 4.965981530959116e-05, "loss": 0.242, "mean_token_accuracy": 0.942544998973608, "num_tokens": 16516266.0, "step": 2210 }, { "entropy": 1.7093798875808717, "epoch": 0.14827306956979103, "grad_norm": 0.3046635389328003, "learning_rate": 4.9650174098087435e-05, "loss": 0.25, "mean_token_accuracy": 0.9399724617600441, "num_tokens": 16591269.0, "step": 2220 }, { "entropy": 1.7450269810855388, "epoch": 0.14894096627956485, "grad_norm": 0.2996240556240082, "learning_rate": 4.96403991318658e-05, "loss": 0.2525, "mean_token_accuracy": 0.9402870047837496, "num_tokens": 16664341.0, "step": 2230 }, { "entropy": 1.7802352659404277, "epoch": 0.1496088629893387, "grad_norm": 0.3075702488422394, "learning_rate": 4.963049046407419e-05, "loss": 0.2301, "mean_token_accuracy": 0.9439422283321619, "num_tokens": 16739026.0, "step": 2240 }, { "entropy": 1.8050305910408497, "epoch": 0.15027675969911253, "grad_norm": 0.27009710669517517, "learning_rate": 4.962044814858746e-05, "loss": 0.2537, "mean_token_accuracy": 0.9410571195185184, "num_tokens": 16813065.0, "step": 2250 }, { "entropy": 1.843242458254099, "epoch": 0.15094465640888638, "grad_norm": 0.34481319785118103, "learning_rate": 4.961027224000715e-05, "loss": 0.2425, "mean_token_accuracy": 0.9395177617669106, "num_tokens": 16885812.0, "step": 2260 }, { "entropy": 1.7868775509297847, "epoch": 0.1516125531186602, "grad_norm": 0.37550628185272217, "learning_rate": 4.959996279366114e-05, "loss": 0.2468, "mean_token_accuracy": 0.9417683627456427, "num_tokens": 16958783.0, "step": 2270 }, { "entropy": 1.799260675907135, "epoch": 0.15228044982843403, "grad_norm": 0.31568869948387146, "learning_rate": 4.958951986560338e-05, "loss": 0.2358, "mean_token_accuracy": 0.9450964849442244, "num_tokens": 17032435.0, "step": 2280 }, { "entropy": 1.7812663353979588, "epoch": 0.15294834653820788, "grad_norm": 0.3289982080459595, "learning_rate": 4.95789435126136e-05, "loss": 0.2498, "mean_token_accuracy": 0.9409911584109067, "num_tokens": 17107302.0, "step": 2290 }, { "entropy": 1.782754474878311, "epoch": 0.1536162432479817, "grad_norm": 0.364711731672287, "learning_rate": 4.9568233792196964e-05, "loss": 0.2442, "mean_token_accuracy": 0.9397149797528982, "num_tokens": 17183282.0, "step": 2300 }, { "entropy": 1.8161667115986346, "epoch": 0.15428413995775553, "grad_norm": 0.30088546872138977, "learning_rate": 4.955739076258377e-05, "loss": 0.2367, "mean_token_accuracy": 0.9431589763611555, "num_tokens": 17257554.0, "step": 2310 }, { "entropy": 1.7942778818309306, "epoch": 0.15495203666752938, "grad_norm": 0.3264505863189697, "learning_rate": 4.9546414482729154e-05, "loss": 0.2393, "mean_token_accuracy": 0.9417916513979435, "num_tokens": 17332071.0, "step": 2320 }, { "entropy": 1.783587858080864, "epoch": 0.1556199333773032, "grad_norm": 0.25699731707572937, "learning_rate": 4.9535305012312735e-05, "loss": 0.2223, "mean_token_accuracy": 0.9469919823110103, "num_tokens": 17407322.0, "step": 2330 }, { "entropy": 1.7524106569588185, "epoch": 0.15628783008707703, "grad_norm": 0.28227999806404114, "learning_rate": 4.952406241173832e-05, "loss": 0.2307, "mean_token_accuracy": 0.9452204752713442, "num_tokens": 17483224.0, "step": 2340 }, { "entropy": 1.8086401492357254, "epoch": 0.15695572679685088, "grad_norm": 0.3575395345687866, "learning_rate": 4.9512686742133554e-05, "loss": 0.2276, "mean_token_accuracy": 0.9439147464931011, "num_tokens": 17557422.0, "step": 2350 }, { "entropy": 1.7260880969464778, "epoch": 0.1576236235066247, "grad_norm": 0.3322930335998535, "learning_rate": 4.950117806534962e-05, "loss": 0.2319, "mean_token_accuracy": 0.9437771786004305, "num_tokens": 17632490.0, "step": 2360 }, { "entropy": 1.7858803570270538, "epoch": 0.15829152021639853, "grad_norm": 0.31739628314971924, "learning_rate": 4.948953644396085e-05, "loss": 0.2424, "mean_token_accuracy": 0.941823310405016, "num_tokens": 17703649.0, "step": 2370 }, { "entropy": 1.7709483467042446, "epoch": 0.15895941692617238, "grad_norm": 0.3278816044330597, "learning_rate": 4.947776194126443e-05, "loss": 0.2461, "mean_token_accuracy": 0.9422798965126276, "num_tokens": 17776440.0, "step": 2380 }, { "entropy": 1.7706992015242577, "epoch": 0.1596273136359462, "grad_norm": 0.28149178624153137, "learning_rate": 4.946585462128004e-05, "loss": 0.2488, "mean_token_accuracy": 0.9397258721292019, "num_tokens": 17853046.0, "step": 2390 }, { "entropy": 1.8093292579054832, "epoch": 0.16029521034572003, "grad_norm": 0.29292032122612, "learning_rate": 4.9453814548749525e-05, "loss": 0.2402, "mean_token_accuracy": 0.9416569489985704, "num_tokens": 17927675.0, "step": 2400 }, { "entropy": 1.8050937592983245, "epoch": 0.16096310705549388, "grad_norm": 0.3780844211578369, "learning_rate": 4.944164178913649e-05, "loss": 0.2579, "mean_token_accuracy": 0.9373075187206268, "num_tokens": 18000388.0, "step": 2410 }, { "entropy": 1.8016890078783034, "epoch": 0.1616310037652677, "grad_norm": 0.34870943427085876, "learning_rate": 4.942933640862599e-05, "loss": 0.2276, "mean_token_accuracy": 0.9450472913682461, "num_tokens": 18074770.0, "step": 2420 }, { "entropy": 1.7888476587831974, "epoch": 0.16229890047504153, "grad_norm": 0.29706668853759766, "learning_rate": 4.941689847412419e-05, "loss": 0.2437, "mean_token_accuracy": 0.9415043368935585, "num_tokens": 18149899.0, "step": 2430 }, { "entropy": 1.8147377699613572, "epoch": 0.16296679718481538, "grad_norm": 0.28822728991508484, "learning_rate": 4.940432805325792e-05, "loss": 0.2642, "mean_token_accuracy": 0.9362334042787552, "num_tokens": 18224872.0, "step": 2440 }, { "entropy": 1.8263470873236656, "epoch": 0.1636346938945892, "grad_norm": 0.32590338587760925, "learning_rate": 4.9391625214374395e-05, "loss": 0.2554, "mean_token_accuracy": 0.9387320384383202, "num_tokens": 18297649.0, "step": 2450 }, { "entropy": 1.800306037068367, "epoch": 0.16430259060436303, "grad_norm": 0.3951384425163269, "learning_rate": 4.93787900265408e-05, "loss": 0.2528, "mean_token_accuracy": 0.9386140391230583, "num_tokens": 18369828.0, "step": 2460 }, { "entropy": 1.804408533871174, "epoch": 0.16497048731413688, "grad_norm": 0.2890225946903229, "learning_rate": 4.93658225595439e-05, "loss": 0.2514, "mean_token_accuracy": 0.9395979948341846, "num_tokens": 18444016.0, "step": 2470 }, { "entropy": 1.791828601807356, "epoch": 0.1656383840239107, "grad_norm": 0.26778239011764526, "learning_rate": 4.935272288388971e-05, "loss": 0.2335, "mean_token_accuracy": 0.9447437960654497, "num_tokens": 18518063.0, "step": 2480 }, { "entropy": 1.7641214445233344, "epoch": 0.16630628073368453, "grad_norm": 0.3373701870441437, "learning_rate": 4.9339491070803063e-05, "loss": 0.2314, "mean_token_accuracy": 0.9459409095346928, "num_tokens": 18592479.0, "step": 2490 }, { "entropy": 1.7729347363114356, "epoch": 0.16697417744345838, "grad_norm": 0.4155683219432831, "learning_rate": 4.932612719222723e-05, "loss": 0.2398, "mean_token_accuracy": 0.9411568857729435, "num_tokens": 18665984.0, "step": 2500 }, { "entropy": 1.803322371840477, "epoch": 0.1676420741532322, "grad_norm": 0.3024482727050781, "learning_rate": 4.931263132082359e-05, "loss": 0.2531, "mean_token_accuracy": 0.9418744131922722, "num_tokens": 18738465.0, "step": 2510 }, { "entropy": 1.7958635151386262, "epoch": 0.16830997086300603, "grad_norm": 0.3386994004249573, "learning_rate": 4.929900352997114e-05, "loss": 0.2253, "mean_token_accuracy": 0.9474283073097467, "num_tokens": 18815718.0, "step": 2520 }, { "entropy": 1.8138790540397167, "epoch": 0.16897786757277988, "grad_norm": 0.2985503077507019, "learning_rate": 4.928524389376615e-05, "loss": 0.2541, "mean_token_accuracy": 0.9393276982009411, "num_tokens": 18889497.0, "step": 2530 }, { "entropy": 1.8433697573840617, "epoch": 0.1696457642825537, "grad_norm": 0.26578304171562195, "learning_rate": 4.9271352487021786e-05, "loss": 0.2543, "mean_token_accuracy": 0.9370607744902373, "num_tokens": 18963905.0, "step": 2540 }, { "entropy": 1.799303326755762, "epoch": 0.17031366099232753, "grad_norm": 0.45828530192375183, "learning_rate": 4.92573293852676e-05, "loss": 0.2287, "mean_token_accuracy": 0.9441456735134125, "num_tokens": 19040441.0, "step": 2550 }, { "entropy": 1.808397851884365, "epoch": 0.17098155770210138, "grad_norm": 0.3327210247516632, "learning_rate": 4.924317466474927e-05, "loss": 0.2282, "mean_token_accuracy": 0.9457386258989573, "num_tokens": 19116101.0, "step": 2560 }, { "entropy": 1.8653571978211403, "epoch": 0.1716494544118752, "grad_norm": 0.3209848701953888, "learning_rate": 4.922888840242805e-05, "loss": 0.2542, "mean_token_accuracy": 0.9404212288558483, "num_tokens": 19190633.0, "step": 2570 }, { "entropy": 1.7841139681637288, "epoch": 0.17231735112164903, "grad_norm": 0.3265194296836853, "learning_rate": 4.921447067598042e-05, "loss": 0.2346, "mean_token_accuracy": 0.942919509112835, "num_tokens": 19265494.0, "step": 2580 }, { "entropy": 1.7643261104822159, "epoch": 0.17298524783142288, "grad_norm": 0.29099276661872864, "learning_rate": 4.9199921563797666e-05, "loss": 0.2311, "mean_token_accuracy": 0.9446221332997083, "num_tokens": 19338724.0, "step": 2590 }, { "entropy": 1.7880529016256332, "epoch": 0.1736531445411967, "grad_norm": 0.3842791020870209, "learning_rate": 4.9185241144985407e-05, "loss": 0.2232, "mean_token_accuracy": 0.9438499320298434, "num_tokens": 19413496.0, "step": 2600 }, { "entropy": 1.7623730182647706, "epoch": 0.17432104125097053, "grad_norm": 0.2518618404865265, "learning_rate": 4.917042949936322e-05, "loss": 0.2396, "mean_token_accuracy": 0.9409934185445309, "num_tokens": 19489554.0, "step": 2610 }, { "entropy": 1.815621118992567, "epoch": 0.17498893796074438, "grad_norm": 0.27371156215667725, "learning_rate": 4.915548670746418e-05, "loss": 0.243, "mean_token_accuracy": 0.9420837715268136, "num_tokens": 19561110.0, "step": 2620 }, { "entropy": 1.799737050384283, "epoch": 0.1756568346705182, "grad_norm": 0.3550506830215454, "learning_rate": 4.914041285053439e-05, "loss": 0.2688, "mean_token_accuracy": 0.9365224111825228, "num_tokens": 19634120.0, "step": 2630 }, { "entropy": 1.8204796224832536, "epoch": 0.17632473138029203, "grad_norm": 0.31795257329940796, "learning_rate": 4.912520801053262e-05, "loss": 0.2457, "mean_token_accuracy": 0.9405323587357998, "num_tokens": 19707007.0, "step": 2640 }, { "entropy": 1.7732565388083459, "epoch": 0.17699262809006588, "grad_norm": 0.3907810151576996, "learning_rate": 4.910987227012978e-05, "loss": 0.2114, "mean_token_accuracy": 0.9482876140624285, "num_tokens": 19781374.0, "step": 2650 }, { "entropy": 1.7709458693861961, "epoch": 0.1776605247998397, "grad_norm": 0.29372161626815796, "learning_rate": 4.909440571270855e-05, "loss": 0.2528, "mean_token_accuracy": 0.9390585873275995, "num_tokens": 19858000.0, "step": 2660 }, { "entropy": 1.7674592830240727, "epoch": 0.17832842150961353, "grad_norm": 0.3351532518863678, "learning_rate": 4.9078808422362805e-05, "loss": 0.2163, "mean_token_accuracy": 0.9467199422419071, "num_tokens": 19933532.0, "step": 2670 }, { "entropy": 1.8004688128829003, "epoch": 0.17899631821938738, "grad_norm": 0.30614417791366577, "learning_rate": 4.906308048389729e-05, "loss": 0.244, "mean_token_accuracy": 0.9407716311514378, "num_tokens": 20007969.0, "step": 2680 }, { "entropy": 1.79113230407238, "epoch": 0.1796642149291612, "grad_norm": 0.2519867420196533, "learning_rate": 4.9047221982827105e-05, "loss": 0.2408, "mean_token_accuracy": 0.9427142448723316, "num_tokens": 20082666.0, "step": 2690 }, { "entropy": 1.82162799090147, "epoch": 0.18033211163893503, "grad_norm": 0.32323145866394043, "learning_rate": 4.9031233005377205e-05, "loss": 0.2607, "mean_token_accuracy": 0.9416906431317329, "num_tokens": 20157796.0, "step": 2700 }, { "entropy": 1.8283264808356763, "epoch": 0.18100000834870889, "grad_norm": 0.4093096852302551, "learning_rate": 4.901511363848199e-05, "loss": 0.2477, "mean_token_accuracy": 0.9399809576570988, "num_tokens": 20231893.0, "step": 2710 }, { "entropy": 1.8407348856329917, "epoch": 0.1816679050584827, "grad_norm": 0.3175579905509949, "learning_rate": 4.89988639697848e-05, "loss": 0.2303, "mean_token_accuracy": 0.9450520567595959, "num_tokens": 20308296.0, "step": 2720 }, { "entropy": 1.8361914508044719, "epoch": 0.18233580176825653, "grad_norm": 0.343191534280777, "learning_rate": 4.8982484087637434e-05, "loss": 0.2444, "mean_token_accuracy": 0.9414731811732053, "num_tokens": 20381860.0, "step": 2730 }, { "entropy": 1.7833547614514829, "epoch": 0.18300369847803039, "grad_norm": 0.3247445225715637, "learning_rate": 4.8965974081099706e-05, "loss": 0.2349, "mean_token_accuracy": 0.9435523323714733, "num_tokens": 20458651.0, "step": 2740 }, { "entropy": 1.760952640324831, "epoch": 0.1836715951878042, "grad_norm": 0.3023550808429718, "learning_rate": 4.894933403993889e-05, "loss": 0.2337, "mean_token_accuracy": 0.9437456987798214, "num_tokens": 20532995.0, "step": 2750 }, { "entropy": 1.8257094100117683, "epoch": 0.18433949189757803, "grad_norm": 0.3648087680339813, "learning_rate": 4.893256405462933e-05, "loss": 0.2368, "mean_token_accuracy": 0.9426568791270256, "num_tokens": 20606639.0, "step": 2760 }, { "entropy": 1.8224825911223888, "epoch": 0.18500738860735189, "grad_norm": 0.3090004324913025, "learning_rate": 4.8915664216351864e-05, "loss": 0.2436, "mean_token_accuracy": 0.9429239921271801, "num_tokens": 20680686.0, "step": 2770 }, { "entropy": 1.8282977767288684, "epoch": 0.1856752853171257, "grad_norm": 0.4072166681289673, "learning_rate": 4.889863461699336e-05, "loss": 0.2481, "mean_token_accuracy": 0.9407894611358643, "num_tokens": 20753386.0, "step": 2780 }, { "entropy": 1.8297925420105456, "epoch": 0.18634318202689953, "grad_norm": 0.32134750485420227, "learning_rate": 4.888147534914623e-05, "loss": 0.2206, "mean_token_accuracy": 0.9439899358898401, "num_tokens": 20829573.0, "step": 2790 }, { "entropy": 1.8206966735422612, "epoch": 0.1870110787366734, "grad_norm": 0.3000108599662781, "learning_rate": 4.88641865061079e-05, "loss": 0.2377, "mean_token_accuracy": 0.9433749865740537, "num_tokens": 20904700.0, "step": 2800 }, { "entropy": 1.8035025045275688, "epoch": 0.1876789754464472, "grad_norm": 0.2725549042224884, "learning_rate": 4.884676818188032e-05, "loss": 0.2292, "mean_token_accuracy": 0.9448900416493415, "num_tokens": 20979907.0, "step": 2810 }, { "entropy": 1.7830322928726674, "epoch": 0.18834687215622103, "grad_norm": 0.43724963068962097, "learning_rate": 4.882922047116945e-05, "loss": 0.238, "mean_token_accuracy": 0.9456601191312075, "num_tokens": 21056711.0, "step": 2820 }, { "entropy": 1.7994263157248498, "epoch": 0.1890147688659949, "grad_norm": 0.29276999831199646, "learning_rate": 4.881154346938474e-05, "loss": 0.2368, "mean_token_accuracy": 0.9421561386436224, "num_tokens": 21132253.0, "step": 2830 }, { "entropy": 1.8200394950807095, "epoch": 0.1896826655757687, "grad_norm": 0.3760021924972534, "learning_rate": 4.879373727263861e-05, "loss": 0.2379, "mean_token_accuracy": 0.9416802622377872, "num_tokens": 21205481.0, "step": 2840 }, { "entropy": 1.82858549952507, "epoch": 0.19035056228554253, "grad_norm": 0.325962632894516, "learning_rate": 4.8775801977745944e-05, "loss": 0.2344, "mean_token_accuracy": 0.940724040567875, "num_tokens": 21279464.0, "step": 2850 }, { "entropy": 1.8095352806150913, "epoch": 0.1910184589953164, "grad_norm": 0.3366350531578064, "learning_rate": 4.875773768222354e-05, "loss": 0.2216, "mean_token_accuracy": 0.9457078546285629, "num_tokens": 21355141.0, "step": 2860 }, { "entropy": 1.7960414096713067, "epoch": 0.1916863557050902, "grad_norm": 0.32072076201438904, "learning_rate": 4.873954448428959e-05, "loss": 0.2184, "mean_token_accuracy": 0.9486239220947027, "num_tokens": 21428320.0, "step": 2870 }, { "entropy": 1.8340895384550095, "epoch": 0.19235425241486404, "grad_norm": 0.28964364528656006, "learning_rate": 4.872122248286316e-05, "loss": 0.2369, "mean_token_accuracy": 0.943690874427557, "num_tokens": 21503892.0, "step": 2880 }, { "entropy": 1.850197684764862, "epoch": 0.1930221491246379, "grad_norm": 0.3319382965564728, "learning_rate": 4.8702771777563646e-05, "loss": 0.2495, "mean_token_accuracy": 0.9389934357255697, "num_tokens": 21579873.0, "step": 2890 }, { "entropy": 1.8499460443854332, "epoch": 0.1936900458344117, "grad_norm": 0.3138546943664551, "learning_rate": 4.868419246871018e-05, "loss": 0.2293, "mean_token_accuracy": 0.9435185875743628, "num_tokens": 21653351.0, "step": 2900 }, { "entropy": 1.8294983595609664, "epoch": 0.19435794254418554, "grad_norm": 0.28921806812286377, "learning_rate": 4.866548465732118e-05, "loss": 0.2485, "mean_token_accuracy": 0.9417641393840313, "num_tokens": 21727321.0, "step": 2910 }, { "entropy": 1.850615631043911, "epoch": 0.1950258392539594, "grad_norm": 0.3138139843940735, "learning_rate": 4.864664844511373e-05, "loss": 0.2316, "mean_token_accuracy": 0.941710140183568, "num_tokens": 21801693.0, "step": 2920 }, { "entropy": 1.8938884772360325, "epoch": 0.1956937359637332, "grad_norm": 0.3019010126590729, "learning_rate": 4.862768393450304e-05, "loss": 0.2306, "mean_token_accuracy": 0.9423238437622785, "num_tokens": 21878352.0, "step": 2930 }, { "entropy": 1.834979911893606, "epoch": 0.19636163267350704, "grad_norm": 0.2476569563150406, "learning_rate": 4.860859122860193e-05, "loss": 0.2213, "mean_token_accuracy": 0.945951184630394, "num_tokens": 21955790.0, "step": 2940 }, { "entropy": 1.8118432722985744, "epoch": 0.1970295293832809, "grad_norm": 0.3174128234386444, "learning_rate": 4.85893704312202e-05, "loss": 0.2218, "mean_token_accuracy": 0.9457420982420445, "num_tokens": 22031599.0, "step": 2950 }, { "entropy": 1.8221365205943585, "epoch": 0.1976974260930547, "grad_norm": 0.3072435259819031, "learning_rate": 4.857002164686411e-05, "loss": 0.2449, "mean_token_accuracy": 0.9402021203190088, "num_tokens": 22105860.0, "step": 2960 }, { "entropy": 1.851933331042528, "epoch": 0.19836532280282854, "grad_norm": 0.28047919273376465, "learning_rate": 4.855054498073581e-05, "loss": 0.2308, "mean_token_accuracy": 0.9437161486595869, "num_tokens": 22178655.0, "step": 2970 }, { "entropy": 1.8283856086432935, "epoch": 0.1990332195126024, "grad_norm": 0.3457595705986023, "learning_rate": 4.853094053873278e-05, "loss": 0.2343, "mean_token_accuracy": 0.9423086777329445, "num_tokens": 22252851.0, "step": 2980 }, { "entropy": 1.8148655988276006, "epoch": 0.1997011162223762, "grad_norm": 0.27360469102859497, "learning_rate": 4.8511208427447194e-05, "loss": 0.2407, "mean_token_accuracy": 0.9426719162613153, "num_tokens": 22327247.0, "step": 2990 }, { "entropy": 1.844046352058649, "epoch": 0.20036901293215004, "grad_norm": 0.36052948236465454, "learning_rate": 4.849134875416542e-05, "loss": 0.2425, "mean_token_accuracy": 0.9421751528978348, "num_tokens": 22402103.0, "step": 3000 }, { "epoch": 0.20036901293215004, "eval_entropy": 1.8109371545791626, "eval_loss": 0.25382745265960693, "eval_mean_token_accuracy": 0.9431343225717544, "eval_num_tokens": 22402103.0, "eval_runtime": 554.0002, "eval_samples_per_second": 36.101, "eval_steps_per_second": 9.025, "step": 3000 }, { "entropy": 1.8049564428627491, "epoch": 0.2010369096419239, "grad_norm": 0.3022690415382385, "learning_rate": 4.8471361626867385e-05, "loss": 0.2247, "mean_token_accuracy": 0.9441684324294328, "num_tokens": 22477985.0, "step": 3010 }, { "entropy": 1.8117576189339162, "epoch": 0.2017048063516977, "grad_norm": 0.3053519129753113, "learning_rate": 4.8451247154225994e-05, "loss": 0.2536, "mean_token_accuracy": 0.9388801921159029, "num_tokens": 22553192.0, "step": 3020 }, { "entropy": 1.7961050122976303, "epoch": 0.20237270306147154, "grad_norm": 0.2798187732696533, "learning_rate": 4.843100544560655e-05, "loss": 0.2395, "mean_token_accuracy": 0.9425423514097929, "num_tokens": 22629440.0, "step": 3030 }, { "entropy": 1.8528731279075146, "epoch": 0.2030405997712454, "grad_norm": 0.32638564705848694, "learning_rate": 4.841063661106618e-05, "loss": 0.2321, "mean_token_accuracy": 0.9433439329266549, "num_tokens": 22704720.0, "step": 3040 }, { "entropy": 1.8354654036462308, "epoch": 0.2037084964810192, "grad_norm": 0.3027002215385437, "learning_rate": 4.839014076135318e-05, "loss": 0.2388, "mean_token_accuracy": 0.9438424319028854, "num_tokens": 22778022.0, "step": 3050 }, { "entropy": 1.7913148306310176, "epoch": 0.20437639319079304, "grad_norm": 0.3384620249271393, "learning_rate": 4.8369518007906464e-05, "loss": 0.2292, "mean_token_accuracy": 0.9437200121581555, "num_tokens": 22851343.0, "step": 3060 }, { "entropy": 1.7788014896214008, "epoch": 0.2050442899005669, "grad_norm": 0.3399059772491455, "learning_rate": 4.834876846285494e-05, "loss": 0.2378, "mean_token_accuracy": 0.9435754213482141, "num_tokens": 22925055.0, "step": 3070 }, { "entropy": 1.7674326702952385, "epoch": 0.2057121866103407, "grad_norm": 0.3759543299674988, "learning_rate": 4.832789223901689e-05, "loss": 0.2321, "mean_token_accuracy": 0.9434260703623295, "num_tokens": 23001078.0, "step": 3080 }, { "entropy": 1.823313407599926, "epoch": 0.20638008332011454, "grad_norm": 0.2871500551700592, "learning_rate": 4.830688944989938e-05, "loss": 0.2435, "mean_token_accuracy": 0.940041083842516, "num_tokens": 23077193.0, "step": 3090 }, { "entropy": 1.7994055196642875, "epoch": 0.2070479800298884, "grad_norm": 0.27684858441352844, "learning_rate": 4.828576020969762e-05, "loss": 0.224, "mean_token_accuracy": 0.9467190150171518, "num_tokens": 23152633.0, "step": 3100 }, { "entropy": 1.7518393844366074, "epoch": 0.20771587673966221, "grad_norm": 0.4524850845336914, "learning_rate": 4.826450463329436e-05, "loss": 0.2477, "mean_token_accuracy": 0.9389440231025219, "num_tokens": 23223527.0, "step": 3110 }, { "entropy": 1.7778724975883962, "epoch": 0.20838377344943604, "grad_norm": 0.37888818979263306, "learning_rate": 4.824312283625925e-05, "loss": 0.2388, "mean_token_accuracy": 0.940614327415824, "num_tokens": 23293540.0, "step": 3120 }, { "entropy": 1.7527782574295998, "epoch": 0.2090516701592099, "grad_norm": 0.29386237263679504, "learning_rate": 4.822161493484822e-05, "loss": 0.2541, "mean_token_accuracy": 0.9378659635782242, "num_tokens": 23366494.0, "step": 3130 }, { "entropy": 1.7559617906808853, "epoch": 0.20971956686898371, "grad_norm": 0.2850927710533142, "learning_rate": 4.819998104600286e-05, "loss": 0.2407, "mean_token_accuracy": 0.9400011789053678, "num_tokens": 23440754.0, "step": 3140 }, { "entropy": 1.8102621376514434, "epoch": 0.21038746357875754, "grad_norm": 0.30684709548950195, "learning_rate": 4.8178221287349764e-05, "loss": 0.245, "mean_token_accuracy": 0.941274481266737, "num_tokens": 23513489.0, "step": 3150 }, { "entropy": 1.8046070531010627, "epoch": 0.2110553602885314, "grad_norm": 0.32182544469833374, "learning_rate": 4.8156335777199906e-05, "loss": 0.2416, "mean_token_accuracy": 0.9421315606683492, "num_tokens": 23585829.0, "step": 3160 }, { "entropy": 1.755084903538227, "epoch": 0.21172325699830521, "grad_norm": 0.3017768859863281, "learning_rate": 4.8134324634547966e-05, "loss": 0.2286, "mean_token_accuracy": 0.9476879339665174, "num_tokens": 23657471.0, "step": 3170 }, { "entropy": 1.7735888287425041, "epoch": 0.21239115370807904, "grad_norm": 0.30247068405151367, "learning_rate": 4.811218797907173e-05, "loss": 0.226, "mean_token_accuracy": 0.9445185609161854, "num_tokens": 23731517.0, "step": 3180 }, { "entropy": 1.7969969406723976, "epoch": 0.2130590504178529, "grad_norm": 0.3549629747867584, "learning_rate": 4.808992593113141e-05, "loss": 0.2358, "mean_token_accuracy": 0.945430938899517, "num_tokens": 23806169.0, "step": 3190 }, { "entropy": 1.8177655592560769, "epoch": 0.21372694712762672, "grad_norm": 0.3350241780281067, "learning_rate": 4.8067538611768995e-05, "loss": 0.2433, "mean_token_accuracy": 0.943061376735568, "num_tokens": 23880228.0, "step": 3200 }, { "entropy": 1.8541865468025207, "epoch": 0.21439484383740054, "grad_norm": 0.3743235468864441, "learning_rate": 4.8045026142707585e-05, "loss": 0.2614, "mean_token_accuracy": 0.935718546807766, "num_tokens": 23952692.0, "step": 3210 }, { "entropy": 1.830523307621479, "epoch": 0.2150627405471744, "grad_norm": 0.291801393032074, "learning_rate": 4.802238864635073e-05, "loss": 0.2484, "mean_token_accuracy": 0.9374997280538082, "num_tokens": 24028103.0, "step": 3220 }, { "entropy": 1.7853223897516728, "epoch": 0.21573063725694822, "grad_norm": 0.29808318614959717, "learning_rate": 4.799962624578181e-05, "loss": 0.2304, "mean_token_accuracy": 0.9421184424310922, "num_tokens": 24103005.0, "step": 3230 }, { "entropy": 1.8096862316131592, "epoch": 0.21639853396672204, "grad_norm": 0.3377639055252075, "learning_rate": 4.797673906476328e-05, "loss": 0.2327, "mean_token_accuracy": 0.9450104378163815, "num_tokens": 24174517.0, "step": 3240 }, { "entropy": 1.7864435084164143, "epoch": 0.2170664306764959, "grad_norm": 0.35219600796699524, "learning_rate": 4.795372722773608e-05, "loss": 0.2223, "mean_token_accuracy": 0.9452082689851522, "num_tokens": 24249275.0, "step": 3250 }, { "entropy": 1.842170026898384, "epoch": 0.21773432738626972, "grad_norm": 0.2833854556083679, "learning_rate": 4.7930590859818893e-05, "loss": 0.245, "mean_token_accuracy": 0.9390489414334298, "num_tokens": 24324467.0, "step": 3260 }, { "entropy": 1.809202066808939, "epoch": 0.21840222409604354, "grad_norm": 0.3260651230812073, "learning_rate": 4.790733008680753e-05, "loss": 0.2351, "mean_token_accuracy": 0.9439034074544906, "num_tokens": 24400522.0, "step": 3270 }, { "entropy": 1.8304984860122204, "epoch": 0.2190701208058174, "grad_norm": 0.2720033824443817, "learning_rate": 4.7883945035174175e-05, "loss": 0.2296, "mean_token_accuracy": 0.9467284128069877, "num_tokens": 24476561.0, "step": 3280 }, { "entropy": 1.824673803895712, "epoch": 0.21973801751559122, "grad_norm": 0.32116538286209106, "learning_rate": 4.7860435832066765e-05, "loss": 0.2496, "mean_token_accuracy": 0.9417725473642349, "num_tokens": 24549445.0, "step": 3290 }, { "entropy": 1.8653734281659127, "epoch": 0.22040591422536504, "grad_norm": 0.25364255905151367, "learning_rate": 4.7836802605308224e-05, "loss": 0.2247, "mean_token_accuracy": 0.9449461746960879, "num_tokens": 24624106.0, "step": 3300 }, { "entropy": 1.8543301723897456, "epoch": 0.2210738109351389, "grad_norm": 0.3310909569263458, "learning_rate": 4.781304548339586e-05, "loss": 0.2431, "mean_token_accuracy": 0.9421414006501436, "num_tokens": 24698207.0, "step": 3310 }, { "entropy": 1.8697098560631276, "epoch": 0.22174170764491272, "grad_norm": 0.30037450790405273, "learning_rate": 4.778916459550059e-05, "loss": 0.2311, "mean_token_accuracy": 0.9462303768843412, "num_tokens": 24771943.0, "step": 3320 }, { "entropy": 1.816944743692875, "epoch": 0.22240960435468654, "grad_norm": 0.2789921164512634, "learning_rate": 4.7765160071466255e-05, "loss": 0.2325, "mean_token_accuracy": 0.9444701805710792, "num_tokens": 24846612.0, "step": 3330 }, { "entropy": 1.8986338444054127, "epoch": 0.2230775010644604, "grad_norm": 0.2924051582813263, "learning_rate": 4.774103204180896e-05, "loss": 0.2459, "mean_token_accuracy": 0.9418189588934183, "num_tokens": 24917314.0, "step": 3340 }, { "entropy": 1.8245647922158241, "epoch": 0.22374539777423422, "grad_norm": 0.28584960103034973, "learning_rate": 4.771678063771628e-05, "loss": 0.2307, "mean_token_accuracy": 0.9448101501911879, "num_tokens": 24994662.0, "step": 3350 }, { "entropy": 1.8702694348990918, "epoch": 0.22441329448400804, "grad_norm": 0.3350934684276581, "learning_rate": 4.7692405991046646e-05, "loss": 0.2314, "mean_token_accuracy": 0.9442384645342827, "num_tokens": 25068785.0, "step": 3360 }, { "entropy": 1.8374993085861206, "epoch": 0.2250811911937819, "grad_norm": 0.24896343052387238, "learning_rate": 4.766790823432852e-05, "loss": 0.229, "mean_token_accuracy": 0.9465972561389208, "num_tokens": 25145338.0, "step": 3370 }, { "entropy": 1.867978721857071, "epoch": 0.22574908790355572, "grad_norm": 0.34039804339408875, "learning_rate": 4.764328750075978e-05, "loss": 0.2367, "mean_token_accuracy": 0.944473821669817, "num_tokens": 25220859.0, "step": 3380 }, { "entropy": 1.8610978439450263, "epoch": 0.22641698461332954, "grad_norm": 0.3372277319431305, "learning_rate": 4.7618543924206935e-05, "loss": 0.2565, "mean_token_accuracy": 0.9431333035230637, "num_tokens": 25294781.0, "step": 3390 }, { "entropy": 1.8835390880703926, "epoch": 0.2270848813231034, "grad_norm": 0.3769782483577728, "learning_rate": 4.759367763920439e-05, "loss": 0.2497, "mean_token_accuracy": 0.9379332199692726, "num_tokens": 25369069.0, "step": 3400 }, { "entropy": 1.8768240429461003, "epoch": 0.22775277803287722, "grad_norm": 0.32036513090133667, "learning_rate": 4.756868878095374e-05, "loss": 0.2289, "mean_token_accuracy": 0.9450360585004092, "num_tokens": 25444795.0, "step": 3410 }, { "entropy": 1.9017126262187958, "epoch": 0.22842067474265104, "grad_norm": 0.28228071331977844, "learning_rate": 4.7543577485323065e-05, "loss": 0.2594, "mean_token_accuracy": 0.9393475946038962, "num_tokens": 25519254.0, "step": 3420 }, { "entropy": 1.8318243347108365, "epoch": 0.2290885714524249, "grad_norm": 0.28551679849624634, "learning_rate": 4.75183438888461e-05, "loss": 0.2339, "mean_token_accuracy": 0.9436967823654413, "num_tokens": 25593483.0, "step": 3430 }, { "entropy": 1.8500353939831258, "epoch": 0.22975646816219872, "grad_norm": 0.26876312494277954, "learning_rate": 4.7492988128721565e-05, "loss": 0.2368, "mean_token_accuracy": 0.9435034118592739, "num_tokens": 25669434.0, "step": 3440 }, { "entropy": 1.830290822684765, "epoch": 0.23042436487197254, "grad_norm": 0.2895486354827881, "learning_rate": 4.7467510342812435e-05, "loss": 0.2247, "mean_token_accuracy": 0.945241654664278, "num_tokens": 25744924.0, "step": 3450 }, { "entropy": 1.8303662419319153, "epoch": 0.2310922615817464, "grad_norm": 0.2706555724143982, "learning_rate": 4.744191066964511e-05, "loss": 0.2257, "mean_token_accuracy": 0.9461141012609005, "num_tokens": 25821606.0, "step": 3460 }, { "entropy": 1.8629770003259183, "epoch": 0.23176015829152022, "grad_norm": 0.2680894136428833, "learning_rate": 4.741618924840874e-05, "loss": 0.2191, "mean_token_accuracy": 0.9460224557667971, "num_tokens": 25898667.0, "step": 3470 }, { "entropy": 1.85146396830678, "epoch": 0.23242805500129404, "grad_norm": 0.34949150681495667, "learning_rate": 4.739034621895443e-05, "loss": 0.2533, "mean_token_accuracy": 0.9408930767327547, "num_tokens": 25974131.0, "step": 3480 }, { "entropy": 1.8315501116216182, "epoch": 0.2330959517110679, "grad_norm": 0.3140328824520111, "learning_rate": 4.736438172179446e-05, "loss": 0.2148, "mean_token_accuracy": 0.947515569999814, "num_tokens": 26050557.0, "step": 3490 }, { "entropy": 1.8211340382695198, "epoch": 0.23376384842084172, "grad_norm": 0.32769250869750977, "learning_rate": 4.73382958981016e-05, "loss": 0.234, "mean_token_accuracy": 0.942050764709711, "num_tokens": 26123638.0, "step": 3500 }, { "entropy": 1.8524242155253887, "epoch": 0.23443174513061554, "grad_norm": 0.2564964294433594, "learning_rate": 4.731208888970825e-05, "loss": 0.2335, "mean_token_accuracy": 0.9442535698413849, "num_tokens": 26197843.0, "step": 3510 }, { "entropy": 1.88613108843565, "epoch": 0.2350996418403894, "grad_norm": 0.24955983459949493, "learning_rate": 4.7285760839105706e-05, "loss": 0.2294, "mean_token_accuracy": 0.941499026119709, "num_tokens": 26271783.0, "step": 3520 }, { "entropy": 1.8038532249629498, "epoch": 0.23576753855016322, "grad_norm": 0.30114203691482544, "learning_rate": 4.725931188944342e-05, "loss": 0.2248, "mean_token_accuracy": 0.9469171680510045, "num_tokens": 26347502.0, "step": 3530 }, { "entropy": 1.8166924223303795, "epoch": 0.23643543525993704, "grad_norm": 0.2860889732837677, "learning_rate": 4.7232742184528155e-05, "loss": 0.2489, "mean_token_accuracy": 0.941021029278636, "num_tokens": 26422797.0, "step": 3540 }, { "entropy": 1.8762867979705333, "epoch": 0.2371033319697109, "grad_norm": 0.29442188143730164, "learning_rate": 4.7206051868823264e-05, "loss": 0.2365, "mean_token_accuracy": 0.942730788514018, "num_tokens": 26496425.0, "step": 3550 }, { "entropy": 1.8776430949568748, "epoch": 0.23777122867948472, "grad_norm": 0.26039785146713257, "learning_rate": 4.717924108744787e-05, "loss": 0.2224, "mean_token_accuracy": 0.9473829843103886, "num_tokens": 26573687.0, "step": 3560 }, { "entropy": 1.8724658526480198, "epoch": 0.23843912538925854, "grad_norm": 0.30388835072517395, "learning_rate": 4.7152309986176077e-05, "loss": 0.2328, "mean_token_accuracy": 0.9449579548090696, "num_tokens": 26649187.0, "step": 3570 }, { "entropy": 1.8556077405810356, "epoch": 0.2391070220990324, "grad_norm": 0.28188958764076233, "learning_rate": 4.712525871143619e-05, "loss": 0.2249, "mean_token_accuracy": 0.944434067979455, "num_tokens": 26724611.0, "step": 3580 }, { "entropy": 1.890062303096056, "epoch": 0.23977491880880622, "grad_norm": 0.34954994916915894, "learning_rate": 4.709808741030992e-05, "loss": 0.2336, "mean_token_accuracy": 0.9438429970294238, "num_tokens": 26798982.0, "step": 3590 }, { "entropy": 1.877310136705637, "epoch": 0.24044281551858004, "grad_norm": 0.27162179350852966, "learning_rate": 4.707079623053159e-05, "loss": 0.2297, "mean_token_accuracy": 0.9456120621412992, "num_tokens": 26873337.0, "step": 3600 }, { "entropy": 1.8258368089795112, "epoch": 0.2411107122283539, "grad_norm": 0.2752111256122589, "learning_rate": 4.704338532048728e-05, "loss": 0.2201, "mean_token_accuracy": 0.9444967415183783, "num_tokens": 26947217.0, "step": 3610 }, { "entropy": 1.8778181873261928, "epoch": 0.24177860893812772, "grad_norm": 0.30664199590682983, "learning_rate": 4.7015854829214104e-05, "loss": 0.2286, "mean_token_accuracy": 0.943577378988266, "num_tokens": 27019170.0, "step": 3620 }, { "entropy": 1.8909952104091645, "epoch": 0.24244650564790154, "grad_norm": 0.298827588558197, "learning_rate": 4.6988204906399355e-05, "loss": 0.2147, "mean_token_accuracy": 0.9472693510353565, "num_tokens": 27093645.0, "step": 3630 }, { "entropy": 1.909240224212408, "epoch": 0.2431144023576754, "grad_norm": 0.3560390770435333, "learning_rate": 4.696043570237964e-05, "loss": 0.2495, "mean_token_accuracy": 0.9418341901153326, "num_tokens": 27168714.0, "step": 3640 }, { "entropy": 1.8704890042543412, "epoch": 0.24378229906744922, "grad_norm": 0.316654235124588, "learning_rate": 4.693254736814017e-05, "loss": 0.2495, "mean_token_accuracy": 0.9396880820393563, "num_tokens": 27242321.0, "step": 3650 }, { "entropy": 1.8840535148978232, "epoch": 0.24445019577722304, "grad_norm": 0.29791778326034546, "learning_rate": 4.690454005531388e-05, "loss": 0.2328, "mean_token_accuracy": 0.9429134096950292, "num_tokens": 27316492.0, "step": 3660 }, { "entropy": 1.8875044971704482, "epoch": 0.2451180924869969, "grad_norm": 0.3188786506652832, "learning_rate": 4.6876413916180576e-05, "loss": 0.2233, "mean_token_accuracy": 0.9476851027458906, "num_tokens": 27390030.0, "step": 3670 }, { "entropy": 1.8899781942367553, "epoch": 0.24578598919677072, "grad_norm": 0.267020583152771, "learning_rate": 4.684816910366618e-05, "loss": 0.2395, "mean_token_accuracy": 0.9413978833705187, "num_tokens": 27466229.0, "step": 3680 }, { "entropy": 1.879320028424263, "epoch": 0.24645388590654455, "grad_norm": 0.2677568793296814, "learning_rate": 4.6819805771341814e-05, "loss": 0.216, "mean_token_accuracy": 0.9485225848853588, "num_tokens": 27543372.0, "step": 3690 }, { "entropy": 1.8553839147090911, "epoch": 0.2471217826163184, "grad_norm": 0.28572285175323486, "learning_rate": 4.679132407342305e-05, "loss": 0.2354, "mean_token_accuracy": 0.9409180752933025, "num_tokens": 27616468.0, "step": 3700 }, { "entropy": 1.8926606640219688, "epoch": 0.24778967932609222, "grad_norm": 0.3074871003627777, "learning_rate": 4.6762724164769014e-05, "loss": 0.2404, "mean_token_accuracy": 0.9434654451906681, "num_tokens": 27691489.0, "step": 3710 }, { "entropy": 1.8878293678164482, "epoch": 0.24845757603586605, "grad_norm": 0.26660841703414917, "learning_rate": 4.673400620088155e-05, "loss": 0.2258, "mean_token_accuracy": 0.9468064650893211, "num_tokens": 27767282.0, "step": 3720 }, { "entropy": 1.9093123912811278, "epoch": 0.2491254727456399, "grad_norm": 0.242268905043602, "learning_rate": 4.670517033790441e-05, "loss": 0.2229, "mean_token_accuracy": 0.944462651014328, "num_tokens": 27842357.0, "step": 3730 }, { "entropy": 1.8764431931078434, "epoch": 0.24979336945541372, "grad_norm": 0.30574408173561096, "learning_rate": 4.6676216732622367e-05, "loss": 0.2333, "mean_token_accuracy": 0.9444595023989677, "num_tokens": 27918261.0, "step": 3740 }, { "entropy": 1.8780780017375946, "epoch": 0.25046126616518755, "grad_norm": 0.28927671909332275, "learning_rate": 4.6647145542460356e-05, "loss": 0.2226, "mean_token_accuracy": 0.9472949348390103, "num_tokens": 27996751.0, "step": 3750 }, { "entropy": 1.8979285068809986, "epoch": 0.2511291628749614, "grad_norm": 0.3261164426803589, "learning_rate": 4.6617956925482685e-05, "loss": 0.2536, "mean_token_accuracy": 0.9386015087366104, "num_tokens": 28069416.0, "step": 3760 }, { "entropy": 1.9287927523255348, "epoch": 0.2517970595847352, "grad_norm": 0.2858129143714905, "learning_rate": 4.658865104039208e-05, "loss": 0.2466, "mean_token_accuracy": 0.942908226698637, "num_tokens": 28145828.0, "step": 3770 }, { "entropy": 1.8883475452661513, "epoch": 0.25246495629450905, "grad_norm": 0.30416712164878845, "learning_rate": 4.655922804652891e-05, "loss": 0.2286, "mean_token_accuracy": 0.9443699412047863, "num_tokens": 28221045.0, "step": 3780 }, { "entropy": 1.9357228808104991, "epoch": 0.2531328530042829, "grad_norm": 0.31053051352500916, "learning_rate": 4.6529688103870264e-05, "loss": 0.2448, "mean_token_accuracy": 0.9393238201737404, "num_tokens": 28294449.0, "step": 3790 }, { "entropy": 1.8701168105006218, "epoch": 0.2538007497140567, "grad_norm": 0.2875557839870453, "learning_rate": 4.650003137302908e-05, "loss": 0.2263, "mean_token_accuracy": 0.9480938505381346, "num_tokens": 28370048.0, "step": 3800 }, { "entropy": 1.9043088875710965, "epoch": 0.25446864642383055, "grad_norm": 0.38767239451408386, "learning_rate": 4.647025801525333e-05, "loss": 0.2409, "mean_token_accuracy": 0.9406221088021993, "num_tokens": 28445602.0, "step": 3810 }, { "entropy": 1.9278858952224254, "epoch": 0.2551365431336044, "grad_norm": 0.3644951581954956, "learning_rate": 4.644036819242506e-05, "loss": 0.2379, "mean_token_accuracy": 0.9439516618847847, "num_tokens": 28519403.0, "step": 3820 }, { "entropy": 1.9014289505779742, "epoch": 0.2558044398433782, "grad_norm": 0.30445632338523865, "learning_rate": 4.641036206705961e-05, "loss": 0.2347, "mean_token_accuracy": 0.943390891700983, "num_tokens": 28595357.0, "step": 3830 }, { "entropy": 1.8606593564152718, "epoch": 0.25647233655315205, "grad_norm": 0.3390524387359619, "learning_rate": 4.63802398023046e-05, "loss": 0.2349, "mean_token_accuracy": 0.9411648731678725, "num_tokens": 28672079.0, "step": 3840 }, { "entropy": 1.8884294882416726, "epoch": 0.2571402332629259, "grad_norm": 0.4061954617500305, "learning_rate": 4.635000156193918e-05, "loss": 0.2414, "mean_token_accuracy": 0.9413364317268134, "num_tokens": 28744711.0, "step": 3850 }, { "entropy": 1.874824495613575, "epoch": 0.2578081299726997, "grad_norm": 0.2919199764728546, "learning_rate": 4.6319647510373046e-05, "loss": 0.2385, "mean_token_accuracy": 0.9417082604020834, "num_tokens": 28819375.0, "step": 3860 }, { "entropy": 1.8597666814923286, "epoch": 0.25847602668247355, "grad_norm": 0.5549324154853821, "learning_rate": 4.6289177812645586e-05, "loss": 0.2366, "mean_token_accuracy": 0.9450602639466524, "num_tokens": 28891975.0, "step": 3870 }, { "entropy": 1.8977480821311474, "epoch": 0.2591439233922474, "grad_norm": 0.4319974482059479, "learning_rate": 4.6258592634424976e-05, "loss": 0.2528, "mean_token_accuracy": 0.9396120455116034, "num_tokens": 28964117.0, "step": 3880 }, { "entropy": 1.8904687605798245, "epoch": 0.2598118201020212, "grad_norm": 0.25685828924179077, "learning_rate": 4.622789214200726e-05, "loss": 0.2409, "mean_token_accuracy": 0.9404903642833233, "num_tokens": 29039759.0, "step": 3890 }, { "entropy": 1.8698497407138348, "epoch": 0.26047971681179505, "grad_norm": 0.34948089718818665, "learning_rate": 4.6197076502315474e-05, "loss": 0.2402, "mean_token_accuracy": 0.9440975349396468, "num_tokens": 29113336.0, "step": 3900 }, { "entropy": 1.915880484879017, "epoch": 0.2611476135215689, "grad_norm": 0.34970033168792725, "learning_rate": 4.616614588289872e-05, "loss": 0.2535, "mean_token_accuracy": 0.9414620477706194, "num_tokens": 29186923.0, "step": 3910 }, { "entropy": 1.8937527641654015, "epoch": 0.2618155102313427, "grad_norm": 0.3331890404224396, "learning_rate": 4.6135100451931276e-05, "loss": 0.2425, "mean_token_accuracy": 0.9413011107593775, "num_tokens": 29260423.0, "step": 3920 }, { "entropy": 1.9137082055211068, "epoch": 0.26248340694111655, "grad_norm": 0.381989449262619, "learning_rate": 4.6103940378211656e-05, "loss": 0.2396, "mean_token_accuracy": 0.9424898091703653, "num_tokens": 29335203.0, "step": 3930 }, { "entropy": 1.864582545310259, "epoch": 0.2631513036508904, "grad_norm": 0.29004234075546265, "learning_rate": 4.607266583116171e-05, "loss": 0.2261, "mean_token_accuracy": 0.9446154166013002, "num_tokens": 29408831.0, "step": 3940 }, { "entropy": 1.8831079982221126, "epoch": 0.2638192003606642, "grad_norm": 0.3435479998588562, "learning_rate": 4.604127698082567e-05, "loss": 0.2538, "mean_token_accuracy": 0.940527680888772, "num_tokens": 29481179.0, "step": 3950 }, { "entropy": 1.8447520434856415, "epoch": 0.26448709707043805, "grad_norm": 0.2671530544757843, "learning_rate": 4.600977399786929e-05, "loss": 0.2331, "mean_token_accuracy": 0.9435788184404373, "num_tokens": 29556624.0, "step": 3960 }, { "entropy": 1.8865703962743283, "epoch": 0.2651549937802119, "grad_norm": 0.29622238874435425, "learning_rate": 4.5978157053578854e-05, "loss": 0.2623, "mean_token_accuracy": 0.9372790973633528, "num_tokens": 29629336.0, "step": 3970 }, { "entropy": 1.839417278766632, "epoch": 0.2658228904899857, "grad_norm": 0.2559685707092285, "learning_rate": 4.5946426319860284e-05, "loss": 0.2318, "mean_token_accuracy": 0.9451282382011413, "num_tokens": 29705947.0, "step": 3980 }, { "entropy": 1.8560559064149857, "epoch": 0.26649078719975955, "grad_norm": 0.38469651341438293, "learning_rate": 4.591458196923818e-05, "loss": 0.2322, "mean_token_accuracy": 0.9416191060096025, "num_tokens": 29779966.0, "step": 3990 }, { "entropy": 1.9010761491954327, "epoch": 0.2671586839095334, "grad_norm": 0.38259655237197876, "learning_rate": 4.5882624174854894e-05, "loss": 0.2528, "mean_token_accuracy": 0.9391449630260468, "num_tokens": 29853036.0, "step": 4000 }, { "epoch": 0.2671586839095334, "eval_entropy": 1.901148555612564, "eval_loss": 0.2492472380399704, "eval_mean_token_accuracy": 0.9440275570511818, "eval_num_tokens": 29853036.0, "eval_runtime": 553.7327, "eval_samples_per_second": 36.119, "eval_steps_per_second": 9.03, "step": 4000 }, { "entropy": 1.8866844855248928, "epoch": 0.2678265806193072, "grad_norm": 0.26135289669036865, "learning_rate": 4.5850553110469606e-05, "loss": 0.2216, "mean_token_accuracy": 0.9460945274680853, "num_tokens": 29928613.0, "step": 4010 }, { "entropy": 1.8946465224027633, "epoch": 0.26849447732908105, "grad_norm": 0.2813650667667389, "learning_rate": 4.5818368950457345e-05, "loss": 0.2403, "mean_token_accuracy": 0.9423510797321797, "num_tokens": 30005051.0, "step": 4020 }, { "entropy": 1.8805329866707325, "epoch": 0.2691623740388549, "grad_norm": 0.32251104712486267, "learning_rate": 4.578607186980807e-05, "loss": 0.2138, "mean_token_accuracy": 0.9491134345531463, "num_tokens": 30079427.0, "step": 4030 }, { "entropy": 1.870673867315054, "epoch": 0.2698302707486287, "grad_norm": 0.32249370217323303, "learning_rate": 4.575366204412567e-05, "loss": 0.2129, "mean_token_accuracy": 0.9503507029265166, "num_tokens": 30153707.0, "step": 4040 }, { "entropy": 1.8925836361944675, "epoch": 0.27049816745840255, "grad_norm": 0.3650279939174652, "learning_rate": 4.5721139649627106e-05, "loss": 0.2309, "mean_token_accuracy": 0.9465401224792004, "num_tokens": 30227660.0, "step": 4050 }, { "entropy": 1.9027898274362087, "epoch": 0.2711660641681764, "grad_norm": 0.3059157133102417, "learning_rate": 4.568850486314133e-05, "loss": 0.2364, "mean_token_accuracy": 0.9449421457946301, "num_tokens": 30301084.0, "step": 4060 }, { "entropy": 1.9198800154030322, "epoch": 0.2718339608779502, "grad_norm": 0.3443954885005951, "learning_rate": 4.5655757862108426e-05, "loss": 0.2385, "mean_token_accuracy": 0.9415464106947183, "num_tokens": 30373637.0, "step": 4070 }, { "entropy": 1.8452917598187923, "epoch": 0.27250185758772405, "grad_norm": 0.3252948820590973, "learning_rate": 4.56228988245786e-05, "loss": 0.2366, "mean_token_accuracy": 0.9430207271128893, "num_tokens": 30449169.0, "step": 4080 }, { "entropy": 1.9020006403326988, "epoch": 0.2731697542974979, "grad_norm": 0.3423897325992584, "learning_rate": 4.55899279292112e-05, "loss": 0.2346, "mean_token_accuracy": 0.9429361525923013, "num_tokens": 30523259.0, "step": 4090 }, { "entropy": 1.8965322069823742, "epoch": 0.2738376510072717, "grad_norm": 0.29990923404693604, "learning_rate": 4.555684535527377e-05, "loss": 0.2293, "mean_token_accuracy": 0.9427106875926257, "num_tokens": 30598924.0, "step": 4100 }, { "entropy": 1.8720484122633934, "epoch": 0.27450554771704555, "grad_norm": 0.25237590074539185, "learning_rate": 4.552365128264107e-05, "loss": 0.225, "mean_token_accuracy": 0.946211227029562, "num_tokens": 30675727.0, "step": 4110 }, { "entropy": 1.847211516648531, "epoch": 0.2751734444268194, "grad_norm": 0.3517327308654785, "learning_rate": 4.549034589179409e-05, "loss": 0.2322, "mean_token_accuracy": 0.9446510747075081, "num_tokens": 30749848.0, "step": 4120 }, { "entropy": 1.8402021639049053, "epoch": 0.2758413411365932, "grad_norm": 0.3106963038444519, "learning_rate": 4.545692936381907e-05, "loss": 0.2184, "mean_token_accuracy": 0.9477717727422714, "num_tokens": 30824000.0, "step": 4130 }, { "entropy": 1.8828895375132562, "epoch": 0.27650923784636705, "grad_norm": 0.35134467482566833, "learning_rate": 4.5423401880406546e-05, "loss": 0.2261, "mean_token_accuracy": 0.9444015204906464, "num_tokens": 30896221.0, "step": 4140 }, { "entropy": 1.8295325577259063, "epoch": 0.2771771345561409, "grad_norm": 0.2969716787338257, "learning_rate": 4.53897636238503e-05, "loss": 0.208, "mean_token_accuracy": 0.949476208910346, "num_tokens": 30971589.0, "step": 4150 }, { "entropy": 1.8696855299174786, "epoch": 0.2778450312659147, "grad_norm": 0.3581697344779968, "learning_rate": 4.53560147770464e-05, "loss": 0.2359, "mean_token_accuracy": 0.943967666849494, "num_tokens": 31044164.0, "step": 4160 }, { "entropy": 1.8627238169312477, "epoch": 0.27851292797568855, "grad_norm": 0.2857859432697296, "learning_rate": 4.532215552349224e-05, "loss": 0.2303, "mean_token_accuracy": 0.9427007786929608, "num_tokens": 31117045.0, "step": 4170 }, { "entropy": 1.8972482278943061, "epoch": 0.2791808246854624, "grad_norm": 0.29394519329071045, "learning_rate": 4.52881860472855e-05, "loss": 0.2394, "mean_token_accuracy": 0.9426060736179351, "num_tokens": 31191061.0, "step": 4180 }, { "entropy": 1.8200726546347141, "epoch": 0.2798487213952362, "grad_norm": 0.3024114966392517, "learning_rate": 4.5254106533123154e-05, "loss": 0.2272, "mean_token_accuracy": 0.9430060673505067, "num_tokens": 31267549.0, "step": 4190 }, { "entropy": 1.8552132204174996, "epoch": 0.28051661810501005, "grad_norm": 0.3161923289299011, "learning_rate": 4.521991716630046e-05, "loss": 0.2262, "mean_token_accuracy": 0.9449829947203398, "num_tokens": 31343976.0, "step": 4200 }, { "entropy": 1.8349798373878001, "epoch": 0.2811845148147839, "grad_norm": 0.3157711327075958, "learning_rate": 4.518561813270997e-05, "loss": 0.2353, "mean_token_accuracy": 0.9441523414105177, "num_tokens": 31416981.0, "step": 4210 }, { "entropy": 1.8618488132953643, "epoch": 0.2818524115245577, "grad_norm": 0.256456196308136, "learning_rate": 4.5151209618840516e-05, "loss": 0.2258, "mean_token_accuracy": 0.9452581308782101, "num_tokens": 31492733.0, "step": 4220 }, { "entropy": 1.8773194417357444, "epoch": 0.28252030823433155, "grad_norm": 0.2675033509731293, "learning_rate": 4.511669181177618e-05, "loss": 0.231, "mean_token_accuracy": 0.9448836881667375, "num_tokens": 31569492.0, "step": 4230 }, { "entropy": 1.906337308138609, "epoch": 0.2831882049441054, "grad_norm": 0.29556792974472046, "learning_rate": 4.5082064899195284e-05, "loss": 0.2375, "mean_token_accuracy": 0.9377251841127873, "num_tokens": 31640754.0, "step": 4240 }, { "entropy": 1.8609922096133231, "epoch": 0.2838561016538792, "grad_norm": 0.2518376410007477, "learning_rate": 4.504732906936938e-05, "loss": 0.2225, "mean_token_accuracy": 0.9435051172971726, "num_tokens": 31714627.0, "step": 4250 }, { "entropy": 1.8560601614415646, "epoch": 0.28452399836365305, "grad_norm": 0.32658979296684265, "learning_rate": 4.501248451116223e-05, "loss": 0.22, "mean_token_accuracy": 0.944538202509284, "num_tokens": 31788036.0, "step": 4260 }, { "entropy": 1.8571526892483234, "epoch": 0.2851918950734269, "grad_norm": 0.32422661781311035, "learning_rate": 4.497753141402875e-05, "loss": 0.242, "mean_token_accuracy": 0.941166504099965, "num_tokens": 31860429.0, "step": 4270 }, { "entropy": 1.805522048473358, "epoch": 0.2858597917832007, "grad_norm": 0.29409337043762207, "learning_rate": 4.4942469968013986e-05, "loss": 0.2165, "mean_token_accuracy": 0.9465219881385565, "num_tokens": 31938096.0, "step": 4280 }, { "entropy": 1.8214035376906395, "epoch": 0.28652768849297455, "grad_norm": 0.2931544780731201, "learning_rate": 4.4907300363752136e-05, "loss": 0.2236, "mean_token_accuracy": 0.9435908664017916, "num_tokens": 32011325.0, "step": 4290 }, { "entropy": 1.8379184059798717, "epoch": 0.2871955852027484, "grad_norm": 0.2970452606678009, "learning_rate": 4.487202279246543e-05, "loss": 0.2396, "mean_token_accuracy": 0.9429842695593834, "num_tokens": 32083739.0, "step": 4300 }, { "entropy": 1.8201567843556403, "epoch": 0.2878634819125222, "grad_norm": 0.26993146538734436, "learning_rate": 4.483663744596314e-05, "loss": 0.2288, "mean_token_accuracy": 0.9451590970158577, "num_tokens": 32159968.0, "step": 4310 }, { "entropy": 1.8193272963166236, "epoch": 0.28853137862229605, "grad_norm": 0.29660362005233765, "learning_rate": 4.4801144516640544e-05, "loss": 0.2166, "mean_token_accuracy": 0.9471204251050949, "num_tokens": 32235405.0, "step": 4320 }, { "entropy": 1.8298594862222672, "epoch": 0.2891992753320699, "grad_norm": 0.3144473731517792, "learning_rate": 4.476554419747785e-05, "loss": 0.2418, "mean_token_accuracy": 0.9419256884604692, "num_tokens": 32308991.0, "step": 4330 }, { "entropy": 1.815320910513401, "epoch": 0.2898671720418437, "grad_norm": 0.2645331919193268, "learning_rate": 4.472983668203915e-05, "loss": 0.2339, "mean_token_accuracy": 0.9424494832754136, "num_tokens": 32385652.0, "step": 4340 }, { "entropy": 1.8737569808959962, "epoch": 0.29053506875161755, "grad_norm": 0.3032049536705017, "learning_rate": 4.469402216447139e-05, "loss": 0.2592, "mean_token_accuracy": 0.9386070717126132, "num_tokens": 32456916.0, "step": 4350 }, { "entropy": 1.833969661593437, "epoch": 0.2912029654613914, "grad_norm": 0.2716382145881653, "learning_rate": 4.4658100839503324e-05, "loss": 0.2356, "mean_token_accuracy": 0.9422187585383653, "num_tokens": 32530601.0, "step": 4360 }, { "entropy": 1.837301241606474, "epoch": 0.2918708621711652, "grad_norm": 0.32120734453201294, "learning_rate": 4.462207290244438e-05, "loss": 0.2225, "mean_token_accuracy": 0.9441341172903777, "num_tokens": 32604989.0, "step": 4370 }, { "entropy": 1.8483294509351254, "epoch": 0.29253875888093905, "grad_norm": 0.26520368456840515, "learning_rate": 4.458593854918372e-05, "loss": 0.2323, "mean_token_accuracy": 0.942601065710187, "num_tokens": 32680902.0, "step": 4380 }, { "entropy": 1.8409473292529583, "epoch": 0.2932066555907129, "grad_norm": 0.32361602783203125, "learning_rate": 4.454969797618902e-05, "loss": 0.2157, "mean_token_accuracy": 0.9451724544167519, "num_tokens": 32755345.0, "step": 4390 }, { "entropy": 1.8125441461801528, "epoch": 0.2938745523004867, "grad_norm": 0.27777454257011414, "learning_rate": 4.451335138050558e-05, "loss": 0.2301, "mean_token_accuracy": 0.9425783287733793, "num_tokens": 32831474.0, "step": 4400 }, { "entropy": 1.8201068609952926, "epoch": 0.29454244901026055, "grad_norm": 0.3343043029308319, "learning_rate": 4.44768989597551e-05, "loss": 0.2313, "mean_token_accuracy": 0.9439606107771397, "num_tokens": 32906299.0, "step": 4410 }, { "entropy": 1.8236121252179145, "epoch": 0.2952103457200344, "grad_norm": 0.22313813865184784, "learning_rate": 4.444034091213468e-05, "loss": 0.2243, "mean_token_accuracy": 0.9450538717210293, "num_tokens": 32982509.0, "step": 4420 }, { "entropy": 1.8397392719984054, "epoch": 0.2958782424298082, "grad_norm": 0.28908953070640564, "learning_rate": 4.440367743641572e-05, "loss": 0.2442, "mean_token_accuracy": 0.940560732409358, "num_tokens": 33057779.0, "step": 4430 }, { "entropy": 1.8658656142652035, "epoch": 0.29654613913958205, "grad_norm": 0.3691408336162567, "learning_rate": 4.436690873194289e-05, "loss": 0.2287, "mean_token_accuracy": 0.9450929258018732, "num_tokens": 33132977.0, "step": 4440 }, { "entropy": 1.8281126484274863, "epoch": 0.2972140358493559, "grad_norm": 0.2597799003124237, "learning_rate": 4.433003499863296e-05, "loss": 0.2019, "mean_token_accuracy": 0.9486159149557352, "num_tokens": 33207351.0, "step": 4450 }, { "entropy": 1.8303055241703987, "epoch": 0.2978819325591297, "grad_norm": 0.29256701469421387, "learning_rate": 4.4293056436973765e-05, "loss": 0.2337, "mean_token_accuracy": 0.9425358675420284, "num_tokens": 33281504.0, "step": 4460 }, { "entropy": 1.8612960532307625, "epoch": 0.29854982926890355, "grad_norm": 0.33854877948760986, "learning_rate": 4.4255973248023116e-05, "loss": 0.2364, "mean_token_accuracy": 0.9431222815066576, "num_tokens": 33354876.0, "step": 4470 }, { "entropy": 1.8458468355238438, "epoch": 0.2992177259786774, "grad_norm": 0.33116385340690613, "learning_rate": 4.4218785633407704e-05, "loss": 0.2386, "mean_token_accuracy": 0.9436350584030151, "num_tokens": 33429475.0, "step": 4480 }, { "entropy": 1.865982796996832, "epoch": 0.2998856226884512, "grad_norm": 0.30375996232032776, "learning_rate": 4.4181493795321984e-05, "loss": 0.2307, "mean_token_accuracy": 0.9446152281016111, "num_tokens": 33502739.0, "step": 4490 }, { "entropy": 1.8897246249020099, "epoch": 0.30055351939822506, "grad_norm": 0.3325091004371643, "learning_rate": 4.414409793652709e-05, "loss": 0.2166, "mean_token_accuracy": 0.9460424091666937, "num_tokens": 33577606.0, "step": 4500 }, { "entropy": 1.8710330106317996, "epoch": 0.3012214161079989, "grad_norm": 0.34524285793304443, "learning_rate": 4.4106598260349735e-05, "loss": 0.2124, "mean_token_accuracy": 0.9496726516634226, "num_tokens": 33652812.0, "step": 4510 }, { "entropy": 1.8505713641643524, "epoch": 0.30188931281777276, "grad_norm": 0.2671905755996704, "learning_rate": 4.406899497068111e-05, "loss": 0.2238, "mean_token_accuracy": 0.9437539499253035, "num_tokens": 33729880.0, "step": 4520 }, { "entropy": 1.9004945039749146, "epoch": 0.30255720952754656, "grad_norm": 0.3384301960468292, "learning_rate": 4.4031288271975734e-05, "loss": 0.228, "mean_token_accuracy": 0.9426455538719892, "num_tokens": 33803589.0, "step": 4530 }, { "entropy": 1.8961285054683685, "epoch": 0.3032251062373204, "grad_norm": 0.30734241008758545, "learning_rate": 4.399347836925044e-05, "loss": 0.2121, "mean_token_accuracy": 0.9471046507358551, "num_tokens": 33881531.0, "step": 4540 }, { "entropy": 1.8047952473163604, "epoch": 0.30389300294709426, "grad_norm": 0.31810906529426575, "learning_rate": 4.395556546808314e-05, "loss": 0.2068, "mean_token_accuracy": 0.9483619179576636, "num_tokens": 33956428.0, "step": 4550 }, { "entropy": 1.8286520220339297, "epoch": 0.30456089965686806, "grad_norm": 0.2646723985671997, "learning_rate": 4.3917549774611774e-05, "loss": 0.2201, "mean_token_accuracy": 0.9456077262759208, "num_tokens": 34030162.0, "step": 4560 }, { "entropy": 1.8612429611384869, "epoch": 0.3052287963666419, "grad_norm": 0.32797884941101074, "learning_rate": 4.38794314955332e-05, "loss": 0.2367, "mean_token_accuracy": 0.9431695096194744, "num_tokens": 34105703.0, "step": 4570 }, { "entropy": 1.9067265942692757, "epoch": 0.30589669307641576, "grad_norm": 0.3241778314113617, "learning_rate": 4.384121083810202e-05, "loss": 0.2433, "mean_token_accuracy": 0.940237358957529, "num_tokens": 34179056.0, "step": 4580 }, { "entropy": 1.8829899229109288, "epoch": 0.30656458978618956, "grad_norm": 0.2544192373752594, "learning_rate": 4.380288801012951e-05, "loss": 0.2342, "mean_token_accuracy": 0.944569843634963, "num_tokens": 34252687.0, "step": 4590 }, { "entropy": 1.852818877995014, "epoch": 0.3072324864959634, "grad_norm": 0.28105655312538147, "learning_rate": 4.3764463219982455e-05, "loss": 0.2271, "mean_token_accuracy": 0.9435019325464964, "num_tokens": 34328899.0, "step": 4600 }, { "entropy": 1.8698960803449154, "epoch": 0.30790038320573726, "grad_norm": 0.3155994117259979, "learning_rate": 4.3725936676582e-05, "loss": 0.2344, "mean_token_accuracy": 0.9412890531122684, "num_tokens": 34403483.0, "step": 4610 }, { "entropy": 1.8788681253790855, "epoch": 0.30856827991551106, "grad_norm": 0.32375720143318176, "learning_rate": 4.368730858940256e-05, "loss": 0.2166, "mean_token_accuracy": 0.9469292409718036, "num_tokens": 34477321.0, "step": 4620 }, { "entropy": 1.8518653787672519, "epoch": 0.3092361766252849, "grad_norm": 0.2895698845386505, "learning_rate": 4.364857916847066e-05, "loss": 0.2076, "mean_token_accuracy": 0.9456298138946295, "num_tokens": 34552247.0, "step": 4630 }, { "entropy": 1.879375659674406, "epoch": 0.30990407333505876, "grad_norm": 0.2914004921913147, "learning_rate": 4.3609748624363776e-05, "loss": 0.2334, "mean_token_accuracy": 0.9401689626276493, "num_tokens": 34625508.0, "step": 4640 }, { "entropy": 1.845840898901224, "epoch": 0.31057197004483256, "grad_norm": 0.3413725793361664, "learning_rate": 4.357081716820922e-05, "loss": 0.2296, "mean_token_accuracy": 0.9441549833863974, "num_tokens": 34701073.0, "step": 4650 }, { "entropy": 1.8971908934414388, "epoch": 0.3112398667546064, "grad_norm": 0.3303360342979431, "learning_rate": 4.353178501168297e-05, "loss": 0.2335, "mean_token_accuracy": 0.9451367352157831, "num_tokens": 34775956.0, "step": 4660 }, { "entropy": 1.898054015636444, "epoch": 0.31190776346438026, "grad_norm": 0.27976253628730774, "learning_rate": 4.349265236700852e-05, "loss": 0.2214, "mean_token_accuracy": 0.9466199483722448, "num_tokens": 34852579.0, "step": 4670 }, { "entropy": 1.9111323684453965, "epoch": 0.31257566017415406, "grad_norm": 0.2828115224838257, "learning_rate": 4.345341944695574e-05, "loss": 0.2311, "mean_token_accuracy": 0.9418555200099945, "num_tokens": 34925466.0, "step": 4680 }, { "entropy": 1.8647110000252725, "epoch": 0.3132435568839279, "grad_norm": 0.2782430052757263, "learning_rate": 4.341408646483973e-05, "loss": 0.2289, "mean_token_accuracy": 0.9432813376188278, "num_tokens": 35000102.0, "step": 4690 }, { "entropy": 1.9170991756021976, "epoch": 0.31391145359370176, "grad_norm": 0.27305853366851807, "learning_rate": 4.3374653634519606e-05, "loss": 0.2365, "mean_token_accuracy": 0.9436933804303408, "num_tokens": 35075247.0, "step": 4700 }, { "entropy": 1.8815664917230606, "epoch": 0.31457935030347556, "grad_norm": 0.38132867217063904, "learning_rate": 4.3335121170397396e-05, "loss": 0.2273, "mean_token_accuracy": 0.9423738639801741, "num_tokens": 35148766.0, "step": 4710 }, { "entropy": 1.8863162621855736, "epoch": 0.3152472470132494, "grad_norm": 0.2659788727760315, "learning_rate": 4.329548928741685e-05, "loss": 0.2261, "mean_token_accuracy": 0.9450285650789738, "num_tokens": 35223172.0, "step": 4720 }, { "entropy": 1.8451788559556008, "epoch": 0.31591514372302326, "grad_norm": 0.3314361274242401, "learning_rate": 4.3255758201062256e-05, "loss": 0.2065, "mean_token_accuracy": 0.9494762852787971, "num_tokens": 35298405.0, "step": 4730 }, { "entropy": 1.8919203341007234, "epoch": 0.31658304043279706, "grad_norm": 0.32431700825691223, "learning_rate": 4.321592812735732e-05, "loss": 0.2379, "mean_token_accuracy": 0.9421888526529074, "num_tokens": 35375230.0, "step": 4740 }, { "entropy": 1.870032712817192, "epoch": 0.3172509371425709, "grad_norm": 0.2901422679424286, "learning_rate": 4.317599928286392e-05, "loss": 0.2163, "mean_token_accuracy": 0.9477691803127527, "num_tokens": 35451126.0, "step": 4750 }, { "entropy": 1.8814179971814156, "epoch": 0.31791883385234476, "grad_norm": 0.32144755125045776, "learning_rate": 4.313597188468099e-05, "loss": 0.2294, "mean_token_accuracy": 0.9436922177672387, "num_tokens": 35525614.0, "step": 4760 }, { "entropy": 1.9087035037577151, "epoch": 0.31858673056211856, "grad_norm": 0.3281264305114746, "learning_rate": 4.3095846150443284e-05, "loss": 0.2368, "mean_token_accuracy": 0.9433741334825754, "num_tokens": 35597957.0, "step": 4770 }, { "entropy": 1.8724081672728061, "epoch": 0.3192546272718924, "grad_norm": 0.2671878933906555, "learning_rate": 4.3055622298320276e-05, "loss": 0.233, "mean_token_accuracy": 0.940693574771285, "num_tokens": 35672467.0, "step": 4780 }, { "entropy": 1.9181607067584991, "epoch": 0.31992252398166626, "grad_norm": 0.3136788308620453, "learning_rate": 4.301530054701486e-05, "loss": 0.2216, "mean_token_accuracy": 0.9458787549287081, "num_tokens": 35750079.0, "step": 4790 }, { "entropy": 1.861856424808502, "epoch": 0.32059042069144006, "grad_norm": 0.2824789583683014, "learning_rate": 4.2974881115762274e-05, "loss": 0.2277, "mean_token_accuracy": 0.9444599103182554, "num_tokens": 35825831.0, "step": 4800 }, { "entropy": 1.912356250733137, "epoch": 0.3212583174012139, "grad_norm": 0.35055530071258545, "learning_rate": 4.293436422432882e-05, "loss": 0.2389, "mean_token_accuracy": 0.9436374962329864, "num_tokens": 35899099.0, "step": 4810 }, { "entropy": 1.934591693431139, "epoch": 0.32192621411098776, "grad_norm": 0.36533433198928833, "learning_rate": 4.289375009301072e-05, "loss": 0.2467, "mean_token_accuracy": 0.940224488452077, "num_tokens": 35970280.0, "step": 4820 }, { "entropy": 1.8885440282523631, "epoch": 0.32259411082076156, "grad_norm": 0.3091188669204712, "learning_rate": 4.28530389426329e-05, "loss": 0.2243, "mean_token_accuracy": 0.9452458128333092, "num_tokens": 36044645.0, "step": 4830 }, { "entropy": 1.924134112149477, "epoch": 0.3232620075305354, "grad_norm": 0.3028869032859802, "learning_rate": 4.2812230994547806e-05, "loss": 0.2257, "mean_token_accuracy": 0.9441969476640224, "num_tokens": 36119364.0, "step": 4840 }, { "entropy": 1.8526901558041573, "epoch": 0.32392990424030926, "grad_norm": 0.26295527815818787, "learning_rate": 4.2771326470634165e-05, "loss": 0.2123, "mean_token_accuracy": 0.9481824822723866, "num_tokens": 36195357.0, "step": 4850 }, { "entropy": 1.877461788803339, "epoch": 0.32459780095008306, "grad_norm": 0.2593669295310974, "learning_rate": 4.273032559329582e-05, "loss": 0.2349, "mean_token_accuracy": 0.9420103743672371, "num_tokens": 36269141.0, "step": 4860 }, { "entropy": 1.9075257934629917, "epoch": 0.3252656976598569, "grad_norm": 0.2766685485839844, "learning_rate": 4.2689228585460494e-05, "loss": 0.2407, "mean_token_accuracy": 0.9416776720434428, "num_tokens": 36341450.0, "step": 4870 }, { "entropy": 1.8789460368454456, "epoch": 0.32593359436963076, "grad_norm": 0.2707120478153229, "learning_rate": 4.2648035670578574e-05, "loss": 0.2195, "mean_token_accuracy": 0.9438760846853256, "num_tokens": 36416193.0, "step": 4880 }, { "entropy": 1.9080967545509337, "epoch": 0.32660149107940456, "grad_norm": 0.40785717964172363, "learning_rate": 4.260674707262193e-05, "loss": 0.2526, "mean_token_accuracy": 0.9366442874073982, "num_tokens": 36487303.0, "step": 4890 }, { "entropy": 1.8581715993583203, "epoch": 0.3272693877891784, "grad_norm": 0.31682661175727844, "learning_rate": 4.256536301608265e-05, "loss": 0.2124, "mean_token_accuracy": 0.9485861904919147, "num_tokens": 36562424.0, "step": 4900 }, { "entropy": 1.926520000398159, "epoch": 0.32793728449895226, "grad_norm": 0.30442801117897034, "learning_rate": 4.2523883725971876e-05, "loss": 0.2553, "mean_token_accuracy": 0.9383448876440525, "num_tokens": 36634810.0, "step": 4910 }, { "entropy": 1.9025879234075547, "epoch": 0.32860518120872606, "grad_norm": 0.3349396586418152, "learning_rate": 4.248230942781851e-05, "loss": 0.2517, "mean_token_accuracy": 0.9404251247644424, "num_tokens": 36706875.0, "step": 4920 }, { "entropy": 1.8629882097244264, "epoch": 0.3292730779184999, "grad_norm": 0.30690711736679077, "learning_rate": 4.2440640347668066e-05, "loss": 0.2237, "mean_token_accuracy": 0.9463497452437878, "num_tokens": 36782323.0, "step": 4930 }, { "entropy": 1.9088253237307071, "epoch": 0.32994097462827376, "grad_norm": 0.25188544392585754, "learning_rate": 4.239887671208136e-05, "loss": 0.2165, "mean_token_accuracy": 0.9470059532672167, "num_tokens": 36858200.0, "step": 4940 }, { "entropy": 1.8869219616055488, "epoch": 0.33060887133804756, "grad_norm": 0.3319534957408905, "learning_rate": 4.2357018748133364e-05, "loss": 0.2578, "mean_token_accuracy": 0.9386107049882412, "num_tokens": 36931357.0, "step": 4950 }, { "entropy": 1.8974449284374715, "epoch": 0.3312767680478214, "grad_norm": 0.3015380799770355, "learning_rate": 4.231506668341189e-05, "loss": 0.2375, "mean_token_accuracy": 0.9412260301411152, "num_tokens": 37005948.0, "step": 4960 }, { "entropy": 1.8834066174924373, "epoch": 0.33194466475759526, "grad_norm": 0.2521904706954956, "learning_rate": 4.22730207460164e-05, "loss": 0.228, "mean_token_accuracy": 0.9452286325395107, "num_tokens": 37080267.0, "step": 4970 }, { "entropy": 1.8718890838325024, "epoch": 0.33261256146736906, "grad_norm": 0.258169561624527, "learning_rate": 4.223088116455679e-05, "loss": 0.2306, "mean_token_accuracy": 0.9449196413159371, "num_tokens": 37156854.0, "step": 4980 }, { "entropy": 1.8671221904456616, "epoch": 0.3332804581771429, "grad_norm": 0.3138870596885681, "learning_rate": 4.218864816815205e-05, "loss": 0.2305, "mean_token_accuracy": 0.9467808868736028, "num_tokens": 37230708.0, "step": 4990 }, { "entropy": 1.875975839793682, "epoch": 0.33394835488691677, "grad_norm": 0.26833420991897583, "learning_rate": 4.214632198642911e-05, "loss": 0.218, "mean_token_accuracy": 0.9458157274872064, "num_tokens": 37305729.0, "step": 5000 }, { "epoch": 0.33394835488691677, "eval_entropy": 1.8628402607917787, "eval_loss": 0.247247114777565, "eval_mean_token_accuracy": 0.9443248253226281, "eval_num_tokens": 37305729.0, "eval_runtime": 552.3326, "eval_samples_per_second": 36.21, "eval_steps_per_second": 9.053, "step": 5000 }, { "entropy": 1.8699682176113128, "epoch": 0.33461625159669056, "grad_norm": 0.3509800136089325, "learning_rate": 4.2103902849521585e-05, "loss": 0.2361, "mean_token_accuracy": 0.9422809060662984, "num_tokens": 37378348.0, "step": 5010 }, { "entropy": 1.8798143222928048, "epoch": 0.3352841483064644, "grad_norm": 0.35147419571876526, "learning_rate": 4.2061390988068476e-05, "loss": 0.2646, "mean_token_accuracy": 0.9363960832357406, "num_tokens": 37452337.0, "step": 5020 }, { "entropy": 1.8594155445694924, "epoch": 0.33595204501623827, "grad_norm": 0.30872824788093567, "learning_rate": 4.201878663321295e-05, "loss": 0.2289, "mean_token_accuracy": 0.943534504249692, "num_tokens": 37526211.0, "step": 5030 }, { "entropy": 1.9377403013408183, "epoch": 0.33661994172601206, "grad_norm": 0.31443890929222107, "learning_rate": 4.197609001660106e-05, "loss": 0.2231, "mean_token_accuracy": 0.9447415392845869, "num_tokens": 37602869.0, "step": 5040 }, { "entropy": 1.9212867490947247, "epoch": 0.3372878384357859, "grad_norm": 0.3028574585914612, "learning_rate": 4.19333013703805e-05, "loss": 0.2336, "mean_token_accuracy": 0.9436277154833078, "num_tokens": 37675465.0, "step": 5050 }, { "entropy": 1.8429759316146375, "epoch": 0.33795573514555977, "grad_norm": 0.3305186331272125, "learning_rate": 4.189042092719937e-05, "loss": 0.2194, "mean_token_accuracy": 0.9478144496679306, "num_tokens": 37750154.0, "step": 5060 }, { "entropy": 1.8589183568954468, "epoch": 0.33862363185533356, "grad_norm": 0.3074212670326233, "learning_rate": 4.184744892020485e-05, "loss": 0.2249, "mean_token_accuracy": 0.9462077233940362, "num_tokens": 37828307.0, "step": 5070 }, { "entropy": 1.8754634030163289, "epoch": 0.3392915285651074, "grad_norm": 0.2615527808666229, "learning_rate": 4.1804385583042e-05, "loss": 0.2258, "mean_token_accuracy": 0.9431425549089909, "num_tokens": 37900994.0, "step": 5080 }, { "entropy": 1.8587918348610402, "epoch": 0.33995942527488127, "grad_norm": 0.3230578899383545, "learning_rate": 4.1761231149852414e-05, "loss": 0.2283, "mean_token_accuracy": 0.9427317231893539, "num_tokens": 37977847.0, "step": 5090 }, { "entropy": 1.8816634833812713, "epoch": 0.34062732198465506, "grad_norm": 0.28146666288375854, "learning_rate": 4.171798585527302e-05, "loss": 0.2411, "mean_token_accuracy": 0.9417926289141179, "num_tokens": 38052360.0, "step": 5100 }, { "entropy": 1.8864408075809478, "epoch": 0.3412952186944289, "grad_norm": 0.3060280680656433, "learning_rate": 4.1674649934434757e-05, "loss": 0.2225, "mean_token_accuracy": 0.9435448095202446, "num_tokens": 38129125.0, "step": 5110 }, { "entropy": 1.8035241551697254, "epoch": 0.34196311540420277, "grad_norm": 0.27368125319480896, "learning_rate": 4.163122362296133e-05, "loss": 0.2173, "mean_token_accuracy": 0.9452866896986961, "num_tokens": 38204358.0, "step": 5120 }, { "entropy": 1.8450581595301627, "epoch": 0.34263101211397656, "grad_norm": 0.2824119031429291, "learning_rate": 4.15877071569679e-05, "loss": 0.2329, "mean_token_accuracy": 0.9438250198960304, "num_tokens": 38278942.0, "step": 5130 }, { "entropy": 1.8859374925494194, "epoch": 0.3432989088237504, "grad_norm": 0.3053126931190491, "learning_rate": 4.154410077305979e-05, "loss": 0.2362, "mean_token_accuracy": 0.9420538257807494, "num_tokens": 38353763.0, "step": 5140 }, { "entropy": 1.87126986682415, "epoch": 0.34396680553352427, "grad_norm": 0.31491461396217346, "learning_rate": 4.1500404708331266e-05, "loss": 0.2361, "mean_token_accuracy": 0.9447729744017124, "num_tokens": 38427115.0, "step": 5150 }, { "entropy": 1.8601775549352169, "epoch": 0.34463470224329806, "grad_norm": 0.24703249335289001, "learning_rate": 4.145661920036415e-05, "loss": 0.2139, "mean_token_accuracy": 0.9474674869328737, "num_tokens": 38502357.0, "step": 5160 }, { "entropy": 1.8727555222809316, "epoch": 0.3453025989530719, "grad_norm": 0.23795869946479797, "learning_rate": 4.141274448722661e-05, "loss": 0.2156, "mean_token_accuracy": 0.9438554402440786, "num_tokens": 38578874.0, "step": 5170 }, { "entropy": 1.8991989843547343, "epoch": 0.34597049566284577, "grad_norm": 0.34368664026260376, "learning_rate": 4.1368780807471855e-05, "loss": 0.2336, "mean_token_accuracy": 0.9409043125808239, "num_tokens": 38651842.0, "step": 5180 }, { "entropy": 1.8837950490415096, "epoch": 0.34663839237261956, "grad_norm": 0.33735916018486023, "learning_rate": 4.132472840013677e-05, "loss": 0.2321, "mean_token_accuracy": 0.9454182650893926, "num_tokens": 38726411.0, "step": 5190 }, { "entropy": 1.9352252803742886, "epoch": 0.3473062890823934, "grad_norm": 0.3296850621700287, "learning_rate": 4.1280587504740696e-05, "loss": 0.2243, "mean_token_accuracy": 0.9450970035046339, "num_tokens": 38800458.0, "step": 5200 }, { "entropy": 1.899579556286335, "epoch": 0.34797418579216727, "grad_norm": 0.35265713930130005, "learning_rate": 4.1236358361284084e-05, "loss": 0.2473, "mean_token_accuracy": 0.9409931804984808, "num_tokens": 38876462.0, "step": 5210 }, { "entropy": 1.8974872305989265, "epoch": 0.34864208250194106, "grad_norm": 0.29030710458755493, "learning_rate": 4.119204121024721e-05, "loss": 0.2325, "mean_token_accuracy": 0.9438703712075949, "num_tokens": 38952029.0, "step": 5220 }, { "entropy": 1.8944323100149632, "epoch": 0.3493099792117149, "grad_norm": 0.2948436439037323, "learning_rate": 4.1147636292588874e-05, "loss": 0.2438, "mean_token_accuracy": 0.9398472532629967, "num_tokens": 39027554.0, "step": 5230 }, { "entropy": 1.8910538606345653, "epoch": 0.34997787592148877, "grad_norm": 0.24279309809207916, "learning_rate": 4.110314384974504e-05, "loss": 0.2214, "mean_token_accuracy": 0.947320806607604, "num_tokens": 39103963.0, "step": 5240 }, { "entropy": 1.8806976824998856, "epoch": 0.35064577263126256, "grad_norm": 0.3154253363609314, "learning_rate": 4.105856412362759e-05, "loss": 0.2126, "mean_token_accuracy": 0.9457191519439221, "num_tokens": 39180417.0, "step": 5250 }, { "entropy": 1.8734717287123204, "epoch": 0.3513136693410364, "grad_norm": 0.34275585412979126, "learning_rate": 4.101389735662296e-05, "loss": 0.219, "mean_token_accuracy": 0.9458412297070027, "num_tokens": 39259315.0, "step": 5260 }, { "entropy": 1.8300933994352817, "epoch": 0.35198156605081027, "grad_norm": 0.2978379726409912, "learning_rate": 4.0969143791590844e-05, "loss": 0.226, "mean_token_accuracy": 0.9459999747574329, "num_tokens": 39334551.0, "step": 5270 }, { "entropy": 1.8873732060194015, "epoch": 0.35264946276058406, "grad_norm": 0.2864626348018646, "learning_rate": 4.0924303671862894e-05, "loss": 0.2409, "mean_token_accuracy": 0.9399205647408962, "num_tokens": 39409350.0, "step": 5280 }, { "entropy": 1.8625124730169773, "epoch": 0.3533173594703579, "grad_norm": 0.2921641170978546, "learning_rate": 4.0879377241241317e-05, "loss": 0.2266, "mean_token_accuracy": 0.9438492223620415, "num_tokens": 39483174.0, "step": 5290 }, { "entropy": 1.8765275306999682, "epoch": 0.35398525618013177, "grad_norm": 0.2676922082901001, "learning_rate": 4.083436474399766e-05, "loss": 0.2279, "mean_token_accuracy": 0.9452288087457419, "num_tokens": 39558669.0, "step": 5300 }, { "entropy": 1.9189662396907807, "epoch": 0.35465315288990557, "grad_norm": 0.3305489122867584, "learning_rate": 4.0789266424871394e-05, "loss": 0.2352, "mean_token_accuracy": 0.9428542200475931, "num_tokens": 39632021.0, "step": 5310 }, { "entropy": 1.879033349454403, "epoch": 0.3553210495996794, "grad_norm": 0.28791821002960205, "learning_rate": 4.074408252906864e-05, "loss": 0.2307, "mean_token_accuracy": 0.9449928559362888, "num_tokens": 39709464.0, "step": 5320 }, { "entropy": 1.8804195158183574, "epoch": 0.35598894630945327, "grad_norm": 0.303653359413147, "learning_rate": 4.06988133022608e-05, "loss": 0.2386, "mean_token_accuracy": 0.9407651532441378, "num_tokens": 39783333.0, "step": 5330 }, { "entropy": 1.9090037167072296, "epoch": 0.35665684301922707, "grad_norm": 0.32017049193382263, "learning_rate": 4.0653458990583224e-05, "loss": 0.2307, "mean_token_accuracy": 0.9425357978790998, "num_tokens": 39854691.0, "step": 5340 }, { "entropy": 1.8525074176490306, "epoch": 0.3573247397290009, "grad_norm": 0.28389784693717957, "learning_rate": 4.060801984063388e-05, "loss": 0.2246, "mean_token_accuracy": 0.944192036613822, "num_tokens": 39931201.0, "step": 5350 }, { "entropy": 1.8636192552745343, "epoch": 0.35799263643877477, "grad_norm": 0.2678419351577759, "learning_rate": 4.056249609947204e-05, "loss": 0.235, "mean_token_accuracy": 0.9450872488319874, "num_tokens": 40007127.0, "step": 5360 }, { "entropy": 1.8853872954845428, "epoch": 0.35866053314854857, "grad_norm": 0.2968935966491699, "learning_rate": 4.051688801461688e-05, "loss": 0.2126, "mean_token_accuracy": 0.9481700476258993, "num_tokens": 40082387.0, "step": 5370 }, { "entropy": 1.8639925502240657, "epoch": 0.3593284298583224, "grad_norm": 0.3370371460914612, "learning_rate": 4.04711958340462e-05, "loss": 0.2279, "mean_token_accuracy": 0.9431246116757392, "num_tokens": 40156022.0, "step": 5380 }, { "entropy": 1.873419537395239, "epoch": 0.35999632656809627, "grad_norm": 0.35656043887138367, "learning_rate": 4.042541980619499e-05, "loss": 0.2302, "mean_token_accuracy": 0.9458245374262333, "num_tokens": 40229621.0, "step": 5390 }, { "entropy": 1.8834988854825496, "epoch": 0.36066422327787007, "grad_norm": 0.3486693799495697, "learning_rate": 4.037956017995418e-05, "loss": 0.2259, "mean_token_accuracy": 0.9466361660510302, "num_tokens": 40303939.0, "step": 5400 }, { "entropy": 1.8507674120366573, "epoch": 0.3613321199876439, "grad_norm": 0.242417111992836, "learning_rate": 4.03336172046692e-05, "loss": 0.212, "mean_token_accuracy": 0.9497998952865601, "num_tokens": 40378777.0, "step": 5410 }, { "entropy": 1.8961491219699382, "epoch": 0.36200001669741777, "grad_norm": 0.3118096590042114, "learning_rate": 4.028759113013868e-05, "loss": 0.2414, "mean_token_accuracy": 0.9415444631129504, "num_tokens": 40451732.0, "step": 5420 }, { "entropy": 1.8738715805113315, "epoch": 0.36266791340719157, "grad_norm": 0.3759858310222626, "learning_rate": 4.024148220661309e-05, "loss": 0.2274, "mean_token_accuracy": 0.9449708998203278, "num_tokens": 40524296.0, "step": 5430 }, { "entropy": 1.8486330926418304, "epoch": 0.3633358101169654, "grad_norm": 0.30139195919036865, "learning_rate": 4.019529068479332e-05, "loss": 0.2212, "mean_token_accuracy": 0.9490444637835026, "num_tokens": 40599827.0, "step": 5440 }, { "entropy": 1.8444453194737433, "epoch": 0.36400370682673927, "grad_norm": 0.3065475821495056, "learning_rate": 4.014901681582938e-05, "loss": 0.2205, "mean_token_accuracy": 0.9450596127659082, "num_tokens": 40675038.0, "step": 5450 }, { "entropy": 1.8432600557804109, "epoch": 0.36467160353651307, "grad_norm": 0.35564085841178894, "learning_rate": 4.010266085131902e-05, "loss": 0.215, "mean_token_accuracy": 0.9459651198238135, "num_tokens": 40751590.0, "step": 5460 }, { "entropy": 1.8573269747197627, "epoch": 0.3653395002462869, "grad_norm": 0.300121545791626, "learning_rate": 4.005622304330635e-05, "loss": 0.2185, "mean_token_accuracy": 0.9460552595555782, "num_tokens": 40828149.0, "step": 5470 }, { "entropy": 1.90805182158947, "epoch": 0.36600739695606077, "grad_norm": 0.33883431553840637, "learning_rate": 4.0009703644280465e-05, "loss": 0.24, "mean_token_accuracy": 0.9444262105971575, "num_tokens": 40906033.0, "step": 5480 }, { "entropy": 1.9340757705271243, "epoch": 0.36667529366583457, "grad_norm": 0.2954683005809784, "learning_rate": 3.996310290717411e-05, "loss": 0.2483, "mean_token_accuracy": 0.9406178243458271, "num_tokens": 40979735.0, "step": 5490 }, { "entropy": 1.887842309474945, "epoch": 0.3673431903756084, "grad_norm": 0.2348015457391739, "learning_rate": 3.991642108536224e-05, "loss": 0.226, "mean_token_accuracy": 0.9455922391265631, "num_tokens": 41056378.0, "step": 5500 }, { "entropy": 1.894931075721979, "epoch": 0.36801108708538227, "grad_norm": 0.28648632764816284, "learning_rate": 3.9869658432660696e-05, "loss": 0.2359, "mean_token_accuracy": 0.9441044371575117, "num_tokens": 41130044.0, "step": 5510 }, { "entropy": 1.89505675137043, "epoch": 0.36867898379515607, "grad_norm": 0.4146939218044281, "learning_rate": 3.982281520332481e-05, "loss": 0.2475, "mean_token_accuracy": 0.9394860856235028, "num_tokens": 41206835.0, "step": 5520 }, { "entropy": 1.9290433168411254, "epoch": 0.3693468805049299, "grad_norm": 0.40325871109962463, "learning_rate": 3.977589165204804e-05, "loss": 0.2172, "mean_token_accuracy": 0.9462254717946053, "num_tokens": 41285784.0, "step": 5530 }, { "entropy": 1.8551645264029504, "epoch": 0.37001477721470377, "grad_norm": 0.2665170133113861, "learning_rate": 3.9728888033960525e-05, "loss": 0.2085, "mean_token_accuracy": 0.9506573807448149, "num_tokens": 41363196.0, "step": 5540 }, { "entropy": 1.885726773738861, "epoch": 0.37068267392447757, "grad_norm": 0.3068387508392334, "learning_rate": 3.9681804604627765e-05, "loss": 0.2234, "mean_token_accuracy": 0.9449964951723814, "num_tokens": 41438447.0, "step": 5550 }, { "entropy": 1.898128830641508, "epoch": 0.3713505706342514, "grad_norm": 0.2888367772102356, "learning_rate": 3.96346416200492e-05, "loss": 0.245, "mean_token_accuracy": 0.939350976422429, "num_tokens": 41513874.0, "step": 5560 }, { "entropy": 1.920731969177723, "epoch": 0.37201846734402527, "grad_norm": 0.28700539469718933, "learning_rate": 3.958739933665683e-05, "loss": 0.2327, "mean_token_accuracy": 0.9404160708189011, "num_tokens": 41589871.0, "step": 5570 }, { "entropy": 1.8654952719807625, "epoch": 0.37268636405379907, "grad_norm": 0.30696895718574524, "learning_rate": 3.954007801131381e-05, "loss": 0.2215, "mean_token_accuracy": 0.943479948490858, "num_tokens": 41664208.0, "step": 5580 }, { "entropy": 1.8375459298491479, "epoch": 0.3733542607635729, "grad_norm": 0.28250840306282043, "learning_rate": 3.949267790131305e-05, "loss": 0.2085, "mean_token_accuracy": 0.94823301397264, "num_tokens": 41740079.0, "step": 5590 }, { "entropy": 1.8448408506810665, "epoch": 0.3740221574733468, "grad_norm": 0.2599450647830963, "learning_rate": 3.9445199264375826e-05, "loss": 0.232, "mean_token_accuracy": 0.9453869223594665, "num_tokens": 41816937.0, "step": 5600 }, { "entropy": 1.8887805461883544, "epoch": 0.37469005418312057, "grad_norm": 0.2883719503879547, "learning_rate": 3.939764235865039e-05, "loss": 0.2432, "mean_token_accuracy": 0.9409231137484312, "num_tokens": 41890371.0, "step": 5610 }, { "entropy": 1.9057791784405709, "epoch": 0.3753579508928944, "grad_norm": 0.26792749762535095, "learning_rate": 3.935000744271053e-05, "loss": 0.2279, "mean_token_accuracy": 0.9451626099646091, "num_tokens": 41967896.0, "step": 5620 }, { "entropy": 1.8630941912531853, "epoch": 0.3760258476026683, "grad_norm": 0.3250010311603546, "learning_rate": 3.930229477555421e-05, "loss": 0.2308, "mean_token_accuracy": 0.9438260331749916, "num_tokens": 42041454.0, "step": 5630 }, { "entropy": 1.8576290264725686, "epoch": 0.37669374431244207, "grad_norm": 0.34566250443458557, "learning_rate": 3.925450461660212e-05, "loss": 0.2274, "mean_token_accuracy": 0.9449837531894445, "num_tokens": 42116184.0, "step": 5640 }, { "entropy": 1.9070193007588387, "epoch": 0.3773616410222159, "grad_norm": 0.29610711336135864, "learning_rate": 3.92066372256963e-05, "loss": 0.2246, "mean_token_accuracy": 0.9449803315103054, "num_tokens": 42191456.0, "step": 5650 }, { "entropy": 1.8656429432332515, "epoch": 0.3780295377319898, "grad_norm": 0.2796553373336792, "learning_rate": 3.915869286309869e-05, "loss": 0.2207, "mean_token_accuracy": 0.945483610779047, "num_tokens": 42267930.0, "step": 5660 }, { "entropy": 1.8829548478126525, "epoch": 0.37869743444176357, "grad_norm": 0.26579412817955017, "learning_rate": 3.911067178948977e-05, "loss": 0.2277, "mean_token_accuracy": 0.9436649471521378, "num_tokens": 42343385.0, "step": 5670 }, { "entropy": 1.893177405744791, "epoch": 0.3793653311515374, "grad_norm": 0.3126572072505951, "learning_rate": 3.9062574265967075e-05, "loss": 0.2455, "mean_token_accuracy": 0.9410084024071693, "num_tokens": 42416351.0, "step": 5680 }, { "entropy": 1.8615103863179683, "epoch": 0.3800332278613113, "grad_norm": 0.3685029447078705, "learning_rate": 3.901440055404383e-05, "loss": 0.2206, "mean_token_accuracy": 0.9446178272366523, "num_tokens": 42492057.0, "step": 5690 }, { "entropy": 1.8649059802293777, "epoch": 0.38070112457108507, "grad_norm": 0.2746874988079071, "learning_rate": 3.8966150915647484e-05, "loss": 0.2312, "mean_token_accuracy": 0.9415227670222521, "num_tokens": 42566103.0, "step": 5700 }, { "entropy": 1.8582611083984375, "epoch": 0.3813690212808589, "grad_norm": 0.3445000648498535, "learning_rate": 3.8917825613118345e-05, "loss": 0.2248, "mean_token_accuracy": 0.9451813399791718, "num_tokens": 42641148.0, "step": 5710 }, { "entropy": 1.8385150879621506, "epoch": 0.3820369179906328, "grad_norm": 0.27385690808296204, "learning_rate": 3.886942490920809e-05, "loss": 0.2353, "mean_token_accuracy": 0.9439975164830685, "num_tokens": 42714158.0, "step": 5720 }, { "entropy": 1.8803850308060646, "epoch": 0.38270481470040657, "grad_norm": 0.2621834874153137, "learning_rate": 3.882094906707838e-05, "loss": 0.2353, "mean_token_accuracy": 0.9418150596320629, "num_tokens": 42789330.0, "step": 5730 }, { "entropy": 1.9232642516493796, "epoch": 0.3833727114101804, "grad_norm": 0.3616364598274231, "learning_rate": 3.8772398350299396e-05, "loss": 0.2575, "mean_token_accuracy": 0.9402707811444998, "num_tokens": 42860054.0, "step": 5740 }, { "entropy": 1.91171570494771, "epoch": 0.3840406081199543, "grad_norm": 0.389970064163208, "learning_rate": 3.872377302284843e-05, "loss": 0.2115, "mean_token_accuracy": 0.9457026407122612, "num_tokens": 42935941.0, "step": 5750 }, { "entropy": 1.9102558188140393, "epoch": 0.38470850482972807, "grad_norm": 0.2997053265571594, "learning_rate": 3.867507334910846e-05, "loss": 0.2391, "mean_token_accuracy": 0.9421985533088446, "num_tokens": 43010176.0, "step": 5760 }, { "entropy": 1.9124287240207196, "epoch": 0.3853764015395019, "grad_norm": 0.2375487983226776, "learning_rate": 3.8626299593866675e-05, "loss": 0.2154, "mean_token_accuracy": 0.9474853195250035, "num_tokens": 43086208.0, "step": 5770 }, { "entropy": 1.916738434880972, "epoch": 0.3860442982492758, "grad_norm": 0.2900070548057556, "learning_rate": 3.8577452022313074e-05, "loss": 0.2213, "mean_token_accuracy": 0.9462229896336793, "num_tokens": 43160191.0, "step": 5780 }, { "entropy": 1.8875885412096978, "epoch": 0.38671219495904957, "grad_norm": 0.2704409062862396, "learning_rate": 3.852853090003897e-05, "loss": 0.2305, "mean_token_accuracy": 0.9444563537836075, "num_tokens": 43236556.0, "step": 5790 }, { "entropy": 1.913160105794668, "epoch": 0.3873800916688234, "grad_norm": 0.344618558883667, "learning_rate": 3.8479536493035634e-05, "loss": 0.2252, "mean_token_accuracy": 0.9445569045841694, "num_tokens": 43309911.0, "step": 5800 }, { "entropy": 1.8723728090524674, "epoch": 0.3880479883785973, "grad_norm": 0.2803967297077179, "learning_rate": 3.843046906769275e-05, "loss": 0.2165, "mean_token_accuracy": 0.9457434058189392, "num_tokens": 43384311.0, "step": 5810 }, { "entropy": 1.9039440669119359, "epoch": 0.38871588508837107, "grad_norm": 0.2550482451915741, "learning_rate": 3.838132889079704e-05, "loss": 0.2238, "mean_token_accuracy": 0.9465091783553362, "num_tokens": 43461111.0, "step": 5820 }, { "entropy": 1.9514834955334663, "epoch": 0.3893837817981449, "grad_norm": 0.3363208770751953, "learning_rate": 3.833211622953078e-05, "loss": 0.2201, "mean_token_accuracy": 0.9457925707101822, "num_tokens": 43537573.0, "step": 5830 }, { "entropy": 1.9034170739352703, "epoch": 0.3900516785079188, "grad_norm": 0.2836158573627472, "learning_rate": 3.828283135147036e-05, "loss": 0.2155, "mean_token_accuracy": 0.946396753564477, "num_tokens": 43611669.0, "step": 5840 }, { "entropy": 1.9066494800150395, "epoch": 0.39071957521769257, "grad_norm": 0.23912501335144043, "learning_rate": 3.82334745245848e-05, "loss": 0.229, "mean_token_accuracy": 0.9444659076631069, "num_tokens": 43687255.0, "step": 5850 }, { "entropy": 1.9668964512646199, "epoch": 0.3913874719274664, "grad_norm": 0.29459482431411743, "learning_rate": 3.8184046017234354e-05, "loss": 0.2378, "mean_token_accuracy": 0.9422699268907309, "num_tokens": 43759618.0, "step": 5860 }, { "entropy": 1.9583055019378661, "epoch": 0.3920553686372403, "grad_norm": 0.3198317587375641, "learning_rate": 3.8134546098168975e-05, "loss": 0.2327, "mean_token_accuracy": 0.9433270651847124, "num_tokens": 43832131.0, "step": 5870 }, { "entropy": 1.9342499651014804, "epoch": 0.39272326534701407, "grad_norm": 0.2366897016763687, "learning_rate": 3.8084975036526924e-05, "loss": 0.2379, "mean_token_accuracy": 0.9422232013195753, "num_tokens": 43908279.0, "step": 5880 }, { "entropy": 1.9105512894690038, "epoch": 0.3933911620567879, "grad_norm": 0.24744364619255066, "learning_rate": 3.8035333101833244e-05, "loss": 0.2064, "mean_token_accuracy": 0.9485102720558644, "num_tokens": 43984882.0, "step": 5890 }, { "entropy": 1.883164818584919, "epoch": 0.3940590587665618, "grad_norm": 0.2920915186405182, "learning_rate": 3.798562056399835e-05, "loss": 0.219, "mean_token_accuracy": 0.9483438994735479, "num_tokens": 44060062.0, "step": 5900 }, { "entropy": 1.9149408027529717, "epoch": 0.3947269554763356, "grad_norm": 0.23199617862701416, "learning_rate": 3.793583769331653e-05, "loss": 0.2279, "mean_token_accuracy": 0.9456027213484048, "num_tokens": 44136277.0, "step": 5910 }, { "entropy": 1.9140928737819194, "epoch": 0.3953948521861094, "grad_norm": 0.2765490412712097, "learning_rate": 3.788598476046448e-05, "loss": 0.2311, "mean_token_accuracy": 0.9434793140739203, "num_tokens": 44210326.0, "step": 5920 }, { "entropy": 1.9026202492415905, "epoch": 0.3960627488958833, "grad_norm": 0.37410467863082886, "learning_rate": 3.783606203649981e-05, "loss": 0.2249, "mean_token_accuracy": 0.9440909586846828, "num_tokens": 44286586.0, "step": 5930 }, { "entropy": 1.8660123124718666, "epoch": 0.3967306456056571, "grad_norm": 0.3082118630409241, "learning_rate": 3.778606979285965e-05, "loss": 0.2229, "mean_token_accuracy": 0.9430748876184225, "num_tokens": 44361043.0, "step": 5940 }, { "entropy": 1.8822263188660144, "epoch": 0.3973985423154309, "grad_norm": 0.32805633544921875, "learning_rate": 3.7736008301359064e-05, "loss": 0.2441, "mean_token_accuracy": 0.9426589887589216, "num_tokens": 44436727.0, "step": 5950 }, { "entropy": 1.9247616775333882, "epoch": 0.3980664390252048, "grad_norm": 0.35823896527290344, "learning_rate": 3.768587783418967e-05, "loss": 0.2398, "mean_token_accuracy": 0.9381592474877835, "num_tokens": 44510360.0, "step": 5960 }, { "entropy": 1.8901113018393516, "epoch": 0.3987343357349786, "grad_norm": 0.26516541838645935, "learning_rate": 3.763567866391807e-05, "loss": 0.2216, "mean_token_accuracy": 0.9455227475613356, "num_tokens": 44585669.0, "step": 5970 }, { "entropy": 1.926313439756632, "epoch": 0.3994022324447524, "grad_norm": 0.26676836609840393, "learning_rate": 3.758541106348446e-05, "loss": 0.2494, "mean_token_accuracy": 0.9367516294121743, "num_tokens": 44659978.0, "step": 5980 }, { "entropy": 1.917150054126978, "epoch": 0.4000701291545263, "grad_norm": 0.3763718903064728, "learning_rate": 3.753507530620107e-05, "loss": 0.2362, "mean_token_accuracy": 0.9436690431088209, "num_tokens": 44733512.0, "step": 5990 }, { "entropy": 1.8905444204807282, "epoch": 0.4007380258643001, "grad_norm": 0.3248978853225708, "learning_rate": 3.748467166575072e-05, "loss": 0.2101, "mean_token_accuracy": 0.9461406122893095, "num_tokens": 44809175.0, "step": 6000 }, { "epoch": 0.4007380258643001, "eval_entropy": 1.8695236456871032, "eval_loss": 0.24391567707061768, "eval_mean_token_accuracy": 0.944749633693695, "eval_num_tokens": 44809175.0, "eval_runtime": 552.2428, "eval_samples_per_second": 36.216, "eval_steps_per_second": 9.054, "step": 6000 }, { "entropy": 1.9028013505041599, "epoch": 0.4014059225740739, "grad_norm": 0.34846240282058716, "learning_rate": 3.743420041618534e-05, "loss": 0.2434, "mean_token_accuracy": 0.9411895230412484, "num_tokens": 44880134.0, "step": 6010 }, { "entropy": 1.8826014414429664, "epoch": 0.4020738192838478, "grad_norm": 0.27955442667007446, "learning_rate": 3.738366183192441e-05, "loss": 0.212, "mean_token_accuracy": 0.9476633965969086, "num_tokens": 44956579.0, "step": 6020 }, { "entropy": 1.9236787579953671, "epoch": 0.4027417159936216, "grad_norm": 0.2702292203903198, "learning_rate": 3.733305618775357e-05, "loss": 0.2275, "mean_token_accuracy": 0.9423356868326664, "num_tokens": 45031454.0, "step": 6030 }, { "entropy": 1.8541994221508502, "epoch": 0.4034096127033954, "grad_norm": 0.3068564832210541, "learning_rate": 3.728238375882305e-05, "loss": 0.2267, "mean_token_accuracy": 0.942199082672596, "num_tokens": 45102674.0, "step": 6040 }, { "entropy": 1.8715508930385112, "epoch": 0.4040775094131693, "grad_norm": 0.2965051829814911, "learning_rate": 3.72316448206462e-05, "loss": 0.2245, "mean_token_accuracy": 0.9468481604009866, "num_tokens": 45175986.0, "step": 6050 }, { "entropy": 1.8987006291747093, "epoch": 0.4047454061229431, "grad_norm": 0.33186593651771545, "learning_rate": 3.7180839649098005e-05, "loss": 0.2235, "mean_token_accuracy": 0.9451838321983814, "num_tokens": 45248123.0, "step": 6060 }, { "entropy": 1.9166165970265865, "epoch": 0.4054133028327169, "grad_norm": 0.31308844685554504, "learning_rate": 3.712996852041353e-05, "loss": 0.2279, "mean_token_accuracy": 0.9453062769025564, "num_tokens": 45321976.0, "step": 6070 }, { "entropy": 1.9069445885717868, "epoch": 0.4060811995424908, "grad_norm": 0.28432127833366394, "learning_rate": 3.707903171118652e-05, "loss": 0.2479, "mean_token_accuracy": 0.9419134773314, "num_tokens": 45396684.0, "step": 6080 }, { "entropy": 1.9531974382698536, "epoch": 0.4067490962522646, "grad_norm": 0.33367905020713806, "learning_rate": 3.7028029498367784e-05, "loss": 0.2515, "mean_token_accuracy": 0.9403557687997818, "num_tokens": 45471213.0, "step": 6090 }, { "entropy": 1.9115024484694003, "epoch": 0.4074169929620384, "grad_norm": 0.3217218518257141, "learning_rate": 3.697696215926375e-05, "loss": 0.2171, "mean_token_accuracy": 0.9454292073845864, "num_tokens": 45547231.0, "step": 6100 }, { "entropy": 1.8814896136522292, "epoch": 0.4080848896718123, "grad_norm": 0.29801493883132935, "learning_rate": 3.692582997153497e-05, "loss": 0.2352, "mean_token_accuracy": 0.9412771929055452, "num_tokens": 45622938.0, "step": 6110 }, { "entropy": 1.8915587805211544, "epoch": 0.4087527863815861, "grad_norm": 0.2785051167011261, "learning_rate": 3.6874633213194565e-05, "loss": 0.2225, "mean_token_accuracy": 0.9448517318814993, "num_tokens": 45698068.0, "step": 6120 }, { "entropy": 1.8883536547422408, "epoch": 0.4094206830913599, "grad_norm": 0.31130892038345337, "learning_rate": 3.6823372162606745e-05, "loss": 0.2189, "mean_token_accuracy": 0.9458511333912611, "num_tokens": 45774861.0, "step": 6130 }, { "entropy": 1.928010568022728, "epoch": 0.4100885798011338, "grad_norm": 0.3430582880973816, "learning_rate": 3.6772047098485274e-05, "loss": 0.2323, "mean_token_accuracy": 0.9417624350637197, "num_tokens": 45848688.0, "step": 6140 }, { "entropy": 1.9242531947791577, "epoch": 0.4107564765109076, "grad_norm": 0.308286190032959, "learning_rate": 3.6720658299891995e-05, "loss": 0.2302, "mean_token_accuracy": 0.9458325952291489, "num_tokens": 45923913.0, "step": 6150 }, { "entropy": 1.9068501241505147, "epoch": 0.4114243732206814, "grad_norm": 0.28455981612205505, "learning_rate": 3.666920604623525e-05, "loss": 0.236, "mean_token_accuracy": 0.9448170073330402, "num_tokens": 45999355.0, "step": 6160 }, { "entropy": 1.9273151695728301, "epoch": 0.4120922699304553, "grad_norm": 0.2953311502933502, "learning_rate": 3.6617690617268416e-05, "loss": 0.2493, "mean_token_accuracy": 0.9371218640357256, "num_tokens": 46074070.0, "step": 6170 }, { "entropy": 1.923949245363474, "epoch": 0.4127601666402291, "grad_norm": 0.32243552803993225, "learning_rate": 3.656611229308837e-05, "loss": 0.2259, "mean_token_accuracy": 0.9464456308633089, "num_tokens": 46149589.0, "step": 6180 }, { "entropy": 1.9378270879387856, "epoch": 0.41342806335000293, "grad_norm": 0.2911277711391449, "learning_rate": 3.6514471354133936e-05, "loss": 0.2309, "mean_token_accuracy": 0.9456627234816551, "num_tokens": 46222113.0, "step": 6190 }, { "entropy": 1.9103655092418195, "epoch": 0.4140959600597768, "grad_norm": 0.2618463635444641, "learning_rate": 3.646276808118439e-05, "loss": 0.219, "mean_token_accuracy": 0.9453224431723356, "num_tokens": 46297486.0, "step": 6200 }, { "entropy": 1.937165941298008, "epoch": 0.4147638567695506, "grad_norm": 0.34674936532974243, "learning_rate": 3.641100275535795e-05, "loss": 0.2323, "mean_token_accuracy": 0.9436026971787215, "num_tokens": 46372503.0, "step": 6210 }, { "entropy": 1.8939755447208881, "epoch": 0.41543175347932443, "grad_norm": 0.28311529755592346, "learning_rate": 3.63591756581102e-05, "loss": 0.2312, "mean_token_accuracy": 0.9440379265695811, "num_tokens": 46446897.0, "step": 6220 }, { "entropy": 1.9137402102351189, "epoch": 0.4160996501890983, "grad_norm": 0.3030659556388855, "learning_rate": 3.630728707123259e-05, "loss": 0.2235, "mean_token_accuracy": 0.943624097108841, "num_tokens": 46523563.0, "step": 6230 }, { "entropy": 1.9250687412917613, "epoch": 0.4167675468988721, "grad_norm": 0.3375629782676697, "learning_rate": 3.62553372768509e-05, "loss": 0.2353, "mean_token_accuracy": 0.9426155641674996, "num_tokens": 46597863.0, "step": 6240 }, { "entropy": 1.9081721894443036, "epoch": 0.41743544360864593, "grad_norm": 0.3522295355796814, "learning_rate": 3.620332655742371e-05, "loss": 0.2253, "mean_token_accuracy": 0.9423638172447681, "num_tokens": 46674309.0, "step": 6250 }, { "entropy": 1.9130800761282445, "epoch": 0.4181033403184198, "grad_norm": 0.3143600523471832, "learning_rate": 3.615125519574084e-05, "loss": 0.2353, "mean_token_accuracy": 0.9443993449211121, "num_tokens": 46749360.0, "step": 6260 }, { "entropy": 1.9183715388178826, "epoch": 0.4187712370281936, "grad_norm": 0.3188576102256775, "learning_rate": 3.6099123474921864e-05, "loss": 0.2217, "mean_token_accuracy": 0.9451267641037703, "num_tokens": 46822602.0, "step": 6270 }, { "entropy": 1.9148419328033923, "epoch": 0.41943913373796743, "grad_norm": 0.3026546239852905, "learning_rate": 3.6046931678414485e-05, "loss": 0.2263, "mean_token_accuracy": 0.9442095790058375, "num_tokens": 46895405.0, "step": 6280 }, { "entropy": 1.9719792023301124, "epoch": 0.4201070304477413, "grad_norm": 0.31735241413116455, "learning_rate": 3.59946800899931e-05, "loss": 0.2405, "mean_token_accuracy": 0.941047714278102, "num_tokens": 46973170.0, "step": 6290 }, { "entropy": 1.9277971625328063, "epoch": 0.4207749271575151, "grad_norm": 0.30713051557540894, "learning_rate": 3.594236899375719e-05, "loss": 0.2209, "mean_token_accuracy": 0.9454218167811632, "num_tokens": 47046074.0, "step": 6300 }, { "entropy": 1.9037809073925018, "epoch": 0.42144282386728893, "grad_norm": 0.3050428330898285, "learning_rate": 3.588999867412975e-05, "loss": 0.2206, "mean_token_accuracy": 0.9419395077973605, "num_tokens": 47120609.0, "step": 6310 }, { "entropy": 1.931861577183008, "epoch": 0.4221107205770628, "grad_norm": 0.283743292093277, "learning_rate": 3.5837569415855825e-05, "loss": 0.226, "mean_token_accuracy": 0.9440953090786934, "num_tokens": 47194666.0, "step": 6320 }, { "entropy": 1.9015536345541477, "epoch": 0.4227786172868366, "grad_norm": 0.2638198435306549, "learning_rate": 3.578508150400092e-05, "loss": 0.2221, "mean_token_accuracy": 0.9482598397880793, "num_tokens": 47271163.0, "step": 6330 }, { "entropy": 1.8965262487530707, "epoch": 0.42344651399661043, "grad_norm": 0.28280046582221985, "learning_rate": 3.57325352239494e-05, "loss": 0.214, "mean_token_accuracy": 0.9467114940285682, "num_tokens": 47347255.0, "step": 6340 }, { "entropy": 1.8840107902884484, "epoch": 0.4241144107063843, "grad_norm": 0.33287447690963745, "learning_rate": 3.5679930861403036e-05, "loss": 0.2053, "mean_token_accuracy": 0.9492501009255647, "num_tokens": 47421584.0, "step": 6350 }, { "entropy": 1.8743778616189957, "epoch": 0.4247823074161581, "grad_norm": 0.26861509680747986, "learning_rate": 3.562726870237939e-05, "loss": 0.2384, "mean_token_accuracy": 0.9431404061615467, "num_tokens": 47497066.0, "step": 6360 }, { "entropy": 1.8955380499362946, "epoch": 0.42545020412593193, "grad_norm": 0.2798490822315216, "learning_rate": 3.557454903321026e-05, "loss": 0.2278, "mean_token_accuracy": 0.9434572167694568, "num_tokens": 47574882.0, "step": 6370 }, { "entropy": 1.9196617253124715, "epoch": 0.4261181008357058, "grad_norm": 0.3466589152812958, "learning_rate": 3.5521772140540126e-05, "loss": 0.237, "mean_token_accuracy": 0.9427095215767622, "num_tokens": 47649258.0, "step": 6380 }, { "entropy": 1.8840134643018245, "epoch": 0.4267859975454796, "grad_norm": 0.3197396993637085, "learning_rate": 3.546893831132464e-05, "loss": 0.2144, "mean_token_accuracy": 0.9482835672795773, "num_tokens": 47722587.0, "step": 6390 }, { "entropy": 1.8524423643946648, "epoch": 0.42745389425525343, "grad_norm": 0.36200129985809326, "learning_rate": 3.541604783282899e-05, "loss": 0.2338, "mean_token_accuracy": 0.9426054045557976, "num_tokens": 47796769.0, "step": 6400 }, { "entropy": 1.855437734723091, "epoch": 0.4281217909650273, "grad_norm": 0.3258037567138672, "learning_rate": 3.536310099262638e-05, "loss": 0.2188, "mean_token_accuracy": 0.9453244972974062, "num_tokens": 47871403.0, "step": 6410 }, { "entropy": 1.8843614600598813, "epoch": 0.4287896876748011, "grad_norm": 0.3072390556335449, "learning_rate": 3.531009807859648e-05, "loss": 0.2436, "mean_token_accuracy": 0.9394047453999519, "num_tokens": 47944732.0, "step": 6420 }, { "entropy": 1.8818963214755058, "epoch": 0.42945758438457493, "grad_norm": 0.2918820381164551, "learning_rate": 3.525703937892381e-05, "loss": 0.2245, "mean_token_accuracy": 0.9446279395371675, "num_tokens": 48020628.0, "step": 6430 }, { "entropy": 1.8776385493576526, "epoch": 0.4301254810943488, "grad_norm": 0.30202630162239075, "learning_rate": 3.520392518209624e-05, "loss": 0.2364, "mean_token_accuracy": 0.9430569637566805, "num_tokens": 48095543.0, "step": 6440 }, { "entropy": 1.919315802305937, "epoch": 0.4307933778041226, "grad_norm": 0.33853879570961, "learning_rate": 3.515075577690337e-05, "loss": 0.2138, "mean_token_accuracy": 0.9462950874119997, "num_tokens": 48168243.0, "step": 6450 }, { "entropy": 1.8829366579651832, "epoch": 0.43146127451389643, "grad_norm": 0.274326890707016, "learning_rate": 3.509753145243495e-05, "loss": 0.227, "mean_token_accuracy": 0.944806321337819, "num_tokens": 48243203.0, "step": 6460 }, { "entropy": 1.8829902492463588, "epoch": 0.4321291712236703, "grad_norm": 0.2924010753631592, "learning_rate": 3.504425249807938e-05, "loss": 0.2403, "mean_token_accuracy": 0.9419176794588566, "num_tokens": 48318494.0, "step": 6470 }, { "entropy": 1.9198862127959728, "epoch": 0.4327970679334441, "grad_norm": 0.316094309091568, "learning_rate": 3.4990919203522084e-05, "loss": 0.2325, "mean_token_accuracy": 0.9449028253555298, "num_tokens": 48391396.0, "step": 6480 }, { "entropy": 1.9263180814683438, "epoch": 0.43346496464321793, "grad_norm": 0.27902543544769287, "learning_rate": 3.4937531858743896e-05, "loss": 0.2241, "mean_token_accuracy": 0.9459644220769405, "num_tokens": 48465129.0, "step": 6490 }, { "entropy": 1.9368058815598488, "epoch": 0.4341328613529918, "grad_norm": 0.31840354204177856, "learning_rate": 3.4884090754019575e-05, "loss": 0.2297, "mean_token_accuracy": 0.9452568523585796, "num_tokens": 48538972.0, "step": 6500 }, { "entropy": 1.9461675800383091, "epoch": 0.4348007580627656, "grad_norm": 0.346287339925766, "learning_rate": 3.483059617991616e-05, "loss": 0.2176, "mean_token_accuracy": 0.9455453310161829, "num_tokens": 48612056.0, "step": 6510 }, { "entropy": 1.9228738784790038, "epoch": 0.43546865477253943, "grad_norm": 0.2979698181152344, "learning_rate": 3.477704842729142e-05, "loss": 0.2376, "mean_token_accuracy": 0.9440739706158638, "num_tokens": 48687725.0, "step": 6520 }, { "entropy": 1.9221594251692296, "epoch": 0.4361365514823133, "grad_norm": 0.26502421498298645, "learning_rate": 3.472344778729227e-05, "loss": 0.2202, "mean_token_accuracy": 0.9462688464671374, "num_tokens": 48762673.0, "step": 6530 }, { "entropy": 1.9363283306360244, "epoch": 0.4368044481920871, "grad_norm": 0.37736600637435913, "learning_rate": 3.4669794551353154e-05, "loss": 0.2322, "mean_token_accuracy": 0.9412756383419036, "num_tokens": 48835051.0, "step": 6540 }, { "entropy": 1.9189944982528686, "epoch": 0.43747234490186093, "grad_norm": 0.24977274239063263, "learning_rate": 3.461608901119452e-05, "loss": 0.2281, "mean_token_accuracy": 0.9436902448534965, "num_tokens": 48909132.0, "step": 6550 }, { "entropy": 1.8862173050642013, "epoch": 0.4381402416116348, "grad_norm": 0.32071566581726074, "learning_rate": 3.4562331458821164e-05, "loss": 0.2211, "mean_token_accuracy": 0.9463409461081028, "num_tokens": 48984980.0, "step": 6560 }, { "entropy": 1.895054043084383, "epoch": 0.4388081383214086, "grad_norm": 0.2953815460205078, "learning_rate": 3.4508522186520724e-05, "loss": 0.2198, "mean_token_accuracy": 0.9452447794377804, "num_tokens": 49060013.0, "step": 6570 }, { "entropy": 1.8868306331336497, "epoch": 0.43947603503118243, "grad_norm": 0.34867608547210693, "learning_rate": 3.445466148686203e-05, "loss": 0.2394, "mean_token_accuracy": 0.9442655451595783, "num_tokens": 49135941.0, "step": 6580 }, { "entropy": 1.9204572565853595, "epoch": 0.4401439317409563, "grad_norm": 0.3229929804801941, "learning_rate": 3.44007496526935e-05, "loss": 0.2332, "mean_token_accuracy": 0.9417555730789899, "num_tokens": 49209215.0, "step": 6590 }, { "entropy": 1.9017700776457787, "epoch": 0.4408118284507301, "grad_norm": 0.318572074174881, "learning_rate": 3.434678697714162e-05, "loss": 0.2349, "mean_token_accuracy": 0.9422289121896028, "num_tokens": 49285006.0, "step": 6600 }, { "entropy": 1.894771010428667, "epoch": 0.44147972516050393, "grad_norm": 0.26797112822532654, "learning_rate": 3.429277375360928e-05, "loss": 0.2439, "mean_token_accuracy": 0.941288698464632, "num_tokens": 49358810.0, "step": 6610 }, { "entropy": 1.902489211410284, "epoch": 0.4421476218702778, "grad_norm": 0.2798771858215332, "learning_rate": 3.4238710275774245e-05, "loss": 0.2208, "mean_token_accuracy": 0.9456051144748926, "num_tokens": 49433063.0, "step": 6620 }, { "entropy": 1.919239255040884, "epoch": 0.4428155185800516, "grad_norm": 0.32063212990760803, "learning_rate": 3.418459683758746e-05, "loss": 0.2277, "mean_token_accuracy": 0.9427162941545248, "num_tokens": 49507216.0, "step": 6630 }, { "entropy": 1.8541309811174869, "epoch": 0.44348341528982543, "grad_norm": 0.26682358980178833, "learning_rate": 3.4130433733271555e-05, "loss": 0.2217, "mean_token_accuracy": 0.9454412367194891, "num_tokens": 49584691.0, "step": 6640 }, { "entropy": 1.850600217282772, "epoch": 0.4441513119995993, "grad_norm": 0.3180466592311859, "learning_rate": 3.4076221257319206e-05, "loss": 0.2172, "mean_token_accuracy": 0.9476006656885148, "num_tokens": 49662014.0, "step": 6650 }, { "entropy": 1.8940122798085213, "epoch": 0.4448192087093731, "grad_norm": 0.30723103880882263, "learning_rate": 3.4021959704491493e-05, "loss": 0.234, "mean_token_accuracy": 0.9394343450665474, "num_tokens": 49733624.0, "step": 6660 }, { "entropy": 1.880489770323038, "epoch": 0.44548710541914693, "grad_norm": 0.30570298433303833, "learning_rate": 3.3967649369816364e-05, "loss": 0.2321, "mean_token_accuracy": 0.945229908823967, "num_tokens": 49806263.0, "step": 6670 }, { "entropy": 1.8641036197543144, "epoch": 0.4461550021289208, "grad_norm": 0.35547709465026855, "learning_rate": 3.3913290548587e-05, "loss": 0.2219, "mean_token_accuracy": 0.9454311702400446, "num_tokens": 49878510.0, "step": 6680 }, { "entropy": 1.862290508300066, "epoch": 0.4468228988386946, "grad_norm": 0.34313470125198364, "learning_rate": 3.38588835363602e-05, "loss": 0.2443, "mean_token_accuracy": 0.9395472008734942, "num_tokens": 49950671.0, "step": 6690 }, { "entropy": 1.892933504283428, "epoch": 0.44749079554846843, "grad_norm": 0.26510775089263916, "learning_rate": 3.380442862895478e-05, "loss": 0.2398, "mean_token_accuracy": 0.9421889808028936, "num_tokens": 50027718.0, "step": 6700 }, { "entropy": 1.8904846854507924, "epoch": 0.4481586922582423, "grad_norm": 0.2967054843902588, "learning_rate": 3.374992612244999e-05, "loss": 0.218, "mean_token_accuracy": 0.9464267261326313, "num_tokens": 50103437.0, "step": 6710 }, { "entropy": 1.8867049098014832, "epoch": 0.4488265889680161, "grad_norm": 0.32129737734794617, "learning_rate": 3.3695376313183856e-05, "loss": 0.2191, "mean_token_accuracy": 0.9464637506753206, "num_tokens": 50179359.0, "step": 6720 }, { "entropy": 1.8691880777478218, "epoch": 0.44949448567778993, "grad_norm": 0.2949567437171936, "learning_rate": 3.364077949775162e-05, "loss": 0.2226, "mean_token_accuracy": 0.9465657882392406, "num_tokens": 50254559.0, "step": 6730 }, { "entropy": 1.8490160331130028, "epoch": 0.4501623823875638, "grad_norm": 0.33848509192466736, "learning_rate": 3.3586135973004096e-05, "loss": 0.224, "mean_token_accuracy": 0.9438275959342718, "num_tokens": 50328081.0, "step": 6740 }, { "entropy": 1.8460321567952633, "epoch": 0.4508302790973376, "grad_norm": 0.3190463185310364, "learning_rate": 3.353144603604606e-05, "loss": 0.2218, "mean_token_accuracy": 0.9459980715066194, "num_tokens": 50403646.0, "step": 6750 }, { "entropy": 1.814967006444931, "epoch": 0.45149817580711143, "grad_norm": 0.2492627054452896, "learning_rate": 3.347670998423463e-05, "loss": 0.2251, "mean_token_accuracy": 0.94491036683321, "num_tokens": 50480554.0, "step": 6760 }, { "entropy": 1.8196490325033665, "epoch": 0.4521660725168853, "grad_norm": 0.34555625915527344, "learning_rate": 3.342192811517767e-05, "loss": 0.2252, "mean_token_accuracy": 0.9440069407224655, "num_tokens": 50555603.0, "step": 6770 }, { "entropy": 1.8382070384919644, "epoch": 0.4528339692266591, "grad_norm": 0.27213919162750244, "learning_rate": 3.3367100726732166e-05, "loss": 0.216, "mean_token_accuracy": 0.9474160704761744, "num_tokens": 50628568.0, "step": 6780 }, { "entropy": 1.8790905468165875, "epoch": 0.45350186593643294, "grad_norm": 0.2994993031024933, "learning_rate": 3.3312228117002564e-05, "loss": 0.234, "mean_token_accuracy": 0.9440126392990351, "num_tokens": 50700871.0, "step": 6790 }, { "entropy": 1.855829305201769, "epoch": 0.4541697626462068, "grad_norm": 0.3038565218448639, "learning_rate": 3.3257310584339236e-05, "loss": 0.2231, "mean_token_accuracy": 0.9469724778085947, "num_tokens": 50775395.0, "step": 6800 }, { "entropy": 1.9227498710155486, "epoch": 0.4548376593559806, "grad_norm": 0.46543049812316895, "learning_rate": 3.320234842733675e-05, "loss": 0.2275, "mean_token_accuracy": 0.9463567581027746, "num_tokens": 50850265.0, "step": 6810 }, { "entropy": 1.8953380823135375, "epoch": 0.45550555606575444, "grad_norm": 0.2792391777038574, "learning_rate": 3.3147341944832367e-05, "loss": 0.2243, "mean_token_accuracy": 0.9461825627833604, "num_tokens": 50923483.0, "step": 6820 }, { "entropy": 1.8902866654098034, "epoch": 0.4561734527755283, "grad_norm": 0.2938770651817322, "learning_rate": 3.30922914359043e-05, "loss": 0.2206, "mean_token_accuracy": 0.9462299484759569, "num_tokens": 50999320.0, "step": 6830 }, { "entropy": 1.8849791131913662, "epoch": 0.4568413494853021, "grad_norm": 0.3157196342945099, "learning_rate": 3.303719719987015e-05, "loss": 0.2137, "mean_token_accuracy": 0.947416216135025, "num_tokens": 51074433.0, "step": 6840 }, { "entropy": 1.892227377742529, "epoch": 0.45750924619507594, "grad_norm": 0.350421667098999, "learning_rate": 3.2982059536285295e-05, "loss": 0.2217, "mean_token_accuracy": 0.947562987357378, "num_tokens": 51150388.0, "step": 6850 }, { "entropy": 1.9007094338536263, "epoch": 0.4581771429048498, "grad_norm": 0.29797685146331787, "learning_rate": 3.292687874494121e-05, "loss": 0.2346, "mean_token_accuracy": 0.9450659941881895, "num_tokens": 51223896.0, "step": 6860 }, { "entropy": 1.9213022746145725, "epoch": 0.4588450396146236, "grad_norm": 0.270723819732666, "learning_rate": 3.287165512586386e-05, "loss": 0.2445, "mean_token_accuracy": 0.9438197415322065, "num_tokens": 51298201.0, "step": 6870 }, { "entropy": 1.8529110699892044, "epoch": 0.45951293632439744, "grad_norm": 0.3196532130241394, "learning_rate": 3.2816388979312084e-05, "loss": 0.2224, "mean_token_accuracy": 0.9463130470365286, "num_tokens": 51372610.0, "step": 6880 }, { "entropy": 1.8407471835613252, "epoch": 0.4601808330341713, "grad_norm": 0.2640169858932495, "learning_rate": 3.276108060577595e-05, "loss": 0.2247, "mean_token_accuracy": 0.9447287756949663, "num_tokens": 51447201.0, "step": 6890 }, { "entropy": 1.8109105303883553, "epoch": 0.4608487297439451, "grad_norm": 0.2655593454837799, "learning_rate": 3.270573030597511e-05, "loss": 0.2065, "mean_token_accuracy": 0.9496787924319505, "num_tokens": 51522173.0, "step": 6900 }, { "entropy": 1.8473745577037335, "epoch": 0.46151662645371894, "grad_norm": 0.30133378505706787, "learning_rate": 3.265033838085716e-05, "loss": 0.2398, "mean_token_accuracy": 0.9436753828078508, "num_tokens": 51594639.0, "step": 6910 }, { "entropy": 1.858110285550356, "epoch": 0.4621845231634928, "grad_norm": 0.36376380920410156, "learning_rate": 3.259490513159608e-05, "loss": 0.2367, "mean_token_accuracy": 0.9416541632264852, "num_tokens": 51669740.0, "step": 6920 }, { "entropy": 1.884439592808485, "epoch": 0.4628524198732666, "grad_norm": 0.3309226334095001, "learning_rate": 3.2539430859590466e-05, "loss": 0.2174, "mean_token_accuracy": 0.9472479324787855, "num_tokens": 51742364.0, "step": 6930 }, { "entropy": 1.8767762765288354, "epoch": 0.46352031658304044, "grad_norm": 0.37698131799697876, "learning_rate": 3.2483915866461976e-05, "loss": 0.2174, "mean_token_accuracy": 0.9452353831380605, "num_tokens": 51818060.0, "step": 6940 }, { "entropy": 1.9130305364727973, "epoch": 0.4641882132928143, "grad_norm": 0.28122803568840027, "learning_rate": 3.242836045405372e-05, "loss": 0.2415, "mean_token_accuracy": 0.942621236294508, "num_tokens": 51890991.0, "step": 6950 }, { "entropy": 1.921229613572359, "epoch": 0.4648561100025881, "grad_norm": 0.2826037108898163, "learning_rate": 3.237276492442852e-05, "loss": 0.2262, "mean_token_accuracy": 0.9483342789113521, "num_tokens": 51966020.0, "step": 6960 }, { "entropy": 1.8836260102689266, "epoch": 0.46552400671236194, "grad_norm": 0.30362722277641296, "learning_rate": 3.231712957986735e-05, "loss": 0.2411, "mean_token_accuracy": 0.9425248399376869, "num_tokens": 52041765.0, "step": 6970 }, { "entropy": 1.8544265240430833, "epoch": 0.4661919034221358, "grad_norm": 0.35201749205589294, "learning_rate": 3.226145472286766e-05, "loss": 0.1992, "mean_token_accuracy": 0.9497203458100557, "num_tokens": 52117393.0, "step": 6980 }, { "entropy": 1.8515958763659, "epoch": 0.4668598001319096, "grad_norm": 0.3822620213031769, "learning_rate": 3.2205740656141704e-05, "loss": 0.2357, "mean_token_accuracy": 0.9414434704929591, "num_tokens": 52189668.0, "step": 6990 }, { "entropy": 1.8938551887869834, "epoch": 0.46752769684168344, "grad_norm": 0.36982882022857666, "learning_rate": 3.214998768261498e-05, "loss": 0.2308, "mean_token_accuracy": 0.9430800579488278, "num_tokens": 52264870.0, "step": 7000 }, { "epoch": 0.46752769684168344, "eval_entropy": 1.884410347867012, "eval_loss": 0.24157805740833282, "eval_mean_token_accuracy": 0.9451566737055779, "eval_num_tokens": 52264870.0, "eval_runtime": 553.2883, "eval_samples_per_second": 36.148, "eval_steps_per_second": 9.037, "step": 7000 }, { "entropy": 1.8968149848282336, "epoch": 0.4681955935514573, "grad_norm": 0.33856382966041565, "learning_rate": 3.2094196105424476e-05, "loss": 0.2344, "mean_token_accuracy": 0.9420758977532386, "num_tokens": 52336884.0, "step": 7010 }, { "entropy": 1.8971335098147393, "epoch": 0.4688634902612311, "grad_norm": 0.3559689521789551, "learning_rate": 3.203836622791711e-05, "loss": 0.2327, "mean_token_accuracy": 0.9416660256683826, "num_tokens": 52408974.0, "step": 7020 }, { "entropy": 1.8569822050631046, "epoch": 0.46953138697100494, "grad_norm": 0.2902000844478607, "learning_rate": 3.198249835364804e-05, "loss": 0.2201, "mean_token_accuracy": 0.9460431203246117, "num_tokens": 52482004.0, "step": 7030 }, { "entropy": 1.8399673692882061, "epoch": 0.4701992836807788, "grad_norm": 0.30542469024658203, "learning_rate": 3.1926592786378997e-05, "loss": 0.2337, "mean_token_accuracy": 0.9438430979847908, "num_tokens": 52558037.0, "step": 7040 }, { "entropy": 1.8313255891203881, "epoch": 0.4708671803905526, "grad_norm": 0.2980274558067322, "learning_rate": 3.187064983007666e-05, "loss": 0.2273, "mean_token_accuracy": 0.9442933153361082, "num_tokens": 52632581.0, "step": 7050 }, { "entropy": 1.8898407019674779, "epoch": 0.47153507710032644, "grad_norm": 0.29755520820617676, "learning_rate": 3.181466978891102e-05, "loss": 0.2392, "mean_token_accuracy": 0.9428853433579206, "num_tokens": 52704292.0, "step": 7060 }, { "entropy": 1.9019944280385972, "epoch": 0.4722029738101003, "grad_norm": 0.30816546082496643, "learning_rate": 3.175865296725367e-05, "loss": 0.2394, "mean_token_accuracy": 0.9419173806905746, "num_tokens": 52778940.0, "step": 7070 }, { "entropy": 1.9086784988641738, "epoch": 0.4728708705198741, "grad_norm": 0.2939527928829193, "learning_rate": 3.170259966967622e-05, "loss": 0.2224, "mean_token_accuracy": 0.9432874158024788, "num_tokens": 52852578.0, "step": 7080 }, { "entropy": 1.8858931235969068, "epoch": 0.47353876722964794, "grad_norm": 0.2692057490348816, "learning_rate": 3.164651020094857e-05, "loss": 0.2296, "mean_token_accuracy": 0.943479648604989, "num_tokens": 52928111.0, "step": 7090 }, { "entropy": 1.9161983594298362, "epoch": 0.4742066639394218, "grad_norm": 0.3036022186279297, "learning_rate": 3.159038486603733e-05, "loss": 0.2191, "mean_token_accuracy": 0.9462693601846695, "num_tokens": 53004598.0, "step": 7100 }, { "entropy": 1.905858301371336, "epoch": 0.4748745606491956, "grad_norm": 0.27847298979759216, "learning_rate": 3.153422397010405e-05, "loss": 0.2182, "mean_token_accuracy": 0.9456410579383373, "num_tokens": 53080309.0, "step": 7110 }, { "entropy": 1.8999128639698029, "epoch": 0.47554245735896944, "grad_norm": 0.2785731554031372, "learning_rate": 3.147802781850371e-05, "loss": 0.224, "mean_token_accuracy": 0.947356840595603, "num_tokens": 53157053.0, "step": 7120 }, { "entropy": 1.8780075281858444, "epoch": 0.4762103540687433, "grad_norm": 0.2808716595172882, "learning_rate": 3.1421796716782936e-05, "loss": 0.2152, "mean_token_accuracy": 0.949623067677021, "num_tokens": 53231403.0, "step": 7130 }, { "entropy": 1.9050028070807457, "epoch": 0.4768782507785171, "grad_norm": 0.3088010251522064, "learning_rate": 3.1365530970678384e-05, "loss": 0.2276, "mean_token_accuracy": 0.9450955573469401, "num_tokens": 53304287.0, "step": 7140 }, { "entropy": 1.9440035305917263, "epoch": 0.47754614748829094, "grad_norm": 0.3013440668582916, "learning_rate": 3.13092308861151e-05, "loss": 0.2232, "mean_token_accuracy": 0.9448355570435524, "num_tokens": 53377127.0, "step": 7150 }, { "entropy": 1.903311026096344, "epoch": 0.4782140441980648, "grad_norm": 0.31735163927078247, "learning_rate": 3.125289676920479e-05, "loss": 0.225, "mean_token_accuracy": 0.9447057921439409, "num_tokens": 53452268.0, "step": 7160 }, { "entropy": 1.867805613577366, "epoch": 0.4788819409078386, "grad_norm": 0.29131561517715454, "learning_rate": 3.119652892624426e-05, "loss": 0.233, "mean_token_accuracy": 0.9428677547723054, "num_tokens": 53522599.0, "step": 7170 }, { "entropy": 1.857548114657402, "epoch": 0.47954983761761244, "grad_norm": 0.2810252904891968, "learning_rate": 3.114012766371363e-05, "loss": 0.2249, "mean_token_accuracy": 0.9437949914485216, "num_tokens": 53596596.0, "step": 7180 }, { "entropy": 1.8477457262575627, "epoch": 0.4802177343273863, "grad_norm": 0.2858681082725525, "learning_rate": 3.108369328827476e-05, "loss": 0.2273, "mean_token_accuracy": 0.9447164285928011, "num_tokens": 53671157.0, "step": 7190 }, { "entropy": 1.8654329650104047, "epoch": 0.4808856310371601, "grad_norm": 0.30987459421157837, "learning_rate": 3.1027226106769544e-05, "loss": 0.2179, "mean_token_accuracy": 0.9447156686335803, "num_tokens": 53746197.0, "step": 7200 }, { "entropy": 1.8650679022073746, "epoch": 0.48155352774693394, "grad_norm": 0.33569371700286865, "learning_rate": 3.097072642621825e-05, "loss": 0.2166, "mean_token_accuracy": 0.9470722407102585, "num_tokens": 53822332.0, "step": 7210 }, { "entropy": 1.8911114886403084, "epoch": 0.4822214244567078, "grad_norm": 0.27788618206977844, "learning_rate": 3.091419455381782e-05, "loss": 0.2115, "mean_token_accuracy": 0.9469106510281563, "num_tokens": 53895170.0, "step": 7220 }, { "entropy": 1.843412983417511, "epoch": 0.4828893211664816, "grad_norm": 0.27476271986961365, "learning_rate": 3.085763079694029e-05, "loss": 0.224, "mean_token_accuracy": 0.9419576160609722, "num_tokens": 53969783.0, "step": 7230 }, { "entropy": 1.8810128442943097, "epoch": 0.48355721787625544, "grad_norm": 0.29250454902648926, "learning_rate": 3.0801035463130986e-05, "loss": 0.21, "mean_token_accuracy": 0.9495118394494056, "num_tokens": 54046213.0, "step": 7240 }, { "entropy": 1.8746795989573002, "epoch": 0.4842251145860293, "grad_norm": 0.3428109288215637, "learning_rate": 3.074440886010697e-05, "loss": 0.217, "mean_token_accuracy": 0.946789625659585, "num_tokens": 54121485.0, "step": 7250 }, { "entropy": 1.911435604840517, "epoch": 0.4848930112958031, "grad_norm": 0.3250446021556854, "learning_rate": 3.068775129575528e-05, "loss": 0.2476, "mean_token_accuracy": 0.940335764363408, "num_tokens": 54194329.0, "step": 7260 }, { "entropy": 1.9061202213168145, "epoch": 0.48556090800557694, "grad_norm": 0.2643176019191742, "learning_rate": 3.0631063078131353e-05, "loss": 0.2158, "mean_token_accuracy": 0.9485023591667414, "num_tokens": 54269080.0, "step": 7270 }, { "entropy": 1.8695035621523857, "epoch": 0.4862288047153508, "grad_norm": 0.37113991379737854, "learning_rate": 3.0574344515457235e-05, "loss": 0.2404, "mean_token_accuracy": 0.9416939731687307, "num_tokens": 54345512.0, "step": 7280 }, { "entropy": 1.8922847397625446, "epoch": 0.4868967014251246, "grad_norm": 0.32886573672294617, "learning_rate": 3.051759591612e-05, "loss": 0.2203, "mean_token_accuracy": 0.9482366230338812, "num_tokens": 54420805.0, "step": 7290 }, { "entropy": 1.8674429669976234, "epoch": 0.48756459813489844, "grad_norm": 0.31715741753578186, "learning_rate": 3.0460817588670004e-05, "loss": 0.2265, "mean_token_accuracy": 0.9446107037365437, "num_tokens": 54494417.0, "step": 7300 }, { "entropy": 1.8811933800578118, "epoch": 0.4882324948446723, "grad_norm": 0.22023308277130127, "learning_rate": 3.0404009841819263e-05, "loss": 0.2113, "mean_token_accuracy": 0.9497490409761667, "num_tokens": 54572044.0, "step": 7310 }, { "entropy": 1.896532792598009, "epoch": 0.4889003915544461, "grad_norm": 0.3073304295539856, "learning_rate": 3.0347172984439753e-05, "loss": 0.2327, "mean_token_accuracy": 0.9447525463998317, "num_tokens": 54649823.0, "step": 7320 }, { "entropy": 1.9122162185609342, "epoch": 0.48956828826421994, "grad_norm": 0.3749728202819824, "learning_rate": 3.029030732556171e-05, "loss": 0.23, "mean_token_accuracy": 0.9446923159062862, "num_tokens": 54725767.0, "step": 7330 }, { "entropy": 1.8501642137765884, "epoch": 0.4902361849739938, "grad_norm": 0.31925761699676514, "learning_rate": 3.0233413174371984e-05, "loss": 0.2079, "mean_token_accuracy": 0.9485565960407257, "num_tokens": 54801038.0, "step": 7340 }, { "entropy": 1.890178529918194, "epoch": 0.4909040816837676, "grad_norm": 0.29928600788116455, "learning_rate": 3.0176490840212317e-05, "loss": 0.2247, "mean_token_accuracy": 0.9467503130435944, "num_tokens": 54874858.0, "step": 7350 }, { "entropy": 1.8896193079650403, "epoch": 0.49157197839354144, "grad_norm": 0.2945694625377655, "learning_rate": 3.0119540632577725e-05, "loss": 0.2289, "mean_token_accuracy": 0.9461097911000251, "num_tokens": 54947814.0, "step": 7360 }, { "entropy": 1.9230032838881015, "epoch": 0.4922398751033153, "grad_norm": 0.32664257287979126, "learning_rate": 3.006256286111474e-05, "loss": 0.2383, "mean_token_accuracy": 0.9404773727059365, "num_tokens": 55022623.0, "step": 7370 }, { "entropy": 1.927004227042198, "epoch": 0.4929077718130891, "grad_norm": 0.32149356603622437, "learning_rate": 3.0005557835619787e-05, "loss": 0.2259, "mean_token_accuracy": 0.9433298457413912, "num_tokens": 55097924.0, "step": 7380 }, { "entropy": 1.929019882529974, "epoch": 0.49357566852286294, "grad_norm": 0.2955763638019562, "learning_rate": 2.9948525866037447e-05, "loss": 0.2388, "mean_token_accuracy": 0.942776921018958, "num_tokens": 55171100.0, "step": 7390 }, { "entropy": 1.8914112061262132, "epoch": 0.4942435652326368, "grad_norm": 0.2722773551940918, "learning_rate": 2.9891467262458844e-05, "loss": 0.234, "mean_token_accuracy": 0.9418485786765813, "num_tokens": 55245366.0, "step": 7400 }, { "entropy": 1.8359092064201832, "epoch": 0.4949114619424106, "grad_norm": 0.27552735805511475, "learning_rate": 2.9834382335119876e-05, "loss": 0.2159, "mean_token_accuracy": 0.9463882490992546, "num_tokens": 55321714.0, "step": 7410 }, { "entropy": 1.8465522609651088, "epoch": 0.49557935865218444, "grad_norm": 0.32382237911224365, "learning_rate": 2.9777271394399575e-05, "loss": 0.2197, "mean_token_accuracy": 0.9491492222994566, "num_tokens": 55394885.0, "step": 7420 }, { "entropy": 1.836780784279108, "epoch": 0.4962472553619583, "grad_norm": 0.35757163166999817, "learning_rate": 2.9720134750818434e-05, "loss": 0.2169, "mean_token_accuracy": 0.9473698291927576, "num_tokens": 55466291.0, "step": 7430 }, { "entropy": 1.8885270342230798, "epoch": 0.4969151520717321, "grad_norm": 0.2864765524864197, "learning_rate": 2.9662972715036663e-05, "loss": 0.2139, "mean_token_accuracy": 0.9477612286806106, "num_tokens": 55540456.0, "step": 7440 }, { "entropy": 1.8900952532887458, "epoch": 0.49758304878150594, "grad_norm": 0.3118791878223419, "learning_rate": 2.9605785597852547e-05, "loss": 0.2269, "mean_token_accuracy": 0.9429914653301239, "num_tokens": 55613429.0, "step": 7450 }, { "entropy": 1.891358818113804, "epoch": 0.4982509454912798, "grad_norm": 0.363603413105011, "learning_rate": 2.9548573710200754e-05, "loss": 0.2337, "mean_token_accuracy": 0.9432939335703849, "num_tokens": 55688127.0, "step": 7460 }, { "entropy": 1.9004506438970565, "epoch": 0.4989188422010536, "grad_norm": 0.2596246898174286, "learning_rate": 2.9491337363150622e-05, "loss": 0.2263, "mean_token_accuracy": 0.9436323195695877, "num_tokens": 55763700.0, "step": 7470 }, { "entropy": 1.8800619326531887, "epoch": 0.49958673891082744, "grad_norm": 0.2418212592601776, "learning_rate": 2.943407686790448e-05, "loss": 0.2177, "mean_token_accuracy": 0.9471217170357704, "num_tokens": 55837299.0, "step": 7480 }, { "entropy": 1.8909110814332961, "epoch": 0.5002546356206012, "grad_norm": 0.3288103938102722, "learning_rate": 2.937679253579595e-05, "loss": 0.2356, "mean_token_accuracy": 0.942650742828846, "num_tokens": 55911171.0, "step": 7490 }, { "entropy": 1.8849252589046954, "epoch": 0.5009225323303751, "grad_norm": 0.2833203375339508, "learning_rate": 2.9319484678288262e-05, "loss": 0.2301, "mean_token_accuracy": 0.945120845735073, "num_tokens": 55986308.0, "step": 7500 }, { "entropy": 1.9096172168850898, "epoch": 0.5015904290401489, "grad_norm": 0.32700464129447937, "learning_rate": 2.926215360697255e-05, "loss": 0.2226, "mean_token_accuracy": 0.9419653285294771, "num_tokens": 56059138.0, "step": 7510 }, { "entropy": 1.8952309794723987, "epoch": 0.5022583257499228, "grad_norm": 0.32460543513298035, "learning_rate": 2.9204799633566183e-05, "loss": 0.2288, "mean_token_accuracy": 0.944747943803668, "num_tokens": 56130710.0, "step": 7520 }, { "entropy": 1.9046694047749042, "epoch": 0.5029262224596966, "grad_norm": 0.2865072786808014, "learning_rate": 2.914742306991104e-05, "loss": 0.2377, "mean_token_accuracy": 0.9400522530078887, "num_tokens": 56205557.0, "step": 7530 }, { "entropy": 1.9235623486340045, "epoch": 0.5035941191694704, "grad_norm": 0.2817114293575287, "learning_rate": 2.909002422797182e-05, "loss": 0.2239, "mean_token_accuracy": 0.945854339376092, "num_tokens": 56283915.0, "step": 7540 }, { "entropy": 1.8534704700112343, "epoch": 0.5042620158792442, "grad_norm": 0.28292497992515564, "learning_rate": 2.903260341983437e-05, "loss": 0.2099, "mean_token_accuracy": 0.9479105699807405, "num_tokens": 56358765.0, "step": 7550 }, { "entropy": 1.8678145796060561, "epoch": 0.5049299125890181, "grad_norm": 0.27667731046676636, "learning_rate": 2.8975160957703952e-05, "loss": 0.2286, "mean_token_accuracy": 0.9462063115090131, "num_tokens": 56432537.0, "step": 7560 }, { "entropy": 1.9020389944314957, "epoch": 0.505597809298792, "grad_norm": 0.3124503195285797, "learning_rate": 2.8917697153903567e-05, "loss": 0.2189, "mean_token_accuracy": 0.9463117547333241, "num_tokens": 56505356.0, "step": 7570 }, { "entropy": 1.8646268159151078, "epoch": 0.5062657060085658, "grad_norm": 0.34951356053352356, "learning_rate": 2.8860212320872264e-05, "loss": 0.2129, "mean_token_accuracy": 0.9468833450227976, "num_tokens": 56578292.0, "step": 7580 }, { "entropy": 1.8221788071095943, "epoch": 0.5069336027183396, "grad_norm": 0.2863594591617584, "learning_rate": 2.8802706771163428e-05, "loss": 0.2093, "mean_token_accuracy": 0.9479325834661723, "num_tokens": 56654498.0, "step": 7590 }, { "entropy": 1.8536480709910392, "epoch": 0.5076014994281134, "grad_norm": 0.327137291431427, "learning_rate": 2.874518081744309e-05, "loss": 0.2421, "mean_token_accuracy": 0.9376656226813793, "num_tokens": 56728279.0, "step": 7600 }, { "entropy": 1.8634555891156197, "epoch": 0.5082693961378872, "grad_norm": 0.2959681749343872, "learning_rate": 2.8687634772488186e-05, "loss": 0.2316, "mean_token_accuracy": 0.9440638281404972, "num_tokens": 56802952.0, "step": 7610 }, { "entropy": 1.871063868701458, "epoch": 0.5089372928476611, "grad_norm": 0.32574859261512756, "learning_rate": 2.863006894918494e-05, "loss": 0.2126, "mean_token_accuracy": 0.9461169857531786, "num_tokens": 56878476.0, "step": 7620 }, { "entropy": 1.8941338248550892, "epoch": 0.509605189557435, "grad_norm": 0.30667027831077576, "learning_rate": 2.8572483660527078e-05, "loss": 0.2394, "mean_token_accuracy": 0.9433797467499971, "num_tokens": 56954176.0, "step": 7630 }, { "entropy": 1.8805853471159935, "epoch": 0.5102730862672088, "grad_norm": 0.29259997606277466, "learning_rate": 2.8514879219614182e-05, "loss": 0.2106, "mean_token_accuracy": 0.9467896539717913, "num_tokens": 57029462.0, "step": 7640 }, { "entropy": 1.8603178225457668, "epoch": 0.5109409829769826, "grad_norm": 0.27425578236579895, "learning_rate": 2.845725593964996e-05, "loss": 0.2095, "mean_token_accuracy": 0.9481328092515469, "num_tokens": 57104841.0, "step": 7650 }, { "entropy": 1.9001431725919247, "epoch": 0.5116088796867564, "grad_norm": 0.31165963411331177, "learning_rate": 2.8399614133940537e-05, "loss": 0.2211, "mean_token_accuracy": 0.9453007891774178, "num_tokens": 57177654.0, "step": 7660 }, { "entropy": 1.8816741175949574, "epoch": 0.5122767763965302, "grad_norm": 0.26656800508499146, "learning_rate": 2.8341954115892798e-05, "loss": 0.2147, "mean_token_accuracy": 0.9465901501476764, "num_tokens": 57253170.0, "step": 7670 }, { "entropy": 1.8403189226984977, "epoch": 0.5129446731063041, "grad_norm": 0.2890680432319641, "learning_rate": 2.8284276199012618e-05, "loss": 0.2263, "mean_token_accuracy": 0.9464253015816212, "num_tokens": 57326768.0, "step": 7680 }, { "entropy": 1.8553779326379298, "epoch": 0.513612569816078, "grad_norm": 0.40375080704689026, "learning_rate": 2.822658069690321e-05, "loss": 0.2322, "mean_token_accuracy": 0.943346194177866, "num_tokens": 57400329.0, "step": 7690 }, { "entropy": 1.8662341050803661, "epoch": 0.5142804665258518, "grad_norm": 0.30424338579177856, "learning_rate": 2.81688679232634e-05, "loss": 0.216, "mean_token_accuracy": 0.9460494916886091, "num_tokens": 57476630.0, "step": 7700 }, { "entropy": 1.8503398597240448, "epoch": 0.5149483632356257, "grad_norm": 0.2923349440097809, "learning_rate": 2.81111381918859e-05, "loss": 0.2006, "mean_token_accuracy": 0.9492053009569645, "num_tokens": 57553020.0, "step": 7710 }, { "entropy": 1.8587808765470981, "epoch": 0.5156162599453994, "grad_norm": 0.26285168528556824, "learning_rate": 2.8053391816655656e-05, "loss": 0.2294, "mean_token_accuracy": 0.9411367610096931, "num_tokens": 57629074.0, "step": 7720 }, { "entropy": 1.8495754942297935, "epoch": 0.5162841566551732, "grad_norm": 0.31382155418395996, "learning_rate": 2.799562911154809e-05, "loss": 0.2256, "mean_token_accuracy": 0.9439142808318138, "num_tokens": 57702819.0, "step": 7730 }, { "entropy": 1.837379440665245, "epoch": 0.5169520533649471, "grad_norm": 0.26100775599479675, "learning_rate": 2.7937850390627406e-05, "loss": 0.2157, "mean_token_accuracy": 0.9464406784623861, "num_tokens": 57779718.0, "step": 7740 }, { "entropy": 1.8983632288873196, "epoch": 0.517619950074721, "grad_norm": 0.31474626064300537, "learning_rate": 2.788005596804492e-05, "loss": 0.2282, "mean_token_accuracy": 0.9455306556075811, "num_tokens": 57855193.0, "step": 7750 }, { "entropy": 1.8795831046998501, "epoch": 0.5182878467844948, "grad_norm": 0.29401010274887085, "learning_rate": 2.7822246158037268e-05, "loss": 0.2362, "mean_token_accuracy": 0.9417175475507975, "num_tokens": 57933506.0, "step": 7760 }, { "entropy": 1.8830607444047929, "epoch": 0.5189557434942687, "grad_norm": 0.30570951104164124, "learning_rate": 2.7764421274924803e-05, "loss": 0.2239, "mean_token_accuracy": 0.9436976905912161, "num_tokens": 58008336.0, "step": 7770 }, { "entropy": 1.916810903698206, "epoch": 0.5196236402040424, "grad_norm": 0.2321866899728775, "learning_rate": 2.77065816331098e-05, "loss": 0.2253, "mean_token_accuracy": 0.9460313744843006, "num_tokens": 58081812.0, "step": 7780 }, { "entropy": 1.8622855216264724, "epoch": 0.5202915369138162, "grad_norm": 0.33274272084236145, "learning_rate": 2.764872754707479e-05, "loss": 0.2403, "mean_token_accuracy": 0.9432096824049949, "num_tokens": 58156913.0, "step": 7790 }, { "entropy": 1.8577060863375663, "epoch": 0.5209594336235901, "grad_norm": 0.3021269738674164, "learning_rate": 2.7590859331380842e-05, "loss": 0.2162, "mean_token_accuracy": 0.9461881406605244, "num_tokens": 58234003.0, "step": 7800 }, { "entropy": 1.8902149342000485, "epoch": 0.521627330333364, "grad_norm": 0.3278430998325348, "learning_rate": 2.7532977300665836e-05, "loss": 0.2392, "mean_token_accuracy": 0.9436495702713728, "num_tokens": 58306444.0, "step": 7810 }, { "entropy": 1.8972839921712876, "epoch": 0.5222952270431378, "grad_norm": 0.35462868213653564, "learning_rate": 2.747508176964278e-05, "loss": 0.2375, "mean_token_accuracy": 0.9418607074767351, "num_tokens": 58382798.0, "step": 7820 }, { "entropy": 1.8793871521949768, "epoch": 0.5229631237529117, "grad_norm": 0.26488596200942993, "learning_rate": 2.741717305309808e-05, "loss": 0.2029, "mean_token_accuracy": 0.9513823010027409, "num_tokens": 58458235.0, "step": 7830 }, { "entropy": 1.884317271411419, "epoch": 0.5236310204626854, "grad_norm": 0.3493448495864868, "learning_rate": 2.735925146588984e-05, "loss": 0.2266, "mean_token_accuracy": 0.9436733886599541, "num_tokens": 58532396.0, "step": 7840 }, { "entropy": 1.8265122584998608, "epoch": 0.5242989171724592, "grad_norm": 0.3416137993335724, "learning_rate": 2.730131732294614e-05, "loss": 0.2035, "mean_token_accuracy": 0.9487059112638235, "num_tokens": 58608437.0, "step": 7850 }, { "entropy": 1.8567959085106849, "epoch": 0.5249668138822331, "grad_norm": 0.30284300446510315, "learning_rate": 2.7243370939263314e-05, "loss": 0.2228, "mean_token_accuracy": 0.9484416019171477, "num_tokens": 58685069.0, "step": 7860 }, { "entropy": 1.9211342953145505, "epoch": 0.525634710592007, "grad_norm": 0.26501908898353577, "learning_rate": 2.7185412629904266e-05, "loss": 0.2307, "mean_token_accuracy": 0.9424899592995644, "num_tokens": 58759659.0, "step": 7870 }, { "entropy": 1.9020105704665184, "epoch": 0.5263026073017808, "grad_norm": 0.2968217134475708, "learning_rate": 2.7127442709996754e-05, "loss": 0.2282, "mean_token_accuracy": 0.9454322118312121, "num_tokens": 58835859.0, "step": 7880 }, { "entropy": 1.8932685352861882, "epoch": 0.5269705040115547, "grad_norm": 0.33987903594970703, "learning_rate": 2.7069461494731625e-05, "loss": 0.2353, "mean_token_accuracy": 0.9406254064291716, "num_tokens": 58909083.0, "step": 7890 }, { "entropy": 1.8616687595844268, "epoch": 0.5276384007213284, "grad_norm": 0.2925051152706146, "learning_rate": 2.7011469299361185e-05, "loss": 0.2273, "mean_token_accuracy": 0.9443053800612689, "num_tokens": 58982603.0, "step": 7900 }, { "entropy": 1.886468544602394, "epoch": 0.5283062974311022, "grad_norm": 0.25922802090644836, "learning_rate": 2.69534664391974e-05, "loss": 0.2325, "mean_token_accuracy": 0.941967923566699, "num_tokens": 59058616.0, "step": 7910 }, { "entropy": 1.8770767435431481, "epoch": 0.5289741941408761, "grad_norm": 0.30758416652679443, "learning_rate": 2.689545322961025e-05, "loss": 0.2136, "mean_token_accuracy": 0.9472320355474949, "num_tokens": 59131392.0, "step": 7920 }, { "entropy": 1.8575767748057843, "epoch": 0.52964209085065, "grad_norm": 0.2764682173728943, "learning_rate": 2.6837429986025986e-05, "loss": 0.2223, "mean_token_accuracy": 0.9451409664005042, "num_tokens": 59204405.0, "step": 7930 }, { "entropy": 1.8431726060807705, "epoch": 0.5303099875604238, "grad_norm": 0.29136666655540466, "learning_rate": 2.677939702392539e-05, "loss": 0.2388, "mean_token_accuracy": 0.9441762343049049, "num_tokens": 59279492.0, "step": 7940 }, { "entropy": 1.866943745315075, "epoch": 0.5309778842701977, "grad_norm": 0.3011800944805145, "learning_rate": 2.6721354658842117e-05, "loss": 0.2235, "mean_token_accuracy": 0.9448039442300796, "num_tokens": 59352696.0, "step": 7950 }, { "entropy": 1.8778190918266773, "epoch": 0.5316457809799714, "grad_norm": 0.29560622572898865, "learning_rate": 2.6663303206360917e-05, "loss": 0.2319, "mean_token_accuracy": 0.9429251346737146, "num_tokens": 59425908.0, "step": 7960 }, { "entropy": 1.835938535630703, "epoch": 0.5323136776897452, "grad_norm": 0.33805063366889954, "learning_rate": 2.6605242982115975e-05, "loss": 0.2255, "mean_token_accuracy": 0.9455182150006294, "num_tokens": 59500064.0, "step": 7970 }, { "entropy": 1.86594817340374, "epoch": 0.5329815743995191, "grad_norm": 0.2938584089279175, "learning_rate": 2.6547174301789163e-05, "loss": 0.2194, "mean_token_accuracy": 0.9445056736469268, "num_tokens": 59573575.0, "step": 7980 }, { "entropy": 1.856761346757412, "epoch": 0.533649471109293, "grad_norm": 0.3130123019218445, "learning_rate": 2.6489097481108316e-05, "loss": 0.215, "mean_token_accuracy": 0.9471686478704214, "num_tokens": 59650851.0, "step": 7990 }, { "entropy": 1.8781053856015206, "epoch": 0.5343173678190668, "grad_norm": 0.2852950096130371, "learning_rate": 2.6431012835845554e-05, "loss": 0.2234, "mean_token_accuracy": 0.9456228621304035, "num_tokens": 59727481.0, "step": 8000 }, { "epoch": 0.5343173678190668, "eval_entropy": 1.8662060023546219, "eval_loss": 0.2400374561548233, "eval_mean_token_accuracy": 0.9455185312509536, "eval_num_tokens": 59727481.0, "eval_runtime": 551.793, "eval_samples_per_second": 36.245, "eval_steps_per_second": 9.061, "step": 8000 }, { "entropy": 1.8653590969741345, "epoch": 0.5349852645288407, "grad_norm": 0.3038094639778137, "learning_rate": 2.6372920681815506e-05, "loss": 0.216, "mean_token_accuracy": 0.9466887358576059, "num_tokens": 59803300.0, "step": 8010 }, { "entropy": 1.8486957401037216, "epoch": 0.5356531612386144, "grad_norm": 0.35459452867507935, "learning_rate": 2.631482133487365e-05, "loss": 0.2, "mean_token_accuracy": 0.951388519257307, "num_tokens": 59879357.0, "step": 8020 }, { "entropy": 1.8877455413341522, "epoch": 0.5363210579483882, "grad_norm": 0.3583106994628906, "learning_rate": 2.6256715110914594e-05, "loss": 0.2288, "mean_token_accuracy": 0.9436018981039525, "num_tokens": 59952207.0, "step": 8030 }, { "entropy": 1.8483912728726863, "epoch": 0.5369889546581621, "grad_norm": 0.2703855633735657, "learning_rate": 2.619860232587028e-05, "loss": 0.2179, "mean_token_accuracy": 0.9464797597378493, "num_tokens": 60028845.0, "step": 8040 }, { "entropy": 1.8448423579335214, "epoch": 0.537656851367936, "grad_norm": 0.35421881079673767, "learning_rate": 2.614048329570838e-05, "loss": 0.2272, "mean_token_accuracy": 0.9448291774839163, "num_tokens": 60103064.0, "step": 8050 }, { "entropy": 1.8547725677490234, "epoch": 0.5383247480777098, "grad_norm": 0.2990838587284088, "learning_rate": 2.6082358336430483e-05, "loss": 0.238, "mean_token_accuracy": 0.9419344145804643, "num_tokens": 60176068.0, "step": 8060 }, { "entropy": 1.8373032554984092, "epoch": 0.5389926447874837, "grad_norm": 0.31900662183761597, "learning_rate": 2.6024227764070445e-05, "loss": 0.2195, "mean_token_accuracy": 0.9477964285761118, "num_tokens": 60250295.0, "step": 8070 }, { "entropy": 1.8211630158126355, "epoch": 0.5396605414972574, "grad_norm": 0.3096672296524048, "learning_rate": 2.5966091894692622e-05, "loss": 0.2116, "mean_token_accuracy": 0.9478581257164478, "num_tokens": 60325809.0, "step": 8080 }, { "entropy": 1.8228729732334614, "epoch": 0.5403284382070312, "grad_norm": 0.32388898730278015, "learning_rate": 2.590795104439017e-05, "loss": 0.2298, "mean_token_accuracy": 0.9449355151504278, "num_tokens": 60402637.0, "step": 8090 }, { "entropy": 1.8285527899861336, "epoch": 0.5409963349168051, "grad_norm": 0.34106579422950745, "learning_rate": 2.5849805529283345e-05, "loss": 0.2125, "mean_token_accuracy": 0.9474385660141706, "num_tokens": 60475072.0, "step": 8100 }, { "entropy": 1.8566961660981178, "epoch": 0.541664231626579, "grad_norm": 0.31970328092575073, "learning_rate": 2.579165566551774e-05, "loss": 0.2201, "mean_token_accuracy": 0.9445961304008961, "num_tokens": 60548308.0, "step": 8110 }, { "entropy": 1.8654835544526578, "epoch": 0.5423321283363528, "grad_norm": 0.32882964611053467, "learning_rate": 2.5733501769262603e-05, "loss": 0.2187, "mean_token_accuracy": 0.9471868388354778, "num_tokens": 60623089.0, "step": 8120 }, { "entropy": 1.8858015693724155, "epoch": 0.5430000250461267, "grad_norm": 0.30182120203971863, "learning_rate": 2.567534415670914e-05, "loss": 0.2367, "mean_token_accuracy": 0.9412665236741304, "num_tokens": 60695316.0, "step": 8130 }, { "entropy": 1.8781175762414932, "epoch": 0.5436679217559004, "grad_norm": 0.30538490414619446, "learning_rate": 2.5617183144068696e-05, "loss": 0.2378, "mean_token_accuracy": 0.9420166041702032, "num_tokens": 60769035.0, "step": 8140 }, { "entropy": 1.873946213722229, "epoch": 0.5443358184656742, "grad_norm": 0.27864402532577515, "learning_rate": 2.5559019047571158e-05, "loss": 0.2174, "mean_token_accuracy": 0.9482248164713383, "num_tokens": 60843937.0, "step": 8150 }, { "entropy": 1.8589042626321315, "epoch": 0.5450037151754481, "grad_norm": 0.2768818438053131, "learning_rate": 2.5500852183463176e-05, "loss": 0.2276, "mean_token_accuracy": 0.9468735165894031, "num_tokens": 60918638.0, "step": 8160 }, { "entropy": 1.8665156617760659, "epoch": 0.545671611885222, "grad_norm": 0.27443212270736694, "learning_rate": 2.54426828680064e-05, "loss": 0.2081, "mean_token_accuracy": 0.9479584507644176, "num_tokens": 60993406.0, "step": 8170 }, { "entropy": 1.9043079972267152, "epoch": 0.5463395085949958, "grad_norm": 0.27907121181488037, "learning_rate": 2.5384511417475876e-05, "loss": 0.2197, "mean_token_accuracy": 0.9454525198787451, "num_tokens": 61070200.0, "step": 8180 }, { "entropy": 1.858091312646866, "epoch": 0.5470074053047697, "grad_norm": 0.31660377979278564, "learning_rate": 2.532633814815821e-05, "loss": 0.2192, "mean_token_accuracy": 0.9451952267438173, "num_tokens": 61145664.0, "step": 8190 }, { "entropy": 1.8549466118216515, "epoch": 0.5476753020145434, "grad_norm": 0.3399874269962311, "learning_rate": 2.5268163376349917e-05, "loss": 0.2187, "mean_token_accuracy": 0.947270717844367, "num_tokens": 61220071.0, "step": 8200 }, { "entropy": 1.8488216981291772, "epoch": 0.5483431987243172, "grad_norm": 0.31718650460243225, "learning_rate": 2.520998741835567e-05, "loss": 0.2441, "mean_token_accuracy": 0.9422694411128759, "num_tokens": 61292349.0, "step": 8210 }, { "entropy": 1.8508421078324317, "epoch": 0.5490110954340911, "grad_norm": 0.3083728551864624, "learning_rate": 2.5151810590486603e-05, "loss": 0.2384, "mean_token_accuracy": 0.9440817829221487, "num_tokens": 61369176.0, "step": 8220 }, { "entropy": 1.8460893273353576, "epoch": 0.549678992143865, "grad_norm": 0.2717324495315552, "learning_rate": 2.509363320905858e-05, "loss": 0.2152, "mean_token_accuracy": 0.9461930736899375, "num_tokens": 61440801.0, "step": 8230 }, { "entropy": 1.837957539409399, "epoch": 0.5503468888536388, "grad_norm": 0.27208277583122253, "learning_rate": 2.5035455590390466e-05, "loss": 0.212, "mean_token_accuracy": 0.9456074565649033, "num_tokens": 61516268.0, "step": 8240 }, { "entropy": 1.857341504096985, "epoch": 0.5510147855634127, "grad_norm": 0.30795618891716003, "learning_rate": 2.4977278050802416e-05, "loss": 0.2108, "mean_token_accuracy": 0.9469363793730736, "num_tokens": 61591889.0, "step": 8250 }, { "entropy": 1.859669104218483, "epoch": 0.5516826822731864, "grad_norm": 0.26675838232040405, "learning_rate": 2.4919100906614166e-05, "loss": 0.2215, "mean_token_accuracy": 0.9426109079271555, "num_tokens": 61665263.0, "step": 8260 }, { "entropy": 1.883779937773943, "epoch": 0.5523505789829602, "grad_norm": 0.3161466121673584, "learning_rate": 2.486092447414328e-05, "loss": 0.2296, "mean_token_accuracy": 0.9453294552862644, "num_tokens": 61741405.0, "step": 8270 }, { "entropy": 1.9008271612226963, "epoch": 0.5530184756927341, "grad_norm": 0.3709556758403778, "learning_rate": 2.4802749069703486e-05, "loss": 0.2378, "mean_token_accuracy": 0.9416403114795685, "num_tokens": 61816289.0, "step": 8280 }, { "entropy": 1.9084829442203044, "epoch": 0.553686372402508, "grad_norm": 0.3552102744579315, "learning_rate": 2.474457500960289e-05, "loss": 0.2207, "mean_token_accuracy": 0.944573924690485, "num_tokens": 61890748.0, "step": 8290 }, { "entropy": 1.9128666058182717, "epoch": 0.5543542691122818, "grad_norm": 0.2954138517379761, "learning_rate": 2.4686402610142308e-05, "loss": 0.23, "mean_token_accuracy": 0.9433212172240019, "num_tokens": 61963216.0, "step": 8300 }, { "entropy": 1.8967509530484676, "epoch": 0.5550221658220557, "grad_norm": 0.329120397567749, "learning_rate": 2.462823218761352e-05, "loss": 0.2344, "mean_token_accuracy": 0.9463879529386758, "num_tokens": 62037313.0, "step": 8310 }, { "entropy": 1.8885513134300709, "epoch": 0.5556900625318294, "grad_norm": 0.28542664647102356, "learning_rate": 2.457006405829755e-05, "loss": 0.2084, "mean_token_accuracy": 0.9479470700025558, "num_tokens": 62113956.0, "step": 8320 }, { "entropy": 1.9086256839334965, "epoch": 0.5563579592416033, "grad_norm": 0.324243426322937, "learning_rate": 2.451189853846298e-05, "loss": 0.2385, "mean_token_accuracy": 0.9402048338204623, "num_tokens": 62186155.0, "step": 8330 }, { "entropy": 1.8833911538124084, "epoch": 0.5570258559513771, "grad_norm": 0.28702181577682495, "learning_rate": 2.4453735944364173e-05, "loss": 0.2223, "mean_token_accuracy": 0.9454862978309393, "num_tokens": 62261828.0, "step": 8340 }, { "entropy": 1.8757649213075638, "epoch": 0.557693752661151, "grad_norm": 0.37363365292549133, "learning_rate": 2.4395576592239597e-05, "loss": 0.2186, "mean_token_accuracy": 0.947131934016943, "num_tokens": 62337417.0, "step": 8350 }, { "entropy": 1.8477208264172078, "epoch": 0.5583616493709248, "grad_norm": 0.2944476008415222, "learning_rate": 2.4337420798310094e-05, "loss": 0.213, "mean_token_accuracy": 0.9485928833484649, "num_tokens": 62411953.0, "step": 8360 }, { "entropy": 1.8999232091009617, "epoch": 0.5590295460806987, "grad_norm": 0.4096059501171112, "learning_rate": 2.427926887877716e-05, "loss": 0.2299, "mean_token_accuracy": 0.9444582555443048, "num_tokens": 62487166.0, "step": 8370 }, { "entropy": 1.8844099454581738, "epoch": 0.5596974427904724, "grad_norm": 0.2626202702522278, "learning_rate": 2.422112114982122e-05, "loss": 0.2093, "mean_token_accuracy": 0.9487072411924601, "num_tokens": 62561941.0, "step": 8380 }, { "entropy": 1.8820263959467411, "epoch": 0.5603653395002463, "grad_norm": 0.27855777740478516, "learning_rate": 2.4162977927599922e-05, "loss": 0.2184, "mean_token_accuracy": 0.9470836147665977, "num_tokens": 62636692.0, "step": 8390 }, { "entropy": 1.885035403072834, "epoch": 0.5610332362100201, "grad_norm": 0.3330121338367462, "learning_rate": 2.4104839528246412e-05, "loss": 0.2168, "mean_token_accuracy": 0.9466604709625244, "num_tokens": 62708450.0, "step": 8400 }, { "entropy": 1.8940217658877372, "epoch": 0.561701132919794, "grad_norm": 0.39527344703674316, "learning_rate": 2.40467062678676e-05, "loss": 0.2635, "mean_token_accuracy": 0.9377460069954395, "num_tokens": 62780463.0, "step": 8410 }, { "entropy": 1.8828867062926293, "epoch": 0.5623690296295678, "grad_norm": 0.27089861035346985, "learning_rate": 2.398857846254246e-05, "loss": 0.2335, "mean_token_accuracy": 0.9446988385170698, "num_tokens": 62853909.0, "step": 8420 }, { "entropy": 1.8660736046731472, "epoch": 0.5630369263393417, "grad_norm": 0.2980462610721588, "learning_rate": 2.393045642832031e-05, "loss": 0.2139, "mean_token_accuracy": 0.9481238935142755, "num_tokens": 62927668.0, "step": 8430 }, { "entropy": 1.880422654747963, "epoch": 0.5637048230491154, "grad_norm": 0.32885050773620605, "learning_rate": 2.387234048121908e-05, "loss": 0.2418, "mean_token_accuracy": 0.9407288305461406, "num_tokens": 63002537.0, "step": 8440 }, { "entropy": 1.854230558872223, "epoch": 0.5643727197588893, "grad_norm": 0.29425862431526184, "learning_rate": 2.3814230937223625e-05, "loss": 0.2074, "mean_token_accuracy": 0.949595658481121, "num_tokens": 63079226.0, "step": 8450 }, { "entropy": 1.8476892814040184, "epoch": 0.5650406164686631, "grad_norm": 0.3095671236515045, "learning_rate": 2.375612811228397e-05, "loss": 0.2082, "mean_token_accuracy": 0.9486114624887705, "num_tokens": 63153413.0, "step": 8460 }, { "entropy": 1.852500356733799, "epoch": 0.565708513178437, "grad_norm": 0.38513025641441345, "learning_rate": 2.3698032322313597e-05, "loss": 0.2328, "mean_token_accuracy": 0.9416500601917506, "num_tokens": 63227570.0, "step": 8470 }, { "entropy": 1.8510682493448258, "epoch": 0.5663764098882108, "grad_norm": 0.27778077125549316, "learning_rate": 2.363994388318777e-05, "loss": 0.2101, "mean_token_accuracy": 0.9455769184976817, "num_tokens": 63299693.0, "step": 8480 }, { "entropy": 1.875589492917061, "epoch": 0.5670443065979847, "grad_norm": 0.3203050196170807, "learning_rate": 2.358186311074175e-05, "loss": 0.2358, "mean_token_accuracy": 0.9414773181080818, "num_tokens": 63375898.0, "step": 8490 }, { "entropy": 1.8759691730141639, "epoch": 0.5677122033077584, "grad_norm": 0.3363718092441559, "learning_rate": 2.352379032076913e-05, "loss": 0.2382, "mean_token_accuracy": 0.9420657128095626, "num_tokens": 63451921.0, "step": 8500 }, { "entropy": 1.8908679261803627, "epoch": 0.5683801000175323, "grad_norm": 0.34495604038238525, "learning_rate": 2.3465725829020107e-05, "loss": 0.2303, "mean_token_accuracy": 0.9428388562053442, "num_tokens": 63527033.0, "step": 8510 }, { "entropy": 1.890539725869894, "epoch": 0.5690479967273061, "grad_norm": 0.31119126081466675, "learning_rate": 2.3407669951199746e-05, "loss": 0.2267, "mean_token_accuracy": 0.943016241490841, "num_tokens": 63601512.0, "step": 8520 }, { "entropy": 1.9125523708760739, "epoch": 0.56971589343708, "grad_norm": 0.3263043463230133, "learning_rate": 2.334962300296629e-05, "loss": 0.2271, "mean_token_accuracy": 0.9413581982254982, "num_tokens": 63678361.0, "step": 8530 }, { "entropy": 1.857296995073557, "epoch": 0.5703837901468538, "grad_norm": 0.33531224727630615, "learning_rate": 2.3291585299929408e-05, "loss": 0.2118, "mean_token_accuracy": 0.9479674693197012, "num_tokens": 63754152.0, "step": 8540 }, { "entropy": 1.8451183453202247, "epoch": 0.5710516868566277, "grad_norm": 0.3622986078262329, "learning_rate": 2.323355715764854e-05, "loss": 0.2231, "mean_token_accuracy": 0.9451228737831116, "num_tokens": 63829944.0, "step": 8550 }, { "entropy": 1.8715076744556427, "epoch": 0.5717195835664014, "grad_norm": 0.27118003368377686, "learning_rate": 2.3175538891631098e-05, "loss": 0.2252, "mean_token_accuracy": 0.9428528670221568, "num_tokens": 63907417.0, "step": 8560 }, { "entropy": 1.8734317906200886, "epoch": 0.5723874802761753, "grad_norm": 0.34238213300704956, "learning_rate": 2.3117530817330828e-05, "loss": 0.2284, "mean_token_accuracy": 0.944256753847003, "num_tokens": 63983175.0, "step": 8570 }, { "entropy": 1.8877094030380248, "epoch": 0.5730553769859491, "grad_norm": 0.25891923904418945, "learning_rate": 2.3059533250146053e-05, "loss": 0.2155, "mean_token_accuracy": 0.9459561046212912, "num_tokens": 64059041.0, "step": 8580 }, { "entropy": 1.8511331334710122, "epoch": 0.573723273695723, "grad_norm": 0.25855767726898193, "learning_rate": 2.3001546505417955e-05, "loss": 0.2165, "mean_token_accuracy": 0.9472135379910469, "num_tokens": 64133932.0, "step": 8590 }, { "entropy": 1.8539586246013642, "epoch": 0.5743911704054968, "grad_norm": 0.3344471752643585, "learning_rate": 2.29435708984289e-05, "loss": 0.2169, "mean_token_accuracy": 0.9478591121733189, "num_tokens": 64207767.0, "step": 8600 }, { "entropy": 1.8822246044874191, "epoch": 0.5750590671152707, "grad_norm": 0.33001628518104553, "learning_rate": 2.2885606744400665e-05, "loss": 0.2332, "mean_token_accuracy": 0.9429154712706804, "num_tokens": 64283244.0, "step": 8610 }, { "entropy": 1.8829777382314206, "epoch": 0.5757269638250444, "grad_norm": 0.33794325590133667, "learning_rate": 2.2827654358492776e-05, "loss": 0.2273, "mean_token_accuracy": 0.9459087539464235, "num_tokens": 64358844.0, "step": 8620 }, { "entropy": 1.8854925595223904, "epoch": 0.5763948605348183, "grad_norm": 0.2960599660873413, "learning_rate": 2.276971405580077e-05, "loss": 0.2492, "mean_token_accuracy": 0.940941645950079, "num_tokens": 64432317.0, "step": 8630 }, { "entropy": 1.8776641704142094, "epoch": 0.5770627572445921, "grad_norm": 0.30550751090049744, "learning_rate": 2.271178615135449e-05, "loss": 0.2197, "mean_token_accuracy": 0.9465542431920767, "num_tokens": 64506050.0, "step": 8640 }, { "entropy": 1.8687704667448997, "epoch": 0.577730653954366, "grad_norm": 0.30258113145828247, "learning_rate": 2.2653870960116343e-05, "loss": 0.2244, "mean_token_accuracy": 0.9450478479266167, "num_tokens": 64580978.0, "step": 8650 }, { "entropy": 1.875409981608391, "epoch": 0.5783985506641398, "grad_norm": 0.26282933354377747, "learning_rate": 2.2595968796979647e-05, "loss": 0.2253, "mean_token_accuracy": 0.9448274232447147, "num_tokens": 64655287.0, "step": 8660 }, { "entropy": 1.8955595210194587, "epoch": 0.5790664473739137, "grad_norm": 0.2973979115486145, "learning_rate": 2.253807997676686e-05, "loss": 0.2078, "mean_token_accuracy": 0.9478851392865181, "num_tokens": 64728315.0, "step": 8670 }, { "entropy": 1.8781954944133759, "epoch": 0.5797343440836874, "grad_norm": 0.3379066288471222, "learning_rate": 2.2480204814227916e-05, "loss": 0.2306, "mean_token_accuracy": 0.9437055505812169, "num_tokens": 64803924.0, "step": 8680 }, { "entropy": 1.8334377713501453, "epoch": 0.5804022407934613, "grad_norm": 0.24142281711101532, "learning_rate": 2.2422343624038454e-05, "loss": 0.2344, "mean_token_accuracy": 0.9435370784252882, "num_tokens": 64878201.0, "step": 8690 }, { "entropy": 1.8821712143719196, "epoch": 0.5810701375032351, "grad_norm": 0.34564438462257385, "learning_rate": 2.2364496720798182e-05, "loss": 0.2189, "mean_token_accuracy": 0.9451495166867971, "num_tokens": 64950541.0, "step": 8700 }, { "entropy": 1.861238856613636, "epoch": 0.581738034213009, "grad_norm": 0.27618059515953064, "learning_rate": 2.230666441902911e-05, "loss": 0.2093, "mean_token_accuracy": 0.9489861331880093, "num_tokens": 65025332.0, "step": 8710 }, { "entropy": 1.8650747872889042, "epoch": 0.5824059309227828, "grad_norm": 0.34626632928848267, "learning_rate": 2.224884703317385e-05, "loss": 0.2168, "mean_token_accuracy": 0.9464887123554945, "num_tokens": 65103052.0, "step": 8720 }, { "entropy": 1.8383357889950276, "epoch": 0.5830738276325567, "grad_norm": 0.26530808210372925, "learning_rate": 2.219104487759393e-05, "loss": 0.218, "mean_token_accuracy": 0.9458564352244139, "num_tokens": 65179654.0, "step": 8730 }, { "entropy": 1.8766178764402865, "epoch": 0.5837417243423304, "grad_norm": 0.3435424566268921, "learning_rate": 2.2133258266568054e-05, "loss": 0.2272, "mean_token_accuracy": 0.9450260020792485, "num_tokens": 65258149.0, "step": 8740 }, { "entropy": 1.886311811953783, "epoch": 0.5844096210521043, "grad_norm": 0.37311139702796936, "learning_rate": 2.207548751429042e-05, "loss": 0.2348, "mean_token_accuracy": 0.9424681596457958, "num_tokens": 65330251.0, "step": 8750 }, { "entropy": 1.8896283090114594, "epoch": 0.5850775177618781, "grad_norm": 0.3530047535896301, "learning_rate": 2.2017732934869e-05, "loss": 0.2324, "mean_token_accuracy": 0.9447159558534622, "num_tokens": 65405042.0, "step": 8760 }, { "entropy": 1.8673791393637658, "epoch": 0.585745414471652, "grad_norm": 0.28683504462242126, "learning_rate": 2.1959994842323817e-05, "loss": 0.207, "mean_token_accuracy": 0.9495283108204603, "num_tokens": 65482208.0, "step": 8770 }, { "entropy": 1.9134384475648403, "epoch": 0.5864133111814258, "grad_norm": 0.25487807393074036, "learning_rate": 2.1902273550585268e-05, "loss": 0.2235, "mean_token_accuracy": 0.9441673211753369, "num_tokens": 65553720.0, "step": 8780 }, { "entropy": 1.8667981952428818, "epoch": 0.5870812078911997, "grad_norm": 0.31790125370025635, "learning_rate": 2.184456937349239e-05, "loss": 0.2117, "mean_token_accuracy": 0.9489233203232288, "num_tokens": 65627833.0, "step": 8790 }, { "entropy": 1.8735299795866012, "epoch": 0.5877491046009734, "grad_norm": 0.2702594995498657, "learning_rate": 2.1786882624791184e-05, "loss": 0.2279, "mean_token_accuracy": 0.9412693019956351, "num_tokens": 65700658.0, "step": 8800 }, { "entropy": 1.8720247872173785, "epoch": 0.5884170013107473, "grad_norm": 0.33199939131736755, "learning_rate": 2.172921361813286e-05, "loss": 0.2355, "mean_token_accuracy": 0.943020797893405, "num_tokens": 65773535.0, "step": 8810 }, { "entropy": 1.93101811632514, "epoch": 0.5890848980205211, "grad_norm": 0.312505304813385, "learning_rate": 2.1671562667072192e-05, "loss": 0.2224, "mean_token_accuracy": 0.946207469701767, "num_tokens": 65846820.0, "step": 8820 }, { "entropy": 1.9124097622931004, "epoch": 0.589752794730295, "grad_norm": 0.2954193353652954, "learning_rate": 2.161393008506577e-05, "loss": 0.2277, "mean_token_accuracy": 0.9451969265937805, "num_tokens": 65921770.0, "step": 8830 }, { "entropy": 1.903800082951784, "epoch": 0.5904206914400688, "grad_norm": 0.3304347097873688, "learning_rate": 2.15563161854703e-05, "loss": 0.2292, "mean_token_accuracy": 0.9432186961174012, "num_tokens": 65997086.0, "step": 8840 }, { "entropy": 1.9177384577691554, "epoch": 0.5910885881498427, "grad_norm": 0.28481411933898926, "learning_rate": 2.1498721281540933e-05, "loss": 0.228, "mean_token_accuracy": 0.9438555292785168, "num_tokens": 66070291.0, "step": 8850 }, { "entropy": 1.905167955905199, "epoch": 0.5917564848596164, "grad_norm": 0.3228171169757843, "learning_rate": 2.1441145686429504e-05, "loss": 0.2188, "mean_token_accuracy": 0.946232233941555, "num_tokens": 66147691.0, "step": 8860 }, { "entropy": 1.888053610920906, "epoch": 0.5924243815693903, "grad_norm": 0.28190138936042786, "learning_rate": 2.13835897131829e-05, "loss": 0.2098, "mean_token_accuracy": 0.9469707697629929, "num_tokens": 66220838.0, "step": 8870 }, { "entropy": 1.9335898198187351, "epoch": 0.5930922782791641, "grad_norm": 0.2705141603946686, "learning_rate": 2.132605367474129e-05, "loss": 0.2328, "mean_token_accuracy": 0.9434020731598138, "num_tokens": 66296329.0, "step": 8880 }, { "entropy": 1.9194143183529377, "epoch": 0.593760174988938, "grad_norm": 0.2994906008243561, "learning_rate": 2.1268537883936475e-05, "loss": 0.2121, "mean_token_accuracy": 0.9483712319284677, "num_tokens": 66370210.0, "step": 8890 }, { "entropy": 1.8665772572159767, "epoch": 0.5944280716987118, "grad_norm": 0.2874792516231537, "learning_rate": 2.1211042653490153e-05, "loss": 0.2155, "mean_token_accuracy": 0.9487036559730768, "num_tokens": 66447967.0, "step": 8900 }, { "entropy": 1.8565380208194255, "epoch": 0.5950959684084857, "grad_norm": 0.2950595021247864, "learning_rate": 2.115356829601225e-05, "loss": 0.223, "mean_token_accuracy": 0.9464364275336266, "num_tokens": 66526240.0, "step": 8910 }, { "entropy": 1.9438115067780017, "epoch": 0.5957638651182594, "grad_norm": 0.2848196029663086, "learning_rate": 2.109611512399918e-05, "loss": 0.2436, "mean_token_accuracy": 0.9396346066147089, "num_tokens": 66599836.0, "step": 8920 }, { "entropy": 1.8883643224835396, "epoch": 0.5964317618280333, "grad_norm": 0.3058909773826599, "learning_rate": 2.1038683449832187e-05, "loss": 0.2224, "mean_token_accuracy": 0.945417657494545, "num_tokens": 66677293.0, "step": 8930 }, { "entropy": 1.9076268143951893, "epoch": 0.5970996585378071, "grad_norm": 0.24468903243541718, "learning_rate": 2.0981273585775614e-05, "loss": 0.2233, "mean_token_accuracy": 0.9450872246176004, "num_tokens": 66754489.0, "step": 8940 }, { "entropy": 1.8957035705447196, "epoch": 0.597767555247581, "grad_norm": 0.38515496253967285, "learning_rate": 2.092388584397523e-05, "loss": 0.2283, "mean_token_accuracy": 0.9423262067139149, "num_tokens": 66831836.0, "step": 8950 }, { "entropy": 1.9043849639594554, "epoch": 0.5984354519573548, "grad_norm": 0.2943609058856964, "learning_rate": 2.0866520536456525e-05, "loss": 0.2174, "mean_token_accuracy": 0.9477788418531418, "num_tokens": 66904632.0, "step": 8960 }, { "entropy": 1.9066061675548553, "epoch": 0.5991033486671287, "grad_norm": 0.27270668745040894, "learning_rate": 2.0809177975122995e-05, "loss": 0.2272, "mean_token_accuracy": 0.9435584831982851, "num_tokens": 66977461.0, "step": 8970 }, { "entropy": 1.8915106266736985, "epoch": 0.5997712453769024, "grad_norm": 0.38080450892448425, "learning_rate": 2.0751858471754477e-05, "loss": 0.2302, "mean_token_accuracy": 0.9453171331435442, "num_tokens": 67051417.0, "step": 8980 }, { "entropy": 1.8840370245277882, "epoch": 0.6004391420866763, "grad_norm": 0.2830585241317749, "learning_rate": 2.0694562338005424e-05, "loss": 0.2254, "mean_token_accuracy": 0.946152427047491, "num_tokens": 67126731.0, "step": 8990 }, { "entropy": 1.9158569969236852, "epoch": 0.6011070387964501, "grad_norm": 0.3386516869068146, "learning_rate": 2.063728988540324e-05, "loss": 0.2268, "mean_token_accuracy": 0.9459601316601038, "num_tokens": 67199356.0, "step": 9000 }, { "epoch": 0.6011070387964501, "eval_entropy": 1.9054617335557937, "eval_loss": 0.23829054832458496, "eval_mean_token_accuracy": 0.9458289430618286, "eval_num_tokens": 67199356.0, "eval_runtime": 552.7364, "eval_samples_per_second": 36.184, "eval_steps_per_second": 9.046, "step": 9000 }, { "entropy": 1.8930243149399757, "epoch": 0.601774935506224, "grad_norm": 0.3108629584312439, "learning_rate": 2.0580041425346568e-05, "loss": 0.2216, "mean_token_accuracy": 0.9460563812404871, "num_tokens": 67274255.0, "step": 9010 }, { "entropy": 1.8935005687177182, "epoch": 0.6024428322159978, "grad_norm": 0.30720093846321106, "learning_rate": 2.0522817269103586e-05, "loss": 0.2106, "mean_token_accuracy": 0.9482952229678631, "num_tokens": 67346807.0, "step": 9020 }, { "entropy": 1.8668569043278693, "epoch": 0.6031107289257717, "grad_norm": 0.31876540184020996, "learning_rate": 2.0465617727810345e-05, "loss": 0.2111, "mean_token_accuracy": 0.9487547673285007, "num_tokens": 67423456.0, "step": 9030 }, { "entropy": 1.8769634239375592, "epoch": 0.6037786256355455, "grad_norm": 0.36163222789764404, "learning_rate": 2.0408443112469055e-05, "loss": 0.2346, "mean_token_accuracy": 0.9438016287982464, "num_tokens": 67498565.0, "step": 9040 }, { "entropy": 1.9187280721962452, "epoch": 0.6044465223453193, "grad_norm": 0.30067041516304016, "learning_rate": 2.03512937339464e-05, "loss": 0.2119, "mean_token_accuracy": 0.9475815940648318, "num_tokens": 67575572.0, "step": 9050 }, { "entropy": 1.9150158524513246, "epoch": 0.6051144190550931, "grad_norm": 0.3035737872123718, "learning_rate": 2.029416990297184e-05, "loss": 0.2176, "mean_token_accuracy": 0.9453137967735529, "num_tokens": 67649413.0, "step": 9060 }, { "entropy": 1.9148891039192677, "epoch": 0.605782315764867, "grad_norm": 0.3508419990539551, "learning_rate": 2.0237071930135946e-05, "loss": 0.2106, "mean_token_accuracy": 0.947960839420557, "num_tokens": 67723583.0, "step": 9070 }, { "entropy": 1.8879984691739082, "epoch": 0.6064502124746408, "grad_norm": 0.2787244915962219, "learning_rate": 2.0180000125888686e-05, "loss": 0.2144, "mean_token_accuracy": 0.947710957750678, "num_tokens": 67798263.0, "step": 9080 }, { "entropy": 1.9052270293235778, "epoch": 0.6071181091844147, "grad_norm": 0.35291776061058044, "learning_rate": 2.012295480053774e-05, "loss": 0.2167, "mean_token_accuracy": 0.946917486935854, "num_tokens": 67875758.0, "step": 9090 }, { "entropy": 1.926875291019678, "epoch": 0.6077860058941885, "grad_norm": 0.3031468689441681, "learning_rate": 2.0065936264246838e-05, "loss": 0.2251, "mean_token_accuracy": 0.9462259538471699, "num_tokens": 67951984.0, "step": 9100 }, { "entropy": 1.90597188398242, "epoch": 0.6084539026039623, "grad_norm": 0.34051406383514404, "learning_rate": 2.0008944827034016e-05, "loss": 0.2223, "mean_token_accuracy": 0.9454433262348175, "num_tokens": 68025754.0, "step": 9110 }, { "entropy": 1.891847651451826, "epoch": 0.6091217993137361, "grad_norm": 0.28218090534210205, "learning_rate": 1.995198079877e-05, "loss": 0.224, "mean_token_accuracy": 0.9456320758908987, "num_tokens": 68102227.0, "step": 9120 }, { "entropy": 1.906551606953144, "epoch": 0.60978969602351, "grad_norm": 0.32842859625816345, "learning_rate": 1.9895044489176478e-05, "loss": 0.2116, "mean_token_accuracy": 0.9474180229008198, "num_tokens": 68178543.0, "step": 9130 }, { "entropy": 1.9225084953010083, "epoch": 0.6104575927332838, "grad_norm": 0.3469751179218292, "learning_rate": 1.983813620782445e-05, "loss": 0.2199, "mean_token_accuracy": 0.9457121465355158, "num_tokens": 68255718.0, "step": 9140 }, { "entropy": 1.9057083517313003, "epoch": 0.6111254894430577, "grad_norm": 0.26819270849227905, "learning_rate": 1.978125626413248e-05, "loss": 0.2226, "mean_token_accuracy": 0.9458238828927279, "num_tokens": 68328639.0, "step": 9150 }, { "entropy": 1.90034921169281, "epoch": 0.6117933861528315, "grad_norm": 0.3128930628299713, "learning_rate": 1.9724404967365102e-05, "loss": 0.2177, "mean_token_accuracy": 0.9472173463553191, "num_tokens": 68401721.0, "step": 9160 }, { "entropy": 1.875298696011305, "epoch": 0.6124612828626053, "grad_norm": 0.33448532223701477, "learning_rate": 1.9667582626631046e-05, "loss": 0.2303, "mean_token_accuracy": 0.9450565122067929, "num_tokens": 68477289.0, "step": 9170 }, { "entropy": 1.895997653156519, "epoch": 0.6131291795723791, "grad_norm": 0.3845632076263428, "learning_rate": 1.9610789550881645e-05, "loss": 0.2358, "mean_token_accuracy": 0.9430301874876023, "num_tokens": 68550763.0, "step": 9180 }, { "entropy": 1.9016799658536911, "epoch": 0.613797076282153, "grad_norm": 0.32598045468330383, "learning_rate": 1.9554026048909092e-05, "loss": 0.2117, "mean_token_accuracy": 0.9479414414614439, "num_tokens": 68625310.0, "step": 9190 }, { "entropy": 1.8913936592638492, "epoch": 0.6144649729919268, "grad_norm": 0.34851107001304626, "learning_rate": 1.9497292429344784e-05, "loss": 0.2198, "mean_token_accuracy": 0.945693937316537, "num_tokens": 68703488.0, "step": 9200 }, { "entropy": 1.8864638805389404, "epoch": 0.6151328697017007, "grad_norm": 0.28284165263175964, "learning_rate": 1.9440589000657648e-05, "loss": 0.2304, "mean_token_accuracy": 0.9435976024717092, "num_tokens": 68779271.0, "step": 9210 }, { "entropy": 1.8724992901086808, "epoch": 0.6158007664114745, "grad_norm": 0.2989194691181183, "learning_rate": 1.938391607115246e-05, "loss": 0.223, "mean_token_accuracy": 0.9453818060457706, "num_tokens": 68853160.0, "step": 9220 }, { "entropy": 1.8866638407111167, "epoch": 0.6164686631212483, "grad_norm": 0.30060428380966187, "learning_rate": 1.9327273948968175e-05, "loss": 0.2109, "mean_token_accuracy": 0.9489407524466514, "num_tokens": 68926654.0, "step": 9230 }, { "entropy": 1.8895188309252262, "epoch": 0.6171365598310221, "grad_norm": 0.2604714632034302, "learning_rate": 1.927066294207621e-05, "loss": 0.2372, "mean_token_accuracy": 0.9458476543426514, "num_tokens": 69000867.0, "step": 9240 }, { "entropy": 1.9009686149656773, "epoch": 0.617804456540796, "grad_norm": 0.3436797261238098, "learning_rate": 1.9214083358278846e-05, "loss": 0.2339, "mean_token_accuracy": 0.9434888288378716, "num_tokens": 69074583.0, "step": 9250 }, { "entropy": 1.8971208855509758, "epoch": 0.6184723532505698, "grad_norm": 0.2961723506450653, "learning_rate": 1.9157535505207495e-05, "loss": 0.2172, "mean_token_accuracy": 0.9440949592739344, "num_tokens": 69149262.0, "step": 9260 }, { "entropy": 1.8461739234626293, "epoch": 0.6191402499603437, "grad_norm": 0.3290032148361206, "learning_rate": 1.9101019690321035e-05, "loss": 0.2203, "mean_token_accuracy": 0.9460521291941404, "num_tokens": 69225923.0, "step": 9270 }, { "entropy": 1.8542075894773007, "epoch": 0.6198081466701175, "grad_norm": 0.26672402024269104, "learning_rate": 1.9044536220904162e-05, "loss": 0.2113, "mean_token_accuracy": 0.9467404522001743, "num_tokens": 69301932.0, "step": 9280 }, { "entropy": 1.8576584227383137, "epoch": 0.6204760433798913, "grad_norm": 0.3438381254673004, "learning_rate": 1.8988085404065695e-05, "loss": 0.2033, "mean_token_accuracy": 0.9490065883845091, "num_tokens": 69374963.0, "step": 9290 }, { "entropy": 1.8618731454014779, "epoch": 0.6211439400896651, "grad_norm": 0.2744857370853424, "learning_rate": 1.8931667546736925e-05, "loss": 0.2213, "mean_token_accuracy": 0.9437948763370514, "num_tokens": 69449043.0, "step": 9300 }, { "entropy": 1.8539308667182923, "epoch": 0.621811836799439, "grad_norm": 0.3019644618034363, "learning_rate": 1.8875282955669926e-05, "loss": 0.2193, "mean_token_accuracy": 0.9427087072283029, "num_tokens": 69524625.0, "step": 9310 }, { "entropy": 1.893137027323246, "epoch": 0.6224797335092128, "grad_norm": 0.2724396884441376, "learning_rate": 1.8818931937435908e-05, "loss": 0.2431, "mean_token_accuracy": 0.94328334890306, "num_tokens": 69597493.0, "step": 9320 }, { "entropy": 1.8799325823783875, "epoch": 0.6231476302189867, "grad_norm": 0.27898383140563965, "learning_rate": 1.876261479842355e-05, "loss": 0.2278, "mean_token_accuracy": 0.9454366229474545, "num_tokens": 69673405.0, "step": 9330 }, { "entropy": 1.8927228800952434, "epoch": 0.6238155269287605, "grad_norm": 0.2509833872318268, "learning_rate": 1.8706331844837298e-05, "loss": 0.2055, "mean_token_accuracy": 0.9507538910955191, "num_tokens": 69748795.0, "step": 9340 }, { "entropy": 1.9088469952344895, "epoch": 0.6244834236385343, "grad_norm": 0.33189061284065247, "learning_rate": 1.8650083382695736e-05, "loss": 0.2229, "mean_token_accuracy": 0.9470415290445089, "num_tokens": 69822471.0, "step": 9350 }, { "entropy": 1.9100259378552438, "epoch": 0.6251513203483081, "grad_norm": 0.3775787055492401, "learning_rate": 1.859386971782994e-05, "loss": 0.2318, "mean_token_accuracy": 0.9430906638503075, "num_tokens": 69896670.0, "step": 9360 }, { "entropy": 1.8997727893292904, "epoch": 0.625819217058082, "grad_norm": 0.29177314043045044, "learning_rate": 1.8537691155881742e-05, "loss": 0.2178, "mean_token_accuracy": 0.9444642275571823, "num_tokens": 69973519.0, "step": 9370 }, { "entropy": 1.8985559575259685, "epoch": 0.6264871137678558, "grad_norm": 0.3505083918571472, "learning_rate": 1.8481548002302158e-05, "loss": 0.2292, "mean_token_accuracy": 0.9444281063973904, "num_tokens": 70048731.0, "step": 9380 }, { "entropy": 1.874289197474718, "epoch": 0.6271550104776297, "grad_norm": 0.3835582733154297, "learning_rate": 1.8425440562349657e-05, "loss": 0.2126, "mean_token_accuracy": 0.9475785404443741, "num_tokens": 70126718.0, "step": 9390 }, { "entropy": 1.8724834360182285, "epoch": 0.6278229071874035, "grad_norm": 0.32895326614379883, "learning_rate": 1.8369369141088532e-05, "loss": 0.2128, "mean_token_accuracy": 0.9477534204721451, "num_tokens": 70203946.0, "step": 9400 }, { "entropy": 1.9146189346909523, "epoch": 0.6284908038971773, "grad_norm": 0.3408152461051941, "learning_rate": 1.8313334043387253e-05, "loss": 0.2377, "mean_token_accuracy": 0.9416464570909738, "num_tokens": 70277262.0, "step": 9410 }, { "entropy": 1.90368904620409, "epoch": 0.6291587006069511, "grad_norm": 0.34073203802108765, "learning_rate": 1.825733557391677e-05, "loss": 0.2271, "mean_token_accuracy": 0.9401124123483896, "num_tokens": 70351864.0, "step": 9420 }, { "entropy": 1.8903987191617488, "epoch": 0.629826597316725, "grad_norm": 0.3101690411567688, "learning_rate": 1.820137403714889e-05, "loss": 0.2162, "mean_token_accuracy": 0.9469412431120873, "num_tokens": 70424867.0, "step": 9430 }, { "entropy": 1.9022814162075519, "epoch": 0.6304944940264988, "grad_norm": 0.3661165237426758, "learning_rate": 1.8145449737354623e-05, "loss": 0.2246, "mean_token_accuracy": 0.9438300043344497, "num_tokens": 70500190.0, "step": 9440 }, { "entropy": 1.8979595214128495, "epoch": 0.6311623907362727, "grad_norm": 0.36789000034332275, "learning_rate": 1.8089562978602493e-05, "loss": 0.223, "mean_token_accuracy": 0.9425424974411726, "num_tokens": 70576208.0, "step": 9450 }, { "entropy": 1.8826049737632276, "epoch": 0.6318302874460465, "grad_norm": 0.28903254866600037, "learning_rate": 1.8033714064756934e-05, "loss": 0.2207, "mean_token_accuracy": 0.9426618255674839, "num_tokens": 70648440.0, "step": 9460 }, { "entropy": 1.895417645573616, "epoch": 0.6324981841558203, "grad_norm": 0.3099706470966339, "learning_rate": 1.7977903299476584e-05, "loss": 0.2186, "mean_token_accuracy": 0.9456299874931574, "num_tokens": 70723830.0, "step": 9470 }, { "entropy": 1.8829485289752483, "epoch": 0.6331660808655941, "grad_norm": 0.309557169675827, "learning_rate": 1.7922130986212696e-05, "loss": 0.222, "mean_token_accuracy": 0.9443500895053148, "num_tokens": 70798345.0, "step": 9480 }, { "entropy": 1.899361400306225, "epoch": 0.633833977575368, "grad_norm": 0.29913508892059326, "learning_rate": 1.786639742820741e-05, "loss": 0.2135, "mean_token_accuracy": 0.9478815961629152, "num_tokens": 70874617.0, "step": 9490 }, { "entropy": 1.8868928365409374, "epoch": 0.6345018742851418, "grad_norm": 0.24733923375606537, "learning_rate": 1.781070292849218e-05, "loss": 0.2152, "mean_token_accuracy": 0.9475489914417267, "num_tokens": 70949437.0, "step": 9500 }, { "entropy": 1.8958236001431943, "epoch": 0.6351697709949157, "grad_norm": 0.302013635635376, "learning_rate": 1.77550477898861e-05, "loss": 0.2297, "mean_token_accuracy": 0.9406222008168698, "num_tokens": 71023015.0, "step": 9510 }, { "entropy": 1.8743866764008998, "epoch": 0.6358376677046895, "grad_norm": 0.29208335280418396, "learning_rate": 1.7699432314994226e-05, "loss": 0.2089, "mean_token_accuracy": 0.946915852278471, "num_tokens": 71098694.0, "step": 9520 }, { "entropy": 1.8999532632529736, "epoch": 0.6365055644144633, "grad_norm": 0.27738434076309204, "learning_rate": 1.764385680620597e-05, "loss": 0.2275, "mean_token_accuracy": 0.9449752297252416, "num_tokens": 71173168.0, "step": 9530 }, { "entropy": 1.8916003756225108, "epoch": 0.6371734611242371, "grad_norm": 0.36834222078323364, "learning_rate": 1.7588321565693444e-05, "loss": 0.2174, "mean_token_accuracy": 0.9484237350523472, "num_tokens": 71247516.0, "step": 9540 }, { "entropy": 1.8881634168326855, "epoch": 0.637841357834011, "grad_norm": 0.36912626028060913, "learning_rate": 1.7532826895409815e-05, "loss": 0.2359, "mean_token_accuracy": 0.9426255002617836, "num_tokens": 71321309.0, "step": 9550 }, { "entropy": 1.9114818081259728, "epoch": 0.6385092545437848, "grad_norm": 0.32032787799835205, "learning_rate": 1.7477373097087664e-05, "loss": 0.2164, "mean_token_accuracy": 0.9461173076182604, "num_tokens": 71395536.0, "step": 9560 }, { "entropy": 1.8963179916143418, "epoch": 0.6391771512535587, "grad_norm": 0.30320611596107483, "learning_rate": 1.7421960472237325e-05, "loss": 0.2284, "mean_token_accuracy": 0.9446917619556189, "num_tokens": 71469799.0, "step": 9570 }, { "entropy": 1.8971133276820182, "epoch": 0.6398450479633325, "grad_norm": 0.3104685842990875, "learning_rate": 1.7366589322145292e-05, "loss": 0.2192, "mean_token_accuracy": 0.9449749819934368, "num_tokens": 71543703.0, "step": 9580 }, { "entropy": 1.8932307437062263, "epoch": 0.6405129446731063, "grad_norm": 0.28371432423591614, "learning_rate": 1.7311259947872564e-05, "loss": 0.2338, "mean_token_accuracy": 0.9452110283076763, "num_tokens": 71617039.0, "step": 9590 }, { "entropy": 1.8857156790792942, "epoch": 0.6411808413828801, "grad_norm": 0.3060430884361267, "learning_rate": 1.725597265025296e-05, "loss": 0.2062, "mean_token_accuracy": 0.9494408696889878, "num_tokens": 71691536.0, "step": 9600 }, { "entropy": 1.914458305388689, "epoch": 0.641848738092654, "grad_norm": 0.2998836040496826, "learning_rate": 1.7200727729891557e-05, "loss": 0.2105, "mean_token_accuracy": 0.9502223901450634, "num_tokens": 71770840.0, "step": 9610 }, { "entropy": 1.9375434875488282, "epoch": 0.6425166348024278, "grad_norm": 0.33531689643859863, "learning_rate": 1.7145525487162996e-05, "loss": 0.2405, "mean_token_accuracy": 0.9410932116210461, "num_tokens": 71844026.0, "step": 9620 }, { "entropy": 1.900812315195799, "epoch": 0.6431845315122017, "grad_norm": 0.2553114891052246, "learning_rate": 1.709036622220989e-05, "loss": 0.2257, "mean_token_accuracy": 0.9443730093538761, "num_tokens": 71918643.0, "step": 9630 }, { "entropy": 1.9463625065982342, "epoch": 0.6438524282219755, "grad_norm": 0.37230777740478516, "learning_rate": 1.703525023494118e-05, "loss": 0.2435, "mean_token_accuracy": 0.9423607751727104, "num_tokens": 71990166.0, "step": 9640 }, { "entropy": 1.9112353555858135, "epoch": 0.6445203249317493, "grad_norm": 0.2643808126449585, "learning_rate": 1.6980177825030468e-05, "loss": 0.2187, "mean_token_accuracy": 0.9439635403454304, "num_tokens": 72063734.0, "step": 9650 }, { "entropy": 1.9036917440593242, "epoch": 0.6451882216415231, "grad_norm": 0.32149404287338257, "learning_rate": 1.6925149291914465e-05, "loss": 0.2355, "mean_token_accuracy": 0.942261739820242, "num_tokens": 72135959.0, "step": 9660 }, { "entropy": 1.8577286154031754, "epoch": 0.645856118351297, "grad_norm": 0.32772204279899597, "learning_rate": 1.6870164934791278e-05, "loss": 0.2036, "mean_token_accuracy": 0.9486184068024158, "num_tokens": 72211938.0, "step": 9670 }, { "entropy": 1.913424578309059, "epoch": 0.6465240150610708, "grad_norm": 0.32256755232810974, "learning_rate": 1.681522505261885e-05, "loss": 0.2432, "mean_token_accuracy": 0.942617866396904, "num_tokens": 72284128.0, "step": 9680 }, { "entropy": 1.9126008175313474, "epoch": 0.6471919117708447, "grad_norm": 0.33424055576324463, "learning_rate": 1.6760329944113286e-05, "loss": 0.2256, "mean_token_accuracy": 0.9433588128536939, "num_tokens": 72356840.0, "step": 9690 }, { "entropy": 1.9473415218293666, "epoch": 0.6478598084806185, "grad_norm": 0.33258989453315735, "learning_rate": 1.6705479907747266e-05, "loss": 0.2369, "mean_token_accuracy": 0.9426125854253768, "num_tokens": 72430720.0, "step": 9700 }, { "entropy": 1.8974012099206448, "epoch": 0.6485277051903923, "grad_norm": 0.29704323410987854, "learning_rate": 1.6650675241748402e-05, "loss": 0.2324, "mean_token_accuracy": 0.9434922259300947, "num_tokens": 72503072.0, "step": 9710 }, { "entropy": 1.9120988190174102, "epoch": 0.6491956019001661, "grad_norm": 0.2917936146259308, "learning_rate": 1.6595916244097618e-05, "loss": 0.2373, "mean_token_accuracy": 0.9428652595728636, "num_tokens": 72579059.0, "step": 9720 }, { "entropy": 1.9111275486648083, "epoch": 0.64986349860994, "grad_norm": 0.32185760140419006, "learning_rate": 1.6541203212527534e-05, "loss": 0.2209, "mean_token_accuracy": 0.9451362181454896, "num_tokens": 72656873.0, "step": 9730 }, { "entropy": 1.9101318418979645, "epoch": 0.6505313953197138, "grad_norm": 0.33374306559562683, "learning_rate": 1.648653644452084e-05, "loss": 0.2309, "mean_token_accuracy": 0.9426966361701489, "num_tokens": 72731989.0, "step": 9740 }, { "entropy": 1.8926914855837822, "epoch": 0.6511992920294877, "grad_norm": 0.30848056077957153, "learning_rate": 1.6431916237308703e-05, "loss": 0.2193, "mean_token_accuracy": 0.9459914352744818, "num_tokens": 72804092.0, "step": 9750 }, { "entropy": 1.8973691657185554, "epoch": 0.6518671887392615, "grad_norm": 0.32435324788093567, "learning_rate": 1.6377342887869105e-05, "loss": 0.2523, "mean_token_accuracy": 0.941319564729929, "num_tokens": 72876634.0, "step": 9760 }, { "entropy": 1.892369518429041, "epoch": 0.6525350854490353, "grad_norm": 0.28423383831977844, "learning_rate": 1.6322816692925273e-05, "loss": 0.2234, "mean_token_accuracy": 0.9461352091282607, "num_tokens": 72951549.0, "step": 9770 }, { "entropy": 1.917740623652935, "epoch": 0.6532029821588091, "grad_norm": 0.3266948461532593, "learning_rate": 1.6268337948944054e-05, "loss": 0.2308, "mean_token_accuracy": 0.9406094893813133, "num_tokens": 73023602.0, "step": 9780 }, { "entropy": 1.922014880180359, "epoch": 0.653870878868583, "grad_norm": 0.35251879692077637, "learning_rate": 1.6213906952134283e-05, "loss": 0.2335, "mean_token_accuracy": 0.9410470966249704, "num_tokens": 73094850.0, "step": 9790 }, { "entropy": 1.891479628533125, "epoch": 0.6545387755783568, "grad_norm": 0.25936606526374817, "learning_rate": 1.6159523998445182e-05, "loss": 0.2125, "mean_token_accuracy": 0.9463196698576212, "num_tokens": 73168575.0, "step": 9800 }, { "entropy": 1.883493823558092, "epoch": 0.6552066722881307, "grad_norm": 0.3399842083454132, "learning_rate": 1.6105189383564782e-05, "loss": 0.222, "mean_token_accuracy": 0.9449453841894865, "num_tokens": 73242763.0, "step": 9810 }, { "entropy": 1.8951681099832058, "epoch": 0.6558745689979045, "grad_norm": 0.34557831287384033, "learning_rate": 1.6050903402918253e-05, "loss": 0.2298, "mean_token_accuracy": 0.9446959998458624, "num_tokens": 73317960.0, "step": 9820 }, { "entropy": 1.8923872597515583, "epoch": 0.6565424657076783, "grad_norm": 0.3376432955265045, "learning_rate": 1.5996666351666364e-05, "loss": 0.2068, "mean_token_accuracy": 0.9481453604996204, "num_tokens": 73391636.0, "step": 9830 }, { "entropy": 1.891785554587841, "epoch": 0.6572103624174521, "grad_norm": 0.30720290541648865, "learning_rate": 1.5942478524703838e-05, "loss": 0.2323, "mean_token_accuracy": 0.9421215292066336, "num_tokens": 73464577.0, "step": 9840 }, { "entropy": 1.8919872418045998, "epoch": 0.657878259127226, "grad_norm": 0.26905012130737305, "learning_rate": 1.5888340216657754e-05, "loss": 0.2087, "mean_token_accuracy": 0.9481104116886854, "num_tokens": 73539071.0, "step": 9850 }, { "entropy": 1.9074813894927503, "epoch": 0.6585461558369998, "grad_norm": 0.28303661942481995, "learning_rate": 1.5834251721885955e-05, "loss": 0.2331, "mean_token_accuracy": 0.9425707191228867, "num_tokens": 73611514.0, "step": 9860 }, { "entropy": 1.8842093892395497, "epoch": 0.6592140525467737, "grad_norm": 0.3321745991706848, "learning_rate": 1.578021333447543e-05, "loss": 0.2116, "mean_token_accuracy": 0.9476104851812124, "num_tokens": 73685360.0, "step": 9870 }, { "entropy": 1.9000260949134826, "epoch": 0.6598819492565475, "grad_norm": 0.2837125062942505, "learning_rate": 1.572622534824075e-05, "loss": 0.2301, "mean_token_accuracy": 0.9446627900004387, "num_tokens": 73758057.0, "step": 9880 }, { "entropy": 1.9003470219671725, "epoch": 0.6605498459663213, "grad_norm": 0.26702362298965454, "learning_rate": 1.567228805672242e-05, "loss": 0.209, "mean_token_accuracy": 0.9485840313136578, "num_tokens": 73833189.0, "step": 9890 }, { "entropy": 1.8759419411420821, "epoch": 0.6612177426760951, "grad_norm": 0.2915317416191101, "learning_rate": 1.5618401753185338e-05, "loss": 0.2112, "mean_token_accuracy": 0.9462038677185773, "num_tokens": 73907938.0, "step": 9900 }, { "entropy": 1.897911613434553, "epoch": 0.661885639385869, "grad_norm": 0.34235090017318726, "learning_rate": 1.5564566730617153e-05, "loss": 0.2359, "mean_token_accuracy": 0.9429119873791934, "num_tokens": 73979605.0, "step": 9910 }, { "entropy": 1.9387646824121476, "epoch": 0.6625535360956428, "grad_norm": 0.3523752689361572, "learning_rate": 1.5510783281726693e-05, "loss": 0.2124, "mean_token_accuracy": 0.9452576469630003, "num_tokens": 74053270.0, "step": 9920 }, { "entropy": 1.879902134090662, "epoch": 0.6632214328054167, "grad_norm": 0.29795941710472107, "learning_rate": 1.5457051698942387e-05, "loss": 0.2144, "mean_token_accuracy": 0.9486784808337688, "num_tokens": 74128527.0, "step": 9930 }, { "entropy": 1.8928095526993274, "epoch": 0.6638893295151905, "grad_norm": 0.3268255293369293, "learning_rate": 1.540337227441064e-05, "loss": 0.207, "mean_token_accuracy": 0.9484345391392708, "num_tokens": 74203714.0, "step": 9940 }, { "entropy": 1.9202770486474037, "epoch": 0.6645572262249643, "grad_norm": 0.3489333391189575, "learning_rate": 1.5349745299994285e-05, "loss": 0.2509, "mean_token_accuracy": 0.9413472600281239, "num_tokens": 74279169.0, "step": 9950 }, { "entropy": 1.9356919780373574, "epoch": 0.6652251229347381, "grad_norm": 0.32012757658958435, "learning_rate": 1.529617106727097e-05, "loss": 0.2331, "mean_token_accuracy": 0.9424417037516832, "num_tokens": 74353994.0, "step": 9960 }, { "entropy": 1.931555875390768, "epoch": 0.665893019644512, "grad_norm": 0.31553220748901367, "learning_rate": 1.5242649867531566e-05, "loss": 0.223, "mean_token_accuracy": 0.9461064361035824, "num_tokens": 74428290.0, "step": 9970 }, { "entropy": 1.8998085968196392, "epoch": 0.6665609163542858, "grad_norm": 0.33924880623817444, "learning_rate": 1.5189181991778614e-05, "loss": 0.2085, "mean_token_accuracy": 0.9488823279738426, "num_tokens": 74503465.0, "step": 9980 }, { "entropy": 1.8661912620067596, "epoch": 0.6672288130640597, "grad_norm": 0.31078508496284485, "learning_rate": 1.513576773072471e-05, "loss": 0.2265, "mean_token_accuracy": 0.9466509778052569, "num_tokens": 74579565.0, "step": 9990 }, { "entropy": 1.8821153879165649, "epoch": 0.6678967097738335, "grad_norm": 0.31515589356422424, "learning_rate": 1.5082407374790951e-05, "loss": 0.2144, "mean_token_accuracy": 0.9475899521261454, "num_tokens": 74654639.0, "step": 10000 }, { "epoch": 0.6678967097738335, "eval_entropy": 1.8767498084783554, "eval_loss": 0.236663356423378, "eval_mean_token_accuracy": 0.9460465997934342, "eval_num_tokens": 74654639.0, "eval_runtime": 552.1022, "eval_samples_per_second": 36.225, "eval_steps_per_second": 9.056, "step": 10000 }, { "entropy": 1.8770928032696248, "epoch": 0.6685646064836073, "grad_norm": 0.2725706994533539, "learning_rate": 1.5029101214105334e-05, "loss": 0.22, "mean_token_accuracy": 0.9455895718187094, "num_tokens": 74731174.0, "step": 10010 }, { "entropy": 1.8732770144939423, "epoch": 0.6692325031933811, "grad_norm": 0.32018646597862244, "learning_rate": 1.4975849538501205e-05, "loss": 0.1976, "mean_token_accuracy": 0.9508919149637223, "num_tokens": 74808245.0, "step": 10020 }, { "entropy": 1.8560627780854702, "epoch": 0.669900399903155, "grad_norm": 0.3270680010318756, "learning_rate": 1.4922652637515635e-05, "loss": 0.2318, "mean_token_accuracy": 0.9454466596245765, "num_tokens": 74883563.0, "step": 10030 }, { "entropy": 1.8667067840695382, "epoch": 0.6705682966129288, "grad_norm": 0.29106202721595764, "learning_rate": 1.4869510800387918e-05, "loss": 0.2131, "mean_token_accuracy": 0.9496993191540242, "num_tokens": 74959220.0, "step": 10040 }, { "entropy": 1.8844712659716607, "epoch": 0.6712361933227027, "grad_norm": 0.32260608673095703, "learning_rate": 1.481642431605792e-05, "loss": 0.2253, "mean_token_accuracy": 0.9459765709936618, "num_tokens": 75032123.0, "step": 10050 }, { "entropy": 1.8944692999124526, "epoch": 0.6719040900324765, "grad_norm": 0.269023060798645, "learning_rate": 1.4763393473164577e-05, "loss": 0.2193, "mean_token_accuracy": 0.946693105995655, "num_tokens": 75109592.0, "step": 10060 }, { "entropy": 1.8866144388914108, "epoch": 0.6725719867422503, "grad_norm": 0.31930679082870483, "learning_rate": 1.471041856004427e-05, "loss": 0.2273, "mean_token_accuracy": 0.9449324276298284, "num_tokens": 75185468.0, "step": 10070 }, { "entropy": 1.9378182969987392, "epoch": 0.6732398834520241, "grad_norm": 0.30855849385261536, "learning_rate": 1.4657499864729299e-05, "loss": 0.2447, "mean_token_accuracy": 0.9389895871281624, "num_tokens": 75260197.0, "step": 10080 }, { "entropy": 1.9235576070845126, "epoch": 0.673907780161798, "grad_norm": 0.36566832661628723, "learning_rate": 1.460463767494629e-05, "loss": 0.2222, "mean_token_accuracy": 0.9441259548068046, "num_tokens": 75333137.0, "step": 10090 }, { "entropy": 1.8855039738118649, "epoch": 0.6745756768715718, "grad_norm": 0.24700982868671417, "learning_rate": 1.4551832278114638e-05, "loss": 0.2206, "mean_token_accuracy": 0.9484541725367308, "num_tokens": 75409681.0, "step": 10100 }, { "entropy": 1.8987921811640263, "epoch": 0.6752435735813457, "grad_norm": 0.279258131980896, "learning_rate": 1.4499083961344961e-05, "loss": 0.2014, "mean_token_accuracy": 0.9481212608516216, "num_tokens": 75483582.0, "step": 10110 }, { "entropy": 1.9032227523624896, "epoch": 0.6759114702911195, "grad_norm": 0.32155728340148926, "learning_rate": 1.4446393011437525e-05, "loss": 0.2219, "mean_token_accuracy": 0.9450641572475433, "num_tokens": 75559399.0, "step": 10120 }, { "entropy": 1.8590004473924637, "epoch": 0.6765793670008933, "grad_norm": 0.32483652234077454, "learning_rate": 1.4393759714880644e-05, "loss": 0.2175, "mean_token_accuracy": 0.9464751157909632, "num_tokens": 75633898.0, "step": 10130 }, { "entropy": 1.8997207395732403, "epoch": 0.6772472637106671, "grad_norm": 0.27143311500549316, "learning_rate": 1.4341184357849213e-05, "loss": 0.2211, "mean_token_accuracy": 0.9461022023111582, "num_tokens": 75708829.0, "step": 10140 }, { "entropy": 1.9080256782472134, "epoch": 0.677915160420441, "grad_norm": 0.2840427756309509, "learning_rate": 1.4288667226203077e-05, "loss": 0.2286, "mean_token_accuracy": 0.9443538438528776, "num_tokens": 75782624.0, "step": 10150 }, { "entropy": 1.93028691932559, "epoch": 0.6785830571302148, "grad_norm": 0.2752184271812439, "learning_rate": 1.4236208605485501e-05, "loss": 0.2378, "mean_token_accuracy": 0.943329131603241, "num_tokens": 75857633.0, "step": 10160 }, { "entropy": 1.9177371695637704, "epoch": 0.6792509538399887, "grad_norm": 0.3550587594509125, "learning_rate": 1.418380878092164e-05, "loss": 0.2316, "mean_token_accuracy": 0.9445929065346718, "num_tokens": 75932074.0, "step": 10170 }, { "entropy": 1.9028411082923413, "epoch": 0.6799188505497625, "grad_norm": 0.2528437674045563, "learning_rate": 1.4131468037416917e-05, "loss": 0.204, "mean_token_accuracy": 0.9501767240464687, "num_tokens": 76008562.0, "step": 10180 }, { "entropy": 1.8954525627195835, "epoch": 0.6805867472595363, "grad_norm": 0.282778799533844, "learning_rate": 1.4079186659555571e-05, "loss": 0.2258, "mean_token_accuracy": 0.9455604698508978, "num_tokens": 76084297.0, "step": 10190 }, { "entropy": 1.8905874237418174, "epoch": 0.6812546439693101, "grad_norm": 0.28031420707702637, "learning_rate": 1.402696493159904e-05, "loss": 0.2285, "mean_token_accuracy": 0.9434068106114865, "num_tokens": 76157111.0, "step": 10200 }, { "entropy": 1.9129234299063682, "epoch": 0.681922540679084, "grad_norm": 0.3190227150917053, "learning_rate": 1.3974803137484444e-05, "loss": 0.2242, "mean_token_accuracy": 0.9443533584475517, "num_tokens": 76228777.0, "step": 10210 }, { "entropy": 1.9016528375446797, "epoch": 0.6825904373888578, "grad_norm": 0.2575254738330841, "learning_rate": 1.3922701560823031e-05, "loss": 0.2237, "mean_token_accuracy": 0.9442144501954317, "num_tokens": 76302041.0, "step": 10220 }, { "entropy": 1.8829542085528375, "epoch": 0.6832583340986317, "grad_norm": 0.3498046398162842, "learning_rate": 1.3870660484898627e-05, "loss": 0.2075, "mean_token_accuracy": 0.946049178764224, "num_tokens": 76376733.0, "step": 10230 }, { "entropy": 1.8748780526220798, "epoch": 0.6839262308084055, "grad_norm": 0.27811399102211, "learning_rate": 1.3818680192666133e-05, "loss": 0.2067, "mean_token_accuracy": 0.9452836539596319, "num_tokens": 76455409.0, "step": 10240 }, { "entropy": 1.8928939312696458, "epoch": 0.6845941275181793, "grad_norm": 0.3447349965572357, "learning_rate": 1.3766760966749925e-05, "loss": 0.2206, "mean_token_accuracy": 0.9453567314893008, "num_tokens": 76532469.0, "step": 10250 }, { "entropy": 1.8949653565883637, "epoch": 0.6852620242279531, "grad_norm": 0.30839037895202637, "learning_rate": 1.3714903089442378e-05, "loss": 0.2219, "mean_token_accuracy": 0.9457360960543155, "num_tokens": 76606123.0, "step": 10260 }, { "entropy": 1.9129513271152974, "epoch": 0.685929920937727, "grad_norm": 0.30321478843688965, "learning_rate": 1.3663106842702303e-05, "loss": 0.2128, "mean_token_accuracy": 0.9456833682954311, "num_tokens": 76679441.0, "step": 10270 }, { "entropy": 1.8930385418236255, "epoch": 0.6865978176475008, "grad_norm": 0.314028799533844, "learning_rate": 1.3611372508153422e-05, "loss": 0.2177, "mean_token_accuracy": 0.947524844110012, "num_tokens": 76751750.0, "step": 10280 }, { "entropy": 1.912549114227295, "epoch": 0.6872657143572747, "grad_norm": 0.3038738965988159, "learning_rate": 1.3559700367082804e-05, "loss": 0.2166, "mean_token_accuracy": 0.9463405251502991, "num_tokens": 76824812.0, "step": 10290 }, { "entropy": 1.8967111505568028, "epoch": 0.6879336110670485, "grad_norm": 0.36032551527023315, "learning_rate": 1.350809070043939e-05, "loss": 0.2339, "mean_token_accuracy": 0.9436006501317025, "num_tokens": 76898782.0, "step": 10300 }, { "entropy": 1.9159264162182807, "epoch": 0.6886015077768223, "grad_norm": 0.31301388144493103, "learning_rate": 1.3456543788832429e-05, "loss": 0.2395, "mean_token_accuracy": 0.9434678621590138, "num_tokens": 76972774.0, "step": 10310 }, { "entropy": 1.8853584058582782, "epoch": 0.6892694044865961, "grad_norm": 0.2590923011302948, "learning_rate": 1.3405059912529974e-05, "loss": 0.2186, "mean_token_accuracy": 0.9430528480559588, "num_tokens": 77047570.0, "step": 10320 }, { "entropy": 1.9312948137521744, "epoch": 0.68993730119637, "grad_norm": 0.3591325879096985, "learning_rate": 1.3353639351457314e-05, "loss": 0.221, "mean_token_accuracy": 0.9452490895986557, "num_tokens": 77123320.0, "step": 10330 }, { "entropy": 1.9148299671709537, "epoch": 0.6906051979061438, "grad_norm": 0.37425604462623596, "learning_rate": 1.3302282385195516e-05, "loss": 0.2394, "mean_token_accuracy": 0.9393338304013014, "num_tokens": 77198843.0, "step": 10340 }, { "entropy": 1.9022190049290657, "epoch": 0.6912730946159177, "grad_norm": 0.35374850034713745, "learning_rate": 1.3250989292979859e-05, "loss": 0.2113, "mean_token_accuracy": 0.9470495611429215, "num_tokens": 77274202.0, "step": 10350 }, { "entropy": 1.883647397905588, "epoch": 0.6919409913256915, "grad_norm": 0.31867679953575134, "learning_rate": 1.3199760353698334e-05, "loss": 0.2138, "mean_token_accuracy": 0.9473440900444985, "num_tokens": 77350488.0, "step": 10360 }, { "entropy": 1.920442698150873, "epoch": 0.6926088880354653, "grad_norm": 0.34543076157569885, "learning_rate": 1.3148595845890126e-05, "loss": 0.2225, "mean_token_accuracy": 0.9456390470266343, "num_tokens": 77425469.0, "step": 10370 }, { "entropy": 1.913692919164896, "epoch": 0.6932767847452391, "grad_norm": 0.2782209813594818, "learning_rate": 1.3097496047744081e-05, "loss": 0.2105, "mean_token_accuracy": 0.9458931490778923, "num_tokens": 77501130.0, "step": 10380 }, { "entropy": 1.9360430128872395, "epoch": 0.693944681455013, "grad_norm": 0.3282945156097412, "learning_rate": 1.3046461237097227e-05, "loss": 0.2162, "mean_token_accuracy": 0.9447419974952936, "num_tokens": 77576687.0, "step": 10390 }, { "entropy": 1.9158230133354663, "epoch": 0.6946125781647868, "grad_norm": 0.3610730767250061, "learning_rate": 1.2995491691433229e-05, "loss": 0.2389, "mean_token_accuracy": 0.9394503276795149, "num_tokens": 77649955.0, "step": 10400 }, { "entropy": 1.9148353688418864, "epoch": 0.6952804748745607, "grad_norm": 0.325503408908844, "learning_rate": 1.2944587687880919e-05, "loss": 0.2458, "mean_token_accuracy": 0.9413210216909647, "num_tokens": 77722460.0, "step": 10410 }, { "entropy": 1.9086212821304798, "epoch": 0.6959483715843345, "grad_norm": 0.2849908471107483, "learning_rate": 1.2893749503212754e-05, "loss": 0.205, "mean_token_accuracy": 0.9504839979112149, "num_tokens": 77798379.0, "step": 10420 }, { "entropy": 1.911132575571537, "epoch": 0.6966162682941083, "grad_norm": 0.3763129711151123, "learning_rate": 1.2842977413843311e-05, "loss": 0.2078, "mean_token_accuracy": 0.9516026563942432, "num_tokens": 77876895.0, "step": 10430 }, { "entropy": 1.8872507065534592, "epoch": 0.6972841650038821, "grad_norm": 0.3012331426143646, "learning_rate": 1.279227169582782e-05, "loss": 0.1955, "mean_token_accuracy": 0.9522138494998217, "num_tokens": 77949297.0, "step": 10440 }, { "entropy": 1.9060810387134552, "epoch": 0.697952061713656, "grad_norm": 0.3150883913040161, "learning_rate": 1.2741632624860628e-05, "loss": 0.2114, "mean_token_accuracy": 0.9443527456372977, "num_tokens": 78023998.0, "step": 10450 }, { "entropy": 1.864063174277544, "epoch": 0.6986199584234298, "grad_norm": 0.27818211913108826, "learning_rate": 1.269106047627372e-05, "loss": 0.1976, "mean_token_accuracy": 0.9494179770350456, "num_tokens": 78098766.0, "step": 10460 }, { "entropy": 1.9028538651764393, "epoch": 0.6992878551332037, "grad_norm": 0.2586256265640259, "learning_rate": 1.2640555525035213e-05, "loss": 0.2244, "mean_token_accuracy": 0.9441565670073032, "num_tokens": 78173065.0, "step": 10470 }, { "entropy": 1.9098172560334206, "epoch": 0.6999557518429775, "grad_norm": 0.3565428853034973, "learning_rate": 1.2590118045747854e-05, "loss": 0.2302, "mean_token_accuracy": 0.9427990823984146, "num_tokens": 78245662.0, "step": 10480 }, { "entropy": 1.9347416557371617, "epoch": 0.7006236485527513, "grad_norm": 0.2804452180862427, "learning_rate": 1.253974831264753e-05, "loss": 0.2081, "mean_token_accuracy": 0.9460851203650236, "num_tokens": 78320231.0, "step": 10490 }, { "entropy": 1.9094208985567094, "epoch": 0.7012915452625251, "grad_norm": 0.3190443813800812, "learning_rate": 1.2489446599601801e-05, "loss": 0.237, "mean_token_accuracy": 0.9449720848351717, "num_tokens": 78394690.0, "step": 10500 }, { "entropy": 1.8809963166713715, "epoch": 0.701959441972299, "grad_norm": 0.29107731580734253, "learning_rate": 1.2439213180108385e-05, "loss": 0.2052, "mean_token_accuracy": 0.9492700982838869, "num_tokens": 78471645.0, "step": 10510 }, { "entropy": 1.9181700721383095, "epoch": 0.7026273386820728, "grad_norm": 0.2929648458957672, "learning_rate": 1.2389048327293672e-05, "loss": 0.2152, "mean_token_accuracy": 0.9482477650046348, "num_tokens": 78546909.0, "step": 10520 }, { "entropy": 1.97821604013443, "epoch": 0.7032952353918467, "grad_norm": 0.29727914929389954, "learning_rate": 1.2338952313911264e-05, "loss": 0.2439, "mean_token_accuracy": 0.9414060182869435, "num_tokens": 78620557.0, "step": 10530 }, { "entropy": 1.9196878917515279, "epoch": 0.7039631321016205, "grad_norm": 0.3136504888534546, "learning_rate": 1.2288925412340437e-05, "loss": 0.2102, "mean_token_accuracy": 0.9470030102878809, "num_tokens": 78694063.0, "step": 10540 }, { "entropy": 1.9015464268624782, "epoch": 0.7046310288113943, "grad_norm": 0.3344622850418091, "learning_rate": 1.2238967894584729e-05, "loss": 0.2145, "mean_token_accuracy": 0.9453800730407238, "num_tokens": 78769097.0, "step": 10550 }, { "entropy": 1.9156240098178388, "epoch": 0.7052989255211681, "grad_norm": 0.2830991744995117, "learning_rate": 1.218908003227041e-05, "loss": 0.2349, "mean_token_accuracy": 0.9418215606361627, "num_tokens": 78843831.0, "step": 10560 }, { "entropy": 1.9218591064214707, "epoch": 0.705966822230942, "grad_norm": 0.28117820620536804, "learning_rate": 1.2139262096645047e-05, "loss": 0.214, "mean_token_accuracy": 0.946132193505764, "num_tokens": 78919302.0, "step": 10570 }, { "entropy": 1.9197048082947732, "epoch": 0.7066347189407158, "grad_norm": 0.31449583172798157, "learning_rate": 1.2089514358575969e-05, "loss": 0.2343, "mean_token_accuracy": 0.9422256987541914, "num_tokens": 78993131.0, "step": 10580 }, { "entropy": 1.9210989877581597, "epoch": 0.7073026156504897, "grad_norm": 0.38509050011634827, "learning_rate": 1.2039837088548854e-05, "loss": 0.2285, "mean_token_accuracy": 0.9447336968034505, "num_tokens": 79067877.0, "step": 10590 }, { "entropy": 1.9332555092871189, "epoch": 0.7079705123602635, "grad_norm": 0.3056189715862274, "learning_rate": 1.1990230556666236e-05, "loss": 0.2211, "mean_token_accuracy": 0.94359893463552, "num_tokens": 79144098.0, "step": 10600 }, { "entropy": 1.923354833573103, "epoch": 0.7086384090700373, "grad_norm": 0.28786858916282654, "learning_rate": 1.1940695032646027e-05, "loss": 0.2089, "mean_token_accuracy": 0.9515276707708835, "num_tokens": 79221011.0, "step": 10610 }, { "entropy": 1.9306829623878001, "epoch": 0.7093063057798111, "grad_norm": 0.2754662334918976, "learning_rate": 1.1891230785820074e-05, "loss": 0.2198, "mean_token_accuracy": 0.9464119967073202, "num_tokens": 79296624.0, "step": 10620 }, { "entropy": 1.908396078646183, "epoch": 0.709974202489585, "grad_norm": 0.29287096858024597, "learning_rate": 1.1841838085132647e-05, "loss": 0.2256, "mean_token_accuracy": 0.9482095073908567, "num_tokens": 79373238.0, "step": 10630 }, { "entropy": 1.9073860429227352, "epoch": 0.7106420991993588, "grad_norm": 0.3153214156627655, "learning_rate": 1.1792517199139041e-05, "loss": 0.2175, "mean_token_accuracy": 0.9462470531463623, "num_tokens": 79448905.0, "step": 10640 }, { "entropy": 1.925882250070572, "epoch": 0.7113099959091327, "grad_norm": 0.4114491641521454, "learning_rate": 1.1743268396004077e-05, "loss": 0.2259, "mean_token_accuracy": 0.9453411553055048, "num_tokens": 79523396.0, "step": 10650 }, { "entropy": 1.9333959378302097, "epoch": 0.7119778926189065, "grad_norm": 0.3115549087524414, "learning_rate": 1.1694091943500641e-05, "loss": 0.2114, "mean_token_accuracy": 0.9485629417002202, "num_tokens": 79599257.0, "step": 10660 }, { "entropy": 1.9398183852434159, "epoch": 0.7126457893286803, "grad_norm": 0.30406397581100464, "learning_rate": 1.1644988109008256e-05, "loss": 0.2184, "mean_token_accuracy": 0.9486421644687653, "num_tokens": 79673245.0, "step": 10670 }, { "entropy": 1.897850428521633, "epoch": 0.7133136860384541, "grad_norm": 0.31005430221557617, "learning_rate": 1.1595957159511582e-05, "loss": 0.2093, "mean_token_accuracy": 0.9467908661812544, "num_tokens": 79747565.0, "step": 10680 }, { "entropy": 1.9372698307037353, "epoch": 0.713981582748228, "grad_norm": 0.36624276638031006, "learning_rate": 1.1546999361599016e-05, "loss": 0.2316, "mean_token_accuracy": 0.9452444355934858, "num_tokens": 79821979.0, "step": 10690 }, { "entropy": 1.902782541513443, "epoch": 0.7146494794580018, "grad_norm": 0.34434133768081665, "learning_rate": 1.1498114981461226e-05, "loss": 0.225, "mean_token_accuracy": 0.9443479336798191, "num_tokens": 79896916.0, "step": 10700 }, { "entropy": 1.9020543485879897, "epoch": 0.7153173761677757, "grad_norm": 0.3101283609867096, "learning_rate": 1.1449304284889657e-05, "loss": 0.2123, "mean_token_accuracy": 0.9482042495161295, "num_tokens": 79974405.0, "step": 10710 }, { "entropy": 1.91372000426054, "epoch": 0.7159852728775495, "grad_norm": 0.3263084888458252, "learning_rate": 1.1400567537275169e-05, "loss": 0.2068, "mean_token_accuracy": 0.9487948149442673, "num_tokens": 80050472.0, "step": 10720 }, { "entropy": 1.8923282079398631, "epoch": 0.7166531695873233, "grad_norm": 0.3215576708316803, "learning_rate": 1.1351905003606545e-05, "loss": 0.2156, "mean_token_accuracy": 0.9463704567402601, "num_tokens": 80124647.0, "step": 10730 }, { "entropy": 1.9246387995779515, "epoch": 0.7173210662970971, "grad_norm": 0.29945650696754456, "learning_rate": 1.130331694846902e-05, "loss": 0.2229, "mean_token_accuracy": 0.9477593809366226, "num_tokens": 80199444.0, "step": 10740 }, { "entropy": 1.9335595175623894, "epoch": 0.717988963006871, "grad_norm": 0.31465283036231995, "learning_rate": 1.1254803636042916e-05, "loss": 0.2155, "mean_token_accuracy": 0.9464696452021599, "num_tokens": 80273836.0, "step": 10750 }, { "entropy": 1.902474556863308, "epoch": 0.7186568597166448, "grad_norm": 0.3238000273704529, "learning_rate": 1.1206365330102156e-05, "loss": 0.2131, "mean_token_accuracy": 0.9495478864759207, "num_tokens": 80350461.0, "step": 10760 }, { "entropy": 1.9139510154724122, "epoch": 0.7193247564264187, "grad_norm": 0.36762136220932007, "learning_rate": 1.1158002294012838e-05, "loss": 0.2165, "mean_token_accuracy": 0.9491926331073046, "num_tokens": 80424054.0, "step": 10770 }, { "entropy": 1.8873869948089124, "epoch": 0.7199926531361925, "grad_norm": 0.3309178948402405, "learning_rate": 1.1109714790731826e-05, "loss": 0.2185, "mean_token_accuracy": 0.9451238356530667, "num_tokens": 80501494.0, "step": 10780 }, { "entropy": 1.9332789048552512, "epoch": 0.7206605498459663, "grad_norm": 0.2736462354660034, "learning_rate": 1.1061503082805262e-05, "loss": 0.2211, "mean_token_accuracy": 0.9458402171730995, "num_tokens": 80575730.0, "step": 10790 }, { "entropy": 1.911842057108879, "epoch": 0.7213284465557401, "grad_norm": 0.27536875009536743, "learning_rate": 1.1013367432367209e-05, "loss": 0.226, "mean_token_accuracy": 0.944275650382042, "num_tokens": 80650372.0, "step": 10800 }, { "entropy": 1.9260739140212535, "epoch": 0.721996343265514, "grad_norm": 0.24608100950717926, "learning_rate": 1.0965308101138192e-05, "loss": 0.2076, "mean_token_accuracy": 0.948920963704586, "num_tokens": 80727426.0, "step": 10810 }, { "entropy": 1.9246294118463994, "epoch": 0.7226642399752878, "grad_norm": 0.3301178216934204, "learning_rate": 1.0917325350423776e-05, "loss": 0.2364, "mean_token_accuracy": 0.9442116837948561, "num_tokens": 80802556.0, "step": 10820 }, { "entropy": 1.9289285562932492, "epoch": 0.7233321366850617, "grad_norm": 0.2902006506919861, "learning_rate": 1.0869419441113127e-05, "loss": 0.221, "mean_token_accuracy": 0.9450737927109003, "num_tokens": 80876470.0, "step": 10830 }, { "entropy": 1.9085661433637142, "epoch": 0.7240000333948355, "grad_norm": 0.3091467320919037, "learning_rate": 1.0821590633677639e-05, "loss": 0.2183, "mean_token_accuracy": 0.946364825963974, "num_tokens": 80950736.0, "step": 10840 }, { "entropy": 1.930638635903597, "epoch": 0.7246679301046093, "grad_norm": 0.33393821120262146, "learning_rate": 1.0773839188169479e-05, "loss": 0.2143, "mean_token_accuracy": 0.9487283498048782, "num_tokens": 81024404.0, "step": 10850 }, { "entropy": 1.888561774045229, "epoch": 0.7253358268143831, "grad_norm": 0.3741356134414673, "learning_rate": 1.0726165364220188e-05, "loss": 0.2147, "mean_token_accuracy": 0.9482394717633724, "num_tokens": 81099544.0, "step": 10860 }, { "entropy": 1.900745715945959, "epoch": 0.726003723524157, "grad_norm": 0.2864074409008026, "learning_rate": 1.067856942103928e-05, "loss": 0.2161, "mean_token_accuracy": 0.9452195778489113, "num_tokens": 81175181.0, "step": 10870 }, { "entropy": 1.9070482835173608, "epoch": 0.7266716202339308, "grad_norm": 0.28629112243652344, "learning_rate": 1.0631051617412784e-05, "loss": 0.2209, "mean_token_accuracy": 0.9458576466888189, "num_tokens": 81249993.0, "step": 10880 }, { "entropy": 1.931928315013647, "epoch": 0.7273395169437047, "grad_norm": 0.2930496037006378, "learning_rate": 1.0583612211701913e-05, "loss": 0.2365, "mean_token_accuracy": 0.9416486214846372, "num_tokens": 81326535.0, "step": 10890 }, { "entropy": 1.90124344304204, "epoch": 0.7280074136534785, "grad_norm": 0.2984851002693176, "learning_rate": 1.0536251461841596e-05, "loss": 0.2117, "mean_token_accuracy": 0.945863937959075, "num_tokens": 81400821.0, "step": 10900 }, { "entropy": 1.920573817193508, "epoch": 0.7286753103632523, "grad_norm": 0.30207282304763794, "learning_rate": 1.0488969625339113e-05, "loss": 0.2233, "mean_token_accuracy": 0.9451156925410032, "num_tokens": 81475823.0, "step": 10910 }, { "entropy": 1.9225694991648197, "epoch": 0.7293432070730261, "grad_norm": 0.3032468259334564, "learning_rate": 1.0441766959272676e-05, "loss": 0.2197, "mean_token_accuracy": 0.9471049934625626, "num_tokens": 81553280.0, "step": 10920 }, { "entropy": 1.921476662904024, "epoch": 0.7300111037828, "grad_norm": 0.2499317079782486, "learning_rate": 1.0394643720290028e-05, "loss": 0.214, "mean_token_accuracy": 0.9472498957067728, "num_tokens": 81625523.0, "step": 10930 }, { "entropy": 1.9392130978405475, "epoch": 0.7306790004925738, "grad_norm": 0.36099153757095337, "learning_rate": 1.0347600164607046e-05, "loss": 0.2306, "mean_token_accuracy": 0.9440038096159696, "num_tokens": 81699770.0, "step": 10940 }, { "entropy": 1.9041217111051083, "epoch": 0.7313468972023477, "grad_norm": 0.26680734753608704, "learning_rate": 1.0300636548006386e-05, "loss": 0.2023, "mean_token_accuracy": 0.9486195117235183, "num_tokens": 81774648.0, "step": 10950 }, { "entropy": 1.9059810176491738, "epoch": 0.7320147939121215, "grad_norm": 0.2969484329223633, "learning_rate": 1.025375312583605e-05, "loss": 0.2231, "mean_token_accuracy": 0.9443758942186833, "num_tokens": 81851430.0, "step": 10960 }, { "entropy": 1.918486201763153, "epoch": 0.7326826906218953, "grad_norm": 0.35175079107284546, "learning_rate": 1.0206950153008005e-05, "loss": 0.2316, "mean_token_accuracy": 0.9463289577513934, "num_tokens": 81923444.0, "step": 10970 }, { "entropy": 1.9131188362836837, "epoch": 0.7333505873316691, "grad_norm": 0.30851465463638306, "learning_rate": 1.0160227883996823e-05, "loss": 0.231, "mean_token_accuracy": 0.9428766563534736, "num_tokens": 81999590.0, "step": 10980 }, { "entropy": 1.9351812101900578, "epoch": 0.734018484041443, "grad_norm": 0.24056492745876312, "learning_rate": 1.0113586572838244e-05, "loss": 0.2143, "mean_token_accuracy": 0.9471086826175451, "num_tokens": 82071641.0, "step": 10990 }, { "entropy": 1.9139883778989315, "epoch": 0.7346863807512168, "grad_norm": 0.28496241569519043, "learning_rate": 1.0067026473127857e-05, "loss": 0.2126, "mean_token_accuracy": 0.947807178273797, "num_tokens": 82147075.0, "step": 11000 }, { "epoch": 0.7346863807512168, "eval_entropy": 1.9059199431180953, "eval_loss": 0.2356305718421936, "eval_mean_token_accuracy": 0.9463012171268463, "eval_num_tokens": 82147075.0, "eval_runtime": 554.1746, "eval_samples_per_second": 36.09, "eval_steps_per_second": 9.022, "step": 11000 }, { "entropy": 1.9091171011328698, "epoch": 0.7353542774609907, "grad_norm": 0.34441131353378296, "learning_rate": 1.0020547838019682e-05, "loss": 0.2062, "mean_token_accuracy": 0.9468987006694078, "num_tokens": 82224421.0, "step": 11010 }, { "entropy": 1.8974645651876927, "epoch": 0.7360221741707645, "grad_norm": 0.3231317698955536, "learning_rate": 9.974150920224805e-06, "loss": 0.2306, "mean_token_accuracy": 0.9416075870394707, "num_tokens": 82298797.0, "step": 11020 }, { "entropy": 1.9342247806489468, "epoch": 0.7366900708805383, "grad_norm": 0.35956835746765137, "learning_rate": 9.927835972010017e-06, "loss": 0.2467, "mean_token_accuracy": 0.9416825965046882, "num_tokens": 82369569.0, "step": 11030 }, { "entropy": 1.8589746229350568, "epoch": 0.7373579675903121, "grad_norm": 0.2973991334438324, "learning_rate": 9.881603245196394e-06, "loss": 0.2015, "mean_token_accuracy": 0.9503379218280316, "num_tokens": 82446934.0, "step": 11040 }, { "entropy": 1.864432605355978, "epoch": 0.738025864300086, "grad_norm": 0.2519768178462982, "learning_rate": 9.835452991157993e-06, "loss": 0.2082, "mean_token_accuracy": 0.9485573947429657, "num_tokens": 82520340.0, "step": 11050 }, { "entropy": 1.8844397969543933, "epoch": 0.7386937610098598, "grad_norm": 0.4154239892959595, "learning_rate": 9.789385460820447e-06, "loss": 0.2284, "mean_token_accuracy": 0.944726001471281, "num_tokens": 82593202.0, "step": 11060 }, { "entropy": 1.8970091849565507, "epoch": 0.7393616577196337, "grad_norm": 0.3660540282726288, "learning_rate": 9.743400904659613e-06, "loss": 0.2036, "mean_token_accuracy": 0.9501904439181089, "num_tokens": 82668771.0, "step": 11070 }, { "entropy": 1.8937359876930713, "epoch": 0.7400295544294075, "grad_norm": 0.3173390030860901, "learning_rate": 9.697499572700177e-06, "loss": 0.2148, "mean_token_accuracy": 0.9467160064727068, "num_tokens": 82741509.0, "step": 11080 }, { "entropy": 1.8948323883116245, "epoch": 0.7406974511391813, "grad_norm": 0.33909356594085693, "learning_rate": 9.651681714514362e-06, "loss": 0.2117, "mean_token_accuracy": 0.9481560476124287, "num_tokens": 82816825.0, "step": 11090 }, { "entropy": 1.8804951347410679, "epoch": 0.7413653478489551, "grad_norm": 0.3089444935321808, "learning_rate": 9.60594757922051e-06, "loss": 0.2116, "mean_token_accuracy": 0.9482202224433423, "num_tokens": 82894242.0, "step": 11100 }, { "entropy": 1.9098335951566696, "epoch": 0.742033244558729, "grad_norm": 0.28488823771476746, "learning_rate": 9.560297415481752e-06, "loss": 0.2254, "mean_token_accuracy": 0.9422137197107077, "num_tokens": 82967463.0, "step": 11110 }, { "entropy": 1.9448677077889442, "epoch": 0.7427011412685028, "grad_norm": 0.3729751408100128, "learning_rate": 9.514731471504668e-06, "loss": 0.2478, "mean_token_accuracy": 0.940930238738656, "num_tokens": 83040541.0, "step": 11120 }, { "entropy": 1.9311937920749187, "epoch": 0.7433690379782767, "grad_norm": 0.3697790503501892, "learning_rate": 9.469249995037892e-06, "loss": 0.2286, "mean_token_accuracy": 0.9461524050682784, "num_tokens": 83113719.0, "step": 11130 }, { "entropy": 1.9159417890012265, "epoch": 0.7440369346880505, "grad_norm": 0.29803135991096497, "learning_rate": 9.423853233370822e-06, "loss": 0.2185, "mean_token_accuracy": 0.9477081406861544, "num_tokens": 83187726.0, "step": 11140 }, { "entropy": 1.893703680485487, "epoch": 0.7447048313978243, "grad_norm": 0.3220638036727905, "learning_rate": 9.378541433332241e-06, "loss": 0.1938, "mean_token_accuracy": 0.9507091857492924, "num_tokens": 83264504.0, "step": 11150 }, { "entropy": 1.9050804533064365, "epoch": 0.7453727281075981, "grad_norm": 1.331411600112915, "learning_rate": 9.333314841288996e-06, "loss": 0.213, "mean_token_accuracy": 0.9479123786091804, "num_tokens": 83338216.0, "step": 11160 }, { "entropy": 1.9048821784555912, "epoch": 0.746040624817372, "grad_norm": 0.2998942732810974, "learning_rate": 9.28817370314461e-06, "loss": 0.2265, "mean_token_accuracy": 0.9448808398097753, "num_tokens": 83413860.0, "step": 11170 }, { "entropy": 1.9363364651799202, "epoch": 0.7467085215271458, "grad_norm": 0.29526156187057495, "learning_rate": 9.243118264338028e-06, "loss": 0.2308, "mean_token_accuracy": 0.9450293987989425, "num_tokens": 83486314.0, "step": 11180 }, { "entropy": 1.9200671084225178, "epoch": 0.7473764182369197, "grad_norm": 0.2819261848926544, "learning_rate": 9.198148769842195e-06, "loss": 0.2247, "mean_token_accuracy": 0.9459836155176162, "num_tokens": 83561342.0, "step": 11190 }, { "entropy": 1.9335692524909973, "epoch": 0.7480443149466935, "grad_norm": 0.2717633843421936, "learning_rate": 9.153265464162785e-06, "loss": 0.2117, "mean_token_accuracy": 0.9457612648606301, "num_tokens": 83635250.0, "step": 11200 }, { "entropy": 1.9017163820564746, "epoch": 0.7487122116564673, "grad_norm": 0.300033837556839, "learning_rate": 9.10846859133685e-06, "loss": 0.2221, "mean_token_accuracy": 0.9455062616616488, "num_tokens": 83709246.0, "step": 11210 }, { "entropy": 1.898740069568157, "epoch": 0.7493801083662411, "grad_norm": 0.30894923210144043, "learning_rate": 9.063758394931486e-06, "loss": 0.218, "mean_token_accuracy": 0.9431704297661782, "num_tokens": 83783894.0, "step": 11220 }, { "entropy": 1.9074263170361518, "epoch": 0.750048005076015, "grad_norm": 0.38207611441612244, "learning_rate": 9.019135118042536e-06, "loss": 0.2119, "mean_token_accuracy": 0.9463793229311704, "num_tokens": 83856472.0, "step": 11230 }, { "entropy": 1.8768710792064667, "epoch": 0.7507159017857888, "grad_norm": 0.3123346269130707, "learning_rate": 8.974599003293216e-06, "loss": 0.2055, "mean_token_accuracy": 0.9483194727450609, "num_tokens": 83932722.0, "step": 11240 }, { "entropy": 1.8639044649899006, "epoch": 0.7513837984955627, "grad_norm": 0.303500771522522, "learning_rate": 8.930150292832855e-06, "loss": 0.2085, "mean_token_accuracy": 0.9482971403747797, "num_tokens": 84008255.0, "step": 11250 }, { "entropy": 1.90454136505723, "epoch": 0.7520516952053365, "grad_norm": 0.3632895052433014, "learning_rate": 8.885789228335544e-06, "loss": 0.209, "mean_token_accuracy": 0.9486837543547153, "num_tokens": 84085090.0, "step": 11260 }, { "entropy": 1.913232085108757, "epoch": 0.7527195919151103, "grad_norm": 0.3618438243865967, "learning_rate": 8.841516050998843e-06, "loss": 0.226, "mean_token_accuracy": 0.9446337543427944, "num_tokens": 84159161.0, "step": 11270 }, { "entropy": 1.8702809795737267, "epoch": 0.7533874886248841, "grad_norm": 0.30103811621665955, "learning_rate": 8.797331001542423e-06, "loss": 0.2065, "mean_token_accuracy": 0.949903305247426, "num_tokens": 84235783.0, "step": 11280 }, { "entropy": 1.8931458652019502, "epoch": 0.754055385334658, "grad_norm": 0.2811412215232849, "learning_rate": 8.753234320206822e-06, "loss": 0.2332, "mean_token_accuracy": 0.9413031421601772, "num_tokens": 84312456.0, "step": 11290 }, { "entropy": 1.8912273250520228, "epoch": 0.7547232820444318, "grad_norm": 0.32122495770454407, "learning_rate": 8.709226246752101e-06, "loss": 0.2211, "mean_token_accuracy": 0.9437547899782658, "num_tokens": 84386846.0, "step": 11300 }, { "entropy": 1.9023813880980014, "epoch": 0.7553911787542057, "grad_norm": 0.3737948536872864, "learning_rate": 8.665307020456538e-06, "loss": 0.2303, "mean_token_accuracy": 0.9444470826536417, "num_tokens": 84462405.0, "step": 11310 }, { "entropy": 1.9102597139775752, "epoch": 0.7560590754639795, "grad_norm": 0.27867555618286133, "learning_rate": 8.621476880115357e-06, "loss": 0.2182, "mean_token_accuracy": 0.9484806664288044, "num_tokens": 84535000.0, "step": 11320 }, { "entropy": 1.8945983208715915, "epoch": 0.7567269721737533, "grad_norm": 0.3151988387107849, "learning_rate": 8.577736064039376e-06, "loss": 0.2394, "mean_token_accuracy": 0.9415588092058897, "num_tokens": 84607288.0, "step": 11330 }, { "entropy": 1.8958983808755874, "epoch": 0.7573948688835271, "grad_norm": 0.3211052715778351, "learning_rate": 8.53408481005377e-06, "loss": 0.2269, "mean_token_accuracy": 0.9449847292155027, "num_tokens": 84680202.0, "step": 11340 }, { "entropy": 1.9088520348072051, "epoch": 0.758062765593301, "grad_norm": 0.3037714660167694, "learning_rate": 8.490523355496742e-06, "loss": 0.2288, "mean_token_accuracy": 0.942930956184864, "num_tokens": 84757110.0, "step": 11350 }, { "entropy": 1.8966107808053494, "epoch": 0.7587306623030748, "grad_norm": 0.2812509536743164, "learning_rate": 8.447051937218244e-06, "loss": 0.2261, "mean_token_accuracy": 0.9439510587602854, "num_tokens": 84831847.0, "step": 11360 }, { "entropy": 1.895159225165844, "epoch": 0.7593985590128487, "grad_norm": 0.2748472988605499, "learning_rate": 8.403670791578702e-06, "loss": 0.2241, "mean_token_accuracy": 0.9463084604591131, "num_tokens": 84905932.0, "step": 11370 }, { "entropy": 1.8941810354590416, "epoch": 0.7600664557226225, "grad_norm": 0.389934241771698, "learning_rate": 8.36038015444768e-06, "loss": 0.2334, "mean_token_accuracy": 0.9450410585850477, "num_tokens": 84983069.0, "step": 11380 }, { "entropy": 1.9433298885822297, "epoch": 0.7607343524323963, "grad_norm": 0.335888147354126, "learning_rate": 8.31718026120268e-06, "loss": 0.2218, "mean_token_accuracy": 0.9459588959813118, "num_tokens": 85055435.0, "step": 11390 }, { "entropy": 1.9400506347417832, "epoch": 0.7614022491421701, "grad_norm": 0.3339567482471466, "learning_rate": 8.274071346727768e-06, "loss": 0.2199, "mean_token_accuracy": 0.9434316240251064, "num_tokens": 85130097.0, "step": 11400 }, { "entropy": 1.906027965247631, "epoch": 0.762070145851944, "grad_norm": 0.3136909008026123, "learning_rate": 8.231053645412385e-06, "loss": 0.2228, "mean_token_accuracy": 0.945674081146717, "num_tokens": 85205660.0, "step": 11410 }, { "entropy": 1.8981819480657578, "epoch": 0.7627380425617178, "grad_norm": 0.36558428406715393, "learning_rate": 8.188127391150016e-06, "loss": 0.2122, "mean_token_accuracy": 0.9477827738970518, "num_tokens": 85279802.0, "step": 11420 }, { "entropy": 1.923303385823965, "epoch": 0.7634059392714917, "grad_norm": 0.2768043577671051, "learning_rate": 8.145292817336944e-06, "loss": 0.2092, "mean_token_accuracy": 0.9491335444152356, "num_tokens": 85355867.0, "step": 11430 }, { "entropy": 1.8939982995390892, "epoch": 0.7640738359812655, "grad_norm": 0.41168367862701416, "learning_rate": 8.102550156870952e-06, "loss": 0.222, "mean_token_accuracy": 0.946155945956707, "num_tokens": 85430653.0, "step": 11440 }, { "entropy": 1.9339173465967179, "epoch": 0.7647417326910393, "grad_norm": 0.2979883551597595, "learning_rate": 8.059899642150095e-06, "loss": 0.2184, "mean_token_accuracy": 0.945008360594511, "num_tokens": 85504074.0, "step": 11450 }, { "entropy": 1.9269521936774254, "epoch": 0.7654096294008131, "grad_norm": 0.3283374607563019, "learning_rate": 8.017341505071417e-06, "loss": 0.2245, "mean_token_accuracy": 0.9450273986905813, "num_tokens": 85576352.0, "step": 11460 }, { "entropy": 1.945946456491947, "epoch": 0.766077526110587, "grad_norm": 0.33567506074905396, "learning_rate": 7.974875977029684e-06, "loss": 0.2256, "mean_token_accuracy": 0.94437888674438, "num_tokens": 85648112.0, "step": 11470 }, { "entropy": 1.9503719687461853, "epoch": 0.7667454228203608, "grad_norm": 0.2934599816799164, "learning_rate": 7.932503288916149e-06, "loss": 0.213, "mean_token_accuracy": 0.9469171226024627, "num_tokens": 85723171.0, "step": 11480 }, { "entropy": 1.925863005965948, "epoch": 0.7674133195301347, "grad_norm": 0.2816382646560669, "learning_rate": 7.890223671117247e-06, "loss": 0.2131, "mean_token_accuracy": 0.94874166585505, "num_tokens": 85802098.0, "step": 11490 }, { "entropy": 1.9346450693905353, "epoch": 0.7680812162399085, "grad_norm": 0.3477094769477844, "learning_rate": 7.848037353513413e-06, "loss": 0.221, "mean_token_accuracy": 0.9449240598827601, "num_tokens": 85873887.0, "step": 11500 }, { "entropy": 1.9228808254003524, "epoch": 0.7687491129496823, "grad_norm": 0.29014065861701965, "learning_rate": 7.805944565477774e-06, "loss": 0.2255, "mean_token_accuracy": 0.9460843607783318, "num_tokens": 85947648.0, "step": 11510 }, { "entropy": 1.9236449711024761, "epoch": 0.7694170096594561, "grad_norm": 0.3228459060192108, "learning_rate": 7.763945535874938e-06, "loss": 0.2146, "mean_token_accuracy": 0.94769237190485, "num_tokens": 86023484.0, "step": 11520 }, { "entropy": 1.9296578779816627, "epoch": 0.77008490636923, "grad_norm": 0.3200177848339081, "learning_rate": 7.722040493059714e-06, "loss": 0.2229, "mean_token_accuracy": 0.9456036038696766, "num_tokens": 86098122.0, "step": 11530 }, { "entropy": 1.9002298817038537, "epoch": 0.7707528030790038, "grad_norm": 0.28655269742012024, "learning_rate": 7.68022966487591e-06, "loss": 0.2073, "mean_token_accuracy": 0.9483430609107018, "num_tokens": 86172617.0, "step": 11540 }, { "entropy": 1.9428872235119343, "epoch": 0.7714206997887777, "grad_norm": 0.31794604659080505, "learning_rate": 7.638513278655068e-06, "loss": 0.2274, "mean_token_accuracy": 0.9445866737514734, "num_tokens": 86246206.0, "step": 11550 }, { "entropy": 1.9186835162341596, "epoch": 0.7720885964985515, "grad_norm": 0.2955509126186371, "learning_rate": 7.596891561215235e-06, "loss": 0.2101, "mean_token_accuracy": 0.9489998806267976, "num_tokens": 86321585.0, "step": 11560 }, { "entropy": 1.9407105453312397, "epoch": 0.7727564932083253, "grad_norm": 0.3108774423599243, "learning_rate": 7.55536473885974e-06, "loss": 0.2202, "mean_token_accuracy": 0.9468152474611997, "num_tokens": 86396296.0, "step": 11570 }, { "entropy": 1.9339792892336845, "epoch": 0.7734243899180991, "grad_norm": 0.29260650277137756, "learning_rate": 7.513933037375928e-06, "loss": 0.2296, "mean_token_accuracy": 0.9442907094955444, "num_tokens": 86471896.0, "step": 11580 }, { "entropy": 1.9268646262586118, "epoch": 0.774092286627873, "grad_norm": 0.2828223407268524, "learning_rate": 7.472596682033987e-06, "loss": 0.2149, "mean_token_accuracy": 0.9474092531949282, "num_tokens": 86547339.0, "step": 11590 }, { "entropy": 1.9156761407852172, "epoch": 0.7747601833376468, "grad_norm": 0.3413717746734619, "learning_rate": 7.431355897585676e-06, "loss": 0.2384, "mean_token_accuracy": 0.9410256911069155, "num_tokens": 86622026.0, "step": 11600 }, { "entropy": 1.9566381104290484, "epoch": 0.7754280800474207, "grad_norm": 0.3666268587112427, "learning_rate": 7.39021090826313e-06, "loss": 0.237, "mean_token_accuracy": 0.9418189655989408, "num_tokens": 86694498.0, "step": 11610 }, { "entropy": 1.9231278404593468, "epoch": 0.7760959767571946, "grad_norm": 0.2729465663433075, "learning_rate": 7.3491619377776366e-06, "loss": 0.2196, "mean_token_accuracy": 0.9478519674390554, "num_tokens": 86770968.0, "step": 11620 }, { "entropy": 1.90982995480299, "epoch": 0.7767638734669683, "grad_norm": 0.30833160877227783, "learning_rate": 7.308209209318402e-06, "loss": 0.2068, "mean_token_accuracy": 0.9494866393506527, "num_tokens": 86846327.0, "step": 11630 }, { "entropy": 1.9449258789420127, "epoch": 0.7774317701767421, "grad_norm": 0.3366851210594177, "learning_rate": 7.267352945551344e-06, "loss": 0.2217, "mean_token_accuracy": 0.9434635043144226, "num_tokens": 86922728.0, "step": 11640 }, { "entropy": 1.914618470519781, "epoch": 0.778099666886516, "grad_norm": 0.3299575448036194, "learning_rate": 7.226593368617911e-06, "loss": 0.2346, "mean_token_accuracy": 0.9417701933532954, "num_tokens": 86998649.0, "step": 11650 }, { "entropy": 1.9171494588255882, "epoch": 0.7787675635962898, "grad_norm": 0.32758399844169617, "learning_rate": 7.185930700133839e-06, "loss": 0.2077, "mean_token_accuracy": 0.950836981460452, "num_tokens": 87071544.0, "step": 11660 }, { "entropy": 1.9156634002923965, "epoch": 0.7794354603060637, "grad_norm": 0.2863110601902008, "learning_rate": 7.145365161187959e-06, "loss": 0.2218, "mean_token_accuracy": 0.9448548093438148, "num_tokens": 87145390.0, "step": 11670 }, { "entropy": 1.9434235371649264, "epoch": 0.7801033570158376, "grad_norm": 0.30168262124061584, "learning_rate": 7.104896972341008e-06, "loss": 0.2215, "mean_token_accuracy": 0.9473841827362776, "num_tokens": 87224108.0, "step": 11680 }, { "entropy": 1.957365720719099, "epoch": 0.7807712537256113, "grad_norm": 0.3578754663467407, "learning_rate": 7.0645263536243785e-06, "loss": 0.2302, "mean_token_accuracy": 0.941792643815279, "num_tokens": 87298779.0, "step": 11690 }, { "entropy": 1.9179133355617524, "epoch": 0.7814391504353851, "grad_norm": 0.4008285105228424, "learning_rate": 7.024253524539003e-06, "loss": 0.2228, "mean_token_accuracy": 0.9455786202102899, "num_tokens": 87371678.0, "step": 11700 }, { "entropy": 1.9348440304398538, "epoch": 0.782107047145159, "grad_norm": 0.3001181483268738, "learning_rate": 6.984078704054092e-06, "loss": 0.2387, "mean_token_accuracy": 0.943041504919529, "num_tokens": 87445081.0, "step": 11710 }, { "entropy": 1.942325195670128, "epoch": 0.7827749438549328, "grad_norm": 0.34287431836128235, "learning_rate": 6.944002110605984e-06, "loss": 0.2373, "mean_token_accuracy": 0.9439044259488583, "num_tokens": 87519273.0, "step": 11720 }, { "entropy": 1.930584143102169, "epoch": 0.7834428405647067, "grad_norm": 0.25890690088272095, "learning_rate": 6.904023962096937e-06, "loss": 0.2184, "mean_token_accuracy": 0.9463085103780031, "num_tokens": 87593384.0, "step": 11730 }, { "entropy": 1.921193440258503, "epoch": 0.7841107372744806, "grad_norm": 0.31245142221450806, "learning_rate": 6.864144475893937e-06, "loss": 0.2156, "mean_token_accuracy": 0.9478344406932593, "num_tokens": 87667522.0, "step": 11740 }, { "entropy": 1.8906810037791728, "epoch": 0.7847786339842543, "grad_norm": 0.3278355598449707, "learning_rate": 6.824363868827548e-06, "loss": 0.2125, "mean_token_accuracy": 0.9487185422331095, "num_tokens": 87746625.0, "step": 11750 }, { "entropy": 1.9176104918122292, "epoch": 0.7854465306940281, "grad_norm": 0.30767709016799927, "learning_rate": 6.784682357190701e-06, "loss": 0.2318, "mean_token_accuracy": 0.9401469543576241, "num_tokens": 87820796.0, "step": 11760 }, { "entropy": 1.91853381767869, "epoch": 0.786114427403802, "grad_norm": 0.2556558847427368, "learning_rate": 6.745100156737548e-06, "loss": 0.2072, "mean_token_accuracy": 0.9488288678228856, "num_tokens": 87896771.0, "step": 11770 }, { "entropy": 1.9115279085934163, "epoch": 0.7867823241135758, "grad_norm": 0.2916814088821411, "learning_rate": 6.7056174826822405e-06, "loss": 0.2241, "mean_token_accuracy": 0.9439541105180979, "num_tokens": 87971536.0, "step": 11780 }, { "entropy": 1.9110812567174436, "epoch": 0.7874502208233497, "grad_norm": 0.2770801782608032, "learning_rate": 6.6662345496978184e-06, "loss": 0.1919, "mean_token_accuracy": 0.951653453707695, "num_tokens": 88046920.0, "step": 11790 }, { "entropy": 1.8751946441829204, "epoch": 0.7881181175331236, "grad_norm": 0.25386354327201843, "learning_rate": 6.626951571915007e-06, "loss": 0.2033, "mean_token_accuracy": 0.949246945977211, "num_tokens": 88122550.0, "step": 11800 }, { "entropy": 1.9106215745210648, "epoch": 0.7887860142428973, "grad_norm": 0.3737806975841522, "learning_rate": 6.587768762921058e-06, "loss": 0.2366, "mean_token_accuracy": 0.9426119856536388, "num_tokens": 88198512.0, "step": 11810 }, { "entropy": 1.8998952463269234, "epoch": 0.7894539109526711, "grad_norm": 0.29235225915908813, "learning_rate": 6.5486863357586e-06, "loss": 0.2112, "mean_token_accuracy": 0.9466220244765282, "num_tokens": 88273588.0, "step": 11820 }, { "entropy": 1.9093636505305767, "epoch": 0.790121807662445, "grad_norm": 0.341068297624588, "learning_rate": 6.509704502924448e-06, "loss": 0.2191, "mean_token_accuracy": 0.9445913273841142, "num_tokens": 88348515.0, "step": 11830 }, { "entropy": 1.92974793612957, "epoch": 0.7907897043722188, "grad_norm": 0.297319233417511, "learning_rate": 6.470823476368496e-06, "loss": 0.2297, "mean_token_accuracy": 0.9433461457490921, "num_tokens": 88423411.0, "step": 11840 }, { "entropy": 1.9271962210536002, "epoch": 0.7914576010819927, "grad_norm": 0.33146753907203674, "learning_rate": 6.432043467492533e-06, "loss": 0.2197, "mean_token_accuracy": 0.9456533152610064, "num_tokens": 88500680.0, "step": 11850 }, { "entropy": 1.9142560467123986, "epoch": 0.7921254977917666, "grad_norm": 0.2693401575088501, "learning_rate": 6.393364687149085e-06, "loss": 0.2248, "mean_token_accuracy": 0.9466971836984157, "num_tokens": 88573332.0, "step": 11860 }, { "entropy": 1.899408396333456, "epoch": 0.7927933945015403, "grad_norm": 0.260791540145874, "learning_rate": 6.354787345640301e-06, "loss": 0.2184, "mean_token_accuracy": 0.9448356207460165, "num_tokens": 88649494.0, "step": 11870 }, { "entropy": 1.8895390599966049, "epoch": 0.7934612912113141, "grad_norm": 0.2668962776660919, "learning_rate": 6.316311652716799e-06, "loss": 0.2049, "mean_token_accuracy": 0.9486229028552771, "num_tokens": 88725208.0, "step": 11880 }, { "entropy": 1.919366579502821, "epoch": 0.794129187921088, "grad_norm": 0.3220490515232086, "learning_rate": 6.2779378175764905e-06, "loss": 0.238, "mean_token_accuracy": 0.9420530818402767, "num_tokens": 88797715.0, "step": 11890 }, { "entropy": 1.9052425637841224, "epoch": 0.7947970846308618, "grad_norm": 0.25093507766723633, "learning_rate": 6.239666048863495e-06, "loss": 0.2089, "mean_token_accuracy": 0.9471659358590842, "num_tokens": 88871536.0, "step": 11900 }, { "entropy": 1.9246492482721806, "epoch": 0.7954649813406357, "grad_norm": 0.3261584937572479, "learning_rate": 6.201496554666975e-06, "loss": 0.2203, "mean_token_accuracy": 0.9443686258047819, "num_tokens": 88945601.0, "step": 11910 }, { "entropy": 1.9137545451521873, "epoch": 0.7961328780504096, "grad_norm": 0.35194119811058044, "learning_rate": 6.163429542520008e-06, "loss": 0.2451, "mean_token_accuracy": 0.9419476479291916, "num_tokens": 89019858.0, "step": 11920 }, { "entropy": 1.9139618828892708, "epoch": 0.7968007747601833, "grad_norm": 0.32016295194625854, "learning_rate": 6.125465219398479e-06, "loss": 0.2376, "mean_token_accuracy": 0.9402606707066298, "num_tokens": 89092021.0, "step": 11930 }, { "entropy": 1.8968940548598767, "epoch": 0.7974686714699571, "grad_norm": 0.27857133746147156, "learning_rate": 6.087603791719909e-06, "loss": 0.2152, "mean_token_accuracy": 0.9455442499369383, "num_tokens": 89167921.0, "step": 11940 }, { "entropy": 1.9391052447259427, "epoch": 0.798136568179731, "grad_norm": 0.290174663066864, "learning_rate": 6.049845465342379e-06, "loss": 0.2353, "mean_token_accuracy": 0.942417386546731, "num_tokens": 89240609.0, "step": 11950 }, { "entropy": 1.9463041372597218, "epoch": 0.7988044648895049, "grad_norm": 0.30286282300949097, "learning_rate": 6.012190445563396e-06, "loss": 0.2225, "mean_token_accuracy": 0.9446444526314736, "num_tokens": 89313669.0, "step": 11960 }, { "entropy": 1.9215276122093201, "epoch": 0.7994723615992787, "grad_norm": 0.28920048475265503, "learning_rate": 5.9746389371187655e-06, "loss": 0.2265, "mean_token_accuracy": 0.9458133615553379, "num_tokens": 89388749.0, "step": 11970 }, { "entropy": 1.8859002590179443, "epoch": 0.8001402583090526, "grad_norm": 0.43147513270378113, "learning_rate": 5.937191144181502e-06, "loss": 0.219, "mean_token_accuracy": 0.9450708650052547, "num_tokens": 89465190.0, "step": 11980 }, { "entropy": 1.912620224058628, "epoch": 0.8008081550188263, "grad_norm": 0.2776070535182953, "learning_rate": 5.899847270360674e-06, "loss": 0.2235, "mean_token_accuracy": 0.9443076837807893, "num_tokens": 89539439.0, "step": 11990 }, { "entropy": 1.927357778698206, "epoch": 0.8014760517286001, "grad_norm": 0.35332590341567993, "learning_rate": 5.862607518700353e-06, "loss": 0.2212, "mean_token_accuracy": 0.9499105460941791, "num_tokens": 89614509.0, "step": 12000 }, { "epoch": 0.8014760517286001, "eval_entropy": 1.9077495398283004, "eval_loss": 0.23475231230258942, "eval_mean_token_accuracy": 0.9464578078866005, "eval_num_tokens": 89614509.0, "eval_runtime": 552.6917, "eval_samples_per_second": 36.187, "eval_steps_per_second": 9.047, "step": 12000 }, { "entropy": 1.93703440874815, "epoch": 0.802143948438374, "grad_norm": 0.38874146342277527, "learning_rate": 5.825472091678475e-06, "loss": 0.2184, "mean_token_accuracy": 0.9452136412262917, "num_tokens": 89690978.0, "step": 12010 }, { "entropy": 1.9058509640395642, "epoch": 0.8028118451481479, "grad_norm": 0.317646861076355, "learning_rate": 5.788441191205756e-06, "loss": 0.232, "mean_token_accuracy": 0.9432979535311461, "num_tokens": 89765550.0, "step": 12020 }, { "entropy": 1.9148917861282826, "epoch": 0.8034797418579217, "grad_norm": 0.2909880578517914, "learning_rate": 5.751515018624561e-06, "loss": 0.2018, "mean_token_accuracy": 0.9504593200981617, "num_tokens": 89839392.0, "step": 12030 }, { "entropy": 1.9205414779484271, "epoch": 0.8041476385676956, "grad_norm": 0.45270484685897827, "learning_rate": 5.714693774707862e-06, "loss": 0.2163, "mean_token_accuracy": 0.9461734648793936, "num_tokens": 89911436.0, "step": 12040 }, { "entropy": 1.9065644189715385, "epoch": 0.8048155352774693, "grad_norm": 0.3243974447250366, "learning_rate": 5.6779776596581065e-06, "loss": 0.2329, "mean_token_accuracy": 0.9426402520388365, "num_tokens": 89983728.0, "step": 12050 }, { "entropy": 1.8841743096709251, "epoch": 0.8054834319872431, "grad_norm": 0.284850150346756, "learning_rate": 5.6413668731061395e-06, "loss": 0.1984, "mean_token_accuracy": 0.949528944119811, "num_tokens": 90059480.0, "step": 12060 }, { "entropy": 1.9222078263759612, "epoch": 0.806151328697017, "grad_norm": 0.33089596033096313, "learning_rate": 5.604861614110132e-06, "loss": 0.2184, "mean_token_accuracy": 0.9441944282501936, "num_tokens": 90133896.0, "step": 12070 }, { "entropy": 1.933812576532364, "epoch": 0.8068192254067909, "grad_norm": 0.2974908947944641, "learning_rate": 5.5684620811544684e-06, "loss": 0.2337, "mean_token_accuracy": 0.9459289290010929, "num_tokens": 90208380.0, "step": 12080 }, { "entropy": 1.9106913723051548, "epoch": 0.8074871221165647, "grad_norm": 0.3189352750778198, "learning_rate": 5.53216847214869e-06, "loss": 0.23, "mean_token_accuracy": 0.9435811273753643, "num_tokens": 90282721.0, "step": 12090 }, { "entropy": 1.9149140909314155, "epoch": 0.8081550188263386, "grad_norm": 0.3116757571697235, "learning_rate": 5.495980984426421e-06, "loss": 0.2239, "mean_token_accuracy": 0.944933907687664, "num_tokens": 90356135.0, "step": 12100 }, { "entropy": 1.8974915623664856, "epoch": 0.8088229155361123, "grad_norm": 0.29558226466178894, "learning_rate": 5.459899814744286e-06, "loss": 0.2247, "mean_token_accuracy": 0.946451997756958, "num_tokens": 90432327.0, "step": 12110 }, { "entropy": 1.9107790172100068, "epoch": 0.8094908122458861, "grad_norm": 0.31916290521621704, "learning_rate": 5.423925159280845e-06, "loss": 0.2183, "mean_token_accuracy": 0.9461866691708565, "num_tokens": 90506458.0, "step": 12120 }, { "entropy": 1.906505247950554, "epoch": 0.81015870895566, "grad_norm": 0.31288862228393555, "learning_rate": 5.388057213635526e-06, "loss": 0.2162, "mean_token_accuracy": 0.946871118247509, "num_tokens": 90582548.0, "step": 12130 }, { "entropy": 1.9007952421903611, "epoch": 0.8108266056654339, "grad_norm": 0.30547887086868286, "learning_rate": 5.352296172827547e-06, "loss": 0.2105, "mean_token_accuracy": 0.9467106480151415, "num_tokens": 90658389.0, "step": 12140 }, { "entropy": 1.952115386724472, "epoch": 0.8114945023752077, "grad_norm": 0.3439217805862427, "learning_rate": 5.316642231294882e-06, "loss": 0.2446, "mean_token_accuracy": 0.9407574523240327, "num_tokens": 90733808.0, "step": 12150 }, { "entropy": 1.9200212970376014, "epoch": 0.8121623990849816, "grad_norm": 0.30591586232185364, "learning_rate": 5.281095582893189e-06, "loss": 0.2336, "mean_token_accuracy": 0.9443939696997404, "num_tokens": 90805914.0, "step": 12160 }, { "entropy": 1.9278677806258202, "epoch": 0.8128302957947553, "grad_norm": 0.31881797313690186, "learning_rate": 5.245656420894755e-06, "loss": 0.2209, "mean_token_accuracy": 0.9470836572349072, "num_tokens": 90881121.0, "step": 12170 }, { "entropy": 1.90970710888505, "epoch": 0.8134981925045291, "grad_norm": 0.2699946463108063, "learning_rate": 5.210324937987452e-06, "loss": 0.2129, "mean_token_accuracy": 0.9496553532779217, "num_tokens": 90955665.0, "step": 12180 }, { "entropy": 1.9190218165516852, "epoch": 0.814166089214303, "grad_norm": 0.28772151470184326, "learning_rate": 5.175101326273678e-06, "loss": 0.2164, "mean_token_accuracy": 0.9481560837477445, "num_tokens": 91029252.0, "step": 12190 }, { "entropy": 1.9169261828064919, "epoch": 0.8148339859240769, "grad_norm": 0.28831717371940613, "learning_rate": 5.139985777269319e-06, "loss": 0.2198, "mean_token_accuracy": 0.9456579513847828, "num_tokens": 91101994.0, "step": 12200 }, { "entropy": 1.8855088956654071, "epoch": 0.8155018826338507, "grad_norm": 0.24257218837738037, "learning_rate": 5.104978481902719e-06, "loss": 0.2005, "mean_token_accuracy": 0.9510732624679804, "num_tokens": 91180249.0, "step": 12210 }, { "entropy": 1.911930686980486, "epoch": 0.8161697793436246, "grad_norm": 0.3006708323955536, "learning_rate": 5.0700796305136255e-06, "loss": 0.2231, "mean_token_accuracy": 0.945105604082346, "num_tokens": 91257831.0, "step": 12220 }, { "entropy": 1.9221073605120182, "epoch": 0.8168376760533983, "grad_norm": 0.3255353271961212, "learning_rate": 5.0352894128521634e-06, "loss": 0.2364, "mean_token_accuracy": 0.939706540107727, "num_tokens": 91332692.0, "step": 12230 }, { "entropy": 1.9181040100753308, "epoch": 0.8175055727631722, "grad_norm": 0.2864046096801758, "learning_rate": 5.0006080180777865e-06, "loss": 0.2156, "mean_token_accuracy": 0.9446999654173851, "num_tokens": 91405687.0, "step": 12240 }, { "entropy": 1.9098816119134425, "epoch": 0.818173469472946, "grad_norm": 0.2883688509464264, "learning_rate": 4.9660356347582764e-06, "loss": 0.2213, "mean_token_accuracy": 0.9463308542966843, "num_tokens": 91480106.0, "step": 12250 }, { "entropy": 1.9178796097636224, "epoch": 0.8188413661827199, "grad_norm": 0.2966650128364563, "learning_rate": 4.931572450868704e-06, "loss": 0.2223, "mean_token_accuracy": 0.9446263413876295, "num_tokens": 91552284.0, "step": 12260 }, { "entropy": 1.892970908433199, "epoch": 0.8195092628924937, "grad_norm": 0.31876063346862793, "learning_rate": 4.8972186537904055e-06, "loss": 0.214, "mean_token_accuracy": 0.945142986625433, "num_tokens": 91625080.0, "step": 12270 }, { "entropy": 1.9201669298112392, "epoch": 0.8201771596022676, "grad_norm": 0.296844482421875, "learning_rate": 4.862974430309952e-06, "loss": 0.2212, "mean_token_accuracy": 0.9442084044218063, "num_tokens": 91700662.0, "step": 12280 }, { "entropy": 1.9088800638914107, "epoch": 0.8208450563120413, "grad_norm": 0.27243557572364807, "learning_rate": 4.828839966618166e-06, "loss": 0.2263, "mean_token_accuracy": 0.9437139257788658, "num_tokens": 91773943.0, "step": 12290 }, { "entropy": 1.9159510530531407, "epoch": 0.8215129530218152, "grad_norm": 0.35071954131126404, "learning_rate": 4.79481544830909e-06, "loss": 0.2198, "mean_token_accuracy": 0.9465903297066689, "num_tokens": 91851143.0, "step": 12300 }, { "entropy": 1.9333980567753315, "epoch": 0.822180849731589, "grad_norm": 0.25562265515327454, "learning_rate": 4.7609010603789495e-06, "loss": 0.2198, "mean_token_accuracy": 0.9474662080407142, "num_tokens": 91926345.0, "step": 12310 }, { "entropy": 1.9161305882036685, "epoch": 0.8228487464413629, "grad_norm": 0.3357928991317749, "learning_rate": 4.7270969872252085e-06, "loss": 0.2257, "mean_token_accuracy": 0.9430730618536473, "num_tokens": 92002132.0, "step": 12320 }, { "entropy": 1.9020003490149975, "epoch": 0.8235166431511367, "grad_norm": 0.2852373421192169, "learning_rate": 4.693403412645523e-06, "loss": 0.2228, "mean_token_accuracy": 0.9454558629542589, "num_tokens": 92077437.0, "step": 12330 }, { "entropy": 1.9694581009447574, "epoch": 0.8241845398609106, "grad_norm": 0.29638954997062683, "learning_rate": 4.6598205198367375e-06, "loss": 0.229, "mean_token_accuracy": 0.9444546531885862, "num_tokens": 92151258.0, "step": 12340 }, { "entropy": 1.9170562088489533, "epoch": 0.8248524365706843, "grad_norm": 0.29127585887908936, "learning_rate": 4.626348491393925e-06, "loss": 0.2213, "mean_token_accuracy": 0.9467327196151019, "num_tokens": 92225354.0, "step": 12350 }, { "entropy": 1.9222478553652764, "epoch": 0.8255203332804582, "grad_norm": 0.3237292766571045, "learning_rate": 4.592987509309356e-06, "loss": 0.2212, "mean_token_accuracy": 0.947163712978363, "num_tokens": 92300008.0, "step": 12360 }, { "entropy": 1.877466270327568, "epoch": 0.826188229990232, "grad_norm": 0.2953042685985565, "learning_rate": 4.559737754971541e-06, "loss": 0.2083, "mean_token_accuracy": 0.947779618948698, "num_tokens": 92375963.0, "step": 12370 }, { "entropy": 1.8960151240229606, "epoch": 0.8268561267000059, "grad_norm": 0.3921753764152527, "learning_rate": 4.526599409164226e-06, "loss": 0.2056, "mean_token_accuracy": 0.9488136760890484, "num_tokens": 92453021.0, "step": 12380 }, { "entropy": 1.9146280325949192, "epoch": 0.8275240234097797, "grad_norm": 0.29990142583847046, "learning_rate": 4.493572652065391e-06, "loss": 0.2241, "mean_token_accuracy": 0.9465552151203156, "num_tokens": 92526342.0, "step": 12390 }, { "entropy": 1.9248810023069383, "epoch": 0.8281919201195536, "grad_norm": 0.32960548996925354, "learning_rate": 4.460657663246322e-06, "loss": 0.2199, "mean_token_accuracy": 0.9430462893098592, "num_tokens": 92602652.0, "step": 12400 }, { "entropy": 1.9142834946513176, "epoch": 0.8288598168293273, "grad_norm": 0.26918256282806396, "learning_rate": 4.427854621670583e-06, "loss": 0.2264, "mean_token_accuracy": 0.9485366005450487, "num_tokens": 92677039.0, "step": 12410 }, { "entropy": 1.9398212164640427, "epoch": 0.8295277135391012, "grad_norm": 0.28655320405960083, "learning_rate": 4.395163705693083e-06, "loss": 0.2316, "mean_token_accuracy": 0.9404951419681311, "num_tokens": 92749309.0, "step": 12420 }, { "entropy": 1.9200722940266133, "epoch": 0.830195610248875, "grad_norm": 0.3873966634273529, "learning_rate": 4.362585093059077e-06, "loss": 0.2307, "mean_token_accuracy": 0.9440862823277711, "num_tokens": 92825786.0, "step": 12430 }, { "entropy": 1.9236732959747314, "epoch": 0.8308635069586489, "grad_norm": 0.3685950040817261, "learning_rate": 4.330118960903201e-06, "loss": 0.2276, "mean_token_accuracy": 0.9434462014585734, "num_tokens": 92900267.0, "step": 12440 }, { "entropy": 1.8944612585008145, "epoch": 0.8315314036684227, "grad_norm": 0.30650460720062256, "learning_rate": 4.297765485748536e-06, "loss": 0.2193, "mean_token_accuracy": 0.9466446179896593, "num_tokens": 92975421.0, "step": 12450 }, { "entropy": 1.9075546264648438, "epoch": 0.8321993003781966, "grad_norm": 0.3539635241031647, "learning_rate": 4.265524843505623e-06, "loss": 0.2328, "mean_token_accuracy": 0.9422083970159292, "num_tokens": 93050007.0, "step": 12460 }, { "entropy": 1.9267285540699959, "epoch": 0.8328671970879703, "grad_norm": 0.318481981754303, "learning_rate": 4.233397209471513e-06, "loss": 0.234, "mean_token_accuracy": 0.9424730904400349, "num_tokens": 93124474.0, "step": 12470 }, { "entropy": 1.9024205163121224, "epoch": 0.8335350937977442, "grad_norm": 0.32240915298461914, "learning_rate": 4.201382758328825e-06, "loss": 0.2117, "mean_token_accuracy": 0.9464437153190375, "num_tokens": 93201345.0, "step": 12480 }, { "entropy": 1.9199492737650872, "epoch": 0.834202990507518, "grad_norm": 0.288259893655777, "learning_rate": 4.169481664144765e-06, "loss": 0.2358, "mean_token_accuracy": 0.9420751929283142, "num_tokens": 93274253.0, "step": 12490 }, { "entropy": 1.9158204957842826, "epoch": 0.8348708872172919, "grad_norm": 0.27644994854927063, "learning_rate": 4.137694100370218e-06, "loss": 0.2193, "mean_token_accuracy": 0.9459875266999006, "num_tokens": 93351974.0, "step": 12500 }, { "entropy": 1.9240369744598866, "epoch": 0.8355387839270657, "grad_norm": 0.29895466566085815, "learning_rate": 4.1060202398387816e-06, "loss": 0.2472, "mean_token_accuracy": 0.9408362310379743, "num_tokens": 93426423.0, "step": 12510 }, { "entropy": 1.9075682036578656, "epoch": 0.8362066806368396, "grad_norm": 0.3330353796482086, "learning_rate": 4.074460254765844e-06, "loss": 0.2124, "mean_token_accuracy": 0.94851104170084, "num_tokens": 93501709.0, "step": 12520 }, { "entropy": 1.909358086436987, "epoch": 0.8368745773466133, "grad_norm": 0.28923672437667847, "learning_rate": 4.043014316747614e-06, "loss": 0.2163, "mean_token_accuracy": 0.9456011939793825, "num_tokens": 93577318.0, "step": 12530 }, { "entropy": 1.899984909594059, "epoch": 0.8375424740563872, "grad_norm": 0.2875509262084961, "learning_rate": 4.011682596760221e-06, "loss": 0.2292, "mean_token_accuracy": 0.9445662580430507, "num_tokens": 93652909.0, "step": 12540 }, { "entropy": 1.906442727893591, "epoch": 0.838210370766161, "grad_norm": 0.35136204957962036, "learning_rate": 3.980465265158779e-06, "loss": 0.2164, "mean_token_accuracy": 0.9453341763466596, "num_tokens": 93726521.0, "step": 12550 }, { "entropy": 1.905178725719452, "epoch": 0.8388782674759349, "grad_norm": 0.23824502527713776, "learning_rate": 3.949362491676454e-06, "loss": 0.2187, "mean_token_accuracy": 0.9441476624459029, "num_tokens": 93800759.0, "step": 12560 }, { "entropy": 1.8736170925199986, "epoch": 0.8395461641857087, "grad_norm": 0.26656362414360046, "learning_rate": 3.918374445423536e-06, "loss": 0.2015, "mean_token_accuracy": 0.9506821319460869, "num_tokens": 93877628.0, "step": 12570 }, { "entropy": 1.8988473922014237, "epoch": 0.8402140608954826, "grad_norm": 0.3266134560108185, "learning_rate": 3.8875012948865406e-06, "loss": 0.2191, "mean_token_accuracy": 0.9459964755922556, "num_tokens": 93951331.0, "step": 12580 }, { "entropy": 1.8885542929172516, "epoch": 0.8408819576052563, "grad_norm": 0.2893097996711731, "learning_rate": 3.8567432079272575e-06, "loss": 0.2026, "mean_token_accuracy": 0.9486055232584476, "num_tokens": 94024591.0, "step": 12590 }, { "entropy": 1.9056413725018502, "epoch": 0.8415498543150302, "grad_norm": 0.33855727314949036, "learning_rate": 3.826100351781877e-06, "loss": 0.2062, "mean_token_accuracy": 0.9487339001148939, "num_tokens": 94099122.0, "step": 12600 }, { "entropy": 1.9189244344830514, "epoch": 0.842217751024804, "grad_norm": 0.3240315616130829, "learning_rate": 3.7955728930600537e-06, "loss": 0.2217, "mean_token_accuracy": 0.9466369111090899, "num_tokens": 94171605.0, "step": 12610 }, { "entropy": 1.9320820726454258, "epoch": 0.8428856477345779, "grad_norm": 0.3500101566314697, "learning_rate": 3.7651609977440132e-06, "loss": 0.2376, "mean_token_accuracy": 0.9429630015045405, "num_tokens": 94245534.0, "step": 12620 }, { "entropy": 1.899515087902546, "epoch": 0.8435535444443517, "grad_norm": 0.2735781669616699, "learning_rate": 3.734864831187655e-06, "loss": 0.2134, "mean_token_accuracy": 0.9473102346062661, "num_tokens": 94321308.0, "step": 12630 }, { "entropy": 1.879213922470808, "epoch": 0.8442214411541256, "grad_norm": 0.38318684697151184, "learning_rate": 3.704684558115619e-06, "loss": 0.2158, "mean_token_accuracy": 0.9502399206161499, "num_tokens": 94396459.0, "step": 12640 }, { "entropy": 1.914496787637472, "epoch": 0.8448893378638993, "grad_norm": 0.28392308950424194, "learning_rate": 3.6746203426224394e-06, "loss": 0.2036, "mean_token_accuracy": 0.9497009128332138, "num_tokens": 94469224.0, "step": 12650 }, { "entropy": 1.911051009595394, "epoch": 0.8455572345736732, "grad_norm": 0.3505001962184906, "learning_rate": 3.6446723481716195e-06, "loss": 0.2386, "mean_token_accuracy": 0.9406479235738516, "num_tokens": 94541886.0, "step": 12660 }, { "entropy": 1.9401042722165585, "epoch": 0.846225131283447, "grad_norm": 0.3758535087108612, "learning_rate": 3.614840737594754e-06, "loss": 0.2085, "mean_token_accuracy": 0.9472375724464654, "num_tokens": 94616074.0, "step": 12670 }, { "entropy": 1.9013698816299438, "epoch": 0.8468930279932209, "grad_norm": 0.3473319411277771, "learning_rate": 3.585125673090644e-06, "loss": 0.2088, "mean_token_accuracy": 0.9465346351265908, "num_tokens": 94690957.0, "step": 12680 }, { "entropy": 1.9082304663956164, "epoch": 0.8475609247029947, "grad_norm": 0.2587113678455353, "learning_rate": 3.555527316224398e-06, "loss": 0.2067, "mean_token_accuracy": 0.9490227155387402, "num_tokens": 94767652.0, "step": 12690 }, { "entropy": 1.8926838703453541, "epoch": 0.8482288214127686, "grad_norm": 0.31046247482299805, "learning_rate": 3.526045827926585e-06, "loss": 0.2177, "mean_token_accuracy": 0.9462960693985224, "num_tokens": 94843529.0, "step": 12700 }, { "entropy": 1.9144454523921013, "epoch": 0.8488967181225423, "grad_norm": 0.32953667640686035, "learning_rate": 3.4966813684923384e-06, "loss": 0.2272, "mean_token_accuracy": 0.9424541935324668, "num_tokens": 94916688.0, "step": 12710 }, { "entropy": 1.913926786929369, "epoch": 0.8495646148323162, "grad_norm": 0.3478092849254608, "learning_rate": 3.467434097580493e-06, "loss": 0.2153, "mean_token_accuracy": 0.9467847377061844, "num_tokens": 94991692.0, "step": 12720 }, { "entropy": 1.896678277105093, "epoch": 0.85023251154209, "grad_norm": 0.3317002058029175, "learning_rate": 3.438304174212693e-06, "loss": 0.2207, "mean_token_accuracy": 0.9460543278604746, "num_tokens": 95068804.0, "step": 12730 }, { "entropy": 1.9101593144237996, "epoch": 0.8509004082518639, "grad_norm": 0.30426764488220215, "learning_rate": 3.40929175677257e-06, "loss": 0.227, "mean_token_accuracy": 0.9424716554582119, "num_tokens": 95144528.0, "step": 12740 }, { "entropy": 1.9011964708566667, "epoch": 0.8515683049616377, "grad_norm": 0.2705959379673004, "learning_rate": 3.3803970030048434e-06, "loss": 0.2013, "mean_token_accuracy": 0.947756539285183, "num_tokens": 95218276.0, "step": 12750 }, { "entropy": 1.9015478432178496, "epoch": 0.8522362016714116, "grad_norm": 0.2622295916080475, "learning_rate": 3.351620070014497e-06, "loss": 0.2072, "mean_token_accuracy": 0.9473953269422054, "num_tokens": 95293257.0, "step": 12760 }, { "entropy": 1.9096700623631477, "epoch": 0.8529040983811853, "grad_norm": 0.3143070340156555, "learning_rate": 3.3229611142658747e-06, "loss": 0.2255, "mean_token_accuracy": 0.9448044616729021, "num_tokens": 95368100.0, "step": 12770 }, { "entropy": 1.9495323419570922, "epoch": 0.8535719950909592, "grad_norm": 0.30113184452056885, "learning_rate": 3.294420291581897e-06, "loss": 0.2192, "mean_token_accuracy": 0.9458323460072279, "num_tokens": 95442181.0, "step": 12780 }, { "entropy": 1.9024573378264904, "epoch": 0.854239891800733, "grad_norm": 0.337389200925827, "learning_rate": 3.2659977571431473e-06, "loss": 0.2146, "mean_token_accuracy": 0.9440126322209835, "num_tokens": 95515226.0, "step": 12790 }, { "entropy": 1.8989201940596103, "epoch": 0.8549077885105069, "grad_norm": 0.2654149830341339, "learning_rate": 3.2376936654870746e-06, "loss": 0.2219, "mean_token_accuracy": 0.9450605168938637, "num_tokens": 95590563.0, "step": 12800 }, { "entropy": 1.897411823272705, "epoch": 0.8555756852202807, "grad_norm": 0.29004570841789246, "learning_rate": 3.209508170507135e-06, "loss": 0.2006, "mean_token_accuracy": 0.9493835728615523, "num_tokens": 95667791.0, "step": 12810 }, { "entropy": 1.9329859793186188, "epoch": 0.8562435819300546, "grad_norm": 0.31763482093811035, "learning_rate": 3.1814414254519602e-06, "loss": 0.2144, "mean_token_accuracy": 0.9449219807982445, "num_tokens": 95743162.0, "step": 12820 }, { "entropy": 1.95360249504447, "epoch": 0.8569114786398283, "grad_norm": 0.35177379846572876, "learning_rate": 3.1534935829245176e-06, "loss": 0.2137, "mean_token_accuracy": 0.9477232187986374, "num_tokens": 95819891.0, "step": 12830 }, { "entropy": 1.914057232439518, "epoch": 0.8575793753496022, "grad_norm": 0.3635084927082062, "learning_rate": 3.1256647948812793e-06, "loss": 0.2234, "mean_token_accuracy": 0.94504219815135, "num_tokens": 95894739.0, "step": 12840 }, { "entropy": 1.9173757053911686, "epoch": 0.858247272059376, "grad_norm": 0.2878390848636627, "learning_rate": 3.097955212631406e-06, "loss": 0.234, "mean_token_accuracy": 0.9414523094892502, "num_tokens": 95969087.0, "step": 12850 }, { "entropy": 1.920248629897833, "epoch": 0.8589151687691499, "grad_norm": 0.37370526790618896, "learning_rate": 3.0703649868359225e-06, "loss": 0.2305, "mean_token_accuracy": 0.943334087356925, "num_tokens": 96044766.0, "step": 12860 }, { "entropy": 1.9216134034097194, "epoch": 0.8595830654789237, "grad_norm": 0.34205037355422974, "learning_rate": 3.042894267506891e-06, "loss": 0.2413, "mean_token_accuracy": 0.9426057361066341, "num_tokens": 96119491.0, "step": 12870 }, { "entropy": 1.9309019044041633, "epoch": 0.8602509621886976, "grad_norm": 0.3354184627532959, "learning_rate": 3.015543204006604e-06, "loss": 0.2353, "mean_token_accuracy": 0.9419073890894651, "num_tokens": 96193036.0, "step": 12880 }, { "entropy": 1.8997986532747746, "epoch": 0.8609188588984713, "grad_norm": 0.2701426148414612, "learning_rate": 2.9883119450467557e-06, "loss": 0.2171, "mean_token_accuracy": 0.947497657686472, "num_tokens": 96267893.0, "step": 12890 }, { "entropy": 1.8968277364969253, "epoch": 0.8615867556082452, "grad_norm": 0.2995654344558716, "learning_rate": 2.9612006386876613e-06, "loss": 0.2063, "mean_token_accuracy": 0.9469488143920899, "num_tokens": 96342369.0, "step": 12900 }, { "entropy": 1.8971393764019013, "epoch": 0.862254652318019, "grad_norm": 0.33524850010871887, "learning_rate": 2.9342094323374267e-06, "loss": 0.2232, "mean_token_accuracy": 0.9447850570082664, "num_tokens": 96416594.0, "step": 12910 }, { "entropy": 1.918541420251131, "epoch": 0.8629225490277929, "grad_norm": 0.2766539752483368, "learning_rate": 2.9073384727511606e-06, "loss": 0.2187, "mean_token_accuracy": 0.9467494156211614, "num_tokens": 96490004.0, "step": 12920 }, { "entropy": 1.907379398494959, "epoch": 0.8635904457375667, "grad_norm": 0.341058611869812, "learning_rate": 2.8805879060301734e-06, "loss": 0.2259, "mean_token_accuracy": 0.9431953445076943, "num_tokens": 96564373.0, "step": 12930 }, { "entropy": 1.8784002639353274, "epoch": 0.8642583424473406, "grad_norm": 0.3375591039657593, "learning_rate": 2.8539578776211743e-06, "loss": 0.2052, "mean_token_accuracy": 0.9507540252059699, "num_tokens": 96639314.0, "step": 12940 }, { "entropy": 1.9218274757266045, "epoch": 0.8649262391571143, "grad_norm": 0.3263833820819855, "learning_rate": 2.827448532315497e-06, "loss": 0.2044, "mean_token_accuracy": 0.9460774265229702, "num_tokens": 96712931.0, "step": 12950 }, { "entropy": 1.895472052693367, "epoch": 0.8655941358668882, "grad_norm": 0.32461920380592346, "learning_rate": 2.8010600142482977e-06, "loss": 0.2131, "mean_token_accuracy": 0.9485759288072586, "num_tokens": 96784654.0, "step": 12960 }, { "entropy": 1.897088672965765, "epoch": 0.866262032576662, "grad_norm": 0.2537863850593567, "learning_rate": 2.774792466897791e-06, "loss": 0.2108, "mean_token_accuracy": 0.9478284027427435, "num_tokens": 96860264.0, "step": 12970 }, { "entropy": 1.8856997050344944, "epoch": 0.8669299292864359, "grad_norm": 0.278632253408432, "learning_rate": 2.7486460330844283e-06, "loss": 0.2048, "mean_token_accuracy": 0.9465761728584766, "num_tokens": 96936431.0, "step": 12980 }, { "entropy": 1.8715303860604764, "epoch": 0.8675978259962097, "grad_norm": 0.26264268159866333, "learning_rate": 2.7226208549701793e-06, "loss": 0.2012, "mean_token_accuracy": 0.9532707251608372, "num_tokens": 97012887.0, "step": 12990 }, { "entropy": 1.884982492774725, "epoch": 0.8682657227059836, "grad_norm": 0.2999236583709717, "learning_rate": 2.696717074057707e-06, "loss": 0.214, "mean_token_accuracy": 0.9472188141196967, "num_tokens": 97091533.0, "step": 13000 }, { "epoch": 0.8682657227059836, "eval_entropy": 1.891543303322792, "eval_loss": 0.23422756791114807, "eval_mean_token_accuracy": 0.9465205826520919, "eval_num_tokens": 97091533.0, "eval_runtime": 553.8499, "eval_samples_per_second": 36.111, "eval_steps_per_second": 9.028, "step": 13000 }, { "entropy": 1.92298434227705, "epoch": 0.8689336194157573, "grad_norm": 0.34577375650405884, "learning_rate": 2.670934831189634e-06, "loss": 0.2283, "mean_token_accuracy": 0.9452300623059273, "num_tokens": 97165811.0, "step": 13010 }, { "entropy": 1.8975606806576253, "epoch": 0.8696015161255312, "grad_norm": 0.2593967020511627, "learning_rate": 2.6452742665477545e-06, "loss": 0.2227, "mean_token_accuracy": 0.9417459007352591, "num_tokens": 97240731.0, "step": 13020 }, { "entropy": 1.8891439154744147, "epoch": 0.870269412835305, "grad_norm": 0.3155575394630432, "learning_rate": 2.619735519652291e-06, "loss": 0.2073, "mean_token_accuracy": 0.9488394863903522, "num_tokens": 97316521.0, "step": 13030 }, { "entropy": 1.946111287176609, "epoch": 0.8709373095450789, "grad_norm": 0.35275089740753174, "learning_rate": 2.594318729361106e-06, "loss": 0.2192, "mean_token_accuracy": 0.9465547289699316, "num_tokens": 97393093.0, "step": 13040 }, { "entropy": 1.8990215368568897, "epoch": 0.8716052062548527, "grad_norm": 0.3260514736175537, "learning_rate": 2.5690240338689856e-06, "loss": 0.2132, "mean_token_accuracy": 0.9487630125135184, "num_tokens": 97466457.0, "step": 13050 }, { "entropy": 1.8967769339680671, "epoch": 0.8722731029646266, "grad_norm": 0.3189840614795685, "learning_rate": 2.543851570706858e-06, "loss": 0.2137, "mean_token_accuracy": 0.9483622338622808, "num_tokens": 97539486.0, "step": 13060 }, { "entropy": 1.8951519280672073, "epoch": 0.8729409996744003, "grad_norm": 0.3604692220687866, "learning_rate": 2.5188014767410647e-06, "loss": 0.212, "mean_token_accuracy": 0.942385621741414, "num_tokens": 97613622.0, "step": 13070 }, { "entropy": 1.8882951810956001, "epoch": 0.8736088963841742, "grad_norm": 0.31977880001068115, "learning_rate": 2.493873888172605e-06, "loss": 0.2083, "mean_token_accuracy": 0.947973096370697, "num_tokens": 97688284.0, "step": 13080 }, { "entropy": 1.917658195644617, "epoch": 0.874276793093948, "grad_norm": 0.29543742537498474, "learning_rate": 2.4690689405363868e-06, "loss": 0.2386, "mean_token_accuracy": 0.9422120042145252, "num_tokens": 97760135.0, "step": 13090 }, { "entropy": 1.8869654476642608, "epoch": 0.8749446898037219, "grad_norm": 0.39594390988349915, "learning_rate": 2.4443867687005175e-06, "loss": 0.2197, "mean_token_accuracy": 0.9461137805134058, "num_tokens": 97835639.0, "step": 13100 }, { "entropy": 1.9309095345437526, "epoch": 0.8756125865134957, "grad_norm": 0.3087207078933716, "learning_rate": 2.419827506865549e-06, "loss": 0.2163, "mean_token_accuracy": 0.9479531478136778, "num_tokens": 97909477.0, "step": 13110 }, { "entropy": 1.9147302009165288, "epoch": 0.8762804832232696, "grad_norm": 0.32227468490600586, "learning_rate": 2.3953912885637522e-06, "loss": 0.2091, "mean_token_accuracy": 0.9483824409544468, "num_tokens": 97983235.0, "step": 13120 }, { "entropy": 1.8944000601768494, "epoch": 0.8769483799330433, "grad_norm": 0.27947521209716797, "learning_rate": 2.371078246658399e-06, "loss": 0.2183, "mean_token_accuracy": 0.9452764131128788, "num_tokens": 98057045.0, "step": 13130 }, { "entropy": 1.8982866704463959, "epoch": 0.8776162766428172, "grad_norm": 0.3334547281265259, "learning_rate": 2.3468885133430154e-06, "loss": 0.2088, "mean_token_accuracy": 0.9467113155871629, "num_tokens": 98131077.0, "step": 13140 }, { "entropy": 1.8906438417732716, "epoch": 0.878284173352591, "grad_norm": 0.31850579380989075, "learning_rate": 2.3228222201407016e-06, "loss": 0.2198, "mean_token_accuracy": 0.946795203909278, "num_tokens": 98202713.0, "step": 13150 }, { "entropy": 1.8986133173108102, "epoch": 0.8789520700623649, "grad_norm": 0.2782582938671112, "learning_rate": 2.2988794979033888e-06, "loss": 0.2228, "mean_token_accuracy": 0.9429177559912205, "num_tokens": 98278027.0, "step": 13160 }, { "entropy": 1.8995852150022983, "epoch": 0.8796199667721387, "grad_norm": 0.29466956853866577, "learning_rate": 2.2750604768111266e-06, "loss": 0.2209, "mean_token_accuracy": 0.9461796466261149, "num_tokens": 98353802.0, "step": 13170 }, { "entropy": 1.8842368714511395, "epoch": 0.8802878634819126, "grad_norm": 0.3136873245239258, "learning_rate": 2.2513652863714043e-06, "loss": 0.223, "mean_token_accuracy": 0.9453888233751059, "num_tokens": 98426818.0, "step": 13180 }, { "entropy": 1.9025919929146766, "epoch": 0.8809557601916863, "grad_norm": 0.28327301144599915, "learning_rate": 2.2277940554183955e-06, "loss": 0.2232, "mean_token_accuracy": 0.9449585396796465, "num_tokens": 98503440.0, "step": 13190 }, { "entropy": 1.9027289628982544, "epoch": 0.8816236569014602, "grad_norm": 0.28458476066589355, "learning_rate": 2.204346912112313e-06, "loss": 0.2128, "mean_token_accuracy": 0.9478524778038263, "num_tokens": 98576337.0, "step": 13200 }, { "entropy": 1.9297608852386474, "epoch": 0.882291553611234, "grad_norm": 0.3180808424949646, "learning_rate": 2.181023983938681e-06, "loss": 0.225, "mean_token_accuracy": 0.9438484117388726, "num_tokens": 98649622.0, "step": 13210 }, { "entropy": 1.9100798867642879, "epoch": 0.8829594503210079, "grad_norm": 0.28057873249053955, "learning_rate": 2.157825397707644e-06, "loss": 0.2185, "mean_token_accuracy": 0.9445180971175432, "num_tokens": 98727263.0, "step": 13220 }, { "entropy": 1.8764438286423684, "epoch": 0.8836273470307817, "grad_norm": 0.33722302317619324, "learning_rate": 2.1347512795532856e-06, "loss": 0.2113, "mean_token_accuracy": 0.9472705338150262, "num_tokens": 98803249.0, "step": 13230 }, { "entropy": 1.902427864074707, "epoch": 0.8842952437405556, "grad_norm": 0.3187564015388489, "learning_rate": 2.1118017549329277e-06, "loss": 0.2358, "mean_token_accuracy": 0.9436456378549337, "num_tokens": 98879488.0, "step": 13240 }, { "entropy": 1.8838684670627117, "epoch": 0.8849631404503293, "grad_norm": 0.2611239552497864, "learning_rate": 2.0889769486264703e-06, "loss": 0.22, "mean_token_accuracy": 0.9462853536009789, "num_tokens": 98954630.0, "step": 13250 }, { "entropy": 1.9105690382421017, "epoch": 0.8856310371601032, "grad_norm": 0.4400027096271515, "learning_rate": 2.0662769847357053e-06, "loss": 0.2317, "mean_token_accuracy": 0.9410594008862972, "num_tokens": 99027957.0, "step": 13260 }, { "entropy": 1.9107958316802978, "epoch": 0.886298933869877, "grad_norm": 0.32987266778945923, "learning_rate": 2.0437019866836244e-06, "loss": 0.2197, "mean_token_accuracy": 0.9442878343164921, "num_tokens": 99100160.0, "step": 13270 }, { "entropy": 1.891150862723589, "epoch": 0.8869668305796509, "grad_norm": 0.40508028864860535, "learning_rate": 2.0212520772137756e-06, "loss": 0.2149, "mean_token_accuracy": 0.9451200991868973, "num_tokens": 99173770.0, "step": 13280 }, { "entropy": 1.8941858768463136, "epoch": 0.8876347272894247, "grad_norm": 0.31875917315483093, "learning_rate": 1.9989273783895704e-06, "loss": 0.2163, "mean_token_accuracy": 0.9474922582507134, "num_tokens": 99249994.0, "step": 13290 }, { "entropy": 1.8973739825189113, "epoch": 0.8883026239991986, "grad_norm": 0.3059801161289215, "learning_rate": 1.976728011593642e-06, "loss": 0.2121, "mean_token_accuracy": 0.9487315006554127, "num_tokens": 99321787.0, "step": 13300 }, { "entropy": 1.905952476710081, "epoch": 0.8889705207089723, "grad_norm": 0.33482030034065247, "learning_rate": 1.9546540975271644e-06, "loss": 0.2203, "mean_token_accuracy": 0.9448102749884129, "num_tokens": 99394023.0, "step": 13310 }, { "entropy": 1.8998353369534016, "epoch": 0.8896384174187462, "grad_norm": 0.26776888966560364, "learning_rate": 1.9327057562092183e-06, "loss": 0.2092, "mean_token_accuracy": 0.9486879654228687, "num_tokens": 99467128.0, "step": 13320 }, { "entropy": 1.8985233709216118, "epoch": 0.89030631412852, "grad_norm": 0.3306865096092224, "learning_rate": 1.910883106976125e-06, "loss": 0.2202, "mean_token_accuracy": 0.945213158801198, "num_tokens": 99541382.0, "step": 13330 }, { "entropy": 1.891828079521656, "epoch": 0.8909742108382939, "grad_norm": 0.32416030764579773, "learning_rate": 1.8891862684807859e-06, "loss": 0.2108, "mean_token_accuracy": 0.9457236006855965, "num_tokens": 99616447.0, "step": 13340 }, { "entropy": 1.8976975105702878, "epoch": 0.8916421075480677, "grad_norm": 0.3189708888530731, "learning_rate": 1.8676153586920695e-06, "loss": 0.2236, "mean_token_accuracy": 0.9464722644537688, "num_tokens": 99690491.0, "step": 13350 }, { "entropy": 1.8865771420300006, "epoch": 0.8923100042578416, "grad_norm": 0.3577705919742584, "learning_rate": 1.8461704948941404e-06, "loss": 0.2407, "mean_token_accuracy": 0.9435342576354742, "num_tokens": 99763480.0, "step": 13360 }, { "entropy": 1.8979328125715256, "epoch": 0.8929779009676153, "grad_norm": 0.31675660610198975, "learning_rate": 1.824851793685838e-06, "loss": 0.2152, "mean_token_accuracy": 0.9487810526043177, "num_tokens": 99839534.0, "step": 13370 }, { "entropy": 1.906707002967596, "epoch": 0.8936457976773892, "grad_norm": 0.2757381200790405, "learning_rate": 1.8036593709800376e-06, "loss": 0.2114, "mean_token_accuracy": 0.9467173650860786, "num_tokens": 99915392.0, "step": 13380 }, { "entropy": 1.905162078142166, "epoch": 0.894313694387163, "grad_norm": 0.2738649547100067, "learning_rate": 1.7825933420030136e-06, "loss": 0.2232, "mean_token_accuracy": 0.947211854159832, "num_tokens": 99989599.0, "step": 13390 }, { "entropy": 1.95468819886446, "epoch": 0.8949815910969369, "grad_norm": 0.3508623540401459, "learning_rate": 1.7616538212938284e-06, "loss": 0.2273, "mean_token_accuracy": 0.9445957690477371, "num_tokens": 100063496.0, "step": 13400 }, { "entropy": 1.9230702228844165, "epoch": 0.8956494878067107, "grad_norm": 0.2760393023490906, "learning_rate": 1.7408409227036918e-06, "loss": 0.2305, "mean_token_accuracy": 0.9437668323516846, "num_tokens": 100139068.0, "step": 13410 }, { "entropy": 1.9089729115366936, "epoch": 0.8963173845164846, "grad_norm": 0.33417776226997375, "learning_rate": 1.7201547593953556e-06, "loss": 0.2148, "mean_token_accuracy": 0.9468063410371542, "num_tokens": 100212345.0, "step": 13420 }, { "entropy": 1.8938631422817707, "epoch": 0.8969852812262583, "grad_norm": 0.2712090313434601, "learning_rate": 1.6995954438425e-06, "loss": 0.2049, "mean_token_accuracy": 0.948897211253643, "num_tokens": 100288882.0, "step": 13430 }, { "entropy": 1.8983085237443447, "epoch": 0.8976531779360322, "grad_norm": 0.28794336318969727, "learning_rate": 1.679163087829097e-06, "loss": 0.2281, "mean_token_accuracy": 0.9439247619360686, "num_tokens": 100365523.0, "step": 13440 }, { "entropy": 1.8961265586316585, "epoch": 0.898321074645806, "grad_norm": 0.3383331000804901, "learning_rate": 1.6588578024488408e-06, "loss": 0.2145, "mean_token_accuracy": 0.9469839949160814, "num_tokens": 100438344.0, "step": 13450 }, { "entropy": 1.8918723858892919, "epoch": 0.8989889713555799, "grad_norm": 0.3040715754032135, "learning_rate": 1.6386796981045117e-06, "loss": 0.2038, "mean_token_accuracy": 0.9499476838856935, "num_tokens": 100516650.0, "step": 13460 }, { "entropy": 1.901743783801794, "epoch": 0.8996568680653537, "grad_norm": 0.3100825548171997, "learning_rate": 1.6186288845073929e-06, "loss": 0.2243, "mean_token_accuracy": 0.9449595987796784, "num_tokens": 100594588.0, "step": 13470 }, { "entropy": 1.8686980076134205, "epoch": 0.9003247647751276, "grad_norm": 0.3108823001384735, "learning_rate": 1.598705470676672e-06, "loss": 0.1911, "mean_token_accuracy": 0.9540467452257871, "num_tokens": 100669922.0, "step": 13480 }, { "entropy": 1.912983275949955, "epoch": 0.9009926614849013, "grad_norm": 0.34020450711250305, "learning_rate": 1.5789095649388359e-06, "loss": 0.2441, "mean_token_accuracy": 0.9437492664903402, "num_tokens": 100743601.0, "step": 13490 }, { "entropy": 1.8800438351929187, "epoch": 0.9016605581946752, "grad_norm": 0.3228403329849243, "learning_rate": 1.559241274927103e-06, "loss": 0.2115, "mean_token_accuracy": 0.9504777606576681, "num_tokens": 100819877.0, "step": 13500 }, { "entropy": 1.9302244670689106, "epoch": 0.902328454904449, "grad_norm": 0.2962304651737213, "learning_rate": 1.5397007075808213e-06, "loss": 0.2172, "mean_token_accuracy": 0.9446598574519157, "num_tokens": 100893443.0, "step": 13510 }, { "entropy": 1.9175043262541294, "epoch": 0.9029963516142229, "grad_norm": 0.2838495075702667, "learning_rate": 1.5202879691448898e-06, "loss": 0.2176, "mean_token_accuracy": 0.9475421570241451, "num_tokens": 100967830.0, "step": 13520 }, { "entropy": 1.9105577133595943, "epoch": 0.9036642483239967, "grad_norm": 0.3758520185947418, "learning_rate": 1.5010031651691909e-06, "loss": 0.2144, "mean_token_accuracy": 0.9449237577617169, "num_tokens": 101040690.0, "step": 13530 }, { "entropy": 1.9058876417577266, "epoch": 0.9043321450337706, "grad_norm": 0.2541896402835846, "learning_rate": 1.4818464005079978e-06, "loss": 0.2207, "mean_token_accuracy": 0.9438064724206925, "num_tokens": 101115522.0, "step": 13540 }, { "entropy": 1.9006869301199913, "epoch": 0.9050000417435443, "grad_norm": 0.25745898485183716, "learning_rate": 1.4628177793194219e-06, "loss": 0.2026, "mean_token_accuracy": 0.9499967951327563, "num_tokens": 101188806.0, "step": 13550 }, { "entropy": 1.924962904304266, "epoch": 0.9056679384533182, "grad_norm": 0.28642842173576355, "learning_rate": 1.4439174050648389e-06, "loss": 0.2299, "mean_token_accuracy": 0.9418151676654816, "num_tokens": 101263232.0, "step": 13560 }, { "entropy": 1.9254615865647793, "epoch": 0.906335835163092, "grad_norm": 0.3092668950557709, "learning_rate": 1.4251453805083297e-06, "loss": 0.2272, "mean_token_accuracy": 0.9459533967077732, "num_tokens": 101337802.0, "step": 13570 }, { "entropy": 1.9103708907961845, "epoch": 0.9070037318728659, "grad_norm": 0.2696140706539154, "learning_rate": 1.4065018077161197e-06, "loss": 0.2055, "mean_token_accuracy": 0.9483724005520344, "num_tokens": 101413467.0, "step": 13580 }, { "entropy": 1.897906582802534, "epoch": 0.9076716285826397, "grad_norm": 0.3275409936904907, "learning_rate": 1.3879867880560133e-06, "loss": 0.2032, "mean_token_accuracy": 0.9504713468253613, "num_tokens": 101487348.0, "step": 13590 }, { "entropy": 1.9108335733413697, "epoch": 0.9083395252924136, "grad_norm": 0.2650662362575531, "learning_rate": 1.3696004221968643e-06, "loss": 0.224, "mean_token_accuracy": 0.9450354319065809, "num_tokens": 101564194.0, "step": 13600 }, { "entropy": 1.901456455886364, "epoch": 0.9090074220021873, "grad_norm": 0.30371785163879395, "learning_rate": 1.3513428101080117e-06, "loss": 0.202, "mean_token_accuracy": 0.9506184365600348, "num_tokens": 101642504.0, "step": 13610 }, { "entropy": 1.9014749571681022, "epoch": 0.9096753187119612, "grad_norm": 0.2971813678741455, "learning_rate": 1.333214051058747e-06, "loss": 0.2208, "mean_token_accuracy": 0.9452633641660213, "num_tokens": 101716721.0, "step": 13620 }, { "entropy": 1.9070034220814704, "epoch": 0.910343215421735, "grad_norm": 0.2824757993221283, "learning_rate": 1.3152142436177634e-06, "loss": 0.2303, "mean_token_accuracy": 0.9453223545104266, "num_tokens": 101788718.0, "step": 13630 }, { "entropy": 1.8911651529371738, "epoch": 0.9110111121315089, "grad_norm": 0.30897578597068787, "learning_rate": 1.2973434856526215e-06, "loss": 0.2075, "mean_token_accuracy": 0.9477046266198158, "num_tokens": 101860138.0, "step": 13640 }, { "entropy": 1.9213181003928184, "epoch": 0.9116790088412827, "grad_norm": 0.3536868095397949, "learning_rate": 1.279601874329233e-06, "loss": 0.2215, "mean_token_accuracy": 0.9447006203234196, "num_tokens": 101934680.0, "step": 13650 }, { "entropy": 1.9152114614844322, "epoch": 0.9123469055510566, "grad_norm": 0.35017839074134827, "learning_rate": 1.2619895061113113e-06, "loss": 0.214, "mean_token_accuracy": 0.9472366467118263, "num_tokens": 102010265.0, "step": 13660 }, { "entropy": 1.8986652418971062, "epoch": 0.9130148022608303, "grad_norm": 0.28530582785606384, "learning_rate": 1.2445064767598626e-06, "loss": 0.2168, "mean_token_accuracy": 0.9429144073277712, "num_tokens": 102084591.0, "step": 13670 }, { "entropy": 1.902928152680397, "epoch": 0.9136826989706042, "grad_norm": 0.2830169200897217, "learning_rate": 1.227152881332655e-06, "loss": 0.2022, "mean_token_accuracy": 0.9487363889813423, "num_tokens": 102159440.0, "step": 13680 }, { "entropy": 1.9146923258900643, "epoch": 0.914350595680378, "grad_norm": 0.3174077570438385, "learning_rate": 1.2099288141837036e-06, "loss": 0.2161, "mean_token_accuracy": 0.9469379331916571, "num_tokens": 102236383.0, "step": 13690 }, { "entropy": 1.886171568185091, "epoch": 0.9150184923901519, "grad_norm": 0.34835055470466614, "learning_rate": 1.1928343689627603e-06, "loss": 0.2272, "mean_token_accuracy": 0.9440027885138988, "num_tokens": 102311299.0, "step": 13700 }, { "entropy": 1.930020059645176, "epoch": 0.9156863890999257, "grad_norm": 0.33307892084121704, "learning_rate": 1.175869638614807e-06, "loss": 0.2214, "mean_token_accuracy": 0.9430679339915514, "num_tokens": 102386799.0, "step": 13710 }, { "entropy": 1.8897304765880107, "epoch": 0.9163542858096996, "grad_norm": 0.30179741978645325, "learning_rate": 1.1590347153795486e-06, "loss": 0.1948, "mean_token_accuracy": 0.9499950230121612, "num_tokens": 102461963.0, "step": 13720 }, { "entropy": 1.9021281115710735, "epoch": 0.9170221825194733, "grad_norm": 0.27086541056632996, "learning_rate": 1.1423296907909062e-06, "loss": 0.2387, "mean_token_accuracy": 0.9403638765215874, "num_tokens": 102536274.0, "step": 13730 }, { "entropy": 1.8921031907200814, "epoch": 0.9176900792292472, "grad_norm": 0.26246461272239685, "learning_rate": 1.125754655676519e-06, "loss": 0.2106, "mean_token_accuracy": 0.9463224306702613, "num_tokens": 102613924.0, "step": 13740 }, { "entropy": 1.9295793034136295, "epoch": 0.918357975939021, "grad_norm": 0.34940090775489807, "learning_rate": 1.1093097001572611e-06, "loss": 0.2419, "mean_token_accuracy": 0.9409036424010992, "num_tokens": 102687478.0, "step": 13750 }, { "entropy": 1.8949863009154797, "epoch": 0.9190258726487949, "grad_norm": 0.3371618986129761, "learning_rate": 1.0929949136467444e-06, "loss": 0.2333, "mean_token_accuracy": 0.9415029205381871, "num_tokens": 102760956.0, "step": 13760 }, { "entropy": 1.8929891839623452, "epoch": 0.9196937693585687, "grad_norm": 0.33426401019096375, "learning_rate": 1.0768103848508323e-06, "loss": 0.2093, "mean_token_accuracy": 0.949324493855238, "num_tokens": 102837543.0, "step": 13770 }, { "entropy": 1.909164971113205, "epoch": 0.9203616660683426, "grad_norm": 0.3457319438457489, "learning_rate": 1.0607562017671615e-06, "loss": 0.2293, "mean_token_accuracy": 0.9444771248847246, "num_tokens": 102908119.0, "step": 13780 }, { "entropy": 1.8979900188744068, "epoch": 0.9210295627781163, "grad_norm": 0.3295208513736725, "learning_rate": 1.0448324516846438e-06, "loss": 0.2206, "mean_token_accuracy": 0.9469987910240889, "num_tokens": 102986304.0, "step": 13790 }, { "entropy": 1.8948651857674121, "epoch": 0.9216974594878902, "grad_norm": 0.2926713824272156, "learning_rate": 1.0290392211830323e-06, "loss": 0.2135, "mean_token_accuracy": 0.9480871453881263, "num_tokens": 103061776.0, "step": 13800 }, { "entropy": 1.8892649672925472, "epoch": 0.922365356197664, "grad_norm": 0.2630287706851959, "learning_rate": 1.013376596132405e-06, "loss": 0.2105, "mean_token_accuracy": 0.9479119196534157, "num_tokens": 103135807.0, "step": 13810 }, { "entropy": 1.90837921500206, "epoch": 0.9230332529074379, "grad_norm": 0.34752416610717773, "learning_rate": 9.97844661692735e-07, "loss": 0.213, "mean_token_accuracy": 0.9481565687805414, "num_tokens": 103208733.0, "step": 13820 }, { "entropy": 1.8790317371487617, "epoch": 0.9237011496172117, "grad_norm": 0.33678585290908813, "learning_rate": 9.82443502313403e-07, "loss": 0.2152, "mean_token_accuracy": 0.9483610242605209, "num_tokens": 103283759.0, "step": 13830 }, { "entropy": 1.90202339887619, "epoch": 0.9243690463269856, "grad_norm": 0.3287935256958008, "learning_rate": 9.671732017327448e-07, "loss": 0.2268, "mean_token_accuracy": 0.9440580252557993, "num_tokens": 103357120.0, "step": 13840 }, { "entropy": 1.914595778286457, "epoch": 0.9250369430367593, "grad_norm": 0.39622658491134644, "learning_rate": 9.520338429776044e-07, "loss": 0.2248, "mean_token_accuracy": 0.9448769468814134, "num_tokens": 103429041.0, "step": 13850 }, { "entropy": 1.9054407931864261, "epoch": 0.9257048397465332, "grad_norm": 0.3200603127479553, "learning_rate": 9.37025508362873e-07, "loss": 0.2116, "mean_token_accuracy": 0.9475846383720636, "num_tokens": 103501936.0, "step": 13860 }, { "entropy": 1.9195763342082501, "epoch": 0.926372736456307, "grad_norm": 0.31297188997268677, "learning_rate": 9.221482794910454e-07, "loss": 0.2088, "mean_token_accuracy": 0.9481914173811674, "num_tokens": 103577288.0, "step": 13870 }, { "entropy": 1.9043946728110313, "epoch": 0.9270406331660809, "grad_norm": 0.26709577441215515, "learning_rate": 9.074022372517754e-07, "loss": 0.2106, "mean_token_accuracy": 0.9488805778324604, "num_tokens": 103651484.0, "step": 13880 }, { "entropy": 1.8853257417678833, "epoch": 0.9277085298758547, "grad_norm": 0.32161444425582886, "learning_rate": 8.927874618214313e-07, "loss": 0.2109, "mean_token_accuracy": 0.9493244666606188, "num_tokens": 103728072.0, "step": 13890 }, { "entropy": 1.8881514206528665, "epoch": 0.9283764265856286, "grad_norm": 0.28794118762016296, "learning_rate": 8.783040326626754e-07, "loss": 0.2131, "mean_token_accuracy": 0.9478063277900219, "num_tokens": 103802010.0, "step": 13900 }, { "entropy": 1.891056627780199, "epoch": 0.9290443232954023, "grad_norm": 0.24881400167942047, "learning_rate": 8.639520285240077e-07, "loss": 0.2127, "mean_token_accuracy": 0.946513257175684, "num_tokens": 103877530.0, "step": 13910 }, { "entropy": 1.9036525025963784, "epoch": 0.9297122200051762, "grad_norm": 0.3208293914794922, "learning_rate": 8.497315274393595e-07, "loss": 0.2039, "mean_token_accuracy": 0.948467843979597, "num_tokens": 103952735.0, "step": 13920 }, { "entropy": 1.8826133012771606, "epoch": 0.93038011671495, "grad_norm": 0.3096645772457123, "learning_rate": 8.356426067276634e-07, "loss": 0.2145, "mean_token_accuracy": 0.9482813503593206, "num_tokens": 104030107.0, "step": 13930 }, { "entropy": 1.9399089455604552, "epoch": 0.9310480134247239, "grad_norm": 0.35808226466178894, "learning_rate": 8.216853429924286e-07, "loss": 0.2277, "mean_token_accuracy": 0.9447576142847538, "num_tokens": 104103384.0, "step": 13940 }, { "entropy": 1.8939123027026654, "epoch": 0.9317159101344977, "grad_norm": 0.313656747341156, "learning_rate": 8.078598121213162e-07, "loss": 0.2244, "mean_token_accuracy": 0.9436252113431692, "num_tokens": 104178860.0, "step": 13950 }, { "entropy": 1.9000036634504796, "epoch": 0.9323838068442716, "grad_norm": 0.3107992112636566, "learning_rate": 7.941660892857477e-07, "loss": 0.2307, "mean_token_accuracy": 0.9432311546057462, "num_tokens": 104251339.0, "step": 13960 }, { "entropy": 1.882425457239151, "epoch": 0.9330517035540453, "grad_norm": 0.3070521354675293, "learning_rate": 7.806042489404854e-07, "loss": 0.209, "mean_token_accuracy": 0.9472176652401686, "num_tokens": 104326846.0, "step": 13970 }, { "entropy": 1.9240444339811802, "epoch": 0.9337196002638192, "grad_norm": 0.35235562920570374, "learning_rate": 7.671743648232226e-07, "loss": 0.2192, "mean_token_accuracy": 0.9461739677935839, "num_tokens": 104401009.0, "step": 13980 }, { "entropy": 1.9051270239055156, "epoch": 0.934387496973593, "grad_norm": 0.30857589840888977, "learning_rate": 7.538765099541853e-07, "loss": 0.2146, "mean_token_accuracy": 0.9468018088489771, "num_tokens": 104476807.0, "step": 13990 }, { "entropy": 1.9361830152571202, "epoch": 0.9350553936833669, "grad_norm": 0.4242134690284729, "learning_rate": 7.407107566357463e-07, "loss": 0.2191, "mean_token_accuracy": 0.9460461411625147, "num_tokens": 104554010.0, "step": 14000 }, { "epoch": 0.9350553936833669, "eval_entropy": 1.8998861152410507, "eval_loss": 0.2339961975812912, "eval_mean_token_accuracy": 0.9466467488050461, "eval_num_tokens": 104554010.0, "eval_runtime": 553.4051, "eval_samples_per_second": 36.14, "eval_steps_per_second": 9.035, "step": 14000 }, { "entropy": 1.9053326681256295, "epoch": 0.9357232903931407, "grad_norm": 0.2986902892589569, "learning_rate": 7.276771764520137e-07, "loss": 0.223, "mean_token_accuracy": 0.9454509973526001, "num_tokens": 104629176.0, "step": 14010 }, { "entropy": 1.8850824356079101, "epoch": 0.9363911871029146, "grad_norm": 0.3177836835384369, "learning_rate": 7.14775840268458e-07, "loss": 0.2233, "mean_token_accuracy": 0.9440376691520214, "num_tokens": 104707245.0, "step": 14020 }, { "entropy": 1.9137109152972698, "epoch": 0.9370590838126883, "grad_norm": 0.29121869802474976, "learning_rate": 7.02006818231518e-07, "loss": 0.1946, "mean_token_accuracy": 0.9512248717248439, "num_tokens": 104784253.0, "step": 14030 }, { "entropy": 1.8909002617001534, "epoch": 0.9377269805224622, "grad_norm": 0.26387354731559753, "learning_rate": 6.893701797682138e-07, "loss": 0.2179, "mean_token_accuracy": 0.9464529417455196, "num_tokens": 104860652.0, "step": 14040 }, { "entropy": 1.909472694247961, "epoch": 0.938394877232236, "grad_norm": 0.2949415445327759, "learning_rate": 6.768659935857912e-07, "loss": 0.2243, "mean_token_accuracy": 0.9460593670606613, "num_tokens": 104934840.0, "step": 14050 }, { "entropy": 1.8926683761179448, "epoch": 0.9390627739420099, "grad_norm": 0.2625250220298767, "learning_rate": 6.644943276713187e-07, "loss": 0.2164, "mean_token_accuracy": 0.9448520917445421, "num_tokens": 105009642.0, "step": 14060 }, { "entropy": 1.906169418990612, "epoch": 0.9397306706517837, "grad_norm": 0.3173508942127228, "learning_rate": 6.522552492913448e-07, "loss": 0.228, "mean_token_accuracy": 0.9431961376219988, "num_tokens": 105082751.0, "step": 14070 }, { "entropy": 1.8969881288707255, "epoch": 0.9403985673615576, "grad_norm": 0.3377363085746765, "learning_rate": 6.401488249915154e-07, "loss": 0.2143, "mean_token_accuracy": 0.9458045039325953, "num_tokens": 105156833.0, "step": 14080 }, { "entropy": 1.8988959573209285, "epoch": 0.9410664640713313, "grad_norm": 0.3353278934955597, "learning_rate": 6.281751205962112e-07, "loss": 0.2285, "mean_token_accuracy": 0.9452743317931891, "num_tokens": 105231605.0, "step": 14090 }, { "entropy": 1.9253309786319732, "epoch": 0.9417343607811052, "grad_norm": 0.30926719307899475, "learning_rate": 6.163342012082096e-07, "loss": 0.2242, "mean_token_accuracy": 0.9434264447540045, "num_tokens": 105303215.0, "step": 14100 }, { "entropy": 1.9120075926184654, "epoch": 0.942402257490879, "grad_norm": 0.35029345750808716, "learning_rate": 6.046261312083021e-07, "loss": 0.2216, "mean_token_accuracy": 0.9450719900429249, "num_tokens": 105379463.0, "step": 14110 }, { "entropy": 1.929402296990156, "epoch": 0.9430701542006529, "grad_norm": 0.27098631858825684, "learning_rate": 5.930509742549684e-07, "loss": 0.2234, "mean_token_accuracy": 0.9445500519126654, "num_tokens": 105454003.0, "step": 14120 }, { "entropy": 1.9110081180930139, "epoch": 0.9437380509104267, "grad_norm": 0.2694525420665741, "learning_rate": 5.81608793284015e-07, "loss": 0.2121, "mean_token_accuracy": 0.9466637037694454, "num_tokens": 105525907.0, "step": 14130 }, { "entropy": 1.9003278836607933, "epoch": 0.9444059476202006, "grad_norm": 0.30434873700141907, "learning_rate": 5.70299650508244e-07, "loss": 0.2227, "mean_token_accuracy": 0.9444978535175323, "num_tokens": 105602125.0, "step": 14140 }, { "entropy": 1.8926567010581494, "epoch": 0.9450738443299743, "grad_norm": 0.2583397626876831, "learning_rate": 5.591236074171032e-07, "loss": 0.2111, "mean_token_accuracy": 0.9485705241560936, "num_tokens": 105675849.0, "step": 14150 }, { "entropy": 1.8904980294406415, "epoch": 0.9457417410397482, "grad_norm": 0.3499576151371002, "learning_rate": 5.480807247763626e-07, "loss": 0.2315, "mean_token_accuracy": 0.9434334632009268, "num_tokens": 105749472.0, "step": 14160 }, { "entropy": 1.9075636386871337, "epoch": 0.946409637749522, "grad_norm": 0.31966209411621094, "learning_rate": 5.371710626277761e-07, "loss": 0.227, "mean_token_accuracy": 0.9443599779158831, "num_tokens": 105821787.0, "step": 14170 }, { "entropy": 1.9219057574868201, "epoch": 0.9470775344592959, "grad_norm": 0.631982684135437, "learning_rate": 5.263946802887687e-07, "loss": 0.228, "mean_token_accuracy": 0.9410583045333624, "num_tokens": 105898727.0, "step": 14180 }, { "entropy": 1.8956761822104453, "epoch": 0.9477454311690697, "grad_norm": 0.3022257089614868, "learning_rate": 5.157516363520846e-07, "loss": 0.2155, "mean_token_accuracy": 0.9445299483835697, "num_tokens": 105973432.0, "step": 14190 }, { "entropy": 1.9058410614728927, "epoch": 0.9484133278788436, "grad_norm": 0.29628491401672363, "learning_rate": 5.052419886855046e-07, "loss": 0.2136, "mean_token_accuracy": 0.9480999674648046, "num_tokens": 106048958.0, "step": 14200 }, { "entropy": 1.8964909233152867, "epoch": 0.9490812245886173, "grad_norm": 0.2666878402233124, "learning_rate": 4.948657944315083e-07, "loss": 0.2191, "mean_token_accuracy": 0.9467222951352596, "num_tokens": 106124757.0, "step": 14210 }, { "entropy": 1.8713796056807042, "epoch": 0.9497491212983912, "grad_norm": 0.3048289120197296, "learning_rate": 4.846231100069693e-07, "loss": 0.2316, "mean_token_accuracy": 0.9437967505306005, "num_tokens": 106202782.0, "step": 14220 }, { "entropy": 1.902660033106804, "epoch": 0.950417018008165, "grad_norm": 0.2985217869281769, "learning_rate": 4.7451399110285357e-07, "loss": 0.2268, "mean_token_accuracy": 0.9446544133126735, "num_tokens": 106275810.0, "step": 14230 }, { "entropy": 1.9055275343358518, "epoch": 0.9510849147179389, "grad_norm": 0.30049318075180054, "learning_rate": 4.645384926839029e-07, "loss": 0.2358, "mean_token_accuracy": 0.9416691426187753, "num_tokens": 106349309.0, "step": 14240 }, { "entropy": 1.918624348193407, "epoch": 0.9517528114277127, "grad_norm": 0.3278043270111084, "learning_rate": 4.546966689883507e-07, "loss": 0.2229, "mean_token_accuracy": 0.9437994439154863, "num_tokens": 106423947.0, "step": 14250 }, { "entropy": 1.9064877651631833, "epoch": 0.9524207081374866, "grad_norm": 0.3928927481174469, "learning_rate": 4.4498857352762723e-07, "loss": 0.216, "mean_token_accuracy": 0.9470358230173588, "num_tokens": 106498959.0, "step": 14260 }, { "entropy": 1.9171678505837917, "epoch": 0.9530886048472603, "grad_norm": 0.29642802476882935, "learning_rate": 4.3541425908605023e-07, "loss": 0.2236, "mean_token_accuracy": 0.9467587042599916, "num_tokens": 106571940.0, "step": 14270 }, { "entropy": 1.9286782294511795, "epoch": 0.9537565015570342, "grad_norm": 0.30293843150138855, "learning_rate": 4.259737777205614e-07, "loss": 0.2352, "mean_token_accuracy": 0.9423229865729809, "num_tokens": 106644657.0, "step": 14280 }, { "entropy": 1.8920840539038182, "epoch": 0.954424398266808, "grad_norm": 0.2970978021621704, "learning_rate": 4.1666718076042444e-07, "loss": 0.2023, "mean_token_accuracy": 0.950397364795208, "num_tokens": 106719816.0, "step": 14290 }, { "entropy": 1.9169700197875499, "epoch": 0.9550922949765819, "grad_norm": 0.32482442259788513, "learning_rate": 4.074945188069621e-07, "loss": 0.2229, "mean_token_accuracy": 0.943707600608468, "num_tokens": 106793048.0, "step": 14300 }, { "entropy": 1.9219482079148293, "epoch": 0.9557601916863557, "grad_norm": 0.2949027121067047, "learning_rate": 3.98455841733265e-07, "loss": 0.2221, "mean_token_accuracy": 0.9472261693328619, "num_tokens": 106866192.0, "step": 14310 }, { "entropy": 1.8989798329770564, "epoch": 0.9564280883961296, "grad_norm": 0.361895889043808, "learning_rate": 3.895511986839372e-07, "loss": 0.2213, "mean_token_accuracy": 0.9457820616662502, "num_tokens": 106940744.0, "step": 14320 }, { "entropy": 1.9364443197846413, "epoch": 0.9570959851059033, "grad_norm": 0.2804163992404938, "learning_rate": 3.807806380748162e-07, "loss": 0.2262, "mean_token_accuracy": 0.9443983431905508, "num_tokens": 107016144.0, "step": 14330 }, { "entropy": 1.9024449817836284, "epoch": 0.9577638818156772, "grad_norm": 0.3311755955219269, "learning_rate": 3.7214420759270687e-07, "loss": 0.2369, "mean_token_accuracy": 0.9418485555797815, "num_tokens": 107088045.0, "step": 14340 }, { "entropy": 1.8688890233635902, "epoch": 0.958431778525451, "grad_norm": 0.2731431722640991, "learning_rate": 3.63641954195138e-07, "loss": 0.2007, "mean_token_accuracy": 0.9524892080575228, "num_tokens": 107165448.0, "step": 14350 }, { "entropy": 1.91527017056942, "epoch": 0.9590996752352249, "grad_norm": 0.32071930170059204, "learning_rate": 3.5527392411010187e-07, "loss": 0.2024, "mean_token_accuracy": 0.9514481287449599, "num_tokens": 107243571.0, "step": 14360 }, { "entropy": 1.9192841432988643, "epoch": 0.9597675719449987, "grad_norm": 0.307857871055603, "learning_rate": 3.4704016283578527e-07, "loss": 0.2237, "mean_token_accuracy": 0.9444409117102623, "num_tokens": 107316773.0, "step": 14370 }, { "entropy": 1.8934790387749671, "epoch": 0.9604354686547726, "grad_norm": 0.30186915397644043, "learning_rate": 3.389407151403454e-07, "loss": 0.2104, "mean_token_accuracy": 0.9473525546491146, "num_tokens": 107391509.0, "step": 14380 }, { "entropy": 1.9183316327631474, "epoch": 0.9611033653645463, "grad_norm": 0.2908487915992737, "learning_rate": 3.3097562506165783e-07, "loss": 0.2122, "mean_token_accuracy": 0.9467424344271421, "num_tokens": 107466915.0, "step": 14390 }, { "entropy": 1.9257058031857013, "epoch": 0.9617712620743202, "grad_norm": 0.3677487373352051, "learning_rate": 3.2314493590706977e-07, "loss": 0.2384, "mean_token_accuracy": 0.9423711311072112, "num_tokens": 107539796.0, "step": 14400 }, { "entropy": 1.9166744612157345, "epoch": 0.962439158784094, "grad_norm": 0.2927500605583191, "learning_rate": 3.154486902531786e-07, "loss": 0.2183, "mean_token_accuracy": 0.9451176710426807, "num_tokens": 107616849.0, "step": 14410 }, { "entropy": 1.9063184700906277, "epoch": 0.9631070554938679, "grad_norm": 0.24640081822872162, "learning_rate": 3.078869299455853e-07, "loss": 0.2217, "mean_token_accuracy": 0.9478651534765958, "num_tokens": 107690799.0, "step": 14420 }, { "entropy": 1.9056262366473675, "epoch": 0.9637749522036417, "grad_norm": 0.313030481338501, "learning_rate": 3.00459696098684e-07, "loss": 0.2047, "mean_token_accuracy": 0.9487129893153906, "num_tokens": 107765207.0, "step": 14430 }, { "entropy": 1.9169410578906536, "epoch": 0.9644428489134156, "grad_norm": 0.32929080724716187, "learning_rate": 2.9316702909541794e-07, "loss": 0.2164, "mean_token_accuracy": 0.9461659785360098, "num_tokens": 107839380.0, "step": 14440 }, { "entropy": 1.8900426775217056, "epoch": 0.9651107456231893, "grad_norm": 0.24310599267482758, "learning_rate": 2.860089685870805e-07, "loss": 0.2194, "mean_token_accuracy": 0.945015249028802, "num_tokens": 107915972.0, "step": 14450 }, { "entropy": 1.9423066228628159, "epoch": 0.9657786423329632, "grad_norm": 0.32423171401023865, "learning_rate": 2.789855534930823e-07, "loss": 0.2207, "mean_token_accuracy": 0.9456261999905109, "num_tokens": 107989110.0, "step": 14460 }, { "entropy": 1.902545154839754, "epoch": 0.966446539042737, "grad_norm": 0.28054577112197876, "learning_rate": 2.720968220007514e-07, "loss": 0.2117, "mean_token_accuracy": 0.9457728024572134, "num_tokens": 108062731.0, "step": 14470 }, { "entropy": 1.899439264833927, "epoch": 0.9671144357525109, "grad_norm": 0.276172012090683, "learning_rate": 2.6534281156512614e-07, "loss": 0.2155, "mean_token_accuracy": 0.9465055733919143, "num_tokens": 108136353.0, "step": 14480 }, { "entropy": 1.8697900146245956, "epoch": 0.9677823324622847, "grad_norm": 0.2538411021232605, "learning_rate": 2.5872355890873333e-07, "loss": 0.22, "mean_token_accuracy": 0.9464835111051798, "num_tokens": 108212839.0, "step": 14490 }, { "entropy": 1.9229343213140964, "epoch": 0.9684502291720586, "grad_norm": 0.30318912863731384, "learning_rate": 2.52239100021419e-07, "loss": 0.2289, "mean_token_accuracy": 0.9440717861056328, "num_tokens": 108289585.0, "step": 14500 }, { "entropy": 1.8845447473227979, "epoch": 0.9691181258818323, "grad_norm": 0.25452524423599243, "learning_rate": 2.4588947016011874e-07, "loss": 0.1919, "mean_token_accuracy": 0.9521220989525319, "num_tokens": 108365302.0, "step": 14510 }, { "entropy": 1.92604451328516, "epoch": 0.9697860225916062, "grad_norm": 0.4214472770690918, "learning_rate": 2.3967470384869995e-07, "loss": 0.2447, "mean_token_accuracy": 0.9431238524615765, "num_tokens": 108437724.0, "step": 14520 }, { "entropy": 1.9152753211557865, "epoch": 0.97045391930138, "grad_norm": 0.35824206471443176, "learning_rate": 2.335948348777456e-07, "loss": 0.2196, "mean_token_accuracy": 0.9456470660865307, "num_tokens": 108511518.0, "step": 14530 }, { "entropy": 1.9206460803747176, "epoch": 0.9711218160111539, "grad_norm": 0.2893131971359253, "learning_rate": 2.2764989630438515e-07, "loss": 0.2185, "mean_token_accuracy": 0.9451597556471825, "num_tokens": 108587601.0, "step": 14540 }, { "entropy": 1.895983377099037, "epoch": 0.9717897127209277, "grad_norm": 0.32508042454719543, "learning_rate": 2.218399204521146e-07, "loss": 0.2178, "mean_token_accuracy": 0.9476647909730673, "num_tokens": 108660487.0, "step": 14550 }, { "entropy": 1.8673418171703815, "epoch": 0.9724576094307016, "grad_norm": 0.2992874085903168, "learning_rate": 2.1616493891061388e-07, "loss": 0.2047, "mean_token_accuracy": 0.9492248620837926, "num_tokens": 108737543.0, "step": 14560 }, { "entropy": 1.912288798391819, "epoch": 0.9731255061404753, "grad_norm": 0.30885881185531616, "learning_rate": 2.1062498253558577e-07, "loss": 0.2112, "mean_token_accuracy": 0.9461349155753851, "num_tokens": 108813388.0, "step": 14570 }, { "entropy": 1.92212390974164, "epoch": 0.9737934028502492, "grad_norm": 0.3620794713497162, "learning_rate": 2.0522008144857357e-07, "loss": 0.2407, "mean_token_accuracy": 0.9415260531008244, "num_tokens": 108885346.0, "step": 14580 }, { "entropy": 1.8799037128686904, "epoch": 0.974461299560023, "grad_norm": 0.41817936301231384, "learning_rate": 1.999502650368082e-07, "loss": 0.2079, "mean_token_accuracy": 0.9467885941267014, "num_tokens": 108961868.0, "step": 14590 }, { "entropy": 1.90477839037776, "epoch": 0.9751291962697969, "grad_norm": 0.2815674841403961, "learning_rate": 1.9481556195305088e-07, "loss": 0.2311, "mean_token_accuracy": 0.9456219393759966, "num_tokens": 109037259.0, "step": 14600 }, { "entropy": 1.8997058264911175, "epoch": 0.9757970929795707, "grad_norm": 0.24212032556533813, "learning_rate": 1.8981600011542368e-07, "loss": 0.2258, "mean_token_accuracy": 0.9447796110063791, "num_tokens": 109113235.0, "step": 14610 }, { "entropy": 1.903115016222, "epoch": 0.9764649896893446, "grad_norm": 0.2980491816997528, "learning_rate": 1.8495160670727132e-07, "loss": 0.2145, "mean_token_accuracy": 0.9470945868641139, "num_tokens": 109188055.0, "step": 14620 }, { "entropy": 1.9022199727594853, "epoch": 0.9771328863991183, "grad_norm": 0.3174128830432892, "learning_rate": 1.8022240817700867e-07, "loss": 0.2084, "mean_token_accuracy": 0.9467992827296257, "num_tokens": 109262767.0, "step": 14630 }, { "entropy": 1.8780999280512334, "epoch": 0.9778007831088922, "grad_norm": 0.2915668785572052, "learning_rate": 1.7562843023797403e-07, "loss": 0.2177, "mean_token_accuracy": 0.9480854034423828, "num_tokens": 109337773.0, "step": 14640 }, { "entropy": 1.9047947071492672, "epoch": 0.978468679818666, "grad_norm": 0.3345016837120056, "learning_rate": 1.7116969786829057e-07, "loss": 0.2154, "mean_token_accuracy": 0.9464879151433706, "num_tokens": 109413221.0, "step": 14650 }, { "entropy": 1.8854721903800964, "epoch": 0.9791365765284399, "grad_norm": 0.3091772794723511, "learning_rate": 1.6684623531073336e-07, "loss": 0.2181, "mean_token_accuracy": 0.9489821385592222, "num_tokens": 109487825.0, "step": 14660 }, { "entropy": 1.9225395686924458, "epoch": 0.9798044732382137, "grad_norm": 0.31313666701316833, "learning_rate": 1.626580660725965e-07, "loss": 0.2274, "mean_token_accuracy": 0.9445375587791205, "num_tokens": 109562805.0, "step": 14670 }, { "entropy": 1.9297599755227566, "epoch": 0.9804723699479876, "grad_norm": 0.29253339767456055, "learning_rate": 1.5860521292556837e-07, "loss": 0.2207, "mean_token_accuracy": 0.9450436372309923, "num_tokens": 109640239.0, "step": 14680 }, { "entropy": 1.9096783593297004, "epoch": 0.9811402666577613, "grad_norm": 0.33872610330581665, "learning_rate": 1.546876979055959e-07, "loss": 0.2149, "mean_token_accuracy": 0.9444828130304813, "num_tokens": 109715591.0, "step": 14690 }, { "entropy": 1.8925483390688895, "epoch": 0.9818081633675352, "grad_norm": 0.2907775938510895, "learning_rate": 1.509055423127739e-07, "loss": 0.2126, "mean_token_accuracy": 0.9496159307658673, "num_tokens": 109788423.0, "step": 14700 }, { "entropy": 1.8837422780692576, "epoch": 0.982476060077309, "grad_norm": 0.323563814163208, "learning_rate": 1.472587667112369e-07, "loss": 0.2109, "mean_token_accuracy": 0.9462040577083826, "num_tokens": 109863505.0, "step": 14710 }, { "entropy": 1.9297125674784184, "epoch": 0.9831439567870829, "grad_norm": 0.3640925884246826, "learning_rate": 1.437473909290317e-07, "loss": 0.2345, "mean_token_accuracy": 0.9424944326281548, "num_tokens": 109937996.0, "step": 14720 }, { "entropy": 1.8911085098981857, "epoch": 0.9838118534968567, "grad_norm": 0.27827513217926025, "learning_rate": 1.4037143405802059e-07, "loss": 0.199, "mean_token_accuracy": 0.9495569165796042, "num_tokens": 110013526.0, "step": 14730 }, { "entropy": 1.9321283496916295, "epoch": 0.9844797502066306, "grad_norm": 0.35959592461586, "learning_rate": 1.3713091445376483e-07, "loss": 0.2221, "mean_token_accuracy": 0.9471862558275461, "num_tokens": 110086477.0, "step": 14740 }, { "entropy": 1.8906516335904597, "epoch": 0.9851476469164043, "grad_norm": 0.3196421265602112, "learning_rate": 1.3402584973544442e-07, "loss": 0.2286, "mean_token_accuracy": 0.9432332340627909, "num_tokens": 110159790.0, "step": 14750 }, { "entropy": 1.9261316314339638, "epoch": 0.9858155436261782, "grad_norm": 0.3286134600639343, "learning_rate": 1.310562567857473e-07, "loss": 0.2232, "mean_token_accuracy": 0.9430730476975441, "num_tokens": 110234090.0, "step": 14760 }, { "entropy": 1.9303351260721684, "epoch": 0.986483440335952, "grad_norm": 0.2944607436656952, "learning_rate": 1.2822215175077788e-07, "loss": 0.2311, "mean_token_accuracy": 0.943125244602561, "num_tokens": 110307598.0, "step": 14770 }, { "entropy": 1.8846277087926864, "epoch": 0.9871513370457259, "grad_norm": 0.2993800938129425, "learning_rate": 1.2552355003998233e-07, "loss": 0.2171, "mean_token_accuracy": 0.9478538773953915, "num_tokens": 110383656.0, "step": 14780 }, { "entropy": 1.892453780770302, "epoch": 0.9878192337554997, "grad_norm": 0.2868650555610657, "learning_rate": 1.2296046632604316e-07, "loss": 0.2021, "mean_token_accuracy": 0.9499805081635714, "num_tokens": 110460658.0, "step": 14790 }, { "entropy": 1.8919722713530063, "epoch": 0.9884871304652736, "grad_norm": 0.29760387539863586, "learning_rate": 1.2053291454482413e-07, "loss": 0.2192, "mean_token_accuracy": 0.9454273480921984, "num_tokens": 110540082.0, "step": 14800 }, { "entropy": 1.869931484013796, "epoch": 0.9891550271750473, "grad_norm": 0.34532567858695984, "learning_rate": 1.1824090789527574e-07, "loss": 0.2063, "mean_token_accuracy": 0.9508180834352971, "num_tokens": 110616426.0, "step": 14810 }, { "entropy": 1.910967905819416, "epoch": 0.9898229238848212, "grad_norm": 0.30471616983413696, "learning_rate": 1.1608445883936888e-07, "loss": 0.2331, "mean_token_accuracy": 0.9438163720071315, "num_tokens": 110690791.0, "step": 14820 }, { "entropy": 1.9329442329704762, "epoch": 0.990490820594595, "grad_norm": 0.38030868768692017, "learning_rate": 1.1406357910202836e-07, "loss": 0.2279, "mean_token_accuracy": 0.9443112336099148, "num_tokens": 110763196.0, "step": 14830 }, { "entropy": 1.8962192341685296, "epoch": 0.9911587173043689, "grad_norm": 0.2726113200187683, "learning_rate": 1.1217827967107762e-07, "loss": 0.2244, "mean_token_accuracy": 0.9445026602596045, "num_tokens": 110837125.0, "step": 14840 }, { "entropy": 1.8790459103882313, "epoch": 0.9918266140141427, "grad_norm": 0.3209843337535858, "learning_rate": 1.1042857079715813e-07, "loss": 0.2182, "mean_token_accuracy": 0.9493644427508116, "num_tokens": 110912006.0, "step": 14850 }, { "entropy": 1.9133743420243263, "epoch": 0.9924945107239166, "grad_norm": 0.3805257976055145, "learning_rate": 1.0881446199369085e-07, "loss": 0.2132, "mean_token_accuracy": 0.948195218667388, "num_tokens": 110990216.0, "step": 14860 }, { "entropy": 1.9052971661090852, "epoch": 0.9931624074336903, "grad_norm": 0.3305679261684418, "learning_rate": 1.0733596203682072e-07, "loss": 0.2186, "mean_token_accuracy": 0.945969745516777, "num_tokens": 111063905.0, "step": 14870 }, { "entropy": 1.9224503308534622, "epoch": 0.9938303041434642, "grad_norm": 0.32435184717178345, "learning_rate": 1.0599307896536684e-07, "loss": 0.2376, "mean_token_accuracy": 0.9441445644944906, "num_tokens": 111136174.0, "step": 14880 }, { "entropy": 1.9025490529835225, "epoch": 0.994498200853238, "grad_norm": 0.26026588678359985, "learning_rate": 1.0478582008078089e-07, "loss": 0.2249, "mean_token_accuracy": 0.9466857232153416, "num_tokens": 111209499.0, "step": 14890 }, { "entropy": 1.9036887191236018, "epoch": 0.9951660975630119, "grad_norm": 0.29366225004196167, "learning_rate": 1.0371419194710279e-07, "loss": 0.22, "mean_token_accuracy": 0.9459269996732473, "num_tokens": 111284322.0, "step": 14900 }, { "entropy": 1.915351528674364, "epoch": 0.9958339942727857, "grad_norm": 0.24741236865520477, "learning_rate": 1.0277820039093034e-07, "loss": 0.2082, "mean_token_accuracy": 0.949078006669879, "num_tokens": 111361067.0, "step": 14910 }, { "entropy": 1.901783287525177, "epoch": 0.9965018909825596, "grad_norm": 0.3467392921447754, "learning_rate": 1.0197785050138585e-07, "loss": 0.2108, "mean_token_accuracy": 0.946212413161993, "num_tokens": 111435370.0, "step": 14920 }, { "entropy": 1.9154698580503464, "epoch": 0.9971697876923333, "grad_norm": 0.2944880723953247, "learning_rate": 1.0131314663008852e-07, "loss": 0.2073, "mean_token_accuracy": 0.9457383468747139, "num_tokens": 111509558.0, "step": 14930 }, { "entropy": 1.9072790823876857, "epoch": 0.9978376844021072, "grad_norm": 0.28679195046424866, "learning_rate": 1.0078409239112666e-07, "loss": 0.2134, "mean_token_accuracy": 0.9477059442549944, "num_tokens": 111584565.0, "step": 14940 }, { "entropy": 1.936252660304308, "epoch": 0.998505581111881, "grad_norm": 0.33688589930534363, "learning_rate": 1.0039069066104954e-07, "loss": 0.2143, "mean_token_accuracy": 0.9477420080453157, "num_tokens": 111657978.0, "step": 14950 }, { "entropy": 1.888141191750765, "epoch": 0.9991734778216549, "grad_norm": 0.28729745745658875, "learning_rate": 1.0013294357883669e-07, "loss": 0.2108, "mean_token_accuracy": 0.9503798212856054, "num_tokens": 111731287.0, "step": 14960 }, { "entropy": 1.8898568801581859, "epoch": 0.9998413745314287, "grad_norm": 0.34546494483947754, "learning_rate": 1.0001085254589811e-07, "loss": 0.2032, "mean_token_accuracy": 0.9500156525522471, "num_tokens": 111806500.0, "step": 14970 } ], "logging_steps": 10, "max_steps": 14973, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.117928302156605e+19, "train_batch_size": 4, "trial_name": null, "trial_params": null }