{ "best_global_step": 23000, "best_metric": 0.24171218276023865, "best_model_checkpoint": "/output/checkpoint-23000", "epoch": 0.3441410454593488, "eval_steps": 1000, "global_step": 23000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.995392406731844, "epoch": 0.00014962654150406469, "grad_norm": 1.6540336608886719, "learning_rate": 3.0000000000000004e-07, "loss": 0.6699, "mean_token_accuracy": 0.8633284188807011, "num_tokens": 74655.0, "step": 10 }, { "entropy": 1.9947461523115635, "epoch": 0.00029925308300812937, "grad_norm": 1.5377693176269531, "learning_rate": 6.333333333333333e-07, "loss": 0.6581, "mean_token_accuracy": 0.8691052194684744, "num_tokens": 148980.0, "step": 20 }, { "entropy": 2.00217300131917, "epoch": 0.0004488796245121941, "grad_norm": 1.5561202764511108, "learning_rate": 9.666666666666668e-07, "loss": 0.6535, "mean_token_accuracy": 0.8677759364247322, "num_tokens": 223581.0, "step": 30 }, { "entropy": 1.993088324368, "epoch": 0.0005985061660162587, "grad_norm": 1.4348832368850708, "learning_rate": 1.3e-06, "loss": 0.6282, "mean_token_accuracy": 0.8703481316566467, "num_tokens": 301292.0, "step": 40 }, { "entropy": 1.9850200325250626, "epoch": 0.0007481327075203235, "grad_norm": 1.510475754737854, "learning_rate": 1.6333333333333333e-06, "loss": 0.6362, "mean_token_accuracy": 0.8701431334018708, "num_tokens": 373829.0, "step": 50 }, { "entropy": 2.0068949691951277, "epoch": 0.0008977592490243882, "grad_norm": 1.2555310726165771, "learning_rate": 1.9666666666666668e-06, "loss": 0.5659, "mean_token_accuracy": 0.8808745600283145, "num_tokens": 446456.0, "step": 60 }, { "entropy": 1.9884536407887936, "epoch": 0.0010473857905284529, "grad_norm": 0.8961914777755737, "learning_rate": 2.3e-06, "loss": 0.54, "mean_token_accuracy": 0.8860756240785121, "num_tokens": 519100.0, "step": 70 }, { "entropy": 1.9966150291264058, "epoch": 0.0011970123320325175, "grad_norm": 0.5592026710510254, "learning_rate": 2.6333333333333337e-06, "loss": 0.4937, "mean_token_accuracy": 0.9029676467180252, "num_tokens": 593933.0, "step": 80 }, { "entropy": 1.971697284281254, "epoch": 0.0013466388735365823, "grad_norm": 0.7416914105415344, "learning_rate": 2.966666666666667e-06, "loss": 0.475, "mean_token_accuracy": 0.9083496272563935, "num_tokens": 668090.0, "step": 90 }, { "entropy": 2.020202798396349, "epoch": 0.001496265415040647, "grad_norm": 0.5684888958930969, "learning_rate": 3.3e-06, "loss": 0.4836, "mean_token_accuracy": 0.9050738759338856, "num_tokens": 742570.0, "step": 100 }, { "entropy": 2.0086157262325286, "epoch": 0.0016458919565447117, "grad_norm": 0.6281460523605347, "learning_rate": 3.633333333333334e-06, "loss": 0.4372, "mean_token_accuracy": 0.911510188318789, "num_tokens": 817427.0, "step": 110 }, { "entropy": 2.0083575293421747, "epoch": 0.0017955184980487763, "grad_norm": 0.4346252679824829, "learning_rate": 3.966666666666667e-06, "loss": 0.4197, "mean_token_accuracy": 0.9160505689680576, "num_tokens": 894027.0, "step": 120 }, { "entropy": 2.027063339948654, "epoch": 0.0019451450395528412, "grad_norm": 0.4729572832584381, "learning_rate": 4.2999999999999995e-06, "loss": 0.4114, "mean_token_accuracy": 0.9123359378427267, "num_tokens": 968082.0, "step": 130 }, { "entropy": 2.0357840031385424, "epoch": 0.0020947715810569058, "grad_norm": 0.4820358157157898, "learning_rate": 4.633333333333334e-06, "loss": 0.3861, "mean_token_accuracy": 0.9201525665819645, "num_tokens": 1041111.0, "step": 140 }, { "entropy": 2.0041785940527914, "epoch": 0.0022443981225609704, "grad_norm": 0.4512932002544403, "learning_rate": 4.966666666666667e-06, "loss": 0.3719, "mean_token_accuracy": 0.9196753237396479, "num_tokens": 1114683.0, "step": 150 }, { "entropy": 1.986509595066309, "epoch": 0.002394024664065035, "grad_norm": 0.49413782358169556, "learning_rate": 5.3e-06, "loss": 0.3633, "mean_token_accuracy": 0.9218655321747065, "num_tokens": 1189363.0, "step": 160 }, { "entropy": 2.008907197415829, "epoch": 0.0025436512055691, "grad_norm": 0.48253825306892395, "learning_rate": 5.633333333333333e-06, "loss": 0.3615, "mean_token_accuracy": 0.9201793625950814, "num_tokens": 1262509.0, "step": 170 }, { "entropy": 2.0038809821009638, "epoch": 0.0026932777470731646, "grad_norm": 0.5222899317741394, "learning_rate": 5.9666666666666666e-06, "loss": 0.3907, "mean_token_accuracy": 0.9163873542100192, "num_tokens": 1335852.0, "step": 180 }, { "entropy": 1.9737722158432007, "epoch": 0.0028429042885772292, "grad_norm": 0.6734032034873962, "learning_rate": 6.300000000000001e-06, "loss": 0.3836, "mean_token_accuracy": 0.9171450879424811, "num_tokens": 1410353.0, "step": 190 }, { "entropy": 1.9792789742350578, "epoch": 0.002992530830081294, "grad_norm": 0.4623475670814514, "learning_rate": 6.633333333333333e-06, "loss": 0.3541, "mean_token_accuracy": 0.9202779714018107, "num_tokens": 1484450.0, "step": 200 }, { "entropy": 1.9741366975009442, "epoch": 0.003142157371585359, "grad_norm": 0.5829670429229736, "learning_rate": 6.966666666666667e-06, "loss": 0.3482, "mean_token_accuracy": 0.9214173048734665, "num_tokens": 1558025.0, "step": 210 }, { "entropy": 1.9535197712481023, "epoch": 0.0032917839130894235, "grad_norm": 0.46482422947883606, "learning_rate": 7.2999999999999996e-06, "loss": 0.3219, "mean_token_accuracy": 0.9295845787972212, "num_tokens": 1635960.0, "step": 220 }, { "entropy": 1.985553939640522, "epoch": 0.003441410454593488, "grad_norm": 0.5042750239372253, "learning_rate": 7.633333333333334e-06, "loss": 0.3468, "mean_token_accuracy": 0.9231617078185081, "num_tokens": 1712553.0, "step": 230 }, { "entropy": 1.99157450273633, "epoch": 0.0035910369960975527, "grad_norm": 0.5442078113555908, "learning_rate": 7.966666666666666e-06, "loss": 0.3359, "mean_token_accuracy": 0.9257699001580477, "num_tokens": 1788108.0, "step": 240 }, { "entropy": 2.0001078858971595, "epoch": 0.0037406635376016173, "grad_norm": 0.5726729035377502, "learning_rate": 8.3e-06, "loss": 0.3264, "mean_token_accuracy": 0.9232569672167301, "num_tokens": 1861212.0, "step": 250 }, { "entropy": 1.9762448623776436, "epoch": 0.0038902900791056823, "grad_norm": 0.48842018842697144, "learning_rate": 8.633333333333334e-06, "loss": 0.3302, "mean_token_accuracy": 0.9280190449208021, "num_tokens": 1935627.0, "step": 260 }, { "entropy": 1.9863562628626823, "epoch": 0.004039916620609747, "grad_norm": 0.5623534321784973, "learning_rate": 8.966666666666668e-06, "loss": 0.3313, "mean_token_accuracy": 0.9267206363379955, "num_tokens": 2012173.0, "step": 270 }, { "entropy": 2.030895411223173, "epoch": 0.0041895431621138115, "grad_norm": 0.7707616090774536, "learning_rate": 9.3e-06, "loss": 0.3494, "mean_token_accuracy": 0.9233444124460221, "num_tokens": 2085239.0, "step": 280 }, { "entropy": 2.0427174262702463, "epoch": 0.004339169703617876, "grad_norm": 0.47786983847618103, "learning_rate": 9.633333333333335e-06, "loss": 0.3293, "mean_token_accuracy": 0.9239508364349603, "num_tokens": 2158990.0, "step": 290 }, { "entropy": 2.0073467031121255, "epoch": 0.004488796245121941, "grad_norm": 0.49501946568489075, "learning_rate": 9.966666666666667e-06, "loss": 0.2997, "mean_token_accuracy": 0.932453353330493, "num_tokens": 2234311.0, "step": 300 }, { "entropy": 2.011546725779772, "epoch": 0.004638422786626005, "grad_norm": 0.5904964804649353, "learning_rate": 1.03e-05, "loss": 0.3373, "mean_token_accuracy": 0.9201153438538313, "num_tokens": 2305473.0, "step": 310 }, { "entropy": 1.9916895642876624, "epoch": 0.00478804932813007, "grad_norm": 0.5510156750679016, "learning_rate": 1.0633333333333334e-05, "loss": 0.3407, "mean_token_accuracy": 0.9223257884383201, "num_tokens": 2379145.0, "step": 320 }, { "entropy": 1.9839037261903285, "epoch": 0.004937675869634135, "grad_norm": 0.6314477920532227, "learning_rate": 1.0966666666666666e-05, "loss": 0.3069, "mean_token_accuracy": 0.9325135432183742, "num_tokens": 2452002.0, "step": 330 }, { "entropy": 1.9725721523165702, "epoch": 0.0050873024111382, "grad_norm": 0.6581112146377563, "learning_rate": 1.13e-05, "loss": 0.303, "mean_token_accuracy": 0.92990313321352, "num_tokens": 2526388.0, "step": 340 }, { "entropy": 1.9570358380675317, "epoch": 0.005236928952642265, "grad_norm": 0.6892510652542114, "learning_rate": 1.1633333333333334e-05, "loss": 0.2994, "mean_token_accuracy": 0.930433790013194, "num_tokens": 2601496.0, "step": 350 }, { "entropy": 1.9567357785999775, "epoch": 0.005386555494146329, "grad_norm": 0.5583544373512268, "learning_rate": 1.1966666666666668e-05, "loss": 0.3068, "mean_token_accuracy": 0.9284893423318863, "num_tokens": 2673864.0, "step": 360 }, { "entropy": 1.940490322560072, "epoch": 0.005536182035650394, "grad_norm": 0.7679713368415833, "learning_rate": 1.23e-05, "loss": 0.3228, "mean_token_accuracy": 0.9260424096137285, "num_tokens": 2746968.0, "step": 370 }, { "entropy": 1.9144606456160544, "epoch": 0.0056858085771544584, "grad_norm": 0.605851948261261, "learning_rate": 1.2633333333333333e-05, "loss": 0.3176, "mean_token_accuracy": 0.9315214604139328, "num_tokens": 2823002.0, "step": 380 }, { "entropy": 1.9592526257038116, "epoch": 0.005835435118658523, "grad_norm": 0.8147691488265991, "learning_rate": 1.2966666666666669e-05, "loss": 0.3048, "mean_token_accuracy": 0.9300720985978842, "num_tokens": 2899342.0, "step": 390 }, { "entropy": 1.9630496338009835, "epoch": 0.005985061660162588, "grad_norm": 0.6642063856124878, "learning_rate": 1.3300000000000001e-05, "loss": 0.306, "mean_token_accuracy": 0.9282677911221981, "num_tokens": 2975334.0, "step": 400 }, { "entropy": 1.9693477630615235, "epoch": 0.006134688201666652, "grad_norm": 0.6033242344856262, "learning_rate": 1.3633333333333334e-05, "loss": 0.3024, "mean_token_accuracy": 0.930531233176589, "num_tokens": 3049045.0, "step": 410 }, { "entropy": 1.9517102107405662, "epoch": 0.006284314743170718, "grad_norm": 0.6966942548751831, "learning_rate": 1.3966666666666666e-05, "loss": 0.3072, "mean_token_accuracy": 0.9308092508465051, "num_tokens": 3121895.0, "step": 420 }, { "entropy": 1.9387120671570301, "epoch": 0.006433941284674782, "grad_norm": 0.5533284544944763, "learning_rate": 1.43e-05, "loss": 0.3175, "mean_token_accuracy": 0.9267605431377888, "num_tokens": 3197559.0, "step": 430 }, { "entropy": 2.006394574791193, "epoch": 0.006583567826178847, "grad_norm": 0.5841144919395447, "learning_rate": 1.4633333333333334e-05, "loss": 0.3451, "mean_token_accuracy": 0.9212180498987437, "num_tokens": 3267770.0, "step": 440 }, { "entropy": 1.9221089392900468, "epoch": 0.0067331943676829115, "grad_norm": 0.6260424256324768, "learning_rate": 1.4966666666666668e-05, "loss": 0.2986, "mean_token_accuracy": 0.9328217662870883, "num_tokens": 3342336.0, "step": 450 }, { "entropy": 1.9266556471586227, "epoch": 0.006882820909186976, "grad_norm": 0.6570745706558228, "learning_rate": 1.53e-05, "loss": 0.3153, "mean_token_accuracy": 0.9267579711973667, "num_tokens": 3414173.0, "step": 460 }, { "entropy": 1.9416103184223175, "epoch": 0.007032447450691041, "grad_norm": 0.6072602868080139, "learning_rate": 1.563333333333333e-05, "loss": 0.305, "mean_token_accuracy": 0.9291992306709289, "num_tokens": 3486177.0, "step": 470 }, { "entropy": 1.916047702729702, "epoch": 0.007182073992195105, "grad_norm": 0.645366370677948, "learning_rate": 1.5966666666666667e-05, "loss": 0.2985, "mean_token_accuracy": 0.9295349083840847, "num_tokens": 3559387.0, "step": 480 }, { "entropy": 1.9014546275138855, "epoch": 0.00733170053369917, "grad_norm": 0.7040843367576599, "learning_rate": 1.63e-05, "loss": 0.2982, "mean_token_accuracy": 0.9314001020044088, "num_tokens": 3630666.0, "step": 490 }, { "entropy": 1.9023175269365311, "epoch": 0.0074813270752032346, "grad_norm": 0.8277549147605896, "learning_rate": 1.6633333333333336e-05, "loss": 0.2889, "mean_token_accuracy": 0.9310158092528582, "num_tokens": 3707339.0, "step": 500 }, { "entropy": 1.8840498104691505, "epoch": 0.0076309536167073, "grad_norm": 0.659382700920105, "learning_rate": 1.6966666666666668e-05, "loss": 0.2708, "mean_token_accuracy": 0.9373713478446006, "num_tokens": 3782141.0, "step": 510 }, { "entropy": 1.8895556643605231, "epoch": 0.007780580158211365, "grad_norm": 0.5819388031959534, "learning_rate": 1.73e-05, "loss": 0.2964, "mean_token_accuracy": 0.9296660047024489, "num_tokens": 3858279.0, "step": 520 }, { "entropy": 1.9089583836495876, "epoch": 0.007930206699715428, "grad_norm": 0.6067777276039124, "learning_rate": 1.7633333333333336e-05, "loss": 0.31, "mean_token_accuracy": 0.9262268859893084, "num_tokens": 3931542.0, "step": 530 }, { "entropy": 1.9079712502658368, "epoch": 0.008079833241219494, "grad_norm": 0.8357219099998474, "learning_rate": 1.796666666666667e-05, "loss": 0.3032, "mean_token_accuracy": 0.9321066863834858, "num_tokens": 4006252.0, "step": 540 }, { "entropy": 1.8887382842600346, "epoch": 0.008229459782723558, "grad_norm": 0.7288631796836853, "learning_rate": 1.83e-05, "loss": 0.2983, "mean_token_accuracy": 0.9299008283764124, "num_tokens": 4084345.0, "step": 550 }, { "entropy": 1.914674286544323, "epoch": 0.008379086324227623, "grad_norm": 0.7599960565567017, "learning_rate": 1.8633333333333333e-05, "loss": 0.2988, "mean_token_accuracy": 0.9312361136078835, "num_tokens": 4159901.0, "step": 560 }, { "entropy": 1.9340942613780499, "epoch": 0.008528712865731689, "grad_norm": 0.6785186529159546, "learning_rate": 1.896666666666667e-05, "loss": 0.3168, "mean_token_accuracy": 0.9255207315087318, "num_tokens": 4234890.0, "step": 570 }, { "entropy": 1.9239650063216687, "epoch": 0.008678339407235752, "grad_norm": 0.6722201108932495, "learning_rate": 1.93e-05, "loss": 0.2878, "mean_token_accuracy": 0.9320832658559084, "num_tokens": 4309875.0, "step": 580 }, { "entropy": 1.9070725180208683, "epoch": 0.008827965948739818, "grad_norm": 0.7774500846862793, "learning_rate": 1.9633333333333334e-05, "loss": 0.3097, "mean_token_accuracy": 0.9279659233987332, "num_tokens": 4385491.0, "step": 590 }, { "entropy": 1.9078837275505065, "epoch": 0.008977592490243881, "grad_norm": 0.6776214838027954, "learning_rate": 1.9966666666666666e-05, "loss": 0.2732, "mean_token_accuracy": 0.9350131578743458, "num_tokens": 4460481.0, "step": 600 }, { "entropy": 1.9244660943746568, "epoch": 0.009127219031747947, "grad_norm": 0.6977888941764832, "learning_rate": 2.0300000000000002e-05, "loss": 0.298, "mean_token_accuracy": 0.9321236774325371, "num_tokens": 4533639.0, "step": 610 }, { "entropy": 1.9258983984589577, "epoch": 0.00927684557325201, "grad_norm": 0.7099884152412415, "learning_rate": 2.0633333333333335e-05, "loss": 0.2899, "mean_token_accuracy": 0.9332225061953068, "num_tokens": 4606907.0, "step": 620 }, { "entropy": 1.9157255716621875, "epoch": 0.009426472114756076, "grad_norm": 0.7240561246871948, "learning_rate": 2.0966666666666667e-05, "loss": 0.296, "mean_token_accuracy": 0.9303838603198529, "num_tokens": 4681670.0, "step": 630 }, { "entropy": 1.9390470430254936, "epoch": 0.00957609865626014, "grad_norm": 0.69577556848526, "learning_rate": 2.13e-05, "loss": 0.314, "mean_token_accuracy": 0.9272349439561367, "num_tokens": 4754738.0, "step": 640 }, { "entropy": 1.9329915449023247, "epoch": 0.009725725197764205, "grad_norm": 0.7179453372955322, "learning_rate": 2.1633333333333332e-05, "loss": 0.3054, "mean_token_accuracy": 0.9324368629604578, "num_tokens": 4826393.0, "step": 650 }, { "entropy": 1.9232095345854758, "epoch": 0.00987535173926827, "grad_norm": 0.6640360355377197, "learning_rate": 2.1966666666666668e-05, "loss": 0.2988, "mean_token_accuracy": 0.9285763081163168, "num_tokens": 4902751.0, "step": 660 }, { "entropy": 1.9348515033721925, "epoch": 0.010024978280772335, "grad_norm": 0.6657624244689941, "learning_rate": 2.23e-05, "loss": 0.2645, "mean_token_accuracy": 0.9398685716092586, "num_tokens": 4978287.0, "step": 670 }, { "entropy": 1.8591935105621815, "epoch": 0.0101746048222764, "grad_norm": 0.5845288038253784, "learning_rate": 2.2633333333333336e-05, "loss": 0.2815, "mean_token_accuracy": 0.9355435144156218, "num_tokens": 5052167.0, "step": 680 }, { "entropy": 1.8645537972450257, "epoch": 0.010324231363780464, "grad_norm": 0.5923750996589661, "learning_rate": 2.2966666666666668e-05, "loss": 0.2795, "mean_token_accuracy": 0.9351237382739782, "num_tokens": 5126224.0, "step": 690 }, { "entropy": 1.8773439265787601, "epoch": 0.01047385790528453, "grad_norm": 0.5365191698074341, "learning_rate": 2.3300000000000004e-05, "loss": 0.2791, "mean_token_accuracy": 0.9342083893716335, "num_tokens": 5199985.0, "step": 700 }, { "entropy": 1.8817263856530189, "epoch": 0.010623484446788593, "grad_norm": 0.8465101718902588, "learning_rate": 2.3633333333333336e-05, "loss": 0.2777, "mean_token_accuracy": 0.9357718873769045, "num_tokens": 5275876.0, "step": 710 }, { "entropy": 1.893296255916357, "epoch": 0.010773110988292658, "grad_norm": 0.685375988483429, "learning_rate": 2.396666666666667e-05, "loss": 0.2977, "mean_token_accuracy": 0.9300573889166117, "num_tokens": 5347997.0, "step": 720 }, { "entropy": 1.92828084602952, "epoch": 0.010922737529796722, "grad_norm": 0.7465219497680664, "learning_rate": 2.43e-05, "loss": 0.2966, "mean_token_accuracy": 0.9275187090039253, "num_tokens": 5418434.0, "step": 730 }, { "entropy": 1.8966885544359684, "epoch": 0.011072364071300788, "grad_norm": 0.5790083408355713, "learning_rate": 2.4633333333333334e-05, "loss": 0.2839, "mean_token_accuracy": 0.9362265005707741, "num_tokens": 5491242.0, "step": 740 }, { "entropy": 1.8974473163485528, "epoch": 0.011221990612804853, "grad_norm": 0.7603051662445068, "learning_rate": 2.496666666666667e-05, "loss": 0.2976, "mean_token_accuracy": 0.9297301787883043, "num_tokens": 5563078.0, "step": 750 }, { "entropy": 1.8984058760106564, "epoch": 0.011371617154308917, "grad_norm": 0.8949026465415955, "learning_rate": 2.5300000000000002e-05, "loss": 0.2788, "mean_token_accuracy": 0.9326956555247307, "num_tokens": 5638433.0, "step": 760 }, { "entropy": 1.9002277642488479, "epoch": 0.011521243695812982, "grad_norm": 0.5953108668327332, "learning_rate": 2.5633333333333338e-05, "loss": 0.2738, "mean_token_accuracy": 0.9366820387542247, "num_tokens": 5714766.0, "step": 770 }, { "entropy": 1.858785030245781, "epoch": 0.011670870237317046, "grad_norm": 0.5735443234443665, "learning_rate": 2.5966666666666667e-05, "loss": 0.2745, "mean_token_accuracy": 0.9378697078675031, "num_tokens": 5786645.0, "step": 780 }, { "entropy": 1.8972781613469123, "epoch": 0.011820496778821112, "grad_norm": 0.6718502044677734, "learning_rate": 2.6300000000000002e-05, "loss": 0.2905, "mean_token_accuracy": 0.9321922946721315, "num_tokens": 5860060.0, "step": 790 }, { "entropy": 1.8990380063652992, "epoch": 0.011970123320325175, "grad_norm": 0.6002764105796814, "learning_rate": 2.663333333333333e-05, "loss": 0.2633, "mean_token_accuracy": 0.9380236633121968, "num_tokens": 5931732.0, "step": 800 }, { "entropy": 1.8749303452670574, "epoch": 0.01211974986182924, "grad_norm": 0.6109471917152405, "learning_rate": 2.6966666666666667e-05, "loss": 0.2715, "mean_token_accuracy": 0.9344659682363272, "num_tokens": 6004329.0, "step": 810 }, { "entropy": 1.8789727620780468, "epoch": 0.012269376403333304, "grad_norm": 0.5260920524597168, "learning_rate": 2.7300000000000003e-05, "loss": 0.2706, "mean_token_accuracy": 0.9346622083336115, "num_tokens": 6078354.0, "step": 820 }, { "entropy": 1.9194171257317065, "epoch": 0.01241900294483737, "grad_norm": 0.7049269080162048, "learning_rate": 2.7633333333333332e-05, "loss": 0.2844, "mean_token_accuracy": 0.9350420698523522, "num_tokens": 6152028.0, "step": 830 }, { "entropy": 1.943284920603037, "epoch": 0.012568629486341435, "grad_norm": 0.6106187701225281, "learning_rate": 2.7966666666666668e-05, "loss": 0.25, "mean_token_accuracy": 0.9411705233156681, "num_tokens": 6224768.0, "step": 840 }, { "entropy": 1.8886298567056656, "epoch": 0.0127182560278455, "grad_norm": 0.567125678062439, "learning_rate": 2.83e-05, "loss": 0.2764, "mean_token_accuracy": 0.9334474727511406, "num_tokens": 6299538.0, "step": 850 }, { "entropy": 1.9227832846343518, "epoch": 0.012867882569349565, "grad_norm": 0.5880188941955566, "learning_rate": 2.8633333333333336e-05, "loss": 0.2801, "mean_token_accuracy": 0.9350915282964707, "num_tokens": 6374973.0, "step": 860 }, { "entropy": 1.9170513726770877, "epoch": 0.013017509110853628, "grad_norm": 0.6411625146865845, "learning_rate": 2.8966666666666668e-05, "loss": 0.2692, "mean_token_accuracy": 0.9337792567908764, "num_tokens": 6449041.0, "step": 870 }, { "entropy": 1.921680285036564, "epoch": 0.013167135652357694, "grad_norm": 0.6360586881637573, "learning_rate": 2.93e-05, "loss": 0.2948, "mean_token_accuracy": 0.9307741347700358, "num_tokens": 6523677.0, "step": 880 }, { "entropy": 1.8694362312555313, "epoch": 0.013316762193861758, "grad_norm": 0.6214519143104553, "learning_rate": 2.9633333333333336e-05, "loss": 0.272, "mean_token_accuracy": 0.9335201870650053, "num_tokens": 6599020.0, "step": 890 }, { "entropy": 1.8842721477150917, "epoch": 0.013466388735365823, "grad_norm": 0.4771357774734497, "learning_rate": 2.9966666666666672e-05, "loss": 0.2693, "mean_token_accuracy": 0.9341329276561737, "num_tokens": 6672193.0, "step": 900 }, { "entropy": 1.8837077029049396, "epoch": 0.013616015276869887, "grad_norm": 0.5215792655944824, "learning_rate": 3.03e-05, "loss": 0.2697, "mean_token_accuracy": 0.940300104022026, "num_tokens": 6747137.0, "step": 910 }, { "entropy": 1.899841669946909, "epoch": 0.013765641818373952, "grad_norm": 0.5038917064666748, "learning_rate": 3.063333333333334e-05, "loss": 0.2836, "mean_token_accuracy": 0.9341947309672832, "num_tokens": 6822933.0, "step": 920 }, { "entropy": 1.8710016667842866, "epoch": 0.013915268359878018, "grad_norm": 0.5185027718544006, "learning_rate": 3.096666666666666e-05, "loss": 0.2467, "mean_token_accuracy": 0.9394612934440374, "num_tokens": 6901078.0, "step": 930 }, { "entropy": 1.8596931979060174, "epoch": 0.014064894901382081, "grad_norm": 0.4969352185726166, "learning_rate": 3.13e-05, "loss": 0.2719, "mean_token_accuracy": 0.9343028452247382, "num_tokens": 6974748.0, "step": 940 }, { "entropy": 1.849874021857977, "epoch": 0.014214521442886147, "grad_norm": 0.47033780813217163, "learning_rate": 3.1633333333333334e-05, "loss": 0.2591, "mean_token_accuracy": 0.9395352073013783, "num_tokens": 7048842.0, "step": 950 }, { "entropy": 1.8826984852552413, "epoch": 0.01436414798439021, "grad_norm": 0.5043299198150635, "learning_rate": 3.196666666666667e-05, "loss": 0.3006, "mean_token_accuracy": 0.9302482720464468, "num_tokens": 7121486.0, "step": 960 }, { "entropy": 1.890236098319292, "epoch": 0.014513774525894276, "grad_norm": 0.4198809266090393, "learning_rate": 3.2300000000000006e-05, "loss": 0.2623, "mean_token_accuracy": 0.9404679380357266, "num_tokens": 7197273.0, "step": 970 }, { "entropy": 1.894095178693533, "epoch": 0.01466340106739834, "grad_norm": 0.5990613698959351, "learning_rate": 3.263333333333333e-05, "loss": 0.2917, "mean_token_accuracy": 0.9296809330582618, "num_tokens": 7273490.0, "step": 980 }, { "entropy": 1.9271334432065488, "epoch": 0.014813027608902405, "grad_norm": 0.5427032709121704, "learning_rate": 3.296666666666667e-05, "loss": 0.2784, "mean_token_accuracy": 0.9338910602033138, "num_tokens": 7348486.0, "step": 990 }, { "entropy": 1.9327290922403335, "epoch": 0.014962654150406469, "grad_norm": 0.5623543858528137, "learning_rate": 3.33e-05, "loss": 0.2783, "mean_token_accuracy": 0.9333202257752419, "num_tokens": 7425317.0, "step": 1000 }, { "epoch": 0.014962654150406469, "eval_entropy": 1.8753016370296478, "eval_loss": 0.3028193414211273, "eval_mean_token_accuracy": 0.9350398851037025, "eval_num_tokens": 7425317.0, "eval_runtime": 550.7977, "eval_samples_per_second": 36.311, "eval_steps_per_second": 9.078, "step": 1000 }, { "entropy": 1.8598886378109456, "epoch": 0.015112280691910535, "grad_norm": 0.5623306035995483, "learning_rate": 3.3633333333333335e-05, "loss": 0.2698, "mean_token_accuracy": 0.9328101098537445, "num_tokens": 7497257.0, "step": 1010 }, { "entropy": 1.9073072776198388, "epoch": 0.0152619072334146, "grad_norm": 0.5176863074302673, "learning_rate": 3.396666666666667e-05, "loss": 0.2647, "mean_token_accuracy": 0.9367997858673334, "num_tokens": 7570454.0, "step": 1020 }, { "entropy": 1.8935526065528392, "epoch": 0.015411533774918664, "grad_norm": 0.5857236385345459, "learning_rate": 3.430000000000001e-05, "loss": 0.2593, "mean_token_accuracy": 0.9381060626357793, "num_tokens": 7646111.0, "step": 1030 }, { "entropy": 1.8718897640705108, "epoch": 0.01556116031642273, "grad_norm": 0.5254436731338501, "learning_rate": 3.463333333333333e-05, "loss": 0.2672, "mean_token_accuracy": 0.9377317324280738, "num_tokens": 7721247.0, "step": 1040 }, { "entropy": 1.8877231419086455, "epoch": 0.015710786857926793, "grad_norm": 0.5419355034828186, "learning_rate": 3.496666666666667e-05, "loss": 0.2689, "mean_token_accuracy": 0.9384996693581342, "num_tokens": 7797010.0, "step": 1050 }, { "entropy": 1.8906154781579971, "epoch": 0.015860413399430857, "grad_norm": 0.5910248160362244, "learning_rate": 3.53e-05, "loss": 0.2948, "mean_token_accuracy": 0.9314150124788284, "num_tokens": 7867342.0, "step": 1060 }, { "entropy": 1.8790299490094184, "epoch": 0.016010039940934924, "grad_norm": 0.6653301119804382, "learning_rate": 3.563333333333334e-05, "loss": 0.2721, "mean_token_accuracy": 0.9363476645201445, "num_tokens": 7940511.0, "step": 1070 }, { "entropy": 1.871644416451454, "epoch": 0.016159666482438988, "grad_norm": 0.6168724298477173, "learning_rate": 3.596666666666667e-05, "loss": 0.2844, "mean_token_accuracy": 0.9328656613826751, "num_tokens": 8013723.0, "step": 1080 }, { "entropy": 1.8985835947096348, "epoch": 0.01630929302394305, "grad_norm": 0.5236951112747192, "learning_rate": 3.63e-05, "loss": 0.2632, "mean_token_accuracy": 0.9363023322075605, "num_tokens": 8090956.0, "step": 1090 }, { "entropy": 1.9234493792057037, "epoch": 0.016458919565447115, "grad_norm": 0.4238961935043335, "learning_rate": 3.6633333333333334e-05, "loss": 0.2727, "mean_token_accuracy": 0.9339867666363716, "num_tokens": 8167253.0, "step": 1100 }, { "entropy": 1.902877391129732, "epoch": 0.016608546106951182, "grad_norm": 0.4996739327907562, "learning_rate": 3.6966666666666666e-05, "loss": 0.3087, "mean_token_accuracy": 0.9344214573502541, "num_tokens": 8242602.0, "step": 1110 }, { "entropy": 1.925073929131031, "epoch": 0.016758172648455246, "grad_norm": 0.6041417717933655, "learning_rate": 3.73e-05, "loss": 0.2968, "mean_token_accuracy": 0.9308765295892953, "num_tokens": 8317125.0, "step": 1120 }, { "entropy": 1.9387078195810319, "epoch": 0.01690779918995931, "grad_norm": 0.5066329836845398, "learning_rate": 3.763333333333334e-05, "loss": 0.2736, "mean_token_accuracy": 0.9361588280647993, "num_tokens": 8390889.0, "step": 1130 }, { "entropy": 1.9376711264252662, "epoch": 0.017057425731463377, "grad_norm": 0.3998706340789795, "learning_rate": 3.796666666666667e-05, "loss": 0.2647, "mean_token_accuracy": 0.9393856279551983, "num_tokens": 8464229.0, "step": 1140 }, { "entropy": 1.9371434718370437, "epoch": 0.01720705227296744, "grad_norm": 0.4436974823474884, "learning_rate": 3.83e-05, "loss": 0.2665, "mean_token_accuracy": 0.9368218403309584, "num_tokens": 8539060.0, "step": 1150 }, { "entropy": 1.9364991538226604, "epoch": 0.017356678814471505, "grad_norm": 0.4545430839061737, "learning_rate": 3.8633333333333335e-05, "loss": 0.2669, "mean_token_accuracy": 0.9374832130968571, "num_tokens": 8615520.0, "step": 1160 }, { "entropy": 1.9852855257689952, "epoch": 0.017506305355975568, "grad_norm": 0.6584464311599731, "learning_rate": 3.896666666666667e-05, "loss": 0.289, "mean_token_accuracy": 0.9299779187887907, "num_tokens": 8687986.0, "step": 1170 }, { "entropy": 1.9448260597884655, "epoch": 0.017655931897479635, "grad_norm": 0.35713228583335876, "learning_rate": 3.9300000000000007e-05, "loss": 0.2565, "mean_token_accuracy": 0.9404401514679194, "num_tokens": 8765081.0, "step": 1180 }, { "entropy": 1.9684312880039214, "epoch": 0.0178055584389837, "grad_norm": 0.6406857967376709, "learning_rate": 3.963333333333333e-05, "loss": 0.2453, "mean_token_accuracy": 0.9406179431825876, "num_tokens": 8842240.0, "step": 1190 }, { "entropy": 1.9455515153706073, "epoch": 0.017955184980487763, "grad_norm": 0.5930728912353516, "learning_rate": 3.996666666666667e-05, "loss": 0.2605, "mean_token_accuracy": 0.9413910396397114, "num_tokens": 8915359.0, "step": 1200 }, { "entropy": 1.966473037749529, "epoch": 0.01810481152199183, "grad_norm": 0.47765591740608215, "learning_rate": 4.0300000000000004e-05, "loss": 0.2746, "mean_token_accuracy": 0.9357528451830148, "num_tokens": 8989678.0, "step": 1210 }, { "entropy": 1.9709252327680589, "epoch": 0.018254438063495894, "grad_norm": 0.4226253032684326, "learning_rate": 4.0633333333333336e-05, "loss": 0.2676, "mean_token_accuracy": 0.9349496249109507, "num_tokens": 9063437.0, "step": 1220 }, { "entropy": 1.9574174158275128, "epoch": 0.018404064604999958, "grad_norm": 0.49076026678085327, "learning_rate": 4.096666666666667e-05, "loss": 0.2749, "mean_token_accuracy": 0.9361681073904038, "num_tokens": 9136033.0, "step": 1230 }, { "entropy": 1.9436740562319756, "epoch": 0.01855369114650402, "grad_norm": 0.42508575320243835, "learning_rate": 4.13e-05, "loss": 0.2722, "mean_token_accuracy": 0.9371613308787345, "num_tokens": 9210323.0, "step": 1240 }, { "entropy": 1.9515752837061882, "epoch": 0.01870331768800809, "grad_norm": 0.5182852745056152, "learning_rate": 4.1633333333333333e-05, "loss": 0.2765, "mean_token_accuracy": 0.9368175711482764, "num_tokens": 9283468.0, "step": 1250 }, { "entropy": 1.9461850970983505, "epoch": 0.018852944229512152, "grad_norm": 0.5053494572639465, "learning_rate": 4.196666666666667e-05, "loss": 0.3014, "mean_token_accuracy": 0.928177010267973, "num_tokens": 9357991.0, "step": 1260 }, { "entropy": 1.9470947682857513, "epoch": 0.019002570771016216, "grad_norm": 0.45178303122520447, "learning_rate": 4.23e-05, "loss": 0.2647, "mean_token_accuracy": 0.937558152154088, "num_tokens": 9433852.0, "step": 1270 }, { "entropy": 1.9238952748477458, "epoch": 0.01915219731252028, "grad_norm": 0.4230474531650543, "learning_rate": 4.263333333333334e-05, "loss": 0.2768, "mean_token_accuracy": 0.9341432381421327, "num_tokens": 9507989.0, "step": 1280 }, { "entropy": 1.9638021126389504, "epoch": 0.019301823854024347, "grad_norm": 0.45698633790016174, "learning_rate": 4.296666666666666e-05, "loss": 0.2671, "mean_token_accuracy": 0.9356396466493606, "num_tokens": 9583157.0, "step": 1290 }, { "entropy": 1.9190260156989098, "epoch": 0.01945145039552841, "grad_norm": 0.4040304124355316, "learning_rate": 4.33e-05, "loss": 0.267, "mean_token_accuracy": 0.9394377671182156, "num_tokens": 9656687.0, "step": 1300 }, { "entropy": 1.950559175759554, "epoch": 0.019601076937032474, "grad_norm": 0.3600620925426483, "learning_rate": 4.3633333333333335e-05, "loss": 0.2565, "mean_token_accuracy": 0.9395214602351188, "num_tokens": 9732763.0, "step": 1310 }, { "entropy": 1.9855354383587838, "epoch": 0.01975070347853654, "grad_norm": 0.5064100623130798, "learning_rate": 4.396666666666667e-05, "loss": 0.2814, "mean_token_accuracy": 0.9348355196416378, "num_tokens": 9807788.0, "step": 1320 }, { "entropy": 1.9128718122839927, "epoch": 0.019900330020040605, "grad_norm": 0.4409477710723877, "learning_rate": 4.43e-05, "loss": 0.2435, "mean_token_accuracy": 0.9403836719691754, "num_tokens": 9882836.0, "step": 1330 }, { "entropy": 1.8933450989425182, "epoch": 0.02004995656154467, "grad_norm": 0.4175204932689667, "learning_rate": 4.463333333333334e-05, "loss": 0.2544, "mean_token_accuracy": 0.9388504240661859, "num_tokens": 9956281.0, "step": 1340 }, { "entropy": 1.9070032380521298, "epoch": 0.020199583103048733, "grad_norm": 0.4159417152404785, "learning_rate": 4.496666666666667e-05, "loss": 0.2677, "mean_token_accuracy": 0.9361295677721501, "num_tokens": 10029334.0, "step": 1350 }, { "entropy": 1.9101487830281259, "epoch": 0.0203492096445528, "grad_norm": 0.46401578187942505, "learning_rate": 4.53e-05, "loss": 0.2866, "mean_token_accuracy": 0.9300867468118668, "num_tokens": 10103058.0, "step": 1360 }, { "entropy": 1.8810361474752426, "epoch": 0.020498836186056864, "grad_norm": 0.46862661838531494, "learning_rate": 4.5633333333333336e-05, "loss": 0.2935, "mean_token_accuracy": 0.9306722909212113, "num_tokens": 10176275.0, "step": 1370 }, { "entropy": 1.9244099050760268, "epoch": 0.020648462727560928, "grad_norm": 0.47564825415611267, "learning_rate": 4.596666666666667e-05, "loss": 0.29, "mean_token_accuracy": 0.9291265770792961, "num_tokens": 10247137.0, "step": 1380 }, { "entropy": 1.9467399790883064, "epoch": 0.020798089269064995, "grad_norm": 0.4551142454147339, "learning_rate": 4.630000000000001e-05, "loss": 0.2903, "mean_token_accuracy": 0.9279755663126708, "num_tokens": 10320274.0, "step": 1390 }, { "entropy": 1.9126875169575215, "epoch": 0.02094771581056906, "grad_norm": 0.3794918656349182, "learning_rate": 4.663333333333333e-05, "loss": 0.2652, "mean_token_accuracy": 0.9367523733526468, "num_tokens": 10396195.0, "step": 1400 }, { "entropy": 1.9332519829273225, "epoch": 0.021097342352073122, "grad_norm": 0.4127694368362427, "learning_rate": 4.696666666666667e-05, "loss": 0.2725, "mean_token_accuracy": 0.9344959072768688, "num_tokens": 10471313.0, "step": 1410 }, { "entropy": 1.9278608597815037, "epoch": 0.021246968893577186, "grad_norm": 0.42189526557922363, "learning_rate": 4.73e-05, "loss": 0.2592, "mean_token_accuracy": 0.9370869193226099, "num_tokens": 10548164.0, "step": 1420 }, { "entropy": 1.9116816632449627, "epoch": 0.021396595435081253, "grad_norm": 0.4197300672531128, "learning_rate": 4.763333333333334e-05, "loss": 0.2717, "mean_token_accuracy": 0.9355357114225626, "num_tokens": 10624765.0, "step": 1430 }, { "entropy": 1.8857680186629295, "epoch": 0.021546221976585317, "grad_norm": 0.40343478322029114, "learning_rate": 4.796666666666667e-05, "loss": 0.2663, "mean_token_accuracy": 0.9368946634232997, "num_tokens": 10698617.0, "step": 1440 }, { "entropy": 1.9078956685960293, "epoch": 0.02169584851808938, "grad_norm": 0.44704073667526245, "learning_rate": 4.83e-05, "loss": 0.2718, "mean_token_accuracy": 0.9337268963456153, "num_tokens": 10768740.0, "step": 1450 }, { "entropy": 1.919688557833433, "epoch": 0.021845475059593444, "grad_norm": 0.499002605676651, "learning_rate": 4.8633333333333334e-05, "loss": 0.2752, "mean_token_accuracy": 0.935129937902093, "num_tokens": 10840930.0, "step": 1460 }, { "entropy": 1.9083768844604492, "epoch": 0.02199510160109751, "grad_norm": 0.4030619263648987, "learning_rate": 4.8966666666666667e-05, "loss": 0.2678, "mean_token_accuracy": 0.9360015477985144, "num_tokens": 10914072.0, "step": 1470 }, { "entropy": 1.9401203468441963, "epoch": 0.022144728142601575, "grad_norm": 0.43506520986557007, "learning_rate": 4.93e-05, "loss": 0.2649, "mean_token_accuracy": 0.9385438848286867, "num_tokens": 10987332.0, "step": 1480 }, { "entropy": 1.950416960567236, "epoch": 0.02229435468410564, "grad_norm": 0.37713760137557983, "learning_rate": 4.963333333333334e-05, "loss": 0.2818, "mean_token_accuracy": 0.9327928606420756, "num_tokens": 11058921.0, "step": 1490 }, { "entropy": 1.9302063561975955, "epoch": 0.022443981225609706, "grad_norm": 0.4021291434764862, "learning_rate": 4.996666666666667e-05, "loss": 0.261, "mean_token_accuracy": 0.9362004119902849, "num_tokens": 11131444.0, "step": 1500 }, { "entropy": 1.9218756295740604, "epoch": 0.02259360776711377, "grad_norm": 0.38073208928108215, "learning_rate": 4.9999997663602054e-05, "loss": 0.281, "mean_token_accuracy": 0.9332431003451347, "num_tokens": 11205193.0, "step": 1510 }, { "entropy": 1.944690889120102, "epoch": 0.022743234308617834, "grad_norm": 0.3809882700443268, "learning_rate": 4.999998958716528e-05, "loss": 0.2437, "mean_token_accuracy": 0.9424938000738621, "num_tokens": 11281679.0, "step": 1520 }, { "entropy": 1.897782201319933, "epoch": 0.022892860850121897, "grad_norm": 0.3762741982936859, "learning_rate": 4.999997574184713e-05, "loss": 0.2517, "mean_token_accuracy": 0.940287358313799, "num_tokens": 11355390.0, "step": 1530 }, { "entropy": 1.916746361553669, "epoch": 0.023042487391625965, "grad_norm": 0.4179477095603943, "learning_rate": 4.999995612765078e-05, "loss": 0.2601, "mean_token_accuracy": 0.9393490124493837, "num_tokens": 11428180.0, "step": 1540 }, { "entropy": 1.8912997141480445, "epoch": 0.02319211393313003, "grad_norm": 0.5718160271644592, "learning_rate": 4.999993074458079e-05, "loss": 0.2835, "mean_token_accuracy": 0.9320059884339571, "num_tokens": 11501459.0, "step": 1550 }, { "entropy": 1.920396737009287, "epoch": 0.023341740474634092, "grad_norm": 0.3995632231235504, "learning_rate": 4.9999899592643027e-05, "loss": 0.2581, "mean_token_accuracy": 0.9398284446448087, "num_tokens": 11575585.0, "step": 1560 }, { "entropy": 1.9146107286214828, "epoch": 0.02349136701613816, "grad_norm": 0.40347373485565186, "learning_rate": 4.9999862671844685e-05, "loss": 0.2494, "mean_token_accuracy": 0.9398542977869511, "num_tokens": 11650607.0, "step": 1570 }, { "entropy": 1.9214057572185994, "epoch": 0.023640993557642223, "grad_norm": 0.35241708159446716, "learning_rate": 4.999981998219429e-05, "loss": 0.248, "mean_token_accuracy": 0.9402223721146583, "num_tokens": 11724299.0, "step": 1580 }, { "entropy": 1.928932322561741, "epoch": 0.023790620099146287, "grad_norm": 0.4366796910762787, "learning_rate": 4.999977152370175e-05, "loss": 0.2676, "mean_token_accuracy": 0.9381843123584985, "num_tokens": 11799196.0, "step": 1590 }, { "entropy": 1.8909890569746495, "epoch": 0.02394024664065035, "grad_norm": 0.4896111786365509, "learning_rate": 4.999971729637824e-05, "loss": 0.2646, "mean_token_accuracy": 0.9363083928823471, "num_tokens": 11873266.0, "step": 1600 }, { "entropy": 1.8947751440107823, "epoch": 0.024089873182154418, "grad_norm": 0.48303547501564026, "learning_rate": 4.99996573002363e-05, "loss": 0.2642, "mean_token_accuracy": 0.9363098442554474, "num_tokens": 11946112.0, "step": 1610 }, { "entropy": 1.8935870833694934, "epoch": 0.02423949972365848, "grad_norm": 0.4124827980995178, "learning_rate": 4.9999591535289807e-05, "loss": 0.2711, "mean_token_accuracy": 0.9327072910964489, "num_tokens": 12017123.0, "step": 1620 }, { "entropy": 1.9289609640836716, "epoch": 0.024389126265162545, "grad_norm": 0.2973644733428955, "learning_rate": 4.999952000155397e-05, "loss": 0.2586, "mean_token_accuracy": 0.936373620480299, "num_tokens": 12095745.0, "step": 1630 }, { "entropy": 1.9134388372302056, "epoch": 0.02453875280666661, "grad_norm": 0.38001781702041626, "learning_rate": 4.999944269904532e-05, "loss": 0.2439, "mean_token_accuracy": 0.9400587182492017, "num_tokens": 12170842.0, "step": 1640 }, { "entropy": 1.8777817323803903, "epoch": 0.024688379348170676, "grad_norm": 0.3203199803829193, "learning_rate": 4.9999359627781744e-05, "loss": 0.2462, "mean_token_accuracy": 0.9418114703148603, "num_tokens": 12248060.0, "step": 1650 }, { "entropy": 1.8883257977664472, "epoch": 0.02483800588967474, "grad_norm": 0.4211905300617218, "learning_rate": 4.999927078778244e-05, "loss": 0.2753, "mean_token_accuracy": 0.9372297335416079, "num_tokens": 12322829.0, "step": 1660 }, { "entropy": 1.836207826435566, "epoch": 0.024987632431178804, "grad_norm": 0.41157951951026917, "learning_rate": 4.999917617906796e-05, "loss": 0.2359, "mean_token_accuracy": 0.9439395423978567, "num_tokens": 12399833.0, "step": 1670 }, { "entropy": 1.8546844005584717, "epoch": 0.02513725897268287, "grad_norm": 0.49052169919013977, "learning_rate": 4.9999075801660156e-05, "loss": 0.2972, "mean_token_accuracy": 0.9316247932612896, "num_tokens": 12474295.0, "step": 1680 }, { "entropy": 1.870160911977291, "epoch": 0.025286885514186935, "grad_norm": 0.4229196310043335, "learning_rate": 4.999896965558225e-05, "loss": 0.2593, "mean_token_accuracy": 0.9369913544505835, "num_tokens": 12548840.0, "step": 1690 }, { "entropy": 1.865529114753008, "epoch": 0.025436512055691, "grad_norm": 0.3937903642654419, "learning_rate": 4.99988577408588e-05, "loss": 0.2514, "mean_token_accuracy": 0.9392479062080383, "num_tokens": 12626807.0, "step": 1700 }, { "entropy": 1.9266904883086682, "epoch": 0.025586138597195062, "grad_norm": 0.37837767601013184, "learning_rate": 4.999874005751567e-05, "loss": 0.2454, "mean_token_accuracy": 0.9401845403015614, "num_tokens": 12701250.0, "step": 1710 }, { "entropy": 1.9229820005595684, "epoch": 0.02573576513869913, "grad_norm": 0.38864415884017944, "learning_rate": 4.9998616605580056e-05, "loss": 0.2529, "mean_token_accuracy": 0.9398800730705261, "num_tokens": 12774216.0, "step": 1720 }, { "entropy": 1.9213424824178218, "epoch": 0.025885391680203193, "grad_norm": 0.44867226481437683, "learning_rate": 4.999848738508052e-05, "loss": 0.2545, "mean_token_accuracy": 0.9368224963545799, "num_tokens": 12849238.0, "step": 1730 }, { "entropy": 1.9184985421597958, "epoch": 0.026035018221707257, "grad_norm": 0.5166764259338379, "learning_rate": 4.999835239604694e-05, "loss": 0.2441, "mean_token_accuracy": 0.9378155428916216, "num_tokens": 12926637.0, "step": 1740 }, { "entropy": 1.9088952593505382, "epoch": 0.02618464476321132, "grad_norm": 0.48186591267585754, "learning_rate": 4.999821163851053e-05, "loss": 0.2608, "mean_token_accuracy": 0.9352299775928259, "num_tokens": 13002156.0, "step": 1750 }, { "entropy": 1.9066528983414173, "epoch": 0.026334271304715388, "grad_norm": 0.4407900869846344, "learning_rate": 4.999806511250382e-05, "loss": 0.2745, "mean_token_accuracy": 0.9300562132149934, "num_tokens": 13075930.0, "step": 1760 }, { "entropy": 1.8909938417375087, "epoch": 0.02648389784621945, "grad_norm": 0.29750967025756836, "learning_rate": 4.999791281806069e-05, "loss": 0.2665, "mean_token_accuracy": 0.9349593546241521, "num_tokens": 13148434.0, "step": 1770 }, { "entropy": 1.9058317221701144, "epoch": 0.026633524387723515, "grad_norm": 0.42107805609703064, "learning_rate": 4.9997754755216383e-05, "loss": 0.2689, "mean_token_accuracy": 0.935636480897665, "num_tokens": 13219905.0, "step": 1780 }, { "entropy": 1.8798053488135338, "epoch": 0.026783150929227582, "grad_norm": 0.4711362421512604, "learning_rate": 4.999759092400741e-05, "loss": 0.2549, "mean_token_accuracy": 0.938982268422842, "num_tokens": 13298194.0, "step": 1790 }, { "entropy": 1.874748171120882, "epoch": 0.026932777470731646, "grad_norm": 0.3945498764514923, "learning_rate": 4.999742132447168e-05, "loss": 0.2414, "mean_token_accuracy": 0.9416402768343687, "num_tokens": 13373833.0, "step": 1800 }, { "entropy": 1.88096881210804, "epoch": 0.02708240401223571, "grad_norm": 0.5215915441513062, "learning_rate": 4.999724595664838e-05, "loss": 0.2645, "mean_token_accuracy": 0.9364828310906887, "num_tokens": 13450606.0, "step": 1810 }, { "entropy": 1.8734424695372582, "epoch": 0.027232030553739774, "grad_norm": 0.34603357315063477, "learning_rate": 4.9997064820578087e-05, "loss": 0.27, "mean_token_accuracy": 0.9391911398619414, "num_tokens": 13524458.0, "step": 1820 }, { "entropy": 1.9060774892568588, "epoch": 0.02738165709524384, "grad_norm": 0.4155914783477783, "learning_rate": 4.999687791630266e-05, "loss": 0.2761, "mean_token_accuracy": 0.9316956490278244, "num_tokens": 13596633.0, "step": 1830 }, { "entropy": 1.9168854914605618, "epoch": 0.027531283636747905, "grad_norm": 0.32368355989456177, "learning_rate": 4.9996685243865326e-05, "loss": 0.2453, "mean_token_accuracy": 0.9384739082306623, "num_tokens": 13674632.0, "step": 1840 }, { "entropy": 1.9248627573251724, "epoch": 0.02768091017825197, "grad_norm": 0.38061970472335815, "learning_rate": 4.999648680331063e-05, "loss": 0.2484, "mean_token_accuracy": 0.9409559514373541, "num_tokens": 13750636.0, "step": 1850 }, { "entropy": 1.9219365417957306, "epoch": 0.027830536719756035, "grad_norm": 0.4516047537326813, "learning_rate": 4.999628259468445e-05, "loss": 0.2716, "mean_token_accuracy": 0.934255688264966, "num_tokens": 13823614.0, "step": 1860 }, { "entropy": 1.9693270392715931, "epoch": 0.0279801632612601, "grad_norm": 0.33230048418045044, "learning_rate": 4.9996072618034016e-05, "loss": 0.2763, "mean_token_accuracy": 0.9362888220697642, "num_tokens": 13893257.0, "step": 1870 }, { "entropy": 1.9107227720320226, "epoch": 0.028129789802764163, "grad_norm": 0.42593950033187866, "learning_rate": 4.999585687340787e-05, "loss": 0.28, "mean_token_accuracy": 0.9359276928007603, "num_tokens": 13964930.0, "step": 1880 }, { "entropy": 1.8682038851082325, "epoch": 0.028279416344268227, "grad_norm": 0.40382304787635803, "learning_rate": 4.9995635360855906e-05, "loss": 0.2706, "mean_token_accuracy": 0.9352442506700754, "num_tokens": 14040267.0, "step": 1890 }, { "entropy": 1.8770518898963928, "epoch": 0.028429042885772294, "grad_norm": 0.43403658270835876, "learning_rate": 4.999540808042931e-05, "loss": 0.2665, "mean_token_accuracy": 0.9348610509186983, "num_tokens": 14112330.0, "step": 1900 }, { "entropy": 1.860290214419365, "epoch": 0.028578669427276358, "grad_norm": 0.3906209468841553, "learning_rate": 4.9995175032180676e-05, "loss": 0.2304, "mean_token_accuracy": 0.9474035806953907, "num_tokens": 14188107.0, "step": 1910 }, { "entropy": 1.8999541856348514, "epoch": 0.02872829596878042, "grad_norm": 0.37739259004592896, "learning_rate": 4.999493621616386e-05, "loss": 0.2616, "mean_token_accuracy": 0.9391215428709984, "num_tokens": 14262520.0, "step": 1920 }, { "entropy": 1.9088940359652042, "epoch": 0.028877922510284485, "grad_norm": 0.5249622464179993, "learning_rate": 4.9994691632434094e-05, "loss": 0.2817, "mean_token_accuracy": 0.9312744207680226, "num_tokens": 14335958.0, "step": 1930 }, { "entropy": 1.877857106924057, "epoch": 0.029027549051788552, "grad_norm": 0.36370429396629333, "learning_rate": 4.999444128104792e-05, "loss": 0.2331, "mean_token_accuracy": 0.9446245223283768, "num_tokens": 14408712.0, "step": 1940 }, { "entropy": 1.9114902280271053, "epoch": 0.029177175593292616, "grad_norm": 0.39494791626930237, "learning_rate": 4.9994185162063236e-05, "loss": 0.2512, "mean_token_accuracy": 0.939300874993205, "num_tokens": 14484152.0, "step": 1950 }, { "entropy": 1.908535370975733, "epoch": 0.02932680213479668, "grad_norm": 0.396015465259552, "learning_rate": 4.9993923275539254e-05, "loss": 0.2606, "mean_token_accuracy": 0.9388527695089579, "num_tokens": 14555223.0, "step": 1960 }, { "entropy": 1.888861994445324, "epoch": 0.029476428676300747, "grad_norm": 0.3579181432723999, "learning_rate": 4.9993655621536526e-05, "loss": 0.2407, "mean_token_accuracy": 0.9433815009891987, "num_tokens": 14630614.0, "step": 1970 }, { "entropy": 1.901060538738966, "epoch": 0.02962605521780481, "grad_norm": 0.378630667924881, "learning_rate": 4.999338220011694e-05, "loss": 0.2542, "mean_token_accuracy": 0.9410500589758157, "num_tokens": 14704309.0, "step": 1980 }, { "entropy": 1.9252351596951485, "epoch": 0.029775681759308874, "grad_norm": 0.3895276188850403, "learning_rate": 4.999310301134372e-05, "loss": 0.274, "mean_token_accuracy": 0.9360985320061446, "num_tokens": 14778498.0, "step": 1990 }, { "entropy": 1.9307069145143032, "epoch": 0.029925308300812938, "grad_norm": 0.383194237947464, "learning_rate": 4.9992818055281405e-05, "loss": 0.2465, "mean_token_accuracy": 0.9400186944752932, "num_tokens": 14854754.0, "step": 2000 }, { "epoch": 0.029925308300812938, "eval_entropy": 1.9322413902759552, "eval_loss": 0.2821834087371826, "eval_mean_token_accuracy": 0.9388002062678337, "eval_num_tokens": 14854754.0, "eval_runtime": 555.3915, "eval_samples_per_second": 36.011, "eval_steps_per_second": 9.003, "step": 2000 }, { "entropy": 1.9565280303359032, "epoch": 0.030074934842317005, "grad_norm": 0.41336962580680847, "learning_rate": 4.99925273319959e-05, "loss": 0.2684, "mean_token_accuracy": 0.937010831385851, "num_tokens": 14926706.0, "step": 2010 }, { "entropy": 1.9696230962872505, "epoch": 0.03022456138382107, "grad_norm": 0.3417767882347107, "learning_rate": 4.9992230841554414e-05, "loss": 0.2622, "mean_token_accuracy": 0.9378949467092752, "num_tokens": 15000508.0, "step": 2020 }, { "entropy": 1.9325991325080394, "epoch": 0.030374187925325133, "grad_norm": 0.424651563167572, "learning_rate": 4.9991928584025505e-05, "loss": 0.2482, "mean_token_accuracy": 0.9400513842701912, "num_tokens": 15074635.0, "step": 2030 }, { "entropy": 1.9370036140084266, "epoch": 0.0305238144668292, "grad_norm": 0.2983887791633606, "learning_rate": 4.999162055947906e-05, "loss": 0.2483, "mean_token_accuracy": 0.9417125564068556, "num_tokens": 15148762.0, "step": 2040 }, { "entropy": 1.917696239054203, "epoch": 0.030673441008333264, "grad_norm": 0.4128051996231079, "learning_rate": 4.9991306767986294e-05, "loss": 0.2388, "mean_token_accuracy": 0.9413021482527256, "num_tokens": 15223251.0, "step": 2050 }, { "entropy": 1.9703282028436662, "epoch": 0.030823067549837328, "grad_norm": 0.4117163121700287, "learning_rate": 4.999098720961977e-05, "loss": 0.2646, "mean_token_accuracy": 0.9360530350357295, "num_tokens": 15293635.0, "step": 2060 }, { "entropy": 1.9402942091226578, "epoch": 0.03097269409134139, "grad_norm": 0.3817594349384308, "learning_rate": 4.9990661884453374e-05, "loss": 0.2416, "mean_token_accuracy": 0.9421465035527945, "num_tokens": 15367325.0, "step": 2070 }, { "entropy": 1.9466923214495182, "epoch": 0.03112232063284546, "grad_norm": 0.36239781975746155, "learning_rate": 4.999033079256232e-05, "loss": 0.2651, "mean_token_accuracy": 0.9382477596402168, "num_tokens": 15442895.0, "step": 2080 }, { "entropy": 1.9442710898816586, "epoch": 0.03127194717434952, "grad_norm": 0.34867575764656067, "learning_rate": 4.9989993934023185e-05, "loss": 0.255, "mean_token_accuracy": 0.9413390252739191, "num_tokens": 15515950.0, "step": 2090 }, { "entropy": 1.9898070678114892, "epoch": 0.031421573715853586, "grad_norm": 0.35317516326904297, "learning_rate": 4.9989651308913817e-05, "loss": 0.2744, "mean_token_accuracy": 0.9344735324382782, "num_tokens": 15590687.0, "step": 2100 }, { "entropy": 1.952912725508213, "epoch": 0.03157120025735765, "grad_norm": 0.48686540126800537, "learning_rate": 4.998930291731347e-05, "loss": 0.2641, "mean_token_accuracy": 0.9377644136548042, "num_tokens": 15664685.0, "step": 2110 }, { "entropy": 1.9264074131846427, "epoch": 0.03172082679886171, "grad_norm": 0.366871178150177, "learning_rate": 4.998894875930269e-05, "loss": 0.2593, "mean_token_accuracy": 0.933463591337204, "num_tokens": 15736965.0, "step": 2120 }, { "entropy": 1.9123641096055508, "epoch": 0.031870453340365784, "grad_norm": 0.4008675217628479, "learning_rate": 4.9988588834963356e-05, "loss": 0.2501, "mean_token_accuracy": 0.9419662795960904, "num_tokens": 15809779.0, "step": 2130 }, { "entropy": 1.8954274870455265, "epoch": 0.03202007988186985, "grad_norm": 0.37401312589645386, "learning_rate": 4.99882231443787e-05, "loss": 0.2581, "mean_token_accuracy": 0.9397182360291481, "num_tokens": 15884044.0, "step": 2140 }, { "entropy": 1.8952218472957612, "epoch": 0.03216970642337391, "grad_norm": 0.35495302081108093, "learning_rate": 4.998785168763326e-05, "loss": 0.2542, "mean_token_accuracy": 0.9380063027143478, "num_tokens": 15959314.0, "step": 2150 }, { "entropy": 1.9137567408382892, "epoch": 0.032319332964877975, "grad_norm": 0.42583364248275757, "learning_rate": 4.998747446481295e-05, "loss": 0.2605, "mean_token_accuracy": 0.9385600250214339, "num_tokens": 16032634.0, "step": 2160 }, { "entropy": 1.9397812642157077, "epoch": 0.03246895950638204, "grad_norm": 0.4027331471443176, "learning_rate": 4.998709147600497e-05, "loss": 0.2642, "mean_token_accuracy": 0.9363725662231446, "num_tokens": 16107629.0, "step": 2170 }, { "entropy": 1.9473442129790783, "epoch": 0.0326185860478861, "grad_norm": 0.3517669439315796, "learning_rate": 4.998670272129787e-05, "loss": 0.2504, "mean_token_accuracy": 0.9392262551933527, "num_tokens": 16179227.0, "step": 2180 }, { "entropy": 1.930887696146965, "epoch": 0.03276821258939017, "grad_norm": 0.48436281085014343, "learning_rate": 4.998630820078155e-05, "loss": 0.2573, "mean_token_accuracy": 0.9367777921259404, "num_tokens": 16250814.0, "step": 2190 }, { "entropy": 1.9166440114378929, "epoch": 0.03291783913089423, "grad_norm": 0.3394937217235565, "learning_rate": 4.998590791454723e-05, "loss": 0.2209, "mean_token_accuracy": 0.9465084623545408, "num_tokens": 16325394.0, "step": 2200 }, { "entropy": 1.943915279954672, "epoch": 0.0330674656723983, "grad_norm": 0.3154884874820709, "learning_rate": 4.998550186268746e-05, "loss": 0.2518, "mean_token_accuracy": 0.9397447355091572, "num_tokens": 16399145.0, "step": 2210 }, { "entropy": 1.982957059890032, "epoch": 0.033217092213902365, "grad_norm": 0.41696280241012573, "learning_rate": 4.9985090045296127e-05, "loss": 0.247, "mean_token_accuracy": 0.9376496184617281, "num_tokens": 16472355.0, "step": 2220 }, { "entropy": 1.9771963335573672, "epoch": 0.03336671875540643, "grad_norm": 0.2631385922431946, "learning_rate": 4.998467246246845e-05, "loss": 0.2577, "mean_token_accuracy": 0.936913312971592, "num_tokens": 16545261.0, "step": 2230 }, { "entropy": 1.9904627092182636, "epoch": 0.03351634529691049, "grad_norm": 0.44014114141464233, "learning_rate": 4.9984249114300966e-05, "loss": 0.2557, "mean_token_accuracy": 0.9391039680689574, "num_tokens": 16617993.0, "step": 2240 }, { "entropy": 1.9717852793633939, "epoch": 0.033665971838414556, "grad_norm": 0.3949442207813263, "learning_rate": 4.998382000089159e-05, "loss": 0.2527, "mean_token_accuracy": 0.9395819250494242, "num_tokens": 16690541.0, "step": 2250 }, { "entropy": 1.9732861898839473, "epoch": 0.03381559837991862, "grad_norm": 0.3988160490989685, "learning_rate": 4.998338512233953e-05, "loss": 0.2533, "mean_token_accuracy": 0.9382437761873007, "num_tokens": 16763956.0, "step": 2260 }, { "entropy": 1.9649958074092866, "epoch": 0.03396522492142268, "grad_norm": 0.4198133945465088, "learning_rate": 4.998294447874532e-05, "loss": 0.2498, "mean_token_accuracy": 0.9421830154955387, "num_tokens": 16838776.0, "step": 2270 }, { "entropy": 1.9426559664309024, "epoch": 0.034114851462926754, "grad_norm": 0.3109755218029022, "learning_rate": 4.9982498070210865e-05, "loss": 0.2468, "mean_token_accuracy": 0.9420979168266058, "num_tokens": 16912019.0, "step": 2280 }, { "entropy": 1.9416701167821884, "epoch": 0.03426447800443082, "grad_norm": 0.4229649603366852, "learning_rate": 4.998204589683938e-05, "loss": 0.2612, "mean_token_accuracy": 0.936279496178031, "num_tokens": 16986643.0, "step": 2290 }, { "entropy": 1.9345242165029048, "epoch": 0.03441410454593488, "grad_norm": 0.4005569517612457, "learning_rate": 4.998158795873541e-05, "loss": 0.257, "mean_token_accuracy": 0.9352407984435558, "num_tokens": 17060966.0, "step": 2300 }, { "entropy": 1.9515607498586178, "epoch": 0.034563731087438945, "grad_norm": 0.3703019320964813, "learning_rate": 4.998112425600483e-05, "loss": 0.2553, "mean_token_accuracy": 0.9372815027832985, "num_tokens": 17134994.0, "step": 2310 }, { "entropy": 1.924177948385477, "epoch": 0.03471335762894301, "grad_norm": 0.33253714442253113, "learning_rate": 4.998065478875488e-05, "loss": 0.2524, "mean_token_accuracy": 0.9396979693323374, "num_tokens": 17209004.0, "step": 2320 }, { "entropy": 1.9030640989542007, "epoch": 0.03486298417044707, "grad_norm": 0.3523918688297272, "learning_rate": 4.9980179557094093e-05, "loss": 0.2472, "mean_token_accuracy": 0.9437584325671196, "num_tokens": 17282925.0, "step": 2330 }, { "entropy": 1.9764552630484105, "epoch": 0.035012610711951136, "grad_norm": 0.34804388880729675, "learning_rate": 4.997969856113235e-05, "loss": 0.2635, "mean_token_accuracy": 0.9387603487819434, "num_tokens": 17356211.0, "step": 2340 }, { "entropy": 1.9563065327703952, "epoch": 0.03516223725345521, "grad_norm": 0.3786119818687439, "learning_rate": 4.997921180098087e-05, "loss": 0.232, "mean_token_accuracy": 0.9470246482640505, "num_tokens": 17434090.0, "step": 2350 }, { "entropy": 1.9553963489830495, "epoch": 0.03531186379495927, "grad_norm": 0.3564468026161194, "learning_rate": 4.99787192767522e-05, "loss": 0.2673, "mean_token_accuracy": 0.936869566142559, "num_tokens": 17506406.0, "step": 2360 }, { "entropy": 1.9346966020762921, "epoch": 0.035461490336463335, "grad_norm": 0.4221576154232025, "learning_rate": 4.997822098856022e-05, "loss": 0.2623, "mean_token_accuracy": 0.9381757996976375, "num_tokens": 17579377.0, "step": 2370 }, { "entropy": 1.9512953609228134, "epoch": 0.0356111168779674, "grad_norm": 0.34667572379112244, "learning_rate": 4.9977716936520147e-05, "loss": 0.2436, "mean_token_accuracy": 0.9382246319204569, "num_tokens": 17654093.0, "step": 2380 }, { "entropy": 1.9857023894786834, "epoch": 0.03576074341947146, "grad_norm": 0.3324300944805145, "learning_rate": 4.997720712074852e-05, "loss": 0.2465, "mean_token_accuracy": 0.9393995355814695, "num_tokens": 17729993.0, "step": 2390 }, { "entropy": 1.9606926009058951, "epoch": 0.035910369960975526, "grad_norm": 0.29386043548583984, "learning_rate": 4.9976691541363226e-05, "loss": 0.2428, "mean_token_accuracy": 0.9429989587515593, "num_tokens": 17802752.0, "step": 2400 }, { "entropy": 1.9807053744792937, "epoch": 0.03605999650247959, "grad_norm": 0.4032626450061798, "learning_rate": 4.9976170198483464e-05, "loss": 0.2553, "mean_token_accuracy": 0.9345075275748969, "num_tokens": 17876956.0, "step": 2410 }, { "entropy": 1.9699526779353618, "epoch": 0.03620962304398366, "grad_norm": 0.27722030878067017, "learning_rate": 4.997564309222979e-05, "loss": 0.2488, "mean_token_accuracy": 0.9399482186883688, "num_tokens": 17952200.0, "step": 2420 }, { "entropy": 1.9373407885432243, "epoch": 0.036359249585487724, "grad_norm": 0.3711972236633301, "learning_rate": 4.997511022272407e-05, "loss": 0.2344, "mean_token_accuracy": 0.9414932928979397, "num_tokens": 18027926.0, "step": 2430 }, { "entropy": 1.9610688969492913, "epoch": 0.03650887612699179, "grad_norm": 0.3180617392063141, "learning_rate": 4.997457159008952e-05, "loss": 0.2568, "mean_token_accuracy": 0.940676337853074, "num_tokens": 18103269.0, "step": 2440 }, { "entropy": 1.9607133604586124, "epoch": 0.03665850266849585, "grad_norm": 0.375173419713974, "learning_rate": 4.997402719445068e-05, "loss": 0.2612, "mean_token_accuracy": 0.9352148834615945, "num_tokens": 18176303.0, "step": 2450 }, { "entropy": 1.9812813706696033, "epoch": 0.036808129209999915, "grad_norm": 0.43037471175193787, "learning_rate": 4.997347703593342e-05, "loss": 0.2529, "mean_token_accuracy": 0.9383953481912612, "num_tokens": 18247801.0, "step": 2460 }, { "entropy": 1.9305276803672313, "epoch": 0.03695775575150398, "grad_norm": 0.3978329300880432, "learning_rate": 4.997292111466496e-05, "loss": 0.2685, "mean_token_accuracy": 0.9387603871524334, "num_tokens": 18323608.0, "step": 2470 }, { "entropy": 1.9468570463359356, "epoch": 0.03710738229300804, "grad_norm": 0.4265293478965759, "learning_rate": 4.9972359430773815e-05, "loss": 0.2753, "mean_token_accuracy": 0.9357739523053169, "num_tokens": 18395689.0, "step": 2480 }, { "entropy": 1.9424455896019936, "epoch": 0.03725700883451211, "grad_norm": 0.4507357180118561, "learning_rate": 4.9971791984389874e-05, "loss": 0.2377, "mean_token_accuracy": 0.9411885067820549, "num_tokens": 18468220.0, "step": 2490 }, { "entropy": 1.923718734830618, "epoch": 0.03740663537601618, "grad_norm": 0.3139372169971466, "learning_rate": 4.997121877564434e-05, "loss": 0.2354, "mean_token_accuracy": 0.9458344623446464, "num_tokens": 18540482.0, "step": 2500 }, { "entropy": 1.9026800259947776, "epoch": 0.03755626191752024, "grad_norm": 0.31177815794944763, "learning_rate": 4.997063980466975e-05, "loss": 0.267, "mean_token_accuracy": 0.9363665070384741, "num_tokens": 18616288.0, "step": 2510 }, { "entropy": 1.9846577145159245, "epoch": 0.037705888459024305, "grad_norm": 0.2984126806259155, "learning_rate": 4.997005507159996e-05, "loss": 0.2756, "mean_token_accuracy": 0.9323837928473949, "num_tokens": 18687150.0, "step": 2520 }, { "entropy": 1.9855789996683597, "epoch": 0.03785551500052837, "grad_norm": 0.3554929494857788, "learning_rate": 4.996946457657018e-05, "loss": 0.2483, "mean_token_accuracy": 0.9386679690331221, "num_tokens": 18762178.0, "step": 2530 }, { "entropy": 1.9625399574637412, "epoch": 0.03800514154203243, "grad_norm": 0.4682481586933136, "learning_rate": 4.996886831971694e-05, "loss": 0.2522, "mean_token_accuracy": 0.9369754523038865, "num_tokens": 18838178.0, "step": 2540 }, { "entropy": 1.953991135954857, "epoch": 0.038154768083536496, "grad_norm": 0.39189374446868896, "learning_rate": 4.996826630117811e-05, "loss": 0.2596, "mean_token_accuracy": 0.933669513463974, "num_tokens": 18913184.0, "step": 2550 }, { "entropy": 1.9629682764410972, "epoch": 0.03830439462504056, "grad_norm": 0.30209338665008545, "learning_rate": 4.996765852109288e-05, "loss": 0.2476, "mean_token_accuracy": 0.9371741250157356, "num_tokens": 18989742.0, "step": 2560 }, { "entropy": 1.9424784727394582, "epoch": 0.03845402116654463, "grad_norm": 0.3802827000617981, "learning_rate": 4.996704497960179e-05, "loss": 0.2618, "mean_token_accuracy": 0.9349131889641284, "num_tokens": 19062948.0, "step": 2570 }, { "entropy": 1.9612093448638916, "epoch": 0.038603647708048694, "grad_norm": 0.3516566753387451, "learning_rate": 4.996642567684669e-05, "loss": 0.2519, "mean_token_accuracy": 0.9395324651151895, "num_tokens": 19135771.0, "step": 2580 }, { "entropy": 1.9820048101246357, "epoch": 0.03875327424955276, "grad_norm": 0.2763564884662628, "learning_rate": 4.996580061297079e-05, "loss": 0.2584, "mean_token_accuracy": 0.9388410236686469, "num_tokens": 19210749.0, "step": 2590 }, { "entropy": 2.014185433834791, "epoch": 0.03890290079105682, "grad_norm": 0.39339205622673035, "learning_rate": 4.9965169788118596e-05, "loss": 0.2604, "mean_token_accuracy": 0.9401724830269813, "num_tokens": 19285305.0, "step": 2600 }, { "entropy": 2.058422737568617, "epoch": 0.039052527332560885, "grad_norm": 0.3765966594219208, "learning_rate": 4.996453320243598e-05, "loss": 0.2638, "mean_token_accuracy": 0.9368779562413693, "num_tokens": 19357731.0, "step": 2610 }, { "entropy": 2.0115641206502914, "epoch": 0.03920215387406495, "grad_norm": 0.411109060049057, "learning_rate": 4.996389085607012e-05, "loss": 0.2604, "mean_token_accuracy": 0.9363212723284959, "num_tokens": 19431994.0, "step": 2620 }, { "entropy": 1.9735753037035466, "epoch": 0.03935178041556901, "grad_norm": 0.444417268037796, "learning_rate": 4.996324274916955e-05, "loss": 0.2303, "mean_token_accuracy": 0.9439159881323576, "num_tokens": 19505137.0, "step": 2630 }, { "entropy": 1.9699680179357528, "epoch": 0.03950140695707308, "grad_norm": 0.36013904213905334, "learning_rate": 4.996258888188411e-05, "loss": 0.256, "mean_token_accuracy": 0.9401726860553026, "num_tokens": 19577925.0, "step": 2640 }, { "entropy": 1.9285006485879421, "epoch": 0.03965103349857715, "grad_norm": 0.3732374310493469, "learning_rate": 4.996192925436501e-05, "loss": 0.2607, "mean_token_accuracy": 0.9384304087609052, "num_tokens": 19652924.0, "step": 2650 }, { "entropy": 1.9509468123316764, "epoch": 0.03980066004008121, "grad_norm": 0.4283207654953003, "learning_rate": 4.996126386676474e-05, "loss": 0.2445, "mean_token_accuracy": 0.9397526569664478, "num_tokens": 19726067.0, "step": 2660 }, { "entropy": 1.9705830961465836, "epoch": 0.039950286581585275, "grad_norm": 0.35293203592300415, "learning_rate": 4.996059271923717e-05, "loss": 0.2378, "mean_token_accuracy": 0.9455716229975224, "num_tokens": 19804418.0, "step": 2670 }, { "entropy": 1.932836677134037, "epoch": 0.04009991312308934, "grad_norm": 0.3222312033176422, "learning_rate": 4.995991581193747e-05, "loss": 0.2271, "mean_token_accuracy": 0.9442108020186424, "num_tokens": 19881488.0, "step": 2680 }, { "entropy": 1.9573209173977375, "epoch": 0.0402495396645934, "grad_norm": 0.42405036091804504, "learning_rate": 4.995923314502216e-05, "loss": 0.2628, "mean_token_accuracy": 0.9384361617267132, "num_tokens": 19956782.0, "step": 2690 }, { "entropy": 1.9718046344816684, "epoch": 0.040399166206097466, "grad_norm": 0.44667866826057434, "learning_rate": 4.995854471864908e-05, "loss": 0.259, "mean_token_accuracy": 0.9392971463501454, "num_tokens": 20031403.0, "step": 2700 }, { "entropy": 2.0155383914709093, "epoch": 0.040548792747601536, "grad_norm": 0.3875434994697571, "learning_rate": 4.99578505329774e-05, "loss": 0.2699, "mean_token_accuracy": 0.9344771649688483, "num_tokens": 20106197.0, "step": 2710 }, { "entropy": 2.052448569238186, "epoch": 0.0406984192891056, "grad_norm": 0.29686251282691956, "learning_rate": 4.995715058816764e-05, "loss": 0.2482, "mean_token_accuracy": 0.9383937004953623, "num_tokens": 20181582.0, "step": 2720 }, { "entropy": 2.052899253368378, "epoch": 0.040848045830609664, "grad_norm": 0.3088366389274597, "learning_rate": 4.995644488438163e-05, "loss": 0.2459, "mean_token_accuracy": 0.9385699488222599, "num_tokens": 20257998.0, "step": 2730 }, { "entropy": 1.984103611111641, "epoch": 0.04099767237211373, "grad_norm": 0.37731194496154785, "learning_rate": 4.995573342178254e-05, "loss": 0.2631, "mean_token_accuracy": 0.9371977284550667, "num_tokens": 20333779.0, "step": 2740 }, { "entropy": 1.9732327796518803, "epoch": 0.04114729891361779, "grad_norm": 0.31622132658958435, "learning_rate": 4.995501620053489e-05, "loss": 0.2542, "mean_token_accuracy": 0.9404299832880497, "num_tokens": 20406214.0, "step": 2750 }, { "entropy": 2.0346471764147283, "epoch": 0.041296925455121855, "grad_norm": 0.3011432886123657, "learning_rate": 4.9954293220804506e-05, "loss": 0.2626, "mean_token_accuracy": 0.9376473885029555, "num_tokens": 20478748.0, "step": 2760 }, { "entropy": 2.0026635088026525, "epoch": 0.04144655199662592, "grad_norm": 0.349150151014328, "learning_rate": 4.9953564482758545e-05, "loss": 0.2399, "mean_token_accuracy": 0.9408206082880497, "num_tokens": 20552214.0, "step": 2770 }, { "entropy": 2.019057286530733, "epoch": 0.04159617853812999, "grad_norm": 0.3964208662509918, "learning_rate": 4.995282998656551e-05, "loss": 0.2478, "mean_token_accuracy": 0.9412313893437385, "num_tokens": 20628151.0, "step": 2780 }, { "entropy": 1.9956378206610679, "epoch": 0.04174580507963405, "grad_norm": 0.2539881467819214, "learning_rate": 4.995208973239523e-05, "loss": 0.2545, "mean_token_accuracy": 0.9400748755782843, "num_tokens": 20704679.0, "step": 2790 }, { "entropy": 1.9954710811376573, "epoch": 0.04189543162113812, "grad_norm": 0.4153245985507965, "learning_rate": 4.995134372041887e-05, "loss": 0.2523, "mean_token_accuracy": 0.9425605285912753, "num_tokens": 20779516.0, "step": 2800 }, { "entropy": 1.9946840420365333, "epoch": 0.04204505816264218, "grad_norm": 1.7740190029144287, "learning_rate": 4.9950591950808915e-05, "loss": 0.2443, "mean_token_accuracy": 0.9387598268687725, "num_tokens": 20855255.0, "step": 2810 }, { "entropy": 1.9897942021489143, "epoch": 0.042194684704146244, "grad_norm": 0.35994648933410645, "learning_rate": 4.994983442373918e-05, "loss": 0.2638, "mean_token_accuracy": 0.9404065068811178, "num_tokens": 20927600.0, "step": 2820 }, { "entropy": 1.9824798643589019, "epoch": 0.04234431124565031, "grad_norm": 0.3997035324573517, "learning_rate": 4.9949071139384835e-05, "loss": 0.2652, "mean_token_accuracy": 0.9389049980789423, "num_tokens": 21002207.0, "step": 2830 }, { "entropy": 1.976809711754322, "epoch": 0.04249393778715437, "grad_norm": 0.3539193868637085, "learning_rate": 4.994830209792236e-05, "loss": 0.2556, "mean_token_accuracy": 0.941960509493947, "num_tokens": 21075338.0, "step": 2840 }, { "entropy": 1.9512909412384034, "epoch": 0.042643564328658436, "grad_norm": 0.3265222907066345, "learning_rate": 4.9947527299529556e-05, "loss": 0.2471, "mean_token_accuracy": 0.9411813333630562, "num_tokens": 21148296.0, "step": 2850 }, { "entropy": 1.9850236222147941, "epoch": 0.042793190870162506, "grad_norm": 0.4315653145313263, "learning_rate": 4.9946746744385585e-05, "loss": 0.2464, "mean_token_accuracy": 0.9355928212404251, "num_tokens": 21223892.0, "step": 2860 }, { "entropy": 1.995324043929577, "epoch": 0.04294281741166657, "grad_norm": 0.41415536403656006, "learning_rate": 4.994596043267093e-05, "loss": 0.2641, "mean_token_accuracy": 0.9354174751788378, "num_tokens": 21299910.0, "step": 2870 }, { "entropy": 1.9925806313753127, "epoch": 0.043092443953170634, "grad_norm": 0.34089967608451843, "learning_rate": 4.994516836456739e-05, "loss": 0.2502, "mean_token_accuracy": 0.9383448909968137, "num_tokens": 21372615.0, "step": 2880 }, { "entropy": 1.9594772972166539, "epoch": 0.0432420704946747, "grad_norm": 0.31095007061958313, "learning_rate": 4.994437054025811e-05, "loss": 0.2372, "mean_token_accuracy": 0.9437022406607867, "num_tokens": 21448511.0, "step": 2890 }, { "entropy": 1.9714134089648723, "epoch": 0.04339169703617876, "grad_norm": 0.35654157400131226, "learning_rate": 4.994356695992756e-05, "loss": 0.2408, "mean_token_accuracy": 0.943603714928031, "num_tokens": 21523201.0, "step": 2900 }, { "entropy": 1.9646256640553474, "epoch": 0.043541323577682825, "grad_norm": 0.27496638894081116, "learning_rate": 4.9942757623761535e-05, "loss": 0.2363, "mean_token_accuracy": 0.9433745224028826, "num_tokens": 21603228.0, "step": 2910 }, { "entropy": 1.9979079753160476, "epoch": 0.04369095011918689, "grad_norm": 0.39425766468048096, "learning_rate": 4.994194253194718e-05, "loss": 0.2472, "mean_token_accuracy": 0.9408998049795627, "num_tokens": 21675327.0, "step": 2920 }, { "entropy": 1.9493498086929322, "epoch": 0.04384057666069096, "grad_norm": 0.37097832560539246, "learning_rate": 4.9941121684672946e-05, "loss": 0.2496, "mean_token_accuracy": 0.9407390601933002, "num_tokens": 21749131.0, "step": 2930 }, { "entropy": 1.9617694713175298, "epoch": 0.04399020320219502, "grad_norm": 0.3001614809036255, "learning_rate": 4.994029508212864e-05, "loss": 0.2614, "mean_token_accuracy": 0.9374994207173586, "num_tokens": 21824553.0, "step": 2940 }, { "entropy": 1.9666986733675003, "epoch": 0.04413982974369909, "grad_norm": 0.4024062752723694, "learning_rate": 4.993946272450538e-05, "loss": 0.2525, "mean_token_accuracy": 0.9387096963822842, "num_tokens": 21899985.0, "step": 2950 }, { "entropy": 1.9731488317251205, "epoch": 0.04428945628520315, "grad_norm": 0.3654042184352875, "learning_rate": 4.993862461199562e-05, "loss": 0.2541, "mean_token_accuracy": 0.935540396720171, "num_tokens": 21972813.0, "step": 2960 }, { "entropy": 1.925535501539707, "epoch": 0.044439082826707214, "grad_norm": 0.4073169231414795, "learning_rate": 4.9937780744793164e-05, "loss": 0.2387, "mean_token_accuracy": 0.9387246772646904, "num_tokens": 22047859.0, "step": 2970 }, { "entropy": 1.910414982587099, "epoch": 0.04458870936821128, "grad_norm": 0.41044309735298157, "learning_rate": 4.99369311230931e-05, "loss": 0.2514, "mean_token_accuracy": 0.9373502794653177, "num_tokens": 22122082.0, "step": 2980 }, { "entropy": 1.924702125787735, "epoch": 0.04473833590971534, "grad_norm": 0.3491014540195465, "learning_rate": 4.99360757470919e-05, "loss": 0.2387, "mean_token_accuracy": 0.9412907123565674, "num_tokens": 22195899.0, "step": 2990 }, { "entropy": 1.9836353830993176, "epoch": 0.04488796245121941, "grad_norm": 0.3577398955821991, "learning_rate": 4.993521461698733e-05, "loss": 0.2493, "mean_token_accuracy": 0.938875550404191, "num_tokens": 22267493.0, "step": 3000 }, { "epoch": 0.04488796245121941, "eval_entropy": 1.9614721521377563, "eval_loss": 0.27463504672050476, "eval_mean_token_accuracy": 0.9400859427690506, "eval_num_tokens": 22267493.0, "eval_runtime": 561.2812, "eval_samples_per_second": 35.633, "eval_steps_per_second": 8.908, "step": 3000 }, { "entropy": 1.951661965996027, "epoch": 0.045037588992723476, "grad_norm": 0.3033333122730255, "learning_rate": 4.993434773297849e-05, "loss": 0.2418, "mean_token_accuracy": 0.9390652362257242, "num_tokens": 22343028.0, "step": 3010 }, { "entropy": 1.983953095972538, "epoch": 0.04518721553422754, "grad_norm": 0.2951551675796509, "learning_rate": 4.993347509526585e-05, "loss": 0.2402, "mean_token_accuracy": 0.942112996801734, "num_tokens": 22416955.0, "step": 3020 }, { "entropy": 1.970123067498207, "epoch": 0.045336842075731604, "grad_norm": 0.3634348213672638, "learning_rate": 4.993259670405115e-05, "loss": 0.2342, "mean_token_accuracy": 0.9429294042289257, "num_tokens": 22490319.0, "step": 3030 }, { "entropy": 1.9808405317366122, "epoch": 0.04548646861723567, "grad_norm": 0.28851082921028137, "learning_rate": 4.9931712559537505e-05, "loss": 0.2453, "mean_token_accuracy": 0.9430048204958439, "num_tokens": 22562914.0, "step": 3040 }, { "entropy": 1.9455489844083786, "epoch": 0.04563609515873973, "grad_norm": 0.2947673499584198, "learning_rate": 4.9930822661929326e-05, "loss": 0.2308, "mean_token_accuracy": 0.9434957057237625, "num_tokens": 22636390.0, "step": 3050 }, { "entropy": 1.9479838095605373, "epoch": 0.045785721700243795, "grad_norm": 0.39096105098724365, "learning_rate": 4.9929927011432395e-05, "loss": 0.263, "mean_token_accuracy": 0.9384656347334385, "num_tokens": 22711857.0, "step": 3060 }, { "entropy": 1.9661613628268242, "epoch": 0.045935348241747866, "grad_norm": 0.37372392416000366, "learning_rate": 4.99290256082538e-05, "loss": 0.2545, "mean_token_accuracy": 0.9406507927924395, "num_tokens": 22785524.0, "step": 3070 }, { "entropy": 1.9609551206231117, "epoch": 0.04608497478325193, "grad_norm": 0.45049989223480225, "learning_rate": 4.9928118452601955e-05, "loss": 0.2622, "mean_token_accuracy": 0.9391500268131494, "num_tokens": 22859637.0, "step": 3080 }, { "entropy": 1.9297973394393921, "epoch": 0.04623460132475599, "grad_norm": 0.4082679748535156, "learning_rate": 4.99272055446866e-05, "loss": 0.2302, "mean_token_accuracy": 0.9419586844742298, "num_tokens": 22934550.0, "step": 3090 }, { "entropy": 1.9703654855489732, "epoch": 0.04638422786626006, "grad_norm": 0.3543381094932556, "learning_rate": 4.992628688471884e-05, "loss": 0.2465, "mean_token_accuracy": 0.9391310147941112, "num_tokens": 23009118.0, "step": 3100 }, { "entropy": 1.9985708743333817, "epoch": 0.04653385440776412, "grad_norm": 0.40854477882385254, "learning_rate": 4.9925362472911055e-05, "loss": 0.2649, "mean_token_accuracy": 0.9377143040299416, "num_tokens": 23083327.0, "step": 3110 }, { "entropy": 1.9200824454426766, "epoch": 0.046683480949268184, "grad_norm": 0.3957577049732208, "learning_rate": 4.992443230947701e-05, "loss": 0.2403, "mean_token_accuracy": 0.9443641010671854, "num_tokens": 23155628.0, "step": 3120 }, { "entropy": 1.9159224435687066, "epoch": 0.04683310749077225, "grad_norm": 0.3775918185710907, "learning_rate": 4.9923496394631776e-05, "loss": 0.2317, "mean_token_accuracy": 0.9411398988217116, "num_tokens": 23228741.0, "step": 3130 }, { "entropy": 1.94199625775218, "epoch": 0.04698273403227632, "grad_norm": 0.3637406826019287, "learning_rate": 4.9922554728591744e-05, "loss": 0.2462, "mean_token_accuracy": 0.9387629423290491, "num_tokens": 23305232.0, "step": 3140 }, { "entropy": 1.9253748051822186, "epoch": 0.04713236057378038, "grad_norm": 0.31956860423088074, "learning_rate": 4.992160731157464e-05, "loss": 0.2621, "mean_token_accuracy": 0.9364793367683888, "num_tokens": 23376590.0, "step": 3150 }, { "entropy": 1.9512000434100627, "epoch": 0.047281987115284446, "grad_norm": 0.4387859106063843, "learning_rate": 4.992065414379953e-05, "loss": 0.2641, "mean_token_accuracy": 0.9401253160089255, "num_tokens": 23450042.0, "step": 3160 }, { "entropy": 1.9227629132568835, "epoch": 0.04743161365678851, "grad_norm": 0.3563423156738281, "learning_rate": 4.99196952254868e-05, "loss": 0.2424, "mean_token_accuracy": 0.9419966097921133, "num_tokens": 23524111.0, "step": 3170 }, { "entropy": 1.9600928090512753, "epoch": 0.047581240198292574, "grad_norm": 0.3269404172897339, "learning_rate": 4.991873055685817e-05, "loss": 0.2527, "mean_token_accuracy": 0.9378321200609208, "num_tokens": 23599342.0, "step": 3180 }, { "entropy": 1.9521087639033794, "epoch": 0.04773086673979664, "grad_norm": 0.3579699695110321, "learning_rate": 4.991776013813669e-05, "loss": 0.2408, "mean_token_accuracy": 0.9401014409959316, "num_tokens": 23673484.0, "step": 3190 }, { "entropy": 1.9315286450088025, "epoch": 0.0478804932813007, "grad_norm": 0.2909514605998993, "learning_rate": 4.9916783969546746e-05, "loss": 0.2497, "mean_token_accuracy": 0.9390591260045766, "num_tokens": 23746016.0, "step": 3200 }, { "entropy": 1.9777843527495862, "epoch": 0.048030119822804765, "grad_norm": 0.329152375459671, "learning_rate": 4.991580205131403e-05, "loss": 0.2459, "mean_token_accuracy": 0.938442450389266, "num_tokens": 23818892.0, "step": 3210 }, { "entropy": 1.9458057560026645, "epoch": 0.048179746364308836, "grad_norm": 0.3980790078639984, "learning_rate": 4.991481438366559e-05, "loss": 0.2445, "mean_token_accuracy": 0.9381002299487591, "num_tokens": 23890554.0, "step": 3220 }, { "entropy": 1.9495098195970058, "epoch": 0.0483293729058129, "grad_norm": 0.3794592320919037, "learning_rate": 4.991382096682978e-05, "loss": 0.2389, "mean_token_accuracy": 0.942136612161994, "num_tokens": 23963817.0, "step": 3230 }, { "entropy": 1.972213963419199, "epoch": 0.04847899944731696, "grad_norm": 0.3533346354961395, "learning_rate": 4.9912821801036305e-05, "loss": 0.2611, "mean_token_accuracy": 0.9350441813468933, "num_tokens": 24039361.0, "step": 3240 }, { "entropy": 1.9682801753282546, "epoch": 0.04862862598882103, "grad_norm": 0.2912701368331909, "learning_rate": 4.991181688651619e-05, "loss": 0.2312, "mean_token_accuracy": 0.9433543212711811, "num_tokens": 24114753.0, "step": 3250 }, { "entropy": 1.9753825806081295, "epoch": 0.04877825253032509, "grad_norm": 0.34170612692832947, "learning_rate": 4.9910806223501786e-05, "loss": 0.2673, "mean_token_accuracy": 0.9385187692940236, "num_tokens": 24189928.0, "step": 3260 }, { "entropy": 1.9833362840116024, "epoch": 0.048927879071829154, "grad_norm": 0.26108744740486145, "learning_rate": 4.990978981222679e-05, "loss": 0.239, "mean_token_accuracy": 0.9427099876105786, "num_tokens": 24262151.0, "step": 3270 }, { "entropy": 1.981126519292593, "epoch": 0.04907750561333322, "grad_norm": 0.40851423144340515, "learning_rate": 4.9908767652926195e-05, "loss": 0.276, "mean_token_accuracy": 0.9340423602610827, "num_tokens": 24336211.0, "step": 3280 }, { "entropy": 1.9556941881775856, "epoch": 0.04922713215483729, "grad_norm": 0.4202451705932617, "learning_rate": 4.990773974583635e-05, "loss": 0.2465, "mean_token_accuracy": 0.9392862305045128, "num_tokens": 24408083.0, "step": 3290 }, { "entropy": 1.9119682967662812, "epoch": 0.04937675869634135, "grad_norm": 0.40605074167251587, "learning_rate": 4.9906706091194926e-05, "loss": 0.255, "mean_token_accuracy": 0.9372483100742102, "num_tokens": 24481936.0, "step": 3300 }, { "entropy": 1.949040424823761, "epoch": 0.049526385237845416, "grad_norm": 0.3744630217552185, "learning_rate": 4.990566668924092e-05, "loss": 0.2558, "mean_token_accuracy": 0.9400570672005415, "num_tokens": 24555468.0, "step": 3310 }, { "entropy": 1.963760080933571, "epoch": 0.04967601177934948, "grad_norm": 0.4890027344226837, "learning_rate": 4.990462154021467e-05, "loss": 0.2477, "mean_token_accuracy": 0.9406858198344707, "num_tokens": 24629865.0, "step": 3320 }, { "entropy": 1.9702147126197815, "epoch": 0.049825638320853544, "grad_norm": 0.3138258457183838, "learning_rate": 4.990357064435781e-05, "loss": 0.2554, "mean_token_accuracy": 0.9399385418742895, "num_tokens": 24706306.0, "step": 3330 }, { "entropy": 1.9547279819846153, "epoch": 0.04997526486235761, "grad_norm": 0.3369857370853424, "learning_rate": 4.9902514001913356e-05, "loss": 0.2301, "mean_token_accuracy": 0.9401251390576363, "num_tokens": 24780087.0, "step": 3340 }, { "entropy": 1.9674689784646033, "epoch": 0.05012489140386167, "grad_norm": 0.3867260813713074, "learning_rate": 4.99014516131256e-05, "loss": 0.2689, "mean_token_accuracy": 0.9365192674100399, "num_tokens": 24852424.0, "step": 3350 }, { "entropy": 1.949245223402977, "epoch": 0.05027451794536574, "grad_norm": 0.3727648854255676, "learning_rate": 4.990038347824019e-05, "loss": 0.2427, "mean_token_accuracy": 0.9440439358353615, "num_tokens": 24928413.0, "step": 3360 }, { "entropy": 1.9658662863075733, "epoch": 0.050424144486869805, "grad_norm": 0.23317165672779083, "learning_rate": 4.98993095975041e-05, "loss": 0.2316, "mean_token_accuracy": 0.9429517719894648, "num_tokens": 25002984.0, "step": 3370 }, { "entropy": 1.977156399190426, "epoch": 0.05057377102837387, "grad_norm": 0.3376786410808563, "learning_rate": 4.989822997116564e-05, "loss": 0.2386, "mean_token_accuracy": 0.9428504556417465, "num_tokens": 25075234.0, "step": 3380 }, { "entropy": 1.9664802446961402, "epoch": 0.05072339756987793, "grad_norm": 0.3119570314884186, "learning_rate": 4.989714459947443e-05, "loss": 0.2412, "mean_token_accuracy": 0.9413769237697125, "num_tokens": 25150203.0, "step": 3390 }, { "entropy": 1.980876636505127, "epoch": 0.050873024111382, "grad_norm": 0.4399169683456421, "learning_rate": 4.989605348268141e-05, "loss": 0.2553, "mean_token_accuracy": 0.9360529657453298, "num_tokens": 25223559.0, "step": 3400 }, { "entropy": 2.018413391709328, "epoch": 0.05102265065288606, "grad_norm": 0.3952925503253937, "learning_rate": 4.9894956621038894e-05, "loss": 0.2555, "mean_token_accuracy": 0.9352204851806164, "num_tokens": 25296682.0, "step": 3410 }, { "entropy": 2.028859171271324, "epoch": 0.051172277194390124, "grad_norm": 0.3790878653526306, "learning_rate": 4.9893854014800486e-05, "loss": 0.2367, "mean_token_accuracy": 0.9425794787704944, "num_tokens": 25369214.0, "step": 3420 }, { "entropy": 1.9781946122646332, "epoch": 0.051321903735894195, "grad_norm": 0.2900044023990631, "learning_rate": 4.989274566422113e-05, "loss": 0.2187, "mean_token_accuracy": 0.9459357675164938, "num_tokens": 25446595.0, "step": 3430 }, { "entropy": 1.9665522664785384, "epoch": 0.05147153027739826, "grad_norm": 0.4413408935070038, "learning_rate": 4.989163156955708e-05, "loss": 0.2382, "mean_token_accuracy": 0.9435696020722389, "num_tokens": 25520219.0, "step": 3440 }, { "entropy": 1.908288972824812, "epoch": 0.05162115681890232, "grad_norm": 0.3438352644443512, "learning_rate": 4.989051173106596e-05, "loss": 0.2401, "mean_token_accuracy": 0.940539662912488, "num_tokens": 25595233.0, "step": 3450 }, { "entropy": 1.8754162169992923, "epoch": 0.051770783360406386, "grad_norm": 0.359891414642334, "learning_rate": 4.988938614900668e-05, "loss": 0.2433, "mean_token_accuracy": 0.9396415658295154, "num_tokens": 25669657.0, "step": 3460 }, { "entropy": 1.9030602879822254, "epoch": 0.05192040990191045, "grad_norm": 0.2997036576271057, "learning_rate": 4.988825482363949e-05, "loss": 0.2227, "mean_token_accuracy": 0.9442131035029888, "num_tokens": 25747011.0, "step": 3470 }, { "entropy": 1.9490637734532357, "epoch": 0.052070036443414514, "grad_norm": 0.3506845235824585, "learning_rate": 4.9887117755225986e-05, "loss": 0.2549, "mean_token_accuracy": 0.937953794375062, "num_tokens": 25825150.0, "step": 3480 }, { "entropy": 1.97315364331007, "epoch": 0.05221966298491858, "grad_norm": 0.3471989333629608, "learning_rate": 4.988597494402908e-05, "loss": 0.2394, "mean_token_accuracy": 0.9415992636233568, "num_tokens": 25898431.0, "step": 3490 }, { "entropy": 1.9594019860029221, "epoch": 0.05236928952642264, "grad_norm": 0.3337489068508148, "learning_rate": 4.9884826390313e-05, "loss": 0.2372, "mean_token_accuracy": 0.9380198605358601, "num_tokens": 25972525.0, "step": 3500 }, { "entropy": 1.9328558690845967, "epoch": 0.05251891606792671, "grad_norm": 0.33132368326187134, "learning_rate": 4.988367209434332e-05, "loss": 0.2426, "mean_token_accuracy": 0.9402026195079088, "num_tokens": 26045348.0, "step": 3510 }, { "entropy": 1.9625490367412568, "epoch": 0.052668542609430775, "grad_norm": 0.3778687119483948, "learning_rate": 4.9882512056386924e-05, "loss": 0.2397, "mean_token_accuracy": 0.9408181730657816, "num_tokens": 26118307.0, "step": 3520 }, { "entropy": 1.953147780895233, "epoch": 0.05281816915093484, "grad_norm": 0.2973726689815521, "learning_rate": 4.9881346276712036e-05, "loss": 0.2358, "mean_token_accuracy": 0.9435360737144947, "num_tokens": 26190337.0, "step": 3530 }, { "entropy": 1.9584115371108055, "epoch": 0.0529677956924389, "grad_norm": 0.2827855050563812, "learning_rate": 4.988017475558821e-05, "loss": 0.2192, "mean_token_accuracy": 0.9449221797287464, "num_tokens": 26264793.0, "step": 3540 }, { "entropy": 1.9118625171482564, "epoch": 0.05311742223394297, "grad_norm": 0.41689079999923706, "learning_rate": 4.987899749328632e-05, "loss": 0.2587, "mean_token_accuracy": 0.936268400400877, "num_tokens": 26341464.0, "step": 3550 }, { "entropy": 1.916252052038908, "epoch": 0.05326704877544703, "grad_norm": 0.4027631878852844, "learning_rate": 4.9877814490078576e-05, "loss": 0.2336, "mean_token_accuracy": 0.9422241192311048, "num_tokens": 26415016.0, "step": 3560 }, { "entropy": 1.9182971835136413, "epoch": 0.053416675316951094, "grad_norm": 0.31365469098091125, "learning_rate": 4.9876625746238504e-05, "loss": 0.2443, "mean_token_accuracy": 0.9404305092990398, "num_tokens": 26488861.0, "step": 3570 }, { "entropy": 1.9366491749882697, "epoch": 0.053566301858455165, "grad_norm": 0.3853353261947632, "learning_rate": 4.987543126204096e-05, "loss": 0.2384, "mean_token_accuracy": 0.9417268808931112, "num_tokens": 26562806.0, "step": 3580 }, { "entropy": 1.8875850826501845, "epoch": 0.05371592839995923, "grad_norm": 0.33684220910072327, "learning_rate": 4.987423103776213e-05, "loss": 0.2361, "mean_token_accuracy": 0.940117359906435, "num_tokens": 26639333.0, "step": 3590 }, { "entropy": 1.900030543655157, "epoch": 0.05386555494146329, "grad_norm": 0.469058632850647, "learning_rate": 4.987302507367953e-05, "loss": 0.2403, "mean_token_accuracy": 0.9396737739443779, "num_tokens": 26712277.0, "step": 3600 }, { "entropy": 1.898341841250658, "epoch": 0.054015181482967356, "grad_norm": 0.33390530943870544, "learning_rate": 4.9871813370071996e-05, "loss": 0.2444, "mean_token_accuracy": 0.9381330009549856, "num_tokens": 26785683.0, "step": 3610 }, { "entropy": 1.9147989459335804, "epoch": 0.05416480802447142, "grad_norm": 0.3603259325027466, "learning_rate": 4.987059592721971e-05, "loss": 0.2364, "mean_token_accuracy": 0.9395476449280977, "num_tokens": 26861265.0, "step": 3620 }, { "entropy": 1.9191819220781325, "epoch": 0.054314434565975483, "grad_norm": 0.362998366355896, "learning_rate": 4.986937274540415e-05, "loss": 0.2767, "mean_token_accuracy": 0.9337626721709966, "num_tokens": 26932032.0, "step": 3630 }, { "entropy": 1.9244706593453884, "epoch": 0.05446406110747955, "grad_norm": 0.3459271788597107, "learning_rate": 4.986814382490815e-05, "loss": 0.246, "mean_token_accuracy": 0.9372870121151209, "num_tokens": 27003386.0, "step": 3640 }, { "entropy": 1.8514331690967083, "epoch": 0.05461368764898362, "grad_norm": 0.3830394148826599, "learning_rate": 4.986690916601584e-05, "loss": 0.2451, "mean_token_accuracy": 0.9406349491328001, "num_tokens": 27075528.0, "step": 3650 }, { "entropy": 1.8538854002952576, "epoch": 0.05476331419048768, "grad_norm": 0.34492596983909607, "learning_rate": 4.986566876901272e-05, "loss": 0.2293, "mean_token_accuracy": 0.9423907049000263, "num_tokens": 27146246.0, "step": 3660 }, { "entropy": 1.8943463444709778, "epoch": 0.054912940731991745, "grad_norm": 0.3893425762653351, "learning_rate": 4.986442263418557e-05, "loss": 0.2591, "mean_token_accuracy": 0.9398513667285442, "num_tokens": 27219352.0, "step": 3670 }, { "entropy": 1.90275426954031, "epoch": 0.05506256727349581, "grad_norm": 0.3186204433441162, "learning_rate": 4.986317076182252e-05, "loss": 0.241, "mean_token_accuracy": 0.9398094248026609, "num_tokens": 27292169.0, "step": 3680 }, { "entropy": 1.89295661970973, "epoch": 0.05521219381499987, "grad_norm": 0.3565833270549774, "learning_rate": 4.986191315221305e-05, "loss": 0.2307, "mean_token_accuracy": 0.9422244787216186, "num_tokens": 27367443.0, "step": 3690 }, { "entropy": 1.8791549310088158, "epoch": 0.05536182035650394, "grad_norm": 0.45371511578559875, "learning_rate": 4.9860649805647916e-05, "loss": 0.241, "mean_token_accuracy": 0.9387322798371315, "num_tokens": 27442069.0, "step": 3700 }, { "entropy": 1.9195011377334594, "epoch": 0.055511446898008, "grad_norm": 0.3225381672382355, "learning_rate": 4.985938072241923e-05, "loss": 0.2539, "mean_token_accuracy": 0.9369510311633349, "num_tokens": 27515881.0, "step": 3710 }, { "entropy": 1.9253335848450661, "epoch": 0.05566107343951207, "grad_norm": 0.5452536940574646, "learning_rate": 4.985810590282044e-05, "loss": 0.2348, "mean_token_accuracy": 0.9448560155928135, "num_tokens": 27592786.0, "step": 3720 }, { "entropy": 1.9253989443182946, "epoch": 0.055810699981016135, "grad_norm": 0.3136405348777771, "learning_rate": 4.985682534714629e-05, "loss": 0.2424, "mean_token_accuracy": 0.940189252793789, "num_tokens": 27666386.0, "step": 3730 }, { "entropy": 1.9281807832419873, "epoch": 0.0559603265225202, "grad_norm": 0.41742774844169617, "learning_rate": 4.985553905569288e-05, "loss": 0.2425, "mean_token_accuracy": 0.9419995874166489, "num_tokens": 27742428.0, "step": 3740 }, { "entropy": 1.9063849180936814, "epoch": 0.05610995306402426, "grad_norm": 0.31059181690216064, "learning_rate": 4.985424702875761e-05, "loss": 0.2408, "mean_token_accuracy": 0.940650561451912, "num_tokens": 27815570.0, "step": 3750 }, { "entropy": 1.8901608169078827, "epoch": 0.056259579605528326, "grad_norm": 0.4291262924671173, "learning_rate": 4.9852949266639235e-05, "loss": 0.2563, "mean_token_accuracy": 0.9391410622745753, "num_tokens": 27889659.0, "step": 3760 }, { "entropy": 1.9381004966795445, "epoch": 0.05640920614703239, "grad_norm": 0.3584326207637787, "learning_rate": 4.985164576963782e-05, "loss": 0.2587, "mean_token_accuracy": 0.9343846295028925, "num_tokens": 27961781.0, "step": 3770 }, { "entropy": 1.916378176957369, "epoch": 0.05655883268853645, "grad_norm": 0.37283962965011597, "learning_rate": 4.985033653805474e-05, "loss": 0.2416, "mean_token_accuracy": 0.9426307030022144, "num_tokens": 28036183.0, "step": 3780 }, { "entropy": 1.8985804244875908, "epoch": 0.056708459230040524, "grad_norm": 0.3972907066345215, "learning_rate": 4.9849021572192725e-05, "loss": 0.2573, "mean_token_accuracy": 0.9418021123856306, "num_tokens": 28109572.0, "step": 3790 }, { "entropy": 1.9059590615332127, "epoch": 0.05685808577154459, "grad_norm": 0.3257286250591278, "learning_rate": 4.984770087235582e-05, "loss": 0.2573, "mean_token_accuracy": 0.939378260076046, "num_tokens": 28183142.0, "step": 3800 }, { "entropy": 1.9020070657134056, "epoch": 0.05700771231304865, "grad_norm": 0.39726758003234863, "learning_rate": 4.984637443884939e-05, "loss": 0.2444, "mean_token_accuracy": 0.9379778765141964, "num_tokens": 28257370.0, "step": 3810 }, { "entropy": 1.840514612942934, "epoch": 0.057157338854552715, "grad_norm": 0.32359281182289124, "learning_rate": 4.984504227198013e-05, "loss": 0.2358, "mean_token_accuracy": 0.9432802062481642, "num_tokens": 28332368.0, "step": 3820 }, { "entropy": 1.869798631966114, "epoch": 0.05730696539605678, "grad_norm": 0.31587567925453186, "learning_rate": 4.984370437205607e-05, "loss": 0.2382, "mean_token_accuracy": 0.9402122475206852, "num_tokens": 28407100.0, "step": 3830 }, { "entropy": 1.8917766630649566, "epoch": 0.05745659193756084, "grad_norm": 0.40083804726600647, "learning_rate": 4.984236073938653e-05, "loss": 0.2419, "mean_token_accuracy": 0.9402970679104328, "num_tokens": 28480749.0, "step": 3840 }, { "entropy": 1.8789951778948306, "epoch": 0.057606218479064907, "grad_norm": 0.3196074366569519, "learning_rate": 4.984101137428221e-05, "loss": 0.2412, "mean_token_accuracy": 0.9394728094339371, "num_tokens": 28554765.0, "step": 3850 }, { "entropy": 1.8740115396678447, "epoch": 0.05775584502056897, "grad_norm": 0.3753882348537445, "learning_rate": 4.983965627705509e-05, "loss": 0.2558, "mean_token_accuracy": 0.9367282748222351, "num_tokens": 28629446.0, "step": 3860 }, { "entropy": 1.8869989313185216, "epoch": 0.05790547156207304, "grad_norm": 0.3814742863178253, "learning_rate": 4.983829544801851e-05, "loss": 0.2253, "mean_token_accuracy": 0.9452599551528692, "num_tokens": 28703311.0, "step": 3870 }, { "entropy": 1.8878202758729459, "epoch": 0.058055098103577105, "grad_norm": 0.3436293303966522, "learning_rate": 4.9836928887487106e-05, "loss": 0.2533, "mean_token_accuracy": 0.9412954740226269, "num_tokens": 28776972.0, "step": 3880 }, { "entropy": 1.8694807685911656, "epoch": 0.05820472464508117, "grad_norm": 0.389157235622406, "learning_rate": 4.9835556595776847e-05, "loss": 0.2376, "mean_token_accuracy": 0.9456676706671715, "num_tokens": 28850053.0, "step": 3890 }, { "entropy": 1.87982322499156, "epoch": 0.05835435118658523, "grad_norm": 0.31380313634872437, "learning_rate": 4.983417857320504e-05, "loss": 0.2269, "mean_token_accuracy": 0.9432132378220558, "num_tokens": 28922425.0, "step": 3900 }, { "entropy": 1.8590649612247945, "epoch": 0.058503977728089296, "grad_norm": 0.3637663424015045, "learning_rate": 4.983279482009031e-05, "loss": 0.2426, "mean_token_accuracy": 0.9404452182352543, "num_tokens": 28995340.0, "step": 3910 }, { "entropy": 1.8628978118300439, "epoch": 0.05865360426959336, "grad_norm": 0.35162267088890076, "learning_rate": 4.983140533675259e-05, "loss": 0.2446, "mean_token_accuracy": 0.9394167732447386, "num_tokens": 29069607.0, "step": 3920 }, { "entropy": 1.8369179308414458, "epoch": 0.05880323081109742, "grad_norm": 0.31461086869239807, "learning_rate": 4.983001012351317e-05, "loss": 0.242, "mean_token_accuracy": 0.9363376252353192, "num_tokens": 29142999.0, "step": 3930 }, { "entropy": 1.8379734806716441, "epoch": 0.058952857352601494, "grad_norm": 0.3496672213077545, "learning_rate": 4.982860918069464e-05, "loss": 0.2452, "mean_token_accuracy": 0.9395245734602213, "num_tokens": 29214922.0, "step": 3940 }, { "entropy": 1.8410824812948703, "epoch": 0.05910248389410556, "grad_norm": 0.347578763961792, "learning_rate": 4.9827202508620925e-05, "loss": 0.2346, "mean_token_accuracy": 0.9396951891481876, "num_tokens": 29286862.0, "step": 3950 }, { "entropy": 1.8700770318508149, "epoch": 0.05925211043560962, "grad_norm": 0.35089391469955444, "learning_rate": 4.982579010761727e-05, "loss": 0.2277, "mean_token_accuracy": 0.9438132122159004, "num_tokens": 29360045.0, "step": 3960 }, { "entropy": 1.8578873306512833, "epoch": 0.059401736977113685, "grad_norm": 0.2721414268016815, "learning_rate": 4.982437197801025e-05, "loss": 0.2314, "mean_token_accuracy": 0.9455706175416708, "num_tokens": 29436980.0, "step": 3970 }, { "entropy": 1.9087005220353603, "epoch": 0.05955136351861775, "grad_norm": 0.35487714409828186, "learning_rate": 4.982294812012776e-05, "loss": 0.2388, "mean_token_accuracy": 0.9426407791674137, "num_tokens": 29511402.0, "step": 3980 }, { "entropy": 1.8990809462964535, "epoch": 0.05970099006012181, "grad_norm": 0.3005237579345703, "learning_rate": 4.9821518534299025e-05, "loss": 0.2317, "mean_token_accuracy": 0.9435649175196886, "num_tokens": 29584291.0, "step": 3990 }, { "entropy": 1.906662954390049, "epoch": 0.059850616601625876, "grad_norm": 0.321585088968277, "learning_rate": 4.98200832208546e-05, "loss": 0.23, "mean_token_accuracy": 0.9431164238601923, "num_tokens": 29660513.0, "step": 4000 }, { "epoch": 0.059850616601625876, "eval_entropy": 1.9211029508113862, "eval_loss": 0.2693643271923065, "eval_mean_token_accuracy": 0.9410648290872574, "eval_num_tokens": 29660513.0, "eval_runtime": 561.0424, "eval_samples_per_second": 35.648, "eval_steps_per_second": 8.912, "step": 4000 }, { "entropy": 1.9580626897513866, "epoch": 0.06000024314312995, "grad_norm": 0.33906257152557373, "learning_rate": 4.9818642180126326e-05, "loss": 0.2488, "mean_token_accuracy": 0.9397790495306253, "num_tokens": 29732049.0, "step": 4010 }, { "entropy": 1.9481628373265267, "epoch": 0.06014986968463401, "grad_norm": 0.3428041636943817, "learning_rate": 4.981719541244742e-05, "loss": 0.2431, "mean_token_accuracy": 0.9414982065558434, "num_tokens": 29806650.0, "step": 4020 }, { "entropy": 1.9589499995112418, "epoch": 0.060299496226138075, "grad_norm": 0.3266701400279999, "learning_rate": 4.9815742918152395e-05, "loss": 0.2333, "mean_token_accuracy": 0.9427565354853868, "num_tokens": 29880045.0, "step": 4030 }, { "entropy": 2.0066395208239554, "epoch": 0.06044912276764214, "grad_norm": 0.32896706461906433, "learning_rate": 4.98142846975771e-05, "loss": 0.2527, "mean_token_accuracy": 0.938217180967331, "num_tokens": 29955598.0, "step": 4040 }, { "entropy": 1.9241844139993192, "epoch": 0.0605987493091462, "grad_norm": 0.3056383728981018, "learning_rate": 4.981282075105868e-05, "loss": 0.2306, "mean_token_accuracy": 0.9437720611691475, "num_tokens": 30032127.0, "step": 4050 }, { "entropy": 1.944128804653883, "epoch": 0.060748375850650266, "grad_norm": 0.3432963788509369, "learning_rate": 4.9811351078935646e-05, "loss": 0.2459, "mean_token_accuracy": 0.939568443968892, "num_tokens": 30107810.0, "step": 4060 }, { "entropy": 1.9063711009919644, "epoch": 0.06089800239215433, "grad_norm": 0.3043891489505768, "learning_rate": 4.980987568154781e-05, "loss": 0.2344, "mean_token_accuracy": 0.9406748246401548, "num_tokens": 30182750.0, "step": 4070 }, { "entropy": 1.9449288852512836, "epoch": 0.0610476289336584, "grad_norm": 0.4303438067436218, "learning_rate": 4.980839455923631e-05, "loss": 0.2493, "mean_token_accuracy": 0.939748951792717, "num_tokens": 30254959.0, "step": 4080 }, { "entropy": 1.9096197232604026, "epoch": 0.061197255475162464, "grad_norm": 0.27646568417549133, "learning_rate": 4.98069077123436e-05, "loss": 0.2359, "mean_token_accuracy": 0.9440571941435337, "num_tokens": 30329785.0, "step": 4090 }, { "entropy": 1.8673910208046436, "epoch": 0.06134688201666653, "grad_norm": 0.38741955161094666, "learning_rate": 4.9805415141213474e-05, "loss": 0.2247, "mean_token_accuracy": 0.9482359036803245, "num_tokens": 30402091.0, "step": 4100 }, { "entropy": 1.9185664035379886, "epoch": 0.06149650855817059, "grad_norm": 0.3976614773273468, "learning_rate": 4.9803916846191034e-05, "loss": 0.2589, "mean_token_accuracy": 0.9383110739290714, "num_tokens": 30474609.0, "step": 4110 }, { "entropy": 1.922715900093317, "epoch": 0.061646135099674655, "grad_norm": 0.3446398079395294, "learning_rate": 4.980241282762272e-05, "loss": 0.2678, "mean_token_accuracy": 0.9369580764323473, "num_tokens": 30546762.0, "step": 4120 }, { "entropy": 1.9000771336257458, "epoch": 0.06179576164117872, "grad_norm": 0.4441876709461212, "learning_rate": 4.980090308585628e-05, "loss": 0.2552, "mean_token_accuracy": 0.9365449137985706, "num_tokens": 30619186.0, "step": 4130 }, { "entropy": 1.8724062703549862, "epoch": 0.06194538818268278, "grad_norm": 0.3932048976421356, "learning_rate": 4.979938762124079e-05, "loss": 0.2366, "mean_token_accuracy": 0.9402556151151658, "num_tokens": 30691989.0, "step": 4140 }, { "entropy": 1.9101918317377566, "epoch": 0.06209501472418685, "grad_norm": 0.2758844494819641, "learning_rate": 4.9797866434126666e-05, "loss": 0.2303, "mean_token_accuracy": 0.9434348590672016, "num_tokens": 30767718.0, "step": 4150 }, { "entropy": 1.9223548412322997, "epoch": 0.06224464126569092, "grad_norm": 0.2812887132167816, "learning_rate": 4.979633952486563e-05, "loss": 0.2253, "mean_token_accuracy": 0.9450450986623764, "num_tokens": 30843681.0, "step": 4160 }, { "entropy": 1.9239393167197705, "epoch": 0.06239426780719498, "grad_norm": 0.2662782669067383, "learning_rate": 4.979480689381072e-05, "loss": 0.2228, "mean_token_accuracy": 0.9442126482725144, "num_tokens": 30918853.0, "step": 4170 }, { "entropy": 1.9172519482672215, "epoch": 0.06254389434869904, "grad_norm": 0.303029328584671, "learning_rate": 4.979326854131631e-05, "loss": 0.2332, "mean_token_accuracy": 0.940716502815485, "num_tokens": 30993080.0, "step": 4180 }, { "entropy": 1.9151354059576988, "epoch": 0.06269352089020311, "grad_norm": 0.4333644509315491, "learning_rate": 4.979172446773812e-05, "loss": 0.2461, "mean_token_accuracy": 0.9411383211612702, "num_tokens": 31068735.0, "step": 4190 }, { "entropy": 1.9604038335382938, "epoch": 0.06284314743170717, "grad_norm": 0.4097864329814911, "learning_rate": 4.979017467343312e-05, "loss": 0.2506, "mean_token_accuracy": 0.9397956416010856, "num_tokens": 31141162.0, "step": 4200 }, { "entropy": 1.8810633726418018, "epoch": 0.06299277397321124, "grad_norm": 0.3743186295032501, "learning_rate": 4.978861915875969e-05, "loss": 0.2388, "mean_token_accuracy": 0.9427598867565393, "num_tokens": 31213978.0, "step": 4210 }, { "entropy": 1.8824913956224918, "epoch": 0.0631424005147153, "grad_norm": 0.2955774962902069, "learning_rate": 4.9787057924077484e-05, "loss": 0.2339, "mean_token_accuracy": 0.9435857642441988, "num_tokens": 31288342.0, "step": 4220 }, { "entropy": 1.8538796797394752, "epoch": 0.06329202705621936, "grad_norm": 0.3167761564254761, "learning_rate": 4.978549096974748e-05, "loss": 0.2316, "mean_token_accuracy": 0.9429129138588905, "num_tokens": 31361488.0, "step": 4230 }, { "entropy": 1.881327047944069, "epoch": 0.06344165359772343, "grad_norm": 0.40334591269493103, "learning_rate": 4.9783918296131973e-05, "loss": 0.2458, "mean_token_accuracy": 0.9413369856774807, "num_tokens": 31434544.0, "step": 4240 }, { "entropy": 1.8709825359284877, "epoch": 0.06359128013922749, "grad_norm": 0.27626362442970276, "learning_rate": 4.978233990359463e-05, "loss": 0.2337, "mean_token_accuracy": 0.9432210780680179, "num_tokens": 31507876.0, "step": 4250 }, { "entropy": 1.9080727517604827, "epoch": 0.06374090668073157, "grad_norm": 0.3503853380680084, "learning_rate": 4.978075579250037e-05, "loss": 0.2416, "mean_token_accuracy": 0.9407722063362598, "num_tokens": 31583559.0, "step": 4260 }, { "entropy": 1.8896555729210376, "epoch": 0.06389053322223563, "grad_norm": 0.34530365467071533, "learning_rate": 4.977916596321547e-05, "loss": 0.2196, "mean_token_accuracy": 0.9415797404944897, "num_tokens": 31657741.0, "step": 4270 }, { "entropy": 1.9040231756865977, "epoch": 0.0640401597637397, "grad_norm": 0.44108060002326965, "learning_rate": 4.977757041610756e-05, "loss": 0.2496, "mean_token_accuracy": 0.9391418494284153, "num_tokens": 31730918.0, "step": 4280 }, { "entropy": 1.8855786994099617, "epoch": 0.06418978630524376, "grad_norm": 0.3584171533584595, "learning_rate": 4.977596915154551e-05, "loss": 0.2665, "mean_token_accuracy": 0.9348370790481567, "num_tokens": 31803315.0, "step": 4290 }, { "entropy": 1.9131797283887864, "epoch": 0.06433941284674782, "grad_norm": 0.3626730740070343, "learning_rate": 4.97743621698996e-05, "loss": 0.25, "mean_token_accuracy": 0.9406764697283506, "num_tokens": 31876156.0, "step": 4300 }, { "entropy": 1.9199877955019473, "epoch": 0.06448903938825189, "grad_norm": 0.27058082818984985, "learning_rate": 4.977274947154138e-05, "loss": 0.244, "mean_token_accuracy": 0.9423986829817295, "num_tokens": 31950991.0, "step": 4310 }, { "entropy": 1.8883497402071954, "epoch": 0.06463866592975595, "grad_norm": 0.3384176194667816, "learning_rate": 4.9771131056843724e-05, "loss": 0.2273, "mean_token_accuracy": 0.9450034677982331, "num_tokens": 32026333.0, "step": 4320 }, { "entropy": 1.9000013411045074, "epoch": 0.06478829247126001, "grad_norm": 0.3558318614959717, "learning_rate": 4.976950692618085e-05, "loss": 0.2305, "mean_token_accuracy": 0.9452659148722887, "num_tokens": 32102885.0, "step": 4330 }, { "entropy": 1.9208225816488267, "epoch": 0.06493791901276408, "grad_norm": 0.3226587176322937, "learning_rate": 4.9767877079928284e-05, "loss": 0.2311, "mean_token_accuracy": 0.9421998880803585, "num_tokens": 32174416.0, "step": 4340 }, { "entropy": 1.8675618380308152, "epoch": 0.06508754555426814, "grad_norm": 0.3689481317996979, "learning_rate": 4.9766241518462874e-05, "loss": 0.2192, "mean_token_accuracy": 0.947725311666727, "num_tokens": 32247877.0, "step": 4350 }, { "entropy": 1.8768537603318691, "epoch": 0.0652371720957722, "grad_norm": 0.2900848984718323, "learning_rate": 4.97646002421628e-05, "loss": 0.2437, "mean_token_accuracy": 0.9417319141328335, "num_tokens": 32321876.0, "step": 4360 }, { "entropy": 1.907610397040844, "epoch": 0.06538679863727627, "grad_norm": 0.3418882489204407, "learning_rate": 4.976295325140753e-05, "loss": 0.2487, "mean_token_accuracy": 0.9372582565993071, "num_tokens": 32394379.0, "step": 4370 }, { "entropy": 1.9123635806143284, "epoch": 0.06553642517878033, "grad_norm": 0.43628475069999695, "learning_rate": 4.97613005465779e-05, "loss": 0.2349, "mean_token_accuracy": 0.9426358591765165, "num_tokens": 32467383.0, "step": 4380 }, { "entropy": 1.8834973566234112, "epoch": 0.0656860517202844, "grad_norm": 0.2998046875, "learning_rate": 4.975964212805605e-05, "loss": 0.2448, "mean_token_accuracy": 0.9394220065325498, "num_tokens": 32542653.0, "step": 4390 }, { "entropy": 1.8860047206282615, "epoch": 0.06583567826178846, "grad_norm": 0.3834998607635498, "learning_rate": 4.975797799622541e-05, "loss": 0.2393, "mean_token_accuracy": 0.9441626362502575, "num_tokens": 32616382.0, "step": 4400 }, { "entropy": 1.9164023026823997, "epoch": 0.06598530480329254, "grad_norm": 0.37270620465278625, "learning_rate": 4.9756308151470774e-05, "loss": 0.2462, "mean_token_accuracy": 0.9410018999129534, "num_tokens": 32691142.0, "step": 4410 }, { "entropy": 1.933480354398489, "epoch": 0.0661349313447966, "grad_norm": 0.3761358857154846, "learning_rate": 4.975463259417824e-05, "loss": 0.2374, "mean_token_accuracy": 0.9404208719730377, "num_tokens": 32767403.0, "step": 4420 }, { "entropy": 1.913258145749569, "epoch": 0.06628455788630067, "grad_norm": 0.337805837392807, "learning_rate": 4.9752951324735216e-05, "loss": 0.207, "mean_token_accuracy": 0.9482471570372581, "num_tokens": 32843360.0, "step": 4430 }, { "entropy": 1.9323188811540604, "epoch": 0.06643418442780473, "grad_norm": 0.3239274024963379, "learning_rate": 4.975126434353045e-05, "loss": 0.2511, "mean_token_accuracy": 0.9389578256756067, "num_tokens": 32919162.0, "step": 4440 }, { "entropy": 1.9385346911847592, "epoch": 0.0665838109693088, "grad_norm": 0.3355640470981598, "learning_rate": 4.9749571650954005e-05, "loss": 0.2317, "mean_token_accuracy": 0.9428307611495257, "num_tokens": 32992829.0, "step": 4450 }, { "entropy": 1.9614437215030194, "epoch": 0.06673343751081286, "grad_norm": 0.44857582449913025, "learning_rate": 4.974787324739726e-05, "loss": 0.2411, "mean_token_accuracy": 0.9421608041971922, "num_tokens": 33063288.0, "step": 4460 }, { "entropy": 1.946429282426834, "epoch": 0.06688306405231692, "grad_norm": 0.35896041989326477, "learning_rate": 4.974616913325291e-05, "loss": 0.235, "mean_token_accuracy": 0.9426769755780697, "num_tokens": 33136225.0, "step": 4470 }, { "entropy": 1.9726510286331176, "epoch": 0.06703269059382098, "grad_norm": 0.3772297501564026, "learning_rate": 4.974445930891498e-05, "loss": 0.2384, "mean_token_accuracy": 0.9419089809060097, "num_tokens": 33209274.0, "step": 4480 }, { "entropy": 1.9571030288934708, "epoch": 0.06718231713532505, "grad_norm": 0.29559776186943054, "learning_rate": 4.974274377477881e-05, "loss": 0.2485, "mean_token_accuracy": 0.9384094506502152, "num_tokens": 33286370.0, "step": 4490 }, { "entropy": 1.9689345449209212, "epoch": 0.06733194367682911, "grad_norm": 0.3302841782569885, "learning_rate": 4.9741022531241064e-05, "loss": 0.2437, "mean_token_accuracy": 0.9405658189207315, "num_tokens": 33359642.0, "step": 4500 }, { "entropy": 1.9485792152583599, "epoch": 0.06748157021833318, "grad_norm": 0.342250794172287, "learning_rate": 4.9739295578699726e-05, "loss": 0.2447, "mean_token_accuracy": 0.94135698415339, "num_tokens": 33432389.0, "step": 4510 }, { "entropy": 1.976430320739746, "epoch": 0.06763119675983724, "grad_norm": 0.3143739402294159, "learning_rate": 4.973756291755409e-05, "loss": 0.2361, "mean_token_accuracy": 0.9420891400426626, "num_tokens": 33506357.0, "step": 4520 }, { "entropy": 1.9461173094809054, "epoch": 0.0677808233013413, "grad_norm": 0.31003648042678833, "learning_rate": 4.9735824548204804e-05, "loss": 0.2345, "mean_token_accuracy": 0.943375562503934, "num_tokens": 33576244.0, "step": 4530 }, { "entropy": 1.9255486294627189, "epoch": 0.06793044984284537, "grad_norm": 0.32437863945961, "learning_rate": 4.9734080471053766e-05, "loss": 0.2559, "mean_token_accuracy": 0.936123200878501, "num_tokens": 33648987.0, "step": 4540 }, { "entropy": 1.926064107567072, "epoch": 0.06808007638434944, "grad_norm": 0.27620166540145874, "learning_rate": 4.973233068650427e-05, "loss": 0.2531, "mean_token_accuracy": 0.9400552168488503, "num_tokens": 33722361.0, "step": 4550 }, { "entropy": 1.954181769490242, "epoch": 0.06822970292585351, "grad_norm": 0.374869167804718, "learning_rate": 4.97305751949609e-05, "loss": 0.2529, "mean_token_accuracy": 0.9397334508597851, "num_tokens": 33796771.0, "step": 4560 }, { "entropy": 1.9658322371542454, "epoch": 0.06837932946735757, "grad_norm": 0.3029889762401581, "learning_rate": 4.972881399682953e-05, "loss": 0.2503, "mean_token_accuracy": 0.9371084406971931, "num_tokens": 33868061.0, "step": 4570 }, { "entropy": 1.9571785159409045, "epoch": 0.06852895600886164, "grad_norm": 0.3619020879268646, "learning_rate": 4.9727047092517406e-05, "loss": 0.2598, "mean_token_accuracy": 0.9366617169231176, "num_tokens": 33940960.0, "step": 4580 }, { "entropy": 1.9944537423551083, "epoch": 0.0686785825503657, "grad_norm": 0.3442176878452301, "learning_rate": 4.972527448243305e-05, "loss": 0.2579, "mean_token_accuracy": 0.9392837449908257, "num_tokens": 34015412.0, "step": 4590 }, { "entropy": 1.9306264266371727, "epoch": 0.06882820909186976, "grad_norm": 0.3249492645263672, "learning_rate": 4.972349616698633e-05, "loss": 0.2603, "mean_token_accuracy": 0.9352037813514471, "num_tokens": 34087841.0, "step": 4600 }, { "entropy": 1.9090164631605149, "epoch": 0.06897783563337383, "grad_norm": 0.32466474175453186, "learning_rate": 4.972171214658843e-05, "loss": 0.2361, "mean_token_accuracy": 0.9433791469782591, "num_tokens": 34160949.0, "step": 4610 }, { "entropy": 1.9303502015769483, "epoch": 0.06912746217487789, "grad_norm": 0.3015376031398773, "learning_rate": 4.9719922421651834e-05, "loss": 0.2278, "mean_token_accuracy": 0.9439161852002144, "num_tokens": 34236685.0, "step": 4620 }, { "entropy": 1.9393461249768733, "epoch": 0.06927708871638195, "grad_norm": 0.3473767936229706, "learning_rate": 4.971812699259037e-05, "loss": 0.2383, "mean_token_accuracy": 0.9448415026068687, "num_tokens": 34311219.0, "step": 4630 }, { "entropy": 1.9330279000103474, "epoch": 0.06942671525788602, "grad_norm": 0.32055577635765076, "learning_rate": 4.9716325859819166e-05, "loss": 0.2538, "mean_token_accuracy": 0.9369359739124775, "num_tokens": 34383649.0, "step": 4640 }, { "entropy": 1.944619643688202, "epoch": 0.06957634179939008, "grad_norm": 0.3436879515647888, "learning_rate": 4.971451902375468e-05, "loss": 0.2417, "mean_token_accuracy": 0.9436385996639729, "num_tokens": 34458687.0, "step": 4650 }, { "entropy": 1.918549082428217, "epoch": 0.06972596834089415, "grad_norm": 0.31978827714920044, "learning_rate": 4.9712706484814675e-05, "loss": 0.221, "mean_token_accuracy": 0.9425349283963442, "num_tokens": 34534267.0, "step": 4660 }, { "entropy": 1.9291232705116272, "epoch": 0.06987559488239821, "grad_norm": 0.35346803069114685, "learning_rate": 4.9710888243418254e-05, "loss": 0.2419, "mean_token_accuracy": 0.9415120765566826, "num_tokens": 34608941.0, "step": 4670 }, { "entropy": 1.9249104529619216, "epoch": 0.07002522142390227, "grad_norm": 0.33946138620376587, "learning_rate": 4.970906429998582e-05, "loss": 0.2327, "mean_token_accuracy": 0.9414967425167561, "num_tokens": 34683019.0, "step": 4680 }, { "entropy": 1.9437850728631019, "epoch": 0.07017484796540634, "grad_norm": 0.2985547184944153, "learning_rate": 4.970723465493911e-05, "loss": 0.2291, "mean_token_accuracy": 0.9441001638770103, "num_tokens": 34755852.0, "step": 4690 }, { "entropy": 1.9494875200092792, "epoch": 0.07032447450691041, "grad_norm": 0.30250322818756104, "learning_rate": 4.9705399308701155e-05, "loss": 0.2547, "mean_token_accuracy": 0.9400616712868214, "num_tokens": 34826628.0, "step": 4700 }, { "entropy": 1.93246788084507, "epoch": 0.07047410104841448, "grad_norm": 0.30346161127090454, "learning_rate": 4.970355826169633e-05, "loss": 0.2509, "mean_token_accuracy": 0.941434844583273, "num_tokens": 34903610.0, "step": 4710 }, { "entropy": 1.979282123595476, "epoch": 0.07062372758991854, "grad_norm": 0.32545796036720276, "learning_rate": 4.9701711514350324e-05, "loss": 0.2437, "mean_token_accuracy": 0.9423569910228252, "num_tokens": 34976043.0, "step": 4720 }, { "entropy": 1.9976098485291005, "epoch": 0.0707733541314226, "grad_norm": 0.29499551653862, "learning_rate": 4.969985906709012e-05, "loss": 0.2295, "mean_token_accuracy": 0.9449848659336567, "num_tokens": 35051988.0, "step": 4730 }, { "entropy": 1.9830034896731377, "epoch": 0.07092298067292667, "grad_norm": 0.3491571545600891, "learning_rate": 4.969800092034406e-05, "loss": 0.2342, "mean_token_accuracy": 0.9433895703405142, "num_tokens": 35125825.0, "step": 4740 }, { "entropy": 1.9787038072943688, "epoch": 0.07107260721443073, "grad_norm": 0.3343149721622467, "learning_rate": 4.969613707454176e-05, "loss": 0.2355, "mean_token_accuracy": 0.9429921254515647, "num_tokens": 35202607.0, "step": 4750 }, { "entropy": 1.9830503724515438, "epoch": 0.0712222337559348, "grad_norm": 0.3656123876571655, "learning_rate": 4.969426753011418e-05, "loss": 0.2473, "mean_token_accuracy": 0.9363072425127029, "num_tokens": 35275357.0, "step": 4760 }, { "entropy": 1.9816188909113408, "epoch": 0.07137186029743886, "grad_norm": 0.39292991161346436, "learning_rate": 4.96923922874936e-05, "loss": 0.2423, "mean_token_accuracy": 0.9393453326076269, "num_tokens": 35350908.0, "step": 4770 }, { "entropy": 1.9509979344904422, "epoch": 0.07152148683894292, "grad_norm": 0.3487650454044342, "learning_rate": 4.969051134711359e-05, "loss": 0.2204, "mean_token_accuracy": 0.9481784246861935, "num_tokens": 35425571.0, "step": 4780 }, { "entropy": 1.9890504203736783, "epoch": 0.07167111338044699, "grad_norm": 0.31558161973953247, "learning_rate": 4.968862470940908e-05, "loss": 0.2286, "mean_token_accuracy": 0.9430839359760285, "num_tokens": 35499792.0, "step": 4790 }, { "entropy": 1.9698636054992675, "epoch": 0.07182073992195105, "grad_norm": 0.328294038772583, "learning_rate": 4.968673237481629e-05, "loss": 0.2287, "mean_token_accuracy": 0.9435634694993495, "num_tokens": 35573835.0, "step": 4800 }, { "entropy": 1.952013086527586, "epoch": 0.07197036646345512, "grad_norm": 0.35859546065330505, "learning_rate": 4.968483434377275e-05, "loss": 0.2214, "mean_token_accuracy": 0.9411528706550598, "num_tokens": 35648542.0, "step": 4810 }, { "entropy": 1.9332124888896942, "epoch": 0.07211999300495918, "grad_norm": 0.4262755811214447, "learning_rate": 4.968293061671732e-05, "loss": 0.246, "mean_token_accuracy": 0.9411147557199001, "num_tokens": 35720285.0, "step": 4820 }, { "entropy": 1.9313638255000114, "epoch": 0.07226961954646324, "grad_norm": 0.3727905750274658, "learning_rate": 4.9681021194090185e-05, "loss": 0.2267, "mean_token_accuracy": 0.9433243900537491, "num_tokens": 35793312.0, "step": 4830 }, { "entropy": 1.913079208135605, "epoch": 0.07241924608796732, "grad_norm": 0.3264462351799011, "learning_rate": 4.9679106076332834e-05, "loss": 0.2382, "mean_token_accuracy": 0.9430547960102558, "num_tokens": 35865904.0, "step": 4840 }, { "entropy": 1.9382446803152562, "epoch": 0.07256887262947138, "grad_norm": 0.3025546669960022, "learning_rate": 4.9677185263888065e-05, "loss": 0.2384, "mean_token_accuracy": 0.9424657423049212, "num_tokens": 35937086.0, "step": 4850 }, { "entropy": 1.9100962474942207, "epoch": 0.07271849917097545, "grad_norm": 0.32135671377182007, "learning_rate": 4.967525875720002e-05, "loss": 0.2345, "mean_token_accuracy": 0.9452652603387832, "num_tokens": 36010741.0, "step": 4860 }, { "entropy": 1.961641325056553, "epoch": 0.07286812571247951, "grad_norm": 0.34906744956970215, "learning_rate": 4.9673326556714135e-05, "loss": 0.2319, "mean_token_accuracy": 0.9447276696562767, "num_tokens": 36085219.0, "step": 4870 }, { "entropy": 1.9557662114501, "epoch": 0.07301775225398358, "grad_norm": 0.2994137108325958, "learning_rate": 4.967138866287717e-05, "loss": 0.2377, "mean_token_accuracy": 0.9427169468253851, "num_tokens": 36159565.0, "step": 4880 }, { "entropy": 1.991092646867037, "epoch": 0.07316737879548764, "grad_norm": 0.26531320810317993, "learning_rate": 4.96694450761372e-05, "loss": 0.2305, "mean_token_accuracy": 0.9408191055059433, "num_tokens": 36235861.0, "step": 4890 }, { "entropy": 1.9640290170907975, "epoch": 0.0733170053369917, "grad_norm": 0.353287011384964, "learning_rate": 4.966749579694362e-05, "loss": 0.2359, "mean_token_accuracy": 0.9409853644669056, "num_tokens": 36309936.0, "step": 4900 }, { "entropy": 1.9747645497322082, "epoch": 0.07346663187849577, "grad_norm": 0.31028926372528076, "learning_rate": 4.966554082574713e-05, "loss": 0.235, "mean_token_accuracy": 0.9449014842510224, "num_tokens": 36382615.0, "step": 4910 }, { "entropy": 1.9454577811062337, "epoch": 0.07361625841999983, "grad_norm": 0.3836038112640381, "learning_rate": 4.9663580162999756e-05, "loss": 0.2369, "mean_token_accuracy": 0.9422901652753353, "num_tokens": 36456532.0, "step": 4920 }, { "entropy": 1.9163921058177948, "epoch": 0.0737658849615039, "grad_norm": 0.3939346373081207, "learning_rate": 4.966161380915485e-05, "loss": 0.2519, "mean_token_accuracy": 0.938479682803154, "num_tokens": 36529939.0, "step": 4930 }, { "entropy": 1.9082995057106018, "epoch": 0.07391551150300796, "grad_norm": 0.2836814820766449, "learning_rate": 4.965964176466705e-05, "loss": 0.2296, "mean_token_accuracy": 0.9436579316854476, "num_tokens": 36605787.0, "step": 4940 }, { "entropy": 1.9427552871406077, "epoch": 0.07406513804451202, "grad_norm": 0.34843355417251587, "learning_rate": 4.965766402999234e-05, "loss": 0.234, "mean_token_accuracy": 0.9426591526716948, "num_tokens": 36677430.0, "step": 4950 }, { "entropy": 1.9466373950242997, "epoch": 0.07421476458601609, "grad_norm": 0.3679488003253937, "learning_rate": 4.9655680605588006e-05, "loss": 0.2479, "mean_token_accuracy": 0.9395054552704096, "num_tokens": 36749568.0, "step": 4960 }, { "entropy": 1.9394116386771203, "epoch": 0.07436439112752015, "grad_norm": 0.4099727272987366, "learning_rate": 4.965369149191265e-05, "loss": 0.2449, "mean_token_accuracy": 0.9420007590204478, "num_tokens": 36821180.0, "step": 4970 }, { "entropy": 1.97816614061594, "epoch": 0.07451401766902423, "grad_norm": 0.4656299352645874, "learning_rate": 4.9651696689426184e-05, "loss": 0.2708, "mean_token_accuracy": 0.9330280151218175, "num_tokens": 36893246.0, "step": 4980 }, { "entropy": 2.0031517200171947, "epoch": 0.07466364421052829, "grad_norm": 0.37220248579978943, "learning_rate": 4.964969619858986e-05, "loss": 0.2537, "mean_token_accuracy": 0.9383817665278912, "num_tokens": 36967194.0, "step": 4990 }, { "entropy": 1.942775446921587, "epoch": 0.07481327075203235, "grad_norm": 0.40330421924591064, "learning_rate": 4.96476900198662e-05, "loss": 0.234, "mean_token_accuracy": 0.9421227253973484, "num_tokens": 37042692.0, "step": 5000 }, { "epoch": 0.07481327075203235, "eval_entropy": 1.9384293358087539, "eval_loss": 0.26564010977745056, "eval_mean_token_accuracy": 0.941402601313591, "eval_num_tokens": 37042692.0, "eval_runtime": 558.9942, "eval_samples_per_second": 35.779, "eval_steps_per_second": 8.945, "step": 5000 }, { "entropy": 1.9523049749433994, "epoch": 0.07496289729353642, "grad_norm": 0.37337055802345276, "learning_rate": 4.964567815371908e-05, "loss": 0.2468, "mean_token_accuracy": 0.9407647088170051, "num_tokens": 37114357.0, "step": 5010 }, { "entropy": 1.9687109090387822, "epoch": 0.07511252383504048, "grad_norm": 0.3207288086414337, "learning_rate": 4.964366060061369e-05, "loss": 0.2459, "mean_token_accuracy": 0.9407301295548678, "num_tokens": 37188298.0, "step": 5020 }, { "entropy": 1.9678151339292527, "epoch": 0.07526215037654455, "grad_norm": 0.31629714369773865, "learning_rate": 4.964163736101652e-05, "loss": 0.243, "mean_token_accuracy": 0.9395524870604277, "num_tokens": 37262808.0, "step": 5030 }, { "entropy": 1.954004179686308, "epoch": 0.07541177691804861, "grad_norm": 0.31784629821777344, "learning_rate": 4.963960843539537e-05, "loss": 0.2534, "mean_token_accuracy": 0.9376971654593944, "num_tokens": 37336289.0, "step": 5040 }, { "entropy": 1.9743161544203758, "epoch": 0.07556140345955267, "grad_norm": 0.3836459219455719, "learning_rate": 4.9637573824219375e-05, "loss": 0.2412, "mean_token_accuracy": 0.9393380101770162, "num_tokens": 37411951.0, "step": 5050 }, { "entropy": 1.9894124783575535, "epoch": 0.07571103000105674, "grad_norm": 0.3423228859901428, "learning_rate": 4.963553352795896e-05, "loss": 0.2445, "mean_token_accuracy": 0.9398914355784654, "num_tokens": 37485616.0, "step": 5060 }, { "entropy": 1.9735226832330226, "epoch": 0.0758606565425608, "grad_norm": 0.3276052474975586, "learning_rate": 4.963348754708589e-05, "loss": 0.2482, "mean_token_accuracy": 0.9390364356338978, "num_tokens": 37559606.0, "step": 5070 }, { "entropy": 1.9659298650920392, "epoch": 0.07601028308406486, "grad_norm": 0.41879716515541077, "learning_rate": 4.963143588207322e-05, "loss": 0.2304, "mean_token_accuracy": 0.9455731365829706, "num_tokens": 37634845.0, "step": 5080 }, { "entropy": 1.9751592963933944, "epoch": 0.07615990962556893, "grad_norm": 0.3498132526874542, "learning_rate": 4.9629378533395345e-05, "loss": 0.247, "mean_token_accuracy": 0.9400275968015194, "num_tokens": 37708543.0, "step": 5090 }, { "entropy": 1.9732576176524161, "epoch": 0.07630953616707299, "grad_norm": 0.3235454261302948, "learning_rate": 4.962731550152795e-05, "loss": 0.2417, "mean_token_accuracy": 0.9391399990767241, "num_tokens": 37783198.0, "step": 5100 }, { "entropy": 2.002301864326, "epoch": 0.07645916270857706, "grad_norm": 0.3621864318847656, "learning_rate": 4.962524678694804e-05, "loss": 0.2407, "mean_token_accuracy": 0.9401468854397536, "num_tokens": 37856991.0, "step": 5110 }, { "entropy": 1.989931981265545, "epoch": 0.07660878925008112, "grad_norm": 0.3116135895252228, "learning_rate": 4.962317239013396e-05, "loss": 0.2445, "mean_token_accuracy": 0.9416136592626572, "num_tokens": 37929877.0, "step": 5120 }, { "entropy": 2.010821530967951, "epoch": 0.0767584157915852, "grad_norm": 0.3892084062099457, "learning_rate": 4.962109231156534e-05, "loss": 0.2392, "mean_token_accuracy": 0.9446036618202924, "num_tokens": 38000683.0, "step": 5130 }, { "entropy": 1.9883898489177227, "epoch": 0.07690804233308926, "grad_norm": 0.3077300190925598, "learning_rate": 4.961900655172311e-05, "loss": 0.2413, "mean_token_accuracy": 0.9417524494230747, "num_tokens": 38071699.0, "step": 5140 }, { "entropy": 2.0000866375863553, "epoch": 0.07705766887459332, "grad_norm": 0.3600141704082489, "learning_rate": 4.961691511108956e-05, "loss": 0.235, "mean_token_accuracy": 0.9416221875697375, "num_tokens": 38146040.0, "step": 5150 }, { "entropy": 1.9977682903409004, "epoch": 0.07720729541609739, "grad_norm": 0.33522486686706543, "learning_rate": 4.9614817990148255e-05, "loss": 0.2424, "mean_token_accuracy": 0.9443767491728068, "num_tokens": 38218277.0, "step": 5160 }, { "entropy": 1.9936495140194892, "epoch": 0.07735692195760145, "grad_norm": 0.332469642162323, "learning_rate": 4.961271518938409e-05, "loss": 0.2358, "mean_token_accuracy": 0.9428583584725857, "num_tokens": 38291332.0, "step": 5170 }, { "entropy": 1.9607647128403187, "epoch": 0.07750654849910552, "grad_norm": 0.34432587027549744, "learning_rate": 4.961060670928328e-05, "loss": 0.2496, "mean_token_accuracy": 0.9383972018957139, "num_tokens": 38364775.0, "step": 5180 }, { "entropy": 1.9823058605194093, "epoch": 0.07765617504060958, "grad_norm": 0.33515360951423645, "learning_rate": 4.960849255033333e-05, "loss": 0.2314, "mean_token_accuracy": 0.9448011297732591, "num_tokens": 38437937.0, "step": 5190 }, { "entropy": 1.9763479329645635, "epoch": 0.07780580158211364, "grad_norm": 0.29226094484329224, "learning_rate": 4.960637271302307e-05, "loss": 0.2407, "mean_token_accuracy": 0.9391347020864487, "num_tokens": 38512553.0, "step": 5200 }, { "entropy": 1.9511084653437138, "epoch": 0.0779554281236177, "grad_norm": 0.361581027507782, "learning_rate": 4.9604247197842655e-05, "loss": 0.2326, "mean_token_accuracy": 0.9453748978674412, "num_tokens": 38585387.0, "step": 5210 }, { "entropy": 1.9513887643814087, "epoch": 0.07810505466512177, "grad_norm": 0.35784319043159485, "learning_rate": 4.960211600528353e-05, "loss": 0.2395, "mean_token_accuracy": 0.9431748818606138, "num_tokens": 38661364.0, "step": 5220 }, { "entropy": 1.952230542898178, "epoch": 0.07825468120662583, "grad_norm": 0.34889718890190125, "learning_rate": 4.959997913583847e-05, "loss": 0.2241, "mean_token_accuracy": 0.9445189233869314, "num_tokens": 38733358.0, "step": 5230 }, { "entropy": 1.9217127703130246, "epoch": 0.0784043077481299, "grad_norm": 0.36322370171546936, "learning_rate": 4.9597836590001565e-05, "loss": 0.2443, "mean_token_accuracy": 0.9428963247686625, "num_tokens": 38808135.0, "step": 5240 }, { "entropy": 1.9605079390108586, "epoch": 0.07855393428963396, "grad_norm": 0.34608060121536255, "learning_rate": 4.95956883682682e-05, "loss": 0.2448, "mean_token_accuracy": 0.9405039887875318, "num_tokens": 38882958.0, "step": 5250 }, { "entropy": 1.9740474626421929, "epoch": 0.07870356083113803, "grad_norm": 0.35976243019104004, "learning_rate": 4.959353447113508e-05, "loss": 0.2277, "mean_token_accuracy": 0.9449405457824469, "num_tokens": 38956921.0, "step": 5260 }, { "entropy": 1.9484592780470849, "epoch": 0.0788531873726421, "grad_norm": 0.26556944847106934, "learning_rate": 4.959137489910023e-05, "loss": 0.2458, "mean_token_accuracy": 0.943807503581047, "num_tokens": 39031270.0, "step": 5270 }, { "entropy": 2.014249498397112, "epoch": 0.07900281391414617, "grad_norm": 0.46005508303642273, "learning_rate": 4.958920965266298e-05, "loss": 0.2594, "mean_token_accuracy": 0.9358900990337133, "num_tokens": 39101910.0, "step": 5280 }, { "entropy": 2.0210400484502316, "epoch": 0.07915244045565023, "grad_norm": 0.33988428115844727, "learning_rate": 4.958703873232397e-05, "loss": 0.2382, "mean_token_accuracy": 0.9395722724497318, "num_tokens": 39176595.0, "step": 5290 }, { "entropy": 2.0097762353718283, "epoch": 0.0793020669971543, "grad_norm": 0.39646950364112854, "learning_rate": 4.958486213858517e-05, "loss": 0.2413, "mean_token_accuracy": 0.937994945794344, "num_tokens": 39251376.0, "step": 5300 }, { "entropy": 2.003940711170435, "epoch": 0.07945169353865836, "grad_norm": 0.3544342517852783, "learning_rate": 4.958267987194983e-05, "loss": 0.2453, "mean_token_accuracy": 0.9402030665427447, "num_tokens": 39324442.0, "step": 5310 }, { "entropy": 2.0033877596259115, "epoch": 0.07960132008016242, "grad_norm": 0.31247514486312866, "learning_rate": 4.9580491932922535e-05, "loss": 0.2518, "mean_token_accuracy": 0.9386104423552751, "num_tokens": 39395823.0, "step": 5320 }, { "entropy": 2.0228067748248577, "epoch": 0.07975094662166649, "grad_norm": 0.37067052721977234, "learning_rate": 4.957829832200918e-05, "loss": 0.251, "mean_token_accuracy": 0.9381369393318891, "num_tokens": 39468456.0, "step": 5330 }, { "entropy": 2.0012464843690396, "epoch": 0.07990057316317055, "grad_norm": 0.3133704364299774, "learning_rate": 4.957609903971695e-05, "loss": 0.2256, "mean_token_accuracy": 0.9442806579172611, "num_tokens": 39543603.0, "step": 5340 }, { "entropy": 2.020212238281965, "epoch": 0.08005019970467461, "grad_norm": 0.3086543381214142, "learning_rate": 4.957389408655439e-05, "loss": 0.2363, "mean_token_accuracy": 0.9423615679144859, "num_tokens": 39620108.0, "step": 5350 }, { "entropy": 2.020922037214041, "epoch": 0.08019982624617868, "grad_norm": 0.3234139680862427, "learning_rate": 4.957168346303129e-05, "loss": 0.2426, "mean_token_accuracy": 0.937639844045043, "num_tokens": 39693639.0, "step": 5360 }, { "entropy": 2.026205163449049, "epoch": 0.08034945278768274, "grad_norm": 0.3466288447380066, "learning_rate": 4.9569467169658805e-05, "loss": 0.2226, "mean_token_accuracy": 0.946575828641653, "num_tokens": 39769108.0, "step": 5370 }, { "entropy": 2.0180299304425717, "epoch": 0.0804990793291868, "grad_norm": 0.37291425466537476, "learning_rate": 4.956724520694938e-05, "loss": 0.2322, "mean_token_accuracy": 0.9410816390067339, "num_tokens": 39841327.0, "step": 5380 }, { "entropy": 1.9986849114298821, "epoch": 0.08064870587069087, "grad_norm": 0.3366378843784332, "learning_rate": 4.9565017575416766e-05, "loss": 0.2431, "mean_token_accuracy": 0.9397193849086761, "num_tokens": 39913557.0, "step": 5390 }, { "entropy": 1.9762165531516076, "epoch": 0.08079833241219493, "grad_norm": 0.3124225437641144, "learning_rate": 4.956278427557603e-05, "loss": 0.2276, "mean_token_accuracy": 0.9442578006535769, "num_tokens": 39988785.0, "step": 5400 }, { "entropy": 2.019265276193619, "epoch": 0.080947958953699, "grad_norm": 0.42172354459762573, "learning_rate": 4.956054530794357e-05, "loss": 0.233, "mean_token_accuracy": 0.9396452262997628, "num_tokens": 40062968.0, "step": 5410 }, { "entropy": 2.013544649630785, "epoch": 0.08109758549520307, "grad_norm": 0.3214823305606842, "learning_rate": 4.955830067303705e-05, "loss": 0.2332, "mean_token_accuracy": 0.9432305067777633, "num_tokens": 40136887.0, "step": 5420 }, { "entropy": 2.024566163122654, "epoch": 0.08124721203670714, "grad_norm": 0.3532926142215729, "learning_rate": 4.955605037137548e-05, "loss": 0.239, "mean_token_accuracy": 0.942586112394929, "num_tokens": 40209712.0, "step": 5430 }, { "entropy": 2.0255594074726107, "epoch": 0.0813968385782112, "grad_norm": 0.41796180605888367, "learning_rate": 4.955379440347917e-05, "loss": 0.2557, "mean_token_accuracy": 0.9389738377183676, "num_tokens": 40286893.0, "step": 5440 }, { "entropy": 2.0882167518138885, "epoch": 0.08154646511971526, "grad_norm": 0.34808599948883057, "learning_rate": 4.955153276986973e-05, "loss": 0.236, "mean_token_accuracy": 0.9430191822350025, "num_tokens": 40361321.0, "step": 5450 }, { "entropy": 2.1006139114499094, "epoch": 0.08169609166121933, "grad_norm": 0.30729398131370544, "learning_rate": 4.954926547107012e-05, "loss": 0.2241, "mean_token_accuracy": 0.943875466287136, "num_tokens": 40435218.0, "step": 5460 }, { "entropy": 2.0789404205977915, "epoch": 0.08184571820272339, "grad_norm": 0.325589656829834, "learning_rate": 4.954699250760455e-05, "loss": 0.2497, "mean_token_accuracy": 0.9384634628891945, "num_tokens": 40508045.0, "step": 5470 }, { "entropy": 2.0723202802240848, "epoch": 0.08199534474422746, "grad_norm": 0.3058010935783386, "learning_rate": 4.9544713879998564e-05, "loss": 0.2545, "mean_token_accuracy": 0.9395518653094769, "num_tokens": 40582044.0, "step": 5480 }, { "entropy": 2.0372195966541766, "epoch": 0.08214497128573152, "grad_norm": 0.3490447998046875, "learning_rate": 4.954242958877905e-05, "loss": 0.2474, "mean_token_accuracy": 0.9405687320977449, "num_tokens": 40656317.0, "step": 5490 }, { "entropy": 2.062868182361126, "epoch": 0.08229459782723558, "grad_norm": 0.3289259970188141, "learning_rate": 4.954013963447416e-05, "loss": 0.2558, "mean_token_accuracy": 0.9369831923395395, "num_tokens": 40729995.0, "step": 5500 }, { "entropy": 2.048599060624838, "epoch": 0.08244422436873965, "grad_norm": 0.4003506898880005, "learning_rate": 4.953784401761337e-05, "loss": 0.262, "mean_token_accuracy": 0.9353604279458523, "num_tokens": 40801691.0, "step": 5510 }, { "entropy": 2.0466851241886617, "epoch": 0.08259385091024371, "grad_norm": 0.41236403584480286, "learning_rate": 4.953554273872748e-05, "loss": 0.2418, "mean_token_accuracy": 0.9421020530164241, "num_tokens": 40874001.0, "step": 5520 }, { "entropy": 2.0186397559940814, "epoch": 0.08274347745174777, "grad_norm": 0.344412624835968, "learning_rate": 4.9533235798348574e-05, "loss": 0.2292, "mean_token_accuracy": 0.9436346687376499, "num_tokens": 40947083.0, "step": 5530 }, { "entropy": 1.9933625869452953, "epoch": 0.08289310399325184, "grad_norm": 0.31085333228111267, "learning_rate": 4.953092319701007e-05, "loss": 0.2378, "mean_token_accuracy": 0.9434937864542008, "num_tokens": 41027142.0, "step": 5540 }, { "entropy": 2.0093927189707754, "epoch": 0.0830427305347559, "grad_norm": 0.3440219759941101, "learning_rate": 4.952860493524667e-05, "loss": 0.2502, "mean_token_accuracy": 0.9372138548642397, "num_tokens": 41098733.0, "step": 5550 }, { "entropy": 2.027844003587961, "epoch": 0.08319235707625998, "grad_norm": 0.34315750002861023, "learning_rate": 4.95262810135944e-05, "loss": 0.2539, "mean_token_accuracy": 0.9384838346391916, "num_tokens": 41169492.0, "step": 5560 }, { "entropy": 2.0327657498419285, "epoch": 0.08334198361776404, "grad_norm": 0.39672374725341797, "learning_rate": 4.95239514325906e-05, "loss": 0.2512, "mean_token_accuracy": 0.9384131621569395, "num_tokens": 41240275.0, "step": 5570 }, { "entropy": 1.9282449886202813, "epoch": 0.0834916101592681, "grad_norm": 0.398840069770813, "learning_rate": 4.95216161927739e-05, "loss": 0.234, "mean_token_accuracy": 0.942188385128975, "num_tokens": 41317339.0, "step": 5580 }, { "entropy": 1.9656348302960396, "epoch": 0.08364123670077217, "grad_norm": 0.3682236075401306, "learning_rate": 4.951927529468426e-05, "loss": 0.2354, "mean_token_accuracy": 0.9423908315598964, "num_tokens": 41391614.0, "step": 5590 }, { "entropy": 2.007145520299673, "epoch": 0.08379086324227623, "grad_norm": 0.35073068737983704, "learning_rate": 4.951692873886292e-05, "loss": 0.2521, "mean_token_accuracy": 0.9389020580798387, "num_tokens": 41464448.0, "step": 5600 }, { "entropy": 2.042485027760267, "epoch": 0.0839404897837803, "grad_norm": 0.4515027701854706, "learning_rate": 4.951457652585246e-05, "loss": 0.244, "mean_token_accuracy": 0.9409322731196881, "num_tokens": 41537142.0, "step": 5610 }, { "entropy": 2.037228162586689, "epoch": 0.08409011632528436, "grad_norm": 0.3204001188278198, "learning_rate": 4.951221865619676e-05, "loss": 0.2432, "mean_token_accuracy": 0.9387986201792955, "num_tokens": 41612102.0, "step": 5620 }, { "entropy": 2.0044845595955847, "epoch": 0.08423974286678843, "grad_norm": 0.2963782250881195, "learning_rate": 4.950985513044098e-05, "loss": 0.2613, "mean_token_accuracy": 0.9353123210370541, "num_tokens": 41687261.0, "step": 5630 }, { "entropy": 2.0031675696372986, "epoch": 0.08438936940829249, "grad_norm": 0.357308030128479, "learning_rate": 4.9507485949131635e-05, "loss": 0.2364, "mean_token_accuracy": 0.9395338408648968, "num_tokens": 41757949.0, "step": 5640 }, { "entropy": 1.974797598272562, "epoch": 0.08453899594979655, "grad_norm": 0.30298322439193726, "learning_rate": 4.950511111281649e-05, "loss": 0.2299, "mean_token_accuracy": 0.9421533238142729, "num_tokens": 41834258.0, "step": 5650 }, { "entropy": 1.9879207871854305, "epoch": 0.08468862249130062, "grad_norm": 0.4356994330883026, "learning_rate": 4.950273062204468e-05, "loss": 0.2435, "mean_token_accuracy": 0.9419903133064509, "num_tokens": 41908789.0, "step": 5660 }, { "entropy": 2.0031319215893744, "epoch": 0.08483824903280468, "grad_norm": 0.29541149735450745, "learning_rate": 4.95003444773666e-05, "loss": 0.2221, "mean_token_accuracy": 0.9462953235954046, "num_tokens": 41983675.0, "step": 5670 }, { "entropy": 2.071229290217161, "epoch": 0.08498787557430874, "grad_norm": 0.29785752296447754, "learning_rate": 4.949795267933398e-05, "loss": 0.2344, "mean_token_accuracy": 0.9403899263590574, "num_tokens": 42057367.0, "step": 5680 }, { "entropy": 2.0707533314824103, "epoch": 0.08513750211581281, "grad_norm": 0.3975188434123993, "learning_rate": 4.949555522849983e-05, "loss": 0.2586, "mean_token_accuracy": 0.9354882039129734, "num_tokens": 42132310.0, "step": 5690 }, { "entropy": 2.0729260869324206, "epoch": 0.08528712865731687, "grad_norm": 0.3207266926765442, "learning_rate": 4.949315212541849e-05, "loss": 0.2351, "mean_token_accuracy": 0.9430180795490741, "num_tokens": 42206105.0, "step": 5700 }, { "entropy": 2.0568599477410316, "epoch": 0.08543675519882095, "grad_norm": 0.3376027047634125, "learning_rate": 4.949074337064561e-05, "loss": 0.2448, "mean_token_accuracy": 0.9385559841990471, "num_tokens": 42278607.0, "step": 5710 }, { "entropy": 2.0697998724877835, "epoch": 0.08558638174032501, "grad_norm": 0.3244185447692871, "learning_rate": 4.948832896473813e-05, "loss": 0.2476, "mean_token_accuracy": 0.9413168095052242, "num_tokens": 42353702.0, "step": 5720 }, { "entropy": 2.0488916143774984, "epoch": 0.08573600828182908, "grad_norm": 0.3531823456287384, "learning_rate": 4.9485908908254295e-05, "loss": 0.245, "mean_token_accuracy": 0.9425504431128502, "num_tokens": 42430596.0, "step": 5730 }, { "entropy": 2.0975300915539266, "epoch": 0.08588563482333314, "grad_norm": 0.39805126190185547, "learning_rate": 4.948348320175368e-05, "loss": 0.2475, "mean_token_accuracy": 0.9424961566925049, "num_tokens": 42503367.0, "step": 5740 }, { "entropy": 2.107554052770138, "epoch": 0.0860352613648372, "grad_norm": 0.41154301166534424, "learning_rate": 4.948105184579714e-05, "loss": 0.251, "mean_token_accuracy": 0.9398801486939192, "num_tokens": 42574116.0, "step": 5750 }, { "entropy": 2.051720730215311, "epoch": 0.08618488790634127, "grad_norm": 0.3699057698249817, "learning_rate": 4.947861484094686e-05, "loss": 0.225, "mean_token_accuracy": 0.9432928927242756, "num_tokens": 42648399.0, "step": 5760 }, { "entropy": 2.0431001022458077, "epoch": 0.08633451444784533, "grad_norm": 0.3378255367279053, "learning_rate": 4.947617218776631e-05, "loss": 0.2443, "mean_token_accuracy": 0.9411807004362345, "num_tokens": 42722007.0, "step": 5770 }, { "entropy": 2.063131057471037, "epoch": 0.0864841409893494, "grad_norm": 0.3617124557495117, "learning_rate": 4.947372388682027e-05, "loss": 0.2295, "mean_token_accuracy": 0.9455738935619593, "num_tokens": 42797193.0, "step": 5780 }, { "entropy": 2.038436956703663, "epoch": 0.08663376753085346, "grad_norm": 0.3896268606185913, "learning_rate": 4.947126993867485e-05, "loss": 0.2557, "mean_token_accuracy": 0.9403161965310574, "num_tokens": 42871297.0, "step": 5790 }, { "entropy": 2.0094648763537406, "epoch": 0.08678339407235752, "grad_norm": 0.314296692609787, "learning_rate": 4.946881034389741e-05, "loss": 0.2151, "mean_token_accuracy": 0.9473994500935078, "num_tokens": 42946020.0, "step": 5800 }, { "entropy": 2.0251397870481016, "epoch": 0.08693302061386159, "grad_norm": 0.3231901228427887, "learning_rate": 4.94663451030567e-05, "loss": 0.2424, "mean_token_accuracy": 0.9396975059062243, "num_tokens": 43017642.0, "step": 5810 }, { "entropy": 2.0104017682373523, "epoch": 0.08708264715536565, "grad_norm": 0.3585280478000641, "learning_rate": 4.946387421672269e-05, "loss": 0.2332, "mean_token_accuracy": 0.9434605691581964, "num_tokens": 43093091.0, "step": 5820 }, { "entropy": 2.0121307387948035, "epoch": 0.08723227369686971, "grad_norm": 0.3292883634567261, "learning_rate": 4.946139768546671e-05, "loss": 0.2372, "mean_token_accuracy": 0.9444511808454991, "num_tokens": 43166204.0, "step": 5830 }, { "entropy": 1.9911436684429646, "epoch": 0.08738190023837378, "grad_norm": 0.34359923005104065, "learning_rate": 4.945891550986137e-05, "loss": 0.2366, "mean_token_accuracy": 0.9435492575168609, "num_tokens": 43238420.0, "step": 5840 }, { "entropy": 2.0067301645874975, "epoch": 0.08753152677987786, "grad_norm": 0.4983045160770416, "learning_rate": 4.94564276904806e-05, "loss": 0.2418, "mean_token_accuracy": 0.9414449829608202, "num_tokens": 43313216.0, "step": 5850 }, { "entropy": 1.9915693342685699, "epoch": 0.08768115332138192, "grad_norm": 0.43152257800102234, "learning_rate": 4.9453934227899626e-05, "loss": 0.2236, "mean_token_accuracy": 0.943453136086464, "num_tokens": 43387416.0, "step": 5860 }, { "entropy": 1.9867277398705483, "epoch": 0.08783077986288598, "grad_norm": 0.3129936754703522, "learning_rate": 4.9451435122694973e-05, "loss": 0.2616, "mean_token_accuracy": 0.9379395052790642, "num_tokens": 43461449.0, "step": 5870 }, { "entropy": 2.008326721936464, "epoch": 0.08798040640439005, "grad_norm": 0.42647117376327515, "learning_rate": 4.94489303754445e-05, "loss": 0.2273, "mean_token_accuracy": 0.9424808446317912, "num_tokens": 43535580.0, "step": 5880 }, { "entropy": 2.0069543428719046, "epoch": 0.08813003294589411, "grad_norm": 0.3329504728317261, "learning_rate": 4.944641998672732e-05, "loss": 0.2255, "mean_token_accuracy": 0.9424146007746458, "num_tokens": 43613174.0, "step": 5890 }, { "entropy": 2.014348681271076, "epoch": 0.08827965948739817, "grad_norm": 0.3741479218006134, "learning_rate": 4.9443903957123904e-05, "loss": 0.2392, "mean_token_accuracy": 0.9430493362247944, "num_tokens": 43688837.0, "step": 5900 }, { "entropy": 1.9829587318003177, "epoch": 0.08842928602890224, "grad_norm": 0.3121398091316223, "learning_rate": 4.944138228721599e-05, "loss": 0.2415, "mean_token_accuracy": 0.9438747577369213, "num_tokens": 43762657.0, "step": 5910 }, { "entropy": 1.9873070389032363, "epoch": 0.0885789125704063, "grad_norm": 0.30037862062454224, "learning_rate": 4.943885497758664e-05, "loss": 0.2308, "mean_token_accuracy": 0.9449743703007698, "num_tokens": 43837696.0, "step": 5920 }, { "entropy": 2.0126344323158265, "epoch": 0.08872853911191037, "grad_norm": 0.32163476943969727, "learning_rate": 4.943632202882021e-05, "loss": 0.2394, "mean_token_accuracy": 0.9391754742711782, "num_tokens": 43912251.0, "step": 5930 }, { "entropy": 2.0232132084667684, "epoch": 0.08887816565341443, "grad_norm": 0.2829095721244812, "learning_rate": 4.943378344150235e-05, "loss": 0.2129, "mean_token_accuracy": 0.9450729068368673, "num_tokens": 43991186.0, "step": 5940 }, { "entropy": 2.000468822568655, "epoch": 0.08902779219491849, "grad_norm": 0.42535385489463806, "learning_rate": 4.943123921622004e-05, "loss": 0.2643, "mean_token_accuracy": 0.9356313236057758, "num_tokens": 44063806.0, "step": 5950 }, { "entropy": 1.9749486148357391, "epoch": 0.08917741873642256, "grad_norm": 0.38431838154792786, "learning_rate": 4.942868935356156e-05, "loss": 0.2427, "mean_token_accuracy": 0.945241916552186, "num_tokens": 44136549.0, "step": 5960 }, { "entropy": 2.006798943132162, "epoch": 0.08932704527792662, "grad_norm": 0.31501495838165283, "learning_rate": 4.942613385411646e-05, "loss": 0.2426, "mean_token_accuracy": 0.9401999864727258, "num_tokens": 44208111.0, "step": 5970 }, { "entropy": 2.007431797683239, "epoch": 0.08947667181943068, "grad_norm": 0.3073079288005829, "learning_rate": 4.942357271847565e-05, "loss": 0.2278, "mean_token_accuracy": 0.943475567176938, "num_tokens": 44283154.0, "step": 5980 }, { "entropy": 2.0305110827088355, "epoch": 0.08962629836093476, "grad_norm": 0.3918016254901886, "learning_rate": 4.9421005947231274e-05, "loss": 0.2546, "mean_token_accuracy": 0.9383151553571224, "num_tokens": 44358057.0, "step": 5990 }, { "entropy": 1.9553543254733086, "epoch": 0.08977592490243883, "grad_norm": 0.3829839527606964, "learning_rate": 4.941843354097682e-05, "loss": 0.2279, "mean_token_accuracy": 0.9453389849513769, "num_tokens": 44432302.0, "step": 6000 }, { "epoch": 0.08977592490243883, "eval_entropy": 1.9293144409894942, "eval_loss": 0.26288577914237976, "eval_mean_token_accuracy": 0.9420813955187798, "eval_num_tokens": 44432302.0, "eval_runtime": 560.6707, "eval_samples_per_second": 35.672, "eval_steps_per_second": 8.918, "step": 6000 }, { "entropy": 1.9387284755706786, "epoch": 0.08992555144394289, "grad_norm": 0.32174190878868103, "learning_rate": 4.9415855500307104e-05, "loss": 0.2346, "mean_token_accuracy": 0.9433124139904976, "num_tokens": 44506534.0, "step": 6010 }, { "entropy": 1.9512828953564167, "epoch": 0.09007517798544695, "grad_norm": 0.2995511293411255, "learning_rate": 4.9413271825818184e-05, "loss": 0.2266, "mean_token_accuracy": 0.9435870587825775, "num_tokens": 44583415.0, "step": 6020 }, { "entropy": 1.9721534483134746, "epoch": 0.09022480452695102, "grad_norm": 0.33534887433052063, "learning_rate": 4.941068251810747e-05, "loss": 0.2415, "mean_token_accuracy": 0.9367950152605772, "num_tokens": 44656778.0, "step": 6030 }, { "entropy": 1.9898998245596886, "epoch": 0.09037443106845508, "grad_norm": 0.33429473638534546, "learning_rate": 4.940808757777364e-05, "loss": 0.2223, "mean_token_accuracy": 0.9434578020125628, "num_tokens": 44731491.0, "step": 6040 }, { "entropy": 1.9694059766829013, "epoch": 0.09052405760995914, "grad_norm": 0.375367134809494, "learning_rate": 4.9405487005416706e-05, "loss": 0.2519, "mean_token_accuracy": 0.9395961355417967, "num_tokens": 44802695.0, "step": 6050 }, { "entropy": 1.982146967202425, "epoch": 0.09067368415146321, "grad_norm": 0.30514591932296753, "learning_rate": 4.940288080163796e-05, "loss": 0.233, "mean_token_accuracy": 0.9415478222072124, "num_tokens": 44876832.0, "step": 6060 }, { "entropy": 1.985879722237587, "epoch": 0.09082331069296727, "grad_norm": 0.38759467005729675, "learning_rate": 4.940026896704e-05, "loss": 0.2573, "mean_token_accuracy": 0.9363418877124786, "num_tokens": 44949594.0, "step": 6070 }, { "entropy": 1.985973409563303, "epoch": 0.09097293723447133, "grad_norm": 0.34681272506713867, "learning_rate": 4.939765150222673e-05, "loss": 0.2338, "mean_token_accuracy": 0.9444064289331436, "num_tokens": 45023824.0, "step": 6080 }, { "entropy": 1.9433952882885932, "epoch": 0.0911225637759754, "grad_norm": 0.2809903025627136, "learning_rate": 4.9395028407803356e-05, "loss": 0.2187, "mean_token_accuracy": 0.9462559569627047, "num_tokens": 45097998.0, "step": 6090 }, { "entropy": 1.9380916833877564, "epoch": 0.09127219031747946, "grad_norm": 0.33656659722328186, "learning_rate": 4.9392399684376386e-05, "loss": 0.2045, "mean_token_accuracy": 0.94820068590343, "num_tokens": 45175452.0, "step": 6100 }, { "entropy": 1.9890604570508004, "epoch": 0.09142181685898353, "grad_norm": 0.4189107418060303, "learning_rate": 4.9389765332553616e-05, "loss": 0.2374, "mean_token_accuracy": 0.9437408000230789, "num_tokens": 45247527.0, "step": 6110 }, { "entropy": 1.990535955131054, "epoch": 0.09157144340048759, "grad_norm": 0.4302513897418976, "learning_rate": 4.938712535294417e-05, "loss": 0.2388, "mean_token_accuracy": 0.9424699287861585, "num_tokens": 45319616.0, "step": 6120 }, { "entropy": 1.9907277204096316, "epoch": 0.09172106994199165, "grad_norm": 0.38890865445137024, "learning_rate": 4.9384479746158456e-05, "loss": 0.2328, "mean_token_accuracy": 0.943159457668662, "num_tokens": 45395938.0, "step": 6130 }, { "entropy": 2.0076694644987585, "epoch": 0.09187069648349573, "grad_norm": 0.3142847716808319, "learning_rate": 4.938182851280818e-05, "loss": 0.2387, "mean_token_accuracy": 0.9398007296025753, "num_tokens": 45470048.0, "step": 6140 }, { "entropy": 2.006206801533699, "epoch": 0.0920203230249998, "grad_norm": 0.29275137186050415, "learning_rate": 4.937917165350635e-05, "loss": 0.2309, "mean_token_accuracy": 0.9441610604524613, "num_tokens": 45547053.0, "step": 6150 }, { "entropy": 2.0174421705305576, "epoch": 0.09216994956650386, "grad_norm": 0.373707115650177, "learning_rate": 4.937650916886729e-05, "loss": 0.2382, "mean_token_accuracy": 0.942445170506835, "num_tokens": 45623274.0, "step": 6160 }, { "entropy": 2.057591637969017, "epoch": 0.09231957610800792, "grad_norm": 0.3343000113964081, "learning_rate": 4.9373841059506616e-05, "loss": 0.2637, "mean_token_accuracy": 0.9346455574035645, "num_tokens": 45696348.0, "step": 6170 }, { "entropy": 2.0000326104462145, "epoch": 0.09246920264951199, "grad_norm": 0.30674639344215393, "learning_rate": 4.9371167326041225e-05, "loss": 0.2029, "mean_token_accuracy": 0.950478482618928, "num_tokens": 45768484.0, "step": 6180 }, { "entropy": 1.9368852168321609, "epoch": 0.09261882919101605, "grad_norm": 0.30373847484588623, "learning_rate": 4.936848796908934e-05, "loss": 0.2173, "mean_token_accuracy": 0.9462162349373102, "num_tokens": 45844786.0, "step": 6190 }, { "entropy": 1.9643405690789222, "epoch": 0.09276845573252011, "grad_norm": 0.4404136538505554, "learning_rate": 4.9365802989270494e-05, "loss": 0.236, "mean_token_accuracy": 0.9428456198424101, "num_tokens": 45919576.0, "step": 6200 }, { "entropy": 1.9862743727862835, "epoch": 0.09291808227402418, "grad_norm": 0.3124238848686218, "learning_rate": 4.9363112387205473e-05, "loss": 0.2439, "mean_token_accuracy": 0.9411855451762676, "num_tokens": 45996903.0, "step": 6210 }, { "entropy": 2.018177844583988, "epoch": 0.09306770881552824, "grad_norm": 0.2903754711151123, "learning_rate": 4.936041616351641e-05, "loss": 0.2544, "mean_token_accuracy": 0.9379108726978302, "num_tokens": 46069089.0, "step": 6220 }, { "entropy": 2.010333774983883, "epoch": 0.0932173353570323, "grad_norm": 0.4018780589103699, "learning_rate": 4.935771431882671e-05, "loss": 0.2134, "mean_token_accuracy": 0.9473061062395572, "num_tokens": 46144505.0, "step": 6230 }, { "entropy": 2.02402925491333, "epoch": 0.09336696189853637, "grad_norm": 0.3372918367385864, "learning_rate": 4.93550068537611e-05, "loss": 0.2352, "mean_token_accuracy": 0.9411699272692203, "num_tokens": 46215836.0, "step": 6240 }, { "entropy": 1.9736057244241239, "epoch": 0.09351658844004043, "grad_norm": 0.38200995326042175, "learning_rate": 4.935229376894558e-05, "loss": 0.2172, "mean_token_accuracy": 0.9462323877960443, "num_tokens": 46291057.0, "step": 6250 }, { "entropy": 1.9556421659886838, "epoch": 0.0936662149815445, "grad_norm": 0.35541853308677673, "learning_rate": 4.934957506500748e-05, "loss": 0.2193, "mean_token_accuracy": 0.9449546594172716, "num_tokens": 46366432.0, "step": 6260 }, { "entropy": 1.9607943184673786, "epoch": 0.09381584152304856, "grad_norm": 0.410266637802124, "learning_rate": 4.934685074257539e-05, "loss": 0.223, "mean_token_accuracy": 0.9432656101882457, "num_tokens": 46440554.0, "step": 6270 }, { "entropy": 1.9585503987967967, "epoch": 0.09396546806455264, "grad_norm": 0.363657146692276, "learning_rate": 4.9344120802279245e-05, "loss": 0.2192, "mean_token_accuracy": 0.947188339009881, "num_tokens": 46516160.0, "step": 6280 }, { "entropy": 1.9898196868598461, "epoch": 0.0941150946060567, "grad_norm": 0.2982536554336548, "learning_rate": 4.9341385244750245e-05, "loss": 0.2744, "mean_token_accuracy": 0.9337642528116703, "num_tokens": 46587953.0, "step": 6290 }, { "entropy": 1.9880972765386105, "epoch": 0.09426472114756076, "grad_norm": 0.29255983233451843, "learning_rate": 4.933864407062089e-05, "loss": 0.2435, "mean_token_accuracy": 0.9409552097320557, "num_tokens": 46662000.0, "step": 6300 }, { "entropy": 2.0375262178480624, "epoch": 0.09441434768906483, "grad_norm": 0.4662066102027893, "learning_rate": 4.933589728052501e-05, "loss": 0.2498, "mean_token_accuracy": 0.9390021458268165, "num_tokens": 46735412.0, "step": 6310 }, { "entropy": 2.0049594908952715, "epoch": 0.09456397423056889, "grad_norm": 0.2765514552593231, "learning_rate": 4.9333144875097694e-05, "loss": 0.2322, "mean_token_accuracy": 0.9438918050378561, "num_tokens": 46808113.0, "step": 6320 }, { "entropy": 2.0338924795389177, "epoch": 0.09471360077207296, "grad_norm": 0.3255186080932617, "learning_rate": 4.9330386854975344e-05, "loss": 0.247, "mean_token_accuracy": 0.9402040060609579, "num_tokens": 46881369.0, "step": 6330 }, { "entropy": 1.9966701485216618, "epoch": 0.09486322731357702, "grad_norm": 0.30386269092559814, "learning_rate": 4.932762322079569e-05, "loss": 0.2341, "mean_token_accuracy": 0.9451959274709225, "num_tokens": 46956376.0, "step": 6340 }, { "entropy": 1.9982624724507332, "epoch": 0.09501285385508108, "grad_norm": 0.36091679334640503, "learning_rate": 4.9324853973197696e-05, "loss": 0.2454, "mean_token_accuracy": 0.9422937951982021, "num_tokens": 47028078.0, "step": 6350 }, { "entropy": 1.9810258775949479, "epoch": 0.09516248039658515, "grad_norm": 0.3851760923862457, "learning_rate": 4.9322079112821694e-05, "loss": 0.2363, "mean_token_accuracy": 0.9429064743220806, "num_tokens": 47104536.0, "step": 6360 }, { "entropy": 1.9813734114170074, "epoch": 0.09531210693808921, "grad_norm": 0.388179212808609, "learning_rate": 4.9319298640309266e-05, "loss": 0.2328, "mean_token_accuracy": 0.9423199363052845, "num_tokens": 47179926.0, "step": 6370 }, { "entropy": 2.0011019200086593, "epoch": 0.09546173347959327, "grad_norm": 0.3539544343948364, "learning_rate": 4.9316512556303315e-05, "loss": 0.2359, "mean_token_accuracy": 0.9431809086352587, "num_tokens": 47251731.0, "step": 6380 }, { "entropy": 2.0126077987253668, "epoch": 0.09561136002109734, "grad_norm": 0.4333111047744751, "learning_rate": 4.931372086144803e-05, "loss": 0.2294, "mean_token_accuracy": 0.9386585537344218, "num_tokens": 47325384.0, "step": 6390 }, { "entropy": 1.9916889756917953, "epoch": 0.0957609865626014, "grad_norm": 0.34524354338645935, "learning_rate": 4.931092355638888e-05, "loss": 0.2372, "mean_token_accuracy": 0.9421248972415924, "num_tokens": 47396632.0, "step": 6400 }, { "entropy": 1.978167374432087, "epoch": 0.09591061310410547, "grad_norm": 0.34311816096305847, "learning_rate": 4.930812064177267e-05, "loss": 0.2134, "mean_token_accuracy": 0.9490993659943342, "num_tokens": 47474205.0, "step": 6410 }, { "entropy": 1.9606876865029335, "epoch": 0.09606023964560953, "grad_norm": 0.34936586022377014, "learning_rate": 4.93053121182475e-05, "loss": 0.243, "mean_token_accuracy": 0.9431053284555674, "num_tokens": 47550583.0, "step": 6420 }, { "entropy": 1.9932142451405526, "epoch": 0.09620986618711361, "grad_norm": 0.35197606682777405, "learning_rate": 4.930249798646272e-05, "loss": 0.2284, "mean_token_accuracy": 0.9452523529529572, "num_tokens": 47623963.0, "step": 6430 }, { "entropy": 1.995342443138361, "epoch": 0.09635949272861767, "grad_norm": 0.3068597614765167, "learning_rate": 4.929967824706902e-05, "loss": 0.2212, "mean_token_accuracy": 0.9454005528241396, "num_tokens": 47699964.0, "step": 6440 }, { "entropy": 1.9946649871766566, "epoch": 0.09650911927012173, "grad_norm": 0.3088610768318176, "learning_rate": 4.9296852900718384e-05, "loss": 0.2229, "mean_token_accuracy": 0.9475109238177538, "num_tokens": 47772795.0, "step": 6450 }, { "entropy": 1.984515665471554, "epoch": 0.0966587458116258, "grad_norm": 0.30914172530174255, "learning_rate": 4.929402194806407e-05, "loss": 0.2305, "mean_token_accuracy": 0.9443839006125927, "num_tokens": 47848033.0, "step": 6460 }, { "entropy": 2.0005695804953576, "epoch": 0.09680837235312986, "grad_norm": 0.3280348479747772, "learning_rate": 4.9291185389760644e-05, "loss": 0.2569, "mean_token_accuracy": 0.9374136213213206, "num_tokens": 47919398.0, "step": 6470 }, { "entropy": 2.022176963090897, "epoch": 0.09695799889463393, "grad_norm": 0.38380885124206543, "learning_rate": 4.928834322646398e-05, "loss": 0.2601, "mean_token_accuracy": 0.9359345212578773, "num_tokens": 47990822.0, "step": 6480 }, { "entropy": 1.9818934887647628, "epoch": 0.09710762543613799, "grad_norm": 0.32045137882232666, "learning_rate": 4.928549545883122e-05, "loss": 0.2147, "mean_token_accuracy": 0.9456462956964969, "num_tokens": 48064169.0, "step": 6490 }, { "entropy": 1.949671220779419, "epoch": 0.09725725197764205, "grad_norm": 0.3448818027973175, "learning_rate": 4.928264208752083e-05, "loss": 0.2475, "mean_token_accuracy": 0.9426261276006699, "num_tokens": 48138143.0, "step": 6500 }, { "entropy": 2.039323177933693, "epoch": 0.09740687851914612, "grad_norm": 0.37154433131217957, "learning_rate": 4.9279783113192566e-05, "loss": 0.2406, "mean_token_accuracy": 0.9428331695497036, "num_tokens": 48209901.0, "step": 6510 }, { "entropy": 2.0142661474645136, "epoch": 0.09755650506065018, "grad_norm": 0.3720242381095886, "learning_rate": 4.9276918536507455e-05, "loss": 0.2508, "mean_token_accuracy": 0.9381663110107183, "num_tokens": 48284210.0, "step": 6520 }, { "entropy": 2.028626708686352, "epoch": 0.09770613160215424, "grad_norm": 0.30136674642562866, "learning_rate": 4.9274048358127855e-05, "loss": 0.2106, "mean_token_accuracy": 0.9460651658475399, "num_tokens": 48361854.0, "step": 6530 }, { "entropy": 2.04504976272583, "epoch": 0.09785575814365831, "grad_norm": 0.34556055068969727, "learning_rate": 4.927117257871739e-05, "loss": 0.2555, "mean_token_accuracy": 0.939410300552845, "num_tokens": 48435619.0, "step": 6540 }, { "entropy": 2.0802429869771, "epoch": 0.09800538468516237, "grad_norm": 0.477430522441864, "learning_rate": 4.926829119894101e-05, "loss": 0.2455, "mean_token_accuracy": 0.9387106411159039, "num_tokens": 48510356.0, "step": 6550 }, { "entropy": 2.036254157871008, "epoch": 0.09815501122666644, "grad_norm": 0.313973605632782, "learning_rate": 4.926540421946491e-05, "loss": 0.2318, "mean_token_accuracy": 0.943378721550107, "num_tokens": 48585360.0, "step": 6560 }, { "entropy": 2.0418919779360296, "epoch": 0.09830463776817051, "grad_norm": 0.3672398030757904, "learning_rate": 4.926251164095664e-05, "loss": 0.2328, "mean_token_accuracy": 0.942517563328147, "num_tokens": 48660057.0, "step": 6570 }, { "entropy": 2.020030361413956, "epoch": 0.09845426430967458, "grad_norm": 0.32402777671813965, "learning_rate": 4.9259613464085e-05, "loss": 0.2311, "mean_token_accuracy": 0.943076952546835, "num_tokens": 48735642.0, "step": 6580 }, { "entropy": 2.0081481248140336, "epoch": 0.09860389085117864, "grad_norm": 0.3028557300567627, "learning_rate": 4.9256709689520113e-05, "loss": 0.2332, "mean_token_accuracy": 0.9416884869337082, "num_tokens": 48810395.0, "step": 6590 }, { "entropy": 2.0543888948857782, "epoch": 0.0987535173926827, "grad_norm": 0.3846410810947418, "learning_rate": 4.9253800317933376e-05, "loss": 0.2309, "mean_token_accuracy": 0.9429361782968044, "num_tokens": 48884559.0, "step": 6600 }, { "entropy": 2.040348903089762, "epoch": 0.09890314393418677, "grad_norm": 0.3542161285877228, "learning_rate": 4.9250885349997475e-05, "loss": 0.2404, "mean_token_accuracy": 0.9424649070948362, "num_tokens": 48958458.0, "step": 6610 }, { "entropy": 2.0048602439463137, "epoch": 0.09905277047569083, "grad_norm": 0.4752148687839508, "learning_rate": 4.924796478638643e-05, "loss": 0.2055, "mean_token_accuracy": 0.9504819098860026, "num_tokens": 49033149.0, "step": 6620 }, { "entropy": 1.9980697922408581, "epoch": 0.0992023970171949, "grad_norm": 0.3800557255744934, "learning_rate": 4.92450386277755e-05, "loss": 0.235, "mean_token_accuracy": 0.9426403239369392, "num_tokens": 49107582.0, "step": 6630 }, { "entropy": 2.014701187610626, "epoch": 0.09935202355869896, "grad_norm": 0.45802465081214905, "learning_rate": 4.924210687484128e-05, "loss": 0.2557, "mean_token_accuracy": 0.9355220459401608, "num_tokens": 49180217.0, "step": 6640 }, { "entropy": 2.0101888939738273, "epoch": 0.09950165010020302, "grad_norm": 0.3397325873374939, "learning_rate": 4.9239169528261635e-05, "loss": 0.223, "mean_token_accuracy": 0.9464712228626013, "num_tokens": 49254377.0, "step": 6650 }, { "entropy": 2.0421974755823613, "epoch": 0.09965127664170709, "grad_norm": 0.33602818846702576, "learning_rate": 4.923622658871575e-05, "loss": 0.2542, "mean_token_accuracy": 0.939394386857748, "num_tokens": 49327405.0, "step": 6660 }, { "entropy": 2.0122411526739596, "epoch": 0.09980090318321115, "grad_norm": 0.37172049283981323, "learning_rate": 4.923327805688406e-05, "loss": 0.2385, "mean_token_accuracy": 0.9439492631703615, "num_tokens": 49401848.0, "step": 6670 }, { "entropy": 2.0287854827940466, "epoch": 0.09995052972471521, "grad_norm": 0.35554781556129456, "learning_rate": 4.923032393344834e-05, "loss": 0.223, "mean_token_accuracy": 0.945672607794404, "num_tokens": 49474409.0, "step": 6680 }, { "entropy": 2.03608126193285, "epoch": 0.10010015626621928, "grad_norm": 0.3851868808269501, "learning_rate": 4.9227364219091615e-05, "loss": 0.2421, "mean_token_accuracy": 0.9394014824181796, "num_tokens": 49548922.0, "step": 6690 }, { "entropy": 2.0229356065392494, "epoch": 0.10024978280772334, "grad_norm": 0.3415566682815552, "learning_rate": 4.922439891449824e-05, "loss": 0.2322, "mean_token_accuracy": 0.9406227465718985, "num_tokens": 49621389.0, "step": 6700 }, { "entropy": 2.00074597671628, "epoch": 0.1003994093492274, "grad_norm": 0.30600619316101074, "learning_rate": 4.9221428020353835e-05, "loss": 0.2471, "mean_token_accuracy": 0.9415341597050428, "num_tokens": 49693931.0, "step": 6710 }, { "entropy": 2.0129027239978314, "epoch": 0.10054903589073148, "grad_norm": 0.31415054202079773, "learning_rate": 4.921845153734533e-05, "loss": 0.2496, "mean_token_accuracy": 0.9378685604780912, "num_tokens": 49767464.0, "step": 6720 }, { "entropy": 2.015584246814251, "epoch": 0.10069866243223555, "grad_norm": 0.2956080138683319, "learning_rate": 4.921546946616095e-05, "loss": 0.2196, "mean_token_accuracy": 0.9437808439135551, "num_tokens": 49843885.0, "step": 6730 }, { "entropy": 2.0356770806014537, "epoch": 0.10084828897373961, "grad_norm": 0.37869328260421753, "learning_rate": 4.921248180749019e-05, "loss": 0.2473, "mean_token_accuracy": 0.9398470185697079, "num_tokens": 49918791.0, "step": 6740 }, { "entropy": 2.0189469158649445, "epoch": 0.10099791551524367, "grad_norm": 0.29984787106513977, "learning_rate": 4.920948856202384e-05, "loss": 0.222, "mean_token_accuracy": 0.94599115177989, "num_tokens": 49992104.0, "step": 6750 }, { "entropy": 2.006312221288681, "epoch": 0.10114754205674774, "grad_norm": 0.3130849003791809, "learning_rate": 4.9206489730454014e-05, "loss": 0.2223, "mean_token_accuracy": 0.9456872925162315, "num_tokens": 50069858.0, "step": 6760 }, { "entropy": 2.044386038184166, "epoch": 0.1012971685982518, "grad_norm": 0.38148391246795654, "learning_rate": 4.9203485313474076e-05, "loss": 0.2245, "mean_token_accuracy": 0.9435559201985597, "num_tokens": 50144641.0, "step": 6770 }, { "entropy": 2.033870132267475, "epoch": 0.10144679513975587, "grad_norm": 0.3582657277584076, "learning_rate": 4.920047531177872e-05, "loss": 0.2132, "mean_token_accuracy": 0.9445033177733422, "num_tokens": 50217231.0, "step": 6780 }, { "entropy": 1.9934844501316547, "epoch": 0.10159642168125993, "grad_norm": 0.3550463914871216, "learning_rate": 4.91974597260639e-05, "loss": 0.2231, "mean_token_accuracy": 0.9455395940691232, "num_tokens": 50292031.0, "step": 6790 }, { "entropy": 1.997012511640787, "epoch": 0.101746048222764, "grad_norm": 0.4058363735675812, "learning_rate": 4.919443855702688e-05, "loss": 0.2467, "mean_token_accuracy": 0.940946352109313, "num_tokens": 50366730.0, "step": 6800 }, { "entropy": 2.0200984247028826, "epoch": 0.10189567476426806, "grad_norm": 0.2931559085845947, "learning_rate": 4.919141180536619e-05, "loss": 0.2406, "mean_token_accuracy": 0.9404024593532085, "num_tokens": 50438719.0, "step": 6810 }, { "entropy": 2.037948836386204, "epoch": 0.10204530130577212, "grad_norm": 0.35713475942611694, "learning_rate": 4.91883794717817e-05, "loss": 0.2372, "mean_token_accuracy": 0.9393110923469067, "num_tokens": 50511589.0, "step": 6820 }, { "entropy": 2.049623614549637, "epoch": 0.10219492784727618, "grad_norm": 0.3255009353160858, "learning_rate": 4.918534155697451e-05, "loss": 0.2459, "mean_token_accuracy": 0.9414567947387695, "num_tokens": 50583939.0, "step": 6830 }, { "entropy": 2.045039141178131, "epoch": 0.10234455438878025, "grad_norm": 0.4031001329421997, "learning_rate": 4.918229806164705e-05, "loss": 0.2483, "mean_token_accuracy": 0.9433498054742813, "num_tokens": 50661354.0, "step": 6840 }, { "entropy": 2.021258094161749, "epoch": 0.10249418093028431, "grad_norm": 0.37417805194854736, "learning_rate": 4.917924898650303e-05, "loss": 0.2599, "mean_token_accuracy": 0.937105530500412, "num_tokens": 50733094.0, "step": 6850 }, { "entropy": 2.0340081468224525, "epoch": 0.10264380747178839, "grad_norm": 0.30731359124183655, "learning_rate": 4.9176194332247456e-05, "loss": 0.2176, "mean_token_accuracy": 0.9450399167835712, "num_tokens": 50808446.0, "step": 6860 }, { "entropy": 2.046274674683809, "epoch": 0.10279343401329245, "grad_norm": 0.3464275598526001, "learning_rate": 4.917313409958661e-05, "loss": 0.2248, "mean_token_accuracy": 0.9422964431345463, "num_tokens": 50882222.0, "step": 6870 }, { "entropy": 2.0226226963102816, "epoch": 0.10294306055479652, "grad_norm": 0.27297133207321167, "learning_rate": 4.9170068289228085e-05, "loss": 0.2452, "mean_token_accuracy": 0.9412497516721487, "num_tokens": 50957201.0, "step": 6880 }, { "entropy": 2.015940083563328, "epoch": 0.10309268709630058, "grad_norm": 0.4369887411594391, "learning_rate": 4.916699690188074e-05, "loss": 0.2267, "mean_token_accuracy": 0.9450420372188091, "num_tokens": 51032750.0, "step": 6890 }, { "entropy": 2.0171053767204286, "epoch": 0.10324231363780464, "grad_norm": 0.3672684133052826, "learning_rate": 4.916391993825473e-05, "loss": 0.2468, "mean_token_accuracy": 0.940800667181611, "num_tokens": 51104672.0, "step": 6900 }, { "entropy": 2.0696181930601596, "epoch": 0.10339194017930871, "grad_norm": 0.3166293799877167, "learning_rate": 4.916083739906151e-05, "loss": 0.2024, "mean_token_accuracy": 0.947877299413085, "num_tokens": 51181356.0, "step": 6910 }, { "entropy": 2.035859489440918, "epoch": 0.10354156672081277, "grad_norm": 0.3044778108596802, "learning_rate": 4.915774928501382e-05, "loss": 0.2242, "mean_token_accuracy": 0.9431015502661466, "num_tokens": 51254789.0, "step": 6920 }, { "entropy": 2.018730130046606, "epoch": 0.10369119326231684, "grad_norm": 0.32537880539894104, "learning_rate": 4.9154655596825685e-05, "loss": 0.2148, "mean_token_accuracy": 0.9445736270397902, "num_tokens": 51330211.0, "step": 6930 }, { "entropy": 2.0382556296885013, "epoch": 0.1038408198038209, "grad_norm": 0.37756624817848206, "learning_rate": 4.915155633521243e-05, "loss": 0.2322, "mean_token_accuracy": 0.9416738353669644, "num_tokens": 51403345.0, "step": 6940 }, { "entropy": 2.0344260580837727, "epoch": 0.10399044634532496, "grad_norm": 0.312160849571228, "learning_rate": 4.914845150089064e-05, "loss": 0.2225, "mean_token_accuracy": 0.9483914408832789, "num_tokens": 51474987.0, "step": 6950 }, { "entropy": 2.000800547748804, "epoch": 0.10414007288682903, "grad_norm": 0.3466229736804962, "learning_rate": 4.9145341094578226e-05, "loss": 0.2179, "mean_token_accuracy": 0.9453424379229546, "num_tokens": 51549070.0, "step": 6960 }, { "entropy": 1.9574648439884186, "epoch": 0.10428969942833309, "grad_norm": 0.36725762486457825, "learning_rate": 4.914222511699435e-05, "loss": 0.2193, "mean_token_accuracy": 0.9428684048354625, "num_tokens": 51623393.0, "step": 6970 }, { "entropy": 1.9608295947313308, "epoch": 0.10443932596983715, "grad_norm": 0.37494465708732605, "learning_rate": 4.913910356885951e-05, "loss": 0.2518, "mean_token_accuracy": 0.9370633356273175, "num_tokens": 51696338.0, "step": 6980 }, { "entropy": 1.9949514374136925, "epoch": 0.10458895251134122, "grad_norm": 0.36238107085227966, "learning_rate": 4.913597645089544e-05, "loss": 0.2488, "mean_token_accuracy": 0.9397410385310649, "num_tokens": 51769611.0, "step": 6990 }, { "entropy": 1.959775475412607, "epoch": 0.10473857905284528, "grad_norm": 0.3562401235103607, "learning_rate": 4.913284376382518e-05, "loss": 0.2173, "mean_token_accuracy": 0.9438587129116058, "num_tokens": 51843379.0, "step": 7000 }, { "epoch": 0.10473857905284528, "eval_entropy": 1.956783408164978, "eval_loss": 0.26053309440612793, "eval_mean_token_accuracy": 0.9424084006667137, "eval_num_tokens": 51843379.0, "eval_runtime": 544.0839, "eval_samples_per_second": 36.759, "eval_steps_per_second": 9.19, "step": 7000 }, { "entropy": 1.9702783420681953, "epoch": 0.10488820559434936, "grad_norm": 0.34491923451423645, "learning_rate": 4.912970550837309e-05, "loss": 0.2234, "mean_token_accuracy": 0.9444088857620955, "num_tokens": 51918197.0, "step": 7010 }, { "entropy": 1.9687664464116097, "epoch": 0.10503783213585342, "grad_norm": 0.3593152165412903, "learning_rate": 4.912656168526477e-05, "loss": 0.2266, "mean_token_accuracy": 0.944999472796917, "num_tokens": 51993262.0, "step": 7020 }, { "entropy": 1.9813758581876755, "epoch": 0.10518745867735749, "grad_norm": 0.45141223073005676, "learning_rate": 4.912341229522713e-05, "loss": 0.2447, "mean_token_accuracy": 0.9380789436399937, "num_tokens": 52065539.0, "step": 7030 }, { "entropy": 1.9591349750757217, "epoch": 0.10533708521886155, "grad_norm": 0.36457210779190063, "learning_rate": 4.912025733898837e-05, "loss": 0.231, "mean_token_accuracy": 0.9424976810812951, "num_tokens": 52141131.0, "step": 7040 }, { "entropy": 1.934197022020817, "epoch": 0.10548671176036561, "grad_norm": 0.3280206620693207, "learning_rate": 4.9117096817277974e-05, "loss": 0.2416, "mean_token_accuracy": 0.9416973732411862, "num_tokens": 52212532.0, "step": 7050 }, { "entropy": 1.9187272541224956, "epoch": 0.10563633830186968, "grad_norm": 0.3634321093559265, "learning_rate": 4.91139307308267e-05, "loss": 0.2456, "mean_token_accuracy": 0.9398303527384997, "num_tokens": 52286821.0, "step": 7060 }, { "entropy": 1.9340363413095474, "epoch": 0.10578596484337374, "grad_norm": 0.35386034846305847, "learning_rate": 4.911075908036662e-05, "loss": 0.2261, "mean_token_accuracy": 0.9458859506994486, "num_tokens": 52358956.0, "step": 7070 }, { "entropy": 1.9237247727811337, "epoch": 0.1059355913848778, "grad_norm": 0.3665013015270233, "learning_rate": 4.910758186663106e-05, "loss": 0.2133, "mean_token_accuracy": 0.9463939022272825, "num_tokens": 52433096.0, "step": 7080 }, { "entropy": 1.92852555885911, "epoch": 0.10608521792638187, "grad_norm": 0.32665374875068665, "learning_rate": 4.910439909035465e-05, "loss": 0.2372, "mean_token_accuracy": 0.9428718138486147, "num_tokens": 52507270.0, "step": 7090 }, { "entropy": 1.9349713616073132, "epoch": 0.10623484446788593, "grad_norm": 0.29269692301750183, "learning_rate": 4.9101210752273316e-05, "loss": 0.2238, "mean_token_accuracy": 0.9449943996965885, "num_tokens": 52581430.0, "step": 7100 }, { "entropy": 1.9410242430865765, "epoch": 0.10638447100939, "grad_norm": 0.3780823349952698, "learning_rate": 4.909801685312425e-05, "loss": 0.2488, "mean_token_accuracy": 0.9380411934107542, "num_tokens": 52654274.0, "step": 7110 }, { "entropy": 1.9378709226846695, "epoch": 0.10653409755089406, "grad_norm": 0.36280402541160583, "learning_rate": 4.909481739364594e-05, "loss": 0.2337, "mean_token_accuracy": 0.9425738591700792, "num_tokens": 52728217.0, "step": 7120 }, { "entropy": 1.9600737757980824, "epoch": 0.10668372409239812, "grad_norm": 0.3633546531200409, "learning_rate": 4.909161237457816e-05, "loss": 0.2385, "mean_token_accuracy": 0.9408579252660274, "num_tokens": 52802991.0, "step": 7130 }, { "entropy": 1.9683450505137443, "epoch": 0.10683335063390219, "grad_norm": 0.35184985399246216, "learning_rate": 4.908840179666196e-05, "loss": 0.2358, "mean_token_accuracy": 0.941391246393323, "num_tokens": 52878767.0, "step": 7140 }, { "entropy": 1.971848327666521, "epoch": 0.10698297717540627, "grad_norm": 0.2789813280105591, "learning_rate": 4.9085185660639696e-05, "loss": 0.2325, "mean_token_accuracy": 0.9402335368096828, "num_tokens": 52952657.0, "step": 7150 }, { "entropy": 1.9906848222017288, "epoch": 0.10713260371691033, "grad_norm": 0.2769067883491516, "learning_rate": 4.908196396725498e-05, "loss": 0.2162, "mean_token_accuracy": 0.9459978934377432, "num_tokens": 53028466.0, "step": 7160 }, { "entropy": 1.9547665022313594, "epoch": 0.1072822302584144, "grad_norm": 0.3809768855571747, "learning_rate": 4.907873671725274e-05, "loss": 0.2394, "mean_token_accuracy": 0.9410716891288757, "num_tokens": 53103411.0, "step": 7170 }, { "entropy": 1.9816002301871776, "epoch": 0.10743185679991846, "grad_norm": 0.3421342074871063, "learning_rate": 4.9075503911379156e-05, "loss": 0.2375, "mean_token_accuracy": 0.9437227305024862, "num_tokens": 53175845.0, "step": 7180 }, { "entropy": 1.924488516151905, "epoch": 0.10758148334142252, "grad_norm": 0.37161052227020264, "learning_rate": 4.9072265550381726e-05, "loss": 0.2395, "mean_token_accuracy": 0.9412518728524446, "num_tokens": 53252165.0, "step": 7190 }, { "entropy": 1.949691928178072, "epoch": 0.10773110988292658, "grad_norm": 0.36173954606056213, "learning_rate": 4.9069021635009214e-05, "loss": 0.2111, "mean_token_accuracy": 0.9467463001608849, "num_tokens": 53327897.0, "step": 7200 }, { "entropy": 1.9609467647969723, "epoch": 0.10788073642443065, "grad_norm": 0.34035366773605347, "learning_rate": 4.906577216601168e-05, "loss": 0.2234, "mean_token_accuracy": 0.9427688263356686, "num_tokens": 53399947.0, "step": 7210 }, { "entropy": 1.9431313663721084, "epoch": 0.10803036296593471, "grad_norm": 0.37429338693618774, "learning_rate": 4.9062517144140416e-05, "loss": 0.2308, "mean_token_accuracy": 0.9409451283514499, "num_tokens": 53475080.0, "step": 7220 }, { "entropy": 1.9719017416238784, "epoch": 0.10817998950743878, "grad_norm": 0.3231341242790222, "learning_rate": 4.90592565701481e-05, "loss": 0.2314, "mean_token_accuracy": 0.9440370395779609, "num_tokens": 53550090.0, "step": 7230 }, { "entropy": 1.9454951584339142, "epoch": 0.10832961604894284, "grad_norm": 0.3078174889087677, "learning_rate": 4.905599044478859e-05, "loss": 0.2309, "mean_token_accuracy": 0.9440415371209383, "num_tokens": 53626682.0, "step": 7240 }, { "entropy": 1.9504641361534596, "epoch": 0.1084792425904469, "grad_norm": 0.427604615688324, "learning_rate": 4.90527187688171e-05, "loss": 0.233, "mean_token_accuracy": 0.9419248614460229, "num_tokens": 53699747.0, "step": 7250 }, { "entropy": 1.9466063216328622, "epoch": 0.10862886913195097, "grad_norm": 0.3223711848258972, "learning_rate": 4.904944154299009e-05, "loss": 0.2388, "mean_token_accuracy": 0.9433444648981094, "num_tokens": 53775107.0, "step": 7260 }, { "entropy": 1.9763004317879678, "epoch": 0.10877849567345503, "grad_norm": 0.3342854082584381, "learning_rate": 4.9046158768065295e-05, "loss": 0.2507, "mean_token_accuracy": 0.9385780848562717, "num_tokens": 53847138.0, "step": 7270 }, { "entropy": 1.9581170223653317, "epoch": 0.1089281222149591, "grad_norm": 0.3320242762565613, "learning_rate": 4.904287044480179e-05, "loss": 0.2289, "mean_token_accuracy": 0.9411128904670477, "num_tokens": 53922652.0, "step": 7280 }, { "entropy": 1.9770950928330422, "epoch": 0.10907774875646317, "grad_norm": 0.3976527452468872, "learning_rate": 4.903957657395986e-05, "loss": 0.2568, "mean_token_accuracy": 0.9363223131746053, "num_tokens": 53999118.0, "step": 7290 }, { "entropy": 1.9558130383491517, "epoch": 0.10922737529796724, "grad_norm": 0.3329937756061554, "learning_rate": 4.903627715630111e-05, "loss": 0.2316, "mean_token_accuracy": 0.9427610773593187, "num_tokens": 54072691.0, "step": 7300 }, { "entropy": 1.9647119984030723, "epoch": 0.1093770018394713, "grad_norm": 0.3223440945148468, "learning_rate": 4.9032972192588444e-05, "loss": 0.2134, "mean_token_accuracy": 0.9471665702760219, "num_tokens": 54147639.0, "step": 7310 }, { "entropy": 1.954242644459009, "epoch": 0.10952662838097536, "grad_norm": 0.4005436599254608, "learning_rate": 4.9029661683586016e-05, "loss": 0.2393, "mean_token_accuracy": 0.9430974654853344, "num_tokens": 54218787.0, "step": 7320 }, { "entropy": 1.9606421187520027, "epoch": 0.10967625492247943, "grad_norm": 0.382323682308197, "learning_rate": 4.902634563005927e-05, "loss": 0.2366, "mean_token_accuracy": 0.9392609771341085, "num_tokens": 54292462.0, "step": 7330 }, { "entropy": 2.00235248580575, "epoch": 0.10982588146398349, "grad_norm": 0.35012274980545044, "learning_rate": 4.9023024032774944e-05, "loss": 0.2528, "mean_token_accuracy": 0.9403872843831778, "num_tokens": 54366287.0, "step": 7340 }, { "entropy": 1.9762489810585975, "epoch": 0.10997550800548755, "grad_norm": 0.2740956246852875, "learning_rate": 4.901969689250105e-05, "loss": 0.2233, "mean_token_accuracy": 0.9452012725174427, "num_tokens": 54440711.0, "step": 7350 }, { "entropy": 1.970696920901537, "epoch": 0.11012513454699162, "grad_norm": 0.32421842217445374, "learning_rate": 4.901636421000687e-05, "loss": 0.2362, "mean_token_accuracy": 0.9400802738964558, "num_tokens": 54514526.0, "step": 7360 }, { "entropy": 1.9665995575487614, "epoch": 0.11027476108849568, "grad_norm": 0.32229533791542053, "learning_rate": 4.9013025986063e-05, "loss": 0.2348, "mean_token_accuracy": 0.9421021923422813, "num_tokens": 54587049.0, "step": 7370 }, { "entropy": 1.9783765882253648, "epoch": 0.11042438762999975, "grad_norm": 0.3116665184497833, "learning_rate": 4.9009682221441284e-05, "loss": 0.2357, "mean_token_accuracy": 0.9432570185512305, "num_tokens": 54660191.0, "step": 7380 }, { "entropy": 2.0220399662852286, "epoch": 0.11057401417150381, "grad_norm": 0.3588930368423462, "learning_rate": 4.900633291691486e-05, "loss": 0.2388, "mean_token_accuracy": 0.9432217977941036, "num_tokens": 54732859.0, "step": 7390 }, { "entropy": 1.9662847317755223, "epoch": 0.11072364071300787, "grad_norm": 0.30455639958381653, "learning_rate": 4.9002978073258156e-05, "loss": 0.2368, "mean_token_accuracy": 0.9416861586272717, "num_tokens": 54807109.0, "step": 7400 }, { "entropy": 1.9805108420550823, "epoch": 0.11087326725451194, "grad_norm": 0.26782509684562683, "learning_rate": 4.8999617691246855e-05, "loss": 0.2269, "mean_token_accuracy": 0.9467954777181149, "num_tokens": 54882861.0, "step": 7410 }, { "entropy": 1.9894406840205192, "epoch": 0.111022893796016, "grad_norm": 0.3435003459453583, "learning_rate": 4.899625177165795e-05, "loss": 0.2222, "mean_token_accuracy": 0.9434870753437281, "num_tokens": 54954654.0, "step": 7420 }, { "entropy": 1.9658081576228141, "epoch": 0.11117252033752006, "grad_norm": 0.28491100668907166, "learning_rate": 4.89928803152697e-05, "loss": 0.203, "mean_token_accuracy": 0.9494588177651166, "num_tokens": 55031006.0, "step": 7430 }, { "entropy": 1.9743023954331875, "epoch": 0.11132214687902414, "grad_norm": 0.405352383852005, "learning_rate": 4.898950332286165e-05, "loss": 0.2225, "mean_token_accuracy": 0.9441508024930954, "num_tokens": 55103646.0, "step": 7440 }, { "entropy": 1.976608407497406, "epoch": 0.1114717734205282, "grad_norm": 0.28956928849220276, "learning_rate": 4.89861207952146e-05, "loss": 0.2295, "mean_token_accuracy": 0.9423568956553936, "num_tokens": 55181490.0, "step": 7450 }, { "entropy": 2.0138902612030507, "epoch": 0.11162139996203227, "grad_norm": 0.32477277517318726, "learning_rate": 4.898273273311067e-05, "loss": 0.2541, "mean_token_accuracy": 0.935784287005663, "num_tokens": 55256383.0, "step": 7460 }, { "entropy": 2.026325400173664, "epoch": 0.11177102650353633, "grad_norm": 0.3543660342693329, "learning_rate": 4.897933913733323e-05, "loss": 0.2176, "mean_token_accuracy": 0.9479182921350002, "num_tokens": 55330447.0, "step": 7470 }, { "entropy": 2.013948369026184, "epoch": 0.1119206530450404, "grad_norm": 0.3204508423805237, "learning_rate": 4.897594000866696e-05, "loss": 0.2239, "mean_token_accuracy": 0.9439801510423422, "num_tokens": 55403850.0, "step": 7480 }, { "entropy": 1.9721547089517117, "epoch": 0.11207027958654446, "grad_norm": 0.2992527484893799, "learning_rate": 4.897253534789777e-05, "loss": 0.227, "mean_token_accuracy": 0.94583880007267, "num_tokens": 55480909.0, "step": 7490 }, { "entropy": 1.9615136340260506, "epoch": 0.11221990612804852, "grad_norm": 0.4126185178756714, "learning_rate": 4.896912515581289e-05, "loss": 0.2417, "mean_token_accuracy": 0.9408015914261341, "num_tokens": 55554786.0, "step": 7500 }, { "entropy": 1.9778620898723602, "epoch": 0.11236953266955259, "grad_norm": 0.3288714587688446, "learning_rate": 4.896570943320083e-05, "loss": 0.2533, "mean_token_accuracy": 0.9393782801926136, "num_tokens": 55628173.0, "step": 7510 }, { "entropy": 1.9640972554683684, "epoch": 0.11251915921105665, "grad_norm": 0.3483368158340454, "learning_rate": 4.896228818085135e-05, "loss": 0.2138, "mean_token_accuracy": 0.9465756364166736, "num_tokens": 55703220.0, "step": 7520 }, { "entropy": 1.9573802798986435, "epoch": 0.11266878575256072, "grad_norm": 0.39200565218925476, "learning_rate": 4.8958861399555514e-05, "loss": 0.224, "mean_token_accuracy": 0.945859632268548, "num_tokens": 55776846.0, "step": 7530 }, { "entropy": 1.9335975103080272, "epoch": 0.11281841229406478, "grad_norm": 0.35961753129959106, "learning_rate": 4.8955429090105645e-05, "loss": 0.2225, "mean_token_accuracy": 0.9464996080845595, "num_tokens": 55849750.0, "step": 7540 }, { "entropy": 1.9627510450780392, "epoch": 0.11296803883556884, "grad_norm": 0.3746900260448456, "learning_rate": 4.895199125329536e-05, "loss": 0.272, "mean_token_accuracy": 0.9338338285684585, "num_tokens": 55920487.0, "step": 7550 }, { "entropy": 2.0039441332221033, "epoch": 0.1131176653770729, "grad_norm": 0.39414066076278687, "learning_rate": 4.894854788991954e-05, "loss": 0.2426, "mean_token_accuracy": 0.9390516452491283, "num_tokens": 55992613.0, "step": 7560 }, { "entropy": 2.008208806812763, "epoch": 0.11326729191857697, "grad_norm": 0.37331703305244446, "learning_rate": 4.894509900077437e-05, "loss": 0.2245, "mean_token_accuracy": 0.9450124565511941, "num_tokens": 56068322.0, "step": 7570 }, { "entropy": 1.9876067832112312, "epoch": 0.11341691846008105, "grad_norm": 0.3615008294582367, "learning_rate": 4.894164458665728e-05, "loss": 0.2305, "mean_token_accuracy": 0.9443882420659065, "num_tokens": 56143571.0, "step": 7580 }, { "entropy": 1.949827364832163, "epoch": 0.11356654500158511, "grad_norm": 0.28961238265037537, "learning_rate": 4.8938184648366995e-05, "loss": 0.232, "mean_token_accuracy": 0.939967067539692, "num_tokens": 56219944.0, "step": 7590 }, { "entropy": 1.9500743009150028, "epoch": 0.11371617154308918, "grad_norm": 0.2952779531478882, "learning_rate": 4.893471918670351e-05, "loss": 0.2153, "mean_token_accuracy": 0.944991498067975, "num_tokens": 56295919.0, "step": 7600 }, { "entropy": 1.959369846433401, "epoch": 0.11386579808459324, "grad_norm": 0.36025580763816833, "learning_rate": 4.8931248202468116e-05, "loss": 0.2352, "mean_token_accuracy": 0.9389270719140768, "num_tokens": 56371871.0, "step": 7610 }, { "entropy": 1.911109447479248, "epoch": 0.1140154246260973, "grad_norm": 0.3745344877243042, "learning_rate": 4.892777169646335e-05, "loss": 0.2313, "mean_token_accuracy": 0.9435254398733377, "num_tokens": 56446458.0, "step": 7620 }, { "entropy": 1.9355987779796124, "epoch": 0.11416505116760137, "grad_norm": 0.31572961807250977, "learning_rate": 4.892428966949305e-05, "loss": 0.2334, "mean_token_accuracy": 0.9436810456216336, "num_tokens": 56522482.0, "step": 7630 }, { "entropy": 1.9828083612024785, "epoch": 0.11431467770910543, "grad_norm": 0.36202681064605713, "learning_rate": 4.892080212236232e-05, "loss": 0.255, "mean_token_accuracy": 0.9377515502274036, "num_tokens": 56595306.0, "step": 7640 }, { "entropy": 1.9993874795734883, "epoch": 0.1144643042506095, "grad_norm": 0.31084680557250977, "learning_rate": 4.891730905587755e-05, "loss": 0.214, "mean_token_accuracy": 0.9476212445646525, "num_tokens": 56668696.0, "step": 7650 }, { "entropy": 1.958421205729246, "epoch": 0.11461393079211356, "grad_norm": 0.3913757801055908, "learning_rate": 4.891381047084638e-05, "loss": 0.2575, "mean_token_accuracy": 0.9382905591279268, "num_tokens": 56740383.0, "step": 7660 }, { "entropy": 1.9506193578243256, "epoch": 0.11476355733361762, "grad_norm": 0.31375589966773987, "learning_rate": 4.891030636807777e-05, "loss": 0.2369, "mean_token_accuracy": 0.9412986893206835, "num_tokens": 56813692.0, "step": 7670 }, { "entropy": 1.951964906603098, "epoch": 0.11491318387512169, "grad_norm": 0.3148193657398224, "learning_rate": 4.890679674838191e-05, "loss": 0.2357, "mean_token_accuracy": 0.9430453546345234, "num_tokens": 56888009.0, "step": 7680 }, { "entropy": 1.9718525499105453, "epoch": 0.11506281041662575, "grad_norm": 0.40108856558799744, "learning_rate": 4.89032816125703e-05, "loss": 0.2589, "mean_token_accuracy": 0.9353983599692584, "num_tokens": 56961083.0, "step": 7690 }, { "entropy": 1.9764004416763783, "epoch": 0.11521243695812981, "grad_norm": 0.3184696435928345, "learning_rate": 4.88997609614557e-05, "loss": 0.229, "mean_token_accuracy": 0.9441411580890418, "num_tokens": 57032566.0, "step": 7700 }, { "entropy": 1.988452311605215, "epoch": 0.11536206349963388, "grad_norm": 0.3779258728027344, "learning_rate": 4.889623479585214e-05, "loss": 0.2488, "mean_token_accuracy": 0.9406640086323023, "num_tokens": 57105401.0, "step": 7710 }, { "entropy": 1.9512231409549714, "epoch": 0.11551169004113794, "grad_norm": 0.3697732985019684, "learning_rate": 4.889270311657494e-05, "loss": 0.2253, "mean_token_accuracy": 0.9416694547981024, "num_tokens": 57178212.0, "step": 7720 }, { "entropy": 1.9566611379384995, "epoch": 0.11566131658264202, "grad_norm": 0.300411581993103, "learning_rate": 4.888916592444068e-05, "loss": 0.229, "mean_token_accuracy": 0.9436910539865494, "num_tokens": 57253184.0, "step": 7730 }, { "entropy": 1.9884315066039562, "epoch": 0.11581094312414608, "grad_norm": 0.2767464220523834, "learning_rate": 4.8885623220267226e-05, "loss": 0.2316, "mean_token_accuracy": 0.9415495052933693, "num_tokens": 57324820.0, "step": 7740 }, { "entropy": 1.9842980623245239, "epoch": 0.11596056966565015, "grad_norm": 0.3031434714794159, "learning_rate": 4.8882075004873715e-05, "loss": 0.2318, "mean_token_accuracy": 0.9417913638055324, "num_tokens": 57401696.0, "step": 7750 }, { "entropy": 1.9897237218916417, "epoch": 0.11611019620715421, "grad_norm": 0.2866101861000061, "learning_rate": 4.8878521279080565e-05, "loss": 0.2104, "mean_token_accuracy": 0.9432899966835976, "num_tokens": 57477092.0, "step": 7760 }, { "entropy": 2.0056554906070234, "epoch": 0.11625982274865827, "grad_norm": 0.3836924433708191, "learning_rate": 4.887496204370944e-05, "loss": 0.2439, "mean_token_accuracy": 0.9392777111381292, "num_tokens": 57551545.0, "step": 7770 }, { "entropy": 1.984122658520937, "epoch": 0.11640944929016234, "grad_norm": 0.3618398904800415, "learning_rate": 4.8871397299583315e-05, "loss": 0.2206, "mean_token_accuracy": 0.9456167384982109, "num_tokens": 57627461.0, "step": 7780 }, { "entropy": 1.98211180716753, "epoch": 0.1165590758316664, "grad_norm": 0.31075379252433777, "learning_rate": 4.8867827047526416e-05, "loss": 0.2221, "mean_token_accuracy": 0.9441700298339128, "num_tokens": 57703230.0, "step": 7790 }, { "entropy": 1.975354964286089, "epoch": 0.11670870237317046, "grad_norm": 0.35607680678367615, "learning_rate": 4.8864251288364254e-05, "loss": 0.2392, "mean_token_accuracy": 0.9414236027747392, "num_tokens": 57777026.0, "step": 7800 }, { "entropy": 1.957238256931305, "epoch": 0.11685832891467453, "grad_norm": 0.2830517292022705, "learning_rate": 4.88606700229236e-05, "loss": 0.2206, "mean_token_accuracy": 0.9407104577869176, "num_tokens": 57854652.0, "step": 7810 }, { "entropy": 1.9861981220543385, "epoch": 0.11700795545617859, "grad_norm": 0.32007896900177, "learning_rate": 4.8857083252032516e-05, "loss": 0.2313, "mean_token_accuracy": 0.9444633319973945, "num_tokens": 57932134.0, "step": 7820 }, { "entropy": 2.0038851484656335, "epoch": 0.11715758199768266, "grad_norm": 0.3092794418334961, "learning_rate": 4.885349097652032e-05, "loss": 0.2424, "mean_token_accuracy": 0.9408882360905408, "num_tokens": 58006010.0, "step": 7830 }, { "entropy": 2.012570309638977, "epoch": 0.11730720853918672, "grad_norm": 0.3337852656841278, "learning_rate": 4.884989319721761e-05, "loss": 0.2461, "mean_token_accuracy": 0.9410578105598688, "num_tokens": 58078986.0, "step": 7840 }, { "entropy": 1.9848682075738906, "epoch": 0.11745683508069078, "grad_norm": 0.3809310495853424, "learning_rate": 4.884628991495626e-05, "loss": 0.2421, "mean_token_accuracy": 0.9422338467091322, "num_tokens": 58154694.0, "step": 7850 }, { "entropy": 1.9879748292267323, "epoch": 0.11760646162219485, "grad_norm": 0.38753095269203186, "learning_rate": 4.884268113056942e-05, "loss": 0.232, "mean_token_accuracy": 0.9426141887903213, "num_tokens": 58228951.0, "step": 7860 }, { "entropy": 2.008814745396376, "epoch": 0.11775608816369892, "grad_norm": 0.29451096057891846, "learning_rate": 4.883906684489148e-05, "loss": 0.2454, "mean_token_accuracy": 0.93609982393682, "num_tokens": 58305245.0, "step": 7870 }, { "entropy": 2.018505879491568, "epoch": 0.11790571470520299, "grad_norm": 0.38933372497558594, "learning_rate": 4.883544705875815e-05, "loss": 0.2287, "mean_token_accuracy": 0.9428345333784819, "num_tokens": 58379500.0, "step": 7880 }, { "entropy": 2.0120041079819204, "epoch": 0.11805534124670705, "grad_norm": 0.3472827970981598, "learning_rate": 4.8831821773006394e-05, "loss": 0.2351, "mean_token_accuracy": 0.9430873706936836, "num_tokens": 58452311.0, "step": 7890 }, { "entropy": 2.0061072528362276, "epoch": 0.11820496778821112, "grad_norm": 0.32910364866256714, "learning_rate": 4.882819098847442e-05, "loss": 0.2337, "mean_token_accuracy": 0.9434091363102197, "num_tokens": 58524760.0, "step": 7900 }, { "entropy": 1.942064929753542, "epoch": 0.11835459432971518, "grad_norm": 0.28931930661201477, "learning_rate": 4.8824554706001746e-05, "loss": 0.2287, "mean_token_accuracy": 0.9441337864845991, "num_tokens": 58600926.0, "step": 7910 }, { "entropy": 1.9873508840799332, "epoch": 0.11850422087121924, "grad_norm": 0.4340669810771942, "learning_rate": 4.882091292642913e-05, "loss": 0.2411, "mean_token_accuracy": 0.9440523099154234, "num_tokens": 58676526.0, "step": 7920 }, { "entropy": 2.007344464212656, "epoch": 0.1186538474127233, "grad_norm": 0.339648574590683, "learning_rate": 4.8817265650598636e-05, "loss": 0.2279, "mean_token_accuracy": 0.9427611395716667, "num_tokens": 58753103.0, "step": 7930 }, { "entropy": 2.018076355010271, "epoch": 0.11880347395422737, "grad_norm": 0.38849717378616333, "learning_rate": 4.8813612879353565e-05, "loss": 0.2493, "mean_token_accuracy": 0.9375931937247515, "num_tokens": 58825096.0, "step": 7940 }, { "entropy": 1.9962676964700221, "epoch": 0.11895310049573143, "grad_norm": 0.36552372574806213, "learning_rate": 4.880995461353852e-05, "loss": 0.2212, "mean_token_accuracy": 0.9422419529408217, "num_tokens": 58900156.0, "step": 7950 }, { "entropy": 2.0157137289643288, "epoch": 0.1191027270372355, "grad_norm": 0.435794472694397, "learning_rate": 4.880629085399934e-05, "loss": 0.2351, "mean_token_accuracy": 0.9419899836182595, "num_tokens": 58973674.0, "step": 7960 }, { "entropy": 2.025240730494261, "epoch": 0.11925235357873956, "grad_norm": 0.3175814747810364, "learning_rate": 4.8802621601583145e-05, "loss": 0.2372, "mean_token_accuracy": 0.942645663022995, "num_tokens": 59047924.0, "step": 7970 }, { "entropy": 2.038414245098829, "epoch": 0.11940198012024363, "grad_norm": 0.25668326020240784, "learning_rate": 4.879894685713835e-05, "loss": 0.2267, "mean_token_accuracy": 0.9440921753644943, "num_tokens": 59121408.0, "step": 7980 }, { "entropy": 2.007302012294531, "epoch": 0.11955160666174769, "grad_norm": 0.32251331210136414, "learning_rate": 4.879526662151461e-05, "loss": 0.2313, "mean_token_accuracy": 0.941983325779438, "num_tokens": 59195756.0, "step": 7990 }, { "entropy": 1.9465818949043752, "epoch": 0.11970123320325175, "grad_norm": 0.31368765234947205, "learning_rate": 4.8791580895562874e-05, "loss": 0.2121, "mean_token_accuracy": 0.9449691016227006, "num_tokens": 59269815.0, "step": 8000 }, { "epoch": 0.11970123320325175, "eval_entropy": 1.9632114042282105, "eval_loss": 0.2563895881175995, "eval_mean_token_accuracy": 0.9431099826931953, "eval_num_tokens": 59269815.0, "eval_runtime": 545.3533, "eval_samples_per_second": 36.673, "eval_steps_per_second": 9.168, "step": 8000 }, { "entropy": 1.9650651969015598, "epoch": 0.11985085974475582, "grad_norm": 0.2659401595592499, "learning_rate": 4.878788968013533e-05, "loss": 0.2181, "mean_token_accuracy": 0.944899171590805, "num_tokens": 59344461.0, "step": 8010 }, { "entropy": 1.991673719882965, "epoch": 0.1200004862862599, "grad_norm": 0.35998767614364624, "learning_rate": 4.878419297608546e-05, "loss": 0.2377, "mean_token_accuracy": 0.9390778996050357, "num_tokens": 59420050.0, "step": 8020 }, { "entropy": 1.937024176120758, "epoch": 0.12015011282776396, "grad_norm": 0.35680779814720154, "learning_rate": 4.878049078426802e-05, "loss": 0.2241, "mean_token_accuracy": 0.9437963265925646, "num_tokens": 59493562.0, "step": 8030 }, { "entropy": 1.9642414554953576, "epoch": 0.12029973936926802, "grad_norm": 0.35885006189346313, "learning_rate": 4.8776783105539e-05, "loss": 0.2231, "mean_token_accuracy": 0.9442583430558443, "num_tokens": 59566032.0, "step": 8040 }, { "entropy": 1.97511575371027, "epoch": 0.12044936591077209, "grad_norm": 0.30620771646499634, "learning_rate": 4.877306994075569e-05, "loss": 0.2191, "mean_token_accuracy": 0.9460680555552244, "num_tokens": 59638638.0, "step": 8050 }, { "entropy": 2.012221439927816, "epoch": 0.12059899245227615, "grad_norm": 0.3005710244178772, "learning_rate": 4.8769351290776646e-05, "loss": 0.235, "mean_token_accuracy": 0.9400858175009489, "num_tokens": 59712230.0, "step": 8060 }, { "entropy": 2.000872851908207, "epoch": 0.12074861899378021, "grad_norm": 0.3741800785064697, "learning_rate": 4.8765627156461676e-05, "loss": 0.2369, "mean_token_accuracy": 0.9425716027617455, "num_tokens": 59783956.0, "step": 8070 }, { "entropy": 1.9883229665458202, "epoch": 0.12089824553528428, "grad_norm": 0.2875189185142517, "learning_rate": 4.876189753867188e-05, "loss": 0.2275, "mean_token_accuracy": 0.9458576399832964, "num_tokens": 59857966.0, "step": 8080 }, { "entropy": 1.9670287810266018, "epoch": 0.12104787207678834, "grad_norm": 0.3263150751590729, "learning_rate": 4.875816243826961e-05, "loss": 0.2044, "mean_token_accuracy": 0.9494062159210443, "num_tokens": 59932912.0, "step": 8090 }, { "entropy": 1.9842902772128581, "epoch": 0.1211974986182924, "grad_norm": 0.388075590133667, "learning_rate": 4.875442185611848e-05, "loss": 0.2373, "mean_token_accuracy": 0.9413359355181455, "num_tokens": 60004261.0, "step": 8100 }, { "entropy": 2.007620833069086, "epoch": 0.12134712515979647, "grad_norm": 0.3924224376678467, "learning_rate": 4.8750675793083365e-05, "loss": 0.2405, "mean_token_accuracy": 0.9395794782787561, "num_tokens": 60076089.0, "step": 8110 }, { "entropy": 1.9913847222924232, "epoch": 0.12149675170130053, "grad_norm": 0.309541255235672, "learning_rate": 4.874692425003045e-05, "loss": 0.2233, "mean_token_accuracy": 0.9450324464589357, "num_tokens": 60151306.0, "step": 8120 }, { "entropy": 2.0059898398816585, "epoch": 0.1216463782428046, "grad_norm": 0.3752894401550293, "learning_rate": 4.8743167227827144e-05, "loss": 0.2476, "mean_token_accuracy": 0.9418621595948935, "num_tokens": 60223069.0, "step": 8130 }, { "entropy": 1.9932882629334927, "epoch": 0.12179600478430866, "grad_norm": 0.34809330105781555, "learning_rate": 4.8739404727342144e-05, "loss": 0.2446, "mean_token_accuracy": 0.9416219037026167, "num_tokens": 60295102.0, "step": 8140 }, { "entropy": 2.0084681786596774, "epoch": 0.12194563132581272, "grad_norm": 0.2914487421512604, "learning_rate": 4.8735636749445394e-05, "loss": 0.2355, "mean_token_accuracy": 0.9412002809345722, "num_tokens": 60368578.0, "step": 8150 }, { "entropy": 2.0299769453704357, "epoch": 0.1220952578673168, "grad_norm": 0.34598615765571594, "learning_rate": 4.8731863295008123e-05, "loss": 0.2472, "mean_token_accuracy": 0.9423439908772707, "num_tokens": 60441122.0, "step": 8160 }, { "entropy": 1.963605634868145, "epoch": 0.12224488440882086, "grad_norm": 0.25985008478164673, "learning_rate": 4.872808436490283e-05, "loss": 0.2332, "mean_token_accuracy": 0.9456941228359937, "num_tokens": 60516860.0, "step": 8170 }, { "entropy": 1.9466576144099235, "epoch": 0.12239451095032493, "grad_norm": 0.3242815434932709, "learning_rate": 4.8724299960003264e-05, "loss": 0.2404, "mean_token_accuracy": 0.9434987168759108, "num_tokens": 60590189.0, "step": 8180 }, { "entropy": 1.978720387071371, "epoch": 0.12254413749182899, "grad_norm": 0.3736899793148041, "learning_rate": 4.8720510081184445e-05, "loss": 0.2591, "mean_token_accuracy": 0.9377596624195575, "num_tokens": 60663502.0, "step": 8190 }, { "entropy": 1.9611873246729374, "epoch": 0.12269376403333306, "grad_norm": 0.3095279932022095, "learning_rate": 4.871671472932267e-05, "loss": 0.2301, "mean_token_accuracy": 0.9423503495752812, "num_tokens": 60741492.0, "step": 8200 }, { "entropy": 1.9340177446603775, "epoch": 0.12284339057483712, "grad_norm": 0.37733903527259827, "learning_rate": 4.871291390529547e-05, "loss": 0.2022, "mean_token_accuracy": 0.950228575989604, "num_tokens": 60815537.0, "step": 8210 }, { "entropy": 1.9657929264009, "epoch": 0.12299301711634118, "grad_norm": 0.31044384837150574, "learning_rate": 4.8709107609981693e-05, "loss": 0.23, "mean_token_accuracy": 0.9424935258924961, "num_tokens": 60891905.0, "step": 8220 }, { "entropy": 1.9878283530473708, "epoch": 0.12314264365784525, "grad_norm": 0.3591158390045166, "learning_rate": 4.8705295844261404e-05, "loss": 0.2319, "mean_token_accuracy": 0.9429921135306358, "num_tokens": 60966336.0, "step": 8230 }, { "entropy": 2.0191489554941655, "epoch": 0.12329227019934931, "grad_norm": 0.3593141734600067, "learning_rate": 4.8701478609015945e-05, "loss": 0.2486, "mean_token_accuracy": 0.9380486898124218, "num_tokens": 61039406.0, "step": 8240 }, { "entropy": 1.991200564801693, "epoch": 0.12344189674085337, "grad_norm": 0.34738439321517944, "learning_rate": 4.869765590512794e-05, "loss": 0.2211, "mean_token_accuracy": 0.9457454591989517, "num_tokens": 61115576.0, "step": 8250 }, { "entropy": 1.9950225219130515, "epoch": 0.12359152328235744, "grad_norm": 0.2894030511379242, "learning_rate": 4.869382773348126e-05, "loss": 0.2152, "mean_token_accuracy": 0.9479049224406481, "num_tokens": 61190313.0, "step": 8260 }, { "entropy": 1.9342955321073532, "epoch": 0.1237411498238615, "grad_norm": 0.34559860825538635, "learning_rate": 4.868999409496106e-05, "loss": 0.221, "mean_token_accuracy": 0.9464694540947676, "num_tokens": 61266698.0, "step": 8270 }, { "entropy": 1.974451456964016, "epoch": 0.12389077636536557, "grad_norm": 0.30783629417419434, "learning_rate": 4.8686154990453734e-05, "loss": 0.2336, "mean_token_accuracy": 0.9425033900886775, "num_tokens": 61342997.0, "step": 8280 }, { "entropy": 1.9569523245096208, "epoch": 0.12404040290686963, "grad_norm": 0.34296104311943054, "learning_rate": 4.8682310420846945e-05, "loss": 0.2406, "mean_token_accuracy": 0.9422730423510075, "num_tokens": 61417826.0, "step": 8290 }, { "entropy": 1.9692927330732346, "epoch": 0.1241900294483737, "grad_norm": 0.33801189064979553, "learning_rate": 4.867846038702964e-05, "loss": 0.2218, "mean_token_accuracy": 0.9448234625160694, "num_tokens": 61489462.0, "step": 8300 }, { "entropy": 1.9861831665039062, "epoch": 0.12433965598987777, "grad_norm": 0.28949058055877686, "learning_rate": 4.8674604889892e-05, "loss": 0.2434, "mean_token_accuracy": 0.9391167432069778, "num_tokens": 61563180.0, "step": 8310 }, { "entropy": 1.974212247878313, "epoch": 0.12448928253138183, "grad_norm": 0.33900365233421326, "learning_rate": 4.8670743930325504e-05, "loss": 0.2251, "mean_token_accuracy": 0.9438469767570495, "num_tokens": 61636792.0, "step": 8320 }, { "entropy": 1.9894649021327495, "epoch": 0.1246389090728859, "grad_norm": 0.3019603192806244, "learning_rate": 4.8666877509222856e-05, "loss": 0.2173, "mean_token_accuracy": 0.9452763896435499, "num_tokens": 61712724.0, "step": 8330 }, { "entropy": 1.98419756218791, "epoch": 0.12478853561438996, "grad_norm": 0.34396257996559143, "learning_rate": 4.866300562747805e-05, "loss": 0.2339, "mean_token_accuracy": 0.9397640496492385, "num_tokens": 61784426.0, "step": 8340 }, { "entropy": 1.9590938612818718, "epoch": 0.12493816215589403, "grad_norm": 0.2474859058856964, "learning_rate": 4.8659128285986336e-05, "loss": 0.2197, "mean_token_accuracy": 0.9466206256300211, "num_tokens": 61858840.0, "step": 8350 }, { "entropy": 1.980057169497013, "epoch": 0.1250877886973981, "grad_norm": 0.25387272238731384, "learning_rate": 4.8655245485644224e-05, "loss": 0.2246, "mean_token_accuracy": 0.9466661866754293, "num_tokens": 61930747.0, "step": 8360 }, { "entropy": 1.971390776336193, "epoch": 0.12523741523890214, "grad_norm": 0.3569907546043396, "learning_rate": 4.865135722734947e-05, "loss": 0.2305, "mean_token_accuracy": 0.9422731041908264, "num_tokens": 62005126.0, "step": 8370 }, { "entropy": 1.9663595296442509, "epoch": 0.12538704178040622, "grad_norm": 0.3019673526287079, "learning_rate": 4.864746351200114e-05, "loss": 0.2289, "mean_token_accuracy": 0.9442000284790992, "num_tokens": 62078363.0, "step": 8380 }, { "entropy": 1.9822776213288307, "epoch": 0.1255366683219103, "grad_norm": 0.3434697091579437, "learning_rate": 4.86435643404995e-05, "loss": 0.2456, "mean_token_accuracy": 0.9392819691449403, "num_tokens": 62150028.0, "step": 8390 }, { "entropy": 1.9773451015353203, "epoch": 0.12568629486341434, "grad_norm": 0.3503270447254181, "learning_rate": 4.863965971374612e-05, "loss": 0.2383, "mean_token_accuracy": 0.9415654823184013, "num_tokens": 62224857.0, "step": 8400 }, { "entropy": 1.9774516694247724, "epoch": 0.12583592140491842, "grad_norm": 0.31939077377319336, "learning_rate": 4.863574963264383e-05, "loss": 0.2348, "mean_token_accuracy": 0.9402480907738209, "num_tokens": 62299817.0, "step": 8410 }, { "entropy": 1.9766998663544655, "epoch": 0.12598554794642247, "grad_norm": 0.32501330971717834, "learning_rate": 4.86318340980967e-05, "loss": 0.2224, "mean_token_accuracy": 0.944223378226161, "num_tokens": 62374989.0, "step": 8420 }, { "entropy": 1.9741141736507415, "epoch": 0.12613517448792655, "grad_norm": 0.39732980728149414, "learning_rate": 4.862791311101006e-05, "loss": 0.2612, "mean_token_accuracy": 0.9363386739045382, "num_tokens": 62448885.0, "step": 8430 }, { "entropy": 1.9976093538105488, "epoch": 0.1262848010294306, "grad_norm": 0.36971303820610046, "learning_rate": 4.862398667229053e-05, "loss": 0.2431, "mean_token_accuracy": 0.9399280592799186, "num_tokens": 62522704.0, "step": 8440 }, { "entropy": 2.0156882248818873, "epoch": 0.12643442757093468, "grad_norm": 0.3868907392024994, "learning_rate": 4.862005478284596e-05, "loss": 0.2457, "mean_token_accuracy": 0.9397084049880504, "num_tokens": 62596028.0, "step": 8450 }, { "entropy": 1.9764956191182137, "epoch": 0.12658405411243873, "grad_norm": 0.3057219684123993, "learning_rate": 4.8616117443585486e-05, "loss": 0.2078, "mean_token_accuracy": 0.9495420183986425, "num_tokens": 62670102.0, "step": 8460 }, { "entropy": 1.9228065252304076, "epoch": 0.1267336806539428, "grad_norm": 0.35979214310646057, "learning_rate": 4.861217465541948e-05, "loss": 0.2183, "mean_token_accuracy": 0.9445719916373492, "num_tokens": 62743599.0, "step": 8470 }, { "entropy": 1.9121742151677608, "epoch": 0.12688330719544685, "grad_norm": 0.40340152382850647, "learning_rate": 4.860822641925958e-05, "loss": 0.2194, "mean_token_accuracy": 0.9463967125862837, "num_tokens": 62818162.0, "step": 8480 }, { "entropy": 1.9151701487600803, "epoch": 0.12703293373695093, "grad_norm": 0.330057829618454, "learning_rate": 4.860427273601871e-05, "loss": 0.2419, "mean_token_accuracy": 0.9443833488970995, "num_tokens": 62890626.0, "step": 8490 }, { "entropy": 1.9346738435328006, "epoch": 0.12718256027845498, "grad_norm": 0.3881211280822754, "learning_rate": 4.8600313606611005e-05, "loss": 0.2304, "mean_token_accuracy": 0.9424592532217503, "num_tokens": 62963133.0, "step": 8500 }, { "entropy": 1.9652894951403141, "epoch": 0.12733218681995906, "grad_norm": 0.3115762770175934, "learning_rate": 4.859634903195191e-05, "loss": 0.2331, "mean_token_accuracy": 0.9442177213728428, "num_tokens": 63035573.0, "step": 8510 }, { "entropy": 1.9568308904767036, "epoch": 0.12748181336146314, "grad_norm": 0.2675648629665375, "learning_rate": 4.8592379012958095e-05, "loss": 0.2409, "mean_token_accuracy": 0.9401015724986792, "num_tokens": 63109590.0, "step": 8520 }, { "entropy": 1.9584609642624855, "epoch": 0.1276314399029672, "grad_norm": 0.32072627544403076, "learning_rate": 4.8588403550547494e-05, "loss": 0.2451, "mean_token_accuracy": 0.9389824490994215, "num_tokens": 63181119.0, "step": 8530 }, { "entropy": 1.9569327257573605, "epoch": 0.12778106644447126, "grad_norm": 0.32235363125801086, "learning_rate": 4.858442264563931e-05, "loss": 0.2258, "mean_token_accuracy": 0.9429894834756851, "num_tokens": 63255238.0, "step": 8540 }, { "entropy": 1.9441192679107189, "epoch": 0.12793069298597531, "grad_norm": 0.30793941020965576, "learning_rate": 4.8580436299154e-05, "loss": 0.2373, "mean_token_accuracy": 0.9416972581297159, "num_tokens": 63329349.0, "step": 8550 }, { "entropy": 1.9822468265891076, "epoch": 0.1280803195274794, "grad_norm": 0.25205153226852417, "learning_rate": 4.857644451201327e-05, "loss": 0.2189, "mean_token_accuracy": 0.9472266159951687, "num_tokens": 63401535.0, "step": 8560 }, { "entropy": 1.988240273296833, "epoch": 0.12822994606898344, "grad_norm": 0.7536655068397522, "learning_rate": 4.857244728514011e-05, "loss": 0.225, "mean_token_accuracy": 0.9464554693549871, "num_tokens": 63475745.0, "step": 8570 }, { "entropy": 1.947568230330944, "epoch": 0.12837957261048752, "grad_norm": 0.3762826919555664, "learning_rate": 4.856844461945872e-05, "loss": 0.2273, "mean_token_accuracy": 0.9428681518882513, "num_tokens": 63549531.0, "step": 8580 }, { "entropy": 1.9757441848516464, "epoch": 0.12852919915199157, "grad_norm": 0.46594375371932983, "learning_rate": 4.8564436515894616e-05, "loss": 0.2538, "mean_token_accuracy": 0.9405520241707563, "num_tokens": 63624345.0, "step": 8590 }, { "entropy": 1.9864204876124858, "epoch": 0.12867882569349565, "grad_norm": 0.42728391289711, "learning_rate": 4.8560422975374536e-05, "loss": 0.2437, "mean_token_accuracy": 0.9395755406469106, "num_tokens": 63698537.0, "step": 8600 }, { "entropy": 1.9666790924966335, "epoch": 0.1288284522349997, "grad_norm": 0.35553333163261414, "learning_rate": 4.855640399882648e-05, "loss": 0.2444, "mean_token_accuracy": 0.9401620116084815, "num_tokens": 63771118.0, "step": 8610 }, { "entropy": 1.9578314311802387, "epoch": 0.12897807877650377, "grad_norm": 0.39668187499046326, "learning_rate": 4.8552379587179694e-05, "loss": 0.2479, "mean_token_accuracy": 0.9411626156419516, "num_tokens": 63846471.0, "step": 8620 }, { "entropy": 1.9691228158771992, "epoch": 0.12912770531800782, "grad_norm": 0.400918573141098, "learning_rate": 4.854834974136472e-05, "loss": 0.2342, "mean_token_accuracy": 0.9434386190026999, "num_tokens": 63919635.0, "step": 8630 }, { "entropy": 1.9797006890177726, "epoch": 0.1292773318595119, "grad_norm": 0.32591941952705383, "learning_rate": 4.854431446231331e-05, "loss": 0.2303, "mean_token_accuracy": 0.9438564013689756, "num_tokens": 63993647.0, "step": 8640 }, { "entropy": 1.985445711016655, "epoch": 0.12942695840101595, "grad_norm": 0.2766413390636444, "learning_rate": 4.854027375095849e-05, "loss": 0.2252, "mean_token_accuracy": 0.9435212541371584, "num_tokens": 64065422.0, "step": 8650 }, { "entropy": 1.9521594598889351, "epoch": 0.12957658494252003, "grad_norm": 0.36526623368263245, "learning_rate": 4.8536227608234564e-05, "loss": 0.2225, "mean_token_accuracy": 0.945048525929451, "num_tokens": 64138632.0, "step": 8660 }, { "entropy": 1.9529690995812417, "epoch": 0.1297262114840241, "grad_norm": 0.2847371995449066, "learning_rate": 4.8532176035077054e-05, "loss": 0.2448, "mean_token_accuracy": 0.9371548358350992, "num_tokens": 64212992.0, "step": 8670 }, { "entropy": 1.9735078819096088, "epoch": 0.12987583802552816, "grad_norm": 0.7598893046379089, "learning_rate": 4.852811903242276e-05, "loss": 0.2242, "mean_token_accuracy": 0.9439747896045446, "num_tokens": 64288444.0, "step": 8680 }, { "entropy": 1.9900413297116757, "epoch": 0.13002546456703223, "grad_norm": 0.30402979254722595, "learning_rate": 4.852405660120975e-05, "loss": 0.2297, "mean_token_accuracy": 0.9427242401987315, "num_tokens": 64359164.0, "step": 8690 }, { "entropy": 1.9761988900601863, "epoch": 0.13017509110853628, "grad_norm": 0.3588244318962097, "learning_rate": 4.85199887423773e-05, "loss": 0.2402, "mean_token_accuracy": 0.9416104767471551, "num_tokens": 64432524.0, "step": 8700 }, { "entropy": 1.9465205788612365, "epoch": 0.13032471765004036, "grad_norm": 0.346652626991272, "learning_rate": 4.851591545686598e-05, "loss": 0.2193, "mean_token_accuracy": 0.9439924176782369, "num_tokens": 64506680.0, "step": 8710 }, { "entropy": 1.9636968933045864, "epoch": 0.1304743441915444, "grad_norm": 0.35844936966896057, "learning_rate": 4.851183674561762e-05, "loss": 0.242, "mean_token_accuracy": 0.9411437481641769, "num_tokens": 64578859.0, "step": 8720 }, { "entropy": 1.9625427171587944, "epoch": 0.1306239707330485, "grad_norm": 0.2936355471611023, "learning_rate": 4.850775260957529e-05, "loss": 0.219, "mean_token_accuracy": 0.9431131657212972, "num_tokens": 64651074.0, "step": 8730 }, { "entropy": 1.9437426067888737, "epoch": 0.13077359727455254, "grad_norm": 0.26664796471595764, "learning_rate": 4.850366304968331e-05, "loss": 0.2315, "mean_token_accuracy": 0.9437053076922893, "num_tokens": 64726339.0, "step": 8740 }, { "entropy": 1.9261946514248849, "epoch": 0.13092322381605662, "grad_norm": 0.25835856795310974, "learning_rate": 4.849956806688725e-05, "loss": 0.2151, "mean_token_accuracy": 0.9456098906695842, "num_tokens": 64800390.0, "step": 8750 }, { "entropy": 1.9333353698253632, "epoch": 0.13107285035756067, "grad_norm": 0.3477896749973297, "learning_rate": 4.849546766213395e-05, "loss": 0.2147, "mean_token_accuracy": 0.9439190872013569, "num_tokens": 64875756.0, "step": 8760 }, { "entropy": 1.9803166374564172, "epoch": 0.13122247689906474, "grad_norm": 0.3693682849407196, "learning_rate": 4.8491361836371494e-05, "loss": 0.2472, "mean_token_accuracy": 0.9403591029345989, "num_tokens": 64949220.0, "step": 8770 }, { "entropy": 1.9510506846010685, "epoch": 0.1313721034405688, "grad_norm": 0.368045449256897, "learning_rate": 4.848725059054923e-05, "loss": 0.2258, "mean_token_accuracy": 0.9450150433927774, "num_tokens": 65023063.0, "step": 8780 }, { "entropy": 1.9711753949522972, "epoch": 0.13152172998207287, "grad_norm": 0.3556571304798126, "learning_rate": 4.8483133925617744e-05, "loss": 0.239, "mean_token_accuracy": 0.9398034173995257, "num_tokens": 65097830.0, "step": 8790 }, { "entropy": 1.9685128338634967, "epoch": 0.13167135652357692, "grad_norm": 0.3265618681907654, "learning_rate": 4.8479011842528885e-05, "loss": 0.2476, "mean_token_accuracy": 0.9389249615371227, "num_tokens": 65168882.0, "step": 8800 }, { "entropy": 1.9480599597096444, "epoch": 0.131820983065081, "grad_norm": 0.3606414198875427, "learning_rate": 4.8474884342235756e-05, "loss": 0.2367, "mean_token_accuracy": 0.9424274686723948, "num_tokens": 65245162.0, "step": 8810 }, { "entropy": 1.9709650918841362, "epoch": 0.13197060960658508, "grad_norm": 0.3648437559604645, "learning_rate": 4.8470751425692694e-05, "loss": 0.225, "mean_token_accuracy": 0.9458903253078461, "num_tokens": 65317847.0, "step": 8820 }, { "entropy": 1.9740999616682529, "epoch": 0.13212023614808913, "grad_norm": 0.381575345993042, "learning_rate": 4.846661309385532e-05, "loss": 0.2513, "mean_token_accuracy": 0.9397554129362107, "num_tokens": 65389230.0, "step": 8830 }, { "entropy": 1.957600075751543, "epoch": 0.1322698626895932, "grad_norm": 0.24571581184864044, "learning_rate": 4.846246934768047e-05, "loss": 0.2481, "mean_token_accuracy": 0.9400928698480129, "num_tokens": 65461623.0, "step": 8840 }, { "entropy": 1.9673214673995971, "epoch": 0.13241948923109725, "grad_norm": 0.28099003434181213, "learning_rate": 4.845832018812627e-05, "loss": 0.2208, "mean_token_accuracy": 0.9440156791359187, "num_tokens": 65536396.0, "step": 8850 }, { "entropy": 1.969651285558939, "epoch": 0.13256911577260133, "grad_norm": 0.37584996223449707, "learning_rate": 4.845416561615207e-05, "loss": 0.2126, "mean_token_accuracy": 0.9477973401546478, "num_tokens": 65611860.0, "step": 8860 }, { "entropy": 1.9568484649062157, "epoch": 0.13271874231410538, "grad_norm": 0.33930739760398865, "learning_rate": 4.84500056327185e-05, "loss": 0.2333, "mean_token_accuracy": 0.9430764563381672, "num_tokens": 65683517.0, "step": 8870 }, { "entropy": 1.944619332998991, "epoch": 0.13286836885560946, "grad_norm": 0.4050168991088867, "learning_rate": 4.8445840238787396e-05, "loss": 0.2603, "mean_token_accuracy": 0.9399784963577986, "num_tokens": 65755427.0, "step": 8880 }, { "entropy": 1.959000463783741, "epoch": 0.1330179953971135, "grad_norm": 0.3912133276462555, "learning_rate": 4.844166943532188e-05, "loss": 0.2192, "mean_token_accuracy": 0.943807939067483, "num_tokens": 65832991.0, "step": 8890 }, { "entropy": 1.9239009767770767, "epoch": 0.1331676219386176, "grad_norm": 0.330244243144989, "learning_rate": 4.843749322328632e-05, "loss": 0.2264, "mean_token_accuracy": 0.9459849793463946, "num_tokens": 65907618.0, "step": 8900 }, { "entropy": 1.942949976027012, "epoch": 0.13331724848012164, "grad_norm": 0.4121508002281189, "learning_rate": 4.8433311603646317e-05, "loss": 0.2271, "mean_token_accuracy": 0.9438702866435051, "num_tokens": 65981665.0, "step": 8910 }, { "entropy": 1.9682985998690128, "epoch": 0.1334668750216257, "grad_norm": 0.2904795706272125, "learning_rate": 4.842912457736876e-05, "loss": 0.231, "mean_token_accuracy": 0.941966163739562, "num_tokens": 66055836.0, "step": 8920 }, { "entropy": 1.9720845118165016, "epoch": 0.13361650156312976, "grad_norm": 0.293618768453598, "learning_rate": 4.842493214542175e-05, "loss": 0.2241, "mean_token_accuracy": 0.9437258597463369, "num_tokens": 66131212.0, "step": 8930 }, { "entropy": 1.9385132156312466, "epoch": 0.13376612810463384, "grad_norm": 0.2917327582836151, "learning_rate": 4.8420734308774655e-05, "loss": 0.2198, "mean_token_accuracy": 0.9486747324466706, "num_tokens": 66205858.0, "step": 8940 }, { "entropy": 1.9383563965559005, "epoch": 0.13391575464613792, "grad_norm": 0.3826505243778229, "learning_rate": 4.841653106839808e-05, "loss": 0.2351, "mean_token_accuracy": 0.9395735554397107, "num_tokens": 66280012.0, "step": 8950 }, { "entropy": 1.9099912263453007, "epoch": 0.13406538118764197, "grad_norm": 0.34202826023101807, "learning_rate": 4.84123224252639e-05, "loss": 0.1976, "mean_token_accuracy": 0.9502735130488873, "num_tokens": 66355311.0, "step": 8960 }, { "entropy": 1.885715789347887, "epoch": 0.13421500772914605, "grad_norm": 0.42412397265434265, "learning_rate": 4.840810838034523e-05, "loss": 0.2339, "mean_token_accuracy": 0.9424956567585469, "num_tokens": 66430508.0, "step": 8970 }, { "entropy": 1.8879559002816677, "epoch": 0.1343646342706501, "grad_norm": 0.40387916564941406, "learning_rate": 4.840388893461641e-05, "loss": 0.2374, "mean_token_accuracy": 0.9418501652777195, "num_tokens": 66503574.0, "step": 8980 }, { "entropy": 1.917030405253172, "epoch": 0.13451426081215417, "grad_norm": 0.3102967441082001, "learning_rate": 4.8399664089053085e-05, "loss": 0.2197, "mean_token_accuracy": 0.9448459714651107, "num_tokens": 66580316.0, "step": 8990 }, { "entropy": 1.9436975404620171, "epoch": 0.13466388735365822, "grad_norm": 0.3890587091445923, "learning_rate": 4.8395433844632074e-05, "loss": 0.2228, "mean_token_accuracy": 0.9456178724765778, "num_tokens": 66655430.0, "step": 9000 }, { "epoch": 0.13466388735365822, "eval_entropy": 1.9488787143468858, "eval_loss": 0.25563159584999084, "eval_mean_token_accuracy": 0.9433935329318046, "eval_num_tokens": 66655430.0, "eval_runtime": 545.2853, "eval_samples_per_second": 36.678, "eval_steps_per_second": 9.17, "step": 9000 }, { "entropy": 1.9483337968587875, "epoch": 0.1348135138951623, "grad_norm": 0.3011627495288849, "learning_rate": 4.839119820233153e-05, "loss": 0.2163, "mean_token_accuracy": 0.9459673687815666, "num_tokens": 66729719.0, "step": 9010 }, { "entropy": 1.9654812686145307, "epoch": 0.13496314043666635, "grad_norm": 0.31736207008361816, "learning_rate": 4.838695716313078e-05, "loss": 0.2257, "mean_token_accuracy": 0.9453720789402723, "num_tokens": 66801812.0, "step": 9020 }, { "entropy": 1.9585977770388125, "epoch": 0.13511276697817043, "grad_norm": 0.27295032143592834, "learning_rate": 4.838271072801043e-05, "loss": 0.2419, "mean_token_accuracy": 0.9412912257015705, "num_tokens": 66875970.0, "step": 9030 }, { "entropy": 1.970735015720129, "epoch": 0.13526239351967448, "grad_norm": 0.3993614912033081, "learning_rate": 4.8378458897952336e-05, "loss": 0.2397, "mean_token_accuracy": 0.9421390369534492, "num_tokens": 66949110.0, "step": 9040 }, { "entropy": 1.9808103710412979, "epoch": 0.13541202006117856, "grad_norm": 0.3647657036781311, "learning_rate": 4.837420167393961e-05, "loss": 0.2193, "mean_token_accuracy": 0.9441422343254089, "num_tokens": 67023299.0, "step": 9050 }, { "entropy": 1.9768221914768218, "epoch": 0.1355616466026826, "grad_norm": 0.37747153639793396, "learning_rate": 4.836993905695657e-05, "loss": 0.2403, "mean_token_accuracy": 0.9398123681545257, "num_tokens": 67096505.0, "step": 9060 }, { "entropy": 1.9879881963133812, "epoch": 0.13571127314418668, "grad_norm": 0.3683839440345764, "learning_rate": 4.8365671047988825e-05, "loss": 0.2417, "mean_token_accuracy": 0.9429855939000845, "num_tokens": 67167639.0, "step": 9070 }, { "entropy": 1.9715983614325523, "epoch": 0.13586089968569073, "grad_norm": 0.36192578077316284, "learning_rate": 4.836139764802321e-05, "loss": 0.2357, "mean_token_accuracy": 0.9431883241981268, "num_tokens": 67241224.0, "step": 9080 }, { "entropy": 1.9246913336217404, "epoch": 0.1360105262271948, "grad_norm": 0.35266897082328796, "learning_rate": 4.835711885804782e-05, "loss": 0.2136, "mean_token_accuracy": 0.9453090026974678, "num_tokens": 67316377.0, "step": 9090 }, { "entropy": 1.9322432443499564, "epoch": 0.1361601527686989, "grad_norm": 0.34745660424232483, "learning_rate": 4.835283467905198e-05, "loss": 0.2487, "mean_token_accuracy": 0.9406419951468706, "num_tokens": 67388526.0, "step": 9100 }, { "entropy": 1.9272822305560111, "epoch": 0.13630977931020294, "grad_norm": 0.2859017252922058, "learning_rate": 4.834854511202627e-05, "loss": 0.2342, "mean_token_accuracy": 0.9472344610840082, "num_tokens": 67465106.0, "step": 9110 }, { "entropy": 1.9539577946066857, "epoch": 0.13645940585170702, "grad_norm": 0.3548308312892914, "learning_rate": 4.8344250157962504e-05, "loss": 0.2249, "mean_token_accuracy": 0.9439939834177494, "num_tokens": 67539732.0, "step": 9120 }, { "entropy": 1.977692713588476, "epoch": 0.13660903239321107, "grad_norm": 0.3132769465446472, "learning_rate": 4.833994981785377e-05, "loss": 0.2325, "mean_token_accuracy": 0.9426475591957569, "num_tokens": 67611979.0, "step": 9130 }, { "entropy": 1.949458361417055, "epoch": 0.13675865893471514, "grad_norm": 0.3377133905887604, "learning_rate": 4.833564409269437e-05, "loss": 0.2151, "mean_token_accuracy": 0.9496698271483183, "num_tokens": 67686569.0, "step": 9140 }, { "entropy": 1.9355627067387104, "epoch": 0.1369082854762192, "grad_norm": 0.3213011920452118, "learning_rate": 4.833133298347987e-05, "loss": 0.234, "mean_token_accuracy": 0.9421371828764677, "num_tokens": 67761774.0, "step": 9150 }, { "entropy": 1.9401809476315974, "epoch": 0.13705791201772327, "grad_norm": 0.32401928305625916, "learning_rate": 4.8327016491207075e-05, "loss": 0.2285, "mean_token_accuracy": 0.9449021417647601, "num_tokens": 67839957.0, "step": 9160 }, { "entropy": 1.9816595241427422, "epoch": 0.13720753855922732, "grad_norm": 0.3979884088039398, "learning_rate": 4.832269461687403e-05, "loss": 0.2358, "mean_token_accuracy": 0.9417010087519884, "num_tokens": 67916378.0, "step": 9170 }, { "entropy": 1.9495150744915009, "epoch": 0.1373571651007314, "grad_norm": 0.3539530634880066, "learning_rate": 4.831836736148004e-05, "loss": 0.205, "mean_token_accuracy": 0.9505281843245029, "num_tokens": 67990229.0, "step": 9180 }, { "entropy": 1.9691606126725674, "epoch": 0.13750679164223545, "grad_norm": 0.44842231273651123, "learning_rate": 4.831403472602563e-05, "loss": 0.2326, "mean_token_accuracy": 0.9405070416629314, "num_tokens": 68061907.0, "step": 9190 }, { "entropy": 1.9491675458848476, "epoch": 0.13765641818373953, "grad_norm": 0.32721734046936035, "learning_rate": 4.8309696711512594e-05, "loss": 0.2195, "mean_token_accuracy": 0.9451438773423433, "num_tokens": 68135653.0, "step": 9200 }, { "entropy": 1.9939965434372424, "epoch": 0.13780604472524358, "grad_norm": 0.353633850812912, "learning_rate": 4.830535331894395e-05, "loss": 0.2566, "mean_token_accuracy": 0.937218252569437, "num_tokens": 68206742.0, "step": 9210 }, { "entropy": 1.9459476798772812, "epoch": 0.13795567126674765, "grad_norm": 0.31654617190361023, "learning_rate": 4.830100454932397e-05, "loss": 0.2097, "mean_token_accuracy": 0.9479497592896223, "num_tokens": 68281111.0, "step": 9220 }, { "entropy": 1.9277146644890308, "epoch": 0.1381052978082517, "grad_norm": 0.3213835656642914, "learning_rate": 4.829665040365817e-05, "loss": 0.2139, "mean_token_accuracy": 0.9485133994370699, "num_tokens": 68357239.0, "step": 9230 }, { "entropy": 1.9786666579544545, "epoch": 0.13825492434975578, "grad_norm": 0.4365866184234619, "learning_rate": 4.82922908829533e-05, "loss": 0.2684, "mean_token_accuracy": 0.9337970435619354, "num_tokens": 68430584.0, "step": 9240 }, { "entropy": 1.9404628470540046, "epoch": 0.13840455089125986, "grad_norm": 0.3002017140388489, "learning_rate": 4.8287925988217365e-05, "loss": 0.198, "mean_token_accuracy": 0.9502225946635008, "num_tokens": 68507158.0, "step": 9250 }, { "entropy": 1.951265572756529, "epoch": 0.1385541774327639, "grad_norm": 0.3586018979549408, "learning_rate": 4.82835557204596e-05, "loss": 0.2375, "mean_token_accuracy": 0.9417462438344956, "num_tokens": 68581231.0, "step": 9260 }, { "entropy": 1.9776667036116122, "epoch": 0.138703803974268, "grad_norm": 0.3314315378665924, "learning_rate": 4.827918008069049e-05, "loss": 0.2596, "mean_token_accuracy": 0.9385028939694167, "num_tokens": 68654225.0, "step": 9270 }, { "entropy": 1.9743095569312572, "epoch": 0.13885343051577204, "grad_norm": 0.29083719849586487, "learning_rate": 4.827479906992177e-05, "loss": 0.2467, "mean_token_accuracy": 0.9407394751906395, "num_tokens": 68728882.0, "step": 9280 }, { "entropy": 1.9809728540480136, "epoch": 0.1390030570572761, "grad_norm": 0.25985953211784363, "learning_rate": 4.827041268916639e-05, "loss": 0.2119, "mean_token_accuracy": 0.9479349613189697, "num_tokens": 68807811.0, "step": 9290 }, { "entropy": 1.9703376397490502, "epoch": 0.13915268359878016, "grad_norm": 0.36498844623565674, "learning_rate": 4.826602093943858e-05, "loss": 0.2281, "mean_token_accuracy": 0.9456536643207073, "num_tokens": 68880398.0, "step": 9300 }, { "entropy": 1.9479986652731895, "epoch": 0.13930231014028424, "grad_norm": 0.27892500162124634, "learning_rate": 4.826162382175378e-05, "loss": 0.2133, "mean_token_accuracy": 0.9468015041202307, "num_tokens": 68951729.0, "step": 9310 }, { "entropy": 1.9210216835141183, "epoch": 0.1394519366817883, "grad_norm": 0.3597976565361023, "learning_rate": 4.8257221337128674e-05, "loss": 0.2432, "mean_token_accuracy": 0.9406485389918089, "num_tokens": 69024086.0, "step": 9320 }, { "entropy": 1.9612861469388008, "epoch": 0.13960156322329237, "grad_norm": 0.31205272674560547, "learning_rate": 4.82528134865812e-05, "loss": 0.2374, "mean_token_accuracy": 0.9433183468878269, "num_tokens": 69095614.0, "step": 9330 }, { "entropy": 1.9877513609826565, "epoch": 0.13975118976479642, "grad_norm": 0.37088486552238464, "learning_rate": 4.824840027113055e-05, "loss": 0.2433, "mean_token_accuracy": 0.9408521112054586, "num_tokens": 69167626.0, "step": 9340 }, { "entropy": 1.98278241828084, "epoch": 0.1399008163063005, "grad_norm": 0.36493024230003357, "learning_rate": 4.8243981691797106e-05, "loss": 0.2375, "mean_token_accuracy": 0.9410956777632237, "num_tokens": 69239211.0, "step": 9350 }, { "entropy": 1.9933070227503777, "epoch": 0.14005044284780455, "grad_norm": 0.31293556094169617, "learning_rate": 4.823955774960255e-05, "loss": 0.2367, "mean_token_accuracy": 0.9408943265676498, "num_tokens": 69312805.0, "step": 9360 }, { "entropy": 1.958333135396242, "epoch": 0.14020006938930862, "grad_norm": 0.31713417172431946, "learning_rate": 4.8235128445569754e-05, "loss": 0.2209, "mean_token_accuracy": 0.9468443047255277, "num_tokens": 69388158.0, "step": 9370 }, { "entropy": 1.9638317182660103, "epoch": 0.14034969593081267, "grad_norm": 0.3242224454879761, "learning_rate": 4.823069378072287e-05, "loss": 0.227, "mean_token_accuracy": 0.9442442692816257, "num_tokens": 69463918.0, "step": 9380 }, { "entropy": 1.986253874003887, "epoch": 0.14049932247231675, "grad_norm": 0.3108769357204437, "learning_rate": 4.822625375608726e-05, "loss": 0.2445, "mean_token_accuracy": 0.942235691845417, "num_tokens": 69535509.0, "step": 9390 }, { "entropy": 1.9511330835521221, "epoch": 0.14064894901382083, "grad_norm": 0.3007988929748535, "learning_rate": 4.8221808372689545e-05, "loss": 0.218, "mean_token_accuracy": 0.9486309554427862, "num_tokens": 69611068.0, "step": 9400 }, { "entropy": 1.951339303702116, "epoch": 0.14079857555532488, "grad_norm": 0.3171694874763489, "learning_rate": 4.821735763155756e-05, "loss": 0.2357, "mean_token_accuracy": 0.9465548057109118, "num_tokens": 69685186.0, "step": 9410 }, { "entropy": 1.953355387598276, "epoch": 0.14094820209682896, "grad_norm": 0.29984259605407715, "learning_rate": 4.821290153372042e-05, "loss": 0.221, "mean_token_accuracy": 0.9436756044626236, "num_tokens": 69760338.0, "step": 9420 }, { "entropy": 1.9204163372516632, "epoch": 0.141097828638333, "grad_norm": 0.29189491271972656, "learning_rate": 4.820844008020844e-05, "loss": 0.2531, "mean_token_accuracy": 0.9399379406124353, "num_tokens": 69834564.0, "step": 9430 }, { "entropy": 1.9474875345826148, "epoch": 0.14124745517983708, "grad_norm": 0.3574906885623932, "learning_rate": 4.820397327205318e-05, "loss": 0.2402, "mean_token_accuracy": 0.9390805486589671, "num_tokens": 69908034.0, "step": 9440 }, { "entropy": 1.9551872149109841, "epoch": 0.14139708172134113, "grad_norm": 0.35252702236175537, "learning_rate": 4.819950111028746e-05, "loss": 0.2257, "mean_token_accuracy": 0.9408782787621022, "num_tokens": 69980070.0, "step": 9450 }, { "entropy": 1.9115084245800973, "epoch": 0.1415467082628452, "grad_norm": 0.3842913508415222, "learning_rate": 4.819502359594533e-05, "loss": 0.2301, "mean_token_accuracy": 0.941709129139781, "num_tokens": 70054460.0, "step": 9460 }, { "entropy": 1.8893527925014495, "epoch": 0.14169633480434926, "grad_norm": 0.3047802746295929, "learning_rate": 4.8190540730062036e-05, "loss": 0.2248, "mean_token_accuracy": 0.9447365637868643, "num_tokens": 70128759.0, "step": 9470 }, { "entropy": 1.9327017694711686, "epoch": 0.14184596134585334, "grad_norm": 0.33507052063941956, "learning_rate": 4.818605251367414e-05, "loss": 0.2243, "mean_token_accuracy": 0.9416280146688223, "num_tokens": 70202817.0, "step": 9480 }, { "entropy": 1.9426468513906001, "epoch": 0.1419955878873574, "grad_norm": 0.35069891810417175, "learning_rate": 4.818155894781936e-05, "loss": 0.2173, "mean_token_accuracy": 0.9464975386857987, "num_tokens": 70276096.0, "step": 9490 }, { "entropy": 1.9518881015479566, "epoch": 0.14214521442886147, "grad_norm": 0.3290864825248718, "learning_rate": 4.817706003353671e-05, "loss": 0.2229, "mean_token_accuracy": 0.9452050339430571, "num_tokens": 70351479.0, "step": 9500 }, { "entropy": 1.970929603278637, "epoch": 0.14229484097036552, "grad_norm": 0.34592166543006897, "learning_rate": 4.817255577186642e-05, "loss": 0.2429, "mean_token_accuracy": 0.9381695881485939, "num_tokens": 70425876.0, "step": 9510 }, { "entropy": 1.9552265472710133, "epoch": 0.1424444675118696, "grad_norm": 0.32449761033058167, "learning_rate": 4.816804616384995e-05, "loss": 0.2324, "mean_token_accuracy": 0.9449277278035879, "num_tokens": 70499060.0, "step": 9520 }, { "entropy": 2.0136697702109814, "epoch": 0.14259409405337367, "grad_norm": 0.3378818929195404, "learning_rate": 4.816353121052999e-05, "loss": 0.2234, "mean_token_accuracy": 0.9438359316438436, "num_tokens": 70574024.0, "step": 9530 }, { "entropy": 1.95682624951005, "epoch": 0.14274372059487772, "grad_norm": 0.2584880590438843, "learning_rate": 4.81590109129505e-05, "loss": 0.2292, "mean_token_accuracy": 0.944714231044054, "num_tokens": 70648369.0, "step": 9540 }, { "entropy": 1.9372911527752876, "epoch": 0.1428933471363818, "grad_norm": 0.31865113973617554, "learning_rate": 4.815448527215663e-05, "loss": 0.214, "mean_token_accuracy": 0.9439224701374769, "num_tokens": 70722875.0, "step": 9550 }, { "entropy": 1.9243810951709748, "epoch": 0.14304297367788585, "grad_norm": 0.413815438747406, "learning_rate": 4.814995428919481e-05, "loss": 0.2374, "mean_token_accuracy": 0.9394006479531527, "num_tokens": 70795601.0, "step": 9560 }, { "entropy": 1.9187439888715745, "epoch": 0.14319260021938993, "grad_norm": 0.286629319190979, "learning_rate": 4.814541796511267e-05, "loss": 0.2188, "mean_token_accuracy": 0.9442979108542204, "num_tokens": 70871964.0, "step": 9570 }, { "entropy": 1.9147816732525826, "epoch": 0.14334222676089398, "grad_norm": 0.3704766631126404, "learning_rate": 4.814087630095909e-05, "loss": 0.2429, "mean_token_accuracy": 0.9406113352626562, "num_tokens": 70945352.0, "step": 9580 }, { "entropy": 1.942322688549757, "epoch": 0.14349185330239805, "grad_norm": 0.4035572409629822, "learning_rate": 4.813632929778419e-05, "loss": 0.2211, "mean_token_accuracy": 0.9434312421828508, "num_tokens": 71022681.0, "step": 9590 }, { "entropy": 1.9356301598250867, "epoch": 0.1436414798439021, "grad_norm": 0.32776445150375366, "learning_rate": 4.8131776956639315e-05, "loss": 0.214, "mean_token_accuracy": 0.9457470294088125, "num_tokens": 71098359.0, "step": 9600 }, { "entropy": 1.9147076666355134, "epoch": 0.14379110638540618, "grad_norm": 0.36388885974884033, "learning_rate": 4.812721927857705e-05, "loss": 0.2444, "mean_token_accuracy": 0.9398420371115208, "num_tokens": 71170989.0, "step": 9610 }, { "entropy": 1.882090973854065, "epoch": 0.14394073292691023, "grad_norm": 0.3057663142681122, "learning_rate": 4.812265626465121e-05, "loss": 0.224, "mean_token_accuracy": 0.9435542799532414, "num_tokens": 71244688.0, "step": 9620 }, { "entropy": 1.9075574971735478, "epoch": 0.1440903594684143, "grad_norm": 0.30157583951950073, "learning_rate": 4.811808791591683e-05, "loss": 0.2262, "mean_token_accuracy": 0.9443697270005942, "num_tokens": 71319184.0, "step": 9630 }, { "entropy": 1.89164879322052, "epoch": 0.14423998600991836, "grad_norm": 0.37271201610565186, "learning_rate": 4.8113514233430216e-05, "loss": 0.2194, "mean_token_accuracy": 0.9475700814276934, "num_tokens": 71393750.0, "step": 9640 }, { "entropy": 1.9133434474468232, "epoch": 0.14438961255142244, "grad_norm": 0.32016822695732117, "learning_rate": 4.810893521824888e-05, "loss": 0.2363, "mean_token_accuracy": 0.9441170435398817, "num_tokens": 71468750.0, "step": 9650 }, { "entropy": 1.9390408918261528, "epoch": 0.14453923909292649, "grad_norm": 0.31049180030822754, "learning_rate": 4.810435087143155e-05, "loss": 0.2051, "mean_token_accuracy": 0.9521675903350115, "num_tokens": 71543368.0, "step": 9660 }, { "entropy": 1.9402896292507648, "epoch": 0.14468886563443056, "grad_norm": 0.3493243157863617, "learning_rate": 4.809976119403824e-05, "loss": 0.2225, "mean_token_accuracy": 0.9445060800760985, "num_tokens": 71617937.0, "step": 9670 }, { "entropy": 1.928921538591385, "epoch": 0.14483849217593464, "grad_norm": 0.35896921157836914, "learning_rate": 4.8095166187130144e-05, "loss": 0.2182, "mean_token_accuracy": 0.9461550883948803, "num_tokens": 71693335.0, "step": 9680 }, { "entropy": 1.90728582367301, "epoch": 0.1449881187174387, "grad_norm": 0.2883624732494354, "learning_rate": 4.8090565851769726e-05, "loss": 0.225, "mean_token_accuracy": 0.9413074858486652, "num_tokens": 71767892.0, "step": 9690 }, { "entropy": 1.9456420816481113, "epoch": 0.14513774525894277, "grad_norm": 0.36232709884643555, "learning_rate": 4.8085960189020644e-05, "loss": 0.2253, "mean_token_accuracy": 0.9420846290886402, "num_tokens": 71841878.0, "step": 9700 }, { "entropy": 1.9357500843703748, "epoch": 0.14528737180044682, "grad_norm": 0.3139575719833374, "learning_rate": 4.808134919994782e-05, "loss": 0.2242, "mean_token_accuracy": 0.9423670586198568, "num_tokens": 71914722.0, "step": 9710 }, { "entropy": 1.9303450793027879, "epoch": 0.1454369983419509, "grad_norm": 0.3181741237640381, "learning_rate": 4.8076732885617406e-05, "loss": 0.2059, "mean_token_accuracy": 0.9462727215141058, "num_tokens": 71988909.0, "step": 9720 }, { "entropy": 1.9360411137342453, "epoch": 0.14558662488345495, "grad_norm": 0.33108997344970703, "learning_rate": 4.807211124709676e-05, "loss": 0.2433, "mean_token_accuracy": 0.943679092824459, "num_tokens": 72061144.0, "step": 9730 }, { "entropy": 1.9307071655988692, "epoch": 0.14573625142495902, "grad_norm": 0.360953152179718, "learning_rate": 4.80674842854545e-05, "loss": 0.2332, "mean_token_accuracy": 0.9412772305309772, "num_tokens": 72134390.0, "step": 9740 }, { "entropy": 1.9613996863365173, "epoch": 0.14588587796646307, "grad_norm": 0.2520855963230133, "learning_rate": 4.806285200176045e-05, "loss": 0.2254, "mean_token_accuracy": 0.944409403204918, "num_tokens": 72209576.0, "step": 9750 }, { "entropy": 1.9498137004673481, "epoch": 0.14603550450796715, "grad_norm": 0.3211948871612549, "learning_rate": 4.805821439708569e-05, "loss": 0.2122, "mean_token_accuracy": 0.947629764676094, "num_tokens": 72285525.0, "step": 9760 }, { "entropy": 1.9193257749080659, "epoch": 0.1461851310494712, "grad_norm": 0.3163833022117615, "learning_rate": 4.80535714725025e-05, "loss": 0.2246, "mean_token_accuracy": 0.9416702345013619, "num_tokens": 72358358.0, "step": 9770 }, { "entropy": 1.9338900044560432, "epoch": 0.14633475759097528, "grad_norm": 0.34347960352897644, "learning_rate": 4.804892322908442e-05, "loss": 0.2272, "mean_token_accuracy": 0.945580180734396, "num_tokens": 72435095.0, "step": 9780 }, { "entropy": 1.9366588167846204, "epoch": 0.14648438413247933, "grad_norm": 0.31336262822151184, "learning_rate": 4.80442696679062e-05, "loss": 0.2276, "mean_token_accuracy": 0.9434244647622109, "num_tokens": 72511427.0, "step": 9790 }, { "entropy": 1.9242891520261765, "epoch": 0.1466340106739834, "grad_norm": 0.3171961307525635, "learning_rate": 4.803961079004383e-05, "loss": 0.2102, "mean_token_accuracy": 0.9478205628693104, "num_tokens": 72588228.0, "step": 9800 }, { "entropy": 1.9427091382443904, "epoch": 0.14678363721548746, "grad_norm": 0.29199811816215515, "learning_rate": 4.803494659657452e-05, "loss": 0.2277, "mean_token_accuracy": 0.9438135959208012, "num_tokens": 72662552.0, "step": 9810 }, { "entropy": 1.9504983954131603, "epoch": 0.14693326375699153, "grad_norm": 0.281848281621933, "learning_rate": 4.803027708857673e-05, "loss": 0.2159, "mean_token_accuracy": 0.9442804489284754, "num_tokens": 72737781.0, "step": 9820 }, { "entropy": 1.9234144739806651, "epoch": 0.1470828902984956, "grad_norm": 0.3392612934112549, "learning_rate": 4.802560226713012e-05, "loss": 0.2198, "mean_token_accuracy": 0.9445745177567005, "num_tokens": 72813053.0, "step": 9830 }, { "entropy": 1.9352587692439556, "epoch": 0.14723251683999966, "grad_norm": 0.3580477237701416, "learning_rate": 4.802092213331558e-05, "loss": 0.2641, "mean_token_accuracy": 0.9382480446249246, "num_tokens": 72886466.0, "step": 9840 }, { "entropy": 1.9515813373029232, "epoch": 0.14738214338150374, "grad_norm": 0.32320213317871094, "learning_rate": 4.801623668821526e-05, "loss": 0.2146, "mean_token_accuracy": 0.9468538921326399, "num_tokens": 72963216.0, "step": 9850 }, { "entropy": 1.9166609413921833, "epoch": 0.1475317699230078, "grad_norm": 0.3752511143684387, "learning_rate": 4.801154593291252e-05, "loss": 0.2289, "mean_token_accuracy": 0.9402341291308403, "num_tokens": 73036539.0, "step": 9860 }, { "entropy": 1.91079076603055, "epoch": 0.14768139646451187, "grad_norm": 0.34397321939468384, "learning_rate": 4.800684986849193e-05, "loss": 0.2388, "mean_token_accuracy": 0.9436853427439928, "num_tokens": 73109440.0, "step": 9870 }, { "entropy": 1.9356561787426472, "epoch": 0.14783102300601592, "grad_norm": 0.3052953779697418, "learning_rate": 4.800214849603931e-05, "loss": 0.2273, "mean_token_accuracy": 0.9470526415854692, "num_tokens": 73184990.0, "step": 9880 }, { "entropy": 1.9489891722798347, "epoch": 0.14798064954752, "grad_norm": 0.3975132703781128, "learning_rate": 4.799744181664171e-05, "loss": 0.2323, "mean_token_accuracy": 0.9412062238901854, "num_tokens": 73258482.0, "step": 9890 }, { "entropy": 1.9365462079644202, "epoch": 0.14813027608902404, "grad_norm": 0.4482927620410919, "learning_rate": 4.7992729831387386e-05, "loss": 0.22, "mean_token_accuracy": 0.9461224015802145, "num_tokens": 73330435.0, "step": 9900 }, { "entropy": 1.885791876167059, "epoch": 0.14827990263052812, "grad_norm": 0.3477848172187805, "learning_rate": 4.798801254136584e-05, "loss": 0.2096, "mean_token_accuracy": 0.9464099742472172, "num_tokens": 73405957.0, "step": 9910 }, { "entropy": 1.9172332286834717, "epoch": 0.14842952917203217, "grad_norm": 0.36400294303894043, "learning_rate": 4.798328994766779e-05, "loss": 0.227, "mean_token_accuracy": 0.9457256682217121, "num_tokens": 73479729.0, "step": 9920 }, { "entropy": 1.9637786597013474, "epoch": 0.14857915571353625, "grad_norm": 0.333106130361557, "learning_rate": 4.7978562051385184e-05, "loss": 0.2468, "mean_token_accuracy": 0.9398229122161865, "num_tokens": 73555138.0, "step": 9930 }, { "entropy": 1.951609492301941, "epoch": 0.1487287822550403, "grad_norm": 0.332767516374588, "learning_rate": 4.7973828853611196e-05, "loss": 0.223, "mean_token_accuracy": 0.9455506943166256, "num_tokens": 73628761.0, "step": 9940 }, { "entropy": 1.932226374000311, "epoch": 0.14887840879654438, "grad_norm": 0.30349162220954895, "learning_rate": 4.796909035544022e-05, "loss": 0.2208, "mean_token_accuracy": 0.9437657959759236, "num_tokens": 73703967.0, "step": 9950 }, { "entropy": 1.992712678015232, "epoch": 0.14902803533804845, "grad_norm": 0.36695024371147156, "learning_rate": 4.7964346557967894e-05, "loss": 0.2289, "mean_token_accuracy": 0.9439554255455732, "num_tokens": 73778880.0, "step": 9960 }, { "entropy": 1.9757874220609666, "epoch": 0.1491776618795525, "grad_norm": 0.37456706166267395, "learning_rate": 4.795959746229106e-05, "loss": 0.2261, "mean_token_accuracy": 0.9443719271570444, "num_tokens": 73852833.0, "step": 9970 }, { "entropy": 1.965779746323824, "epoch": 0.14932728842105658, "grad_norm": 0.3689342439174652, "learning_rate": 4.795484306950779e-05, "loss": 0.2329, "mean_token_accuracy": 0.9431554324924946, "num_tokens": 73926444.0, "step": 9980 }, { "entropy": 1.9717483691871167, "epoch": 0.14947691496256063, "grad_norm": 0.30721649527549744, "learning_rate": 4.795008338071739e-05, "loss": 0.2202, "mean_token_accuracy": 0.945174703001976, "num_tokens": 74000217.0, "step": 9990 }, { "entropy": 2.0146261431276797, "epoch": 0.1496265415040647, "grad_norm": 0.31610745191574097, "learning_rate": 4.794531839702039e-05, "loss": 0.2373, "mean_token_accuracy": 0.9427457839250565, "num_tokens": 74073489.0, "step": 10000 }, { "epoch": 0.1496265415040647, "eval_entropy": 2.0023350311994554, "eval_loss": 0.2541130483150482, "eval_mean_token_accuracy": 0.9434884492874146, "eval_num_tokens": 74073489.0, "eval_runtime": 547.2649, "eval_samples_per_second": 36.545, "eval_steps_per_second": 9.136, "step": 10000 }, { "entropy": 2.0096257492899894, "epoch": 0.14977616804556876, "grad_norm": 0.41175577044487, "learning_rate": 4.794054811951852e-05, "loss": 0.2231, "mean_token_accuracy": 0.9445735428482294, "num_tokens": 74145452.0, "step": 10010 }, { "entropy": 1.96277888789773, "epoch": 0.14992579458707284, "grad_norm": 0.38437095284461975, "learning_rate": 4.793577254931477e-05, "loss": 0.2363, "mean_token_accuracy": 0.9410177625715732, "num_tokens": 74218173.0, "step": 10020 }, { "entropy": 1.9713745146989823, "epoch": 0.15007542112857689, "grad_norm": 0.4264318346977234, "learning_rate": 4.793099168751334e-05, "loss": 0.2552, "mean_token_accuracy": 0.9402187038213015, "num_tokens": 74289714.0, "step": 10030 }, { "entropy": 2.0118980705738068, "epoch": 0.15022504767008096, "grad_norm": 0.3127113878726959, "learning_rate": 4.7926205535219644e-05, "loss": 0.249, "mean_token_accuracy": 0.9399946581572294, "num_tokens": 74363240.0, "step": 10040 }, { "entropy": 2.0039468236267566, "epoch": 0.150374674211585, "grad_norm": 0.3341583013534546, "learning_rate": 4.792141409354031e-05, "loss": 0.2271, "mean_token_accuracy": 0.9471007533371448, "num_tokens": 74440048.0, "step": 10050 }, { "entropy": 1.9907129302620887, "epoch": 0.1505243007530891, "grad_norm": 0.32159239053726196, "learning_rate": 4.7916617363583236e-05, "loss": 0.2117, "mean_token_accuracy": 0.9476275566965342, "num_tokens": 74515465.0, "step": 10060 }, { "entropy": 1.9853538058698177, "epoch": 0.15067392729459314, "grad_norm": 0.31087031960487366, "learning_rate": 4.791181534645748e-05, "loss": 0.2692, "mean_token_accuracy": 0.9375228494405746, "num_tokens": 74590380.0, "step": 10070 }, { "entropy": 2.044235463440418, "epoch": 0.15082355383609722, "grad_norm": 0.4257383644580841, "learning_rate": 4.790700804327337e-05, "loss": 0.2246, "mean_token_accuracy": 0.9427407011389732, "num_tokens": 74664814.0, "step": 10080 }, { "entropy": 2.0140422962605955, "epoch": 0.15097318037760127, "grad_norm": 0.3344215154647827, "learning_rate": 4.790219545514244e-05, "loss": 0.2182, "mean_token_accuracy": 0.9469365004450083, "num_tokens": 74739249.0, "step": 10090 }, { "entropy": 1.9841054931282998, "epoch": 0.15112280691910535, "grad_norm": 0.4196813404560089, "learning_rate": 4.789737758317744e-05, "loss": 0.213, "mean_token_accuracy": 0.9458187758922577, "num_tokens": 74814142.0, "step": 10100 }, { "entropy": 2.0130374021828175, "epoch": 0.15127243346060942, "grad_norm": 0.25859564542770386, "learning_rate": 4.7892554428492355e-05, "loss": 0.2273, "mean_token_accuracy": 0.9443059764802456, "num_tokens": 74889368.0, "step": 10110 }, { "entropy": 1.9955432578921317, "epoch": 0.15142206000211347, "grad_norm": 0.2633899748325348, "learning_rate": 4.788772599220238e-05, "loss": 0.226, "mean_token_accuracy": 0.9447741836309433, "num_tokens": 74968209.0, "step": 10120 }, { "entropy": 2.027172787487507, "epoch": 0.15157168654361755, "grad_norm": 0.3068169057369232, "learning_rate": 4.7882892275423944e-05, "loss": 0.2272, "mean_token_accuracy": 0.9453667365014553, "num_tokens": 75041250.0, "step": 10130 }, { "entropy": 2.00287516489625, "epoch": 0.1517213130851216, "grad_norm": 0.28688597679138184, "learning_rate": 4.787805327927466e-05, "loss": 0.202, "mean_token_accuracy": 0.9475355301052332, "num_tokens": 75118005.0, "step": 10140 }, { "entropy": 1.9912812247872353, "epoch": 0.15187093962662568, "grad_norm": 0.3301286995410919, "learning_rate": 4.787320900487342e-05, "loss": 0.2303, "mean_token_accuracy": 0.9416725657880306, "num_tokens": 75192995.0, "step": 10150 }, { "entropy": 1.984282349795103, "epoch": 0.15202056616812973, "grad_norm": 0.36690813302993774, "learning_rate": 4.7868359453340306e-05, "loss": 0.2106, "mean_token_accuracy": 0.9486179735511542, "num_tokens": 75266359.0, "step": 10160 }, { "entropy": 1.9733359031379223, "epoch": 0.1521701927096338, "grad_norm": 0.3084751069545746, "learning_rate": 4.78635046257966e-05, "loss": 0.2257, "mean_token_accuracy": 0.944027767330408, "num_tokens": 75339651.0, "step": 10170 }, { "entropy": 1.9452820114791394, "epoch": 0.15231981925113786, "grad_norm": 0.4038937985897064, "learning_rate": 4.7858644523364836e-05, "loss": 0.2237, "mean_token_accuracy": 0.9453101187944413, "num_tokens": 75413711.0, "step": 10180 }, { "entropy": 1.9682258747518062, "epoch": 0.15246944579264193, "grad_norm": 0.3249014914035797, "learning_rate": 4.785377914716876e-05, "loss": 0.2481, "mean_token_accuracy": 0.9381590314209461, "num_tokens": 75489487.0, "step": 10190 }, { "entropy": 1.9567937403917313, "epoch": 0.15261907233414598, "grad_norm": 0.40018409490585327, "learning_rate": 4.7848908498333326e-05, "loss": 0.2254, "mean_token_accuracy": 0.9459907744079828, "num_tokens": 75562406.0, "step": 10200 }, { "entropy": 1.9470438182353973, "epoch": 0.15276869887565006, "grad_norm": 0.44914180040359497, "learning_rate": 4.784403257798472e-05, "loss": 0.2232, "mean_token_accuracy": 0.9474494758993387, "num_tokens": 75637282.0, "step": 10210 }, { "entropy": 1.9817422211170197, "epoch": 0.1529183254171541, "grad_norm": 0.39441195130348206, "learning_rate": 4.7839151387250345e-05, "loss": 0.2286, "mean_token_accuracy": 0.9444709490984678, "num_tokens": 75713969.0, "step": 10220 }, { "entropy": 1.9814308978617192, "epoch": 0.1530679519586582, "grad_norm": 0.4253191351890564, "learning_rate": 4.78342649272588e-05, "loss": 0.2241, "mean_token_accuracy": 0.9437417417764664, "num_tokens": 75786449.0, "step": 10230 }, { "entropy": 1.9705582112073898, "epoch": 0.15321757850016224, "grad_norm": 0.38298362493515015, "learning_rate": 4.7829373199139946e-05, "loss": 0.2266, "mean_token_accuracy": 0.9441553324460983, "num_tokens": 75860517.0, "step": 10240 }, { "entropy": 1.961432795971632, "epoch": 0.15336720504166632, "grad_norm": 0.3164595663547516, "learning_rate": 4.782447620402482e-05, "loss": 0.2187, "mean_token_accuracy": 0.9451293453574181, "num_tokens": 75936023.0, "step": 10250 }, { "entropy": 1.9676277592778206, "epoch": 0.1535168315831704, "grad_norm": 0.34096574783325195, "learning_rate": 4.7819573943045695e-05, "loss": 0.2233, "mean_token_accuracy": 0.9452019326388836, "num_tokens": 76010359.0, "step": 10260 }, { "entropy": 1.9231061466038226, "epoch": 0.15366645812467444, "grad_norm": 0.3452071249485016, "learning_rate": 4.781466641733608e-05, "loss": 0.2152, "mean_token_accuracy": 0.947759136930108, "num_tokens": 76084169.0, "step": 10270 }, { "entropy": 1.9195040717720986, "epoch": 0.15381608466617852, "grad_norm": 0.35254359245300293, "learning_rate": 4.7809753628030663e-05, "loss": 0.2133, "mean_token_accuracy": 0.950443197414279, "num_tokens": 76159506.0, "step": 10280 }, { "entropy": 1.9417597696185112, "epoch": 0.15396571120768257, "grad_norm": 0.32364755868911743, "learning_rate": 4.780483557626537e-05, "loss": 0.2133, "mean_token_accuracy": 0.9476958364248276, "num_tokens": 76234246.0, "step": 10290 }, { "entropy": 1.9783832170069218, "epoch": 0.15411533774918665, "grad_norm": 0.3573232591152191, "learning_rate": 4.7799912263177354e-05, "loss": 0.2117, "mean_token_accuracy": 0.9468444090336561, "num_tokens": 76308556.0, "step": 10300 }, { "entropy": 1.9693367302417755, "epoch": 0.1542649642906907, "grad_norm": 0.3826085031032562, "learning_rate": 4.779498368990497e-05, "loss": 0.2368, "mean_token_accuracy": 0.9394370969384909, "num_tokens": 76381224.0, "step": 10310 }, { "entropy": 1.9444942571222783, "epoch": 0.15441459083219478, "grad_norm": 0.3278908133506775, "learning_rate": 4.779004985758777e-05, "loss": 0.2278, "mean_token_accuracy": 0.9443727150559426, "num_tokens": 76455875.0, "step": 10320 }, { "entropy": 1.9720619566738606, "epoch": 0.15456421737369883, "grad_norm": 0.3902450501918793, "learning_rate": 4.7785110767366576e-05, "loss": 0.2436, "mean_token_accuracy": 0.9407512798905373, "num_tokens": 76527498.0, "step": 10330 }, { "entropy": 1.9660998113453387, "epoch": 0.1547138439152029, "grad_norm": 0.3909050226211548, "learning_rate": 4.778016642038337e-05, "loss": 0.2384, "mean_token_accuracy": 0.9423815131187439, "num_tokens": 76600289.0, "step": 10340 }, { "entropy": 1.9942153520882129, "epoch": 0.15486347045670695, "grad_norm": 0.3505004048347473, "learning_rate": 4.777521681778138e-05, "loss": 0.2375, "mean_token_accuracy": 0.9432413939386606, "num_tokens": 76674964.0, "step": 10350 }, { "entropy": 1.9955847837030887, "epoch": 0.15501309699821103, "grad_norm": 0.3075355887413025, "learning_rate": 4.7770261960705046e-05, "loss": 0.2173, "mean_token_accuracy": 0.9458872582763433, "num_tokens": 76749212.0, "step": 10360 }, { "entropy": 1.9781630665063858, "epoch": 0.15516272353971508, "grad_norm": 0.5010891556739807, "learning_rate": 4.776530185030001e-05, "loss": 0.2337, "mean_token_accuracy": 0.9421981893479824, "num_tokens": 76826068.0, "step": 10370 }, { "entropy": 1.9448955468833447, "epoch": 0.15531235008121916, "grad_norm": 0.31132784485816956, "learning_rate": 4.776033648771315e-05, "loss": 0.2093, "mean_token_accuracy": 0.9477094251662492, "num_tokens": 76900784.0, "step": 10380 }, { "entropy": 1.9730580471456052, "epoch": 0.1554619766227232, "grad_norm": 0.32480528950691223, "learning_rate": 4.7755365874092544e-05, "loss": 0.2364, "mean_token_accuracy": 0.9397799544036388, "num_tokens": 76975783.0, "step": 10390 }, { "entropy": 1.9658220052719115, "epoch": 0.15561160316422729, "grad_norm": 0.3758400082588196, "learning_rate": 4.7750390010587473e-05, "loss": 0.2431, "mean_token_accuracy": 0.9406151827424765, "num_tokens": 77048362.0, "step": 10400 }, { "entropy": 1.9778623804450035, "epoch": 0.15576122970573136, "grad_norm": 0.3254123628139496, "learning_rate": 4.774540889834847e-05, "loss": 0.2135, "mean_token_accuracy": 0.9480778209865093, "num_tokens": 77121836.0, "step": 10410 }, { "entropy": 1.935928375273943, "epoch": 0.1559108562472354, "grad_norm": 0.36201465129852295, "learning_rate": 4.7740422538527225e-05, "loss": 0.2241, "mean_token_accuracy": 0.9439206875860691, "num_tokens": 77200511.0, "step": 10420 }, { "entropy": 1.9682085797190667, "epoch": 0.1560604827887395, "grad_norm": 0.3414900302886963, "learning_rate": 4.7735430932276696e-05, "loss": 0.2238, "mean_token_accuracy": 0.9455634739249945, "num_tokens": 77273849.0, "step": 10430 }, { "entropy": 1.9416078969836235, "epoch": 0.15621010933024354, "grad_norm": 0.3483978509902954, "learning_rate": 4.773043408075102e-05, "loss": 0.2329, "mean_token_accuracy": 0.9449137635529041, "num_tokens": 77346544.0, "step": 10440 }, { "entropy": 1.9785201512277126, "epoch": 0.15635973587174762, "grad_norm": 0.3955497145652771, "learning_rate": 4.772543198510556e-05, "loss": 0.2272, "mean_token_accuracy": 0.9469719376415014, "num_tokens": 77420226.0, "step": 10450 }, { "entropy": 2.0132290981709957, "epoch": 0.15650936241325167, "grad_norm": 0.36287185549736023, "learning_rate": 4.7720424646496905e-05, "loss": 0.2493, "mean_token_accuracy": 0.9358021222054959, "num_tokens": 77495676.0, "step": 10460 }, { "entropy": 2.0146973818540572, "epoch": 0.15665898895475575, "grad_norm": 0.36396801471710205, "learning_rate": 4.771541206608282e-05, "loss": 0.2254, "mean_token_accuracy": 0.9452680945396423, "num_tokens": 77568766.0, "step": 10470 }, { "entropy": 2.0186705641448497, "epoch": 0.1568086154962598, "grad_norm": 0.3387264013290405, "learning_rate": 4.771039424502232e-05, "loss": 0.2362, "mean_token_accuracy": 0.9423900414258242, "num_tokens": 77642064.0, "step": 10480 }, { "entropy": 1.973207425326109, "epoch": 0.15695824203776387, "grad_norm": 0.3171241283416748, "learning_rate": 4.770537118447559e-05, "loss": 0.2379, "mean_token_accuracy": 0.9448492452502251, "num_tokens": 77716321.0, "step": 10490 }, { "entropy": 2.012285700440407, "epoch": 0.15710786857926792, "grad_norm": 0.2792969346046448, "learning_rate": 4.7700342885604066e-05, "loss": 0.2304, "mean_token_accuracy": 0.9414599124342203, "num_tokens": 77791143.0, "step": 10500 }, { "entropy": 1.9563880451023579, "epoch": 0.157257495120772, "grad_norm": 0.3146459460258484, "learning_rate": 4.7695309349570384e-05, "loss": 0.2164, "mean_token_accuracy": 0.94557551369071, "num_tokens": 77865517.0, "step": 10510 }, { "entropy": 1.9683196663856506, "epoch": 0.15740712166227605, "grad_norm": 0.31142696738243103, "learning_rate": 4.769027057753839e-05, "loss": 0.2189, "mean_token_accuracy": 0.9453274752944708, "num_tokens": 77942415.0, "step": 10520 }, { "entropy": 2.0028581485152244, "epoch": 0.15755674820378013, "grad_norm": 0.3106737434864044, "learning_rate": 4.768522657067313e-05, "loss": 0.2304, "mean_token_accuracy": 0.9446032267063856, "num_tokens": 78013607.0, "step": 10530 }, { "entropy": 1.991431586444378, "epoch": 0.1577063747452842, "grad_norm": 0.41271111369132996, "learning_rate": 4.7680177330140864e-05, "loss": 0.2343, "mean_token_accuracy": 0.9441709138453007, "num_tokens": 78088094.0, "step": 10540 }, { "entropy": 2.0153347618877886, "epoch": 0.15785600128678826, "grad_norm": 0.356224000453949, "learning_rate": 4.767512285710906e-05, "loss": 0.2178, "mean_token_accuracy": 0.9443151004612446, "num_tokens": 78162858.0, "step": 10550 }, { "entropy": 2.0088924184441566, "epoch": 0.15800562782829233, "grad_norm": 0.3527098596096039, "learning_rate": 4.7670063152746436e-05, "loss": 0.2497, "mean_token_accuracy": 0.9393941190093755, "num_tokens": 78236392.0, "step": 10560 }, { "entropy": 2.0209972254931925, "epoch": 0.15815525436979638, "grad_norm": 0.3115454614162445, "learning_rate": 4.7664998218222846e-05, "loss": 0.228, "mean_token_accuracy": 0.94420220926404, "num_tokens": 78311048.0, "step": 10570 }, { "entropy": 1.9964174672961235, "epoch": 0.15830488091130046, "grad_norm": 0.4216262996196747, "learning_rate": 4.7659928054709415e-05, "loss": 0.2484, "mean_token_accuracy": 0.9414950624108315, "num_tokens": 78385869.0, "step": 10580 }, { "entropy": 1.9904039442539214, "epoch": 0.1584545074528045, "grad_norm": 0.40144437551498413, "learning_rate": 4.765485266337845e-05, "loss": 0.235, "mean_token_accuracy": 0.9442124094814062, "num_tokens": 78459652.0, "step": 10590 }, { "entropy": 1.9699851073324681, "epoch": 0.1586041339943086, "grad_norm": 0.3338618576526642, "learning_rate": 4.7649772045403476e-05, "loss": 0.2325, "mean_token_accuracy": 0.9430190443992614, "num_tokens": 78533879.0, "step": 10600 }, { "entropy": 1.9537183180451394, "epoch": 0.15875376053581264, "grad_norm": 0.33143433928489685, "learning_rate": 4.7644686201959214e-05, "loss": 0.2285, "mean_token_accuracy": 0.9432450734078884, "num_tokens": 78607206.0, "step": 10610 }, { "entropy": 1.941721798479557, "epoch": 0.15890338707731672, "grad_norm": 0.34236812591552734, "learning_rate": 4.76395951342216e-05, "loss": 0.2342, "mean_token_accuracy": 0.9421915169805288, "num_tokens": 78681555.0, "step": 10620 }, { "entropy": 1.989346131682396, "epoch": 0.15905301361882077, "grad_norm": 0.3201507031917572, "learning_rate": 4.7634498843367796e-05, "loss": 0.2288, "mean_token_accuracy": 0.9434388693422079, "num_tokens": 78753899.0, "step": 10630 }, { "entropy": 2.0069540180265903, "epoch": 0.15920264016032484, "grad_norm": 0.38621047139167786, "learning_rate": 4.762939733057614e-05, "loss": 0.2103, "mean_token_accuracy": 0.943544851243496, "num_tokens": 78827981.0, "step": 10640 }, { "entropy": 1.9651928126811982, "epoch": 0.1593522667018289, "grad_norm": 0.31219255924224854, "learning_rate": 4.762429059702619e-05, "loss": 0.231, "mean_token_accuracy": 0.9450302854180336, "num_tokens": 78901733.0, "step": 10650 }, { "entropy": 1.9831410489976407, "epoch": 0.15950189324333297, "grad_norm": 0.26025286316871643, "learning_rate": 4.7619178643898725e-05, "loss": 0.2367, "mean_token_accuracy": 0.9404673781245947, "num_tokens": 78975108.0, "step": 10660 }, { "entropy": 1.978158713877201, "epoch": 0.15965151978483702, "grad_norm": 0.4043017029762268, "learning_rate": 4.7614061472375715e-05, "loss": 0.2207, "mean_token_accuracy": 0.9456560432910919, "num_tokens": 79049229.0, "step": 10670 }, { "entropy": 1.9537462018430234, "epoch": 0.1598011463263411, "grad_norm": 0.27361536026000977, "learning_rate": 4.760893908364034e-05, "loss": 0.2119, "mean_token_accuracy": 0.9488750763237477, "num_tokens": 79124867.0, "step": 10680 }, { "entropy": 1.9781516090035438, "epoch": 0.15995077286784518, "grad_norm": 0.41842177510261536, "learning_rate": 4.760381147887698e-05, "loss": 0.2323, "mean_token_accuracy": 0.9431587524712086, "num_tokens": 79196736.0, "step": 10690 }, { "entropy": 1.9668852277100086, "epoch": 0.16010039940934923, "grad_norm": 0.33304363489151, "learning_rate": 4.759867865927124e-05, "loss": 0.2228, "mean_token_accuracy": 0.9462146919220686, "num_tokens": 79270489.0, "step": 10700 }, { "entropy": 1.970092374831438, "epoch": 0.1602500259508533, "grad_norm": 0.3183971643447876, "learning_rate": 4.759354062600993e-05, "loss": 0.2114, "mean_token_accuracy": 0.946943337470293, "num_tokens": 79346060.0, "step": 10710 }, { "entropy": 1.9573637008666993, "epoch": 0.16039965249235735, "grad_norm": 0.5096936821937561, "learning_rate": 4.7588397380281024e-05, "loss": 0.239, "mean_token_accuracy": 0.9416359167546033, "num_tokens": 79416908.0, "step": 10720 }, { "entropy": 1.9613184303045272, "epoch": 0.16054927903386143, "grad_norm": 0.32115495204925537, "learning_rate": 4.7583248923273746e-05, "loss": 0.1964, "mean_token_accuracy": 0.9490230828523636, "num_tokens": 79492025.0, "step": 10730 }, { "entropy": 1.9644240103662014, "epoch": 0.16069890557536548, "grad_norm": 0.3410327434539795, "learning_rate": 4.7578095256178526e-05, "loss": 0.2223, "mean_token_accuracy": 0.945114828273654, "num_tokens": 79566212.0, "step": 10740 }, { "entropy": 1.952405869215727, "epoch": 0.16084853211686956, "grad_norm": 0.40386343002319336, "learning_rate": 4.757293638018697e-05, "loss": 0.236, "mean_token_accuracy": 0.9415817927569151, "num_tokens": 79639653.0, "step": 10750 }, { "entropy": 1.9546678058803082, "epoch": 0.1609981586583736, "grad_norm": 0.37465283274650574, "learning_rate": 4.7567772296491895e-05, "loss": 0.2184, "mean_token_accuracy": 0.9458628330379725, "num_tokens": 79713793.0, "step": 10760 }, { "entropy": 1.9670131176710128, "epoch": 0.16114778519987769, "grad_norm": 0.34774649143218994, "learning_rate": 4.7562603006287335e-05, "loss": 0.2336, "mean_token_accuracy": 0.9412055384367705, "num_tokens": 79790490.0, "step": 10770 }, { "entropy": 1.9672094404697418, "epoch": 0.16129741174138174, "grad_norm": 0.33496513962745667, "learning_rate": 4.755742851076853e-05, "loss": 0.2257, "mean_token_accuracy": 0.9471564702689648, "num_tokens": 79864554.0, "step": 10780 }, { "entropy": 1.9885177597403527, "epoch": 0.1614470382828858, "grad_norm": 0.30325421690940857, "learning_rate": 4.7552248811131896e-05, "loss": 0.2114, "mean_token_accuracy": 0.945768577978015, "num_tokens": 79940683.0, "step": 10790 }, { "entropy": 1.975594438612461, "epoch": 0.16159666482438986, "grad_norm": 0.355462908744812, "learning_rate": 4.75470639085751e-05, "loss": 0.2171, "mean_token_accuracy": 0.9456601209938527, "num_tokens": 80013159.0, "step": 10800 }, { "entropy": 1.9485169537365437, "epoch": 0.16174629136589394, "grad_norm": 0.34689298272132874, "learning_rate": 4.754187380429695e-05, "loss": 0.2368, "mean_token_accuracy": 0.9436494067311287, "num_tokens": 80083557.0, "step": 10810 }, { "entropy": 1.971580981463194, "epoch": 0.161895917907398, "grad_norm": 0.4138765335083008, "learning_rate": 4.753667849949752e-05, "loss": 0.2534, "mean_token_accuracy": 0.9404000699520111, "num_tokens": 80155087.0, "step": 10820 }, { "entropy": 2.004280689358711, "epoch": 0.16204554444890207, "grad_norm": 0.3035665452480316, "learning_rate": 4.753147799537804e-05, "loss": 0.2368, "mean_token_accuracy": 0.9413384258747101, "num_tokens": 80229524.0, "step": 10830 }, { "entropy": 1.9797514848411084, "epoch": 0.16219517099040615, "grad_norm": 0.33744123578071594, "learning_rate": 4.7526272293140975e-05, "loss": 0.2425, "mean_token_accuracy": 0.9379522424191237, "num_tokens": 80303836.0, "step": 10840 }, { "entropy": 1.958918285369873, "epoch": 0.1623447975319102, "grad_norm": 0.3103746473789215, "learning_rate": 4.7521061393989964e-05, "loss": 0.2133, "mean_token_accuracy": 0.9470954809337855, "num_tokens": 80378194.0, "step": 10850 }, { "entropy": 1.9701179198920726, "epoch": 0.16249442407341427, "grad_norm": 0.4412486255168915, "learning_rate": 4.7515845299129854e-05, "loss": 0.2445, "mean_token_accuracy": 0.9429891966283321, "num_tokens": 80452563.0, "step": 10860 }, { "entropy": 1.949977456778288, "epoch": 0.16264405061491832, "grad_norm": 0.37699609994888306, "learning_rate": 4.75106240097667e-05, "loss": 0.2142, "mean_token_accuracy": 0.9463824927806854, "num_tokens": 80526005.0, "step": 10870 }, { "entropy": 1.9736156642436982, "epoch": 0.1627936771564224, "grad_norm": 0.27534738183021545, "learning_rate": 4.7505397527107776e-05, "loss": 0.2185, "mean_token_accuracy": 0.9467197686433793, "num_tokens": 80603133.0, "step": 10880 }, { "entropy": 2.000217464566231, "epoch": 0.16294330369792645, "grad_norm": 0.33747947216033936, "learning_rate": 4.750016585236152e-05, "loss": 0.2361, "mean_token_accuracy": 0.9405313212424516, "num_tokens": 80676285.0, "step": 10890 }, { "entropy": 1.9920235708355905, "epoch": 0.16309293023943053, "grad_norm": 0.33371323347091675, "learning_rate": 4.749492898673758e-05, "loss": 0.2253, "mean_token_accuracy": 0.9417155481874943, "num_tokens": 80750781.0, "step": 10900 }, { "entropy": 1.9735712334513664, "epoch": 0.16324255678093458, "grad_norm": 0.35176360607147217, "learning_rate": 4.7489686931446843e-05, "loss": 0.2293, "mean_token_accuracy": 0.9438793353736401, "num_tokens": 80824533.0, "step": 10910 }, { "entropy": 2.008169595897198, "epoch": 0.16339218332243866, "grad_norm": 0.2957383990287781, "learning_rate": 4.7484439687701336e-05, "loss": 0.2195, "mean_token_accuracy": 0.9459058258682489, "num_tokens": 80902321.0, "step": 10920 }, { "entropy": 1.9874602533876895, "epoch": 0.1635418098639427, "grad_norm": 0.31329163908958435, "learning_rate": 4.7479187256714336e-05, "loss": 0.2202, "mean_token_accuracy": 0.9472841840237379, "num_tokens": 80978387.0, "step": 10930 }, { "entropy": 1.968823428452015, "epoch": 0.16369143640544678, "grad_norm": 0.3770764172077179, "learning_rate": 4.747392963970028e-05, "loss": 0.2198, "mean_token_accuracy": 0.945463977009058, "num_tokens": 81054543.0, "step": 10940 }, { "entropy": 1.941917323321104, "epoch": 0.16384106294695083, "grad_norm": 0.407034307718277, "learning_rate": 4.746866683787484e-05, "loss": 0.2338, "mean_token_accuracy": 0.9455674681812525, "num_tokens": 81126519.0, "step": 10950 }, { "entropy": 1.968162039667368, "epoch": 0.1639906894884549, "grad_norm": 0.4003603756427765, "learning_rate": 4.746339885245486e-05, "loss": 0.2481, "mean_token_accuracy": 0.9375172656029462, "num_tokens": 81202184.0, "step": 10960 }, { "entropy": 1.983988807350397, "epoch": 0.164140316029959, "grad_norm": 0.34252604842185974, "learning_rate": 4.745812568465839e-05, "loss": 0.2398, "mean_token_accuracy": 0.9432325001806021, "num_tokens": 81274197.0, "step": 10970 }, { "entropy": 2.0024105235934258, "epoch": 0.16428994257146304, "grad_norm": 0.36099374294281006, "learning_rate": 4.745284733570468e-05, "loss": 0.2351, "mean_token_accuracy": 0.9424055811017752, "num_tokens": 81347282.0, "step": 10980 }, { "entropy": 1.9782360464334487, "epoch": 0.16443956911296712, "grad_norm": 0.24694211781024933, "learning_rate": 4.7447563806814185e-05, "loss": 0.2077, "mean_token_accuracy": 0.9477418273687362, "num_tokens": 81423730.0, "step": 10990 }, { "entropy": 1.9813645020127297, "epoch": 0.16458919565447117, "grad_norm": 0.4146910309791565, "learning_rate": 4.744227509920855e-05, "loss": 0.2422, "mean_token_accuracy": 0.9429894223809242, "num_tokens": 81496003.0, "step": 11000 }, { "epoch": 0.16458919565447117, "eval_entropy": 2.004666271686554, "eval_loss": 0.25224271416664124, "eval_mean_token_accuracy": 0.9437370450496674, "eval_num_tokens": 81496003.0, "eval_runtime": 543.6838, "eval_samples_per_second": 36.786, "eval_steps_per_second": 9.197, "step": 11000 }, { "entropy": 1.9927356079220773, "epoch": 0.16473882219597524, "grad_norm": 0.33182159066200256, "learning_rate": 4.743698121411061e-05, "loss": 0.209, "mean_token_accuracy": 0.9461609624326229, "num_tokens": 81569623.0, "step": 11010 }, { "entropy": 2.0417598888278006, "epoch": 0.1648884487374793, "grad_norm": 0.32985419034957886, "learning_rate": 4.7431682152744414e-05, "loss": 0.242, "mean_token_accuracy": 0.9359782136976719, "num_tokens": 81644163.0, "step": 11020 }, { "entropy": 2.046129982918501, "epoch": 0.16503807527898337, "grad_norm": 0.4606972634792328, "learning_rate": 4.74263779163352e-05, "loss": 0.2545, "mean_token_accuracy": 0.9384373672306537, "num_tokens": 81716254.0, "step": 11030 }, { "entropy": 2.00350741147995, "epoch": 0.16518770182048742, "grad_norm": 0.3878551721572876, "learning_rate": 4.7421068506109394e-05, "loss": 0.2489, "mean_token_accuracy": 0.9392802346497774, "num_tokens": 81788120.0, "step": 11040 }, { "entropy": 2.003596521168947, "epoch": 0.1653373283619915, "grad_norm": 0.3278098404407501, "learning_rate": 4.741575392329462e-05, "loss": 0.2449, "mean_token_accuracy": 0.9429786529392004, "num_tokens": 81862624.0, "step": 11050 }, { "entropy": 2.0163043096661566, "epoch": 0.16548695490349555, "grad_norm": 0.3412734270095825, "learning_rate": 4.741043416911974e-05, "loss": 0.2541, "mean_token_accuracy": 0.935042281076312, "num_tokens": 81936836.0, "step": 11060 }, { "entropy": 1.989291739463806, "epoch": 0.16563658144499963, "grad_norm": 0.34780606627464294, "learning_rate": 4.740510924481473e-05, "loss": 0.2589, "mean_token_accuracy": 0.9357319053262472, "num_tokens": 82009898.0, "step": 11070 }, { "entropy": 1.9842719361186028, "epoch": 0.16578620798650368, "grad_norm": 0.34832021594047546, "learning_rate": 4.739977915161083e-05, "loss": 0.2336, "mean_token_accuracy": 0.9419632039964199, "num_tokens": 82085868.0, "step": 11080 }, { "entropy": 2.022157220542431, "epoch": 0.16593583452800775, "grad_norm": 0.31946173310279846, "learning_rate": 4.7394443890740456e-05, "loss": 0.2451, "mean_token_accuracy": 0.9380356334149837, "num_tokens": 82160104.0, "step": 11090 }, { "entropy": 1.9865759693086147, "epoch": 0.1660854610695118, "grad_norm": 0.3690767288208008, "learning_rate": 4.7389103463437196e-05, "loss": 0.2449, "mean_token_accuracy": 0.940768975764513, "num_tokens": 82235915.0, "step": 11100 }, { "entropy": 1.9949030950665474, "epoch": 0.16623508761101588, "grad_norm": 0.2824763357639313, "learning_rate": 4.738375787093587e-05, "loss": 0.2278, "mean_token_accuracy": 0.9438487235456705, "num_tokens": 82309623.0, "step": 11110 }, { "entropy": 2.0076543390750885, "epoch": 0.16638471415251996, "grad_norm": 0.3778853714466095, "learning_rate": 4.737840711447248e-05, "loss": 0.2286, "mean_token_accuracy": 0.9425571031868458, "num_tokens": 82387678.0, "step": 11120 }, { "entropy": 2.030814906209707, "epoch": 0.166534340694024, "grad_norm": 0.3743649423122406, "learning_rate": 4.7373051195284186e-05, "loss": 0.2285, "mean_token_accuracy": 0.9437940642237663, "num_tokens": 82461894.0, "step": 11130 }, { "entropy": 2.0106933273375036, "epoch": 0.16668396723552809, "grad_norm": 0.44694194197654724, "learning_rate": 4.73676901146094e-05, "loss": 0.232, "mean_token_accuracy": 0.9449918989092112, "num_tokens": 82537066.0, "step": 11140 }, { "entropy": 1.9608184173703194, "epoch": 0.16683359377703214, "grad_norm": 0.3679609000682831, "learning_rate": 4.73623238736877e-05, "loss": 0.2161, "mean_token_accuracy": 0.9452104546129704, "num_tokens": 82615122.0, "step": 11150 }, { "entropy": 1.9855125054717064, "epoch": 0.1669832203185362, "grad_norm": 0.40195468068122864, "learning_rate": 4.7356952473759835e-05, "loss": 0.2258, "mean_token_accuracy": 0.9458672877401113, "num_tokens": 82687518.0, "step": 11160 }, { "entropy": 1.966302090138197, "epoch": 0.16713284686004026, "grad_norm": 0.3887089788913727, "learning_rate": 4.735157591606777e-05, "loss": 0.2352, "mean_token_accuracy": 0.9384690564125776, "num_tokens": 82759632.0, "step": 11170 }, { "entropy": 1.9579239383339881, "epoch": 0.16728247340154434, "grad_norm": 0.2957284152507782, "learning_rate": 4.734619420185468e-05, "loss": 0.2235, "mean_token_accuracy": 0.9465036384761334, "num_tokens": 82835445.0, "step": 11180 }, { "entropy": 1.997496996819973, "epoch": 0.1674320999430484, "grad_norm": 0.3416714668273926, "learning_rate": 4.7340807332364905e-05, "loss": 0.2378, "mean_token_accuracy": 0.9424118213355541, "num_tokens": 82908756.0, "step": 11190 }, { "entropy": 2.019940835982561, "epoch": 0.16758172648455247, "grad_norm": 0.32623180747032166, "learning_rate": 4.733541530884398e-05, "loss": 0.2078, "mean_token_accuracy": 0.9473976008594036, "num_tokens": 82984683.0, "step": 11200 }, { "entropy": 2.042385031282902, "epoch": 0.16773135302605652, "grad_norm": 0.37172645330429077, "learning_rate": 4.7330018132538645e-05, "loss": 0.2422, "mean_token_accuracy": 0.9400179572403431, "num_tokens": 83057513.0, "step": 11210 }, { "entropy": 2.015123999118805, "epoch": 0.1678809795675606, "grad_norm": 0.3376302421092987, "learning_rate": 4.7324615804696816e-05, "loss": 0.2352, "mean_token_accuracy": 0.9445292435586452, "num_tokens": 83132521.0, "step": 11220 }, { "entropy": 2.0334195122122765, "epoch": 0.16803060610906465, "grad_norm": 0.3890132009983063, "learning_rate": 4.731920832656761e-05, "loss": 0.2399, "mean_token_accuracy": 0.940800054743886, "num_tokens": 83206297.0, "step": 11230 }, { "entropy": 1.9911458320915698, "epoch": 0.16818023265056872, "grad_norm": 0.27696743607521057, "learning_rate": 4.7313795699401326e-05, "loss": 0.212, "mean_token_accuracy": 0.9480526529252529, "num_tokens": 83279423.0, "step": 11240 }, { "entropy": 2.006420696526766, "epoch": 0.16832985919207277, "grad_norm": 0.26376888155937195, "learning_rate": 4.730837792444947e-05, "loss": 0.2424, "mean_token_accuracy": 0.9410385452210903, "num_tokens": 83357460.0, "step": 11250 }, { "entropy": 2.003609035909176, "epoch": 0.16847948573357685, "grad_norm": 0.3280031085014343, "learning_rate": 4.7302955002964725e-05, "loss": 0.2247, "mean_token_accuracy": 0.9427330803126097, "num_tokens": 83433069.0, "step": 11260 }, { "entropy": 2.0081531308591365, "epoch": 0.16862911227508093, "grad_norm": 0.30559009313583374, "learning_rate": 4.7297526936200956e-05, "loss": 0.2189, "mean_token_accuracy": 0.943436112254858, "num_tokens": 83506417.0, "step": 11270 }, { "entropy": 1.9873912274837493, "epoch": 0.16877873881658498, "grad_norm": 0.3467153012752533, "learning_rate": 4.729209372541324e-05, "loss": 0.2426, "mean_token_accuracy": 0.9395671043545007, "num_tokens": 83580790.0, "step": 11280 }, { "entropy": 1.9938005469739437, "epoch": 0.16892836535808906, "grad_norm": 0.33694988489151, "learning_rate": 4.728665537185783e-05, "loss": 0.2305, "mean_token_accuracy": 0.9443761296570301, "num_tokens": 83656969.0, "step": 11290 }, { "entropy": 1.9792845122516156, "epoch": 0.1690779918995931, "grad_norm": 0.37290507555007935, "learning_rate": 4.7281211876792177e-05, "loss": 0.2315, "mean_token_accuracy": 0.9427817400544882, "num_tokens": 83735036.0, "step": 11300 }, { "entropy": 1.9764795929193497, "epoch": 0.16922761844109718, "grad_norm": 0.31503549218177795, "learning_rate": 4.7275763241474895e-05, "loss": 0.2369, "mean_token_accuracy": 0.9433816157281398, "num_tokens": 83810555.0, "step": 11310 }, { "entropy": 2.0068880416452886, "epoch": 0.16937724498260123, "grad_norm": 0.3658764064311981, "learning_rate": 4.727030946716582e-05, "loss": 0.2314, "mean_token_accuracy": 0.942457003891468, "num_tokens": 83886670.0, "step": 11320 }, { "entropy": 1.9784133471548557, "epoch": 0.1695268715241053, "grad_norm": 0.30738013982772827, "learning_rate": 4.726485055512596e-05, "loss": 0.2061, "mean_token_accuracy": 0.9475188191980124, "num_tokens": 83962578.0, "step": 11330 }, { "entropy": 1.9734949164092541, "epoch": 0.16967649806560936, "grad_norm": 0.322635680437088, "learning_rate": 4.725938650661752e-05, "loss": 0.252, "mean_token_accuracy": 0.9433252871036529, "num_tokens": 84038224.0, "step": 11340 }, { "entropy": 1.9685859464108943, "epoch": 0.16982612460711344, "grad_norm": 0.3552205562591553, "learning_rate": 4.7253917322903865e-05, "loss": 0.2219, "mean_token_accuracy": 0.9435147665441036, "num_tokens": 84114270.0, "step": 11350 }, { "entropy": 1.9976129665970803, "epoch": 0.1699757511486175, "grad_norm": 0.3485437035560608, "learning_rate": 4.724844300524958e-05, "loss": 0.2337, "mean_token_accuracy": 0.9430071525275707, "num_tokens": 84187117.0, "step": 11360 }, { "entropy": 2.025367783755064, "epoch": 0.17012537769012157, "grad_norm": 0.3402247726917267, "learning_rate": 4.724296355492043e-05, "loss": 0.2363, "mean_token_accuracy": 0.9379003636538983, "num_tokens": 84259224.0, "step": 11370 }, { "entropy": 2.0367686569690706, "epoch": 0.17027500423162562, "grad_norm": 0.2624521553516388, "learning_rate": 4.723747897318334e-05, "loss": 0.2409, "mean_token_accuracy": 0.9414156951010227, "num_tokens": 84333292.0, "step": 11380 }, { "entropy": 1.998896025121212, "epoch": 0.1704246307731297, "grad_norm": 0.37605130672454834, "learning_rate": 4.7231989261306474e-05, "loss": 0.2323, "mean_token_accuracy": 0.9418044328689575, "num_tokens": 84406272.0, "step": 11390 }, { "entropy": 1.990217313170433, "epoch": 0.17057425731463374, "grad_norm": 0.25922632217407227, "learning_rate": 4.722649442055913e-05, "loss": 0.2124, "mean_token_accuracy": 0.9490035511553288, "num_tokens": 84482908.0, "step": 11400 }, { "entropy": 2.0117429167032244, "epoch": 0.17072388385613782, "grad_norm": 0.3807252049446106, "learning_rate": 4.722099445221181e-05, "loss": 0.2504, "mean_token_accuracy": 0.9396326608955861, "num_tokens": 84552310.0, "step": 11410 }, { "entropy": 1.9989011235535146, "epoch": 0.1708735103976419, "grad_norm": 0.33218055963516235, "learning_rate": 4.7215489357536224e-05, "loss": 0.2433, "mean_token_accuracy": 0.9399367064237595, "num_tokens": 84626001.0, "step": 11420 }, { "entropy": 1.9518065460026264, "epoch": 0.17102313693914595, "grad_norm": 0.2501559555530548, "learning_rate": 4.720997913780523e-05, "loss": 0.2068, "mean_token_accuracy": 0.9479783162474632, "num_tokens": 84701016.0, "step": 11430 }, { "entropy": 1.9699207291007041, "epoch": 0.17117276348065003, "grad_norm": 0.43689748644828796, "learning_rate": 4.72044637942929e-05, "loss": 0.2191, "mean_token_accuracy": 0.9467272449284792, "num_tokens": 84775505.0, "step": 11440 }, { "entropy": 1.977792189270258, "epoch": 0.17132239002215408, "grad_norm": 0.3523460030555725, "learning_rate": 4.719894332827447e-05, "loss": 0.241, "mean_token_accuracy": 0.9422855533659458, "num_tokens": 84847919.0, "step": 11450 }, { "entropy": 1.9940011978149415, "epoch": 0.17147201656365815, "grad_norm": 0.2924376428127289, "learning_rate": 4.719341774102636e-05, "loss": 0.2498, "mean_token_accuracy": 0.9395606476813555, "num_tokens": 84922478.0, "step": 11460 }, { "entropy": 2.009524831175804, "epoch": 0.1716216431051622, "grad_norm": 0.31076130270957947, "learning_rate": 4.7187887033826214e-05, "loss": 0.2402, "mean_token_accuracy": 0.9428077362477779, "num_tokens": 84993883.0, "step": 11470 }, { "entropy": 1.9925081998109817, "epoch": 0.17177126964666628, "grad_norm": 0.31091538071632385, "learning_rate": 4.718235120795282e-05, "loss": 0.2185, "mean_token_accuracy": 0.9450667701661587, "num_tokens": 85066121.0, "step": 11480 }, { "entropy": 1.9914929665625096, "epoch": 0.17192089618817033, "grad_norm": 0.45386621356010437, "learning_rate": 4.717681026468615e-05, "loss": 0.2332, "mean_token_accuracy": 0.939835711568594, "num_tokens": 85138439.0, "step": 11490 }, { "entropy": 1.989299291372299, "epoch": 0.1720705227296744, "grad_norm": 0.32469138503074646, "learning_rate": 4.717126420530736e-05, "loss": 0.2261, "mean_token_accuracy": 0.9470309380441904, "num_tokens": 85209552.0, "step": 11500 }, { "entropy": 2.009778030216694, "epoch": 0.17222014927117846, "grad_norm": 0.2888270616531372, "learning_rate": 4.716571303109881e-05, "loss": 0.2275, "mean_token_accuracy": 0.9456829790025949, "num_tokens": 85282340.0, "step": 11510 }, { "entropy": 1.995441696792841, "epoch": 0.17236977581268254, "grad_norm": 0.34296390414237976, "learning_rate": 4.716015674334405e-05, "loss": 0.2308, "mean_token_accuracy": 0.9426594771444797, "num_tokens": 85354536.0, "step": 11520 }, { "entropy": 1.987555281072855, "epoch": 0.17251940235418659, "grad_norm": 0.26210397481918335, "learning_rate": 4.715459534332775e-05, "loss": 0.2555, "mean_token_accuracy": 0.9388522062450647, "num_tokens": 85427841.0, "step": 11530 }, { "entropy": 1.9448085844516754, "epoch": 0.17266902889569066, "grad_norm": 0.27720192074775696, "learning_rate": 4.714902883233584e-05, "loss": 0.1969, "mean_token_accuracy": 0.9489927809685469, "num_tokens": 85502180.0, "step": 11540 }, { "entropy": 1.9452966034412384, "epoch": 0.17281865543719474, "grad_norm": 0.3437153100967407, "learning_rate": 4.7143457211655376e-05, "loss": 0.2172, "mean_token_accuracy": 0.9438325099647045, "num_tokens": 85575647.0, "step": 11550 }, { "entropy": 1.9413255617022513, "epoch": 0.1729682819786988, "grad_norm": 0.3672594726085663, "learning_rate": 4.713788048257463e-05, "loss": 0.2309, "mean_token_accuracy": 0.9421920731663704, "num_tokens": 85647727.0, "step": 11560 }, { "entropy": 1.937819854915142, "epoch": 0.17311790852020287, "grad_norm": 0.33253198862075806, "learning_rate": 4.713229864638303e-05, "loss": 0.2182, "mean_token_accuracy": 0.9448194082826376, "num_tokens": 85723911.0, "step": 11570 }, { "entropy": 1.967685354501009, "epoch": 0.17326753506170692, "grad_norm": 0.3533225357532501, "learning_rate": 4.712671170437121e-05, "loss": 0.2518, "mean_token_accuracy": 0.9368028469383717, "num_tokens": 85796999.0, "step": 11580 }, { "entropy": 1.9381090596318244, "epoch": 0.173417161603211, "grad_norm": 0.3203708231449127, "learning_rate": 4.712111965783095e-05, "loss": 0.2314, "mean_token_accuracy": 0.9443447958678007, "num_tokens": 85871746.0, "step": 11590 }, { "entropy": 1.93919398188591, "epoch": 0.17356678814471505, "grad_norm": 0.32674136757850647, "learning_rate": 4.711552250805525e-05, "loss": 0.2264, "mean_token_accuracy": 0.944812948256731, "num_tokens": 85943385.0, "step": 11600 }, { "entropy": 1.9240055955946445, "epoch": 0.17371641468621912, "grad_norm": 0.3292785882949829, "learning_rate": 4.710992025633825e-05, "loss": 0.2122, "mean_token_accuracy": 0.947202593833208, "num_tokens": 86019547.0, "step": 11610 }, { "entropy": 1.9504281006753446, "epoch": 0.17386604122772317, "grad_norm": 0.3692404329776764, "learning_rate": 4.710431290397531e-05, "loss": 0.2311, "mean_token_accuracy": 0.9428993128240108, "num_tokens": 86095600.0, "step": 11620 }, { "entropy": 2.0045026652514935, "epoch": 0.17401566776922725, "grad_norm": 0.31418874859809875, "learning_rate": 4.709870045226293e-05, "loss": 0.2245, "mean_token_accuracy": 0.9433543309569359, "num_tokens": 86168060.0, "step": 11630 }, { "entropy": 1.9617283843457698, "epoch": 0.1741652943107313, "grad_norm": 0.3664930462837219, "learning_rate": 4.709308290249883e-05, "loss": 0.2098, "mean_token_accuracy": 0.9459586538374424, "num_tokens": 86239125.0, "step": 11640 }, { "entropy": 1.929988507926464, "epoch": 0.17431492085223538, "grad_norm": 0.3214315176010132, "learning_rate": 4.708746025598188e-05, "loss": 0.216, "mean_token_accuracy": 0.9470377992838621, "num_tokens": 86311942.0, "step": 11650 }, { "entropy": 1.9321693368256092, "epoch": 0.17446454739373943, "grad_norm": 0.4081851840019226, "learning_rate": 4.708183251401213e-05, "loss": 0.2326, "mean_token_accuracy": 0.9418060846626759, "num_tokens": 86385061.0, "step": 11660 }, { "entropy": 1.9304345116019248, "epoch": 0.1746141739352435, "grad_norm": 0.47714775800704956, "learning_rate": 4.707619967789082e-05, "loss": 0.2201, "mean_token_accuracy": 0.9451507557183504, "num_tokens": 86459482.0, "step": 11670 }, { "entropy": 1.9033852018415929, "epoch": 0.17476380047674756, "grad_norm": 0.3254261612892151, "learning_rate": 4.707056174892035e-05, "loss": 0.2166, "mean_token_accuracy": 0.947445360198617, "num_tokens": 86537158.0, "step": 11680 }, { "entropy": 1.9561389043927193, "epoch": 0.17491342701825163, "grad_norm": 0.3169887065887451, "learning_rate": 4.706491872840433e-05, "loss": 0.2418, "mean_token_accuracy": 0.9413825996220112, "num_tokens": 86609901.0, "step": 11690 }, { "entropy": 1.9344462431967258, "epoch": 0.1750630535597557, "grad_norm": 0.31042397022247314, "learning_rate": 4.705927061764751e-05, "loss": 0.2224, "mean_token_accuracy": 0.9433655422180891, "num_tokens": 86683481.0, "step": 11700 }, { "entropy": 1.9256453976035117, "epoch": 0.17521268010125976, "grad_norm": 0.41656678915023804, "learning_rate": 4.7053617417955844e-05, "loss": 0.2308, "mean_token_accuracy": 0.9437326103448868, "num_tokens": 86755408.0, "step": 11710 }, { "entropy": 1.9313046686351298, "epoch": 0.17536230664276384, "grad_norm": 0.32611384987831116, "learning_rate": 4.7047959130636437e-05, "loss": 0.2458, "mean_token_accuracy": 0.9393491044640541, "num_tokens": 86828799.0, "step": 11720 }, { "entropy": 1.919238407164812, "epoch": 0.1755119331842679, "grad_norm": 0.28555989265441895, "learning_rate": 4.704229575699761e-05, "loss": 0.2038, "mean_token_accuracy": 0.9483412735164165, "num_tokens": 86907131.0, "step": 11730 }, { "entropy": 1.959150043874979, "epoch": 0.17566155972577197, "grad_norm": 0.3012308180332184, "learning_rate": 4.703662729834881e-05, "loss": 0.2425, "mean_token_accuracy": 0.9386565640568734, "num_tokens": 86979766.0, "step": 11740 }, { "entropy": 1.9357104040682316, "epoch": 0.17581118626727602, "grad_norm": 0.35708725452423096, "learning_rate": 4.7030953756000706e-05, "loss": 0.2399, "mean_token_accuracy": 0.9450996421277523, "num_tokens": 87055950.0, "step": 11750 }, { "entropy": 1.9493321485817432, "epoch": 0.1759608128087801, "grad_norm": 0.38161128759384155, "learning_rate": 4.7025275131265106e-05, "loss": 0.2316, "mean_token_accuracy": 0.9417205080389977, "num_tokens": 87131067.0, "step": 11760 }, { "entropy": 1.9052909553050994, "epoch": 0.17611043935028414, "grad_norm": 0.3973505198955536, "learning_rate": 4.701959142545502e-05, "loss": 0.2154, "mean_token_accuracy": 0.9479531172662974, "num_tokens": 87206555.0, "step": 11770 }, { "entropy": 1.9235304296016693, "epoch": 0.17626006589178822, "grad_norm": 0.5511879324913025, "learning_rate": 4.701390263988462e-05, "loss": 0.2416, "mean_token_accuracy": 0.9396278414875269, "num_tokens": 87280966.0, "step": 11780 }, { "entropy": 1.9063782408833503, "epoch": 0.17640969243329227, "grad_norm": 0.34514760971069336, "learning_rate": 4.7008208775869254e-05, "loss": 0.2201, "mean_token_accuracy": 0.9461074750870466, "num_tokens": 87355770.0, "step": 11790 }, { "entropy": 1.908871029317379, "epoch": 0.17655931897479635, "grad_norm": 0.39832258224487305, "learning_rate": 4.700250983472544e-05, "loss": 0.2335, "mean_token_accuracy": 0.9455657251179218, "num_tokens": 87429928.0, "step": 11800 }, { "entropy": 1.93466479703784, "epoch": 0.1767089455163004, "grad_norm": 0.4126843810081482, "learning_rate": 4.699680581777088e-05, "loss": 0.2217, "mean_token_accuracy": 0.9448823489248752, "num_tokens": 87504561.0, "step": 11810 }, { "entropy": 1.9009818837046624, "epoch": 0.17685857205780448, "grad_norm": 0.3930802345275879, "learning_rate": 4.699109672632444e-05, "loss": 0.2158, "mean_token_accuracy": 0.9463172253221274, "num_tokens": 87579014.0, "step": 11820 }, { "entropy": 1.9089251399040221, "epoch": 0.17700819859930852, "grad_norm": 0.30471739172935486, "learning_rate": 4.698538256170616e-05, "loss": 0.2373, "mean_token_accuracy": 0.9431010823696852, "num_tokens": 87653519.0, "step": 11830 }, { "entropy": 1.9564978040754795, "epoch": 0.1771578251408126, "grad_norm": 0.3308776319026947, "learning_rate": 4.697966332523728e-05, "loss": 0.229, "mean_token_accuracy": 0.9403819229453803, "num_tokens": 87726421.0, "step": 11840 }, { "entropy": 1.967709169536829, "epoch": 0.17730745168231668, "grad_norm": 0.35049569606781006, "learning_rate": 4.697393901824016e-05, "loss": 0.2458, "mean_token_accuracy": 0.9409485526382924, "num_tokens": 87801350.0, "step": 11850 }, { "entropy": 1.9941087171435357, "epoch": 0.17745707822382073, "grad_norm": 0.40882498025894165, "learning_rate": 4.696820964203837e-05, "loss": 0.2405, "mean_token_accuracy": 0.9398682795464992, "num_tokens": 87873180.0, "step": 11860 }, { "entropy": 1.967032478749752, "epoch": 0.1776067047653248, "grad_norm": 0.3035028874874115, "learning_rate": 4.696247519795665e-05, "loss": 0.2471, "mean_token_accuracy": 0.9369981177151203, "num_tokens": 87946210.0, "step": 11870 }, { "entropy": 1.9317103445529937, "epoch": 0.17775633130682886, "grad_norm": 0.38312920928001404, "learning_rate": 4.69567356873209e-05, "loss": 0.2368, "mean_token_accuracy": 0.94202882014215, "num_tokens": 88023240.0, "step": 11880 }, { "entropy": 1.939635204523802, "epoch": 0.17790595784833294, "grad_norm": 0.41997671127319336, "learning_rate": 4.6950991111458206e-05, "loss": 0.2295, "mean_token_accuracy": 0.9437234051525593, "num_tokens": 88096232.0, "step": 11890 }, { "entropy": 1.9522278435528277, "epoch": 0.17805558438983698, "grad_norm": 0.3657970130443573, "learning_rate": 4.6945241471696796e-05, "loss": 0.2323, "mean_token_accuracy": 0.9440057579427957, "num_tokens": 88170037.0, "step": 11900 }, { "entropy": 1.9423182480037213, "epoch": 0.17820521093134106, "grad_norm": 0.3174639642238617, "learning_rate": 4.6939486769366106e-05, "loss": 0.2219, "mean_token_accuracy": 0.9480380184948445, "num_tokens": 88244594.0, "step": 11910 }, { "entropy": 1.9633292973041534, "epoch": 0.1783548374728451, "grad_norm": 0.3805256187915802, "learning_rate": 4.6933727005796736e-05, "loss": 0.238, "mean_token_accuracy": 0.9393668442964553, "num_tokens": 88319947.0, "step": 11920 }, { "entropy": 1.9683417588472367, "epoch": 0.1785044640143492, "grad_norm": 0.4310803711414337, "learning_rate": 4.692796218232042e-05, "loss": 0.23, "mean_token_accuracy": 0.942944435030222, "num_tokens": 88394082.0, "step": 11930 }, { "entropy": 1.9801807649433614, "epoch": 0.17865409055585324, "grad_norm": 0.3662787079811096, "learning_rate": 4.6922192300270104e-05, "loss": 0.243, "mean_token_accuracy": 0.9408070523291826, "num_tokens": 88472198.0, "step": 11940 }, { "entropy": 1.950430803745985, "epoch": 0.17880371709735732, "grad_norm": 0.28596171736717224, "learning_rate": 4.691641736097987e-05, "loss": 0.2241, "mean_token_accuracy": 0.9443738542497158, "num_tokens": 88545012.0, "step": 11950 }, { "entropy": 1.944110681116581, "epoch": 0.17895334363886137, "grad_norm": 0.3334936499595642, "learning_rate": 4.6910637365785004e-05, "loss": 0.2458, "mean_token_accuracy": 0.9389479156583548, "num_tokens": 88617233.0, "step": 11960 }, { "entropy": 1.918237602710724, "epoch": 0.17910297018036545, "grad_norm": 0.34052762389183044, "learning_rate": 4.690485231602195e-05, "loss": 0.2023, "mean_token_accuracy": 0.9470183115452528, "num_tokens": 88694388.0, "step": 11970 }, { "entropy": 1.9329943858087062, "epoch": 0.17925259672186952, "grad_norm": 0.34407472610473633, "learning_rate": 4.689906221302829e-05, "loss": 0.2129, "mean_token_accuracy": 0.9479840029031038, "num_tokens": 88770862.0, "step": 11980 }, { "entropy": 1.9657779030501843, "epoch": 0.17940222326337357, "grad_norm": 0.3621869683265686, "learning_rate": 4.689326705814282e-05, "loss": 0.2267, "mean_token_accuracy": 0.9447189796715975, "num_tokens": 88842562.0, "step": 11990 }, { "entropy": 1.988500027358532, "epoch": 0.17955184980487765, "grad_norm": 0.5374886393547058, "learning_rate": 4.6887466852705474e-05, "loss": 0.2113, "mean_token_accuracy": 0.9480006195604801, "num_tokens": 88915917.0, "step": 12000 }, { "epoch": 0.17955184980487765, "eval_entropy": 1.9875859952926636, "eval_loss": 0.2513410151004791, "eval_mean_token_accuracy": 0.9441012032866478, "eval_num_tokens": 88915917.0, "eval_runtime": 545.636, "eval_samples_per_second": 36.654, "eval_steps_per_second": 9.164, "step": 12000 }, { "entropy": 2.012895941734314, "epoch": 0.1797014763463817, "grad_norm": 0.3534221947193146, "learning_rate": 4.688166159805736e-05, "loss": 0.2492, "mean_token_accuracy": 0.9361440792679787, "num_tokens": 88989913.0, "step": 12010 }, { "entropy": 1.9872764982283115, "epoch": 0.17985110288788578, "grad_norm": 0.35632598400115967, "learning_rate": 4.687585129554076e-05, "loss": 0.2099, "mean_token_accuracy": 0.9454539440572262, "num_tokens": 89062190.0, "step": 12020 }, { "entropy": 1.9924490667879582, "epoch": 0.18000072942938983, "grad_norm": 0.423711895942688, "learning_rate": 4.6870035946499124e-05, "loss": 0.2437, "mean_token_accuracy": 0.9400301907211542, "num_tokens": 89136097.0, "step": 12030 }, { "entropy": 1.982486742734909, "epoch": 0.1801503559708939, "grad_norm": 0.34255117177963257, "learning_rate": 4.686421555227706e-05, "loss": 0.2363, "mean_token_accuracy": 0.9440226208418607, "num_tokens": 89207254.0, "step": 12040 }, { "entropy": 1.9663990870118142, "epoch": 0.18029998251239795, "grad_norm": 0.33750784397125244, "learning_rate": 4.685839011422034e-05, "loss": 0.229, "mean_token_accuracy": 0.9415697660297155, "num_tokens": 89281090.0, "step": 12050 }, { "entropy": 1.9928039580583572, "epoch": 0.18044960905390203, "grad_norm": 0.3189346492290497, "learning_rate": 4.685255963367591e-05, "loss": 0.2257, "mean_token_accuracy": 0.9457709453999996, "num_tokens": 89354069.0, "step": 12060 }, { "entropy": 2.0083920061588287, "epoch": 0.18059923559540608, "grad_norm": 0.3330828845500946, "learning_rate": 4.6846724111991897e-05, "loss": 0.2317, "mean_token_accuracy": 0.9401556111872196, "num_tokens": 89427942.0, "step": 12070 }, { "entropy": 2.0150293998420237, "epoch": 0.18074886213691016, "grad_norm": 0.307551771402359, "learning_rate": 4.684088355051756e-05, "loss": 0.2259, "mean_token_accuracy": 0.9449098668992519, "num_tokens": 89501309.0, "step": 12080 }, { "entropy": 1.9826707653701305, "epoch": 0.1808984886784142, "grad_norm": 0.3512353301048279, "learning_rate": 4.683503795060335e-05, "loss": 0.2299, "mean_token_accuracy": 0.94310795776546, "num_tokens": 89576985.0, "step": 12090 }, { "entropy": 2.0480178661644457, "epoch": 0.1810481152199183, "grad_norm": 0.29993006587028503, "learning_rate": 4.682918731360088e-05, "loss": 0.2413, "mean_token_accuracy": 0.9390263468027115, "num_tokens": 89654107.0, "step": 12100 }, { "entropy": 2.0381418362259867, "epoch": 0.18119774176142234, "grad_norm": 0.3122093379497528, "learning_rate": 4.6823331640862886e-05, "loss": 0.2268, "mean_token_accuracy": 0.9458162236958743, "num_tokens": 89726204.0, "step": 12110 }, { "entropy": 1.9979759395122527, "epoch": 0.18134736830292641, "grad_norm": 0.33283668756484985, "learning_rate": 4.681747093374335e-05, "loss": 0.2073, "mean_token_accuracy": 0.9441422950476408, "num_tokens": 89800794.0, "step": 12120 }, { "entropy": 1.9659617491066457, "epoch": 0.1814969948444305, "grad_norm": 0.38408419489860535, "learning_rate": 4.681160519359735e-05, "loss": 0.2298, "mean_token_accuracy": 0.9414928331971169, "num_tokens": 89873039.0, "step": 12130 }, { "entropy": 1.9444603882730007, "epoch": 0.18164662138593454, "grad_norm": 0.3329567611217499, "learning_rate": 4.680573442178114e-05, "loss": 0.2258, "mean_token_accuracy": 0.94475935138762, "num_tokens": 89945730.0, "step": 12140 }, { "entropy": 1.9573444165289402, "epoch": 0.18179624792743862, "grad_norm": 0.3912147581577301, "learning_rate": 4.679985861965217e-05, "loss": 0.2321, "mean_token_accuracy": 0.9435878794640302, "num_tokens": 90019389.0, "step": 12150 }, { "entropy": 1.9586571998894216, "epoch": 0.18194587446894267, "grad_norm": 0.38354218006134033, "learning_rate": 4.6793977788569e-05, "loss": 0.2185, "mean_token_accuracy": 0.946517676860094, "num_tokens": 90094285.0, "step": 12160 }, { "entropy": 1.97623944953084, "epoch": 0.18209550101044675, "grad_norm": 0.37047767639160156, "learning_rate": 4.678809192989141e-05, "loss": 0.2536, "mean_token_accuracy": 0.9409733712673187, "num_tokens": 90169038.0, "step": 12170 }, { "entropy": 2.041138318926096, "epoch": 0.1822451275519508, "grad_norm": 0.3336089849472046, "learning_rate": 4.678220104498031e-05, "loss": 0.2274, "mean_token_accuracy": 0.942755876109004, "num_tokens": 90250646.0, "step": 12180 }, { "entropy": 2.015570829808712, "epoch": 0.18239475409345487, "grad_norm": 0.37503889203071594, "learning_rate": 4.677630513519777e-05, "loss": 0.1945, "mean_token_accuracy": 0.9520297717303038, "num_tokens": 90324523.0, "step": 12190 }, { "entropy": 1.973142673075199, "epoch": 0.18254438063495892, "grad_norm": 0.41232702136039734, "learning_rate": 4.677040420190703e-05, "loss": 0.2357, "mean_token_accuracy": 0.9427297707647085, "num_tokens": 90397984.0, "step": 12200 }, { "entropy": 1.9758772172033787, "epoch": 0.182694007176463, "grad_norm": 0.3938673734664917, "learning_rate": 4.676449824647249e-05, "loss": 0.2305, "mean_token_accuracy": 0.9453857235610486, "num_tokens": 90472863.0, "step": 12210 }, { "entropy": 2.016880201548338, "epoch": 0.18284363371796705, "grad_norm": 0.4802177846431732, "learning_rate": 4.675858727025973e-05, "loss": 0.2488, "mean_token_accuracy": 0.9390620745718479, "num_tokens": 90545328.0, "step": 12220 }, { "entropy": 2.0198921017348765, "epoch": 0.18299326025947113, "grad_norm": 0.33742478489875793, "learning_rate": 4.675267127463545e-05, "loss": 0.2219, "mean_token_accuracy": 0.9443189572542906, "num_tokens": 90621653.0, "step": 12230 }, { "entropy": 2.04875762462616, "epoch": 0.18314288680097518, "grad_norm": 0.3153846263885498, "learning_rate": 4.6746750260967525e-05, "loss": 0.241, "mean_token_accuracy": 0.939516383036971, "num_tokens": 90696348.0, "step": 12240 }, { "entropy": 2.0584877356886864, "epoch": 0.18329251334247926, "grad_norm": 0.2935430705547333, "learning_rate": 4.6740824230625025e-05, "loss": 0.2143, "mean_token_accuracy": 0.9445522993803024, "num_tokens": 90772986.0, "step": 12250 }, { "entropy": 1.9970536909997463, "epoch": 0.1834421398839833, "grad_norm": 0.3429434895515442, "learning_rate": 4.673489318497815e-05, "loss": 0.2245, "mean_token_accuracy": 0.9447935916483402, "num_tokens": 90847550.0, "step": 12260 }, { "entropy": 1.9761030197143554, "epoch": 0.18359176642548738, "grad_norm": 0.3029574751853943, "learning_rate": 4.6728957125398256e-05, "loss": 0.2319, "mean_token_accuracy": 0.9419239275157452, "num_tokens": 90921388.0, "step": 12270 }, { "entropy": 2.002379209548235, "epoch": 0.18374139296699146, "grad_norm": 0.31647494435310364, "learning_rate": 4.672301605325786e-05, "loss": 0.2626, "mean_token_accuracy": 0.9385421011596918, "num_tokens": 90994944.0, "step": 12280 }, { "entropy": 2.0049819447100163, "epoch": 0.1838910195084955, "grad_norm": 0.3294638395309448, "learning_rate": 4.671706996993064e-05, "loss": 0.2212, "mean_token_accuracy": 0.9447358623147011, "num_tokens": 91072590.0, "step": 12290 }, { "entropy": 1.9556850589811803, "epoch": 0.1840406460499996, "grad_norm": 0.3292301297187805, "learning_rate": 4.671111887679146e-05, "loss": 0.2292, "mean_token_accuracy": 0.9431035924702883, "num_tokens": 91146085.0, "step": 12300 }, { "entropy": 1.9493032641708852, "epoch": 0.18419027259150364, "grad_norm": 0.4046098291873932, "learning_rate": 4.670516277521631e-05, "loss": 0.2394, "mean_token_accuracy": 0.9407251317054033, "num_tokens": 91219831.0, "step": 12310 }, { "entropy": 1.9774758778512478, "epoch": 0.18433989913300772, "grad_norm": 0.2884744703769684, "learning_rate": 4.669920166658233e-05, "loss": 0.227, "mean_token_accuracy": 0.941375371068716, "num_tokens": 91294385.0, "step": 12320 }, { "entropy": 1.9768357135355472, "epoch": 0.18448952567451177, "grad_norm": 0.35058748722076416, "learning_rate": 4.669323555226784e-05, "loss": 0.2005, "mean_token_accuracy": 0.9459309797734022, "num_tokens": 91366030.0, "step": 12330 }, { "entropy": 1.9743297010660172, "epoch": 0.18463915221601584, "grad_norm": 0.3337935507297516, "learning_rate": 4.6687264433652325e-05, "loss": 0.2254, "mean_token_accuracy": 0.943428598344326, "num_tokens": 91438181.0, "step": 12340 }, { "entropy": 1.9773857183754444, "epoch": 0.1847887787575199, "grad_norm": 0.384075790643692, "learning_rate": 4.668128831211641e-05, "loss": 0.2389, "mean_token_accuracy": 0.9412962321192027, "num_tokens": 91514040.0, "step": 12350 }, { "entropy": 1.986565286666155, "epoch": 0.18493840529902397, "grad_norm": 0.25894656777381897, "learning_rate": 4.667530718904187e-05, "loss": 0.2309, "mean_token_accuracy": 0.9439631383866072, "num_tokens": 91590875.0, "step": 12360 }, { "entropy": 1.9711171582341194, "epoch": 0.18508803184052802, "grad_norm": 0.31875500082969666, "learning_rate": 4.666932106581166e-05, "loss": 0.235, "mean_token_accuracy": 0.9451153051108122, "num_tokens": 91666768.0, "step": 12370 }, { "entropy": 1.9550660729408265, "epoch": 0.1852376583820321, "grad_norm": 0.2813469469547272, "learning_rate": 4.666332994380987e-05, "loss": 0.2105, "mean_token_accuracy": 0.9487713694572448, "num_tokens": 91743694.0, "step": 12380 }, { "entropy": 1.9945204332470894, "epoch": 0.18538728492353615, "grad_norm": 0.3674592673778534, "learning_rate": 4.665733382442175e-05, "loss": 0.2448, "mean_token_accuracy": 0.9395047053694725, "num_tokens": 91817221.0, "step": 12390 }, { "entropy": 2.0199562132358553, "epoch": 0.18553691146504023, "grad_norm": 0.38970842957496643, "learning_rate": 4.6651332709033715e-05, "loss": 0.2394, "mean_token_accuracy": 0.9402485869824886, "num_tokens": 91891831.0, "step": 12400 }, { "entropy": 2.012060023844242, "epoch": 0.18568653800654428, "grad_norm": 0.3685074746608734, "learning_rate": 4.664532659903333e-05, "loss": 0.2489, "mean_token_accuracy": 0.9402780160307884, "num_tokens": 91964973.0, "step": 12410 }, { "entropy": 1.9883493572473525, "epoch": 0.18583616454804835, "grad_norm": 0.32115596532821655, "learning_rate": 4.663931549580932e-05, "loss": 0.2035, "mean_token_accuracy": 0.9494829922914505, "num_tokens": 92041187.0, "step": 12420 }, { "entropy": 2.0159843400120736, "epoch": 0.18598579108955243, "grad_norm": 0.4011954367160797, "learning_rate": 4.663329940075155e-05, "loss": 0.2432, "mean_token_accuracy": 0.9392575826495886, "num_tokens": 92113701.0, "step": 12430 }, { "entropy": 2.0084626637399197, "epoch": 0.18613541763105648, "grad_norm": 0.2720877528190613, "learning_rate": 4.6627278315251046e-05, "loss": 0.2303, "mean_token_accuracy": 0.9442315146327018, "num_tokens": 92187595.0, "step": 12440 }, { "entropy": 2.0480816535651685, "epoch": 0.18628504417256056, "grad_norm": 0.35714223980903625, "learning_rate": 4.662125224070001e-05, "loss": 0.2206, "mean_token_accuracy": 0.9465075585991144, "num_tokens": 92260465.0, "step": 12450 }, { "entropy": 2.0112148486077785, "epoch": 0.1864346707140646, "grad_norm": 0.35225775837898254, "learning_rate": 4.6615221178491754e-05, "loss": 0.2113, "mean_token_accuracy": 0.9486066609621048, "num_tokens": 92336835.0, "step": 12460 }, { "entropy": 2.012115205079317, "epoch": 0.1865842972555687, "grad_norm": 0.40558138489723206, "learning_rate": 4.660918513002078e-05, "loss": 0.2286, "mean_token_accuracy": 0.9446737866848707, "num_tokens": 92409251.0, "step": 12470 }, { "entropy": 2.001447109133005, "epoch": 0.18673392379707274, "grad_norm": 0.39400357007980347, "learning_rate": 4.660314409668272e-05, "loss": 0.2202, "mean_token_accuracy": 0.9460970275104046, "num_tokens": 92483828.0, "step": 12480 }, { "entropy": 2.0200071588158606, "epoch": 0.18688355033857681, "grad_norm": 0.3507217466831207, "learning_rate": 4.6597098079874376e-05, "loss": 0.2177, "mean_token_accuracy": 0.9435345999896526, "num_tokens": 92556122.0, "step": 12490 }, { "entropy": 2.024462301284075, "epoch": 0.18703317688008086, "grad_norm": 0.359611451625824, "learning_rate": 4.65910470809937e-05, "loss": 0.2277, "mean_token_accuracy": 0.9451525513082742, "num_tokens": 92632267.0, "step": 12500 }, { "entropy": 2.0418856598436834, "epoch": 0.18718280342158494, "grad_norm": 0.416637122631073, "learning_rate": 4.658499110143978e-05, "loss": 0.2404, "mean_token_accuracy": 0.9408710427582264, "num_tokens": 92703385.0, "step": 12510 }, { "entropy": 2.0599921569228172, "epoch": 0.187332429963089, "grad_norm": 0.3596418499946594, "learning_rate": 4.657893014261286e-05, "loss": 0.2344, "mean_token_accuracy": 0.9438908442854881, "num_tokens": 92775553.0, "step": 12520 }, { "entropy": 2.033356899023056, "epoch": 0.18748205650459307, "grad_norm": 0.267794132232666, "learning_rate": 4.657286420591436e-05, "loss": 0.2006, "mean_token_accuracy": 0.9488066412508488, "num_tokens": 92851494.0, "step": 12530 }, { "entropy": 1.994048361480236, "epoch": 0.18763168304609712, "grad_norm": 0.28815969824790955, "learning_rate": 4.656679329274682e-05, "loss": 0.2174, "mean_token_accuracy": 0.9466773256659508, "num_tokens": 92929310.0, "step": 12540 }, { "entropy": 1.986451756209135, "epoch": 0.1877813095876012, "grad_norm": 0.3258649408817291, "learning_rate": 4.656071740451395e-05, "loss": 0.2099, "mean_token_accuracy": 0.9459570970386266, "num_tokens": 93005383.0, "step": 12550 }, { "entropy": 1.9851609982550145, "epoch": 0.18793093612910527, "grad_norm": 0.412160724401474, "learning_rate": 4.65546365426206e-05, "loss": 0.226, "mean_token_accuracy": 0.944441294670105, "num_tokens": 93079874.0, "step": 12560 }, { "entropy": 1.9879626117646694, "epoch": 0.18808056267060932, "grad_norm": 0.5187681913375854, "learning_rate": 4.654855070847277e-05, "loss": 0.2123, "mean_token_accuracy": 0.948008393123746, "num_tokens": 93154115.0, "step": 12570 }, { "entropy": 1.993713741749525, "epoch": 0.1882301892121134, "grad_norm": 0.3736415207386017, "learning_rate": 4.654245990347762e-05, "loss": 0.2451, "mean_token_accuracy": 0.9392469093203545, "num_tokens": 93227654.0, "step": 12580 }, { "entropy": 1.9707159124314786, "epoch": 0.18837981575361745, "grad_norm": 0.3252852261066437, "learning_rate": 4.653636412904344e-05, "loss": 0.2293, "mean_token_accuracy": 0.9420193661004305, "num_tokens": 93301105.0, "step": 12590 }, { "entropy": 2.0169090069830418, "epoch": 0.18852944229512153, "grad_norm": 0.34150323271751404, "learning_rate": 4.65302633865797e-05, "loss": 0.2272, "mean_token_accuracy": 0.9447330333292484, "num_tokens": 93375384.0, "step": 12600 }, { "entropy": 1.9933415532112122, "epoch": 0.18867906883662558, "grad_norm": 0.3371177017688751, "learning_rate": 4.6524157677496985e-05, "loss": 0.2238, "mean_token_accuracy": 0.9466878648847341, "num_tokens": 93450330.0, "step": 12610 }, { "entropy": 1.9838598623871804, "epoch": 0.18882869537812966, "grad_norm": 0.3177426755428314, "learning_rate": 4.651804700320706e-05, "loss": 0.2162, "mean_token_accuracy": 0.9484531678259372, "num_tokens": 93523839.0, "step": 12620 }, { "entropy": 2.011392040550709, "epoch": 0.1889783219196337, "grad_norm": 0.343526691198349, "learning_rate": 4.6511931365122804e-05, "loss": 0.2155, "mean_token_accuracy": 0.9463164493441582, "num_tokens": 93598052.0, "step": 12630 }, { "entropy": 2.048951276391745, "epoch": 0.18912794846113778, "grad_norm": 0.36618557572364807, "learning_rate": 4.6505810764658267e-05, "loss": 0.2518, "mean_token_accuracy": 0.9396453212946654, "num_tokens": 93671792.0, "step": 12640 }, { "entropy": 2.046569278091192, "epoch": 0.18927757500264183, "grad_norm": 0.3630104064941406, "learning_rate": 4.649968520322864e-05, "loss": 0.2182, "mean_token_accuracy": 0.9469216849654913, "num_tokens": 93743419.0, "step": 12650 }, { "entropy": 1.998548550158739, "epoch": 0.1894272015441459, "grad_norm": 0.3913586139678955, "learning_rate": 4.649355468225026e-05, "loss": 0.2342, "mean_token_accuracy": 0.9418482434004545, "num_tokens": 93818566.0, "step": 12660 }, { "entropy": 2.0538141928613185, "epoch": 0.18957682808564996, "grad_norm": 0.37342703342437744, "learning_rate": 4.648741920314062e-05, "loss": 0.2143, "mean_token_accuracy": 0.9431826565414667, "num_tokens": 93893712.0, "step": 12670 }, { "entropy": 2.0663034223020076, "epoch": 0.18972645462715404, "grad_norm": 0.3052605390548706, "learning_rate": 4.6481278767318356e-05, "loss": 0.2152, "mean_token_accuracy": 0.9462787631899119, "num_tokens": 93968978.0, "step": 12680 }, { "entropy": 2.0582934468984604, "epoch": 0.1898760811686581, "grad_norm": 0.46919500827789307, "learning_rate": 4.6475133376203234e-05, "loss": 0.2354, "mean_token_accuracy": 0.9422364257276058, "num_tokens": 94042750.0, "step": 12690 }, { "entropy": 2.0404804304242132, "epoch": 0.19002570771016217, "grad_norm": 0.3673853576183319, "learning_rate": 4.646898303121618e-05, "loss": 0.2208, "mean_token_accuracy": 0.9459051191806793, "num_tokens": 94115821.0, "step": 12700 }, { "entropy": 2.0473834209144117, "epoch": 0.19017533425166624, "grad_norm": 0.34090012311935425, "learning_rate": 4.646282773377927e-05, "loss": 0.2107, "mean_token_accuracy": 0.9489753317087889, "num_tokens": 94189227.0, "step": 12710 }, { "entropy": 2.030070558935404, "epoch": 0.1903249607931703, "grad_norm": 0.38792163133621216, "learning_rate": 4.64566674853157e-05, "loss": 0.2438, "mean_token_accuracy": 0.9421743422746658, "num_tokens": 94264537.0, "step": 12720 }, { "entropy": 2.0587759517133235, "epoch": 0.19047458733467437, "grad_norm": 0.3498346507549286, "learning_rate": 4.6450502287249856e-05, "loss": 0.2288, "mean_token_accuracy": 0.9464053608477115, "num_tokens": 94337210.0, "step": 12730 }, { "entropy": 2.0429174192249775, "epoch": 0.19062421387617842, "grad_norm": 0.35026171803474426, "learning_rate": 4.644433214100722e-05, "loss": 0.2365, "mean_token_accuracy": 0.9421745900064706, "num_tokens": 94408998.0, "step": 12740 }, { "entropy": 2.0348124846816065, "epoch": 0.1907738404176825, "grad_norm": 0.34645387530326843, "learning_rate": 4.643815704801445e-05, "loss": 0.2349, "mean_token_accuracy": 0.9420465085655451, "num_tokens": 94482651.0, "step": 12750 }, { "entropy": 2.0275880500674246, "epoch": 0.19092346695918655, "grad_norm": 0.395126610994339, "learning_rate": 4.643197700969933e-05, "loss": 0.232, "mean_token_accuracy": 0.9426661632955075, "num_tokens": 94560087.0, "step": 12760 }, { "entropy": 2.0455701306462286, "epoch": 0.19107309350069063, "grad_norm": 0.37439921498298645, "learning_rate": 4.6425792027490797e-05, "loss": 0.2592, "mean_token_accuracy": 0.9403974823653698, "num_tokens": 94632836.0, "step": 12770 }, { "entropy": 2.0700371719896795, "epoch": 0.19122272004219468, "grad_norm": 0.2971782982349396, "learning_rate": 4.6419602102818935e-05, "loss": 0.2231, "mean_token_accuracy": 0.9445210836827755, "num_tokens": 94707014.0, "step": 12780 }, { "entropy": 2.079044646024704, "epoch": 0.19137234658369875, "grad_norm": 0.30761635303497314, "learning_rate": 4.6413407237114965e-05, "loss": 0.2224, "mean_token_accuracy": 0.9456683035939932, "num_tokens": 94784026.0, "step": 12790 }, { "entropy": 2.0358204998075964, "epoch": 0.1915219731252028, "grad_norm": 0.3715766668319702, "learning_rate": 4.640720743181125e-05, "loss": 0.2025, "mean_token_accuracy": 0.9493161968886852, "num_tokens": 94859856.0, "step": 12800 }, { "entropy": 2.0614868752658366, "epoch": 0.19167159966670688, "grad_norm": 0.3233117163181305, "learning_rate": 4.6401002688341274e-05, "loss": 0.2362, "mean_token_accuracy": 0.9425906989723444, "num_tokens": 94930769.0, "step": 12810 }, { "entropy": 2.071055691689253, "epoch": 0.19182122620821093, "grad_norm": 0.297460675239563, "learning_rate": 4.6394793008139715e-05, "loss": 0.2261, "mean_token_accuracy": 0.9464649677276611, "num_tokens": 95008849.0, "step": 12820 }, { "entropy": 2.0118863292038442, "epoch": 0.191970852749715, "grad_norm": 0.35426774621009827, "learning_rate": 4.6388578392642344e-05, "loss": 0.2103, "mean_token_accuracy": 0.9499097801744938, "num_tokens": 95083466.0, "step": 12830 }, { "entropy": 2.0275502778589725, "epoch": 0.19212047929121906, "grad_norm": 0.40937238931655884, "learning_rate": 4.63823588432861e-05, "loss": 0.2175, "mean_token_accuracy": 0.9443226125091314, "num_tokens": 95158163.0, "step": 12840 }, { "entropy": 1.9942583583295346, "epoch": 0.19227010583272314, "grad_norm": 0.3694326877593994, "learning_rate": 4.637613436150904e-05, "loss": 0.2052, "mean_token_accuracy": 0.9458387911319732, "num_tokens": 95231564.0, "step": 12850 }, { "entropy": 1.9739273957908154, "epoch": 0.19241973237422721, "grad_norm": 0.2701924741268158, "learning_rate": 4.6369904948750385e-05, "loss": 0.2148, "mean_token_accuracy": 0.9469009272754192, "num_tokens": 95305282.0, "step": 12860 }, { "entropy": 2.0230797596275805, "epoch": 0.19256935891573126, "grad_norm": 0.331013947725296, "learning_rate": 4.636367060645048e-05, "loss": 0.2376, "mean_token_accuracy": 0.9392116397619248, "num_tokens": 95377761.0, "step": 12870 }, { "entropy": 2.0178587026894093, "epoch": 0.19271898545723534, "grad_norm": 0.30451303720474243, "learning_rate": 4.6357431336050824e-05, "loss": 0.2373, "mean_token_accuracy": 0.9406913008540869, "num_tokens": 95450764.0, "step": 12880 }, { "entropy": 2.0127994656562804, "epoch": 0.1928686119987394, "grad_norm": 0.38137465715408325, "learning_rate": 4.635118713899404e-05, "loss": 0.2324, "mean_token_accuracy": 0.9411035474389792, "num_tokens": 95521611.0, "step": 12890 }, { "entropy": 1.9883999943733215, "epoch": 0.19301823854024347, "grad_norm": 0.40598559379577637, "learning_rate": 4.634493801672391e-05, "loss": 0.2325, "mean_token_accuracy": 0.9429035481065512, "num_tokens": 95597427.0, "step": 12900 }, { "entropy": 2.0049871653318405, "epoch": 0.19316786508174752, "grad_norm": 0.3310081660747528, "learning_rate": 4.633868397068533e-05, "loss": 0.2208, "mean_token_accuracy": 0.9457008853554726, "num_tokens": 95670397.0, "step": 12910 }, { "entropy": 1.9839185170829297, "epoch": 0.1933174916232516, "grad_norm": 0.3417423665523529, "learning_rate": 4.6332425002324345e-05, "loss": 0.2277, "mean_token_accuracy": 0.9397353518754243, "num_tokens": 95744611.0, "step": 12920 }, { "entropy": 1.9417737230658532, "epoch": 0.19346711816475565, "grad_norm": 0.3883616030216217, "learning_rate": 4.632616111308814e-05, "loss": 0.2206, "mean_token_accuracy": 0.9417427971959114, "num_tokens": 95820601.0, "step": 12930 }, { "entropy": 1.9597273781895637, "epoch": 0.19361674470625972, "grad_norm": 0.3107667863368988, "learning_rate": 4.6319892304425046e-05, "loss": 0.2131, "mean_token_accuracy": 0.9458891075104475, "num_tokens": 95896030.0, "step": 12940 }, { "entropy": 2.0041957937180994, "epoch": 0.19376637124776377, "grad_norm": 0.30913451313972473, "learning_rate": 4.631361857778452e-05, "loss": 0.2564, "mean_token_accuracy": 0.9401714570820332, "num_tokens": 95969492.0, "step": 12950 }, { "entropy": 1.9882222041487694, "epoch": 0.19391599778926785, "grad_norm": 0.4230377674102783, "learning_rate": 4.630733993461715e-05, "loss": 0.2327, "mean_token_accuracy": 0.9444467082619667, "num_tokens": 96044684.0, "step": 12960 }, { "entropy": 1.9750345475971698, "epoch": 0.1940656243307719, "grad_norm": 0.3696315586566925, "learning_rate": 4.630105637637469e-05, "loss": 0.2276, "mean_token_accuracy": 0.9450843960046769, "num_tokens": 96123136.0, "step": 12970 }, { "entropy": 1.9689860306680202, "epoch": 0.19421525087227598, "grad_norm": 0.3193543553352356, "learning_rate": 4.629476790450999e-05, "loss": 0.2485, "mean_token_accuracy": 0.9359623327851295, "num_tokens": 96196828.0, "step": 12980 }, { "entropy": 2.0244121462106706, "epoch": 0.19436487741378006, "grad_norm": 0.36437466740608215, "learning_rate": 4.628847452047707e-05, "loss": 0.2521, "mean_token_accuracy": 0.9398603431880475, "num_tokens": 96268549.0, "step": 12990 }, { "entropy": 2.027615471184254, "epoch": 0.1945145039552841, "grad_norm": 0.33267271518707275, "learning_rate": 4.628217622573107e-05, "loss": 0.2169, "mean_token_accuracy": 0.9415725883096456, "num_tokens": 96342161.0, "step": 13000 }, { "epoch": 0.1945145039552841, "eval_entropy": 1.992415794301033, "eval_loss": 0.24962739646434784, "eval_mean_token_accuracy": 0.9442220282196998, "eval_num_tokens": 96342161.0, "eval_runtime": 544.4218, "eval_samples_per_second": 36.736, "eval_steps_per_second": 9.184, "step": 13000 }, { "entropy": 1.9892649523913861, "epoch": 0.19466413049678818, "grad_norm": 0.42806655168533325, "learning_rate": 4.627587302172825e-05, "loss": 0.2303, "mean_token_accuracy": 0.9446578934788704, "num_tokens": 96415995.0, "step": 13010 }, { "entropy": 2.0028172358870506, "epoch": 0.19481375703829223, "grad_norm": 0.3377649784088135, "learning_rate": 4.626956490992605e-05, "loss": 0.2374, "mean_token_accuracy": 0.9403172481805087, "num_tokens": 96488301.0, "step": 13020 }, { "entropy": 2.0120084576308725, "epoch": 0.1949633835797963, "grad_norm": 0.35164982080459595, "learning_rate": 4.6263251891783006e-05, "loss": 0.227, "mean_token_accuracy": 0.9391670566052198, "num_tokens": 96562278.0, "step": 13030 }, { "entropy": 1.9583049647510051, "epoch": 0.19511301012130036, "grad_norm": 0.28708845376968384, "learning_rate": 4.62569339687588e-05, "loss": 0.1987, "mean_token_accuracy": 0.9480591140687465, "num_tokens": 96637269.0, "step": 13040 }, { "entropy": 1.9730226568877698, "epoch": 0.19526263666280444, "grad_norm": 0.3432137370109558, "learning_rate": 4.625061114231425e-05, "loss": 0.2303, "mean_token_accuracy": 0.943403460457921, "num_tokens": 96712005.0, "step": 13050 }, { "entropy": 2.010793086141348, "epoch": 0.1954122632043085, "grad_norm": 0.29028448462486267, "learning_rate": 4.62442834139113e-05, "loss": 0.2313, "mean_token_accuracy": 0.9441841159015893, "num_tokens": 96787071.0, "step": 13060 }, { "entropy": 2.051914893090725, "epoch": 0.19556188974581257, "grad_norm": 0.30175355076789856, "learning_rate": 4.623795078501303e-05, "loss": 0.2369, "mean_token_accuracy": 0.9403054881840944, "num_tokens": 96858996.0, "step": 13070 }, { "entropy": 2.044176313281059, "epoch": 0.19571151628731662, "grad_norm": 0.3076680302619934, "learning_rate": 4.623161325708367e-05, "loss": 0.2192, "mean_token_accuracy": 0.9441388368606567, "num_tokens": 96934462.0, "step": 13080 }, { "entropy": 2.0268160715699195, "epoch": 0.1958611428288207, "grad_norm": 0.3417598009109497, "learning_rate": 4.6225270831588566e-05, "loss": 0.2104, "mean_token_accuracy": 0.9461489867419004, "num_tokens": 97009842.0, "step": 13090 }, { "entropy": 2.0121673926711083, "epoch": 0.19601076937032474, "grad_norm": 0.36367419362068176, "learning_rate": 4.621892350999419e-05, "loss": 0.2013, "mean_token_accuracy": 0.948818153142929, "num_tokens": 97086526.0, "step": 13100 }, { "entropy": 2.0380085848271845, "epoch": 0.19616039591182882, "grad_norm": 0.36796584725379944, "learning_rate": 4.621257129376817e-05, "loss": 0.2235, "mean_token_accuracy": 0.9436346258968115, "num_tokens": 97161419.0, "step": 13110 }, { "entropy": 2.028250318020582, "epoch": 0.19631002245333287, "grad_norm": 0.3301417827606201, "learning_rate": 4.6206214184379235e-05, "loss": 0.2331, "mean_token_accuracy": 0.9452169176191092, "num_tokens": 97234842.0, "step": 13120 }, { "entropy": 2.0282094910740853, "epoch": 0.19645964899483695, "grad_norm": 0.34328019618988037, "learning_rate": 4.619985218329728e-05, "loss": 0.2255, "mean_token_accuracy": 0.9430899232625961, "num_tokens": 97309630.0, "step": 13130 }, { "entropy": 2.0284452505409716, "epoch": 0.19660927553634103, "grad_norm": 0.32580190896987915, "learning_rate": 4.619348529199329e-05, "loss": 0.2115, "mean_token_accuracy": 0.9462859068065882, "num_tokens": 97383689.0, "step": 13140 }, { "entropy": 2.0305058397352695, "epoch": 0.19675890207784508, "grad_norm": 0.3518810272216797, "learning_rate": 4.618711351193943e-05, "loss": 0.2144, "mean_token_accuracy": 0.9489344019442797, "num_tokens": 97457261.0, "step": 13150 }, { "entropy": 2.0396322667598725, "epoch": 0.19690852861934915, "grad_norm": 0.34808966517448425, "learning_rate": 4.6180736844608944e-05, "loss": 0.2161, "mean_token_accuracy": 0.9473258048295975, "num_tokens": 97532004.0, "step": 13160 }, { "entropy": 2.0629574082791806, "epoch": 0.1970581551608532, "grad_norm": 0.282895565032959, "learning_rate": 4.617435529147625e-05, "loss": 0.2223, "mean_token_accuracy": 0.9454885926097631, "num_tokens": 97605922.0, "step": 13170 }, { "entropy": 2.0492070063948633, "epoch": 0.19720778170235728, "grad_norm": 0.3502848148345947, "learning_rate": 4.616796885401686e-05, "loss": 0.2183, "mean_token_accuracy": 0.9461462937295437, "num_tokens": 97680663.0, "step": 13180 }, { "entropy": 2.0526459857821466, "epoch": 0.19735740824386133, "grad_norm": 0.4252983033657074, "learning_rate": 4.616157753370745e-05, "loss": 0.2402, "mean_token_accuracy": 0.9420736491680145, "num_tokens": 97753982.0, "step": 13190 }, { "entropy": 2.031171438097954, "epoch": 0.1975070347853654, "grad_norm": 0.39808085560798645, "learning_rate": 4.615518133202579e-05, "loss": 0.2256, "mean_token_accuracy": 0.9456831488758326, "num_tokens": 97828807.0, "step": 13200 }, { "entropy": 2.0179490357637406, "epoch": 0.19765666132686946, "grad_norm": 0.37608644366264343, "learning_rate": 4.614878025045081e-05, "loss": 0.2243, "mean_token_accuracy": 0.9439956180751323, "num_tokens": 97903240.0, "step": 13210 }, { "entropy": 2.0230360493063926, "epoch": 0.19780628786837354, "grad_norm": 0.3312515914440155, "learning_rate": 4.614237429046255e-05, "loss": 0.2056, "mean_token_accuracy": 0.9471672214567661, "num_tokens": 97978637.0, "step": 13220 }, { "entropy": 2.020954118669033, "epoch": 0.1979559144098776, "grad_norm": 0.33968374133110046, "learning_rate": 4.613596345354217e-05, "loss": 0.242, "mean_token_accuracy": 0.9415618892759084, "num_tokens": 98050588.0, "step": 13230 }, { "entropy": 2.005578847974539, "epoch": 0.19810554095138166, "grad_norm": 0.31122902035713196, "learning_rate": 4.612954774117198e-05, "loss": 0.2329, "mean_token_accuracy": 0.9435742847621441, "num_tokens": 98126415.0, "step": 13240 }, { "entropy": 2.024767728149891, "epoch": 0.19825516749288571, "grad_norm": 0.3609143793582916, "learning_rate": 4.612312715483541e-05, "loss": 0.2569, "mean_token_accuracy": 0.9379268161952495, "num_tokens": 98197156.0, "step": 13250 }, { "entropy": 2.000527998059988, "epoch": 0.1984047940343898, "grad_norm": 0.3371099829673767, "learning_rate": 4.6116701696017e-05, "loss": 0.2263, "mean_token_accuracy": 0.9432230889797211, "num_tokens": 98273879.0, "step": 13260 }, { "entropy": 1.9830008544027806, "epoch": 0.19855442057589384, "grad_norm": 0.38208097219467163, "learning_rate": 4.6110271366202455e-05, "loss": 0.2148, "mean_token_accuracy": 0.9472452659159899, "num_tokens": 98351084.0, "step": 13270 }, { "entropy": 2.0097381584346294, "epoch": 0.19870404711739792, "grad_norm": 0.29632511734962463, "learning_rate": 4.610383616687856e-05, "loss": 0.2275, "mean_token_accuracy": 0.9429416820406914, "num_tokens": 98425663.0, "step": 13280 }, { "entropy": 2.0016107082366945, "epoch": 0.198853673658902, "grad_norm": 0.37086182832717896, "learning_rate": 4.6097396099533255e-05, "loss": 0.1971, "mean_token_accuracy": 0.9506999772042036, "num_tokens": 98501723.0, "step": 13290 }, { "entropy": 1.9863453939557076, "epoch": 0.19900330020040605, "grad_norm": 0.378793329000473, "learning_rate": 4.609095116565559e-05, "loss": 0.2121, "mean_token_accuracy": 0.9500246290117502, "num_tokens": 98576940.0, "step": 13300 }, { "entropy": 1.9806398324668408, "epoch": 0.19915292674191012, "grad_norm": 0.36172476410865784, "learning_rate": 4.608450136673576e-05, "loss": 0.2249, "mean_token_accuracy": 0.945240779966116, "num_tokens": 98650287.0, "step": 13310 }, { "entropy": 2.0126746609807014, "epoch": 0.19930255328341417, "grad_norm": 0.3847506642341614, "learning_rate": 4.6078046704265064e-05, "loss": 0.2255, "mean_token_accuracy": 0.9469317834824323, "num_tokens": 98723445.0, "step": 13320 }, { "entropy": 1.9976569883525372, "epoch": 0.19945217982491825, "grad_norm": 0.32241061329841614, "learning_rate": 4.6071587179735945e-05, "loss": 0.2088, "mean_token_accuracy": 0.9470632802695036, "num_tokens": 98796170.0, "step": 13330 }, { "entropy": 1.984074392169714, "epoch": 0.1996018063664223, "grad_norm": 0.32582202553749084, "learning_rate": 4.6065122794641954e-05, "loss": 0.201, "mean_token_accuracy": 0.9485153377056121, "num_tokens": 98873005.0, "step": 13340 }, { "entropy": 1.9937818862497807, "epoch": 0.19975143290792638, "grad_norm": 0.31795161962509155, "learning_rate": 4.605865355047778e-05, "loss": 0.2243, "mean_token_accuracy": 0.9431983504444361, "num_tokens": 98946320.0, "step": 13350 }, { "entropy": 1.982643087953329, "epoch": 0.19990105944943043, "grad_norm": 0.3697422444820404, "learning_rate": 4.6052179448739206e-05, "loss": 0.2128, "mean_token_accuracy": 0.9459359519183635, "num_tokens": 99021575.0, "step": 13360 }, { "entropy": 1.956934154778719, "epoch": 0.2000506859909345, "grad_norm": 0.3301470875740051, "learning_rate": 4.604570049092318e-05, "loss": 0.2165, "mean_token_accuracy": 0.9443233996629715, "num_tokens": 99096846.0, "step": 13370 }, { "entropy": 1.946332136541605, "epoch": 0.20020031253243856, "grad_norm": 0.38618722558021545, "learning_rate": 4.603921667852774e-05, "loss": 0.1992, "mean_token_accuracy": 0.9492907710373402, "num_tokens": 99171795.0, "step": 13380 }, { "entropy": 1.9673570565879346, "epoch": 0.20034993907394263, "grad_norm": 0.4620040953159332, "learning_rate": 4.603272801305206e-05, "loss": 0.2218, "mean_token_accuracy": 0.9461702398955822, "num_tokens": 99245991.0, "step": 13390 }, { "entropy": 1.9973426215350627, "epoch": 0.20049956561544668, "grad_norm": 0.333280473947525, "learning_rate": 4.602623449599644e-05, "loss": 0.2043, "mean_token_accuracy": 0.9497626837342977, "num_tokens": 99319184.0, "step": 13400 }, { "entropy": 2.023459393531084, "epoch": 0.20064919215695076, "grad_norm": 0.35945624113082886, "learning_rate": 4.601973612886231e-05, "loss": 0.2357, "mean_token_accuracy": 0.9375539746135473, "num_tokens": 99393675.0, "step": 13410 }, { "entropy": 2.0211163640022276, "epoch": 0.2007988186984548, "grad_norm": 0.3786636292934418, "learning_rate": 4.601323291315218e-05, "loss": 0.2338, "mean_token_accuracy": 0.945373747497797, "num_tokens": 99466708.0, "step": 13420 }, { "entropy": 2.0557154424488546, "epoch": 0.2009484452399589, "grad_norm": 0.3517566919326782, "learning_rate": 4.600672485036973e-05, "loss": 0.2522, "mean_token_accuracy": 0.9366081919521093, "num_tokens": 99539955.0, "step": 13430 }, { "entropy": 2.029182569682598, "epoch": 0.20109807178146297, "grad_norm": 0.31801098585128784, "learning_rate": 4.600021194201973e-05, "loss": 0.2127, "mean_token_accuracy": 0.947599996253848, "num_tokens": 99616424.0, "step": 13440 }, { "entropy": 2.0114041179418565, "epoch": 0.20124769832296702, "grad_norm": 0.29898601770401, "learning_rate": 4.5993694189608085e-05, "loss": 0.2323, "mean_token_accuracy": 0.9424703534692526, "num_tokens": 99693559.0, "step": 13450 }, { "entropy": 2.004046581685543, "epoch": 0.2013973248644711, "grad_norm": 0.2844940423965454, "learning_rate": 4.59871715946418e-05, "loss": 0.2312, "mean_token_accuracy": 0.9415409177541733, "num_tokens": 99766196.0, "step": 13460 }, { "entropy": 1.9924535147845746, "epoch": 0.20154695140597514, "grad_norm": 0.3602909445762634, "learning_rate": 4.598064415862904e-05, "loss": 0.2253, "mean_token_accuracy": 0.9447620656341315, "num_tokens": 99838637.0, "step": 13470 }, { "entropy": 2.0252523370087148, "epoch": 0.20169657794747922, "grad_norm": 0.31451576948165894, "learning_rate": 4.597411188307906e-05, "loss": 0.2517, "mean_token_accuracy": 0.9372601445764304, "num_tokens": 99911721.0, "step": 13480 }, { "entropy": 2.0222074188292027, "epoch": 0.20184620448898327, "grad_norm": 0.3806108832359314, "learning_rate": 4.596757476950221e-05, "loss": 0.2061, "mean_token_accuracy": 0.9478537701070309, "num_tokens": 99985032.0, "step": 13490 }, { "entropy": 2.0263987362384794, "epoch": 0.20199583103048735, "grad_norm": 0.33649447560310364, "learning_rate": 4.596103281941003e-05, "loss": 0.2241, "mean_token_accuracy": 0.9429521523416042, "num_tokens": 100057342.0, "step": 13500 }, { "entropy": 2.006431180983782, "epoch": 0.2021454575719914, "grad_norm": 0.3981854319572449, "learning_rate": 4.595448603431509e-05, "loss": 0.2138, "mean_token_accuracy": 0.9443598583340644, "num_tokens": 100132735.0, "step": 13510 }, { "entropy": 1.9652430541813373, "epoch": 0.20229508411349548, "grad_norm": 0.3931941092014313, "learning_rate": 4.5947934415731164e-05, "loss": 0.2331, "mean_token_accuracy": 0.9428030338138342, "num_tokens": 100205902.0, "step": 13520 }, { "entropy": 1.9791137717664242, "epoch": 0.20244471065499953, "grad_norm": 0.36476054787635803, "learning_rate": 4.594137796517308e-05, "loss": 0.2315, "mean_token_accuracy": 0.9434269558638334, "num_tokens": 100280315.0, "step": 13530 }, { "entropy": 2.003652787953615, "epoch": 0.2025943371965036, "grad_norm": 0.3404044210910797, "learning_rate": 4.593481668415681e-05, "loss": 0.2275, "mean_token_accuracy": 0.9437274042516947, "num_tokens": 100355765.0, "step": 13540 }, { "entropy": 2.0061951696872713, "epoch": 0.20274396373800765, "grad_norm": 0.2875403165817261, "learning_rate": 4.5928250574199436e-05, "loss": 0.2049, "mean_token_accuracy": 0.9470361057668925, "num_tokens": 100431129.0, "step": 13550 }, { "entropy": 2.029212936758995, "epoch": 0.20289359027951173, "grad_norm": 0.2941003739833832, "learning_rate": 4.592167963681917e-05, "loss": 0.2376, "mean_token_accuracy": 0.9400687415152789, "num_tokens": 100503907.0, "step": 13560 }, { "entropy": 2.038173444569111, "epoch": 0.2030432168210158, "grad_norm": 0.38190141320228577, "learning_rate": 4.591510387353531e-05, "loss": 0.2271, "mean_token_accuracy": 0.9434329379349947, "num_tokens": 100577285.0, "step": 13570 }, { "entropy": 2.0054588414728642, "epoch": 0.20319284336251986, "grad_norm": 0.26861098408699036, "learning_rate": 4.590852328586831e-05, "loss": 0.2088, "mean_token_accuracy": 0.9485218290239572, "num_tokens": 100653379.0, "step": 13580 }, { "entropy": 2.038307202607393, "epoch": 0.20334246990402394, "grad_norm": 0.4251239001750946, "learning_rate": 4.590193787533972e-05, "loss": 0.2393, "mean_token_accuracy": 0.937624192610383, "num_tokens": 100726169.0, "step": 13590 }, { "entropy": 2.022958455234766, "epoch": 0.203492096445528, "grad_norm": 0.3239625096321106, "learning_rate": 4.589534764347218e-05, "loss": 0.2155, "mean_token_accuracy": 0.9460875399410724, "num_tokens": 100803277.0, "step": 13600 }, { "entropy": 2.0323875240981577, "epoch": 0.20364172298703206, "grad_norm": 0.3710615336894989, "learning_rate": 4.588875259178949e-05, "loss": 0.2309, "mean_token_accuracy": 0.9419273141771555, "num_tokens": 100873353.0, "step": 13610 }, { "entropy": 2.015052127093077, "epoch": 0.20379134952853611, "grad_norm": 0.4614577889442444, "learning_rate": 4.588215272181654e-05, "loss": 0.2482, "mean_token_accuracy": 0.9371887370944023, "num_tokens": 100946619.0, "step": 13620 }, { "entropy": 2.0216915301978586, "epoch": 0.2039409760700402, "grad_norm": 0.33102545142173767, "learning_rate": 4.587554803507934e-05, "loss": 0.2165, "mean_token_accuracy": 0.9474774982780219, "num_tokens": 101023012.0, "step": 13630 }, { "entropy": 2.0015990279614924, "epoch": 0.20409060261154424, "grad_norm": 0.379935085773468, "learning_rate": 4.5868938533104994e-05, "loss": 0.216, "mean_token_accuracy": 0.9469445217400789, "num_tokens": 101099582.0, "step": 13640 }, { "entropy": 1.9948401413857937, "epoch": 0.20424022915304832, "grad_norm": 0.3240996301174164, "learning_rate": 4.5862324217421745e-05, "loss": 0.2474, "mean_token_accuracy": 0.9417290586978198, "num_tokens": 101172142.0, "step": 13650 }, { "entropy": 2.0060148909687996, "epoch": 0.20438985569455237, "grad_norm": 0.32297807931900024, "learning_rate": 4.585570508955895e-05, "loss": 0.2266, "mean_token_accuracy": 0.9453066024929285, "num_tokens": 101247694.0, "step": 13660 }, { "entropy": 2.0866540536284446, "epoch": 0.20453948223605645, "grad_norm": 0.3442113995552063, "learning_rate": 4.584908115104707e-05, "loss": 0.261, "mean_token_accuracy": 0.9361680295318365, "num_tokens": 101319108.0, "step": 13670 }, { "entropy": 2.062214882671833, "epoch": 0.2046891087775605, "grad_norm": 0.33941927552223206, "learning_rate": 4.584245240341766e-05, "loss": 0.2209, "mean_token_accuracy": 0.9421812366694212, "num_tokens": 101394331.0, "step": 13680 }, { "entropy": 2.0513444118201734, "epoch": 0.20483873531906457, "grad_norm": 0.32651960849761963, "learning_rate": 4.583581884820341e-05, "loss": 0.2175, "mean_token_accuracy": 0.9456468645483256, "num_tokens": 101466364.0, "step": 13690 }, { "entropy": 2.0187342561781407, "epoch": 0.20498836186056862, "grad_norm": 0.38680827617645264, "learning_rate": 4.582918048693814e-05, "loss": 0.2298, "mean_token_accuracy": 0.941051097586751, "num_tokens": 101540124.0, "step": 13700 }, { "entropy": 2.020453943312168, "epoch": 0.2051379884020727, "grad_norm": 0.3135911226272583, "learning_rate": 4.5822537321156714e-05, "loss": 0.2376, "mean_token_accuracy": 0.9436797488480806, "num_tokens": 101614131.0, "step": 13710 }, { "entropy": 2.0127654664218424, "epoch": 0.20528761494357678, "grad_norm": 0.36478978395462036, "learning_rate": 4.581588935239519e-05, "loss": 0.2065, "mean_token_accuracy": 0.9487535905092954, "num_tokens": 101687314.0, "step": 13720 }, { "entropy": 2.000778838992119, "epoch": 0.20543724148508083, "grad_norm": 0.3725127577781677, "learning_rate": 4.5809236582190675e-05, "loss": 0.2242, "mean_token_accuracy": 0.945598254725337, "num_tokens": 101759078.0, "step": 13730 }, { "entropy": 2.0251752883195877, "epoch": 0.2055868680265849, "grad_norm": 0.3356815576553345, "learning_rate": 4.580257901208141e-05, "loss": 0.2441, "mean_token_accuracy": 0.9374097749590874, "num_tokens": 101831559.0, "step": 13740 }, { "entropy": 2.0035163924098014, "epoch": 0.20573649456808896, "grad_norm": 0.35103824734687805, "learning_rate": 4.579591664360675e-05, "loss": 0.2107, "mean_token_accuracy": 0.945456625148654, "num_tokens": 101905878.0, "step": 13750 }, { "entropy": 1.991134136915207, "epoch": 0.20588612110959303, "grad_norm": 0.3809353709220886, "learning_rate": 4.5789249478307145e-05, "loss": 0.2194, "mean_token_accuracy": 0.9493240788578987, "num_tokens": 101980615.0, "step": 13760 }, { "entropy": 2.06479157358408, "epoch": 0.20603574765109708, "grad_norm": 0.3452010452747345, "learning_rate": 4.578257751772417e-05, "loss": 0.2219, "mean_token_accuracy": 0.9434987671673298, "num_tokens": 102054692.0, "step": 13770 }, { "entropy": 2.0690784364938737, "epoch": 0.20618537419260116, "grad_norm": 0.3188270032405853, "learning_rate": 4.5775900763400495e-05, "loss": 0.2369, "mean_token_accuracy": 0.9364047430455684, "num_tokens": 102127223.0, "step": 13780 }, { "entropy": 2.0650348074734213, "epoch": 0.2063350007341052, "grad_norm": 0.4257359206676483, "learning_rate": 4.5769219216879914e-05, "loss": 0.2275, "mean_token_accuracy": 0.9428519736975431, "num_tokens": 102200180.0, "step": 13790 }, { "entropy": 2.052281577140093, "epoch": 0.2064846272756093, "grad_norm": 0.407749742269516, "learning_rate": 4.57625328797073e-05, "loss": 0.2284, "mean_token_accuracy": 0.9436328608542681, "num_tokens": 102273246.0, "step": 13800 }, { "entropy": 2.0550562888383865, "epoch": 0.20663425381711334, "grad_norm": 0.3340471684932709, "learning_rate": 4.575584175342868e-05, "loss": 0.2313, "mean_token_accuracy": 0.9412753332406283, "num_tokens": 102345233.0, "step": 13810 }, { "entropy": 2.0366390213370322, "epoch": 0.20678388035861742, "grad_norm": 0.3973354399204254, "learning_rate": 4.574914583959114e-05, "loss": 0.2331, "mean_token_accuracy": 0.9421418771147728, "num_tokens": 102417374.0, "step": 13820 }, { "entropy": 2.0372855864465236, "epoch": 0.20693350690012147, "grad_norm": 0.2730023264884949, "learning_rate": 4.574244513974291e-05, "loss": 0.2294, "mean_token_accuracy": 0.9400602508336305, "num_tokens": 102494337.0, "step": 13830 }, { "entropy": 2.0125115908682347, "epoch": 0.20708313344162554, "grad_norm": 0.4082595407962799, "learning_rate": 4.5735739655433285e-05, "loss": 0.2351, "mean_token_accuracy": 0.9440697595477104, "num_tokens": 102568352.0, "step": 13840 }, { "entropy": 2.0475587539374827, "epoch": 0.2072327599831296, "grad_norm": 0.33937376737594604, "learning_rate": 4.5729029388212725e-05, "loss": 0.2374, "mean_token_accuracy": 0.9444423895329237, "num_tokens": 102642015.0, "step": 13850 }, { "entropy": 2.045319443196058, "epoch": 0.20738238652463367, "grad_norm": 0.3459959030151367, "learning_rate": 4.572231433963274e-05, "loss": 0.2274, "mean_token_accuracy": 0.9403028655797243, "num_tokens": 102713298.0, "step": 13860 }, { "entropy": 2.042854976654053, "epoch": 0.20753201306613775, "grad_norm": 0.4001365005970001, "learning_rate": 4.571559451124598e-05, "loss": 0.2442, "mean_token_accuracy": 0.9411084968596697, "num_tokens": 102785749.0, "step": 13870 }, { "entropy": 2.004806100577116, "epoch": 0.2076816396076418, "grad_norm": 0.3483239412307739, "learning_rate": 4.570886990460618e-05, "loss": 0.2179, "mean_token_accuracy": 0.9450951226055622, "num_tokens": 102858265.0, "step": 13880 }, { "entropy": 2.031186766922474, "epoch": 0.20783126614914588, "grad_norm": 0.3541969954967499, "learning_rate": 4.57021405212682e-05, "loss": 0.257, "mean_token_accuracy": 0.933038930222392, "num_tokens": 102932864.0, "step": 13890 }, { "entropy": 2.0399622060358524, "epoch": 0.20798089269064993, "grad_norm": 0.2990318834781647, "learning_rate": 4.5695406362787985e-05, "loss": 0.2335, "mean_token_accuracy": 0.9412774406373501, "num_tokens": 103003551.0, "step": 13900 }, { "entropy": 2.0386382013559343, "epoch": 0.208130519232154, "grad_norm": 0.3305821120738983, "learning_rate": 4.5688667430722594e-05, "loss": 0.2089, "mean_token_accuracy": 0.9443869732320309, "num_tokens": 103076773.0, "step": 13910 }, { "entropy": 2.0051053181290626, "epoch": 0.20828014577365805, "grad_norm": 0.33082348108291626, "learning_rate": 4.5681923726630185e-05, "loss": 0.2242, "mean_token_accuracy": 0.9427927855402232, "num_tokens": 103152837.0, "step": 13920 }, { "entropy": 2.0167103253304957, "epoch": 0.20842977231516213, "grad_norm": 0.410129189491272, "learning_rate": 4.567517525207004e-05, "loss": 0.2341, "mean_token_accuracy": 0.9435369193553924, "num_tokens": 103227863.0, "step": 13930 }, { "entropy": 2.0337758123874665, "epoch": 0.20857939885666618, "grad_norm": 0.3676702380180359, "learning_rate": 4.56684220086025e-05, "loss": 0.2227, "mean_token_accuracy": 0.9445686791092157, "num_tokens": 103300551.0, "step": 13940 }, { "entropy": 2.0316509559750555, "epoch": 0.20872902539817026, "grad_norm": 0.32173505425453186, "learning_rate": 4.5661663997789046e-05, "loss": 0.2327, "mean_token_accuracy": 0.943427013233304, "num_tokens": 103373926.0, "step": 13950 }, { "entropy": 2.028409276902676, "epoch": 0.2088786519396743, "grad_norm": 0.34493017196655273, "learning_rate": 4.565490122119225e-05, "loss": 0.2341, "mean_token_accuracy": 0.9404893536120653, "num_tokens": 103448077.0, "step": 13960 }, { "entropy": 2.0482101306319236, "epoch": 0.2090282784811784, "grad_norm": 0.37653908133506775, "learning_rate": 4.56481336803758e-05, "loss": 0.254, "mean_token_accuracy": 0.9387929130345583, "num_tokens": 103522070.0, "step": 13970 }, { "entropy": 2.061176474392414, "epoch": 0.20917790502268244, "grad_norm": 0.32369285821914673, "learning_rate": 4.564136137690445e-05, "loss": 0.2182, "mean_token_accuracy": 0.9469171587377787, "num_tokens": 103598005.0, "step": 13980 }, { "entropy": 2.059191434085369, "epoch": 0.20932753156418651, "grad_norm": 0.35450130701065063, "learning_rate": 4.563458431234409e-05, "loss": 0.2468, "mean_token_accuracy": 0.9392203651368618, "num_tokens": 103671656.0, "step": 13990 }, { "entropy": 2.017102116346359, "epoch": 0.20947715810569056, "grad_norm": 0.3949444890022278, "learning_rate": 4.562780248826168e-05, "loss": 0.2259, "mean_token_accuracy": 0.9415003594011069, "num_tokens": 103744642.0, "step": 14000 }, { "epoch": 0.20947715810569056, "eval_entropy": 2.0080390424013137, "eval_loss": 0.24956941604614258, "eval_mean_token_accuracy": 0.9442813966870308, "eval_num_tokens": 103744642.0, "eval_runtime": 545.3147, "eval_samples_per_second": 36.676, "eval_steps_per_second": 9.169, "step": 14000 }, { "entropy": 2.0273719415068627, "epoch": 0.20962678464719464, "grad_norm": 0.48935794830322266, "learning_rate": 4.562101590622533e-05, "loss": 0.2319, "mean_token_accuracy": 0.9418709628283978, "num_tokens": 103819933.0, "step": 14010 }, { "entropy": 2.0217023603618145, "epoch": 0.20977641118869872, "grad_norm": 0.3255375027656555, "learning_rate": 4.5614224567804206e-05, "loss": 0.2084, "mean_token_accuracy": 0.9497186955064535, "num_tokens": 103897382.0, "step": 14020 }, { "entropy": 2.0894786074757574, "epoch": 0.20992603773020277, "grad_norm": 0.36979830265045166, "learning_rate": 4.560742847456856e-05, "loss": 0.2453, "mean_token_accuracy": 0.9374333295971156, "num_tokens": 103968011.0, "step": 14030 }, { "entropy": 2.0647294141352175, "epoch": 0.21007566427170685, "grad_norm": 0.3802686035633087, "learning_rate": 4.56006276280898e-05, "loss": 0.2267, "mean_token_accuracy": 0.9426207568496465, "num_tokens": 104041370.0, "step": 14040 }, { "entropy": 2.032048621028662, "epoch": 0.2102252908132109, "grad_norm": 0.3462115526199341, "learning_rate": 4.5593822029940396e-05, "loss": 0.2177, "mean_token_accuracy": 0.9428571213036776, "num_tokens": 104116049.0, "step": 14050 }, { "entropy": 2.0698194071650504, "epoch": 0.21037491735471497, "grad_norm": 0.35200339555740356, "learning_rate": 4.5587011681693924e-05, "loss": 0.2112, "mean_token_accuracy": 0.943917902559042, "num_tokens": 104189171.0, "step": 14060 }, { "entropy": 2.062006044387817, "epoch": 0.21052454389621902, "grad_norm": 0.3327452540397644, "learning_rate": 4.558019658492505e-05, "loss": 0.2171, "mean_token_accuracy": 0.9459799945354461, "num_tokens": 104262940.0, "step": 14070 }, { "entropy": 2.1112869054079058, "epoch": 0.2106741704377231, "grad_norm": 0.3299127519130707, "learning_rate": 4.557337674120955e-05, "loss": 0.2161, "mean_token_accuracy": 0.9473522700369358, "num_tokens": 104336884.0, "step": 14080 }, { "entropy": 2.0866345278918743, "epoch": 0.21082379697922715, "grad_norm": 0.30508989095687866, "learning_rate": 4.5566552152124306e-05, "loss": 0.2359, "mean_token_accuracy": 0.942463006079197, "num_tokens": 104410565.0, "step": 14090 }, { "entropy": 2.0396482326090335, "epoch": 0.21097342352073123, "grad_norm": 0.311389297246933, "learning_rate": 4.5559722819247255e-05, "loss": 0.238, "mean_token_accuracy": 0.9408155672252179, "num_tokens": 104485578.0, "step": 14100 }, { "entropy": 2.059272352606058, "epoch": 0.21112305006223528, "grad_norm": 0.3001222610473633, "learning_rate": 4.5552888744157485e-05, "loss": 0.2024, "mean_token_accuracy": 0.9480536639690399, "num_tokens": 104562070.0, "step": 14110 }, { "entropy": 2.0498397432267668, "epoch": 0.21127267660373936, "grad_norm": 0.3171306252479553, "learning_rate": 4.554604992843514e-05, "loss": 0.2182, "mean_token_accuracy": 0.9457856170833111, "num_tokens": 104635469.0, "step": 14120 }, { "entropy": 2.0390916019678116, "epoch": 0.2114223031452434, "grad_norm": 0.40084949135780334, "learning_rate": 4.55392063736615e-05, "loss": 0.2021, "mean_token_accuracy": 0.950303491950035, "num_tokens": 104710055.0, "step": 14130 }, { "entropy": 2.0825776025652885, "epoch": 0.21157192968674748, "grad_norm": 0.4157717227935791, "learning_rate": 4.553235808141888e-05, "loss": 0.2207, "mean_token_accuracy": 0.9444057192653418, "num_tokens": 104780604.0, "step": 14140 }, { "entropy": 2.077703186869621, "epoch": 0.21172155622825156, "grad_norm": 0.3221442401409149, "learning_rate": 4.5525505053290756e-05, "loss": 0.2119, "mean_token_accuracy": 0.9470340929925442, "num_tokens": 104853872.0, "step": 14150 }, { "entropy": 2.047640284895897, "epoch": 0.2118711827697556, "grad_norm": 0.3039309084415436, "learning_rate": 4.551864729086166e-05, "loss": 0.2095, "mean_token_accuracy": 0.9490785293281079, "num_tokens": 104929782.0, "step": 14160 }, { "entropy": 2.044596544653177, "epoch": 0.2120208093112597, "grad_norm": 0.3463141620159149, "learning_rate": 4.551178479571724e-05, "loss": 0.2312, "mean_token_accuracy": 0.9413029212504626, "num_tokens": 105005706.0, "step": 14170 }, { "entropy": 1.9910026602447033, "epoch": 0.21217043585276374, "grad_norm": 0.3136058449745178, "learning_rate": 4.55049175694442e-05, "loss": 0.2077, "mean_token_accuracy": 0.9501286294311285, "num_tokens": 105080213.0, "step": 14180 }, { "entropy": 2.009447134286165, "epoch": 0.21232006239426782, "grad_norm": 0.32847824692726135, "learning_rate": 4.5498045613630396e-05, "loss": 0.2384, "mean_token_accuracy": 0.9423948977142572, "num_tokens": 105152601.0, "step": 14190 }, { "entropy": 2.008737666159868, "epoch": 0.21246968893577187, "grad_norm": 0.3503546118736267, "learning_rate": 4.549116892986473e-05, "loss": 0.2243, "mean_token_accuracy": 0.9447012137621641, "num_tokens": 105225433.0, "step": 14200 }, { "entropy": 1.9871891394257546, "epoch": 0.21261931547727594, "grad_norm": 0.31457802653312683, "learning_rate": 4.548428751973721e-05, "loss": 0.2276, "mean_token_accuracy": 0.943184008821845, "num_tokens": 105300395.0, "step": 14210 }, { "entropy": 2.0030731901526453, "epoch": 0.21276894201878, "grad_norm": 0.2812349498271942, "learning_rate": 4.5477401384838946e-05, "loss": 0.2401, "mean_token_accuracy": 0.9453381665050984, "num_tokens": 105377221.0, "step": 14220 }, { "entropy": 1.994311522692442, "epoch": 0.21291856856028407, "grad_norm": 0.2985413074493408, "learning_rate": 4.547051052676214e-05, "loss": 0.2205, "mean_token_accuracy": 0.9466726612299681, "num_tokens": 105452687.0, "step": 14230 }, { "entropy": 2.0383806467056274, "epoch": 0.21306819510178812, "grad_norm": 0.33854004740715027, "learning_rate": 4.546361494710007e-05, "loss": 0.2314, "mean_token_accuracy": 0.9397301491349935, "num_tokens": 105526979.0, "step": 14240 }, { "entropy": 1.9875376045703887, "epoch": 0.2132178216432922, "grad_norm": 0.36132553219795227, "learning_rate": 4.545671464744713e-05, "loss": 0.2051, "mean_token_accuracy": 0.9500968258827924, "num_tokens": 105601120.0, "step": 14250 }, { "entropy": 1.9937491610646247, "epoch": 0.21336744818479625, "grad_norm": 0.4212442934513092, "learning_rate": 4.544980962939878e-05, "loss": 0.2344, "mean_token_accuracy": 0.9429334599524737, "num_tokens": 105674339.0, "step": 14260 }, { "entropy": 2.010219784080982, "epoch": 0.21351707472630033, "grad_norm": 0.3434756100177765, "learning_rate": 4.5442899894551586e-05, "loss": 0.2155, "mean_token_accuracy": 0.9454343423247338, "num_tokens": 105749181.0, "step": 14270 }, { "entropy": 2.003081592917442, "epoch": 0.21366670126780438, "grad_norm": 0.3519607186317444, "learning_rate": 4.543598544450321e-05, "loss": 0.217, "mean_token_accuracy": 0.9445916220545769, "num_tokens": 105822684.0, "step": 14280 }, { "entropy": 2.02151248306036, "epoch": 0.21381632780930845, "grad_norm": 0.3664741814136505, "learning_rate": 4.542906628085238e-05, "loss": 0.2306, "mean_token_accuracy": 0.9424382109194994, "num_tokens": 105897841.0, "step": 14290 }, { "entropy": 2.0471510611474515, "epoch": 0.21396595435081253, "grad_norm": 0.3892284333705902, "learning_rate": 4.542214240519895e-05, "loss": 0.2383, "mean_token_accuracy": 0.9425520073622465, "num_tokens": 105970105.0, "step": 14300 }, { "entropy": 2.01874038875103, "epoch": 0.21411558089231658, "grad_norm": 0.3899373412132263, "learning_rate": 4.541521381914381e-05, "loss": 0.1973, "mean_token_accuracy": 0.9492669120430947, "num_tokens": 106044014.0, "step": 14310 }, { "entropy": 2.05056769028306, "epoch": 0.21426520743382066, "grad_norm": 0.30089476704597473, "learning_rate": 4.540828052428902e-05, "loss": 0.2244, "mean_token_accuracy": 0.9427152283489704, "num_tokens": 106116822.0, "step": 14320 }, { "entropy": 2.0359993636608125, "epoch": 0.2144148339753247, "grad_norm": 0.4225158393383026, "learning_rate": 4.5401342522237645e-05, "loss": 0.2362, "mean_token_accuracy": 0.9437825735658407, "num_tokens": 106188818.0, "step": 14330 }, { "entropy": 2.0393473096191883, "epoch": 0.2145644605168288, "grad_norm": 0.29121410846710205, "learning_rate": 4.539439981459388e-05, "loss": 0.2279, "mean_token_accuracy": 0.9438212994486094, "num_tokens": 106262658.0, "step": 14340 }, { "entropy": 2.0159406289458275, "epoch": 0.21471408705833284, "grad_norm": 0.3678544759750366, "learning_rate": 4.538745240296302e-05, "loss": 0.216, "mean_token_accuracy": 0.947970000654459, "num_tokens": 106336352.0, "step": 14350 }, { "entropy": 2.035090596228838, "epoch": 0.21486371359983691, "grad_norm": 0.36536234617233276, "learning_rate": 4.53805002889514e-05, "loss": 0.2189, "mean_token_accuracy": 0.9452924955636263, "num_tokens": 106411675.0, "step": 14360 }, { "entropy": 2.020190351456404, "epoch": 0.21501334014134096, "grad_norm": 0.46197736263275146, "learning_rate": 4.53735434741665e-05, "loss": 0.2479, "mean_token_accuracy": 0.9390276070684195, "num_tokens": 106485288.0, "step": 14370 }, { "entropy": 1.9986189514398576, "epoch": 0.21516296668284504, "grad_norm": 0.40906208753585815, "learning_rate": 4.536658196021685e-05, "loss": 0.2365, "mean_token_accuracy": 0.9424494810402393, "num_tokens": 106558833.0, "step": 14380 }, { "entropy": 2.0325156562030315, "epoch": 0.2153125932243491, "grad_norm": 0.3710268437862396, "learning_rate": 4.535961574871207e-05, "loss": 0.1952, "mean_token_accuracy": 0.9485281784087419, "num_tokens": 106636349.0, "step": 14390 }, { "entropy": 2.039134042710066, "epoch": 0.21546221976585317, "grad_norm": 0.42623192071914673, "learning_rate": 4.535264484126289e-05, "loss": 0.2532, "mean_token_accuracy": 0.9385594550520182, "num_tokens": 106710212.0, "step": 14400 }, { "entropy": 2.0437661364674566, "epoch": 0.21561184630735722, "grad_norm": 0.3585650324821472, "learning_rate": 4.534566923948109e-05, "loss": 0.2404, "mean_token_accuracy": 0.9394515540450812, "num_tokens": 106782549.0, "step": 14410 }, { "entropy": 2.0139872558414935, "epoch": 0.2157614728488613, "grad_norm": 0.31033241748809814, "learning_rate": 4.533868894497955e-05, "loss": 0.2, "mean_token_accuracy": 0.9479148518294096, "num_tokens": 106858473.0, "step": 14420 }, { "entropy": 2.0231525883078576, "epoch": 0.21591109939036535, "grad_norm": 0.39773106575012207, "learning_rate": 4.533170395937225e-05, "loss": 0.2601, "mean_token_accuracy": 0.9381564032286406, "num_tokens": 106930704.0, "step": 14430 }, { "entropy": 2.0354252994060515, "epoch": 0.21606072593186942, "grad_norm": 0.38997986912727356, "learning_rate": 4.532471428427424e-05, "loss": 0.2369, "mean_token_accuracy": 0.9402155447751284, "num_tokens": 107006177.0, "step": 14440 }, { "entropy": 1.9895979709923268, "epoch": 0.2162103524733735, "grad_norm": 0.27290162444114685, "learning_rate": 4.531771992130165e-05, "loss": 0.2035, "mean_token_accuracy": 0.9463789030909538, "num_tokens": 107082959.0, "step": 14450 }, { "entropy": 2.0247496142983437, "epoch": 0.21635997901487755, "grad_norm": 0.4424523413181305, "learning_rate": 4.5310720872071723e-05, "loss": 0.2488, "mean_token_accuracy": 0.939605812728405, "num_tokens": 107158075.0, "step": 14460 }, { "entropy": 2.035554326325655, "epoch": 0.21650960555638163, "grad_norm": 0.3559085428714752, "learning_rate": 4.5303717138202734e-05, "loss": 0.2295, "mean_token_accuracy": 0.9397487282752991, "num_tokens": 107231961.0, "step": 14470 }, { "entropy": 2.002565947920084, "epoch": 0.21665923209788568, "grad_norm": 0.34464335441589355, "learning_rate": 4.529670872131409e-05, "loss": 0.2253, "mean_token_accuracy": 0.9457228995859623, "num_tokens": 107306940.0, "step": 14480 }, { "entropy": 1.9886301167309284, "epoch": 0.21680885863938976, "grad_norm": 0.3407740592956543, "learning_rate": 4.5289695623026256e-05, "loss": 0.2384, "mean_token_accuracy": 0.9402735892683267, "num_tokens": 107381814.0, "step": 14490 }, { "entropy": 1.9978798821568489, "epoch": 0.2169584851808938, "grad_norm": 0.42909935116767883, "learning_rate": 4.528267784496078e-05, "loss": 0.2465, "mean_token_accuracy": 0.9391152616590261, "num_tokens": 107455316.0, "step": 14500 }, { "entropy": 1.9780038617551328, "epoch": 0.21710811172239788, "grad_norm": 0.33966153860092163, "learning_rate": 4.527565538874031e-05, "loss": 0.2187, "mean_token_accuracy": 0.9435544602572918, "num_tokens": 107526737.0, "step": 14510 }, { "entropy": 1.9603234604001045, "epoch": 0.21725773826390193, "grad_norm": 0.29562997817993164, "learning_rate": 4.526862825598857e-05, "loss": 0.2164, "mean_token_accuracy": 0.9456202309578657, "num_tokens": 107600302.0, "step": 14520 }, { "entropy": 1.998859702795744, "epoch": 0.217407364805406, "grad_norm": 0.3347362279891968, "learning_rate": 4.526159644833032e-05, "loss": 0.2336, "mean_token_accuracy": 0.9415851477533579, "num_tokens": 107677545.0, "step": 14530 }, { "entropy": 2.019018518924713, "epoch": 0.21755699134691006, "grad_norm": 0.37746894359588623, "learning_rate": 4.525455996739148e-05, "loss": 0.2264, "mean_token_accuracy": 0.9434488203376532, "num_tokens": 107751636.0, "step": 14540 }, { "entropy": 1.9951883628964424, "epoch": 0.21770661788841414, "grad_norm": 0.36727237701416016, "learning_rate": 4.524751881479898e-05, "loss": 0.2033, "mean_token_accuracy": 0.9505205690860749, "num_tokens": 107825718.0, "step": 14550 }, { "entropy": 2.028523854166269, "epoch": 0.2178562444299182, "grad_norm": 0.3333470821380615, "learning_rate": 4.524047299218088e-05, "loss": 0.2008, "mean_token_accuracy": 0.9488738182932138, "num_tokens": 107900609.0, "step": 14560 }, { "entropy": 1.9822638213634491, "epoch": 0.21800587097142227, "grad_norm": 0.39034590125083923, "learning_rate": 4.523342250116628e-05, "loss": 0.2206, "mean_token_accuracy": 0.9428967472165823, "num_tokens": 107976715.0, "step": 14570 }, { "entropy": 1.9745465092360974, "epoch": 0.21815549751292634, "grad_norm": 0.30179017782211304, "learning_rate": 4.522636734338541e-05, "loss": 0.2179, "mean_token_accuracy": 0.9453186102211475, "num_tokens": 108051634.0, "step": 14580 }, { "entropy": 1.9934435322880746, "epoch": 0.2183051240544304, "grad_norm": 0.35103926062583923, "learning_rate": 4.521930752046951e-05, "loss": 0.2355, "mean_token_accuracy": 0.9403260391205549, "num_tokens": 108125681.0, "step": 14590 }, { "entropy": 2.012093395739794, "epoch": 0.21845475059593447, "grad_norm": 0.3107030987739563, "learning_rate": 4.521224303405097e-05, "loss": 0.2176, "mean_token_accuracy": 0.9447121240198613, "num_tokens": 108197951.0, "step": 14600 }, { "entropy": 2.002424023300409, "epoch": 0.21860437713743852, "grad_norm": 0.3759273290634155, "learning_rate": 4.5205173885763195e-05, "loss": 0.2176, "mean_token_accuracy": 0.9482057135552168, "num_tokens": 108272325.0, "step": 14610 }, { "entropy": 2.008123317360878, "epoch": 0.2187540036789426, "grad_norm": 0.3698536455631256, "learning_rate": 4.519810007724073e-05, "loss": 0.2265, "mean_token_accuracy": 0.9434138637036085, "num_tokens": 108347284.0, "step": 14620 }, { "entropy": 2.0290424823760986, "epoch": 0.21890363022044665, "grad_norm": 0.2920144498348236, "learning_rate": 4.519102161011914e-05, "loss": 0.2379, "mean_token_accuracy": 0.9413405280560255, "num_tokens": 108421060.0, "step": 14630 }, { "entropy": 1.9961930103600025, "epoch": 0.21905325676195073, "grad_norm": 0.4342615604400635, "learning_rate": 4.518393848603509e-05, "loss": 0.2269, "mean_token_accuracy": 0.944616636261344, "num_tokens": 108496282.0, "step": 14640 }, { "entropy": 1.9991177491843701, "epoch": 0.21920288330345478, "grad_norm": 0.37027639150619507, "learning_rate": 4.517685070662635e-05, "loss": 0.2255, "mean_token_accuracy": 0.9444262117147446, "num_tokens": 108569810.0, "step": 14650 }, { "entropy": 2.0311176896095278, "epoch": 0.21935250984495885, "grad_norm": 0.3263057470321655, "learning_rate": 4.516975827353172e-05, "loss": 0.2111, "mean_token_accuracy": 0.9493883866816759, "num_tokens": 108643556.0, "step": 14660 }, { "entropy": 2.0206560507416724, "epoch": 0.2195021363864629, "grad_norm": 0.3265742361545563, "learning_rate": 4.5162661188391105e-05, "loss": 0.2241, "mean_token_accuracy": 0.9442542865872383, "num_tokens": 108720282.0, "step": 14670 }, { "entropy": 2.020593335479498, "epoch": 0.21965176292796698, "grad_norm": 0.35405778884887695, "learning_rate": 4.515555945284547e-05, "loss": 0.2113, "mean_token_accuracy": 0.9472356382757425, "num_tokens": 108795078.0, "step": 14680 }, { "entropy": 1.9945539109408856, "epoch": 0.21980138946947103, "grad_norm": 0.3349688947200775, "learning_rate": 4.514845306853687e-05, "loss": 0.2142, "mean_token_accuracy": 0.9470288790762424, "num_tokens": 108871043.0, "step": 14690 }, { "entropy": 2.015487936139107, "epoch": 0.2199510160109751, "grad_norm": 0.2935735881328583, "learning_rate": 4.514134203710843e-05, "loss": 0.2099, "mean_token_accuracy": 0.9479257009923459, "num_tokens": 108945571.0, "step": 14700 }, { "entropy": 2.0221143081784247, "epoch": 0.22010064255247916, "grad_norm": 0.28863877058029175, "learning_rate": 4.5134226360204335e-05, "loss": 0.2213, "mean_token_accuracy": 0.9445856083184481, "num_tokens": 109018931.0, "step": 14710 }, { "entropy": 2.0221292711794376, "epoch": 0.22025026909398324, "grad_norm": 0.363619327545166, "learning_rate": 4.5127106039469865e-05, "loss": 0.215, "mean_token_accuracy": 0.9446193464100361, "num_tokens": 109091989.0, "step": 14720 }, { "entropy": 2.044370622932911, "epoch": 0.22039989563548731, "grad_norm": 0.32431307435035706, "learning_rate": 4.5119981076551365e-05, "loss": 0.2383, "mean_token_accuracy": 0.9402523253113031, "num_tokens": 109166996.0, "step": 14730 }, { "entropy": 2.046439695358276, "epoch": 0.22054952217699136, "grad_norm": 0.2999296486377716, "learning_rate": 4.5112851473096245e-05, "loss": 0.2405, "mean_token_accuracy": 0.9384118739515543, "num_tokens": 109241378.0, "step": 14740 }, { "entropy": 2.0250346310436727, "epoch": 0.22069914871849544, "grad_norm": 0.4018903374671936, "learning_rate": 4.5105717230753e-05, "loss": 0.2272, "mean_token_accuracy": 0.9417232543230056, "num_tokens": 109315486.0, "step": 14750 }, { "entropy": 1.9814502477645874, "epoch": 0.2208487752599995, "grad_norm": 0.2861822247505188, "learning_rate": 4.509857835117121e-05, "loss": 0.2282, "mean_token_accuracy": 0.9445540428161621, "num_tokens": 109390889.0, "step": 14760 }, { "entropy": 2.018892766535282, "epoch": 0.22099840180150357, "grad_norm": 0.27450478076934814, "learning_rate": 4.509143483600148e-05, "loss": 0.2143, "mean_token_accuracy": 0.9467836678028106, "num_tokens": 109468399.0, "step": 14770 }, { "entropy": 2.038572285324335, "epoch": 0.22114802834300762, "grad_norm": 0.3654242157936096, "learning_rate": 4.508428668689554e-05, "loss": 0.228, "mean_token_accuracy": 0.9472150184214115, "num_tokens": 109540867.0, "step": 14780 }, { "entropy": 2.0337013743817804, "epoch": 0.2212976548845117, "grad_norm": 0.32926055788993835, "learning_rate": 4.507713390550617e-05, "loss": 0.2219, "mean_token_accuracy": 0.9450745921581983, "num_tokens": 109614102.0, "step": 14790 }, { "entropy": 2.020954838395119, "epoch": 0.22144728142601575, "grad_norm": 0.299465149641037, "learning_rate": 4.506997649348721e-05, "loss": 0.2161, "mean_token_accuracy": 0.9443256184458733, "num_tokens": 109686639.0, "step": 14800 }, { "entropy": 2.018161502480507, "epoch": 0.22159690796751982, "grad_norm": 0.40466201305389404, "learning_rate": 4.506281445249358e-05, "loss": 0.2174, "mean_token_accuracy": 0.9436618845909834, "num_tokens": 109765406.0, "step": 14810 }, { "entropy": 2.03743614628911, "epoch": 0.22174653450902387, "grad_norm": 0.27791842818260193, "learning_rate": 4.5055647784181284e-05, "loss": 0.2252, "mean_token_accuracy": 0.9436235826462507, "num_tokens": 109838262.0, "step": 14820 }, { "entropy": 2.0500128395855426, "epoch": 0.22189616105052795, "grad_norm": 0.31925252079963684, "learning_rate": 4.504847649020738e-05, "loss": 0.2257, "mean_token_accuracy": 0.944381145015359, "num_tokens": 109912208.0, "step": 14830 }, { "entropy": 2.054877780377865, "epoch": 0.222045787592032, "grad_norm": 0.3602094054222107, "learning_rate": 4.504130057222998e-05, "loss": 0.2278, "mean_token_accuracy": 0.9451314132660628, "num_tokens": 109984899.0, "step": 14840 }, { "entropy": 2.0549397341907025, "epoch": 0.22219541413353608, "grad_norm": 0.36160555481910706, "learning_rate": 4.50341200319083e-05, "loss": 0.2263, "mean_token_accuracy": 0.9428565960377455, "num_tokens": 110059659.0, "step": 14850 }, { "entropy": 2.01293528303504, "epoch": 0.22234504067504013, "grad_norm": 0.3723517954349518, "learning_rate": 4.502693487090261e-05, "loss": 0.2212, "mean_token_accuracy": 0.9437457606196403, "num_tokens": 110132942.0, "step": 14860 }, { "entropy": 2.040511917322874, "epoch": 0.2224946672165442, "grad_norm": 0.4029499888420105, "learning_rate": 4.5019745090874236e-05, "loss": 0.2349, "mean_token_accuracy": 0.9431281600147485, "num_tokens": 110209573.0, "step": 14870 }, { "entropy": 1.9904178090393543, "epoch": 0.22264429375804828, "grad_norm": 0.30335453152656555, "learning_rate": 4.5012550693485606e-05, "loss": 0.2087, "mean_token_accuracy": 0.9479824036359787, "num_tokens": 110282786.0, "step": 14880 }, { "entropy": 1.9474720314145089, "epoch": 0.22279392029955233, "grad_norm": 0.3769731819629669, "learning_rate": 4.500535168040017e-05, "loss": 0.2054, "mean_token_accuracy": 0.9461545970290899, "num_tokens": 110359163.0, "step": 14890 }, { "entropy": 1.9322262346744536, "epoch": 0.2229435468410564, "grad_norm": 0.34426093101501465, "learning_rate": 4.499814805328247e-05, "loss": 0.2149, "mean_token_accuracy": 0.9482953980565071, "num_tokens": 110435083.0, "step": 14900 }, { "entropy": 1.9813862100243569, "epoch": 0.22309317338256046, "grad_norm": 0.40497761964797974, "learning_rate": 4.499093981379813e-05, "loss": 0.2217, "mean_token_accuracy": 0.9443288538604975, "num_tokens": 110507961.0, "step": 14910 }, { "entropy": 2.014493740350008, "epoch": 0.22324279992406454, "grad_norm": 0.37459319829940796, "learning_rate": 4.49837269636138e-05, "loss": 0.2477, "mean_token_accuracy": 0.9367315895855427, "num_tokens": 110580474.0, "step": 14920 }, { "entropy": 2.00632803812623, "epoch": 0.2233924264655686, "grad_norm": 0.28861263394355774, "learning_rate": 4.497650950439723e-05, "loss": 0.2297, "mean_token_accuracy": 0.9422844409942627, "num_tokens": 110652856.0, "step": 14930 }, { "entropy": 1.997613750398159, "epoch": 0.22354205300707267, "grad_norm": 0.3124845027923584, "learning_rate": 4.496928743781723e-05, "loss": 0.2157, "mean_token_accuracy": 0.9445130914449692, "num_tokens": 110727797.0, "step": 14940 }, { "entropy": 2.027167608588934, "epoch": 0.22369167954857672, "grad_norm": 0.3353038728237152, "learning_rate": 4.496206076554366e-05, "loss": 0.2417, "mean_token_accuracy": 0.9426096089184284, "num_tokens": 110799840.0, "step": 14950 }, { "entropy": 2.0383143827319143, "epoch": 0.2238413060900808, "grad_norm": 0.3793546259403229, "learning_rate": 4.495482948924747e-05, "loss": 0.2239, "mean_token_accuracy": 0.9443628448992968, "num_tokens": 110872758.0, "step": 14960 }, { "entropy": 2.0226249001920222, "epoch": 0.22399093263158484, "grad_norm": 0.35126665234565735, "learning_rate": 4.494759361060064e-05, "loss": 0.2207, "mean_token_accuracy": 0.9447830632328987, "num_tokens": 110947932.0, "step": 14970 }, { "entropy": 2.0217545360326765, "epoch": 0.22414055917308892, "grad_norm": 0.42849671840667725, "learning_rate": 4.494035313127625e-05, "loss": 0.227, "mean_token_accuracy": 0.9408001057803631, "num_tokens": 111020906.0, "step": 14980 }, { "entropy": 2.0074046552181244, "epoch": 0.22429018571459297, "grad_norm": 0.32058873772621155, "learning_rate": 4.4933108052948416e-05, "loss": 0.216, "mean_token_accuracy": 0.9435962595045566, "num_tokens": 111092756.0, "step": 14990 }, { "entropy": 2.0074996441602706, "epoch": 0.22443981225609705, "grad_norm": 0.3518684208393097, "learning_rate": 4.492585837729235e-05, "loss": 0.2268, "mean_token_accuracy": 0.9457818914204836, "num_tokens": 111167650.0, "step": 15000 }, { "epoch": 0.22443981225609705, "eval_entropy": 2.0174143748521804, "eval_loss": 0.24776865541934967, "eval_mean_token_accuracy": 0.9446574423193932, "eval_num_tokens": 111167650.0, "eval_runtime": 546.9813, "eval_samples_per_second": 36.564, "eval_steps_per_second": 9.141, "step": 15000 }, { "entropy": 2.012942238897085, "epoch": 0.2245894387976011, "grad_norm": 0.37047305703163147, "learning_rate": 4.491860410598428e-05, "loss": 0.2351, "mean_token_accuracy": 0.9441512532532215, "num_tokens": 111240820.0, "step": 15010 }, { "entropy": 2.0317082308232783, "epoch": 0.22473906533910518, "grad_norm": 0.31004947423934937, "learning_rate": 4.491134524070152e-05, "loss": 0.2125, "mean_token_accuracy": 0.9467091996222734, "num_tokens": 111315654.0, "step": 15020 }, { "entropy": 2.0063771970570086, "epoch": 0.22488869188060925, "grad_norm": 0.3441016972064972, "learning_rate": 4.4904081783122486e-05, "loss": 0.2208, "mean_token_accuracy": 0.9466823801398278, "num_tokens": 111389415.0, "step": 15030 }, { "entropy": 2.0139746218919754, "epoch": 0.2250383184221133, "grad_norm": 0.32765012979507446, "learning_rate": 4.489681373492659e-05, "loss": 0.2271, "mean_token_accuracy": 0.9435013346374035, "num_tokens": 111464089.0, "step": 15040 }, { "entropy": 1.9938028737902642, "epoch": 0.22518794496361738, "grad_norm": 0.27247363328933716, "learning_rate": 4.488954109779432e-05, "loss": 0.2098, "mean_token_accuracy": 0.947207548469305, "num_tokens": 111540008.0, "step": 15050 }, { "entropy": 2.0233231499791144, "epoch": 0.22533757150512143, "grad_norm": 0.43771183490753174, "learning_rate": 4.488226387340728e-05, "loss": 0.2345, "mean_token_accuracy": 0.942552775144577, "num_tokens": 111611082.0, "step": 15060 }, { "entropy": 2.0256434842944144, "epoch": 0.2254871980466255, "grad_norm": 0.3521353304386139, "learning_rate": 4.487498206344806e-05, "loss": 0.2306, "mean_token_accuracy": 0.9430926218628883, "num_tokens": 111683690.0, "step": 15070 }, { "entropy": 1.981017790734768, "epoch": 0.22563682458812956, "grad_norm": 0.2681540250778198, "learning_rate": 4.486769566960036e-05, "loss": 0.2092, "mean_token_accuracy": 0.9438813894987106, "num_tokens": 111759958.0, "step": 15080 }, { "entropy": 1.9519768051803112, "epoch": 0.22578645112963364, "grad_norm": 0.31493079662323, "learning_rate": 4.4860404693548916e-05, "loss": 0.2146, "mean_token_accuracy": 0.9446296352893114, "num_tokens": 111835018.0, "step": 15090 }, { "entropy": 1.996109177172184, "epoch": 0.2259360776711377, "grad_norm": 0.396827757358551, "learning_rate": 4.485310913697953e-05, "loss": 0.2248, "mean_token_accuracy": 0.942341884970665, "num_tokens": 111907119.0, "step": 15100 }, { "entropy": 2.000981708616018, "epoch": 0.22608570421264176, "grad_norm": 0.3713546097278595, "learning_rate": 4.4845809001579074e-05, "loss": 0.2135, "mean_token_accuracy": 0.9471950579434634, "num_tokens": 111980244.0, "step": 15110 }, { "entropy": 2.024167613685131, "epoch": 0.2262353307541458, "grad_norm": 0.33345866203308105, "learning_rate": 4.483850428903547e-05, "loss": 0.2178, "mean_token_accuracy": 0.9453145645558834, "num_tokens": 112051740.0, "step": 15120 }, { "entropy": 2.015564624220133, "epoch": 0.2263849572956499, "grad_norm": 0.31970494985580444, "learning_rate": 4.483119500103768e-05, "loss": 0.2064, "mean_token_accuracy": 0.945020142570138, "num_tokens": 112127905.0, "step": 15130 }, { "entropy": 2.0034637093544005, "epoch": 0.22653458383715394, "grad_norm": 0.31423550844192505, "learning_rate": 4.482388113927576e-05, "loss": 0.2114, "mean_token_accuracy": 0.9474483519792557, "num_tokens": 112201671.0, "step": 15140 }, { "entropy": 1.9893664948642253, "epoch": 0.22668421037865802, "grad_norm": 0.349835604429245, "learning_rate": 4.48165627054408e-05, "loss": 0.2297, "mean_token_accuracy": 0.9444744683802128, "num_tokens": 112276969.0, "step": 15150 }, { "entropy": 2.0122391514480116, "epoch": 0.2268338369201621, "grad_norm": 0.40789559483528137, "learning_rate": 4.480923970122495e-05, "loss": 0.2381, "mean_token_accuracy": 0.9406100045889616, "num_tokens": 112348870.0, "step": 15160 }, { "entropy": 2.0072805628180506, "epoch": 0.22698346346166615, "grad_norm": 0.3554311990737915, "learning_rate": 4.4801912128321414e-05, "loss": 0.2224, "mean_token_accuracy": 0.9441691931337118, "num_tokens": 112422180.0, "step": 15170 }, { "entropy": 2.0480201341211797, "epoch": 0.22713309000317022, "grad_norm": 0.2843068540096283, "learning_rate": 4.4794579988424466e-05, "loss": 0.2246, "mean_token_accuracy": 0.9463415015488863, "num_tokens": 112496651.0, "step": 15180 }, { "entropy": 2.02738618478179, "epoch": 0.22728271654467427, "grad_norm": 0.3361741304397583, "learning_rate": 4.478724328322943e-05, "loss": 0.2206, "mean_token_accuracy": 0.9482717584818602, "num_tokens": 112571282.0, "step": 15190 }, { "entropy": 2.002488683909178, "epoch": 0.22743234308617835, "grad_norm": 0.4443276524543762, "learning_rate": 4.477990201443266e-05, "loss": 0.2327, "mean_token_accuracy": 0.9418461881577969, "num_tokens": 112645406.0, "step": 15200 }, { "entropy": 2.0331130675971507, "epoch": 0.2275819696276824, "grad_norm": 0.37163543701171875, "learning_rate": 4.477255618373161e-05, "loss": 0.2288, "mean_token_accuracy": 0.94352303519845, "num_tokens": 112718870.0, "step": 15210 }, { "entropy": 2.0063043043017386, "epoch": 0.22773159616918648, "grad_norm": 0.3073780834674835, "learning_rate": 4.476520579282477e-05, "loss": 0.199, "mean_token_accuracy": 0.9514647215604782, "num_tokens": 112795738.0, "step": 15220 }, { "entropy": 2.012467374652624, "epoch": 0.22788122271069053, "grad_norm": 0.332012414932251, "learning_rate": 4.475785084341166e-05, "loss": 0.2311, "mean_token_accuracy": 0.9413779832422733, "num_tokens": 112869347.0, "step": 15230 }, { "entropy": 2.0126412525773048, "epoch": 0.2280308492521946, "grad_norm": 0.3271101415157318, "learning_rate": 4.475049133719289e-05, "loss": 0.222, "mean_token_accuracy": 0.9442832361906767, "num_tokens": 112944687.0, "step": 15240 }, { "entropy": 2.007618512958288, "epoch": 0.22818047579369866, "grad_norm": 0.3432691693305969, "learning_rate": 4.4743127275870116e-05, "loss": 0.2224, "mean_token_accuracy": 0.948285736888647, "num_tokens": 113019129.0, "step": 15250 }, { "entropy": 2.021186326444149, "epoch": 0.22833010233520273, "grad_norm": 0.43205055594444275, "learning_rate": 4.473575866114602e-05, "loss": 0.2388, "mean_token_accuracy": 0.9421476304531098, "num_tokens": 113094468.0, "step": 15260 }, { "entropy": 2.0146180599927903, "epoch": 0.22847972887670678, "grad_norm": 0.2635376751422882, "learning_rate": 4.472838549472437e-05, "loss": 0.232, "mean_token_accuracy": 0.9405811082571744, "num_tokens": 113166788.0, "step": 15270 }, { "entropy": 1.970995730906725, "epoch": 0.22862935541821086, "grad_norm": 0.3192756772041321, "learning_rate": 4.4721007778309966e-05, "loss": 0.2161, "mean_token_accuracy": 0.9490535497665405, "num_tokens": 113241371.0, "step": 15280 }, { "entropy": 2.0057829186320304, "epoch": 0.2287789819597149, "grad_norm": 0.34637805819511414, "learning_rate": 4.471362551360867e-05, "loss": 0.2103, "mean_token_accuracy": 0.9471637140959501, "num_tokens": 113318042.0, "step": 15290 }, { "entropy": 1.962550550699234, "epoch": 0.228928608501219, "grad_norm": 0.3373715579509735, "learning_rate": 4.4706238702327403e-05, "loss": 0.2271, "mean_token_accuracy": 0.9427593577653169, "num_tokens": 113393855.0, "step": 15300 }, { "entropy": 1.9506757736206055, "epoch": 0.22907823504272307, "grad_norm": 0.44020876288414, "learning_rate": 4.469884734617411e-05, "loss": 0.201, "mean_token_accuracy": 0.9504586450755597, "num_tokens": 113470528.0, "step": 15310 }, { "entropy": 1.9786839924752713, "epoch": 0.22922786158422712, "grad_norm": 0.45927894115448, "learning_rate": 4.469145144685781e-05, "loss": 0.2247, "mean_token_accuracy": 0.9459199849516153, "num_tokens": 113545045.0, "step": 15320 }, { "entropy": 1.985029573738575, "epoch": 0.2293774881257312, "grad_norm": 0.3427533805370331, "learning_rate": 4.4684051006088575e-05, "loss": 0.2034, "mean_token_accuracy": 0.9476940434426069, "num_tokens": 113618152.0, "step": 15330 }, { "entropy": 1.9877336949110032, "epoch": 0.22952711466723524, "grad_norm": 0.4131075441837311, "learning_rate": 4.467664602557751e-05, "loss": 0.2383, "mean_token_accuracy": 0.9390629705041647, "num_tokens": 113690716.0, "step": 15340 }, { "entropy": 1.9985576778650285, "epoch": 0.22967674120873932, "grad_norm": 0.3161776065826416, "learning_rate": 4.4669236507036776e-05, "loss": 0.2237, "mean_token_accuracy": 0.9456408929079771, "num_tokens": 113765518.0, "step": 15350 }, { "entropy": 2.0003026209771635, "epoch": 0.22982636775024337, "grad_norm": 0.3550056517124176, "learning_rate": 4.4661822452179594e-05, "loss": 0.2303, "mean_token_accuracy": 0.9440422609448433, "num_tokens": 113840565.0, "step": 15360 }, { "entropy": 2.025747472792864, "epoch": 0.22997599429174745, "grad_norm": 0.3500961363315582, "learning_rate": 4.465440386272022e-05, "loss": 0.2289, "mean_token_accuracy": 0.9430900417268276, "num_tokens": 113914731.0, "step": 15370 }, { "entropy": 2.0125860802829267, "epoch": 0.2301256208332515, "grad_norm": 0.32893988490104675, "learning_rate": 4.464698074037396e-05, "loss": 0.2283, "mean_token_accuracy": 0.943072447180748, "num_tokens": 113988657.0, "step": 15380 }, { "entropy": 2.012650966644287, "epoch": 0.23027524737475558, "grad_norm": 0.39278852939605713, "learning_rate": 4.463955308685719e-05, "loss": 0.2387, "mean_token_accuracy": 0.9394141204655171, "num_tokens": 114063127.0, "step": 15390 }, { "entropy": 2.0306603901088236, "epoch": 0.23042487391625963, "grad_norm": 0.32136571407318115, "learning_rate": 4.463212090388729e-05, "loss": 0.2264, "mean_token_accuracy": 0.9420533444732427, "num_tokens": 114137488.0, "step": 15400 }, { "entropy": 1.984863667935133, "epoch": 0.2305745004577637, "grad_norm": 0.30267465114593506, "learning_rate": 4.462468419318273e-05, "loss": 0.2236, "mean_token_accuracy": 0.9452044025063515, "num_tokens": 114212397.0, "step": 15410 }, { "entropy": 2.0077911049127577, "epoch": 0.23072412699926775, "grad_norm": 0.35751578211784363, "learning_rate": 4.461724295646301e-05, "loss": 0.23, "mean_token_accuracy": 0.9420890953391791, "num_tokens": 114283689.0, "step": 15420 }, { "entropy": 1.9952733471989632, "epoch": 0.23087375354077183, "grad_norm": 0.37443336844444275, "learning_rate": 4.460979719544866e-05, "loss": 0.216, "mean_token_accuracy": 0.9466187212616205, "num_tokens": 114356048.0, "step": 15430 }, { "entropy": 1.9643361032009126, "epoch": 0.23102338008227588, "grad_norm": 0.3619861304759979, "learning_rate": 4.4602346911861296e-05, "loss": 0.1879, "mean_token_accuracy": 0.9491075027734042, "num_tokens": 114432972.0, "step": 15440 }, { "entropy": 1.995201399922371, "epoch": 0.23117300662377996, "grad_norm": 0.3272418975830078, "learning_rate": 4.459489210742354e-05, "loss": 0.2353, "mean_token_accuracy": 0.9431777350604534, "num_tokens": 114504861.0, "step": 15450 }, { "entropy": 2.0347736589610577, "epoch": 0.23132263316528404, "grad_norm": 0.30950263142585754, "learning_rate": 4.458743278385907e-05, "loss": 0.2178, "mean_token_accuracy": 0.9462115079164505, "num_tokens": 114580705.0, "step": 15460 }, { "entropy": 2.0100708961486817, "epoch": 0.23147225970678809, "grad_norm": 0.3298996388912201, "learning_rate": 4.457996894289263e-05, "loss": 0.206, "mean_token_accuracy": 0.9478289760649204, "num_tokens": 114656412.0, "step": 15470 }, { "entropy": 1.989882143586874, "epoch": 0.23162188624829216, "grad_norm": 0.3745694160461426, "learning_rate": 4.457250058624999e-05, "loss": 0.2491, "mean_token_accuracy": 0.9389148846268653, "num_tokens": 114727618.0, "step": 15480 }, { "entropy": 2.004741308093071, "epoch": 0.2317715127897962, "grad_norm": 0.3305400013923645, "learning_rate": 4.456502771565796e-05, "loss": 0.2028, "mean_token_accuracy": 0.9482883840799332, "num_tokens": 114803744.0, "step": 15490 }, { "entropy": 1.985539823770523, "epoch": 0.2319211393313003, "grad_norm": 0.2776624262332916, "learning_rate": 4.455755033284441e-05, "loss": 0.2235, "mean_token_accuracy": 0.9452421743422746, "num_tokens": 114878305.0, "step": 15500 }, { "entropy": 2.0420316599309443, "epoch": 0.23207076587280434, "grad_norm": 0.3426123857498169, "learning_rate": 4.455006843953823e-05, "loss": 0.2183, "mean_token_accuracy": 0.9434906840324402, "num_tokens": 114953541.0, "step": 15510 }, { "entropy": 2.0307010404765604, "epoch": 0.23222039241430842, "grad_norm": 0.3252795338630676, "learning_rate": 4.454258203746938e-05, "loss": 0.2313, "mean_token_accuracy": 0.9415312763303518, "num_tokens": 115027963.0, "step": 15520 }, { "entropy": 2.0189708456397057, "epoch": 0.23237001895581247, "grad_norm": 0.3352615535259247, "learning_rate": 4.453509112836884e-05, "loss": 0.24, "mean_token_accuracy": 0.9406589701771736, "num_tokens": 115100268.0, "step": 15530 }, { "entropy": 2.033125193417072, "epoch": 0.23251964549731655, "grad_norm": 0.32187867164611816, "learning_rate": 4.452759571396864e-05, "loss": 0.2225, "mean_token_accuracy": 0.9452978666871786, "num_tokens": 115175484.0, "step": 15540 }, { "entropy": 2.05086784735322, "epoch": 0.2326692720388206, "grad_norm": 0.38895705342292786, "learning_rate": 4.452009579600187e-05, "loss": 0.2224, "mean_token_accuracy": 0.9441924814134837, "num_tokens": 115248366.0, "step": 15550 }, { "entropy": 2.039254383742809, "epoch": 0.23281889858032467, "grad_norm": 0.3700357675552368, "learning_rate": 4.451259137620263e-05, "loss": 0.2256, "mean_token_accuracy": 0.946529433131218, "num_tokens": 115323547.0, "step": 15560 }, { "entropy": 2.0355828039348127, "epoch": 0.23296852512182872, "grad_norm": 0.362968385219574, "learning_rate": 4.4505082456306074e-05, "loss": 0.2279, "mean_token_accuracy": 0.9431021708995104, "num_tokens": 115397627.0, "step": 15570 }, { "entropy": 2.057919367402792, "epoch": 0.2331181516633328, "grad_norm": 0.2936594486236572, "learning_rate": 4.4497569038048396e-05, "loss": 0.2197, "mean_token_accuracy": 0.9424905151128768, "num_tokens": 115471366.0, "step": 15580 }, { "entropy": 2.0321060746908186, "epoch": 0.23326777820483688, "grad_norm": 0.4062644839286804, "learning_rate": 4.449005112316685e-05, "loss": 0.2115, "mean_token_accuracy": 0.9460125006735325, "num_tokens": 115545041.0, "step": 15590 }, { "entropy": 2.041969918459654, "epoch": 0.23341740474634093, "grad_norm": 0.3537786900997162, "learning_rate": 4.44825287133997e-05, "loss": 0.2416, "mean_token_accuracy": 0.9420095339417458, "num_tokens": 115618091.0, "step": 15600 }, { "entropy": 2.0278504341840744, "epoch": 0.233567031287845, "grad_norm": 0.343595415353775, "learning_rate": 4.447500181048626e-05, "loss": 0.2183, "mean_token_accuracy": 0.9424794338643551, "num_tokens": 115692572.0, "step": 15610 }, { "entropy": 2.0476527832448483, "epoch": 0.23371665782934906, "grad_norm": 0.3992612361907959, "learning_rate": 4.4467470416166876e-05, "loss": 0.2185, "mean_token_accuracy": 0.9465295031666756, "num_tokens": 115764858.0, "step": 15620 }, { "entropy": 2.0857450872659684, "epoch": 0.23386628437085313, "grad_norm": 0.33826524019241333, "learning_rate": 4.445993453218296e-05, "loss": 0.2224, "mean_token_accuracy": 0.9450020175427198, "num_tokens": 115840642.0, "step": 15630 }, { "entropy": 2.093594118207693, "epoch": 0.23401591091235718, "grad_norm": 0.3504444360733032, "learning_rate": 4.4452394160276914e-05, "loss": 0.2185, "mean_token_accuracy": 0.9479228254407644, "num_tokens": 115915890.0, "step": 15640 }, { "entropy": 2.0980848394334317, "epoch": 0.23416553745386126, "grad_norm": 0.39364513754844666, "learning_rate": 4.444484930219224e-05, "loss": 0.2399, "mean_token_accuracy": 0.942791672796011, "num_tokens": 115988657.0, "step": 15650 }, { "entropy": 2.1216987788677217, "epoch": 0.2343151639953653, "grad_norm": 0.3813497722148895, "learning_rate": 4.443729995967342e-05, "loss": 0.2368, "mean_token_accuracy": 0.9420614931732416, "num_tokens": 116058457.0, "step": 15660 }, { "entropy": 2.09001642242074, "epoch": 0.2344647905368694, "grad_norm": 0.3150218427181244, "learning_rate": 4.4429746134466004e-05, "loss": 0.2298, "mean_token_accuracy": 0.9393909320235252, "num_tokens": 116133822.0, "step": 15670 }, { "entropy": 2.043114899843931, "epoch": 0.23461441707837344, "grad_norm": 0.30269700288772583, "learning_rate": 4.442218782831657e-05, "loss": 0.2118, "mean_token_accuracy": 0.9457640029489994, "num_tokens": 116209675.0, "step": 15680 }, { "entropy": 2.059490706026554, "epoch": 0.23476404361987752, "grad_norm": 0.2580171227455139, "learning_rate": 4.4414625042972734e-05, "loss": 0.2164, "mean_token_accuracy": 0.9483754806220531, "num_tokens": 116283696.0, "step": 15690 }, { "entropy": 2.0796605609357357, "epoch": 0.23491367016138157, "grad_norm": 0.44307324290275574, "learning_rate": 4.440705778018314e-05, "loss": 0.2477, "mean_token_accuracy": 0.938773638382554, "num_tokens": 116355017.0, "step": 15700 }, { "entropy": 2.0547694697976113, "epoch": 0.23506329670288564, "grad_norm": 0.3357575535774231, "learning_rate": 4.439948604169748e-05, "loss": 0.2272, "mean_token_accuracy": 0.9463300593197346, "num_tokens": 116430040.0, "step": 15710 }, { "entropy": 2.1021420657634735, "epoch": 0.2352129232443897, "grad_norm": 0.3328273594379425, "learning_rate": 4.439190982926648e-05, "loss": 0.2323, "mean_token_accuracy": 0.9411369491368532, "num_tokens": 116502028.0, "step": 15720 }, { "entropy": 2.0631238766014577, "epoch": 0.23536254978589377, "grad_norm": 0.3535475432872772, "learning_rate": 4.438432914464188e-05, "loss": 0.2145, "mean_token_accuracy": 0.9472492534667254, "num_tokens": 116575955.0, "step": 15730 }, { "entropy": 2.070156579464674, "epoch": 0.23551217632739785, "grad_norm": 0.3684746026992798, "learning_rate": 4.4376743989576486e-05, "loss": 0.2364, "mean_token_accuracy": 0.9411379583179951, "num_tokens": 116649624.0, "step": 15740 }, { "entropy": 2.037500633299351, "epoch": 0.2356618028689019, "grad_norm": 0.35305026173591614, "learning_rate": 4.4369154365824114e-05, "loss": 0.234, "mean_token_accuracy": 0.9428451918065548, "num_tokens": 116723254.0, "step": 15750 }, { "entropy": 2.047383426874876, "epoch": 0.23581142941040598, "grad_norm": 0.37458449602127075, "learning_rate": 4.436156027513961e-05, "loss": 0.2061, "mean_token_accuracy": 0.9489231254905462, "num_tokens": 116797033.0, "step": 15760 }, { "entropy": 2.0384680651128293, "epoch": 0.23596105595191003, "grad_norm": 0.33996808528900146, "learning_rate": 4.435396171927887e-05, "loss": 0.2025, "mean_token_accuracy": 0.9509435724467039, "num_tokens": 116869641.0, "step": 15770 }, { "entropy": 2.0476046822965146, "epoch": 0.2361106824934141, "grad_norm": 0.33860573172569275, "learning_rate": 4.434635869999882e-05, "loss": 0.2226, "mean_token_accuracy": 0.9495259393006563, "num_tokens": 116943636.0, "step": 15780 }, { "entropy": 2.0439771845936776, "epoch": 0.23626030903491815, "grad_norm": 0.33408668637275696, "learning_rate": 4.4338751219057414e-05, "loss": 0.2323, "mean_token_accuracy": 0.9447633545845747, "num_tokens": 117016617.0, "step": 15790 }, { "entropy": 2.0760328866541387, "epoch": 0.23640993557642223, "grad_norm": 0.3129129707813263, "learning_rate": 4.433113927821362e-05, "loss": 0.2238, "mean_token_accuracy": 0.9417223058640957, "num_tokens": 117091042.0, "step": 15800 }, { "entropy": 2.0507302597165107, "epoch": 0.23655956211792628, "grad_norm": 0.38783541321754456, "learning_rate": 4.432352287922748e-05, "loss": 0.2264, "mean_token_accuracy": 0.9432470206171274, "num_tokens": 117166568.0, "step": 15810 }, { "entropy": 2.0711214542388916, "epoch": 0.23670918865943036, "grad_norm": 0.3301248252391815, "learning_rate": 4.431590202386002e-05, "loss": 0.2302, "mean_token_accuracy": 0.9427740078419447, "num_tokens": 117243022.0, "step": 15820 }, { "entropy": 2.0793760634958742, "epoch": 0.2368588152009344, "grad_norm": 0.3130905032157898, "learning_rate": 4.4308276713873335e-05, "loss": 0.2291, "mean_token_accuracy": 0.9445065405219794, "num_tokens": 117316059.0, "step": 15830 }, { "entropy": 2.090775099396706, "epoch": 0.23700844174243849, "grad_norm": 0.3165552020072937, "learning_rate": 4.430064695103052e-05, "loss": 0.2159, "mean_token_accuracy": 0.9448061212897301, "num_tokens": 117389091.0, "step": 15840 }, { "entropy": 2.0690905950963496, "epoch": 0.23715806828394254, "grad_norm": 0.3243985176086426, "learning_rate": 4.4293012737095705e-05, "loss": 0.2129, "mean_token_accuracy": 0.9462750602513552, "num_tokens": 117460937.0, "step": 15850 }, { "entropy": 2.053806984424591, "epoch": 0.2373076948254466, "grad_norm": 0.36149829626083374, "learning_rate": 4.4285374073834077e-05, "loss": 0.2307, "mean_token_accuracy": 0.9425987333059311, "num_tokens": 117531851.0, "step": 15860 }, { "entropy": 2.0383010409772395, "epoch": 0.23745732136695066, "grad_norm": 0.32097554206848145, "learning_rate": 4.42777309630118e-05, "loss": 0.2226, "mean_token_accuracy": 0.9430879011750222, "num_tokens": 117609917.0, "step": 15870 }, { "entropy": 2.0740928016602993, "epoch": 0.23760694790845474, "grad_norm": 0.3941027820110321, "learning_rate": 4.427008340639614e-05, "loss": 0.2149, "mean_token_accuracy": 0.9488260477781296, "num_tokens": 117685225.0, "step": 15880 }, { "entropy": 2.073116146028042, "epoch": 0.23775657444995882, "grad_norm": 0.3424692451953888, "learning_rate": 4.4262431405755314e-05, "loss": 0.2133, "mean_token_accuracy": 0.9461569461971522, "num_tokens": 117759559.0, "step": 15890 }, { "entropy": 2.0798732958734036, "epoch": 0.23790620099146287, "grad_norm": 0.42008957266807556, "learning_rate": 4.425477496285861e-05, "loss": 0.2186, "mean_token_accuracy": 0.9454585824161768, "num_tokens": 117832399.0, "step": 15900 }, { "entropy": 2.0575854554772377, "epoch": 0.23805582753296695, "grad_norm": 0.35241132974624634, "learning_rate": 4.424711407947633e-05, "loss": 0.2311, "mean_token_accuracy": 0.9424953121691942, "num_tokens": 117906704.0, "step": 15910 }, { "entropy": 2.0935396663844585, "epoch": 0.238205454074471, "grad_norm": 0.40505465865135193, "learning_rate": 4.423944875737982e-05, "loss": 0.2336, "mean_token_accuracy": 0.9435701709240675, "num_tokens": 117977995.0, "step": 15920 }, { "entropy": 2.1041508346796034, "epoch": 0.23835508061597507, "grad_norm": 0.27820131182670593, "learning_rate": 4.423177899834143e-05, "loss": 0.2457, "mean_token_accuracy": 0.940861701965332, "num_tokens": 118050373.0, "step": 15930 }, { "entropy": 2.068365006893873, "epoch": 0.23850470715747912, "grad_norm": 0.302327960729599, "learning_rate": 4.422410480413454e-05, "loss": 0.2296, "mean_token_accuracy": 0.9455043748021126, "num_tokens": 118126341.0, "step": 15940 }, { "entropy": 2.0691476710140706, "epoch": 0.2386543336989832, "grad_norm": 0.31645458936691284, "learning_rate": 4.421642617653356e-05, "loss": 0.2115, "mean_token_accuracy": 0.9467107065021991, "num_tokens": 118204674.0, "step": 15950 }, { "entropy": 2.087872290611267, "epoch": 0.23880396024048725, "grad_norm": 0.3942251205444336, "learning_rate": 4.420874311731394e-05, "loss": 0.2279, "mean_token_accuracy": 0.9445725582540035, "num_tokens": 118275557.0, "step": 15960 }, { "entropy": 2.0585035145282746, "epoch": 0.23895358678199133, "grad_norm": 0.3205868899822235, "learning_rate": 4.420105562825213e-05, "loss": 0.2145, "mean_token_accuracy": 0.9473403446376324, "num_tokens": 118352338.0, "step": 15970 }, { "entropy": 2.0751403607428074, "epoch": 0.23910321332349538, "grad_norm": 0.397442102432251, "learning_rate": 4.419336371112561e-05, "loss": 0.2271, "mean_token_accuracy": 0.9462721731513739, "num_tokens": 118429252.0, "step": 15980 }, { "entropy": 2.1158520355820656, "epoch": 0.23925283986499946, "grad_norm": 0.335366427898407, "learning_rate": 4.4185667367712895e-05, "loss": 0.2326, "mean_token_accuracy": 0.94274448081851, "num_tokens": 118504478.0, "step": 15990 }, { "entropy": 2.1069047853350638, "epoch": 0.2394024664065035, "grad_norm": 0.4520975947380066, "learning_rate": 4.417796659979352e-05, "loss": 0.2441, "mean_token_accuracy": 0.9418787810951471, "num_tokens": 118577149.0, "step": 16000 }, { "epoch": 0.2394024664065035, "eval_entropy": 2.098721252131462, "eval_loss": 0.24755480885505676, "eval_mean_token_accuracy": 0.944678509402275, "eval_num_tokens": 118577149.0, "eval_runtime": 543.513, "eval_samples_per_second": 36.798, "eval_steps_per_second": 9.199, "step": 16000 }, { "entropy": 2.0848411075770854, "epoch": 0.23955209294800758, "grad_norm": 0.4328034818172455, "learning_rate": 4.417026140914802e-05, "loss": 0.2184, "mean_token_accuracy": 0.9453351046890021, "num_tokens": 118649926.0, "step": 16010 }, { "entropy": 2.0452876202762127, "epoch": 0.23970171948951163, "grad_norm": 0.352972149848938, "learning_rate": 4.4162551797558e-05, "loss": 0.2145, "mean_token_accuracy": 0.9448449041694402, "num_tokens": 118724618.0, "step": 16020 }, { "entropy": 2.069345071911812, "epoch": 0.2398513460310157, "grad_norm": 0.3966101408004761, "learning_rate": 4.415483776680604e-05, "loss": 0.2499, "mean_token_accuracy": 0.9425683658570051, "num_tokens": 118796079.0, "step": 16030 }, { "entropy": 2.0619590900838376, "epoch": 0.2400009725725198, "grad_norm": 0.36089709401130676, "learning_rate": 4.414711931867576e-05, "loss": 0.2226, "mean_token_accuracy": 0.9465872455388308, "num_tokens": 118869909.0, "step": 16040 }, { "entropy": 2.0692064471542837, "epoch": 0.24015059911402384, "grad_norm": 0.2963952124118805, "learning_rate": 4.413939645495182e-05, "loss": 0.2104, "mean_token_accuracy": 0.9475876275449991, "num_tokens": 118945988.0, "step": 16050 }, { "entropy": 2.058154482394457, "epoch": 0.24030022565552792, "grad_norm": 0.30522504448890686, "learning_rate": 4.4131669177419865e-05, "loss": 0.2133, "mean_token_accuracy": 0.9439670585095883, "num_tokens": 119021646.0, "step": 16060 }, { "entropy": 2.0585036404430865, "epoch": 0.24044985219703197, "grad_norm": 0.3717178404331207, "learning_rate": 4.412393748786658e-05, "loss": 0.2197, "mean_token_accuracy": 0.9466731593012809, "num_tokens": 119093720.0, "step": 16070 }, { "entropy": 2.0416114769876, "epoch": 0.24059947873853604, "grad_norm": 0.27685752511024475, "learning_rate": 4.4116201388079684e-05, "loss": 0.2409, "mean_token_accuracy": 0.941658328846097, "num_tokens": 119168171.0, "step": 16080 }, { "entropy": 2.0600788913667203, "epoch": 0.2407491052800401, "grad_norm": 0.31977570056915283, "learning_rate": 4.410846087984789e-05, "loss": 0.2137, "mean_token_accuracy": 0.9483227115124464, "num_tokens": 119241908.0, "step": 16090 }, { "entropy": 2.0905535601079466, "epoch": 0.24089873182154417, "grad_norm": 0.3567586839199066, "learning_rate": 4.4100715964960944e-05, "loss": 0.227, "mean_token_accuracy": 0.9422936372458934, "num_tokens": 119315026.0, "step": 16100 }, { "entropy": 2.065988294035196, "epoch": 0.24104835836304822, "grad_norm": 0.32850468158721924, "learning_rate": 4.409296664520961e-05, "loss": 0.2263, "mean_token_accuracy": 0.9438053708523512, "num_tokens": 119389410.0, "step": 16110 }, { "entropy": 2.0821424767374994, "epoch": 0.2411979849045523, "grad_norm": 0.42206600308418274, "learning_rate": 4.408521292238566e-05, "loss": 0.2098, "mean_token_accuracy": 0.9485210493206978, "num_tokens": 119464709.0, "step": 16120 }, { "entropy": 2.0478326573967935, "epoch": 0.24134761144605635, "grad_norm": 0.42451903223991394, "learning_rate": 4.4077454798281905e-05, "loss": 0.2199, "mean_token_accuracy": 0.9468190506100654, "num_tokens": 119537451.0, "step": 16130 }, { "entropy": 2.074319223314524, "epoch": 0.24149723798756043, "grad_norm": 0.4473297894001007, "learning_rate": 4.4069692274692155e-05, "loss": 0.243, "mean_token_accuracy": 0.9423326823860407, "num_tokens": 119608619.0, "step": 16140 }, { "entropy": 2.0335396267473698, "epoch": 0.24164686452906448, "grad_norm": 0.33964160084724426, "learning_rate": 4.406192535341124e-05, "loss": 0.2245, "mean_token_accuracy": 0.9463571567088366, "num_tokens": 119684314.0, "step": 16150 }, { "entropy": 2.03813733831048, "epoch": 0.24179649107056855, "grad_norm": 0.2849193215370178, "learning_rate": 4.4054154036235016e-05, "loss": 0.225, "mean_token_accuracy": 0.9464765787124634, "num_tokens": 119759183.0, "step": 16160 }, { "entropy": 2.0337743066251277, "epoch": 0.24194611761207263, "grad_norm": 0.33442673087120056, "learning_rate": 4.404637832496034e-05, "loss": 0.2237, "mean_token_accuracy": 0.9459697607904672, "num_tokens": 119833426.0, "step": 16170 }, { "entropy": 2.055902273207903, "epoch": 0.24209574415357668, "grad_norm": 0.3602216839790344, "learning_rate": 4.4038598221385115e-05, "loss": 0.2342, "mean_token_accuracy": 0.9417982868850231, "num_tokens": 119906636.0, "step": 16180 }, { "entropy": 2.07627956867218, "epoch": 0.24224537069508076, "grad_norm": 0.443600594997406, "learning_rate": 4.403081372730821e-05, "loss": 0.2352, "mean_token_accuracy": 0.9413743548095226, "num_tokens": 119982633.0, "step": 16190 }, { "entropy": 2.041438663750887, "epoch": 0.2423949972365848, "grad_norm": 0.29614707827568054, "learning_rate": 4.402302484452957e-05, "loss": 0.2253, "mean_token_accuracy": 0.9437682565301657, "num_tokens": 120057007.0, "step": 16200 }, { "entropy": 2.0192115172743796, "epoch": 0.24254462377808889, "grad_norm": 0.3380019962787628, "learning_rate": 4.40152315748501e-05, "loss": 0.2072, "mean_token_accuracy": 0.9471330963075161, "num_tokens": 120129796.0, "step": 16210 }, { "entropy": 2.016851223260164, "epoch": 0.24269425031959294, "grad_norm": 0.3314051926136017, "learning_rate": 4.400743392007176e-05, "loss": 0.2229, "mean_token_accuracy": 0.9428550433367491, "num_tokens": 120200554.0, "step": 16220 }, { "entropy": 1.9930514819920062, "epoch": 0.242843876861097, "grad_norm": 0.3363197147846222, "learning_rate": 4.399963188199748e-05, "loss": 0.2112, "mean_token_accuracy": 0.9477915689349174, "num_tokens": 120273992.0, "step": 16230 }, { "entropy": 2.0037550680339336, "epoch": 0.24299350340260106, "grad_norm": 0.3375464379787445, "learning_rate": 4.399182546243127e-05, "loss": 0.2239, "mean_token_accuracy": 0.9422389108687639, "num_tokens": 120348151.0, "step": 16240 }, { "entropy": 1.9866594195365905, "epoch": 0.24314312994410514, "grad_norm": 0.3421008586883545, "learning_rate": 4.398401466317808e-05, "loss": 0.2133, "mean_token_accuracy": 0.9468516822904348, "num_tokens": 120424637.0, "step": 16250 }, { "entropy": 2.0045946575701237, "epoch": 0.2432927564856092, "grad_norm": 0.39425644278526306, "learning_rate": 4.397619948604391e-05, "loss": 0.238, "mean_token_accuracy": 0.9434769116342068, "num_tokens": 120497875.0, "step": 16260 }, { "entropy": 2.0337354809045793, "epoch": 0.24344238302711327, "grad_norm": 0.40602436661720276, "learning_rate": 4.3968379932835786e-05, "loss": 0.2558, "mean_token_accuracy": 0.9360252488404512, "num_tokens": 120568843.0, "step": 16270 }, { "entropy": 1.9917780749499798, "epoch": 0.24359200956861732, "grad_norm": 0.32842880487442017, "learning_rate": 4.396055600536171e-05, "loss": 0.2123, "mean_token_accuracy": 0.9452771190553904, "num_tokens": 120644025.0, "step": 16280 }, { "entropy": 1.9718476995825767, "epoch": 0.2437416361101214, "grad_norm": 0.3771713078022003, "learning_rate": 4.395272770543072e-05, "loss": 0.2208, "mean_token_accuracy": 0.9456279583275318, "num_tokens": 120718577.0, "step": 16290 }, { "entropy": 2.002423678338528, "epoch": 0.24389126265162545, "grad_norm": 0.39539510011672974, "learning_rate": 4.394489503485285e-05, "loss": 0.2396, "mean_token_accuracy": 0.9407203998416662, "num_tokens": 120793611.0, "step": 16300 }, { "entropy": 2.012669153511524, "epoch": 0.24404088919312952, "grad_norm": 0.3061200976371765, "learning_rate": 4.3937057995439176e-05, "loss": 0.2316, "mean_token_accuracy": 0.9413558680564165, "num_tokens": 120869946.0, "step": 16310 }, { "entropy": 2.052753484249115, "epoch": 0.2441905157346336, "grad_norm": 0.3230930268764496, "learning_rate": 4.392921658900174e-05, "loss": 0.2504, "mean_token_accuracy": 0.9360945120453834, "num_tokens": 120941861.0, "step": 16320 }, { "entropy": 2.026337506622076, "epoch": 0.24434014227613765, "grad_norm": 0.39909130334854126, "learning_rate": 4.3921370817353605e-05, "loss": 0.2259, "mean_token_accuracy": 0.9437697723507881, "num_tokens": 121014794.0, "step": 16330 }, { "entropy": 2.0071354769170284, "epoch": 0.24448976881764173, "grad_norm": 0.3305225968360901, "learning_rate": 4.391352068230888e-05, "loss": 0.224, "mean_token_accuracy": 0.9416888732463121, "num_tokens": 121091143.0, "step": 16340 }, { "entropy": 2.036068270355463, "epoch": 0.24463939535914578, "grad_norm": 0.3151331841945648, "learning_rate": 4.390566618568264e-05, "loss": 0.2241, "mean_token_accuracy": 0.9463795971125364, "num_tokens": 121165791.0, "step": 16350 }, { "entropy": 2.0497440725564955, "epoch": 0.24478902190064986, "grad_norm": 0.3441990315914154, "learning_rate": 4.3897807329290995e-05, "loss": 0.226, "mean_token_accuracy": 0.9438645161688328, "num_tokens": 121240097.0, "step": 16360 }, { "entropy": 2.0152134865522386, "epoch": 0.2449386484421539, "grad_norm": 0.3641666769981384, "learning_rate": 4.388994411495104e-05, "loss": 0.2284, "mean_token_accuracy": 0.944090685993433, "num_tokens": 121313149.0, "step": 16370 }, { "entropy": 2.018006507307291, "epoch": 0.24508827498365798, "grad_norm": 0.2816300690174103, "learning_rate": 4.3882076544480895e-05, "loss": 0.2256, "mean_token_accuracy": 0.9424852773547172, "num_tokens": 121386154.0, "step": 16380 }, { "entropy": 2.019013747572899, "epoch": 0.24523790152516203, "grad_norm": 0.3590509295463562, "learning_rate": 4.3874204619699684e-05, "loss": 0.2535, "mean_token_accuracy": 0.9339492313563824, "num_tokens": 121459193.0, "step": 16390 }, { "entropy": 1.9696059748530388, "epoch": 0.2453875280666661, "grad_norm": 0.3834046423435211, "learning_rate": 4.386632834242753e-05, "loss": 0.2126, "mean_token_accuracy": 0.9442971590906382, "num_tokens": 121531655.0, "step": 16400 }, { "entropy": 1.96181361079216, "epoch": 0.24553715460817016, "grad_norm": 0.3191194534301758, "learning_rate": 4.3858447714485574e-05, "loss": 0.2247, "mean_token_accuracy": 0.9467709362506866, "num_tokens": 121605420.0, "step": 16410 }, { "entropy": 1.9572921447455882, "epoch": 0.24568678114967424, "grad_norm": 0.39426347613334656, "learning_rate": 4.385056273769596e-05, "loss": 0.2168, "mean_token_accuracy": 0.9477232247591019, "num_tokens": 121681949.0, "step": 16420 }, { "entropy": 2.0002415224909784, "epoch": 0.2458364076911783, "grad_norm": 0.2768111824989319, "learning_rate": 4.384267341388183e-05, "loss": 0.2286, "mean_token_accuracy": 0.9430888962000609, "num_tokens": 121755880.0, "step": 16430 }, { "entropy": 2.0337524503469466, "epoch": 0.24598603423268237, "grad_norm": 0.36334654688835144, "learning_rate": 4.3834779744867335e-05, "loss": 0.2458, "mean_token_accuracy": 0.9378060389310121, "num_tokens": 121828391.0, "step": 16440 }, { "entropy": 2.0571872130036355, "epoch": 0.24613566077418642, "grad_norm": 0.3307816684246063, "learning_rate": 4.382688173247763e-05, "loss": 0.2336, "mean_token_accuracy": 0.9402903161942959, "num_tokens": 121901243.0, "step": 16450 }, { "entropy": 2.053033521771431, "epoch": 0.2462852873156905, "grad_norm": 0.3435797393321991, "learning_rate": 4.381897937853889e-05, "loss": 0.2238, "mean_token_accuracy": 0.943028011918068, "num_tokens": 121975299.0, "step": 16460 }, { "entropy": 2.0084967061877252, "epoch": 0.24643491385719457, "grad_norm": 0.3818540573120117, "learning_rate": 4.381107268487827e-05, "loss": 0.2341, "mean_token_accuracy": 0.9409181106835603, "num_tokens": 122049289.0, "step": 16470 }, { "entropy": 2.047669021040201, "epoch": 0.24658454039869862, "grad_norm": 0.32403117418289185, "learning_rate": 4.3803161653323926e-05, "loss": 0.2548, "mean_token_accuracy": 0.9364870361983776, "num_tokens": 122120549.0, "step": 16480 }, { "entropy": 1.9855361193418504, "epoch": 0.2467341669402027, "grad_norm": 0.30268576741218567, "learning_rate": 4.3795246285705056e-05, "loss": 0.2186, "mean_token_accuracy": 0.9451680358499288, "num_tokens": 122195401.0, "step": 16490 }, { "entropy": 1.9707822889089583, "epoch": 0.24688379348170675, "grad_norm": 0.3267269432544708, "learning_rate": 4.3787326583851806e-05, "loss": 0.2163, "mean_token_accuracy": 0.9465970400720835, "num_tokens": 122268489.0, "step": 16500 }, { "entropy": 2.0079424642026424, "epoch": 0.24703342002321083, "grad_norm": 0.3960433006286621, "learning_rate": 4.377940254959537e-05, "loss": 0.2265, "mean_token_accuracy": 0.942170899733901, "num_tokens": 122340322.0, "step": 16510 }, { "entropy": 2.048304967582226, "epoch": 0.24718304656471488, "grad_norm": 0.3772333562374115, "learning_rate": 4.377147418476791e-05, "loss": 0.225, "mean_token_accuracy": 0.9434278637170792, "num_tokens": 122416783.0, "step": 16520 }, { "entropy": 2.017482512444258, "epoch": 0.24733267310621895, "grad_norm": 0.3865550458431244, "learning_rate": 4.376354149120263e-05, "loss": 0.2187, "mean_token_accuracy": 0.9457809492945671, "num_tokens": 122491568.0, "step": 16530 }, { "entropy": 1.9773899637162686, "epoch": 0.247482299647723, "grad_norm": 0.39673933386802673, "learning_rate": 4.375560447073369e-05, "loss": 0.2147, "mean_token_accuracy": 0.9469282567501068, "num_tokens": 122564461.0, "step": 16540 }, { "entropy": 1.9578679554164409, "epoch": 0.24763192618922708, "grad_norm": 0.3386728763580322, "learning_rate": 4.3747663125196274e-05, "loss": 0.2161, "mean_token_accuracy": 0.9476192023605108, "num_tokens": 122638600.0, "step": 16550 }, { "entropy": 1.990031461417675, "epoch": 0.24778155273073113, "grad_norm": 0.3364439904689789, "learning_rate": 4.3739717456426574e-05, "loss": 0.2228, "mean_token_accuracy": 0.94636568762362, "num_tokens": 122714984.0, "step": 16560 }, { "entropy": 2.0045017920434476, "epoch": 0.2479311792722352, "grad_norm": 0.3133964538574219, "learning_rate": 4.3731767466261744e-05, "loss": 0.2146, "mean_token_accuracy": 0.9434027221053839, "num_tokens": 122788247.0, "step": 16570 }, { "entropy": 1.9610675513744353, "epoch": 0.24808080581373926, "grad_norm": 0.3368903696537018, "learning_rate": 4.372381315653998e-05, "loss": 0.2126, "mean_token_accuracy": 0.9473176315426827, "num_tokens": 122862257.0, "step": 16580 }, { "entropy": 1.9492383748292923, "epoch": 0.24823043235524334, "grad_norm": 0.3312985897064209, "learning_rate": 4.371585452910047e-05, "loss": 0.2073, "mean_token_accuracy": 0.9479431383311748, "num_tokens": 122938846.0, "step": 16590 }, { "entropy": 1.971950925141573, "epoch": 0.2483800588967474, "grad_norm": 0.3543524146080017, "learning_rate": 4.370789158578337e-05, "loss": 0.226, "mean_token_accuracy": 0.9431917991489172, "num_tokens": 123011438.0, "step": 16600 }, { "entropy": 1.9573254011571408, "epoch": 0.24852968543825146, "grad_norm": 0.3092285096645355, "learning_rate": 4.3699924328429873e-05, "loss": 0.217, "mean_token_accuracy": 0.9475264042615891, "num_tokens": 123087341.0, "step": 16610 }, { "entropy": 2.0000997729599477, "epoch": 0.24867931197975554, "grad_norm": 0.33425843715667725, "learning_rate": 4.369195275888214e-05, "loss": 0.2198, "mean_token_accuracy": 0.9441487450152636, "num_tokens": 123162687.0, "step": 16620 }, { "entropy": 2.0022789508104326, "epoch": 0.2488289385212596, "grad_norm": 0.3099813163280487, "learning_rate": 4.368397687898333e-05, "loss": 0.2075, "mean_token_accuracy": 0.9505322974175214, "num_tokens": 123238702.0, "step": 16630 }, { "entropy": 2.0081651136279106, "epoch": 0.24897856506276367, "grad_norm": 0.31102094054222107, "learning_rate": 4.367599669057762e-05, "loss": 0.2306, "mean_token_accuracy": 0.9449191451072693, "num_tokens": 123310061.0, "step": 16640 }, { "entropy": 2.0100230783224107, "epoch": 0.24912819160426772, "grad_norm": 0.32776451110839844, "learning_rate": 4.3668012195510175e-05, "loss": 0.21, "mean_token_accuracy": 0.9471614200621843, "num_tokens": 123386702.0, "step": 16650 }, { "entropy": 2.0042002387344837, "epoch": 0.2492778181457718, "grad_norm": 0.38518717885017395, "learning_rate": 4.366002339562715e-05, "loss": 0.225, "mean_token_accuracy": 0.94392872415483, "num_tokens": 123463652.0, "step": 16660 }, { "entropy": 1.975849761813879, "epoch": 0.24942744468727585, "grad_norm": 0.3566230535507202, "learning_rate": 4.3652030292775695e-05, "loss": 0.2177, "mean_token_accuracy": 0.9478672806173563, "num_tokens": 123538573.0, "step": 16670 }, { "entropy": 1.989323589205742, "epoch": 0.24957707122877992, "grad_norm": 0.3418055772781372, "learning_rate": 4.3644032888803955e-05, "loss": 0.2317, "mean_token_accuracy": 0.9450258005410432, "num_tokens": 123611256.0, "step": 16680 }, { "entropy": 2.035205653309822, "epoch": 0.24972669777028397, "grad_norm": 0.363689661026001, "learning_rate": 4.363603118556107e-05, "loss": 0.2218, "mean_token_accuracy": 0.9423216570168733, "num_tokens": 123683517.0, "step": 16690 }, { "entropy": 2.039001078903675, "epoch": 0.24987632431178805, "grad_norm": 0.38119035959243774, "learning_rate": 4.3628025184897194e-05, "loss": 0.2435, "mean_token_accuracy": 0.9373656831681728, "num_tokens": 123756380.0, "step": 16700 }, { "entropy": 2.0349832609295846, "epoch": 0.2500259508532921, "grad_norm": 0.2823590636253357, "learning_rate": 4.362001488866343e-05, "loss": 0.2229, "mean_token_accuracy": 0.941704834997654, "num_tokens": 123829670.0, "step": 16710 }, { "entropy": 2.0058689691126346, "epoch": 0.2501755773947962, "grad_norm": 0.2992836833000183, "learning_rate": 4.361200029871192e-05, "loss": 0.2142, "mean_token_accuracy": 0.9481477294117212, "num_tokens": 123904601.0, "step": 16720 }, { "entropy": 2.0063904598355293, "epoch": 0.25032520393630026, "grad_norm": 0.41628551483154297, "learning_rate": 4.360398141689577e-05, "loss": 0.2193, "mean_token_accuracy": 0.9430948473513127, "num_tokens": 123977071.0, "step": 16730 }, { "entropy": 2.020273266732693, "epoch": 0.2504748304778043, "grad_norm": 0.3421095609664917, "learning_rate": 4.35959582450691e-05, "loss": 0.2235, "mean_token_accuracy": 0.9441402390599251, "num_tokens": 124049079.0, "step": 16740 }, { "entropy": 2.043296295404434, "epoch": 0.25062445701930836, "grad_norm": 0.3016813099384308, "learning_rate": 4.3587930785087e-05, "loss": 0.2288, "mean_token_accuracy": 0.9424254439771176, "num_tokens": 124123113.0, "step": 16750 }, { "entropy": 2.0543952472507954, "epoch": 0.25077408356081243, "grad_norm": 0.3363136947154999, "learning_rate": 4.3579899038805564e-05, "loss": 0.2152, "mean_token_accuracy": 0.9461530242115259, "num_tokens": 124196196.0, "step": 16760 }, { "entropy": 2.0375195115804674, "epoch": 0.2509237101023165, "grad_norm": 0.3310266137123108, "learning_rate": 4.357186300808188e-05, "loss": 0.2039, "mean_token_accuracy": 0.9482848644256592, "num_tokens": 124269633.0, "step": 16770 }, { "entropy": 1.9885814964771271, "epoch": 0.2510733366438206, "grad_norm": 0.294413298368454, "learning_rate": 4.3563822694774e-05, "loss": 0.2058, "mean_token_accuracy": 0.9478947155177593, "num_tokens": 124347201.0, "step": 16780 }, { "entropy": 2.026625461131334, "epoch": 0.2512229631853246, "grad_norm": 0.3412422239780426, "learning_rate": 4.3555778100741024e-05, "loss": 0.2213, "mean_token_accuracy": 0.9442304644733668, "num_tokens": 124419940.0, "step": 16790 }, { "entropy": 2.031872060149908, "epoch": 0.2513725897268287, "grad_norm": 0.34379133582115173, "learning_rate": 4.354772922784297e-05, "loss": 0.2284, "mean_token_accuracy": 0.9434406265616417, "num_tokens": 124496337.0, "step": 16800 }, { "entropy": 2.0488209024071695, "epoch": 0.25152221626833277, "grad_norm": 0.411844402551651, "learning_rate": 4.35396760779409e-05, "loss": 0.2234, "mean_token_accuracy": 0.9420457955449819, "num_tokens": 124570583.0, "step": 16810 }, { "entropy": 2.015605629980564, "epoch": 0.25167184280983684, "grad_norm": 0.3768039047718048, "learning_rate": 4.3531618652896836e-05, "loss": 0.2076, "mean_token_accuracy": 0.9490985263139009, "num_tokens": 124644753.0, "step": 16820 }, { "entropy": 2.0118858821690084, "epoch": 0.25182146935134087, "grad_norm": 0.4580540060997009, "learning_rate": 4.3523556954573806e-05, "loss": 0.2208, "mean_token_accuracy": 0.9407936118543148, "num_tokens": 124719139.0, "step": 16830 }, { "entropy": 2.0249043092131616, "epoch": 0.25197109589284494, "grad_norm": 0.32576364278793335, "learning_rate": 4.351549098483582e-05, "loss": 0.2307, "mean_token_accuracy": 0.9403771858662366, "num_tokens": 124791060.0, "step": 16840 }, { "entropy": 2.0139253407716753, "epoch": 0.252120722434349, "grad_norm": 0.5852076411247253, "learning_rate": 4.350742074554787e-05, "loss": 0.2182, "mean_token_accuracy": 0.9467729043215514, "num_tokens": 124865922.0, "step": 16850 }, { "entropy": 2.0327835284173488, "epoch": 0.2522703489758531, "grad_norm": 0.34613946080207825, "learning_rate": 4.349934623857592e-05, "loss": 0.2222, "mean_token_accuracy": 0.9439053174108267, "num_tokens": 124938374.0, "step": 16860 }, { "entropy": 2.016629195213318, "epoch": 0.2524199755173571, "grad_norm": 0.4179118573665619, "learning_rate": 4.349126746578697e-05, "loss": 0.2207, "mean_token_accuracy": 0.9457638803869486, "num_tokens": 125012719.0, "step": 16870 }, { "entropy": 2.0316185727715492, "epoch": 0.2525696020588612, "grad_norm": 0.3678561747074127, "learning_rate": 4.348318442904897e-05, "loss": 0.2129, "mean_token_accuracy": 0.947494312748313, "num_tokens": 125086126.0, "step": 16880 }, { "entropy": 2.0064745537936686, "epoch": 0.2527192286003653, "grad_norm": 0.28348076343536377, "learning_rate": 4.347509713023083e-05, "loss": 0.2117, "mean_token_accuracy": 0.9481040451675653, "num_tokens": 125162906.0, "step": 16890 }, { "entropy": 2.0510476611554624, "epoch": 0.25286885514186935, "grad_norm": 0.4033825993537903, "learning_rate": 4.346700557120253e-05, "loss": 0.2374, "mean_token_accuracy": 0.9422494497150182, "num_tokens": 125239022.0, "step": 16900 }, { "entropy": 2.0089678950607777, "epoch": 0.25301848168337343, "grad_norm": 0.34085607528686523, "learning_rate": 4.345890975383494e-05, "loss": 0.2319, "mean_token_accuracy": 0.9421025216579437, "num_tokens": 125314501.0, "step": 16910 }, { "entropy": 2.01661573946476, "epoch": 0.25316810822487745, "grad_norm": 0.35542815923690796, "learning_rate": 4.345080967999997e-05, "loss": 0.2353, "mean_token_accuracy": 0.9416692964732647, "num_tokens": 125385794.0, "step": 16920 }, { "entropy": 2.052581109851599, "epoch": 0.25331773476638153, "grad_norm": 0.3307231366634369, "learning_rate": 4.344270535157051e-05, "loss": 0.2482, "mean_token_accuracy": 0.9417580153793097, "num_tokens": 125459401.0, "step": 16930 }, { "entropy": 2.026107481867075, "epoch": 0.2534673613078856, "grad_norm": 0.42462819814682007, "learning_rate": 4.343459677042041e-05, "loss": 0.2041, "mean_token_accuracy": 0.9483846720308066, "num_tokens": 125535691.0, "step": 16940 }, { "entropy": 2.0067538641393186, "epoch": 0.2536169878493897, "grad_norm": 0.39572760462760925, "learning_rate": 4.342648393842453e-05, "loss": 0.2347, "mean_token_accuracy": 0.942656633630395, "num_tokens": 125608043.0, "step": 16950 }, { "entropy": 2.0076343685388567, "epoch": 0.2537666143908937, "grad_norm": 0.3775143325328827, "learning_rate": 4.34183668574587e-05, "loss": 0.215, "mean_token_accuracy": 0.9483071684837341, "num_tokens": 125679476.0, "step": 16960 }, { "entropy": 2.0084052227437494, "epoch": 0.2539162409323978, "grad_norm": 0.37910330295562744, "learning_rate": 4.341024552939972e-05, "loss": 0.2188, "mean_token_accuracy": 0.94336854852736, "num_tokens": 125751129.0, "step": 16970 }, { "entropy": 2.036190717667341, "epoch": 0.25406586747390186, "grad_norm": 0.40339210629463196, "learning_rate": 4.340211995612541e-05, "loss": 0.2291, "mean_token_accuracy": 0.9453953098505735, "num_tokens": 125823456.0, "step": 16980 }, { "entropy": 2.0309246577322484, "epoch": 0.25421549401540594, "grad_norm": 0.3322254717350006, "learning_rate": 4.339399013951452e-05, "loss": 0.2327, "mean_token_accuracy": 0.9456148259341717, "num_tokens": 125898482.0, "step": 16990 }, { "entropy": 2.0426239393651486, "epoch": 0.25436512055690996, "grad_norm": 0.49731385707855225, "learning_rate": 4.338585608144683e-05, "loss": 0.2283, "mean_token_accuracy": 0.944075546041131, "num_tokens": 125970887.0, "step": 17000 }, { "epoch": 0.25436512055690996, "eval_entropy": 2.02679338157177, "eval_loss": 0.2466127872467041, "eval_mean_token_accuracy": 0.9448320381641387, "eval_num_tokens": 125970887.0, "eval_runtime": 543.27, "eval_samples_per_second": 36.814, "eval_steps_per_second": 9.204, "step": 17000 }, { "entropy": 2.0168982595205307, "epoch": 0.25451474709841404, "grad_norm": 0.3718942105770111, "learning_rate": 4.3377717783803066e-05, "loss": 0.2179, "mean_token_accuracy": 0.9435641348361969, "num_tokens": 126047886.0, "step": 17010 }, { "entropy": 2.0054264828562736, "epoch": 0.2546643736399181, "grad_norm": 0.44374823570251465, "learning_rate": 4.336957524846494e-05, "loss": 0.2381, "mean_token_accuracy": 0.9443205490708351, "num_tokens": 126124676.0, "step": 17020 }, { "entropy": 2.001351786404848, "epoch": 0.2548140001814222, "grad_norm": 0.3329358696937561, "learning_rate": 4.336142847731518e-05, "loss": 0.2029, "mean_token_accuracy": 0.9477333903312684, "num_tokens": 126198569.0, "step": 17030 }, { "entropy": 1.9631784930825233, "epoch": 0.2549636267229263, "grad_norm": 0.39166826009750366, "learning_rate": 4.3353277472237444e-05, "loss": 0.2164, "mean_token_accuracy": 0.9449137799441815, "num_tokens": 126273572.0, "step": 17040 }, { "entropy": 2.0052668027579785, "epoch": 0.2551132532644303, "grad_norm": 0.32352301478385925, "learning_rate": 4.334512223511638e-05, "loss": 0.2339, "mean_token_accuracy": 0.9435946058481932, "num_tokens": 126348967.0, "step": 17050 }, { "entropy": 1.9778543323278428, "epoch": 0.2552628798059344, "grad_norm": 0.3239785432815552, "learning_rate": 4.333696276783765e-05, "loss": 0.2191, "mean_token_accuracy": 0.9451056253165007, "num_tokens": 126421948.0, "step": 17060 }, { "entropy": 1.9993440955877304, "epoch": 0.25541250634743845, "grad_norm": 0.32256850600242615, "learning_rate": 4.332879907228784e-05, "loss": 0.2186, "mean_token_accuracy": 0.9425697054713964, "num_tokens": 126496428.0, "step": 17070 }, { "entropy": 1.9978416383266449, "epoch": 0.25556213288894253, "grad_norm": 0.313690185546875, "learning_rate": 4.332063115035456e-05, "loss": 0.2172, "mean_token_accuracy": 0.9494311794638634, "num_tokens": 126570848.0, "step": 17080 }, { "entropy": 2.0182333581149576, "epoch": 0.25571175943044655, "grad_norm": 0.3785570561885834, "learning_rate": 4.331245900392639e-05, "loss": 0.2137, "mean_token_accuracy": 0.9434557281434536, "num_tokens": 126643932.0, "step": 17090 }, { "entropy": 1.9853479161858558, "epoch": 0.25586138597195063, "grad_norm": 0.3464750647544861, "learning_rate": 4.3304282634892836e-05, "loss": 0.2324, "mean_token_accuracy": 0.9406619675457477, "num_tokens": 126717843.0, "step": 17100 }, { "entropy": 1.9790563829243184, "epoch": 0.2560110125134547, "grad_norm": 0.3426876366138458, "learning_rate": 4.3296102045144456e-05, "loss": 0.2192, "mean_token_accuracy": 0.9472858447581529, "num_tokens": 126793079.0, "step": 17110 }, { "entropy": 2.0121135517954825, "epoch": 0.2561606390549588, "grad_norm": 0.35031428933143616, "learning_rate": 4.3287917236572734e-05, "loss": 0.2312, "mean_token_accuracy": 0.9414006408303977, "num_tokens": 126867589.0, "step": 17120 }, { "entropy": 1.9980814643204212, "epoch": 0.2563102655964628, "grad_norm": 0.4419938623905182, "learning_rate": 4.327972821107014e-05, "loss": 0.2243, "mean_token_accuracy": 0.9458811666816473, "num_tokens": 126941560.0, "step": 17130 }, { "entropy": 1.9779719687998294, "epoch": 0.2564598921379669, "grad_norm": 0.3605317175388336, "learning_rate": 4.3271534970530134e-05, "loss": 0.2114, "mean_token_accuracy": 0.9439295940101147, "num_tokens": 127016032.0, "step": 17140 }, { "entropy": 2.010127256065607, "epoch": 0.25660951867947096, "grad_norm": 0.2917308807373047, "learning_rate": 4.326333751684713e-05, "loss": 0.2165, "mean_token_accuracy": 0.947640473023057, "num_tokens": 127088247.0, "step": 17150 }, { "entropy": 2.0435455590486526, "epoch": 0.25675914522097504, "grad_norm": 0.3274212181568146, "learning_rate": 4.325513585191652e-05, "loss": 0.2261, "mean_token_accuracy": 0.9439743306487799, "num_tokens": 127162723.0, "step": 17160 }, { "entropy": 2.03381944745779, "epoch": 0.25690877176247906, "grad_norm": 0.37538138031959534, "learning_rate": 4.3246929977634694e-05, "loss": 0.2223, "mean_token_accuracy": 0.9429311230778694, "num_tokens": 127237384.0, "step": 17170 }, { "entropy": 2.0363868504762648, "epoch": 0.25705839830398314, "grad_norm": 0.3380146026611328, "learning_rate": 4.3238719895898985e-05, "loss": 0.2281, "mean_token_accuracy": 0.9434455685317517, "num_tokens": 127312529.0, "step": 17180 }, { "entropy": 2.039004324376583, "epoch": 0.2572080248454872, "grad_norm": 0.351798951625824, "learning_rate": 4.323050560860769e-05, "loss": 0.2019, "mean_token_accuracy": 0.9469769861549139, "num_tokens": 127386450.0, "step": 17190 }, { "entropy": 2.0314171835780144, "epoch": 0.2573576513869913, "grad_norm": 0.32466062903404236, "learning_rate": 4.322228711766014e-05, "loss": 0.2303, "mean_token_accuracy": 0.942680211365223, "num_tokens": 127461005.0, "step": 17200 }, { "entropy": 2.022487550973892, "epoch": 0.25750727792849537, "grad_norm": 0.36314094066619873, "learning_rate": 4.3214064424956563e-05, "loss": 0.242, "mean_token_accuracy": 0.9414778728038072, "num_tokens": 127533899.0, "step": 17210 }, { "entropy": 1.9910138800740242, "epoch": 0.2576569044699994, "grad_norm": 0.3252077102661133, "learning_rate": 4.320583753239821e-05, "loss": 0.2151, "mean_token_accuracy": 0.9486230961978436, "num_tokens": 127607851.0, "step": 17220 }, { "entropy": 1.9792562119662762, "epoch": 0.25780653101150347, "grad_norm": 0.4847642481327057, "learning_rate": 4.319760644188727e-05, "loss": 0.2249, "mean_token_accuracy": 0.9450223345309496, "num_tokens": 127681918.0, "step": 17230 }, { "entropy": 1.9889018058776855, "epoch": 0.25795615755300755, "grad_norm": 0.32753607630729675, "learning_rate": 4.318937115532693e-05, "loss": 0.213, "mean_token_accuracy": 0.9469874978065491, "num_tokens": 127753352.0, "step": 17240 }, { "entropy": 2.0024723291397093, "epoch": 0.2581057840945116, "grad_norm": 0.3816656768321991, "learning_rate": 4.318113167462132e-05, "loss": 0.2177, "mean_token_accuracy": 0.9446849081665277, "num_tokens": 127824985.0, "step": 17250 }, { "entropy": 1.9502695381641388, "epoch": 0.25825541063601565, "grad_norm": 0.3409341871738434, "learning_rate": 4.317288800167557e-05, "loss": 0.2028, "mean_token_accuracy": 0.9492498282343149, "num_tokens": 127900533.0, "step": 17260 }, { "entropy": 1.9487469665706159, "epoch": 0.2584050371775197, "grad_norm": 0.32847729325294495, "learning_rate": 4.3164640138395764e-05, "loss": 0.2133, "mean_token_accuracy": 0.9460049189627171, "num_tokens": 127974650.0, "step": 17270 }, { "entropy": 1.952818927168846, "epoch": 0.2585546637190238, "grad_norm": 0.3086678087711334, "learning_rate": 4.315638808668894e-05, "loss": 0.2093, "mean_token_accuracy": 0.9491973910480738, "num_tokens": 128049316.0, "step": 17280 }, { "entropy": 2.0158708497881888, "epoch": 0.2587042902605279, "grad_norm": 0.34382888674736023, "learning_rate": 4.314813184846313e-05, "loss": 0.2469, "mean_token_accuracy": 0.93866643384099, "num_tokens": 128120506.0, "step": 17290 }, { "entropy": 2.022077728062868, "epoch": 0.2588539168020319, "grad_norm": 0.30771294236183167, "learning_rate": 4.3139871425627325e-05, "loss": 0.2182, "mean_token_accuracy": 0.9458696868270635, "num_tokens": 128195750.0, "step": 17300 }, { "entropy": 1.9928697161376476, "epoch": 0.259003543343536, "grad_norm": 0.3136599659919739, "learning_rate": 4.3131606820091474e-05, "loss": 0.2146, "mean_token_accuracy": 0.9444810140877962, "num_tokens": 128272874.0, "step": 17310 }, { "entropy": 2.008440475910902, "epoch": 0.25915316988504006, "grad_norm": 0.308378130197525, "learning_rate": 4.3123338033766506e-05, "loss": 0.2453, "mean_token_accuracy": 0.9369776047766208, "num_tokens": 128344606.0, "step": 17320 }, { "entropy": 2.0219190023839473, "epoch": 0.25930279642654414, "grad_norm": 0.35981300473213196, "learning_rate": 4.3115065068564316e-05, "loss": 0.2295, "mean_token_accuracy": 0.942860359326005, "num_tokens": 128417462.0, "step": 17330 }, { "entropy": 1.9899151727557183, "epoch": 0.2594524229680482, "grad_norm": 0.31166768074035645, "learning_rate": 4.310678792639775e-05, "loss": 0.2072, "mean_token_accuracy": 0.947108582407236, "num_tokens": 128491221.0, "step": 17340 }, { "entropy": 1.977298940718174, "epoch": 0.25960204950955224, "grad_norm": 0.3761517107486725, "learning_rate": 4.309850660918063e-05, "loss": 0.22, "mean_token_accuracy": 0.9459284603595733, "num_tokens": 128566158.0, "step": 17350 }, { "entropy": 1.9889166578650475, "epoch": 0.2597516760510563, "grad_norm": 0.35321831703186035, "learning_rate": 4.309022111882775e-05, "loss": 0.2305, "mean_token_accuracy": 0.9435504451394081, "num_tokens": 128638405.0, "step": 17360 }, { "entropy": 1.964811161905527, "epoch": 0.2599013025925604, "grad_norm": 0.35165607929229736, "learning_rate": 4.308193145725486e-05, "loss": 0.2203, "mean_token_accuracy": 0.9455436542630196, "num_tokens": 128712216.0, "step": 17370 }, { "entropy": 1.9711891077458858, "epoch": 0.26005092913406447, "grad_norm": 0.3585442304611206, "learning_rate": 4.307363762637869e-05, "loss": 0.2272, "mean_token_accuracy": 0.942692095413804, "num_tokens": 128788556.0, "step": 17380 }, { "entropy": 1.9759587064385413, "epoch": 0.2602005556755685, "grad_norm": 0.40561795234680176, "learning_rate": 4.3065339628116905e-05, "loss": 0.2219, "mean_token_accuracy": 0.9418573338538409, "num_tokens": 128863574.0, "step": 17390 }, { "entropy": 1.9541731216013432, "epoch": 0.26035018221707257, "grad_norm": 0.3849547505378723, "learning_rate": 4.305703746438815e-05, "loss": 0.2168, "mean_token_accuracy": 0.9432085048407316, "num_tokens": 128938799.0, "step": 17400 }, { "entropy": 1.9686829060316087, "epoch": 0.26049980875857665, "grad_norm": 0.35497909784317017, "learning_rate": 4.304873113711204e-05, "loss": 0.2245, "mean_token_accuracy": 0.9426066383719445, "num_tokens": 129010561.0, "step": 17410 }, { "entropy": 1.975174593180418, "epoch": 0.2606494353000807, "grad_norm": 0.3264389634132385, "learning_rate": 4.304042064820915e-05, "loss": 0.205, "mean_token_accuracy": 0.9479788269847631, "num_tokens": 129084874.0, "step": 17420 }, { "entropy": 1.9707801088690757, "epoch": 0.26079906184158475, "grad_norm": 0.41133826971054077, "learning_rate": 4.3032105999601e-05, "loss": 0.2271, "mean_token_accuracy": 0.9441683806478978, "num_tokens": 129159563.0, "step": 17430 }, { "entropy": 1.9593721844255925, "epoch": 0.2609486883830888, "grad_norm": 0.4234388768672943, "learning_rate": 4.302378719321009e-05, "loss": 0.2418, "mean_token_accuracy": 0.9383463028818368, "num_tokens": 129232793.0, "step": 17440 }, { "entropy": 1.9605794072151184, "epoch": 0.2610983149245929, "grad_norm": 0.4137575626373291, "learning_rate": 4.301546423095989e-05, "loss": 0.2022, "mean_token_accuracy": 0.9507377818226814, "num_tokens": 129307007.0, "step": 17450 }, { "entropy": 1.9872503340244294, "epoch": 0.261247941466097, "grad_norm": 0.2910176217556, "learning_rate": 4.3007137114774785e-05, "loss": 0.2252, "mean_token_accuracy": 0.945542873814702, "num_tokens": 129382829.0, "step": 17460 }, { "entropy": 1.9626220516860484, "epoch": 0.26139756800760106, "grad_norm": 0.29842138290405273, "learning_rate": 4.2998805846580184e-05, "loss": 0.2226, "mean_token_accuracy": 0.9435526240617037, "num_tokens": 129459384.0, "step": 17470 }, { "entropy": 1.961517696082592, "epoch": 0.2615471945491051, "grad_norm": 0.3537742793560028, "learning_rate": 4.2990470428302405e-05, "loss": 0.2207, "mean_token_accuracy": 0.9435574550181627, "num_tokens": 129535566.0, "step": 17480 }, { "entropy": 2.001833839714527, "epoch": 0.26169682109060916, "grad_norm": 0.35447975993156433, "learning_rate": 4.2982130861868755e-05, "loss": 0.2234, "mean_token_accuracy": 0.9445947904139758, "num_tokens": 129609625.0, "step": 17490 }, { "entropy": 1.9952963776886463, "epoch": 0.26184644763211323, "grad_norm": 0.37846505641937256, "learning_rate": 4.297378714920749e-05, "loss": 0.2153, "mean_token_accuracy": 0.9473113521933556, "num_tokens": 129685026.0, "step": 17500 }, { "entropy": 2.016940402984619, "epoch": 0.2619960741736173, "grad_norm": 0.3567720353603363, "learning_rate": 4.2965439292247814e-05, "loss": 0.2192, "mean_token_accuracy": 0.9449314881116152, "num_tokens": 129756995.0, "step": 17510 }, { "entropy": 1.9974692091345787, "epoch": 0.26214570071512133, "grad_norm": 0.36610057950019836, "learning_rate": 4.295708729291991e-05, "loss": 0.2248, "mean_token_accuracy": 0.9432786282151937, "num_tokens": 129830899.0, "step": 17520 }, { "entropy": 2.001037161052227, "epoch": 0.2622953272566254, "grad_norm": 0.3010680675506592, "learning_rate": 4.294873115315491e-05, "loss": 0.2174, "mean_token_accuracy": 0.9463255159556866, "num_tokens": 129906210.0, "step": 17530 }, { "entropy": 2.0504595056176185, "epoch": 0.2624449537981295, "grad_norm": 0.4136195182800293, "learning_rate": 4.2940370874884906e-05, "loss": 0.2523, "mean_token_accuracy": 0.9384560212492943, "num_tokens": 129978068.0, "step": 17540 }, { "entropy": 2.0636304400861265, "epoch": 0.26259458033963357, "grad_norm": 0.47486916184425354, "learning_rate": 4.293200646004292e-05, "loss": 0.242, "mean_token_accuracy": 0.9387151911854744, "num_tokens": 130052316.0, "step": 17550 }, { "entropy": 2.082205343991518, "epoch": 0.2627442068811376, "grad_norm": 0.40483376383781433, "learning_rate": 4.292363791056298e-05, "loss": 0.2171, "mean_token_accuracy": 0.9449768204241991, "num_tokens": 130125038.0, "step": 17560 }, { "entropy": 2.0309106297791004, "epoch": 0.26289383342264167, "grad_norm": 0.3578304648399353, "learning_rate": 4.291526522838002e-05, "loss": 0.2276, "mean_token_accuracy": 0.9455477550625802, "num_tokens": 130198234.0, "step": 17570 }, { "entropy": 2.0147901706397535, "epoch": 0.26304345996414574, "grad_norm": 0.3547304570674896, "learning_rate": 4.290688841542998e-05, "loss": 0.224, "mean_token_accuracy": 0.9418873999267816, "num_tokens": 130272004.0, "step": 17580 }, { "entropy": 2.0047319449484347, "epoch": 0.2631930865056498, "grad_norm": 0.34719160199165344, "learning_rate": 4.2898507473649706e-05, "loss": 0.217, "mean_token_accuracy": 0.9467524759471416, "num_tokens": 130347702.0, "step": 17590 }, { "entropy": 2.0281103223562242, "epoch": 0.26334271304715384, "grad_norm": 0.3798537850379944, "learning_rate": 4.289012240497703e-05, "loss": 0.2037, "mean_token_accuracy": 0.9509062968194485, "num_tokens": 130421131.0, "step": 17600 }, { "entropy": 2.022486115992069, "epoch": 0.2634923395886579, "grad_norm": 0.44909578561782837, "learning_rate": 4.288173321135073e-05, "loss": 0.2338, "mean_token_accuracy": 0.9439417753368616, "num_tokens": 130495342.0, "step": 17610 }, { "entropy": 2.022466143220663, "epoch": 0.263641966130162, "grad_norm": 0.30635958909988403, "learning_rate": 4.287333989471052e-05, "loss": 0.2062, "mean_token_accuracy": 0.9496336128562689, "num_tokens": 130573953.0, "step": 17620 }, { "entropy": 2.0312775962054728, "epoch": 0.2637915926716661, "grad_norm": 0.3737289011478424, "learning_rate": 4.286494245699712e-05, "loss": 0.239, "mean_token_accuracy": 0.9403443302959203, "num_tokens": 130646781.0, "step": 17630 }, { "entropy": 2.0525998272001744, "epoch": 0.26394121921317015, "grad_norm": 0.38113486766815186, "learning_rate": 4.285654090015214e-05, "loss": 0.2326, "mean_token_accuracy": 0.940512691065669, "num_tokens": 130717668.0, "step": 17640 }, { "entropy": 2.029163409024477, "epoch": 0.2640908457546742, "grad_norm": 0.46075165271759033, "learning_rate": 4.2848135226118166e-05, "loss": 0.2137, "mean_token_accuracy": 0.9450889442116022, "num_tokens": 130791338.0, "step": 17650 }, { "entropy": 1.9713542118668557, "epoch": 0.26424047229617825, "grad_norm": 0.2969851791858673, "learning_rate": 4.2839725436838754e-05, "loss": 0.2064, "mean_token_accuracy": 0.9488908022642135, "num_tokens": 130864093.0, "step": 17660 }, { "entropy": 1.9958363749086856, "epoch": 0.26439009883768233, "grad_norm": 0.291681706905365, "learning_rate": 4.2831311534258396e-05, "loss": 0.2006, "mean_token_accuracy": 0.948507721722126, "num_tokens": 130934749.0, "step": 17670 }, { "entropy": 2.024748580902815, "epoch": 0.2645397253791864, "grad_norm": 0.3385277986526489, "learning_rate": 4.282289352032252e-05, "loss": 0.2403, "mean_token_accuracy": 0.9381538767367601, "num_tokens": 131006490.0, "step": 17680 }, { "entropy": 2.04764044880867, "epoch": 0.26468935192069043, "grad_norm": 0.49041318893432617, "learning_rate": 4.281447139697754e-05, "loss": 0.2319, "mean_token_accuracy": 0.942776982486248, "num_tokens": 131078439.0, "step": 17690 }, { "entropy": 2.03910723477602, "epoch": 0.2648389784621945, "grad_norm": 0.3468276560306549, "learning_rate": 4.280604516617078e-05, "loss": 0.2146, "mean_token_accuracy": 0.9486701887100935, "num_tokens": 131154427.0, "step": 17700 }, { "entropy": 2.037722332775593, "epoch": 0.2649886050036986, "grad_norm": 0.3466048538684845, "learning_rate": 4.279761482985056e-05, "loss": 0.2116, "mean_token_accuracy": 0.9459042120724916, "num_tokens": 131228821.0, "step": 17710 }, { "entropy": 2.0034206956624985, "epoch": 0.26513823154520266, "grad_norm": 0.2954052686691284, "learning_rate": 4.278918038996611e-05, "loss": 0.2061, "mean_token_accuracy": 0.946030754595995, "num_tokens": 131302554.0, "step": 17720 }, { "entropy": 1.9941191963851452, "epoch": 0.2652878580867067, "grad_norm": 0.36720165610313416, "learning_rate": 4.278074184846762e-05, "loss": 0.229, "mean_token_accuracy": 0.9404993798583746, "num_tokens": 131376909.0, "step": 17730 }, { "entropy": 2.0092363335192203, "epoch": 0.26543748462821076, "grad_norm": 0.3861556947231293, "learning_rate": 4.277229920730623e-05, "loss": 0.2124, "mean_token_accuracy": 0.9456748113036155, "num_tokens": 131449664.0, "step": 17740 }, { "entropy": 2.019600921869278, "epoch": 0.26558711116971484, "grad_norm": 0.4270144999027252, "learning_rate": 4.276385246843404e-05, "loss": 0.2377, "mean_token_accuracy": 0.9397767677903175, "num_tokens": 131521087.0, "step": 17750 }, { "entropy": 2.046319001168013, "epoch": 0.2657367377112189, "grad_norm": 0.33829551935195923, "learning_rate": 4.2755401633804075e-05, "loss": 0.2037, "mean_token_accuracy": 0.9449324559420347, "num_tokens": 131597125.0, "step": 17760 }, { "entropy": 2.0328876174986363, "epoch": 0.265886364252723, "grad_norm": 0.31292375922203064, "learning_rate": 4.274694670537033e-05, "loss": 0.2432, "mean_token_accuracy": 0.9418448995798826, "num_tokens": 131670323.0, "step": 17770 }, { "entropy": 2.0468028388917445, "epoch": 0.266035990794227, "grad_norm": 0.3730217516422272, "learning_rate": 4.273848768508771e-05, "loss": 0.2099, "mean_token_accuracy": 0.9489680986851454, "num_tokens": 131742813.0, "step": 17780 }, { "entropy": 2.0350642174482347, "epoch": 0.2661856173357311, "grad_norm": 0.34829699993133545, "learning_rate": 4.273002457491212e-05, "loss": 0.2132, "mean_token_accuracy": 0.9468727346509695, "num_tokens": 131818194.0, "step": 17790 }, { "entropy": 2.0639965884387492, "epoch": 0.2663352438772352, "grad_norm": 0.3347161114215851, "learning_rate": 4.272155737680037e-05, "loss": 0.2329, "mean_token_accuracy": 0.9400759331882, "num_tokens": 131889949.0, "step": 17800 }, { "entropy": 2.011091100424528, "epoch": 0.26648487041873925, "grad_norm": 0.3353201150894165, "learning_rate": 4.271308609271022e-05, "loss": 0.2284, "mean_token_accuracy": 0.942489180713892, "num_tokens": 131965365.0, "step": 17810 }, { "entropy": 2.060721480101347, "epoch": 0.2666344969602433, "grad_norm": 0.3964075744152069, "learning_rate": 4.270461072460039e-05, "loss": 0.2621, "mean_token_accuracy": 0.9336626414209604, "num_tokens": 132036943.0, "step": 17820 }, { "entropy": 2.002261830866337, "epoch": 0.26678412350174735, "grad_norm": 0.38764169812202454, "learning_rate": 4.269613127443054e-05, "loss": 0.2204, "mean_token_accuracy": 0.9458250042051077, "num_tokens": 132111293.0, "step": 17830 }, { "entropy": 2.0242681615054607, "epoch": 0.2669337500432514, "grad_norm": 0.3036015033721924, "learning_rate": 4.268764774416126e-05, "loss": 0.2196, "mean_token_accuracy": 0.9468665599822998, "num_tokens": 132183344.0, "step": 17840 }, { "entropy": 2.0303299449384213, "epoch": 0.2670833765847555, "grad_norm": 0.3105604350566864, "learning_rate": 4.2679160135754086e-05, "loss": 0.2007, "mean_token_accuracy": 0.9504918597638607, "num_tokens": 132255943.0, "step": 17850 }, { "entropy": 2.0628513015806673, "epoch": 0.2672330031262595, "grad_norm": 0.33919087052345276, "learning_rate": 4.267066845117153e-05, "loss": 0.2416, "mean_token_accuracy": 0.9390486862510443, "num_tokens": 132326230.0, "step": 17860 }, { "entropy": 2.00702800899744, "epoch": 0.2673826296677636, "grad_norm": 0.298063725233078, "learning_rate": 4.2662172692377e-05, "loss": 0.2133, "mean_token_accuracy": 0.9463082946836948, "num_tokens": 132402308.0, "step": 17870 }, { "entropy": 1.9925678826868534, "epoch": 0.2675322562092677, "grad_norm": 0.341201514005661, "learning_rate": 4.265367286133487e-05, "loss": 0.2152, "mean_token_accuracy": 0.948339295387268, "num_tokens": 132477042.0, "step": 17880 }, { "entropy": 2.002018129825592, "epoch": 0.26768188275077176, "grad_norm": 0.37781527638435364, "learning_rate": 4.264516896001046e-05, "loss": 0.2227, "mean_token_accuracy": 0.9447626590728759, "num_tokens": 132551960.0, "step": 17890 }, { "entropy": 2.0631848059594633, "epoch": 0.26783150929227584, "grad_norm": 0.3190608322620392, "learning_rate": 4.263666099037001e-05, "loss": 0.2347, "mean_token_accuracy": 0.9401345096528531, "num_tokens": 132624821.0, "step": 17900 }, { "entropy": 2.0559956721961496, "epoch": 0.26798113583377986, "grad_norm": 0.30890265107154846, "learning_rate": 4.262814895438073e-05, "loss": 0.2143, "mean_token_accuracy": 0.9479293666779995, "num_tokens": 132698605.0, "step": 17910 }, { "entropy": 2.078419268131256, "epoch": 0.26813076237528394, "grad_norm": 0.32682353258132935, "learning_rate": 4.2619632854010725e-05, "loss": 0.2226, "mean_token_accuracy": 0.943324676156044, "num_tokens": 132771628.0, "step": 17920 }, { "entropy": 2.0519722640514373, "epoch": 0.268280388916788, "grad_norm": 0.31532716751098633, "learning_rate": 4.261111269122911e-05, "loss": 0.1974, "mean_token_accuracy": 0.9496322073042393, "num_tokens": 132847151.0, "step": 17930 }, { "entropy": 1.9829540766775609, "epoch": 0.2684300154582921, "grad_norm": 0.3580506443977356, "learning_rate": 4.2602588468005874e-05, "loss": 0.2082, "mean_token_accuracy": 0.9499303434044123, "num_tokens": 132923703.0, "step": 17940 }, { "entropy": 2.0283055998384953, "epoch": 0.2685796419997961, "grad_norm": 0.47611668705940247, "learning_rate": 4.259406018631197e-05, "loss": 0.234, "mean_token_accuracy": 0.9415302246809005, "num_tokens": 132998478.0, "step": 17950 }, { "entropy": 2.040881954878569, "epoch": 0.2687292685413002, "grad_norm": 0.30716952681541443, "learning_rate": 4.258552784811929e-05, "loss": 0.23, "mean_token_accuracy": 0.9376135040074587, "num_tokens": 133070068.0, "step": 17960 }, { "entropy": 2.043821970373392, "epoch": 0.26887889508280427, "grad_norm": 0.4280816614627838, "learning_rate": 4.2576991455400655e-05, "loss": 0.2231, "mean_token_accuracy": 0.9450179640203714, "num_tokens": 133145191.0, "step": 17970 }, { "entropy": 2.0277457468211653, "epoch": 0.26902852162430835, "grad_norm": 0.35947221517562866, "learning_rate": 4.2568451010129853e-05, "loss": 0.2235, "mean_token_accuracy": 0.9440630115568638, "num_tokens": 133217884.0, "step": 17980 }, { "entropy": 2.0370886988937853, "epoch": 0.26917814816581237, "grad_norm": 0.2640123665332794, "learning_rate": 4.255990651428156e-05, "loss": 0.2191, "mean_token_accuracy": 0.9457904122769832, "num_tokens": 133292399.0, "step": 17990 }, { "entropy": 2.0545321866869926, "epoch": 0.26932777470731645, "grad_norm": 0.40209871530532837, "learning_rate": 4.2551357969831437e-05, "loss": 0.216, "mean_token_accuracy": 0.945240993052721, "num_tokens": 133369999.0, "step": 18000 }, { "epoch": 0.26932777470731645, "eval_entropy": 2.032932476854324, "eval_loss": 0.2456362247467041, "eval_mean_token_accuracy": 0.9449632157921791, "eval_num_tokens": 133369999.0, "eval_runtime": 543.1241, "eval_samples_per_second": 36.824, "eval_steps_per_second": 9.206, "step": 18000 }, { "entropy": 2.0408055007457735, "epoch": 0.2694774012488205, "grad_norm": 0.3894859850406647, "learning_rate": 4.254280537875605e-05, "loss": 0.224, "mean_token_accuracy": 0.945162595808506, "num_tokens": 133444279.0, "step": 18010 }, { "entropy": 2.040571527183056, "epoch": 0.2696270277903246, "grad_norm": 0.3294428884983063, "learning_rate": 4.253424874303291e-05, "loss": 0.2138, "mean_token_accuracy": 0.9471924025565386, "num_tokens": 133516898.0, "step": 18020 }, { "entropy": 2.025993775576353, "epoch": 0.2697766543318286, "grad_norm": 0.2972036600112915, "learning_rate": 4.2525688064640464e-05, "loss": 0.2131, "mean_token_accuracy": 0.9465685278177262, "num_tokens": 133590262.0, "step": 18030 }, { "entropy": 2.0547771252691747, "epoch": 0.2699262808733327, "grad_norm": 0.3184581995010376, "learning_rate": 4.251712334555809e-05, "loss": 0.2077, "mean_token_accuracy": 0.9474600825458765, "num_tokens": 133664812.0, "step": 18040 }, { "entropy": 2.072434861212969, "epoch": 0.2700759074148368, "grad_norm": 0.401377409696579, "learning_rate": 4.2508554587766105e-05, "loss": 0.1998, "mean_token_accuracy": 0.9504003830254077, "num_tokens": 133742279.0, "step": 18050 }, { "entropy": 2.0875652648508547, "epoch": 0.27022553395634086, "grad_norm": 0.3234099745750427, "learning_rate": 4.249998179324577e-05, "loss": 0.2458, "mean_token_accuracy": 0.9395138043910265, "num_tokens": 133815216.0, "step": 18060 }, { "entropy": 2.0594569988548757, "epoch": 0.27037516049784494, "grad_norm": 0.2818845510482788, "learning_rate": 4.249140496397925e-05, "loss": 0.2098, "mean_token_accuracy": 0.9482460029423236, "num_tokens": 133888788.0, "step": 18070 }, { "entropy": 2.0344219408929347, "epoch": 0.27052478703934896, "grad_norm": 0.34061676263809204, "learning_rate": 4.248282410194967e-05, "loss": 0.2106, "mean_token_accuracy": 0.9489198680967093, "num_tokens": 133962592.0, "step": 18080 }, { "entropy": 2.0163093373179435, "epoch": 0.27067441358085303, "grad_norm": 0.4497212767601013, "learning_rate": 4.2474239209141075e-05, "loss": 0.2269, "mean_token_accuracy": 0.9442314021289349, "num_tokens": 134036851.0, "step": 18090 }, { "entropy": 2.017015743255615, "epoch": 0.2708240401223571, "grad_norm": 0.3502942621707916, "learning_rate": 4.246565028753845e-05, "loss": 0.2075, "mean_token_accuracy": 0.9471006710082293, "num_tokens": 134110631.0, "step": 18100 }, { "entropy": 2.0393383227288724, "epoch": 0.2709736666638612, "grad_norm": 0.37357452511787415, "learning_rate": 4.2457057339127705e-05, "loss": 0.2237, "mean_token_accuracy": 0.9457779925316572, "num_tokens": 134184413.0, "step": 18110 }, { "entropy": 2.0620221897959707, "epoch": 0.2711232932053652, "grad_norm": 0.3612636923789978, "learning_rate": 4.244846036589567e-05, "loss": 0.2123, "mean_token_accuracy": 0.9476705510169268, "num_tokens": 134258957.0, "step": 18120 }, { "entropy": 2.0866783775389193, "epoch": 0.2712729197468693, "grad_norm": 0.294169157743454, "learning_rate": 4.243985936983013e-05, "loss": 0.228, "mean_token_accuracy": 0.9419513683766126, "num_tokens": 134333576.0, "step": 18130 }, { "entropy": 2.037560198456049, "epoch": 0.27142254628837337, "grad_norm": 0.3890853524208069, "learning_rate": 4.243125435291979e-05, "loss": 0.2172, "mean_token_accuracy": 0.9462948691099882, "num_tokens": 134407346.0, "step": 18140 }, { "entropy": 2.0153480976819993, "epoch": 0.27157217282987745, "grad_norm": 0.2998529374599457, "learning_rate": 4.242264531715428e-05, "loss": 0.2004, "mean_token_accuracy": 0.9478793989866972, "num_tokens": 134483911.0, "step": 18150 }, { "entropy": 2.03355066254735, "epoch": 0.27172179937138147, "grad_norm": 0.4071115255355835, "learning_rate": 4.241403226452416e-05, "loss": 0.2209, "mean_token_accuracy": 0.9447440791875124, "num_tokens": 134558075.0, "step": 18160 }, { "entropy": 2.03444909080863, "epoch": 0.27187142591288554, "grad_norm": 0.29406195878982544, "learning_rate": 4.240541519702092e-05, "loss": 0.2419, "mean_token_accuracy": 0.9405380580574274, "num_tokens": 134633426.0, "step": 18170 }, { "entropy": 2.06948067471385, "epoch": 0.2720210524543896, "grad_norm": 0.32778263092041016, "learning_rate": 4.2396794116636976e-05, "loss": 0.2009, "mean_token_accuracy": 0.948231928795576, "num_tokens": 134707687.0, "step": 18180 }, { "entropy": 2.0545158363878726, "epoch": 0.2721706789958937, "grad_norm": 0.3893728256225586, "learning_rate": 4.23881690253657e-05, "loss": 0.2297, "mean_token_accuracy": 0.9450697984546423, "num_tokens": 134780320.0, "step": 18190 }, { "entropy": 2.0420808009803295, "epoch": 0.2723203055373978, "grad_norm": 0.40593183040618896, "learning_rate": 4.237953992520133e-05, "loss": 0.2294, "mean_token_accuracy": 0.9433854795992375, "num_tokens": 134853971.0, "step": 18200 }, { "entropy": 2.0449700109660625, "epoch": 0.2724699320789018, "grad_norm": 0.3766489624977112, "learning_rate": 4.237090681813909e-05, "loss": 0.2188, "mean_token_accuracy": 0.9448163963854312, "num_tokens": 134927865.0, "step": 18210 }, { "entropy": 2.0795838005840777, "epoch": 0.2726195586204059, "grad_norm": 0.43642085790634155, "learning_rate": 4.23622697061751e-05, "loss": 0.2316, "mean_token_accuracy": 0.94608996771276, "num_tokens": 135001022.0, "step": 18220 }, { "entropy": 2.0937659993767737, "epoch": 0.27276918516190996, "grad_norm": 0.2979442775249481, "learning_rate": 4.235362859130642e-05, "loss": 0.2174, "mean_token_accuracy": 0.9440000209957361, "num_tokens": 135078012.0, "step": 18230 }, { "entropy": 2.0923197217285634, "epoch": 0.27291881170341403, "grad_norm": 0.44040948152542114, "learning_rate": 4.234498347553103e-05, "loss": 0.2419, "mean_token_accuracy": 0.9399584282189608, "num_tokens": 135151736.0, "step": 18240 }, { "entropy": 2.0501592487096785, "epoch": 0.27306843824491805, "grad_norm": 0.36849233508110046, "learning_rate": 4.233633436084783e-05, "loss": 0.2146, "mean_token_accuracy": 0.9465037569403648, "num_tokens": 135227001.0, "step": 18250 }, { "entropy": 2.032037995010614, "epoch": 0.27321806478642213, "grad_norm": 0.3081227242946625, "learning_rate": 4.232768124925664e-05, "loss": 0.2139, "mean_token_accuracy": 0.9465609356760979, "num_tokens": 135302010.0, "step": 18260 }, { "entropy": 2.041413481533527, "epoch": 0.2733676913279262, "grad_norm": 0.3574448227882385, "learning_rate": 4.231902414275824e-05, "loss": 0.212, "mean_token_accuracy": 0.9455951485782862, "num_tokens": 135375800.0, "step": 18270 }, { "entropy": 2.0589251168072225, "epoch": 0.2735173178694303, "grad_norm": 0.341811865568161, "learning_rate": 4.2310363043354276e-05, "loss": 0.2125, "mean_token_accuracy": 0.9483492769300937, "num_tokens": 135450070.0, "step": 18280 }, { "entropy": 2.110490904003382, "epoch": 0.2736669444109343, "grad_norm": 0.35117724537849426, "learning_rate": 4.230169795304737e-05, "loss": 0.241, "mean_token_accuracy": 0.9425245705991984, "num_tokens": 135521763.0, "step": 18290 }, { "entropy": 2.0464411430060863, "epoch": 0.2738165709524384, "grad_norm": 0.4113922119140625, "learning_rate": 4.229302887384103e-05, "loss": 0.2154, "mean_token_accuracy": 0.9458016745746136, "num_tokens": 135594041.0, "step": 18300 }, { "entropy": 2.062289177626371, "epoch": 0.27396619749394246, "grad_norm": 0.5518506765365601, "learning_rate": 4.2284355807739714e-05, "loss": 0.2335, "mean_token_accuracy": 0.941171970590949, "num_tokens": 135668386.0, "step": 18310 }, { "entropy": 2.078730411082506, "epoch": 0.27411582403544654, "grad_norm": 0.36489707231521606, "learning_rate": 4.227567875674878e-05, "loss": 0.2504, "mean_token_accuracy": 0.9422944277524948, "num_tokens": 135742681.0, "step": 18320 }, { "entropy": 2.1214917838573455, "epoch": 0.2742654505769506, "grad_norm": 0.36626705527305603, "learning_rate": 4.2266997722874525e-05, "loss": 0.222, "mean_token_accuracy": 0.9441429376602173, "num_tokens": 135817804.0, "step": 18330 }, { "entropy": 2.09757549315691, "epoch": 0.27441507711845464, "grad_norm": 0.3245505392551422, "learning_rate": 4.225831270812414e-05, "loss": 0.2428, "mean_token_accuracy": 0.9402012165635825, "num_tokens": 135892332.0, "step": 18340 }, { "entropy": 2.079206131398678, "epoch": 0.2745647036599587, "grad_norm": 0.38551098108291626, "learning_rate": 4.2249623714505785e-05, "loss": 0.2348, "mean_token_accuracy": 0.9424356084316969, "num_tokens": 135964909.0, "step": 18350 }, { "entropy": 2.0848313689231874, "epoch": 0.2747143302014628, "grad_norm": 0.4020768404006958, "learning_rate": 4.224093074402849e-05, "loss": 0.225, "mean_token_accuracy": 0.9437496196478605, "num_tokens": 136036134.0, "step": 18360 }, { "entropy": 2.0565269708633425, "epoch": 0.2748639567429669, "grad_norm": 0.3413435220718384, "learning_rate": 4.223223379870222e-05, "loss": 0.228, "mean_token_accuracy": 0.9418129827827215, "num_tokens": 136111376.0, "step": 18370 }, { "entropy": 2.062454446405172, "epoch": 0.2750135832844709, "grad_norm": 0.3518320322036743, "learning_rate": 4.222353288053788e-05, "loss": 0.2082, "mean_token_accuracy": 0.9461835123598575, "num_tokens": 136184642.0, "step": 18380 }, { "entropy": 2.07863834425807, "epoch": 0.275163209825975, "grad_norm": 0.4114658236503601, "learning_rate": 4.2214827991547266e-05, "loss": 0.2464, "mean_token_accuracy": 0.9394934225827456, "num_tokens": 136255251.0, "step": 18390 }, { "entropy": 2.062755359709263, "epoch": 0.27531283636747905, "grad_norm": 0.42160865664482117, "learning_rate": 4.220611913374311e-05, "loss": 0.2367, "mean_token_accuracy": 0.9423040580004454, "num_tokens": 136327673.0, "step": 18400 }, { "entropy": 2.052606646716595, "epoch": 0.27546246290898313, "grad_norm": 0.44263756275177, "learning_rate": 4.219740630913904e-05, "loss": 0.2339, "mean_token_accuracy": 0.941598741710186, "num_tokens": 136399657.0, "step": 18410 }, { "entropy": 2.0223962023854254, "epoch": 0.27561208945048715, "grad_norm": 0.3220590353012085, "learning_rate": 4.2188689519749636e-05, "loss": 0.2248, "mean_token_accuracy": 0.9472240276634694, "num_tokens": 136474705.0, "step": 18420 }, { "entropy": 2.0413773842155933, "epoch": 0.27576171599199123, "grad_norm": 0.3709854483604431, "learning_rate": 4.217996876759037e-05, "loss": 0.2101, "mean_token_accuracy": 0.9452756538987159, "num_tokens": 136549061.0, "step": 18430 }, { "entropy": 2.0624384708702563, "epoch": 0.2759113425334953, "grad_norm": 0.2936898469924927, "learning_rate": 4.217124405467762e-05, "loss": 0.2287, "mean_token_accuracy": 0.9419232547283173, "num_tokens": 136626400.0, "step": 18440 }, { "entropy": 2.0403049543499945, "epoch": 0.2760609690749994, "grad_norm": 0.37017953395843506, "learning_rate": 4.21625153830287e-05, "loss": 0.2145, "mean_token_accuracy": 0.9463361319154501, "num_tokens": 136703152.0, "step": 18450 }, { "entropy": 2.0422281220555307, "epoch": 0.2762105956165034, "grad_norm": 0.3478231728076935, "learning_rate": 4.215378275466185e-05, "loss": 0.238, "mean_token_accuracy": 0.9414387229830027, "num_tokens": 136775701.0, "step": 18460 }, { "entropy": 2.027935326844454, "epoch": 0.2763602221580075, "grad_norm": 0.3442736864089966, "learning_rate": 4.21450461715962e-05, "loss": 0.1898, "mean_token_accuracy": 0.9508050210773945, "num_tokens": 136850589.0, "step": 18470 }, { "entropy": 1.9965142816305161, "epoch": 0.27650984869951156, "grad_norm": 0.2997758090496063, "learning_rate": 4.2136305635851796e-05, "loss": 0.2033, "mean_token_accuracy": 0.9486421305686236, "num_tokens": 136926048.0, "step": 18480 }, { "entropy": 1.9957321412861346, "epoch": 0.27665947524101564, "grad_norm": 0.31858164072036743, "learning_rate": 4.2127561149449605e-05, "loss": 0.221, "mean_token_accuracy": 0.942990842834115, "num_tokens": 137002238.0, "step": 18490 }, { "entropy": 2.0288641512393952, "epoch": 0.2768091017825197, "grad_norm": 0.4636212885379791, "learning_rate": 4.211881271441153e-05, "loss": 0.2407, "mean_token_accuracy": 0.9436327964067459, "num_tokens": 137076318.0, "step": 18500 }, { "entropy": 2.0751604810357094, "epoch": 0.27695872832402374, "grad_norm": 0.3495842516422272, "learning_rate": 4.2110060332760335e-05, "loss": 0.2663, "mean_token_accuracy": 0.9383338689804077, "num_tokens": 137149302.0, "step": 18510 }, { "entropy": 2.077486325800419, "epoch": 0.2771083548655278, "grad_norm": 0.38012605905532837, "learning_rate": 4.2101304006519735e-05, "loss": 0.2166, "mean_token_accuracy": 0.9448123019188642, "num_tokens": 137223791.0, "step": 18520 }, { "entropy": 2.0725693568587302, "epoch": 0.2772579814070319, "grad_norm": 0.3547988831996918, "learning_rate": 4.209254373771437e-05, "loss": 0.2074, "mean_token_accuracy": 0.9450439121574163, "num_tokens": 137296985.0, "step": 18530 }, { "entropy": 2.0524710163474085, "epoch": 0.277407607948536, "grad_norm": 0.37117061018943787, "learning_rate": 4.208377952836974e-05, "loss": 0.2172, "mean_token_accuracy": 0.9486215464770794, "num_tokens": 137371610.0, "step": 18540 }, { "entropy": 2.0582168929278852, "epoch": 0.27755723449004, "grad_norm": 0.36203354597091675, "learning_rate": 4.207501138051231e-05, "loss": 0.2268, "mean_token_accuracy": 0.9440382104367018, "num_tokens": 137447076.0, "step": 18550 }, { "entropy": 2.025244905799627, "epoch": 0.27770686103154407, "grad_norm": 0.3644031584262848, "learning_rate": 4.2066239296169414e-05, "loss": 0.2129, "mean_token_accuracy": 0.9462102502584457, "num_tokens": 137522208.0, "step": 18560 }, { "entropy": 2.0489648029208185, "epoch": 0.27785648757304815, "grad_norm": 0.35710328817367554, "learning_rate": 4.205746327736932e-05, "loss": 0.2322, "mean_token_accuracy": 0.9408591013401747, "num_tokens": 137593526.0, "step": 18570 }, { "entropy": 2.0361582323908807, "epoch": 0.2780061141145522, "grad_norm": 0.38068822026252747, "learning_rate": 4.20486833261412e-05, "loss": 0.213, "mean_token_accuracy": 0.9474812593311072, "num_tokens": 137667469.0, "step": 18580 }, { "entropy": 2.0413844235241414, "epoch": 0.27815574065605625, "grad_norm": 0.3494391143321991, "learning_rate": 4.2039899444515147e-05, "loss": 0.2111, "mean_token_accuracy": 0.9445367429405451, "num_tokens": 137742002.0, "step": 18590 }, { "entropy": 2.0514455653727053, "epoch": 0.2783053671975603, "grad_norm": 0.35180479288101196, "learning_rate": 4.2031111634522133e-05, "loss": 0.2501, "mean_token_accuracy": 0.9396644573658705, "num_tokens": 137814318.0, "step": 18600 }, { "entropy": 2.043489322066307, "epoch": 0.2784549937390644, "grad_norm": 0.3107980489730835, "learning_rate": 4.2022319898194054e-05, "loss": 0.225, "mean_token_accuracy": 0.9448707785457373, "num_tokens": 137892345.0, "step": 18610 }, { "entropy": 2.038166705518961, "epoch": 0.2786046202805685, "grad_norm": 0.3189834654331207, "learning_rate": 4.201352423756373e-05, "loss": 0.2249, "mean_token_accuracy": 0.9463358268141746, "num_tokens": 137967334.0, "step": 18620 }, { "entropy": 2.0123340927064417, "epoch": 0.27875424682207256, "grad_norm": 0.35150328278541565, "learning_rate": 4.2004724654664874e-05, "loss": 0.2139, "mean_token_accuracy": 0.9487344469875097, "num_tokens": 138039431.0, "step": 18630 }, { "entropy": 2.0151193886995316, "epoch": 0.2789038733635766, "grad_norm": 0.3368518352508545, "learning_rate": 4.199592115153209e-05, "loss": 0.2244, "mean_token_accuracy": 0.9443730127066374, "num_tokens": 138114386.0, "step": 18640 }, { "entropy": 2.016951708495617, "epoch": 0.27905349990508066, "grad_norm": 0.38006192445755005, "learning_rate": 4.198711373020092e-05, "loss": 0.2429, "mean_token_accuracy": 0.9414054803550244, "num_tokens": 138187157.0, "step": 18650 }, { "entropy": 2.0137404680252073, "epoch": 0.27920312644658474, "grad_norm": 0.3471709191799164, "learning_rate": 4.1978302392707795e-05, "loss": 0.2467, "mean_token_accuracy": 0.9362635936588048, "num_tokens": 138261052.0, "step": 18660 }, { "entropy": 2.0529631271958353, "epoch": 0.2793527529880888, "grad_norm": 0.36627161502838135, "learning_rate": 4.1969487141090044e-05, "loss": 0.2332, "mean_token_accuracy": 0.9440194319933652, "num_tokens": 138334014.0, "step": 18670 }, { "entropy": 2.0277971342206, "epoch": 0.27950237952959284, "grad_norm": 0.3198646008968353, "learning_rate": 4.1960667977385906e-05, "loss": 0.2178, "mean_token_accuracy": 0.9469820514321328, "num_tokens": 138408076.0, "step": 18680 }, { "entropy": 2.0425813741981984, "epoch": 0.2796520060710969, "grad_norm": 0.39036881923675537, "learning_rate": 4.195184490363455e-05, "loss": 0.2127, "mean_token_accuracy": 0.9463781978935003, "num_tokens": 138484654.0, "step": 18690 }, { "entropy": 2.0550139889121057, "epoch": 0.279801632612601, "grad_norm": 0.4529547095298767, "learning_rate": 4.194301792187602e-05, "loss": 0.2175, "mean_token_accuracy": 0.9451748415827751, "num_tokens": 138557827.0, "step": 18700 }, { "entropy": 2.0668136782944204, "epoch": 0.27995125915410507, "grad_norm": 0.3962840437889099, "learning_rate": 4.1934187034151264e-05, "loss": 0.2214, "mean_token_accuracy": 0.9478241514414549, "num_tokens": 138629774.0, "step": 18710 }, { "entropy": 2.0423460379242897, "epoch": 0.2801008856956091, "grad_norm": 0.3541772961616516, "learning_rate": 4.192535224250213e-05, "loss": 0.2213, "mean_token_accuracy": 0.94769446849823, "num_tokens": 138703439.0, "step": 18720 }, { "entropy": 2.0338203951716425, "epoch": 0.28025051223711317, "grad_norm": 0.3149760961532593, "learning_rate": 4.191651354897141e-05, "loss": 0.2266, "mean_token_accuracy": 0.945298059284687, "num_tokens": 138778466.0, "step": 18730 }, { "entropy": 2.042553113400936, "epoch": 0.28040013877861725, "grad_norm": 0.43838343024253845, "learning_rate": 4.190767095560273e-05, "loss": 0.2119, "mean_token_accuracy": 0.9468694549053908, "num_tokens": 138854163.0, "step": 18740 }, { "entropy": 2.0193994611501696, "epoch": 0.2805497653201213, "grad_norm": 0.3140980899333954, "learning_rate": 4.1898824464440686e-05, "loss": 0.2029, "mean_token_accuracy": 0.9491469334810972, "num_tokens": 138928915.0, "step": 18750 }, { "entropy": 2.026965218037367, "epoch": 0.28069939186162535, "grad_norm": 0.38596779108047485, "learning_rate": 4.188997407753073e-05, "loss": 0.2284, "mean_token_accuracy": 0.9461881373077631, "num_tokens": 139000526.0, "step": 18760 }, { "entropy": 2.0746323578059673, "epoch": 0.2808490184031294, "grad_norm": 0.35778096318244934, "learning_rate": 4.1881119796919225e-05, "loss": 0.2024, "mean_token_accuracy": 0.9499216876924038, "num_tokens": 139077104.0, "step": 18770 }, { "entropy": 2.0472045801579952, "epoch": 0.2809986449446335, "grad_norm": 0.31523221731185913, "learning_rate": 4.1872261624653455e-05, "loss": 0.2235, "mean_token_accuracy": 0.9433153495192528, "num_tokens": 139152257.0, "step": 18780 }, { "entropy": 2.0438988633453845, "epoch": 0.2811482714861376, "grad_norm": 0.3384609818458557, "learning_rate": 4.186339956278157e-05, "loss": 0.2129, "mean_token_accuracy": 0.9469064172357321, "num_tokens": 139224851.0, "step": 18790 }, { "entropy": 2.0316933512687685, "epoch": 0.28129789802764166, "grad_norm": 0.34056273102760315, "learning_rate": 4.185453361335264e-05, "loss": 0.2253, "mean_token_accuracy": 0.9431099519133568, "num_tokens": 139299366.0, "step": 18800 }, { "entropy": 2.0515247009694577, "epoch": 0.2814475245691457, "grad_norm": 0.36333808302879333, "learning_rate": 4.184566377841664e-05, "loss": 0.2164, "mean_token_accuracy": 0.9453124329447746, "num_tokens": 139372178.0, "step": 18810 }, { "entropy": 2.084352830797434, "epoch": 0.28159715111064976, "grad_norm": 0.4016410708427429, "learning_rate": 4.183679006002441e-05, "loss": 0.2198, "mean_token_accuracy": 0.946783883869648, "num_tokens": 139444690.0, "step": 18820 }, { "entropy": 2.064262942224741, "epoch": 0.28174677765215383, "grad_norm": 0.3707505762577057, "learning_rate": 4.182791246022774e-05, "loss": 0.2202, "mean_token_accuracy": 0.9474179904907942, "num_tokens": 139521546.0, "step": 18830 }, { "entropy": 2.061519002914429, "epoch": 0.2818964041936579, "grad_norm": 0.3917161524295807, "learning_rate": 4.1819030981079275e-05, "loss": 0.2241, "mean_token_accuracy": 0.9425201997160911, "num_tokens": 139593497.0, "step": 18840 }, { "entropy": 1.9889956191182137, "epoch": 0.28204603073516193, "grad_norm": 0.3814077377319336, "learning_rate": 4.181014562463257e-05, "loss": 0.1945, "mean_token_accuracy": 0.9537968579679728, "num_tokens": 139668834.0, "step": 18850 }, { "entropy": 2.024089213460684, "epoch": 0.282195657276666, "grad_norm": 0.3451828956604004, "learning_rate": 4.180125639294209e-05, "loss": 0.2516, "mean_token_accuracy": 0.9386969532817602, "num_tokens": 139740687.0, "step": 18860 }, { "entropy": 2.044738408178091, "epoch": 0.2823452838181701, "grad_norm": 0.31049394607543945, "learning_rate": 4.179236328806317e-05, "loss": 0.216, "mean_token_accuracy": 0.9456838808953762, "num_tokens": 139814297.0, "step": 18870 }, { "entropy": 2.023719023913145, "epoch": 0.28249491035967417, "grad_norm": 0.34184572100639343, "learning_rate": 4.178346631205205e-05, "loss": 0.2166, "mean_token_accuracy": 0.9460842613130808, "num_tokens": 139886065.0, "step": 18880 }, { "entropy": 2.013763380795717, "epoch": 0.2826445369011782, "grad_norm": 0.3594011664390564, "learning_rate": 4.177456546696588e-05, "loss": 0.2154, "mean_token_accuracy": 0.9472302999347448, "num_tokens": 139958509.0, "step": 18890 }, { "entropy": 2.0229734420776366, "epoch": 0.28279416344268227, "grad_norm": 0.36598172783851624, "learning_rate": 4.176566075486269e-05, "loss": 0.217, "mean_token_accuracy": 0.9460081171244383, "num_tokens": 140032110.0, "step": 18900 }, { "entropy": 2.0380223214626314, "epoch": 0.28294378998418634, "grad_norm": 0.38212352991104126, "learning_rate": 4.175675217780141e-05, "loss": 0.2116, "mean_token_accuracy": 0.9459437381476163, "num_tokens": 140106692.0, "step": 18910 }, { "entropy": 2.0251020193099976, "epoch": 0.2830934165256904, "grad_norm": 0.39991524815559387, "learning_rate": 4.174783973784186e-05, "loss": 0.2202, "mean_token_accuracy": 0.9422227840870618, "num_tokens": 140180597.0, "step": 18920 }, { "entropy": 2.0390100069344044, "epoch": 0.2832430430671945, "grad_norm": 0.3565160930156708, "learning_rate": 4.173892343704475e-05, "loss": 0.2244, "mean_token_accuracy": 0.9423737730830908, "num_tokens": 140251960.0, "step": 18930 }, { "entropy": 1.9707071863114833, "epoch": 0.2833926696086985, "grad_norm": 0.3760647773742676, "learning_rate": 4.173000327747169e-05, "loss": 0.2093, "mean_token_accuracy": 0.9497558526694775, "num_tokens": 140327146.0, "step": 18940 }, { "entropy": 1.9672926016151906, "epoch": 0.2835422961502026, "grad_norm": 0.36126407980918884, "learning_rate": 4.172107926118519e-05, "loss": 0.2129, "mean_token_accuracy": 0.9462910059839487, "num_tokens": 140401937.0, "step": 18950 }, { "entropy": 1.979753314703703, "epoch": 0.2836919226917067, "grad_norm": 0.3449506461620331, "learning_rate": 4.171215139024864e-05, "loss": 0.2241, "mean_token_accuracy": 0.9444792300462723, "num_tokens": 140477295.0, "step": 18960 }, { "entropy": 1.9834757447242737, "epoch": 0.28384154923321075, "grad_norm": 0.41755038499832153, "learning_rate": 4.1703219666726293e-05, "loss": 0.2202, "mean_token_accuracy": 0.944455549493432, "num_tokens": 140549920.0, "step": 18970 }, { "entropy": 1.9919896595180036, "epoch": 0.2839911757747148, "grad_norm": 0.38521695137023926, "learning_rate": 4.1694284092683356e-05, "loss": 0.2355, "mean_token_accuracy": 0.9443584073334932, "num_tokens": 140623353.0, "step": 18980 }, { "entropy": 2.015780097991228, "epoch": 0.28414080231621885, "grad_norm": 0.34652242064476013, "learning_rate": 4.1685344670185884e-05, "loss": 0.2294, "mean_token_accuracy": 0.9450482990592718, "num_tokens": 140696112.0, "step": 18990 }, { "entropy": 2.0005426786839964, "epoch": 0.28429042885772293, "grad_norm": 0.2863911986351013, "learning_rate": 4.167640140130082e-05, "loss": 0.218, "mean_token_accuracy": 0.9479904975742102, "num_tokens": 140768181.0, "step": 19000 }, { "epoch": 0.28429042885772293, "eval_entropy": 2.02031144156456, "eval_loss": 0.24498778581619263, "eval_mean_token_accuracy": 0.9452503816246987, "eval_num_tokens": 140768181.0, "eval_runtime": 555.3498, "eval_samples_per_second": 36.013, "eval_steps_per_second": 9.003, "step": 19000 }, { "entropy": 2.027205886691809, "epoch": 0.284440055399227, "grad_norm": 0.2785838842391968, "learning_rate": 4.166745428809601e-05, "loss": 0.2167, "mean_token_accuracy": 0.9448889102786779, "num_tokens": 140842749.0, "step": 19010 }, { "entropy": 2.0289974197745324, "epoch": 0.28458968194073103, "grad_norm": 0.3426930606365204, "learning_rate": 4.16585033326402e-05, "loss": 0.2266, "mean_token_accuracy": 0.941736264154315, "num_tokens": 140914934.0, "step": 19020 }, { "entropy": 1.997819370776415, "epoch": 0.2847393084822351, "grad_norm": 0.5024489164352417, "learning_rate": 4.1649548537003005e-05, "loss": 0.2191, "mean_token_accuracy": 0.9462288957089185, "num_tokens": 140989704.0, "step": 19030 }, { "entropy": 1.9965325437486172, "epoch": 0.2848889350237392, "grad_norm": 0.3459457457065582, "learning_rate": 4.164058990325493e-05, "loss": 0.2339, "mean_token_accuracy": 0.940864809602499, "num_tokens": 141065113.0, "step": 19040 }, { "entropy": 1.998188631236553, "epoch": 0.28503856156524326, "grad_norm": 0.32374563813209534, "learning_rate": 4.163162743346735e-05, "loss": 0.2124, "mean_token_accuracy": 0.9461703088134528, "num_tokens": 141137665.0, "step": 19050 }, { "entropy": 2.0321890391409396, "epoch": 0.28518818810674734, "grad_norm": 0.2236821949481964, "learning_rate": 4.1622661129712576e-05, "loss": 0.2274, "mean_token_accuracy": 0.9446377016603946, "num_tokens": 141215825.0, "step": 19060 }, { "entropy": 2.031581325083971, "epoch": 0.28533781464825136, "grad_norm": 0.37125664949417114, "learning_rate": 4.161369099406376e-05, "loss": 0.2155, "mean_token_accuracy": 0.9467072561383247, "num_tokens": 141291748.0, "step": 19070 }, { "entropy": 1.9868048392236233, "epoch": 0.28548744118975544, "grad_norm": 0.43177497386932373, "learning_rate": 4.160471702859498e-05, "loss": 0.2097, "mean_token_accuracy": 0.9499659389257431, "num_tokens": 141368464.0, "step": 19080 }, { "entropy": 2.0178396977484225, "epoch": 0.2856370677312595, "grad_norm": 0.38260743021965027, "learning_rate": 4.159573923538115e-05, "loss": 0.2276, "mean_token_accuracy": 0.9464736625552177, "num_tokens": 141440329.0, "step": 19090 }, { "entropy": 2.003493504971266, "epoch": 0.2857866942727636, "grad_norm": 0.38395771384239197, "learning_rate": 4.158675761649812e-05, "loss": 0.2209, "mean_token_accuracy": 0.9464287050068378, "num_tokens": 141516321.0, "step": 19100 }, { "entropy": 2.045782498270273, "epoch": 0.2859363208142676, "grad_norm": 0.39461347460746765, "learning_rate": 4.1577772174022564e-05, "loss": 0.2319, "mean_token_accuracy": 0.9423138335347175, "num_tokens": 141592988.0, "step": 19110 }, { "entropy": 1.9975715763866901, "epoch": 0.2860859473557717, "grad_norm": 0.3696184754371643, "learning_rate": 4.156878291003211e-05, "loss": 0.2244, "mean_token_accuracy": 0.9454155080020428, "num_tokens": 141668219.0, "step": 19120 }, { "entropy": 1.9911875426769257, "epoch": 0.2862355738972758, "grad_norm": 0.3416394591331482, "learning_rate": 4.155978982660522e-05, "loss": 0.2092, "mean_token_accuracy": 0.947189799323678, "num_tokens": 141741721.0, "step": 19130 }, { "entropy": 2.0163810029625893, "epoch": 0.28638520043877985, "grad_norm": 0.3842177391052246, "learning_rate": 4.155079292582126e-05, "loss": 0.2259, "mean_token_accuracy": 0.9443196214735508, "num_tokens": 141815139.0, "step": 19140 }, { "entropy": 2.0187873542308807, "epoch": 0.2865348269802839, "grad_norm": 0.4396173059940338, "learning_rate": 4.154179220976048e-05, "loss": 0.2246, "mean_token_accuracy": 0.943511925637722, "num_tokens": 141889709.0, "step": 19150 }, { "entropy": 2.0159444510936737, "epoch": 0.28668445352178795, "grad_norm": 0.30550047755241394, "learning_rate": 4.153278768050399e-05, "loss": 0.2235, "mean_token_accuracy": 0.9404990077018738, "num_tokens": 141964485.0, "step": 19160 }, { "entropy": 1.9971608579158784, "epoch": 0.28683408006329203, "grad_norm": 0.363066166639328, "learning_rate": 4.1523779340133805e-05, "loss": 0.2359, "mean_token_accuracy": 0.9444653902202844, "num_tokens": 142038962.0, "step": 19170 }, { "entropy": 1.9893890514969825, "epoch": 0.2869837066047961, "grad_norm": 0.3109620213508606, "learning_rate": 4.151476719073282e-05, "loss": 0.2084, "mean_token_accuracy": 0.9501341089606286, "num_tokens": 142114536.0, "step": 19180 }, { "entropy": 2.00932981967926, "epoch": 0.28713333314630013, "grad_norm": 0.3176131546497345, "learning_rate": 4.150575123438479e-05, "loss": 0.2107, "mean_token_accuracy": 0.945628322660923, "num_tokens": 142192272.0, "step": 19190 }, { "entropy": 2.0379151582717894, "epoch": 0.2872829596878042, "grad_norm": 0.3827197849750519, "learning_rate": 4.149673147317437e-05, "loss": 0.2179, "mean_token_accuracy": 0.9455595865845681, "num_tokens": 142268136.0, "step": 19200 }, { "entropy": 2.003543919324875, "epoch": 0.2874325862293083, "grad_norm": 0.39703768491744995, "learning_rate": 4.14877079091871e-05, "loss": 0.2263, "mean_token_accuracy": 0.9420764662325383, "num_tokens": 142342846.0, "step": 19210 }, { "entropy": 2.002555912733078, "epoch": 0.28758221277081236, "grad_norm": 0.3634537160396576, "learning_rate": 4.1478680544509375e-05, "loss": 0.2184, "mean_token_accuracy": 0.9474540788680315, "num_tokens": 142419379.0, "step": 19220 }, { "entropy": 1.9828537493944167, "epoch": 0.28773183931231644, "grad_norm": 0.3495555818080902, "learning_rate": 4.146964938122849e-05, "loss": 0.223, "mean_token_accuracy": 0.946489142999053, "num_tokens": 142493843.0, "step": 19230 }, { "entropy": 1.9926489010453223, "epoch": 0.28788146585382046, "grad_norm": 0.3554561734199524, "learning_rate": 4.146061442143261e-05, "loss": 0.2413, "mean_token_accuracy": 0.9429801497608423, "num_tokens": 142568613.0, "step": 19240 }, { "entropy": 2.076005844771862, "epoch": 0.28803109239532454, "grad_norm": 0.4142340421676636, "learning_rate": 4.145157566721077e-05, "loss": 0.2293, "mean_token_accuracy": 0.9413616731762886, "num_tokens": 142639524.0, "step": 19250 }, { "entropy": 2.0507871650159357, "epoch": 0.2881807189368286, "grad_norm": 0.40420281887054443, "learning_rate": 4.14425331206529e-05, "loss": 0.2396, "mean_token_accuracy": 0.941462367027998, "num_tokens": 142714303.0, "step": 19260 }, { "entropy": 1.9908677011728286, "epoch": 0.2883303454783327, "grad_norm": 0.33306199312210083, "learning_rate": 4.1433486783849796e-05, "loss": 0.2081, "mean_token_accuracy": 0.9449459314346313, "num_tokens": 142791991.0, "step": 19270 }, { "entropy": 2.0439110986888407, "epoch": 0.2884799720198367, "grad_norm": 0.39535558223724365, "learning_rate": 4.1424436658893134e-05, "loss": 0.2276, "mean_token_accuracy": 0.9424667019397021, "num_tokens": 142867304.0, "step": 19280 }, { "entropy": 2.0362544685602186, "epoch": 0.2886295985613408, "grad_norm": 0.3420041799545288, "learning_rate": 4.1415382747875456e-05, "loss": 0.2299, "mean_token_accuracy": 0.9427588600665331, "num_tokens": 142937144.0, "step": 19290 }, { "entropy": 1.9993120409548282, "epoch": 0.28877922510284487, "grad_norm": 0.35424086451530457, "learning_rate": 4.140632505289019e-05, "loss": 0.2165, "mean_token_accuracy": 0.9457357801496983, "num_tokens": 143010041.0, "step": 19300 }, { "entropy": 2.028030426055193, "epoch": 0.28892885164434895, "grad_norm": 0.421956866979599, "learning_rate": 4.1397263576031644e-05, "loss": 0.2216, "mean_token_accuracy": 0.9474210020154714, "num_tokens": 143084543.0, "step": 19310 }, { "entropy": 2.025577488541603, "epoch": 0.28907847818585297, "grad_norm": 0.377094566822052, "learning_rate": 4.138819831939498e-05, "loss": 0.2121, "mean_token_accuracy": 0.9474115096032619, "num_tokens": 143163019.0, "step": 19320 }, { "entropy": 2.0393564343452453, "epoch": 0.28922810472735705, "grad_norm": 0.3564658761024475, "learning_rate": 4.137912928507626e-05, "loss": 0.2216, "mean_token_accuracy": 0.9469887781888247, "num_tokens": 143235748.0, "step": 19330 }, { "entropy": 2.0214167945086956, "epoch": 0.2893777312688611, "grad_norm": 0.3326159119606018, "learning_rate": 4.13700564751724e-05, "loss": 0.2151, "mean_token_accuracy": 0.9463445458561182, "num_tokens": 143310300.0, "step": 19340 }, { "entropy": 2.038857350498438, "epoch": 0.2895273578103652, "grad_norm": 0.3593785762786865, "learning_rate": 4.1360979891781185e-05, "loss": 0.2113, "mean_token_accuracy": 0.9464337833225727, "num_tokens": 143386209.0, "step": 19350 }, { "entropy": 2.010245291888714, "epoch": 0.2896769843518693, "grad_norm": 0.41534116864204407, "learning_rate": 4.1351899537001294e-05, "loss": 0.2027, "mean_token_accuracy": 0.9472188122570515, "num_tokens": 143462973.0, "step": 19360 }, { "entropy": 2.071219979971647, "epoch": 0.2898266108933733, "grad_norm": 0.3706682324409485, "learning_rate": 4.1342815412932276e-05, "loss": 0.2351, "mean_token_accuracy": 0.9374992590397596, "num_tokens": 143534722.0, "step": 19370 }, { "entropy": 2.043961289525032, "epoch": 0.2899762374348774, "grad_norm": 0.3208138942718506, "learning_rate": 4.133372752167452e-05, "loss": 0.2163, "mean_token_accuracy": 0.9436949111521244, "num_tokens": 143608727.0, "step": 19380 }, { "entropy": 1.982392144203186, "epoch": 0.29012586397638146, "grad_norm": 0.2898438274860382, "learning_rate": 4.132463586532932e-05, "loss": 0.2243, "mean_token_accuracy": 0.9445894751697779, "num_tokens": 143683061.0, "step": 19390 }, { "entropy": 1.9748047687113286, "epoch": 0.29027549051788554, "grad_norm": 0.3796473443508148, "learning_rate": 4.131554044599883e-05, "loss": 0.2343, "mean_token_accuracy": 0.944151297584176, "num_tokens": 143758219.0, "step": 19400 }, { "entropy": 1.9767847508192062, "epoch": 0.29042511705938956, "grad_norm": 0.3115903437137604, "learning_rate": 4.130644126578607e-05, "loss": 0.1996, "mean_token_accuracy": 0.9499203372746706, "num_tokens": 143830655.0, "step": 19410 }, { "entropy": 1.9845007054507733, "epoch": 0.29057474360089364, "grad_norm": 0.3089817762374878, "learning_rate": 4.129733832679493e-05, "loss": 0.2162, "mean_token_accuracy": 0.9446139160543681, "num_tokens": 143906544.0, "step": 19420 }, { "entropy": 2.001465954631567, "epoch": 0.2907243701423977, "grad_norm": 0.26999640464782715, "learning_rate": 4.128823163113018e-05, "loss": 0.2199, "mean_token_accuracy": 0.9457458753138781, "num_tokens": 143982199.0, "step": 19430 }, { "entropy": 2.011623577773571, "epoch": 0.2908739966839018, "grad_norm": 0.3828546106815338, "learning_rate": 4.127912118089743e-05, "loss": 0.2139, "mean_token_accuracy": 0.9462559968233109, "num_tokens": 144056359.0, "step": 19440 }, { "entropy": 2.006866566836834, "epoch": 0.2910236232254058, "grad_norm": 0.35948505997657776, "learning_rate": 4.12700069782032e-05, "loss": 0.2196, "mean_token_accuracy": 0.9453226558864116, "num_tokens": 144130014.0, "step": 19450 }, { "entropy": 1.9932134814560414, "epoch": 0.2911732497669099, "grad_norm": 0.37443414330482483, "learning_rate": 4.126088902515485e-05, "loss": 0.2465, "mean_token_accuracy": 0.9424038253724575, "num_tokens": 144205413.0, "step": 19460 }, { "entropy": 2.0161292761564256, "epoch": 0.29132287630841397, "grad_norm": 0.3447151482105255, "learning_rate": 4.1251767323860615e-05, "loss": 0.2285, "mean_token_accuracy": 0.9430126335471869, "num_tokens": 144278970.0, "step": 19470 }, { "entropy": 2.0269536308944227, "epoch": 0.29147250284991805, "grad_norm": 0.2640238404273987, "learning_rate": 4.124264187642958e-05, "loss": 0.211, "mean_token_accuracy": 0.9454924125224352, "num_tokens": 144355082.0, "step": 19480 }, { "entropy": 2.0321346059441567, "epoch": 0.2916221293914221, "grad_norm": 0.35263651609420776, "learning_rate": 4.123351268497172e-05, "loss": 0.2028, "mean_token_accuracy": 0.9497700709849596, "num_tokens": 144430360.0, "step": 19490 }, { "entropy": 2.048047775030136, "epoch": 0.29177175593292615, "grad_norm": 0.34211254119873047, "learning_rate": 4.122437975159787e-05, "loss": 0.2337, "mean_token_accuracy": 0.9445621252059937, "num_tokens": 144504841.0, "step": 19500 }, { "entropy": 2.0127721816301345, "epoch": 0.2919213824744302, "grad_norm": 0.37980666756629944, "learning_rate": 4.121524307841972e-05, "loss": 0.2155, "mean_token_accuracy": 0.9427575219422579, "num_tokens": 144579270.0, "step": 19510 }, { "entropy": 2.02224944755435, "epoch": 0.2920710090159343, "grad_norm": 0.3055545389652252, "learning_rate": 4.120610266754985e-05, "loss": 0.2331, "mean_token_accuracy": 0.946198432892561, "num_tokens": 144650032.0, "step": 19520 }, { "entropy": 1.9993158817291259, "epoch": 0.2922206355574384, "grad_norm": 0.3966371715068817, "learning_rate": 4.1196958521101666e-05, "loss": 0.2258, "mean_token_accuracy": 0.9443116266280412, "num_tokens": 144723709.0, "step": 19530 }, { "entropy": 2.0156676970422267, "epoch": 0.2923702620989424, "grad_norm": 0.2709941565990448, "learning_rate": 4.118781064118945e-05, "loss": 0.2184, "mean_token_accuracy": 0.9463618010282516, "num_tokens": 144795612.0, "step": 19540 }, { "entropy": 2.0284367904067038, "epoch": 0.2925198886404465, "grad_norm": 0.3392142951488495, "learning_rate": 4.1178659029928385e-05, "loss": 0.2096, "mean_token_accuracy": 0.9485639542341232, "num_tokens": 144870682.0, "step": 19550 }, { "entropy": 2.03234349116683, "epoch": 0.29266951518195056, "grad_norm": 0.3494682013988495, "learning_rate": 4.116950368943446e-05, "loss": 0.246, "mean_token_accuracy": 0.939114723354578, "num_tokens": 144943383.0, "step": 19560 }, { "entropy": 2.0234033286571504, "epoch": 0.29281914172345463, "grad_norm": 0.3731505274772644, "learning_rate": 4.116034462182456e-05, "loss": 0.208, "mean_token_accuracy": 0.9488781578838825, "num_tokens": 145016448.0, "step": 19570 }, { "entropy": 2.0094316944479944, "epoch": 0.29296876826495866, "grad_norm": 0.29979071021080017, "learning_rate": 4.115118182921642e-05, "loss": 0.1929, "mean_token_accuracy": 0.9486490063369274, "num_tokens": 145090066.0, "step": 19580 }, { "entropy": 2.0141825422644617, "epoch": 0.29311839480646273, "grad_norm": 0.3503182530403137, "learning_rate": 4.114201531372865e-05, "loss": 0.2206, "mean_token_accuracy": 0.9429158348590135, "num_tokens": 145166099.0, "step": 19590 }, { "entropy": 1.994695892930031, "epoch": 0.2932680213479668, "grad_norm": 0.42686930298805237, "learning_rate": 4.113284507748071e-05, "loss": 0.2188, "mean_token_accuracy": 0.9456496275961399, "num_tokens": 145238062.0, "step": 19600 }, { "entropy": 2.0545146852731704, "epoch": 0.2934176478894709, "grad_norm": 0.4200618863105774, "learning_rate": 4.112367112259291e-05, "loss": 0.2411, "mean_token_accuracy": 0.9377747546881438, "num_tokens": 145309086.0, "step": 19610 }, { "entropy": 2.0282765552401543, "epoch": 0.2935672744309749, "grad_norm": 0.4016728401184082, "learning_rate": 4.1114493451186446e-05, "loss": 0.2184, "mean_token_accuracy": 0.9442884162068367, "num_tokens": 145385771.0, "step": 19620 }, { "entropy": 2.0473625123500825, "epoch": 0.293716900972479, "grad_norm": 0.3272794783115387, "learning_rate": 4.1105312065383355e-05, "loss": 0.2226, "mean_token_accuracy": 0.945939016342163, "num_tokens": 145458202.0, "step": 19630 }, { "entropy": 2.017625433951616, "epoch": 0.29386652751398307, "grad_norm": 0.37465739250183105, "learning_rate": 4.1096126967306536e-05, "loss": 0.2436, "mean_token_accuracy": 0.9393696300685406, "num_tokens": 145529976.0, "step": 19640 }, { "entropy": 2.007725605368614, "epoch": 0.29401615405548714, "grad_norm": 0.35948389768600464, "learning_rate": 4.108693815907974e-05, "loss": 0.2073, "mean_token_accuracy": 0.9491938173770904, "num_tokens": 145601327.0, "step": 19650 }, { "entropy": 2.0509208396077154, "epoch": 0.2941657805969912, "grad_norm": 0.3008934259414673, "learning_rate": 4.10777456428276e-05, "loss": 0.2589, "mean_token_accuracy": 0.934301046282053, "num_tokens": 145671581.0, "step": 19660 }, { "entropy": 2.0360881075263024, "epoch": 0.29431540713849524, "grad_norm": 0.42072632908821106, "learning_rate": 4.1068549420675575e-05, "loss": 0.1943, "mean_token_accuracy": 0.9494276024401188, "num_tokens": 145745750.0, "step": 19670 }, { "entropy": 2.045329646021128, "epoch": 0.2944650336799993, "grad_norm": 0.46567341685295105, "learning_rate": 4.105934949474999e-05, "loss": 0.2405, "mean_token_accuracy": 0.9418666385114193, "num_tokens": 145819587.0, "step": 19680 }, { "entropy": 2.023375128954649, "epoch": 0.2946146602215034, "grad_norm": 0.38378089666366577, "learning_rate": 4.105014586717804e-05, "loss": 0.2243, "mean_token_accuracy": 0.9466793645173311, "num_tokens": 145894487.0, "step": 19690 }, { "entropy": 2.0113506980240343, "epoch": 0.2947642867630075, "grad_norm": 0.3974805176258087, "learning_rate": 4.1040938540087776e-05, "loss": 0.2093, "mean_token_accuracy": 0.9468415066599846, "num_tokens": 145969077.0, "step": 19700 }, { "entropy": 1.9913309440016747, "epoch": 0.2949139133045115, "grad_norm": 0.31204694509506226, "learning_rate": 4.1031727515608074e-05, "loss": 0.2138, "mean_token_accuracy": 0.9460851542651654, "num_tokens": 146044307.0, "step": 19710 }, { "entropy": 2.005850520730019, "epoch": 0.2950635398460156, "grad_norm": 0.4471956193447113, "learning_rate": 4.102251279586872e-05, "loss": 0.2269, "mean_token_accuracy": 0.9421543184667825, "num_tokens": 146116940.0, "step": 19720 }, { "entropy": 1.9804161600768566, "epoch": 0.29521316638751965, "grad_norm": 0.34054404497146606, "learning_rate": 4.1013294383000285e-05, "loss": 0.2133, "mean_token_accuracy": 0.9456283111125231, "num_tokens": 146192863.0, "step": 19730 }, { "entropy": 1.9990719571709632, "epoch": 0.29536279292902373, "grad_norm": 0.3339153528213501, "learning_rate": 4.100407227913425e-05, "loss": 0.2247, "mean_token_accuracy": 0.9446085713803768, "num_tokens": 146264276.0, "step": 19740 }, { "entropy": 1.985842365771532, "epoch": 0.29551241947052775, "grad_norm": 0.30111441016197205, "learning_rate": 4.099484648640292e-05, "loss": 0.2139, "mean_token_accuracy": 0.945923775061965, "num_tokens": 146338451.0, "step": 19750 }, { "entropy": 2.016427589952946, "epoch": 0.29566204601203183, "grad_norm": 0.30611446499824524, "learning_rate": 4.098561700693947e-05, "loss": 0.2264, "mean_token_accuracy": 0.9428063247352838, "num_tokens": 146412263.0, "step": 19760 }, { "entropy": 2.0081195876002313, "epoch": 0.2958116725535359, "grad_norm": 0.31625494360923767, "learning_rate": 4.097638384287792e-05, "loss": 0.2158, "mean_token_accuracy": 0.9454154785722494, "num_tokens": 146483612.0, "step": 19770 }, { "entropy": 2.0008365988731383, "epoch": 0.29596129909504, "grad_norm": 0.3585444986820221, "learning_rate": 4.096714699635315e-05, "loss": 0.2212, "mean_token_accuracy": 0.9458553910255432, "num_tokens": 146558585.0, "step": 19780 }, { "entropy": 1.993656063079834, "epoch": 0.29611092563654406, "grad_norm": 0.35468655824661255, "learning_rate": 4.095790646950086e-05, "loss": 0.2292, "mean_token_accuracy": 0.9443667333573103, "num_tokens": 146632495.0, "step": 19790 }, { "entropy": 1.9758825704455376, "epoch": 0.2962605521780481, "grad_norm": 0.43393224477767944, "learning_rate": 4.094866226445763e-05, "loss": 0.2032, "mean_token_accuracy": 0.9497439593076706, "num_tokens": 146709693.0, "step": 19800 }, { "entropy": 1.9865000322461128, "epoch": 0.29641017871955216, "grad_norm": 0.37553897500038147, "learning_rate": 4.09394143833609e-05, "loss": 0.218, "mean_token_accuracy": 0.9455925840884447, "num_tokens": 146783679.0, "step": 19810 }, { "entropy": 2.001179201900959, "epoch": 0.29655980526105624, "grad_norm": 0.3062836229801178, "learning_rate": 4.0930162828348945e-05, "loss": 0.2225, "mean_token_accuracy": 0.9439009569585324, "num_tokens": 146856949.0, "step": 19820 }, { "entropy": 2.013218576461077, "epoch": 0.2967094318025603, "grad_norm": 0.34968891739845276, "learning_rate": 4.092090760156087e-05, "loss": 0.2118, "mean_token_accuracy": 0.9468849711120129, "num_tokens": 146931126.0, "step": 19830 }, { "entropy": 1.9840328246355057, "epoch": 0.29685905834406434, "grad_norm": 0.39939936995506287, "learning_rate": 4.091164870513666e-05, "loss": 0.2185, "mean_token_accuracy": 0.9458829414099454, "num_tokens": 147006849.0, "step": 19840 }, { "entropy": 2.0314989760518074, "epoch": 0.2970086848855684, "grad_norm": 0.3434779942035675, "learning_rate": 4.0902386141217135e-05, "loss": 0.2312, "mean_token_accuracy": 0.940334552153945, "num_tokens": 147081819.0, "step": 19850 }, { "entropy": 2.007120017707348, "epoch": 0.2971583114270725, "grad_norm": 0.2926064729690552, "learning_rate": 4.0893119911943964e-05, "loss": 0.2185, "mean_token_accuracy": 0.9461166225373745, "num_tokens": 147156103.0, "step": 19860 }, { "entropy": 2.0122553169727326, "epoch": 0.2973079379685766, "grad_norm": 0.3425265848636627, "learning_rate": 4.088385001945966e-05, "loss": 0.2132, "mean_token_accuracy": 0.9451687458902598, "num_tokens": 147228567.0, "step": 19870 }, { "entropy": 1.9995957918465137, "epoch": 0.2974575645100806, "grad_norm": 0.3475918173789978, "learning_rate": 4.08745764659076e-05, "loss": 0.2094, "mean_token_accuracy": 0.9486463360488415, "num_tokens": 147303495.0, "step": 19880 }, { "entropy": 2.0184695474803447, "epoch": 0.2976071910515847, "grad_norm": 0.4519127309322357, "learning_rate": 4.0865299253431974e-05, "loss": 0.2312, "mean_token_accuracy": 0.9418253682553768, "num_tokens": 147376487.0, "step": 19890 }, { "entropy": 2.0048968225717543, "epoch": 0.29775681759308875, "grad_norm": 0.34926164150238037, "learning_rate": 4.085601838417786e-05, "loss": 0.2194, "mean_token_accuracy": 0.9442270547151566, "num_tokens": 147452696.0, "step": 19900 }, { "entropy": 2.0098508350551127, "epoch": 0.29790644413459283, "grad_norm": 0.36559855937957764, "learning_rate": 4.084673386029115e-05, "loss": 0.2242, "mean_token_accuracy": 0.9443294763565063, "num_tokens": 147526882.0, "step": 19910 }, { "entropy": 1.9947369545698166, "epoch": 0.2980560706760969, "grad_norm": 0.44540220499038696, "learning_rate": 4.0837445683918586e-05, "loss": 0.2198, "mean_token_accuracy": 0.9443842884153127, "num_tokens": 147602093.0, "step": 19920 }, { "entropy": 2.023253387957811, "epoch": 0.29820569721760093, "grad_norm": 0.39571183919906616, "learning_rate": 4.0828153857207766e-05, "loss": 0.2254, "mean_token_accuracy": 0.94560980014503, "num_tokens": 147675439.0, "step": 19930 }, { "entropy": 2.011840672791004, "epoch": 0.298355323759105, "grad_norm": 0.35391393303871155, "learning_rate": 4.081885838230712e-05, "loss": 0.2169, "mean_token_accuracy": 0.9453230824321508, "num_tokens": 147749723.0, "step": 19940 }, { "entropy": 2.011302823573351, "epoch": 0.2985049503006091, "grad_norm": 0.3616487979888916, "learning_rate": 4.0809559261365945e-05, "loss": 0.2356, "mean_token_accuracy": 0.9423373688012362, "num_tokens": 147824188.0, "step": 19950 }, { "entropy": 2.0500920340418816, "epoch": 0.29865457684211316, "grad_norm": 0.36686018109321594, "learning_rate": 4.080025649653434e-05, "loss": 0.2433, "mean_token_accuracy": 0.9410277891904115, "num_tokens": 147897400.0, "step": 19960 }, { "entropy": 2.0559603571891785, "epoch": 0.2988042033836172, "grad_norm": 0.33165568113327026, "learning_rate": 4.079095008996328e-05, "loss": 0.2285, "mean_token_accuracy": 0.9429252095520496, "num_tokens": 147971127.0, "step": 19970 }, { "entropy": 2.0634577453136442, "epoch": 0.29895382992512126, "grad_norm": 0.3879674971103668, "learning_rate": 4.078164004380458e-05, "loss": 0.2367, "mean_token_accuracy": 0.9419488787651062, "num_tokens": 148044261.0, "step": 19980 }, { "entropy": 2.082177019119263, "epoch": 0.29910345646662534, "grad_norm": 0.3713471293449402, "learning_rate": 4.0772326360210865e-05, "loss": 0.2277, "mean_token_accuracy": 0.9412368107587099, "num_tokens": 148117880.0, "step": 19990 }, { "entropy": 2.051739877462387, "epoch": 0.2992530830081294, "grad_norm": 0.4093238115310669, "learning_rate": 4.0763009041335656e-05, "loss": 0.2151, "mean_token_accuracy": 0.9473922595381736, "num_tokens": 148193531.0, "step": 20000 }, { "epoch": 0.2992530830081294, "eval_entropy": 2.0708330021142958, "eval_loss": 0.24427860975265503, "eval_mean_token_accuracy": 0.9453043068051338, "eval_num_tokens": 148193531.0, "eval_runtime": 552.4355, "eval_samples_per_second": 36.203, "eval_steps_per_second": 9.051, "step": 20000 }, { "entropy": 2.0759102158248424, "epoch": 0.29940270954963344, "grad_norm": 0.32652974128723145, "learning_rate": 4.0753688089333254e-05, "loss": 0.232, "mean_token_accuracy": 0.9436774171888829, "num_tokens": 148266107.0, "step": 20010 }, { "entropy": 2.071843759715557, "epoch": 0.2995523360911375, "grad_norm": 0.3483104109764099, "learning_rate": 4.074436350635884e-05, "loss": 0.2304, "mean_token_accuracy": 0.942254251614213, "num_tokens": 148339488.0, "step": 20020 }, { "entropy": 2.0224280312657354, "epoch": 0.2997019626326416, "grad_norm": 0.3100298047065735, "learning_rate": 4.073503529456843e-05, "loss": 0.222, "mean_token_accuracy": 0.9447232559323311, "num_tokens": 148412362.0, "step": 20030 }, { "entropy": 2.005318670719862, "epoch": 0.29985158917414567, "grad_norm": 0.3879857659339905, "learning_rate": 4.0725703456118864e-05, "loss": 0.2039, "mean_token_accuracy": 0.9510106228291988, "num_tokens": 148486270.0, "step": 20040 }, { "entropy": 1.9853283494710923, "epoch": 0.3000012157156497, "grad_norm": 0.379280686378479, "learning_rate": 4.071636799316783e-05, "loss": 0.2092, "mean_token_accuracy": 0.9501786291599273, "num_tokens": 148562525.0, "step": 20050 }, { "entropy": 2.0553229197859766, "epoch": 0.30015084225715377, "grad_norm": 0.42344072461128235, "learning_rate": 4.070702890787386e-05, "loss": 0.2452, "mean_token_accuracy": 0.9360755395144225, "num_tokens": 148633811.0, "step": 20060 }, { "entropy": 2.0442332707345487, "epoch": 0.30030046879865785, "grad_norm": 0.3089575171470642, "learning_rate": 4.0697686202396304e-05, "loss": 0.2058, "mean_token_accuracy": 0.9498985353857279, "num_tokens": 148709521.0, "step": 20070 }, { "entropy": 2.020933372527361, "epoch": 0.3004500953401619, "grad_norm": 0.3511551320552826, "learning_rate": 4.0688339878895374e-05, "loss": 0.1957, "mean_token_accuracy": 0.9477142490446567, "num_tokens": 148785250.0, "step": 20080 }, { "entropy": 2.031305019557476, "epoch": 0.300599721881666, "grad_norm": 0.3700384795665741, "learning_rate": 4.0678989939532094e-05, "loss": 0.2206, "mean_token_accuracy": 0.9467990510165691, "num_tokens": 148857675.0, "step": 20090 }, { "entropy": 2.014890494942665, "epoch": 0.30074934842317, "grad_norm": 0.3483615815639496, "learning_rate": 4.066963638646835e-05, "loss": 0.2246, "mean_token_accuracy": 0.945467672124505, "num_tokens": 148932164.0, "step": 20100 }, { "entropy": 2.0515431985259056, "epoch": 0.3008989749646741, "grad_norm": 0.40009334683418274, "learning_rate": 4.066027922186685e-05, "loss": 0.2006, "mean_token_accuracy": 0.9473388653248549, "num_tokens": 149007738.0, "step": 20110 }, { "entropy": 2.025045321881771, "epoch": 0.3010486015061782, "grad_norm": 0.30723336338996887, "learning_rate": 4.0650918447891124e-05, "loss": 0.1945, "mean_token_accuracy": 0.9517740681767464, "num_tokens": 149081891.0, "step": 20120 }, { "entropy": 2.048409187048674, "epoch": 0.30119822804768226, "grad_norm": 0.5110505223274231, "learning_rate": 4.0641554066705554e-05, "loss": 0.2276, "mean_token_accuracy": 0.9421701367944479, "num_tokens": 149154826.0, "step": 20130 }, { "entropy": 2.0346573255956173, "epoch": 0.3013478545891863, "grad_norm": 0.3433528244495392, "learning_rate": 4.0632186080475356e-05, "loss": 0.218, "mean_token_accuracy": 0.9457694068551064, "num_tokens": 149232107.0, "step": 20140 }, { "entropy": 2.10154742076993, "epoch": 0.30149748113069036, "grad_norm": 0.34369465708732605, "learning_rate": 4.062281449136657e-05, "loss": 0.2172, "mean_token_accuracy": 0.94480160176754, "num_tokens": 149305035.0, "step": 20150 }, { "entropy": 2.0551410019397736, "epoch": 0.30164710767219444, "grad_norm": 0.33466172218322754, "learning_rate": 4.0613439301546074e-05, "loss": 0.2121, "mean_token_accuracy": 0.9461729116737843, "num_tokens": 149379035.0, "step": 20160 }, { "entropy": 2.03267692103982, "epoch": 0.3017967342136985, "grad_norm": 0.3798556625843048, "learning_rate": 4.060406051318158e-05, "loss": 0.2161, "mean_token_accuracy": 0.9483131438493728, "num_tokens": 149454733.0, "step": 20170 }, { "entropy": 2.092066039144993, "epoch": 0.30194636075520254, "grad_norm": 0.35490837693214417, "learning_rate": 4.0594678128441636e-05, "loss": 0.2329, "mean_token_accuracy": 0.9424069199711085, "num_tokens": 149528065.0, "step": 20180 }, { "entropy": 2.0757917180657386, "epoch": 0.3020959872967066, "grad_norm": 0.3507733643054962, "learning_rate": 4.0585292149495614e-05, "loss": 0.2147, "mean_token_accuracy": 0.9483824774622918, "num_tokens": 149602476.0, "step": 20190 }, { "entropy": 2.085632944852114, "epoch": 0.3022456138382107, "grad_norm": 0.37306100130081177, "learning_rate": 4.0575902578513716e-05, "loss": 0.238, "mean_token_accuracy": 0.9442973997443914, "num_tokens": 149675515.0, "step": 20200 }, { "entropy": 2.065065673738718, "epoch": 0.30239524037971477, "grad_norm": 0.3211262822151184, "learning_rate": 4.056650941766698e-05, "loss": 0.2178, "mean_token_accuracy": 0.9449353717267513, "num_tokens": 149749815.0, "step": 20210 }, { "entropy": 2.0836403131484986, "epoch": 0.30254486692121885, "grad_norm": 0.3854275345802307, "learning_rate": 4.055711266912727e-05, "loss": 0.2116, "mean_token_accuracy": 0.9469335421919822, "num_tokens": 149823995.0, "step": 20220 }, { "entropy": 2.0359827056527138, "epoch": 0.30269449346272287, "grad_norm": 0.3149131238460541, "learning_rate": 4.054771233506728e-05, "loss": 0.2153, "mean_token_accuracy": 0.9444231435656547, "num_tokens": 149898263.0, "step": 20230 }, { "entropy": 2.0499155953526498, "epoch": 0.30284412000422695, "grad_norm": 0.29920250177383423, "learning_rate": 4.053830841766054e-05, "loss": 0.2296, "mean_token_accuracy": 0.9426768034696579, "num_tokens": 149969676.0, "step": 20240 }, { "entropy": 2.0736030772328378, "epoch": 0.302993746545731, "grad_norm": 0.3825022578239441, "learning_rate": 4.05289009190814e-05, "loss": 0.2466, "mean_token_accuracy": 0.9367811609059572, "num_tokens": 150042404.0, "step": 20250 }, { "entropy": 2.07252961024642, "epoch": 0.3031433730872351, "grad_norm": 0.28683727979660034, "learning_rate": 4.0519489841505035e-05, "loss": 0.2232, "mean_token_accuracy": 0.9401893369853497, "num_tokens": 150114646.0, "step": 20260 }, { "entropy": 2.0394650235772134, "epoch": 0.3032929996287391, "grad_norm": 0.33626025915145874, "learning_rate": 4.051007518710746e-05, "loss": 0.2076, "mean_token_accuracy": 0.9450729813426733, "num_tokens": 150189369.0, "step": 20270 }, { "entropy": 2.0168922170996666, "epoch": 0.3034426261702432, "grad_norm": 0.313623309135437, "learning_rate": 4.050065695806551e-05, "loss": 0.2073, "mean_token_accuracy": 0.9457651685923338, "num_tokens": 150263076.0, "step": 20280 }, { "entropy": 2.0252253018319606, "epoch": 0.3035922527117473, "grad_norm": 0.39041003584861755, "learning_rate": 4.049123515655685e-05, "loss": 0.2096, "mean_token_accuracy": 0.9477199658751487, "num_tokens": 150340176.0, "step": 20290 }, { "entropy": 2.0609344869852064, "epoch": 0.30374187925325136, "grad_norm": 0.337556928396225, "learning_rate": 4.048180978475997e-05, "loss": 0.226, "mean_token_accuracy": 0.9455450732260943, "num_tokens": 150414013.0, "step": 20300 }, { "entropy": 2.0581371992826463, "epoch": 0.3038915057947554, "grad_norm": 0.3807758092880249, "learning_rate": 4.047238084485418e-05, "loss": 0.2164, "mean_token_accuracy": 0.9460260260850191, "num_tokens": 150484684.0, "step": 20310 }, { "entropy": 2.0739156499505045, "epoch": 0.30404113233625946, "grad_norm": 0.41557514667510986, "learning_rate": 4.0462948339019604e-05, "loss": 0.2303, "mean_token_accuracy": 0.9429688390344382, "num_tokens": 150558641.0, "step": 20320 }, { "entropy": 2.0311658129096033, "epoch": 0.30419075887776353, "grad_norm": 0.3977046608924866, "learning_rate": 4.0453512269437224e-05, "loss": 0.2094, "mean_token_accuracy": 0.9484169911593199, "num_tokens": 150633445.0, "step": 20330 }, { "entropy": 2.034919075667858, "epoch": 0.3043403854192676, "grad_norm": 0.3646228611469269, "learning_rate": 4.0444072638288824e-05, "loss": 0.2128, "mean_token_accuracy": 0.9471397165209055, "num_tokens": 150708125.0, "step": 20340 }, { "entropy": 2.0485635086894036, "epoch": 0.30449001196077163, "grad_norm": 0.3745535612106323, "learning_rate": 4.0434629447757005e-05, "loss": 0.2188, "mean_token_accuracy": 0.9450364284217357, "num_tokens": 150781804.0, "step": 20350 }, { "entropy": 2.025724655389786, "epoch": 0.3046396385022757, "grad_norm": 0.30733734369277954, "learning_rate": 4.0425182700025214e-05, "loss": 0.2227, "mean_token_accuracy": 0.9454188141971827, "num_tokens": 150858959.0, "step": 20360 }, { "entropy": 2.011425943672657, "epoch": 0.3047892650437798, "grad_norm": 0.32149365544319153, "learning_rate": 4.04157323972777e-05, "loss": 0.2113, "mean_token_accuracy": 0.9473905976861715, "num_tokens": 150932182.0, "step": 20370 }, { "entropy": 1.9974001124501228, "epoch": 0.30493889158528387, "grad_norm": 0.4118684232234955, "learning_rate": 4.040627854169955e-05, "loss": 0.2271, "mean_token_accuracy": 0.942804392799735, "num_tokens": 151005940.0, "step": 20380 }, { "entropy": 2.021271604299545, "epoch": 0.30508851812678794, "grad_norm": 0.42837023735046387, "learning_rate": 4.039682113547665e-05, "loss": 0.2168, "mean_token_accuracy": 0.9418392848223448, "num_tokens": 151082519.0, "step": 20390 }, { "entropy": 2.006600972265005, "epoch": 0.30523814466829197, "grad_norm": 0.48619765043258667, "learning_rate": 4.0387360180795716e-05, "loss": 0.2168, "mean_token_accuracy": 0.9463105499744415, "num_tokens": 151154859.0, "step": 20400 }, { "entropy": 2.032611910253763, "epoch": 0.30538777120979604, "grad_norm": 0.38922959566116333, "learning_rate": 4.037789567984431e-05, "loss": 0.2367, "mean_token_accuracy": 0.9382399510592222, "num_tokens": 151226945.0, "step": 20410 }, { "entropy": 2.02854560315609, "epoch": 0.3055373977513001, "grad_norm": 0.4069543778896332, "learning_rate": 4.036842763481078e-05, "loss": 0.2356, "mean_token_accuracy": 0.9406383708119392, "num_tokens": 151300508.0, "step": 20420 }, { "entropy": 2.0425567157566547, "epoch": 0.3056870242928042, "grad_norm": 0.33164307475090027, "learning_rate": 4.035895604788431e-05, "loss": 0.2068, "mean_token_accuracy": 0.9477099508047104, "num_tokens": 151376136.0, "step": 20430 }, { "entropy": 2.0062108054757117, "epoch": 0.3058366508343082, "grad_norm": 0.39279812574386597, "learning_rate": 4.0349480921254896e-05, "loss": 0.2286, "mean_token_accuracy": 0.9416333962231874, "num_tokens": 151449782.0, "step": 20440 }, { "entropy": 1.9681022197008133, "epoch": 0.3059862773758123, "grad_norm": 0.4712926745414734, "learning_rate": 4.034000225711335e-05, "loss": 0.2491, "mean_token_accuracy": 0.9407241377979517, "num_tokens": 151523301.0, "step": 20450 }, { "entropy": 2.005452035367489, "epoch": 0.3061359039173164, "grad_norm": 0.5050312280654907, "learning_rate": 4.033052005765132e-05, "loss": 0.216, "mean_token_accuracy": 0.9431620825082063, "num_tokens": 151599663.0, "step": 20460 }, { "entropy": 2.000017238408327, "epoch": 0.30628553045882045, "grad_norm": 0.3637327551841736, "learning_rate": 4.032103432506126e-05, "loss": 0.2273, "mean_token_accuracy": 0.9459776900708675, "num_tokens": 151673857.0, "step": 20470 }, { "entropy": 2.019589538872242, "epoch": 0.3064351570003245, "grad_norm": 0.3020767569541931, "learning_rate": 4.0311545061536434e-05, "loss": 0.217, "mean_token_accuracy": 0.9451740752905607, "num_tokens": 151748579.0, "step": 20480 }, { "entropy": 2.035581620782614, "epoch": 0.30658478354182855, "grad_norm": 0.3323059380054474, "learning_rate": 4.0302052269270924e-05, "loss": 0.2171, "mean_token_accuracy": 0.9468574225902557, "num_tokens": 151827662.0, "step": 20490 }, { "entropy": 2.0439609944820405, "epoch": 0.30673441008333263, "grad_norm": 0.44183799624443054, "learning_rate": 4.0292555950459646e-05, "loss": 0.2252, "mean_token_accuracy": 0.942878994718194, "num_tokens": 151903455.0, "step": 20500 }, { "entropy": 1.9951113767921924, "epoch": 0.3068840366248367, "grad_norm": 0.337418794631958, "learning_rate": 4.02830561072983e-05, "loss": 0.2141, "mean_token_accuracy": 0.9458775170147419, "num_tokens": 151975342.0, "step": 20510 }, { "entropy": 2.0598106063902377, "epoch": 0.3070336631663408, "grad_norm": 0.30076271295547485, "learning_rate": 4.027355274198343e-05, "loss": 0.2409, "mean_token_accuracy": 0.9402170769870282, "num_tokens": 152047764.0, "step": 20520 }, { "entropy": 2.031250324100256, "epoch": 0.3071832897078448, "grad_norm": 0.3674869239330292, "learning_rate": 4.026404585671238e-05, "loss": 0.2024, "mean_token_accuracy": 0.9463290981948376, "num_tokens": 152124084.0, "step": 20530 }, { "entropy": 2.006423906236887, "epoch": 0.3073329162493489, "grad_norm": 0.3871377408504486, "learning_rate": 4.025453545368333e-05, "loss": 0.2327, "mean_token_accuracy": 0.9453656852245331, "num_tokens": 152197737.0, "step": 20540 }, { "entropy": 2.0046853736042975, "epoch": 0.30748254279085296, "grad_norm": 0.3386818468570709, "learning_rate": 4.024502153509522e-05, "loss": 0.2123, "mean_token_accuracy": 0.9441407084465027, "num_tokens": 152272605.0, "step": 20550 }, { "entropy": 2.0315895207226276, "epoch": 0.30763216933235704, "grad_norm": 0.3717646598815918, "learning_rate": 4.023550410314784e-05, "loss": 0.2251, "mean_token_accuracy": 0.9426624353975057, "num_tokens": 152346719.0, "step": 20560 }, { "entropy": 2.0220543377101423, "epoch": 0.30778179587386106, "grad_norm": 0.32115015387535095, "learning_rate": 4.022598316004183e-05, "loss": 0.2107, "mean_token_accuracy": 0.9453809712082147, "num_tokens": 152421286.0, "step": 20570 }, { "entropy": 1.997485026717186, "epoch": 0.30793142241536514, "grad_norm": 0.38315844535827637, "learning_rate": 4.021645870797856e-05, "loss": 0.2177, "mean_token_accuracy": 0.9425423528999091, "num_tokens": 152496465.0, "step": 20580 }, { "entropy": 2.0124673798680304, "epoch": 0.3080810489568692, "grad_norm": 0.32588624954223633, "learning_rate": 4.0206930749160274e-05, "loss": 0.217, "mean_token_accuracy": 0.9485005788505078, "num_tokens": 152570609.0, "step": 20590 }, { "entropy": 2.030595215409994, "epoch": 0.3082306754983733, "grad_norm": 0.33306217193603516, "learning_rate": 4.0197399285789993e-05, "loss": 0.2265, "mean_token_accuracy": 0.9438888899981975, "num_tokens": 152644928.0, "step": 20600 }, { "entropy": 2.0564027316868305, "epoch": 0.3083803020398773, "grad_norm": 0.3430580198764801, "learning_rate": 4.018786432007157e-05, "loss": 0.238, "mean_token_accuracy": 0.9415122382342815, "num_tokens": 152719993.0, "step": 20610 }, { "entropy": 2.0483881630003453, "epoch": 0.3085299285813814, "grad_norm": 0.3424883782863617, "learning_rate": 4.0178325854209664e-05, "loss": 0.2187, "mean_token_accuracy": 0.9459471311420202, "num_tokens": 152790720.0, "step": 20620 }, { "entropy": 2.0609630599617956, "epoch": 0.3086795551228855, "grad_norm": 0.3543964922428131, "learning_rate": 4.0168783890409715e-05, "loss": 0.229, "mean_token_accuracy": 0.9428050830960274, "num_tokens": 152863954.0, "step": 20630 }, { "entropy": 2.0334871239960193, "epoch": 0.30882918166438955, "grad_norm": 0.43066349625587463, "learning_rate": 4.0159238430878014e-05, "loss": 0.2175, "mean_token_accuracy": 0.9461889903992414, "num_tokens": 152936194.0, "step": 20640 }, { "entropy": 2.017429203540087, "epoch": 0.30897880820589363, "grad_norm": 0.37669119238853455, "learning_rate": 4.014968947782164e-05, "loss": 0.2335, "mean_token_accuracy": 0.9417244594544172, "num_tokens": 153010233.0, "step": 20650 }, { "entropy": 1.9555924907326698, "epoch": 0.30912843474739765, "grad_norm": 0.4077781140804291, "learning_rate": 4.014013703344848e-05, "loss": 0.213, "mean_token_accuracy": 0.9468055468052625, "num_tokens": 153084880.0, "step": 20660 }, { "entropy": 2.0257609263062477, "epoch": 0.30927806128890173, "grad_norm": 0.35262539982795715, "learning_rate": 4.0130581099967214e-05, "loss": 0.2502, "mean_token_accuracy": 0.938075703009963, "num_tokens": 153156985.0, "step": 20670 }, { "entropy": 2.0132630944252012, "epoch": 0.3094276878304058, "grad_norm": 0.3171537220478058, "learning_rate": 4.012102167958737e-05, "loss": 0.2222, "mean_token_accuracy": 0.9471158277243376, "num_tokens": 153234396.0, "step": 20680 }, { "entropy": 2.02591550052166, "epoch": 0.3095773143719099, "grad_norm": 0.4488358199596405, "learning_rate": 4.011145877451923e-05, "loss": 0.2544, "mean_token_accuracy": 0.9364600818604231, "num_tokens": 153307037.0, "step": 20690 }, { "entropy": 2.031464084982872, "epoch": 0.3097269409134139, "grad_norm": 0.30517369508743286, "learning_rate": 4.010189238697393e-05, "loss": 0.2481, "mean_token_accuracy": 0.939165124297142, "num_tokens": 153380839.0, "step": 20700 }, { "entropy": 2.0346524991095065, "epoch": 0.309876567454918, "grad_norm": 0.36129963397979736, "learning_rate": 4.009232251916337e-05, "loss": 0.2191, "mean_token_accuracy": 0.9454477079212665, "num_tokens": 153454447.0, "step": 20710 }, { "entropy": 2.034428533911705, "epoch": 0.31002619399642206, "grad_norm": 0.3525198698043823, "learning_rate": 4.008274917330028e-05, "loss": 0.2176, "mean_token_accuracy": 0.9469003856182099, "num_tokens": 153527575.0, "step": 20720 }, { "entropy": 2.0697022952139377, "epoch": 0.31017582053792614, "grad_norm": 0.38144925236701965, "learning_rate": 4.0073172351598204e-05, "loss": 0.2365, "mean_token_accuracy": 0.9391985733062029, "num_tokens": 153605523.0, "step": 20730 }, { "entropy": 2.0354940690100194, "epoch": 0.31032544707943016, "grad_norm": 0.27484214305877686, "learning_rate": 4.0063592056271447e-05, "loss": 0.2116, "mean_token_accuracy": 0.9489546019583941, "num_tokens": 153679281.0, "step": 20740 }, { "entropy": 2.034306912124157, "epoch": 0.31047507362093424, "grad_norm": 0.3726237714290619, "learning_rate": 4.005400828953517e-05, "loss": 0.2211, "mean_token_accuracy": 0.9473531350493432, "num_tokens": 153753445.0, "step": 20750 }, { "entropy": 2.044531650096178, "epoch": 0.3106247001624383, "grad_norm": 0.4144675135612488, "learning_rate": 4.0044421053605276e-05, "loss": 0.2156, "mean_token_accuracy": 0.9460084095597268, "num_tokens": 153831007.0, "step": 20760 }, { "entropy": 2.064971076697111, "epoch": 0.3107743267039424, "grad_norm": 0.4215957224369049, "learning_rate": 4.003483035069854e-05, "loss": 0.2294, "mean_token_accuracy": 0.9425821494311094, "num_tokens": 153904281.0, "step": 20770 }, { "entropy": 2.045664390921593, "epoch": 0.3109239532454464, "grad_norm": 0.38648131489753723, "learning_rate": 4.0025236183032486e-05, "loss": 0.2124, "mean_token_accuracy": 0.9458922579884529, "num_tokens": 153979582.0, "step": 20780 }, { "entropy": 2.0467068500816823, "epoch": 0.3110735797869505, "grad_norm": 0.40097951889038086, "learning_rate": 4.001563855282546e-05, "loss": 0.2157, "mean_token_accuracy": 0.9470040310174227, "num_tokens": 154051821.0, "step": 20790 }, { "entropy": 2.035109144449234, "epoch": 0.31122320632845457, "grad_norm": 0.34178274869918823, "learning_rate": 4.00060374622966e-05, "loss": 0.2127, "mean_token_accuracy": 0.9481329530477524, "num_tokens": 154129068.0, "step": 20800 }, { "entropy": 1.9955035082995891, "epoch": 0.31137283286995865, "grad_norm": 0.32662278413772583, "learning_rate": 3.999643291366585e-05, "loss": 0.213, "mean_token_accuracy": 0.9457138780504465, "num_tokens": 154205071.0, "step": 20810 }, { "entropy": 2.0531374648213387, "epoch": 0.3115224594114627, "grad_norm": 0.3054129183292389, "learning_rate": 3.9986824909153965e-05, "loss": 0.2274, "mean_token_accuracy": 0.9421583835035563, "num_tokens": 154280973.0, "step": 20820 }, { "entropy": 2.0693315140902997, "epoch": 0.31167208595296675, "grad_norm": 0.5104321837425232, "learning_rate": 3.997721345098247e-05, "loss": 0.2379, "mean_token_accuracy": 0.9406526647508144, "num_tokens": 154356846.0, "step": 20830 }, { "entropy": 2.023317018151283, "epoch": 0.3118217124944708, "grad_norm": 0.28538450598716736, "learning_rate": 3.996759854137371e-05, "loss": 0.209, "mean_token_accuracy": 0.9469563696533442, "num_tokens": 154432101.0, "step": 20840 }, { "entropy": 1.97511872574687, "epoch": 0.3119713390359749, "grad_norm": 0.3441958427429199, "learning_rate": 3.9957980182550824e-05, "loss": 0.2085, "mean_token_accuracy": 0.9458885002881289, "num_tokens": 154506730.0, "step": 20850 }, { "entropy": 2.0496716529130934, "epoch": 0.312120965577479, "grad_norm": 0.3860388994216919, "learning_rate": 3.994835837673775e-05, "loss": 0.2116, "mean_token_accuracy": 0.9434463396668434, "num_tokens": 154580108.0, "step": 20860 }, { "entropy": 2.049126545339823, "epoch": 0.312270592118983, "grad_norm": 0.3473508358001709, "learning_rate": 3.9938733126159216e-05, "loss": 0.2254, "mean_token_accuracy": 0.9452503927052021, "num_tokens": 154651675.0, "step": 20870 }, { "entropy": 2.0800929561257364, "epoch": 0.3124202186604871, "grad_norm": 0.34802186489105225, "learning_rate": 3.992910443304076e-05, "loss": 0.2341, "mean_token_accuracy": 0.9397499542683363, "num_tokens": 154725577.0, "step": 20880 }, { "entropy": 2.003300468623638, "epoch": 0.31256984520199116, "grad_norm": 0.3554462790489197, "learning_rate": 3.991947229960869e-05, "loss": 0.2111, "mean_token_accuracy": 0.9496726907789708, "num_tokens": 154802057.0, "step": 20890 }, { "entropy": 2.036792879551649, "epoch": 0.31271947174349524, "grad_norm": 0.3895892798900604, "learning_rate": 3.9909836728090155e-05, "loss": 0.2234, "mean_token_accuracy": 0.9414533726871014, "num_tokens": 154874260.0, "step": 20900 }, { "entropy": 2.0275000773370264, "epoch": 0.31286909828499926, "grad_norm": 0.41381338238716125, "learning_rate": 3.990019772071304e-05, "loss": 0.21, "mean_token_accuracy": 0.9475589234381914, "num_tokens": 154952318.0, "step": 20910 }, { "entropy": 2.064033020287752, "epoch": 0.31301872482650334, "grad_norm": 0.42414525151252747, "learning_rate": 3.989055527970607e-05, "loss": 0.2163, "mean_token_accuracy": 0.9455028463155031, "num_tokens": 155025251.0, "step": 20920 }, { "entropy": 2.0484140418469905, "epoch": 0.3131683513680074, "grad_norm": 0.3718685209751129, "learning_rate": 3.988090940729875e-05, "loss": 0.2161, "mean_token_accuracy": 0.9460485558956861, "num_tokens": 155096279.0, "step": 20930 }, { "entropy": 2.0486058235168456, "epoch": 0.3133179779095115, "grad_norm": 0.3463824391365051, "learning_rate": 3.987126010572137e-05, "loss": 0.2266, "mean_token_accuracy": 0.9441498599946498, "num_tokens": 155170232.0, "step": 20940 }, { "entropy": 2.0465155705809592, "epoch": 0.31346760445101557, "grad_norm": 0.3537174165248871, "learning_rate": 3.986160737720503e-05, "loss": 0.2092, "mean_token_accuracy": 0.9469104565680027, "num_tokens": 155244098.0, "step": 20950 }, { "entropy": 2.06198565736413, "epoch": 0.3136172309925196, "grad_norm": 0.37638577818870544, "learning_rate": 3.98519512239816e-05, "loss": 0.2041, "mean_token_accuracy": 0.9478725403547287, "num_tokens": 155319329.0, "step": 20960 }, { "entropy": 1.996738040447235, "epoch": 0.31376685753402367, "grad_norm": 0.3048970103263855, "learning_rate": 3.9842291648283766e-05, "loss": 0.2026, "mean_token_accuracy": 0.9497688509523868, "num_tokens": 155392002.0, "step": 20970 }, { "entropy": 2.0046715155243873, "epoch": 0.31391648407552775, "grad_norm": 0.37890535593032837, "learning_rate": 3.983262865234499e-05, "loss": 0.2135, "mean_token_accuracy": 0.9495746187865735, "num_tokens": 155466638.0, "step": 20980 }, { "entropy": 2.021643092483282, "epoch": 0.3140661106170318, "grad_norm": 0.2615390717983246, "learning_rate": 3.982296223839953e-05, "loss": 0.2057, "mean_token_accuracy": 0.9475334361195564, "num_tokens": 155542727.0, "step": 20990 }, { "entropy": 2.0476947478950023, "epoch": 0.31421573715853585, "grad_norm": 0.33889931440353394, "learning_rate": 3.9813292408682425e-05, "loss": 0.2341, "mean_token_accuracy": 0.9452584467828273, "num_tokens": 155616047.0, "step": 21000 }, { "epoch": 0.31421573715853585, "eval_entropy": 2.049203820157051, "eval_loss": 0.24272094666957855, "eval_mean_token_accuracy": 0.9455852692008019, "eval_num_tokens": 155616047.0, "eval_runtime": 551.3391, "eval_samples_per_second": 36.275, "eval_steps_per_second": 9.069, "step": 21000 }, { "entropy": 2.067938378453255, "epoch": 0.3143653637000399, "grad_norm": 0.3299214839935303, "learning_rate": 3.980361916542952e-05, "loss": 0.2202, "mean_token_accuracy": 0.9460555110126734, "num_tokens": 155686270.0, "step": 21010 }, { "entropy": 2.040417101979256, "epoch": 0.314514990241544, "grad_norm": 0.31013473868370056, "learning_rate": 3.979394251087743e-05, "loss": 0.211, "mean_token_accuracy": 0.9493416756391525, "num_tokens": 155761211.0, "step": 21020 }, { "entropy": 2.086323032528162, "epoch": 0.3146646167830481, "grad_norm": 0.3625803589820862, "learning_rate": 3.9784262447263585e-05, "loss": 0.2361, "mean_token_accuracy": 0.943095950037241, "num_tokens": 155835527.0, "step": 21030 }, { "entropy": 2.0910055972635746, "epoch": 0.3148142433245521, "grad_norm": 0.3228873312473297, "learning_rate": 3.977457897682618e-05, "loss": 0.2059, "mean_token_accuracy": 0.9497723091393709, "num_tokens": 155911674.0, "step": 21040 }, { "entropy": 2.054501846432686, "epoch": 0.3149638698660562, "grad_norm": 0.3460301160812378, "learning_rate": 3.9764892101804206e-05, "loss": 0.2086, "mean_token_accuracy": 0.9459057450294495, "num_tokens": 155986718.0, "step": 21050 }, { "entropy": 2.05505652949214, "epoch": 0.31511349640756026, "grad_norm": 0.3822898268699646, "learning_rate": 3.975520182443744e-05, "loss": 0.2234, "mean_token_accuracy": 0.9430285263806581, "num_tokens": 156059885.0, "step": 21060 }, { "entropy": 2.033085487037897, "epoch": 0.31526312294906433, "grad_norm": 0.31928619742393494, "learning_rate": 3.9745508146966447e-05, "loss": 0.2118, "mean_token_accuracy": 0.943522747978568, "num_tokens": 156133793.0, "step": 21070 }, { "entropy": 1.9927950337529183, "epoch": 0.3154127494905684, "grad_norm": 0.4609970450401306, "learning_rate": 3.9735811071632584e-05, "loss": 0.2221, "mean_token_accuracy": 0.9451512970030308, "num_tokens": 156210434.0, "step": 21080 }, { "entropy": 2.0285411842167376, "epoch": 0.31556237603207243, "grad_norm": 0.3782942295074463, "learning_rate": 3.9726110600677975e-05, "loss": 0.2261, "mean_token_accuracy": 0.9455464221537113, "num_tokens": 156283713.0, "step": 21090 }, { "entropy": 2.0534337289631366, "epoch": 0.3157120025735765, "grad_norm": 0.2939006984233856, "learning_rate": 3.971640673634555e-05, "loss": 0.2327, "mean_token_accuracy": 0.941748633980751, "num_tokens": 156357174.0, "step": 21100 }, { "entropy": 2.072802795469761, "epoch": 0.3158616291150806, "grad_norm": 0.2700656056404114, "learning_rate": 3.970669948087901e-05, "loss": 0.2231, "mean_token_accuracy": 0.9408281002193689, "num_tokens": 156429886.0, "step": 21110 }, { "entropy": 2.030059576779604, "epoch": 0.31601125565658467, "grad_norm": 0.3797900378704071, "learning_rate": 3.9696988836522844e-05, "loss": 0.2119, "mean_token_accuracy": 0.9481119718402624, "num_tokens": 156503894.0, "step": 21120 }, { "entropy": 2.026000624895096, "epoch": 0.3161608821980887, "grad_norm": 0.3602733910083771, "learning_rate": 3.968727480552234e-05, "loss": 0.2291, "mean_token_accuracy": 0.9416314449161292, "num_tokens": 156578105.0, "step": 21130 }, { "entropy": 2.020570170879364, "epoch": 0.31631050873959277, "grad_norm": 0.3036384880542755, "learning_rate": 3.9677557390123545e-05, "loss": 0.2147, "mean_token_accuracy": 0.944324952736497, "num_tokens": 156652887.0, "step": 21140 }, { "entropy": 2.026704975217581, "epoch": 0.31646013528109684, "grad_norm": 0.31078073382377625, "learning_rate": 3.966783659257329e-05, "loss": 0.2135, "mean_token_accuracy": 0.9464764360338449, "num_tokens": 156726684.0, "step": 21150 }, { "entropy": 2.0353177413344383, "epoch": 0.3166097618226009, "grad_norm": 0.38851556181907654, "learning_rate": 3.965811241511921e-05, "loss": 0.2181, "mean_token_accuracy": 0.9444101713597775, "num_tokens": 156798958.0, "step": 21160 }, { "entropy": 2.0476369075477123, "epoch": 0.31675938836410494, "grad_norm": 0.334753155708313, "learning_rate": 3.964838486000969e-05, "loss": 0.2214, "mean_token_accuracy": 0.9446969959884882, "num_tokens": 156871548.0, "step": 21170 }, { "entropy": 2.038842688500881, "epoch": 0.316909014905609, "grad_norm": 0.36391958594322205, "learning_rate": 3.963865392949394e-05, "loss": 0.2155, "mean_token_accuracy": 0.9459203172475099, "num_tokens": 156945769.0, "step": 21180 }, { "entropy": 2.002093390375376, "epoch": 0.3170586414471131, "grad_norm": 0.42484068870544434, "learning_rate": 3.9628919625821905e-05, "loss": 0.191, "mean_token_accuracy": 0.9506699938327074, "num_tokens": 157021140.0, "step": 21190 }, { "entropy": 1.9908698186278344, "epoch": 0.3172082679886172, "grad_norm": 0.36248889565467834, "learning_rate": 3.9619181951244335e-05, "loss": 0.2099, "mean_token_accuracy": 0.9491431560367346, "num_tokens": 157093904.0, "step": 21200 }, { "entropy": 1.9868118532001973, "epoch": 0.3173578945301212, "grad_norm": 0.33576852083206177, "learning_rate": 3.960944090801274e-05, "loss": 0.217, "mean_token_accuracy": 0.9462547600269318, "num_tokens": 157167987.0, "step": 21210 }, { "entropy": 2.0365115188062193, "epoch": 0.3175075210716253, "grad_norm": 0.35511136054992676, "learning_rate": 3.959969649837945e-05, "loss": 0.219, "mean_token_accuracy": 0.9461350623518229, "num_tokens": 157242746.0, "step": 21220 }, { "entropy": 2.0402232773602007, "epoch": 0.31765714761312935, "grad_norm": 0.36837494373321533, "learning_rate": 3.958994872459752e-05, "loss": 0.2203, "mean_token_accuracy": 0.9428602252155542, "num_tokens": 157317331.0, "step": 21230 }, { "entropy": 1.9857642568647862, "epoch": 0.31780677415463343, "grad_norm": 0.3189406096935272, "learning_rate": 3.958019758892083e-05, "loss": 0.2179, "mean_token_accuracy": 0.9464772686362266, "num_tokens": 157393123.0, "step": 21240 }, { "entropy": 1.992910234630108, "epoch": 0.3179564006961375, "grad_norm": 0.3239775598049164, "learning_rate": 3.9570443093604e-05, "loss": 0.215, "mean_token_accuracy": 0.9451756544411183, "num_tokens": 157465751.0, "step": 21250 }, { "entropy": 2.0002670891582968, "epoch": 0.31810602723764153, "grad_norm": 0.3075005114078522, "learning_rate": 3.956068524090245e-05, "loss": 0.2208, "mean_token_accuracy": 0.9445587109774352, "num_tokens": 157544351.0, "step": 21260 }, { "entropy": 1.9972836568951606, "epoch": 0.3182556537791456, "grad_norm": 0.3258792757987976, "learning_rate": 3.955092403307237e-05, "loss": 0.2091, "mean_token_accuracy": 0.9458262383937835, "num_tokens": 157620844.0, "step": 21270 }, { "entropy": 2.0234507739543917, "epoch": 0.3184052803206497, "grad_norm": 0.3724513053894043, "learning_rate": 3.954115947237072e-05, "loss": 0.2293, "mean_token_accuracy": 0.9418605446815491, "num_tokens": 157695951.0, "step": 21280 }, { "entropy": 2.0016843006014824, "epoch": 0.31855490686215376, "grad_norm": 0.4644080102443695, "learning_rate": 3.9531391561055245e-05, "loss": 0.2288, "mean_token_accuracy": 0.9438267134130001, "num_tokens": 157773275.0, "step": 21290 }, { "entropy": 2.0175721898674963, "epoch": 0.3187045334036578, "grad_norm": 0.32737523317337036, "learning_rate": 3.952162030138445e-05, "loss": 0.2082, "mean_token_accuracy": 0.9469501547515392, "num_tokens": 157848161.0, "step": 21300 }, { "entropy": 1.990839173644781, "epoch": 0.31885415994516186, "grad_norm": 0.3597821891307831, "learning_rate": 3.9511845695617636e-05, "loss": 0.2233, "mean_token_accuracy": 0.9433918241411448, "num_tokens": 157923182.0, "step": 21310 }, { "entropy": 2.010980723053217, "epoch": 0.31900378648666594, "grad_norm": 0.39587196707725525, "learning_rate": 3.9502067746014855e-05, "loss": 0.2429, "mean_token_accuracy": 0.9394553314894438, "num_tokens": 157995680.0, "step": 21320 }, { "entropy": 2.0357247851788998, "epoch": 0.31915341302817, "grad_norm": 0.32736778259277344, "learning_rate": 3.9492286454836956e-05, "loss": 0.2146, "mean_token_accuracy": 0.9440926939249039, "num_tokens": 158070465.0, "step": 21330 }, { "entropy": 1.97601200863719, "epoch": 0.31930303956967404, "grad_norm": 0.28568172454833984, "learning_rate": 3.948250182434554e-05, "loss": 0.2114, "mean_token_accuracy": 0.9444621555507183, "num_tokens": 158145174.0, "step": 21340 }, { "entropy": 1.9470690689980983, "epoch": 0.3194526661111781, "grad_norm": 0.3590262532234192, "learning_rate": 3.947271385680299e-05, "loss": 0.2329, "mean_token_accuracy": 0.9426858507096767, "num_tokens": 158217250.0, "step": 21350 }, { "entropy": 1.9611158460378646, "epoch": 0.3196022926526822, "grad_norm": 0.3179415166378021, "learning_rate": 3.946292255447245e-05, "loss": 0.2153, "mean_token_accuracy": 0.9469668809324503, "num_tokens": 158292197.0, "step": 21360 }, { "entropy": 1.9819176979362965, "epoch": 0.3197519191941863, "grad_norm": 0.3512411415576935, "learning_rate": 3.9453127919617854e-05, "loss": 0.2047, "mean_token_accuracy": 0.9462457746267319, "num_tokens": 158368081.0, "step": 21370 }, { "entropy": 2.0229830175638197, "epoch": 0.31990154573569035, "grad_norm": 0.38249602913856506, "learning_rate": 3.9443329954503886e-05, "loss": 0.2342, "mean_token_accuracy": 0.9430902604013681, "num_tokens": 158442502.0, "step": 21380 }, { "entropy": 2.032430177181959, "epoch": 0.3200511722771944, "grad_norm": 0.3795258104801178, "learning_rate": 3.943352866139602e-05, "loss": 0.2289, "mean_token_accuracy": 0.9447651542723179, "num_tokens": 158514440.0, "step": 21390 }, { "entropy": 2.023717015981674, "epoch": 0.32020079881869845, "grad_norm": 0.30938658118247986, "learning_rate": 3.9423724042560484e-05, "loss": 0.2156, "mean_token_accuracy": 0.9452714815735817, "num_tokens": 158588338.0, "step": 21400 }, { "entropy": 2.0178687386214733, "epoch": 0.32035042536020253, "grad_norm": 0.42074257135391235, "learning_rate": 3.9413916100264275e-05, "loss": 0.223, "mean_token_accuracy": 0.9438644349575043, "num_tokens": 158660937.0, "step": 21410 }, { "entropy": 1.9600103966891766, "epoch": 0.3205000519017066, "grad_norm": 0.4060099422931671, "learning_rate": 3.940410483677518e-05, "loss": 0.2169, "mean_token_accuracy": 0.9456734035164118, "num_tokens": 158735732.0, "step": 21420 }, { "entropy": 1.9779482908546924, "epoch": 0.32064967844321063, "grad_norm": 0.3536320626735687, "learning_rate": 3.939429025436172e-05, "loss": 0.2032, "mean_token_accuracy": 0.9473308224231005, "num_tokens": 158811649.0, "step": 21430 }, { "entropy": 1.9725464567542077, "epoch": 0.3207993049847147, "grad_norm": 0.28914687037467957, "learning_rate": 3.9384472355293207e-05, "loss": 0.2068, "mean_token_accuracy": 0.9494631376117468, "num_tokens": 158887313.0, "step": 21440 }, { "entropy": 1.982947215437889, "epoch": 0.3209489315262188, "grad_norm": 0.4032208323478699, "learning_rate": 3.937465114183972e-05, "loss": 0.2194, "mean_token_accuracy": 0.9434507060796022, "num_tokens": 158962765.0, "step": 21450 }, { "entropy": 1.987280560284853, "epoch": 0.32109855806772286, "grad_norm": 0.3512982130050659, "learning_rate": 3.9364826616272086e-05, "loss": 0.2204, "mean_token_accuracy": 0.9463640470057726, "num_tokens": 159034200.0, "step": 21460 }, { "entropy": 1.9863001890480518, "epoch": 0.3212481846092269, "grad_norm": 0.46394428610801697, "learning_rate": 3.935499878086192e-05, "loss": 0.2015, "mean_token_accuracy": 0.9495463334023952, "num_tokens": 159109359.0, "step": 21470 }, { "entropy": 2.0119037181138992, "epoch": 0.32139781115073096, "grad_norm": 0.30585619807243347, "learning_rate": 3.9345167637881594e-05, "loss": 0.2197, "mean_token_accuracy": 0.9402464888989925, "num_tokens": 159185335.0, "step": 21480 }, { "entropy": 2.0103465363383295, "epoch": 0.32154743769223504, "grad_norm": 0.4745115637779236, "learning_rate": 3.933533318960423e-05, "loss": 0.2042, "mean_token_accuracy": 0.948231453448534, "num_tokens": 159261565.0, "step": 21490 }, { "entropy": 2.0037326201796533, "epoch": 0.3216970642337391, "grad_norm": 0.32413962483406067, "learning_rate": 3.9325495438303746e-05, "loss": 0.2279, "mean_token_accuracy": 0.940834591165185, "num_tokens": 159335105.0, "step": 21500 }, { "entropy": 1.9720140799880028, "epoch": 0.3218466907752432, "grad_norm": 0.3732118010520935, "learning_rate": 3.931565438625479e-05, "loss": 0.205, "mean_token_accuracy": 0.9474518183618784, "num_tokens": 159407885.0, "step": 21510 }, { "entropy": 1.9738122932612896, "epoch": 0.3219963173167472, "grad_norm": 0.3450663387775421, "learning_rate": 3.9305810035732796e-05, "loss": 0.2319, "mean_token_accuracy": 0.9433425858616828, "num_tokens": 159481590.0, "step": 21520 }, { "entropy": 1.9817461341619491, "epoch": 0.3221459438582513, "grad_norm": 0.33707523345947266, "learning_rate": 3.929596238901395e-05, "loss": 0.2113, "mean_token_accuracy": 0.945607977733016, "num_tokens": 159552873.0, "step": 21530 }, { "entropy": 1.9840748824179173, "epoch": 0.32229557039975537, "grad_norm": 0.3030901551246643, "learning_rate": 3.9286111448375196e-05, "loss": 0.2362, "mean_token_accuracy": 0.9407924819737673, "num_tokens": 159628268.0, "step": 21540 }, { "entropy": 2.003737914562225, "epoch": 0.32244519694125945, "grad_norm": 0.36346423625946045, "learning_rate": 3.9276257216094264e-05, "loss": 0.2254, "mean_token_accuracy": 0.9422803707420826, "num_tokens": 159702337.0, "step": 21550 }, { "entropy": 1.9975286461412907, "epoch": 0.32259482348276347, "grad_norm": 0.37526774406433105, "learning_rate": 3.9266399694449616e-05, "loss": 0.2117, "mean_token_accuracy": 0.9459686815738678, "num_tokens": 159776289.0, "step": 21560 }, { "entropy": 2.0102029852569103, "epoch": 0.32274445002426755, "grad_norm": 0.3834324777126312, "learning_rate": 3.925653888572048e-05, "loss": 0.205, "mean_token_accuracy": 0.9490348465740681, "num_tokens": 159846946.0, "step": 21570 }, { "entropy": 1.9851542390882968, "epoch": 0.3228940765657716, "grad_norm": 0.3518499433994293, "learning_rate": 3.924667479218687e-05, "loss": 0.2123, "mean_token_accuracy": 0.9484173983335495, "num_tokens": 159920715.0, "step": 21580 }, { "entropy": 1.9847568929195405, "epoch": 0.3230437031072757, "grad_norm": 0.39872080087661743, "learning_rate": 3.923680741612952e-05, "loss": 0.2275, "mean_token_accuracy": 0.944013575464487, "num_tokens": 159995436.0, "step": 21590 }, { "entropy": 2.007246517390013, "epoch": 0.3231933296487797, "grad_norm": 0.2699209153652191, "learning_rate": 3.922693675982996e-05, "loss": 0.2245, "mean_token_accuracy": 0.9413744397461414, "num_tokens": 160072182.0, "step": 21600 }, { "entropy": 2.0074453584849836, "epoch": 0.3233429561902838, "grad_norm": 0.3509252667427063, "learning_rate": 3.921706282557045e-05, "loss": 0.2171, "mean_token_accuracy": 0.9467690706253051, "num_tokens": 160146983.0, "step": 21610 }, { "entropy": 2.077109782397747, "epoch": 0.3234925827317879, "grad_norm": 0.4871334731578827, "learning_rate": 3.9207185615634014e-05, "loss": 0.23, "mean_token_accuracy": 0.9448326826095581, "num_tokens": 160219243.0, "step": 21620 }, { "entropy": 2.0690233670175076, "epoch": 0.32364220927329196, "grad_norm": 0.39562880992889404, "learning_rate": 3.919730513230445e-05, "loss": 0.2334, "mean_token_accuracy": 0.9388488363474607, "num_tokens": 160291335.0, "step": 21630 }, { "entropy": 1.9964601308107377, "epoch": 0.323791835814796, "grad_norm": 0.35720333456993103, "learning_rate": 3.9187421377866305e-05, "loss": 0.2031, "mean_token_accuracy": 0.9470710754394531, "num_tokens": 160363896.0, "step": 21640 }, { "entropy": 1.9931552797555923, "epoch": 0.32394146235630006, "grad_norm": 0.35890018939971924, "learning_rate": 3.917753435460487e-05, "loss": 0.2263, "mean_token_accuracy": 0.9434368804097175, "num_tokens": 160438144.0, "step": 21650 }, { "entropy": 2.0072352454066276, "epoch": 0.32409108889780414, "grad_norm": 0.3876381516456604, "learning_rate": 3.9167644064806194e-05, "loss": 0.2118, "mean_token_accuracy": 0.9457936495542526, "num_tokens": 160514775.0, "step": 21660 }, { "entropy": 2.011367876827717, "epoch": 0.3242407154393082, "grad_norm": 0.33291056752204895, "learning_rate": 3.915775051075711e-05, "loss": 0.2072, "mean_token_accuracy": 0.9475776456296444, "num_tokens": 160587499.0, "step": 21670 }, { "entropy": 1.987958462536335, "epoch": 0.3243903419808123, "grad_norm": 0.3264543116092682, "learning_rate": 3.9147853694745154e-05, "loss": 0.2368, "mean_token_accuracy": 0.9422347642481327, "num_tokens": 160658756.0, "step": 21680 }, { "entropy": 1.96802050024271, "epoch": 0.3245399685223163, "grad_norm": 0.4058969020843506, "learning_rate": 3.913795361905867e-05, "loss": 0.214, "mean_token_accuracy": 0.9491988968104124, "num_tokens": 160736808.0, "step": 21690 }, { "entropy": 1.9849737845361233, "epoch": 0.3246895950638204, "grad_norm": 0.30971574783325195, "learning_rate": 3.912805028598673e-05, "loss": 0.2178, "mean_token_accuracy": 0.9447855114936828, "num_tokens": 160811990.0, "step": 21700 }, { "entropy": 1.975720302760601, "epoch": 0.32483922160532447, "grad_norm": 0.3507390022277832, "learning_rate": 3.911814369781914e-05, "loss": 0.2039, "mean_token_accuracy": 0.9463858529925346, "num_tokens": 160887607.0, "step": 21710 }, { "entropy": 2.0132723189890385, "epoch": 0.32498884814682855, "grad_norm": 0.3478752374649048, "learning_rate": 3.910823385684651e-05, "loss": 0.2334, "mean_token_accuracy": 0.9430777702480555, "num_tokens": 160963013.0, "step": 21720 }, { "entropy": 2.0074999004602434, "epoch": 0.32513847468833257, "grad_norm": 0.4104067385196686, "learning_rate": 3.909832076536015e-05, "loss": 0.2196, "mean_token_accuracy": 0.9465911034494638, "num_tokens": 161036093.0, "step": 21730 }, { "entropy": 1.9822812102735043, "epoch": 0.32528810122983665, "grad_norm": 0.5129075646400452, "learning_rate": 3.908840442565214e-05, "loss": 0.2392, "mean_token_accuracy": 0.9407647550106049, "num_tokens": 161108188.0, "step": 21740 }, { "entropy": 1.976319255679846, "epoch": 0.3254377277713407, "grad_norm": 0.3484298884868622, "learning_rate": 3.907848484001533e-05, "loss": 0.221, "mean_token_accuracy": 0.9454923130571842, "num_tokens": 161182163.0, "step": 21750 }, { "entropy": 1.936514262855053, "epoch": 0.3255873543128448, "grad_norm": 0.3309216797351837, "learning_rate": 3.9068562010743295e-05, "loss": 0.2194, "mean_token_accuracy": 0.9472241543233395, "num_tokens": 161256575.0, "step": 21760 }, { "entropy": 1.963012869656086, "epoch": 0.3257369808543488, "grad_norm": 0.344516396522522, "learning_rate": 3.9058635940130374e-05, "loss": 0.2077, "mean_token_accuracy": 0.9462473016232252, "num_tokens": 161332014.0, "step": 21770 }, { "entropy": 1.9798145152628421, "epoch": 0.3258866073958529, "grad_norm": 0.41650813817977905, "learning_rate": 3.904870663047165e-05, "loss": 0.2152, "mean_token_accuracy": 0.9455726474523545, "num_tokens": 161406741.0, "step": 21780 }, { "entropy": 1.9715054392814637, "epoch": 0.326036233937357, "grad_norm": 0.3356781303882599, "learning_rate": 3.903877408406295e-05, "loss": 0.22, "mean_token_accuracy": 0.947141955792904, "num_tokens": 161480601.0, "step": 21790 }, { "entropy": 2.0067955769598482, "epoch": 0.32618586047886106, "grad_norm": 0.3800460994243622, "learning_rate": 3.902883830320086e-05, "loss": 0.2204, "mean_token_accuracy": 0.9450761683285236, "num_tokens": 161552332.0, "step": 21800 }, { "entropy": 1.9599581368267536, "epoch": 0.32633548702036513, "grad_norm": 0.33722949028015137, "learning_rate": 3.901889929018272e-05, "loss": 0.2123, "mean_token_accuracy": 0.9493962861597538, "num_tokens": 161624610.0, "step": 21810 }, { "entropy": 1.95061514377594, "epoch": 0.32648511356186916, "grad_norm": 0.2997848689556122, "learning_rate": 3.900895704730658e-05, "loss": 0.2225, "mean_token_accuracy": 0.9451621443033218, "num_tokens": 161698215.0, "step": 21820 }, { "entropy": 1.9601900659501552, "epoch": 0.32663474010337323, "grad_norm": 0.3582102656364441, "learning_rate": 3.8999011576871295e-05, "loss": 0.221, "mean_token_accuracy": 0.9441618472337723, "num_tokens": 161771814.0, "step": 21830 }, { "entropy": 1.9685291223227979, "epoch": 0.3267843666448773, "grad_norm": 0.3601633608341217, "learning_rate": 3.898906288117642e-05, "loss": 0.2297, "mean_token_accuracy": 0.9425498012453317, "num_tokens": 161847655.0, "step": 21840 }, { "entropy": 2.0029328264296056, "epoch": 0.3269339931863814, "grad_norm": 0.4203227758407593, "learning_rate": 3.8979110962522246e-05, "loss": 0.2182, "mean_token_accuracy": 0.9481376122683287, "num_tokens": 161920869.0, "step": 21850 }, { "entropy": 1.9949205078184604, "epoch": 0.3270836197278854, "grad_norm": 0.40930211544036865, "learning_rate": 3.896915582320988e-05, "loss": 0.232, "mean_token_accuracy": 0.9432474978268146, "num_tokens": 161990111.0, "step": 21860 }, { "entropy": 2.007215920090675, "epoch": 0.3272332462693895, "grad_norm": 0.3967520594596863, "learning_rate": 3.8959197465541095e-05, "loss": 0.2105, "mean_token_accuracy": 0.9459788091480732, "num_tokens": 162061571.0, "step": 21870 }, { "entropy": 1.9882694467902184, "epoch": 0.32738287281089357, "grad_norm": 0.4378608167171478, "learning_rate": 3.8949235891818444e-05, "loss": 0.245, "mean_token_accuracy": 0.9427026618272066, "num_tokens": 162135916.0, "step": 21880 }, { "entropy": 2.0088863745331764, "epoch": 0.32753249935239764, "grad_norm": 0.49103930592536926, "learning_rate": 3.893927110434524e-05, "loss": 0.259, "mean_token_accuracy": 0.9365622412413359, "num_tokens": 162207405.0, "step": 21890 }, { "entropy": 2.032796887308359, "epoch": 0.32768212589390167, "grad_norm": 0.3637041747570038, "learning_rate": 3.89293031054255e-05, "loss": 0.2256, "mean_token_accuracy": 0.9419725600630044, "num_tokens": 162280512.0, "step": 21900 }, { "entropy": 2.0212688580155374, "epoch": 0.32783175243540574, "grad_norm": 0.4264254570007324, "learning_rate": 3.8919331897364e-05, "loss": 0.2259, "mean_token_accuracy": 0.9406461082398891, "num_tokens": 162354151.0, "step": 21910 }, { "entropy": 1.993683560192585, "epoch": 0.3279813789769098, "grad_norm": 0.3256816267967224, "learning_rate": 3.890935748246628e-05, "loss": 0.2187, "mean_token_accuracy": 0.94453533180058, "num_tokens": 162427681.0, "step": 21920 }, { "entropy": 1.9639060840010643, "epoch": 0.3281310055184139, "grad_norm": 0.29746904969215393, "learning_rate": 3.889937986303858e-05, "loss": 0.2104, "mean_token_accuracy": 0.9487059436738491, "num_tokens": 162504018.0, "step": 21930 }, { "entropy": 2.0068055264651776, "epoch": 0.328280632059918, "grad_norm": 0.35065099596977234, "learning_rate": 3.888939904138792e-05, "loss": 0.2267, "mean_token_accuracy": 0.9442271359264851, "num_tokens": 162578850.0, "step": 21940 }, { "entropy": 1.9904586605727672, "epoch": 0.328430258601422, "grad_norm": 0.37796810269355774, "learning_rate": 3.8879415019822035e-05, "loss": 0.2258, "mean_token_accuracy": 0.9440772298723459, "num_tokens": 162650736.0, "step": 21950 }, { "entropy": 2.0260983295738697, "epoch": 0.3285798851429261, "grad_norm": 0.35720184445381165, "learning_rate": 3.8869427800649414e-05, "loss": 0.2262, "mean_token_accuracy": 0.9437341153621673, "num_tokens": 162722914.0, "step": 21960 }, { "entropy": 2.0135708704590796, "epoch": 0.32872951168443015, "grad_norm": 0.29358145594596863, "learning_rate": 3.885943738617927e-05, "loss": 0.2096, "mean_token_accuracy": 0.9464553758502007, "num_tokens": 162798839.0, "step": 21970 }, { "entropy": 1.982262659817934, "epoch": 0.32887913822593423, "grad_norm": 0.4329977035522461, "learning_rate": 3.884944377872158e-05, "loss": 0.207, "mean_token_accuracy": 0.94520303606987, "num_tokens": 162872994.0, "step": 21980 }, { "entropy": 2.0072369672358037, "epoch": 0.32902876476743825, "grad_norm": 0.2786324620246887, "learning_rate": 3.883944698058702e-05, "loss": 0.2196, "mean_token_accuracy": 0.9437058694660664, "num_tokens": 162947911.0, "step": 21990 }, { "entropy": 1.9870320603251457, "epoch": 0.32917839130894233, "grad_norm": 0.2841031551361084, "learning_rate": 3.882944699408706e-05, "loss": 0.2184, "mean_token_accuracy": 0.9439545970410108, "num_tokens": 163022854.0, "step": 22000 }, { "epoch": 0.32917839130894233, "eval_entropy": 1.984092717027664, "eval_loss": 0.24280153214931488, "eval_mean_token_accuracy": 0.9454244793534279, "eval_num_tokens": 163022854.0, "eval_runtime": 560.2949, "eval_samples_per_second": 35.695, "eval_steps_per_second": 8.924, "step": 22000 }, { "entropy": 1.9947519056499003, "epoch": 0.3293280178504464, "grad_norm": 0.3883761465549469, "learning_rate": 3.881944382153385e-05, "loss": 0.2287, "mean_token_accuracy": 0.9467568263411522, "num_tokens": 163097124.0, "step": 22010 }, { "entropy": 1.9650073267519474, "epoch": 0.3294776443919505, "grad_norm": 0.3093666732311249, "learning_rate": 3.88094374652403e-05, "loss": 0.2011, "mean_token_accuracy": 0.9489787604659796, "num_tokens": 163172170.0, "step": 22020 }, { "entropy": 1.9942278049886226, "epoch": 0.3296272709334545, "grad_norm": 0.33886194229125977, "learning_rate": 3.879942792752007e-05, "loss": 0.2199, "mean_token_accuracy": 0.9466099195182324, "num_tokens": 163247442.0, "step": 22030 }, { "entropy": 1.9741010949015618, "epoch": 0.3297768974749586, "grad_norm": 0.32196399569511414, "learning_rate": 3.878941521068754e-05, "loss": 0.2148, "mean_token_accuracy": 0.9476872123777866, "num_tokens": 163322716.0, "step": 22040 }, { "entropy": 2.0231268793344497, "epoch": 0.32992652401646266, "grad_norm": 0.38922715187072754, "learning_rate": 3.877939931705783e-05, "loss": 0.2329, "mean_token_accuracy": 0.9390785004943609, "num_tokens": 163397244.0, "step": 22050 }, { "entropy": 2.0104342699050903, "epoch": 0.33007615055796674, "grad_norm": 0.39372381567955017, "learning_rate": 3.876938024894679e-05, "loss": 0.2388, "mean_token_accuracy": 0.9394273795187473, "num_tokens": 163470546.0, "step": 22060 }, { "entropy": 1.9760512001812458, "epoch": 0.33022577709947076, "grad_norm": 0.35849446058273315, "learning_rate": 3.875935800867101e-05, "loss": 0.2234, "mean_token_accuracy": 0.9438125740736723, "num_tokens": 163542740.0, "step": 22070 }, { "entropy": 1.9456640169024468, "epoch": 0.33037540364097484, "grad_norm": 0.29396793246269226, "learning_rate": 3.8749332598547795e-05, "loss": 0.2145, "mean_token_accuracy": 0.9456471778452397, "num_tokens": 163616598.0, "step": 22080 }, { "entropy": 1.9560938701033592, "epoch": 0.3305250301824789, "grad_norm": 0.33489927649497986, "learning_rate": 3.873930402089522e-05, "loss": 0.2069, "mean_token_accuracy": 0.9448212962597609, "num_tokens": 163691681.0, "step": 22090 }, { "entropy": 1.947559378296137, "epoch": 0.330674656723983, "grad_norm": 0.3570326566696167, "learning_rate": 3.8729272278032045e-05, "loss": 0.2211, "mean_token_accuracy": 0.9434581238776445, "num_tokens": 163763139.0, "step": 22100 }, { "entropy": 1.949570919573307, "epoch": 0.3308242832654871, "grad_norm": 0.29445546865463257, "learning_rate": 3.8719237372277826e-05, "loss": 0.2012, "mean_token_accuracy": 0.9492198441177606, "num_tokens": 163837047.0, "step": 22110 }, { "entropy": 1.9799493305385112, "epoch": 0.3309739098069911, "grad_norm": 0.4709635376930237, "learning_rate": 3.8709199305952776e-05, "loss": 0.2253, "mean_token_accuracy": 0.945633015781641, "num_tokens": 163908952.0, "step": 22120 }, { "entropy": 1.9920643419027328, "epoch": 0.3311235363484952, "grad_norm": 0.3318102955818176, "learning_rate": 3.8699158081377886e-05, "loss": 0.221, "mean_token_accuracy": 0.946069548651576, "num_tokens": 163983292.0, "step": 22130 }, { "entropy": 1.9889032244682312, "epoch": 0.33127316288999925, "grad_norm": 0.2715649902820587, "learning_rate": 3.8689113700874875e-05, "loss": 0.2155, "mean_token_accuracy": 0.9487286407500506, "num_tokens": 164056774.0, "step": 22140 }, { "entropy": 2.0127250850200653, "epoch": 0.33142278943150333, "grad_norm": 0.291069895029068, "learning_rate": 3.8679066166766165e-05, "loss": 0.2138, "mean_token_accuracy": 0.9456589709967375, "num_tokens": 164132069.0, "step": 22150 }, { "entropy": 2.015047777444124, "epoch": 0.33157241597300735, "grad_norm": 0.4519747197628021, "learning_rate": 3.8669015481374936e-05, "loss": 0.2136, "mean_token_accuracy": 0.9462128173559904, "num_tokens": 164206344.0, "step": 22160 }, { "entropy": 1.9632880724966526, "epoch": 0.33172204251451143, "grad_norm": 0.3658117949962616, "learning_rate": 3.865896164702509e-05, "loss": 0.2076, "mean_token_accuracy": 0.9492143057286739, "num_tokens": 164278842.0, "step": 22170 }, { "entropy": 1.9718986608088016, "epoch": 0.3318716690560155, "grad_norm": 0.4263376295566559, "learning_rate": 3.864890466604124e-05, "loss": 0.2277, "mean_token_accuracy": 0.9421748846769333, "num_tokens": 164354290.0, "step": 22180 }, { "entropy": 1.9770046323537827, "epoch": 0.3320212955975196, "grad_norm": 0.3859645128250122, "learning_rate": 3.863884454074874e-05, "loss": 0.2046, "mean_token_accuracy": 0.9482002187520265, "num_tokens": 164427628.0, "step": 22190 }, { "entropy": 1.9907614447176456, "epoch": 0.3321709221390236, "grad_norm": 0.38428595662117004, "learning_rate": 3.862878127347368e-05, "loss": 0.2253, "mean_token_accuracy": 0.9448198597878218, "num_tokens": 164498394.0, "step": 22200 }, { "entropy": 2.013235003501177, "epoch": 0.3323205486805277, "grad_norm": 0.3255077004432678, "learning_rate": 3.861871486654286e-05, "loss": 0.216, "mean_token_accuracy": 0.9478859852999448, "num_tokens": 164573016.0, "step": 22210 }, { "entropy": 2.02057753354311, "epoch": 0.33247017522203176, "grad_norm": 0.34081074595451355, "learning_rate": 3.860864532228382e-05, "loss": 0.2291, "mean_token_accuracy": 0.9440531175583601, "num_tokens": 164648557.0, "step": 22220 }, { "entropy": 1.964355606585741, "epoch": 0.33261980176353584, "grad_norm": 0.3173394501209259, "learning_rate": 3.8598572643024794e-05, "loss": 0.1986, "mean_token_accuracy": 0.9502705112099648, "num_tokens": 164723907.0, "step": 22230 }, { "entropy": 1.9810654371976852, "epoch": 0.3327694283050399, "grad_norm": 0.333822101354599, "learning_rate": 3.8588496831094797e-05, "loss": 0.2428, "mean_token_accuracy": 0.9424056190997362, "num_tokens": 164797241.0, "step": 22240 }, { "entropy": 1.985083206743002, "epoch": 0.33291905484654394, "grad_norm": 0.33599618077278137, "learning_rate": 3.857841788882351e-05, "loss": 0.2318, "mean_token_accuracy": 0.9448844894766808, "num_tokens": 164870567.0, "step": 22250 }, { "entropy": 1.9875101156532764, "epoch": 0.333068681388048, "grad_norm": 0.3883637487888336, "learning_rate": 3.8568335818541385e-05, "loss": 0.2129, "mean_token_accuracy": 0.9459547851234674, "num_tokens": 164947524.0, "step": 22260 }, { "entropy": 1.9986580431461334, "epoch": 0.3332183079295521, "grad_norm": 0.3494413495063782, "learning_rate": 3.855825062257955e-05, "loss": 0.2268, "mean_token_accuracy": 0.9417286153882742, "num_tokens": 165020527.0, "step": 22270 }, { "entropy": 2.0103697285056112, "epoch": 0.33336793447105617, "grad_norm": 0.3924461007118225, "learning_rate": 3.8548162303269915e-05, "loss": 0.246, "mean_token_accuracy": 0.9407783579081297, "num_tokens": 165092675.0, "step": 22280 }, { "entropy": 2.0127294093370436, "epoch": 0.3335175610125602, "grad_norm": 0.4026166796684265, "learning_rate": 3.8538070862945045e-05, "loss": 0.2113, "mean_token_accuracy": 0.9490899715572596, "num_tokens": 165167796.0, "step": 22290 }, { "entropy": 2.027315577864647, "epoch": 0.33366718755406427, "grad_norm": 0.408602774143219, "learning_rate": 3.852797630393828e-05, "loss": 0.2217, "mean_token_accuracy": 0.9447690561413765, "num_tokens": 165246609.0, "step": 22300 }, { "entropy": 2.0412926405668257, "epoch": 0.33381681409556835, "grad_norm": 0.39664673805236816, "learning_rate": 3.851787862858367e-05, "loss": 0.229, "mean_token_accuracy": 0.9428691904991865, "num_tokens": 165316268.0, "step": 22310 }, { "entropy": 1.9958080969750882, "epoch": 0.3339664406370724, "grad_norm": 0.2754150331020355, "learning_rate": 3.8507777839215946e-05, "loss": 0.2067, "mean_token_accuracy": 0.9483322449028492, "num_tokens": 165392222.0, "step": 22320 }, { "entropy": 1.989423394203186, "epoch": 0.33411606717857645, "grad_norm": 0.38209885358810425, "learning_rate": 3.849767393817061e-05, "loss": 0.2272, "mean_token_accuracy": 0.9427867665886879, "num_tokens": 165464842.0, "step": 22330 }, { "entropy": 1.9861025840044022, "epoch": 0.3342656937200805, "grad_norm": 0.3378436863422394, "learning_rate": 3.848756692778388e-05, "loss": 0.222, "mean_token_accuracy": 0.9442888684570789, "num_tokens": 165537609.0, "step": 22340 }, { "entropy": 1.9796036012470721, "epoch": 0.3344153202615846, "grad_norm": 0.42756444215774536, "learning_rate": 3.8477456810392645e-05, "loss": 0.2332, "mean_token_accuracy": 0.9443303264677525, "num_tokens": 165613384.0, "step": 22350 }, { "entropy": 1.9721853196620942, "epoch": 0.3345649468030887, "grad_norm": 0.3878195583820343, "learning_rate": 3.8467343588334565e-05, "loss": 0.2189, "mean_token_accuracy": 0.9427981745451689, "num_tokens": 165688650.0, "step": 22360 }, { "entropy": 1.9629192598164082, "epoch": 0.3347145733445927, "grad_norm": 0.3269806206226349, "learning_rate": 3.845722726394799e-05, "loss": 0.2101, "mean_token_accuracy": 0.9468015395104885, "num_tokens": 165764963.0, "step": 22370 }, { "entropy": 1.9656088538467884, "epoch": 0.3348641998860968, "grad_norm": 0.3811371922492981, "learning_rate": 3.844710783957199e-05, "loss": 0.2115, "mean_token_accuracy": 0.9466866906732321, "num_tokens": 165838988.0, "step": 22380 }, { "entropy": 1.9964581154286862, "epoch": 0.33501382642760086, "grad_norm": 0.38405466079711914, "learning_rate": 3.843698531754637e-05, "loss": 0.2305, "mean_token_accuracy": 0.9400617584586144, "num_tokens": 165913235.0, "step": 22390 }, { "entropy": 1.9889946311712265, "epoch": 0.33516345296910494, "grad_norm": 0.28389832377433777, "learning_rate": 3.842685970021161e-05, "loss": 0.2235, "mean_token_accuracy": 0.9433514337986708, "num_tokens": 165988131.0, "step": 22400 }, { "entropy": 1.967279040068388, "epoch": 0.335313079510609, "grad_norm": 0.33313578367233276, "learning_rate": 3.8416730989908964e-05, "loss": 0.2054, "mean_token_accuracy": 0.9457957621663808, "num_tokens": 166064206.0, "step": 22410 }, { "entropy": 1.9666185714304447, "epoch": 0.33546270605211304, "grad_norm": 0.3528568148612976, "learning_rate": 3.8406599188980345e-05, "loss": 0.2202, "mean_token_accuracy": 0.9473166991025209, "num_tokens": 166138974.0, "step": 22420 }, { "entropy": 1.9873205877840519, "epoch": 0.3356123325936171, "grad_norm": 0.3034018874168396, "learning_rate": 3.839646429976843e-05, "loss": 0.214, "mean_token_accuracy": 0.9425133876502514, "num_tokens": 166213737.0, "step": 22430 }, { "entropy": 1.9689572058618068, "epoch": 0.3357619591351212, "grad_norm": 0.342240571975708, "learning_rate": 3.838632632461656e-05, "loss": 0.2135, "mean_token_accuracy": 0.9487418826669455, "num_tokens": 166286471.0, "step": 22440 }, { "entropy": 1.9795271143317223, "epoch": 0.33591158567662527, "grad_norm": 0.349244087934494, "learning_rate": 3.8376185265868835e-05, "loss": 0.2221, "mean_token_accuracy": 0.9435827914625406, "num_tokens": 166359597.0, "step": 22450 }, { "entropy": 1.9884016081690787, "epoch": 0.3360612122181293, "grad_norm": 0.31827735900878906, "learning_rate": 3.8366041125870035e-05, "loss": 0.2281, "mean_token_accuracy": 0.9439912039786578, "num_tokens": 166433703.0, "step": 22460 }, { "entropy": 1.9906642042100429, "epoch": 0.33621083875963337, "grad_norm": 0.37262120842933655, "learning_rate": 3.8355893906965676e-05, "loss": 0.2158, "mean_token_accuracy": 0.9450167387723922, "num_tokens": 166506633.0, "step": 22470 }, { "entropy": 1.9850214943289757, "epoch": 0.33636046530113745, "grad_norm": 0.36646273732185364, "learning_rate": 3.834574361150197e-05, "loss": 0.227, "mean_token_accuracy": 0.9426586218178272, "num_tokens": 166579717.0, "step": 22480 }, { "entropy": 1.9831901043653488, "epoch": 0.3365100918426415, "grad_norm": 0.46940261125564575, "learning_rate": 3.833559024182584e-05, "loss": 0.2252, "mean_token_accuracy": 0.9434010289609432, "num_tokens": 166656778.0, "step": 22490 }, { "entropy": 1.9995835065841674, "epoch": 0.33665971838414555, "grad_norm": 0.3591897189617157, "learning_rate": 3.832543380028495e-05, "loss": 0.2068, "mean_token_accuracy": 0.9477128904312849, "num_tokens": 166731960.0, "step": 22500 }, { "entropy": 1.9835202097892761, "epoch": 0.3368093449256496, "grad_norm": 0.28715255856513977, "learning_rate": 3.831527428922762e-05, "loss": 0.2192, "mean_token_accuracy": 0.9474842969328165, "num_tokens": 166808581.0, "step": 22510 }, { "entropy": 1.9983441658318042, "epoch": 0.3369589714671537, "grad_norm": 0.40073856711387634, "learning_rate": 3.8305111711002916e-05, "loss": 0.2293, "mean_token_accuracy": 0.9438222028315068, "num_tokens": 166883693.0, "step": 22520 }, { "entropy": 2.0246086359024047, "epoch": 0.3371085980086578, "grad_norm": 0.4178582727909088, "learning_rate": 3.829494606796062e-05, "loss": 0.2259, "mean_token_accuracy": 0.944524110853672, "num_tokens": 166957017.0, "step": 22530 }, { "entropy": 1.9891228027641774, "epoch": 0.33725822455016186, "grad_norm": 0.28491654992103577, "learning_rate": 3.82847773624512e-05, "loss": 0.223, "mean_token_accuracy": 0.9438227467238903, "num_tokens": 167031159.0, "step": 22540 }, { "entropy": 2.0074817262589932, "epoch": 0.3374078510916659, "grad_norm": 0.35180261731147766, "learning_rate": 3.827460559682585e-05, "loss": 0.2163, "mean_token_accuracy": 0.9468038789927959, "num_tokens": 167107109.0, "step": 22550 }, { "entropy": 2.0127397678792476, "epoch": 0.33755747763316996, "grad_norm": 0.40493640303611755, "learning_rate": 3.826443077343645e-05, "loss": 0.2436, "mean_token_accuracy": 0.94097690731287, "num_tokens": 167178330.0, "step": 22560 }, { "entropy": 2.0012123823165893, "epoch": 0.33770710417467403, "grad_norm": 0.35406494140625, "learning_rate": 3.825425289463561e-05, "loss": 0.2139, "mean_token_accuracy": 0.9445201061666012, "num_tokens": 167253525.0, "step": 22570 }, { "entropy": 1.982150959223509, "epoch": 0.3378567307161781, "grad_norm": 0.3615398705005646, "learning_rate": 3.824407196277663e-05, "loss": 0.2129, "mean_token_accuracy": 0.9488407384604216, "num_tokens": 167328276.0, "step": 22580 }, { "entropy": 1.974751351773739, "epoch": 0.33800635725768213, "grad_norm": 0.32915040850639343, "learning_rate": 3.823388798021352e-05, "loss": 0.2211, "mean_token_accuracy": 0.9452420361340046, "num_tokens": 167402691.0, "step": 22590 }, { "entropy": 1.9997020199894906, "epoch": 0.3381559837991862, "grad_norm": 0.28292548656463623, "learning_rate": 3.822370094930102e-05, "loss": 0.2209, "mean_token_accuracy": 0.944814781844616, "num_tokens": 167477560.0, "step": 22600 }, { "entropy": 2.0099263824522495, "epoch": 0.3383056103406903, "grad_norm": 0.4152122139930725, "learning_rate": 3.8213510872394527e-05, "loss": 0.2126, "mean_token_accuracy": 0.9452424012124538, "num_tokens": 167550774.0, "step": 22610 }, { "entropy": 1.99155660495162, "epoch": 0.33845523688219437, "grad_norm": 0.41171714663505554, "learning_rate": 3.820331775185018e-05, "loss": 0.2247, "mean_token_accuracy": 0.9456832867115736, "num_tokens": 167623134.0, "step": 22620 }, { "entropy": 2.006849817931652, "epoch": 0.3386048634236984, "grad_norm": 0.31894227862358093, "learning_rate": 3.819312159002481e-05, "loss": 0.2094, "mean_token_accuracy": 0.9501057080924511, "num_tokens": 167698149.0, "step": 22630 }, { "entropy": 2.0163633465766906, "epoch": 0.33875448996520247, "grad_norm": 0.36198076605796814, "learning_rate": 3.818292238927595e-05, "loss": 0.214, "mean_token_accuracy": 0.9464807070791721, "num_tokens": 167771687.0, "step": 22640 }, { "entropy": 2.032291793823242, "epoch": 0.33890411650670654, "grad_norm": 0.3464234471321106, "learning_rate": 3.817272015196184e-05, "loss": 0.2225, "mean_token_accuracy": 0.9428748242557049, "num_tokens": 167843821.0, "step": 22650 }, { "entropy": 2.032166563719511, "epoch": 0.3390537430482106, "grad_norm": 0.3723832368850708, "learning_rate": 3.8162514880441395e-05, "loss": 0.2142, "mean_token_accuracy": 0.9415746599435806, "num_tokens": 167917269.0, "step": 22660 }, { "entropy": 2.0131359875202177, "epoch": 0.3392033695897147, "grad_norm": 0.32584264874458313, "learning_rate": 3.8152306577074284e-05, "loss": 0.2255, "mean_token_accuracy": 0.9457547824829817, "num_tokens": 167990250.0, "step": 22670 }, { "entropy": 1.978609497100115, "epoch": 0.3393529961312187, "grad_norm": 0.40151363611221313, "learning_rate": 3.8142095244220844e-05, "loss": 0.2103, "mean_token_accuracy": 0.9466174811124801, "num_tokens": 168065061.0, "step": 22680 }, { "entropy": 1.967474202811718, "epoch": 0.3395026226727228, "grad_norm": 0.34766316413879395, "learning_rate": 3.8131880884242114e-05, "loss": 0.1996, "mean_token_accuracy": 0.9491662163287401, "num_tokens": 168140405.0, "step": 22690 }, { "entropy": 1.9728846274316312, "epoch": 0.3396522492142269, "grad_norm": 0.39087334275245667, "learning_rate": 3.812166349949982e-05, "loss": 0.2212, "mean_token_accuracy": 0.945611210912466, "num_tokens": 168213220.0, "step": 22700 }, { "entropy": 1.9953075408935548, "epoch": 0.33980187575573095, "grad_norm": 0.4397093951702118, "learning_rate": 3.811144309235643e-05, "loss": 0.2354, "mean_token_accuracy": 0.9421325724571943, "num_tokens": 168284072.0, "step": 22710 }, { "entropy": 2.006800177693367, "epoch": 0.339951502297235, "grad_norm": 0.2698858678340912, "learning_rate": 3.810121966517506e-05, "loss": 0.2054, "mean_token_accuracy": 0.9460940405726432, "num_tokens": 168361882.0, "step": 22720 }, { "entropy": 2.0176710568368437, "epoch": 0.34010112883873905, "grad_norm": 0.32487982511520386, "learning_rate": 3.8090993220319564e-05, "loss": 0.2146, "mean_token_accuracy": 0.9448831107467413, "num_tokens": 168433910.0, "step": 22730 }, { "entropy": 2.014442837238312, "epoch": 0.34025075538024313, "grad_norm": 0.32062992453575134, "learning_rate": 3.808076376015447e-05, "loss": 0.2365, "mean_token_accuracy": 0.9427271839231253, "num_tokens": 168506596.0, "step": 22740 }, { "entropy": 2.001173871010542, "epoch": 0.3404003819217472, "grad_norm": 0.3502158522605896, "learning_rate": 3.807053128704501e-05, "loss": 0.2219, "mean_token_accuracy": 0.9434507202357054, "num_tokens": 168579666.0, "step": 22750 }, { "entropy": 1.9657455727458, "epoch": 0.34055000846325123, "grad_norm": 0.4495643377304077, "learning_rate": 3.806029580335712e-05, "loss": 0.233, "mean_token_accuracy": 0.9418537691235542, "num_tokens": 168651765.0, "step": 22760 }, { "entropy": 1.9818620055913925, "epoch": 0.3406996350047553, "grad_norm": 0.32124900817871094, "learning_rate": 3.805005731145743e-05, "loss": 0.197, "mean_token_accuracy": 0.9500485964119434, "num_tokens": 168724225.0, "step": 22770 }, { "entropy": 1.9738273717463017, "epoch": 0.3408492615462594, "grad_norm": 0.5319764614105225, "learning_rate": 3.803981581371325e-05, "loss": 0.2157, "mean_token_accuracy": 0.9453102320432663, "num_tokens": 168798274.0, "step": 22780 }, { "entropy": 1.9728849284350871, "epoch": 0.34099888808776346, "grad_norm": 0.4935317635536194, "learning_rate": 3.802957131249259e-05, "loss": 0.2185, "mean_token_accuracy": 0.9478708177804946, "num_tokens": 168872597.0, "step": 22790 }, { "entropy": 2.0031559698283674, "epoch": 0.3411485146292675, "grad_norm": 0.33401283621788025, "learning_rate": 3.8019323810164185e-05, "loss": 0.2224, "mean_token_accuracy": 0.9448565445840359, "num_tokens": 168949215.0, "step": 22800 }, { "entropy": 2.0192716658115386, "epoch": 0.34129814117077156, "grad_norm": 0.42012497782707214, "learning_rate": 3.8009073309097435e-05, "loss": 0.2299, "mean_token_accuracy": 0.9414010502398014, "num_tokens": 169025774.0, "step": 22810 }, { "entropy": 1.994770310819149, "epoch": 0.34144776771227564, "grad_norm": 0.3326359689235687, "learning_rate": 3.7998819811662415e-05, "loss": 0.2204, "mean_token_accuracy": 0.9447783924639225, "num_tokens": 169097540.0, "step": 22820 }, { "entropy": 1.993638276308775, "epoch": 0.3415973942537797, "grad_norm": 0.428134024143219, "learning_rate": 3.798856332022992e-05, "loss": 0.2164, "mean_token_accuracy": 0.9461646623909473, "num_tokens": 169173635.0, "step": 22830 }, { "entropy": 1.9706661030650139, "epoch": 0.3417470207952838, "grad_norm": 0.3939938545227051, "learning_rate": 3.797830383717146e-05, "loss": 0.2319, "mean_token_accuracy": 0.9438707262277604, "num_tokens": 169249926.0, "step": 22840 }, { "entropy": 1.9754851102828979, "epoch": 0.3418966473367878, "grad_norm": 0.4234197735786438, "learning_rate": 3.7968041364859197e-05, "loss": 0.2292, "mean_token_accuracy": 0.9411979436874389, "num_tokens": 169325409.0, "step": 22850 }, { "entropy": 2.0119520142674445, "epoch": 0.3420462738782919, "grad_norm": 0.5001817941665649, "learning_rate": 3.7957775905665994e-05, "loss": 0.2297, "mean_token_accuracy": 0.9439186301082373, "num_tokens": 169400930.0, "step": 22860 }, { "entropy": 1.9859436497092247, "epoch": 0.342195900419796, "grad_norm": 0.31200987100601196, "learning_rate": 3.79475074619654e-05, "loss": 0.2234, "mean_token_accuracy": 0.9457449648529291, "num_tokens": 169476342.0, "step": 22870 }, { "entropy": 2.0226414375007153, "epoch": 0.34234552696130005, "grad_norm": 0.3898511230945587, "learning_rate": 3.793723603613168e-05, "loss": 0.2136, "mean_token_accuracy": 0.9461279354989529, "num_tokens": 169551401.0, "step": 22880 }, { "entropy": 2.0437833279371262, "epoch": 0.3424951535028041, "grad_norm": 0.323141872882843, "learning_rate": 3.7926961630539753e-05, "loss": 0.2267, "mean_token_accuracy": 0.9444992698729038, "num_tokens": 169624185.0, "step": 22890 }, { "entropy": 2.015289480239153, "epoch": 0.34264478004430815, "grad_norm": 0.36977940797805786, "learning_rate": 3.791668424756525e-05, "loss": 0.2302, "mean_token_accuracy": 0.942643329501152, "num_tokens": 169698352.0, "step": 22900 }, { "entropy": 2.017540106922388, "epoch": 0.34279440658581223, "grad_norm": 0.3740963041782379, "learning_rate": 3.790640388958449e-05, "loss": 0.1969, "mean_token_accuracy": 0.9530144531279803, "num_tokens": 169770764.0, "step": 22910 }, { "entropy": 2.003644347935915, "epoch": 0.3429440331273163, "grad_norm": 0.2741229236125946, "learning_rate": 3.789612055897447e-05, "loss": 0.2214, "mean_token_accuracy": 0.9436117220669985, "num_tokens": 169842991.0, "step": 22920 }, { "entropy": 1.9877101913094521, "epoch": 0.3430936596688203, "grad_norm": 0.28630098700523376, "learning_rate": 3.7885834258112876e-05, "loss": 0.2058, "mean_token_accuracy": 0.9502271637320518, "num_tokens": 169922802.0, "step": 22930 }, { "entropy": 1.9902968160808086, "epoch": 0.3432432862103244, "grad_norm": 0.39478009939193726, "learning_rate": 3.7875544989378095e-05, "loss": 0.1956, "mean_token_accuracy": 0.9487415678799153, "num_tokens": 169998269.0, "step": 22940 }, { "entropy": 1.9926106356084348, "epoch": 0.3433929127518285, "grad_norm": 0.39118868112564087, "learning_rate": 3.786525275514918e-05, "loss": 0.2084, "mean_token_accuracy": 0.9488235156983137, "num_tokens": 170073208.0, "step": 22950 }, { "entropy": 1.9972306117415428, "epoch": 0.34354253929333256, "grad_norm": 0.3511309325695038, "learning_rate": 3.785495755780587e-05, "loss": 0.2042, "mean_token_accuracy": 0.9496672347187995, "num_tokens": 170146234.0, "step": 22960 }, { "entropy": 1.9996977671980858, "epoch": 0.34369216583483664, "grad_norm": 0.37187445163726807, "learning_rate": 3.7844659399728626e-05, "loss": 0.2263, "mean_token_accuracy": 0.9438729170709849, "num_tokens": 170219538.0, "step": 22970 }, { "entropy": 2.0048478439450266, "epoch": 0.34384179237634066, "grad_norm": 0.3165706992149353, "learning_rate": 3.7834358283298534e-05, "loss": 0.1842, "mean_token_accuracy": 0.9544384509325028, "num_tokens": 170293173.0, "step": 22980 }, { "entropy": 2.047573671489954, "epoch": 0.34399141891784474, "grad_norm": 0.4817623794078827, "learning_rate": 3.782405421089741e-05, "loss": 0.2401, "mean_token_accuracy": 0.9407077964395285, "num_tokens": 170363769.0, "step": 22990 }, { "entropy": 2.0440934896469116, "epoch": 0.3441410454593488, "grad_norm": 0.3303025960922241, "learning_rate": 3.781374718490774e-05, "loss": 0.2096, "mean_token_accuracy": 0.9483917437493801, "num_tokens": 170437591.0, "step": 23000 }, { "epoch": 0.3441410454593488, "eval_entropy": 2.0569298552274704, "eval_loss": 0.24171218276023865, "eval_mean_token_accuracy": 0.9456899745345115, "eval_num_tokens": 170437591.0, "eval_runtime": 558.9131, "eval_samples_per_second": 35.784, "eval_steps_per_second": 8.946, "step": 23000 } ], "logging_steps": 10, "max_steps": 66834, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.7075226725891178e+19, "train_batch_size": 4, "trial_name": null, "trial_params": null }