{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 804, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1260029673576355, "epoch": 0.0037313432835820895, "grad_norm": 1.6953052282333374, "learning_rate": 0.0002, "loss": 2.460799217224121, "mean_token_accuracy": 0.5385793447494507, "num_tokens": 16458.0, "step": 1 }, { "entropy": 1.2484523057937622, "epoch": 0.007462686567164179, "grad_norm": 1.5863436460494995, "learning_rate": 0.0002, "loss": 2.1654767990112305, "mean_token_accuracy": 0.5669277608394623, "num_tokens": 32789.0, "step": 2 }, { "entropy": 1.4055505394935608, "epoch": 0.011194029850746268, "grad_norm": 1.1718486547470093, "learning_rate": 0.0002, "loss": 1.714382290840149, "mean_token_accuracy": 0.5935665369033813, "num_tokens": 49349.0, "step": 3 }, { "entropy": 1.3796880543231964, "epoch": 0.014925373134328358, "grad_norm": 0.9294341802597046, "learning_rate": 0.0002, "loss": 1.3914273977279663, "mean_token_accuracy": 0.6369634121656418, "num_tokens": 65829.0, "step": 4 }, { "entropy": 1.3194991052150726, "epoch": 0.018656716417910446, "grad_norm": 1.0537753105163574, "learning_rate": 0.0002, "loss": 1.2675070762634277, "mean_token_accuracy": 0.6544732749462128, "num_tokens": 82394.0, "step": 5 }, { "entropy": 1.2329450845718384, "epoch": 0.022388059701492536, "grad_norm": 0.5125759840011597, "learning_rate": 0.0002, "loss": 1.1630359888076782, "mean_token_accuracy": 0.6683834344148636, "num_tokens": 98903.0, "step": 6 }, { "entropy": 1.1502311825752258, "epoch": 0.026119402985074626, "grad_norm": 0.39078545570373535, "learning_rate": 0.0002, "loss": 1.0693285465240479, "mean_token_accuracy": 0.675154522061348, "num_tokens": 115247.0, "step": 7 }, { "entropy": 1.0659821331501007, "epoch": 0.029850746268656716, "grad_norm": 0.4620763957500458, "learning_rate": 0.0002, "loss": 1.0068438053131104, "mean_token_accuracy": 0.6829047352075577, "num_tokens": 131731.0, "step": 8 }, { "entropy": 1.0000898838043213, "epoch": 0.033582089552238806, "grad_norm": 0.5140990614891052, "learning_rate": 0.0002, "loss": 0.9476600885391235, "mean_token_accuracy": 0.6949260085821152, "num_tokens": 148350.0, "step": 9 }, { "entropy": 0.9560111612081528, "epoch": 0.03731343283582089, "grad_norm": 0.497260719537735, "learning_rate": 0.0002, "loss": 0.8725440502166748, "mean_token_accuracy": 0.710997924208641, "num_tokens": 164467.0, "step": 10 }, { "entropy": 0.9134543389081955, "epoch": 0.041044776119402986, "grad_norm": 0.45270034670829773, "learning_rate": 0.0002, "loss": 0.8241041898727417, "mean_token_accuracy": 0.7159350216388702, "num_tokens": 180927.0, "step": 11 }, { "entropy": 0.798617348074913, "epoch": 0.04477611940298507, "grad_norm": 0.48476189374923706, "learning_rate": 0.0002, "loss": 0.770041286945343, "mean_token_accuracy": 0.7293703109025955, "num_tokens": 197219.0, "step": 12 }, { "entropy": 0.7840605825185776, "epoch": 0.048507462686567165, "grad_norm": 0.40834739804267883, "learning_rate": 0.0002, "loss": 0.7530187368392944, "mean_token_accuracy": 0.7250247299671173, "num_tokens": 213644.0, "step": 13 }, { "entropy": 0.7022175937891006, "epoch": 0.05223880597014925, "grad_norm": 0.40251079201698303, "learning_rate": 0.0002, "loss": 0.7203142046928406, "mean_token_accuracy": 0.734594002366066, "num_tokens": 229979.0, "step": 14 }, { "entropy": 0.7001681327819824, "epoch": 0.055970149253731345, "grad_norm": 0.35986149311065674, "learning_rate": 0.0002, "loss": 0.7040289044380188, "mean_token_accuracy": 0.7360049784183502, "num_tokens": 246473.0, "step": 15 }, { "entropy": 0.6849737167358398, "epoch": 0.05970149253731343, "grad_norm": 0.33282366394996643, "learning_rate": 0.0002, "loss": 0.6554020047187805, "mean_token_accuracy": 0.7522932589054108, "num_tokens": 262988.0, "step": 16 }, { "entropy": 0.6813573390245438, "epoch": 0.06343283582089553, "grad_norm": 0.3554367423057556, "learning_rate": 0.0002, "loss": 0.6626776456832886, "mean_token_accuracy": 0.7477623820304871, "num_tokens": 279264.0, "step": 17 }, { "entropy": 0.6491282731294632, "epoch": 0.06716417910447761, "grad_norm": 0.312103271484375, "learning_rate": 0.0002, "loss": 0.6249456405639648, "mean_token_accuracy": 0.7609707713127136, "num_tokens": 295556.0, "step": 18 }, { "entropy": 0.6441417187452316, "epoch": 0.0708955223880597, "grad_norm": 0.33169475197792053, "learning_rate": 0.0002, "loss": 0.6275812387466431, "mean_token_accuracy": 0.755386084318161, "num_tokens": 311911.0, "step": 19 }, { "entropy": 0.63529072701931, "epoch": 0.07462686567164178, "grad_norm": 0.30479201674461365, "learning_rate": 0.0002, "loss": 0.6244862079620361, "mean_token_accuracy": 0.757283627986908, "num_tokens": 328411.0, "step": 20 }, { "entropy": 0.5928637981414795, "epoch": 0.07835820895522388, "grad_norm": 0.339279443025589, "learning_rate": 0.0002, "loss": 0.6037462949752808, "mean_token_accuracy": 0.7652928382158279, "num_tokens": 344891.0, "step": 21 }, { "entropy": 0.5829604864120483, "epoch": 0.08208955223880597, "grad_norm": 0.27806463837623596, "learning_rate": 0.0002, "loss": 0.5940107107162476, "mean_token_accuracy": 0.7702941447496414, "num_tokens": 361235.0, "step": 22 }, { "entropy": 0.5957961678504944, "epoch": 0.08582089552238806, "grad_norm": 0.24885332584381104, "learning_rate": 0.0002, "loss": 0.5948885679244995, "mean_token_accuracy": 0.7657869160175323, "num_tokens": 377384.0, "step": 23 }, { "entropy": 0.6124956607818604, "epoch": 0.08955223880597014, "grad_norm": 0.25812840461730957, "learning_rate": 0.0002, "loss": 0.6049087047576904, "mean_token_accuracy": 0.7600619345903397, "num_tokens": 393591.0, "step": 24 }, { "entropy": 0.6115936785936356, "epoch": 0.09328358208955224, "grad_norm": 0.24209237098693848, "learning_rate": 0.0002, "loss": 0.5928857326507568, "mean_token_accuracy": 0.7660015225410461, "num_tokens": 410275.0, "step": 25 }, { "entropy": 0.6117522269487381, "epoch": 0.09701492537313433, "grad_norm": 0.2623499631881714, "learning_rate": 0.0002, "loss": 0.6010225415229797, "mean_token_accuracy": 0.7596103847026825, "num_tokens": 426343.0, "step": 26 }, { "entropy": 0.5846991240978241, "epoch": 0.10074626865671642, "grad_norm": 0.255848228931427, "learning_rate": 0.0002, "loss": 0.5731462836265564, "mean_token_accuracy": 0.7730763554573059, "num_tokens": 442529.0, "step": 27 }, { "entropy": 0.5835026651620865, "epoch": 0.1044776119402985, "grad_norm": 0.26115483045578003, "learning_rate": 0.0002, "loss": 0.5819462537765503, "mean_token_accuracy": 0.7699420154094696, "num_tokens": 458911.0, "step": 28 }, { "entropy": 0.5770604312419891, "epoch": 0.10820895522388059, "grad_norm": 0.21723432838916779, "learning_rate": 0.0002, "loss": 0.5792397856712341, "mean_token_accuracy": 0.7707104980945587, "num_tokens": 475390.0, "step": 29 }, { "entropy": 0.5611739307641983, "epoch": 0.11194029850746269, "grad_norm": 0.22502686083316803, "learning_rate": 0.0002, "loss": 0.5769323706626892, "mean_token_accuracy": 0.7717459946870804, "num_tokens": 491664.0, "step": 30 }, { "entropy": 0.5530466288328171, "epoch": 0.11567164179104478, "grad_norm": 0.24965344369411469, "learning_rate": 0.0002, "loss": 0.5644280910491943, "mean_token_accuracy": 0.7790123075246811, "num_tokens": 508002.0, "step": 31 }, { "entropy": 0.5743643939495087, "epoch": 0.11940298507462686, "grad_norm": 0.23363712430000305, "learning_rate": 0.0002, "loss": 0.5805435180664062, "mean_token_accuracy": 0.7706304490566254, "num_tokens": 524313.0, "step": 32 }, { "entropy": 0.5664798021316528, "epoch": 0.12313432835820895, "grad_norm": 0.2516216039657593, "learning_rate": 0.0002, "loss": 0.5730225443840027, "mean_token_accuracy": 0.7700050920248032, "num_tokens": 540778.0, "step": 33 }, { "entropy": 0.5729327946901321, "epoch": 0.12686567164179105, "grad_norm": 0.19088800251483917, "learning_rate": 0.0002, "loss": 0.570796012878418, "mean_token_accuracy": 0.7728039622306824, "num_tokens": 557177.0, "step": 34 }, { "entropy": 0.5797266364097595, "epoch": 0.13059701492537312, "grad_norm": 0.23257242143154144, "learning_rate": 0.0002, "loss": 0.5671622157096863, "mean_token_accuracy": 0.7741479426622391, "num_tokens": 573749.0, "step": 35 }, { "entropy": 0.571784034371376, "epoch": 0.13432835820895522, "grad_norm": 0.20902124047279358, "learning_rate": 0.0002, "loss": 0.5635585784912109, "mean_token_accuracy": 0.776234894990921, "num_tokens": 590172.0, "step": 36 }, { "entropy": 0.5775258988142014, "epoch": 0.13805970149253732, "grad_norm": 0.21658626198768616, "learning_rate": 0.0002, "loss": 0.577404797077179, "mean_token_accuracy": 0.7704328000545502, "num_tokens": 606865.0, "step": 37 }, { "entropy": 0.5636124461889267, "epoch": 0.1417910447761194, "grad_norm": 0.181837797164917, "learning_rate": 0.0002, "loss": 0.5649010539054871, "mean_token_accuracy": 0.774622842669487, "num_tokens": 623186.0, "step": 38 }, { "entropy": 0.5586818605661392, "epoch": 0.1455223880597015, "grad_norm": 0.19703401625156403, "learning_rate": 0.0002, "loss": 0.5703071355819702, "mean_token_accuracy": 0.7706339806318283, "num_tokens": 639625.0, "step": 39 }, { "entropy": 0.5555090457201004, "epoch": 0.14925373134328357, "grad_norm": 0.16290432214736938, "learning_rate": 0.0002, "loss": 0.5560703277587891, "mean_token_accuracy": 0.7768503576517105, "num_tokens": 656135.0, "step": 40 }, { "entropy": 0.5701133161783218, "epoch": 0.15298507462686567, "grad_norm": 0.19164100289344788, "learning_rate": 0.0002, "loss": 0.576887309551239, "mean_token_accuracy": 0.7674428522586823, "num_tokens": 672233.0, "step": 41 }, { "entropy": 0.5744345933198929, "epoch": 0.15671641791044777, "grad_norm": 0.18373753130435944, "learning_rate": 0.0002, "loss": 0.5698904991149902, "mean_token_accuracy": 0.7698992490768433, "num_tokens": 688517.0, "step": 42 }, { "entropy": 0.5747536867856979, "epoch": 0.16044776119402984, "grad_norm": 0.17863287031650543, "learning_rate": 0.0002, "loss": 0.5794167518615723, "mean_token_accuracy": 0.7684431076049805, "num_tokens": 704885.0, "step": 43 }, { "entropy": 0.5701879560947418, "epoch": 0.16417910447761194, "grad_norm": 0.16616570949554443, "learning_rate": 0.0002, "loss": 0.5643965005874634, "mean_token_accuracy": 0.7729478478431702, "num_tokens": 721192.0, "step": 44 }, { "entropy": 0.559878334403038, "epoch": 0.16791044776119404, "grad_norm": 0.14239990711212158, "learning_rate": 0.0002, "loss": 0.5554589033126831, "mean_token_accuracy": 0.7787265032529831, "num_tokens": 737493.0, "step": 45 }, { "entropy": 0.5644266754388809, "epoch": 0.17164179104477612, "grad_norm": 0.17384031414985657, "learning_rate": 0.0002, "loss": 0.5654000639915466, "mean_token_accuracy": 0.7739932388067245, "num_tokens": 753949.0, "step": 46 }, { "entropy": 0.5645141154527664, "epoch": 0.17537313432835822, "grad_norm": 0.17348957061767578, "learning_rate": 0.0002, "loss": 0.5617217421531677, "mean_token_accuracy": 0.7774634659290314, "num_tokens": 770544.0, "step": 47 }, { "entropy": 0.5625235587358475, "epoch": 0.1791044776119403, "grad_norm": 0.14307668805122375, "learning_rate": 0.0002, "loss": 0.560384213924408, "mean_token_accuracy": 0.7760685384273529, "num_tokens": 787084.0, "step": 48 }, { "entropy": 0.555452972650528, "epoch": 0.1828358208955224, "grad_norm": 0.16662120819091797, "learning_rate": 0.0002, "loss": 0.5601282715797424, "mean_token_accuracy": 0.7779025435447693, "num_tokens": 803757.0, "step": 49 }, { "entropy": 0.557629257440567, "epoch": 0.1865671641791045, "grad_norm": 0.15931881964206696, "learning_rate": 0.0002, "loss": 0.5621690154075623, "mean_token_accuracy": 0.7754093408584595, "num_tokens": 820259.0, "step": 50 }, { "entropy": 0.5400655269622803, "epoch": 0.19029850746268656, "grad_norm": 0.16219788789749146, "learning_rate": 0.0002, "loss": 0.5453745722770691, "mean_token_accuracy": 0.7794964462518692, "num_tokens": 836165.0, "step": 51 }, { "entropy": 0.567253589630127, "epoch": 0.19402985074626866, "grad_norm": 0.1521536111831665, "learning_rate": 0.0002, "loss": 0.5732303857803345, "mean_token_accuracy": 0.7715951949357986, "num_tokens": 852770.0, "step": 52 }, { "entropy": 0.5600331574678421, "epoch": 0.19776119402985073, "grad_norm": 0.18043731153011322, "learning_rate": 0.0002, "loss": 0.5502007007598877, "mean_token_accuracy": 0.7802667319774628, "num_tokens": 869142.0, "step": 53 }, { "entropy": 0.5579064935445786, "epoch": 0.20149253731343283, "grad_norm": 0.14194370806217194, "learning_rate": 0.0002, "loss": 0.5532926321029663, "mean_token_accuracy": 0.7787930965423584, "num_tokens": 885527.0, "step": 54 }, { "entropy": 0.5481145083904266, "epoch": 0.20522388059701493, "grad_norm": 0.18247617781162262, "learning_rate": 0.0002, "loss": 0.5540817975997925, "mean_token_accuracy": 0.774936631321907, "num_tokens": 901951.0, "step": 55 }, { "entropy": 0.5435811579227448, "epoch": 0.208955223880597, "grad_norm": 0.14611691236495972, "learning_rate": 0.0002, "loss": 0.5460960865020752, "mean_token_accuracy": 0.7804523259401321, "num_tokens": 918549.0, "step": 56 }, { "entropy": 0.5274965688586235, "epoch": 0.2126865671641791, "grad_norm": 0.16689632833003998, "learning_rate": 0.0002, "loss": 0.5317626595497131, "mean_token_accuracy": 0.7861348390579224, "num_tokens": 934568.0, "step": 57 }, { "entropy": 0.5469426512718201, "epoch": 0.21641791044776118, "grad_norm": 0.17422115802764893, "learning_rate": 0.0002, "loss": 0.5483155846595764, "mean_token_accuracy": 0.7792017906904221, "num_tokens": 950845.0, "step": 58 }, { "entropy": 0.5521796494722366, "epoch": 0.22014925373134328, "grad_norm": 0.15713948011398315, "learning_rate": 0.0002, "loss": 0.5532113313674927, "mean_token_accuracy": 0.7776449769735336, "num_tokens": 967389.0, "step": 59 }, { "entropy": 0.5459235310554504, "epoch": 0.22388059701492538, "grad_norm": 0.159347265958786, "learning_rate": 0.0002, "loss": 0.5439324378967285, "mean_token_accuracy": 0.7833367586135864, "num_tokens": 983960.0, "step": 60 }, { "entropy": 0.5611889511346817, "epoch": 0.22761194029850745, "grad_norm": 0.19656279683113098, "learning_rate": 0.0002, "loss": 0.5588216185569763, "mean_token_accuracy": 0.7787718325853348, "num_tokens": 1000264.0, "step": 61 }, { "entropy": 0.5443999469280243, "epoch": 0.23134328358208955, "grad_norm": 0.16265363991260529, "learning_rate": 0.0002, "loss": 0.5430524945259094, "mean_token_accuracy": 0.783473938703537, "num_tokens": 1016591.0, "step": 62 }, { "entropy": 0.5739233940839767, "epoch": 0.23507462686567165, "grad_norm": 0.16212719678878784, "learning_rate": 0.0002, "loss": 0.5744223594665527, "mean_token_accuracy": 0.7719471603631973, "num_tokens": 1032986.0, "step": 63 }, { "entropy": 0.5672716349363327, "epoch": 0.23880597014925373, "grad_norm": 0.16331897675991058, "learning_rate": 0.0002, "loss": 0.5665188431739807, "mean_token_accuracy": 0.7713304907083511, "num_tokens": 1049424.0, "step": 64 }, { "entropy": 0.5762098878622055, "epoch": 0.24253731343283583, "grad_norm": 0.13884824514389038, "learning_rate": 0.0002, "loss": 0.5767008662223816, "mean_token_accuracy": 0.7696898132562637, "num_tokens": 1065969.0, "step": 65 }, { "entropy": 0.5569287538528442, "epoch": 0.2462686567164179, "grad_norm": 0.1740816980600357, "learning_rate": 0.0002, "loss": 0.5631753206253052, "mean_token_accuracy": 0.7727806568145752, "num_tokens": 1082229.0, "step": 66 }, { "entropy": 0.5548796504735947, "epoch": 0.25, "grad_norm": 0.1667051911354065, "learning_rate": 0.0002, "loss": 0.5509235262870789, "mean_token_accuracy": 0.7790889889001846, "num_tokens": 1099010.0, "step": 67 }, { "entropy": 0.5462881028652191, "epoch": 0.2537313432835821, "grad_norm": 0.14191995561122894, "learning_rate": 0.0002, "loss": 0.5450850129127502, "mean_token_accuracy": 0.781976968050003, "num_tokens": 1115328.0, "step": 68 }, { "entropy": 0.5640436559915543, "epoch": 0.2574626865671642, "grad_norm": 0.16489970684051514, "learning_rate": 0.0002, "loss": 0.5714234113693237, "mean_token_accuracy": 0.7743055671453476, "num_tokens": 1131527.0, "step": 69 }, { "entropy": 0.5581524074077606, "epoch": 0.26119402985074625, "grad_norm": 0.17524468898773193, "learning_rate": 0.0002, "loss": 0.5653409361839294, "mean_token_accuracy": 0.7740405648946762, "num_tokens": 1147997.0, "step": 70 }, { "entropy": 0.5587889850139618, "epoch": 0.26492537313432835, "grad_norm": 0.13126389682292938, "learning_rate": 0.0002, "loss": 0.563335657119751, "mean_token_accuracy": 0.7715445905923843, "num_tokens": 1164153.0, "step": 71 }, { "entropy": 0.5487140715122223, "epoch": 0.26865671641791045, "grad_norm": 0.21885372698307037, "learning_rate": 0.0002, "loss": 0.5488876104354858, "mean_token_accuracy": 0.7801245003938675, "num_tokens": 1180525.0, "step": 72 }, { "entropy": 0.5341571718454361, "epoch": 0.27238805970149255, "grad_norm": 0.13752351701259613, "learning_rate": 0.0002, "loss": 0.5344278812408447, "mean_token_accuracy": 0.784472331404686, "num_tokens": 1196847.0, "step": 73 }, { "entropy": 0.551477774977684, "epoch": 0.27611940298507465, "grad_norm": 0.13981129229068756, "learning_rate": 0.0002, "loss": 0.5494024753570557, "mean_token_accuracy": 0.7799880355596542, "num_tokens": 1213481.0, "step": 74 }, { "entropy": 0.5447621941566467, "epoch": 0.2798507462686567, "grad_norm": 0.15920379757881165, "learning_rate": 0.0002, "loss": 0.5405699610710144, "mean_token_accuracy": 0.7826831936836243, "num_tokens": 1230084.0, "step": 75 }, { "entropy": 0.5486634969711304, "epoch": 0.2835820895522388, "grad_norm": 0.13304069638252258, "learning_rate": 0.0002, "loss": 0.5446336269378662, "mean_token_accuracy": 0.7830937057733536, "num_tokens": 1246769.0, "step": 76 }, { "entropy": 0.5452822148799896, "epoch": 0.2873134328358209, "grad_norm": 0.15798641741275787, "learning_rate": 0.0002, "loss": 0.557198703289032, "mean_token_accuracy": 0.7773135006427765, "num_tokens": 1263008.0, "step": 77 }, { "entropy": 0.5309847742319107, "epoch": 0.291044776119403, "grad_norm": 0.1608300358057022, "learning_rate": 0.0002, "loss": 0.5421797037124634, "mean_token_accuracy": 0.7828473746776581, "num_tokens": 1279441.0, "step": 78 }, { "entropy": 0.5622646063566208, "epoch": 0.2947761194029851, "grad_norm": 0.13157972693443298, "learning_rate": 0.0002, "loss": 0.558945894241333, "mean_token_accuracy": 0.7717398554086685, "num_tokens": 1295651.0, "step": 79 }, { "entropy": 0.5753958076238632, "epoch": 0.29850746268656714, "grad_norm": 0.14517387747764587, "learning_rate": 0.0002, "loss": 0.5727032423019409, "mean_token_accuracy": 0.7672933489084244, "num_tokens": 1311962.0, "step": 80 }, { "entropy": 0.5534999370574951, "epoch": 0.30223880597014924, "grad_norm": 0.1413838267326355, "learning_rate": 0.0002, "loss": 0.5444930195808411, "mean_token_accuracy": 0.7826777994632721, "num_tokens": 1328248.0, "step": 81 }, { "entropy": 0.5375708788633347, "epoch": 0.30597014925373134, "grad_norm": 0.13538850843906403, "learning_rate": 0.0002, "loss": 0.538631796836853, "mean_token_accuracy": 0.7803685069084167, "num_tokens": 1344467.0, "step": 82 }, { "entropy": 0.5297208279371262, "epoch": 0.30970149253731344, "grad_norm": 0.14185431599617004, "learning_rate": 0.0002, "loss": 0.5332384705543518, "mean_token_accuracy": 0.7804697453975677, "num_tokens": 1360718.0, "step": 83 }, { "entropy": 0.5498329550027847, "epoch": 0.31343283582089554, "grad_norm": 0.14588527381420135, "learning_rate": 0.0002, "loss": 0.5577006340026855, "mean_token_accuracy": 0.7738551795482635, "num_tokens": 1376845.0, "step": 84 }, { "entropy": 0.5527947694063187, "epoch": 0.31716417910447764, "grad_norm": 0.1357346624135971, "learning_rate": 0.0002, "loss": 0.5527830719947815, "mean_token_accuracy": 0.7788930237293243, "num_tokens": 1393076.0, "step": 85 }, { "entropy": 0.5394750982522964, "epoch": 0.3208955223880597, "grad_norm": 0.13744208216667175, "learning_rate": 0.0002, "loss": 0.5478135943412781, "mean_token_accuracy": 0.780300036072731, "num_tokens": 1409217.0, "step": 86 }, { "entropy": 0.5559671819210052, "epoch": 0.3246268656716418, "grad_norm": 0.13147583603858948, "learning_rate": 0.0002, "loss": 0.5562646985054016, "mean_token_accuracy": 0.7762454152107239, "num_tokens": 1425477.0, "step": 87 }, { "entropy": 0.5543066263198853, "epoch": 0.3283582089552239, "grad_norm": 0.11719482392072678, "learning_rate": 0.0002, "loss": 0.5529443621635437, "mean_token_accuracy": 0.7772444784641266, "num_tokens": 1441671.0, "step": 88 }, { "entropy": 0.5419782102108002, "epoch": 0.332089552238806, "grad_norm": 0.14719344675540924, "learning_rate": 0.0002, "loss": 0.5404766798019409, "mean_token_accuracy": 0.7831247895956039, "num_tokens": 1457971.0, "step": 89 }, { "entropy": 0.5399269163608551, "epoch": 0.3358208955223881, "grad_norm": 0.12220615893602371, "learning_rate": 0.0002, "loss": 0.5387459397315979, "mean_token_accuracy": 0.7855129837989807, "num_tokens": 1474274.0, "step": 90 }, { "entropy": 0.5337241441011429, "epoch": 0.33955223880597013, "grad_norm": 0.13422612845897675, "learning_rate": 0.0002, "loss": 0.5408236980438232, "mean_token_accuracy": 0.7799499779939651, "num_tokens": 1490481.0, "step": 91 }, { "entropy": 0.5499130040407181, "epoch": 0.34328358208955223, "grad_norm": 0.1426658183336258, "learning_rate": 0.0002, "loss": 0.5537517666816711, "mean_token_accuracy": 0.7782512009143829, "num_tokens": 1506700.0, "step": 92 }, { "entropy": 0.5318698287010193, "epoch": 0.34701492537313433, "grad_norm": 0.12993979454040527, "learning_rate": 0.0002, "loss": 0.5316786766052246, "mean_token_accuracy": 0.7850093394517899, "num_tokens": 1523002.0, "step": 93 }, { "entropy": 0.5481119602918625, "epoch": 0.35074626865671643, "grad_norm": 0.13163146376609802, "learning_rate": 0.0002, "loss": 0.548253059387207, "mean_token_accuracy": 0.780367836356163, "num_tokens": 1539288.0, "step": 94 }, { "entropy": 0.5703603178262711, "epoch": 0.35447761194029853, "grad_norm": 0.12978118658065796, "learning_rate": 0.0002, "loss": 0.5666322708129883, "mean_token_accuracy": 0.7723395079374313, "num_tokens": 1555506.0, "step": 95 }, { "entropy": 0.5624447613954544, "epoch": 0.3582089552238806, "grad_norm": 0.12965592741966248, "learning_rate": 0.0002, "loss": 0.5602748394012451, "mean_token_accuracy": 0.7747233361005783, "num_tokens": 1572115.0, "step": 96 }, { "entropy": 0.5613084137439728, "epoch": 0.3619402985074627, "grad_norm": 0.14199502766132355, "learning_rate": 0.0002, "loss": 0.555010974407196, "mean_token_accuracy": 0.7760839462280273, "num_tokens": 1588821.0, "step": 97 }, { "entropy": 0.5324004143476486, "epoch": 0.3656716417910448, "grad_norm": 0.13919012248516083, "learning_rate": 0.0002, "loss": 0.5334999561309814, "mean_token_accuracy": 0.7850101590156555, "num_tokens": 1605300.0, "step": 98 }, { "entropy": 0.5360228419303894, "epoch": 0.3694029850746269, "grad_norm": 0.14360296726226807, "learning_rate": 0.0002, "loss": 0.5472567081451416, "mean_token_accuracy": 0.7786711901426315, "num_tokens": 1621431.0, "step": 99 }, { "entropy": 0.5455528795719147, "epoch": 0.373134328358209, "grad_norm": 0.1277836412191391, "learning_rate": 0.0002, "loss": 0.5538268089294434, "mean_token_accuracy": 0.7776066958904266, "num_tokens": 1637964.0, "step": 100 }, { "entropy": 0.5532989650964737, "epoch": 0.376865671641791, "grad_norm": 0.13713549077510834, "learning_rate": 0.0002, "loss": 0.5561457872390747, "mean_token_accuracy": 0.7771011143922806, "num_tokens": 1654089.0, "step": 101 }, { "entropy": 0.5741413533687592, "epoch": 0.3805970149253731, "grad_norm": 0.13025760650634766, "learning_rate": 0.0002, "loss": 0.5691399574279785, "mean_token_accuracy": 0.772384986281395, "num_tokens": 1670665.0, "step": 102 }, { "entropy": 0.5667874813079834, "epoch": 0.3843283582089552, "grad_norm": 0.12920764088630676, "learning_rate": 0.0002, "loss": 0.5599198341369629, "mean_token_accuracy": 0.7729279398918152, "num_tokens": 1687063.0, "step": 103 }, { "entropy": 0.5548859238624573, "epoch": 0.3880597014925373, "grad_norm": 0.13648352026939392, "learning_rate": 0.0002, "loss": 0.5587888956069946, "mean_token_accuracy": 0.7738962918519974, "num_tokens": 1703545.0, "step": 104 }, { "entropy": 0.5481197685003281, "epoch": 0.3917910447761194, "grad_norm": 0.13556665182113647, "learning_rate": 0.0002, "loss": 0.551975667476654, "mean_token_accuracy": 0.7755906730890274, "num_tokens": 1720094.0, "step": 105 }, { "entropy": 0.5406413227319717, "epoch": 0.39552238805970147, "grad_norm": 0.12847866117954254, "learning_rate": 0.0002, "loss": 0.5447836518287659, "mean_token_accuracy": 0.7771267741918564, "num_tokens": 1736466.0, "step": 106 }, { "entropy": 0.5483510047197342, "epoch": 0.39925373134328357, "grad_norm": 0.14766491949558258, "learning_rate": 0.0002, "loss": 0.54759281873703, "mean_token_accuracy": 0.7777384519577026, "num_tokens": 1753014.0, "step": 107 }, { "entropy": 0.5594521313905716, "epoch": 0.40298507462686567, "grad_norm": 0.1325310319662094, "learning_rate": 0.0002, "loss": 0.5559228658676147, "mean_token_accuracy": 0.7776539623737335, "num_tokens": 1769397.0, "step": 108 }, { "entropy": 0.5235730409622192, "epoch": 0.40671641791044777, "grad_norm": 0.14838212728500366, "learning_rate": 0.0002, "loss": 0.5363551378250122, "mean_token_accuracy": 0.7855585068464279, "num_tokens": 1785496.0, "step": 109 }, { "entropy": 0.529867097735405, "epoch": 0.41044776119402987, "grad_norm": 0.1400843858718872, "learning_rate": 0.0002, "loss": 0.5262739062309265, "mean_token_accuracy": 0.7853756546974182, "num_tokens": 1802161.0, "step": 110 }, { "entropy": 0.5641083866357803, "epoch": 0.4141791044776119, "grad_norm": 0.12946833670139313, "learning_rate": 0.0002, "loss": 0.5594510436058044, "mean_token_accuracy": 0.7754105180501938, "num_tokens": 1818597.0, "step": 111 }, { "entropy": 0.5582448691129684, "epoch": 0.417910447761194, "grad_norm": 0.141814723610878, "learning_rate": 0.0002, "loss": 0.5595210194587708, "mean_token_accuracy": 0.7736571133136749, "num_tokens": 1834990.0, "step": 112 }, { "entropy": 0.5417420417070389, "epoch": 0.4216417910447761, "grad_norm": 0.12932373583316803, "learning_rate": 0.0002, "loss": 0.547935962677002, "mean_token_accuracy": 0.7809092104434967, "num_tokens": 1851431.0, "step": 113 }, { "entropy": 0.5411195009946823, "epoch": 0.4253731343283582, "grad_norm": 0.13595683872699738, "learning_rate": 0.0002, "loss": 0.5450493097305298, "mean_token_accuracy": 0.7794583141803741, "num_tokens": 1867771.0, "step": 114 }, { "entropy": 0.5582379996776581, "epoch": 0.4291044776119403, "grad_norm": 0.13590583205223083, "learning_rate": 0.0002, "loss": 0.5637767910957336, "mean_token_accuracy": 0.7740200757980347, "num_tokens": 1884142.0, "step": 115 }, { "entropy": 0.5411937683820724, "epoch": 0.43283582089552236, "grad_norm": 0.14205913245677948, "learning_rate": 0.0002, "loss": 0.542431116104126, "mean_token_accuracy": 0.7799777090549469, "num_tokens": 1900516.0, "step": 116 }, { "entropy": 0.5482146292924881, "epoch": 0.43656716417910446, "grad_norm": 0.11477427929639816, "learning_rate": 0.0002, "loss": 0.5456505417823792, "mean_token_accuracy": 0.7757869809865952, "num_tokens": 1916885.0, "step": 117 }, { "entropy": 0.5370079576969147, "epoch": 0.44029850746268656, "grad_norm": 0.13816410303115845, "learning_rate": 0.0002, "loss": 0.5429069399833679, "mean_token_accuracy": 0.7780599594116211, "num_tokens": 1933169.0, "step": 118 }, { "entropy": 0.5455102026462555, "epoch": 0.44402985074626866, "grad_norm": 0.13368608057498932, "learning_rate": 0.0002, "loss": 0.5398865938186646, "mean_token_accuracy": 0.783423513174057, "num_tokens": 1949594.0, "step": 119 }, { "entropy": 0.5368959903717041, "epoch": 0.44776119402985076, "grad_norm": 0.13672706484794617, "learning_rate": 0.0002, "loss": 0.5356795787811279, "mean_token_accuracy": 0.7833909094333649, "num_tokens": 1965772.0, "step": 120 }, { "entropy": 0.5283652544021606, "epoch": 0.45149253731343286, "grad_norm": 0.16315960884094238, "learning_rate": 0.0002, "loss": 0.5378228425979614, "mean_token_accuracy": 0.7841643989086151, "num_tokens": 1981885.0, "step": 121 }, { "entropy": 0.5414575785398483, "epoch": 0.4552238805970149, "grad_norm": 0.13416600227355957, "learning_rate": 0.0002, "loss": 0.5479776859283447, "mean_token_accuracy": 0.7784606367349625, "num_tokens": 1998430.0, "step": 122 }, { "entropy": 0.5641719400882721, "epoch": 0.458955223880597, "grad_norm": 0.13336408138275146, "learning_rate": 0.0002, "loss": 0.5604909658432007, "mean_token_accuracy": 0.772265836596489, "num_tokens": 2015003.0, "step": 123 }, { "entropy": 0.5521317422389984, "epoch": 0.4626865671641791, "grad_norm": 0.13578884303569794, "learning_rate": 0.0002, "loss": 0.5430817604064941, "mean_token_accuracy": 0.780389592051506, "num_tokens": 2031375.0, "step": 124 }, { "entropy": 0.5561365038156509, "epoch": 0.4664179104477612, "grad_norm": 0.13006186485290527, "learning_rate": 0.0002, "loss": 0.5517395734786987, "mean_token_accuracy": 0.7766251713037491, "num_tokens": 2047573.0, "step": 125 }, { "entropy": 0.5579850822687149, "epoch": 0.4701492537313433, "grad_norm": 0.12219003587961197, "learning_rate": 0.0002, "loss": 0.557759702205658, "mean_token_accuracy": 0.7729216068983078, "num_tokens": 2064084.0, "step": 126 }, { "entropy": 0.5411650538444519, "epoch": 0.47388059701492535, "grad_norm": 0.15279285609722137, "learning_rate": 0.0002, "loss": 0.5496426224708557, "mean_token_accuracy": 0.7773544490337372, "num_tokens": 2080693.0, "step": 127 }, { "entropy": 0.5413447618484497, "epoch": 0.47761194029850745, "grad_norm": 0.15482240915298462, "learning_rate": 0.0002, "loss": 0.5425417423248291, "mean_token_accuracy": 0.780493900179863, "num_tokens": 2097090.0, "step": 128 }, { "entropy": 0.5401688069105148, "epoch": 0.48134328358208955, "grad_norm": 0.13282036781311035, "learning_rate": 0.0002, "loss": 0.543215274810791, "mean_token_accuracy": 0.7801757156848907, "num_tokens": 2113369.0, "step": 129 }, { "entropy": 0.5527068078517914, "epoch": 0.48507462686567165, "grad_norm": 0.13907410204410553, "learning_rate": 0.0002, "loss": 0.5536910891532898, "mean_token_accuracy": 0.7762171775102615, "num_tokens": 2129711.0, "step": 130 }, { "entropy": 0.5255335569381714, "epoch": 0.48880597014925375, "grad_norm": 0.12128844857215881, "learning_rate": 0.0002, "loss": 0.5272364020347595, "mean_token_accuracy": 0.7870801836252213, "num_tokens": 2145726.0, "step": 131 }, { "entropy": 0.5413011759519577, "epoch": 0.4925373134328358, "grad_norm": 0.11150290817022324, "learning_rate": 0.0002, "loss": 0.5447565317153931, "mean_token_accuracy": 0.7812841534614563, "num_tokens": 2162226.0, "step": 132 }, { "entropy": 0.5405918657779694, "epoch": 0.4962686567164179, "grad_norm": 0.180214062333107, "learning_rate": 0.0002, "loss": 0.5419008731842041, "mean_token_accuracy": 0.779103696346283, "num_tokens": 2178734.0, "step": 133 }, { "entropy": 0.5386396795511246, "epoch": 0.5, "grad_norm": 0.11724670231342316, "learning_rate": 0.0002, "loss": 0.5388697981834412, "mean_token_accuracy": 0.7833260148763657, "num_tokens": 2195006.0, "step": 134 }, { "entropy": 0.5358224213123322, "epoch": 0.503731343283582, "grad_norm": 0.16803957521915436, "learning_rate": 0.0002, "loss": 0.5442015528678894, "mean_token_accuracy": 0.7798204123973846, "num_tokens": 2211091.0, "step": 135 }, { "entropy": 0.5409800261259079, "epoch": 0.5074626865671642, "grad_norm": 0.11882071197032928, "learning_rate": 0.0002, "loss": 0.5377349257469177, "mean_token_accuracy": 0.7844288647174835, "num_tokens": 2227557.0, "step": 136 }, { "entropy": 0.5705572813749313, "epoch": 0.5111940298507462, "grad_norm": 0.14624297618865967, "learning_rate": 0.0002, "loss": 0.5614476203918457, "mean_token_accuracy": 0.7717961966991425, "num_tokens": 2243947.0, "step": 137 }, { "entropy": 0.5261306613683701, "epoch": 0.5149253731343284, "grad_norm": 0.12288782745599747, "learning_rate": 0.0002, "loss": 0.5277607440948486, "mean_token_accuracy": 0.7837703675031662, "num_tokens": 2260248.0, "step": 138 }, { "entropy": 0.5489343255758286, "epoch": 0.5186567164179104, "grad_norm": 0.12894777953624725, "learning_rate": 0.0002, "loss": 0.5560361742973328, "mean_token_accuracy": 0.7759750783443451, "num_tokens": 2276747.0, "step": 139 }, { "entropy": 0.5430862605571747, "epoch": 0.5223880597014925, "grad_norm": 0.14144180715084076, "learning_rate": 0.0002, "loss": 0.547459602355957, "mean_token_accuracy": 0.7805726677179337, "num_tokens": 2293077.0, "step": 140 }, { "entropy": 0.5440323650836945, "epoch": 0.5261194029850746, "grad_norm": 0.11917843669652939, "learning_rate": 0.0002, "loss": 0.5477656722068787, "mean_token_accuracy": 0.7797518819570541, "num_tokens": 2309337.0, "step": 141 }, { "entropy": 0.5420307070016861, "epoch": 0.5298507462686567, "grad_norm": 0.1192653626203537, "learning_rate": 0.0002, "loss": 0.5394734144210815, "mean_token_accuracy": 0.7826057225465775, "num_tokens": 2325670.0, "step": 142 }, { "entropy": 0.5393340289592743, "epoch": 0.5335820895522388, "grad_norm": 0.13303329050540924, "learning_rate": 0.0002, "loss": 0.5385794639587402, "mean_token_accuracy": 0.7815165519714355, "num_tokens": 2341755.0, "step": 143 }, { "entropy": 0.5444102138280869, "epoch": 0.5373134328358209, "grad_norm": 0.14008203148841858, "learning_rate": 0.0002, "loss": 0.5488988757133484, "mean_token_accuracy": 0.7799032479524612, "num_tokens": 2358153.0, "step": 144 }, { "entropy": 0.5365025699138641, "epoch": 0.5410447761194029, "grad_norm": 0.14566808938980103, "learning_rate": 0.0002, "loss": 0.5419079661369324, "mean_token_accuracy": 0.7805670350790024, "num_tokens": 2374467.0, "step": 145 }, { "entropy": 0.5426971465349197, "epoch": 0.5447761194029851, "grad_norm": 0.1357433944940567, "learning_rate": 0.0002, "loss": 0.5379341244697571, "mean_token_accuracy": 0.7826648503541946, "num_tokens": 2390600.0, "step": 146 }, { "entropy": 0.5661343783140182, "epoch": 0.5485074626865671, "grad_norm": 0.13934989273548126, "learning_rate": 0.0002, "loss": 0.5629899501800537, "mean_token_accuracy": 0.7758099287748337, "num_tokens": 2407080.0, "step": 147 }, { "entropy": 0.541400671005249, "epoch": 0.5522388059701493, "grad_norm": 0.14024044573307037, "learning_rate": 0.0002, "loss": 0.541731595993042, "mean_token_accuracy": 0.7802949547767639, "num_tokens": 2423568.0, "step": 148 }, { "entropy": 0.5476364940404892, "epoch": 0.5559701492537313, "grad_norm": 0.1358904242515564, "learning_rate": 0.0002, "loss": 0.5512872934341431, "mean_token_accuracy": 0.7763868570327759, "num_tokens": 2439947.0, "step": 149 }, { "entropy": 0.546050176024437, "epoch": 0.5597014925373134, "grad_norm": 0.14050431549549103, "learning_rate": 0.0002, "loss": 0.5520421266555786, "mean_token_accuracy": 0.7763620764017105, "num_tokens": 2456394.0, "step": 150 }, { "entropy": 0.5617920160293579, "epoch": 0.5634328358208955, "grad_norm": 0.12195290625095367, "learning_rate": 0.0002, "loss": 0.5633358955383301, "mean_token_accuracy": 0.7721698135137558, "num_tokens": 2472801.0, "step": 151 }, { "entropy": 0.5335766077041626, "epoch": 0.5671641791044776, "grad_norm": 0.1224474310874939, "learning_rate": 0.0002, "loss": 0.5250234007835388, "mean_token_accuracy": 0.7903417944908142, "num_tokens": 2489048.0, "step": 152 }, { "entropy": 0.5577341765165329, "epoch": 0.5708955223880597, "grad_norm": 0.12528087198734283, "learning_rate": 0.0002, "loss": 0.561303436756134, "mean_token_accuracy": 0.7743656784296036, "num_tokens": 2505442.0, "step": 153 }, { "entropy": 0.5553326904773712, "epoch": 0.5746268656716418, "grad_norm": 0.12870363891124725, "learning_rate": 0.0002, "loss": 0.5615543127059937, "mean_token_accuracy": 0.7726895660161972, "num_tokens": 2521815.0, "step": 154 }, { "entropy": 0.5630124509334564, "epoch": 0.5783582089552238, "grad_norm": 0.12597967684268951, "learning_rate": 0.0002, "loss": 0.5687354803085327, "mean_token_accuracy": 0.7691132724285126, "num_tokens": 2538286.0, "step": 155 }, { "entropy": 0.5581531077623367, "epoch": 0.582089552238806, "grad_norm": 0.1168755516409874, "learning_rate": 0.0002, "loss": 0.5532963275909424, "mean_token_accuracy": 0.775028184056282, "num_tokens": 2554519.0, "step": 156 }, { "entropy": 0.5546217858791351, "epoch": 0.585820895522388, "grad_norm": 0.131391242146492, "learning_rate": 0.0002, "loss": 0.5544172525405884, "mean_token_accuracy": 0.772693082690239, "num_tokens": 2570785.0, "step": 157 }, { "entropy": 0.5427669435739517, "epoch": 0.5895522388059702, "grad_norm": 0.14516305923461914, "learning_rate": 0.0002, "loss": 0.5510904788970947, "mean_token_accuracy": 0.7808411121368408, "num_tokens": 2587443.0, "step": 158 }, { "entropy": 0.5409528166055679, "epoch": 0.5932835820895522, "grad_norm": 0.17116999626159668, "learning_rate": 0.0002, "loss": 0.5488826036453247, "mean_token_accuracy": 0.777285099029541, "num_tokens": 2603592.0, "step": 159 }, { "entropy": 0.5733516365289688, "epoch": 0.5970149253731343, "grad_norm": 0.13355422019958496, "learning_rate": 0.0002, "loss": 0.5614065527915955, "mean_token_accuracy": 0.7743426263332367, "num_tokens": 2619909.0, "step": 160 }, { "entropy": 0.5415901988744736, "epoch": 0.6007462686567164, "grad_norm": 0.13737861812114716, "learning_rate": 0.0002, "loss": 0.5314146280288696, "mean_token_accuracy": 0.785938948392868, "num_tokens": 2636085.0, "step": 161 }, { "entropy": 0.5612253397703171, "epoch": 0.6044776119402985, "grad_norm": 0.14785514771938324, "learning_rate": 0.0002, "loss": 0.5628178715705872, "mean_token_accuracy": 0.7715339511632919, "num_tokens": 2652634.0, "step": 162 }, { "entropy": 0.5437108278274536, "epoch": 0.6082089552238806, "grad_norm": 0.10948356240987778, "learning_rate": 0.0002, "loss": 0.547478437423706, "mean_token_accuracy": 0.7772163152694702, "num_tokens": 2668983.0, "step": 163 }, { "entropy": 0.5426544100046158, "epoch": 0.6119402985074627, "grad_norm": 0.18059010803699493, "learning_rate": 0.0002, "loss": 0.5537011027336121, "mean_token_accuracy": 0.7747623771429062, "num_tokens": 2685249.0, "step": 164 }, { "entropy": 0.529934898018837, "epoch": 0.6156716417910447, "grad_norm": 0.11337770521640778, "learning_rate": 0.0002, "loss": 0.5303418636322021, "mean_token_accuracy": 0.7853435575962067, "num_tokens": 2701660.0, "step": 165 }, { "entropy": 0.5464923083782196, "epoch": 0.6194029850746269, "grad_norm": 0.14328055083751678, "learning_rate": 0.0002, "loss": 0.5412318706512451, "mean_token_accuracy": 0.7794769406318665, "num_tokens": 2718009.0, "step": 166 }, { "entropy": 0.5332994908094406, "epoch": 0.6231343283582089, "grad_norm": 0.124599389731884, "learning_rate": 0.0002, "loss": 0.5295602679252625, "mean_token_accuracy": 0.7858390063047409, "num_tokens": 2733940.0, "step": 167 }, { "entropy": 0.5405105203390121, "epoch": 0.6268656716417911, "grad_norm": 0.1258486807346344, "learning_rate": 0.0002, "loss": 0.5447245240211487, "mean_token_accuracy": 0.7793877273797989, "num_tokens": 2750120.0, "step": 168 }, { "entropy": 0.5483063012361526, "epoch": 0.6305970149253731, "grad_norm": 0.12760283052921295, "learning_rate": 0.0002, "loss": 0.5542790293693542, "mean_token_accuracy": 0.777314305305481, "num_tokens": 2766400.0, "step": 169 }, { "entropy": 0.5282255113124847, "epoch": 0.6343283582089553, "grad_norm": 0.11275236308574677, "learning_rate": 0.0002, "loss": 0.532568633556366, "mean_token_accuracy": 0.7843974977731705, "num_tokens": 2782639.0, "step": 170 }, { "entropy": 0.5487422794103622, "epoch": 0.6380597014925373, "grad_norm": 0.12859784066677094, "learning_rate": 0.0002, "loss": 0.5562790632247925, "mean_token_accuracy": 0.7746353149414062, "num_tokens": 2798847.0, "step": 171 }, { "entropy": 0.5516662746667862, "epoch": 0.6417910447761194, "grad_norm": 0.1135534718632698, "learning_rate": 0.0002, "loss": 0.5541255474090576, "mean_token_accuracy": 0.7761951684951782, "num_tokens": 2815484.0, "step": 172 }, { "entropy": 0.5466583147644997, "epoch": 0.6455223880597015, "grad_norm": 0.12440499663352966, "learning_rate": 0.0002, "loss": 0.5376479625701904, "mean_token_accuracy": 0.7826560735702515, "num_tokens": 2831953.0, "step": 173 }, { "entropy": 0.5650184452533722, "epoch": 0.6492537313432836, "grad_norm": 0.12500424683094025, "learning_rate": 0.0002, "loss": 0.5570256114006042, "mean_token_accuracy": 0.775683656334877, "num_tokens": 2848576.0, "step": 174 }, { "entropy": 0.5299219936132431, "epoch": 0.6529850746268657, "grad_norm": 0.12209604680538177, "learning_rate": 0.0002, "loss": 0.5341060757637024, "mean_token_accuracy": 0.7854541093111038, "num_tokens": 2865028.0, "step": 175 }, { "entropy": 0.527473658323288, "epoch": 0.6567164179104478, "grad_norm": 0.13374948501586914, "learning_rate": 0.0002, "loss": 0.5358298420906067, "mean_token_accuracy": 0.7821341753005981, "num_tokens": 2881235.0, "step": 176 }, { "entropy": 0.530792161822319, "epoch": 0.6604477611940298, "grad_norm": 0.1418503224849701, "learning_rate": 0.0002, "loss": 0.5484696626663208, "mean_token_accuracy": 0.7771261185407639, "num_tokens": 2897352.0, "step": 177 }, { "entropy": 0.529504582285881, "epoch": 0.664179104477612, "grad_norm": 0.1355515867471695, "learning_rate": 0.0002, "loss": 0.5337001085281372, "mean_token_accuracy": 0.7831253409385681, "num_tokens": 2913466.0, "step": 178 }, { "entropy": 0.5478560030460358, "epoch": 0.667910447761194, "grad_norm": 0.12079652398824692, "learning_rate": 0.0002, "loss": 0.5434887409210205, "mean_token_accuracy": 0.7814661264419556, "num_tokens": 2929627.0, "step": 179 }, { "entropy": 0.5615387558937073, "epoch": 0.6716417910447762, "grad_norm": 0.12244576960802078, "learning_rate": 0.0002, "loss": 0.5516577959060669, "mean_token_accuracy": 0.7753744870424271, "num_tokens": 2946165.0, "step": 180 }, { "entropy": 0.5508608520030975, "epoch": 0.6753731343283582, "grad_norm": 0.14292050898075104, "learning_rate": 0.0002, "loss": 0.5470070242881775, "mean_token_accuracy": 0.7745987325906754, "num_tokens": 2962296.0, "step": 181 }, { "entropy": 0.5406470000743866, "epoch": 0.6791044776119403, "grad_norm": 0.12849874794483185, "learning_rate": 0.0002, "loss": 0.5443695187568665, "mean_token_accuracy": 0.7796088755130768, "num_tokens": 2978771.0, "step": 182 }, { "entropy": 0.5391182154417038, "epoch": 0.6828358208955224, "grad_norm": 0.14676682651042938, "learning_rate": 0.0002, "loss": 0.5457857251167297, "mean_token_accuracy": 0.7784734219312668, "num_tokens": 2995061.0, "step": 183 }, { "entropy": 0.560190424323082, "epoch": 0.6865671641791045, "grad_norm": 0.12630562484264374, "learning_rate": 0.0002, "loss": 0.5650532841682434, "mean_token_accuracy": 0.7698299288749695, "num_tokens": 3011564.0, "step": 184 }, { "entropy": 0.56383316218853, "epoch": 0.6902985074626866, "grad_norm": 0.11451014131307602, "learning_rate": 0.0002, "loss": 0.5619198083877563, "mean_token_accuracy": 0.7752022296190262, "num_tokens": 3028041.0, "step": 185 }, { "entropy": 0.5337186753749847, "epoch": 0.6940298507462687, "grad_norm": 0.11182348430156708, "learning_rate": 0.0002, "loss": 0.5291807055473328, "mean_token_accuracy": 0.7860076576471329, "num_tokens": 3044427.0, "step": 186 }, { "entropy": 0.5426793694496155, "epoch": 0.6977611940298507, "grad_norm": 0.1289970427751541, "learning_rate": 0.0002, "loss": 0.5458519458770752, "mean_token_accuracy": 0.7804786115884781, "num_tokens": 3060550.0, "step": 187 }, { "entropy": 0.5481364578008652, "epoch": 0.7014925373134329, "grad_norm": 0.11624104529619217, "learning_rate": 0.0002, "loss": 0.5494486689567566, "mean_token_accuracy": 0.7777003347873688, "num_tokens": 3076985.0, "step": 188 }, { "entropy": 0.5405264496803284, "epoch": 0.7052238805970149, "grad_norm": 0.12466499209403992, "learning_rate": 0.0002, "loss": 0.5457755923271179, "mean_token_accuracy": 0.7773817032575607, "num_tokens": 3093305.0, "step": 189 }, { "entropy": 0.5467436462640762, "epoch": 0.7089552238805971, "grad_norm": 0.16258826851844788, "learning_rate": 0.0002, "loss": 0.5626595616340637, "mean_token_accuracy": 0.7722655385732651, "num_tokens": 3109841.0, "step": 190 }, { "entropy": 0.5435369312763214, "epoch": 0.7126865671641791, "grad_norm": 0.1250208616256714, "learning_rate": 0.0002, "loss": 0.5456626415252686, "mean_token_accuracy": 0.7792533487081528, "num_tokens": 3126390.0, "step": 191 }, { "entropy": 0.5665273517370224, "epoch": 0.7164179104477612, "grad_norm": 0.13022343814373016, "learning_rate": 0.0002, "loss": 0.5511953234672546, "mean_token_accuracy": 0.7755104452371597, "num_tokens": 3142789.0, "step": 192 }, { "entropy": 0.5572501718997955, "epoch": 0.7201492537313433, "grad_norm": 0.13365279138088226, "learning_rate": 0.0002, "loss": 0.5513952374458313, "mean_token_accuracy": 0.7761309891939163, "num_tokens": 3159053.0, "step": 193 }, { "entropy": 0.5266987681388855, "epoch": 0.7238805970149254, "grad_norm": 0.1201450526714325, "learning_rate": 0.0002, "loss": 0.5288004875183105, "mean_token_accuracy": 0.7855914831161499, "num_tokens": 3175525.0, "step": 194 }, { "entropy": 0.5352121591567993, "epoch": 0.7276119402985075, "grad_norm": 0.1398552507162094, "learning_rate": 0.0002, "loss": 0.5395978689193726, "mean_token_accuracy": 0.7819965928792953, "num_tokens": 3192099.0, "step": 195 }, { "entropy": 0.533184140920639, "epoch": 0.7313432835820896, "grad_norm": 0.1487068384885788, "learning_rate": 0.0002, "loss": 0.5468820929527283, "mean_token_accuracy": 0.7791697829961777, "num_tokens": 3208505.0, "step": 196 }, { "entropy": 0.5317975580692291, "epoch": 0.7350746268656716, "grad_norm": 0.12477895617485046, "learning_rate": 0.0002, "loss": 0.5355808734893799, "mean_token_accuracy": 0.7824379354715347, "num_tokens": 3225010.0, "step": 197 }, { "entropy": 0.5748307108879089, "epoch": 0.7388059701492538, "grad_norm": 0.12914563715457916, "learning_rate": 0.0002, "loss": 0.5788255929946899, "mean_token_accuracy": 0.7650759667158127, "num_tokens": 3241658.0, "step": 198 }, { "entropy": 0.5368754714727402, "epoch": 0.7425373134328358, "grad_norm": 0.11934071779251099, "learning_rate": 0.0002, "loss": 0.5274195075035095, "mean_token_accuracy": 0.7854534685611725, "num_tokens": 3258064.0, "step": 199 }, { "entropy": 0.5409929752349854, "epoch": 0.746268656716418, "grad_norm": 0.1189829558134079, "learning_rate": 0.0002, "loss": 0.5376108288764954, "mean_token_accuracy": 0.7814257591962814, "num_tokens": 3274512.0, "step": 200 }, { "entropy": 0.5288984030485153, "epoch": 0.75, "grad_norm": 0.18263517320156097, "learning_rate": 0.0002, "loss": 0.5427844524383545, "mean_token_accuracy": 0.7802873849868774, "num_tokens": 3290639.0, "step": 201 }, { "entropy": 0.5691705942153931, "epoch": 0.753731343283582, "grad_norm": 0.1280129849910736, "learning_rate": 0.0002, "loss": 0.5745768547058105, "mean_token_accuracy": 0.7654204666614532, "num_tokens": 3307020.0, "step": 202 }, { "entropy": 0.5719635188579559, "epoch": 0.7574626865671642, "grad_norm": 0.11226256936788559, "learning_rate": 0.0002, "loss": 0.5669863224029541, "mean_token_accuracy": 0.7705253958702087, "num_tokens": 3323426.0, "step": 203 }, { "entropy": 0.5740833729505539, "epoch": 0.7611940298507462, "grad_norm": 0.16702376306056976, "learning_rate": 0.0002, "loss": 0.5620068907737732, "mean_token_accuracy": 0.769936203956604, "num_tokens": 3339801.0, "step": 204 }, { "entropy": 0.5441322475671768, "epoch": 0.7649253731343284, "grad_norm": 0.13137376308441162, "learning_rate": 0.0002, "loss": 0.5305750370025635, "mean_token_accuracy": 0.7868027091026306, "num_tokens": 3356118.0, "step": 205 }, { "entropy": 0.5498729795217514, "epoch": 0.7686567164179104, "grad_norm": 0.14498212933540344, "learning_rate": 0.0002, "loss": 0.5578135251998901, "mean_token_accuracy": 0.7715203762054443, "num_tokens": 3372313.0, "step": 206 }, { "entropy": 0.518561378121376, "epoch": 0.7723880597014925, "grad_norm": 0.17109735310077667, "learning_rate": 0.0002, "loss": 0.5355443954467773, "mean_token_accuracy": 0.7833957225084305, "num_tokens": 3388823.0, "step": 207 }, { "entropy": 0.5251610577106476, "epoch": 0.7761194029850746, "grad_norm": 0.1357729136943817, "learning_rate": 0.0002, "loss": 0.5393021106719971, "mean_token_accuracy": 0.7840308547019958, "num_tokens": 3405230.0, "step": 208 }, { "entropy": 0.5503880083560944, "epoch": 0.7798507462686567, "grad_norm": 0.1302410066127777, "learning_rate": 0.0002, "loss": 0.5439841151237488, "mean_token_accuracy": 0.7808199971914291, "num_tokens": 3421538.0, "step": 209 }, { "entropy": 0.5504791587591171, "epoch": 0.7835820895522388, "grad_norm": 0.17588983476161957, "learning_rate": 0.0002, "loss": 0.5450472831726074, "mean_token_accuracy": 0.7778802812099457, "num_tokens": 3437751.0, "step": 210 }, { "entropy": 0.5515212118625641, "epoch": 0.7873134328358209, "grad_norm": 0.12591375410556793, "learning_rate": 0.0002, "loss": 0.5451067686080933, "mean_token_accuracy": 0.7791963666677475, "num_tokens": 3453958.0, "step": 211 }, { "entropy": 0.5373163223266602, "epoch": 0.7910447761194029, "grad_norm": 0.11395501345396042, "learning_rate": 0.0002, "loss": 0.5358302593231201, "mean_token_accuracy": 0.7810690551996231, "num_tokens": 3470360.0, "step": 212 }, { "entropy": 0.5450779050588608, "epoch": 0.7947761194029851, "grad_norm": 0.13792671263217926, "learning_rate": 0.0002, "loss": 0.544927179813385, "mean_token_accuracy": 0.7764876931905746, "num_tokens": 3486976.0, "step": 213 }, { "entropy": 0.542982280254364, "epoch": 0.7985074626865671, "grad_norm": 0.14203859865665436, "learning_rate": 0.0002, "loss": 0.5473698377609253, "mean_token_accuracy": 0.7803648114204407, "num_tokens": 3503108.0, "step": 214 }, { "entropy": 0.5468839257955551, "epoch": 0.8022388059701493, "grad_norm": 0.14546480774879456, "learning_rate": 0.0002, "loss": 0.5536583065986633, "mean_token_accuracy": 0.7759220898151398, "num_tokens": 3519438.0, "step": 215 }, { "entropy": 0.5323249697685242, "epoch": 0.8059701492537313, "grad_norm": 0.12205041199922562, "learning_rate": 0.0002, "loss": 0.5366013050079346, "mean_token_accuracy": 0.7834390252828598, "num_tokens": 3535744.0, "step": 216 }, { "entropy": 0.5549503713846207, "epoch": 0.8097014925373134, "grad_norm": 0.12942132353782654, "learning_rate": 0.0002, "loss": 0.5488545298576355, "mean_token_accuracy": 0.7754624336957932, "num_tokens": 3552229.0, "step": 217 }, { "entropy": 0.5418603718280792, "epoch": 0.8134328358208955, "grad_norm": 0.11578696221113205, "learning_rate": 0.0002, "loss": 0.5355917811393738, "mean_token_accuracy": 0.7838476449251175, "num_tokens": 3568579.0, "step": 218 }, { "entropy": 0.5710959583520889, "epoch": 0.8171641791044776, "grad_norm": 0.1490243822336197, "learning_rate": 0.0002, "loss": 0.5620180368423462, "mean_token_accuracy": 0.774310976266861, "num_tokens": 3585243.0, "step": 219 }, { "entropy": 0.5469939708709717, "epoch": 0.8208955223880597, "grad_norm": 0.12220045179128647, "learning_rate": 0.0002, "loss": 0.5480121374130249, "mean_token_accuracy": 0.7782059013843536, "num_tokens": 3601764.0, "step": 220 }, { "entropy": 0.5289393365383148, "epoch": 0.8246268656716418, "grad_norm": 0.1687396615743637, "learning_rate": 0.0002, "loss": 0.5451465249061584, "mean_token_accuracy": 0.7791816592216492, "num_tokens": 3618085.0, "step": 221 }, { "entropy": 0.5347074121236801, "epoch": 0.8283582089552238, "grad_norm": 0.13434253633022308, "learning_rate": 0.0002, "loss": 0.542661190032959, "mean_token_accuracy": 0.7783772945404053, "num_tokens": 3634378.0, "step": 222 }, { "entropy": 0.5412849485874176, "epoch": 0.832089552238806, "grad_norm": 0.11510826647281647, "learning_rate": 0.0002, "loss": 0.5439392328262329, "mean_token_accuracy": 0.7777635306119919, "num_tokens": 3650552.0, "step": 223 }, { "entropy": 0.5579446852207184, "epoch": 0.835820895522388, "grad_norm": 0.14014939963817596, "learning_rate": 0.0002, "loss": 0.5538932681083679, "mean_token_accuracy": 0.7754973918199539, "num_tokens": 3666791.0, "step": 224 }, { "entropy": 0.5415721386671066, "epoch": 0.8395522388059702, "grad_norm": 0.13600188493728638, "learning_rate": 0.0002, "loss": 0.5392742156982422, "mean_token_accuracy": 0.7821011990308762, "num_tokens": 3682947.0, "step": 225 }, { "entropy": 0.5572647303342819, "epoch": 0.8432835820895522, "grad_norm": 0.10934413224458694, "learning_rate": 0.0002, "loss": 0.5546595454216003, "mean_token_accuracy": 0.7696610689163208, "num_tokens": 3699234.0, "step": 226 }, { "entropy": 0.5482315272092819, "epoch": 0.8470149253731343, "grad_norm": 0.12785379588603973, "learning_rate": 0.0002, "loss": 0.5524696707725525, "mean_token_accuracy": 0.7756107896566391, "num_tokens": 3715642.0, "step": 227 }, { "entropy": 0.5469722747802734, "epoch": 0.8507462686567164, "grad_norm": 0.17460216581821442, "learning_rate": 0.0002, "loss": 0.5504593849182129, "mean_token_accuracy": 0.7762730270624161, "num_tokens": 3732150.0, "step": 228 }, { "entropy": 0.5381356775760651, "epoch": 0.8544776119402985, "grad_norm": 0.13738028705120087, "learning_rate": 0.0002, "loss": 0.5410696268081665, "mean_token_accuracy": 0.7804866135120392, "num_tokens": 3748356.0, "step": 229 }, { "entropy": 0.5419336557388306, "epoch": 0.8582089552238806, "grad_norm": 0.1366986632347107, "learning_rate": 0.0002, "loss": 0.54702228307724, "mean_token_accuracy": 0.7779697477817535, "num_tokens": 3764864.0, "step": 230 }, { "entropy": 0.5650088787078857, "epoch": 0.8619402985074627, "grad_norm": 0.1245863139629364, "learning_rate": 0.0002, "loss": 0.5644104480743408, "mean_token_accuracy": 0.7698388695716858, "num_tokens": 3781158.0, "step": 231 }, { "entropy": 0.5491328537464142, "epoch": 0.8656716417910447, "grad_norm": 0.12666523456573486, "learning_rate": 0.0002, "loss": 0.547432005405426, "mean_token_accuracy": 0.7800118178129196, "num_tokens": 3797547.0, "step": 232 }, { "entropy": 0.5397607833147049, "epoch": 0.8694029850746269, "grad_norm": 0.13737380504608154, "learning_rate": 0.0002, "loss": 0.5392321348190308, "mean_token_accuracy": 0.7841152101755142, "num_tokens": 3813843.0, "step": 233 }, { "entropy": 0.544382706284523, "epoch": 0.8731343283582089, "grad_norm": 0.11425275355577469, "learning_rate": 0.0002, "loss": 0.5442847609519958, "mean_token_accuracy": 0.7817698568105698, "num_tokens": 3830087.0, "step": 234 }, { "entropy": 0.5501336306333542, "epoch": 0.8768656716417911, "grad_norm": 0.11622001230716705, "learning_rate": 0.0002, "loss": 0.5528742074966431, "mean_token_accuracy": 0.7744111120700836, "num_tokens": 3846206.0, "step": 235 }, { "entropy": 0.5614665448665619, "epoch": 0.8805970149253731, "grad_norm": 0.13408295810222626, "learning_rate": 0.0002, "loss": 0.5573604106903076, "mean_token_accuracy": 0.7725346237421036, "num_tokens": 3862800.0, "step": 236 }, { "entropy": 0.5298355966806412, "epoch": 0.8843283582089553, "grad_norm": 0.12251684814691544, "learning_rate": 0.0002, "loss": 0.5347483158111572, "mean_token_accuracy": 0.7849987000226974, "num_tokens": 3879053.0, "step": 237 }, { "entropy": 0.527460902929306, "epoch": 0.8880597014925373, "grad_norm": 0.1435721516609192, "learning_rate": 0.0002, "loss": 0.5373647809028625, "mean_token_accuracy": 0.7806102335453033, "num_tokens": 3895482.0, "step": 238 }, { "entropy": 0.5427086651325226, "epoch": 0.8917910447761194, "grad_norm": 0.15594077110290527, "learning_rate": 0.0002, "loss": 0.5516656637191772, "mean_token_accuracy": 0.77671217918396, "num_tokens": 3911639.0, "step": 239 }, { "entropy": 0.5452292412519455, "epoch": 0.8955223880597015, "grad_norm": 0.13117194175720215, "learning_rate": 0.0002, "loss": 0.547135055065155, "mean_token_accuracy": 0.7797868549823761, "num_tokens": 3927678.0, "step": 240 }, { "entropy": 0.5607290267944336, "epoch": 0.8992537313432836, "grad_norm": 0.1290806084871292, "learning_rate": 0.0002, "loss": 0.5505275726318359, "mean_token_accuracy": 0.7754765301942825, "num_tokens": 3944068.0, "step": 241 }, { "entropy": 0.5452372431755066, "epoch": 0.9029850746268657, "grad_norm": 0.1041363850235939, "learning_rate": 0.0002, "loss": 0.5423585772514343, "mean_token_accuracy": 0.7772356569766998, "num_tokens": 3960455.0, "step": 242 }, { "entropy": 0.5599673539400101, "epoch": 0.9067164179104478, "grad_norm": 0.12637630105018616, "learning_rate": 0.0002, "loss": 0.5576352477073669, "mean_token_accuracy": 0.7743173092603683, "num_tokens": 3976930.0, "step": 243 }, { "entropy": 0.5532275587320328, "epoch": 0.9104477611940298, "grad_norm": 0.1246461272239685, "learning_rate": 0.0002, "loss": 0.5524167418479919, "mean_token_accuracy": 0.7746891975402832, "num_tokens": 3993200.0, "step": 244 }, { "entropy": 0.5353778898715973, "epoch": 0.914179104477612, "grad_norm": 0.1204264834523201, "learning_rate": 0.0002, "loss": 0.5398914217948914, "mean_token_accuracy": 0.780600368976593, "num_tokens": 4009579.0, "step": 245 }, { "entropy": 0.5454006344079971, "epoch": 0.917910447761194, "grad_norm": 0.14190614223480225, "learning_rate": 0.0002, "loss": 0.5499029159545898, "mean_token_accuracy": 0.7774828523397446, "num_tokens": 4025835.0, "step": 246 }, { "entropy": 0.5335248857736588, "epoch": 0.9216417910447762, "grad_norm": 0.12253561615943909, "learning_rate": 0.0002, "loss": 0.531761884689331, "mean_token_accuracy": 0.782997652888298, "num_tokens": 4041832.0, "step": 247 }, { "entropy": 0.5199212953448296, "epoch": 0.9253731343283582, "grad_norm": 0.12186253070831299, "learning_rate": 0.0002, "loss": 0.5216535329818726, "mean_token_accuracy": 0.788480818271637, "num_tokens": 4057892.0, "step": 248 }, { "entropy": 0.5205824747681618, "epoch": 0.9291044776119403, "grad_norm": 0.1254664659500122, "learning_rate": 0.0002, "loss": 0.5266774296760559, "mean_token_accuracy": 0.7851553857326508, "num_tokens": 4074337.0, "step": 249 }, { "entropy": 0.5461059212684631, "epoch": 0.9328358208955224, "grad_norm": 0.12566933035850525, "learning_rate": 0.0002, "loss": 0.5446832776069641, "mean_token_accuracy": 0.7797155976295471, "num_tokens": 4090894.0, "step": 250 }, { "entropy": 0.5468244701623917, "epoch": 0.9365671641791045, "grad_norm": 0.1111629381775856, "learning_rate": 0.0002, "loss": 0.5508494973182678, "mean_token_accuracy": 0.7770780026912689, "num_tokens": 4107223.0, "step": 251 }, { "entropy": 0.5277251750230789, "epoch": 0.9402985074626866, "grad_norm": 0.12095754593610764, "learning_rate": 0.0002, "loss": 0.5359346866607666, "mean_token_accuracy": 0.7836727201938629, "num_tokens": 4123421.0, "step": 252 }, { "entropy": 0.5456234216690063, "epoch": 0.9440298507462687, "grad_norm": 0.15432782471179962, "learning_rate": 0.0002, "loss": 0.5424333810806274, "mean_token_accuracy": 0.7781681269407272, "num_tokens": 4139814.0, "step": 253 }, { "entropy": 0.561904102563858, "epoch": 0.9477611940298507, "grad_norm": 0.11046113818883896, "learning_rate": 0.0002, "loss": 0.555654764175415, "mean_token_accuracy": 0.77543506026268, "num_tokens": 4156145.0, "step": 254 }, { "entropy": 0.550317719578743, "epoch": 0.9514925373134329, "grad_norm": 0.11810830980539322, "learning_rate": 0.0002, "loss": 0.551179051399231, "mean_token_accuracy": 0.7750379741191864, "num_tokens": 4172486.0, "step": 255 }, { "entropy": 0.5419327318668365, "epoch": 0.9552238805970149, "grad_norm": 0.12468105554580688, "learning_rate": 0.0002, "loss": 0.5484491586685181, "mean_token_accuracy": 0.7767989039421082, "num_tokens": 4188789.0, "step": 256 }, { "entropy": 0.5456331819295883, "epoch": 0.9589552238805971, "grad_norm": 0.10254428535699844, "learning_rate": 0.0002, "loss": 0.5463854074478149, "mean_token_accuracy": 0.7775218188762665, "num_tokens": 4205039.0, "step": 257 }, { "entropy": 0.5631006211042404, "epoch": 0.9626865671641791, "grad_norm": 0.11667738854885101, "learning_rate": 0.0002, "loss": 0.5608720183372498, "mean_token_accuracy": 0.770975336432457, "num_tokens": 4221737.0, "step": 258 }, { "entropy": 0.5438289195299149, "epoch": 0.9664179104477612, "grad_norm": 0.10653994977474213, "learning_rate": 0.0002, "loss": 0.5415982007980347, "mean_token_accuracy": 0.7795556634664536, "num_tokens": 4238154.0, "step": 259 }, { "entropy": 0.54365074634552, "epoch": 0.9701492537313433, "grad_norm": 0.10474390536546707, "learning_rate": 0.0002, "loss": 0.5424013137817383, "mean_token_accuracy": 0.7802460342645645, "num_tokens": 4254544.0, "step": 260 }, { "entropy": 0.5336029231548309, "epoch": 0.9738805970149254, "grad_norm": 0.10472694039344788, "learning_rate": 0.0002, "loss": 0.5306434631347656, "mean_token_accuracy": 0.786760687828064, "num_tokens": 4270769.0, "step": 261 }, { "entropy": 0.5328535884618759, "epoch": 0.9776119402985075, "grad_norm": 0.12627209722995758, "learning_rate": 0.0002, "loss": 0.5387364625930786, "mean_token_accuracy": 0.7820819616317749, "num_tokens": 4287087.0, "step": 262 }, { "entropy": 0.5569794625043869, "epoch": 0.9813432835820896, "grad_norm": 0.12556159496307373, "learning_rate": 0.0002, "loss": 0.5633010268211365, "mean_token_accuracy": 0.773500457406044, "num_tokens": 4303275.0, "step": 263 }, { "entropy": 0.5476076602935791, "epoch": 0.9850746268656716, "grad_norm": 0.11449912190437317, "learning_rate": 0.0002, "loss": 0.5478817224502563, "mean_token_accuracy": 0.7760190218687057, "num_tokens": 4319447.0, "step": 264 }, { "entropy": 0.5338123887777328, "epoch": 0.9888059701492538, "grad_norm": 0.11093062907457352, "learning_rate": 0.0002, "loss": 0.5374420881271362, "mean_token_accuracy": 0.7827984094619751, "num_tokens": 4335610.0, "step": 265 }, { "entropy": 0.5231072157621384, "epoch": 0.9925373134328358, "grad_norm": 0.11385290324687958, "learning_rate": 0.0002, "loss": 0.518035352230072, "mean_token_accuracy": 0.7871184349060059, "num_tokens": 4352006.0, "step": 266 }, { "entropy": 0.5597157925367355, "epoch": 0.996268656716418, "grad_norm": 0.12694767117500305, "learning_rate": 0.0002, "loss": 0.5584501624107361, "mean_token_accuracy": 0.7767712473869324, "num_tokens": 4368643.0, "step": 267 }, { "entropy": 0.5244968682527542, "epoch": 1.0, "grad_norm": 0.11100418865680695, "learning_rate": 0.0002, "loss": 0.5219011306762695, "mean_token_accuracy": 0.7878229916095734, "num_tokens": 4385170.0, "step": 268 }, { "entropy": 0.5507489442825317, "epoch": 1.0037313432835822, "grad_norm": 0.11917725205421448, "learning_rate": 0.0002, "loss": 0.5477783679962158, "mean_token_accuracy": 0.7768960893154144, "num_tokens": 4401649.0, "step": 269 }, { "entropy": 0.5179261267185211, "epoch": 1.007462686567164, "grad_norm": 0.114885114133358, "learning_rate": 0.0002, "loss": 0.5203835964202881, "mean_token_accuracy": 0.7879552990198135, "num_tokens": 4417657.0, "step": 270 }, { "entropy": 0.5413845926523209, "epoch": 1.0111940298507462, "grad_norm": 0.11034537851810455, "learning_rate": 0.0002, "loss": 0.5424505472183228, "mean_token_accuracy": 0.780542716383934, "num_tokens": 4433808.0, "step": 271 }, { "entropy": 0.5339591354131699, "epoch": 1.0149253731343284, "grad_norm": 0.10123753547668457, "learning_rate": 0.0002, "loss": 0.5324500203132629, "mean_token_accuracy": 0.7834791243076324, "num_tokens": 4450074.0, "step": 272 }, { "entropy": 0.5246681123971939, "epoch": 1.0186567164179103, "grad_norm": 0.11839871853590012, "learning_rate": 0.0002, "loss": 0.530142605304718, "mean_token_accuracy": 0.7845751047134399, "num_tokens": 4466501.0, "step": 273 }, { "entropy": 0.5286023616790771, "epoch": 1.0223880597014925, "grad_norm": 0.12706530094146729, "learning_rate": 0.0002, "loss": 0.5256507396697998, "mean_token_accuracy": 0.7853004187345505, "num_tokens": 4482854.0, "step": 274 }, { "entropy": 0.5193610340356827, "epoch": 1.0261194029850746, "grad_norm": 0.1515689492225647, "learning_rate": 0.0002, "loss": 0.5248588919639587, "mean_token_accuracy": 0.7882117629051208, "num_tokens": 4499325.0, "step": 275 }, { "entropy": 0.5320159494876862, "epoch": 1.0298507462686568, "grad_norm": 0.13122239708900452, "learning_rate": 0.0002, "loss": 0.534252941608429, "mean_token_accuracy": 0.7805082648992538, "num_tokens": 4515563.0, "step": 276 }, { "entropy": 0.5442035794258118, "epoch": 1.0335820895522387, "grad_norm": 0.12928421795368195, "learning_rate": 0.0002, "loss": 0.5358187556266785, "mean_token_accuracy": 0.7840018421411514, "num_tokens": 4531822.0, "step": 277 }, { "entropy": 0.5246908813714981, "epoch": 1.037313432835821, "grad_norm": 0.14177928864955902, "learning_rate": 0.0002, "loss": 0.522698163986206, "mean_token_accuracy": 0.7914385795593262, "num_tokens": 4548179.0, "step": 278 }, { "entropy": 0.5337726771831512, "epoch": 1.041044776119403, "grad_norm": 0.12917082011699677, "learning_rate": 0.0002, "loss": 0.5394143462181091, "mean_token_accuracy": 0.7827410697937012, "num_tokens": 4564544.0, "step": 279 }, { "entropy": 0.5249736607074738, "epoch": 1.044776119402985, "grad_norm": 0.15507692098617554, "learning_rate": 0.0002, "loss": 0.530266523361206, "mean_token_accuracy": 0.784500926733017, "num_tokens": 4580899.0, "step": 280 }, { "entropy": 0.5224004536867142, "epoch": 1.0485074626865671, "grad_norm": 0.13328292965888977, "learning_rate": 0.0002, "loss": 0.5272551774978638, "mean_token_accuracy": 0.7841868251562119, "num_tokens": 4597148.0, "step": 281 }, { "entropy": 0.5343264937400818, "epoch": 1.0522388059701493, "grad_norm": 0.12672054767608643, "learning_rate": 0.0002, "loss": 0.5322040319442749, "mean_token_accuracy": 0.7872680425643921, "num_tokens": 4613527.0, "step": 282 }, { "entropy": 0.5167456269264221, "epoch": 1.0559701492537314, "grad_norm": 0.1300593614578247, "learning_rate": 0.0002, "loss": 0.5081961750984192, "mean_token_accuracy": 0.796296164393425, "num_tokens": 4629820.0, "step": 283 }, { "entropy": 0.5502501279115677, "epoch": 1.0597014925373134, "grad_norm": 0.11848345398902893, "learning_rate": 0.0002, "loss": 0.5440031886100769, "mean_token_accuracy": 0.7831816971302032, "num_tokens": 4646409.0, "step": 284 }, { "entropy": 0.537413626909256, "epoch": 1.0634328358208955, "grad_norm": 0.1294218748807907, "learning_rate": 0.0002, "loss": 0.5396757125854492, "mean_token_accuracy": 0.7809827625751495, "num_tokens": 4662669.0, "step": 285 }, { "entropy": 0.5442153364419937, "epoch": 1.0671641791044777, "grad_norm": 0.1345270872116089, "learning_rate": 0.0002, "loss": 0.5449458956718445, "mean_token_accuracy": 0.7765765637159348, "num_tokens": 4679238.0, "step": 286 }, { "entropy": 0.5223373919725418, "epoch": 1.0708955223880596, "grad_norm": 0.13911806046962738, "learning_rate": 0.0002, "loss": 0.527599036693573, "mean_token_accuracy": 0.7872483432292938, "num_tokens": 4695791.0, "step": 287 }, { "entropy": 0.5344910472631454, "epoch": 1.0746268656716418, "grad_norm": 0.12189274281263351, "learning_rate": 0.0002, "loss": 0.5306644439697266, "mean_token_accuracy": 0.7878366857767105, "num_tokens": 4711915.0, "step": 288 }, { "entropy": 0.5503940731287003, "epoch": 1.078358208955224, "grad_norm": 0.12994466722011566, "learning_rate": 0.0002, "loss": 0.5426635146141052, "mean_token_accuracy": 0.7800120115280151, "num_tokens": 4728355.0, "step": 289 }, { "entropy": 0.5371982753276825, "epoch": 1.0820895522388059, "grad_norm": 0.11566822230815887, "learning_rate": 0.0002, "loss": 0.5357840061187744, "mean_token_accuracy": 0.7830845862627029, "num_tokens": 4744985.0, "step": 290 }, { "entropy": 0.5363182723522186, "epoch": 1.085820895522388, "grad_norm": 0.14267492294311523, "learning_rate": 0.0002, "loss": 0.547325849533081, "mean_token_accuracy": 0.778549462556839, "num_tokens": 4761335.0, "step": 291 }, { "entropy": 0.5316378027200699, "epoch": 1.0895522388059702, "grad_norm": 0.14865896105766296, "learning_rate": 0.0002, "loss": 0.5413302183151245, "mean_token_accuracy": 0.7811136245727539, "num_tokens": 4777695.0, "step": 292 }, { "entropy": 0.5230907201766968, "epoch": 1.0932835820895523, "grad_norm": 0.11756227165460587, "learning_rate": 0.0002, "loss": 0.5194687843322754, "mean_token_accuracy": 0.7905423790216446, "num_tokens": 4794345.0, "step": 293 }, { "entropy": 0.5252106562256813, "epoch": 1.0970149253731343, "grad_norm": 0.12259907275438309, "learning_rate": 0.0002, "loss": 0.5216252207756042, "mean_token_accuracy": 0.7896531373262405, "num_tokens": 4810734.0, "step": 294 }, { "entropy": 0.5349573045969009, "epoch": 1.1007462686567164, "grad_norm": 0.14738821983337402, "learning_rate": 0.0002, "loss": 0.5411865711212158, "mean_token_accuracy": 0.7810265272855759, "num_tokens": 4827208.0, "step": 295 }, { "entropy": 0.5216178447008133, "epoch": 1.1044776119402986, "grad_norm": 0.1261540949344635, "learning_rate": 0.0002, "loss": 0.530312180519104, "mean_token_accuracy": 0.786735400557518, "num_tokens": 4843467.0, "step": 296 }, { "entropy": 0.5475742220878601, "epoch": 1.1082089552238805, "grad_norm": 0.17317992448806763, "learning_rate": 0.0002, "loss": 0.5447714328765869, "mean_token_accuracy": 0.7785773426294327, "num_tokens": 4859845.0, "step": 297 }, { "entropy": 0.5403448045253754, "epoch": 1.1119402985074627, "grad_norm": 0.11798793077468872, "learning_rate": 0.0002, "loss": 0.5318464040756226, "mean_token_accuracy": 0.7843561172485352, "num_tokens": 4876407.0, "step": 298 }, { "entropy": 0.5377328842878342, "epoch": 1.1156716417910448, "grad_norm": 0.13185109198093414, "learning_rate": 0.0002, "loss": 0.5353187918663025, "mean_token_accuracy": 0.7843449413776398, "num_tokens": 4892742.0, "step": 299 }, { "entropy": 0.5279147699475288, "epoch": 1.1194029850746268, "grad_norm": 0.16606053709983826, "learning_rate": 0.0002, "loss": 0.5365189909934998, "mean_token_accuracy": 0.783987894654274, "num_tokens": 4909223.0, "step": 300 }, { "entropy": 0.5365699529647827, "epoch": 1.123134328358209, "grad_norm": 0.160949245095253, "learning_rate": 0.0002, "loss": 0.5369877815246582, "mean_token_accuracy": 0.7800540775060654, "num_tokens": 4925547.0, "step": 301 }, { "entropy": 0.5412300229072571, "epoch": 1.126865671641791, "grad_norm": 0.13560807704925537, "learning_rate": 0.0002, "loss": 0.5425742864608765, "mean_token_accuracy": 0.7801165878772736, "num_tokens": 4941811.0, "step": 302 }, { "entropy": 0.5323121100664139, "epoch": 1.1305970149253732, "grad_norm": 0.1241421177983284, "learning_rate": 0.0002, "loss": 0.5286750793457031, "mean_token_accuracy": 0.7866266220808029, "num_tokens": 4958292.0, "step": 303 }, { "entropy": 0.533287987112999, "epoch": 1.1343283582089552, "grad_norm": 0.12874163687229156, "learning_rate": 0.0002, "loss": 0.5292162895202637, "mean_token_accuracy": 0.7868117541074753, "num_tokens": 4974588.0, "step": 304 }, { "entropy": 0.5256194174289703, "epoch": 1.1380597014925373, "grad_norm": 0.1257098764181137, "learning_rate": 0.0002, "loss": 0.5303645730018616, "mean_token_accuracy": 0.7867012023925781, "num_tokens": 4990937.0, "step": 305 }, { "entropy": 0.5340888798236847, "epoch": 1.1417910447761195, "grad_norm": 0.1419389545917511, "learning_rate": 0.0002, "loss": 0.5442762970924377, "mean_token_accuracy": 0.778327003121376, "num_tokens": 5007117.0, "step": 306 }, { "entropy": 0.5182383954524994, "epoch": 1.1455223880597014, "grad_norm": 0.13628648221492767, "learning_rate": 0.0002, "loss": 0.5177187323570251, "mean_token_accuracy": 0.7890002727508545, "num_tokens": 5023154.0, "step": 307 }, { "entropy": 0.5281811505556107, "epoch": 1.1492537313432836, "grad_norm": 0.13477671146392822, "learning_rate": 0.0002, "loss": 0.5306061506271362, "mean_token_accuracy": 0.7834227383136749, "num_tokens": 5039244.0, "step": 308 }, { "entropy": 0.526213601231575, "epoch": 1.1529850746268657, "grad_norm": 0.12357262521982193, "learning_rate": 0.0002, "loss": 0.5250381231307983, "mean_token_accuracy": 0.7864978313446045, "num_tokens": 5055638.0, "step": 309 }, { "entropy": 0.5203096121549606, "epoch": 1.1567164179104479, "grad_norm": 0.14019498229026794, "learning_rate": 0.0002, "loss": 0.5250931978225708, "mean_token_accuracy": 0.7855905443429947, "num_tokens": 5072051.0, "step": 310 }, { "entropy": 0.5365833044052124, "epoch": 1.1604477611940298, "grad_norm": 0.11511947959661484, "learning_rate": 0.0002, "loss": 0.5366431474685669, "mean_token_accuracy": 0.7812765091657639, "num_tokens": 5088455.0, "step": 311 }, { "entropy": 0.549386665225029, "epoch": 1.164179104477612, "grad_norm": 0.22190974652767181, "learning_rate": 0.0002, "loss": 0.5439768433570862, "mean_token_accuracy": 0.7783290147781372, "num_tokens": 5104840.0, "step": 312 }, { "entropy": 0.5462167263031006, "epoch": 1.1679104477611941, "grad_norm": 0.12778188288211823, "learning_rate": 0.0002, "loss": 0.543470025062561, "mean_token_accuracy": 0.7785560786724091, "num_tokens": 5121470.0, "step": 313 }, { "entropy": 0.5416186302900314, "epoch": 1.171641791044776, "grad_norm": 0.14187116920948029, "learning_rate": 0.0002, "loss": 0.5464950799942017, "mean_token_accuracy": 0.7785798162221909, "num_tokens": 5137875.0, "step": 314 }, { "entropy": 0.5286829024553299, "epoch": 1.1753731343283582, "grad_norm": 0.13838821649551392, "learning_rate": 0.0002, "loss": 0.5358678102493286, "mean_token_accuracy": 0.7815852910280228, "num_tokens": 5154241.0, "step": 315 }, { "entropy": 0.5266743376851082, "epoch": 1.1791044776119404, "grad_norm": 0.147015780210495, "learning_rate": 0.0002, "loss": 0.5362037420272827, "mean_token_accuracy": 0.7841357439756393, "num_tokens": 5170521.0, "step": 316 }, { "entropy": 0.5310831069946289, "epoch": 1.1828358208955223, "grad_norm": 0.14254894852638245, "learning_rate": 0.0002, "loss": 0.5336026549339294, "mean_token_accuracy": 0.7839198410511017, "num_tokens": 5186829.0, "step": 317 }, { "entropy": 0.5473271459341049, "epoch": 1.1865671641791045, "grad_norm": 0.1311594694852829, "learning_rate": 0.0002, "loss": 0.544696569442749, "mean_token_accuracy": 0.7774120271205902, "num_tokens": 5203232.0, "step": 318 }, { "entropy": 0.5363661348819733, "epoch": 1.1902985074626866, "grad_norm": 0.1488485336303711, "learning_rate": 0.0002, "loss": 0.528728187084198, "mean_token_accuracy": 0.7841808795928955, "num_tokens": 5219571.0, "step": 319 }, { "entropy": 0.5424627363681793, "epoch": 1.1940298507462686, "grad_norm": 0.1739611029624939, "learning_rate": 0.0002, "loss": 0.5434719920158386, "mean_token_accuracy": 0.7807931751012802, "num_tokens": 5235639.0, "step": 320 }, { "entropy": 0.5289300680160522, "epoch": 1.1977611940298507, "grad_norm": 0.16747383773326874, "learning_rate": 0.0002, "loss": 0.5332000851631165, "mean_token_accuracy": 0.7818503081798553, "num_tokens": 5252171.0, "step": 321 }, { "entropy": 0.501720704138279, "epoch": 1.2014925373134329, "grad_norm": 0.14918096363544464, "learning_rate": 0.0002, "loss": 0.5059674978256226, "mean_token_accuracy": 0.7958301901817322, "num_tokens": 5268541.0, "step": 322 }, { "entropy": 0.5355239808559418, "epoch": 1.205223880597015, "grad_norm": 0.13879424333572388, "learning_rate": 0.0002, "loss": 0.5362867116928101, "mean_token_accuracy": 0.7825663089752197, "num_tokens": 5285009.0, "step": 323 }, { "entropy": 0.5333442091941833, "epoch": 1.208955223880597, "grad_norm": 0.14377108216285706, "learning_rate": 0.0002, "loss": 0.5346744060516357, "mean_token_accuracy": 0.7837191075086594, "num_tokens": 5301110.0, "step": 324 }, { "entropy": 0.5217743068933487, "epoch": 1.212686567164179, "grad_norm": 0.14959798753261566, "learning_rate": 0.0002, "loss": 0.5172246098518372, "mean_token_accuracy": 0.7899685055017471, "num_tokens": 5317468.0, "step": 325 }, { "entropy": 0.5328510701656342, "epoch": 1.2164179104477613, "grad_norm": 0.12470122426748276, "learning_rate": 0.0002, "loss": 0.5278521776199341, "mean_token_accuracy": 0.7836970090866089, "num_tokens": 5333876.0, "step": 326 }, { "entropy": 0.5309373140335083, "epoch": 1.2201492537313432, "grad_norm": 0.1433599442243576, "learning_rate": 0.0002, "loss": 0.5376647710800171, "mean_token_accuracy": 0.7800339162349701, "num_tokens": 5350199.0, "step": 327 }, { "entropy": 0.5192165076732635, "epoch": 1.2238805970149254, "grad_norm": 0.15373900532722473, "learning_rate": 0.0002, "loss": 0.5219945311546326, "mean_token_accuracy": 0.7878232598304749, "num_tokens": 5366574.0, "step": 328 }, { "entropy": 0.5340954586863518, "epoch": 1.2276119402985075, "grad_norm": 0.16795483231544495, "learning_rate": 0.0002, "loss": 0.5392008423805237, "mean_token_accuracy": 0.7791661024093628, "num_tokens": 5382990.0, "step": 329 }, { "entropy": 0.5285765826702118, "epoch": 1.2313432835820897, "grad_norm": 0.1866690218448639, "learning_rate": 0.0002, "loss": 0.5312389135360718, "mean_token_accuracy": 0.7833608090877533, "num_tokens": 5399472.0, "step": 330 }, { "entropy": 0.5517836213111877, "epoch": 1.2350746268656716, "grad_norm": 0.1322752982378006, "learning_rate": 0.0002, "loss": 0.5441842079162598, "mean_token_accuracy": 0.7805340141057968, "num_tokens": 5415825.0, "step": 331 }, { "entropy": 0.5583052486181259, "epoch": 1.2388059701492538, "grad_norm": 0.15239977836608887, "learning_rate": 0.0002, "loss": 0.546027421951294, "mean_token_accuracy": 0.7804329693317413, "num_tokens": 5432413.0, "step": 332 }, { "entropy": 0.5434032082557678, "epoch": 1.242537313432836, "grad_norm": 0.18549253046512604, "learning_rate": 0.0002, "loss": 0.5535240769386292, "mean_token_accuracy": 0.7762450277805328, "num_tokens": 5448590.0, "step": 333 }, { "entropy": 0.5200468450784683, "epoch": 1.2462686567164178, "grad_norm": 0.1469220519065857, "learning_rate": 0.0002, "loss": 0.5291376113891602, "mean_token_accuracy": 0.783469021320343, "num_tokens": 5464965.0, "step": 334 }, { "entropy": 0.5271460115909576, "epoch": 1.25, "grad_norm": 0.18688258528709412, "learning_rate": 0.0002, "loss": 0.5423641204833984, "mean_token_accuracy": 0.7798116505146027, "num_tokens": 5481288.0, "step": 335 }, { "entropy": 0.5354730933904648, "epoch": 1.2537313432835822, "grad_norm": 0.14062704145908356, "learning_rate": 0.0002, "loss": 0.5326344966888428, "mean_token_accuracy": 0.7858006954193115, "num_tokens": 5497484.0, "step": 336 }, { "entropy": 0.5392645597457886, "epoch": 1.2574626865671643, "grad_norm": 0.1739262342453003, "learning_rate": 0.0002, "loss": 0.5398157835006714, "mean_token_accuracy": 0.7812083959579468, "num_tokens": 5513800.0, "step": 337 }, { "entropy": 0.5331858694553375, "epoch": 1.2611940298507462, "grad_norm": 0.1530216783285141, "learning_rate": 0.0002, "loss": 0.5339893698692322, "mean_token_accuracy": 0.7844341546297073, "num_tokens": 5529910.0, "step": 338 }, { "entropy": 0.5276523530483246, "epoch": 1.2649253731343284, "grad_norm": 0.15110304951667786, "learning_rate": 0.0002, "loss": 0.5268523097038269, "mean_token_accuracy": 0.7853612899780273, "num_tokens": 5546422.0, "step": 339 }, { "entropy": 0.5267068892717361, "epoch": 1.2686567164179103, "grad_norm": 0.16843296587467194, "learning_rate": 0.0002, "loss": 0.5251078009605408, "mean_token_accuracy": 0.7890652269124985, "num_tokens": 5562574.0, "step": 340 }, { "entropy": 0.5488177984952927, "epoch": 1.2723880597014925, "grad_norm": 0.1422610580921173, "learning_rate": 0.0002, "loss": 0.5420413017272949, "mean_token_accuracy": 0.7802799195051193, "num_tokens": 5579060.0, "step": 341 }, { "entropy": 0.5321039855480194, "epoch": 1.2761194029850746, "grad_norm": 0.27034249901771545, "learning_rate": 0.0002, "loss": 0.534512996673584, "mean_token_accuracy": 0.7857411950826645, "num_tokens": 5595396.0, "step": 342 }, { "entropy": 0.5352365374565125, "epoch": 1.2798507462686568, "grad_norm": 0.15001201629638672, "learning_rate": 0.0002, "loss": 0.5391510725021362, "mean_token_accuracy": 0.7823953479528427, "num_tokens": 5611886.0, "step": 343 }, { "entropy": 0.5359922051429749, "epoch": 1.2835820895522387, "grad_norm": 0.18623347580432892, "learning_rate": 0.0002, "loss": 0.5446541905403137, "mean_token_accuracy": 0.780242919921875, "num_tokens": 5628417.0, "step": 344 }, { "entropy": 0.5499957650899887, "epoch": 1.287313432835821, "grad_norm": 0.13785430788993835, "learning_rate": 0.0002, "loss": 0.5447918772697449, "mean_token_accuracy": 0.7773040980100632, "num_tokens": 5644807.0, "step": 345 }, { "entropy": 0.5422873198986053, "epoch": 1.291044776119403, "grad_norm": 0.19493389129638672, "learning_rate": 0.0002, "loss": 0.545580267906189, "mean_token_accuracy": 0.7785766869783401, "num_tokens": 5660968.0, "step": 346 }, { "entropy": 0.5600688457489014, "epoch": 1.294776119402985, "grad_norm": 0.13508763909339905, "learning_rate": 0.0002, "loss": 0.5586625337600708, "mean_token_accuracy": 0.7736444920301437, "num_tokens": 5677583.0, "step": 347 }, { "entropy": 0.5331953912973404, "epoch": 1.2985074626865671, "grad_norm": 0.13123084604740143, "learning_rate": 0.0002, "loss": 0.5309450030326843, "mean_token_accuracy": 0.7863212525844574, "num_tokens": 5694104.0, "step": 348 }, { "entropy": 0.5230339020490646, "epoch": 1.3022388059701493, "grad_norm": 0.15445858240127563, "learning_rate": 0.0002, "loss": 0.5290713310241699, "mean_token_accuracy": 0.7851019501686096, "num_tokens": 5710331.0, "step": 349 }, { "entropy": 0.5597670078277588, "epoch": 1.3059701492537314, "grad_norm": 0.12102854996919632, "learning_rate": 0.0002, "loss": 0.5601732730865479, "mean_token_accuracy": 0.7745916843414307, "num_tokens": 5726639.0, "step": 350 }, { "entropy": 0.5379252731800079, "epoch": 1.3097014925373134, "grad_norm": 0.15875613689422607, "learning_rate": 0.0002, "loss": 0.5450211763381958, "mean_token_accuracy": 0.7802536338567734, "num_tokens": 5743022.0, "step": 351 }, { "entropy": 0.5242641121149063, "epoch": 1.3134328358208955, "grad_norm": 0.1778116673231125, "learning_rate": 0.0002, "loss": 0.5308142304420471, "mean_token_accuracy": 0.7841234058141708, "num_tokens": 5759431.0, "step": 352 }, { "entropy": 0.5329146087169647, "epoch": 1.3171641791044777, "grad_norm": 0.13093073666095734, "learning_rate": 0.0002, "loss": 0.5333167314529419, "mean_token_accuracy": 0.7824307978153229, "num_tokens": 5775870.0, "step": 353 }, { "entropy": 0.5363575518131256, "epoch": 1.3208955223880596, "grad_norm": 0.15412437915802002, "learning_rate": 0.0002, "loss": 0.5358852744102478, "mean_token_accuracy": 0.7839270085096359, "num_tokens": 5792217.0, "step": 354 }, { "entropy": 0.538811706006527, "epoch": 1.3246268656716418, "grad_norm": 0.12728764116764069, "learning_rate": 0.0002, "loss": 0.5357580780982971, "mean_token_accuracy": 0.7833316326141357, "num_tokens": 5808781.0, "step": 355 }, { "entropy": 0.5331800431013107, "epoch": 1.328358208955224, "grad_norm": 0.14081059396266937, "learning_rate": 0.0002, "loss": 0.5337068438529968, "mean_token_accuracy": 0.7839716076850891, "num_tokens": 5824951.0, "step": 356 }, { "entropy": 0.5460695028305054, "epoch": 1.332089552238806, "grad_norm": 0.16031600534915924, "learning_rate": 0.0002, "loss": 0.5452313423156738, "mean_token_accuracy": 0.7771268039941788, "num_tokens": 5841261.0, "step": 357 }, { "entropy": 0.540604442358017, "epoch": 1.335820895522388, "grad_norm": 0.12970028817653656, "learning_rate": 0.0002, "loss": 0.5406724810600281, "mean_token_accuracy": 0.7837041467428207, "num_tokens": 5857446.0, "step": 358 }, { "entropy": 0.5167972147464752, "epoch": 1.3395522388059702, "grad_norm": 0.15045662224292755, "learning_rate": 0.0002, "loss": 0.5290297865867615, "mean_token_accuracy": 0.785188764333725, "num_tokens": 5873984.0, "step": 359 }, { "entropy": 0.5397705882787704, "epoch": 1.3432835820895521, "grad_norm": 0.12482494115829468, "learning_rate": 0.0002, "loss": 0.5406928062438965, "mean_token_accuracy": 0.7810540497303009, "num_tokens": 5890369.0, "step": 360 }, { "entropy": 0.5350628793239594, "epoch": 1.3470149253731343, "grad_norm": 0.12060931324958801, "learning_rate": 0.0002, "loss": 0.5288930535316467, "mean_token_accuracy": 0.7861282080411911, "num_tokens": 5906651.0, "step": 361 }, { "entropy": 0.5198515579104424, "epoch": 1.3507462686567164, "grad_norm": 0.12899695336818695, "learning_rate": 0.0002, "loss": 0.5199739336967468, "mean_token_accuracy": 0.7908322215080261, "num_tokens": 5922992.0, "step": 362 }, { "entropy": 0.5311819463968277, "epoch": 1.3544776119402986, "grad_norm": 0.12395589053630829, "learning_rate": 0.0002, "loss": 0.5295090675354004, "mean_token_accuracy": 0.7864852249622345, "num_tokens": 5939475.0, "step": 363 }, { "entropy": 0.5441964268684387, "epoch": 1.3582089552238805, "grad_norm": 0.15559257566928864, "learning_rate": 0.0002, "loss": 0.5557464957237244, "mean_token_accuracy": 0.7727831602096558, "num_tokens": 5955917.0, "step": 364 }, { "entropy": 0.5318419188261032, "epoch": 1.3619402985074627, "grad_norm": 0.13309583067893982, "learning_rate": 0.0002, "loss": 0.531787633895874, "mean_token_accuracy": 0.7829223573207855, "num_tokens": 5972429.0, "step": 365 }, { "entropy": 0.5325569957494736, "epoch": 1.3656716417910448, "grad_norm": 0.15286150574684143, "learning_rate": 0.0002, "loss": 0.5281562805175781, "mean_token_accuracy": 0.7858050912618637, "num_tokens": 5988860.0, "step": 366 }, { "entropy": 0.5343448221683502, "epoch": 1.3694029850746268, "grad_norm": 0.15089887380599976, "learning_rate": 0.0002, "loss": 0.5317696332931519, "mean_token_accuracy": 0.7849821001291275, "num_tokens": 6005244.0, "step": 367 }, { "entropy": 0.5514230877161026, "epoch": 1.373134328358209, "grad_norm": 0.13945485651493073, "learning_rate": 0.0002, "loss": 0.5445812940597534, "mean_token_accuracy": 0.7807283848524094, "num_tokens": 6021687.0, "step": 368 }, { "entropy": 0.5257244408130646, "epoch": 1.376865671641791, "grad_norm": 0.15246176719665527, "learning_rate": 0.0002, "loss": 0.5266861319541931, "mean_token_accuracy": 0.7850677073001862, "num_tokens": 6038259.0, "step": 369 }, { "entropy": 0.5162273794412613, "epoch": 1.3805970149253732, "grad_norm": 0.12324219942092896, "learning_rate": 0.0002, "loss": 0.5183256268501282, "mean_token_accuracy": 0.7884418070316315, "num_tokens": 6054637.0, "step": 370 }, { "entropy": 0.5300852656364441, "epoch": 1.3843283582089552, "grad_norm": 0.1871775984764099, "learning_rate": 0.0002, "loss": 0.5378446578979492, "mean_token_accuracy": 0.7807964831590652, "num_tokens": 6071175.0, "step": 371 }, { "entropy": 0.5412422120571136, "epoch": 1.3880597014925373, "grad_norm": 0.14725005626678467, "learning_rate": 0.0002, "loss": 0.5465957522392273, "mean_token_accuracy": 0.7783457934856415, "num_tokens": 6087459.0, "step": 372 }, { "entropy": 0.5440727770328522, "epoch": 1.3917910447761195, "grad_norm": 0.1507187932729721, "learning_rate": 0.0002, "loss": 0.5401308536529541, "mean_token_accuracy": 0.7813372761011124, "num_tokens": 6103779.0, "step": 373 }, { "entropy": 0.5449319109320641, "epoch": 1.3955223880597014, "grad_norm": 0.1400064378976822, "learning_rate": 0.0002, "loss": 0.5477454662322998, "mean_token_accuracy": 0.7775075435638428, "num_tokens": 6120211.0, "step": 374 }, { "entropy": 0.5422904789447784, "epoch": 1.3992537313432836, "grad_norm": 0.14892356097698212, "learning_rate": 0.0002, "loss": 0.5438749194145203, "mean_token_accuracy": 0.7779098898172379, "num_tokens": 6136613.0, "step": 375 }, { "entropy": 0.5359798967838287, "epoch": 1.4029850746268657, "grad_norm": 0.1638849824666977, "learning_rate": 0.0002, "loss": 0.5464264154434204, "mean_token_accuracy": 0.7796951085329056, "num_tokens": 6153118.0, "step": 376 }, { "entropy": 0.5272762179374695, "epoch": 1.4067164179104479, "grad_norm": 0.1572565734386444, "learning_rate": 0.0002, "loss": 0.5275948643684387, "mean_token_accuracy": 0.7868656516075134, "num_tokens": 6169351.0, "step": 377 }, { "entropy": 0.5318129509687424, "epoch": 1.4104477611940298, "grad_norm": 0.1217207983136177, "learning_rate": 0.0002, "loss": 0.5282657742500305, "mean_token_accuracy": 0.7874875515699387, "num_tokens": 6185947.0, "step": 378 }, { "entropy": 0.5453623086214066, "epoch": 1.414179104477612, "grad_norm": 0.3408029079437256, "learning_rate": 0.0002, "loss": 0.5384775400161743, "mean_token_accuracy": 0.7859825044870377, "num_tokens": 6202395.0, "step": 379 }, { "entropy": 0.5526222735643387, "epoch": 1.417910447761194, "grad_norm": 0.23189330101013184, "learning_rate": 0.0002, "loss": 0.5524420738220215, "mean_token_accuracy": 0.7748881280422211, "num_tokens": 6218653.0, "step": 380 }, { "entropy": 0.5264930576086044, "epoch": 1.421641791044776, "grad_norm": 0.19049955904483795, "learning_rate": 0.0002, "loss": 0.5374311208724976, "mean_token_accuracy": 0.7826297730207443, "num_tokens": 6234993.0, "step": 381 }, { "entropy": 0.5191953629255295, "epoch": 1.4253731343283582, "grad_norm": 0.1691526621580124, "learning_rate": 0.0002, "loss": 0.5358802080154419, "mean_token_accuracy": 0.7822402864694595, "num_tokens": 6251114.0, "step": 382 }, { "entropy": 0.5427180528640747, "epoch": 1.4291044776119404, "grad_norm": 0.13084714114665985, "learning_rate": 0.0002, "loss": 0.537938117980957, "mean_token_accuracy": 0.783057376742363, "num_tokens": 6267469.0, "step": 383 }, { "entropy": 0.5605024993419647, "epoch": 1.4328358208955223, "grad_norm": 0.15293866395950317, "learning_rate": 0.0002, "loss": 0.5501874685287476, "mean_token_accuracy": 0.7784303724765778, "num_tokens": 6283955.0, "step": 384 }, { "entropy": 0.5423373132944107, "epoch": 1.4365671641791045, "grad_norm": 0.12526267766952515, "learning_rate": 0.0002, "loss": 0.5338963866233826, "mean_token_accuracy": 0.7840876579284668, "num_tokens": 6300241.0, "step": 385 }, { "entropy": 0.5322032272815704, "epoch": 1.4402985074626866, "grad_norm": 0.14180147647857666, "learning_rate": 0.0002, "loss": 0.5326216220855713, "mean_token_accuracy": 0.7845493853092194, "num_tokens": 6316506.0, "step": 386 }, { "entropy": 0.5429232567548752, "epoch": 1.4440298507462686, "grad_norm": 0.16007299721240997, "learning_rate": 0.0002, "loss": 0.5557198524475098, "mean_token_accuracy": 0.7756443470716476, "num_tokens": 6333160.0, "step": 387 }, { "entropy": 0.5302825719118118, "epoch": 1.4477611940298507, "grad_norm": 0.12839363515377045, "learning_rate": 0.0002, "loss": 0.5346431136131287, "mean_token_accuracy": 0.7858215421438217, "num_tokens": 6349692.0, "step": 388 }, { "entropy": 0.5415708720684052, "epoch": 1.4514925373134329, "grad_norm": 0.1452096849679947, "learning_rate": 0.0002, "loss": 0.5441015362739563, "mean_token_accuracy": 0.7760088890790939, "num_tokens": 6365979.0, "step": 389 }, { "entropy": 0.5408393442630768, "epoch": 1.455223880597015, "grad_norm": 0.1318868100643158, "learning_rate": 0.0002, "loss": 0.5366842746734619, "mean_token_accuracy": 0.7860211282968521, "num_tokens": 6382253.0, "step": 390 }, { "entropy": 0.5344153642654419, "epoch": 1.458955223880597, "grad_norm": 0.1528550684452057, "learning_rate": 0.0002, "loss": 0.5343711972236633, "mean_token_accuracy": 0.7834310978651047, "num_tokens": 6398277.0, "step": 391 }, { "entropy": 0.5448261797428131, "epoch": 1.462686567164179, "grad_norm": 0.13751660287380219, "learning_rate": 0.0002, "loss": 0.5372248888015747, "mean_token_accuracy": 0.781394749879837, "num_tokens": 6414655.0, "step": 392 }, { "entropy": 0.5271979123353958, "epoch": 1.4664179104477613, "grad_norm": 0.14335128664970398, "learning_rate": 0.0002, "loss": 0.5272061824798584, "mean_token_accuracy": 0.7860262989997864, "num_tokens": 6430931.0, "step": 393 }, { "entropy": 0.5503392070531845, "epoch": 1.4701492537313432, "grad_norm": 0.1436121165752411, "learning_rate": 0.0002, "loss": 0.5583488345146179, "mean_token_accuracy": 0.7723452150821686, "num_tokens": 6447385.0, "step": 394 }, { "entropy": 0.5310524106025696, "epoch": 1.4738805970149254, "grad_norm": 0.16840456426143646, "learning_rate": 0.0002, "loss": 0.5381408929824829, "mean_token_accuracy": 0.7820066809654236, "num_tokens": 6463801.0, "step": 395 }, { "entropy": 0.544038251042366, "epoch": 1.4776119402985075, "grad_norm": 0.12804877758026123, "learning_rate": 0.0002, "loss": 0.5466898083686829, "mean_token_accuracy": 0.779111385345459, "num_tokens": 6480225.0, "step": 396 }, { "entropy": 0.5286617875099182, "epoch": 1.4813432835820897, "grad_norm": 0.1583615094423294, "learning_rate": 0.0002, "loss": 0.5371429324150085, "mean_token_accuracy": 0.781273365020752, "num_tokens": 6496250.0, "step": 397 }, { "entropy": 0.5369281619787216, "epoch": 1.4850746268656716, "grad_norm": 0.13522376120090485, "learning_rate": 0.0002, "loss": 0.5328642129898071, "mean_token_accuracy": 0.7812697738409042, "num_tokens": 6512604.0, "step": 398 }, { "entropy": 0.535246454179287, "epoch": 1.4888059701492538, "grad_norm": 0.12748968601226807, "learning_rate": 0.0002, "loss": 0.529126763343811, "mean_token_accuracy": 0.7845304161310196, "num_tokens": 6528888.0, "step": 399 }, { "entropy": 0.5552913099527359, "epoch": 1.4925373134328357, "grad_norm": 0.1282271295785904, "learning_rate": 0.0002, "loss": 0.5470327138900757, "mean_token_accuracy": 0.7776638716459274, "num_tokens": 6545412.0, "step": 400 }, { "entropy": 0.5173196047544479, "epoch": 1.4962686567164178, "grad_norm": 0.14874818921089172, "learning_rate": 0.0002, "loss": 0.524068295955658, "mean_token_accuracy": 0.7867140471935272, "num_tokens": 6561535.0, "step": 401 }, { "entropy": 0.5213709771633148, "epoch": 1.5, "grad_norm": 0.13309182226657867, "learning_rate": 0.0002, "loss": 0.5244147777557373, "mean_token_accuracy": 0.7871381193399429, "num_tokens": 6577842.0, "step": 402 }, { "entropy": 0.5317850112915039, "epoch": 1.5037313432835822, "grad_norm": 0.1433606594800949, "learning_rate": 0.0002, "loss": 0.5365285277366638, "mean_token_accuracy": 0.7824452221393585, "num_tokens": 6594006.0, "step": 403 }, { "entropy": 0.544880673289299, "epoch": 1.5074626865671643, "grad_norm": 0.12236304581165314, "learning_rate": 0.0002, "loss": 0.5444092750549316, "mean_token_accuracy": 0.778602346777916, "num_tokens": 6610288.0, "step": 404 }, { "entropy": 0.532042846083641, "epoch": 1.5111940298507462, "grad_norm": 0.12565302848815918, "learning_rate": 0.0002, "loss": 0.5315436124801636, "mean_token_accuracy": 0.7820066958665848, "num_tokens": 6626761.0, "step": 405 }, { "entropy": 0.5506146252155304, "epoch": 1.5149253731343284, "grad_norm": 0.12706807255744934, "learning_rate": 0.0002, "loss": 0.5524188876152039, "mean_token_accuracy": 0.7748337537050247, "num_tokens": 6643344.0, "step": 406 }, { "entropy": 0.5542557537555695, "epoch": 1.5186567164179103, "grad_norm": 0.12174059450626373, "learning_rate": 0.0002, "loss": 0.5521225929260254, "mean_token_accuracy": 0.778037965297699, "num_tokens": 6660150.0, "step": 407 }, { "entropy": 0.5313189476728439, "epoch": 1.5223880597014925, "grad_norm": 0.16201771795749664, "learning_rate": 0.0002, "loss": 0.5316515564918518, "mean_token_accuracy": 0.7825613915920258, "num_tokens": 6676257.0, "step": 408 }, { "entropy": 0.5481334328651428, "epoch": 1.5261194029850746, "grad_norm": 0.14420105516910553, "learning_rate": 0.0002, "loss": 0.547515869140625, "mean_token_accuracy": 0.7776167094707489, "num_tokens": 6692716.0, "step": 409 }, { "entropy": 0.5290578305721283, "epoch": 1.5298507462686568, "grad_norm": 0.14699825644493103, "learning_rate": 0.0002, "loss": 0.5254528522491455, "mean_token_accuracy": 0.788268119096756, "num_tokens": 6708994.0, "step": 410 }, { "entropy": 0.5288655012845993, "epoch": 1.533582089552239, "grad_norm": 0.15162502229213715, "learning_rate": 0.0002, "loss": 0.5358376502990723, "mean_token_accuracy": 0.782762810587883, "num_tokens": 6725371.0, "step": 411 }, { "entropy": 0.5213432013988495, "epoch": 1.537313432835821, "grad_norm": 0.1827428936958313, "learning_rate": 0.0002, "loss": 0.5308473110198975, "mean_token_accuracy": 0.7839875668287277, "num_tokens": 6741339.0, "step": 412 }, { "entropy": 0.5378746837377548, "epoch": 1.5410447761194028, "grad_norm": 0.13657329976558685, "learning_rate": 0.0002, "loss": 0.5338229537010193, "mean_token_accuracy": 0.7829029411077499, "num_tokens": 6757780.0, "step": 413 }, { "entropy": 0.5342704057693481, "epoch": 1.544776119402985, "grad_norm": 0.1464962214231491, "learning_rate": 0.0002, "loss": 0.529054582118988, "mean_token_accuracy": 0.785891056060791, "num_tokens": 6774311.0, "step": 414 }, { "entropy": 0.5312474966049194, "epoch": 1.5485074626865671, "grad_norm": 0.15172705054283142, "learning_rate": 0.0002, "loss": 0.5394980311393738, "mean_token_accuracy": 0.7824061512947083, "num_tokens": 6790408.0, "step": 415 }, { "entropy": 0.5170525014400482, "epoch": 1.5522388059701493, "grad_norm": 0.15336130559444427, "learning_rate": 0.0002, "loss": 0.5251516699790955, "mean_token_accuracy": 0.7875834852457047, "num_tokens": 6806555.0, "step": 416 }, { "entropy": 0.5356197506189346, "epoch": 1.5559701492537314, "grad_norm": 0.14176255464553833, "learning_rate": 0.0002, "loss": 0.5379368662834167, "mean_token_accuracy": 0.781431034207344, "num_tokens": 6823014.0, "step": 417 }, { "entropy": 0.5277817100286484, "epoch": 1.5597014925373134, "grad_norm": 0.14984361827373505, "learning_rate": 0.0002, "loss": 0.524969756603241, "mean_token_accuracy": 0.7859384715557098, "num_tokens": 6839244.0, "step": 418 }, { "entropy": 0.535449355840683, "epoch": 1.5634328358208955, "grad_norm": 0.13689614832401276, "learning_rate": 0.0002, "loss": 0.5337757468223572, "mean_token_accuracy": 0.7802022695541382, "num_tokens": 6855421.0, "step": 419 }, { "entropy": 0.5216768980026245, "epoch": 1.5671641791044775, "grad_norm": 0.13293899595737457, "learning_rate": 0.0002, "loss": 0.5152947902679443, "mean_token_accuracy": 0.7913374304771423, "num_tokens": 6871759.0, "step": 420 }, { "entropy": 0.5257552266120911, "epoch": 1.5708955223880596, "grad_norm": 0.12973323464393616, "learning_rate": 0.0002, "loss": 0.5320898294448853, "mean_token_accuracy": 0.7863506823778152, "num_tokens": 6888261.0, "step": 421 }, { "entropy": 0.5438365638256073, "epoch": 1.5746268656716418, "grad_norm": 0.15889972448349, "learning_rate": 0.0002, "loss": 0.5526459217071533, "mean_token_accuracy": 0.7783207595348358, "num_tokens": 6904962.0, "step": 422 }, { "entropy": 0.5427816063165665, "epoch": 1.578358208955224, "grad_norm": 0.141456738114357, "learning_rate": 0.0002, "loss": 0.5505415797233582, "mean_token_accuracy": 0.7792007029056549, "num_tokens": 6921400.0, "step": 423 }, { "entropy": 0.5111957639455795, "epoch": 1.582089552238806, "grad_norm": 0.1351761519908905, "learning_rate": 0.0002, "loss": 0.511957585811615, "mean_token_accuracy": 0.7941061407327652, "num_tokens": 6937506.0, "step": 424 }, { "entropy": 0.5456200540065765, "epoch": 1.585820895522388, "grad_norm": 0.14772872626781464, "learning_rate": 0.0002, "loss": 0.5425821542739868, "mean_token_accuracy": 0.777664914727211, "num_tokens": 6953968.0, "step": 425 }, { "entropy": 0.5384055227041245, "epoch": 1.5895522388059702, "grad_norm": 0.12057865411043167, "learning_rate": 0.0002, "loss": 0.5403178930282593, "mean_token_accuracy": 0.7802070528268814, "num_tokens": 6970101.0, "step": 426 }, { "entropy": 0.5330870598554611, "epoch": 1.5932835820895521, "grad_norm": 0.14061623811721802, "learning_rate": 0.0002, "loss": 0.5319790244102478, "mean_token_accuracy": 0.7867544293403625, "num_tokens": 6986564.0, "step": 427 }, { "entropy": 0.5127943903207779, "epoch": 1.5970149253731343, "grad_norm": 0.1368899643421173, "learning_rate": 0.0002, "loss": 0.5163131952285767, "mean_token_accuracy": 0.7912420630455017, "num_tokens": 7002876.0, "step": 428 }, { "entropy": 0.5254192352294922, "epoch": 1.6007462686567164, "grad_norm": 0.16491283476352692, "learning_rate": 0.0002, "loss": 0.5343653559684753, "mean_token_accuracy": 0.7813780009746552, "num_tokens": 7019170.0, "step": 429 }, { "entropy": 0.5337297320365906, "epoch": 1.6044776119402986, "grad_norm": 0.13911473751068115, "learning_rate": 0.0002, "loss": 0.5348519086837769, "mean_token_accuracy": 0.7835835814476013, "num_tokens": 7035680.0, "step": 430 }, { "entropy": 0.5483486354351044, "epoch": 1.6082089552238807, "grad_norm": 0.15066570043563843, "learning_rate": 0.0002, "loss": 0.543323814868927, "mean_token_accuracy": 0.7779914885759354, "num_tokens": 7051951.0, "step": 431 }, { "entropy": 0.558162733912468, "epoch": 1.6119402985074627, "grad_norm": 0.14888809621334076, "learning_rate": 0.0002, "loss": 0.5558294057846069, "mean_token_accuracy": 0.7741727977991104, "num_tokens": 7068414.0, "step": 432 }, { "entropy": 0.5639995038509369, "epoch": 1.6156716417910446, "grad_norm": 0.14019054174423218, "learning_rate": 0.0002, "loss": 0.5553058385848999, "mean_token_accuracy": 0.7748651653528214, "num_tokens": 7084803.0, "step": 433 }, { "entropy": 0.52562515437603, "epoch": 1.6194029850746268, "grad_norm": 0.1775631606578827, "learning_rate": 0.0002, "loss": 0.5248590111732483, "mean_token_accuracy": 0.7880850434303284, "num_tokens": 7101193.0, "step": 434 }, { "entropy": 0.5416489392518997, "epoch": 1.623134328358209, "grad_norm": 0.12513571977615356, "learning_rate": 0.0002, "loss": 0.5416374206542969, "mean_token_accuracy": 0.7787177264690399, "num_tokens": 7117779.0, "step": 435 }, { "entropy": 0.5430044084787369, "epoch": 1.626865671641791, "grad_norm": 0.19869297742843628, "learning_rate": 0.0002, "loss": 0.5577962398529053, "mean_token_accuracy": 0.7749052196741104, "num_tokens": 7134065.0, "step": 436 }, { "entropy": 0.526473268866539, "epoch": 1.6305970149253732, "grad_norm": 0.13564684987068176, "learning_rate": 0.0002, "loss": 0.5336202383041382, "mean_token_accuracy": 0.7842326164245605, "num_tokens": 7150250.0, "step": 437 }, { "entropy": 0.5367172211408615, "epoch": 1.6343283582089554, "grad_norm": 0.13337789475917816, "learning_rate": 0.0002, "loss": 0.5405253171920776, "mean_token_accuracy": 0.7821898907423019, "num_tokens": 7166822.0, "step": 438 }, { "entropy": 0.5436544269323349, "epoch": 1.6380597014925373, "grad_norm": 0.13991288840770721, "learning_rate": 0.0002, "loss": 0.5384564399719238, "mean_token_accuracy": 0.7812158763408661, "num_tokens": 7183330.0, "step": 439 }, { "entropy": 0.5360020697116852, "epoch": 1.6417910447761193, "grad_norm": 0.1291709989309311, "learning_rate": 0.0002, "loss": 0.524196982383728, "mean_token_accuracy": 0.7875594347715378, "num_tokens": 7199815.0, "step": 440 }, { "entropy": 0.5343951657414436, "epoch": 1.6455223880597014, "grad_norm": 0.13694606721401215, "learning_rate": 0.0002, "loss": 0.5314103960990906, "mean_token_accuracy": 0.7855215966701508, "num_tokens": 7216312.0, "step": 441 }, { "entropy": 0.5499645173549652, "epoch": 1.6492537313432836, "grad_norm": 0.1579257845878601, "learning_rate": 0.0002, "loss": 0.5512703061103821, "mean_token_accuracy": 0.7742991000413895, "num_tokens": 7232728.0, "step": 442 }, { "entropy": 0.5159503519535065, "epoch": 1.6529850746268657, "grad_norm": 0.16577711701393127, "learning_rate": 0.0002, "loss": 0.5299012660980225, "mean_token_accuracy": 0.7818514108657837, "num_tokens": 7248844.0, "step": 443 }, { "entropy": 0.5321104824542999, "epoch": 1.6567164179104479, "grad_norm": 0.19517181813716888, "learning_rate": 0.0002, "loss": 0.5426245927810669, "mean_token_accuracy": 0.7829670608043671, "num_tokens": 7265297.0, "step": 444 }, { "entropy": 0.5357498228549957, "epoch": 1.6604477611940298, "grad_norm": 0.1414795070886612, "learning_rate": 0.0002, "loss": 0.5346581935882568, "mean_token_accuracy": 0.784277081489563, "num_tokens": 7281737.0, "step": 445 }, { "entropy": 0.5516169220209122, "epoch": 1.664179104477612, "grad_norm": 0.16740073263645172, "learning_rate": 0.0002, "loss": 0.5406741499900818, "mean_token_accuracy": 0.7807598114013672, "num_tokens": 7298065.0, "step": 446 }, { "entropy": 0.5355339050292969, "epoch": 1.667910447761194, "grad_norm": 0.11836501210927963, "learning_rate": 0.0002, "loss": 0.527145266532898, "mean_token_accuracy": 0.7858247607946396, "num_tokens": 7314370.0, "step": 447 }, { "entropy": 0.5455258637666702, "epoch": 1.671641791044776, "grad_norm": 0.12945692241191864, "learning_rate": 0.0002, "loss": 0.5454037189483643, "mean_token_accuracy": 0.7800126224756241, "num_tokens": 7330673.0, "step": 448 }, { "entropy": 0.5411469787359238, "epoch": 1.6753731343283582, "grad_norm": 0.16638043522834778, "learning_rate": 0.0002, "loss": 0.5542144775390625, "mean_token_accuracy": 0.772837832570076, "num_tokens": 7346907.0, "step": 449 }, { "entropy": 0.5359169989824295, "epoch": 1.6791044776119404, "grad_norm": 0.14383791387081146, "learning_rate": 0.0002, "loss": 0.5425304770469666, "mean_token_accuracy": 0.7819065749645233, "num_tokens": 7363351.0, "step": 450 }, { "entropy": 0.5467946827411652, "epoch": 1.6828358208955225, "grad_norm": 0.12469735741615295, "learning_rate": 0.0002, "loss": 0.5454594492912292, "mean_token_accuracy": 0.7800441980361938, "num_tokens": 7379994.0, "step": 451 }, { "entropy": 0.5265442132949829, "epoch": 1.6865671641791045, "grad_norm": 0.123937226831913, "learning_rate": 0.0002, "loss": 0.5216733813285828, "mean_token_accuracy": 0.786560595035553, "num_tokens": 7396349.0, "step": 452 }, { "entropy": 0.5408566147089005, "epoch": 1.6902985074626866, "grad_norm": 0.14807483553886414, "learning_rate": 0.0002, "loss": 0.5339705944061279, "mean_token_accuracy": 0.7806796431541443, "num_tokens": 7412716.0, "step": 453 }, { "entropy": 0.542450025677681, "epoch": 1.6940298507462686, "grad_norm": 0.12422959506511688, "learning_rate": 0.0002, "loss": 0.538216769695282, "mean_token_accuracy": 0.7807506322860718, "num_tokens": 7429301.0, "step": 454 }, { "entropy": 0.5282323509454727, "epoch": 1.6977611940298507, "grad_norm": 0.1373056024312973, "learning_rate": 0.0002, "loss": 0.5334514379501343, "mean_token_accuracy": 0.7819238603115082, "num_tokens": 7445698.0, "step": 455 }, { "entropy": 0.5225353688001633, "epoch": 1.7014925373134329, "grad_norm": 0.1703997701406479, "learning_rate": 0.0002, "loss": 0.5377897024154663, "mean_token_accuracy": 0.7809168249368668, "num_tokens": 7462002.0, "step": 456 }, { "entropy": 0.5348514318466187, "epoch": 1.705223880597015, "grad_norm": 0.15133416652679443, "learning_rate": 0.0002, "loss": 0.543133020401001, "mean_token_accuracy": 0.7799534946680069, "num_tokens": 7478153.0, "step": 457 }, { "entropy": 0.54405577480793, "epoch": 1.7089552238805972, "grad_norm": 0.13994158804416656, "learning_rate": 0.0002, "loss": 0.5500596165657043, "mean_token_accuracy": 0.7780357599258423, "num_tokens": 7494573.0, "step": 458 }, { "entropy": 0.5588826686143875, "epoch": 1.712686567164179, "grad_norm": 0.15153922140598297, "learning_rate": 0.0002, "loss": 0.5551016330718994, "mean_token_accuracy": 0.7748077511787415, "num_tokens": 7510790.0, "step": 459 }, { "entropy": 0.5657205730676651, "epoch": 1.716417910447761, "grad_norm": 0.13676036894321442, "learning_rate": 0.0002, "loss": 0.5570163726806641, "mean_token_accuracy": 0.773433119058609, "num_tokens": 7527466.0, "step": 460 }, { "entropy": 0.5257614329457283, "epoch": 1.7201492537313432, "grad_norm": 0.13067854940891266, "learning_rate": 0.0002, "loss": 0.5170261263847351, "mean_token_accuracy": 0.7894982546567917, "num_tokens": 7543803.0, "step": 461 }, { "entropy": 0.5358800739049911, "epoch": 1.7238805970149254, "grad_norm": 0.12191294878721237, "learning_rate": 0.0002, "loss": 0.5280119776725769, "mean_token_accuracy": 0.7868626117706299, "num_tokens": 7560274.0, "step": 462 }, { "entropy": 0.5240240395069122, "epoch": 1.7276119402985075, "grad_norm": 0.14306314289569855, "learning_rate": 0.0002, "loss": 0.5353462100028992, "mean_token_accuracy": 0.782327190041542, "num_tokens": 7576773.0, "step": 463 }, { "entropy": 0.5037208497524261, "epoch": 1.7313432835820897, "grad_norm": 0.14881490170955658, "learning_rate": 0.0002, "loss": 0.5086286067962646, "mean_token_accuracy": 0.7924383580684662, "num_tokens": 7593022.0, "step": 464 }, { "entropy": 0.5487196296453476, "epoch": 1.7350746268656716, "grad_norm": 0.14098134636878967, "learning_rate": 0.0002, "loss": 0.5548460483551025, "mean_token_accuracy": 0.7751922011375427, "num_tokens": 7609497.0, "step": 465 }, { "entropy": 0.5405637472867966, "epoch": 1.7388059701492538, "grad_norm": 0.13519442081451416, "learning_rate": 0.0002, "loss": 0.5397500395774841, "mean_token_accuracy": 0.7797744125127792, "num_tokens": 7625829.0, "step": 466 }, { "entropy": 0.542302668094635, "epoch": 1.7425373134328357, "grad_norm": 0.12859952449798584, "learning_rate": 0.0002, "loss": 0.534672200679779, "mean_token_accuracy": 0.7826961874961853, "num_tokens": 7642312.0, "step": 467 }, { "entropy": 0.533673532307148, "epoch": 1.7462686567164178, "grad_norm": 0.14180679619312286, "learning_rate": 0.0002, "loss": 0.5322732925415039, "mean_token_accuracy": 0.7828265875577927, "num_tokens": 7658803.0, "step": 468 }, { "entropy": 0.5318716764450073, "epoch": 1.75, "grad_norm": 0.16254329681396484, "learning_rate": 0.0002, "loss": 0.5418020486831665, "mean_token_accuracy": 0.7817637473344803, "num_tokens": 7674957.0, "step": 469 }, { "entropy": 0.5334404781460762, "epoch": 1.7537313432835822, "grad_norm": 0.14448624849319458, "learning_rate": 0.0002, "loss": 0.5339848399162292, "mean_token_accuracy": 0.7814598977565765, "num_tokens": 7691620.0, "step": 470 }, { "entropy": 0.551649421453476, "epoch": 1.7574626865671643, "grad_norm": 0.16072067618370056, "learning_rate": 0.0002, "loss": 0.5504499673843384, "mean_token_accuracy": 0.7762804180383682, "num_tokens": 7708049.0, "step": 471 }, { "entropy": 0.5477486550807953, "epoch": 1.7611940298507462, "grad_norm": 0.1135358139872551, "learning_rate": 0.0002, "loss": 0.5485340356826782, "mean_token_accuracy": 0.7758127301931381, "num_tokens": 7724545.0, "step": 472 }, { "entropy": 0.5408584326505661, "epoch": 1.7649253731343284, "grad_norm": 0.132512167096138, "learning_rate": 0.0002, "loss": 0.5433669686317444, "mean_token_accuracy": 0.7828538417816162, "num_tokens": 7741050.0, "step": 473 }, { "entropy": 0.5271462053060532, "epoch": 1.7686567164179103, "grad_norm": 0.1477174609899521, "learning_rate": 0.0002, "loss": 0.5306966304779053, "mean_token_accuracy": 0.7825304567813873, "num_tokens": 7757294.0, "step": 474 }, { "entropy": 0.5110566020011902, "epoch": 1.7723880597014925, "grad_norm": 0.1395856738090515, "learning_rate": 0.0002, "loss": 0.5155825018882751, "mean_token_accuracy": 0.7897263616323471, "num_tokens": 7773651.0, "step": 475 }, { "entropy": 0.5346289277076721, "epoch": 1.7761194029850746, "grad_norm": 0.12764999270439148, "learning_rate": 0.0002, "loss": 0.5333414673805237, "mean_token_accuracy": 0.7830168902873993, "num_tokens": 7789823.0, "step": 476 }, { "entropy": 0.5467153936624527, "epoch": 1.7798507462686568, "grad_norm": 0.15203405916690826, "learning_rate": 0.0002, "loss": 0.5423698425292969, "mean_token_accuracy": 0.7790202498435974, "num_tokens": 7806470.0, "step": 477 }, { "entropy": 0.532525897026062, "epoch": 1.783582089552239, "grad_norm": 0.1433921456336975, "learning_rate": 0.0002, "loss": 0.529548168182373, "mean_token_accuracy": 0.786345586180687, "num_tokens": 7822732.0, "step": 478 }, { "entropy": 0.5197082981467247, "epoch": 1.787313432835821, "grad_norm": 0.14001280069351196, "learning_rate": 0.0002, "loss": 0.5263832807540894, "mean_token_accuracy": 0.7867995053529739, "num_tokens": 7838797.0, "step": 479 }, { "entropy": 0.5292367935180664, "epoch": 1.7910447761194028, "grad_norm": 0.14335371553897858, "learning_rate": 0.0002, "loss": 0.5325329303741455, "mean_token_accuracy": 0.7837976664304733, "num_tokens": 7855144.0, "step": 480 }, { "entropy": 0.5310244560241699, "epoch": 1.794776119402985, "grad_norm": 0.15651096403598785, "learning_rate": 0.0002, "loss": 0.5364205837249756, "mean_token_accuracy": 0.781629890203476, "num_tokens": 7871292.0, "step": 481 }, { "entropy": 0.5531992614269257, "epoch": 1.7985074626865671, "grad_norm": 0.1264420747756958, "learning_rate": 0.0002, "loss": 0.5501738786697388, "mean_token_accuracy": 0.7759624570608139, "num_tokens": 7887723.0, "step": 482 }, { "entropy": 0.5409988686442375, "epoch": 1.8022388059701493, "grad_norm": 0.12659387290477753, "learning_rate": 0.0002, "loss": 0.5382291674613953, "mean_token_accuracy": 0.7843269854784012, "num_tokens": 7904018.0, "step": 483 }, { "entropy": 0.5395593494176865, "epoch": 1.8059701492537314, "grad_norm": 0.1302158683538437, "learning_rate": 0.0002, "loss": 0.5366786122322083, "mean_token_accuracy": 0.7830972671508789, "num_tokens": 7920488.0, "step": 484 }, { "entropy": 0.5380191504955292, "epoch": 1.8097014925373134, "grad_norm": 0.1527208387851715, "learning_rate": 0.0002, "loss": 0.5442609786987305, "mean_token_accuracy": 0.7774769812822342, "num_tokens": 7936844.0, "step": 485 }, { "entropy": 0.5356980487704277, "epoch": 1.8134328358208955, "grad_norm": 0.1346481293439865, "learning_rate": 0.0002, "loss": 0.533320426940918, "mean_token_accuracy": 0.7837155610322952, "num_tokens": 7953142.0, "step": 486 }, { "entropy": 0.528105616569519, "epoch": 1.8171641791044775, "grad_norm": 0.1391320377588272, "learning_rate": 0.0002, "loss": 0.5345504879951477, "mean_token_accuracy": 0.784235417842865, "num_tokens": 7969458.0, "step": 487 }, { "entropy": 0.5304473042488098, "epoch": 1.8208955223880596, "grad_norm": 0.1381186991930008, "learning_rate": 0.0002, "loss": 0.5353981852531433, "mean_token_accuracy": 0.7815601527690887, "num_tokens": 7985948.0, "step": 488 }, { "entropy": 0.5339603275060654, "epoch": 1.8246268656716418, "grad_norm": 0.12126309424638748, "learning_rate": 0.0002, "loss": 0.53676837682724, "mean_token_accuracy": 0.7817868292331696, "num_tokens": 8002545.0, "step": 489 }, { "entropy": 0.542829766869545, "epoch": 1.828358208955224, "grad_norm": 0.15814469754695892, "learning_rate": 0.0002, "loss": 0.5454267263412476, "mean_token_accuracy": 0.7802938371896744, "num_tokens": 8018823.0, "step": 490 }, { "entropy": 0.5319127887487411, "epoch": 1.832089552238806, "grad_norm": 0.17742769420146942, "learning_rate": 0.0002, "loss": 0.5341488122940063, "mean_token_accuracy": 0.7826338112354279, "num_tokens": 8035341.0, "step": 491 }, { "entropy": 0.5450225174427032, "epoch": 1.835820895522388, "grad_norm": 0.16771593689918518, "learning_rate": 0.0002, "loss": 0.5443899035453796, "mean_token_accuracy": 0.7811568826436996, "num_tokens": 8051642.0, "step": 492 }, { "entropy": 0.5478601604700089, "epoch": 1.8395522388059702, "grad_norm": 0.16015928983688354, "learning_rate": 0.0002, "loss": 0.5466909408569336, "mean_token_accuracy": 0.7799689322710037, "num_tokens": 8068174.0, "step": 493 }, { "entropy": 0.5199587792158127, "epoch": 1.8432835820895521, "grad_norm": 0.18532446026802063, "learning_rate": 0.0002, "loss": 0.51955246925354, "mean_token_accuracy": 0.7891423404216766, "num_tokens": 8084364.0, "step": 494 }, { "entropy": 0.5241135209798813, "epoch": 1.8470149253731343, "grad_norm": 0.1427345871925354, "learning_rate": 0.0002, "loss": 0.5248921513557434, "mean_token_accuracy": 0.787857785820961, "num_tokens": 8100628.0, "step": 495 }, { "entropy": 0.5340007096529007, "epoch": 1.8507462686567164, "grad_norm": 0.17814995348453522, "learning_rate": 0.0002, "loss": 0.540264368057251, "mean_token_accuracy": 0.7790678143501282, "num_tokens": 8116959.0, "step": 496 }, { "entropy": 0.527913436293602, "epoch": 1.8544776119402986, "grad_norm": 0.13427263498306274, "learning_rate": 0.0002, "loss": 0.5335310697555542, "mean_token_accuracy": 0.7840446978807449, "num_tokens": 8133469.0, "step": 497 }, { "entropy": 0.5294159948825836, "epoch": 1.8582089552238807, "grad_norm": 0.15380533039569855, "learning_rate": 0.0002, "loss": 0.5384203791618347, "mean_token_accuracy": 0.7821631729602814, "num_tokens": 8149696.0, "step": 498 }, { "entropy": 0.551758736371994, "epoch": 1.8619402985074627, "grad_norm": 0.14327947795391083, "learning_rate": 0.0002, "loss": 0.5482276678085327, "mean_token_accuracy": 0.7767462432384491, "num_tokens": 8165879.0, "step": 499 }, { "entropy": 0.5242659151554108, "epoch": 1.8656716417910446, "grad_norm": 0.12858544290065765, "learning_rate": 0.0002, "loss": 0.5157872438430786, "mean_token_accuracy": 0.7902811467647552, "num_tokens": 8182190.0, "step": 500 }, { "entropy": 0.5306264460086823, "epoch": 1.8694029850746268, "grad_norm": 0.15147298574447632, "learning_rate": 0.0002, "loss": 0.5306845903396606, "mean_token_accuracy": 0.7868326008319855, "num_tokens": 8198532.0, "step": 501 }, { "entropy": 0.5289736092090607, "epoch": 1.873134328358209, "grad_norm": 0.1485019028186798, "learning_rate": 0.0002, "loss": 0.5295736789703369, "mean_token_accuracy": 0.7867529690265656, "num_tokens": 8214876.0, "step": 502 }, { "entropy": 0.5189197212457657, "epoch": 1.876865671641791, "grad_norm": 0.16673879325389862, "learning_rate": 0.0002, "loss": 0.530517578125, "mean_token_accuracy": 0.7832315862178802, "num_tokens": 8231372.0, "step": 503 }, { "entropy": 0.5216372013092041, "epoch": 1.8805970149253732, "grad_norm": 0.14986100792884827, "learning_rate": 0.0002, "loss": 0.5253111720085144, "mean_token_accuracy": 0.7875290215015411, "num_tokens": 8247818.0, "step": 504 }, { "entropy": 0.5231712907552719, "epoch": 1.8843283582089554, "grad_norm": 0.1456281542778015, "learning_rate": 0.0002, "loss": 0.5197166204452515, "mean_token_accuracy": 0.7897316515445709, "num_tokens": 8264150.0, "step": 505 }, { "entropy": 0.5563454926013947, "epoch": 1.8880597014925373, "grad_norm": 0.16623522341251373, "learning_rate": 0.0002, "loss": 0.5501665472984314, "mean_token_accuracy": 0.7771624773740768, "num_tokens": 8280747.0, "step": 506 }, { "entropy": 0.5328278690576553, "epoch": 1.8917910447761193, "grad_norm": 0.14126084744930267, "learning_rate": 0.0002, "loss": 0.5289823412895203, "mean_token_accuracy": 0.7830969095230103, "num_tokens": 8296683.0, "step": 507 }, { "entropy": 0.530360110104084, "epoch": 1.8955223880597014, "grad_norm": 0.1487768143415451, "learning_rate": 0.0002, "loss": 0.5299562215805054, "mean_token_accuracy": 0.7846151441335678, "num_tokens": 8313098.0, "step": 508 }, { "entropy": 0.5228631570935249, "epoch": 1.8992537313432836, "grad_norm": 0.1883818805217743, "learning_rate": 0.0002, "loss": 0.5329415798187256, "mean_token_accuracy": 0.7835862636566162, "num_tokens": 8329292.0, "step": 509 }, { "entropy": 0.5307874977588654, "epoch": 1.9029850746268657, "grad_norm": 0.17275580763816833, "learning_rate": 0.0002, "loss": 0.5390638113021851, "mean_token_accuracy": 0.7791903018951416, "num_tokens": 8345581.0, "step": 510 }, { "entropy": 0.5359426289796829, "epoch": 1.9067164179104479, "grad_norm": 0.14612574875354767, "learning_rate": 0.0002, "loss": 0.5378193259239197, "mean_token_accuracy": 0.7792247533798218, "num_tokens": 8361871.0, "step": 511 }, { "entropy": 0.539593517780304, "epoch": 1.9104477611940298, "grad_norm": 0.16161257028579712, "learning_rate": 0.0002, "loss": 0.5343602299690247, "mean_token_accuracy": 0.7851338088512421, "num_tokens": 8378103.0, "step": 512 }, { "entropy": 0.5392905324697495, "epoch": 1.914179104477612, "grad_norm": 0.12597458064556122, "learning_rate": 0.0002, "loss": 0.530954122543335, "mean_token_accuracy": 0.7846523523330688, "num_tokens": 8394348.0, "step": 513 }, { "entropy": 0.547580674290657, "epoch": 1.917910447761194, "grad_norm": 0.17028233408927917, "learning_rate": 0.0002, "loss": 0.5528735518455505, "mean_token_accuracy": 0.7771532535552979, "num_tokens": 8410989.0, "step": 514 }, { "entropy": 0.5490703731775284, "epoch": 1.921641791044776, "grad_norm": 0.1378035694360733, "learning_rate": 0.0002, "loss": 0.5464003086090088, "mean_token_accuracy": 0.7778326570987701, "num_tokens": 8427380.0, "step": 515 }, { "entropy": 0.5565768778324127, "epoch": 1.9253731343283582, "grad_norm": 0.1366737335920334, "learning_rate": 0.0002, "loss": 0.5584871172904968, "mean_token_accuracy": 0.7713783830404282, "num_tokens": 8443919.0, "step": 516 }, { "entropy": 0.5345391035079956, "epoch": 1.9291044776119404, "grad_norm": 0.1527157723903656, "learning_rate": 0.0002, "loss": 0.5405983328819275, "mean_token_accuracy": 0.779501810669899, "num_tokens": 8460174.0, "step": 517 }, { "entropy": 0.544240266084671, "epoch": 1.9328358208955225, "grad_norm": 0.14191998541355133, "learning_rate": 0.0002, "loss": 0.547295331954956, "mean_token_accuracy": 0.7777374982833862, "num_tokens": 8476737.0, "step": 518 }, { "entropy": 0.5293041467666626, "epoch": 1.9365671641791045, "grad_norm": 0.15670642256736755, "learning_rate": 0.0002, "loss": 0.5309778451919556, "mean_token_accuracy": 0.7865030914545059, "num_tokens": 8492947.0, "step": 519 }, { "entropy": 0.5330537855625153, "epoch": 1.9402985074626866, "grad_norm": 0.15017330646514893, "learning_rate": 0.0002, "loss": 0.5395172238349915, "mean_token_accuracy": 0.7815082669258118, "num_tokens": 8509337.0, "step": 520 }, { "entropy": 0.5353135764598846, "epoch": 1.9440298507462686, "grad_norm": 0.14300917088985443, "learning_rate": 0.0002, "loss": 0.5328524112701416, "mean_token_accuracy": 0.7861177921295166, "num_tokens": 8525672.0, "step": 521 }, { "entropy": 0.530888095498085, "epoch": 1.9477611940298507, "grad_norm": 0.1593046933412552, "learning_rate": 0.0002, "loss": 0.53388512134552, "mean_token_accuracy": 0.7821628004312515, "num_tokens": 8541976.0, "step": 522 }, { "entropy": 0.5539785474538803, "epoch": 1.9514925373134329, "grad_norm": 0.12615355849266052, "learning_rate": 0.0002, "loss": 0.5512434840202332, "mean_token_accuracy": 0.7770510613918304, "num_tokens": 8558299.0, "step": 523 }, { "entropy": 0.518076553940773, "epoch": 1.955223880597015, "grad_norm": 0.15514200925827026, "learning_rate": 0.0002, "loss": 0.5218104124069214, "mean_token_accuracy": 0.7879758924245834, "num_tokens": 8574716.0, "step": 524 }, { "entropy": 0.5353099256753922, "epoch": 1.9589552238805972, "grad_norm": 0.13487055897712708, "learning_rate": 0.0002, "loss": 0.538606584072113, "mean_token_accuracy": 0.781571164727211, "num_tokens": 8591050.0, "step": 525 }, { "entropy": 0.5266296789050102, "epoch": 1.962686567164179, "grad_norm": 0.1971937119960785, "learning_rate": 0.0002, "loss": 0.5315322279930115, "mean_token_accuracy": 0.7832879722118378, "num_tokens": 8607133.0, "step": 526 }, { "entropy": 0.5294190347194672, "epoch": 1.966417910447761, "grad_norm": 0.14176510274410248, "learning_rate": 0.0002, "loss": 0.5304378867149353, "mean_token_accuracy": 0.7834701687097549, "num_tokens": 8623512.0, "step": 527 }, { "entropy": 0.5403010845184326, "epoch": 1.9701492537313432, "grad_norm": 0.13602930307388306, "learning_rate": 0.0002, "loss": 0.5389670133590698, "mean_token_accuracy": 0.780187577009201, "num_tokens": 8639953.0, "step": 528 }, { "entropy": 0.5418667942285538, "epoch": 1.9738805970149254, "grad_norm": 0.15750795602798462, "learning_rate": 0.0002, "loss": 0.5364986658096313, "mean_token_accuracy": 0.7812219262123108, "num_tokens": 8656318.0, "step": 529 }, { "entropy": 0.5283338874578476, "epoch": 1.9776119402985075, "grad_norm": 0.1357993483543396, "learning_rate": 0.0002, "loss": 0.5258264541625977, "mean_token_accuracy": 0.7875591516494751, "num_tokens": 8672429.0, "step": 530 }, { "entropy": 0.508994422852993, "epoch": 1.9813432835820897, "grad_norm": 0.14409013092517853, "learning_rate": 0.0002, "loss": 0.5108156800270081, "mean_token_accuracy": 0.7937235236167908, "num_tokens": 8688776.0, "step": 531 }, { "entropy": 0.5443366467952728, "epoch": 1.9850746268656716, "grad_norm": 0.1645997315645218, "learning_rate": 0.0002, "loss": 0.5518733859062195, "mean_token_accuracy": 0.7764965444803238, "num_tokens": 8705134.0, "step": 532 }, { "entropy": 0.5353538542985916, "epoch": 1.9888059701492538, "grad_norm": 0.13118219375610352, "learning_rate": 0.0002, "loss": 0.5298490524291992, "mean_token_accuracy": 0.7852030396461487, "num_tokens": 8721422.0, "step": 533 }, { "entropy": 0.5499696731567383, "epoch": 1.9925373134328357, "grad_norm": 0.14602512121200562, "learning_rate": 0.0002, "loss": 0.5541141629219055, "mean_token_accuracy": 0.7733804285526276, "num_tokens": 8737587.0, "step": 534 }, { "entropy": 0.5241136103868484, "epoch": 1.9962686567164178, "grad_norm": 0.13069047033786774, "learning_rate": 0.0002, "loss": 0.5247742533683777, "mean_token_accuracy": 0.7877077162265778, "num_tokens": 8753886.0, "step": 535 }, { "entropy": 0.5522785931825638, "epoch": 2.0, "grad_norm": 0.13797929883003235, "learning_rate": 0.0002, "loss": 0.5517363548278809, "mean_token_accuracy": 0.7764420509338379, "num_tokens": 8770409.0, "step": 536 }, { "entropy": 0.5294849127531052, "epoch": 2.003731343283582, "grad_norm": 0.125420480966568, "learning_rate": 0.0002, "loss": 0.5204938054084778, "mean_token_accuracy": 0.7905426770448685, "num_tokens": 8786951.0, "step": 537 }, { "entropy": 0.5258107706904411, "epoch": 2.0074626865671643, "grad_norm": 0.1486080288887024, "learning_rate": 0.0002, "loss": 0.5231454372406006, "mean_token_accuracy": 0.7883965820074081, "num_tokens": 8803315.0, "step": 538 }, { "entropy": 0.5175661221146584, "epoch": 2.0111940298507465, "grad_norm": 0.13154980540275574, "learning_rate": 0.0002, "loss": 0.5184586644172668, "mean_token_accuracy": 0.7910201251506805, "num_tokens": 8819911.0, "step": 539 }, { "entropy": 0.4994604140520096, "epoch": 2.014925373134328, "grad_norm": 0.16595442593097687, "learning_rate": 0.0002, "loss": 0.5148791074752808, "mean_token_accuracy": 0.7942434102296829, "num_tokens": 8836154.0, "step": 540 }, { "entropy": 0.5127262026071548, "epoch": 2.0186567164179103, "grad_norm": 0.1592157632112503, "learning_rate": 0.0002, "loss": 0.5228517651557922, "mean_token_accuracy": 0.7881066054105759, "num_tokens": 8852520.0, "step": 541 }, { "entropy": 0.5340550392866135, "epoch": 2.0223880597014925, "grad_norm": 0.17649918794631958, "learning_rate": 0.0002, "loss": 0.5372640490531921, "mean_token_accuracy": 0.7816326469182968, "num_tokens": 8868924.0, "step": 542 }, { "entropy": 0.5152621045708656, "epoch": 2.0261194029850746, "grad_norm": 0.14082451164722443, "learning_rate": 0.0002, "loss": 0.5027863383293152, "mean_token_accuracy": 0.7955759316682816, "num_tokens": 8885106.0, "step": 543 }, { "entropy": 0.522370234131813, "epoch": 2.029850746268657, "grad_norm": 0.14631766080856323, "learning_rate": 0.0002, "loss": 0.5158503651618958, "mean_token_accuracy": 0.7942074984312057, "num_tokens": 8901600.0, "step": 544 }, { "entropy": 0.5079411640763283, "epoch": 2.033582089552239, "grad_norm": 0.13866929709911346, "learning_rate": 0.0002, "loss": 0.4975392818450928, "mean_token_accuracy": 0.7998307049274445, "num_tokens": 8918068.0, "step": 545 }, { "entropy": 0.5192210525274277, "epoch": 2.0373134328358207, "grad_norm": 0.15910667181015015, "learning_rate": 0.0002, "loss": 0.5216242671012878, "mean_token_accuracy": 0.7882837206125259, "num_tokens": 8934441.0, "step": 546 }, { "entropy": 0.49886780977249146, "epoch": 2.041044776119403, "grad_norm": 0.1706812083721161, "learning_rate": 0.0002, "loss": 0.5059823989868164, "mean_token_accuracy": 0.7956507951021194, "num_tokens": 8950731.0, "step": 547 }, { "entropy": 0.5080099627375603, "epoch": 2.044776119402985, "grad_norm": 0.18679271638393402, "learning_rate": 0.0002, "loss": 0.5219873189926147, "mean_token_accuracy": 0.7893132120370865, "num_tokens": 8966920.0, "step": 548 }, { "entropy": 0.5161280035972595, "epoch": 2.048507462686567, "grad_norm": 0.15718749165534973, "learning_rate": 0.0002, "loss": 0.5155758857727051, "mean_token_accuracy": 0.7914890348911285, "num_tokens": 8983333.0, "step": 549 }, { "entropy": 0.5230599641799927, "epoch": 2.0522388059701493, "grad_norm": 0.16827784478664398, "learning_rate": 0.0002, "loss": 0.5158221125602722, "mean_token_accuracy": 0.7917670756578445, "num_tokens": 8999615.0, "step": 550 }, { "entropy": 0.5276069939136505, "epoch": 2.0559701492537314, "grad_norm": 0.15786929428577423, "learning_rate": 0.0002, "loss": 0.5228967070579529, "mean_token_accuracy": 0.7900322675704956, "num_tokens": 9016070.0, "step": 551 }, { "entropy": 0.5261552929878235, "epoch": 2.0597014925373136, "grad_norm": 0.179435133934021, "learning_rate": 0.0002, "loss": 0.5274342894554138, "mean_token_accuracy": 0.7874346524477005, "num_tokens": 9032325.0, "step": 552 }, { "entropy": 0.508784145116806, "epoch": 2.0634328358208953, "grad_norm": 0.18862098455429077, "learning_rate": 0.0002, "loss": 0.5171835422515869, "mean_token_accuracy": 0.7909427434206009, "num_tokens": 9048544.0, "step": 553 }, { "entropy": 0.5254177302122116, "epoch": 2.0671641791044775, "grad_norm": 0.15294437110424042, "learning_rate": 0.0002, "loss": 0.5267332792282104, "mean_token_accuracy": 0.7861658930778503, "num_tokens": 9064928.0, "step": 554 }, { "entropy": 0.5087190493941307, "epoch": 2.0708955223880596, "grad_norm": 0.14013507962226868, "learning_rate": 0.0002, "loss": 0.5050034523010254, "mean_token_accuracy": 0.7958011031150818, "num_tokens": 9081236.0, "step": 555 }, { "entropy": 0.5136034488677979, "epoch": 2.074626865671642, "grad_norm": 0.17949984967708588, "learning_rate": 0.0002, "loss": 0.5207123756408691, "mean_token_accuracy": 0.7871850281953812, "num_tokens": 9097632.0, "step": 556 }, { "entropy": 0.5167653933167458, "epoch": 2.078358208955224, "grad_norm": 0.17791901528835297, "learning_rate": 0.0002, "loss": 0.5193839073181152, "mean_token_accuracy": 0.7898633778095245, "num_tokens": 9114047.0, "step": 557 }, { "entropy": 0.5242370218038559, "epoch": 2.082089552238806, "grad_norm": 0.18635064363479614, "learning_rate": 0.0002, "loss": 0.5251120328903198, "mean_token_accuracy": 0.7863645255565643, "num_tokens": 9130395.0, "step": 558 }, { "entropy": 0.5116435959935188, "epoch": 2.0858208955223883, "grad_norm": 0.17594675719738007, "learning_rate": 0.0002, "loss": 0.5087394714355469, "mean_token_accuracy": 0.7953201085329056, "num_tokens": 9146761.0, "step": 559 }, { "entropy": 0.5367572158575058, "epoch": 2.08955223880597, "grad_norm": 0.16770021617412567, "learning_rate": 0.0002, "loss": 0.5259926915168762, "mean_token_accuracy": 0.7842537760734558, "num_tokens": 9163292.0, "step": 560 }, { "entropy": 0.5182780101895332, "epoch": 2.093283582089552, "grad_norm": 0.15339073538780212, "learning_rate": 0.0002, "loss": 0.5159294009208679, "mean_token_accuracy": 0.7939708232879639, "num_tokens": 9179681.0, "step": 561 }, { "entropy": 0.5029266253113747, "epoch": 2.0970149253731343, "grad_norm": 0.2085951417684555, "learning_rate": 0.0002, "loss": 0.5057911276817322, "mean_token_accuracy": 0.7953764498233795, "num_tokens": 9196009.0, "step": 562 }, { "entropy": 0.5088721960783005, "epoch": 2.1007462686567164, "grad_norm": 0.23663504421710968, "learning_rate": 0.0002, "loss": 0.5137120485305786, "mean_token_accuracy": 0.7930423617362976, "num_tokens": 9212477.0, "step": 563 }, { "entropy": 0.5090882033109665, "epoch": 2.1044776119402986, "grad_norm": 0.17074984312057495, "learning_rate": 0.0002, "loss": 0.5111451148986816, "mean_token_accuracy": 0.7952387928962708, "num_tokens": 9228991.0, "step": 564 }, { "entropy": 0.5197137892246246, "epoch": 2.1082089552238807, "grad_norm": 0.18768630921840668, "learning_rate": 0.0002, "loss": 0.5150706171989441, "mean_token_accuracy": 0.7908357232809067, "num_tokens": 9245501.0, "step": 565 }, { "entropy": 0.5140221863985062, "epoch": 2.111940298507463, "grad_norm": 0.1833381950855255, "learning_rate": 0.0002, "loss": 0.5144209861755371, "mean_token_accuracy": 0.7924097031354904, "num_tokens": 9261721.0, "step": 566 }, { "entropy": 0.5247924327850342, "epoch": 2.1156716417910446, "grad_norm": 0.19777074456214905, "learning_rate": 0.0002, "loss": 0.5174472332000732, "mean_token_accuracy": 0.7918887138366699, "num_tokens": 9278242.0, "step": 567 }, { "entropy": 0.4977032169699669, "epoch": 2.1194029850746268, "grad_norm": 0.19118627905845642, "learning_rate": 0.0002, "loss": 0.5060408115386963, "mean_token_accuracy": 0.79521843791008, "num_tokens": 9294474.0, "step": 568 }, { "entropy": 0.4930529072880745, "epoch": 2.123134328358209, "grad_norm": 0.17287500202655792, "learning_rate": 0.0002, "loss": 0.5063955783843994, "mean_token_accuracy": 0.7964753955602646, "num_tokens": 9310448.0, "step": 569 }, { "entropy": 0.4997175335884094, "epoch": 2.126865671641791, "grad_norm": 0.19182001054286957, "learning_rate": 0.0002, "loss": 0.511003315448761, "mean_token_accuracy": 0.7929231375455856, "num_tokens": 9326574.0, "step": 570 }, { "entropy": 0.5178787037730217, "epoch": 2.1305970149253732, "grad_norm": 0.16347914934158325, "learning_rate": 0.0002, "loss": 0.5087844729423523, "mean_token_accuracy": 0.7940262705087662, "num_tokens": 9342970.0, "step": 571 }, { "entropy": 0.5362161993980408, "epoch": 2.1343283582089554, "grad_norm": 0.16588380932807922, "learning_rate": 0.0002, "loss": 0.5250737071037292, "mean_token_accuracy": 0.7876630574464798, "num_tokens": 9359168.0, "step": 572 }, { "entropy": 0.532064899802208, "epoch": 2.138059701492537, "grad_norm": 0.15581250190734863, "learning_rate": 0.0002, "loss": 0.5236944556236267, "mean_token_accuracy": 0.790793389081955, "num_tokens": 9375380.0, "step": 573 }, { "entropy": 0.5272438824176788, "epoch": 2.1417910447761193, "grad_norm": 0.20483332872390747, "learning_rate": 0.0002, "loss": 0.5327727198600769, "mean_token_accuracy": 0.7848416119813919, "num_tokens": 9391851.0, "step": 574 }, { "entropy": 0.5178545862436295, "epoch": 2.1455223880597014, "grad_norm": 0.17937517166137695, "learning_rate": 0.0002, "loss": 0.520628809928894, "mean_token_accuracy": 0.7914203107357025, "num_tokens": 9408515.0, "step": 575 }, { "entropy": 0.5144930109381676, "epoch": 2.1492537313432836, "grad_norm": 0.20648981630802155, "learning_rate": 0.0002, "loss": 0.5262653827667236, "mean_token_accuracy": 0.7883694916963577, "num_tokens": 9424748.0, "step": 576 }, { "entropy": 0.5081476420164108, "epoch": 2.1529850746268657, "grad_norm": 0.15983696281909943, "learning_rate": 0.0002, "loss": 0.5091989040374756, "mean_token_accuracy": 0.7932504862546921, "num_tokens": 9440987.0, "step": 577 }, { "entropy": 0.5091744139790535, "epoch": 2.156716417910448, "grad_norm": 0.143747940659523, "learning_rate": 0.0002, "loss": 0.507089376449585, "mean_token_accuracy": 0.794156089425087, "num_tokens": 9457349.0, "step": 578 }, { "entropy": 0.5104940757155418, "epoch": 2.16044776119403, "grad_norm": 0.16569356620311737, "learning_rate": 0.0002, "loss": 0.5061535239219666, "mean_token_accuracy": 0.7964262366294861, "num_tokens": 9473817.0, "step": 579 }, { "entropy": 0.5086464136838913, "epoch": 2.1641791044776117, "grad_norm": 0.179887592792511, "learning_rate": 0.0002, "loss": 0.5004557371139526, "mean_token_accuracy": 0.7990415841341019, "num_tokens": 9490110.0, "step": 580 }, { "entropy": 0.5114818289875984, "epoch": 2.167910447761194, "grad_norm": 0.2178039252758026, "learning_rate": 0.0002, "loss": 0.5228156447410583, "mean_token_accuracy": 0.7900251597166061, "num_tokens": 9506558.0, "step": 581 }, { "entropy": 0.5055092200636864, "epoch": 2.171641791044776, "grad_norm": 0.17143648862838745, "learning_rate": 0.0002, "loss": 0.5139644145965576, "mean_token_accuracy": 0.7933343797922134, "num_tokens": 9522674.0, "step": 582 }, { "entropy": 0.5209199637174606, "epoch": 2.175373134328358, "grad_norm": 0.1963517814874649, "learning_rate": 0.0002, "loss": 0.5282465219497681, "mean_token_accuracy": 0.7860098034143448, "num_tokens": 9538967.0, "step": 583 }, { "entropy": 0.5108934044837952, "epoch": 2.1791044776119404, "grad_norm": 0.14624883234500885, "learning_rate": 0.0002, "loss": 0.5060119032859802, "mean_token_accuracy": 0.7967799454927444, "num_tokens": 9555308.0, "step": 584 }, { "entropy": 0.5247770547866821, "epoch": 2.1828358208955225, "grad_norm": 0.16273266077041626, "learning_rate": 0.0002, "loss": 0.5228431224822998, "mean_token_accuracy": 0.788749948143959, "num_tokens": 9571783.0, "step": 585 }, { "entropy": 0.5204054489731789, "epoch": 2.1865671641791047, "grad_norm": 0.14925257861614227, "learning_rate": 0.0002, "loss": 0.5232412219047546, "mean_token_accuracy": 0.7892403602600098, "num_tokens": 9588235.0, "step": 586 }, { "entropy": 0.5165363550186157, "epoch": 2.1902985074626864, "grad_norm": 0.16366349160671234, "learning_rate": 0.0002, "loss": 0.5210464000701904, "mean_token_accuracy": 0.7882984429597855, "num_tokens": 9604408.0, "step": 587 }, { "entropy": 0.5106817856431007, "epoch": 2.1940298507462686, "grad_norm": 0.18039654195308685, "learning_rate": 0.0002, "loss": 0.5134552717208862, "mean_token_accuracy": 0.7908795177936554, "num_tokens": 9620552.0, "step": 588 }, { "entropy": 0.5111690908670425, "epoch": 2.1977611940298507, "grad_norm": 0.1635941118001938, "learning_rate": 0.0002, "loss": 0.5129784941673279, "mean_token_accuracy": 0.7909968048334122, "num_tokens": 9636913.0, "step": 589 }, { "entropy": 0.5287658274173737, "epoch": 2.201492537313433, "grad_norm": 0.18495672941207886, "learning_rate": 0.0002, "loss": 0.5281989574432373, "mean_token_accuracy": 0.784828245639801, "num_tokens": 9653251.0, "step": 590 }, { "entropy": 0.5366753935813904, "epoch": 2.205223880597015, "grad_norm": 0.17156296968460083, "learning_rate": 0.0002, "loss": 0.5293815732002258, "mean_token_accuracy": 0.7864246368408203, "num_tokens": 9669560.0, "step": 591 }, { "entropy": 0.5325558334589005, "epoch": 2.208955223880597, "grad_norm": 0.19953666627407074, "learning_rate": 0.0002, "loss": 0.5299435257911682, "mean_token_accuracy": 0.7853131592273712, "num_tokens": 9686058.0, "step": 592 }, { "entropy": 0.5221890658140182, "epoch": 2.2126865671641793, "grad_norm": 0.19219942390918732, "learning_rate": 0.0002, "loss": 0.5268661975860596, "mean_token_accuracy": 0.784967839717865, "num_tokens": 9702350.0, "step": 593 }, { "entropy": 0.5307768136262894, "epoch": 2.216417910447761, "grad_norm": 0.17264924943447113, "learning_rate": 0.0002, "loss": 0.5293731689453125, "mean_token_accuracy": 0.7857524007558823, "num_tokens": 9718930.0, "step": 594 }, { "entropy": 0.5272602289915085, "epoch": 2.220149253731343, "grad_norm": 0.19435909390449524, "learning_rate": 0.0002, "loss": 0.5310930609703064, "mean_token_accuracy": 0.786889910697937, "num_tokens": 9735287.0, "step": 595 }, { "entropy": 0.5084069296717644, "epoch": 2.2238805970149254, "grad_norm": 0.17865370213985443, "learning_rate": 0.0002, "loss": 0.5123623609542847, "mean_token_accuracy": 0.7948104739189148, "num_tokens": 9751646.0, "step": 596 }, { "entropy": 0.5117323100566864, "epoch": 2.2276119402985075, "grad_norm": 0.17900389432907104, "learning_rate": 0.0002, "loss": 0.5196022987365723, "mean_token_accuracy": 0.7908018082380295, "num_tokens": 9767886.0, "step": 597 }, { "entropy": 0.5059385448694229, "epoch": 2.2313432835820897, "grad_norm": 0.17656244337558746, "learning_rate": 0.0002, "loss": 0.5047177672386169, "mean_token_accuracy": 0.7968951612710953, "num_tokens": 9784353.0, "step": 598 }, { "entropy": 0.515342965722084, "epoch": 2.235074626865672, "grad_norm": 0.17201915383338928, "learning_rate": 0.0002, "loss": 0.5150702595710754, "mean_token_accuracy": 0.7913296669721603, "num_tokens": 9800514.0, "step": 599 }, { "entropy": 0.5440414994955063, "epoch": 2.2388059701492535, "grad_norm": 0.17017365992069244, "learning_rate": 0.0002, "loss": 0.5365599989891052, "mean_token_accuracy": 0.7842509299516678, "num_tokens": 9817052.0, "step": 600 }, { "entropy": 0.5261255204677582, "epoch": 2.2425373134328357, "grad_norm": 0.17153213918209076, "learning_rate": 0.0002, "loss": 0.5241469740867615, "mean_token_accuracy": 0.7881980240345001, "num_tokens": 9833301.0, "step": 601 }, { "entropy": 0.5091669335961342, "epoch": 2.246268656716418, "grad_norm": 0.17429564893245697, "learning_rate": 0.0002, "loss": 0.5136046409606934, "mean_token_accuracy": 0.7911395728588104, "num_tokens": 9849553.0, "step": 602 }, { "entropy": 0.5217274948954582, "epoch": 2.25, "grad_norm": 0.18611721694469452, "learning_rate": 0.0002, "loss": 0.5315898656845093, "mean_token_accuracy": 0.7870735377073288, "num_tokens": 9865877.0, "step": 603 }, { "entropy": 0.5227696150541306, "epoch": 2.253731343283582, "grad_norm": 0.18880440294742584, "learning_rate": 0.0002, "loss": 0.5296134352684021, "mean_token_accuracy": 0.7852792292833328, "num_tokens": 9882313.0, "step": 604 }, { "entropy": 0.5258260294795036, "epoch": 2.2574626865671643, "grad_norm": 0.14611785113811493, "learning_rate": 0.0002, "loss": 0.5206936597824097, "mean_token_accuracy": 0.7903030216693878, "num_tokens": 9898839.0, "step": 605 }, { "entropy": 0.5399209856987, "epoch": 2.2611940298507465, "grad_norm": 0.14919111132621765, "learning_rate": 0.0002, "loss": 0.5303294062614441, "mean_token_accuracy": 0.7863423973321915, "num_tokens": 9915421.0, "step": 606 }, { "entropy": 0.5277860313653946, "epoch": 2.264925373134328, "grad_norm": 0.14488378167152405, "learning_rate": 0.0002, "loss": 0.519542396068573, "mean_token_accuracy": 0.7928669452667236, "num_tokens": 9931727.0, "step": 607 }, { "entropy": 0.4945507273077965, "epoch": 2.2686567164179103, "grad_norm": 0.1835111826658249, "learning_rate": 0.0002, "loss": 0.5029417276382446, "mean_token_accuracy": 0.7954000681638718, "num_tokens": 9947880.0, "step": 608 }, { "entropy": 0.5122526064515114, "epoch": 2.2723880597014925, "grad_norm": 0.17832306027412415, "learning_rate": 0.0002, "loss": 0.5254662036895752, "mean_token_accuracy": 0.7880468964576721, "num_tokens": 9964273.0, "step": 609 }, { "entropy": 0.5167535543441772, "epoch": 2.2761194029850746, "grad_norm": 0.1590995043516159, "learning_rate": 0.0002, "loss": 0.5195916295051575, "mean_token_accuracy": 0.787218302488327, "num_tokens": 9980854.0, "step": 610 }, { "entropy": 0.5098580792546272, "epoch": 2.279850746268657, "grad_norm": 0.15836626291275024, "learning_rate": 0.0002, "loss": 0.5124033689498901, "mean_token_accuracy": 0.7913301140069962, "num_tokens": 9996905.0, "step": 611 }, { "entropy": 0.5259643197059631, "epoch": 2.283582089552239, "grad_norm": 0.1523635983467102, "learning_rate": 0.0002, "loss": 0.5187619924545288, "mean_token_accuracy": 0.7937401235103607, "num_tokens": 10013405.0, "step": 612 }, { "entropy": 0.5277784913778305, "epoch": 2.2873134328358207, "grad_norm": 0.1649775356054306, "learning_rate": 0.0002, "loss": 0.5315808653831482, "mean_token_accuracy": 0.7855904698371887, "num_tokens": 10029667.0, "step": 613 }, { "entropy": 0.5262410789728165, "epoch": 2.291044776119403, "grad_norm": 0.15203334391117096, "learning_rate": 0.0002, "loss": 0.5255904197692871, "mean_token_accuracy": 0.7881879210472107, "num_tokens": 10046160.0, "step": 614 }, { "entropy": 0.5241505354642868, "epoch": 2.294776119402985, "grad_norm": 0.18789614737033844, "learning_rate": 0.0002, "loss": 0.5238255858421326, "mean_token_accuracy": 0.7843707501888275, "num_tokens": 10062453.0, "step": 615 }, { "entropy": 0.5166228264570236, "epoch": 2.298507462686567, "grad_norm": 0.1664339303970337, "learning_rate": 0.0002, "loss": 0.5110273361206055, "mean_token_accuracy": 0.7905164808034897, "num_tokens": 10078529.0, "step": 616 }, { "entropy": 0.5075492858886719, "epoch": 2.3022388059701493, "grad_norm": 0.22521668672561646, "learning_rate": 0.0002, "loss": 0.5120429396629333, "mean_token_accuracy": 0.7934232652187347, "num_tokens": 10094762.0, "step": 617 }, { "entropy": 0.506694033741951, "epoch": 2.3059701492537314, "grad_norm": 0.22079938650131226, "learning_rate": 0.0002, "loss": 0.5139238238334656, "mean_token_accuracy": 0.787568524479866, "num_tokens": 10110659.0, "step": 618 }, { "entropy": 0.5242674350738525, "epoch": 2.3097014925373136, "grad_norm": 0.1853271722793579, "learning_rate": 0.0002, "loss": 0.5255372524261475, "mean_token_accuracy": 0.7875581830739975, "num_tokens": 10127103.0, "step": 619 }, { "entropy": 0.5136331543326378, "epoch": 2.3134328358208958, "grad_norm": 0.1589234173297882, "learning_rate": 0.0002, "loss": 0.5141199827194214, "mean_token_accuracy": 0.7937167435884476, "num_tokens": 10143612.0, "step": 620 }, { "entropy": 0.524729534983635, "epoch": 2.3171641791044775, "grad_norm": 0.205324187874794, "learning_rate": 0.0002, "loss": 0.5216213464736938, "mean_token_accuracy": 0.7882188111543655, "num_tokens": 10159941.0, "step": 621 }, { "entropy": 0.5130689889192581, "epoch": 2.3208955223880596, "grad_norm": 0.16606491804122925, "learning_rate": 0.0002, "loss": 0.5043811798095703, "mean_token_accuracy": 0.7958787977695465, "num_tokens": 10176187.0, "step": 622 }, { "entropy": 0.5039496794342995, "epoch": 2.324626865671642, "grad_norm": 0.19112904369831085, "learning_rate": 0.0002, "loss": 0.5113927721977234, "mean_token_accuracy": 0.7904049158096313, "num_tokens": 10192620.0, "step": 623 }, { "entropy": 0.49748485535383224, "epoch": 2.328358208955224, "grad_norm": 0.19301722943782806, "learning_rate": 0.0002, "loss": 0.5107299089431763, "mean_token_accuracy": 0.7948975116014481, "num_tokens": 10208980.0, "step": 624 }, { "entropy": 0.5088533237576485, "epoch": 2.332089552238806, "grad_norm": 0.20937587320804596, "learning_rate": 0.0002, "loss": 0.5153738260269165, "mean_token_accuracy": 0.7925478518009186, "num_tokens": 10225269.0, "step": 625 }, { "entropy": 0.5225254744291306, "epoch": 2.3358208955223883, "grad_norm": 0.15447191894054413, "learning_rate": 0.0002, "loss": 0.5196532607078552, "mean_token_accuracy": 0.7922751158475876, "num_tokens": 10241676.0, "step": 626 }, { "entropy": 0.5326119512319565, "epoch": 2.33955223880597, "grad_norm": 0.1772749423980713, "learning_rate": 0.0002, "loss": 0.5275702476501465, "mean_token_accuracy": 0.7883079051971436, "num_tokens": 10258282.0, "step": 627 }, { "entropy": 0.5241412222385406, "epoch": 2.343283582089552, "grad_norm": 0.15652857720851898, "learning_rate": 0.0002, "loss": 0.5206055641174316, "mean_token_accuracy": 0.7899506539106369, "num_tokens": 10274618.0, "step": 628 }, { "entropy": 0.5035678222775459, "epoch": 2.3470149253731343, "grad_norm": 0.1610826700925827, "learning_rate": 0.0002, "loss": 0.5049140453338623, "mean_token_accuracy": 0.7945234477519989, "num_tokens": 10290740.0, "step": 629 }, { "entropy": 0.5056828930974007, "epoch": 2.3507462686567164, "grad_norm": 0.19641247391700745, "learning_rate": 0.0002, "loss": 0.5203961730003357, "mean_token_accuracy": 0.7882252931594849, "num_tokens": 10306908.0, "step": 630 }, { "entropy": 0.5376667827367783, "epoch": 2.3544776119402986, "grad_norm": 0.1892770230770111, "learning_rate": 0.0002, "loss": 0.5438809394836426, "mean_token_accuracy": 0.7808854281902313, "num_tokens": 10323600.0, "step": 631 }, { "entropy": 0.5257938951253891, "epoch": 2.3582089552238807, "grad_norm": 0.1734701544046402, "learning_rate": 0.0002, "loss": 0.5274419188499451, "mean_token_accuracy": 0.7882835865020752, "num_tokens": 10339842.0, "step": 632 }, { "entropy": 0.5335331857204437, "epoch": 2.361940298507463, "grad_norm": 0.15732470154762268, "learning_rate": 0.0002, "loss": 0.5302885174751282, "mean_token_accuracy": 0.7879149913787842, "num_tokens": 10356146.0, "step": 633 }, { "entropy": 0.5305976718664169, "epoch": 2.3656716417910446, "grad_norm": 0.14950533211231232, "learning_rate": 0.0002, "loss": 0.5217748880386353, "mean_token_accuracy": 0.7901571691036224, "num_tokens": 10372774.0, "step": 634 }, { "entropy": 0.5027497857809067, "epoch": 2.3694029850746268, "grad_norm": 0.1668434888124466, "learning_rate": 0.0002, "loss": 0.49668481945991516, "mean_token_accuracy": 0.7978196144104004, "num_tokens": 10389233.0, "step": 635 }, { "entropy": 0.5358419269323349, "epoch": 2.373134328358209, "grad_norm": 0.17945551872253418, "learning_rate": 0.0002, "loss": 0.5389994382858276, "mean_token_accuracy": 0.7802686244249344, "num_tokens": 10405879.0, "step": 636 }, { "entropy": 0.5104084759950638, "epoch": 2.376865671641791, "grad_norm": 0.17669576406478882, "learning_rate": 0.0002, "loss": 0.5137860178947449, "mean_token_accuracy": 0.7914855033159256, "num_tokens": 10422059.0, "step": 637 }, { "entropy": 0.5348759889602661, "epoch": 2.3805970149253732, "grad_norm": 0.17230568826198578, "learning_rate": 0.0002, "loss": 0.5333091020584106, "mean_token_accuracy": 0.7840609103441238, "num_tokens": 10438486.0, "step": 638 }, { "entropy": 0.5165744200348854, "epoch": 2.3843283582089554, "grad_norm": 0.17449212074279785, "learning_rate": 0.0002, "loss": 0.5179176330566406, "mean_token_accuracy": 0.7892343103885651, "num_tokens": 10454418.0, "step": 639 }, { "entropy": 0.5385671108961105, "epoch": 2.388059701492537, "grad_norm": 0.1890452355146408, "learning_rate": 0.0002, "loss": 0.5375429391860962, "mean_token_accuracy": 0.7834752649068832, "num_tokens": 10470842.0, "step": 640 }, { "entropy": 0.49661771208047867, "epoch": 2.3917910447761193, "grad_norm": 0.1732311248779297, "learning_rate": 0.0002, "loss": 0.49945348501205444, "mean_token_accuracy": 0.8011882454156876, "num_tokens": 10487044.0, "step": 641 }, { "entropy": 0.519076332449913, "epoch": 2.3955223880597014, "grad_norm": 0.18893247842788696, "learning_rate": 0.0002, "loss": 0.5197221040725708, "mean_token_accuracy": 0.7879463732242584, "num_tokens": 10502951.0, "step": 642 }, { "entropy": 0.5214255601167679, "epoch": 2.3992537313432836, "grad_norm": 0.20484893023967743, "learning_rate": 0.0002, "loss": 0.5267422795295715, "mean_token_accuracy": 0.7866235077381134, "num_tokens": 10519055.0, "step": 643 }, { "entropy": 0.5253995954990387, "epoch": 2.4029850746268657, "grad_norm": 0.1876876801252365, "learning_rate": 0.0002, "loss": 0.5317081212997437, "mean_token_accuracy": 0.7831747829914093, "num_tokens": 10535333.0, "step": 644 }, { "entropy": 0.5186711996793747, "epoch": 2.406716417910448, "grad_norm": 0.18439075350761414, "learning_rate": 0.0002, "loss": 0.5136252045631409, "mean_token_accuracy": 0.7919325232505798, "num_tokens": 10551621.0, "step": 645 }, { "entropy": 0.5383310168981552, "epoch": 2.41044776119403, "grad_norm": 0.19391457736492157, "learning_rate": 0.0002, "loss": 0.536406397819519, "mean_token_accuracy": 0.7821435630321503, "num_tokens": 10567850.0, "step": 646 }, { "entropy": 0.5125755220651627, "epoch": 2.4141791044776117, "grad_norm": 0.20207205414772034, "learning_rate": 0.0002, "loss": 0.5210078954696655, "mean_token_accuracy": 0.7870661616325378, "num_tokens": 10583999.0, "step": 647 }, { "entropy": 0.5297990292310715, "epoch": 2.417910447761194, "grad_norm": 0.20189954340457916, "learning_rate": 0.0002, "loss": 0.5326197743415833, "mean_token_accuracy": 0.7850360125303268, "num_tokens": 10600525.0, "step": 648 }, { "entropy": 0.5246636644005775, "epoch": 2.421641791044776, "grad_norm": 0.1728029102087021, "learning_rate": 0.0002, "loss": 0.525002121925354, "mean_token_accuracy": 0.7875626981258392, "num_tokens": 10616849.0, "step": 649 }, { "entropy": 0.5095944106578827, "epoch": 2.425373134328358, "grad_norm": 0.2387600839138031, "learning_rate": 0.0002, "loss": 0.5112872123718262, "mean_token_accuracy": 0.7921067625284195, "num_tokens": 10633233.0, "step": 650 }, { "entropy": 0.5263043940067291, "epoch": 2.4291044776119404, "grad_norm": 0.15833254158496857, "learning_rate": 0.0002, "loss": 0.5244647264480591, "mean_token_accuracy": 0.7867362052202225, "num_tokens": 10649827.0, "step": 651 }, { "entropy": 0.5192963778972626, "epoch": 2.4328358208955225, "grad_norm": 0.20977173745632172, "learning_rate": 0.0002, "loss": 0.5227269530296326, "mean_token_accuracy": 0.7878894209861755, "num_tokens": 10666321.0, "step": 652 }, { "entropy": 0.5367371439933777, "epoch": 2.4365671641791042, "grad_norm": 0.15084603428840637, "learning_rate": 0.0002, "loss": 0.5376932621002197, "mean_token_accuracy": 0.7824547588825226, "num_tokens": 10682965.0, "step": 653 }, { "entropy": 0.5382617115974426, "epoch": 2.4402985074626864, "grad_norm": 0.1801973283290863, "learning_rate": 0.0002, "loss": 0.5432254076004028, "mean_token_accuracy": 0.7805831581354141, "num_tokens": 10699544.0, "step": 654 }, { "entropy": 0.5095302909612656, "epoch": 2.4440298507462686, "grad_norm": 0.18439368903636932, "learning_rate": 0.0002, "loss": 0.5105661749839783, "mean_token_accuracy": 0.7942203730344772, "num_tokens": 10715786.0, "step": 655 }, { "entropy": 0.5031231418251991, "epoch": 2.4477611940298507, "grad_norm": 0.2009238451719284, "learning_rate": 0.0002, "loss": 0.5032652020454407, "mean_token_accuracy": 0.796208992600441, "num_tokens": 10731876.0, "step": 656 }, { "entropy": 0.5191497802734375, "epoch": 2.451492537313433, "grad_norm": 0.15563416481018066, "learning_rate": 0.0002, "loss": 0.5171559453010559, "mean_token_accuracy": 0.7906945198774338, "num_tokens": 10748315.0, "step": 657 }, { "entropy": 0.534915566444397, "epoch": 2.455223880597015, "grad_norm": 0.1711549013853073, "learning_rate": 0.0002, "loss": 0.5389001965522766, "mean_token_accuracy": 0.7799905091524124, "num_tokens": 10764790.0, "step": 658 }, { "entropy": 0.5258138328790665, "epoch": 2.458955223880597, "grad_norm": 0.1676245927810669, "learning_rate": 0.0002, "loss": 0.5202907919883728, "mean_token_accuracy": 0.7907141149044037, "num_tokens": 10781180.0, "step": 659 }, { "entropy": 0.5184210613369942, "epoch": 2.4626865671641793, "grad_norm": 0.19272486865520477, "learning_rate": 0.0002, "loss": 0.5211130380630493, "mean_token_accuracy": 0.7910874783992767, "num_tokens": 10797415.0, "step": 660 }, { "entropy": 0.5086240172386169, "epoch": 2.466417910447761, "grad_norm": 0.15660832822322845, "learning_rate": 0.0002, "loss": 0.5071555376052856, "mean_token_accuracy": 0.7956086099147797, "num_tokens": 10813817.0, "step": 661 }, { "entropy": 0.5204941183328629, "epoch": 2.470149253731343, "grad_norm": 0.1729627549648285, "learning_rate": 0.0002, "loss": 0.5216123461723328, "mean_token_accuracy": 0.7889334261417389, "num_tokens": 10830306.0, "step": 662 }, { "entropy": 0.5246492028236389, "epoch": 2.4738805970149254, "grad_norm": 0.16240543127059937, "learning_rate": 0.0002, "loss": 0.5221917629241943, "mean_token_accuracy": 0.7887895107269287, "num_tokens": 10846665.0, "step": 663 }, { "entropy": 0.5247633457183838, "epoch": 2.4776119402985075, "grad_norm": 0.17897000908851624, "learning_rate": 0.0002, "loss": 0.5230647325515747, "mean_token_accuracy": 0.7872501760721207, "num_tokens": 10863063.0, "step": 664 }, { "entropy": 0.5195020511746407, "epoch": 2.4813432835820897, "grad_norm": 0.17342959344387054, "learning_rate": 0.0002, "loss": 0.5188111066818237, "mean_token_accuracy": 0.7901908159255981, "num_tokens": 10879309.0, "step": 665 }, { "entropy": 0.5102927386760712, "epoch": 2.485074626865672, "grad_norm": 0.19114357233047485, "learning_rate": 0.0002, "loss": 0.5075148940086365, "mean_token_accuracy": 0.793827474117279, "num_tokens": 10895754.0, "step": 666 }, { "entropy": 0.5079594776034355, "epoch": 2.4888059701492535, "grad_norm": 0.17865923047065735, "learning_rate": 0.0002, "loss": 0.5172625184059143, "mean_token_accuracy": 0.7915907651185989, "num_tokens": 10912075.0, "step": 667 }, { "entropy": 0.5225436985492706, "epoch": 2.4925373134328357, "grad_norm": 0.16307690739631653, "learning_rate": 0.0002, "loss": 0.5252382159233093, "mean_token_accuracy": 0.7875044196844101, "num_tokens": 10928580.0, "step": 668 }, { "entropy": 0.5093511343002319, "epoch": 2.496268656716418, "grad_norm": 0.1806548833847046, "learning_rate": 0.0002, "loss": 0.5136329531669617, "mean_token_accuracy": 0.7932980954647064, "num_tokens": 10944938.0, "step": 669 }, { "entropy": 0.5392017215490341, "epoch": 2.5, "grad_norm": 0.172809436917305, "learning_rate": 0.0002, "loss": 0.5332465767860413, "mean_token_accuracy": 0.7860011905431747, "num_tokens": 10961259.0, "step": 670 }, { "entropy": 0.5107344835996628, "epoch": 2.503731343283582, "grad_norm": 0.16989955306053162, "learning_rate": 0.0002, "loss": 0.515048623085022, "mean_token_accuracy": 0.7915125340223312, "num_tokens": 10977526.0, "step": 671 }, { "entropy": 0.5134129077196121, "epoch": 2.5074626865671643, "grad_norm": 0.1751825511455536, "learning_rate": 0.0002, "loss": 0.5138539671897888, "mean_token_accuracy": 0.7937446385622025, "num_tokens": 10993852.0, "step": 672 }, { "entropy": 0.5191601738333702, "epoch": 2.5111940298507465, "grad_norm": 0.20491214096546173, "learning_rate": 0.0002, "loss": 0.5287593603134155, "mean_token_accuracy": 0.7851235568523407, "num_tokens": 11010234.0, "step": 673 }, { "entropy": 0.5235985666513443, "epoch": 2.5149253731343286, "grad_norm": 0.18775786459445953, "learning_rate": 0.0002, "loss": 0.522467315196991, "mean_token_accuracy": 0.7902757078409195, "num_tokens": 11026702.0, "step": 674 }, { "entropy": 0.5197082608938217, "epoch": 2.5186567164179103, "grad_norm": 0.1559353768825531, "learning_rate": 0.0002, "loss": 0.5209258794784546, "mean_token_accuracy": 0.7914120852947235, "num_tokens": 11042983.0, "step": 675 }, { "entropy": 0.5311167538166046, "epoch": 2.5223880597014925, "grad_norm": 0.3643738329410553, "learning_rate": 0.0002, "loss": 0.5349550247192383, "mean_token_accuracy": 0.7879150658845901, "num_tokens": 11059310.0, "step": 676 }, { "entropy": 0.5285512655973434, "epoch": 2.5261194029850746, "grad_norm": 0.35899150371551514, "learning_rate": 0.0002, "loss": 0.5323964953422546, "mean_token_accuracy": 0.7864739298820496, "num_tokens": 11075633.0, "step": 677 }, { "entropy": 0.5160254240036011, "epoch": 2.529850746268657, "grad_norm": 0.1786215752363205, "learning_rate": 0.0002, "loss": 0.5121774077415466, "mean_token_accuracy": 0.7930204421281815, "num_tokens": 11091937.0, "step": 678 }, { "entropy": 0.5221347957849503, "epoch": 2.533582089552239, "grad_norm": 0.17423835396766663, "learning_rate": 0.0002, "loss": 0.521117091178894, "mean_token_accuracy": 0.7917880117893219, "num_tokens": 11108434.0, "step": 679 }, { "entropy": 0.5129313766956329, "epoch": 2.5373134328358207, "grad_norm": 0.2339075803756714, "learning_rate": 0.0002, "loss": 0.5248045325279236, "mean_token_accuracy": 0.7886321395635605, "num_tokens": 11124838.0, "step": 680 }, { "entropy": 0.5080573558807373, "epoch": 2.541044776119403, "grad_norm": 0.16493134200572968, "learning_rate": 0.0002, "loss": 0.5047459602355957, "mean_token_accuracy": 0.7968858331441879, "num_tokens": 11141150.0, "step": 681 }, { "entropy": 0.5269840210676193, "epoch": 2.544776119402985, "grad_norm": 0.18450985848903656, "learning_rate": 0.0002, "loss": 0.519035816192627, "mean_token_accuracy": 0.7893852144479752, "num_tokens": 11157626.0, "step": 682 }, { "entropy": 0.5483007431030273, "epoch": 2.548507462686567, "grad_norm": 0.18199008703231812, "learning_rate": 0.0002, "loss": 0.5438345074653625, "mean_token_accuracy": 0.7794067114591599, "num_tokens": 11174029.0, "step": 683 }, { "entropy": 0.513416476547718, "epoch": 2.5522388059701493, "grad_norm": 0.21075013279914856, "learning_rate": 0.0002, "loss": 0.5135990977287292, "mean_token_accuracy": 0.7913079857826233, "num_tokens": 11190225.0, "step": 684 }, { "entropy": 0.5416000038385391, "epoch": 2.5559701492537314, "grad_norm": 0.17459255456924438, "learning_rate": 0.0002, "loss": 0.5411964654922485, "mean_token_accuracy": 0.7781907021999359, "num_tokens": 11206277.0, "step": 685 }, { "entropy": 0.5139903053641319, "epoch": 2.5597014925373136, "grad_norm": 0.2360483855009079, "learning_rate": 0.0002, "loss": 0.5156392455101013, "mean_token_accuracy": 0.7910273224115372, "num_tokens": 11222661.0, "step": 686 }, { "entropy": 0.5297715365886688, "epoch": 2.5634328358208958, "grad_norm": 0.16449929773807526, "learning_rate": 0.0002, "loss": 0.526314914226532, "mean_token_accuracy": 0.7875741422176361, "num_tokens": 11239309.0, "step": 687 }, { "entropy": 0.5207169353961945, "epoch": 2.5671641791044775, "grad_norm": 0.18443575501441956, "learning_rate": 0.0002, "loss": 0.5246210694313049, "mean_token_accuracy": 0.7876296937465668, "num_tokens": 11255544.0, "step": 688 }, { "entropy": 0.5143519788980484, "epoch": 2.5708955223880596, "grad_norm": 0.18113332986831665, "learning_rate": 0.0002, "loss": 0.5267289876937866, "mean_token_accuracy": 0.7861593663692474, "num_tokens": 11272128.0, "step": 689 }, { "entropy": 0.5073645934462547, "epoch": 2.574626865671642, "grad_norm": 0.1688588708639145, "learning_rate": 0.0002, "loss": 0.5128133893013, "mean_token_accuracy": 0.7928483635187149, "num_tokens": 11288485.0, "step": 690 }, { "entropy": 0.5352355241775513, "epoch": 2.578358208955224, "grad_norm": 0.2043209820985794, "learning_rate": 0.0002, "loss": 0.5441552996635437, "mean_token_accuracy": 0.7808532267808914, "num_tokens": 11304943.0, "step": 691 }, { "entropy": 0.5129336938261986, "epoch": 2.582089552238806, "grad_norm": 0.17394010722637177, "learning_rate": 0.0002, "loss": 0.5214764475822449, "mean_token_accuracy": 0.7900305837392807, "num_tokens": 11321326.0, "step": 692 }, { "entropy": 0.5380357950925827, "epoch": 2.585820895522388, "grad_norm": 0.17667418718338013, "learning_rate": 0.0002, "loss": 0.5346931219100952, "mean_token_accuracy": 0.7854123413562775, "num_tokens": 11337848.0, "step": 693 }, { "entropy": 0.5276758819818497, "epoch": 2.58955223880597, "grad_norm": 0.1541767120361328, "learning_rate": 0.0002, "loss": 0.5159422755241394, "mean_token_accuracy": 0.7916016578674316, "num_tokens": 11354276.0, "step": 694 }, { "entropy": 0.5228015929460526, "epoch": 2.593283582089552, "grad_norm": 0.15557631850242615, "learning_rate": 0.0002, "loss": 0.5210080146789551, "mean_token_accuracy": 0.7870455980300903, "num_tokens": 11370495.0, "step": 695 }, { "entropy": 0.5402127206325531, "epoch": 2.5970149253731343, "grad_norm": 0.1675378531217575, "learning_rate": 0.0002, "loss": 0.5398890376091003, "mean_token_accuracy": 0.7822866439819336, "num_tokens": 11387311.0, "step": 696 }, { "entropy": 0.5136967226862907, "epoch": 2.6007462686567164, "grad_norm": 0.19592520594596863, "learning_rate": 0.0002, "loss": 0.5270940065383911, "mean_token_accuracy": 0.7860371470451355, "num_tokens": 11403707.0, "step": 697 }, { "entropy": 0.5126481875777245, "epoch": 2.6044776119402986, "grad_norm": 0.15868966281414032, "learning_rate": 0.0002, "loss": 0.5106173157691956, "mean_token_accuracy": 0.7943423539400101, "num_tokens": 11420475.0, "step": 698 }, { "entropy": 0.5322592258453369, "epoch": 2.6082089552238807, "grad_norm": 0.1745113879442215, "learning_rate": 0.0002, "loss": 0.5285219550132751, "mean_token_accuracy": 0.7842403054237366, "num_tokens": 11436972.0, "step": 699 }, { "entropy": 0.5454751402139664, "epoch": 2.611940298507463, "grad_norm": 0.17534111440181732, "learning_rate": 0.0002, "loss": 0.5420178174972534, "mean_token_accuracy": 0.7788625806570053, "num_tokens": 11453287.0, "step": 700 }, { "entropy": 0.5207047313451767, "epoch": 2.6156716417910446, "grad_norm": 0.19825099408626556, "learning_rate": 0.0002, "loss": 0.5221109390258789, "mean_token_accuracy": 0.7887770980596542, "num_tokens": 11469763.0, "step": 701 }, { "entropy": 0.5161542892456055, "epoch": 2.6194029850746268, "grad_norm": 0.20169204473495483, "learning_rate": 0.0002, "loss": 0.5191456079483032, "mean_token_accuracy": 0.7898091673851013, "num_tokens": 11486183.0, "step": 702 }, { "entropy": 0.5139896869659424, "epoch": 2.623134328358209, "grad_norm": 0.1553078144788742, "learning_rate": 0.0002, "loss": 0.5166129469871521, "mean_token_accuracy": 0.7905794680118561, "num_tokens": 11502580.0, "step": 703 }, { "entropy": 0.5328216999769211, "epoch": 2.626865671641791, "grad_norm": 0.16720637679100037, "learning_rate": 0.0002, "loss": 0.5284329652786255, "mean_token_accuracy": 0.7845450043678284, "num_tokens": 11519139.0, "step": 704 }, { "entropy": 0.5221163928508759, "epoch": 2.6305970149253732, "grad_norm": 0.18718595802783966, "learning_rate": 0.0002, "loss": 0.5283530354499817, "mean_token_accuracy": 0.7861590385437012, "num_tokens": 11535331.0, "step": 705 }, { "entropy": 0.5037321597337723, "epoch": 2.6343283582089554, "grad_norm": 0.18179404735565186, "learning_rate": 0.0002, "loss": 0.5100149512290955, "mean_token_accuracy": 0.7948807179927826, "num_tokens": 11551521.0, "step": 706 }, { "entropy": 0.5192279741168022, "epoch": 2.638059701492537, "grad_norm": 0.20862863957881927, "learning_rate": 0.0002, "loss": 0.5236419439315796, "mean_token_accuracy": 0.78767329454422, "num_tokens": 11567724.0, "step": 707 }, { "entropy": 0.5220971703529358, "epoch": 2.6417910447761193, "grad_norm": 0.1864498108625412, "learning_rate": 0.0002, "loss": 0.5215906500816345, "mean_token_accuracy": 0.7895607203245163, "num_tokens": 11584312.0, "step": 708 }, { "entropy": 0.5166686177253723, "epoch": 2.6455223880597014, "grad_norm": 0.19756394624710083, "learning_rate": 0.0002, "loss": 0.5216847658157349, "mean_token_accuracy": 0.7885107100009918, "num_tokens": 11600627.0, "step": 709 }, { "entropy": 0.5282913744449615, "epoch": 2.6492537313432836, "grad_norm": 0.17049254477024078, "learning_rate": 0.0002, "loss": 0.5236992835998535, "mean_token_accuracy": 0.7891093492507935, "num_tokens": 11617078.0, "step": 710 }, { "entropy": 0.535365641117096, "epoch": 2.6529850746268657, "grad_norm": 0.18149472773075104, "learning_rate": 0.0002, "loss": 0.5293483734130859, "mean_token_accuracy": 0.7839226573705673, "num_tokens": 11633150.0, "step": 711 }, { "entropy": 0.5354510843753815, "epoch": 2.656716417910448, "grad_norm": 0.14960937201976776, "learning_rate": 0.0002, "loss": 0.5259742736816406, "mean_token_accuracy": 0.7883720546960831, "num_tokens": 11649869.0, "step": 712 }, { "entropy": 0.5009367614984512, "epoch": 2.66044776119403, "grad_norm": 0.1922633796930313, "learning_rate": 0.0002, "loss": 0.5144891142845154, "mean_token_accuracy": 0.7931148111820221, "num_tokens": 11666213.0, "step": 713 }, { "entropy": 0.5240390002727509, "epoch": 2.664179104477612, "grad_norm": 0.18613417446613312, "learning_rate": 0.0002, "loss": 0.5301287174224854, "mean_token_accuracy": 0.7852264195680618, "num_tokens": 11682401.0, "step": 714 }, { "entropy": 0.5058765560388565, "epoch": 2.667910447761194, "grad_norm": 0.18312235176563263, "learning_rate": 0.0002, "loss": 0.5103883743286133, "mean_token_accuracy": 0.7938342690467834, "num_tokens": 11698526.0, "step": 715 }, { "entropy": 0.5158815458416939, "epoch": 2.671641791044776, "grad_norm": 0.17897051572799683, "learning_rate": 0.0002, "loss": 0.5187905430793762, "mean_token_accuracy": 0.7909149527549744, "num_tokens": 11714969.0, "step": 716 }, { "entropy": 0.5180910006165504, "epoch": 2.675373134328358, "grad_norm": 0.17239928245544434, "learning_rate": 0.0002, "loss": 0.5176571011543274, "mean_token_accuracy": 0.7897525131702423, "num_tokens": 11731465.0, "step": 717 }, { "entropy": 0.5389165133237839, "epoch": 2.6791044776119404, "grad_norm": 0.187730610370636, "learning_rate": 0.0002, "loss": 0.5379902720451355, "mean_token_accuracy": 0.7827825844287872, "num_tokens": 11747857.0, "step": 718 }, { "entropy": 0.5241931825876236, "epoch": 2.6828358208955225, "grad_norm": 0.17442777752876282, "learning_rate": 0.0002, "loss": 0.5209442973136902, "mean_token_accuracy": 0.7903313934803009, "num_tokens": 11764348.0, "step": 719 }, { "entropy": 0.5140400677919388, "epoch": 2.6865671641791042, "grad_norm": 0.17288851737976074, "learning_rate": 0.0002, "loss": 0.5115959048271179, "mean_token_accuracy": 0.7920527160167694, "num_tokens": 11780822.0, "step": 720 }, { "entropy": 0.5226388201117516, "epoch": 2.6902985074626864, "grad_norm": 0.20361240208148956, "learning_rate": 0.0002, "loss": 0.5352538824081421, "mean_token_accuracy": 0.7822130769491196, "num_tokens": 11797173.0, "step": 721 }, { "entropy": 0.5000582486391068, "epoch": 2.6940298507462686, "grad_norm": 0.15772968530654907, "learning_rate": 0.0002, "loss": 0.5034382939338684, "mean_token_accuracy": 0.796001210808754, "num_tokens": 11813674.0, "step": 722 }, { "entropy": 0.5309499502182007, "epoch": 2.6977611940298507, "grad_norm": 0.18732546269893646, "learning_rate": 0.0002, "loss": 0.5299732685089111, "mean_token_accuracy": 0.7848151177167892, "num_tokens": 11830402.0, "step": 723 }, { "entropy": 0.5357850790023804, "epoch": 2.701492537313433, "grad_norm": 0.18165066838264465, "learning_rate": 0.0002, "loss": 0.5308882594108582, "mean_token_accuracy": 0.7862505465745926, "num_tokens": 11846707.0, "step": 724 }, { "entropy": 0.5284833014011383, "epoch": 2.705223880597015, "grad_norm": 0.172774076461792, "learning_rate": 0.0002, "loss": 0.5216760635375977, "mean_token_accuracy": 0.7896177619695663, "num_tokens": 11863081.0, "step": 725 }, { "entropy": 0.5200880020856857, "epoch": 2.708955223880597, "grad_norm": 0.2079714685678482, "learning_rate": 0.0002, "loss": 0.5182638168334961, "mean_token_accuracy": 0.7900623828172684, "num_tokens": 11879482.0, "step": 726 }, { "entropy": 0.5209276676177979, "epoch": 2.7126865671641793, "grad_norm": 0.19981354475021362, "learning_rate": 0.0002, "loss": 0.533184289932251, "mean_token_accuracy": 0.7846023589372635, "num_tokens": 11895845.0, "step": 727 }, { "entropy": 0.5259044617414474, "epoch": 2.716417910447761, "grad_norm": 0.25463277101516724, "learning_rate": 0.0002, "loss": 0.5362758636474609, "mean_token_accuracy": 0.7840900421142578, "num_tokens": 11912248.0, "step": 728 }, { "entropy": 0.5323220193386078, "epoch": 2.720149253731343, "grad_norm": 0.1765269637107849, "learning_rate": 0.0002, "loss": 0.5269978046417236, "mean_token_accuracy": 0.7877814024686813, "num_tokens": 11928507.0, "step": 729 }, { "entropy": 0.5406877994537354, "epoch": 2.7238805970149254, "grad_norm": 0.19709576666355133, "learning_rate": 0.0002, "loss": 0.5350936651229858, "mean_token_accuracy": 0.7793232202529907, "num_tokens": 11944765.0, "step": 730 }, { "entropy": 0.5157359838485718, "epoch": 2.7276119402985075, "grad_norm": 0.17762304842472076, "learning_rate": 0.0002, "loss": 0.5103439092636108, "mean_token_accuracy": 0.7935812622308731, "num_tokens": 11961061.0, "step": 731 }, { "entropy": 0.5088659226894379, "epoch": 2.7313432835820897, "grad_norm": 0.2038097232580185, "learning_rate": 0.0002, "loss": 0.5155967473983765, "mean_token_accuracy": 0.7911150306463242, "num_tokens": 11977255.0, "step": 732 }, { "entropy": 0.5112843066453934, "epoch": 2.7350746268656714, "grad_norm": 0.19635888934135437, "learning_rate": 0.0002, "loss": 0.5193964242935181, "mean_token_accuracy": 0.790523573756218, "num_tokens": 11993549.0, "step": 733 }, { "entropy": 0.5119920894503593, "epoch": 2.7388059701492535, "grad_norm": 0.17737363278865814, "learning_rate": 0.0002, "loss": 0.5203633308410645, "mean_token_accuracy": 0.7897647768259048, "num_tokens": 12009626.0, "step": 734 }, { "entropy": 0.5212873220443726, "epoch": 2.7425373134328357, "grad_norm": 0.17992158234119415, "learning_rate": 0.0002, "loss": 0.5268858671188354, "mean_token_accuracy": 0.7881815582513809, "num_tokens": 12026060.0, "step": 735 }, { "entropy": 0.5266913175582886, "epoch": 2.746268656716418, "grad_norm": 0.1624017059803009, "learning_rate": 0.0002, "loss": 0.525255560874939, "mean_token_accuracy": 0.7902468144893646, "num_tokens": 12042407.0, "step": 736 }, { "entropy": 0.5043733343482018, "epoch": 2.75, "grad_norm": 0.17971543967723846, "learning_rate": 0.0002, "loss": 0.5028079152107239, "mean_token_accuracy": 0.7998141497373581, "num_tokens": 12058820.0, "step": 737 }, { "entropy": 0.5165901780128479, "epoch": 2.753731343283582, "grad_norm": 0.18306542932987213, "learning_rate": 0.0002, "loss": 0.514511227607727, "mean_token_accuracy": 0.7911152690649033, "num_tokens": 12075073.0, "step": 738 }, { "entropy": 0.521696463227272, "epoch": 2.7574626865671643, "grad_norm": 0.2015487104654312, "learning_rate": 0.0002, "loss": 0.5179941058158875, "mean_token_accuracy": 0.789873868227005, "num_tokens": 12091362.0, "step": 739 }, { "entropy": 0.52324378490448, "epoch": 2.7611940298507465, "grad_norm": 0.1782568246126175, "learning_rate": 0.0002, "loss": 0.5252962112426758, "mean_token_accuracy": 0.7859823405742645, "num_tokens": 12107787.0, "step": 740 }, { "entropy": 0.5147482007741928, "epoch": 2.7649253731343286, "grad_norm": 0.19460241496562958, "learning_rate": 0.0002, "loss": 0.5198803544044495, "mean_token_accuracy": 0.7908852845430374, "num_tokens": 12123988.0, "step": 741 }, { "entropy": 0.532531350851059, "epoch": 2.7686567164179103, "grad_norm": 0.21107251942157745, "learning_rate": 0.0002, "loss": 0.5386015176773071, "mean_token_accuracy": 0.7829076945781708, "num_tokens": 12140336.0, "step": 742 }, { "entropy": 0.5097082331776619, "epoch": 2.7723880597014925, "grad_norm": 0.18247488141059875, "learning_rate": 0.0002, "loss": 0.5075528025627136, "mean_token_accuracy": 0.7967899888753891, "num_tokens": 12156517.0, "step": 743 }, { "entropy": 0.5386329740285873, "epoch": 2.7761194029850746, "grad_norm": 0.1703251600265503, "learning_rate": 0.0002, "loss": 0.5331581830978394, "mean_token_accuracy": 0.7818602025508881, "num_tokens": 12172890.0, "step": 744 }, { "entropy": 0.5344566106796265, "epoch": 2.779850746268657, "grad_norm": 0.1912059634923935, "learning_rate": 0.0002, "loss": 0.5289663076400757, "mean_token_accuracy": 0.7873619496822357, "num_tokens": 12189337.0, "step": 745 }, { "entropy": 0.519013062119484, "epoch": 2.783582089552239, "grad_norm": 0.1737934947013855, "learning_rate": 0.0002, "loss": 0.5253188014030457, "mean_token_accuracy": 0.7876646816730499, "num_tokens": 12205610.0, "step": 746 }, { "entropy": 0.5199131593108177, "epoch": 2.7873134328358207, "grad_norm": 0.20281687378883362, "learning_rate": 0.0002, "loss": 0.5254766941070557, "mean_token_accuracy": 0.785002738237381, "num_tokens": 12221943.0, "step": 747 }, { "entropy": 0.5261564403772354, "epoch": 2.791044776119403, "grad_norm": 0.17186403274536133, "learning_rate": 0.0002, "loss": 0.52431321144104, "mean_token_accuracy": 0.7875388860702515, "num_tokens": 12238419.0, "step": 748 }, { "entropy": 0.5311170220375061, "epoch": 2.794776119402985, "grad_norm": 0.2272450029850006, "learning_rate": 0.0002, "loss": 0.5422958135604858, "mean_token_accuracy": 0.7811820060014725, "num_tokens": 12254810.0, "step": 749 }, { "entropy": 0.5110429674386978, "epoch": 2.798507462686567, "grad_norm": 0.1752447783946991, "learning_rate": 0.0002, "loss": 0.511790931224823, "mean_token_accuracy": 0.7926972359418869, "num_tokens": 12271003.0, "step": 750 }, { "entropy": 0.5179876983165741, "epoch": 2.8022388059701493, "grad_norm": 0.17473958432674408, "learning_rate": 0.0002, "loss": 0.5154609084129333, "mean_token_accuracy": 0.7912380993366241, "num_tokens": 12287481.0, "step": 751 }, { "entropy": 0.5093216001987457, "epoch": 2.8059701492537314, "grad_norm": 0.18723160028457642, "learning_rate": 0.0002, "loss": 0.5158673524856567, "mean_token_accuracy": 0.7871368080377579, "num_tokens": 12303930.0, "step": 752 }, { "entropy": 0.508473701775074, "epoch": 2.8097014925373136, "grad_norm": 0.16832517087459564, "learning_rate": 0.0002, "loss": 0.5054484605789185, "mean_token_accuracy": 0.7960272431373596, "num_tokens": 12320104.0, "step": 753 }, { "entropy": 0.5237400829792023, "epoch": 2.8134328358208958, "grad_norm": 0.16328011453151703, "learning_rate": 0.0002, "loss": 0.521124541759491, "mean_token_accuracy": 0.7856553643941879, "num_tokens": 12336433.0, "step": 754 }, { "entropy": 0.5281547904014587, "epoch": 2.8171641791044775, "grad_norm": 0.1548423022031784, "learning_rate": 0.0002, "loss": 0.5290802121162415, "mean_token_accuracy": 0.786285325884819, "num_tokens": 12353044.0, "step": 755 }, { "entropy": 0.5319864898920059, "epoch": 2.8208955223880596, "grad_norm": 0.17879781126976013, "learning_rate": 0.0002, "loss": 0.5398349761962891, "mean_token_accuracy": 0.7838435024023056, "num_tokens": 12369412.0, "step": 756 }, { "entropy": 0.5187028869986534, "epoch": 2.824626865671642, "grad_norm": 0.1700705736875534, "learning_rate": 0.0002, "loss": 0.5216772556304932, "mean_token_accuracy": 0.7881180942058563, "num_tokens": 12385842.0, "step": 757 }, { "entropy": 0.5375183820724487, "epoch": 2.828358208955224, "grad_norm": 0.18571849167346954, "learning_rate": 0.0002, "loss": 0.5363373160362244, "mean_token_accuracy": 0.7835224717855453, "num_tokens": 12401843.0, "step": 758 }, { "entropy": 0.5308329612016678, "epoch": 2.832089552238806, "grad_norm": 0.17223785817623138, "learning_rate": 0.0002, "loss": 0.526056170463562, "mean_token_accuracy": 0.7878949195146561, "num_tokens": 12418294.0, "step": 759 }, { "entropy": 0.5180955529212952, "epoch": 2.835820895522388, "grad_norm": 0.19426262378692627, "learning_rate": 0.0002, "loss": 0.5233747363090515, "mean_token_accuracy": 0.7847504019737244, "num_tokens": 12434639.0, "step": 760 }, { "entropy": 0.5211240500211716, "epoch": 2.83955223880597, "grad_norm": 0.17702415585517883, "learning_rate": 0.0002, "loss": 0.5200589299201965, "mean_token_accuracy": 0.7906626909971237, "num_tokens": 12450966.0, "step": 761 }, { "entropy": 0.5131405591964722, "epoch": 2.843283582089552, "grad_norm": 0.16737323999404907, "learning_rate": 0.0002, "loss": 0.5157369375228882, "mean_token_accuracy": 0.7910412847995758, "num_tokens": 12467267.0, "step": 762 }, { "entropy": 0.5366750806570053, "epoch": 2.8470149253731343, "grad_norm": 0.16437119245529175, "learning_rate": 0.0002, "loss": 0.5366208553314209, "mean_token_accuracy": 0.7785362154245377, "num_tokens": 12483825.0, "step": 763 }, { "entropy": 0.5352065116167068, "epoch": 2.8507462686567164, "grad_norm": 0.14709708094596863, "learning_rate": 0.0002, "loss": 0.5321803092956543, "mean_token_accuracy": 0.7876356840133667, "num_tokens": 12500282.0, "step": 764 }, { "entropy": 0.5344839543104172, "epoch": 2.8544776119402986, "grad_norm": 0.14966800808906555, "learning_rate": 0.0002, "loss": 0.531541109085083, "mean_token_accuracy": 0.7864569425582886, "num_tokens": 12516745.0, "step": 765 }, { "entropy": 0.5019206777215004, "epoch": 2.8582089552238807, "grad_norm": 0.18061211705207825, "learning_rate": 0.0002, "loss": 0.5042290687561035, "mean_token_accuracy": 0.7964124828577042, "num_tokens": 12532956.0, "step": 766 }, { "entropy": 0.5074614435434341, "epoch": 2.861940298507463, "grad_norm": 0.18505603075027466, "learning_rate": 0.0002, "loss": 0.5167686939239502, "mean_token_accuracy": 0.7910870015621185, "num_tokens": 12549228.0, "step": 767 }, { "entropy": 0.5183932334184647, "epoch": 2.8656716417910446, "grad_norm": 0.1724204570055008, "learning_rate": 0.0002, "loss": 0.524673581123352, "mean_token_accuracy": 0.7895944714546204, "num_tokens": 12565584.0, "step": 768 }, { "entropy": 0.5218961760401726, "epoch": 2.8694029850746268, "grad_norm": 0.15690268576145172, "learning_rate": 0.0002, "loss": 0.5237387418746948, "mean_token_accuracy": 0.7879291921854019, "num_tokens": 12582028.0, "step": 769 }, { "entropy": 0.522913858294487, "epoch": 2.873134328358209, "grad_norm": 0.21558451652526855, "learning_rate": 0.0002, "loss": 0.5252016186714172, "mean_token_accuracy": 0.7892911732196808, "num_tokens": 12598433.0, "step": 770 }, { "entropy": 0.5268243104219437, "epoch": 2.876865671641791, "grad_norm": 0.14720359444618225, "learning_rate": 0.0002, "loss": 0.5126805901527405, "mean_token_accuracy": 0.7932652682065964, "num_tokens": 12615016.0, "step": 771 }, { "entropy": 0.5350854992866516, "epoch": 2.8805970149253732, "grad_norm": 0.2269367277622223, "learning_rate": 0.0002, "loss": 0.5303336977958679, "mean_token_accuracy": 0.7860198318958282, "num_tokens": 12631417.0, "step": 772 }, { "entropy": 0.5364827066659927, "epoch": 2.8843283582089554, "grad_norm": 0.174966961145401, "learning_rate": 0.0002, "loss": 0.539239227771759, "mean_token_accuracy": 0.7799928337335587, "num_tokens": 12647945.0, "step": 773 }, { "entropy": 0.5175943821668625, "epoch": 2.888059701492537, "grad_norm": 0.239835724234581, "learning_rate": 0.0002, "loss": 0.5245868563652039, "mean_token_accuracy": 0.7879510670900345, "num_tokens": 12664357.0, "step": 774 }, { "entropy": 0.525666281580925, "epoch": 2.8917910447761193, "grad_norm": 0.19655871391296387, "learning_rate": 0.0002, "loss": 0.5303555727005005, "mean_token_accuracy": 0.7861410826444626, "num_tokens": 12680982.0, "step": 775 }, { "entropy": 0.5001505762338638, "epoch": 2.8955223880597014, "grad_norm": 0.2157313972711563, "learning_rate": 0.0002, "loss": 0.5040432810783386, "mean_token_accuracy": 0.7954959124326706, "num_tokens": 12697247.0, "step": 776 }, { "entropy": 0.5350449979305267, "epoch": 2.8992537313432836, "grad_norm": 0.20097671449184418, "learning_rate": 0.0002, "loss": 0.5355807542800903, "mean_token_accuracy": 0.7829754054546356, "num_tokens": 12713704.0, "step": 777 }, { "entropy": 0.5254835188388824, "epoch": 2.9029850746268657, "grad_norm": 0.16286872327327728, "learning_rate": 0.0002, "loss": 0.5268586874008179, "mean_token_accuracy": 0.7856743782758713, "num_tokens": 12730121.0, "step": 778 }, { "entropy": 0.5580068975687027, "epoch": 2.906716417910448, "grad_norm": 0.1875162571668625, "learning_rate": 0.0002, "loss": 0.5552141666412354, "mean_token_accuracy": 0.7768043726682663, "num_tokens": 12746743.0, "step": 779 }, { "entropy": 0.5280749648809433, "epoch": 2.91044776119403, "grad_norm": 0.1497505009174347, "learning_rate": 0.0002, "loss": 0.5217434167861938, "mean_token_accuracy": 0.7901686578989029, "num_tokens": 12763132.0, "step": 780 }, { "entropy": 0.5150540545582771, "epoch": 2.914179104477612, "grad_norm": 0.1816144436597824, "learning_rate": 0.0002, "loss": 0.518502414226532, "mean_token_accuracy": 0.787481039762497, "num_tokens": 12779424.0, "step": 781 }, { "entropy": 0.5084019601345062, "epoch": 2.917910447761194, "grad_norm": 0.18711701035499573, "learning_rate": 0.0002, "loss": 0.513791024684906, "mean_token_accuracy": 0.792212188243866, "num_tokens": 12795613.0, "step": 782 }, { "entropy": 0.5053626373410225, "epoch": 2.921641791044776, "grad_norm": 0.18591050803661346, "learning_rate": 0.0002, "loss": 0.5184471607208252, "mean_token_accuracy": 0.7897629290819168, "num_tokens": 12812042.0, "step": 783 }, { "entropy": 0.5152643695473671, "epoch": 2.925373134328358, "grad_norm": 0.1889844536781311, "learning_rate": 0.0002, "loss": 0.5239505171775818, "mean_token_accuracy": 0.7899060547351837, "num_tokens": 12828347.0, "step": 784 }, { "entropy": 0.5273154824972153, "epoch": 2.9291044776119404, "grad_norm": 0.1580808460712433, "learning_rate": 0.0002, "loss": 0.5230674147605896, "mean_token_accuracy": 0.7892739921808243, "num_tokens": 12844649.0, "step": 785 }, { "entropy": 0.5427146404981613, "epoch": 2.9328358208955225, "grad_norm": 0.1609242558479309, "learning_rate": 0.0002, "loss": 0.5328511595726013, "mean_token_accuracy": 0.7870279252529144, "num_tokens": 12860925.0, "step": 786 }, { "entropy": 0.5395708978176117, "epoch": 2.9365671641791042, "grad_norm": 0.16566500067710876, "learning_rate": 0.0002, "loss": 0.5288230180740356, "mean_token_accuracy": 0.7857491821050644, "num_tokens": 12877421.0, "step": 787 }, { "entropy": 0.5150002017617226, "epoch": 2.9402985074626864, "grad_norm": 0.15979735553264618, "learning_rate": 0.0002, "loss": 0.5151138305664062, "mean_token_accuracy": 0.7929274588823318, "num_tokens": 12893884.0, "step": 788 }, { "entropy": 0.5136501267552376, "epoch": 2.9440298507462686, "grad_norm": 0.22995848953723907, "learning_rate": 0.0002, "loss": 0.5289221405982971, "mean_token_accuracy": 0.7861058861017227, "num_tokens": 12910392.0, "step": 789 }, { "entropy": 0.5414163321256638, "epoch": 2.9477611940298507, "grad_norm": 0.18121406435966492, "learning_rate": 0.0002, "loss": 0.5471609830856323, "mean_token_accuracy": 0.7791576832532883, "num_tokens": 12927008.0, "step": 790 }, { "entropy": 0.5124125629663467, "epoch": 2.951492537313433, "grad_norm": 0.20011217892169952, "learning_rate": 0.0002, "loss": 0.5082826614379883, "mean_token_accuracy": 0.7953236252069473, "num_tokens": 12943455.0, "step": 791 }, { "entropy": 0.5297976434230804, "epoch": 2.955223880597015, "grad_norm": 0.15697196125984192, "learning_rate": 0.0002, "loss": 0.52349853515625, "mean_token_accuracy": 0.7878834158182144, "num_tokens": 12959738.0, "step": 792 }, { "entropy": 0.5208505988121033, "epoch": 2.958955223880597, "grad_norm": 0.1743849664926529, "learning_rate": 0.0002, "loss": 0.5164416432380676, "mean_token_accuracy": 0.7905778139829636, "num_tokens": 12975959.0, "step": 793 }, { "entropy": 0.5202152505517006, "epoch": 2.9626865671641793, "grad_norm": 0.2171812653541565, "learning_rate": 0.0002, "loss": 0.5232265591621399, "mean_token_accuracy": 0.7891267985105515, "num_tokens": 12992210.0, "step": 794 }, { "entropy": 0.5199966579675674, "epoch": 2.966417910447761, "grad_norm": 0.22469930350780487, "learning_rate": 0.0002, "loss": 0.5291239619255066, "mean_token_accuracy": 0.7850851565599442, "num_tokens": 13008651.0, "step": 795 }, { "entropy": 0.5255369544029236, "epoch": 2.970149253731343, "grad_norm": 0.2371702492237091, "learning_rate": 0.0002, "loss": 0.5344793796539307, "mean_token_accuracy": 0.7816057652235031, "num_tokens": 13024835.0, "step": 796 }, { "entropy": 0.533539667725563, "epoch": 2.9738805970149254, "grad_norm": 0.16759631037712097, "learning_rate": 0.0002, "loss": 0.5290622711181641, "mean_token_accuracy": 0.7863010764122009, "num_tokens": 13041317.0, "step": 797 }, { "entropy": 0.5440120846033096, "epoch": 2.9776119402985075, "grad_norm": 0.18567466735839844, "learning_rate": 0.0002, "loss": 0.5380448698997498, "mean_token_accuracy": 0.7847449481487274, "num_tokens": 13057786.0, "step": 798 }, { "entropy": 0.5316625982522964, "epoch": 2.9813432835820897, "grad_norm": 0.16756805777549744, "learning_rate": 0.0002, "loss": 0.530038058757782, "mean_token_accuracy": 0.7850957661867142, "num_tokens": 13074101.0, "step": 799 }, { "entropy": 0.5209571197628975, "epoch": 2.9850746268656714, "grad_norm": 0.15372832119464874, "learning_rate": 0.0002, "loss": 0.5174048542976379, "mean_token_accuracy": 0.7904630899429321, "num_tokens": 13090657.0, "step": 800 }, { "entropy": 0.4961584433913231, "epoch": 2.9888059701492535, "grad_norm": 0.20615528523921967, "learning_rate": 0.0002, "loss": 0.5061897039413452, "mean_token_accuracy": 0.7948594838380814, "num_tokens": 13106809.0, "step": 801 }, { "entropy": 0.5250304043292999, "epoch": 2.9925373134328357, "grad_norm": 0.19997206330299377, "learning_rate": 0.0002, "loss": 0.5354763269424438, "mean_token_accuracy": 0.7813558727502823, "num_tokens": 13123157.0, "step": 802 }, { "entropy": 0.5133228674530983, "epoch": 2.996268656716418, "grad_norm": 0.1635276973247528, "learning_rate": 0.0002, "loss": 0.5166719555854797, "mean_token_accuracy": 0.7908363342285156, "num_tokens": 13139302.0, "step": 803 }, { "entropy": 0.5134190171957016, "epoch": 3.0, "grad_norm": 0.15589290857315063, "learning_rate": 0.0002, "loss": 0.5092208981513977, "mean_token_accuracy": 0.7965500056743622, "num_tokens": 13155671.0, "step": 804 } ], "logging_steps": 1, "max_steps": 804, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.2262397699277455e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }