diff --git "a/trainer_state.json" "b/trainer_state.json" --- "a/trainer_state.json" +++ "b/trainer_state.json" @@ -2,3118 +2,6468 @@ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, - "epoch": 10.0, + "epoch": 5.0, "eval_steps": 500, - "global_step": 310, + "global_step": 645, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { - "entropy": 1.2108377814292908, - "epoch": 0.03225806451612903, - "grad_norm": 0.6928424835205078, + "entropy": 1.1461779922246933, + "epoch": 0.007774538386783284, + "grad_norm": 0.2348785102367401, "learning_rate": 0.0002, - "loss": 2.6145451068878174, - "mean_token_accuracy": 0.5257208347320557, - "num_tokens": 77915.0, + "loss": 2.5822062492370605, + "mean_token_accuracy": 0.5106955841183662, + "num_tokens": 37728.0, "step": 1 }, { - "entropy": 1.2280026972293854, - "epoch": 0.06451612903225806, - "grad_norm": 0.40360888838768005, + "entropy": 1.2709465026855469, + "epoch": 0.015549076773566569, + "grad_norm": 0.19847582280635834, "learning_rate": 0.0002, - "loss": 2.12216854095459, - "mean_token_accuracy": 0.5751811861991882, - "num_tokens": 155609.0, + "loss": 2.256243944168091, + "mean_token_accuracy": 0.5385559350252151, + "num_tokens": 74823.0, "step": 2 }, { - "entropy": 1.3157195746898651, - "epoch": 0.0967741935483871, - "grad_norm": 0.37724417448043823, + "entropy": 1.457642063498497, + "epoch": 0.023323615160349854, + "grad_norm": 0.14325936138629913, "learning_rate": 0.0002, - "loss": 1.7939939498901367, - "mean_token_accuracy": 0.5949544161558151, - "num_tokens": 234747.0, + "loss": 1.8135013580322266, + "mean_token_accuracy": 0.5658686235547066, + "num_tokens": 112223.0, "step": 3 }, { - "entropy": 1.3692472279071808, - "epoch": 0.12903225806451613, - "grad_norm": 0.4072861969470978, + "entropy": 1.4453874379396439, + "epoch": 0.031098153547133137, + "grad_norm": 0.11537832021713257, "learning_rate": 0.0002, - "loss": 1.5643707513809204, - "mean_token_accuracy": 0.6154418289661407, - "num_tokens": 314203.0, + "loss": 1.4907238483428955, + "mean_token_accuracy": 0.6095475852489471, + "num_tokens": 149646.0, "step": 4 }, { - "entropy": 1.3363037109375, - "epoch": 0.16129032258064516, - "grad_norm": 0.25536584854125977, + "entropy": 1.4222392737865448, + "epoch": 0.038872691933916424, + "grad_norm": 0.14347851276397705, "learning_rate": 0.0002, - "loss": 1.3993436098098755, - "mean_token_accuracy": 0.6389602273702621, - "num_tokens": 393638.0, + "loss": 1.3716599941253662, + "mean_token_accuracy": 0.614239789545536, + "num_tokens": 186807.0, "step": 5 }, { - "entropy": 1.3661861419677734, - "epoch": 0.1935483870967742, - "grad_norm": 0.16949856281280518, + "entropy": 1.3676332831382751, + "epoch": 0.04664723032069971, + "grad_norm": 0.07458607107400894, "learning_rate": 0.0002, - "loss": 1.2982456684112549, - "mean_token_accuracy": 0.649403303861618, - "num_tokens": 472178.0, + "loss": 1.2618626356124878, + "mean_token_accuracy": 0.6355780363082886, + "num_tokens": 224243.0, "step": 6 }, { - "entropy": 1.3246012330055237, - "epoch": 0.22580645161290322, - "grad_norm": 0.1267392337322235, + "entropy": 1.2903779596090317, + "epoch": 0.05442176870748299, + "grad_norm": 0.050369806587696075, "learning_rate": 0.0002, - "loss": 1.2008121013641357, - "mean_token_accuracy": 0.6618895977735519, - "num_tokens": 550442.0, + "loss": 1.1705503463745117, + "mean_token_accuracy": 0.6446279659867287, + "num_tokens": 261678.0, "step": 7 }, { - "entropy": 1.2534887194633484, - "epoch": 0.25806451612903225, - "grad_norm": 0.12660343945026398, + "entropy": 1.231130599975586, + "epoch": 0.062196307094266275, + "grad_norm": 0.05470636859536171, "learning_rate": 0.0002, - "loss": 1.0963741540908813, - "mean_token_accuracy": 0.6759665459394455, - "num_tokens": 631057.0, + "loss": 1.0978062152862549, + "mean_token_accuracy": 0.6580947414040565, + "num_tokens": 298703.0, "step": 8 }, { - "entropy": 1.2272652387619019, - "epoch": 0.2903225806451613, - "grad_norm": 0.1357613056898117, + "entropy": 1.1396304965019226, + "epoch": 0.06997084548104957, + "grad_norm": 0.05549474433064461, "learning_rate": 0.0002, - "loss": 1.0560389757156372, - "mean_token_accuracy": 0.6746651232242584, - "num_tokens": 709785.0, + "loss": 1.026996374130249, + "mean_token_accuracy": 0.6708663776516914, + "num_tokens": 336240.0, "step": 9 }, { - "entropy": 1.1543474793434143, - "epoch": 0.3225806451612903, - "grad_norm": 0.1262923926115036, + "entropy": 1.0528622567653656, + "epoch": 0.07774538386783285, + "grad_norm": 0.05926097184419632, "learning_rate": 0.0002, - "loss": 0.9836021661758423, - "mean_token_accuracy": 0.693942204117775, - "num_tokens": 788705.0, + "loss": 0.9768505096435547, + "mean_token_accuracy": 0.6747338622808456, + "num_tokens": 373808.0, "step": 10 }, { - "entropy": 1.0659774839878082, - "epoch": 0.3548387096774194, - "grad_norm": 0.10476168245077133, + "entropy": 0.978929877281189, + "epoch": 0.08551992225461613, + "grad_norm": 0.08427942544221878, "learning_rate": 0.0002, - "loss": 0.9247925877571106, - "mean_token_accuracy": 0.7010035812854767, - "num_tokens": 866898.0, + "loss": 0.9218605756759644, + "mean_token_accuracy": 0.6868897452950478, + "num_tokens": 410822.0, "step": 11 }, { - "entropy": 0.9727843105792999, - "epoch": 0.3870967741935484, - "grad_norm": 0.09436453878879547, + "entropy": 0.9272410869598389, + "epoch": 0.09329446064139942, + "grad_norm": 0.0502631776034832, "learning_rate": 0.0002, - "loss": 0.8839961290359497, - "mean_token_accuracy": 0.7076074182987213, - "num_tokens": 945336.0, + "loss": 0.8876349925994873, + "mean_token_accuracy": 0.688661016523838, + "num_tokens": 447975.0, "step": 12 }, { - "entropy": 0.8906200975179672, - "epoch": 0.41935483870967744, - "grad_norm": 0.0898677408695221, + "entropy": 0.860072985291481, + "epoch": 0.1010689990281827, + "grad_norm": 0.04337044060230255, "learning_rate": 0.0002, - "loss": 0.8381521105766296, - "mean_token_accuracy": 0.7165039479732513, - "num_tokens": 1023470.0, + "loss": 0.8350162506103516, + "mean_token_accuracy": 0.7001973986625671, + "num_tokens": 485476.0, "step": 13 }, { - "entropy": 0.8297237753868103, - "epoch": 0.45161290322580644, - "grad_norm": 0.09061617404222488, + "entropy": 0.7882575914263725, + "epoch": 0.10884353741496598, + "grad_norm": 0.06162057816982269, "learning_rate": 0.0002, - "loss": 0.8075975179672241, - "mean_token_accuracy": 0.7183874249458313, - "num_tokens": 1102366.0, + "loss": 0.8057988882064819, + "mean_token_accuracy": 0.7050592303276062, + "num_tokens": 522792.0, "step": 14 }, { - "entropy": 0.7862683832645416, - "epoch": 0.4838709677419355, - "grad_norm": 0.09677388519048691, + "entropy": 0.7824503108859062, + "epoch": 0.11661807580174927, + "grad_norm": 0.03932056203484535, "learning_rate": 0.0002, - "loss": 0.7915093898773193, - "mean_token_accuracy": 0.7166366279125214, - "num_tokens": 1181463.0, + "loss": 0.7716900110244751, + "mean_token_accuracy": 0.7123773470520973, + "num_tokens": 559845.0, "step": 15 }, { - "entropy": 0.7366400808095932, - "epoch": 0.5161290322580645, - "grad_norm": 0.08824242651462555, + "entropy": 0.7571921274065971, + "epoch": 0.12439261418853255, + "grad_norm": 0.03887049853801727, "learning_rate": 0.0002, - "loss": 0.7438744306564331, - "mean_token_accuracy": 0.7302631139755249, - "num_tokens": 1260006.0, + "loss": 0.7427914142608643, + "mean_token_accuracy": 0.721781499683857, + "num_tokens": 596752.0, "step": 16 }, { - "entropy": 0.7312893569469452, - "epoch": 0.5483870967741935, - "grad_norm": 0.07547659426927567, + "entropy": 0.7445609271526337, + "epoch": 0.13216715257531583, + "grad_norm": 0.037259574979543686, "learning_rate": 0.0002, - "loss": 0.7313656806945801, - "mean_token_accuracy": 0.7311705946922302, - "num_tokens": 1338935.0, + "loss": 0.7245944738388062, + "mean_token_accuracy": 0.7208689078688622, + "num_tokens": 634143.0, "step": 17 }, { - "entropy": 0.7072197049856186, - "epoch": 0.5806451612903226, - "grad_norm": 0.07940181344747543, + "entropy": 0.7450662180781364, + "epoch": 0.13994169096209913, + "grad_norm": 0.03612779080867767, "learning_rate": 0.0002, - "loss": 0.6973146796226501, - "mean_token_accuracy": 0.7380757033824921, - "num_tokens": 1418014.0, + "loss": 0.7255409955978394, + "mean_token_accuracy": 0.7214401289820671, + "num_tokens": 671585.0, "step": 18 }, { - "entropy": 0.7047975361347198, - "epoch": 0.6129032258064516, - "grad_norm": 0.08228685706853867, + "entropy": 0.7271910980343819, + "epoch": 0.1477162293488824, + "grad_norm": 0.03141465783119202, "learning_rate": 0.0002, - "loss": 0.6983991861343384, - "mean_token_accuracy": 0.7352693974971771, - "num_tokens": 1497045.0, + "loss": 0.7076310515403748, + "mean_token_accuracy": 0.7255471646785736, + "num_tokens": 708756.0, "step": 19 }, { - "entropy": 0.6795883923768997, - "epoch": 0.6451612903225806, - "grad_norm": 0.0756707489490509, + "entropy": 0.7060252502560616, + "epoch": 0.1554907677356657, + "grad_norm": 0.035933561623096466, "learning_rate": 0.0002, - "loss": 0.6704490184783936, - "mean_token_accuracy": 0.7453291118144989, - "num_tokens": 1576440.0, + "loss": 0.6859346628189087, + "mean_token_accuracy": 0.732830710709095, + "num_tokens": 746139.0, "step": 20 }, { - "entropy": 0.6742499768733978, - "epoch": 0.6774193548387096, - "grad_norm": 0.06836266070604324, + "entropy": 0.6829683035612106, + "epoch": 0.16326530612244897, + "grad_norm": 0.03822736069560051, "learning_rate": 0.0002, - "loss": 0.6623807549476624, - "mean_token_accuracy": 0.7448357492685318, - "num_tokens": 1656085.0, + "loss": 0.6772962212562561, + "mean_token_accuracy": 0.7338771298527718, + "num_tokens": 783417.0, "step": 21 }, { - "entropy": 0.6770815700292587, - "epoch": 0.7096774193548387, - "grad_norm": 0.0641896054148674, + "entropy": 0.6782366037368774, + "epoch": 0.17103984450923226, + "grad_norm": 0.031850460916757584, "learning_rate": 0.0002, - "loss": 0.6653863787651062, - "mean_token_accuracy": 0.742030069231987, - "num_tokens": 1733785.0, + "loss": 0.6737133264541626, + "mean_token_accuracy": 0.7363682463765144, + "num_tokens": 820745.0, "step": 22 }, { - "entropy": 0.6622436791658401, - "epoch": 0.7419354838709677, - "grad_norm": 0.061193544417619705, + "entropy": 0.6792467907071114, + "epoch": 0.17881438289601556, + "grad_norm": 0.031343962997198105, "learning_rate": 0.0002, - "loss": 0.6471956968307495, - "mean_token_accuracy": 0.7478197664022446, - "num_tokens": 1811732.0, + "loss": 0.6833145618438721, + "mean_token_accuracy": 0.7314189001917839, + "num_tokens": 858477.0, "step": 23 }, { - "entropy": 0.6454922705888748, - "epoch": 0.7741935483870968, - "grad_norm": 0.05598059669137001, + "entropy": 0.6493787094950676, + "epoch": 0.18658892128279883, + "grad_norm": 0.028227699920535088, "learning_rate": 0.0002, - "loss": 0.6315531134605408, - "mean_token_accuracy": 0.7541234940290451, - "num_tokens": 1890421.0, + "loss": 0.6512086987495422, + "mean_token_accuracy": 0.7448033019900322, + "num_tokens": 895754.0, "step": 24 }, { - "entropy": 0.6487089246511459, - "epoch": 0.8064516129032258, - "grad_norm": 0.0565122552216053, + "entropy": 0.6527747735381126, + "epoch": 0.19436345966958213, + "grad_norm": 0.02940857782959938, "learning_rate": 0.0002, - "loss": 0.6389895677566528, - "mean_token_accuracy": 0.7514772266149521, - "num_tokens": 1967043.0, + "loss": 0.6458977460861206, + "mean_token_accuracy": 0.7454173043370247, + "num_tokens": 933200.0, "step": 25 }, { - "entropy": 0.6330023109912872, - "epoch": 0.8387096774193549, - "grad_norm": 0.06039460375905037, + "entropy": 0.6647381633520126, + "epoch": 0.2021379980563654, + "grad_norm": 0.03015323169529438, "learning_rate": 0.0002, - "loss": 0.6244106292724609, - "mean_token_accuracy": 0.7557308524847031, - "num_tokens": 2045932.0, + "loss": 0.6591448783874512, + "mean_token_accuracy": 0.7374408692121506, + "num_tokens": 970838.0, "step": 26 }, { - "entropy": 0.624711200594902, - "epoch": 0.8709677419354839, - "grad_norm": 0.05815982446074486, + "entropy": 0.6438521891832352, + "epoch": 0.2099125364431487, + "grad_norm": 0.035360876470804214, "learning_rate": 0.0002, - "loss": 0.6193004846572876, - "mean_token_accuracy": 0.7580623775720596, - "num_tokens": 2125352.0, + "loss": 0.6528849601745605, + "mean_token_accuracy": 0.7403199598193169, + "num_tokens": 1008094.0, "step": 27 }, { - "entropy": 0.6006695479154587, - "epoch": 0.9032258064516129, - "grad_norm": 0.06260675936937332, + "entropy": 0.6399626433849335, + "epoch": 0.21768707482993196, + "grad_norm": 0.02637004852294922, "learning_rate": 0.0002, - "loss": 0.6044747829437256, - "mean_token_accuracy": 0.7639114111661911, - "num_tokens": 2203090.0, + "loss": 0.6530839204788208, + "mean_token_accuracy": 0.7398090362548828, + "num_tokens": 1045463.0, "step": 28 }, { - "entropy": 0.5943089425563812, - "epoch": 0.9354838709677419, - "grad_norm": 0.060202307999134064, + "entropy": 0.6436624526977539, + "epoch": 0.22546161321671526, + "grad_norm": 0.02592352218925953, "learning_rate": 0.0002, - "loss": 0.5964701771736145, - "mean_token_accuracy": 0.7653262317180634, - "num_tokens": 2281537.0, + "loss": 0.6487458944320679, + "mean_token_accuracy": 0.7412822172045708, + "num_tokens": 1083139.0, "step": 29 }, { - "entropy": 0.5986111164093018, - "epoch": 0.967741935483871, - "grad_norm": 0.0541241429746151, + "entropy": 0.653114914894104, + "epoch": 0.23323615160349853, + "grad_norm": 0.018322035670280457, "learning_rate": 0.0002, - "loss": 0.5991954803466797, - "mean_token_accuracy": 0.7634078860282898, - "num_tokens": 2360516.0, + "loss": 0.6511994004249573, + "mean_token_accuracy": 0.7411110699176788, + "num_tokens": 1120783.0, "step": 30 }, { - "entropy": 0.5967210531234741, - "epoch": 1.0, - "grad_norm": 0.05269192159175873, + "entropy": 0.642485961318016, + "epoch": 0.24101068999028183, + "grad_norm": 0.021689819172024727, "learning_rate": 0.0002, - "loss": 0.5975545048713684, - "mean_token_accuracy": 0.7649656534194946, - "num_tokens": 2438564.0, + "loss": 0.644116222858429, + "mean_token_accuracy": 0.7440010756254196, + "num_tokens": 1158207.0, "step": 31 }, { - "entropy": 0.5890886783599854, - "epoch": 1.032258064516129, - "grad_norm": 0.05449746176600456, + "entropy": 0.6343450918793678, + "epoch": 0.2487852283770651, + "grad_norm": 0.02071012370288372, "learning_rate": 0.0002, - "loss": 0.5800559520721436, - "mean_token_accuracy": 0.7717925757169724, - "num_tokens": 2516742.0, + "loss": 0.6319076418876648, + "mean_token_accuracy": 0.7487388849258423, + "num_tokens": 1195845.0, "step": 32 }, { - "entropy": 0.5956283509731293, - "epoch": 1.064516129032258, - "grad_norm": 0.05351584777235985, + "entropy": 0.6410091295838356, + "epoch": 0.2565597667638484, + "grad_norm": 0.025183040648698807, "learning_rate": 0.0002, - "loss": 0.5879819393157959, - "mean_token_accuracy": 0.7676646113395691, - "num_tokens": 2595672.0, + "loss": 0.6358401775360107, + "mean_token_accuracy": 0.7465788945555687, + "num_tokens": 1233366.0, "step": 33 }, { - "entropy": 0.5949074476957321, - "epoch": 1.096774193548387, - "grad_norm": 0.05134779214859009, + "entropy": 0.6519959643483162, + "epoch": 0.26433430515063167, + "grad_norm": 0.017367947846651077, "learning_rate": 0.0002, - "loss": 0.593163251876831, - "mean_token_accuracy": 0.7667708247900009, - "num_tokens": 2674992.0, + "loss": 0.6433607339859009, + "mean_token_accuracy": 0.7429918646812439, + "num_tokens": 1270710.0, "step": 34 }, { - "entropy": 0.5895005166530609, - "epoch": 1.129032258064516, - "grad_norm": 0.04475667327642441, + "entropy": 0.6490929946303368, + "epoch": 0.272108843537415, + "grad_norm": 0.023137487471103668, "learning_rate": 0.0002, - "loss": 0.5876166820526123, - "mean_token_accuracy": 0.7677939385175705, - "num_tokens": 2754315.0, + "loss": 0.6468774676322937, + "mean_token_accuracy": 0.7406889051198959, + "num_tokens": 1308095.0, "step": 35 }, { - "entropy": 0.5794888734817505, - "epoch": 1.1612903225806452, - "grad_norm": 0.03956792876124382, + "entropy": 0.6438097059726715, + "epoch": 0.27988338192419826, + "grad_norm": 0.016993502154946327, "learning_rate": 0.0002, - "loss": 0.5770071744918823, - "mean_token_accuracy": 0.7725034654140472, - "num_tokens": 2834196.0, + "loss": 0.6424656510353088, + "mean_token_accuracy": 0.7413171753287315, + "num_tokens": 1345646.0, "step": 36 }, { - "entropy": 0.5960649400949478, - "epoch": 1.1935483870967742, - "grad_norm": 0.04742363467812538, + "entropy": 0.6314259544014931, + "epoch": 0.28765792031098153, + "grad_norm": 0.016146596521139145, "learning_rate": 0.0002, - "loss": 0.5952359437942505, - "mean_token_accuracy": 0.7638276815414429, - "num_tokens": 2912297.0, + "loss": 0.6370364427566528, + "mean_token_accuracy": 0.7465247958898544, + "num_tokens": 1382928.0, "step": 37 }, { - "entropy": 0.588940218091011, - "epoch": 1.2258064516129032, - "grad_norm": 0.04095599055290222, + "entropy": 0.6270746886730194, + "epoch": 0.2954324586977648, + "grad_norm": 0.019162772223353386, "learning_rate": 0.0002, - "loss": 0.5888320207595825, - "mean_token_accuracy": 0.7661104947328568, - "num_tokens": 2989829.0, + "loss": 0.6330348253250122, + "mean_token_accuracy": 0.747043713927269, + "num_tokens": 1420089.0, "step": 38 }, { - "entropy": 0.5950354784727097, - "epoch": 1.2580645161290323, - "grad_norm": 0.041268933564424515, + "entropy": 0.6293222159147263, + "epoch": 0.3032069970845481, + "grad_norm": 0.01702946238219738, "learning_rate": 0.0002, - "loss": 0.5957392454147339, - "mean_token_accuracy": 0.762763723731041, - "num_tokens": 3067135.0, + "loss": 0.6317635178565979, + "mean_token_accuracy": 0.7488930821418762, + "num_tokens": 1457216.0, "step": 39 }, { - "entropy": 0.5728808343410492, - "epoch": 1.2903225806451613, - "grad_norm": 0.030816541984677315, + "entropy": 0.6111311987042427, + "epoch": 0.3109815354713314, + "grad_norm": 0.015137894079089165, "learning_rate": 0.0002, - "loss": 0.5696955919265747, - "mean_token_accuracy": 0.7730816453695297, - "num_tokens": 3147099.0, + "loss": 0.6177330017089844, + "mean_token_accuracy": 0.753462478518486, + "num_tokens": 1494415.0, "step": 40 }, { - "entropy": 0.5765672028064728, - "epoch": 1.3225806451612903, - "grad_norm": 0.04333742335438728, + "entropy": 0.6119553595781326, + "epoch": 0.31875607385811466, + "grad_norm": 0.014271042309701443, "learning_rate": 0.0002, - "loss": 0.577884316444397, - "mean_token_accuracy": 0.7716145664453506, - "num_tokens": 3225549.0, + "loss": 0.6184912919998169, + "mean_token_accuracy": 0.7530097812414169, + "num_tokens": 1531665.0, "step": 41 }, { - "entropy": 0.573496475815773, - "epoch": 1.3548387096774195, - "grad_norm": 0.03675653412938118, + "entropy": 0.627587340772152, + "epoch": 0.32653061224489793, + "grad_norm": 0.01676957495510578, "learning_rate": 0.0002, - "loss": 0.5731475949287415, - "mean_token_accuracy": 0.7725466936826706, - "num_tokens": 3302551.0, + "loss": 0.628797173500061, + "mean_token_accuracy": 0.7489041686058044, + "num_tokens": 1568905.0, "step": 42 }, { - "entropy": 0.5770469456911087, - "epoch": 1.3870967741935485, - "grad_norm": 0.0320008248090744, + "entropy": 0.6380143910646439, + "epoch": 0.33430515063168126, + "grad_norm": 0.013997296802699566, "learning_rate": 0.0002, - "loss": 0.5700103044509888, - "mean_token_accuracy": 0.7736899256706238, - "num_tokens": 3381541.0, + "loss": 0.6401110291481018, + "mean_token_accuracy": 0.7437692731618881, + "num_tokens": 1606022.0, "step": 43 }, { - "entropy": 0.5819686949253082, - "epoch": 1.4193548387096775, - "grad_norm": 0.03123253397643566, + "entropy": 0.6236186027526855, + "epoch": 0.34207968901846453, + "grad_norm": 0.013737027533352375, "learning_rate": 0.0002, - "loss": 0.5789672136306763, - "mean_token_accuracy": 0.7693924754858017, - "num_tokens": 3460837.0, + "loss": 0.622249960899353, + "mean_token_accuracy": 0.7506565973162651, + "num_tokens": 1643817.0, "step": 44 }, { - "entropy": 0.580963209271431, - "epoch": 1.4516129032258065, - "grad_norm": 0.04066276177763939, + "entropy": 0.6351634711027145, + "epoch": 0.3498542274052478, + "grad_norm": 0.013750840909779072, "learning_rate": 0.0002, - "loss": 0.5793372988700867, - "mean_token_accuracy": 0.7687239795923233, - "num_tokens": 3538644.0, + "loss": 0.6342694163322449, + "mean_token_accuracy": 0.7469271644949913, + "num_tokens": 1681417.0, "step": 45 }, { - "entropy": 0.5791344493627548, - "epoch": 1.4838709677419355, - "grad_norm": 0.031351737678050995, + "entropy": 0.6226040348410606, + "epoch": 0.3576287657920311, + "grad_norm": 0.015259931795299053, "learning_rate": 0.0002, - "loss": 0.5801466107368469, - "mean_token_accuracy": 0.7692239880561829, - "num_tokens": 3616245.0, + "loss": 0.6237019896507263, + "mean_token_accuracy": 0.7505070269107819, + "num_tokens": 1718574.0, "step": 46 }, { - "entropy": 0.5724106431007385, - "epoch": 1.5161290322580645, - "grad_norm": 0.033206913620233536, + "entropy": 0.6210184469819069, + "epoch": 0.3654033041788144, + "grad_norm": 0.013225192204117775, "learning_rate": 0.0002, - "loss": 0.5713744163513184, - "mean_token_accuracy": 0.7738502323627472, - "num_tokens": 3695574.0, + "loss": 0.6187986135482788, + "mean_token_accuracy": 0.7520730867981911, + "num_tokens": 1756095.0, "step": 47 }, { - "entropy": 0.5739834606647491, - "epoch": 1.5483870967741935, - "grad_norm": 0.03075285442173481, + "entropy": 0.6205598041415215, + "epoch": 0.37317784256559766, + "grad_norm": 0.012887167744338512, "learning_rate": 0.0002, - "loss": 0.5729138255119324, - "mean_token_accuracy": 0.7724349647760391, - "num_tokens": 3774001.0, + "loss": 0.6181526780128479, + "mean_token_accuracy": 0.7511478438973427, + "num_tokens": 1793392.0, "step": 48 }, { - "entropy": 0.5661155879497528, - "epoch": 1.5806451612903225, - "grad_norm": 0.026813488453626633, + "entropy": 0.629549115896225, + "epoch": 0.38095238095238093, + "grad_norm": 0.013227855786681175, "learning_rate": 0.0002, - "loss": 0.5657498240470886, - "mean_token_accuracy": 0.7752608209848404, - "num_tokens": 3852374.0, + "loss": 0.6304742097854614, + "mean_token_accuracy": 0.7472723796963692, + "num_tokens": 1830606.0, "step": 49 }, { - "entropy": 0.5684164315462112, - "epoch": 1.6129032258064515, - "grad_norm": 0.0284164696931839, + "entropy": 0.6296898201107979, + "epoch": 0.38872691933916426, + "grad_norm": 0.015021155588328838, "learning_rate": 0.0002, - "loss": 0.5668526887893677, - "mean_token_accuracy": 0.774157777428627, - "num_tokens": 3930849.0, + "loss": 0.6288135647773743, + "mean_token_accuracy": 0.7465364933013916, + "num_tokens": 1868232.0, "step": 50 }, { - "entropy": 0.5668631792068481, - "epoch": 1.6451612903225805, - "grad_norm": 0.029652748256921768, + "entropy": 0.6357625275850296, + "epoch": 0.3965014577259475, + "grad_norm": 0.011794226244091988, "learning_rate": 0.0002, - "loss": 0.5632265210151672, - "mean_token_accuracy": 0.7760342657566071, - "num_tokens": 4010738.0, + "loss": 0.6371973156929016, + "mean_token_accuracy": 0.7450965940952301, + "num_tokens": 1905598.0, "step": 51 }, { - "entropy": 0.5639189630746841, - "epoch": 1.6774193548387095, - "grad_norm": 0.02636871486902237, + "entropy": 0.6295278668403625, + "epoch": 0.4042759961127308, + "grad_norm": 0.012368254363536835, "learning_rate": 0.0002, - "loss": 0.56150221824646, - "mean_token_accuracy": 0.7754913568496704, - "num_tokens": 4089609.0, + "loss": 0.6367925405502319, + "mean_token_accuracy": 0.7448450028896332, + "num_tokens": 1942785.0, "step": 52 }, { - "entropy": 0.5659375041723251, - "epoch": 1.7096774193548387, - "grad_norm": 0.030338820070028305, + "entropy": 0.6321664452552795, + "epoch": 0.41205053449951407, + "grad_norm": 0.011660202406346798, "learning_rate": 0.0002, - "loss": 0.5647764205932617, - "mean_token_accuracy": 0.7749795466661453, - "num_tokens": 4169556.0, + "loss": 0.6337926983833313, + "mean_token_accuracy": 0.7433984354138374, + "num_tokens": 1980646.0, "step": 53 }, { - "entropy": 0.5694165378808975, - "epoch": 1.7419354838709677, - "grad_norm": 0.02605626732110977, + "entropy": 0.6304126009345055, + "epoch": 0.4198250728862974, + "grad_norm": 0.012000083923339844, "learning_rate": 0.0002, - "loss": 0.5678636431694031, - "mean_token_accuracy": 0.7740114033222198, - "num_tokens": 4247901.0, + "loss": 0.6315821409225464, + "mean_token_accuracy": 0.7455745488405228, + "num_tokens": 2018148.0, "step": 54 }, { - "entropy": 0.5724839717149734, - "epoch": 1.7741935483870968, - "grad_norm": 0.023751629516482353, + "entropy": 0.6312398687005043, + "epoch": 0.42759961127308066, + "grad_norm": 0.012478172779083252, "learning_rate": 0.0002, - "loss": 0.570723295211792, - "mean_token_accuracy": 0.7715318500995636, - "num_tokens": 4325711.0, + "loss": 0.6293996572494507, + "mean_token_accuracy": 0.7464256510138512, + "num_tokens": 2055123.0, "step": 55 }, { - "entropy": 0.5751885026693344, - "epoch": 1.8064516129032258, - "grad_norm": 0.029801664873957634, + "entropy": 0.6144075095653534, + "epoch": 0.43537414965986393, + "grad_norm": 0.010203132405877113, "learning_rate": 0.0002, - "loss": 0.5713039636611938, - "mean_token_accuracy": 0.7714657932519913, - "num_tokens": 4404074.0, + "loss": 0.6101412773132324, + "mean_token_accuracy": 0.7551510035991669, + "num_tokens": 2092759.0, "step": 56 }, { - "entropy": 0.5683879405260086, - "epoch": 1.838709677419355, - "grad_norm": 0.024153606966137886, + "entropy": 0.6334135234355927, + "epoch": 0.44314868804664725, + "grad_norm": 0.012491037137806416, "learning_rate": 0.0002, - "loss": 0.5647911429405212, - "mean_token_accuracy": 0.7757914811372757, - "num_tokens": 4484176.0, + "loss": 0.6366456747055054, + "mean_token_accuracy": 0.7441563606262207, + "num_tokens": 2130468.0, "step": 57 }, { - "entropy": 0.5598143339157104, - "epoch": 1.870967741935484, - "grad_norm": 0.02074209600687027, + "entropy": 0.6204067915678024, + "epoch": 0.4509232264334305, + "grad_norm": 0.012662500143051147, "learning_rate": 0.0002, - "loss": 0.5574623942375183, - "mean_token_accuracy": 0.7780470103025436, - "num_tokens": 4563496.0, + "loss": 0.6225067377090454, + "mean_token_accuracy": 0.7498065009713173, + "num_tokens": 2167896.0, "step": 58 }, { - "entropy": 0.5672164112329483, - "epoch": 1.903225806451613, - "grad_norm": 0.024077970534563065, + "entropy": 0.626205176115036, + "epoch": 0.4586977648202138, + "grad_norm": 0.011919913813471794, "learning_rate": 0.0002, - "loss": 0.5635547041893005, - "mean_token_accuracy": 0.7746394872665405, - "num_tokens": 4642865.0, + "loss": 0.6297718286514282, + "mean_token_accuracy": 0.7457590103149414, + "num_tokens": 2204991.0, "step": 59 }, { - "entropy": 0.5679460912942886, - "epoch": 1.935483870967742, - "grad_norm": 0.02324177511036396, + "entropy": 0.6314920708537102, + "epoch": 0.46647230320699706, + "grad_norm": 0.011844294145703316, "learning_rate": 0.0002, - "loss": 0.5665385723114014, - "mean_token_accuracy": 0.7735758572816849, - "num_tokens": 4720857.0, + "loss": 0.6283063888549805, + "mean_token_accuracy": 0.7473507225513458, + "num_tokens": 2242421.0, "step": 60 }, { - "entropy": 0.5664634257555008, - "epoch": 1.967741935483871, - "grad_norm": 0.020476961508393288, + "entropy": 0.629265584051609, + "epoch": 0.4742468415937804, + "grad_norm": 0.012998970225453377, "learning_rate": 0.0002, - "loss": 0.5626745820045471, - "mean_token_accuracy": 0.7753059267997742, - "num_tokens": 4799418.0, + "loss": 0.6303939819335938, + "mean_token_accuracy": 0.7454146966338158, + "num_tokens": 2279756.0, "step": 61 }, { - "entropy": 0.5632900893688202, - "epoch": 2.0, - "grad_norm": 0.022128164768218994, + "entropy": 0.6266416981816292, + "epoch": 0.48202137998056366, + "grad_norm": 0.010719172656536102, "learning_rate": 0.0002, - "loss": 0.5620392560958862, - "mean_token_accuracy": 0.7761431336402893, - "num_tokens": 4877822.0, + "loss": 0.6256165504455566, + "mean_token_accuracy": 0.7477178424596786, + "num_tokens": 2317119.0, "step": 62 }, { - "entropy": 0.5647830814123154, - "epoch": 2.032258064516129, - "grad_norm": 0.022481486201286316, + "entropy": 0.6031938791275024, + "epoch": 0.4897959183673469, + "grad_norm": 0.011259288527071476, "learning_rate": 0.0002, - "loss": 0.5607410669326782, - "mean_token_accuracy": 0.775324359536171, - "num_tokens": 4956332.0, + "loss": 0.5979391932487488, + "mean_token_accuracy": 0.7593775168061256, + "num_tokens": 2354598.0, "step": 63 }, { - "entropy": 0.5720101296901703, - "epoch": 2.064516129032258, - "grad_norm": 0.019787590950727463, + "entropy": 0.6359111741185188, + "epoch": 0.4975704567541302, + "grad_norm": 0.01182929240167141, "learning_rate": 0.0002, - "loss": 0.5699939131736755, - "mean_token_accuracy": 0.7723715603351593, - "num_tokens": 5034188.0, + "loss": 0.6360020041465759, + "mean_token_accuracy": 0.7429406046867371, + "num_tokens": 2391824.0, "step": 64 }, { - "entropy": 0.550421878695488, - "epoch": 2.096774193548387, - "grad_norm": 0.020370641723275185, + "entropy": 0.6270973086357117, + "epoch": 0.5053449951409135, + "grad_norm": 0.01080579124391079, "learning_rate": 0.0002, - "loss": 0.5468724966049194, - "mean_token_accuracy": 0.7817957699298859, - "num_tokens": 5114558.0, + "loss": 0.6288405060768127, + "mean_token_accuracy": 0.7458023801445961, + "num_tokens": 2428949.0, "step": 65 }, { - "entropy": 0.5751384943723679, - "epoch": 2.129032258064516, - "grad_norm": 0.023148294538259506, + "entropy": 0.6371860653162003, + "epoch": 0.5131195335276968, + "grad_norm": 0.012401307933032513, "learning_rate": 0.0002, - "loss": 0.574794590473175, - "mean_token_accuracy": 0.7702242583036423, - "num_tokens": 5192598.0, + "loss": 0.6441806554794312, + "mean_token_accuracy": 0.7399793341755867, + "num_tokens": 2466079.0, "step": 66 }, { - "entropy": 0.5702789425849915, - "epoch": 2.161290322580645, - "grad_norm": 0.02145976386964321, + "entropy": 0.6057624816894531, + "epoch": 0.5208940719144801, + "grad_norm": 0.012216067872941494, "learning_rate": 0.0002, - "loss": 0.5721745491027832, - "mean_token_accuracy": 0.7724328637123108, - "num_tokens": 5272044.0, + "loss": 0.6104533672332764, + "mean_token_accuracy": 0.754143625497818, + "num_tokens": 2503686.0, "step": 67 }, { - "entropy": 0.5614835023880005, - "epoch": 2.193548387096774, - "grad_norm": 0.02582446113228798, + "entropy": 0.6143222749233246, + "epoch": 0.5286686103012633, + "grad_norm": 0.010598300956189632, "learning_rate": 0.0002, - "loss": 0.56424880027771, - "mean_token_accuracy": 0.7733140736818314, - "num_tokens": 5350931.0, + "loss": 0.617759108543396, + "mean_token_accuracy": 0.7507391050457954, + "num_tokens": 2541428.0, "step": 68 }, { - "entropy": 0.5537518709897995, - "epoch": 2.225806451612903, - "grad_norm": 0.020391393452882767, + "entropy": 0.6160529032349586, + "epoch": 0.5364431486880467, + "grad_norm": 0.010992376133799553, "learning_rate": 0.0002, - "loss": 0.5535145401954651, - "mean_token_accuracy": 0.779021218419075, - "num_tokens": 5429751.0, + "loss": 0.6156395673751831, + "mean_token_accuracy": 0.7503774240612984, + "num_tokens": 2578762.0, "step": 69 }, { - "entropy": 0.5642409324645996, - "epoch": 2.258064516129032, - "grad_norm": 0.023080818355083466, + "entropy": 0.6199713721871376, + "epoch": 0.54421768707483, + "grad_norm": 0.01134777907282114, "learning_rate": 0.0002, - "loss": 0.5602237582206726, - "mean_token_accuracy": 0.7764452248811722, - "num_tokens": 5508522.0, + "loss": 0.6140978932380676, + "mean_token_accuracy": 0.7530878558754921, + "num_tokens": 2616254.0, "step": 70 }, { - "entropy": 0.5553158819675446, - "epoch": 2.2903225806451615, - "grad_norm": 0.027256183326244354, + "entropy": 0.6425308436155319, + "epoch": 0.5519922254616132, + "grad_norm": 0.011413667351007462, "learning_rate": 0.0002, - "loss": 0.5490841269493103, - "mean_token_accuracy": 0.7800116837024689, - "num_tokens": 5587349.0, + "loss": 0.63960862159729, + "mean_token_accuracy": 0.7409021556377411, + "num_tokens": 2653615.0, "step": 71 }, { - "entropy": 0.5612549781799316, - "epoch": 2.3225806451612905, - "grad_norm": 0.019826354458928108, + "entropy": 0.6269439905881882, + "epoch": 0.5597667638483965, + "grad_norm": 0.011452693492174149, "learning_rate": 0.0002, - "loss": 0.5554416179656982, - "mean_token_accuracy": 0.7773576229810715, - "num_tokens": 5665374.0, + "loss": 0.6268940567970276, + "mean_token_accuracy": 0.7482407689094543, + "num_tokens": 2691144.0, "step": 72 }, { - "entropy": 0.5597121864557266, - "epoch": 2.3548387096774195, - "grad_norm": 0.021395916119217873, + "entropy": 0.6223431453108788, + "epoch": 0.5675413022351797, + "grad_norm": 0.011051226407289505, "learning_rate": 0.0002, - "loss": 0.5550926923751831, - "mean_token_accuracy": 0.7764492034912109, - "num_tokens": 5742628.0, + "loss": 0.627192497253418, + "mean_token_accuracy": 0.7496485412120819, + "num_tokens": 2728868.0, "step": 73 }, { - "entropy": 0.5639219135046005, - "epoch": 2.3870967741935485, - "grad_norm": 0.021380137652158737, + "entropy": 0.6142039522528648, + "epoch": 0.5753158406219631, + "grad_norm": 0.010462508536875248, "learning_rate": 0.0002, - "loss": 0.5646259784698486, - "mean_token_accuracy": 0.7729929685592651, - "num_tokens": 5823005.0, + "loss": 0.6176329851150513, + "mean_token_accuracy": 0.7508676871657372, + "num_tokens": 2766300.0, "step": 74 }, { - "entropy": 0.5548926442861557, - "epoch": 2.4193548387096775, - "grad_norm": 0.02109702117741108, + "entropy": 0.6121213287115097, + "epoch": 0.5830903790087464, + "grad_norm": 0.01290794089436531, "learning_rate": 0.0002, - "loss": 0.5567398071289062, - "mean_token_accuracy": 0.7773918360471725, - "num_tokens": 5901142.0, + "loss": 0.6207513809204102, + "mean_token_accuracy": 0.7499961778521538, + "num_tokens": 2803656.0, "step": 75 }, { - "entropy": 0.5468960106372833, - "epoch": 2.4516129032258065, - "grad_norm": 0.020396072417497635, + "entropy": 0.6135914027690887, + "epoch": 0.5908649173955296, + "grad_norm": 0.009645558893680573, "learning_rate": 0.0002, - "loss": 0.55022794008255, - "mean_token_accuracy": 0.7789339423179626, - "num_tokens": 5980524.0, + "loss": 0.6158081293106079, + "mean_token_accuracy": 0.7523107752203941, + "num_tokens": 2841367.0, "step": 76 }, { - "entropy": 0.5607923120260239, - "epoch": 2.4838709677419355, - "grad_norm": 0.023684872314333916, + "entropy": 0.6079287081956863, + "epoch": 0.5986394557823129, + "grad_norm": 0.010133286938071251, "learning_rate": 0.0002, - "loss": 0.5640513896942139, - "mean_token_accuracy": 0.7740097939968109, - "num_tokens": 6058950.0, + "loss": 0.6089348196983337, + "mean_token_accuracy": 0.7539728805422783, + "num_tokens": 2878743.0, "step": 77 }, { - "entropy": 0.5643693804740906, - "epoch": 2.5161290322580645, - "grad_norm": 0.01775151677429676, + "entropy": 0.619053803384304, + "epoch": 0.6064139941690962, + "grad_norm": 0.011026635766029358, "learning_rate": 0.0002, - "loss": 0.5636025071144104, - "mean_token_accuracy": 0.7733512371778488, - "num_tokens": 6137977.0, + "loss": 0.6179240942001343, + "mean_token_accuracy": 0.752836562693119, + "num_tokens": 2916083.0, "step": 78 }, { - "entropy": 0.5629870891571045, - "epoch": 2.5483870967741935, - "grad_norm": 0.020683595910668373, + "entropy": 0.6179199442267418, + "epoch": 0.6141885325558795, + "grad_norm": 0.009910841472446918, "learning_rate": 0.0002, - "loss": 0.5582836866378784, - "mean_token_accuracy": 0.7763189226388931, - "num_tokens": 6216345.0, + "loss": 0.6233879923820496, + "mean_token_accuracy": 0.7482481822371483, + "num_tokens": 2953599.0, "step": 79 }, { - "entropy": 0.5666602998971939, - "epoch": 2.5806451612903225, - "grad_norm": 0.019191065803170204, + "entropy": 0.6186161413788795, + "epoch": 0.6219630709426628, + "grad_norm": 0.00901505071669817, "learning_rate": 0.0002, - "loss": 0.5626470446586609, - "mean_token_accuracy": 0.7741801738739014, - "num_tokens": 6294649.0, + "loss": 0.6190614700317383, + "mean_token_accuracy": 0.7501069083809853, + "num_tokens": 2990903.0, "step": 80 }, { - "entropy": 0.5715147405862808, - "epoch": 2.6129032258064515, - "grad_norm": 0.019432390108704567, + "entropy": 0.6112105250358582, + "epoch": 0.6297376093294461, + "grad_norm": 0.011348889209330082, "learning_rate": 0.0002, - "loss": 0.5688481330871582, - "mean_token_accuracy": 0.773037850856781, - "num_tokens": 6373316.0, + "loss": 0.6137362718582153, + "mean_token_accuracy": 0.7515707835555077, + "num_tokens": 3028013.0, "step": 81 }, { - "entropy": 0.5707144886255264, - "epoch": 2.6451612903225805, - "grad_norm": 0.023160185664892197, + "entropy": 0.631052277982235, + "epoch": 0.6375121477162293, + "grad_norm": 0.012229959480464458, "learning_rate": 0.0002, - "loss": 0.5679908990859985, - "mean_token_accuracy": 0.7726998925209045, - "num_tokens": 6451529.0, + "loss": 0.6278471946716309, + "mean_token_accuracy": 0.7475830912590027, + "num_tokens": 3065444.0, "step": 82 }, { - "entropy": 0.5647523552179337, - "epoch": 2.6774193548387095, - "grad_norm": 0.022113436833024025, + "entropy": 0.6256950199604034, + "epoch": 0.6452866861030127, + "grad_norm": 0.009951086714863777, "learning_rate": 0.0002, - "loss": 0.5626997351646423, - "mean_token_accuracy": 0.7755681276321411, - "num_tokens": 6530936.0, + "loss": 0.6218305826187134, + "mean_token_accuracy": 0.7465297132730484, + "num_tokens": 3102683.0, "step": 83 }, { - "entropy": 0.5687842816114426, - "epoch": 2.709677419354839, - "grad_norm": 0.023050479590892792, + "entropy": 0.6196548789739609, + "epoch": 0.6530612244897959, + "grad_norm": 0.010236121714115143, "learning_rate": 0.0002, - "loss": 0.5685533881187439, - "mean_token_accuracy": 0.7720850706100464, - "num_tokens": 6609190.0, + "loss": 0.6180955767631531, + "mean_token_accuracy": 0.7518158033490181, + "num_tokens": 3140271.0, "step": 84 }, { - "entropy": 0.5653624683618546, - "epoch": 2.741935483870968, - "grad_norm": 0.020719164982438087, + "entropy": 0.6243495345115662, + "epoch": 0.6608357628765792, + "grad_norm": 0.011498089879751205, "learning_rate": 0.0002, - "loss": 0.5654714703559875, - "mean_token_accuracy": 0.7718778252601624, - "num_tokens": 6687358.0, + "loss": 0.6245218515396118, + "mean_token_accuracy": 0.7478918880224228, + "num_tokens": 3177703.0, "step": 85 }, { - "entropy": 0.557345911860466, - "epoch": 2.774193548387097, - "grad_norm": 0.02426682785153389, + "entropy": 0.619852252304554, + "epoch": 0.6686103012633625, + "grad_norm": 0.009944644756615162, "learning_rate": 0.0002, - "loss": 0.5572041869163513, - "mean_token_accuracy": 0.7766713351011276, - "num_tokens": 6765326.0, + "loss": 0.6247724294662476, + "mean_token_accuracy": 0.7476306930184364, + "num_tokens": 3215349.0, "step": 86 }, { - "entropy": 0.5582546591758728, - "epoch": 2.806451612903226, - "grad_norm": 0.020220208913087845, + "entropy": 0.6298213005065918, + "epoch": 0.6763848396501457, + "grad_norm": 0.009104517288506031, "learning_rate": 0.0002, - "loss": 0.5565258264541626, - "mean_token_accuracy": 0.7767817080020905, - "num_tokens": 6843956.0, + "loss": 0.6307124495506287, + "mean_token_accuracy": 0.7444773614406586, + "num_tokens": 3252965.0, "step": 87 }, { - "entropy": 0.5673591643571854, - "epoch": 2.838709677419355, - "grad_norm": 0.020146643742918968, + "entropy": 0.617066778242588, + "epoch": 0.6841593780369291, + "grad_norm": 0.009981841780245304, "learning_rate": 0.0002, - "loss": 0.5709323883056641, - "mean_token_accuracy": 0.7711061388254166, - "num_tokens": 6921812.0, + "loss": 0.6200389862060547, + "mean_token_accuracy": 0.7506762072443962, + "num_tokens": 3290319.0, "step": 88 }, { - "entropy": 0.556847408413887, - "epoch": 2.870967741935484, - "grad_norm": 0.01990182138979435, + "entropy": 0.6173762008547783, + "epoch": 0.6919339164237124, + "grad_norm": 0.010542662814259529, "learning_rate": 0.0002, - "loss": 0.5572229027748108, - "mean_token_accuracy": 0.7751472145318985, - "num_tokens": 7000840.0, + "loss": 0.6204540729522705, + "mean_token_accuracy": 0.7490114718675613, + "num_tokens": 3328270.0, "step": 89 }, { - "entropy": 0.563188761472702, - "epoch": 2.903225806451613, - "grad_norm": 0.02342582680284977, + "entropy": 0.6311885267496109, + "epoch": 0.6997084548104956, + "grad_norm": 0.009542804211378098, "learning_rate": 0.0002, - "loss": 0.5629247426986694, - "mean_token_accuracy": 0.7743992209434509, - "num_tokens": 7080445.0, + "loss": 0.630376935005188, + "mean_token_accuracy": 0.7458378821611404, + "num_tokens": 3365973.0, "step": 90 }, { - "entropy": 0.5722239166498184, - "epoch": 2.935483870967742, - "grad_norm": 0.019702041521668434, + "entropy": 0.6197073757648468, + "epoch": 0.7074829931972789, + "grad_norm": 0.009216145612299442, "learning_rate": 0.0002, - "loss": 0.5663557052612305, - "mean_token_accuracy": 0.7710109949111938, - "num_tokens": 7158666.0, + "loss": 0.6229982376098633, + "mean_token_accuracy": 0.7472847774624825, + "num_tokens": 3403209.0, "step": 91 }, { - "entropy": 0.5657145082950592, - "epoch": 2.967741935483871, - "grad_norm": 0.02240707166492939, + "entropy": 0.6161768138408661, + "epoch": 0.7152575315840622, + "grad_norm": 0.0102296257391572, "learning_rate": 0.0002, - "loss": 0.5609397888183594, - "mean_token_accuracy": 0.7747763097286224, - "num_tokens": 7238514.0, + "loss": 0.6171408891677856, + "mean_token_accuracy": 0.7507107704877853, + "num_tokens": 3440047.0, "step": 92 }, { - "entropy": 0.5848636776208878, - "epoch": 3.0, - "grad_norm": 0.023333914577960968, + "entropy": 0.6355379894375801, + "epoch": 0.7230320699708455, + "grad_norm": 0.011433378793299198, "learning_rate": 0.0002, - "loss": 0.5794190168380737, - "mean_token_accuracy": 0.7670062482357025, - "num_tokens": 7316444.0, + "loss": 0.6368508338928223, + "mean_token_accuracy": 0.7425181716680527, + "num_tokens": 3477583.0, "step": 93 }, { - "entropy": 0.5561475306749344, - "epoch": 3.032258064516129, - "grad_norm": 0.022262820973992348, + "entropy": 0.6173990294337273, + "epoch": 0.7308066083576288, + "grad_norm": 0.009371397085487843, "learning_rate": 0.0002, - "loss": 0.5519885420799255, - "mean_token_accuracy": 0.7779376059770584, - "num_tokens": 7394992.0, + "loss": 0.6161597371101379, + "mean_token_accuracy": 0.752352699637413, + "num_tokens": 3515443.0, "step": 94 }, { - "entropy": 0.5668191462755203, - "epoch": 3.064516129032258, - "grad_norm": 0.025911103934049606, + "entropy": 0.6139659285545349, + "epoch": 0.738581146744412, + "grad_norm": 0.00992497242987156, "learning_rate": 0.0002, - "loss": 0.5712538957595825, - "mean_token_accuracy": 0.770626112818718, - "num_tokens": 7472729.0, + "loss": 0.6122086644172668, + "mean_token_accuracy": 0.7519859671592712, + "num_tokens": 3552895.0, "step": 95 }, { - "entropy": 0.547975942492485, - "epoch": 3.096774193548387, - "grad_norm": 0.023955151438713074, + "entropy": 0.6270382553339005, + "epoch": 0.7463556851311953, + "grad_norm": 0.009038747288286686, "learning_rate": 0.0002, - "loss": 0.5533621311187744, - "mean_token_accuracy": 0.778180256485939, - "num_tokens": 7552213.0, + "loss": 0.6263892650604248, + "mean_token_accuracy": 0.7476321458816528, + "num_tokens": 3590558.0, "step": 96 }, { - "entropy": 0.5508177727460861, - "epoch": 3.129032258064516, - "grad_norm": 0.020201170817017555, + "entropy": 0.6252292916178703, + "epoch": 0.7541302235179786, + "grad_norm": 0.008724549785256386, "learning_rate": 0.0002, - "loss": 0.5523043870925903, - "mean_token_accuracy": 0.7791523486375809, - "num_tokens": 7631359.0, + "loss": 0.6235740184783936, + "mean_token_accuracy": 0.7499061301350594, + "num_tokens": 3628009.0, "step": 97 }, { - "entropy": 0.5587449967861176, - "epoch": 3.161290322580645, - "grad_norm": 0.022456398233771324, + "entropy": 0.6164776980876923, + "epoch": 0.7619047619047619, + "grad_norm": 0.009640969336032867, "learning_rate": 0.0002, - "loss": 0.5554713606834412, - "mean_token_accuracy": 0.7772288173437119, - "num_tokens": 7711191.0, + "loss": 0.6190721988677979, + "mean_token_accuracy": 0.7499102726578712, + "num_tokens": 3665592.0, "step": 98 }, { - "entropy": 0.5667514055967331, - "epoch": 3.193548387096774, - "grad_norm": 0.02376161515712738, + "entropy": 0.6058400347828865, + "epoch": 0.7696793002915452, + "grad_norm": 0.010068013332784176, "learning_rate": 0.0002, - "loss": 0.560375988483429, - "mean_token_accuracy": 0.7743281573057175, - "num_tokens": 7789741.0, + "loss": 0.6085440516471863, + "mean_token_accuracy": 0.7550365477800369, + "num_tokens": 3702702.0, "step": 99 }, { - "entropy": 0.5590975731611252, - "epoch": 3.225806451612903, - "grad_norm": 0.02175886370241642, + "entropy": 0.6062669232487679, + "epoch": 0.7774538386783285, + "grad_norm": 0.009750640951097012, "learning_rate": 0.0002, - "loss": 0.5548145771026611, - "mean_token_accuracy": 0.7771512418985367, - "num_tokens": 7867872.0, + "loss": 0.6106675267219543, + "mean_token_accuracy": 0.753579393029213, + "num_tokens": 3739974.0, "step": 100 }, { - "entropy": 0.5560945719480515, - "epoch": 3.258064516129032, - "grad_norm": 0.021177250891923904, + "entropy": 0.6228908747434616, + "epoch": 0.7852283770651117, + "grad_norm": 0.010727898217737675, "learning_rate": 0.0002, - "loss": 0.5567014217376709, - "mean_token_accuracy": 0.7768864035606384, - "num_tokens": 7946723.0, + "loss": 0.6273207664489746, + "mean_token_accuracy": 0.7462224960327148, + "num_tokens": 3777563.0, "step": 101 }, { - "entropy": 0.5489799231290817, - "epoch": 3.2903225806451615, - "grad_norm": 0.02086879126727581, + "entropy": 0.623473547399044, + "epoch": 0.793002915451895, + "grad_norm": 0.00916969496756792, "learning_rate": 0.0002, - "loss": 0.5482127070426941, - "mean_token_accuracy": 0.7793612778186798, - "num_tokens": 8025383.0, + "loss": 0.6267216205596924, + "mean_token_accuracy": 0.7489331811666489, + "num_tokens": 3815209.0, "step": 102 }, { - "entropy": 0.5634010285139084, - "epoch": 3.3225806451612905, - "grad_norm": 0.024660678580403328, + "entropy": 0.6183424741029739, + "epoch": 0.8007774538386784, + "grad_norm": 0.009042995050549507, "learning_rate": 0.0002, - "loss": 0.5666055083274841, - "mean_token_accuracy": 0.7726119607686996, - "num_tokens": 8103693.0, + "loss": 0.6215161681175232, + "mean_token_accuracy": 0.7501572594046593, + "num_tokens": 3853109.0, "step": 103 }, { - "entropy": 0.5655943602323532, - "epoch": 3.3548387096774195, - "grad_norm": 0.020694825798273087, + "entropy": 0.6086031794548035, + "epoch": 0.8085519922254616, + "grad_norm": 0.010368067771196365, "learning_rate": 0.0002, - "loss": 0.5662607550621033, - "mean_token_accuracy": 0.7717288136482239, - "num_tokens": 8180427.0, + "loss": 0.6092633008956909, + "mean_token_accuracy": 0.7548685073852539, + "num_tokens": 3890248.0, "step": 104 }, { - "entropy": 0.5499924272298813, - "epoch": 3.3870967741935485, - "grad_norm": 0.02108810283243656, + "entropy": 0.6166428253054619, + "epoch": 0.8163265306122449, + "grad_norm": 0.009941854514181614, "learning_rate": 0.0002, - "loss": 0.5465772151947021, - "mean_token_accuracy": 0.7803959846496582, - "num_tokens": 8260871.0, + "loss": 0.6201497316360474, + "mean_token_accuracy": 0.746953047811985, + "num_tokens": 3927797.0, "step": 105 }, { - "entropy": 0.557305708527565, - "epoch": 3.4193548387096775, - "grad_norm": 0.023198287934064865, + "entropy": 0.6270147785544395, + "epoch": 0.8241010689990281, + "grad_norm": 0.0085823442786932, "learning_rate": 0.0002, - "loss": 0.5546095371246338, - "mean_token_accuracy": 0.7774775624275208, - "num_tokens": 8339637.0, + "loss": 0.6264973878860474, + "mean_token_accuracy": 0.746023453772068, + "num_tokens": 3965467.0, "step": 106 }, { - "entropy": 0.5631329417228699, - "epoch": 3.4516129032258065, - "grad_norm": 0.025266552343964577, + "entropy": 0.6165590658783913, + "epoch": 0.8318756073858115, + "grad_norm": 0.009966393932700157, "learning_rate": 0.0002, - "loss": 0.5597484707832336, - "mean_token_accuracy": 0.7742401659488678, - "num_tokens": 8418700.0, + "loss": 0.6136085987091064, + "mean_token_accuracy": 0.7522286921739578, + "num_tokens": 4002647.0, "step": 107 }, { - "entropy": 0.5628319978713989, - "epoch": 3.4838709677419355, - "grad_norm": 0.02215176448225975, + "entropy": 0.6224516704678535, + "epoch": 0.8396501457725948, + "grad_norm": 0.01067335158586502, "learning_rate": 0.0002, - "loss": 0.5613549947738647, - "mean_token_accuracy": 0.7735034227371216, - "num_tokens": 8498009.0, + "loss": 0.6225627660751343, + "mean_token_accuracy": 0.7488038167357445, + "num_tokens": 4039990.0, "step": 108 }, { - "entropy": 0.55545274913311, - "epoch": 3.5161290322580645, - "grad_norm": 0.02309485711157322, + "entropy": 0.6210483014583588, + "epoch": 0.847424684159378, + "grad_norm": 0.010811593383550644, "learning_rate": 0.0002, - "loss": 0.5577254295349121, - "mean_token_accuracy": 0.7765019983053207, - "num_tokens": 8575886.0, + "loss": 0.6203762292861938, + "mean_token_accuracy": 0.7501420751214027, + "num_tokens": 4077461.0, "step": 109 }, { - "entropy": 0.5634028613567352, - "epoch": 3.5483870967741935, - "grad_norm": 0.025781216099858284, + "entropy": 0.6205326095223427, + "epoch": 0.8551992225461613, + "grad_norm": 0.009125830605626106, "learning_rate": 0.0002, - "loss": 0.566740870475769, - "mean_token_accuracy": 0.7714875340461731, - "num_tokens": 8654161.0, + "loss": 0.623924732208252, + "mean_token_accuracy": 0.7463032528758049, + "num_tokens": 4115100.0, "step": 110 }, { - "entropy": 0.5486367046833038, - "epoch": 3.5806451612903225, - "grad_norm": 0.024618223309516907, + "entropy": 0.6294923424720764, + "epoch": 0.8629737609329446, + "grad_norm": 0.008677372708916664, "learning_rate": 0.0002, - "loss": 0.5475247502326965, - "mean_token_accuracy": 0.7789197564125061, - "num_tokens": 8733226.0, + "loss": 0.6358845233917236, + "mean_token_accuracy": 0.7433422952890396, + "num_tokens": 4152751.0, "step": 111 }, { - "entropy": 0.5631587356328964, - "epoch": 3.6129032258064515, - "grad_norm": 0.024299612268805504, + "entropy": 0.615186795592308, + "epoch": 0.8707482993197279, + "grad_norm": 0.012182718142867088, "learning_rate": 0.0002, - "loss": 0.5573891401290894, - "mean_token_accuracy": 0.7757365703582764, - "num_tokens": 8810909.0, + "loss": 0.6257232427597046, + "mean_token_accuracy": 0.7469102591276169, + "num_tokens": 4189807.0, "step": 112 }, { - "entropy": 0.5608923137187958, - "epoch": 3.6451612903225805, - "grad_norm": 0.02582414820790291, + "entropy": 0.6161832436919212, + "epoch": 0.8785228377065112, + "grad_norm": 0.009921083226799965, "learning_rate": 0.0002, - "loss": 0.5579054951667786, - "mean_token_accuracy": 0.7754584103822708, - "num_tokens": 8890850.0, + "loss": 0.6149104237556458, + "mean_token_accuracy": 0.7501650750637054, + "num_tokens": 4227148.0, "step": 113 }, { - "entropy": 0.5561199635267258, - "epoch": 3.6774193548387095, - "grad_norm": 0.022211294621229172, + "entropy": 0.6069425120949745, + "epoch": 0.8862973760932945, + "grad_norm": 0.010401617735624313, "learning_rate": 0.0002, - "loss": 0.5566504001617432, - "mean_token_accuracy": 0.7767579257488251, - "num_tokens": 8969877.0, + "loss": 0.6072876453399658, + "mean_token_accuracy": 0.7546068653464317, + "num_tokens": 4264665.0, "step": 114 }, { - "entropy": 0.5588024407625198, - "epoch": 3.709677419354839, - "grad_norm": 0.022309575229883194, + "entropy": 0.6115981489419937, + "epoch": 0.8940719144800777, + "grad_norm": 0.009178240783512592, "learning_rate": 0.0002, - "loss": 0.5632297992706299, - "mean_token_accuracy": 0.7747749090194702, - "num_tokens": 9048037.0, + "loss": 0.6142789125442505, + "mean_token_accuracy": 0.7516015693545341, + "num_tokens": 4301705.0, "step": 115 }, { - "entropy": 0.551807701587677, - "epoch": 3.741935483870968, - "grad_norm": 0.025719881057739258, + "entropy": 0.6232319623231888, + "epoch": 0.901846452866861, + "grad_norm": 0.011550409719347954, "learning_rate": 0.0002, - "loss": 0.5533503293991089, - "mean_token_accuracy": 0.7774915248155594, - "num_tokens": 9126988.0, + "loss": 0.6232004165649414, + "mean_token_accuracy": 0.7479738518595695, + "num_tokens": 4339005.0, "step": 116 }, { - "entropy": 0.5595156997442245, - "epoch": 3.774193548387097, - "grad_norm": 0.024725891649723053, + "entropy": 0.6050816774368286, + "epoch": 0.9096209912536443, + "grad_norm": 0.009149852208793163, "learning_rate": 0.0002, - "loss": 0.555779218673706, - "mean_token_accuracy": 0.7771975845098495, - "num_tokens": 9206269.0, + "loss": 0.6073260307312012, + "mean_token_accuracy": 0.7553000226616859, + "num_tokens": 4376492.0, "step": 117 }, { - "entropy": 0.5715308636426926, - "epoch": 3.806451612903226, - "grad_norm": 0.02310684695839882, + "entropy": 0.6323671862483025, + "epoch": 0.9173955296404276, + "grad_norm": 0.01042769942432642, "learning_rate": 0.0002, - "loss": 0.5639746189117432, - "mean_token_accuracy": 0.772603914141655, - "num_tokens": 9284589.0, + "loss": 0.6354271769523621, + "mean_token_accuracy": 0.742473192512989, + "num_tokens": 4414516.0, "step": 118 }, { - "entropy": 0.5701656937599182, - "epoch": 3.838709677419355, - "grad_norm": 0.024147434160113335, + "entropy": 0.6279568076133728, + "epoch": 0.9251700680272109, + "grad_norm": 0.009754139930009842, "learning_rate": 0.0002, - "loss": 0.5665973424911499, - "mean_token_accuracy": 0.7718524187803268, - "num_tokens": 9362727.0, + "loss": 0.6289409399032593, + "mean_token_accuracy": 0.7444217056035995, + "num_tokens": 4452210.0, "step": 119 }, { - "entropy": 0.567099928855896, - "epoch": 3.870967741935484, - "grad_norm": 0.027005858719348907, + "entropy": 0.6090738251805305, + "epoch": 0.9329446064139941, + "grad_norm": 0.011155272834002972, "learning_rate": 0.0002, - "loss": 0.5683907270431519, - "mean_token_accuracy": 0.7712606638669968, - "num_tokens": 9441192.0, + "loss": 0.61219322681427, + "mean_token_accuracy": 0.7522945404052734, + "num_tokens": 4489567.0, "step": 120 }, { - "entropy": 0.5548799186944962, - "epoch": 3.903225806451613, - "grad_norm": 0.022680699825286865, + "entropy": 0.6002820879220963, + "epoch": 0.9407191448007775, + "grad_norm": 0.009737227112054825, "learning_rate": 0.0002, - "loss": 0.5592993497848511, - "mean_token_accuracy": 0.7751470804214478, - "num_tokens": 9519671.0, + "loss": 0.6018539071083069, + "mean_token_accuracy": 0.757467195391655, + "num_tokens": 4527111.0, "step": 121 }, { - "entropy": 0.5616104304790497, - "epoch": 3.935483870967742, - "grad_norm": 0.02054096944630146, + "entropy": 0.6134138256311417, + "epoch": 0.9484936831875608, + "grad_norm": 0.010466666892170906, "learning_rate": 0.0002, - "loss": 0.5620638132095337, - "mean_token_accuracy": 0.7740459442138672, - "num_tokens": 9597676.0, + "loss": 0.6216229200363159, + "mean_token_accuracy": 0.7486356720328331, + "num_tokens": 4564450.0, "step": 122 }, { - "entropy": 0.5476446449756622, - "epoch": 3.967741935483871, - "grad_norm": 0.020764634013175964, + "entropy": 0.6079460605978966, + "epoch": 0.956268221574344, + "grad_norm": 0.008756682276725769, "learning_rate": 0.0002, - "loss": 0.5447226762771606, - "mean_token_accuracy": 0.781438797712326, - "num_tokens": 9677971.0, + "loss": 0.6086549758911133, + "mean_token_accuracy": 0.7539011463522911, + "num_tokens": 4601781.0, "step": 123 }, { - "entropy": 0.5660000741481781, - "epoch": 4.0, - "grad_norm": 0.021668102592229843, + "entropy": 0.612805612385273, + "epoch": 0.9640427599611273, + "grad_norm": 0.009290359914302826, "learning_rate": 0.0002, - "loss": 0.5623193979263306, - "mean_token_accuracy": 0.7729711085557938, - "num_tokens": 9755431.0, + "loss": 0.6137915849685669, + "mean_token_accuracy": 0.752314880490303, + "num_tokens": 4639256.0, "step": 124 }, { - "entropy": 0.5558377206325531, - "epoch": 4.032258064516129, - "grad_norm": 0.0236333180218935, + "entropy": 0.6211065128445625, + "epoch": 0.9718172983479106, + "grad_norm": 0.010166316293179989, "learning_rate": 0.0002, - "loss": 0.5508249998092651, - "mean_token_accuracy": 0.7782040685415268, - "num_tokens": 9833682.0, + "loss": 0.6211485266685486, + "mean_token_accuracy": 0.7476831749081612, + "num_tokens": 4676689.0, "step": 125 }, { - "entropy": 0.5649599432945251, - "epoch": 4.064516129032258, - "grad_norm": 0.019735056906938553, + "entropy": 0.6219009906053543, + "epoch": 0.9795918367346939, + "grad_norm": 0.009910349734127522, "learning_rate": 0.0002, - "loss": 0.5595760941505432, - "mean_token_accuracy": 0.7747052013874054, - "num_tokens": 9911701.0, + "loss": 0.6177939176559448, + "mean_token_accuracy": 0.7506504207849503, + "num_tokens": 4714123.0, "step": 126 }, { - "entropy": 0.5603556483983994, - "epoch": 4.096774193548387, - "grad_norm": 0.019977176561951637, + "entropy": 0.6336647123098373, + "epoch": 0.9873663751214772, + "grad_norm": 0.00899409968405962, "learning_rate": 0.0002, - "loss": 0.560118556022644, - "mean_token_accuracy": 0.774644523859024, - "num_tokens": 9990441.0, + "loss": 0.6283681392669678, + "mean_token_accuracy": 0.7467537075281143, + "num_tokens": 4751822.0, "step": 127 }, { - "entropy": 0.556746780872345, - "epoch": 4.129032258064516, - "grad_norm": 0.02315964549779892, + "entropy": 0.6106422170996666, + "epoch": 0.9951409135082604, + "grad_norm": 0.009350291453301907, "learning_rate": 0.0002, - "loss": 0.5585101842880249, - "mean_token_accuracy": 0.7743638008832932, - "num_tokens": 10068737.0, + "loss": 0.6105437278747559, + "mean_token_accuracy": 0.7529440075159073, + "num_tokens": 4789003.0, "step": 128 }, { - "entropy": 0.5695119947195053, - "epoch": 4.161290322580645, - "grad_norm": 0.023623613640666008, + "entropy": 0.6007849931716919, + "epoch": 1.0, + "grad_norm": 0.011687238700687885, "learning_rate": 0.0002, - "loss": 0.573641300201416, - "mean_token_accuracy": 0.7688134759664536, - "num_tokens": 10146119.0, + "loss": 0.6050734519958496, + "mean_token_accuracy": 0.7555755734443664, + "num_tokens": 4812561.0, "step": 129 }, { - "entropy": 0.5613479018211365, - "epoch": 4.193548387096774, - "grad_norm": 0.02121862955391407, + "entropy": 0.6145111918449402, + "epoch": 1.0077745383867833, + "grad_norm": 0.00996165256947279, "learning_rate": 0.0002, - "loss": 0.5623332262039185, - "mean_token_accuracy": 0.773470863699913, - "num_tokens": 10223963.0, + "loss": 0.6200628280639648, + "mean_token_accuracy": 0.7501887455582619, + "num_tokens": 4849863.0, "step": 130 }, { - "entropy": 0.5604702234268188, - "epoch": 4.225806451612903, - "grad_norm": 0.020838554948568344, + "entropy": 0.6117109283804893, + "epoch": 1.0155490767735667, + "grad_norm": 0.009831785224378109, "learning_rate": 0.0002, - "loss": 0.5538380146026611, - "mean_token_accuracy": 0.7777739018201828, - "num_tokens": 10303313.0, + "loss": 0.6182730793952942, + "mean_token_accuracy": 0.7466977462172508, + "num_tokens": 4887693.0, "step": 131 }, { - "entropy": 0.5683186054229736, - "epoch": 4.258064516129032, - "grad_norm": 0.02106897532939911, + "entropy": 0.6117515116930008, + "epoch": 1.0233236151603498, + "grad_norm": 0.007678937632590532, "learning_rate": 0.0002, - "loss": 0.5649935603141785, - "mean_token_accuracy": 0.7719052284955978, - "num_tokens": 10381934.0, + "loss": 0.6126781105995178, + "mean_token_accuracy": 0.7521011829376221, + "num_tokens": 4925266.0, "step": 132 }, { - "entropy": 0.5469363033771515, - "epoch": 4.290322580645161, - "grad_norm": 0.0212655458599329, + "entropy": 0.6145991012454033, + "epoch": 1.031098153547133, + "grad_norm": 0.00878220982849598, "learning_rate": 0.0002, - "loss": 0.5432569980621338, - "mean_token_accuracy": 0.7824582010507584, - "num_tokens": 10461631.0, + "loss": 0.6143695116043091, + "mean_token_accuracy": 0.7531941831111908, + "num_tokens": 4962307.0, "step": 133 }, { - "entropy": 0.5437141954898834, - "epoch": 4.32258064516129, - "grad_norm": 0.02336573600769043, + "entropy": 0.6105677559971809, + "epoch": 1.0388726919339164, + "grad_norm": 0.009893382899463177, "learning_rate": 0.0002, - "loss": 0.5471414923667908, - "mean_token_accuracy": 0.7800082862377167, - "num_tokens": 10540427.0, + "loss": 0.6073343753814697, + "mean_token_accuracy": 0.7548379600048065, + "num_tokens": 4999709.0, "step": 134 }, { - "entropy": 0.5527804344892502, - "epoch": 4.354838709677419, - "grad_norm": 0.020969511941075325, + "entropy": 0.6226058155298233, + "epoch": 1.0466472303206997, + "grad_norm": 0.01014266349375248, "learning_rate": 0.0002, - "loss": 0.5548494458198547, - "mean_token_accuracy": 0.7759415507316589, - "num_tokens": 10618610.0, + "loss": 0.6212986707687378, + "mean_token_accuracy": 0.7492796331644058, + "num_tokens": 5036991.0, "step": 135 }, { - "entropy": 0.5538617074489594, - "epoch": 4.387096774193548, - "grad_norm": 0.02194584719836712, + "entropy": 0.6036651879549026, + "epoch": 1.054421768707483, + "grad_norm": 0.008363187313079834, "learning_rate": 0.0002, - "loss": 0.55549556016922, - "mean_token_accuracy": 0.7759937942028046, - "num_tokens": 10696364.0, + "loss": 0.6068825721740723, + "mean_token_accuracy": 0.753925733268261, + "num_tokens": 5074058.0, "step": 136 }, { - "entropy": 0.5536889731884003, - "epoch": 4.419354838709677, - "grad_norm": 0.020031817257404327, + "entropy": 0.6133922636508942, + "epoch": 1.0621963070942664, + "grad_norm": 0.00871324259787798, "learning_rate": 0.0002, - "loss": 0.5526796579360962, - "mean_token_accuracy": 0.7770518809556961, - "num_tokens": 10774927.0, + "loss": 0.6173220276832581, + "mean_token_accuracy": 0.7509826496243477, + "num_tokens": 5111393.0, "step": 137 }, { - "entropy": 0.5647106319665909, - "epoch": 4.451612903225806, - "grad_norm": 0.023352017626166344, + "entropy": 0.622228629887104, + "epoch": 1.0699708454810495, + "grad_norm": 0.010760784149169922, "learning_rate": 0.0002, - "loss": 0.5584677457809448, - "mean_token_accuracy": 0.7754687964916229, - "num_tokens": 10853063.0, + "loss": 0.629308819770813, + "mean_token_accuracy": 0.7456969246268272, + "num_tokens": 5148886.0, "step": 138 }, { - "entropy": 0.5529246926307678, - "epoch": 4.483870967741936, - "grad_norm": 0.02302417904138565, + "entropy": 0.6098063141107559, + "epoch": 1.0777453838678328, + "grad_norm": 0.010240385308861732, "learning_rate": 0.0002, - "loss": 0.5511515736579895, - "mean_token_accuracy": 0.777482196688652, - "num_tokens": 10932630.0, + "loss": 0.6158695220947266, + "mean_token_accuracy": 0.7498040646314621, + "num_tokens": 5186054.0, "step": 139 }, { - "entropy": 0.5594740360975266, - "epoch": 4.516129032258064, - "grad_norm": 0.023653097450733185, + "entropy": 0.6184578239917755, + "epoch": 1.0855199222546161, + "grad_norm": 0.010335118509829044, "learning_rate": 0.0002, - "loss": 0.5600106716156006, - "mean_token_accuracy": 0.7750049978494644, - "num_tokens": 11010608.0, + "loss": 0.6153397560119629, + "mean_token_accuracy": 0.7500413805246353, + "num_tokens": 5223497.0, "step": 140 }, { - "entropy": 0.5542867481708527, - "epoch": 4.548387096774194, - "grad_norm": 0.020881926640868187, + "entropy": 0.626154899597168, + "epoch": 1.0932944606413995, + "grad_norm": 0.009573339484632015, "learning_rate": 0.0002, - "loss": 0.5544250011444092, - "mean_token_accuracy": 0.7768481224775314, - "num_tokens": 11090001.0, + "loss": 0.6198714971542358, + "mean_token_accuracy": 0.7480529472231865, + "num_tokens": 5261284.0, "step": 141 }, { - "entropy": 0.5386150777339935, - "epoch": 4.580645161290323, - "grad_norm": 0.020752349868416786, + "entropy": 0.6239576488733292, + "epoch": 1.1010689990281828, + "grad_norm": 0.01078983023762703, "learning_rate": 0.0002, - "loss": 0.5364447832107544, - "mean_token_accuracy": 0.7837993949651718, - "num_tokens": 11170786.0, + "loss": 0.6222984790802002, + "mean_token_accuracy": 0.7482637241482735, + "num_tokens": 5298391.0, "step": 142 }, { - "entropy": 0.5630347430706024, - "epoch": 4.612903225806452, - "grad_norm": 0.02071365900337696, + "entropy": 0.6052972301840782, + "epoch": 1.1088435374149659, + "grad_norm": 0.009443830698728561, "learning_rate": 0.0002, - "loss": 0.5641552209854126, - "mean_token_accuracy": 0.7728276401758194, - "num_tokens": 11249199.0, + "loss": 0.6056097745895386, + "mean_token_accuracy": 0.755977600812912, + "num_tokens": 5335665.0, "step": 143 }, { - "entropy": 0.5528657734394073, - "epoch": 4.645161290322581, - "grad_norm": 0.023699482902884483, + "entropy": 0.6082469522953033, + "epoch": 1.1166180758017492, + "grad_norm": 0.008718990720808506, "learning_rate": 0.0002, - "loss": 0.5528600215911865, - "mean_token_accuracy": 0.7769691050052643, - "num_tokens": 11326014.0, + "loss": 0.6119707822799683, + "mean_token_accuracy": 0.7540762051939964, + "num_tokens": 5373467.0, "step": 144 }, { - "entropy": 0.5494723469018936, - "epoch": 4.67741935483871, - "grad_norm": 0.023178691044449806, + "entropy": 0.6099165305495262, + "epoch": 1.1243926141885325, + "grad_norm": 0.00886059831827879, "learning_rate": 0.0002, - "loss": 0.5483137369155884, - "mean_token_accuracy": 0.778669074177742, - "num_tokens": 11406477.0, + "loss": 0.6144919395446777, + "mean_token_accuracy": 0.7509082928299904, + "num_tokens": 5410699.0, "step": 145 }, { - "entropy": 0.5606386959552765, - "epoch": 4.709677419354839, - "grad_norm": 0.024073773995041847, + "entropy": 0.606502428650856, + "epoch": 1.1321671525753159, + "grad_norm": 0.009656739421188831, "learning_rate": 0.0002, - "loss": 0.5597125291824341, - "mean_token_accuracy": 0.7748508900403976, - "num_tokens": 11484581.0, + "loss": 0.6092766523361206, + "mean_token_accuracy": 0.7524644657969475, + "num_tokens": 5448145.0, "step": 146 }, { - "entropy": 0.5582331120967865, - "epoch": 4.741935483870968, - "grad_norm": 0.02165294997394085, + "entropy": 0.6240331009030342, + "epoch": 1.1399416909620992, + "grad_norm": 0.009215152822434902, "learning_rate": 0.0002, - "loss": 0.5575276017189026, - "mean_token_accuracy": 0.7765386253595352, - "num_tokens": 11563894.0, + "loss": 0.6283767819404602, + "mean_token_accuracy": 0.7434803545475006, + "num_tokens": 5485424.0, "step": 147 }, { - "entropy": 0.5467294007539749, - "epoch": 4.774193548387097, - "grad_norm": 0.024752194061875343, + "entropy": 0.6154414415359497, + "epoch": 1.1477162293488825, + "grad_norm": 0.009418639354407787, "learning_rate": 0.0002, - "loss": 0.5452256202697754, - "mean_token_accuracy": 0.779546245932579, - "num_tokens": 11643114.0, + "loss": 0.6141241192817688, + "mean_token_accuracy": 0.752318486571312, + "num_tokens": 5522963.0, "step": 148 }, { - "entropy": 0.5514553785324097, - "epoch": 4.806451612903226, - "grad_norm": 0.023302922025322914, + "entropy": 0.6115295439958572, + "epoch": 1.1554907677356656, + "grad_norm": 0.008995896205306053, "learning_rate": 0.0002, - "loss": 0.5512630343437195, - "mean_token_accuracy": 0.7783655822277069, - "num_tokens": 11721689.0, + "loss": 0.6093723773956299, + "mean_token_accuracy": 0.7540601193904877, + "num_tokens": 5560173.0, "step": 149 }, { - "entropy": 0.5526825040578842, - "epoch": 4.838709677419355, - "grad_norm": 0.023031046614050865, + "entropy": 0.6168172955513, + "epoch": 1.163265306122449, + "grad_norm": 0.007887676358222961, "learning_rate": 0.0002, - "loss": 0.5490496754646301, - "mean_token_accuracy": 0.7788337171077728, - "num_tokens": 11800889.0, + "loss": 0.6149598360061646, + "mean_token_accuracy": 0.7500165104866028, + "num_tokens": 5597781.0, "step": 150 }, { - "entropy": 0.5668125748634338, - "epoch": 4.870967741935484, - "grad_norm": 0.021988127380609512, + "entropy": 0.6069798469543457, + "epoch": 1.1710398445092323, + "grad_norm": 0.008911027573049068, "learning_rate": 0.0002, - "loss": 0.5608407258987427, - "mean_token_accuracy": 0.7742439359426498, - "num_tokens": 11880825.0, + "loss": 0.6064385771751404, + "mean_token_accuracy": 0.7551223114132881, + "num_tokens": 5635360.0, "step": 151 }, { - "entropy": 0.5554933696985245, - "epoch": 4.903225806451613, - "grad_norm": 0.020031005144119263, + "entropy": 0.6170337721705437, + "epoch": 1.1788143828960156, + "grad_norm": 0.008784991689026356, "learning_rate": 0.0002, - "loss": 0.5538957118988037, - "mean_token_accuracy": 0.7775003910064697, - "num_tokens": 11959141.0, + "loss": 0.6199371814727783, + "mean_token_accuracy": 0.7501093670725822, + "num_tokens": 5673236.0, "step": 152 }, { - "entropy": 0.5566612184047699, - "epoch": 4.935483870967742, - "grad_norm": 0.023369155824184418, + "entropy": 0.6042322665452957, + "epoch": 1.186588921282799, + "grad_norm": 0.008859240449965, "learning_rate": 0.0002, - "loss": 0.5597338676452637, - "mean_token_accuracy": 0.7750471085309982, - "num_tokens": 12036910.0, + "loss": 0.6099147200584412, + "mean_token_accuracy": 0.7529143393039703, + "num_tokens": 5710364.0, "step": 153 }, { - "entropy": 0.5446057766675949, - "epoch": 4.967741935483871, - "grad_norm": 0.02630646713078022, + "entropy": 0.6032149121165276, + "epoch": 1.194363459669582, + "grad_norm": 0.008698609657585621, "learning_rate": 0.0002, - "loss": 0.5490501523017883, - "mean_token_accuracy": 0.7789898663759232, - "num_tokens": 12115573.0, + "loss": 0.6091040372848511, + "mean_token_accuracy": 0.7545271888375282, + "num_tokens": 5747783.0, "step": 154 }, { - "entropy": 0.5549590289592743, - "epoch": 5.0, - "grad_norm": 0.02291618101298809, + "entropy": 0.5934446603059769, + "epoch": 1.2021379980563653, + "grad_norm": 0.009365703910589218, "learning_rate": 0.0002, - "loss": 0.5535373687744141, - "mean_token_accuracy": 0.7768057286739349, - "num_tokens": 12193899.0, + "loss": 0.6000581979751587, + "mean_token_accuracy": 0.7570822536945343, + "num_tokens": 5784550.0, "step": 155 }, { - "entropy": 0.5561019033193588, - "epoch": 5.032258064516129, - "grad_norm": 0.026937829330563545, + "entropy": 0.6240461468696594, + "epoch": 1.2099125364431487, + "grad_norm": 0.00959563348442316, "learning_rate": 0.0002, - "loss": 0.5483195781707764, - "mean_token_accuracy": 0.7804572731256485, - "num_tokens": 12272768.0, + "loss": 0.6229224801063538, + "mean_token_accuracy": 0.7504049837589264, + "num_tokens": 5822051.0, "step": 156 }, { - "entropy": 0.567187175154686, - "epoch": 5.064516129032258, - "grad_norm": 0.024019401520490646, + "entropy": 0.6372882649302483, + "epoch": 1.217687074829932, + "grad_norm": 0.008253706619143486, "learning_rate": 0.0002, - "loss": 0.5632338523864746, - "mean_token_accuracy": 0.7725232094526291, - "num_tokens": 12350931.0, + "loss": 0.6363227367401123, + "mean_token_accuracy": 0.7415706738829613, + "num_tokens": 5859606.0, "step": 157 }, { - "entropy": 0.5438211113214493, - "epoch": 5.096774193548387, - "grad_norm": 0.03028087317943573, + "entropy": 0.6115364283323288, + "epoch": 1.2254616132167153, + "grad_norm": 0.009423714131116867, "learning_rate": 0.0002, - "loss": 0.5464832782745361, - "mean_token_accuracy": 0.7778522670269012, - "num_tokens": 12429717.0, + "loss": 0.6082147359848022, + "mean_token_accuracy": 0.7525753974914551, + "num_tokens": 5897144.0, "step": 158 }, { - "entropy": 0.5475486516952515, - "epoch": 5.129032258064516, - "grad_norm": 0.02604476921260357, + "entropy": 0.6259980425238609, + "epoch": 1.2332361516034984, + "grad_norm": 0.008684671483933926, "learning_rate": 0.0002, - "loss": 0.549872875213623, - "mean_token_accuracy": 0.777956560254097, - "num_tokens": 12509565.0, + "loss": 0.6272211074829102, + "mean_token_accuracy": 0.7443205043673515, + "num_tokens": 5934271.0, "step": 159 }, { - "entropy": 0.5558717250823975, - "epoch": 5.161290322580645, - "grad_norm": 0.0321776308119297, + "entropy": 0.6230324283242226, + "epoch": 1.2410106899902817, + "grad_norm": 0.008543766103684902, "learning_rate": 0.0002, - "loss": 0.5513166189193726, - "mean_token_accuracy": 0.7780381888151169, - "num_tokens": 12588412.0, + "loss": 0.6271595358848572, + "mean_token_accuracy": 0.7448511347174644, + "num_tokens": 5971696.0, "step": 160 }, { - "entropy": 0.5628859251737595, - "epoch": 5.193548387096774, - "grad_norm": 0.02652231976389885, + "entropy": 0.6094089895486832, + "epoch": 1.248785228377065, + "grad_norm": 0.008484925143420696, "learning_rate": 0.0002, - "loss": 0.5562256574630737, - "mean_token_accuracy": 0.7748238295316696, - "num_tokens": 12665848.0, + "loss": 0.611902117729187, + "mean_token_accuracy": 0.751502238214016, + "num_tokens": 6009264.0, "step": 161 }, { - "entropy": 0.5413103997707367, - "epoch": 5.225806451612903, - "grad_norm": 0.03387759253382683, + "entropy": 0.6298199594020844, + "epoch": 1.2565597667638484, + "grad_norm": 0.009336225688457489, "learning_rate": 0.0002, - "loss": 0.5417234301567078, - "mean_token_accuracy": 0.7818101793527603, - "num_tokens": 12745448.0, + "loss": 0.6334519386291504, + "mean_token_accuracy": 0.7432255297899246, + "num_tokens": 6046764.0, "step": 162 }, { - "entropy": 0.5551229268312454, - "epoch": 5.258064516129032, - "grad_norm": 0.023084145039319992, + "entropy": 0.6082314997911453, + "epoch": 1.2643343051506317, + "grad_norm": 0.008643310517072678, "learning_rate": 0.0002, - "loss": 0.5586496591567993, - "mean_token_accuracy": 0.774695560336113, - "num_tokens": 12824082.0, + "loss": 0.6062188148498535, + "mean_token_accuracy": 0.7549923211336136, + "num_tokens": 6084129.0, "step": 163 }, { - "entropy": 0.5464837104082108, - "epoch": 5.290322580645161, - "grad_norm": 0.0308171845972538, + "entropy": 0.6305336207151413, + "epoch": 1.272108843537415, + "grad_norm": 0.009341283701360226, "learning_rate": 0.0002, - "loss": 0.5477242469787598, - "mean_token_accuracy": 0.7798135727643967, - "num_tokens": 12904238.0, + "loss": 0.6319139003753662, + "mean_token_accuracy": 0.7440996170043945, + "num_tokens": 6121588.0, "step": 164 }, { - "entropy": 0.5441529452800751, - "epoch": 5.32258064516129, - "grad_norm": 0.0238366536796093, + "entropy": 0.6267635151743889, + "epoch": 1.2798833819241984, + "grad_norm": 0.00801732949912548, "learning_rate": 0.0002, - "loss": 0.5439585447311401, - "mean_token_accuracy": 0.7792287319898605, - "num_tokens": 12983526.0, + "loss": 0.6295123100280762, + "mean_token_accuracy": 0.7461825907230377, + "num_tokens": 6158885.0, "step": 165 }, { - "entropy": 0.5672517120838165, - "epoch": 5.354838709677419, - "grad_norm": 0.03152715414762497, + "entropy": 0.6146969944238663, + "epoch": 1.2876579203109815, + "grad_norm": 0.009981551207602024, "learning_rate": 0.0002, - "loss": 0.5655900835990906, - "mean_token_accuracy": 0.772352933883667, - "num_tokens": 13060468.0, + "loss": 0.611693263053894, + "mean_token_accuracy": 0.7518708109855652, + "num_tokens": 6196224.0, "step": 166 }, { - "entropy": 0.5608488917350769, - "epoch": 5.387096774193548, - "grad_norm": 0.02373046800494194, + "entropy": 0.61357232183218, + "epoch": 1.2954324586977648, + "grad_norm": 0.009115675464272499, "learning_rate": 0.0002, - "loss": 0.5555386543273926, - "mean_token_accuracy": 0.7747525721788406, - "num_tokens": 13138649.0, + "loss": 0.6161482930183411, + "mean_token_accuracy": 0.7504228800535202, + "num_tokens": 6233989.0, "step": 167 }, { - "entropy": 0.5586176365613937, - "epoch": 5.419354838709677, - "grad_norm": 0.03595823422074318, + "entropy": 0.6055504828691483, + "epoch": 1.3032069970845481, + "grad_norm": 0.009081711992621422, "learning_rate": 0.0002, - "loss": 0.5541322827339172, - "mean_token_accuracy": 0.7748987674713135, - "num_tokens": 13216338.0, + "loss": 0.6060025691986084, + "mean_token_accuracy": 0.7522977739572525, + "num_tokens": 6271394.0, "step": 168 }, { - "entropy": 0.5443743169307709, - "epoch": 5.451612903225806, - "grad_norm": 0.023366756737232208, + "entropy": 0.6105418056249619, + "epoch": 1.3109815354713314, + "grad_norm": 0.009730422869324684, "learning_rate": 0.0002, - "loss": 0.5441352725028992, - "mean_token_accuracy": 0.780906617641449, - "num_tokens": 13295756.0, + "loss": 0.6106258630752563, + "mean_token_accuracy": 0.753718800842762, + "num_tokens": 6308814.0, "step": 169 }, { - "entropy": 0.5391481816768646, - "epoch": 5.483870967741936, - "grad_norm": 0.030348939821124077, + "entropy": 0.6137099266052246, + "epoch": 1.3187560738581148, + "grad_norm": 0.009750008583068848, "learning_rate": 0.0002, - "loss": 0.5443218350410461, - "mean_token_accuracy": 0.7819477766752243, - "num_tokens": 13374481.0, + "loss": 0.6176519393920898, + "mean_token_accuracy": 0.7496867552399635, + "num_tokens": 6346282.0, "step": 170 }, { - "entropy": 0.5512904077768326, - "epoch": 5.516129032258064, - "grad_norm": 0.02274961955845356, + "entropy": 0.6076096817851067, + "epoch": 1.3265306122448979, + "grad_norm": 0.00966191291809082, "learning_rate": 0.0002, - "loss": 0.551249623298645, - "mean_token_accuracy": 0.7771816253662109, - "num_tokens": 13451677.0, + "loss": 0.6177955865859985, + "mean_token_accuracy": 0.7480223625898361, + "num_tokens": 6383602.0, "step": 171 }, { - "entropy": 0.5613770186901093, - "epoch": 5.548387096774194, - "grad_norm": 0.028490891680121422, + "entropy": 0.6195629611611366, + "epoch": 1.3343051506316812, + "grad_norm": 0.008418413810431957, "learning_rate": 0.0002, - "loss": 0.5578492879867554, - "mean_token_accuracy": 0.776411771774292, - "num_tokens": 13529937.0, + "loss": 0.6202820539474487, + "mean_token_accuracy": 0.7488253712654114, + "num_tokens": 6421035.0, "step": 172 }, { - "entropy": 0.5444934517145157, - "epoch": 5.580645161290323, - "grad_norm": 0.02613925375044346, + "entropy": 0.6313579976558685, + "epoch": 1.3420796890184645, + "grad_norm": 0.009207581169903278, "learning_rate": 0.0002, - "loss": 0.5422302484512329, - "mean_token_accuracy": 0.7822085916996002, - "num_tokens": 13609443.0, + "loss": 0.6277562379837036, + "mean_token_accuracy": 0.7459008172154427, + "num_tokens": 6458322.0, "step": 173 }, { - "entropy": 0.5491741746664047, - "epoch": 5.612903225806452, - "grad_norm": 0.027057429775595665, + "entropy": 0.6184266805648804, + "epoch": 1.3498542274052479, + "grad_norm": 0.009536071680486202, "learning_rate": 0.0002, - "loss": 0.5511897206306458, - "mean_token_accuracy": 0.7783340960741043, - "num_tokens": 13689772.0, + "loss": 0.6161496639251709, + "mean_token_accuracy": 0.7486988604068756, + "num_tokens": 6495621.0, "step": 174 }, { - "entropy": 0.5478880554437637, - "epoch": 5.645161290322581, - "grad_norm": 0.026018880307674408, + "entropy": 0.6189115419983864, + "epoch": 1.3576287657920312, + "grad_norm": 0.0097253592684865, "learning_rate": 0.0002, - "loss": 0.5485314130783081, - "mean_token_accuracy": 0.7789710909128189, - "num_tokens": 13767989.0, + "loss": 0.6185729503631592, + "mean_token_accuracy": 0.7469287514686584, + "num_tokens": 6532892.0, "step": 175 }, { - "entropy": 0.5589290112257004, - "epoch": 5.67741935483871, - "grad_norm": 0.029512794688344002, + "entropy": 0.6204129755496979, + "epoch": 1.3654033041788143, + "grad_norm": 0.008999030105769634, "learning_rate": 0.0002, - "loss": 0.5614359378814697, - "mean_token_accuracy": 0.7731590867042542, - "num_tokens": 13845810.0, + "loss": 0.6241609454154968, + "mean_token_accuracy": 0.7467619553208351, + "num_tokens": 6570420.0, "step": 176 }, { - "entropy": 0.5505948513746262, - "epoch": 5.709677419354839, - "grad_norm": 0.024590788409113884, + "entropy": 0.6034655645489693, + "epoch": 1.3731778425655976, + "grad_norm": 0.009542280808091164, "learning_rate": 0.0002, - "loss": 0.5468696355819702, - "mean_token_accuracy": 0.780251756310463, - "num_tokens": 13924126.0, + "loss": 0.6092945337295532, + "mean_token_accuracy": 0.7532089725136757, + "num_tokens": 6607782.0, "step": 177 }, { - "entropy": 0.5619102567434311, - "epoch": 5.741935483870968, - "grad_norm": 0.024399949237704277, + "entropy": 0.5901695042848587, + "epoch": 1.380952380952381, + "grad_norm": 0.009766815230250359, "learning_rate": 0.0002, - "loss": 0.5583929419517517, - "mean_token_accuracy": 0.7739093750715256, - "num_tokens": 14002635.0, + "loss": 0.5972245335578918, + "mean_token_accuracy": 0.7562905699014664, + "num_tokens": 6644876.0, "step": 178 }, { - "entropy": 0.5550903379917145, - "epoch": 5.774193548387097, - "grad_norm": 0.024970386177301407, + "entropy": 0.6139540746808052, + "epoch": 1.3887269193391643, + "grad_norm": 0.00885457918047905, "learning_rate": 0.0002, - "loss": 0.552678108215332, - "mean_token_accuracy": 0.777456060051918, - "num_tokens": 14080946.0, + "loss": 0.6145105361938477, + "mean_token_accuracy": 0.7494652420282364, + "num_tokens": 6682153.0, "step": 179 }, { - "entropy": 0.5512722134590149, - "epoch": 5.806451612903226, - "grad_norm": 0.025160595774650574, + "entropy": 0.6128789633512497, + "epoch": 1.3965014577259476, + "grad_norm": 0.008380657061934471, "learning_rate": 0.0002, - "loss": 0.549900472164154, - "mean_token_accuracy": 0.7770860642194748, - "num_tokens": 14159665.0, + "loss": 0.6103215217590332, + "mean_token_accuracy": 0.7528893128037453, + "num_tokens": 6719589.0, "step": 180 }, { - "entropy": 0.5473987311124802, - "epoch": 5.838709677419355, - "grad_norm": 0.023530514910817146, + "entropy": 0.6158252954483032, + "epoch": 1.4042759961127307, + "grad_norm": 0.008612860925495625, "learning_rate": 0.0002, - "loss": 0.5512905120849609, - "mean_token_accuracy": 0.7771292179822922, - "num_tokens": 14238752.0, + "loss": 0.6157952547073364, + "mean_token_accuracy": 0.7490102499723434, + "num_tokens": 6757256.0, "step": 181 }, { - "entropy": 0.5468312054872513, - "epoch": 5.870967741935484, - "grad_norm": 0.02680164761841297, + "entropy": 0.6120009869337082, + "epoch": 1.412050534499514, + "grad_norm": 0.008242498151957989, "learning_rate": 0.0002, - "loss": 0.5493057370185852, - "mean_token_accuracy": 0.7771333903074265, - "num_tokens": 14318306.0, + "loss": 0.610822319984436, + "mean_token_accuracy": 0.7527074217796326, + "num_tokens": 6794427.0, "step": 182 }, { - "entropy": 0.5578427314758301, - "epoch": 5.903225806451613, - "grad_norm": 0.021048691123723984, + "entropy": 0.607716366648674, + "epoch": 1.4198250728862973, + "grad_norm": 0.00903896614909172, "learning_rate": 0.0002, - "loss": 0.5549115538597107, - "mean_token_accuracy": 0.775988444685936, - "num_tokens": 14396279.0, + "loss": 0.6105165481567383, + "mean_token_accuracy": 0.7544176280498505, + "num_tokens": 6831592.0, "step": 183 }, { - "entropy": 0.5536772906780243, - "epoch": 5.935483870967742, - "grad_norm": 0.022526104003190994, + "entropy": 0.6083493009209633, + "epoch": 1.4275996112730807, + "grad_norm": 0.007915884256362915, "learning_rate": 0.0002, - "loss": 0.5495197176933289, - "mean_token_accuracy": 0.7781153470277786, - "num_tokens": 14476180.0, + "loss": 0.611156165599823, + "mean_token_accuracy": 0.7522151321172714, + "num_tokens": 6869182.0, "step": 184 }, { - "entropy": 0.5544522255659103, - "epoch": 5.967741935483871, - "grad_norm": 0.024115389212965965, + "entropy": 0.6225397288799286, + "epoch": 1.435374149659864, + "grad_norm": 0.009225807152688503, "learning_rate": 0.0002, - "loss": 0.5527682304382324, - "mean_token_accuracy": 0.7773118168115616, - "num_tokens": 14554359.0, + "loss": 0.6281070709228516, + "mean_token_accuracy": 0.7460536956787109, + "num_tokens": 6906740.0, "step": 185 }, { - "entropy": 0.5480682402849197, - "epoch": 6.0, - "grad_norm": 0.02979295328259468, + "entropy": 0.6144149005413055, + "epoch": 1.4431486880466473, + "grad_norm": 0.010468881577253342, "learning_rate": 0.0002, - "loss": 0.5507486462593079, - "mean_token_accuracy": 0.7767946571111679, - "num_tokens": 14632526.0, + "loss": 0.6134935617446899, + "mean_token_accuracy": 0.7510944902896881, + "num_tokens": 6944215.0, "step": 186 }, { - "entropy": 0.5580382943153381, - "epoch": 6.032258064516129, - "grad_norm": 0.02307111956179142, + "entropy": 0.6219450011849403, + "epoch": 1.4509232264334306, + "grad_norm": 0.008004755713045597, "learning_rate": 0.0002, - "loss": 0.5539210438728333, - "mean_token_accuracy": 0.7763322442770004, - "num_tokens": 14711118.0, + "loss": 0.6226309537887573, + "mean_token_accuracy": 0.7474055960774422, + "num_tokens": 6981266.0, "step": 187 }, { - "entropy": 0.5532259047031403, - "epoch": 6.064516129032258, - "grad_norm": 0.028182433918118477, + "entropy": 0.6094852611422539, + "epoch": 1.4586977648202137, + "grad_norm": 0.00825564842671156, "learning_rate": 0.0002, - "loss": 0.547465443611145, - "mean_token_accuracy": 0.7796971946954727, - "num_tokens": 14789744.0, + "loss": 0.6140962839126587, + "mean_token_accuracy": 0.7508443966507912, + "num_tokens": 7018562.0, "step": 188 }, { - "entropy": 0.5554233491420746, - "epoch": 6.096774193548387, - "grad_norm": 0.021296130493283272, + "entropy": 0.6202999800443649, + "epoch": 1.466472303206997, + "grad_norm": 0.00858406163752079, "learning_rate": 0.0002, - "loss": 0.553041934967041, - "mean_token_accuracy": 0.7760283201932907, - "num_tokens": 14868371.0, + "loss": 0.6255123615264893, + "mean_token_accuracy": 0.744349479675293, + "num_tokens": 7055995.0, "step": 189 }, { - "entropy": 0.5400276184082031, - "epoch": 6.129032258064516, - "grad_norm": 0.029270071536302567, + "entropy": 0.620690606534481, + "epoch": 1.4742468415937804, + "grad_norm": 0.008920849300920963, "learning_rate": 0.0002, - "loss": 0.5436077117919922, - "mean_token_accuracy": 0.7790288478136063, - "num_tokens": 14946769.0, + "loss": 0.6179178357124329, + "mean_token_accuracy": 0.7499353438615799, + "num_tokens": 7093265.0, "step": 190 }, { - "entropy": 0.5573062002658844, - "epoch": 6.161290322580645, - "grad_norm": 0.02297142706811428, + "entropy": 0.6239896044135094, + "epoch": 1.4820213799805637, + "grad_norm": 0.00956004112958908, "learning_rate": 0.0002, - "loss": 0.5577552318572998, - "mean_token_accuracy": 0.7743619382381439, - "num_tokens": 15024271.0, + "loss": 0.6228440999984741, + "mean_token_accuracy": 0.7463066428899765, + "num_tokens": 7130758.0, "step": 191 }, { - "entropy": 0.5473188757896423, - "epoch": 6.193548387096774, - "grad_norm": 0.03082077018916607, + "entropy": 0.6123484745621681, + "epoch": 1.489795918367347, + "grad_norm": 0.009270581416785717, "learning_rate": 0.0002, - "loss": 0.5461888313293457, - "mean_token_accuracy": 0.7801126092672348, - "num_tokens": 15103815.0, + "loss": 0.6113156080245972, + "mean_token_accuracy": 0.752521239221096, + "num_tokens": 7168712.0, "step": 192 }, { - "entropy": 0.5432057976722717, - "epoch": 6.225806451612903, - "grad_norm": 0.0229332372546196, + "entropy": 0.616000160574913, + "epoch": 1.4975704567541301, + "grad_norm": 0.010770791210234165, "learning_rate": 0.0002, - "loss": 0.5412731170654297, - "mean_token_accuracy": 0.7815204709768295, - "num_tokens": 15182419.0, + "loss": 0.6215670108795166, + "mean_token_accuracy": 0.7469163537025452, + "num_tokens": 7205815.0, "step": 193 }, { - "entropy": 0.5486985445022583, - "epoch": 6.258064516129032, - "grad_norm": 0.02622872032225132, + "entropy": 0.6254132762551308, + "epoch": 1.5053449951409135, + "grad_norm": 0.008934563025832176, "learning_rate": 0.0002, - "loss": 0.5463793277740479, - "mean_token_accuracy": 0.7784279584884644, - "num_tokens": 15260644.0, + "loss": 0.627918541431427, + "mean_token_accuracy": 0.7457368895411491, + "num_tokens": 7243319.0, "step": 194 }, { - "entropy": 0.551539808511734, - "epoch": 6.290322580645161, - "grad_norm": 0.025613069534301758, + "entropy": 0.6185151413083076, + "epoch": 1.5131195335276968, + "grad_norm": 0.008593689650297165, "learning_rate": 0.0002, - "loss": 0.5521561503410339, - "mean_token_accuracy": 0.7762308567762375, - "num_tokens": 15338884.0, + "loss": 0.6180027723312378, + "mean_token_accuracy": 0.7505958154797554, + "num_tokens": 7280988.0, "step": 195 }, { - "entropy": 0.5487957298755646, - "epoch": 6.32258064516129, - "grad_norm": 0.02660960517823696, + "entropy": 0.6063526794314384, + "epoch": 1.5208940719144801, + "grad_norm": 0.01172675471752882, "learning_rate": 0.0002, - "loss": 0.5461074113845825, - "mean_token_accuracy": 0.7797946333885193, - "num_tokens": 15417356.0, + "loss": 0.6113625764846802, + "mean_token_accuracy": 0.7508470490574837, + "num_tokens": 7318322.0, "step": 196 }, { - "entropy": 0.5484287142753601, - "epoch": 6.354838709677419, - "grad_norm": 0.025937844067811966, + "entropy": 0.6110472977161407, + "epoch": 1.5286686103012634, + "grad_norm": 0.009914939291775227, "learning_rate": 0.0002, - "loss": 0.5483534336090088, - "mean_token_accuracy": 0.7784149944782257, - "num_tokens": 15496287.0, + "loss": 0.6066443920135498, + "mean_token_accuracy": 0.7531256228685379, + "num_tokens": 7355926.0, "step": 197 }, { - "entropy": 0.5399597436189651, - "epoch": 6.387096774193548, - "grad_norm": 0.02921709045767784, + "entropy": 0.6154029294848442, + "epoch": 1.5364431486880465, + "grad_norm": 0.008429116569459438, "learning_rate": 0.0002, - "loss": 0.5408337116241455, - "mean_token_accuracy": 0.7813759595155716, - "num_tokens": 15575856.0, + "loss": 0.6149218678474426, + "mean_token_accuracy": 0.7508518844842911, + "num_tokens": 7393433.0, "step": 198 }, { - "entropy": 0.5393888503313065, - "epoch": 6.419354838709677, - "grad_norm": 0.028209807351231575, + "entropy": 0.622289851307869, + "epoch": 1.54421768707483, + "grad_norm": 0.06439514458179474, "learning_rate": 0.0002, - "loss": 0.537765622138977, - "mean_token_accuracy": 0.7822040915489197, - "num_tokens": 15656049.0, + "loss": 0.631239116191864, + "mean_token_accuracy": 0.7464239746332169, + "num_tokens": 7431062.0, "step": 199 }, { - "entropy": 0.5398154109716415, - "epoch": 6.451612903225806, - "grad_norm": 0.02456795424222946, + "entropy": 0.619748018682003, + "epoch": 1.5519922254616132, + "grad_norm": 0.014919525012373924, "learning_rate": 0.0002, - "loss": 0.5377130508422852, - "mean_token_accuracy": 0.7834392338991165, - "num_tokens": 15736009.0, + "loss": 0.6189074516296387, + "mean_token_accuracy": 0.7492179349064827, + "num_tokens": 7468637.0, "step": 200 }, { - "entropy": 0.5495229363441467, - "epoch": 6.483870967741936, - "grad_norm": 0.024359729140996933, + "entropy": 0.6060447245836258, + "epoch": 1.5597667638483965, + "grad_norm": 0.019268253818154335, "learning_rate": 0.0002, - "loss": 0.5489087700843811, - "mean_token_accuracy": 0.7771141827106476, - "num_tokens": 15814393.0, + "loss": 0.6034001708030701, + "mean_token_accuracy": 0.7538621947169304, + "num_tokens": 7506043.0, "step": 201 }, { - "entropy": 0.5561530888080597, - "epoch": 6.516129032258064, - "grad_norm": 0.025875220075249672, + "entropy": 0.6062331944704056, + "epoch": 1.5675413022351798, + "grad_norm": 0.013310298323631287, "learning_rate": 0.0002, - "loss": 0.5526772141456604, - "mean_token_accuracy": 0.7763231992721558, - "num_tokens": 15893219.0, + "loss": 0.6041976809501648, + "mean_token_accuracy": 0.7555137276649475, + "num_tokens": 7543352.0, "step": 202 }, { - "entropy": 0.5465659946203232, - "epoch": 6.548387096774194, - "grad_norm": 0.024376418441534042, + "entropy": 0.6137887313961983, + "epoch": 1.575315840621963, + "grad_norm": 0.010207262821495533, "learning_rate": 0.0002, - "loss": 0.5443940758705139, - "mean_token_accuracy": 0.7796058654785156, - "num_tokens": 15971928.0, + "loss": 0.6102935671806335, + "mean_token_accuracy": 0.7525052726268768, + "num_tokens": 7580867.0, "step": 203 }, { - "entropy": 0.5460532903671265, - "epoch": 6.580645161290323, - "grad_norm": 0.02943381294608116, + "entropy": 0.6222132593393326, + "epoch": 1.5830903790087465, + "grad_norm": 0.013623848557472229, "learning_rate": 0.0002, - "loss": 0.5474627614021301, - "mean_token_accuracy": 0.7784818559885025, - "num_tokens": 16049771.0, + "loss": 0.6228193044662476, + "mean_token_accuracy": 0.7474973797798157, + "num_tokens": 7618160.0, "step": 204 }, { - "entropy": 0.5501101911067963, - "epoch": 6.612903225806452, - "grad_norm": 0.03332793340086937, + "entropy": 0.6147656589746475, + "epoch": 1.5908649173955296, + "grad_norm": 0.011189316399395466, "learning_rate": 0.0002, - "loss": 0.5518757700920105, - "mean_token_accuracy": 0.7763904929161072, - "num_tokens": 16127561.0, + "loss": 0.6171211004257202, + "mean_token_accuracy": 0.750194676220417, + "num_tokens": 7655454.0, "step": 205 }, { - "entropy": 0.5436413139104843, - "epoch": 6.645161290322581, - "grad_norm": 0.02456376701593399, + "entropy": 0.6172639206051826, + "epoch": 1.598639455782313, + "grad_norm": 0.010384263470768929, "learning_rate": 0.0002, - "loss": 0.5429570078849792, - "mean_token_accuracy": 0.7813099920749664, - "num_tokens": 16206759.0, + "loss": 0.6146183013916016, + "mean_token_accuracy": 0.7520541921257973, + "num_tokens": 7693399.0, "step": 206 }, { - "entropy": 0.5561850965023041, - "epoch": 6.67741935483871, - "grad_norm": 0.029962576925754547, + "entropy": 0.6170154958963394, + "epoch": 1.6064139941690962, + "grad_norm": 0.01584717258810997, "learning_rate": 0.0002, - "loss": 0.5575984716415405, - "mean_token_accuracy": 0.7756843119859695, - "num_tokens": 16284941.0, + "loss": 0.6188840866088867, + "mean_token_accuracy": 0.7489955052733421, + "num_tokens": 7730827.0, "step": 207 }, { - "entropy": 0.5501436293125153, - "epoch": 6.709677419354839, - "grad_norm": 0.024612169712781906, + "entropy": 0.6163731887936592, + "epoch": 1.6141885325558794, + "grad_norm": 0.018742689862847328, "learning_rate": 0.0002, - "loss": 0.5489822626113892, - "mean_token_accuracy": 0.7770082056522369, - "num_tokens": 16363484.0, + "loss": 0.6233645677566528, + "mean_token_accuracy": 0.7474886327981949, + "num_tokens": 7768375.0, "step": 208 }, { - "entropy": 0.5469796806573868, - "epoch": 6.741935483870968, - "grad_norm": 0.032858025282621384, + "entropy": 0.6161412820219994, + "epoch": 1.621963070942663, + "grad_norm": 0.00972844660282135, "learning_rate": 0.0002, - "loss": 0.5432774424552917, - "mean_token_accuracy": 0.7797504663467407, - "num_tokens": 16443224.0, + "loss": 0.622969388961792, + "mean_token_accuracy": 0.747713029384613, + "num_tokens": 7806087.0, "step": 209 }, { - "entropy": 0.5524753332138062, - "epoch": 6.774193548387097, - "grad_norm": 0.027275629341602325, + "entropy": 0.6096204742789268, + "epoch": 1.629737609329446, + "grad_norm": 0.008969136513769627, "learning_rate": 0.0002, - "loss": 0.5505518913269043, - "mean_token_accuracy": 0.7788595259189606, - "num_tokens": 16522163.0, + "loss": 0.6155728697776794, + "mean_token_accuracy": 0.7519758120179176, + "num_tokens": 7843539.0, "step": 210 }, { - "entropy": 0.5436955541372299, - "epoch": 6.806451612903226, - "grad_norm": 0.033380795270204544, + "entropy": 0.6264154762029648, + "epoch": 1.6375121477162293, + "grad_norm": 0.009598297998309135, "learning_rate": 0.0002, - "loss": 0.5442633628845215, - "mean_token_accuracy": 0.7801192104816437, - "num_tokens": 16600824.0, + "loss": 0.6284589767456055, + "mean_token_accuracy": 0.7461679801344872, + "num_tokens": 7881097.0, "step": 211 }, { - "entropy": 0.5455887615680695, - "epoch": 6.838709677419355, - "grad_norm": 0.029686089605093002, + "entropy": 0.6087732166051865, + "epoch": 1.6452866861030127, + "grad_norm": 0.012110014446079731, "learning_rate": 0.0002, - "loss": 0.5451895594596863, - "mean_token_accuracy": 0.7799460589885712, - "num_tokens": 16679996.0, + "loss": 0.6086750626564026, + "mean_token_accuracy": 0.7552923634648323, + "num_tokens": 7918507.0, "step": 212 }, { - "entropy": 0.5443432927131653, - "epoch": 6.870967741935484, - "grad_norm": 0.034105002880096436, + "entropy": 0.6052073761820793, + "epoch": 1.6530612244897958, + "grad_norm": 0.009252856485545635, "learning_rate": 0.0002, - "loss": 0.5448198914527893, - "mean_token_accuracy": 0.7806573361158371, - "num_tokens": 16757525.0, + "loss": 0.6080942153930664, + "mean_token_accuracy": 0.7508447393774986, + "num_tokens": 7955564.0, "step": 213 }, { - "entropy": 0.5445855557918549, - "epoch": 6.903225806451613, - "grad_norm": 0.03775215521454811, + "entropy": 0.6120294705033302, + "epoch": 1.6608357628765793, + "grad_norm": 0.00877399556338787, "learning_rate": 0.0002, - "loss": 0.5394209623336792, - "mean_token_accuracy": 0.7814014852046967, - "num_tokens": 16837120.0, + "loss": 0.614532470703125, + "mean_token_accuracy": 0.7511213645339012, + "num_tokens": 7992945.0, "step": 214 }, { - "entropy": 0.5457793027162552, - "epoch": 6.935483870967742, - "grad_norm": 0.0267504770308733, + "entropy": 0.6241516917943954, + "epoch": 1.6686103012633624, + "grad_norm": 0.01109123881906271, "learning_rate": 0.0002, - "loss": 0.5454181432723999, - "mean_token_accuracy": 0.7807471007108688, - "num_tokens": 16915568.0, + "loss": 0.626361608505249, + "mean_token_accuracy": 0.7474541217088699, + "num_tokens": 8030734.0, "step": 215 }, { - "entropy": 0.5482135564088821, - "epoch": 6.967741935483871, - "grad_norm": 0.038814593106508255, + "entropy": 0.6194194927811623, + "epoch": 1.6763848396501457, + "grad_norm": 0.009091328829526901, "learning_rate": 0.0002, - "loss": 0.552478551864624, - "mean_token_accuracy": 0.7767772674560547, - "num_tokens": 16993690.0, + "loss": 0.6160167455673218, + "mean_token_accuracy": 0.7495900243520737, + "num_tokens": 8067927.0, "step": 216 }, { - "entropy": 0.5654344111680984, - "epoch": 7.0, - "grad_norm": 0.031003009527921677, + "entropy": 0.6229095980525017, + "epoch": 1.684159378036929, + "grad_norm": 0.01083504967391491, "learning_rate": 0.0002, - "loss": 0.5617949366569519, - "mean_token_accuracy": 0.7726786136627197, - "num_tokens": 17071218.0, + "loss": 0.6173299551010132, + "mean_token_accuracy": 0.7501125037670135, + "num_tokens": 8105627.0, "step": 217 }, { - "entropy": 0.5554635226726532, - "epoch": 7.032258064516129, - "grad_norm": 0.03204672038555145, + "entropy": 0.6194786503911018, + "epoch": 1.6919339164237124, + "grad_norm": 0.008784794248640537, "learning_rate": 0.0002, - "loss": 0.5454404950141907, - "mean_token_accuracy": 0.7804635167121887, - "num_tokens": 17151568.0, + "loss": 0.6191180944442749, + "mean_token_accuracy": 0.748157188296318, + "num_tokens": 8143034.0, "step": 218 }, { - "entropy": 0.530587300658226, - "epoch": 7.064516129032258, - "grad_norm": 0.02964143082499504, + "entropy": 0.6127319037914276, + "epoch": 1.6997084548104957, + "grad_norm": 0.008322956040501595, "learning_rate": 0.0002, - "loss": 0.5306113958358765, - "mean_token_accuracy": 0.7852308750152588, - "num_tokens": 17230148.0, + "loss": 0.6156037449836731, + "mean_token_accuracy": 0.7487869411706924, + "num_tokens": 8180596.0, "step": 219 }, { - "entropy": 0.5281653106212616, - "epoch": 7.096774193548387, - "grad_norm": 0.027958055958151817, + "entropy": 0.6223913356661797, + "epoch": 1.7074829931972788, + "grad_norm": 0.008480758406221867, "learning_rate": 0.0002, - "loss": 0.5308482646942139, - "mean_token_accuracy": 0.7845461368560791, - "num_tokens": 17309751.0, + "loss": 0.6275689601898193, + "mean_token_accuracy": 0.7448212057352066, + "num_tokens": 8218297.0, "step": 220 }, { - "entropy": 0.548245832324028, - "epoch": 7.129032258064516, - "grad_norm": 0.0297231525182724, + "entropy": 0.6217603012919426, + "epoch": 1.7152575315840624, + "grad_norm": 0.008550974540412426, "learning_rate": 0.0002, - "loss": 0.5488801598548889, - "mean_token_accuracy": 0.7783880233764648, - "num_tokens": 17388675.0, + "loss": 0.6251344680786133, + "mean_token_accuracy": 0.74727413803339, + "num_tokens": 8255632.0, "step": 221 }, { - "entropy": 0.5462783575057983, - "epoch": 7.161290322580645, - "grad_norm": 0.02872973121702671, + "entropy": 0.6164599433541298, + "epoch": 1.7230320699708455, + "grad_norm": 0.008577285334467888, "learning_rate": 0.0002, - "loss": 0.5400034189224243, - "mean_token_accuracy": 0.7810834497213364, - "num_tokens": 17466936.0, + "loss": 0.6166675090789795, + "mean_token_accuracy": 0.7512230649590492, + "num_tokens": 8292769.0, "step": 222 }, { - "entropy": 0.5517232865095139, - "epoch": 7.193548387096774, - "grad_norm": 0.03185023367404938, + "entropy": 0.619569830596447, + "epoch": 1.7308066083576288, + "grad_norm": 0.008122924715280533, "learning_rate": 0.0002, - "loss": 0.5485620498657227, - "mean_token_accuracy": 0.7789378315210342, - "num_tokens": 17547010.0, + "loss": 0.6211944818496704, + "mean_token_accuracy": 0.7477053627371788, + "num_tokens": 8330358.0, "step": 223 }, { - "entropy": 0.5413918197154999, - "epoch": 7.225806451612903, - "grad_norm": 0.03178510442376137, + "entropy": 0.6090706288814545, + "epoch": 1.738581146744412, + "grad_norm": 0.008728940039873123, "learning_rate": 0.0002, - "loss": 0.5440365076065063, - "mean_token_accuracy": 0.7805528491735458, - "num_tokens": 17625499.0, + "loss": 0.6092976927757263, + "mean_token_accuracy": 0.7530095875263214, + "num_tokens": 8367398.0, "step": 224 }, { - "entropy": 0.5458857864141464, - "epoch": 7.258064516129032, - "grad_norm": 0.03427484259009361, + "entropy": 0.617340199649334, + "epoch": 1.7463556851311952, + "grad_norm": 0.007776155136525631, "learning_rate": 0.0002, - "loss": 0.545717179775238, - "mean_token_accuracy": 0.7795657068490982, - "num_tokens": 17704661.0, + "loss": 0.6156238913536072, + "mean_token_accuracy": 0.7495973780751228, + "num_tokens": 8404907.0, "step": 225 }, { - "entropy": 0.5347914099693298, - "epoch": 7.290322580645161, - "grad_norm": 0.04105692729353905, + "entropy": 0.6192676723003387, + "epoch": 1.7541302235179788, + "grad_norm": 0.008142861537635326, "learning_rate": 0.0002, - "loss": 0.537568211555481, - "mean_token_accuracy": 0.7824617475271225, - "num_tokens": 17783737.0, + "loss": 0.6212935447692871, + "mean_token_accuracy": 0.7502573132514954, + "num_tokens": 8442551.0, "step": 226 }, { - "entropy": 0.5410804450511932, - "epoch": 7.32258064516129, - "grad_norm": 0.027142923325300217, + "entropy": 0.6181206256151199, + "epoch": 1.7619047619047619, + "grad_norm": 0.009585011750459671, "learning_rate": 0.0002, - "loss": 0.5402100086212158, - "mean_token_accuracy": 0.7800760716199875, - "num_tokens": 17861910.0, + "loss": 0.625989556312561, + "mean_token_accuracy": 0.7449588850140572, + "num_tokens": 8480048.0, "step": 227 }, { - "entropy": 0.551323264837265, - "epoch": 7.354838709677419, - "grad_norm": 0.040414851158857346, + "entropy": 0.6096160188317299, + "epoch": 1.7696793002915452, + "grad_norm": 0.008407268673181534, "learning_rate": 0.0002, - "loss": 0.5469727516174316, - "mean_token_accuracy": 0.778721958398819, - "num_tokens": 17939724.0, + "loss": 0.6082819700241089, + "mean_token_accuracy": 0.7547600343823433, + "num_tokens": 8517427.0, "step": 228 }, { - "entropy": 0.5368226915597916, - "epoch": 7.387096774193548, - "grad_norm": 0.037495292723178864, + "entropy": 0.6192163527011871, + "epoch": 1.7774538386783285, + "grad_norm": 0.007702583912760019, "learning_rate": 0.0002, - "loss": 0.5379670858383179, - "mean_token_accuracy": 0.781633272767067, - "num_tokens": 18018788.0, + "loss": 0.6174746751785278, + "mean_token_accuracy": 0.7493149042129517, + "num_tokens": 8554570.0, "step": 229 }, { - "entropy": 0.5478527843952179, - "epoch": 7.419354838709677, - "grad_norm": 0.03409694880247116, + "entropy": 0.6089940667152405, + "epoch": 1.7852283770651116, + "grad_norm": 0.007490647025406361, "learning_rate": 0.0002, - "loss": 0.5442065000534058, - "mean_token_accuracy": 0.7787181437015533, - "num_tokens": 18098265.0, + "loss": 0.6111437082290649, + "mean_token_accuracy": 0.7528351470828056, + "num_tokens": 8591761.0, "step": 230 }, { - "entropy": 0.5493320971727371, - "epoch": 7.451612903225806, - "grad_norm": 0.03359943628311157, + "entropy": 0.6070573329925537, + "epoch": 1.7930029154518952, + "grad_norm": 0.008878695778548717, "learning_rate": 0.0002, - "loss": 0.5459405183792114, - "mean_token_accuracy": 0.7783495485782623, - "num_tokens": 18175715.0, + "loss": 0.6092367172241211, + "mean_token_accuracy": 0.7542654424905777, + "num_tokens": 8628522.0, "step": 231 }, { - "entropy": 0.5432014316320419, - "epoch": 7.483870967741936, - "grad_norm": 0.03568321838974953, + "entropy": 0.617328479886055, + "epoch": 1.8007774538386783, + "grad_norm": 0.008331574499607086, "learning_rate": 0.0002, - "loss": 0.5388095378875732, - "mean_token_accuracy": 0.7820334285497665, - "num_tokens": 18254428.0, + "loss": 0.6187005043029785, + "mean_token_accuracy": 0.7479601725935936, + "num_tokens": 8666140.0, "step": 232 }, { - "entropy": 0.5381491780281067, - "epoch": 7.516129032258064, - "grad_norm": 0.03510123863816261, + "entropy": 0.6115391552448273, + "epoch": 1.8085519922254616, + "grad_norm": 0.0087031414732337, "learning_rate": 0.0002, - "loss": 0.5440586805343628, - "mean_token_accuracy": 0.7799699455499649, - "num_tokens": 18333475.0, + "loss": 0.6169438362121582, + "mean_token_accuracy": 0.7492516785860062, + "num_tokens": 8703399.0, "step": 233 }, { - "entropy": 0.5427374690771103, - "epoch": 7.548387096774194, - "grad_norm": 0.04146914184093475, + "entropy": 0.6166737154126167, + "epoch": 1.816326530612245, + "grad_norm": 0.008778571151196957, "learning_rate": 0.0002, - "loss": 0.5435429215431213, - "mean_token_accuracy": 0.779713585972786, - "num_tokens": 18411870.0, + "loss": 0.6192659139633179, + "mean_token_accuracy": 0.7489692941308022, + "num_tokens": 8741141.0, "step": 234 }, { - "entropy": 0.5446290969848633, - "epoch": 7.580645161290323, - "grad_norm": 0.04291892424225807, + "entropy": 0.6278815269470215, + "epoch": 1.824101068999028, + "grad_norm": 0.008317695930600166, "learning_rate": 0.0002, - "loss": 0.5438494682312012, - "mean_token_accuracy": 0.7800731658935547, - "num_tokens": 18490201.0, + "loss": 0.6227933168411255, + "mean_token_accuracy": 0.7477347627282143, + "num_tokens": 8778706.0, "step": 235 }, { - "entropy": 0.5558793991804123, - "epoch": 7.612903225806452, - "grad_norm": 0.03633000701665878, + "entropy": 0.612150214612484, + "epoch": 1.8318756073858116, + "grad_norm": 0.008878265507519245, "learning_rate": 0.0002, - "loss": 0.5556504726409912, - "mean_token_accuracy": 0.7759376913309097, - "num_tokens": 18568345.0, + "loss": 0.6094038486480713, + "mean_token_accuracy": 0.7539248242974281, + "num_tokens": 8815790.0, "step": 236 }, { - "entropy": 0.5467730015516281, - "epoch": 7.645161290322581, - "grad_norm": 0.037996433675289154, + "entropy": 0.637272298336029, + "epoch": 1.8396501457725947, + "grad_norm": 0.007240319158881903, "learning_rate": 0.0002, - "loss": 0.5422417521476746, - "mean_token_accuracy": 0.7819823771715164, - "num_tokens": 18646506.0, + "loss": 0.6381018757820129, + "mean_token_accuracy": 0.7397879138588905, + "num_tokens": 8853228.0, "step": 237 }, { - "entropy": 0.5440531671047211, - "epoch": 7.67741935483871, - "grad_norm": 0.033006228506565094, + "entropy": 0.6079713776707649, + "epoch": 1.847424684159378, + "grad_norm": 0.008403577841818333, "learning_rate": 0.0002, - "loss": 0.5415350198745728, - "mean_token_accuracy": 0.7817762196063995, - "num_tokens": 18725716.0, + "loss": 0.6132397651672363, + "mean_token_accuracy": 0.750219389796257, + "num_tokens": 8890524.0, "step": 238 }, { - "entropy": 0.5402092933654785, - "epoch": 7.709677419354839, - "grad_norm": 0.04646630957722664, + "entropy": 0.6004362255334854, + "epoch": 1.8551992225461613, + "grad_norm": 0.008654654026031494, "learning_rate": 0.0002, - "loss": 0.5435824990272522, - "mean_token_accuracy": 0.7818535268306732, - "num_tokens": 18803274.0, + "loss": 0.6059733629226685, + "mean_token_accuracy": 0.7544897198677063, + "num_tokens": 8927518.0, "step": 239 }, { - "entropy": 0.5443805754184723, - "epoch": 7.741935483870968, - "grad_norm": 0.03801609203219414, + "entropy": 0.6205713227391243, + "epoch": 1.8629737609329446, + "grad_norm": 0.008852572180330753, "learning_rate": 0.0002, - "loss": 0.5479947328567505, - "mean_token_accuracy": 0.778268352150917, - "num_tokens": 18881044.0, + "loss": 0.6241973638534546, + "mean_token_accuracy": 0.7456497400999069, + "num_tokens": 8964770.0, "step": 240 }, { - "entropy": 0.5582472383975983, - "epoch": 7.774193548387097, - "grad_norm": 0.036031145602464676, + "entropy": 0.6309987902641296, + "epoch": 1.870748299319728, + "grad_norm": 0.00919515173882246, "learning_rate": 0.0002, - "loss": 0.5539592504501343, - "mean_token_accuracy": 0.7765996158123016, - "num_tokens": 18958606.0, + "loss": 0.6267882585525513, + "mean_token_accuracy": 0.7451199591159821, + "num_tokens": 9002039.0, "step": 241 }, { - "entropy": 0.5502520501613617, - "epoch": 7.806451612903226, - "grad_norm": 0.03642534092068672, + "entropy": 0.6201007068157196, + "epoch": 1.878522837706511, + "grad_norm": 0.008951977826654911, "learning_rate": 0.0002, - "loss": 0.5436160564422607, - "mean_token_accuracy": 0.7795243710279465, - "num_tokens": 19038252.0, + "loss": 0.6155404448509216, + "mean_token_accuracy": 0.7500432655215263, + "num_tokens": 9040052.0, "step": 242 }, { - "entropy": 0.5315112918615341, - "epoch": 7.838709677419355, - "grad_norm": 0.031813643872737885, + "entropy": 0.6137275472283363, + "epoch": 1.8862973760932946, + "grad_norm": 0.008249848149716854, "learning_rate": 0.0002, - "loss": 0.5328270196914673, - "mean_token_accuracy": 0.7842982560396194, - "num_tokens": 19116407.0, + "loss": 0.6162374019622803, + "mean_token_accuracy": 0.7486926540732384, + "num_tokens": 9077331.0, "step": 243 }, { - "entropy": 0.5394415557384491, - "epoch": 7.870967741935484, - "grad_norm": 0.03788164630532265, + "entropy": 0.6179945692420006, + "epoch": 1.8940719144800777, + "grad_norm": 0.008306370116770267, "learning_rate": 0.0002, - "loss": 0.5444040298461914, - "mean_token_accuracy": 0.7799783796072006, - "num_tokens": 19195585.0, + "loss": 0.6247057914733887, + "mean_token_accuracy": 0.7457103058695793, + "num_tokens": 9114582.0, "step": 244 }, { - "entropy": 0.5485299974679947, - "epoch": 7.903225806451613, - "grad_norm": 0.044309306889772415, + "entropy": 0.6145003139972687, + "epoch": 1.901846452866861, + "grad_norm": 0.009250648319721222, "learning_rate": 0.0002, - "loss": 0.5483869314193726, - "mean_token_accuracy": 0.7791053205728531, - "num_tokens": 19273583.0, + "loss": 0.6231353282928467, + "mean_token_accuracy": 0.7480179741978645, + "num_tokens": 9152485.0, "step": 245 }, { - "entropy": 0.542279988527298, - "epoch": 7.935483870967742, - "grad_norm": 0.03189428895711899, + "entropy": 0.6100682318210602, + "epoch": 1.9096209912536444, + "grad_norm": 0.008305463939905167, "learning_rate": 0.0002, - "loss": 0.5314847826957703, - "mean_token_accuracy": 0.7860700339078903, - "num_tokens": 19353829.0, + "loss": 0.61110520362854, + "mean_token_accuracy": 0.7516937106847763, + "num_tokens": 9189875.0, "step": 246 }, { - "entropy": 0.5488948225975037, - "epoch": 7.967741935483871, - "grad_norm": 0.03813633695244789, + "entropy": 0.6206101104617119, + "epoch": 1.9173955296404275, + "grad_norm": 0.009909824468195438, "learning_rate": 0.0002, - "loss": 0.5496359467506409, - "mean_token_accuracy": 0.7778913676738739, - "num_tokens": 19431439.0, + "loss": 0.6180837154388428, + "mean_token_accuracy": 0.7495366632938385, + "num_tokens": 9227450.0, "step": 247 }, { - "entropy": 0.5444356352090836, - "epoch": 8.0, - "grad_norm": 0.028016965836286545, + "entropy": 0.6217730790376663, + "epoch": 1.925170068027211, + "grad_norm": 0.008246448822319508, "learning_rate": 0.0002, - "loss": 0.5397998690605164, - "mean_token_accuracy": 0.7827391028404236, - "num_tokens": 19510222.0, + "loss": 0.6189583539962769, + "mean_token_accuracy": 0.7493142858147621, + "num_tokens": 9265223.0, "step": 248 }, { - "entropy": 0.5289585143327713, - "epoch": 8.03225806451613, - "grad_norm": 0.030331183224916458, + "entropy": 0.6133992001414299, + "epoch": 1.9329446064139941, + "grad_norm": 0.007729528471827507, "learning_rate": 0.0002, - "loss": 0.5258626937866211, - "mean_token_accuracy": 0.7890947312116623, - "num_tokens": 19589365.0, + "loss": 0.6164335608482361, + "mean_token_accuracy": 0.7500994428992271, + "num_tokens": 9302597.0, "step": 249 }, { - "entropy": 0.5283683687448502, - "epoch": 8.064516129032258, - "grad_norm": 0.041665561497211456, + "entropy": 0.596331886947155, + "epoch": 1.9407191448007775, + "grad_norm": 0.00885640550404787, "learning_rate": 0.0002, - "loss": 0.5343490242958069, - "mean_token_accuracy": 0.7842156440019608, - "num_tokens": 19667843.0, + "loss": 0.6054399013519287, + "mean_token_accuracy": 0.7546022981405258, + "num_tokens": 9339665.0, "step": 250 }, { - "entropy": 0.5371775776147842, - "epoch": 8.096774193548388, - "grad_norm": 0.031220240518450737, + "entropy": 0.6010145470499992, + "epoch": 1.9484936831875608, + "grad_norm": 0.00908851157873869, "learning_rate": 0.0002, - "loss": 0.5383769273757935, - "mean_token_accuracy": 0.7812917083501816, - "num_tokens": 19745970.0, + "loss": 0.6051974296569824, + "mean_token_accuracy": 0.7543318867683411, + "num_tokens": 9376514.0, "step": 251 }, { - "entropy": 0.535509005188942, - "epoch": 8.129032258064516, - "grad_norm": 0.034565962851047516, + "entropy": 0.6160777136683464, + "epoch": 1.9562682215743439, + "grad_norm": 0.008100342005491257, "learning_rate": 0.0002, - "loss": 0.5311164855957031, - "mean_token_accuracy": 0.7854022979736328, - "num_tokens": 19823505.0, + "loss": 0.6146577000617981, + "mean_token_accuracy": 0.7485847100615501, + "num_tokens": 9414214.0, "step": 252 }, { - "entropy": 0.5520065724849701, - "epoch": 8.161290322580646, - "grad_norm": 0.037510838359594345, + "entropy": 0.6268075257539749, + "epoch": 1.9640427599611274, + "grad_norm": 0.009163864888250828, "learning_rate": 0.0002, - "loss": 0.5506926774978638, - "mean_token_accuracy": 0.7766683101654053, - "num_tokens": 19902880.0, + "loss": 0.6204258799552917, + "mean_token_accuracy": 0.7494765147566795, + "num_tokens": 9451946.0, "step": 253 }, { - "entropy": 0.5412134379148483, - "epoch": 8.193548387096774, - "grad_norm": 0.03456275537610054, + "entropy": 0.6106092482805252, + "epoch": 1.9718172983479105, + "grad_norm": 0.007819678634405136, "learning_rate": 0.0002, - "loss": 0.5416734218597412, - "mean_token_accuracy": 0.780981183052063, - "num_tokens": 19981523.0, + "loss": 0.6087175011634827, + "mean_token_accuracy": 0.7527309507131577, + "num_tokens": 9489076.0, "step": 254 }, { - "entropy": 0.5260696411132812, - "epoch": 8.225806451612904, - "grad_norm": 0.04149680584669113, + "entropy": 0.6168656274676323, + "epoch": 1.9795918367346939, + "grad_norm": 0.007515368517488241, "learning_rate": 0.0002, - "loss": 0.5258564949035645, - "mean_token_accuracy": 0.7856866270303726, - "num_tokens": 20060057.0, + "loss": 0.6177273392677307, + "mean_token_accuracy": 0.751363955438137, + "num_tokens": 9526620.0, "step": 255 }, { - "entropy": 0.5432638376951218, - "epoch": 8.258064516129032, - "grad_norm": 0.03363949432969093, + "entropy": 0.6079138219356537, + "epoch": 1.9873663751214772, + "grad_norm": 0.009815288707613945, "learning_rate": 0.0002, - "loss": 0.5418345928192139, - "mean_token_accuracy": 0.7798439264297485, - "num_tokens": 20138196.0, + "loss": 0.6155093312263489, + "mean_token_accuracy": 0.7523162961006165, + "num_tokens": 9564466.0, "step": 256 }, { - "entropy": 0.5362787991762161, - "epoch": 8.290322580645162, - "grad_norm": 0.039886943995952606, + "entropy": 0.6036990880966187, + "epoch": 1.9951409135082603, + "grad_norm": 0.008685542270541191, "learning_rate": 0.0002, - "loss": 0.5321515798568726, - "mean_token_accuracy": 0.7850725948810577, - "num_tokens": 20217064.0, + "loss": 0.6101571917533875, + "mean_token_accuracy": 0.7522860541939735, + "num_tokens": 9601565.0, "step": 257 }, { - "entropy": 0.5206107646226883, - "epoch": 8.32258064516129, - "grad_norm": 0.03769670054316521, + "entropy": 0.6164417505264282, + "epoch": 2.0, + "grad_norm": 0.010608273558318615, "learning_rate": 0.0002, - "loss": 0.5199801921844482, - "mean_token_accuracy": 0.789309486746788, - "num_tokens": 20296824.0, + "loss": 0.6168809533119202, + "mean_token_accuracy": 0.7516962647438049, + "num_tokens": 9625165.0, "step": 258 }, { - "entropy": 0.533658817410469, - "epoch": 8.35483870967742, - "grad_norm": 0.044177986681461334, + "entropy": 0.6057095304131508, + "epoch": 2.007774538386783, + "grad_norm": 0.009618077427148819, "learning_rate": 0.0002, - "loss": 0.5321055054664612, - "mean_token_accuracy": 0.7848184555768967, - "num_tokens": 20375664.0, + "loss": 0.6003708839416504, + "mean_token_accuracy": 0.7543603405356407, + "num_tokens": 9662658.0, "step": 259 }, { - "entropy": 0.5468465983867645, - "epoch": 8.387096774193548, - "grad_norm": 0.04525522515177727, + "entropy": 0.6160204112529755, + "epoch": 2.0155490767735667, + "grad_norm": 0.007366312202066183, "learning_rate": 0.0002, - "loss": 0.5517196655273438, - "mean_token_accuracy": 0.7764200270175934, - "num_tokens": 20452975.0, + "loss": 0.6107323169708252, + "mean_token_accuracy": 0.751634031534195, + "num_tokens": 9700423.0, "step": 260 }, { - "entropy": 0.5353173762559891, - "epoch": 8.419354838709678, - "grad_norm": 0.03942183405160904, + "entropy": 0.6157180666923523, + "epoch": 2.0233236151603498, + "grad_norm": 0.008381242863833904, "learning_rate": 0.0002, - "loss": 0.5361676216125488, - "mean_token_accuracy": 0.7836414724588394, - "num_tokens": 20529996.0, + "loss": 0.6190871596336365, + "mean_token_accuracy": 0.7481335178017616, + "num_tokens": 9737692.0, "step": 261 }, { - "entropy": 0.5416340827941895, - "epoch": 8.451612903225806, - "grad_norm": 0.0363653190433979, + "entropy": 0.6075473129749298, + "epoch": 2.0310981535471333, + "grad_norm": 0.010082116350531578, "learning_rate": 0.0002, - "loss": 0.5382126569747925, - "mean_token_accuracy": 0.7817256599664688, - "num_tokens": 20608526.0, + "loss": 0.6141625642776489, + "mean_token_accuracy": 0.7516499608755112, + "num_tokens": 9775062.0, "step": 262 }, { - "entropy": 0.5331941545009613, - "epoch": 8.483870967741936, - "grad_norm": 0.03704048693180084, + "entropy": 0.6151047423481941, + "epoch": 2.0388726919339164, + "grad_norm": 0.009529951959848404, "learning_rate": 0.0002, - "loss": 0.5287242531776428, - "mean_token_accuracy": 0.7847851067781448, - "num_tokens": 20688137.0, + "loss": 0.6205469965934753, + "mean_token_accuracy": 0.7464399412274361, + "num_tokens": 9812526.0, "step": 263 }, { - "entropy": 0.5385544896125793, - "epoch": 8.516129032258064, - "grad_norm": 0.03550460934638977, + "entropy": 0.6053090617060661, + "epoch": 2.0466472303206995, + "grad_norm": 0.008532468229532242, "learning_rate": 0.0002, - "loss": 0.5389328002929688, - "mean_token_accuracy": 0.7807945758104324, - "num_tokens": 20766079.0, + "loss": 0.604971170425415, + "mean_token_accuracy": 0.7544130459427834, + "num_tokens": 9849685.0, "step": 264 }, { - "entropy": 0.5371405631303787, - "epoch": 8.548387096774194, - "grad_norm": 0.034064196050167084, + "entropy": 0.6305021941661835, + "epoch": 2.054421768707483, + "grad_norm": 0.009080994874238968, "learning_rate": 0.0002, - "loss": 0.5364264249801636, - "mean_token_accuracy": 0.7841684371232986, - "num_tokens": 20845237.0, + "loss": 0.6241769790649414, + "mean_token_accuracy": 0.7455881908535957, + "num_tokens": 9887441.0, "step": 265 }, { - "entropy": 0.5327372252941132, - "epoch": 8.580645161290322, - "grad_norm": 0.04183376953005791, + "entropy": 0.6111467704176903, + "epoch": 2.062196307094266, + "grad_norm": 0.008834858424961567, "learning_rate": 0.0002, - "loss": 0.5354538559913635, - "mean_token_accuracy": 0.7825859487056732, - "num_tokens": 20923137.0, + "loss": 0.6073428392410278, + "mean_token_accuracy": 0.7530370578169823, + "num_tokens": 9924611.0, "step": 266 }, { - "entropy": 0.550455629825592, - "epoch": 8.612903225806452, - "grad_norm": 0.04953514039516449, + "entropy": 0.6218099594116211, + "epoch": 2.0699708454810497, + "grad_norm": 0.009297652170062065, "learning_rate": 0.0002, - "loss": 0.5466119050979614, - "mean_token_accuracy": 0.7782289534807205, - "num_tokens": 21001585.0, + "loss": 0.6261637806892395, + "mean_token_accuracy": 0.7442486062645912, + "num_tokens": 9962409.0, "step": 267 }, { - "entropy": 0.5444563925266266, - "epoch": 8.64516129032258, - "grad_norm": 0.03682374581694603, + "entropy": 0.620900422334671, + "epoch": 2.077745383867833, + "grad_norm": 0.012807542458176613, "learning_rate": 0.0002, - "loss": 0.5486843585968018, - "mean_token_accuracy": 0.7768545746803284, - "num_tokens": 21079550.0, + "loss": 0.6319394111633301, + "mean_token_accuracy": 0.7447366267442703, + "num_tokens": 9999911.0, "step": 268 }, { - "entropy": 0.5407392978668213, - "epoch": 8.67741935483871, - "grad_norm": 0.03509804606437683, + "entropy": 0.6219062060117722, + "epoch": 2.0855199222546164, + "grad_norm": 0.008311600424349308, "learning_rate": 0.0002, - "loss": 0.5428568124771118, - "mean_token_accuracy": 0.7798480093479156, - "num_tokens": 21158113.0, + "loss": 0.6196457147598267, + "mean_token_accuracy": 0.7454339265823364, + "num_tokens": 10037309.0, "step": 269 }, { - "entropy": 0.5410716235637665, - "epoch": 8.709677419354838, - "grad_norm": 0.05400121584534645, + "entropy": 0.6179447770118713, + "epoch": 2.0932944606413995, + "grad_norm": 0.010762435384094715, "learning_rate": 0.0002, - "loss": 0.5374223589897156, - "mean_token_accuracy": 0.7816896289587021, - "num_tokens": 21236915.0, + "loss": 0.6135507822036743, + "mean_token_accuracy": 0.7513665333390236, + "num_tokens": 10074802.0, "step": 270 }, { - "entropy": 0.5346012562513351, - "epoch": 8.741935483870968, - "grad_norm": 0.05865916237235069, + "entropy": 0.6114057898521423, + "epoch": 2.1010689990281826, + "grad_norm": 0.009498962201178074, "learning_rate": 0.0002, - "loss": 0.5330258011817932, - "mean_token_accuracy": 0.7844430059194565, - "num_tokens": 21316149.0, + "loss": 0.6119563579559326, + "mean_token_accuracy": 0.7511925473809242, + "num_tokens": 10112087.0, "step": 271 }, { - "entropy": 0.5349076390266418, - "epoch": 8.774193548387096, - "grad_norm": 0.04287338629364967, + "entropy": 0.5985657572746277, + "epoch": 2.108843537414966, + "grad_norm": 0.00927242822945118, "learning_rate": 0.0002, - "loss": 0.5328216552734375, - "mean_token_accuracy": 0.7840270400047302, - "num_tokens": 21395461.0, + "loss": 0.6077044010162354, + "mean_token_accuracy": 0.751846119761467, + "num_tokens": 10149470.0, "step": 272 }, { - "entropy": 0.5366696864366531, - "epoch": 8.806451612903226, - "grad_norm": 0.03183649480342865, + "entropy": 0.5983473360538483, + "epoch": 2.116618075801749, + "grad_norm": 0.011125227436423302, "learning_rate": 0.0002, - "loss": 0.5360084772109985, - "mean_token_accuracy": 0.7832410633563995, - "num_tokens": 21474171.0, + "loss": 0.6070785522460938, + "mean_token_accuracy": 0.7521045431494713, + "num_tokens": 10187018.0, "step": 273 }, { - "entropy": 0.5488806217908859, - "epoch": 8.838709677419354, - "grad_norm": 0.03919295594096184, + "entropy": 0.6010436862707138, + "epoch": 2.1243926141885328, + "grad_norm": 0.008612287230789661, "learning_rate": 0.0002, - "loss": 0.5487998723983765, - "mean_token_accuracy": 0.7769176214933395, - "num_tokens": 21553568.0, + "loss": 0.6019182205200195, + "mean_token_accuracy": 0.7563453242182732, + "num_tokens": 10224534.0, "step": 274 }, { - "entropy": 0.5357145518064499, - "epoch": 8.870967741935484, - "grad_norm": 0.02984362095594406, + "entropy": 0.6097739785909653, + "epoch": 2.132167152575316, + "grad_norm": 0.009082912467420101, "learning_rate": 0.0002, - "loss": 0.5326351523399353, - "mean_token_accuracy": 0.7843077331781387, - "num_tokens": 21632757.0, + "loss": 0.6092417240142822, + "mean_token_accuracy": 0.7527365237474442, + "num_tokens": 10261606.0, "step": 275 }, { - "entropy": 0.5395043194293976, - "epoch": 8.903225806451612, - "grad_norm": 0.033653538674116135, + "entropy": 0.6300967186689377, + "epoch": 2.139941690962099, + "grad_norm": 0.00942782312631607, "learning_rate": 0.0002, - "loss": 0.536690354347229, - "mean_token_accuracy": 0.7822536379098892, - "num_tokens": 21712646.0, + "loss": 0.6258421540260315, + "mean_token_accuracy": 0.7469290718436241, + "num_tokens": 10299180.0, "step": 276 }, { - "entropy": 0.5327845886349678, - "epoch": 8.935483870967742, - "grad_norm": 0.035915497690439224, + "entropy": 0.6028410047292709, + "epoch": 2.1477162293488825, + "grad_norm": 0.008522949181497097, "learning_rate": 0.0002, - "loss": 0.5334969758987427, - "mean_token_accuracy": 0.7827408462762833, - "num_tokens": 21791364.0, + "loss": 0.6008127927780151, + "mean_token_accuracy": 0.7564279735088348, + "num_tokens": 10336360.0, "step": 277 }, { - "entropy": 0.5245150029659271, - "epoch": 8.967741935483872, - "grad_norm": 0.03674691170454025, + "entropy": 0.6102243736386299, + "epoch": 2.1554907677356656, + "grad_norm": 0.010031149722635746, "learning_rate": 0.0002, - "loss": 0.5283703804016113, - "mean_token_accuracy": 0.7849698960781097, - "num_tokens": 21869790.0, + "loss": 0.6199367046356201, + "mean_token_accuracy": 0.7469272315502167, + "num_tokens": 10373565.0, "step": 278 }, { - "entropy": 0.5436734557151794, - "epoch": 9.0, - "grad_norm": 0.03945446386933327, + "entropy": 0.6027829498052597, + "epoch": 2.163265306122449, + "grad_norm": 0.008753525093197823, "learning_rate": 0.0002, - "loss": 0.5423560738563538, - "mean_token_accuracy": 0.7805917263031006, - "num_tokens": 21949007.0, + "loss": 0.6074038147926331, + "mean_token_accuracy": 0.7534594535827637, + "num_tokens": 10411197.0, "step": 279 }, { - "entropy": 0.5403507351875305, - "epoch": 9.03225806451613, - "grad_norm": 0.040384337306022644, + "entropy": 0.6299364790320396, + "epoch": 2.1710398445092323, + "grad_norm": 0.007901565171778202, "learning_rate": 0.0002, - "loss": 0.5335516929626465, - "mean_token_accuracy": 0.784522145986557, - "num_tokens": 22026156.0, + "loss": 0.6327069401741028, + "mean_token_accuracy": 0.7429891973733902, + "num_tokens": 10448851.0, "step": 280 }, { - "entropy": 0.5205833613872528, - "epoch": 9.064516129032258, - "grad_norm": 0.03210374340415001, + "entropy": 0.623109444975853, + "epoch": 2.1788143828960154, + "grad_norm": 0.008401944302022457, "learning_rate": 0.0002, - "loss": 0.5193948745727539, - "mean_token_accuracy": 0.7887756377458572, - "num_tokens": 22104932.0, + "loss": 0.6217602491378784, + "mean_token_accuracy": 0.7446876764297485, + "num_tokens": 10486285.0, "step": 281 }, { - "entropy": 0.5186300128698349, - "epoch": 9.096774193548388, - "grad_norm": 0.043942417949438095, + "entropy": 0.5951671376824379, + "epoch": 2.186588921282799, + "grad_norm": 0.009740160778164864, "learning_rate": 0.0002, - "loss": 0.5202578902244568, - "mean_token_accuracy": 0.7897594273090363, - "num_tokens": 22182744.0, + "loss": 0.5930252075195312, + "mean_token_accuracy": 0.7590748071670532, + "num_tokens": 10523187.0, "step": 282 }, { - "entropy": 0.513887882232666, - "epoch": 9.129032258064516, - "grad_norm": 0.052492085844278336, + "entropy": 0.6063435301184654, + "epoch": 2.194363459669582, + "grad_norm": 0.008115135133266449, "learning_rate": 0.0002, - "loss": 0.5176864862442017, - "mean_token_accuracy": 0.790604293346405, - "num_tokens": 22262340.0, + "loss": 0.6058975458145142, + "mean_token_accuracy": 0.7546751350164413, + "num_tokens": 10560619.0, "step": 283 }, { - "entropy": 0.5307815670967102, - "epoch": 9.161290322580646, - "grad_norm": 0.050507497042417526, + "entropy": 0.6197424605488777, + "epoch": 2.2021379980563656, + "grad_norm": 0.007982614450156689, "learning_rate": 0.0002, - "loss": 0.5187040567398071, - "mean_token_accuracy": 0.7905398905277252, - "num_tokens": 22342518.0, + "loss": 0.6196328401565552, + "mean_token_accuracy": 0.7473800256848335, + "num_tokens": 10597952.0, "step": 284 }, { - "entropy": 0.5250707566738129, - "epoch": 9.193548387096774, - "grad_norm": 0.04122259095311165, + "entropy": 0.5975362882018089, + "epoch": 2.2099125364431487, + "grad_norm": 0.008934210054576397, "learning_rate": 0.0002, - "loss": 0.5248624086380005, - "mean_token_accuracy": 0.787539929151535, - "num_tokens": 22421363.0, + "loss": 0.6019341945648193, + "mean_token_accuracy": 0.7551193311810493, + "num_tokens": 10635474.0, "step": 285 }, { - "entropy": 0.5179962068796158, - "epoch": 9.225806451612904, - "grad_norm": 0.062456656247377396, + "entropy": 0.6057508885860443, + "epoch": 2.2176870748299318, + "grad_norm": 0.007894222624599934, "learning_rate": 0.0002, - "loss": 0.5286165475845337, - "mean_token_accuracy": 0.7862128764390945, - "num_tokens": 22500411.0, + "loss": 0.6054433584213257, + "mean_token_accuracy": 0.7555015385150909, + "num_tokens": 10672866.0, "step": 286 }, { - "entropy": 0.5425870567560196, - "epoch": 9.258064516129032, - "grad_norm": 0.05237641558051109, + "entropy": 0.6011307016015053, + "epoch": 2.2254616132167153, + "grad_norm": 0.008009341545403004, "learning_rate": 0.0002, - "loss": 0.5357320308685303, - "mean_token_accuracy": 0.7818474918603897, - "num_tokens": 22578954.0, + "loss": 0.6015121936798096, + "mean_token_accuracy": 0.7533531039953232, + "num_tokens": 10710119.0, "step": 287 }, { - "entropy": 0.5489015877246857, - "epoch": 9.290322580645162, - "grad_norm": 0.04592309519648552, + "entropy": 0.6083035543560982, + "epoch": 2.2332361516034984, + "grad_norm": 0.008571778424084187, "learning_rate": 0.0002, - "loss": 0.5391058921813965, - "mean_token_accuracy": 0.781953975558281, - "num_tokens": 22656865.0, + "loss": 0.6072158813476562, + "mean_token_accuracy": 0.7525660693645477, + "num_tokens": 10747533.0, "step": 288 }, { - "entropy": 0.5262634605169296, - "epoch": 9.32258064516129, - "grad_norm": 0.04665505513548851, + "entropy": 0.596297912299633, + "epoch": 2.241010689990282, + "grad_norm": 0.007835134863853455, "learning_rate": 0.0002, - "loss": 0.5303994417190552, - "mean_token_accuracy": 0.784704178571701, - "num_tokens": 22734848.0, + "loss": 0.6007227897644043, + "mean_token_accuracy": 0.75400510430336, + "num_tokens": 10784600.0, "step": 289 }, { - "entropy": 0.5207262188196182, - "epoch": 9.35483870967742, - "grad_norm": 0.06092476472258568, + "entropy": 0.6027623787522316, + "epoch": 2.248785228377065, + "grad_norm": 0.00971238687634468, "learning_rate": 0.0002, - "loss": 0.5245224237442017, - "mean_token_accuracy": 0.7855150699615479, - "num_tokens": 22813242.0, + "loss": 0.6095942258834839, + "mean_token_accuracy": 0.753618136048317, + "num_tokens": 10822085.0, "step": 290 }, { - "entropy": 0.5316435396671295, - "epoch": 9.387096774193548, - "grad_norm": 0.05380527302622795, + "entropy": 0.596187099814415, + "epoch": 2.256559766763848, + "grad_norm": 0.008036565966904163, "learning_rate": 0.0002, - "loss": 0.5261737108230591, - "mean_token_accuracy": 0.7874870747327805, - "num_tokens": 22892873.0, + "loss": 0.5973517298698425, + "mean_token_accuracy": 0.7577640637755394, + "num_tokens": 10859362.0, "step": 291 }, { - "entropy": 0.5344062894582748, - "epoch": 9.419354838709678, - "grad_norm": 0.04123701527714729, + "entropy": 0.6243500411510468, + "epoch": 2.2643343051506317, + "grad_norm": 0.00934487022459507, "learning_rate": 0.0002, - "loss": 0.5327101945877075, - "mean_token_accuracy": 0.7833229005336761, - "num_tokens": 22971116.0, + "loss": 0.6226072311401367, + "mean_token_accuracy": 0.7454966679215431, + "num_tokens": 10896757.0, "step": 292 }, { - "entropy": 0.524382010102272, - "epoch": 9.451612903225806, - "grad_norm": 0.08812697976827621, + "entropy": 0.6136296838521957, + "epoch": 2.272108843537415, + "grad_norm": 0.008677436038851738, "learning_rate": 0.0002, - "loss": 0.5324304103851318, - "mean_token_accuracy": 0.7840967774391174, - "num_tokens": 23049380.0, + "loss": 0.615119457244873, + "mean_token_accuracy": 0.750088632106781, + "num_tokens": 10934016.0, "step": 293 }, { - "entropy": 0.5306137502193451, - "epoch": 9.483870967741936, - "grad_norm": 0.08938439935445786, + "entropy": 0.5983113646507263, + "epoch": 2.2798833819241984, + "grad_norm": 0.007704727817326784, "learning_rate": 0.0002, - "loss": 0.5269825458526611, - "mean_token_accuracy": 0.7875665426254272, - "num_tokens": 23128218.0, + "loss": 0.5992428064346313, + "mean_token_accuracy": 0.7575259953737259, + "num_tokens": 10971732.0, "step": 294 }, { - "entropy": 0.5367314219474792, - "epoch": 9.516129032258064, - "grad_norm": 0.05447512865066528, + "entropy": 0.602768175303936, + "epoch": 2.2876579203109815, + "grad_norm": 0.008800746873021126, "learning_rate": 0.0002, - "loss": 0.5286938548088074, - "mean_token_accuracy": 0.7865005433559418, - "num_tokens": 23207525.0, + "loss": 0.6059098243713379, + "mean_token_accuracy": 0.7514860853552818, + "num_tokens": 11009363.0, "step": 295 }, { - "entropy": 0.5252849012613297, - "epoch": 9.548387096774194, - "grad_norm": 0.06832025945186615, + "entropy": 0.6180300787091255, + "epoch": 2.295432458697765, + "grad_norm": 0.009863065555691719, "learning_rate": 0.0002, - "loss": 0.5257875323295593, - "mean_token_accuracy": 0.7862931191921234, - "num_tokens": 23287210.0, + "loss": 0.6232578754425049, + "mean_token_accuracy": 0.7460011914372444, + "num_tokens": 11046850.0, "step": 296 }, { - "entropy": 0.5178247690200806, - "epoch": 9.580645161290322, - "grad_norm": 0.09167063236236572, + "entropy": 0.615628756582737, + "epoch": 2.303206997084548, + "grad_norm": 0.00794578343629837, "learning_rate": 0.0002, - "loss": 0.5258931517601013, - "mean_token_accuracy": 0.7874697148799896, - "num_tokens": 23366831.0, + "loss": 0.6193504929542542, + "mean_token_accuracy": 0.7466345354914665, + "num_tokens": 11084028.0, "step": 297 }, { - "entropy": 0.5381314009428024, - "epoch": 9.612903225806452, - "grad_norm": 0.05428946390748024, + "entropy": 0.6079032048583031, + "epoch": 2.3109815354713312, + "grad_norm": 0.008673022501170635, "learning_rate": 0.0002, - "loss": 0.5342376232147217, - "mean_token_accuracy": 0.7819546610116959, - "num_tokens": 23445938.0, + "loss": 0.6060619354248047, + "mean_token_accuracy": 0.7532483711838722, + "num_tokens": 11121691.0, "step": 298 }, { - "entropy": 0.5478924512863159, - "epoch": 9.64516129032258, - "grad_norm": 0.06756260246038437, + "entropy": 0.6126295253634453, + "epoch": 2.3187560738581148, + "grad_norm": 0.010211586020886898, "learning_rate": 0.0002, - "loss": 0.5411292314529419, - "mean_token_accuracy": 0.781807467341423, - "num_tokens": 23523910.0, + "loss": 0.6097185611724854, + "mean_token_accuracy": 0.7503807097673416, + "num_tokens": 11159118.0, "step": 299 }, { - "entropy": 0.5383109152317047, - "epoch": 9.67741935483871, - "grad_norm": 0.07821021974086761, + "entropy": 0.6223906055092812, + "epoch": 2.326530612244898, + "grad_norm": 0.007925095036625862, "learning_rate": 0.0002, - "loss": 0.5393465757369995, - "mean_token_accuracy": 0.7826394438743591, - "num_tokens": 23602935.0, + "loss": 0.6250431537628174, + "mean_token_accuracy": 0.7459972500801086, + "num_tokens": 11196522.0, "step": 300 }, { - "entropy": 0.5300856381654739, - "epoch": 9.709677419354838, - "grad_norm": 0.05791868641972542, + "entropy": 0.6105447709560394, + "epoch": 2.3343051506316814, + "grad_norm": 0.008913103491067886, "learning_rate": 0.0002, - "loss": 0.5366538763046265, - "mean_token_accuracy": 0.7823646813631058, - "num_tokens": 23680706.0, + "loss": 0.616736114025116, + "mean_token_accuracy": 0.749770350754261, + "num_tokens": 11234173.0, "step": 301 }, { - "entropy": 0.5394613444805145, - "epoch": 9.741935483870968, - "grad_norm": 0.07757086306810379, + "entropy": 0.6050237938761711, + "epoch": 2.3420796890184645, + "grad_norm": 0.00913191493600607, "learning_rate": 0.0002, - "loss": 0.5367089509963989, - "mean_token_accuracy": 0.78324094414711, - "num_tokens": 23759268.0, + "loss": 0.6078106164932251, + "mean_token_accuracy": 0.7534833922982216, + "num_tokens": 11271528.0, "step": 302 }, { - "entropy": 0.5447310507297516, - "epoch": 9.774193548387096, - "grad_norm": 0.049349840730428696, + "entropy": 0.624389261007309, + "epoch": 2.3498542274052476, + "grad_norm": 0.00800058338791132, "learning_rate": 0.0002, - "loss": 0.5364006757736206, - "mean_token_accuracy": 0.7828964740037918, - "num_tokens": 23837981.0, + "loss": 0.624384880065918, + "mean_token_accuracy": 0.7484247088432312, + "num_tokens": 11309275.0, "step": 303 }, { - "entropy": 0.5333449840545654, - "epoch": 9.806451612903226, - "grad_norm": 0.06826647371053696, + "entropy": 0.621875673532486, + "epoch": 2.357628765792031, + "grad_norm": 0.009797596372663975, "learning_rate": 0.0002, - "loss": 0.53536057472229, - "mean_token_accuracy": 0.7834214121103287, - "num_tokens": 23915246.0, + "loss": 0.6190812587738037, + "mean_token_accuracy": 0.7491643279790878, + "num_tokens": 11346386.0, "step": 304 }, { - "entropy": 0.5236239582300186, - "epoch": 9.838709677419354, - "grad_norm": 0.06063172593712807, + "entropy": 0.6205748915672302, + "epoch": 2.3654033041788143, + "grad_norm": 0.009043901227414608, "learning_rate": 0.0002, - "loss": 0.526973307132721, - "mean_token_accuracy": 0.7862582057714462, - "num_tokens": 23993749.0, + "loss": 0.616840124130249, + "mean_token_accuracy": 0.7496623322367668, + "num_tokens": 11383273.0, "step": 305 }, { - "entropy": 0.5442259162664413, - "epoch": 9.870967741935484, - "grad_norm": 0.0450434610247612, + "entropy": 0.5943257734179497, + "epoch": 2.373177842565598, + "grad_norm": 0.009680100716650486, "learning_rate": 0.0002, - "loss": 0.5387926697731018, - "mean_token_accuracy": 0.7815881818532944, - "num_tokens": 24072030.0, + "loss": 0.6005733013153076, + "mean_token_accuracy": 0.7566492632031441, + "num_tokens": 11420226.0, "step": 306 }, { - "entropy": 0.5275344997644424, - "epoch": 9.903225806451612, - "grad_norm": 0.04751954600214958, + "entropy": 0.5875989943742752, + "epoch": 2.380952380952381, + "grad_norm": 0.009831924922764301, "learning_rate": 0.0002, - "loss": 0.5248628258705139, - "mean_token_accuracy": 0.7874411344528198, - "num_tokens": 24152020.0, + "loss": 0.5920431613922119, + "mean_token_accuracy": 0.758441336452961, + "num_tokens": 11457658.0, "step": 307 }, { - "entropy": 0.5380201190710068, - "epoch": 9.935483870967742, - "grad_norm": 0.04302695393562317, + "entropy": 0.605907216668129, + "epoch": 2.388726919339164, + "grad_norm": 0.008310995064675808, "learning_rate": 0.0002, - "loss": 0.538284420967102, - "mean_token_accuracy": 0.7823643535375595, - "num_tokens": 24230082.0, + "loss": 0.606610894203186, + "mean_token_accuracy": 0.7539205178618431, + "num_tokens": 11495093.0, "step": 308 }, { - "entropy": 0.5229910910129547, - "epoch": 9.967741935483872, - "grad_norm": 0.0525338277220726, + "entropy": 0.6085820719599724, + "epoch": 2.3965014577259476, + "grad_norm": 0.008422457613050938, "learning_rate": 0.0002, - "loss": 0.5264443159103394, - "mean_token_accuracy": 0.786424458026886, - "num_tokens": 24309618.0, + "loss": 0.6112357378005981, + "mean_token_accuracy": 0.7495599314570427, + "num_tokens": 11532305.0, "step": 309 }, { - "entropy": 0.5351384729146957, - "epoch": 10.0, - "grad_norm": 0.04153383523225784, + "entropy": 0.6038077920675278, + "epoch": 2.4042759961127307, + "grad_norm": 0.009313938207924366, "learning_rate": 0.0002, - "loss": 0.5313504934310913, - "mean_token_accuracy": 0.7846148610115051, - "num_tokens": 24387187.0, + "loss": 0.6037260293960571, + "mean_token_accuracy": 0.7537373602390289, + "num_tokens": 11569956.0, "step": 310 + }, + { + "entropy": 0.6088597327470779, + "epoch": 2.4120505344995142, + "grad_norm": 0.008129115216434002, + "learning_rate": 0.0002, + "loss": 0.6097284555435181, + "mean_token_accuracy": 0.752282939851284, + "num_tokens": 11607580.0, + "step": 311 + }, + { + "entropy": 0.6035630702972412, + "epoch": 2.4198250728862973, + "grad_norm": 0.010189153254032135, + "learning_rate": 0.0002, + "loss": 0.6098878383636475, + "mean_token_accuracy": 0.7509205341339111, + "num_tokens": 11645065.0, + "step": 312 + }, + { + "entropy": 0.5988744720816612, + "epoch": 2.427599611273081, + "grad_norm": 0.008477658964693546, + "learning_rate": 0.0002, + "loss": 0.600048840045929, + "mean_token_accuracy": 0.7566671743988991, + "num_tokens": 11682523.0, + "step": 313 + }, + { + "entropy": 0.604704961180687, + "epoch": 2.435374149659864, + "grad_norm": 0.009996007196605206, + "learning_rate": 0.0002, + "loss": 0.6124827861785889, + "mean_token_accuracy": 0.7483595088124275, + "num_tokens": 11719829.0, + "step": 314 + }, + { + "entropy": 0.6142484471201897, + "epoch": 2.443148688046647, + "grad_norm": 0.008275930769741535, + "learning_rate": 0.0002, + "loss": 0.6168549060821533, + "mean_token_accuracy": 0.7509273141622543, + "num_tokens": 11757130.0, + "step": 315 + }, + { + "entropy": 0.618528425693512, + "epoch": 2.4509232264334306, + "grad_norm": 0.00913267582654953, + "learning_rate": 0.0002, + "loss": 0.6144739985466003, + "mean_token_accuracy": 0.7495302185416222, + "num_tokens": 11794646.0, + "step": 316 + }, + { + "entropy": 0.6221663355827332, + "epoch": 2.4586977648202137, + "grad_norm": 0.008833467960357666, + "learning_rate": 0.0002, + "loss": 0.6160144805908203, + "mean_token_accuracy": 0.7488524913787842, + "num_tokens": 11832667.0, + "step": 317 + }, + { + "entropy": 0.6151534616947174, + "epoch": 2.466472303206997, + "grad_norm": 0.008367245085537434, + "learning_rate": 0.0002, + "loss": 0.6178625226020813, + "mean_token_accuracy": 0.7469210624694824, + "num_tokens": 11870196.0, + "step": 318 + }, + { + "entropy": 0.599577471613884, + "epoch": 2.4742468415937804, + "grad_norm": 0.008229793980717659, + "learning_rate": 0.0002, + "loss": 0.6013622283935547, + "mean_token_accuracy": 0.7555016428232193, + "num_tokens": 11907738.0, + "step": 319 + }, + { + "entropy": 0.6037501096725464, + "epoch": 2.4820213799805635, + "grad_norm": 0.009975764900445938, + "learning_rate": 0.0002, + "loss": 0.6080362796783447, + "mean_token_accuracy": 0.754118837416172, + "num_tokens": 11945154.0, + "step": 320 + }, + { + "entropy": 0.6234212592244148, + "epoch": 2.489795918367347, + "grad_norm": 0.009158926084637642, + "learning_rate": 0.0002, + "loss": 0.6259138584136963, + "mean_token_accuracy": 0.7461888268589973, + "num_tokens": 11983030.0, + "step": 321 + }, + { + "entropy": 0.6105703264474869, + "epoch": 2.49757045675413, + "grad_norm": 0.009549647569656372, + "learning_rate": 0.0002, + "loss": 0.6138617992401123, + "mean_token_accuracy": 0.7500449195504189, + "num_tokens": 12020106.0, + "step": 322 + }, + { + "entropy": 0.5886913314461708, + "epoch": 2.5053449951409137, + "grad_norm": 0.009142185561358929, + "learning_rate": 0.0002, + "loss": 0.5951993465423584, + "mean_token_accuracy": 0.7568985298275948, + "num_tokens": 12057274.0, + "step": 323 + }, + { + "entropy": 0.6163628548383713, + "epoch": 2.513119533527697, + "grad_norm": 0.008757554925978184, + "learning_rate": 0.0002, + "loss": 0.6170852184295654, + "mean_token_accuracy": 0.749226838350296, + "num_tokens": 12094665.0, + "step": 324 + }, + { + "entropy": 0.6229220703244209, + "epoch": 2.52089407191448, + "grad_norm": 0.007944419980049133, + "learning_rate": 0.0002, + "loss": 0.6211696267127991, + "mean_token_accuracy": 0.749010942876339, + "num_tokens": 12132302.0, + "step": 325 + }, + { + "entropy": 0.6257840767502785, + "epoch": 2.5286686103012634, + "grad_norm": 0.008713958784937859, + "learning_rate": 0.0002, + "loss": 0.6223682165145874, + "mean_token_accuracy": 0.7470938488841057, + "num_tokens": 12169510.0, + "step": 326 + }, + { + "entropy": 0.6103069111704826, + "epoch": 2.5364431486880465, + "grad_norm": 0.008112641051411629, + "learning_rate": 0.0002, + "loss": 0.6112810969352722, + "mean_token_accuracy": 0.7517933994531631, + "num_tokens": 12206878.0, + "step": 327 + }, + { + "entropy": 0.6295960918068886, + "epoch": 2.54421768707483, + "grad_norm": 0.009597997181117535, + "learning_rate": 0.0002, + "loss": 0.6329588890075684, + "mean_token_accuracy": 0.7417808771133423, + "num_tokens": 12244230.0, + "step": 328 + }, + { + "entropy": 0.6144092008471489, + "epoch": 2.551992225461613, + "grad_norm": 0.007173395249992609, + "learning_rate": 0.0002, + "loss": 0.6167792081832886, + "mean_token_accuracy": 0.750128723680973, + "num_tokens": 12281944.0, + "step": 329 + }, + { + "entropy": 0.6102811768651009, + "epoch": 2.5597667638483967, + "grad_norm": 0.00874980166554451, + "learning_rate": 0.0002, + "loss": 0.6081819534301758, + "mean_token_accuracy": 0.7545690611004829, + "num_tokens": 12319144.0, + "step": 330 + }, + { + "entropy": 0.6088513135910034, + "epoch": 2.56754130223518, + "grad_norm": 0.007437287364155054, + "learning_rate": 0.0002, + "loss": 0.610903799533844, + "mean_token_accuracy": 0.7525679916143417, + "num_tokens": 12356752.0, + "step": 331 + }, + { + "entropy": 0.605910450220108, + "epoch": 2.575315840621963, + "grad_norm": 0.008948191069066525, + "learning_rate": 0.0002, + "loss": 0.6137778759002686, + "mean_token_accuracy": 0.7502530664205551, + "num_tokens": 12394388.0, + "step": 332 + }, + { + "entropy": 0.6148117780685425, + "epoch": 2.5830903790087465, + "grad_norm": 0.008310764096677303, + "learning_rate": 0.0002, + "loss": 0.6203396320343018, + "mean_token_accuracy": 0.7478612065315247, + "num_tokens": 12431583.0, + "step": 333 + }, + { + "entropy": 0.6049426943063736, + "epoch": 2.5908649173955296, + "grad_norm": 0.00928961019963026, + "learning_rate": 0.0002, + "loss": 0.6102631688117981, + "mean_token_accuracy": 0.7530224993824959, + "num_tokens": 12469057.0, + "step": 334 + }, + { + "entropy": 0.6105730906128883, + "epoch": 2.5986394557823127, + "grad_norm": 0.008061802014708519, + "learning_rate": 0.0002, + "loss": 0.6099789142608643, + "mean_token_accuracy": 0.7517432495951653, + "num_tokens": 12506375.0, + "step": 335 + }, + { + "entropy": 0.6109907403588295, + "epoch": 2.6064139941690962, + "grad_norm": 0.008131072856485844, + "learning_rate": 0.0002, + "loss": 0.6083254814147949, + "mean_token_accuracy": 0.7539641037583351, + "num_tokens": 12543683.0, + "step": 336 + }, + { + "entropy": 0.60856644064188, + "epoch": 2.6141885325558794, + "grad_norm": 0.008039598353207111, + "learning_rate": 0.0002, + "loss": 0.6059796810150146, + "mean_token_accuracy": 0.7539034485816956, + "num_tokens": 12581164.0, + "step": 337 + }, + { + "entropy": 0.6075717508792877, + "epoch": 2.621963070942663, + "grad_norm": 0.007622460834681988, + "learning_rate": 0.0002, + "loss": 0.6058254241943359, + "mean_token_accuracy": 0.755204826593399, + "num_tokens": 12618385.0, + "step": 338 + }, + { + "entropy": 0.6058209240436554, + "epoch": 2.629737609329446, + "grad_norm": 0.009571490809321404, + "learning_rate": 0.0002, + "loss": 0.6132853031158447, + "mean_token_accuracy": 0.7517998144030571, + "num_tokens": 12656198.0, + "step": 339 + }, + { + "entropy": 0.609808899462223, + "epoch": 2.6375121477162295, + "grad_norm": 0.009121098555624485, + "learning_rate": 0.0002, + "loss": 0.6116859912872314, + "mean_token_accuracy": 0.7522552087903023, + "num_tokens": 12693619.0, + "step": 340 + }, + { + "entropy": 0.5982947275042534, + "epoch": 2.6452866861030127, + "grad_norm": 0.007683332543820143, + "learning_rate": 0.0002, + "loss": 0.6035135984420776, + "mean_token_accuracy": 0.7554004937410355, + "num_tokens": 12731247.0, + "step": 341 + }, + { + "entropy": 0.6199963241815567, + "epoch": 2.6530612244897958, + "grad_norm": 0.008116503246128559, + "learning_rate": 0.0002, + "loss": 0.6209834814071655, + "mean_token_accuracy": 0.7469918876886368, + "num_tokens": 12768639.0, + "step": 342 + }, + { + "entropy": 0.611749030649662, + "epoch": 2.6608357628765793, + "grad_norm": 0.009202837944030762, + "learning_rate": 0.0002, + "loss": 0.609596848487854, + "mean_token_accuracy": 0.7527265250682831, + "num_tokens": 12805843.0, + "step": 343 + }, + { + "entropy": 0.6049032211303711, + "epoch": 2.6686103012633624, + "grad_norm": 0.008622320368885994, + "learning_rate": 0.0002, + "loss": 0.6062831282615662, + "mean_token_accuracy": 0.7529996708035469, + "num_tokens": 12843334.0, + "step": 344 + }, + { + "entropy": 0.6080296412110329, + "epoch": 2.6763848396501455, + "grad_norm": 0.010344683192670345, + "learning_rate": 0.0002, + "loss": 0.6155232787132263, + "mean_token_accuracy": 0.7492252364754677, + "num_tokens": 12881114.0, + "step": 345 + }, + { + "entropy": 0.6105146557092667, + "epoch": 2.684159378036929, + "grad_norm": 0.00811974797397852, + "learning_rate": 0.0002, + "loss": 0.61601722240448, + "mean_token_accuracy": 0.7480410560965538, + "num_tokens": 12918628.0, + "step": 346 + }, + { + "entropy": 0.616872251033783, + "epoch": 2.6919339164237126, + "grad_norm": 0.009087933227419853, + "learning_rate": 0.0002, + "loss": 0.6140284538269043, + "mean_token_accuracy": 0.7496198862791061, + "num_tokens": 12955856.0, + "step": 347 + }, + { + "entropy": 0.6135741174221039, + "epoch": 2.6997084548104957, + "grad_norm": 0.008728091605007648, + "learning_rate": 0.0002, + "loss": 0.6116735935211182, + "mean_token_accuracy": 0.7527862265706062, + "num_tokens": 12993282.0, + "step": 348 + }, + { + "entropy": 0.6206527948379517, + "epoch": 2.707482993197279, + "grad_norm": 0.008598288521170616, + "learning_rate": 0.0002, + "loss": 0.6233333349227905, + "mean_token_accuracy": 0.7463840544223785, + "num_tokens": 13030919.0, + "step": 349 + }, + { + "entropy": 0.608021192252636, + "epoch": 2.7152575315840624, + "grad_norm": 0.008716718293726444, + "learning_rate": 0.0002, + "loss": 0.612204909324646, + "mean_token_accuracy": 0.7511651292443275, + "num_tokens": 13068022.0, + "step": 350 + }, + { + "entropy": 0.6055907234549522, + "epoch": 2.7230320699708455, + "grad_norm": 0.007125901058316231, + "learning_rate": 0.0002, + "loss": 0.6055992841720581, + "mean_token_accuracy": 0.753873273730278, + "num_tokens": 13105324.0, + "step": 351 + }, + { + "entropy": 0.6134061738848686, + "epoch": 2.7308066083576286, + "grad_norm": 0.007964730262756348, + "learning_rate": 0.0002, + "loss": 0.6122632026672363, + "mean_token_accuracy": 0.7516495808959007, + "num_tokens": 13143067.0, + "step": 352 + }, + { + "entropy": 0.6035361513495445, + "epoch": 2.738581146744412, + "grad_norm": 0.008376477286219597, + "learning_rate": 0.0002, + "loss": 0.6055692434310913, + "mean_token_accuracy": 0.7536868900060654, + "num_tokens": 13180307.0, + "step": 353 + }, + { + "entropy": 0.6108582690358162, + "epoch": 2.746355685131195, + "grad_norm": 0.008256555534899235, + "learning_rate": 0.0002, + "loss": 0.6159192323684692, + "mean_token_accuracy": 0.7500140145421028, + "num_tokens": 13217651.0, + "step": 354 + }, + { + "entropy": 0.6065188273787498, + "epoch": 2.7541302235179788, + "grad_norm": 0.007910750806331635, + "learning_rate": 0.0002, + "loss": 0.6087648868560791, + "mean_token_accuracy": 0.7539975792169571, + "num_tokens": 13255245.0, + "step": 355 + }, + { + "entropy": 0.6058445647358894, + "epoch": 2.761904761904762, + "grad_norm": 0.007995028980076313, + "learning_rate": 0.0002, + "loss": 0.6082870960235596, + "mean_token_accuracy": 0.7520255744457245, + "num_tokens": 13293244.0, + "step": 356 + }, + { + "entropy": 0.6188160851597786, + "epoch": 2.7696793002915454, + "grad_norm": 0.008255942724645138, + "learning_rate": 0.0002, + "loss": 0.615801990032196, + "mean_token_accuracy": 0.7498086243867874, + "num_tokens": 13330234.0, + "step": 357 + }, + { + "entropy": 0.6236889883875847, + "epoch": 2.7774538386783285, + "grad_norm": 0.007726432289928198, + "learning_rate": 0.0002, + "loss": 0.6215789914131165, + "mean_token_accuracy": 0.7462954670190811, + "num_tokens": 13367753.0, + "step": 358 + }, + { + "entropy": 0.6057674139738083, + "epoch": 2.7852283770651116, + "grad_norm": 0.007486944552510977, + "learning_rate": 0.0002, + "loss": 0.6107175946235657, + "mean_token_accuracy": 0.7536005079746246, + "num_tokens": 13405367.0, + "step": 359 + }, + { + "entropy": 0.6108546778559685, + "epoch": 2.793002915451895, + "grad_norm": 0.00800468772649765, + "learning_rate": 0.0002, + "loss": 0.6151923537254333, + "mean_token_accuracy": 0.7498300299048424, + "num_tokens": 13442458.0, + "step": 360 + }, + { + "entropy": 0.611615277826786, + "epoch": 2.8007774538386783, + "grad_norm": 0.008358453400433064, + "learning_rate": 0.0002, + "loss": 0.6143432855606079, + "mean_token_accuracy": 0.7498634308576584, + "num_tokens": 13479706.0, + "step": 361 + }, + { + "entropy": 0.6097937971353531, + "epoch": 2.8085519922254614, + "grad_norm": 0.008056551218032837, + "learning_rate": 0.0002, + "loss": 0.6140632629394531, + "mean_token_accuracy": 0.7493433877825737, + "num_tokens": 13517106.0, + "step": 362 + }, + { + "entropy": 0.6036530286073685, + "epoch": 2.816326530612245, + "grad_norm": 0.008669313974678516, + "learning_rate": 0.0002, + "loss": 0.604174792766571, + "mean_token_accuracy": 0.755392961204052, + "num_tokens": 13554029.0, + "step": 363 + }, + { + "entropy": 0.6074316874146461, + "epoch": 2.824101068999028, + "grad_norm": 0.008313254453241825, + "learning_rate": 0.0002, + "loss": 0.6034117937088013, + "mean_token_accuracy": 0.7538974210619926, + "num_tokens": 13591496.0, + "step": 364 + }, + { + "entropy": 0.625335082411766, + "epoch": 2.8318756073858116, + "grad_norm": 0.00826285034418106, + "learning_rate": 0.0002, + "loss": 0.6179195642471313, + "mean_token_accuracy": 0.7473107278347015, + "num_tokens": 13629175.0, + "step": 365 + }, + { + "entropy": 0.6023752987384796, + "epoch": 2.8396501457725947, + "grad_norm": 0.008760266937315464, + "learning_rate": 0.0002, + "loss": 0.6035041809082031, + "mean_token_accuracy": 0.752547599375248, + "num_tokens": 13666378.0, + "step": 366 + }, + { + "entropy": 0.6186700463294983, + "epoch": 2.847424684159378, + "grad_norm": 0.009422390721738338, + "learning_rate": 0.0002, + "loss": 0.6255558133125305, + "mean_token_accuracy": 0.7451329976320267, + "num_tokens": 13704147.0, + "step": 367 + }, + { + "entropy": 0.6027014032006264, + "epoch": 2.8551992225461613, + "grad_norm": 0.007943754084408283, + "learning_rate": 0.0002, + "loss": 0.6077042818069458, + "mean_token_accuracy": 0.7518687173724174, + "num_tokens": 13741252.0, + "step": 368 + }, + { + "entropy": 0.6081340312957764, + "epoch": 2.8629737609329444, + "grad_norm": 0.008472657762467861, + "learning_rate": 0.0002, + "loss": 0.6082110404968262, + "mean_token_accuracy": 0.7499295845627785, + "num_tokens": 13778637.0, + "step": 369 + }, + { + "entropy": 0.6041673645377159, + "epoch": 2.870748299319728, + "grad_norm": 0.008525537326931953, + "learning_rate": 0.0002, + "loss": 0.6059847474098206, + "mean_token_accuracy": 0.7531944662332535, + "num_tokens": 13816076.0, + "step": 370 + }, + { + "entropy": 0.6156945377588272, + "epoch": 2.878522837706511, + "grad_norm": 0.007397054228931665, + "learning_rate": 0.0002, + "loss": 0.6175694465637207, + "mean_token_accuracy": 0.7489196062088013, + "num_tokens": 13853700.0, + "step": 371 + }, + { + "entropy": 0.6109963580965996, + "epoch": 2.8862973760932946, + "grad_norm": 0.008632549084722996, + "learning_rate": 0.0002, + "loss": 0.6189043521881104, + "mean_token_accuracy": 0.7480105683207512, + "num_tokens": 13890909.0, + "step": 372 + }, + { + "entropy": 0.60771045088768, + "epoch": 2.8940719144800777, + "grad_norm": 0.008767201565206051, + "learning_rate": 0.0002, + "loss": 0.6133548021316528, + "mean_token_accuracy": 0.7522530779242516, + "num_tokens": 13928292.0, + "step": 373 + }, + { + "entropy": 0.6067496612668037, + "epoch": 2.9018464528668613, + "grad_norm": 0.007676385343074799, + "learning_rate": 0.0002, + "loss": 0.60523521900177, + "mean_token_accuracy": 0.754976786673069, + "num_tokens": 13965803.0, + "step": 374 + }, + { + "entropy": 0.6119726821780205, + "epoch": 2.9096209912536444, + "grad_norm": 0.007059477269649506, + "learning_rate": 0.0002, + "loss": 0.6106954216957092, + "mean_token_accuracy": 0.7522552087903023, + "num_tokens": 14002852.0, + "step": 375 + }, + { + "entropy": 0.6248558238148689, + "epoch": 2.9173955296404275, + "grad_norm": 0.008261643350124359, + "learning_rate": 0.0002, + "loss": 0.6251908540725708, + "mean_token_accuracy": 0.7473416924476624, + "num_tokens": 14040214.0, + "step": 376 + }, + { + "entropy": 0.6125365421175957, + "epoch": 2.925170068027211, + "grad_norm": 0.00803174264729023, + "learning_rate": 0.0002, + "loss": 0.6121209859848022, + "mean_token_accuracy": 0.7514154240489006, + "num_tokens": 14077708.0, + "step": 377 + }, + { + "entropy": 0.6050901785492897, + "epoch": 2.932944606413994, + "grad_norm": 0.007550297304987907, + "learning_rate": 0.0002, + "loss": 0.6031768321990967, + "mean_token_accuracy": 0.7547935023903847, + "num_tokens": 14115081.0, + "step": 378 + }, + { + "entropy": 0.5867772176861763, + "epoch": 2.9407191448007772, + "grad_norm": 0.007504226174205542, + "learning_rate": 0.0002, + "loss": 0.586522102355957, + "mean_token_accuracy": 0.7607723250985146, + "num_tokens": 14152707.0, + "step": 379 + }, + { + "entropy": 0.6053405031561852, + "epoch": 2.9484936831875608, + "grad_norm": 0.007515515200793743, + "learning_rate": 0.0002, + "loss": 0.6078545451164246, + "mean_token_accuracy": 0.7521200627088547, + "num_tokens": 14190102.0, + "step": 380 + }, + { + "entropy": 0.6189891770482063, + "epoch": 2.956268221574344, + "grad_norm": 0.009104753844439983, + "learning_rate": 0.0002, + "loss": 0.6249637603759766, + "mean_token_accuracy": 0.745013989508152, + "num_tokens": 14227592.0, + "step": 381 + }, + { + "entropy": 0.6138845458626747, + "epoch": 2.9640427599611274, + "grad_norm": 0.008113187737762928, + "learning_rate": 0.0002, + "loss": 0.6206336617469788, + "mean_token_accuracy": 0.7456697672605515, + "num_tokens": 14264742.0, + "step": 382 + }, + { + "entropy": 0.6130691468715668, + "epoch": 2.9718172983479105, + "grad_norm": 0.009299568831920624, + "learning_rate": 0.0002, + "loss": 0.6096789836883545, + "mean_token_accuracy": 0.7523899152874947, + "num_tokens": 14302195.0, + "step": 383 + }, + { + "entropy": 0.6205710843205452, + "epoch": 2.979591836734694, + "grad_norm": 0.009512864053249359, + "learning_rate": 0.0002, + "loss": 0.6156758069992065, + "mean_token_accuracy": 0.7508921846747398, + "num_tokens": 14339245.0, + "step": 384 + }, + { + "entropy": 0.6069811135530472, + "epoch": 2.987366375121477, + "grad_norm": 0.007910305634140968, + "learning_rate": 0.0002, + "loss": 0.6085284948348999, + "mean_token_accuracy": 0.753339558839798, + "num_tokens": 14376587.0, + "step": 385 + }, + { + "entropy": 0.6119454056024551, + "epoch": 2.9951409135082603, + "grad_norm": 0.009647355414927006, + "learning_rate": 0.0002, + "loss": 0.6212526559829712, + "mean_token_accuracy": 0.7483848258852959, + "num_tokens": 14414269.0, + "step": 386 + }, + { + "entropy": 0.5991271257400512, + "epoch": 3.0, + "grad_norm": 0.010158240795135498, + "learning_rate": 0.0002, + "loss": 0.6065676212310791, + "mean_token_accuracy": 0.7547077178955078, + "num_tokens": 14437732.0, + "step": 387 + }, + { + "entropy": 0.6155622974038124, + "epoch": 3.007774538386783, + "grad_norm": 0.007469667587429285, + "learning_rate": 0.0002, + "loss": 0.610929012298584, + "mean_token_accuracy": 0.7500728666782379, + "num_tokens": 14475215.0, + "step": 388 + }, + { + "entropy": 0.6059615164995193, + "epoch": 3.0155490767735667, + "grad_norm": 0.008237253874540329, + "learning_rate": 0.0002, + "loss": 0.6052074432373047, + "mean_token_accuracy": 0.75154148042202, + "num_tokens": 14512098.0, + "step": 389 + }, + { + "entropy": 0.6095065400004387, + "epoch": 3.0233236151603498, + "grad_norm": 0.008823649026453495, + "learning_rate": 0.0002, + "loss": 0.6052320599555969, + "mean_token_accuracy": 0.7540639191865921, + "num_tokens": 14549796.0, + "step": 390 + }, + { + "entropy": 0.5965104550123215, + "epoch": 3.0310981535471333, + "grad_norm": 0.008173096925020218, + "learning_rate": 0.0002, + "loss": 0.5943379998207092, + "mean_token_accuracy": 0.7575219720602036, + "num_tokens": 14587236.0, + "step": 391 + }, + { + "entropy": 0.6153795942664146, + "epoch": 3.0388726919339164, + "grad_norm": 0.011041256599128246, + "learning_rate": 0.0002, + "loss": 0.6242270469665527, + "mean_token_accuracy": 0.7458753809332848, + "num_tokens": 14624782.0, + "step": 392 + }, + { + "entropy": 0.5972734019160271, + "epoch": 3.0466472303206995, + "grad_norm": 0.008677808567881584, + "learning_rate": 0.0002, + "loss": 0.5998678207397461, + "mean_token_accuracy": 0.7576502561569214, + "num_tokens": 14662174.0, + "step": 393 + }, + { + "entropy": 0.6102932617068291, + "epoch": 3.054421768707483, + "grad_norm": 0.010088201612234116, + "learning_rate": 0.0002, + "loss": 0.6051709651947021, + "mean_token_accuracy": 0.7535885870456696, + "num_tokens": 14699746.0, + "step": 394 + }, + { + "entropy": 0.6008228436112404, + "epoch": 3.062196307094266, + "grad_norm": 0.008312424644827843, + "learning_rate": 0.0002, + "loss": 0.6032264232635498, + "mean_token_accuracy": 0.7517057359218597, + "num_tokens": 14737247.0, + "step": 395 + }, + { + "entropy": 0.5989790633320808, + "epoch": 3.0699708454810497, + "grad_norm": 0.008239499293267727, + "learning_rate": 0.0002, + "loss": 0.6043699979782104, + "mean_token_accuracy": 0.7529819533228874, + "num_tokens": 14774702.0, + "step": 396 + }, + { + "entropy": 0.6045716553926468, + "epoch": 3.077745383867833, + "grad_norm": 0.01003638468682766, + "learning_rate": 0.0002, + "loss": 0.6113682985305786, + "mean_token_accuracy": 0.7505319342017174, + "num_tokens": 14811886.0, + "step": 397 + }, + { + "entropy": 0.6115910932421684, + "epoch": 3.0855199222546164, + "grad_norm": 0.009529519826173782, + "learning_rate": 0.0002, + "loss": 0.6107526421546936, + "mean_token_accuracy": 0.7507694736123085, + "num_tokens": 14848988.0, + "step": 398 + }, + { + "entropy": 0.6084096133708954, + "epoch": 3.0932944606413995, + "grad_norm": 0.010617745108902454, + "learning_rate": 0.0002, + "loss": 0.6034584045410156, + "mean_token_accuracy": 0.753932997584343, + "num_tokens": 14886459.0, + "step": 399 + }, + { + "entropy": 0.6054683178663254, + "epoch": 3.1010689990281826, + "grad_norm": 0.008427645079791546, + "learning_rate": 0.0002, + "loss": 0.603972852230072, + "mean_token_accuracy": 0.7547962665557861, + "num_tokens": 14924071.0, + "step": 400 + }, + { + "entropy": 0.5898149386048317, + "epoch": 3.108843537414966, + "grad_norm": 0.009828660637140274, + "learning_rate": 0.0002, + "loss": 0.5968987941741943, + "mean_token_accuracy": 0.7556750178337097, + "num_tokens": 14961693.0, + "step": 401 + }, + { + "entropy": 0.5877138301730156, + "epoch": 3.116618075801749, + "grad_norm": 0.010062897577881813, + "learning_rate": 0.0002, + "loss": 0.5967484712600708, + "mean_token_accuracy": 0.7571568712592125, + "num_tokens": 14998846.0, + "step": 402 + }, + { + "entropy": 0.5948435962200165, + "epoch": 3.1243926141885328, + "grad_norm": 0.008929714560508728, + "learning_rate": 0.0002, + "loss": 0.596827507019043, + "mean_token_accuracy": 0.7577486112713814, + "num_tokens": 15036731.0, + "step": 403 + }, + { + "entropy": 0.6053501963615417, + "epoch": 3.132167152575316, + "grad_norm": 0.009441581554710865, + "learning_rate": 0.0002, + "loss": 0.6060553789138794, + "mean_token_accuracy": 0.7532980218529701, + "num_tokens": 15074609.0, + "step": 404 + }, + { + "entropy": 0.6139290183782578, + "epoch": 3.139941690962099, + "grad_norm": 0.009152664802968502, + "learning_rate": 0.0002, + "loss": 0.6124223470687866, + "mean_token_accuracy": 0.7500443160533905, + "num_tokens": 15112062.0, + "step": 405 + }, + { + "entropy": 0.5967981591820717, + "epoch": 3.1477162293488825, + "grad_norm": 0.009577469900250435, + "learning_rate": 0.0002, + "loss": 0.60134357213974, + "mean_token_accuracy": 0.75638198107481, + "num_tokens": 15149260.0, + "step": 406 + }, + { + "entropy": 0.6026358082890511, + "epoch": 3.1554907677356656, + "grad_norm": 0.008992240764200687, + "learning_rate": 0.0002, + "loss": 0.6071676015853882, + "mean_token_accuracy": 0.7526509240269661, + "num_tokens": 15186342.0, + "step": 407 + }, + { + "entropy": 0.6130121350288391, + "epoch": 3.163265306122449, + "grad_norm": 0.009787038899958134, + "learning_rate": 0.0002, + "loss": 0.616807222366333, + "mean_token_accuracy": 0.7485663071274757, + "num_tokens": 15224037.0, + "step": 408 + }, + { + "entropy": 0.6062626764178276, + "epoch": 3.1710398445092323, + "grad_norm": 0.009504587389528751, + "learning_rate": 0.0002, + "loss": 0.6050899624824524, + "mean_token_accuracy": 0.7536401823163033, + "num_tokens": 15261579.0, + "step": 409 + }, + { + "entropy": 0.6065879017114639, + "epoch": 3.1788143828960154, + "grad_norm": 0.008364197798073292, + "learning_rate": 0.0002, + "loss": 0.6022209525108337, + "mean_token_accuracy": 0.7534467577934265, + "num_tokens": 15299024.0, + "step": 410 + }, + { + "entropy": 0.6233559027314186, + "epoch": 3.186588921282799, + "grad_norm": 0.010281233116984367, + "learning_rate": 0.0002, + "loss": 0.6214974522590637, + "mean_token_accuracy": 0.7470389008522034, + "num_tokens": 15336558.0, + "step": 411 + }, + { + "entropy": 0.6087061986327171, + "epoch": 3.194363459669582, + "grad_norm": 0.00957780983299017, + "learning_rate": 0.0002, + "loss": 0.6129252910614014, + "mean_token_accuracy": 0.7495343014597893, + "num_tokens": 15374032.0, + "step": 412 + }, + { + "entropy": 0.596970833837986, + "epoch": 3.2021379980563656, + "grad_norm": 0.00984536949545145, + "learning_rate": 0.0002, + "loss": 0.5985467433929443, + "mean_token_accuracy": 0.7565372809767723, + "num_tokens": 15411483.0, + "step": 413 + }, + { + "entropy": 0.5959193110466003, + "epoch": 3.2099125364431487, + "grad_norm": 0.010170173831284046, + "learning_rate": 0.0002, + "loss": 0.599077045917511, + "mean_token_accuracy": 0.756831057369709, + "num_tokens": 15448812.0, + "step": 414 + }, + { + "entropy": 0.6122774854302406, + "epoch": 3.2176870748299318, + "grad_norm": 0.00988403894007206, + "learning_rate": 0.0002, + "loss": 0.6123433113098145, + "mean_token_accuracy": 0.7474271655082703, + "num_tokens": 15486225.0, + "step": 415 + }, + { + "entropy": 0.5967384874820709, + "epoch": 3.2254616132167153, + "grad_norm": 0.010967456735670567, + "learning_rate": 0.0002, + "loss": 0.60502028465271, + "mean_token_accuracy": 0.75384970754385, + "num_tokens": 15523563.0, + "step": 416 + }, + { + "entropy": 0.5971691235899925, + "epoch": 3.2332361516034984, + "grad_norm": 0.009652617387473583, + "learning_rate": 0.0002, + "loss": 0.596883237361908, + "mean_token_accuracy": 0.7563904896378517, + "num_tokens": 15561284.0, + "step": 417 + }, + { + "entropy": 0.5993461608886719, + "epoch": 3.241010689990282, + "grad_norm": 0.01028553955256939, + "learning_rate": 0.0002, + "loss": 0.5969662666320801, + "mean_token_accuracy": 0.7561450004577637, + "num_tokens": 15598518.0, + "step": 418 + }, + { + "entropy": 0.6052126884460449, + "epoch": 3.248785228377065, + "grad_norm": 0.009491597302258015, + "learning_rate": 0.0002, + "loss": 0.6018233299255371, + "mean_token_accuracy": 0.754707433283329, + "num_tokens": 15636077.0, + "step": 419 + }, + { + "entropy": 0.5944898948073387, + "epoch": 3.256559766763848, + "grad_norm": 0.009509161114692688, + "learning_rate": 0.0002, + "loss": 0.598441481590271, + "mean_token_accuracy": 0.7549791261553764, + "num_tokens": 15673148.0, + "step": 420 + }, + { + "entropy": 0.5968391299247742, + "epoch": 3.2643343051506317, + "grad_norm": 0.012232691049575806, + "learning_rate": 0.0002, + "loss": 0.6061251163482666, + "mean_token_accuracy": 0.7526469007134438, + "num_tokens": 15710778.0, + "step": 421 + }, + { + "entropy": 0.6134240105748177, + "epoch": 3.272108843537415, + "grad_norm": 0.00959104672074318, + "learning_rate": 0.0002, + "loss": 0.6182757616043091, + "mean_token_accuracy": 0.7455755323171616, + "num_tokens": 15748509.0, + "step": 422 + }, + { + "entropy": 0.6232677772641182, + "epoch": 3.2798833819241984, + "grad_norm": 0.008630241267383099, + "learning_rate": 0.0002, + "loss": 0.6197680234909058, + "mean_token_accuracy": 0.7470053881406784, + "num_tokens": 15786160.0, + "step": 423 + }, + { + "entropy": 0.613219253718853, + "epoch": 3.2876579203109815, + "grad_norm": 0.0128620695322752, + "learning_rate": 0.0002, + "loss": 0.607075572013855, + "mean_token_accuracy": 0.7511464059352875, + "num_tokens": 15823826.0, + "step": 424 + }, + { + "entropy": 0.6041038259863853, + "epoch": 3.295432458697765, + "grad_norm": 0.011236878111958504, + "learning_rate": 0.0002, + "loss": 0.6055868864059448, + "mean_token_accuracy": 0.7537136226892471, + "num_tokens": 15861102.0, + "step": 425 + }, + { + "entropy": 0.6037536263465881, + "epoch": 3.303206997084548, + "grad_norm": 0.01190877053886652, + "learning_rate": 0.0002, + "loss": 0.6142691373825073, + "mean_token_accuracy": 0.7493078485131264, + "num_tokens": 15898770.0, + "step": 426 + }, + { + "entropy": 0.5997900441288948, + "epoch": 3.3109815354713312, + "grad_norm": 0.01027680840343237, + "learning_rate": 0.0002, + "loss": 0.606103777885437, + "mean_token_accuracy": 0.7539091035723686, + "num_tokens": 15936500.0, + "step": 427 + }, + { + "entropy": 0.611216127872467, + "epoch": 3.3187560738581148, + "grad_norm": 0.011017821729183197, + "learning_rate": 0.0002, + "loss": 0.6174614429473877, + "mean_token_accuracy": 0.7461550533771515, + "num_tokens": 15974513.0, + "step": 428 + }, + { + "entropy": 0.6048758924007416, + "epoch": 3.326530612244898, + "grad_norm": 0.010105214081704617, + "learning_rate": 0.0002, + "loss": 0.6031618118286133, + "mean_token_accuracy": 0.7546434104442596, + "num_tokens": 16012014.0, + "step": 429 + }, + { + "entropy": 0.6172537207603455, + "epoch": 3.3343051506316814, + "grad_norm": 0.009731764905154705, + "learning_rate": 0.0002, + "loss": 0.6138004064559937, + "mean_token_accuracy": 0.7473105862736702, + "num_tokens": 16049595.0, + "step": 430 + }, + { + "entropy": 0.601245328783989, + "epoch": 3.3420796890184645, + "grad_norm": 0.010152102448046207, + "learning_rate": 0.0002, + "loss": 0.6028028726577759, + "mean_token_accuracy": 0.7536987066268921, + "num_tokens": 16087175.0, + "step": 431 + }, + { + "entropy": 0.6049877479672432, + "epoch": 3.3498542274052476, + "grad_norm": 0.008624416776001453, + "learning_rate": 0.0002, + "loss": 0.6070842742919922, + "mean_token_accuracy": 0.7543686851859093, + "num_tokens": 16124434.0, + "step": 432 + }, + { + "entropy": 0.6113510951399803, + "epoch": 3.357628765792031, + "grad_norm": 0.00979162473231554, + "learning_rate": 0.0002, + "loss": 0.614505410194397, + "mean_token_accuracy": 0.7483974099159241, + "num_tokens": 16161797.0, + "step": 433 + }, + { + "entropy": 0.6149813681840897, + "epoch": 3.3654033041788143, + "grad_norm": 0.009648281149566174, + "learning_rate": 0.0002, + "loss": 0.6138153076171875, + "mean_token_accuracy": 0.7505435049533844, + "num_tokens": 16199386.0, + "step": 434 + }, + { + "entropy": 0.6114403232932091, + "epoch": 3.373177842565598, + "grad_norm": 0.00991707295179367, + "learning_rate": 0.0002, + "loss": 0.6108669638633728, + "mean_token_accuracy": 0.7510098665952682, + "num_tokens": 16236951.0, + "step": 435 + }, + { + "entropy": 0.6059002429246902, + "epoch": 3.380952380952381, + "grad_norm": 0.009901657700538635, + "learning_rate": 0.0002, + "loss": 0.6064650416374207, + "mean_token_accuracy": 0.7527595311403275, + "num_tokens": 16274203.0, + "step": 436 + }, + { + "entropy": 0.6086044162511826, + "epoch": 3.388726919339164, + "grad_norm": 0.011115623638033867, + "learning_rate": 0.0002, + "loss": 0.609772801399231, + "mean_token_accuracy": 0.7524074539542198, + "num_tokens": 16311856.0, + "step": 437 + }, + { + "entropy": 0.6069784238934517, + "epoch": 3.3965014577259476, + "grad_norm": 0.009795066900551319, + "learning_rate": 0.0002, + "loss": 0.60982745885849, + "mean_token_accuracy": 0.7514877542853355, + "num_tokens": 16349625.0, + "step": 438 + }, + { + "entropy": 0.602266825735569, + "epoch": 3.4042759961127307, + "grad_norm": 0.009143724106252193, + "learning_rate": 0.0002, + "loss": 0.6032094359397888, + "mean_token_accuracy": 0.7547830194234848, + "num_tokens": 16387358.0, + "step": 439 + }, + { + "entropy": 0.5899055674672127, + "epoch": 3.4120505344995142, + "grad_norm": 0.009034923277795315, + "learning_rate": 0.0002, + "loss": 0.5931638479232788, + "mean_token_accuracy": 0.7577911838889122, + "num_tokens": 16424225.0, + "step": 440 + }, + { + "entropy": 0.5923598855733871, + "epoch": 3.4198250728862973, + "grad_norm": 0.00976620800793171, + "learning_rate": 0.0002, + "loss": 0.5963320732116699, + "mean_token_accuracy": 0.7556646093726158, + "num_tokens": 16461363.0, + "step": 441 + }, + { + "entropy": 0.6050904020667076, + "epoch": 3.427599611273081, + "grad_norm": 0.010530819185078144, + "learning_rate": 0.0002, + "loss": 0.6116576194763184, + "mean_token_accuracy": 0.7500759586691856, + "num_tokens": 16498597.0, + "step": 442 + }, + { + "entropy": 0.6166655048727989, + "epoch": 3.435374149659864, + "grad_norm": 0.009784851223230362, + "learning_rate": 0.0002, + "loss": 0.6191204786300659, + "mean_token_accuracy": 0.7476971745491028, + "num_tokens": 16535886.0, + "step": 443 + }, + { + "entropy": 0.6059679165482521, + "epoch": 3.443148688046647, + "grad_norm": 0.009777678176760674, + "learning_rate": 0.0002, + "loss": 0.600814700126648, + "mean_token_accuracy": 0.7545428648591042, + "num_tokens": 16573204.0, + "step": 444 + }, + { + "entropy": 0.6082785129547119, + "epoch": 3.4509232264334306, + "grad_norm": 0.009606909938156605, + "learning_rate": 0.0002, + "loss": 0.6063122153282166, + "mean_token_accuracy": 0.7535424381494522, + "num_tokens": 16610341.0, + "step": 445 + }, + { + "entropy": 0.6118370518088341, + "epoch": 3.4586977648202137, + "grad_norm": 0.009755875915288925, + "learning_rate": 0.0002, + "loss": 0.6115654706954956, + "mean_token_accuracy": 0.7514548450708389, + "num_tokens": 16648078.0, + "step": 446 + }, + { + "entropy": 0.5936368778347969, + "epoch": 3.466472303206997, + "grad_norm": 0.011094003915786743, + "learning_rate": 0.0002, + "loss": 0.6031495332717896, + "mean_token_accuracy": 0.75296650826931, + "num_tokens": 16684979.0, + "step": 447 + }, + { + "entropy": 0.5946005135774612, + "epoch": 3.4742468415937804, + "grad_norm": 0.00817946158349514, + "learning_rate": 0.0002, + "loss": 0.597072184085846, + "mean_token_accuracy": 0.756522886455059, + "num_tokens": 16722537.0, + "step": 448 + }, + { + "entropy": 0.6108994483947754, + "epoch": 3.4820213799805635, + "grad_norm": 0.0094683188945055, + "learning_rate": 0.0002, + "loss": 0.6126965284347534, + "mean_token_accuracy": 0.750556543469429, + "num_tokens": 16759490.0, + "step": 449 + }, + { + "entropy": 0.6224265471100807, + "epoch": 3.489795918367347, + "grad_norm": 0.009895196184515953, + "learning_rate": 0.0002, + "loss": 0.6202942132949829, + "mean_token_accuracy": 0.7480411902070045, + "num_tokens": 16797135.0, + "step": 450 + }, + { + "entropy": 0.597562313079834, + "epoch": 3.49757045675413, + "grad_norm": 0.00880007166415453, + "learning_rate": 0.0002, + "loss": 0.5973268151283264, + "mean_token_accuracy": 0.7553020343184471, + "num_tokens": 16834270.0, + "step": 451 + }, + { + "entropy": 0.5932627841830254, + "epoch": 3.5053449951409137, + "grad_norm": 0.009338297881186008, + "learning_rate": 0.0002, + "loss": 0.5983443856239319, + "mean_token_accuracy": 0.7540717199444771, + "num_tokens": 16871670.0, + "step": 452 + }, + { + "entropy": 0.603311225771904, + "epoch": 3.513119533527697, + "grad_norm": 0.009173530153930187, + "learning_rate": 0.0002, + "loss": 0.6072041988372803, + "mean_token_accuracy": 0.752394326031208, + "num_tokens": 16909221.0, + "step": 453 + }, + { + "entropy": 0.6008370220661163, + "epoch": 3.52089407191448, + "grad_norm": 0.009413264691829681, + "learning_rate": 0.0002, + "loss": 0.6025704145431519, + "mean_token_accuracy": 0.7541562095284462, + "num_tokens": 16946802.0, + "step": 454 + }, + { + "entropy": 0.6156598478555679, + "epoch": 3.5286686103012634, + "grad_norm": 0.009066940285265446, + "learning_rate": 0.0002, + "loss": 0.6163049936294556, + "mean_token_accuracy": 0.7471535354852676, + "num_tokens": 16983926.0, + "step": 455 + }, + { + "entropy": 0.6066097542643547, + "epoch": 3.5364431486880465, + "grad_norm": 0.008060373365879059, + "learning_rate": 0.0002, + "loss": 0.6057984828948975, + "mean_token_accuracy": 0.753935232758522, + "num_tokens": 17021676.0, + "step": 456 + }, + { + "entropy": 0.5982315316796303, + "epoch": 3.54421768707483, + "grad_norm": 0.008438881486654282, + "learning_rate": 0.0002, + "loss": 0.6000136137008667, + "mean_token_accuracy": 0.7557498961687088, + "num_tokens": 17059698.0, + "step": 457 + }, + { + "entropy": 0.6007475033402443, + "epoch": 3.551992225461613, + "grad_norm": 0.008833416737616062, + "learning_rate": 0.0002, + "loss": 0.6044740676879883, + "mean_token_accuracy": 0.7540414854884148, + "num_tokens": 17096952.0, + "step": 458 + }, + { + "entropy": 0.6120948642492294, + "epoch": 3.5597667638483967, + "grad_norm": 0.010080665349960327, + "learning_rate": 0.0002, + "loss": 0.6188148260116577, + "mean_token_accuracy": 0.7483313381671906, + "num_tokens": 17134663.0, + "step": 459 + }, + { + "entropy": 0.6083438396453857, + "epoch": 3.56754130223518, + "grad_norm": 0.009289734996855259, + "learning_rate": 0.0002, + "loss": 0.6083492636680603, + "mean_token_accuracy": 0.7500124499201775, + "num_tokens": 17172169.0, + "step": 460 + }, + { + "entropy": 0.6143280863761902, + "epoch": 3.575315840621963, + "grad_norm": 0.010136788710951805, + "learning_rate": 0.0002, + "loss": 0.6146470308303833, + "mean_token_accuracy": 0.749954454600811, + "num_tokens": 17209481.0, + "step": 461 + }, + { + "entropy": 0.6075241789221764, + "epoch": 3.5830903790087465, + "grad_norm": 0.008481534197926521, + "learning_rate": 0.0002, + "loss": 0.6094347238540649, + "mean_token_accuracy": 0.7524155974388123, + "num_tokens": 17246466.0, + "step": 462 + }, + { + "entropy": 0.6080920621752739, + "epoch": 3.5908649173955296, + "grad_norm": 0.009619004093110561, + "learning_rate": 0.0002, + "loss": 0.6094264984130859, + "mean_token_accuracy": 0.752539336681366, + "num_tokens": 17284014.0, + "step": 463 + }, + { + "entropy": 0.5951874181628227, + "epoch": 3.5986394557823127, + "grad_norm": 0.010971908457577229, + "learning_rate": 0.0002, + "loss": 0.5968849062919617, + "mean_token_accuracy": 0.7571029588580132, + "num_tokens": 17321447.0, + "step": 464 + }, + { + "entropy": 0.600244015455246, + "epoch": 3.6064139941690962, + "grad_norm": 0.009995541535317898, + "learning_rate": 0.0002, + "loss": 0.6033259630203247, + "mean_token_accuracy": 0.7534294128417969, + "num_tokens": 17358802.0, + "step": 465 + }, + { + "entropy": 0.6006019562482834, + "epoch": 3.6141885325558794, + "grad_norm": 0.008752602152526379, + "learning_rate": 0.0002, + "loss": 0.6017124652862549, + "mean_token_accuracy": 0.756244920194149, + "num_tokens": 17396188.0, + "step": 466 + }, + { + "entropy": 0.6169783622026443, + "epoch": 3.621963070942663, + "grad_norm": 0.010406076908111572, + "learning_rate": 0.0002, + "loss": 0.6129188537597656, + "mean_token_accuracy": 0.7500476241111755, + "num_tokens": 17433577.0, + "step": 467 + }, + { + "entropy": 0.6030160784721375, + "epoch": 3.629737609329446, + "grad_norm": 0.009500440210103989, + "learning_rate": 0.0002, + "loss": 0.6009221076965332, + "mean_token_accuracy": 0.7557852789759636, + "num_tokens": 17471102.0, + "step": 468 + }, + { + "entropy": 0.5835254713892937, + "epoch": 3.6375121477162295, + "grad_norm": 0.009339805692434311, + "learning_rate": 0.0002, + "loss": 0.5876451730728149, + "mean_token_accuracy": 0.7601824253797531, + "num_tokens": 17508438.0, + "step": 469 + }, + { + "entropy": 0.6057174652814865, + "epoch": 3.6452866861030127, + "grad_norm": 0.010681871324777603, + "learning_rate": 0.0002, + "loss": 0.6165672540664673, + "mean_token_accuracy": 0.7476890683174133, + "num_tokens": 17546176.0, + "step": 470 + }, + { + "entropy": 0.6023501753807068, + "epoch": 3.6530612244897958, + "grad_norm": 0.009493213146924973, + "learning_rate": 0.0002, + "loss": 0.6091412305831909, + "mean_token_accuracy": 0.7539057731628418, + "num_tokens": 17583501.0, + "step": 471 + }, + { + "entropy": 0.6135850101709366, + "epoch": 3.6608357628765793, + "grad_norm": 0.009873135015368462, + "learning_rate": 0.0002, + "loss": 0.6167327165603638, + "mean_token_accuracy": 0.7497850060462952, + "num_tokens": 17620694.0, + "step": 472 + }, + { + "entropy": 0.6023069024085999, + "epoch": 3.6686103012633624, + "grad_norm": 0.009261439554393291, + "learning_rate": 0.0002, + "loss": 0.5992604494094849, + "mean_token_accuracy": 0.7568845972418785, + "num_tokens": 17657846.0, + "step": 473 + }, + { + "entropy": 0.6220817118883133, + "epoch": 3.6763848396501455, + "grad_norm": 0.008002927526831627, + "learning_rate": 0.0002, + "loss": 0.6206220984458923, + "mean_token_accuracy": 0.7471845746040344, + "num_tokens": 17695493.0, + "step": 474 + }, + { + "entropy": 0.6081802695989609, + "epoch": 3.684159378036929, + "grad_norm": 0.008587166666984558, + "learning_rate": 0.0002, + "loss": 0.607234001159668, + "mean_token_accuracy": 0.755810484290123, + "num_tokens": 17732856.0, + "step": 475 + }, + { + "entropy": 0.6025589928030968, + "epoch": 3.6919339164237126, + "grad_norm": 0.009315953589975834, + "learning_rate": 0.0002, + "loss": 0.6054584383964539, + "mean_token_accuracy": 0.7516716048121452, + "num_tokens": 17769974.0, + "step": 476 + }, + { + "entropy": 0.6041041016578674, + "epoch": 3.6997084548104957, + "grad_norm": 0.009252023883163929, + "learning_rate": 0.0002, + "loss": 0.6035861968994141, + "mean_token_accuracy": 0.754462331533432, + "num_tokens": 17807234.0, + "step": 477 + }, + { + "entropy": 0.6150568872690201, + "epoch": 3.707482993197279, + "grad_norm": 0.009806321002542973, + "learning_rate": 0.0002, + "loss": 0.6143267154693604, + "mean_token_accuracy": 0.7500679716467857, + "num_tokens": 17844713.0, + "step": 478 + }, + { + "entropy": 0.6017017439007759, + "epoch": 3.7152575315840624, + "grad_norm": 0.009355618618428707, + "learning_rate": 0.0002, + "loss": 0.6050205230712891, + "mean_token_accuracy": 0.7535286843776703, + "num_tokens": 17882167.0, + "step": 479 + }, + { + "entropy": 0.6020700857043266, + "epoch": 3.7230320699708455, + "grad_norm": 0.010259266011416912, + "learning_rate": 0.0002, + "loss": 0.6069679856300354, + "mean_token_accuracy": 0.7521628364920616, + "num_tokens": 17919373.0, + "step": 480 + }, + { + "entropy": 0.6041392460465431, + "epoch": 3.7308066083576286, + "grad_norm": 0.008957406505942345, + "learning_rate": 0.0002, + "loss": 0.6065245270729065, + "mean_token_accuracy": 0.7511508986353874, + "num_tokens": 17956544.0, + "step": 481 + }, + { + "entropy": 0.6143322214484215, + "epoch": 3.738581146744412, + "grad_norm": 0.010185849852859974, + "learning_rate": 0.0002, + "loss": 0.6167340278625488, + "mean_token_accuracy": 0.7486473768949509, + "num_tokens": 17993752.0, + "step": 482 + }, + { + "entropy": 0.597200371325016, + "epoch": 3.746355685131195, + "grad_norm": 0.009210821241140366, + "learning_rate": 0.0002, + "loss": 0.5978806018829346, + "mean_token_accuracy": 0.7557302191853523, + "num_tokens": 18031025.0, + "step": 483 + }, + { + "entropy": 0.6069202646613121, + "epoch": 3.7541302235179788, + "grad_norm": 0.011117368005216122, + "learning_rate": 0.0002, + "loss": 0.6108845472335815, + "mean_token_accuracy": 0.7496053129434586, + "num_tokens": 18067927.0, + "step": 484 + }, + { + "entropy": 0.6041139885783195, + "epoch": 3.761904761904762, + "grad_norm": 0.00938522256910801, + "learning_rate": 0.0002, + "loss": 0.6076387166976929, + "mean_token_accuracy": 0.7511148899793625, + "num_tokens": 18105521.0, + "step": 485 + }, + { + "entropy": 0.5986451655626297, + "epoch": 3.7696793002915454, + "grad_norm": 0.009973375126719475, + "learning_rate": 0.0002, + "loss": 0.6053519248962402, + "mean_token_accuracy": 0.7534126862883568, + "num_tokens": 18142635.0, + "step": 486 + }, + { + "entropy": 0.6009933426976204, + "epoch": 3.7774538386783285, + "grad_norm": 0.008744049817323685, + "learning_rate": 0.0002, + "loss": 0.6009329557418823, + "mean_token_accuracy": 0.7565900459885597, + "num_tokens": 18179737.0, + "step": 487 + }, + { + "entropy": 0.6145603656768799, + "epoch": 3.7852283770651116, + "grad_norm": 0.008431525900959969, + "learning_rate": 0.0002, + "loss": 0.6102414727210999, + "mean_token_accuracy": 0.7497778162360191, + "num_tokens": 18216997.0, + "step": 488 + }, + { + "entropy": 0.6055081114172935, + "epoch": 3.793002915451895, + "grad_norm": 0.00999277364462614, + "learning_rate": 0.0002, + "loss": 0.6034255623817444, + "mean_token_accuracy": 0.7561624273657799, + "num_tokens": 18254319.0, + "step": 489 + }, + { + "entropy": 0.5926950201392174, + "epoch": 3.8007774538386783, + "grad_norm": 0.008595049381256104, + "learning_rate": 0.0002, + "loss": 0.5922105312347412, + "mean_token_accuracy": 0.7585625573992729, + "num_tokens": 18291224.0, + "step": 490 + }, + { + "entropy": 0.6234352439641953, + "epoch": 3.8085519922254614, + "grad_norm": 0.009778706356883049, + "learning_rate": 0.0002, + "loss": 0.628953754901886, + "mean_token_accuracy": 0.743121363222599, + "num_tokens": 18328744.0, + "step": 491 + }, + { + "entropy": 0.6095947250723839, + "epoch": 3.816326530612245, + "grad_norm": 0.009355447255074978, + "learning_rate": 0.0002, + "loss": 0.6148620843887329, + "mean_token_accuracy": 0.7512015551328659, + "num_tokens": 18366284.0, + "step": 492 + }, + { + "entropy": 0.6000761389732361, + "epoch": 3.824101068999028, + "grad_norm": 0.00857703946530819, + "learning_rate": 0.0002, + "loss": 0.604392409324646, + "mean_token_accuracy": 0.7549523860216141, + "num_tokens": 18403721.0, + "step": 493 + }, + { + "entropy": 0.5995704010128975, + "epoch": 3.8318756073858116, + "grad_norm": 0.010483372025191784, + "learning_rate": 0.0002, + "loss": 0.6008812785148621, + "mean_token_accuracy": 0.7550973892211914, + "num_tokens": 18440931.0, + "step": 494 + }, + { + "entropy": 0.6065568849444389, + "epoch": 3.8396501457725947, + "grad_norm": 0.00975153036415577, + "learning_rate": 0.0002, + "loss": 0.6107536554336548, + "mean_token_accuracy": 0.7495853081345558, + "num_tokens": 18478285.0, + "step": 495 + }, + { + "entropy": 0.6092389151453972, + "epoch": 3.847424684159378, + "grad_norm": 0.008589878678321838, + "learning_rate": 0.0002, + "loss": 0.6096630096435547, + "mean_token_accuracy": 0.7536827027797699, + "num_tokens": 18515709.0, + "step": 496 + }, + { + "entropy": 0.5968381017446518, + "epoch": 3.8551992225461613, + "grad_norm": 0.011193851009011269, + "learning_rate": 0.0002, + "loss": 0.6000962257385254, + "mean_token_accuracy": 0.7573477849364281, + "num_tokens": 18553032.0, + "step": 497 + }, + { + "entropy": 0.6045369654893875, + "epoch": 3.8629737609329444, + "grad_norm": 0.009280527010560036, + "learning_rate": 0.0002, + "loss": 0.6028830409049988, + "mean_token_accuracy": 0.7542475759983063, + "num_tokens": 18590308.0, + "step": 498 + }, + { + "entropy": 0.6031981706619263, + "epoch": 3.870748299319728, + "grad_norm": 0.009086862206459045, + "learning_rate": 0.0002, + "loss": 0.6040035486221313, + "mean_token_accuracy": 0.7532067000865936, + "num_tokens": 18627503.0, + "step": 499 + }, + { + "entropy": 0.6000340953469276, + "epoch": 3.878522837706511, + "grad_norm": 0.008906064555048943, + "learning_rate": 0.0002, + "loss": 0.6016078591346741, + "mean_token_accuracy": 0.7553933039307594, + "num_tokens": 18664999.0, + "step": 500 + }, + { + "entropy": 0.613756813108921, + "epoch": 3.8862973760932946, + "grad_norm": 0.00961924996227026, + "learning_rate": 0.0002, + "loss": 0.6131439208984375, + "mean_token_accuracy": 0.7474770769476891, + "num_tokens": 18702736.0, + "step": 501 + }, + { + "entropy": 0.6073272302746773, + "epoch": 3.8940719144800777, + "grad_norm": 0.008611987344920635, + "learning_rate": 0.0002, + "loss": 0.6086411476135254, + "mean_token_accuracy": 0.7537659332156181, + "num_tokens": 18740002.0, + "step": 502 + }, + { + "entropy": 0.5979632884263992, + "epoch": 3.9018464528668613, + "grad_norm": 0.008601277135312557, + "learning_rate": 0.0002, + "loss": 0.5986984968185425, + "mean_token_accuracy": 0.7558256238698959, + "num_tokens": 18777409.0, + "step": 503 + }, + { + "entropy": 0.5990572273731232, + "epoch": 3.9096209912536444, + "grad_norm": 0.009787015616893768, + "learning_rate": 0.0002, + "loss": 0.5969674587249756, + "mean_token_accuracy": 0.7572850733995438, + "num_tokens": 18814832.0, + "step": 504 + }, + { + "entropy": 0.5952424928545952, + "epoch": 3.9173955296404275, + "grad_norm": 0.009869958274066448, + "learning_rate": 0.0002, + "loss": 0.600977897644043, + "mean_token_accuracy": 0.7555051743984222, + "num_tokens": 18852288.0, + "step": 505 + }, + { + "entropy": 0.5953851416707039, + "epoch": 3.925170068027211, + "grad_norm": 0.009635512717068195, + "learning_rate": 0.0002, + "loss": 0.5988470315933228, + "mean_token_accuracy": 0.7552962228655815, + "num_tokens": 18889544.0, + "step": 506 + }, + { + "entropy": 0.6188566163182259, + "epoch": 3.932944606413994, + "grad_norm": 0.00981516670435667, + "learning_rate": 0.0002, + "loss": 0.6207889914512634, + "mean_token_accuracy": 0.748513400554657, + "num_tokens": 18927252.0, + "step": 507 + }, + { + "entropy": 0.6106720492243767, + "epoch": 3.9407191448007772, + "grad_norm": 0.011930068954825401, + "learning_rate": 0.0002, + "loss": 0.6130895614624023, + "mean_token_accuracy": 0.7500510811805725, + "num_tokens": 18964681.0, + "step": 508 + }, + { + "entropy": 0.6134953126311302, + "epoch": 3.9484936831875608, + "grad_norm": 0.009485729970037937, + "learning_rate": 0.0002, + "loss": 0.6170802116394043, + "mean_token_accuracy": 0.7490968182682991, + "num_tokens": 19002066.0, + "step": 509 + }, + { + "entropy": 0.6209791451692581, + "epoch": 3.956268221574344, + "grad_norm": 0.009478907100856304, + "learning_rate": 0.0002, + "loss": 0.6176908612251282, + "mean_token_accuracy": 0.7488641366362572, + "num_tokens": 19039553.0, + "step": 510 + }, + { + "entropy": 0.6174532473087311, + "epoch": 3.9640427599611274, + "grad_norm": 0.010146988555788994, + "learning_rate": 0.0002, + "loss": 0.6160500049591064, + "mean_token_accuracy": 0.7503278478980064, + "num_tokens": 19076777.0, + "step": 511 + }, + { + "entropy": 0.6139644980430603, + "epoch": 3.9718172983479105, + "grad_norm": 0.009649143554270267, + "learning_rate": 0.0002, + "loss": 0.6151527166366577, + "mean_token_accuracy": 0.7500214949250221, + "num_tokens": 19114295.0, + "step": 512 + }, + { + "entropy": 0.5903387889266014, + "epoch": 3.979591836734694, + "grad_norm": 0.009517780505120754, + "learning_rate": 0.0002, + "loss": 0.5949221253395081, + "mean_token_accuracy": 0.7585930302739143, + "num_tokens": 19151608.0, + "step": 513 + }, + { + "entropy": 0.60362558811903, + "epoch": 3.987366375121477, + "grad_norm": 0.008633180521428585, + "learning_rate": 0.0002, + "loss": 0.606721818447113, + "mean_token_accuracy": 0.7524262145161629, + "num_tokens": 19189092.0, + "step": 514 + }, + { + "entropy": 0.6161174476146698, + "epoch": 3.9951409135082603, + "grad_norm": 0.00904986634850502, + "learning_rate": 0.0002, + "loss": 0.6170212030410767, + "mean_token_accuracy": 0.7481908574700356, + "num_tokens": 19226930.0, + "step": 515 + }, + { + "entropy": 0.6157908320426941, + "epoch": 4.0, + "grad_norm": 0.011043760925531387, + "learning_rate": 0.0002, + "loss": 0.6197408437728882, + "mean_token_accuracy": 0.7473827481269837, + "num_tokens": 19250261.0, + "step": 516 + }, + { + "entropy": 0.5984989553689957, + "epoch": 4.0077745383867835, + "grad_norm": 0.010571295395493507, + "learning_rate": 0.0002, + "loss": 0.5962023138999939, + "mean_token_accuracy": 0.7551586180925369, + "num_tokens": 19287781.0, + "step": 517 + }, + { + "entropy": 0.5755362883210182, + "epoch": 4.015549076773566, + "grad_norm": 0.01085303071886301, + "learning_rate": 0.0002, + "loss": 0.5781339406967163, + "mean_token_accuracy": 0.763518862426281, + "num_tokens": 19324763.0, + "step": 518 + }, + { + "entropy": 0.5975531563162804, + "epoch": 4.02332361516035, + "grad_norm": 0.009798814542591572, + "learning_rate": 0.0002, + "loss": 0.6017999649047852, + "mean_token_accuracy": 0.7532066255807877, + "num_tokens": 19362451.0, + "step": 519 + }, + { + "entropy": 0.5838107392191887, + "epoch": 4.031098153547133, + "grad_norm": 0.011370974592864513, + "learning_rate": 0.0002, + "loss": 0.5857977867126465, + "mean_token_accuracy": 0.7589215487241745, + "num_tokens": 19399597.0, + "step": 520 + }, + { + "entropy": 0.586229719221592, + "epoch": 4.038872691933917, + "grad_norm": 0.010519232600927353, + "learning_rate": 0.0002, + "loss": 0.5870205760002136, + "mean_token_accuracy": 0.7586957290768623, + "num_tokens": 19436947.0, + "step": 521 + }, + { + "entropy": 0.5909631699323654, + "epoch": 4.0466472303206995, + "grad_norm": 0.011675548739731312, + "learning_rate": 0.0002, + "loss": 0.5927350521087646, + "mean_token_accuracy": 0.7586767747998238, + "num_tokens": 19474464.0, + "step": 522 + }, + { + "entropy": 0.602616548538208, + "epoch": 4.054421768707483, + "grad_norm": 0.01183371152728796, + "learning_rate": 0.0002, + "loss": 0.6010576486587524, + "mean_token_accuracy": 0.753461204469204, + "num_tokens": 19512364.0, + "step": 523 + }, + { + "entropy": 0.5877483561635017, + "epoch": 4.062196307094267, + "grad_norm": 0.011604937724769115, + "learning_rate": 0.0002, + "loss": 0.5869612693786621, + "mean_token_accuracy": 0.7605117782950401, + "num_tokens": 19549629.0, + "step": 524 + }, + { + "entropy": 0.5913394093513489, + "epoch": 4.069970845481049, + "grad_norm": 0.010066917166113853, + "learning_rate": 0.0002, + "loss": 0.5947997570037842, + "mean_token_accuracy": 0.755763366818428, + "num_tokens": 19586996.0, + "step": 525 + }, + { + "entropy": 0.5896845906972885, + "epoch": 4.077745383867833, + "grad_norm": 0.013865236192941666, + "learning_rate": 0.0002, + "loss": 0.5975737571716309, + "mean_token_accuracy": 0.756596714258194, + "num_tokens": 19624454.0, + "step": 526 + }, + { + "entropy": 0.6071945577859879, + "epoch": 4.085519922254616, + "grad_norm": 0.01125173456966877, + "learning_rate": 0.0002, + "loss": 0.6075310707092285, + "mean_token_accuracy": 0.7516418322920799, + "num_tokens": 19662369.0, + "step": 527 + }, + { + "entropy": 0.6004839465022087, + "epoch": 4.093294460641399, + "grad_norm": 0.012244274839758873, + "learning_rate": 0.0002, + "loss": 0.5988795161247253, + "mean_token_accuracy": 0.7533307895064354, + "num_tokens": 19699833.0, + "step": 528 + }, + { + "entropy": 0.5805928781628609, + "epoch": 4.101068999028183, + "grad_norm": 0.012553567998111248, + "learning_rate": 0.0002, + "loss": 0.5836637616157532, + "mean_token_accuracy": 0.7613400369882584, + "num_tokens": 19736626.0, + "step": 529 + }, + { + "entropy": 0.5802028924226761, + "epoch": 4.108843537414966, + "grad_norm": 0.013091178610920906, + "learning_rate": 0.0002, + "loss": 0.5839430093765259, + "mean_token_accuracy": 0.7619325369596481, + "num_tokens": 19773772.0, + "step": 530 + }, + { + "entropy": 0.5931153893470764, + "epoch": 4.11661807580175, + "grad_norm": 0.0117764538154006, + "learning_rate": 0.0002, + "loss": 0.598299503326416, + "mean_token_accuracy": 0.755822129547596, + "num_tokens": 19810974.0, + "step": 531 + }, + { + "entropy": 0.6081870496273041, + "epoch": 4.124392614188532, + "grad_norm": 0.013240421190857887, + "learning_rate": 0.0002, + "loss": 0.6058256030082703, + "mean_token_accuracy": 0.7531123831868172, + "num_tokens": 19848433.0, + "step": 532 + }, + { + "entropy": 0.6002762466669083, + "epoch": 4.132167152575316, + "grad_norm": 0.010874156840145588, + "learning_rate": 0.0002, + "loss": 0.5934455990791321, + "mean_token_accuracy": 0.7567582130432129, + "num_tokens": 19885930.0, + "step": 533 + }, + { + "entropy": 0.604529857635498, + "epoch": 4.139941690962099, + "grad_norm": 0.011289739049971104, + "learning_rate": 0.0002, + "loss": 0.6058647632598877, + "mean_token_accuracy": 0.7521885484457016, + "num_tokens": 19923130.0, + "step": 534 + }, + { + "entropy": 0.5959961265325546, + "epoch": 4.147716229348882, + "grad_norm": 0.0105770044028759, + "learning_rate": 0.0002, + "loss": 0.5998325347900391, + "mean_token_accuracy": 0.7545555010437965, + "num_tokens": 19960651.0, + "step": 535 + }, + { + "entropy": 0.6115074902772903, + "epoch": 4.155490767735666, + "grad_norm": 0.01272744033485651, + "learning_rate": 0.0002, + "loss": 0.6133629083633423, + "mean_token_accuracy": 0.7504753991961479, + "num_tokens": 19998458.0, + "step": 536 + }, + { + "entropy": 0.5959336087107658, + "epoch": 4.163265306122449, + "grad_norm": 0.01114166434854269, + "learning_rate": 0.0002, + "loss": 0.5921066403388977, + "mean_token_accuracy": 0.7599503472447395, + "num_tokens": 20035742.0, + "step": 537 + }, + { + "entropy": 0.6055325567722321, + "epoch": 4.171039844509233, + "grad_norm": 0.01163046807050705, + "learning_rate": 0.0002, + "loss": 0.6048938035964966, + "mean_token_accuracy": 0.7535717412829399, + "num_tokens": 20073263.0, + "step": 538 + }, + { + "entropy": 0.5937555730342865, + "epoch": 4.178814382896015, + "grad_norm": 0.010925386101007462, + "learning_rate": 0.0002, + "loss": 0.5978741645812988, + "mean_token_accuracy": 0.7580423355102539, + "num_tokens": 20110930.0, + "step": 539 + }, + { + "entropy": 0.6025584638118744, + "epoch": 4.186588921282799, + "grad_norm": 0.013231265358626842, + "learning_rate": 0.0002, + "loss": 0.6098158955574036, + "mean_token_accuracy": 0.7506869807839394, + "num_tokens": 20148878.0, + "step": 540 + }, + { + "entropy": 0.5955850780010223, + "epoch": 4.1943634596695825, + "grad_norm": 0.01381654478609562, + "learning_rate": 0.0002, + "loss": 0.6050733327865601, + "mean_token_accuracy": 0.7540115043520927, + "num_tokens": 20186590.0, + "step": 541 + }, + { + "entropy": 0.6100573241710663, + "epoch": 4.202137998056365, + "grad_norm": 0.01217405591160059, + "learning_rate": 0.0002, + "loss": 0.6091620922088623, + "mean_token_accuracy": 0.7501495629549026, + "num_tokens": 20224026.0, + "step": 542 + }, + { + "entropy": 0.6055784001946449, + "epoch": 4.209912536443149, + "grad_norm": 0.01034702267497778, + "learning_rate": 0.0002, + "loss": 0.6047437191009521, + "mean_token_accuracy": 0.7533470839262009, + "num_tokens": 20261538.0, + "step": 543 + }, + { + "entropy": 0.5968894883990288, + "epoch": 4.217687074829932, + "grad_norm": 0.013704034499824047, + "learning_rate": 0.0002, + "loss": 0.6015293002128601, + "mean_token_accuracy": 0.7537187412381172, + "num_tokens": 20298484.0, + "step": 544 + }, + { + "entropy": 0.5940377935767174, + "epoch": 4.225461613216715, + "grad_norm": 0.011667119339108467, + "learning_rate": 0.0002, + "loss": 0.5925427079200745, + "mean_token_accuracy": 0.7584238648414612, + "num_tokens": 20336353.0, + "step": 545 + }, + { + "entropy": 0.6106893792748451, + "epoch": 4.233236151603498, + "grad_norm": 0.01224418543279171, + "learning_rate": 0.0002, + "loss": 0.611664891242981, + "mean_token_accuracy": 0.7507496625185013, + "num_tokens": 20374019.0, + "step": 546 + }, + { + "entropy": 0.6042328551411629, + "epoch": 4.241010689990282, + "grad_norm": 0.01316764671355486, + "learning_rate": 0.0002, + "loss": 0.6062799096107483, + "mean_token_accuracy": 0.7534623667597771, + "num_tokens": 20411398.0, + "step": 547 + }, + { + "entropy": 0.6105416268110275, + "epoch": 4.2487852283770655, + "grad_norm": 0.012853113003075123, + "learning_rate": 0.0002, + "loss": 0.6092797517776489, + "mean_token_accuracy": 0.7522982135415077, + "num_tokens": 20448672.0, + "step": 548 + }, + { + "entropy": 0.5981989204883575, + "epoch": 4.256559766763848, + "grad_norm": 0.011458336375653744, + "learning_rate": 0.0002, + "loss": 0.5959842205047607, + "mean_token_accuracy": 0.7573426440358162, + "num_tokens": 20486126.0, + "step": 549 + }, + { + "entropy": 0.5939232558012009, + "epoch": 4.264334305150632, + "grad_norm": 0.013793280348181725, + "learning_rate": 0.0002, + "loss": 0.6013151407241821, + "mean_token_accuracy": 0.7532796338200569, + "num_tokens": 20523335.0, + "step": 550 + }, + { + "entropy": 0.5925507992506027, + "epoch": 4.272108843537415, + "grad_norm": 0.012333216145634651, + "learning_rate": 0.0002, + "loss": 0.5946025848388672, + "mean_token_accuracy": 0.7598577961325645, + "num_tokens": 20560754.0, + "step": 551 + }, + { + "entropy": 0.6068093478679657, + "epoch": 4.279883381924198, + "grad_norm": 0.012082048691809177, + "learning_rate": 0.0002, + "loss": 0.6070762872695923, + "mean_token_accuracy": 0.7520242631435394, + "num_tokens": 20598383.0, + "step": 552 + }, + { + "entropy": 0.5919818729162216, + "epoch": 4.2876579203109815, + "grad_norm": 0.011891715228557587, + "learning_rate": 0.0002, + "loss": 0.5928791761398315, + "mean_token_accuracy": 0.7572562247514725, + "num_tokens": 20635386.0, + "step": 553 + }, + { + "entropy": 0.6074100211262703, + "epoch": 4.295432458697765, + "grad_norm": 0.014123337343335152, + "learning_rate": 0.0002, + "loss": 0.6073712706565857, + "mean_token_accuracy": 0.751992791891098, + "num_tokens": 20672892.0, + "step": 554 + }, + { + "entropy": 0.5886855572462082, + "epoch": 4.303206997084548, + "grad_norm": 0.0101819122210145, + "learning_rate": 0.0002, + "loss": 0.5912100076675415, + "mean_token_accuracy": 0.7583736777305603, + "num_tokens": 20710466.0, + "step": 555 + }, + { + "entropy": 0.6005367860198021, + "epoch": 4.310981535471331, + "grad_norm": 0.014812132343649864, + "learning_rate": 0.0002, + "loss": 0.6055353879928589, + "mean_token_accuracy": 0.7521958500146866, + "num_tokens": 20747846.0, + "step": 556 + }, + { + "entropy": 0.5981654673814774, + "epoch": 4.318756073858115, + "grad_norm": 0.011666829697787762, + "learning_rate": 0.0002, + "loss": 0.597842276096344, + "mean_token_accuracy": 0.7551755681633949, + "num_tokens": 20784741.0, + "step": 557 + }, + { + "entropy": 0.5991752445697784, + "epoch": 4.326530612244898, + "grad_norm": 0.012378910556435585, + "learning_rate": 0.0002, + "loss": 0.5976471900939941, + "mean_token_accuracy": 0.7547527700662613, + "num_tokens": 20822385.0, + "step": 558 + }, + { + "entropy": 0.6060795336961746, + "epoch": 4.334305150631681, + "grad_norm": 0.012490339577198029, + "learning_rate": 0.0002, + "loss": 0.6054461002349854, + "mean_token_accuracy": 0.7526181265711784, + "num_tokens": 20860006.0, + "step": 559 + }, + { + "entropy": 0.6072399467229843, + "epoch": 4.3420796890184645, + "grad_norm": 0.014051525853574276, + "learning_rate": 0.0002, + "loss": 0.6056400537490845, + "mean_token_accuracy": 0.7516866251826286, + "num_tokens": 20897385.0, + "step": 560 + }, + { + "entropy": 0.5980757176876068, + "epoch": 4.349854227405248, + "grad_norm": 0.011723170056939125, + "learning_rate": 0.0002, + "loss": 0.5963304042816162, + "mean_token_accuracy": 0.758495531976223, + "num_tokens": 20934914.0, + "step": 561 + }, + { + "entropy": 0.5847646594047546, + "epoch": 4.357628765792031, + "grad_norm": 0.013849250972270966, + "learning_rate": 0.0002, + "loss": 0.5895295143127441, + "mean_token_accuracy": 0.7575425952672958, + "num_tokens": 20972211.0, + "step": 562 + }, + { + "entropy": 0.5863577350974083, + "epoch": 4.365403304178814, + "grad_norm": 0.01223720796406269, + "learning_rate": 0.0002, + "loss": 0.5942325592041016, + "mean_token_accuracy": 0.7572259679436684, + "num_tokens": 21009384.0, + "step": 563 + }, + { + "entropy": 0.5997140482068062, + "epoch": 4.373177842565598, + "grad_norm": 0.014335358515381813, + "learning_rate": 0.0002, + "loss": 0.6024245619773865, + "mean_token_accuracy": 0.7510812431573868, + "num_tokens": 21046739.0, + "step": 564 + }, + { + "entropy": 0.6076342239975929, + "epoch": 4.380952380952381, + "grad_norm": 0.012497556395828724, + "learning_rate": 0.0002, + "loss": 0.6062162518501282, + "mean_token_accuracy": 0.7522109970450401, + "num_tokens": 21084263.0, + "step": 565 + }, + { + "entropy": 0.6001847013831139, + "epoch": 4.388726919339164, + "grad_norm": 0.010952596552670002, + "learning_rate": 0.0002, + "loss": 0.6020297408103943, + "mean_token_accuracy": 0.753420390188694, + "num_tokens": 21121894.0, + "step": 566 + }, + { + "entropy": 0.6051000133156776, + "epoch": 4.396501457725948, + "grad_norm": 0.013345146551728249, + "learning_rate": 0.0002, + "loss": 0.6103641986846924, + "mean_token_accuracy": 0.7505576461553574, + "num_tokens": 21159434.0, + "step": 567 + }, + { + "entropy": 0.5888576209545135, + "epoch": 4.404275996112731, + "grad_norm": 0.011659773997962475, + "learning_rate": 0.0002, + "loss": 0.5904802680015564, + "mean_token_accuracy": 0.7587999328970909, + "num_tokens": 21197109.0, + "step": 568 + }, + { + "entropy": 0.6007365435361862, + "epoch": 4.412050534499514, + "grad_norm": 0.010827448219060898, + "learning_rate": 0.0002, + "loss": 0.6000881195068359, + "mean_token_accuracy": 0.7543788328766823, + "num_tokens": 21234413.0, + "step": 569 + }, + { + "entropy": 0.5974342674016953, + "epoch": 4.419825072886297, + "grad_norm": 0.012830649502575397, + "learning_rate": 0.0002, + "loss": 0.6020520925521851, + "mean_token_accuracy": 0.7534354031085968, + "num_tokens": 21271758.0, + "step": 570 + }, + { + "entropy": 0.6090180650353432, + "epoch": 4.427599611273081, + "grad_norm": 0.012071631848812103, + "learning_rate": 0.0002, + "loss": 0.6067869663238525, + "mean_token_accuracy": 0.7518825978040695, + "num_tokens": 21309387.0, + "step": 571 + }, + { + "entropy": 0.5914840847253799, + "epoch": 4.4353741496598635, + "grad_norm": 0.013224054127931595, + "learning_rate": 0.0002, + "loss": 0.595637857913971, + "mean_token_accuracy": 0.7551431059837341, + "num_tokens": 21346475.0, + "step": 572 + }, + { + "entropy": 0.5997625440359116, + "epoch": 4.443148688046647, + "grad_norm": 0.011799960397183895, + "learning_rate": 0.0002, + "loss": 0.602319598197937, + "mean_token_accuracy": 0.7539779245853424, + "num_tokens": 21383957.0, + "step": 573 + }, + { + "entropy": 0.6102292612195015, + "epoch": 4.450923226433431, + "grad_norm": 0.01201384887099266, + "learning_rate": 0.0002, + "loss": 0.6108826398849487, + "mean_token_accuracy": 0.7517506182193756, + "num_tokens": 21421332.0, + "step": 574 + }, + { + "entropy": 0.5991413816809654, + "epoch": 4.458697764820214, + "grad_norm": 0.010899091139435768, + "learning_rate": 0.0002, + "loss": 0.596094012260437, + "mean_token_accuracy": 0.7565351948142052, + "num_tokens": 21458719.0, + "step": 575 + }, + { + "entropy": 0.5933232456445694, + "epoch": 4.466472303206997, + "grad_norm": 0.010439079254865646, + "learning_rate": 0.0002, + "loss": 0.5930327773094177, + "mean_token_accuracy": 0.7583755627274513, + "num_tokens": 21496264.0, + "step": 576 + }, + { + "entropy": 0.6057801619172096, + "epoch": 4.47424684159378, + "grad_norm": 0.011234867386519909, + "learning_rate": 0.0002, + "loss": 0.6073678135871887, + "mean_token_accuracy": 0.7530662715435028, + "num_tokens": 21533621.0, + "step": 577 + }, + { + "entropy": 0.6064127087593079, + "epoch": 4.482021379980564, + "grad_norm": 0.01104860007762909, + "learning_rate": 0.0002, + "loss": 0.6121537685394287, + "mean_token_accuracy": 0.7498331218957901, + "num_tokens": 21570804.0, + "step": 578 + }, + { + "entropy": 0.5948187559843063, + "epoch": 4.489795918367347, + "grad_norm": 0.01251922082155943, + "learning_rate": 0.0002, + "loss": 0.598996102809906, + "mean_token_accuracy": 0.7545123025774956, + "num_tokens": 21607975.0, + "step": 579 + }, + { + "entropy": 0.614658959209919, + "epoch": 4.49757045675413, + "grad_norm": 0.010701852850615978, + "learning_rate": 0.0002, + "loss": 0.6137805581092834, + "mean_token_accuracy": 0.7465793862938881, + "num_tokens": 21645423.0, + "step": 580 + }, + { + "entropy": 0.5894118696451187, + "epoch": 4.505344995140914, + "grad_norm": 0.012251303531229496, + "learning_rate": 0.0002, + "loss": 0.5877728462219238, + "mean_token_accuracy": 0.75811368227005, + "num_tokens": 21682411.0, + "step": 581 + }, + { + "entropy": 0.6109742075204849, + "epoch": 4.513119533527696, + "grad_norm": 0.011500229127705097, + "learning_rate": 0.0002, + "loss": 0.6115055084228516, + "mean_token_accuracy": 0.7521626874804497, + "num_tokens": 21720167.0, + "step": 582 + }, + { + "entropy": 0.591577798128128, + "epoch": 4.52089407191448, + "grad_norm": 0.011309963651001453, + "learning_rate": 0.0002, + "loss": 0.5981800556182861, + "mean_token_accuracy": 0.7563935667276382, + "num_tokens": 21758012.0, + "step": 583 + }, + { + "entropy": 0.6063844040036201, + "epoch": 4.528668610301263, + "grad_norm": 0.014559866860508919, + "learning_rate": 0.0002, + "loss": 0.6146761178970337, + "mean_token_accuracy": 0.7492925748229027, + "num_tokens": 21795528.0, + "step": 584 + }, + { + "entropy": 0.5918325483798981, + "epoch": 4.536443148688047, + "grad_norm": 0.011580277234315872, + "learning_rate": 0.0002, + "loss": 0.5908594131469727, + "mean_token_accuracy": 0.7565957456827164, + "num_tokens": 21833000.0, + "step": 585 + }, + { + "entropy": 0.612893208861351, + "epoch": 4.54421768707483, + "grad_norm": 0.01330646313726902, + "learning_rate": 0.0002, + "loss": 0.6055165529251099, + "mean_token_accuracy": 0.7545250579714775, + "num_tokens": 21870418.0, + "step": 586 + }, + { + "entropy": 0.5842209830880165, + "epoch": 4.551992225461613, + "grad_norm": 0.012110188603401184, + "learning_rate": 0.0002, + "loss": 0.5849249362945557, + "mean_token_accuracy": 0.7618754804134369, + "num_tokens": 21907507.0, + "step": 587 + }, + { + "entropy": 0.6068574264645576, + "epoch": 4.559766763848397, + "grad_norm": 0.012672025710344315, + "learning_rate": 0.0002, + "loss": 0.6145685911178589, + "mean_token_accuracy": 0.750059075653553, + "num_tokens": 21944988.0, + "step": 588 + }, + { + "entropy": 0.5868222415447235, + "epoch": 4.567541302235179, + "grad_norm": 0.011733310297131538, + "learning_rate": 0.0002, + "loss": 0.5891362428665161, + "mean_token_accuracy": 0.7605921477079391, + "num_tokens": 21982183.0, + "step": 589 + }, + { + "entropy": 0.6040458679199219, + "epoch": 4.575315840621963, + "grad_norm": 0.010982259176671505, + "learning_rate": 0.0002, + "loss": 0.6011037230491638, + "mean_token_accuracy": 0.7543822079896927, + "num_tokens": 22019570.0, + "step": 590 + }, + { + "entropy": 0.5989029258489609, + "epoch": 4.5830903790087465, + "grad_norm": 0.012942496687173843, + "learning_rate": 0.0002, + "loss": 0.5922666788101196, + "mean_token_accuracy": 0.7587461397051811, + "num_tokens": 22056831.0, + "step": 591 + }, + { + "entropy": 0.5930005833506584, + "epoch": 4.59086491739553, + "grad_norm": 0.010408308357000351, + "learning_rate": 0.0002, + "loss": 0.5919668078422546, + "mean_token_accuracy": 0.7574074566364288, + "num_tokens": 22094356.0, + "step": 592 + }, + { + "entropy": 0.5869537368416786, + "epoch": 4.598639455782313, + "grad_norm": 0.013977079652249813, + "learning_rate": 0.0002, + "loss": 0.5976507663726807, + "mean_token_accuracy": 0.7580091804265976, + "num_tokens": 22131838.0, + "step": 593 + }, + { + "entropy": 0.5787304788827896, + "epoch": 4.606413994169096, + "grad_norm": 0.013945071026682854, + "learning_rate": 0.0002, + "loss": 0.5908917188644409, + "mean_token_accuracy": 0.7597628980875015, + "num_tokens": 22169036.0, + "step": 594 + }, + { + "entropy": 0.6027527749538422, + "epoch": 4.61418853255588, + "grad_norm": 0.00982499960809946, + "learning_rate": 0.0002, + "loss": 0.6021907925605774, + "mean_token_accuracy": 0.7546107098460197, + "num_tokens": 22206352.0, + "step": 595 + }, + { + "entropy": 0.6077359542250633, + "epoch": 4.6219630709426625, + "grad_norm": 0.011836841702461243, + "learning_rate": 0.0002, + "loss": 0.6049139499664307, + "mean_token_accuracy": 0.7528544068336487, + "num_tokens": 22243663.0, + "step": 596 + }, + { + "entropy": 0.5822278633713722, + "epoch": 4.629737609329446, + "grad_norm": 0.011577391996979713, + "learning_rate": 0.0002, + "loss": 0.5828737020492554, + "mean_token_accuracy": 0.7616033405065536, + "num_tokens": 22281074.0, + "step": 597 + }, + { + "entropy": 0.5920702815055847, + "epoch": 4.6375121477162295, + "grad_norm": 0.01129237376153469, + "learning_rate": 0.0002, + "loss": 0.5975418090820312, + "mean_token_accuracy": 0.7549193054437637, + "num_tokens": 22318190.0, + "step": 598 + }, + { + "entropy": 0.5989422127604485, + "epoch": 4.645286686103013, + "grad_norm": 0.014368323609232903, + "learning_rate": 0.0002, + "loss": 0.6041890978813171, + "mean_token_accuracy": 0.7541765421628952, + "num_tokens": 22355560.0, + "step": 599 + }, + { + "entropy": 0.602604515850544, + "epoch": 4.653061224489796, + "grad_norm": 0.012781691737473011, + "learning_rate": 0.0002, + "loss": 0.6051725149154663, + "mean_token_accuracy": 0.7530051618814468, + "num_tokens": 22393652.0, + "step": 600 + }, + { + "entropy": 0.6060863882303238, + "epoch": 4.660835762876579, + "grad_norm": 0.013375566340982914, + "learning_rate": 0.0002, + "loss": 0.6032074689865112, + "mean_token_accuracy": 0.7527770921587944, + "num_tokens": 22431345.0, + "step": 601 + }, + { + "entropy": 0.5950343683362007, + "epoch": 4.668610301263363, + "grad_norm": 0.012800985015928745, + "learning_rate": 0.0002, + "loss": 0.5933507084846497, + "mean_token_accuracy": 0.7560804039239883, + "num_tokens": 22469042.0, + "step": 602 + }, + { + "entropy": 0.5962737649679184, + "epoch": 4.6763848396501455, + "grad_norm": 0.014961260370910168, + "learning_rate": 0.0002, + "loss": 0.6006712913513184, + "mean_token_accuracy": 0.7546053975820541, + "num_tokens": 22506485.0, + "step": 603 + }, + { + "entropy": 0.606819398701191, + "epoch": 4.684159378036929, + "grad_norm": 0.011082889512181282, + "learning_rate": 0.0002, + "loss": 0.6065730452537537, + "mean_token_accuracy": 0.7529779449105263, + "num_tokens": 22544222.0, + "step": 604 + }, + { + "entropy": 0.577197976410389, + "epoch": 4.691933916423713, + "grad_norm": 0.014075525104999542, + "learning_rate": 0.0002, + "loss": 0.5835320949554443, + "mean_token_accuracy": 0.7612094879150391, + "num_tokens": 22581327.0, + "step": 605 + }, + { + "entropy": 0.6152481734752655, + "epoch": 4.699708454810495, + "grad_norm": 0.012122808955609798, + "learning_rate": 0.0002, + "loss": 0.6139184236526489, + "mean_token_accuracy": 0.7484366744756699, + "num_tokens": 22619089.0, + "step": 606 + }, + { + "entropy": 0.6120219603180885, + "epoch": 4.707482993197279, + "grad_norm": 0.011670667678117752, + "learning_rate": 0.0002, + "loss": 0.6125247478485107, + "mean_token_accuracy": 0.7505181655287743, + "num_tokens": 22656719.0, + "step": 607 + }, + { + "entropy": 0.5946462079882622, + "epoch": 4.715257531584062, + "grad_norm": 0.011501600034534931, + "learning_rate": 0.0002, + "loss": 0.600022554397583, + "mean_token_accuracy": 0.7565812543034554, + "num_tokens": 22694298.0, + "step": 608 + }, + { + "entropy": 0.5967997536063194, + "epoch": 4.723032069970845, + "grad_norm": 0.011824545450508595, + "learning_rate": 0.0002, + "loss": 0.6004019975662231, + "mean_token_accuracy": 0.7516064792871475, + "num_tokens": 22731785.0, + "step": 609 + }, + { + "entropy": 0.6012083142995834, + "epoch": 4.730806608357629, + "grad_norm": 0.009814469143748283, + "learning_rate": 0.0002, + "loss": 0.6001886129379272, + "mean_token_accuracy": 0.7529330998659134, + "num_tokens": 22769434.0, + "step": 610 + }, + { + "entropy": 0.6195448860526085, + "epoch": 4.738581146744412, + "grad_norm": 0.012913862243294716, + "learning_rate": 0.0002, + "loss": 0.6205934286117554, + "mean_token_accuracy": 0.7455445975065231, + "num_tokens": 22806676.0, + "step": 611 + }, + { + "entropy": 0.5957802012562752, + "epoch": 4.746355685131196, + "grad_norm": 0.011553781107068062, + "learning_rate": 0.0002, + "loss": 0.5980523824691772, + "mean_token_accuracy": 0.7560853660106659, + "num_tokens": 22843869.0, + "step": 612 + }, + { + "entropy": 0.6090810522437096, + "epoch": 4.754130223517978, + "grad_norm": 0.01271018385887146, + "learning_rate": 0.0002, + "loss": 0.6106667518615723, + "mean_token_accuracy": 0.7504242658615112, + "num_tokens": 22881762.0, + "step": 613 + }, + { + "entropy": 0.599302776157856, + "epoch": 4.761904761904762, + "grad_norm": 0.012581666931509972, + "learning_rate": 0.0002, + "loss": 0.5982247591018677, + "mean_token_accuracy": 0.7549748122692108, + "num_tokens": 22918922.0, + "step": 614 + }, + { + "entropy": 0.5844490081071854, + "epoch": 4.769679300291545, + "grad_norm": 0.011192350648343563, + "learning_rate": 0.0002, + "loss": 0.5844826698303223, + "mean_token_accuracy": 0.7625714018940926, + "num_tokens": 22956332.0, + "step": 615 + }, + { + "entropy": 0.5874569863080978, + "epoch": 4.777453838678328, + "grad_norm": 0.014751655049622059, + "learning_rate": 0.0002, + "loss": 0.5924921035766602, + "mean_token_accuracy": 0.7579960823059082, + "num_tokens": 22993598.0, + "step": 616 + }, + { + "entropy": 0.5977986827492714, + "epoch": 4.785228377065112, + "grad_norm": 0.011030304245650768, + "learning_rate": 0.0002, + "loss": 0.6010499000549316, + "mean_token_accuracy": 0.7557829320430756, + "num_tokens": 23031001.0, + "step": 617 + }, + { + "entropy": 0.599865585565567, + "epoch": 4.793002915451895, + "grad_norm": 0.011046946048736572, + "learning_rate": 0.0002, + "loss": 0.6028144359588623, + "mean_token_accuracy": 0.7549864649772644, + "num_tokens": 23068467.0, + "step": 618 + }, + { + "entropy": 0.6039430871605873, + "epoch": 4.800777453838679, + "grad_norm": 0.011677506379783154, + "learning_rate": 0.0002, + "loss": 0.6007229089736938, + "mean_token_accuracy": 0.7543792948126793, + "num_tokens": 23105954.0, + "step": 619 + }, + { + "entropy": 0.5956612825393677, + "epoch": 4.808551992225461, + "grad_norm": 0.011992014944553375, + "learning_rate": 0.0002, + "loss": 0.5964670181274414, + "mean_token_accuracy": 0.7563618123531342, + "num_tokens": 23143320.0, + "step": 620 + }, + { + "entropy": 0.5978101342916489, + "epoch": 4.816326530612245, + "grad_norm": 0.011897146701812744, + "learning_rate": 0.0002, + "loss": 0.6034868359565735, + "mean_token_accuracy": 0.7537665143609047, + "num_tokens": 23180916.0, + "step": 621 + }, + { + "entropy": 0.5931472703814507, + "epoch": 4.8241010689990285, + "grad_norm": 0.013459539040923119, + "learning_rate": 0.0002, + "loss": 0.6040017604827881, + "mean_token_accuracy": 0.7539473846554756, + "num_tokens": 23218627.0, + "step": 622 + }, + { + "entropy": 0.5916698947548866, + "epoch": 4.831875607385811, + "grad_norm": 0.011180682107806206, + "learning_rate": 0.0002, + "loss": 0.5919395685195923, + "mean_token_accuracy": 0.7593255490064621, + "num_tokens": 23255772.0, + "step": 623 + }, + { + "entropy": 0.6087042316794395, + "epoch": 4.839650145772595, + "grad_norm": 0.010437374003231525, + "learning_rate": 0.0002, + "loss": 0.6082122325897217, + "mean_token_accuracy": 0.7515282183885574, + "num_tokens": 23293061.0, + "step": 624 + }, + { + "entropy": 0.5966414213180542, + "epoch": 4.847424684159378, + "grad_norm": 0.011942134238779545, + "learning_rate": 0.0002, + "loss": 0.595150351524353, + "mean_token_accuracy": 0.7563839182257652, + "num_tokens": 23330109.0, + "step": 625 + }, + { + "entropy": 0.5881121456623077, + "epoch": 4.855199222546162, + "grad_norm": 0.011955403722822666, + "learning_rate": 0.0002, + "loss": 0.590496301651001, + "mean_token_accuracy": 0.7592649832367897, + "num_tokens": 23367496.0, + "step": 626 + }, + { + "entropy": 0.6133239194750786, + "epoch": 4.862973760932944, + "grad_norm": 0.012963500805199146, + "learning_rate": 0.0002, + "loss": 0.6236002445220947, + "mean_token_accuracy": 0.7459099292755127, + "num_tokens": 23404854.0, + "step": 627 + }, + { + "entropy": 0.5968378111720085, + "epoch": 4.870748299319728, + "grad_norm": 0.013238959014415741, + "learning_rate": 0.0002, + "loss": 0.5976919531822205, + "mean_token_accuracy": 0.7568426579236984, + "num_tokens": 23442227.0, + "step": 628 + }, + { + "entropy": 0.609023816883564, + "epoch": 4.8785228377065115, + "grad_norm": 0.012166466563940048, + "learning_rate": 0.0002, + "loss": 0.6067010164260864, + "mean_token_accuracy": 0.7532210573554039, + "num_tokens": 23479346.0, + "step": 629 + }, + { + "entropy": 0.6018581166863441, + "epoch": 4.886297376093294, + "grad_norm": 0.011096199974417686, + "learning_rate": 0.0002, + "loss": 0.5967071652412415, + "mean_token_accuracy": 0.7587796524167061, + "num_tokens": 23516484.0, + "step": 630 + }, + { + "entropy": 0.6068798899650574, + "epoch": 4.894071914480078, + "grad_norm": 0.0127568943426013, + "learning_rate": 0.0002, + "loss": 0.6059014797210693, + "mean_token_accuracy": 0.7524421662092209, + "num_tokens": 23553907.0, + "step": 631 + }, + { + "entropy": 0.5919808447360992, + "epoch": 4.901846452866861, + "grad_norm": 0.011789746582508087, + "learning_rate": 0.0002, + "loss": 0.596630334854126, + "mean_token_accuracy": 0.757590651512146, + "num_tokens": 23591693.0, + "step": 632 + }, + { + "entropy": 0.6100347265601158, + "epoch": 4.909620991253644, + "grad_norm": 0.013258693739771843, + "learning_rate": 0.0002, + "loss": 0.6171900033950806, + "mean_token_accuracy": 0.7499294355511665, + "num_tokens": 23629030.0, + "step": 633 + }, + { + "entropy": 0.5936124697327614, + "epoch": 4.9173955296404275, + "grad_norm": 0.011930654756724834, + "learning_rate": 0.0002, + "loss": 0.5924524664878845, + "mean_token_accuracy": 0.7581655383110046, + "num_tokens": 23666601.0, + "step": 634 + }, + { + "entropy": 0.6037433966994286, + "epoch": 4.925170068027211, + "grad_norm": 0.010547666810452938, + "learning_rate": 0.0002, + "loss": 0.6054027080535889, + "mean_token_accuracy": 0.7513353079557419, + "num_tokens": 23703928.0, + "step": 635 + }, + { + "entropy": 0.6012375876307487, + "epoch": 4.932944606413994, + "grad_norm": 0.013904466293752193, + "learning_rate": 0.0002, + "loss": 0.6056373119354248, + "mean_token_accuracy": 0.7527650520205498, + "num_tokens": 23741413.0, + "step": 636 + }, + { + "entropy": 0.6080401092767715, + "epoch": 4.940719144800777, + "grad_norm": 0.012218053452670574, + "learning_rate": 0.0002, + "loss": 0.6113067865371704, + "mean_token_accuracy": 0.7506906762719154, + "num_tokens": 23778797.0, + "step": 637 + }, + { + "entropy": 0.6042793691158295, + "epoch": 4.948493683187561, + "grad_norm": 0.012100595980882645, + "learning_rate": 0.0002, + "loss": 0.6038735508918762, + "mean_token_accuracy": 0.7550994455814362, + "num_tokens": 23816409.0, + "step": 638 + }, + { + "entropy": 0.5889951586723328, + "epoch": 4.956268221574344, + "grad_norm": 0.012997129000723362, + "learning_rate": 0.0002, + "loss": 0.5903059840202332, + "mean_token_accuracy": 0.7594538182020187, + "num_tokens": 23853723.0, + "step": 639 + }, + { + "entropy": 0.5925157070159912, + "epoch": 4.964042759961127, + "grad_norm": 0.015738792717456818, + "learning_rate": 0.0002, + "loss": 0.5936194658279419, + "mean_token_accuracy": 0.7593093439936638, + "num_tokens": 23891029.0, + "step": 640 + }, + { + "entropy": 0.5936921015381813, + "epoch": 4.9718172983479105, + "grad_norm": 0.01318391039967537, + "learning_rate": 0.0002, + "loss": 0.5958787202835083, + "mean_token_accuracy": 0.7549382373690605, + "num_tokens": 23928148.0, + "step": 641 + }, + { + "entropy": 0.6125310584902763, + "epoch": 4.979591836734694, + "grad_norm": 0.013194733299314976, + "learning_rate": 0.0002, + "loss": 0.6129195094108582, + "mean_token_accuracy": 0.7493861764669418, + "num_tokens": 23965085.0, + "step": 642 + }, + { + "entropy": 0.5964741930365562, + "epoch": 4.987366375121477, + "grad_norm": 0.013308845460414886, + "learning_rate": 0.0002, + "loss": 0.5979577302932739, + "mean_token_accuracy": 0.7562628239393234, + "num_tokens": 24002145.0, + "step": 643 + }, + { + "entropy": 0.5872825607657433, + "epoch": 4.99514091350826, + "grad_norm": 0.010709763504564762, + "learning_rate": 0.0002, + "loss": 0.5851190686225891, + "mean_token_accuracy": 0.7606633305549622, + "num_tokens": 24039501.0, + "step": 644 + }, + { + "entropy": 0.6111570835113526, + "epoch": 5.0, + "grad_norm": 0.012978802435100079, + "learning_rate": 0.0002, + "loss": 0.6106741428375244, + "mean_token_accuracy": 0.749509060382843, + "num_tokens": 24062815.0, + "step": 645 } ], "logging_steps": 1, - "max_steps": 310, + "max_steps": 645, "num_input_tokens_seen": 0, - "num_train_epochs": 10, + "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { @@ -3127,8 +6477,8 @@ "attributes": {} } }, - "total_flos": 1.632026661790679e+18, - "train_batch_size": 16, + "total_flos": 2.2502112888923095e+18, + "train_batch_size": 4, "trial_name": null, "trial_params": null }