{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 645, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1461779922246933, "epoch": 0.007774538386783284, "grad_norm": 0.2348785102367401, "learning_rate": 0.0002, "loss": 2.5822062492370605, "mean_token_accuracy": 0.5106955841183662, "num_tokens": 37728.0, "step": 1 }, { "entropy": 1.2709465026855469, "epoch": 0.015549076773566569, "grad_norm": 0.19847582280635834, "learning_rate": 0.0002, "loss": 2.256243944168091, "mean_token_accuracy": 0.5385559350252151, "num_tokens": 74823.0, "step": 2 }, { "entropy": 1.457642063498497, "epoch": 0.023323615160349854, "grad_norm": 0.14325936138629913, "learning_rate": 0.0002, "loss": 1.8135013580322266, "mean_token_accuracy": 0.5658686235547066, "num_tokens": 112223.0, "step": 3 }, { "entropy": 1.4453874379396439, "epoch": 0.031098153547133137, "grad_norm": 0.11537832021713257, "learning_rate": 0.0002, "loss": 1.4907238483428955, "mean_token_accuracy": 0.6095475852489471, "num_tokens": 149646.0, "step": 4 }, { "entropy": 1.4222392737865448, "epoch": 0.038872691933916424, "grad_norm": 0.14347851276397705, "learning_rate": 0.0002, "loss": 1.3716599941253662, "mean_token_accuracy": 0.614239789545536, "num_tokens": 186807.0, "step": 5 }, { "entropy": 1.3676332831382751, "epoch": 0.04664723032069971, "grad_norm": 0.07458607107400894, "learning_rate": 0.0002, "loss": 1.2618626356124878, "mean_token_accuracy": 0.6355780363082886, "num_tokens": 224243.0, "step": 6 }, { "entropy": 1.2903779596090317, "epoch": 0.05442176870748299, "grad_norm": 0.050369806587696075, "learning_rate": 0.0002, "loss": 1.1705503463745117, "mean_token_accuracy": 0.6446279659867287, "num_tokens": 261678.0, "step": 7 }, { "entropy": 1.231130599975586, "epoch": 0.062196307094266275, "grad_norm": 0.05470636859536171, "learning_rate": 0.0002, "loss": 1.0978062152862549, "mean_token_accuracy": 0.6580947414040565, "num_tokens": 298703.0, "step": 8 }, { "entropy": 1.1396304965019226, "epoch": 0.06997084548104957, "grad_norm": 0.05549474433064461, "learning_rate": 0.0002, "loss": 1.026996374130249, "mean_token_accuracy": 0.6708663776516914, "num_tokens": 336240.0, "step": 9 }, { "entropy": 1.0528622567653656, "epoch": 0.07774538386783285, "grad_norm": 0.05926097184419632, "learning_rate": 0.0002, "loss": 0.9768505096435547, "mean_token_accuracy": 0.6747338622808456, "num_tokens": 373808.0, "step": 10 }, { "entropy": 0.978929877281189, "epoch": 0.08551992225461613, "grad_norm": 0.08427942544221878, "learning_rate": 0.0002, "loss": 0.9218605756759644, "mean_token_accuracy": 0.6868897452950478, "num_tokens": 410822.0, "step": 11 }, { "entropy": 0.9272410869598389, "epoch": 0.09329446064139942, "grad_norm": 0.0502631776034832, "learning_rate": 0.0002, "loss": 0.8876349925994873, "mean_token_accuracy": 0.688661016523838, "num_tokens": 447975.0, "step": 12 }, { "entropy": 0.860072985291481, "epoch": 0.1010689990281827, "grad_norm": 0.04337044060230255, "learning_rate": 0.0002, "loss": 0.8350162506103516, "mean_token_accuracy": 0.7001973986625671, "num_tokens": 485476.0, "step": 13 }, { "entropy": 0.7882575914263725, "epoch": 0.10884353741496598, "grad_norm": 0.06162057816982269, "learning_rate": 0.0002, "loss": 0.8057988882064819, "mean_token_accuracy": 0.7050592303276062, "num_tokens": 522792.0, "step": 14 }, { "entropy": 0.7824503108859062, "epoch": 0.11661807580174927, "grad_norm": 0.03932056203484535, "learning_rate": 0.0002, "loss": 0.7716900110244751, "mean_token_accuracy": 0.7123773470520973, "num_tokens": 559845.0, "step": 15 }, { "entropy": 0.7571921274065971, "epoch": 0.12439261418853255, "grad_norm": 0.03887049853801727, "learning_rate": 0.0002, "loss": 0.7427914142608643, "mean_token_accuracy": 0.721781499683857, "num_tokens": 596752.0, "step": 16 }, { "entropy": 0.7445609271526337, "epoch": 0.13216715257531583, "grad_norm": 0.037259574979543686, "learning_rate": 0.0002, "loss": 0.7245944738388062, "mean_token_accuracy": 0.7208689078688622, "num_tokens": 634143.0, "step": 17 }, { "entropy": 0.7450662180781364, "epoch": 0.13994169096209913, "grad_norm": 0.03612779080867767, "learning_rate": 0.0002, "loss": 0.7255409955978394, "mean_token_accuracy": 0.7214401289820671, "num_tokens": 671585.0, "step": 18 }, { "entropy": 0.7271910980343819, "epoch": 0.1477162293488824, "grad_norm": 0.03141465783119202, "learning_rate": 0.0002, "loss": 0.7076310515403748, "mean_token_accuracy": 0.7255471646785736, "num_tokens": 708756.0, "step": 19 }, { "entropy": 0.7060252502560616, "epoch": 0.1554907677356657, "grad_norm": 0.035933561623096466, "learning_rate": 0.0002, "loss": 0.6859346628189087, "mean_token_accuracy": 0.732830710709095, "num_tokens": 746139.0, "step": 20 }, { "entropy": 0.6829683035612106, "epoch": 0.16326530612244897, "grad_norm": 0.03822736069560051, "learning_rate": 0.0002, "loss": 0.6772962212562561, "mean_token_accuracy": 0.7338771298527718, "num_tokens": 783417.0, "step": 21 }, { "entropy": 0.6782366037368774, "epoch": 0.17103984450923226, "grad_norm": 0.031850460916757584, "learning_rate": 0.0002, "loss": 0.6737133264541626, "mean_token_accuracy": 0.7363682463765144, "num_tokens": 820745.0, "step": 22 }, { "entropy": 0.6792467907071114, "epoch": 0.17881438289601556, "grad_norm": 0.031343962997198105, "learning_rate": 0.0002, "loss": 0.6833145618438721, "mean_token_accuracy": 0.7314189001917839, "num_tokens": 858477.0, "step": 23 }, { "entropy": 0.6493787094950676, "epoch": 0.18658892128279883, "grad_norm": 0.028227699920535088, "learning_rate": 0.0002, "loss": 0.6512086987495422, "mean_token_accuracy": 0.7448033019900322, "num_tokens": 895754.0, "step": 24 }, { "entropy": 0.6527747735381126, "epoch": 0.19436345966958213, "grad_norm": 0.02940857782959938, "learning_rate": 0.0002, "loss": 0.6458977460861206, "mean_token_accuracy": 0.7454173043370247, "num_tokens": 933200.0, "step": 25 }, { "entropy": 0.6647381633520126, "epoch": 0.2021379980563654, "grad_norm": 0.03015323169529438, "learning_rate": 0.0002, "loss": 0.6591448783874512, "mean_token_accuracy": 0.7374408692121506, "num_tokens": 970838.0, "step": 26 }, { "entropy": 0.6438521891832352, "epoch": 0.2099125364431487, "grad_norm": 0.035360876470804214, "learning_rate": 0.0002, "loss": 0.6528849601745605, "mean_token_accuracy": 0.7403199598193169, "num_tokens": 1008094.0, "step": 27 }, { "entropy": 0.6399626433849335, "epoch": 0.21768707482993196, "grad_norm": 0.02637004852294922, "learning_rate": 0.0002, "loss": 0.6530839204788208, "mean_token_accuracy": 0.7398090362548828, "num_tokens": 1045463.0, "step": 28 }, { "entropy": 0.6436624526977539, "epoch": 0.22546161321671526, "grad_norm": 0.02592352218925953, "learning_rate": 0.0002, "loss": 0.6487458944320679, "mean_token_accuracy": 0.7412822172045708, "num_tokens": 1083139.0, "step": 29 }, { "entropy": 0.653114914894104, "epoch": 0.23323615160349853, "grad_norm": 0.018322035670280457, "learning_rate": 0.0002, "loss": 0.6511994004249573, "mean_token_accuracy": 0.7411110699176788, "num_tokens": 1120783.0, "step": 30 }, { "entropy": 0.642485961318016, "epoch": 0.24101068999028183, "grad_norm": 0.021689819172024727, "learning_rate": 0.0002, "loss": 0.644116222858429, "mean_token_accuracy": 0.7440010756254196, "num_tokens": 1158207.0, "step": 31 }, { "entropy": 0.6343450918793678, "epoch": 0.2487852283770651, "grad_norm": 0.02071012370288372, "learning_rate": 0.0002, "loss": 0.6319076418876648, "mean_token_accuracy": 0.7487388849258423, "num_tokens": 1195845.0, "step": 32 }, { "entropy": 0.6410091295838356, "epoch": 0.2565597667638484, "grad_norm": 0.025183040648698807, "learning_rate": 0.0002, "loss": 0.6358401775360107, "mean_token_accuracy": 0.7465788945555687, "num_tokens": 1233366.0, "step": 33 }, { "entropy": 0.6519959643483162, "epoch": 0.26433430515063167, "grad_norm": 0.017367947846651077, "learning_rate": 0.0002, "loss": 0.6433607339859009, "mean_token_accuracy": 0.7429918646812439, "num_tokens": 1270710.0, "step": 34 }, { "entropy": 0.6490929946303368, "epoch": 0.272108843537415, "grad_norm": 0.023137487471103668, "learning_rate": 0.0002, "loss": 0.6468774676322937, "mean_token_accuracy": 0.7406889051198959, "num_tokens": 1308095.0, "step": 35 }, { "entropy": 0.6438097059726715, "epoch": 0.27988338192419826, "grad_norm": 0.016993502154946327, "learning_rate": 0.0002, "loss": 0.6424656510353088, "mean_token_accuracy": 0.7413171753287315, "num_tokens": 1345646.0, "step": 36 }, { "entropy": 0.6314259544014931, "epoch": 0.28765792031098153, "grad_norm": 0.016146596521139145, "learning_rate": 0.0002, "loss": 0.6370364427566528, "mean_token_accuracy": 0.7465247958898544, "num_tokens": 1382928.0, "step": 37 }, { "entropy": 0.6270746886730194, "epoch": 0.2954324586977648, "grad_norm": 0.019162772223353386, "learning_rate": 0.0002, "loss": 0.6330348253250122, "mean_token_accuracy": 0.747043713927269, "num_tokens": 1420089.0, "step": 38 }, { "entropy": 0.6293222159147263, "epoch": 0.3032069970845481, "grad_norm": 0.01702946238219738, "learning_rate": 0.0002, "loss": 0.6317635178565979, "mean_token_accuracy": 0.7488930821418762, "num_tokens": 1457216.0, "step": 39 }, { "entropy": 0.6111311987042427, "epoch": 0.3109815354713314, "grad_norm": 0.015137894079089165, "learning_rate": 0.0002, "loss": 0.6177330017089844, "mean_token_accuracy": 0.753462478518486, "num_tokens": 1494415.0, "step": 40 }, { "entropy": 0.6119553595781326, "epoch": 0.31875607385811466, "grad_norm": 0.014271042309701443, "learning_rate": 0.0002, "loss": 0.6184912919998169, "mean_token_accuracy": 0.7530097812414169, "num_tokens": 1531665.0, "step": 41 }, { "entropy": 0.627587340772152, "epoch": 0.32653061224489793, "grad_norm": 0.01676957495510578, "learning_rate": 0.0002, "loss": 0.628797173500061, "mean_token_accuracy": 0.7489041686058044, "num_tokens": 1568905.0, "step": 42 }, { "entropy": 0.6380143910646439, "epoch": 0.33430515063168126, "grad_norm": 0.013997296802699566, "learning_rate": 0.0002, "loss": 0.6401110291481018, "mean_token_accuracy": 0.7437692731618881, "num_tokens": 1606022.0, "step": 43 }, { "entropy": 0.6236186027526855, "epoch": 0.34207968901846453, "grad_norm": 0.013737027533352375, "learning_rate": 0.0002, "loss": 0.622249960899353, "mean_token_accuracy": 0.7506565973162651, "num_tokens": 1643817.0, "step": 44 }, { "entropy": 0.6351634711027145, "epoch": 0.3498542274052478, "grad_norm": 0.013750840909779072, "learning_rate": 0.0002, "loss": 0.6342694163322449, "mean_token_accuracy": 0.7469271644949913, "num_tokens": 1681417.0, "step": 45 }, { "entropy": 0.6226040348410606, "epoch": 0.3576287657920311, "grad_norm": 0.015259931795299053, "learning_rate": 0.0002, "loss": 0.6237019896507263, "mean_token_accuracy": 0.7505070269107819, "num_tokens": 1718574.0, "step": 46 }, { "entropy": 0.6210184469819069, "epoch": 0.3654033041788144, "grad_norm": 0.013225192204117775, "learning_rate": 0.0002, "loss": 0.6187986135482788, "mean_token_accuracy": 0.7520730867981911, "num_tokens": 1756095.0, "step": 47 }, { "entropy": 0.6205598041415215, "epoch": 0.37317784256559766, "grad_norm": 0.012887167744338512, "learning_rate": 0.0002, "loss": 0.6181526780128479, "mean_token_accuracy": 0.7511478438973427, "num_tokens": 1793392.0, "step": 48 }, { "entropy": 0.629549115896225, "epoch": 0.38095238095238093, "grad_norm": 0.013227855786681175, "learning_rate": 0.0002, "loss": 0.6304742097854614, "mean_token_accuracy": 0.7472723796963692, "num_tokens": 1830606.0, "step": 49 }, { "entropy": 0.6296898201107979, "epoch": 0.38872691933916426, "grad_norm": 0.015021155588328838, "learning_rate": 0.0002, "loss": 0.6288135647773743, "mean_token_accuracy": 0.7465364933013916, "num_tokens": 1868232.0, "step": 50 }, { "entropy": 0.6357625275850296, "epoch": 0.3965014577259475, "grad_norm": 0.011794226244091988, "learning_rate": 0.0002, "loss": 0.6371973156929016, "mean_token_accuracy": 0.7450965940952301, "num_tokens": 1905598.0, "step": 51 }, { "entropy": 0.6295278668403625, "epoch": 0.4042759961127308, "grad_norm": 0.012368254363536835, "learning_rate": 0.0002, "loss": 0.6367925405502319, "mean_token_accuracy": 0.7448450028896332, "num_tokens": 1942785.0, "step": 52 }, { "entropy": 0.6321664452552795, "epoch": 0.41205053449951407, "grad_norm": 0.011660202406346798, "learning_rate": 0.0002, "loss": 0.6337926983833313, "mean_token_accuracy": 0.7433984354138374, "num_tokens": 1980646.0, "step": 53 }, { "entropy": 0.6304126009345055, "epoch": 0.4198250728862974, "grad_norm": 0.012000083923339844, "learning_rate": 0.0002, "loss": 0.6315821409225464, "mean_token_accuracy": 0.7455745488405228, "num_tokens": 2018148.0, "step": 54 }, { "entropy": 0.6312398687005043, "epoch": 0.42759961127308066, "grad_norm": 0.012478172779083252, "learning_rate": 0.0002, "loss": 0.6293996572494507, "mean_token_accuracy": 0.7464256510138512, "num_tokens": 2055123.0, "step": 55 }, { "entropy": 0.6144075095653534, "epoch": 0.43537414965986393, "grad_norm": 0.010203132405877113, "learning_rate": 0.0002, "loss": 0.6101412773132324, "mean_token_accuracy": 0.7551510035991669, "num_tokens": 2092759.0, "step": 56 }, { "entropy": 0.6334135234355927, "epoch": 0.44314868804664725, "grad_norm": 0.012491037137806416, "learning_rate": 0.0002, "loss": 0.6366456747055054, "mean_token_accuracy": 0.7441563606262207, "num_tokens": 2130468.0, "step": 57 }, { "entropy": 0.6204067915678024, "epoch": 0.4509232264334305, "grad_norm": 0.012662500143051147, "learning_rate": 0.0002, "loss": 0.6225067377090454, "mean_token_accuracy": 0.7498065009713173, "num_tokens": 2167896.0, "step": 58 }, { "entropy": 0.626205176115036, "epoch": 0.4586977648202138, "grad_norm": 0.011919913813471794, "learning_rate": 0.0002, "loss": 0.6297718286514282, "mean_token_accuracy": 0.7457590103149414, "num_tokens": 2204991.0, "step": 59 }, { "entropy": 0.6314920708537102, "epoch": 0.46647230320699706, "grad_norm": 0.011844294145703316, "learning_rate": 0.0002, "loss": 0.6283063888549805, "mean_token_accuracy": 0.7473507225513458, "num_tokens": 2242421.0, "step": 60 }, { "entropy": 0.629265584051609, "epoch": 0.4742468415937804, "grad_norm": 0.012998970225453377, "learning_rate": 0.0002, "loss": 0.6303939819335938, "mean_token_accuracy": 0.7454146966338158, "num_tokens": 2279756.0, "step": 61 }, { "entropy": 0.6266416981816292, "epoch": 0.48202137998056366, "grad_norm": 0.010719172656536102, "learning_rate": 0.0002, "loss": 0.6256165504455566, "mean_token_accuracy": 0.7477178424596786, "num_tokens": 2317119.0, "step": 62 }, { "entropy": 0.6031938791275024, "epoch": 0.4897959183673469, "grad_norm": 0.011259288527071476, "learning_rate": 0.0002, "loss": 0.5979391932487488, "mean_token_accuracy": 0.7593775168061256, "num_tokens": 2354598.0, "step": 63 }, { "entropy": 0.6359111741185188, "epoch": 0.4975704567541302, "grad_norm": 0.01182929240167141, "learning_rate": 0.0002, "loss": 0.6360020041465759, "mean_token_accuracy": 0.7429406046867371, "num_tokens": 2391824.0, "step": 64 }, { "entropy": 0.6270973086357117, "epoch": 0.5053449951409135, "grad_norm": 0.01080579124391079, "learning_rate": 0.0002, "loss": 0.6288405060768127, "mean_token_accuracy": 0.7458023801445961, "num_tokens": 2428949.0, "step": 65 }, { "entropy": 0.6371860653162003, "epoch": 0.5131195335276968, "grad_norm": 0.012401307933032513, "learning_rate": 0.0002, "loss": 0.6441806554794312, "mean_token_accuracy": 0.7399793341755867, "num_tokens": 2466079.0, "step": 66 }, { "entropy": 0.6057624816894531, "epoch": 0.5208940719144801, "grad_norm": 0.012216067872941494, "learning_rate": 0.0002, "loss": 0.6104533672332764, "mean_token_accuracy": 0.754143625497818, "num_tokens": 2503686.0, "step": 67 }, { "entropy": 0.6143222749233246, "epoch": 0.5286686103012633, "grad_norm": 0.010598300956189632, "learning_rate": 0.0002, "loss": 0.617759108543396, "mean_token_accuracy": 0.7507391050457954, "num_tokens": 2541428.0, "step": 68 }, { "entropy": 0.6160529032349586, "epoch": 0.5364431486880467, "grad_norm": 0.010992376133799553, "learning_rate": 0.0002, "loss": 0.6156395673751831, "mean_token_accuracy": 0.7503774240612984, "num_tokens": 2578762.0, "step": 69 }, { "entropy": 0.6199713721871376, "epoch": 0.54421768707483, "grad_norm": 0.01134777907282114, "learning_rate": 0.0002, "loss": 0.6140978932380676, "mean_token_accuracy": 0.7530878558754921, "num_tokens": 2616254.0, "step": 70 }, { "entropy": 0.6425308436155319, "epoch": 0.5519922254616132, "grad_norm": 0.011413667351007462, "learning_rate": 0.0002, "loss": 0.63960862159729, "mean_token_accuracy": 0.7409021556377411, "num_tokens": 2653615.0, "step": 71 }, { "entropy": 0.6269439905881882, "epoch": 0.5597667638483965, "grad_norm": 0.011452693492174149, "learning_rate": 0.0002, "loss": 0.6268940567970276, "mean_token_accuracy": 0.7482407689094543, "num_tokens": 2691144.0, "step": 72 }, { "entropy": 0.6223431453108788, "epoch": 0.5675413022351797, "grad_norm": 0.011051226407289505, "learning_rate": 0.0002, "loss": 0.627192497253418, "mean_token_accuracy": 0.7496485412120819, "num_tokens": 2728868.0, "step": 73 }, { "entropy": 0.6142039522528648, "epoch": 0.5753158406219631, "grad_norm": 0.010462508536875248, "learning_rate": 0.0002, "loss": 0.6176329851150513, "mean_token_accuracy": 0.7508676871657372, "num_tokens": 2766300.0, "step": 74 }, { "entropy": 0.6121213287115097, "epoch": 0.5830903790087464, "grad_norm": 0.01290794089436531, "learning_rate": 0.0002, "loss": 0.6207513809204102, "mean_token_accuracy": 0.7499961778521538, "num_tokens": 2803656.0, "step": 75 }, { "entropy": 0.6135914027690887, "epoch": 0.5908649173955296, "grad_norm": 0.009645558893680573, "learning_rate": 0.0002, "loss": 0.6158081293106079, "mean_token_accuracy": 0.7523107752203941, "num_tokens": 2841367.0, "step": 76 }, { "entropy": 0.6079287081956863, "epoch": 0.5986394557823129, "grad_norm": 0.010133286938071251, "learning_rate": 0.0002, "loss": 0.6089348196983337, "mean_token_accuracy": 0.7539728805422783, "num_tokens": 2878743.0, "step": 77 }, { "entropy": 0.619053803384304, "epoch": 0.6064139941690962, "grad_norm": 0.011026635766029358, "learning_rate": 0.0002, "loss": 0.6179240942001343, "mean_token_accuracy": 0.752836562693119, "num_tokens": 2916083.0, "step": 78 }, { "entropy": 0.6179199442267418, "epoch": 0.6141885325558795, "grad_norm": 0.009910841472446918, "learning_rate": 0.0002, "loss": 0.6233879923820496, "mean_token_accuracy": 0.7482481822371483, "num_tokens": 2953599.0, "step": 79 }, { "entropy": 0.6186161413788795, "epoch": 0.6219630709426628, "grad_norm": 0.00901505071669817, "learning_rate": 0.0002, "loss": 0.6190614700317383, "mean_token_accuracy": 0.7501069083809853, "num_tokens": 2990903.0, "step": 80 }, { "entropy": 0.6112105250358582, "epoch": 0.6297376093294461, "grad_norm": 0.011348889209330082, "learning_rate": 0.0002, "loss": 0.6137362718582153, "mean_token_accuracy": 0.7515707835555077, "num_tokens": 3028013.0, "step": 81 }, { "entropy": 0.631052277982235, "epoch": 0.6375121477162293, "grad_norm": 0.012229959480464458, "learning_rate": 0.0002, "loss": 0.6278471946716309, "mean_token_accuracy": 0.7475830912590027, "num_tokens": 3065444.0, "step": 82 }, { "entropy": 0.6256950199604034, "epoch": 0.6452866861030127, "grad_norm": 0.009951086714863777, "learning_rate": 0.0002, "loss": 0.6218305826187134, "mean_token_accuracy": 0.7465297132730484, "num_tokens": 3102683.0, "step": 83 }, { "entropy": 0.6196548789739609, "epoch": 0.6530612244897959, "grad_norm": 0.010236121714115143, "learning_rate": 0.0002, "loss": 0.6180955767631531, "mean_token_accuracy": 0.7518158033490181, "num_tokens": 3140271.0, "step": 84 }, { "entropy": 0.6243495345115662, "epoch": 0.6608357628765792, "grad_norm": 0.011498089879751205, "learning_rate": 0.0002, "loss": 0.6245218515396118, "mean_token_accuracy": 0.7478918880224228, "num_tokens": 3177703.0, "step": 85 }, { "entropy": 0.619852252304554, "epoch": 0.6686103012633625, "grad_norm": 0.009944644756615162, "learning_rate": 0.0002, "loss": 0.6247724294662476, "mean_token_accuracy": 0.7476306930184364, "num_tokens": 3215349.0, "step": 86 }, { "entropy": 0.6298213005065918, "epoch": 0.6763848396501457, "grad_norm": 0.009104517288506031, "learning_rate": 0.0002, "loss": 0.6307124495506287, "mean_token_accuracy": 0.7444773614406586, "num_tokens": 3252965.0, "step": 87 }, { "entropy": 0.617066778242588, "epoch": 0.6841593780369291, "grad_norm": 0.009981841780245304, "learning_rate": 0.0002, "loss": 0.6200389862060547, "mean_token_accuracy": 0.7506762072443962, "num_tokens": 3290319.0, "step": 88 }, { "entropy": 0.6173762008547783, "epoch": 0.6919339164237124, "grad_norm": 0.010542662814259529, "learning_rate": 0.0002, "loss": 0.6204540729522705, "mean_token_accuracy": 0.7490114718675613, "num_tokens": 3328270.0, "step": 89 }, { "entropy": 0.6311885267496109, "epoch": 0.6997084548104956, "grad_norm": 0.009542804211378098, "learning_rate": 0.0002, "loss": 0.630376935005188, "mean_token_accuracy": 0.7458378821611404, "num_tokens": 3365973.0, "step": 90 }, { "entropy": 0.6197073757648468, "epoch": 0.7074829931972789, "grad_norm": 0.009216145612299442, "learning_rate": 0.0002, "loss": 0.6229982376098633, "mean_token_accuracy": 0.7472847774624825, "num_tokens": 3403209.0, "step": 91 }, { "entropy": 0.6161768138408661, "epoch": 0.7152575315840622, "grad_norm": 0.0102296257391572, "learning_rate": 0.0002, "loss": 0.6171408891677856, "mean_token_accuracy": 0.7507107704877853, "num_tokens": 3440047.0, "step": 92 }, { "entropy": 0.6355379894375801, "epoch": 0.7230320699708455, "grad_norm": 0.011433378793299198, "learning_rate": 0.0002, "loss": 0.6368508338928223, "mean_token_accuracy": 0.7425181716680527, "num_tokens": 3477583.0, "step": 93 }, { "entropy": 0.6173990294337273, "epoch": 0.7308066083576288, "grad_norm": 0.009371397085487843, "learning_rate": 0.0002, "loss": 0.6161597371101379, "mean_token_accuracy": 0.752352699637413, "num_tokens": 3515443.0, "step": 94 }, { "entropy": 0.6139659285545349, "epoch": 0.738581146744412, "grad_norm": 0.00992497242987156, "learning_rate": 0.0002, "loss": 0.6122086644172668, "mean_token_accuracy": 0.7519859671592712, "num_tokens": 3552895.0, "step": 95 }, { "entropy": 0.6270382553339005, "epoch": 0.7463556851311953, "grad_norm": 0.009038747288286686, "learning_rate": 0.0002, "loss": 0.6263892650604248, "mean_token_accuracy": 0.7476321458816528, "num_tokens": 3590558.0, "step": 96 }, { "entropy": 0.6252292916178703, "epoch": 0.7541302235179786, "grad_norm": 0.008724549785256386, "learning_rate": 0.0002, "loss": 0.6235740184783936, "mean_token_accuracy": 0.7499061301350594, "num_tokens": 3628009.0, "step": 97 }, { "entropy": 0.6164776980876923, "epoch": 0.7619047619047619, "grad_norm": 0.009640969336032867, "learning_rate": 0.0002, "loss": 0.6190721988677979, "mean_token_accuracy": 0.7499102726578712, "num_tokens": 3665592.0, "step": 98 }, { "entropy": 0.6058400347828865, "epoch": 0.7696793002915452, "grad_norm": 0.010068013332784176, "learning_rate": 0.0002, "loss": 0.6085440516471863, "mean_token_accuracy": 0.7550365477800369, "num_tokens": 3702702.0, "step": 99 }, { "entropy": 0.6062669232487679, "epoch": 0.7774538386783285, "grad_norm": 0.009750640951097012, "learning_rate": 0.0002, "loss": 0.6106675267219543, "mean_token_accuracy": 0.753579393029213, "num_tokens": 3739974.0, "step": 100 }, { "entropy": 0.6228908747434616, "epoch": 0.7852283770651117, "grad_norm": 0.010727898217737675, "learning_rate": 0.0002, "loss": 0.6273207664489746, "mean_token_accuracy": 0.7462224960327148, "num_tokens": 3777563.0, "step": 101 }, { "entropy": 0.623473547399044, "epoch": 0.793002915451895, "grad_norm": 0.00916969496756792, "learning_rate": 0.0002, "loss": 0.6267216205596924, "mean_token_accuracy": 0.7489331811666489, "num_tokens": 3815209.0, "step": 102 }, { "entropy": 0.6183424741029739, "epoch": 0.8007774538386784, "grad_norm": 0.009042995050549507, "learning_rate": 0.0002, "loss": 0.6215161681175232, "mean_token_accuracy": 0.7501572594046593, "num_tokens": 3853109.0, "step": 103 }, { "entropy": 0.6086031794548035, "epoch": 0.8085519922254616, "grad_norm": 0.010368067771196365, "learning_rate": 0.0002, "loss": 0.6092633008956909, "mean_token_accuracy": 0.7548685073852539, "num_tokens": 3890248.0, "step": 104 }, { "entropy": 0.6166428253054619, "epoch": 0.8163265306122449, "grad_norm": 0.009941854514181614, "learning_rate": 0.0002, "loss": 0.6201497316360474, "mean_token_accuracy": 0.746953047811985, "num_tokens": 3927797.0, "step": 105 }, { "entropy": 0.6270147785544395, "epoch": 0.8241010689990281, "grad_norm": 0.0085823442786932, "learning_rate": 0.0002, "loss": 0.6264973878860474, "mean_token_accuracy": 0.746023453772068, "num_tokens": 3965467.0, "step": 106 }, { "entropy": 0.6165590658783913, "epoch": 0.8318756073858115, "grad_norm": 0.009966393932700157, "learning_rate": 0.0002, "loss": 0.6136085987091064, "mean_token_accuracy": 0.7522286921739578, "num_tokens": 4002647.0, "step": 107 }, { "entropy": 0.6224516704678535, "epoch": 0.8396501457725948, "grad_norm": 0.01067335158586502, "learning_rate": 0.0002, "loss": 0.6225627660751343, "mean_token_accuracy": 0.7488038167357445, "num_tokens": 4039990.0, "step": 108 }, { "entropy": 0.6210483014583588, "epoch": 0.847424684159378, "grad_norm": 0.010811593383550644, "learning_rate": 0.0002, "loss": 0.6203762292861938, "mean_token_accuracy": 0.7501420751214027, "num_tokens": 4077461.0, "step": 109 }, { "entropy": 0.6205326095223427, "epoch": 0.8551992225461613, "grad_norm": 0.009125830605626106, "learning_rate": 0.0002, "loss": 0.623924732208252, "mean_token_accuracy": 0.7463032528758049, "num_tokens": 4115100.0, "step": 110 }, { "entropy": 0.6294923424720764, "epoch": 0.8629737609329446, "grad_norm": 0.008677372708916664, "learning_rate": 0.0002, "loss": 0.6358845233917236, "mean_token_accuracy": 0.7433422952890396, "num_tokens": 4152751.0, "step": 111 }, { "entropy": 0.615186795592308, "epoch": 0.8707482993197279, "grad_norm": 0.012182718142867088, "learning_rate": 0.0002, "loss": 0.6257232427597046, "mean_token_accuracy": 0.7469102591276169, "num_tokens": 4189807.0, "step": 112 }, { "entropy": 0.6161832436919212, "epoch": 0.8785228377065112, "grad_norm": 0.009921083226799965, "learning_rate": 0.0002, "loss": 0.6149104237556458, "mean_token_accuracy": 0.7501650750637054, "num_tokens": 4227148.0, "step": 113 }, { "entropy": 0.6069425120949745, "epoch": 0.8862973760932945, "grad_norm": 0.010401617735624313, "learning_rate": 0.0002, "loss": 0.6072876453399658, "mean_token_accuracy": 0.7546068653464317, "num_tokens": 4264665.0, "step": 114 }, { "entropy": 0.6115981489419937, "epoch": 0.8940719144800777, "grad_norm": 0.009178240783512592, "learning_rate": 0.0002, "loss": 0.6142789125442505, "mean_token_accuracy": 0.7516015693545341, "num_tokens": 4301705.0, "step": 115 }, { "entropy": 0.6232319623231888, "epoch": 0.901846452866861, "grad_norm": 0.011550409719347954, "learning_rate": 0.0002, "loss": 0.6232004165649414, "mean_token_accuracy": 0.7479738518595695, "num_tokens": 4339005.0, "step": 116 }, { "entropy": 0.6050816774368286, "epoch": 0.9096209912536443, "grad_norm": 0.009149852208793163, "learning_rate": 0.0002, "loss": 0.6073260307312012, "mean_token_accuracy": 0.7553000226616859, "num_tokens": 4376492.0, "step": 117 }, { "entropy": 0.6323671862483025, "epoch": 0.9173955296404276, "grad_norm": 0.01042769942432642, "learning_rate": 0.0002, "loss": 0.6354271769523621, "mean_token_accuracy": 0.742473192512989, "num_tokens": 4414516.0, "step": 118 }, { "entropy": 0.6279568076133728, "epoch": 0.9251700680272109, "grad_norm": 0.009754139930009842, "learning_rate": 0.0002, "loss": 0.6289409399032593, "mean_token_accuracy": 0.7444217056035995, "num_tokens": 4452210.0, "step": 119 }, { "entropy": 0.6090738251805305, "epoch": 0.9329446064139941, "grad_norm": 0.011155272834002972, "learning_rate": 0.0002, "loss": 0.61219322681427, "mean_token_accuracy": 0.7522945404052734, "num_tokens": 4489567.0, "step": 120 }, { "entropy": 0.6002820879220963, "epoch": 0.9407191448007775, "grad_norm": 0.009737227112054825, "learning_rate": 0.0002, "loss": 0.6018539071083069, "mean_token_accuracy": 0.757467195391655, "num_tokens": 4527111.0, "step": 121 }, { "entropy": 0.6134138256311417, "epoch": 0.9484936831875608, "grad_norm": 0.010466666892170906, "learning_rate": 0.0002, "loss": 0.6216229200363159, "mean_token_accuracy": 0.7486356720328331, "num_tokens": 4564450.0, "step": 122 }, { "entropy": 0.6079460605978966, "epoch": 0.956268221574344, "grad_norm": 0.008756682276725769, "learning_rate": 0.0002, "loss": 0.6086549758911133, "mean_token_accuracy": 0.7539011463522911, "num_tokens": 4601781.0, "step": 123 }, { "entropy": 0.612805612385273, "epoch": 0.9640427599611273, "grad_norm": 0.009290359914302826, "learning_rate": 0.0002, "loss": 0.6137915849685669, "mean_token_accuracy": 0.752314880490303, "num_tokens": 4639256.0, "step": 124 }, { "entropy": 0.6211065128445625, "epoch": 0.9718172983479106, "grad_norm": 0.010166316293179989, "learning_rate": 0.0002, "loss": 0.6211485266685486, "mean_token_accuracy": 0.7476831749081612, "num_tokens": 4676689.0, "step": 125 }, { "entropy": 0.6219009906053543, "epoch": 0.9795918367346939, "grad_norm": 0.009910349734127522, "learning_rate": 0.0002, "loss": 0.6177939176559448, "mean_token_accuracy": 0.7506504207849503, "num_tokens": 4714123.0, "step": 126 }, { "entropy": 0.6336647123098373, "epoch": 0.9873663751214772, "grad_norm": 0.00899409968405962, "learning_rate": 0.0002, "loss": 0.6283681392669678, "mean_token_accuracy": 0.7467537075281143, "num_tokens": 4751822.0, "step": 127 }, { "entropy": 0.6106422170996666, "epoch": 0.9951409135082604, "grad_norm": 0.009350291453301907, "learning_rate": 0.0002, "loss": 0.6105437278747559, "mean_token_accuracy": 0.7529440075159073, "num_tokens": 4789003.0, "step": 128 }, { "entropy": 0.6007849931716919, "epoch": 1.0, "grad_norm": 0.011687238700687885, "learning_rate": 0.0002, "loss": 0.6050734519958496, "mean_token_accuracy": 0.7555755734443664, "num_tokens": 4812561.0, "step": 129 }, { "entropy": 0.6145111918449402, "epoch": 1.0077745383867833, "grad_norm": 0.00996165256947279, "learning_rate": 0.0002, "loss": 0.6200628280639648, "mean_token_accuracy": 0.7501887455582619, "num_tokens": 4849863.0, "step": 130 }, { "entropy": 0.6117109283804893, "epoch": 1.0155490767735667, "grad_norm": 0.009831785224378109, "learning_rate": 0.0002, "loss": 0.6182730793952942, "mean_token_accuracy": 0.7466977462172508, "num_tokens": 4887693.0, "step": 131 }, { "entropy": 0.6117515116930008, "epoch": 1.0233236151603498, "grad_norm": 0.007678937632590532, "learning_rate": 0.0002, "loss": 0.6126781105995178, "mean_token_accuracy": 0.7521011829376221, "num_tokens": 4925266.0, "step": 132 }, { "entropy": 0.6145991012454033, "epoch": 1.031098153547133, "grad_norm": 0.00878220982849598, "learning_rate": 0.0002, "loss": 0.6143695116043091, "mean_token_accuracy": 0.7531941831111908, "num_tokens": 4962307.0, "step": 133 }, { "entropy": 0.6105677559971809, "epoch": 1.0388726919339164, "grad_norm": 0.009893382899463177, "learning_rate": 0.0002, "loss": 0.6073343753814697, "mean_token_accuracy": 0.7548379600048065, "num_tokens": 4999709.0, "step": 134 }, { "entropy": 0.6226058155298233, "epoch": 1.0466472303206997, "grad_norm": 0.01014266349375248, "learning_rate": 0.0002, "loss": 0.6212986707687378, "mean_token_accuracy": 0.7492796331644058, "num_tokens": 5036991.0, "step": 135 }, { "entropy": 0.6036651879549026, "epoch": 1.054421768707483, "grad_norm": 0.008363187313079834, "learning_rate": 0.0002, "loss": 0.6068825721740723, "mean_token_accuracy": 0.753925733268261, "num_tokens": 5074058.0, "step": 136 }, { "entropy": 0.6133922636508942, "epoch": 1.0621963070942664, "grad_norm": 0.00871324259787798, "learning_rate": 0.0002, "loss": 0.6173220276832581, "mean_token_accuracy": 0.7509826496243477, "num_tokens": 5111393.0, "step": 137 }, { "entropy": 0.622228629887104, "epoch": 1.0699708454810495, "grad_norm": 0.010760784149169922, "learning_rate": 0.0002, "loss": 0.629308819770813, "mean_token_accuracy": 0.7456969246268272, "num_tokens": 5148886.0, "step": 138 }, { "entropy": 0.6098063141107559, "epoch": 1.0777453838678328, "grad_norm": 0.010240385308861732, "learning_rate": 0.0002, "loss": 0.6158695220947266, "mean_token_accuracy": 0.7498040646314621, "num_tokens": 5186054.0, "step": 139 }, { "entropy": 0.6184578239917755, "epoch": 1.0855199222546161, "grad_norm": 0.010335118509829044, "learning_rate": 0.0002, "loss": 0.6153397560119629, "mean_token_accuracy": 0.7500413805246353, "num_tokens": 5223497.0, "step": 140 }, { "entropy": 0.626154899597168, "epoch": 1.0932944606413995, "grad_norm": 0.009573339484632015, "learning_rate": 0.0002, "loss": 0.6198714971542358, "mean_token_accuracy": 0.7480529472231865, "num_tokens": 5261284.0, "step": 141 }, { "entropy": 0.6239576488733292, "epoch": 1.1010689990281828, "grad_norm": 0.01078983023762703, "learning_rate": 0.0002, "loss": 0.6222984790802002, "mean_token_accuracy": 0.7482637241482735, "num_tokens": 5298391.0, "step": 142 }, { "entropy": 0.6052972301840782, "epoch": 1.1088435374149659, "grad_norm": 0.009443830698728561, "learning_rate": 0.0002, "loss": 0.6056097745895386, "mean_token_accuracy": 0.755977600812912, "num_tokens": 5335665.0, "step": 143 }, { "entropy": 0.6082469522953033, "epoch": 1.1166180758017492, "grad_norm": 0.008718990720808506, "learning_rate": 0.0002, "loss": 0.6119707822799683, "mean_token_accuracy": 0.7540762051939964, "num_tokens": 5373467.0, "step": 144 }, { "entropy": 0.6099165305495262, "epoch": 1.1243926141885325, "grad_norm": 0.00886059831827879, "learning_rate": 0.0002, "loss": 0.6144919395446777, "mean_token_accuracy": 0.7509082928299904, "num_tokens": 5410699.0, "step": 145 }, { "entropy": 0.606502428650856, "epoch": 1.1321671525753159, "grad_norm": 0.009656739421188831, "learning_rate": 0.0002, "loss": 0.6092766523361206, "mean_token_accuracy": 0.7524644657969475, "num_tokens": 5448145.0, "step": 146 }, { "entropy": 0.6240331009030342, "epoch": 1.1399416909620992, "grad_norm": 0.009215152822434902, "learning_rate": 0.0002, "loss": 0.6283767819404602, "mean_token_accuracy": 0.7434803545475006, "num_tokens": 5485424.0, "step": 147 }, { "entropy": 0.6154414415359497, "epoch": 1.1477162293488825, "grad_norm": 0.009418639354407787, "learning_rate": 0.0002, "loss": 0.6141241192817688, "mean_token_accuracy": 0.752318486571312, "num_tokens": 5522963.0, "step": 148 }, { "entropy": 0.6115295439958572, "epoch": 1.1554907677356656, "grad_norm": 0.008995896205306053, "learning_rate": 0.0002, "loss": 0.6093723773956299, "mean_token_accuracy": 0.7540601193904877, "num_tokens": 5560173.0, "step": 149 }, { "entropy": 0.6168172955513, "epoch": 1.163265306122449, "grad_norm": 0.007887676358222961, "learning_rate": 0.0002, "loss": 0.6149598360061646, "mean_token_accuracy": 0.7500165104866028, "num_tokens": 5597781.0, "step": 150 }, { "entropy": 0.6069798469543457, "epoch": 1.1710398445092323, "grad_norm": 0.008911027573049068, "learning_rate": 0.0002, "loss": 0.6064385771751404, "mean_token_accuracy": 0.7551223114132881, "num_tokens": 5635360.0, "step": 151 }, { "entropy": 0.6170337721705437, "epoch": 1.1788143828960156, "grad_norm": 0.008784991689026356, "learning_rate": 0.0002, "loss": 0.6199371814727783, "mean_token_accuracy": 0.7501093670725822, "num_tokens": 5673236.0, "step": 152 }, { "entropy": 0.6042322665452957, "epoch": 1.186588921282799, "grad_norm": 0.008859240449965, "learning_rate": 0.0002, "loss": 0.6099147200584412, "mean_token_accuracy": 0.7529143393039703, "num_tokens": 5710364.0, "step": 153 }, { "entropy": 0.6032149121165276, "epoch": 1.194363459669582, "grad_norm": 0.008698609657585621, "learning_rate": 0.0002, "loss": 0.6091040372848511, "mean_token_accuracy": 0.7545271888375282, "num_tokens": 5747783.0, "step": 154 }, { "entropy": 0.5934446603059769, "epoch": 1.2021379980563653, "grad_norm": 0.009365703910589218, "learning_rate": 0.0002, "loss": 0.6000581979751587, "mean_token_accuracy": 0.7570822536945343, "num_tokens": 5784550.0, "step": 155 }, { "entropy": 0.6240461468696594, "epoch": 1.2099125364431487, "grad_norm": 0.00959563348442316, "learning_rate": 0.0002, "loss": 0.6229224801063538, "mean_token_accuracy": 0.7504049837589264, "num_tokens": 5822051.0, "step": 156 }, { "entropy": 0.6372882649302483, "epoch": 1.217687074829932, "grad_norm": 0.008253706619143486, "learning_rate": 0.0002, "loss": 0.6363227367401123, "mean_token_accuracy": 0.7415706738829613, "num_tokens": 5859606.0, "step": 157 }, { "entropy": 0.6115364283323288, "epoch": 1.2254616132167153, "grad_norm": 0.009423714131116867, "learning_rate": 0.0002, "loss": 0.6082147359848022, "mean_token_accuracy": 0.7525753974914551, "num_tokens": 5897144.0, "step": 158 }, { "entropy": 0.6259980425238609, "epoch": 1.2332361516034984, "grad_norm": 0.008684671483933926, "learning_rate": 0.0002, "loss": 0.6272211074829102, "mean_token_accuracy": 0.7443205043673515, "num_tokens": 5934271.0, "step": 159 }, { "entropy": 0.6230324283242226, "epoch": 1.2410106899902817, "grad_norm": 0.008543766103684902, "learning_rate": 0.0002, "loss": 0.6271595358848572, "mean_token_accuracy": 0.7448511347174644, "num_tokens": 5971696.0, "step": 160 }, { "entropy": 0.6094089895486832, "epoch": 1.248785228377065, "grad_norm": 0.008484925143420696, "learning_rate": 0.0002, "loss": 0.611902117729187, "mean_token_accuracy": 0.751502238214016, "num_tokens": 6009264.0, "step": 161 }, { "entropy": 0.6298199594020844, "epoch": 1.2565597667638484, "grad_norm": 0.009336225688457489, "learning_rate": 0.0002, "loss": 0.6334519386291504, "mean_token_accuracy": 0.7432255297899246, "num_tokens": 6046764.0, "step": 162 }, { "entropy": 0.6082314997911453, "epoch": 1.2643343051506317, "grad_norm": 0.008643310517072678, "learning_rate": 0.0002, "loss": 0.6062188148498535, "mean_token_accuracy": 0.7549923211336136, "num_tokens": 6084129.0, "step": 163 }, { "entropy": 0.6305336207151413, "epoch": 1.272108843537415, "grad_norm": 0.009341283701360226, "learning_rate": 0.0002, "loss": 0.6319139003753662, "mean_token_accuracy": 0.7440996170043945, "num_tokens": 6121588.0, "step": 164 }, { "entropy": 0.6267635151743889, "epoch": 1.2798833819241984, "grad_norm": 0.00801732949912548, "learning_rate": 0.0002, "loss": 0.6295123100280762, "mean_token_accuracy": 0.7461825907230377, "num_tokens": 6158885.0, "step": 165 }, { "entropy": 0.6146969944238663, "epoch": 1.2876579203109815, "grad_norm": 0.009981551207602024, "learning_rate": 0.0002, "loss": 0.611693263053894, "mean_token_accuracy": 0.7518708109855652, "num_tokens": 6196224.0, "step": 166 }, { "entropy": 0.61357232183218, "epoch": 1.2954324586977648, "grad_norm": 0.009115675464272499, "learning_rate": 0.0002, "loss": 0.6161482930183411, "mean_token_accuracy": 0.7504228800535202, "num_tokens": 6233989.0, "step": 167 }, { "entropy": 0.6055504828691483, "epoch": 1.3032069970845481, "grad_norm": 0.009081711992621422, "learning_rate": 0.0002, "loss": 0.6060025691986084, "mean_token_accuracy": 0.7522977739572525, "num_tokens": 6271394.0, "step": 168 }, { "entropy": 0.6105418056249619, "epoch": 1.3109815354713314, "grad_norm": 0.009730422869324684, "learning_rate": 0.0002, "loss": 0.6106258630752563, "mean_token_accuracy": 0.753718800842762, "num_tokens": 6308814.0, "step": 169 }, { "entropy": 0.6137099266052246, "epoch": 1.3187560738581148, "grad_norm": 0.009750008583068848, "learning_rate": 0.0002, "loss": 0.6176519393920898, "mean_token_accuracy": 0.7496867552399635, "num_tokens": 6346282.0, "step": 170 }, { "entropy": 0.6076096817851067, "epoch": 1.3265306122448979, "grad_norm": 0.00966191291809082, "learning_rate": 0.0002, "loss": 0.6177955865859985, "mean_token_accuracy": 0.7480223625898361, "num_tokens": 6383602.0, "step": 171 }, { "entropy": 0.6195629611611366, "epoch": 1.3343051506316812, "grad_norm": 0.008418413810431957, "learning_rate": 0.0002, "loss": 0.6202820539474487, "mean_token_accuracy": 0.7488253712654114, "num_tokens": 6421035.0, "step": 172 }, { "entropy": 0.6313579976558685, "epoch": 1.3420796890184645, "grad_norm": 0.009207581169903278, "learning_rate": 0.0002, "loss": 0.6277562379837036, "mean_token_accuracy": 0.7459008172154427, "num_tokens": 6458322.0, "step": 173 }, { "entropy": 0.6184266805648804, "epoch": 1.3498542274052479, "grad_norm": 0.009536071680486202, "learning_rate": 0.0002, "loss": 0.6161496639251709, "mean_token_accuracy": 0.7486988604068756, "num_tokens": 6495621.0, "step": 174 }, { "entropy": 0.6189115419983864, "epoch": 1.3576287657920312, "grad_norm": 0.0097253592684865, "learning_rate": 0.0002, "loss": 0.6185729503631592, "mean_token_accuracy": 0.7469287514686584, "num_tokens": 6532892.0, "step": 175 }, { "entropy": 0.6204129755496979, "epoch": 1.3654033041788143, "grad_norm": 0.008999030105769634, "learning_rate": 0.0002, "loss": 0.6241609454154968, "mean_token_accuracy": 0.7467619553208351, "num_tokens": 6570420.0, "step": 176 }, { "entropy": 0.6034655645489693, "epoch": 1.3731778425655976, "grad_norm": 0.009542280808091164, "learning_rate": 0.0002, "loss": 0.6092945337295532, "mean_token_accuracy": 0.7532089725136757, "num_tokens": 6607782.0, "step": 177 }, { "entropy": 0.5901695042848587, "epoch": 1.380952380952381, "grad_norm": 0.009766815230250359, "learning_rate": 0.0002, "loss": 0.5972245335578918, "mean_token_accuracy": 0.7562905699014664, "num_tokens": 6644876.0, "step": 178 }, { "entropy": 0.6139540746808052, "epoch": 1.3887269193391643, "grad_norm": 0.00885457918047905, "learning_rate": 0.0002, "loss": 0.6145105361938477, "mean_token_accuracy": 0.7494652420282364, "num_tokens": 6682153.0, "step": 179 }, { "entropy": 0.6128789633512497, "epoch": 1.3965014577259476, "grad_norm": 0.008380657061934471, "learning_rate": 0.0002, "loss": 0.6103215217590332, "mean_token_accuracy": 0.7528893128037453, "num_tokens": 6719589.0, "step": 180 }, { "entropy": 0.6158252954483032, "epoch": 1.4042759961127307, "grad_norm": 0.008612860925495625, "learning_rate": 0.0002, "loss": 0.6157952547073364, "mean_token_accuracy": 0.7490102499723434, "num_tokens": 6757256.0, "step": 181 }, { "entropy": 0.6120009869337082, "epoch": 1.412050534499514, "grad_norm": 0.008242498151957989, "learning_rate": 0.0002, "loss": 0.610822319984436, "mean_token_accuracy": 0.7527074217796326, "num_tokens": 6794427.0, "step": 182 }, { "entropy": 0.607716366648674, "epoch": 1.4198250728862973, "grad_norm": 0.00903896614909172, "learning_rate": 0.0002, "loss": 0.6105165481567383, "mean_token_accuracy": 0.7544176280498505, "num_tokens": 6831592.0, "step": 183 }, { "entropy": 0.6083493009209633, "epoch": 1.4275996112730807, "grad_norm": 0.007915884256362915, "learning_rate": 0.0002, "loss": 0.611156165599823, "mean_token_accuracy": 0.7522151321172714, "num_tokens": 6869182.0, "step": 184 }, { "entropy": 0.6225397288799286, "epoch": 1.435374149659864, "grad_norm": 0.009225807152688503, "learning_rate": 0.0002, "loss": 0.6281070709228516, "mean_token_accuracy": 0.7460536956787109, "num_tokens": 6906740.0, "step": 185 }, { "entropy": 0.6144149005413055, "epoch": 1.4431486880466473, "grad_norm": 0.010468881577253342, "learning_rate": 0.0002, "loss": 0.6134935617446899, "mean_token_accuracy": 0.7510944902896881, "num_tokens": 6944215.0, "step": 186 }, { "entropy": 0.6219450011849403, "epoch": 1.4509232264334306, "grad_norm": 0.008004755713045597, "learning_rate": 0.0002, "loss": 0.6226309537887573, "mean_token_accuracy": 0.7474055960774422, "num_tokens": 6981266.0, "step": 187 }, { "entropy": 0.6094852611422539, "epoch": 1.4586977648202137, "grad_norm": 0.00825564842671156, "learning_rate": 0.0002, "loss": 0.6140962839126587, "mean_token_accuracy": 0.7508443966507912, "num_tokens": 7018562.0, "step": 188 }, { "entropy": 0.6202999800443649, "epoch": 1.466472303206997, "grad_norm": 0.00858406163752079, "learning_rate": 0.0002, "loss": 0.6255123615264893, "mean_token_accuracy": 0.744349479675293, "num_tokens": 7055995.0, "step": 189 }, { "entropy": 0.620690606534481, "epoch": 1.4742468415937804, "grad_norm": 0.008920849300920963, "learning_rate": 0.0002, "loss": 0.6179178357124329, "mean_token_accuracy": 0.7499353438615799, "num_tokens": 7093265.0, "step": 190 }, { "entropy": 0.6239896044135094, "epoch": 1.4820213799805637, "grad_norm": 0.00956004112958908, "learning_rate": 0.0002, "loss": 0.6228440999984741, "mean_token_accuracy": 0.7463066428899765, "num_tokens": 7130758.0, "step": 191 }, { "entropy": 0.6123484745621681, "epoch": 1.489795918367347, "grad_norm": 0.009270581416785717, "learning_rate": 0.0002, "loss": 0.6113156080245972, "mean_token_accuracy": 0.752521239221096, "num_tokens": 7168712.0, "step": 192 }, { "entropy": 0.616000160574913, "epoch": 1.4975704567541301, "grad_norm": 0.010770791210234165, "learning_rate": 0.0002, "loss": 0.6215670108795166, "mean_token_accuracy": 0.7469163537025452, "num_tokens": 7205815.0, "step": 193 }, { "entropy": 0.6254132762551308, "epoch": 1.5053449951409135, "grad_norm": 0.008934563025832176, "learning_rate": 0.0002, "loss": 0.627918541431427, "mean_token_accuracy": 0.7457368895411491, "num_tokens": 7243319.0, "step": 194 }, { "entropy": 0.6185151413083076, "epoch": 1.5131195335276968, "grad_norm": 0.008593689650297165, "learning_rate": 0.0002, "loss": 0.6180027723312378, "mean_token_accuracy": 0.7505958154797554, "num_tokens": 7280988.0, "step": 195 }, { "entropy": 0.6063526794314384, "epoch": 1.5208940719144801, "grad_norm": 0.01172675471752882, "learning_rate": 0.0002, "loss": 0.6113625764846802, "mean_token_accuracy": 0.7508470490574837, "num_tokens": 7318322.0, "step": 196 }, { "entropy": 0.6110472977161407, "epoch": 1.5286686103012634, "grad_norm": 0.009914939291775227, "learning_rate": 0.0002, "loss": 0.6066443920135498, "mean_token_accuracy": 0.7531256228685379, "num_tokens": 7355926.0, "step": 197 }, { "entropy": 0.6154029294848442, "epoch": 1.5364431486880465, "grad_norm": 0.008429116569459438, "learning_rate": 0.0002, "loss": 0.6149218678474426, "mean_token_accuracy": 0.7508518844842911, "num_tokens": 7393433.0, "step": 198 }, { "entropy": 0.622289851307869, "epoch": 1.54421768707483, "grad_norm": 0.06439514458179474, "learning_rate": 0.0002, "loss": 0.631239116191864, "mean_token_accuracy": 0.7464239746332169, "num_tokens": 7431062.0, "step": 199 }, { "entropy": 0.619748018682003, "epoch": 1.5519922254616132, "grad_norm": 0.014919525012373924, "learning_rate": 0.0002, "loss": 0.6189074516296387, "mean_token_accuracy": 0.7492179349064827, "num_tokens": 7468637.0, "step": 200 }, { "entropy": 0.6060447245836258, "epoch": 1.5597667638483965, "grad_norm": 0.019268253818154335, "learning_rate": 0.0002, "loss": 0.6034001708030701, "mean_token_accuracy": 0.7538621947169304, "num_tokens": 7506043.0, "step": 201 }, { "entropy": 0.6062331944704056, "epoch": 1.5675413022351798, "grad_norm": 0.013310298323631287, "learning_rate": 0.0002, "loss": 0.6041976809501648, "mean_token_accuracy": 0.7555137276649475, "num_tokens": 7543352.0, "step": 202 }, { "entropy": 0.6137887313961983, "epoch": 1.575315840621963, "grad_norm": 0.010207262821495533, "learning_rate": 0.0002, "loss": 0.6102935671806335, "mean_token_accuracy": 0.7525052726268768, "num_tokens": 7580867.0, "step": 203 }, { "entropy": 0.6222132593393326, "epoch": 1.5830903790087465, "grad_norm": 0.013623848557472229, "learning_rate": 0.0002, "loss": 0.6228193044662476, "mean_token_accuracy": 0.7474973797798157, "num_tokens": 7618160.0, "step": 204 }, { "entropy": 0.6147656589746475, "epoch": 1.5908649173955296, "grad_norm": 0.011189316399395466, "learning_rate": 0.0002, "loss": 0.6171211004257202, "mean_token_accuracy": 0.750194676220417, "num_tokens": 7655454.0, "step": 205 }, { "entropy": 0.6172639206051826, "epoch": 1.598639455782313, "grad_norm": 0.010384263470768929, "learning_rate": 0.0002, "loss": 0.6146183013916016, "mean_token_accuracy": 0.7520541921257973, "num_tokens": 7693399.0, "step": 206 }, { "entropy": 0.6170154958963394, "epoch": 1.6064139941690962, "grad_norm": 0.01584717258810997, "learning_rate": 0.0002, "loss": 0.6188840866088867, "mean_token_accuracy": 0.7489955052733421, "num_tokens": 7730827.0, "step": 207 }, { "entropy": 0.6163731887936592, "epoch": 1.6141885325558794, "grad_norm": 0.018742689862847328, "learning_rate": 0.0002, "loss": 0.6233645677566528, "mean_token_accuracy": 0.7474886327981949, "num_tokens": 7768375.0, "step": 208 }, { "entropy": 0.6161412820219994, "epoch": 1.621963070942663, "grad_norm": 0.00972844660282135, "learning_rate": 0.0002, "loss": 0.622969388961792, "mean_token_accuracy": 0.747713029384613, "num_tokens": 7806087.0, "step": 209 }, { "entropy": 0.6096204742789268, "epoch": 1.629737609329446, "grad_norm": 0.008969136513769627, "learning_rate": 0.0002, "loss": 0.6155728697776794, "mean_token_accuracy": 0.7519758120179176, "num_tokens": 7843539.0, "step": 210 }, { "entropy": 0.6264154762029648, "epoch": 1.6375121477162293, "grad_norm": 0.009598297998309135, "learning_rate": 0.0002, "loss": 0.6284589767456055, "mean_token_accuracy": 0.7461679801344872, "num_tokens": 7881097.0, "step": 211 }, { "entropy": 0.6087732166051865, "epoch": 1.6452866861030127, "grad_norm": 0.012110014446079731, "learning_rate": 0.0002, "loss": 0.6086750626564026, "mean_token_accuracy": 0.7552923634648323, "num_tokens": 7918507.0, "step": 212 }, { "entropy": 0.6052073761820793, "epoch": 1.6530612244897958, "grad_norm": 0.009252856485545635, "learning_rate": 0.0002, "loss": 0.6080942153930664, "mean_token_accuracy": 0.7508447393774986, "num_tokens": 7955564.0, "step": 213 }, { "entropy": 0.6120294705033302, "epoch": 1.6608357628765793, "grad_norm": 0.00877399556338787, "learning_rate": 0.0002, "loss": 0.614532470703125, "mean_token_accuracy": 0.7511213645339012, "num_tokens": 7992945.0, "step": 214 }, { "entropy": 0.6241516917943954, "epoch": 1.6686103012633624, "grad_norm": 0.01109123881906271, "learning_rate": 0.0002, "loss": 0.626361608505249, "mean_token_accuracy": 0.7474541217088699, "num_tokens": 8030734.0, "step": 215 }, { "entropy": 0.6194194927811623, "epoch": 1.6763848396501457, "grad_norm": 0.009091328829526901, "learning_rate": 0.0002, "loss": 0.6160167455673218, "mean_token_accuracy": 0.7495900243520737, "num_tokens": 8067927.0, "step": 216 }, { "entropy": 0.6229095980525017, "epoch": 1.684159378036929, "grad_norm": 0.01083504967391491, "learning_rate": 0.0002, "loss": 0.6173299551010132, "mean_token_accuracy": 0.7501125037670135, "num_tokens": 8105627.0, "step": 217 }, { "entropy": 0.6194786503911018, "epoch": 1.6919339164237124, "grad_norm": 0.008784794248640537, "learning_rate": 0.0002, "loss": 0.6191180944442749, "mean_token_accuracy": 0.748157188296318, "num_tokens": 8143034.0, "step": 218 }, { "entropy": 0.6127319037914276, "epoch": 1.6997084548104957, "grad_norm": 0.008322956040501595, "learning_rate": 0.0002, "loss": 0.6156037449836731, "mean_token_accuracy": 0.7487869411706924, "num_tokens": 8180596.0, "step": 219 }, { "entropy": 0.6223913356661797, "epoch": 1.7074829931972788, "grad_norm": 0.008480758406221867, "learning_rate": 0.0002, "loss": 0.6275689601898193, "mean_token_accuracy": 0.7448212057352066, "num_tokens": 8218297.0, "step": 220 }, { "entropy": 0.6217603012919426, "epoch": 1.7152575315840624, "grad_norm": 0.008550974540412426, "learning_rate": 0.0002, "loss": 0.6251344680786133, "mean_token_accuracy": 0.74727413803339, "num_tokens": 8255632.0, "step": 221 }, { "entropy": 0.6164599433541298, "epoch": 1.7230320699708455, "grad_norm": 0.008577285334467888, "learning_rate": 0.0002, "loss": 0.6166675090789795, "mean_token_accuracy": 0.7512230649590492, "num_tokens": 8292769.0, "step": 222 }, { "entropy": 0.619569830596447, "epoch": 1.7308066083576288, "grad_norm": 0.008122924715280533, "learning_rate": 0.0002, "loss": 0.6211944818496704, "mean_token_accuracy": 0.7477053627371788, "num_tokens": 8330358.0, "step": 223 }, { "entropy": 0.6090706288814545, "epoch": 1.738581146744412, "grad_norm": 0.008728940039873123, "learning_rate": 0.0002, "loss": 0.6092976927757263, "mean_token_accuracy": 0.7530095875263214, "num_tokens": 8367398.0, "step": 224 }, { "entropy": 0.617340199649334, "epoch": 1.7463556851311952, "grad_norm": 0.007776155136525631, "learning_rate": 0.0002, "loss": 0.6156238913536072, "mean_token_accuracy": 0.7495973780751228, "num_tokens": 8404907.0, "step": 225 }, { "entropy": 0.6192676723003387, "epoch": 1.7541302235179788, "grad_norm": 0.008142861537635326, "learning_rate": 0.0002, "loss": 0.6212935447692871, "mean_token_accuracy": 0.7502573132514954, "num_tokens": 8442551.0, "step": 226 }, { "entropy": 0.6181206256151199, "epoch": 1.7619047619047619, "grad_norm": 0.009585011750459671, "learning_rate": 0.0002, "loss": 0.625989556312561, "mean_token_accuracy": 0.7449588850140572, "num_tokens": 8480048.0, "step": 227 }, { "entropy": 0.6096160188317299, "epoch": 1.7696793002915452, "grad_norm": 0.008407268673181534, "learning_rate": 0.0002, "loss": 0.6082819700241089, "mean_token_accuracy": 0.7547600343823433, "num_tokens": 8517427.0, "step": 228 }, { "entropy": 0.6192163527011871, "epoch": 1.7774538386783285, "grad_norm": 0.007702583912760019, "learning_rate": 0.0002, "loss": 0.6174746751785278, "mean_token_accuracy": 0.7493149042129517, "num_tokens": 8554570.0, "step": 229 }, { "entropy": 0.6089940667152405, "epoch": 1.7852283770651116, "grad_norm": 0.007490647025406361, "learning_rate": 0.0002, "loss": 0.6111437082290649, "mean_token_accuracy": 0.7528351470828056, "num_tokens": 8591761.0, "step": 230 }, { "entropy": 0.6070573329925537, "epoch": 1.7930029154518952, "grad_norm": 0.008878695778548717, "learning_rate": 0.0002, "loss": 0.6092367172241211, "mean_token_accuracy": 0.7542654424905777, "num_tokens": 8628522.0, "step": 231 }, { "entropy": 0.617328479886055, "epoch": 1.8007774538386783, "grad_norm": 0.008331574499607086, "learning_rate": 0.0002, "loss": 0.6187005043029785, "mean_token_accuracy": 0.7479601725935936, "num_tokens": 8666140.0, "step": 232 }, { "entropy": 0.6115391552448273, "epoch": 1.8085519922254616, "grad_norm": 0.0087031414732337, "learning_rate": 0.0002, "loss": 0.6169438362121582, "mean_token_accuracy": 0.7492516785860062, "num_tokens": 8703399.0, "step": 233 }, { "entropy": 0.6166737154126167, "epoch": 1.816326530612245, "grad_norm": 0.008778571151196957, "learning_rate": 0.0002, "loss": 0.6192659139633179, "mean_token_accuracy": 0.7489692941308022, "num_tokens": 8741141.0, "step": 234 }, { "entropy": 0.6278815269470215, "epoch": 1.824101068999028, "grad_norm": 0.008317695930600166, "learning_rate": 0.0002, "loss": 0.6227933168411255, "mean_token_accuracy": 0.7477347627282143, "num_tokens": 8778706.0, "step": 235 }, { "entropy": 0.612150214612484, "epoch": 1.8318756073858116, "grad_norm": 0.008878265507519245, "learning_rate": 0.0002, "loss": 0.6094038486480713, "mean_token_accuracy": 0.7539248242974281, "num_tokens": 8815790.0, "step": 236 }, { "entropy": 0.637272298336029, "epoch": 1.8396501457725947, "grad_norm": 0.007240319158881903, "learning_rate": 0.0002, "loss": 0.6381018757820129, "mean_token_accuracy": 0.7397879138588905, "num_tokens": 8853228.0, "step": 237 }, { "entropy": 0.6079713776707649, "epoch": 1.847424684159378, "grad_norm": 0.008403577841818333, "learning_rate": 0.0002, "loss": 0.6132397651672363, "mean_token_accuracy": 0.750219389796257, "num_tokens": 8890524.0, "step": 238 }, { "entropy": 0.6004362255334854, "epoch": 1.8551992225461613, "grad_norm": 0.008654654026031494, "learning_rate": 0.0002, "loss": 0.6059733629226685, "mean_token_accuracy": 0.7544897198677063, "num_tokens": 8927518.0, "step": 239 }, { "entropy": 0.6205713227391243, "epoch": 1.8629737609329446, "grad_norm": 0.008852572180330753, "learning_rate": 0.0002, "loss": 0.6241973638534546, "mean_token_accuracy": 0.7456497400999069, "num_tokens": 8964770.0, "step": 240 }, { "entropy": 0.6309987902641296, "epoch": 1.870748299319728, "grad_norm": 0.00919515173882246, "learning_rate": 0.0002, "loss": 0.6267882585525513, "mean_token_accuracy": 0.7451199591159821, "num_tokens": 9002039.0, "step": 241 }, { "entropy": 0.6201007068157196, "epoch": 1.878522837706511, "grad_norm": 0.008951977826654911, "learning_rate": 0.0002, "loss": 0.6155404448509216, "mean_token_accuracy": 0.7500432655215263, "num_tokens": 9040052.0, "step": 242 }, { "entropy": 0.6137275472283363, "epoch": 1.8862973760932946, "grad_norm": 0.008249848149716854, "learning_rate": 0.0002, "loss": 0.6162374019622803, "mean_token_accuracy": 0.7486926540732384, "num_tokens": 9077331.0, "step": 243 }, { "entropy": 0.6179945692420006, "epoch": 1.8940719144800777, "grad_norm": 0.008306370116770267, "learning_rate": 0.0002, "loss": 0.6247057914733887, "mean_token_accuracy": 0.7457103058695793, "num_tokens": 9114582.0, "step": 244 }, { "entropy": 0.6145003139972687, "epoch": 1.901846452866861, "grad_norm": 0.009250648319721222, "learning_rate": 0.0002, "loss": 0.6231353282928467, "mean_token_accuracy": 0.7480179741978645, "num_tokens": 9152485.0, "step": 245 }, { "entropy": 0.6100682318210602, "epoch": 1.9096209912536444, "grad_norm": 0.008305463939905167, "learning_rate": 0.0002, "loss": 0.61110520362854, "mean_token_accuracy": 0.7516937106847763, "num_tokens": 9189875.0, "step": 246 }, { "entropy": 0.6206101104617119, "epoch": 1.9173955296404275, "grad_norm": 0.009909824468195438, "learning_rate": 0.0002, "loss": 0.6180837154388428, "mean_token_accuracy": 0.7495366632938385, "num_tokens": 9227450.0, "step": 247 }, { "entropy": 0.6217730790376663, "epoch": 1.925170068027211, "grad_norm": 0.008246448822319508, "learning_rate": 0.0002, "loss": 0.6189583539962769, "mean_token_accuracy": 0.7493142858147621, "num_tokens": 9265223.0, "step": 248 }, { "entropy": 0.6133992001414299, "epoch": 1.9329446064139941, "grad_norm": 0.007729528471827507, "learning_rate": 0.0002, "loss": 0.6164335608482361, "mean_token_accuracy": 0.7500994428992271, "num_tokens": 9302597.0, "step": 249 }, { "entropy": 0.596331886947155, "epoch": 1.9407191448007775, "grad_norm": 0.00885640550404787, "learning_rate": 0.0002, "loss": 0.6054399013519287, "mean_token_accuracy": 0.7546022981405258, "num_tokens": 9339665.0, "step": 250 }, { "entropy": 0.6010145470499992, "epoch": 1.9484936831875608, "grad_norm": 0.00908851157873869, "learning_rate": 0.0002, "loss": 0.6051974296569824, "mean_token_accuracy": 0.7543318867683411, "num_tokens": 9376514.0, "step": 251 }, { "entropy": 0.6160777136683464, "epoch": 1.9562682215743439, "grad_norm": 0.008100342005491257, "learning_rate": 0.0002, "loss": 0.6146577000617981, "mean_token_accuracy": 0.7485847100615501, "num_tokens": 9414214.0, "step": 252 }, { "entropy": 0.6268075257539749, "epoch": 1.9640427599611274, "grad_norm": 0.009163864888250828, "learning_rate": 0.0002, "loss": 0.6204258799552917, "mean_token_accuracy": 0.7494765147566795, "num_tokens": 9451946.0, "step": 253 }, { "entropy": 0.6106092482805252, "epoch": 1.9718172983479105, "grad_norm": 0.007819678634405136, "learning_rate": 0.0002, "loss": 0.6087175011634827, "mean_token_accuracy": 0.7527309507131577, "num_tokens": 9489076.0, "step": 254 }, { "entropy": 0.6168656274676323, "epoch": 1.9795918367346939, "grad_norm": 0.007515368517488241, "learning_rate": 0.0002, "loss": 0.6177273392677307, "mean_token_accuracy": 0.751363955438137, "num_tokens": 9526620.0, "step": 255 }, { "entropy": 0.6079138219356537, "epoch": 1.9873663751214772, "grad_norm": 0.009815288707613945, "learning_rate": 0.0002, "loss": 0.6155093312263489, "mean_token_accuracy": 0.7523162961006165, "num_tokens": 9564466.0, "step": 256 }, { "entropy": 0.6036990880966187, "epoch": 1.9951409135082603, "grad_norm": 0.008685542270541191, "learning_rate": 0.0002, "loss": 0.6101571917533875, "mean_token_accuracy": 0.7522860541939735, "num_tokens": 9601565.0, "step": 257 }, { "entropy": 0.6164417505264282, "epoch": 2.0, "grad_norm": 0.010608273558318615, "learning_rate": 0.0002, "loss": 0.6168809533119202, "mean_token_accuracy": 0.7516962647438049, "num_tokens": 9625165.0, "step": 258 }, { "entropy": 0.6057095304131508, "epoch": 2.007774538386783, "grad_norm": 0.009618077427148819, "learning_rate": 0.0002, "loss": 0.6003708839416504, "mean_token_accuracy": 0.7543603405356407, "num_tokens": 9662658.0, "step": 259 }, { "entropy": 0.6160204112529755, "epoch": 2.0155490767735667, "grad_norm": 0.007366312202066183, "learning_rate": 0.0002, "loss": 0.6107323169708252, "mean_token_accuracy": 0.751634031534195, "num_tokens": 9700423.0, "step": 260 }, { "entropy": 0.6157180666923523, "epoch": 2.0233236151603498, "grad_norm": 0.008381242863833904, "learning_rate": 0.0002, "loss": 0.6190871596336365, "mean_token_accuracy": 0.7481335178017616, "num_tokens": 9737692.0, "step": 261 }, { "entropy": 0.6075473129749298, "epoch": 2.0310981535471333, "grad_norm": 0.010082116350531578, "learning_rate": 0.0002, "loss": 0.6141625642776489, "mean_token_accuracy": 0.7516499608755112, "num_tokens": 9775062.0, "step": 262 }, { "entropy": 0.6151047423481941, "epoch": 2.0388726919339164, "grad_norm": 0.009529951959848404, "learning_rate": 0.0002, "loss": 0.6205469965934753, "mean_token_accuracy": 0.7464399412274361, "num_tokens": 9812526.0, "step": 263 }, { "entropy": 0.6053090617060661, "epoch": 2.0466472303206995, "grad_norm": 0.008532468229532242, "learning_rate": 0.0002, "loss": 0.604971170425415, "mean_token_accuracy": 0.7544130459427834, "num_tokens": 9849685.0, "step": 264 }, { "entropy": 0.6305021941661835, "epoch": 2.054421768707483, "grad_norm": 0.009080994874238968, "learning_rate": 0.0002, "loss": 0.6241769790649414, "mean_token_accuracy": 0.7455881908535957, "num_tokens": 9887441.0, "step": 265 }, { "entropy": 0.6111467704176903, "epoch": 2.062196307094266, "grad_norm": 0.008834858424961567, "learning_rate": 0.0002, "loss": 0.6073428392410278, "mean_token_accuracy": 0.7530370578169823, "num_tokens": 9924611.0, "step": 266 }, { "entropy": 0.6218099594116211, "epoch": 2.0699708454810497, "grad_norm": 0.009297652170062065, "learning_rate": 0.0002, "loss": 0.6261637806892395, "mean_token_accuracy": 0.7442486062645912, "num_tokens": 9962409.0, "step": 267 }, { "entropy": 0.620900422334671, "epoch": 2.077745383867833, "grad_norm": 0.012807542458176613, "learning_rate": 0.0002, "loss": 0.6319394111633301, "mean_token_accuracy": 0.7447366267442703, "num_tokens": 9999911.0, "step": 268 }, { "entropy": 0.6219062060117722, "epoch": 2.0855199222546164, "grad_norm": 0.008311600424349308, "learning_rate": 0.0002, "loss": 0.6196457147598267, "mean_token_accuracy": 0.7454339265823364, "num_tokens": 10037309.0, "step": 269 }, { "entropy": 0.6179447770118713, "epoch": 2.0932944606413995, "grad_norm": 0.010762435384094715, "learning_rate": 0.0002, "loss": 0.6135507822036743, "mean_token_accuracy": 0.7513665333390236, "num_tokens": 10074802.0, "step": 270 }, { "entropy": 0.6114057898521423, "epoch": 2.1010689990281826, "grad_norm": 0.009498962201178074, "learning_rate": 0.0002, "loss": 0.6119563579559326, "mean_token_accuracy": 0.7511925473809242, "num_tokens": 10112087.0, "step": 271 }, { "entropy": 0.5985657572746277, "epoch": 2.108843537414966, "grad_norm": 0.00927242822945118, "learning_rate": 0.0002, "loss": 0.6077044010162354, "mean_token_accuracy": 0.751846119761467, "num_tokens": 10149470.0, "step": 272 }, { "entropy": 0.5983473360538483, "epoch": 2.116618075801749, "grad_norm": 0.011125227436423302, "learning_rate": 0.0002, "loss": 0.6070785522460938, "mean_token_accuracy": 0.7521045431494713, "num_tokens": 10187018.0, "step": 273 }, { "entropy": 0.6010436862707138, "epoch": 2.1243926141885328, "grad_norm": 0.008612287230789661, "learning_rate": 0.0002, "loss": 0.6019182205200195, "mean_token_accuracy": 0.7563453242182732, "num_tokens": 10224534.0, "step": 274 }, { "entropy": 0.6097739785909653, "epoch": 2.132167152575316, "grad_norm": 0.009082912467420101, "learning_rate": 0.0002, "loss": 0.6092417240142822, "mean_token_accuracy": 0.7527365237474442, "num_tokens": 10261606.0, "step": 275 }, { "entropy": 0.6300967186689377, "epoch": 2.139941690962099, "grad_norm": 0.00942782312631607, "learning_rate": 0.0002, "loss": 0.6258421540260315, "mean_token_accuracy": 0.7469290718436241, "num_tokens": 10299180.0, "step": 276 }, { "entropy": 0.6028410047292709, "epoch": 2.1477162293488825, "grad_norm": 0.008522949181497097, "learning_rate": 0.0002, "loss": 0.6008127927780151, "mean_token_accuracy": 0.7564279735088348, "num_tokens": 10336360.0, "step": 277 }, { "entropy": 0.6102243736386299, "epoch": 2.1554907677356656, "grad_norm": 0.010031149722635746, "learning_rate": 0.0002, "loss": 0.6199367046356201, "mean_token_accuracy": 0.7469272315502167, "num_tokens": 10373565.0, "step": 278 }, { "entropy": 0.6027829498052597, "epoch": 2.163265306122449, "grad_norm": 0.008753525093197823, "learning_rate": 0.0002, "loss": 0.6074038147926331, "mean_token_accuracy": 0.7534594535827637, "num_tokens": 10411197.0, "step": 279 }, { "entropy": 0.6299364790320396, "epoch": 2.1710398445092323, "grad_norm": 0.007901565171778202, "learning_rate": 0.0002, "loss": 0.6327069401741028, "mean_token_accuracy": 0.7429891973733902, "num_tokens": 10448851.0, "step": 280 }, { "entropy": 0.623109444975853, "epoch": 2.1788143828960154, "grad_norm": 0.008401944302022457, "learning_rate": 0.0002, "loss": 0.6217602491378784, "mean_token_accuracy": 0.7446876764297485, "num_tokens": 10486285.0, "step": 281 }, { "entropy": 0.5951671376824379, "epoch": 2.186588921282799, "grad_norm": 0.009740160778164864, "learning_rate": 0.0002, "loss": 0.5930252075195312, "mean_token_accuracy": 0.7590748071670532, "num_tokens": 10523187.0, "step": 282 }, { "entropy": 0.6063435301184654, "epoch": 2.194363459669582, "grad_norm": 0.008115135133266449, "learning_rate": 0.0002, "loss": 0.6058975458145142, "mean_token_accuracy": 0.7546751350164413, "num_tokens": 10560619.0, "step": 283 }, { "entropy": 0.6197424605488777, "epoch": 2.2021379980563656, "grad_norm": 0.007982614450156689, "learning_rate": 0.0002, "loss": 0.6196328401565552, "mean_token_accuracy": 0.7473800256848335, "num_tokens": 10597952.0, "step": 284 }, { "entropy": 0.5975362882018089, "epoch": 2.2099125364431487, "grad_norm": 0.008934210054576397, "learning_rate": 0.0002, "loss": 0.6019341945648193, "mean_token_accuracy": 0.7551193311810493, "num_tokens": 10635474.0, "step": 285 }, { "entropy": 0.6057508885860443, "epoch": 2.2176870748299318, "grad_norm": 0.007894222624599934, "learning_rate": 0.0002, "loss": 0.6054433584213257, "mean_token_accuracy": 0.7555015385150909, "num_tokens": 10672866.0, "step": 286 }, { "entropy": 0.6011307016015053, "epoch": 2.2254616132167153, "grad_norm": 0.008009341545403004, "learning_rate": 0.0002, "loss": 0.6015121936798096, "mean_token_accuracy": 0.7533531039953232, "num_tokens": 10710119.0, "step": 287 }, { "entropy": 0.6083035543560982, "epoch": 2.2332361516034984, "grad_norm": 0.008571778424084187, "learning_rate": 0.0002, "loss": 0.6072158813476562, "mean_token_accuracy": 0.7525660693645477, "num_tokens": 10747533.0, "step": 288 }, { "entropy": 0.596297912299633, "epoch": 2.241010689990282, "grad_norm": 0.007835134863853455, "learning_rate": 0.0002, "loss": 0.6007227897644043, "mean_token_accuracy": 0.75400510430336, "num_tokens": 10784600.0, "step": 289 }, { "entropy": 0.6027623787522316, "epoch": 2.248785228377065, "grad_norm": 0.00971238687634468, "learning_rate": 0.0002, "loss": 0.6095942258834839, "mean_token_accuracy": 0.753618136048317, "num_tokens": 10822085.0, "step": 290 }, { "entropy": 0.596187099814415, "epoch": 2.256559766763848, "grad_norm": 0.008036565966904163, "learning_rate": 0.0002, "loss": 0.5973517298698425, "mean_token_accuracy": 0.7577640637755394, "num_tokens": 10859362.0, "step": 291 }, { "entropy": 0.6243500411510468, "epoch": 2.2643343051506317, "grad_norm": 0.00934487022459507, "learning_rate": 0.0002, "loss": 0.6226072311401367, "mean_token_accuracy": 0.7454966679215431, "num_tokens": 10896757.0, "step": 292 }, { "entropy": 0.6136296838521957, "epoch": 2.272108843537415, "grad_norm": 0.008677436038851738, "learning_rate": 0.0002, "loss": 0.615119457244873, "mean_token_accuracy": 0.750088632106781, "num_tokens": 10934016.0, "step": 293 }, { "entropy": 0.5983113646507263, "epoch": 2.2798833819241984, "grad_norm": 0.007704727817326784, "learning_rate": 0.0002, "loss": 0.5992428064346313, "mean_token_accuracy": 0.7575259953737259, "num_tokens": 10971732.0, "step": 294 }, { "entropy": 0.602768175303936, "epoch": 2.2876579203109815, "grad_norm": 0.008800746873021126, "learning_rate": 0.0002, "loss": 0.6059098243713379, "mean_token_accuracy": 0.7514860853552818, "num_tokens": 11009363.0, "step": 295 }, { "entropy": 0.6180300787091255, "epoch": 2.295432458697765, "grad_norm": 0.009863065555691719, "learning_rate": 0.0002, "loss": 0.6232578754425049, "mean_token_accuracy": 0.7460011914372444, "num_tokens": 11046850.0, "step": 296 }, { "entropy": 0.615628756582737, "epoch": 2.303206997084548, "grad_norm": 0.00794578343629837, "learning_rate": 0.0002, "loss": 0.6193504929542542, "mean_token_accuracy": 0.7466345354914665, "num_tokens": 11084028.0, "step": 297 }, { "entropy": 0.6079032048583031, "epoch": 2.3109815354713312, "grad_norm": 0.008673022501170635, "learning_rate": 0.0002, "loss": 0.6060619354248047, "mean_token_accuracy": 0.7532483711838722, "num_tokens": 11121691.0, "step": 298 }, { "entropy": 0.6126295253634453, "epoch": 2.3187560738581148, "grad_norm": 0.010211586020886898, "learning_rate": 0.0002, "loss": 0.6097185611724854, "mean_token_accuracy": 0.7503807097673416, "num_tokens": 11159118.0, "step": 299 }, { "entropy": 0.6223906055092812, "epoch": 2.326530612244898, "grad_norm": 0.007925095036625862, "learning_rate": 0.0002, "loss": 0.6250431537628174, "mean_token_accuracy": 0.7459972500801086, "num_tokens": 11196522.0, "step": 300 }, { "entropy": 0.6105447709560394, "epoch": 2.3343051506316814, "grad_norm": 0.008913103491067886, "learning_rate": 0.0002, "loss": 0.616736114025116, "mean_token_accuracy": 0.749770350754261, "num_tokens": 11234173.0, "step": 301 }, { "entropy": 0.6050237938761711, "epoch": 2.3420796890184645, "grad_norm": 0.00913191493600607, "learning_rate": 0.0002, "loss": 0.6078106164932251, "mean_token_accuracy": 0.7534833922982216, "num_tokens": 11271528.0, "step": 302 }, { "entropy": 0.624389261007309, "epoch": 2.3498542274052476, "grad_norm": 0.00800058338791132, "learning_rate": 0.0002, "loss": 0.624384880065918, "mean_token_accuracy": 0.7484247088432312, "num_tokens": 11309275.0, "step": 303 }, { "entropy": 0.621875673532486, "epoch": 2.357628765792031, "grad_norm": 0.009797596372663975, "learning_rate": 0.0002, "loss": 0.6190812587738037, "mean_token_accuracy": 0.7491643279790878, "num_tokens": 11346386.0, "step": 304 }, { "entropy": 0.6205748915672302, "epoch": 2.3654033041788143, "grad_norm": 0.009043901227414608, "learning_rate": 0.0002, "loss": 0.616840124130249, "mean_token_accuracy": 0.7496623322367668, "num_tokens": 11383273.0, "step": 305 }, { "entropy": 0.5943257734179497, "epoch": 2.373177842565598, "grad_norm": 0.009680100716650486, "learning_rate": 0.0002, "loss": 0.6005733013153076, "mean_token_accuracy": 0.7566492632031441, "num_tokens": 11420226.0, "step": 306 }, { "entropy": 0.5875989943742752, "epoch": 2.380952380952381, "grad_norm": 0.009831924922764301, "learning_rate": 0.0002, "loss": 0.5920431613922119, "mean_token_accuracy": 0.758441336452961, "num_tokens": 11457658.0, "step": 307 }, { "entropy": 0.605907216668129, "epoch": 2.388726919339164, "grad_norm": 0.008310995064675808, "learning_rate": 0.0002, "loss": 0.606610894203186, "mean_token_accuracy": 0.7539205178618431, "num_tokens": 11495093.0, "step": 308 }, { "entropy": 0.6085820719599724, "epoch": 2.3965014577259476, "grad_norm": 0.008422457613050938, "learning_rate": 0.0002, "loss": 0.6112357378005981, "mean_token_accuracy": 0.7495599314570427, "num_tokens": 11532305.0, "step": 309 }, { "entropy": 0.6038077920675278, "epoch": 2.4042759961127307, "grad_norm": 0.009313938207924366, "learning_rate": 0.0002, "loss": 0.6037260293960571, "mean_token_accuracy": 0.7537373602390289, "num_tokens": 11569956.0, "step": 310 }, { "entropy": 0.6088597327470779, "epoch": 2.4120505344995142, "grad_norm": 0.008129115216434002, "learning_rate": 0.0002, "loss": 0.6097284555435181, "mean_token_accuracy": 0.752282939851284, "num_tokens": 11607580.0, "step": 311 }, { "entropy": 0.6035630702972412, "epoch": 2.4198250728862973, "grad_norm": 0.010189153254032135, "learning_rate": 0.0002, "loss": 0.6098878383636475, "mean_token_accuracy": 0.7509205341339111, "num_tokens": 11645065.0, "step": 312 }, { "entropy": 0.5988744720816612, "epoch": 2.427599611273081, "grad_norm": 0.008477658964693546, "learning_rate": 0.0002, "loss": 0.600048840045929, "mean_token_accuracy": 0.7566671743988991, "num_tokens": 11682523.0, "step": 313 }, { "entropy": 0.604704961180687, "epoch": 2.435374149659864, "grad_norm": 0.009996007196605206, "learning_rate": 0.0002, "loss": 0.6124827861785889, "mean_token_accuracy": 0.7483595088124275, "num_tokens": 11719829.0, "step": 314 }, { "entropy": 0.6142484471201897, "epoch": 2.443148688046647, "grad_norm": 0.008275930769741535, "learning_rate": 0.0002, "loss": 0.6168549060821533, "mean_token_accuracy": 0.7509273141622543, "num_tokens": 11757130.0, "step": 315 }, { "entropy": 0.618528425693512, "epoch": 2.4509232264334306, "grad_norm": 0.00913267582654953, "learning_rate": 0.0002, "loss": 0.6144739985466003, "mean_token_accuracy": 0.7495302185416222, "num_tokens": 11794646.0, "step": 316 }, { "entropy": 0.6221663355827332, "epoch": 2.4586977648202137, "grad_norm": 0.008833467960357666, "learning_rate": 0.0002, "loss": 0.6160144805908203, "mean_token_accuracy": 0.7488524913787842, "num_tokens": 11832667.0, "step": 317 }, { "entropy": 0.6151534616947174, "epoch": 2.466472303206997, "grad_norm": 0.008367245085537434, "learning_rate": 0.0002, "loss": 0.6178625226020813, "mean_token_accuracy": 0.7469210624694824, "num_tokens": 11870196.0, "step": 318 }, { "entropy": 0.599577471613884, "epoch": 2.4742468415937804, "grad_norm": 0.008229793980717659, "learning_rate": 0.0002, "loss": 0.6013622283935547, "mean_token_accuracy": 0.7555016428232193, "num_tokens": 11907738.0, "step": 319 }, { "entropy": 0.6037501096725464, "epoch": 2.4820213799805635, "grad_norm": 0.009975764900445938, "learning_rate": 0.0002, "loss": 0.6080362796783447, "mean_token_accuracy": 0.754118837416172, "num_tokens": 11945154.0, "step": 320 }, { "entropy": 0.6234212592244148, "epoch": 2.489795918367347, "grad_norm": 0.009158926084637642, "learning_rate": 0.0002, "loss": 0.6259138584136963, "mean_token_accuracy": 0.7461888268589973, "num_tokens": 11983030.0, "step": 321 }, { "entropy": 0.6105703264474869, "epoch": 2.49757045675413, "grad_norm": 0.009549647569656372, "learning_rate": 0.0002, "loss": 0.6138617992401123, "mean_token_accuracy": 0.7500449195504189, "num_tokens": 12020106.0, "step": 322 }, { "entropy": 0.5886913314461708, "epoch": 2.5053449951409137, "grad_norm": 0.009142185561358929, "learning_rate": 0.0002, "loss": 0.5951993465423584, "mean_token_accuracy": 0.7568985298275948, "num_tokens": 12057274.0, "step": 323 }, { "entropy": 0.6163628548383713, "epoch": 2.513119533527697, "grad_norm": 0.008757554925978184, "learning_rate": 0.0002, "loss": 0.6170852184295654, "mean_token_accuracy": 0.749226838350296, "num_tokens": 12094665.0, "step": 324 }, { "entropy": 0.6229220703244209, "epoch": 2.52089407191448, "grad_norm": 0.007944419980049133, "learning_rate": 0.0002, "loss": 0.6211696267127991, "mean_token_accuracy": 0.749010942876339, "num_tokens": 12132302.0, "step": 325 }, { "entropy": 0.6257840767502785, "epoch": 2.5286686103012634, "grad_norm": 0.008713958784937859, "learning_rate": 0.0002, "loss": 0.6223682165145874, "mean_token_accuracy": 0.7470938488841057, "num_tokens": 12169510.0, "step": 326 }, { "entropy": 0.6103069111704826, "epoch": 2.5364431486880465, "grad_norm": 0.008112641051411629, "learning_rate": 0.0002, "loss": 0.6112810969352722, "mean_token_accuracy": 0.7517933994531631, "num_tokens": 12206878.0, "step": 327 }, { "entropy": 0.6295960918068886, "epoch": 2.54421768707483, "grad_norm": 0.009597997181117535, "learning_rate": 0.0002, "loss": 0.6329588890075684, "mean_token_accuracy": 0.7417808771133423, "num_tokens": 12244230.0, "step": 328 }, { "entropy": 0.6144092008471489, "epoch": 2.551992225461613, "grad_norm": 0.007173395249992609, "learning_rate": 0.0002, "loss": 0.6167792081832886, "mean_token_accuracy": 0.750128723680973, "num_tokens": 12281944.0, "step": 329 }, { "entropy": 0.6102811768651009, "epoch": 2.5597667638483967, "grad_norm": 0.00874980166554451, "learning_rate": 0.0002, "loss": 0.6081819534301758, "mean_token_accuracy": 0.7545690611004829, "num_tokens": 12319144.0, "step": 330 }, { "entropy": 0.6088513135910034, "epoch": 2.56754130223518, "grad_norm": 0.007437287364155054, "learning_rate": 0.0002, "loss": 0.610903799533844, "mean_token_accuracy": 0.7525679916143417, "num_tokens": 12356752.0, "step": 331 }, { "entropy": 0.605910450220108, "epoch": 2.575315840621963, "grad_norm": 0.008948191069066525, "learning_rate": 0.0002, "loss": 0.6137778759002686, "mean_token_accuracy": 0.7502530664205551, "num_tokens": 12394388.0, "step": 332 }, { "entropy": 0.6148117780685425, "epoch": 2.5830903790087465, "grad_norm": 0.008310764096677303, "learning_rate": 0.0002, "loss": 0.6203396320343018, "mean_token_accuracy": 0.7478612065315247, "num_tokens": 12431583.0, "step": 333 }, { "entropy": 0.6049426943063736, "epoch": 2.5908649173955296, "grad_norm": 0.00928961019963026, "learning_rate": 0.0002, "loss": 0.6102631688117981, "mean_token_accuracy": 0.7530224993824959, "num_tokens": 12469057.0, "step": 334 }, { "entropy": 0.6105730906128883, "epoch": 2.5986394557823127, "grad_norm": 0.008061802014708519, "learning_rate": 0.0002, "loss": 0.6099789142608643, "mean_token_accuracy": 0.7517432495951653, "num_tokens": 12506375.0, "step": 335 }, { "entropy": 0.6109907403588295, "epoch": 2.6064139941690962, "grad_norm": 0.008131072856485844, "learning_rate": 0.0002, "loss": 0.6083254814147949, "mean_token_accuracy": 0.7539641037583351, "num_tokens": 12543683.0, "step": 336 }, { "entropy": 0.60856644064188, "epoch": 2.6141885325558794, "grad_norm": 0.008039598353207111, "learning_rate": 0.0002, "loss": 0.6059796810150146, "mean_token_accuracy": 0.7539034485816956, "num_tokens": 12581164.0, "step": 337 }, { "entropy": 0.6075717508792877, "epoch": 2.621963070942663, "grad_norm": 0.007622460834681988, "learning_rate": 0.0002, "loss": 0.6058254241943359, "mean_token_accuracy": 0.755204826593399, "num_tokens": 12618385.0, "step": 338 }, { "entropy": 0.6058209240436554, "epoch": 2.629737609329446, "grad_norm": 0.009571490809321404, "learning_rate": 0.0002, "loss": 0.6132853031158447, "mean_token_accuracy": 0.7517998144030571, "num_tokens": 12656198.0, "step": 339 }, { "entropy": 0.609808899462223, "epoch": 2.6375121477162295, "grad_norm": 0.009121098555624485, "learning_rate": 0.0002, "loss": 0.6116859912872314, "mean_token_accuracy": 0.7522552087903023, "num_tokens": 12693619.0, "step": 340 }, { "entropy": 0.5982947275042534, "epoch": 2.6452866861030127, "grad_norm": 0.007683332543820143, "learning_rate": 0.0002, "loss": 0.6035135984420776, "mean_token_accuracy": 0.7554004937410355, "num_tokens": 12731247.0, "step": 341 }, { "entropy": 0.6199963241815567, "epoch": 2.6530612244897958, "grad_norm": 0.008116503246128559, "learning_rate": 0.0002, "loss": 0.6209834814071655, "mean_token_accuracy": 0.7469918876886368, "num_tokens": 12768639.0, "step": 342 }, { "entropy": 0.611749030649662, "epoch": 2.6608357628765793, "grad_norm": 0.009202837944030762, "learning_rate": 0.0002, "loss": 0.609596848487854, "mean_token_accuracy": 0.7527265250682831, "num_tokens": 12805843.0, "step": 343 }, { "entropy": 0.6049032211303711, "epoch": 2.6686103012633624, "grad_norm": 0.008622320368885994, "learning_rate": 0.0002, "loss": 0.6062831282615662, "mean_token_accuracy": 0.7529996708035469, "num_tokens": 12843334.0, "step": 344 }, { "entropy": 0.6080296412110329, "epoch": 2.6763848396501455, "grad_norm": 0.010344683192670345, "learning_rate": 0.0002, "loss": 0.6155232787132263, "mean_token_accuracy": 0.7492252364754677, "num_tokens": 12881114.0, "step": 345 }, { "entropy": 0.6105146557092667, "epoch": 2.684159378036929, "grad_norm": 0.00811974797397852, "learning_rate": 0.0002, "loss": 0.61601722240448, "mean_token_accuracy": 0.7480410560965538, "num_tokens": 12918628.0, "step": 346 }, { "entropy": 0.616872251033783, "epoch": 2.6919339164237126, "grad_norm": 0.009087933227419853, "learning_rate": 0.0002, "loss": 0.6140284538269043, "mean_token_accuracy": 0.7496198862791061, "num_tokens": 12955856.0, "step": 347 }, { "entropy": 0.6135741174221039, "epoch": 2.6997084548104957, "grad_norm": 0.008728091605007648, "learning_rate": 0.0002, "loss": 0.6116735935211182, "mean_token_accuracy": 0.7527862265706062, "num_tokens": 12993282.0, "step": 348 }, { "entropy": 0.6206527948379517, "epoch": 2.707482993197279, "grad_norm": 0.008598288521170616, "learning_rate": 0.0002, "loss": 0.6233333349227905, "mean_token_accuracy": 0.7463840544223785, "num_tokens": 13030919.0, "step": 349 }, { "entropy": 0.608021192252636, "epoch": 2.7152575315840624, "grad_norm": 0.008716718293726444, "learning_rate": 0.0002, "loss": 0.612204909324646, "mean_token_accuracy": 0.7511651292443275, "num_tokens": 13068022.0, "step": 350 }, { "entropy": 0.6055907234549522, "epoch": 2.7230320699708455, "grad_norm": 0.007125901058316231, "learning_rate": 0.0002, "loss": 0.6055992841720581, "mean_token_accuracy": 0.753873273730278, "num_tokens": 13105324.0, "step": 351 }, { "entropy": 0.6134061738848686, "epoch": 2.7308066083576286, "grad_norm": 0.007964730262756348, "learning_rate": 0.0002, "loss": 0.6122632026672363, "mean_token_accuracy": 0.7516495808959007, "num_tokens": 13143067.0, "step": 352 }, { "entropy": 0.6035361513495445, "epoch": 2.738581146744412, "grad_norm": 0.008376477286219597, "learning_rate": 0.0002, "loss": 0.6055692434310913, "mean_token_accuracy": 0.7536868900060654, "num_tokens": 13180307.0, "step": 353 }, { "entropy": 0.6108582690358162, "epoch": 2.746355685131195, "grad_norm": 0.008256555534899235, "learning_rate": 0.0002, "loss": 0.6159192323684692, "mean_token_accuracy": 0.7500140145421028, "num_tokens": 13217651.0, "step": 354 }, { "entropy": 0.6065188273787498, "epoch": 2.7541302235179788, "grad_norm": 0.007910750806331635, "learning_rate": 0.0002, "loss": 0.6087648868560791, "mean_token_accuracy": 0.7539975792169571, "num_tokens": 13255245.0, "step": 355 }, { "entropy": 0.6058445647358894, "epoch": 2.761904761904762, "grad_norm": 0.007995028980076313, "learning_rate": 0.0002, "loss": 0.6082870960235596, "mean_token_accuracy": 0.7520255744457245, "num_tokens": 13293244.0, "step": 356 }, { "entropy": 0.6188160851597786, "epoch": 2.7696793002915454, "grad_norm": 0.008255942724645138, "learning_rate": 0.0002, "loss": 0.615801990032196, "mean_token_accuracy": 0.7498086243867874, "num_tokens": 13330234.0, "step": 357 }, { "entropy": 0.6236889883875847, "epoch": 2.7774538386783285, "grad_norm": 0.007726432289928198, "learning_rate": 0.0002, "loss": 0.6215789914131165, "mean_token_accuracy": 0.7462954670190811, "num_tokens": 13367753.0, "step": 358 }, { "entropy": 0.6057674139738083, "epoch": 2.7852283770651116, "grad_norm": 0.007486944552510977, "learning_rate": 0.0002, "loss": 0.6107175946235657, "mean_token_accuracy": 0.7536005079746246, "num_tokens": 13405367.0, "step": 359 }, { "entropy": 0.6108546778559685, "epoch": 2.793002915451895, "grad_norm": 0.00800468772649765, "learning_rate": 0.0002, "loss": 0.6151923537254333, "mean_token_accuracy": 0.7498300299048424, "num_tokens": 13442458.0, "step": 360 }, { "entropy": 0.611615277826786, "epoch": 2.8007774538386783, "grad_norm": 0.008358453400433064, "learning_rate": 0.0002, "loss": 0.6143432855606079, "mean_token_accuracy": 0.7498634308576584, "num_tokens": 13479706.0, "step": 361 }, { "entropy": 0.6097937971353531, "epoch": 2.8085519922254614, "grad_norm": 0.008056551218032837, "learning_rate": 0.0002, "loss": 0.6140632629394531, "mean_token_accuracy": 0.7493433877825737, "num_tokens": 13517106.0, "step": 362 }, { "entropy": 0.6036530286073685, "epoch": 2.816326530612245, "grad_norm": 0.008669313974678516, "learning_rate": 0.0002, "loss": 0.604174792766571, "mean_token_accuracy": 0.755392961204052, "num_tokens": 13554029.0, "step": 363 }, { "entropy": 0.6074316874146461, "epoch": 2.824101068999028, "grad_norm": 0.008313254453241825, "learning_rate": 0.0002, "loss": 0.6034117937088013, "mean_token_accuracy": 0.7538974210619926, "num_tokens": 13591496.0, "step": 364 }, { "entropy": 0.625335082411766, "epoch": 2.8318756073858116, "grad_norm": 0.00826285034418106, "learning_rate": 0.0002, "loss": 0.6179195642471313, "mean_token_accuracy": 0.7473107278347015, "num_tokens": 13629175.0, "step": 365 }, { "entropy": 0.6023752987384796, "epoch": 2.8396501457725947, "grad_norm": 0.008760266937315464, "learning_rate": 0.0002, "loss": 0.6035041809082031, "mean_token_accuracy": 0.752547599375248, "num_tokens": 13666378.0, "step": 366 }, { "entropy": 0.6186700463294983, "epoch": 2.847424684159378, "grad_norm": 0.009422390721738338, "learning_rate": 0.0002, "loss": 0.6255558133125305, "mean_token_accuracy": 0.7451329976320267, "num_tokens": 13704147.0, "step": 367 }, { "entropy": 0.6027014032006264, "epoch": 2.8551992225461613, "grad_norm": 0.007943754084408283, "learning_rate": 0.0002, "loss": 0.6077042818069458, "mean_token_accuracy": 0.7518687173724174, "num_tokens": 13741252.0, "step": 368 }, { "entropy": 0.6081340312957764, "epoch": 2.8629737609329444, "grad_norm": 0.008472657762467861, "learning_rate": 0.0002, "loss": 0.6082110404968262, "mean_token_accuracy": 0.7499295845627785, "num_tokens": 13778637.0, "step": 369 }, { "entropy": 0.6041673645377159, "epoch": 2.870748299319728, "grad_norm": 0.008525537326931953, "learning_rate": 0.0002, "loss": 0.6059847474098206, "mean_token_accuracy": 0.7531944662332535, "num_tokens": 13816076.0, "step": 370 }, { "entropy": 0.6156945377588272, "epoch": 2.878522837706511, "grad_norm": 0.007397054228931665, "learning_rate": 0.0002, "loss": 0.6175694465637207, "mean_token_accuracy": 0.7489196062088013, "num_tokens": 13853700.0, "step": 371 }, { "entropy": 0.6109963580965996, "epoch": 2.8862973760932946, "grad_norm": 0.008632549084722996, "learning_rate": 0.0002, "loss": 0.6189043521881104, "mean_token_accuracy": 0.7480105683207512, "num_tokens": 13890909.0, "step": 372 }, { "entropy": 0.60771045088768, "epoch": 2.8940719144800777, "grad_norm": 0.008767201565206051, "learning_rate": 0.0002, "loss": 0.6133548021316528, "mean_token_accuracy": 0.7522530779242516, "num_tokens": 13928292.0, "step": 373 }, { "entropy": 0.6067496612668037, "epoch": 2.9018464528668613, "grad_norm": 0.007676385343074799, "learning_rate": 0.0002, "loss": 0.60523521900177, "mean_token_accuracy": 0.754976786673069, "num_tokens": 13965803.0, "step": 374 }, { "entropy": 0.6119726821780205, "epoch": 2.9096209912536444, "grad_norm": 0.007059477269649506, "learning_rate": 0.0002, "loss": 0.6106954216957092, "mean_token_accuracy": 0.7522552087903023, "num_tokens": 14002852.0, "step": 375 }, { "entropy": 0.6248558238148689, "epoch": 2.9173955296404275, "grad_norm": 0.008261643350124359, "learning_rate": 0.0002, "loss": 0.6251908540725708, "mean_token_accuracy": 0.7473416924476624, "num_tokens": 14040214.0, "step": 376 }, { "entropy": 0.6125365421175957, "epoch": 2.925170068027211, "grad_norm": 0.00803174264729023, "learning_rate": 0.0002, "loss": 0.6121209859848022, "mean_token_accuracy": 0.7514154240489006, "num_tokens": 14077708.0, "step": 377 }, { "entropy": 0.6050901785492897, "epoch": 2.932944606413994, "grad_norm": 0.007550297304987907, "learning_rate": 0.0002, "loss": 0.6031768321990967, "mean_token_accuracy": 0.7547935023903847, "num_tokens": 14115081.0, "step": 378 }, { "entropy": 0.5867772176861763, "epoch": 2.9407191448007772, "grad_norm": 0.007504226174205542, "learning_rate": 0.0002, "loss": 0.586522102355957, "mean_token_accuracy": 0.7607723250985146, "num_tokens": 14152707.0, "step": 379 }, { "entropy": 0.6053405031561852, "epoch": 2.9484936831875608, "grad_norm": 0.007515515200793743, "learning_rate": 0.0002, "loss": 0.6078545451164246, "mean_token_accuracy": 0.7521200627088547, "num_tokens": 14190102.0, "step": 380 }, { "entropy": 0.6189891770482063, "epoch": 2.956268221574344, "grad_norm": 0.009104753844439983, "learning_rate": 0.0002, "loss": 0.6249637603759766, "mean_token_accuracy": 0.745013989508152, "num_tokens": 14227592.0, "step": 381 }, { "entropy": 0.6138845458626747, "epoch": 2.9640427599611274, "grad_norm": 0.008113187737762928, "learning_rate": 0.0002, "loss": 0.6206336617469788, "mean_token_accuracy": 0.7456697672605515, "num_tokens": 14264742.0, "step": 382 }, { "entropy": 0.6130691468715668, "epoch": 2.9718172983479105, "grad_norm": 0.009299568831920624, "learning_rate": 0.0002, "loss": 0.6096789836883545, "mean_token_accuracy": 0.7523899152874947, "num_tokens": 14302195.0, "step": 383 }, { "entropy": 0.6205710843205452, "epoch": 2.979591836734694, "grad_norm": 0.009512864053249359, "learning_rate": 0.0002, "loss": 0.6156758069992065, "mean_token_accuracy": 0.7508921846747398, "num_tokens": 14339245.0, "step": 384 }, { "entropy": 0.6069811135530472, "epoch": 2.987366375121477, "grad_norm": 0.007910305634140968, "learning_rate": 0.0002, "loss": 0.6085284948348999, "mean_token_accuracy": 0.753339558839798, "num_tokens": 14376587.0, "step": 385 }, { "entropy": 0.6119454056024551, "epoch": 2.9951409135082603, "grad_norm": 0.009647355414927006, "learning_rate": 0.0002, "loss": 0.6212526559829712, "mean_token_accuracy": 0.7483848258852959, "num_tokens": 14414269.0, "step": 386 }, { "entropy": 0.5991271257400512, "epoch": 3.0, "grad_norm": 0.010158240795135498, "learning_rate": 0.0002, "loss": 0.6065676212310791, "mean_token_accuracy": 0.7547077178955078, "num_tokens": 14437732.0, "step": 387 }, { "entropy": 0.6155622974038124, "epoch": 3.007774538386783, "grad_norm": 0.007469667587429285, "learning_rate": 0.0002, "loss": 0.610929012298584, "mean_token_accuracy": 0.7500728666782379, "num_tokens": 14475215.0, "step": 388 }, { "entropy": 0.6059615164995193, "epoch": 3.0155490767735667, "grad_norm": 0.008237253874540329, "learning_rate": 0.0002, "loss": 0.6052074432373047, "mean_token_accuracy": 0.75154148042202, "num_tokens": 14512098.0, "step": 389 }, { "entropy": 0.6095065400004387, "epoch": 3.0233236151603498, "grad_norm": 0.008823649026453495, "learning_rate": 0.0002, "loss": 0.6052320599555969, "mean_token_accuracy": 0.7540639191865921, "num_tokens": 14549796.0, "step": 390 }, { "entropy": 0.5965104550123215, "epoch": 3.0310981535471333, "grad_norm": 0.008173096925020218, "learning_rate": 0.0002, "loss": 0.5943379998207092, "mean_token_accuracy": 0.7575219720602036, "num_tokens": 14587236.0, "step": 391 }, { "entropy": 0.6153795942664146, "epoch": 3.0388726919339164, "grad_norm": 0.011041256599128246, "learning_rate": 0.0002, "loss": 0.6242270469665527, "mean_token_accuracy": 0.7458753809332848, "num_tokens": 14624782.0, "step": 392 }, { "entropy": 0.5972734019160271, "epoch": 3.0466472303206995, "grad_norm": 0.008677808567881584, "learning_rate": 0.0002, "loss": 0.5998678207397461, "mean_token_accuracy": 0.7576502561569214, "num_tokens": 14662174.0, "step": 393 }, { "entropy": 0.6102932617068291, "epoch": 3.054421768707483, "grad_norm": 0.010088201612234116, "learning_rate": 0.0002, "loss": 0.6051709651947021, "mean_token_accuracy": 0.7535885870456696, "num_tokens": 14699746.0, "step": 394 }, { "entropy": 0.6008228436112404, "epoch": 3.062196307094266, "grad_norm": 0.008312424644827843, "learning_rate": 0.0002, "loss": 0.6032264232635498, "mean_token_accuracy": 0.7517057359218597, "num_tokens": 14737247.0, "step": 395 }, { "entropy": 0.5989790633320808, "epoch": 3.0699708454810497, "grad_norm": 0.008239499293267727, "learning_rate": 0.0002, "loss": 0.6043699979782104, "mean_token_accuracy": 0.7529819533228874, "num_tokens": 14774702.0, "step": 396 }, { "entropy": 0.6045716553926468, "epoch": 3.077745383867833, "grad_norm": 0.01003638468682766, "learning_rate": 0.0002, "loss": 0.6113682985305786, "mean_token_accuracy": 0.7505319342017174, "num_tokens": 14811886.0, "step": 397 }, { "entropy": 0.6115910932421684, "epoch": 3.0855199222546164, "grad_norm": 0.009529519826173782, "learning_rate": 0.0002, "loss": 0.6107526421546936, "mean_token_accuracy": 0.7507694736123085, "num_tokens": 14848988.0, "step": 398 }, { "entropy": 0.6084096133708954, "epoch": 3.0932944606413995, "grad_norm": 0.010617745108902454, "learning_rate": 0.0002, "loss": 0.6034584045410156, "mean_token_accuracy": 0.753932997584343, "num_tokens": 14886459.0, "step": 399 }, { "entropy": 0.6054683178663254, "epoch": 3.1010689990281826, "grad_norm": 0.008427645079791546, "learning_rate": 0.0002, "loss": 0.603972852230072, "mean_token_accuracy": 0.7547962665557861, "num_tokens": 14924071.0, "step": 400 }, { "entropy": 0.5898149386048317, "epoch": 3.108843537414966, "grad_norm": 0.009828660637140274, "learning_rate": 0.0002, "loss": 0.5968987941741943, "mean_token_accuracy": 0.7556750178337097, "num_tokens": 14961693.0, "step": 401 }, { "entropy": 0.5877138301730156, "epoch": 3.116618075801749, "grad_norm": 0.010062897577881813, "learning_rate": 0.0002, "loss": 0.5967484712600708, "mean_token_accuracy": 0.7571568712592125, "num_tokens": 14998846.0, "step": 402 }, { "entropy": 0.5948435962200165, "epoch": 3.1243926141885328, "grad_norm": 0.008929714560508728, "learning_rate": 0.0002, "loss": 0.596827507019043, "mean_token_accuracy": 0.7577486112713814, "num_tokens": 15036731.0, "step": 403 }, { "entropy": 0.6053501963615417, "epoch": 3.132167152575316, "grad_norm": 0.009441581554710865, "learning_rate": 0.0002, "loss": 0.6060553789138794, "mean_token_accuracy": 0.7532980218529701, "num_tokens": 15074609.0, "step": 404 }, { "entropy": 0.6139290183782578, "epoch": 3.139941690962099, "grad_norm": 0.009152664802968502, "learning_rate": 0.0002, "loss": 0.6124223470687866, "mean_token_accuracy": 0.7500443160533905, "num_tokens": 15112062.0, "step": 405 }, { "entropy": 0.5967981591820717, "epoch": 3.1477162293488825, "grad_norm": 0.009577469900250435, "learning_rate": 0.0002, "loss": 0.60134357213974, "mean_token_accuracy": 0.75638198107481, "num_tokens": 15149260.0, "step": 406 }, { "entropy": 0.6026358082890511, "epoch": 3.1554907677356656, "grad_norm": 0.008992240764200687, "learning_rate": 0.0002, "loss": 0.6071676015853882, "mean_token_accuracy": 0.7526509240269661, "num_tokens": 15186342.0, "step": 407 }, { "entropy": 0.6130121350288391, "epoch": 3.163265306122449, "grad_norm": 0.009787038899958134, "learning_rate": 0.0002, "loss": 0.616807222366333, "mean_token_accuracy": 0.7485663071274757, "num_tokens": 15224037.0, "step": 408 }, { "entropy": 0.6062626764178276, "epoch": 3.1710398445092323, "grad_norm": 0.009504587389528751, "learning_rate": 0.0002, "loss": 0.6050899624824524, "mean_token_accuracy": 0.7536401823163033, "num_tokens": 15261579.0, "step": 409 }, { "entropy": 0.6065879017114639, "epoch": 3.1788143828960154, "grad_norm": 0.008364197798073292, "learning_rate": 0.0002, "loss": 0.6022209525108337, "mean_token_accuracy": 0.7534467577934265, "num_tokens": 15299024.0, "step": 410 }, { "entropy": 0.6233559027314186, "epoch": 3.186588921282799, "grad_norm": 0.010281233116984367, "learning_rate": 0.0002, "loss": 0.6214974522590637, "mean_token_accuracy": 0.7470389008522034, "num_tokens": 15336558.0, "step": 411 }, { "entropy": 0.6087061986327171, "epoch": 3.194363459669582, "grad_norm": 0.00957780983299017, "learning_rate": 0.0002, "loss": 0.6129252910614014, "mean_token_accuracy": 0.7495343014597893, "num_tokens": 15374032.0, "step": 412 }, { "entropy": 0.596970833837986, "epoch": 3.2021379980563656, "grad_norm": 0.00984536949545145, "learning_rate": 0.0002, "loss": 0.5985467433929443, "mean_token_accuracy": 0.7565372809767723, "num_tokens": 15411483.0, "step": 413 }, { "entropy": 0.5959193110466003, "epoch": 3.2099125364431487, "grad_norm": 0.010170173831284046, "learning_rate": 0.0002, "loss": 0.599077045917511, "mean_token_accuracy": 0.756831057369709, "num_tokens": 15448812.0, "step": 414 }, { "entropy": 0.6122774854302406, "epoch": 3.2176870748299318, "grad_norm": 0.00988403894007206, "learning_rate": 0.0002, "loss": 0.6123433113098145, "mean_token_accuracy": 0.7474271655082703, "num_tokens": 15486225.0, "step": 415 }, { "entropy": 0.5967384874820709, "epoch": 3.2254616132167153, "grad_norm": 0.010967456735670567, "learning_rate": 0.0002, "loss": 0.60502028465271, "mean_token_accuracy": 0.75384970754385, "num_tokens": 15523563.0, "step": 416 }, { "entropy": 0.5971691235899925, "epoch": 3.2332361516034984, "grad_norm": 0.009652617387473583, "learning_rate": 0.0002, "loss": 0.596883237361908, "mean_token_accuracy": 0.7563904896378517, "num_tokens": 15561284.0, "step": 417 }, { "entropy": 0.5993461608886719, "epoch": 3.241010689990282, "grad_norm": 0.01028553955256939, "learning_rate": 0.0002, "loss": 0.5969662666320801, "mean_token_accuracy": 0.7561450004577637, "num_tokens": 15598518.0, "step": 418 }, { "entropy": 0.6052126884460449, "epoch": 3.248785228377065, "grad_norm": 0.009491597302258015, "learning_rate": 0.0002, "loss": 0.6018233299255371, "mean_token_accuracy": 0.754707433283329, "num_tokens": 15636077.0, "step": 419 }, { "entropy": 0.5944898948073387, "epoch": 3.256559766763848, "grad_norm": 0.009509161114692688, "learning_rate": 0.0002, "loss": 0.598441481590271, "mean_token_accuracy": 0.7549791261553764, "num_tokens": 15673148.0, "step": 420 }, { "entropy": 0.5968391299247742, "epoch": 3.2643343051506317, "grad_norm": 0.012232691049575806, "learning_rate": 0.0002, "loss": 0.6061251163482666, "mean_token_accuracy": 0.7526469007134438, "num_tokens": 15710778.0, "step": 421 }, { "entropy": 0.6134240105748177, "epoch": 3.272108843537415, "grad_norm": 0.00959104672074318, "learning_rate": 0.0002, "loss": 0.6182757616043091, "mean_token_accuracy": 0.7455755323171616, "num_tokens": 15748509.0, "step": 422 }, { "entropy": 0.6232677772641182, "epoch": 3.2798833819241984, "grad_norm": 0.008630241267383099, "learning_rate": 0.0002, "loss": 0.6197680234909058, "mean_token_accuracy": 0.7470053881406784, "num_tokens": 15786160.0, "step": 423 }, { "entropy": 0.613219253718853, "epoch": 3.2876579203109815, "grad_norm": 0.0128620695322752, "learning_rate": 0.0002, "loss": 0.607075572013855, "mean_token_accuracy": 0.7511464059352875, "num_tokens": 15823826.0, "step": 424 }, { "entropy": 0.6041038259863853, "epoch": 3.295432458697765, "grad_norm": 0.011236878111958504, "learning_rate": 0.0002, "loss": 0.6055868864059448, "mean_token_accuracy": 0.7537136226892471, "num_tokens": 15861102.0, "step": 425 }, { "entropy": 0.6037536263465881, "epoch": 3.303206997084548, "grad_norm": 0.01190877053886652, "learning_rate": 0.0002, "loss": 0.6142691373825073, "mean_token_accuracy": 0.7493078485131264, "num_tokens": 15898770.0, "step": 426 }, { "entropy": 0.5997900441288948, "epoch": 3.3109815354713312, "grad_norm": 0.01027680840343237, "learning_rate": 0.0002, "loss": 0.606103777885437, "mean_token_accuracy": 0.7539091035723686, "num_tokens": 15936500.0, "step": 427 }, { "entropy": 0.611216127872467, "epoch": 3.3187560738581148, "grad_norm": 0.011017821729183197, "learning_rate": 0.0002, "loss": 0.6174614429473877, "mean_token_accuracy": 0.7461550533771515, "num_tokens": 15974513.0, "step": 428 }, { "entropy": 0.6048758924007416, "epoch": 3.326530612244898, "grad_norm": 0.010105214081704617, "learning_rate": 0.0002, "loss": 0.6031618118286133, "mean_token_accuracy": 0.7546434104442596, "num_tokens": 16012014.0, "step": 429 }, { "entropy": 0.6172537207603455, "epoch": 3.3343051506316814, "grad_norm": 0.009731764905154705, "learning_rate": 0.0002, "loss": 0.6138004064559937, "mean_token_accuracy": 0.7473105862736702, "num_tokens": 16049595.0, "step": 430 }, { "entropy": 0.601245328783989, "epoch": 3.3420796890184645, "grad_norm": 0.010152102448046207, "learning_rate": 0.0002, "loss": 0.6028028726577759, "mean_token_accuracy": 0.7536987066268921, "num_tokens": 16087175.0, "step": 431 }, { "entropy": 0.6049877479672432, "epoch": 3.3498542274052476, "grad_norm": 0.008624416776001453, "learning_rate": 0.0002, "loss": 0.6070842742919922, "mean_token_accuracy": 0.7543686851859093, "num_tokens": 16124434.0, "step": 432 }, { "entropy": 0.6113510951399803, "epoch": 3.357628765792031, "grad_norm": 0.00979162473231554, "learning_rate": 0.0002, "loss": 0.614505410194397, "mean_token_accuracy": 0.7483974099159241, "num_tokens": 16161797.0, "step": 433 }, { "entropy": 0.6149813681840897, "epoch": 3.3654033041788143, "grad_norm": 0.009648281149566174, "learning_rate": 0.0002, "loss": 0.6138153076171875, "mean_token_accuracy": 0.7505435049533844, "num_tokens": 16199386.0, "step": 434 }, { "entropy": 0.6114403232932091, "epoch": 3.373177842565598, "grad_norm": 0.00991707295179367, "learning_rate": 0.0002, "loss": 0.6108669638633728, "mean_token_accuracy": 0.7510098665952682, "num_tokens": 16236951.0, "step": 435 }, { "entropy": 0.6059002429246902, "epoch": 3.380952380952381, "grad_norm": 0.009901657700538635, "learning_rate": 0.0002, "loss": 0.6064650416374207, "mean_token_accuracy": 0.7527595311403275, "num_tokens": 16274203.0, "step": 436 }, { "entropy": 0.6086044162511826, "epoch": 3.388726919339164, "grad_norm": 0.011115623638033867, "learning_rate": 0.0002, "loss": 0.609772801399231, "mean_token_accuracy": 0.7524074539542198, "num_tokens": 16311856.0, "step": 437 }, { "entropy": 0.6069784238934517, "epoch": 3.3965014577259476, "grad_norm": 0.009795066900551319, "learning_rate": 0.0002, "loss": 0.60982745885849, "mean_token_accuracy": 0.7514877542853355, "num_tokens": 16349625.0, "step": 438 }, { "entropy": 0.602266825735569, "epoch": 3.4042759961127307, "grad_norm": 0.009143724106252193, "learning_rate": 0.0002, "loss": 0.6032094359397888, "mean_token_accuracy": 0.7547830194234848, "num_tokens": 16387358.0, "step": 439 }, { "entropy": 0.5899055674672127, "epoch": 3.4120505344995142, "grad_norm": 0.009034923277795315, "learning_rate": 0.0002, "loss": 0.5931638479232788, "mean_token_accuracy": 0.7577911838889122, "num_tokens": 16424225.0, "step": 440 }, { "entropy": 0.5923598855733871, "epoch": 3.4198250728862973, "grad_norm": 0.00976620800793171, "learning_rate": 0.0002, "loss": 0.5963320732116699, "mean_token_accuracy": 0.7556646093726158, "num_tokens": 16461363.0, "step": 441 }, { "entropy": 0.6050904020667076, "epoch": 3.427599611273081, "grad_norm": 0.010530819185078144, "learning_rate": 0.0002, "loss": 0.6116576194763184, "mean_token_accuracy": 0.7500759586691856, "num_tokens": 16498597.0, "step": 442 }, { "entropy": 0.6166655048727989, "epoch": 3.435374149659864, "grad_norm": 0.009784851223230362, "learning_rate": 0.0002, "loss": 0.6191204786300659, "mean_token_accuracy": 0.7476971745491028, "num_tokens": 16535886.0, "step": 443 }, { "entropy": 0.6059679165482521, "epoch": 3.443148688046647, "grad_norm": 0.009777678176760674, "learning_rate": 0.0002, "loss": 0.600814700126648, "mean_token_accuracy": 0.7545428648591042, "num_tokens": 16573204.0, "step": 444 }, { "entropy": 0.6082785129547119, "epoch": 3.4509232264334306, "grad_norm": 0.009606909938156605, "learning_rate": 0.0002, "loss": 0.6063122153282166, "mean_token_accuracy": 0.7535424381494522, "num_tokens": 16610341.0, "step": 445 }, { "entropy": 0.6118370518088341, "epoch": 3.4586977648202137, "grad_norm": 0.009755875915288925, "learning_rate": 0.0002, "loss": 0.6115654706954956, "mean_token_accuracy": 0.7514548450708389, "num_tokens": 16648078.0, "step": 446 }, { "entropy": 0.5936368778347969, "epoch": 3.466472303206997, "grad_norm": 0.011094003915786743, "learning_rate": 0.0002, "loss": 0.6031495332717896, "mean_token_accuracy": 0.75296650826931, "num_tokens": 16684979.0, "step": 447 }, { "entropy": 0.5946005135774612, "epoch": 3.4742468415937804, "grad_norm": 0.00817946158349514, "learning_rate": 0.0002, "loss": 0.597072184085846, "mean_token_accuracy": 0.756522886455059, "num_tokens": 16722537.0, "step": 448 }, { "entropy": 0.6108994483947754, "epoch": 3.4820213799805635, "grad_norm": 0.0094683188945055, "learning_rate": 0.0002, "loss": 0.6126965284347534, "mean_token_accuracy": 0.750556543469429, "num_tokens": 16759490.0, "step": 449 }, { "entropy": 0.6224265471100807, "epoch": 3.489795918367347, "grad_norm": 0.009895196184515953, "learning_rate": 0.0002, "loss": 0.6202942132949829, "mean_token_accuracy": 0.7480411902070045, "num_tokens": 16797135.0, "step": 450 }, { "entropy": 0.597562313079834, "epoch": 3.49757045675413, "grad_norm": 0.00880007166415453, "learning_rate": 0.0002, "loss": 0.5973268151283264, "mean_token_accuracy": 0.7553020343184471, "num_tokens": 16834270.0, "step": 451 }, { "entropy": 0.5932627841830254, "epoch": 3.5053449951409137, "grad_norm": 0.009338297881186008, "learning_rate": 0.0002, "loss": 0.5983443856239319, "mean_token_accuracy": 0.7540717199444771, "num_tokens": 16871670.0, "step": 452 }, { "entropy": 0.603311225771904, "epoch": 3.513119533527697, "grad_norm": 0.009173530153930187, "learning_rate": 0.0002, "loss": 0.6072041988372803, "mean_token_accuracy": 0.752394326031208, "num_tokens": 16909221.0, "step": 453 }, { "entropy": 0.6008370220661163, "epoch": 3.52089407191448, "grad_norm": 0.009413264691829681, "learning_rate": 0.0002, "loss": 0.6025704145431519, "mean_token_accuracy": 0.7541562095284462, "num_tokens": 16946802.0, "step": 454 }, { "entropy": 0.6156598478555679, "epoch": 3.5286686103012634, "grad_norm": 0.009066940285265446, "learning_rate": 0.0002, "loss": 0.6163049936294556, "mean_token_accuracy": 0.7471535354852676, "num_tokens": 16983926.0, "step": 455 }, { "entropy": 0.6066097542643547, "epoch": 3.5364431486880465, "grad_norm": 0.008060373365879059, "learning_rate": 0.0002, "loss": 0.6057984828948975, "mean_token_accuracy": 0.753935232758522, "num_tokens": 17021676.0, "step": 456 }, { "entropy": 0.5982315316796303, "epoch": 3.54421768707483, "grad_norm": 0.008438881486654282, "learning_rate": 0.0002, "loss": 0.6000136137008667, "mean_token_accuracy": 0.7557498961687088, "num_tokens": 17059698.0, "step": 457 }, { "entropy": 0.6007475033402443, "epoch": 3.551992225461613, "grad_norm": 0.008833416737616062, "learning_rate": 0.0002, "loss": 0.6044740676879883, "mean_token_accuracy": 0.7540414854884148, "num_tokens": 17096952.0, "step": 458 }, { "entropy": 0.6120948642492294, "epoch": 3.5597667638483967, "grad_norm": 0.010080665349960327, "learning_rate": 0.0002, "loss": 0.6188148260116577, "mean_token_accuracy": 0.7483313381671906, "num_tokens": 17134663.0, "step": 459 }, { "entropy": 0.6083438396453857, "epoch": 3.56754130223518, "grad_norm": 0.009289734996855259, "learning_rate": 0.0002, "loss": 0.6083492636680603, "mean_token_accuracy": 0.7500124499201775, "num_tokens": 17172169.0, "step": 460 }, { "entropy": 0.6143280863761902, "epoch": 3.575315840621963, "grad_norm": 0.010136788710951805, "learning_rate": 0.0002, "loss": 0.6146470308303833, "mean_token_accuracy": 0.749954454600811, "num_tokens": 17209481.0, "step": 461 }, { "entropy": 0.6075241789221764, "epoch": 3.5830903790087465, "grad_norm": 0.008481534197926521, "learning_rate": 0.0002, "loss": 0.6094347238540649, "mean_token_accuracy": 0.7524155974388123, "num_tokens": 17246466.0, "step": 462 }, { "entropy": 0.6080920621752739, "epoch": 3.5908649173955296, "grad_norm": 0.009619004093110561, "learning_rate": 0.0002, "loss": 0.6094264984130859, "mean_token_accuracy": 0.752539336681366, "num_tokens": 17284014.0, "step": 463 }, { "entropy": 0.5951874181628227, "epoch": 3.5986394557823127, "grad_norm": 0.010971908457577229, "learning_rate": 0.0002, "loss": 0.5968849062919617, "mean_token_accuracy": 0.7571029588580132, "num_tokens": 17321447.0, "step": 464 }, { "entropy": 0.600244015455246, "epoch": 3.6064139941690962, "grad_norm": 0.009995541535317898, "learning_rate": 0.0002, "loss": 0.6033259630203247, "mean_token_accuracy": 0.7534294128417969, "num_tokens": 17358802.0, "step": 465 }, { "entropy": 0.6006019562482834, "epoch": 3.6141885325558794, "grad_norm": 0.008752602152526379, "learning_rate": 0.0002, "loss": 0.6017124652862549, "mean_token_accuracy": 0.756244920194149, "num_tokens": 17396188.0, "step": 466 }, { "entropy": 0.6169783622026443, "epoch": 3.621963070942663, "grad_norm": 0.010406076908111572, "learning_rate": 0.0002, "loss": 0.6129188537597656, "mean_token_accuracy": 0.7500476241111755, "num_tokens": 17433577.0, "step": 467 }, { "entropy": 0.6030160784721375, "epoch": 3.629737609329446, "grad_norm": 0.009500440210103989, "learning_rate": 0.0002, "loss": 0.6009221076965332, "mean_token_accuracy": 0.7557852789759636, "num_tokens": 17471102.0, "step": 468 }, { "entropy": 0.5835254713892937, "epoch": 3.6375121477162295, "grad_norm": 0.009339805692434311, "learning_rate": 0.0002, "loss": 0.5876451730728149, "mean_token_accuracy": 0.7601824253797531, "num_tokens": 17508438.0, "step": 469 }, { "entropy": 0.6057174652814865, "epoch": 3.6452866861030127, "grad_norm": 0.010681871324777603, "learning_rate": 0.0002, "loss": 0.6165672540664673, "mean_token_accuracy": 0.7476890683174133, "num_tokens": 17546176.0, "step": 470 }, { "entropy": 0.6023501753807068, "epoch": 3.6530612244897958, "grad_norm": 0.009493213146924973, "learning_rate": 0.0002, "loss": 0.6091412305831909, "mean_token_accuracy": 0.7539057731628418, "num_tokens": 17583501.0, "step": 471 }, { "entropy": 0.6135850101709366, "epoch": 3.6608357628765793, "grad_norm": 0.009873135015368462, "learning_rate": 0.0002, "loss": 0.6167327165603638, "mean_token_accuracy": 0.7497850060462952, "num_tokens": 17620694.0, "step": 472 }, { "entropy": 0.6023069024085999, "epoch": 3.6686103012633624, "grad_norm": 0.009261439554393291, "learning_rate": 0.0002, "loss": 0.5992604494094849, "mean_token_accuracy": 0.7568845972418785, "num_tokens": 17657846.0, "step": 473 }, { "entropy": 0.6220817118883133, "epoch": 3.6763848396501455, "grad_norm": 0.008002927526831627, "learning_rate": 0.0002, "loss": 0.6206220984458923, "mean_token_accuracy": 0.7471845746040344, "num_tokens": 17695493.0, "step": 474 }, { "entropy": 0.6081802695989609, "epoch": 3.684159378036929, "grad_norm": 0.008587166666984558, "learning_rate": 0.0002, "loss": 0.607234001159668, "mean_token_accuracy": 0.755810484290123, "num_tokens": 17732856.0, "step": 475 }, { "entropy": 0.6025589928030968, "epoch": 3.6919339164237126, "grad_norm": 0.009315953589975834, "learning_rate": 0.0002, "loss": 0.6054584383964539, "mean_token_accuracy": 0.7516716048121452, "num_tokens": 17769974.0, "step": 476 }, { "entropy": 0.6041041016578674, "epoch": 3.6997084548104957, "grad_norm": 0.009252023883163929, "learning_rate": 0.0002, "loss": 0.6035861968994141, "mean_token_accuracy": 0.754462331533432, "num_tokens": 17807234.0, "step": 477 }, { "entropy": 0.6150568872690201, "epoch": 3.707482993197279, "grad_norm": 0.009806321002542973, "learning_rate": 0.0002, "loss": 0.6143267154693604, "mean_token_accuracy": 0.7500679716467857, "num_tokens": 17844713.0, "step": 478 }, { "entropy": 0.6017017439007759, "epoch": 3.7152575315840624, "grad_norm": 0.009355618618428707, "learning_rate": 0.0002, "loss": 0.6050205230712891, "mean_token_accuracy": 0.7535286843776703, "num_tokens": 17882167.0, "step": 479 }, { "entropy": 0.6020700857043266, "epoch": 3.7230320699708455, "grad_norm": 0.010259266011416912, "learning_rate": 0.0002, "loss": 0.6069679856300354, "mean_token_accuracy": 0.7521628364920616, "num_tokens": 17919373.0, "step": 480 }, { "entropy": 0.6041392460465431, "epoch": 3.7308066083576286, "grad_norm": 0.008957406505942345, "learning_rate": 0.0002, "loss": 0.6065245270729065, "mean_token_accuracy": 0.7511508986353874, "num_tokens": 17956544.0, "step": 481 }, { "entropy": 0.6143322214484215, "epoch": 3.738581146744412, "grad_norm": 0.010185849852859974, "learning_rate": 0.0002, "loss": 0.6167340278625488, "mean_token_accuracy": 0.7486473768949509, "num_tokens": 17993752.0, "step": 482 }, { "entropy": 0.597200371325016, "epoch": 3.746355685131195, "grad_norm": 0.009210821241140366, "learning_rate": 0.0002, "loss": 0.5978806018829346, "mean_token_accuracy": 0.7557302191853523, "num_tokens": 18031025.0, "step": 483 }, { "entropy": 0.6069202646613121, "epoch": 3.7541302235179788, "grad_norm": 0.011117368005216122, "learning_rate": 0.0002, "loss": 0.6108845472335815, "mean_token_accuracy": 0.7496053129434586, "num_tokens": 18067927.0, "step": 484 }, { "entropy": 0.6041139885783195, "epoch": 3.761904761904762, "grad_norm": 0.00938522256910801, "learning_rate": 0.0002, "loss": 0.6076387166976929, "mean_token_accuracy": 0.7511148899793625, "num_tokens": 18105521.0, "step": 485 }, { "entropy": 0.5986451655626297, "epoch": 3.7696793002915454, "grad_norm": 0.009973375126719475, "learning_rate": 0.0002, "loss": 0.6053519248962402, "mean_token_accuracy": 0.7534126862883568, "num_tokens": 18142635.0, "step": 486 }, { "entropy": 0.6009933426976204, "epoch": 3.7774538386783285, "grad_norm": 0.008744049817323685, "learning_rate": 0.0002, "loss": 0.6009329557418823, "mean_token_accuracy": 0.7565900459885597, "num_tokens": 18179737.0, "step": 487 }, { "entropy": 0.6145603656768799, "epoch": 3.7852283770651116, "grad_norm": 0.008431525900959969, "learning_rate": 0.0002, "loss": 0.6102414727210999, "mean_token_accuracy": 0.7497778162360191, "num_tokens": 18216997.0, "step": 488 }, { "entropy": 0.6055081114172935, "epoch": 3.793002915451895, "grad_norm": 0.00999277364462614, "learning_rate": 0.0002, "loss": 0.6034255623817444, "mean_token_accuracy": 0.7561624273657799, "num_tokens": 18254319.0, "step": 489 }, { "entropy": 0.5926950201392174, "epoch": 3.8007774538386783, "grad_norm": 0.008595049381256104, "learning_rate": 0.0002, "loss": 0.5922105312347412, "mean_token_accuracy": 0.7585625573992729, "num_tokens": 18291224.0, "step": 490 }, { "entropy": 0.6234352439641953, "epoch": 3.8085519922254614, "grad_norm": 0.009778706356883049, "learning_rate": 0.0002, "loss": 0.628953754901886, "mean_token_accuracy": 0.743121363222599, "num_tokens": 18328744.0, "step": 491 }, { "entropy": 0.6095947250723839, "epoch": 3.816326530612245, "grad_norm": 0.009355447255074978, "learning_rate": 0.0002, "loss": 0.6148620843887329, "mean_token_accuracy": 0.7512015551328659, "num_tokens": 18366284.0, "step": 492 }, { "entropy": 0.6000761389732361, "epoch": 3.824101068999028, "grad_norm": 0.00857703946530819, "learning_rate": 0.0002, "loss": 0.604392409324646, "mean_token_accuracy": 0.7549523860216141, "num_tokens": 18403721.0, "step": 493 }, { "entropy": 0.5995704010128975, "epoch": 3.8318756073858116, "grad_norm": 0.010483372025191784, "learning_rate": 0.0002, "loss": 0.6008812785148621, "mean_token_accuracy": 0.7550973892211914, "num_tokens": 18440931.0, "step": 494 }, { "entropy": 0.6065568849444389, "epoch": 3.8396501457725947, "grad_norm": 0.00975153036415577, "learning_rate": 0.0002, "loss": 0.6107536554336548, "mean_token_accuracy": 0.7495853081345558, "num_tokens": 18478285.0, "step": 495 }, { "entropy": 0.6092389151453972, "epoch": 3.847424684159378, "grad_norm": 0.008589878678321838, "learning_rate": 0.0002, "loss": 0.6096630096435547, "mean_token_accuracy": 0.7536827027797699, "num_tokens": 18515709.0, "step": 496 }, { "entropy": 0.5968381017446518, "epoch": 3.8551992225461613, "grad_norm": 0.011193851009011269, "learning_rate": 0.0002, "loss": 0.6000962257385254, "mean_token_accuracy": 0.7573477849364281, "num_tokens": 18553032.0, "step": 497 }, { "entropy": 0.6045369654893875, "epoch": 3.8629737609329444, "grad_norm": 0.009280527010560036, "learning_rate": 0.0002, "loss": 0.6028830409049988, "mean_token_accuracy": 0.7542475759983063, "num_tokens": 18590308.0, "step": 498 }, { "entropy": 0.6031981706619263, "epoch": 3.870748299319728, "grad_norm": 0.009086862206459045, "learning_rate": 0.0002, "loss": 0.6040035486221313, "mean_token_accuracy": 0.7532067000865936, "num_tokens": 18627503.0, "step": 499 }, { "entropy": 0.6000340953469276, "epoch": 3.878522837706511, "grad_norm": 0.008906064555048943, "learning_rate": 0.0002, "loss": 0.6016078591346741, "mean_token_accuracy": 0.7553933039307594, "num_tokens": 18664999.0, "step": 500 }, { "entropy": 0.613756813108921, "epoch": 3.8862973760932946, "grad_norm": 0.00961924996227026, "learning_rate": 0.0002, "loss": 0.6131439208984375, "mean_token_accuracy": 0.7474770769476891, "num_tokens": 18702736.0, "step": 501 }, { "entropy": 0.6073272302746773, "epoch": 3.8940719144800777, "grad_norm": 0.008611987344920635, "learning_rate": 0.0002, "loss": 0.6086411476135254, "mean_token_accuracy": 0.7537659332156181, "num_tokens": 18740002.0, "step": 502 }, { "entropy": 0.5979632884263992, "epoch": 3.9018464528668613, "grad_norm": 0.008601277135312557, "learning_rate": 0.0002, "loss": 0.5986984968185425, "mean_token_accuracy": 0.7558256238698959, "num_tokens": 18777409.0, "step": 503 }, { "entropy": 0.5990572273731232, "epoch": 3.9096209912536444, "grad_norm": 0.009787015616893768, "learning_rate": 0.0002, "loss": 0.5969674587249756, "mean_token_accuracy": 0.7572850733995438, "num_tokens": 18814832.0, "step": 504 }, { "entropy": 0.5952424928545952, "epoch": 3.9173955296404275, "grad_norm": 0.009869958274066448, "learning_rate": 0.0002, "loss": 0.600977897644043, "mean_token_accuracy": 0.7555051743984222, "num_tokens": 18852288.0, "step": 505 }, { "entropy": 0.5953851416707039, "epoch": 3.925170068027211, "grad_norm": 0.009635512717068195, "learning_rate": 0.0002, "loss": 0.5988470315933228, "mean_token_accuracy": 0.7552962228655815, "num_tokens": 18889544.0, "step": 506 }, { "entropy": 0.6188566163182259, "epoch": 3.932944606413994, "grad_norm": 0.00981516670435667, "learning_rate": 0.0002, "loss": 0.6207889914512634, "mean_token_accuracy": 0.748513400554657, "num_tokens": 18927252.0, "step": 507 }, { "entropy": 0.6106720492243767, "epoch": 3.9407191448007772, "grad_norm": 0.011930068954825401, "learning_rate": 0.0002, "loss": 0.6130895614624023, "mean_token_accuracy": 0.7500510811805725, "num_tokens": 18964681.0, "step": 508 }, { "entropy": 0.6134953126311302, "epoch": 3.9484936831875608, "grad_norm": 0.009485729970037937, "learning_rate": 0.0002, "loss": 0.6170802116394043, "mean_token_accuracy": 0.7490968182682991, "num_tokens": 19002066.0, "step": 509 }, { "entropy": 0.6209791451692581, "epoch": 3.956268221574344, "grad_norm": 0.009478907100856304, "learning_rate": 0.0002, "loss": 0.6176908612251282, "mean_token_accuracy": 0.7488641366362572, "num_tokens": 19039553.0, "step": 510 }, { "entropy": 0.6174532473087311, "epoch": 3.9640427599611274, "grad_norm": 0.010146988555788994, "learning_rate": 0.0002, "loss": 0.6160500049591064, "mean_token_accuracy": 0.7503278478980064, "num_tokens": 19076777.0, "step": 511 }, { "entropy": 0.6139644980430603, "epoch": 3.9718172983479105, "grad_norm": 0.009649143554270267, "learning_rate": 0.0002, "loss": 0.6151527166366577, "mean_token_accuracy": 0.7500214949250221, "num_tokens": 19114295.0, "step": 512 }, { "entropy": 0.5903387889266014, "epoch": 3.979591836734694, "grad_norm": 0.009517780505120754, "learning_rate": 0.0002, "loss": 0.5949221253395081, "mean_token_accuracy": 0.7585930302739143, "num_tokens": 19151608.0, "step": 513 }, { "entropy": 0.60362558811903, "epoch": 3.987366375121477, "grad_norm": 0.008633180521428585, "learning_rate": 0.0002, "loss": 0.606721818447113, "mean_token_accuracy": 0.7524262145161629, "num_tokens": 19189092.0, "step": 514 }, { "entropy": 0.6161174476146698, "epoch": 3.9951409135082603, "grad_norm": 0.00904986634850502, "learning_rate": 0.0002, "loss": 0.6170212030410767, "mean_token_accuracy": 0.7481908574700356, "num_tokens": 19226930.0, "step": 515 }, { "entropy": 0.6157908320426941, "epoch": 4.0, "grad_norm": 0.011043760925531387, "learning_rate": 0.0002, "loss": 0.6197408437728882, "mean_token_accuracy": 0.7473827481269837, "num_tokens": 19250261.0, "step": 516 }, { "entropy": 0.5984989553689957, "epoch": 4.0077745383867835, "grad_norm": 0.010571295395493507, "learning_rate": 0.0002, "loss": 0.5962023138999939, "mean_token_accuracy": 0.7551586180925369, "num_tokens": 19287781.0, "step": 517 }, { "entropy": 0.5755362883210182, "epoch": 4.015549076773566, "grad_norm": 0.01085303071886301, "learning_rate": 0.0002, "loss": 0.5781339406967163, "mean_token_accuracy": 0.763518862426281, "num_tokens": 19324763.0, "step": 518 }, { "entropy": 0.5975531563162804, "epoch": 4.02332361516035, "grad_norm": 0.009798814542591572, "learning_rate": 0.0002, "loss": 0.6017999649047852, "mean_token_accuracy": 0.7532066255807877, "num_tokens": 19362451.0, "step": 519 }, { "entropy": 0.5838107392191887, "epoch": 4.031098153547133, "grad_norm": 0.011370974592864513, "learning_rate": 0.0002, "loss": 0.5857977867126465, "mean_token_accuracy": 0.7589215487241745, "num_tokens": 19399597.0, "step": 520 }, { "entropy": 0.586229719221592, "epoch": 4.038872691933917, "grad_norm": 0.010519232600927353, "learning_rate": 0.0002, "loss": 0.5870205760002136, "mean_token_accuracy": 0.7586957290768623, "num_tokens": 19436947.0, "step": 521 }, { "entropy": 0.5909631699323654, "epoch": 4.0466472303206995, "grad_norm": 0.011675548739731312, "learning_rate": 0.0002, "loss": 0.5927350521087646, "mean_token_accuracy": 0.7586767747998238, "num_tokens": 19474464.0, "step": 522 }, { "entropy": 0.602616548538208, "epoch": 4.054421768707483, "grad_norm": 0.01183371152728796, "learning_rate": 0.0002, "loss": 0.6010576486587524, "mean_token_accuracy": 0.753461204469204, "num_tokens": 19512364.0, "step": 523 }, { "entropy": 0.5877483561635017, "epoch": 4.062196307094267, "grad_norm": 0.011604937724769115, "learning_rate": 0.0002, "loss": 0.5869612693786621, "mean_token_accuracy": 0.7605117782950401, "num_tokens": 19549629.0, "step": 524 }, { "entropy": 0.5913394093513489, "epoch": 4.069970845481049, "grad_norm": 0.010066917166113853, "learning_rate": 0.0002, "loss": 0.5947997570037842, "mean_token_accuracy": 0.755763366818428, "num_tokens": 19586996.0, "step": 525 }, { "entropy": 0.5896845906972885, "epoch": 4.077745383867833, "grad_norm": 0.013865236192941666, "learning_rate": 0.0002, "loss": 0.5975737571716309, "mean_token_accuracy": 0.756596714258194, "num_tokens": 19624454.0, "step": 526 }, { "entropy": 0.6071945577859879, "epoch": 4.085519922254616, "grad_norm": 0.01125173456966877, "learning_rate": 0.0002, "loss": 0.6075310707092285, "mean_token_accuracy": 0.7516418322920799, "num_tokens": 19662369.0, "step": 527 }, { "entropy": 0.6004839465022087, "epoch": 4.093294460641399, "grad_norm": 0.012244274839758873, "learning_rate": 0.0002, "loss": 0.5988795161247253, "mean_token_accuracy": 0.7533307895064354, "num_tokens": 19699833.0, "step": 528 }, { "entropy": 0.5805928781628609, "epoch": 4.101068999028183, "grad_norm": 0.012553567998111248, "learning_rate": 0.0002, "loss": 0.5836637616157532, "mean_token_accuracy": 0.7613400369882584, "num_tokens": 19736626.0, "step": 529 }, { "entropy": 0.5802028924226761, "epoch": 4.108843537414966, "grad_norm": 0.013091178610920906, "learning_rate": 0.0002, "loss": 0.5839430093765259, "mean_token_accuracy": 0.7619325369596481, "num_tokens": 19773772.0, "step": 530 }, { "entropy": 0.5931153893470764, "epoch": 4.11661807580175, "grad_norm": 0.0117764538154006, "learning_rate": 0.0002, "loss": 0.598299503326416, "mean_token_accuracy": 0.755822129547596, "num_tokens": 19810974.0, "step": 531 }, { "entropy": 0.6081870496273041, "epoch": 4.124392614188532, "grad_norm": 0.013240421190857887, "learning_rate": 0.0002, "loss": 0.6058256030082703, "mean_token_accuracy": 0.7531123831868172, "num_tokens": 19848433.0, "step": 532 }, { "entropy": 0.6002762466669083, "epoch": 4.132167152575316, "grad_norm": 0.010874156840145588, "learning_rate": 0.0002, "loss": 0.5934455990791321, "mean_token_accuracy": 0.7567582130432129, "num_tokens": 19885930.0, "step": 533 }, { "entropy": 0.604529857635498, "epoch": 4.139941690962099, "grad_norm": 0.011289739049971104, "learning_rate": 0.0002, "loss": 0.6058647632598877, "mean_token_accuracy": 0.7521885484457016, "num_tokens": 19923130.0, "step": 534 }, { "entropy": 0.5959961265325546, "epoch": 4.147716229348882, "grad_norm": 0.0105770044028759, "learning_rate": 0.0002, "loss": 0.5998325347900391, "mean_token_accuracy": 0.7545555010437965, "num_tokens": 19960651.0, "step": 535 }, { "entropy": 0.6115074902772903, "epoch": 4.155490767735666, "grad_norm": 0.01272744033485651, "learning_rate": 0.0002, "loss": 0.6133629083633423, "mean_token_accuracy": 0.7504753991961479, "num_tokens": 19998458.0, "step": 536 }, { "entropy": 0.5959336087107658, "epoch": 4.163265306122449, "grad_norm": 0.01114166434854269, "learning_rate": 0.0002, "loss": 0.5921066403388977, "mean_token_accuracy": 0.7599503472447395, "num_tokens": 20035742.0, "step": 537 }, { "entropy": 0.6055325567722321, "epoch": 4.171039844509233, "grad_norm": 0.01163046807050705, "learning_rate": 0.0002, "loss": 0.6048938035964966, "mean_token_accuracy": 0.7535717412829399, "num_tokens": 20073263.0, "step": 538 }, { "entropy": 0.5937555730342865, "epoch": 4.178814382896015, "grad_norm": 0.010925386101007462, "learning_rate": 0.0002, "loss": 0.5978741645812988, "mean_token_accuracy": 0.7580423355102539, "num_tokens": 20110930.0, "step": 539 }, { "entropy": 0.6025584638118744, "epoch": 4.186588921282799, "grad_norm": 0.013231265358626842, "learning_rate": 0.0002, "loss": 0.6098158955574036, "mean_token_accuracy": 0.7506869807839394, "num_tokens": 20148878.0, "step": 540 }, { "entropy": 0.5955850780010223, "epoch": 4.1943634596695825, "grad_norm": 0.01381654478609562, "learning_rate": 0.0002, "loss": 0.6050733327865601, "mean_token_accuracy": 0.7540115043520927, "num_tokens": 20186590.0, "step": 541 }, { "entropy": 0.6100573241710663, "epoch": 4.202137998056365, "grad_norm": 0.01217405591160059, "learning_rate": 0.0002, "loss": 0.6091620922088623, "mean_token_accuracy": 0.7501495629549026, "num_tokens": 20224026.0, "step": 542 }, { "entropy": 0.6055784001946449, "epoch": 4.209912536443149, "grad_norm": 0.01034702267497778, "learning_rate": 0.0002, "loss": 0.6047437191009521, "mean_token_accuracy": 0.7533470839262009, "num_tokens": 20261538.0, "step": 543 }, { "entropy": 0.5968894883990288, "epoch": 4.217687074829932, "grad_norm": 0.013704034499824047, "learning_rate": 0.0002, "loss": 0.6015293002128601, "mean_token_accuracy": 0.7537187412381172, "num_tokens": 20298484.0, "step": 544 }, { "entropy": 0.5940377935767174, "epoch": 4.225461613216715, "grad_norm": 0.011667119339108467, "learning_rate": 0.0002, "loss": 0.5925427079200745, "mean_token_accuracy": 0.7584238648414612, "num_tokens": 20336353.0, "step": 545 }, { "entropy": 0.6106893792748451, "epoch": 4.233236151603498, "grad_norm": 0.01224418543279171, "learning_rate": 0.0002, "loss": 0.611664891242981, "mean_token_accuracy": 0.7507496625185013, "num_tokens": 20374019.0, "step": 546 }, { "entropy": 0.6042328551411629, "epoch": 4.241010689990282, "grad_norm": 0.01316764671355486, "learning_rate": 0.0002, "loss": 0.6062799096107483, "mean_token_accuracy": 0.7534623667597771, "num_tokens": 20411398.0, "step": 547 }, { "entropy": 0.6105416268110275, "epoch": 4.2487852283770655, "grad_norm": 0.012853113003075123, "learning_rate": 0.0002, "loss": 0.6092797517776489, "mean_token_accuracy": 0.7522982135415077, "num_tokens": 20448672.0, "step": 548 }, { "entropy": 0.5981989204883575, "epoch": 4.256559766763848, "grad_norm": 0.011458336375653744, "learning_rate": 0.0002, "loss": 0.5959842205047607, "mean_token_accuracy": 0.7573426440358162, "num_tokens": 20486126.0, "step": 549 }, { "entropy": 0.5939232558012009, "epoch": 4.264334305150632, "grad_norm": 0.013793280348181725, "learning_rate": 0.0002, "loss": 0.6013151407241821, "mean_token_accuracy": 0.7532796338200569, "num_tokens": 20523335.0, "step": 550 }, { "entropy": 0.5925507992506027, "epoch": 4.272108843537415, "grad_norm": 0.012333216145634651, "learning_rate": 0.0002, "loss": 0.5946025848388672, "mean_token_accuracy": 0.7598577961325645, "num_tokens": 20560754.0, "step": 551 }, { "entropy": 0.6068093478679657, "epoch": 4.279883381924198, "grad_norm": 0.012082048691809177, "learning_rate": 0.0002, "loss": 0.6070762872695923, "mean_token_accuracy": 0.7520242631435394, "num_tokens": 20598383.0, "step": 552 }, { "entropy": 0.5919818729162216, "epoch": 4.2876579203109815, "grad_norm": 0.011891715228557587, "learning_rate": 0.0002, "loss": 0.5928791761398315, "mean_token_accuracy": 0.7572562247514725, "num_tokens": 20635386.0, "step": 553 }, { "entropy": 0.6074100211262703, "epoch": 4.295432458697765, "grad_norm": 0.014123337343335152, "learning_rate": 0.0002, "loss": 0.6073712706565857, "mean_token_accuracy": 0.751992791891098, "num_tokens": 20672892.0, "step": 554 }, { "entropy": 0.5886855572462082, "epoch": 4.303206997084548, "grad_norm": 0.0101819122210145, "learning_rate": 0.0002, "loss": 0.5912100076675415, "mean_token_accuracy": 0.7583736777305603, "num_tokens": 20710466.0, "step": 555 }, { "entropy": 0.6005367860198021, "epoch": 4.310981535471331, "grad_norm": 0.014812132343649864, "learning_rate": 0.0002, "loss": 0.6055353879928589, "mean_token_accuracy": 0.7521958500146866, "num_tokens": 20747846.0, "step": 556 }, { "entropy": 0.5981654673814774, "epoch": 4.318756073858115, "grad_norm": 0.011666829697787762, "learning_rate": 0.0002, "loss": 0.597842276096344, "mean_token_accuracy": 0.7551755681633949, "num_tokens": 20784741.0, "step": 557 }, { "entropy": 0.5991752445697784, "epoch": 4.326530612244898, "grad_norm": 0.012378910556435585, "learning_rate": 0.0002, "loss": 0.5976471900939941, "mean_token_accuracy": 0.7547527700662613, "num_tokens": 20822385.0, "step": 558 }, { "entropy": 0.6060795336961746, "epoch": 4.334305150631681, "grad_norm": 0.012490339577198029, "learning_rate": 0.0002, "loss": 0.6054461002349854, "mean_token_accuracy": 0.7526181265711784, "num_tokens": 20860006.0, "step": 559 }, { "entropy": 0.6072399467229843, "epoch": 4.3420796890184645, "grad_norm": 0.014051525853574276, "learning_rate": 0.0002, "loss": 0.6056400537490845, "mean_token_accuracy": 0.7516866251826286, "num_tokens": 20897385.0, "step": 560 }, { "entropy": 0.5980757176876068, "epoch": 4.349854227405248, "grad_norm": 0.011723170056939125, "learning_rate": 0.0002, "loss": 0.5963304042816162, "mean_token_accuracy": 0.758495531976223, "num_tokens": 20934914.0, "step": 561 }, { "entropy": 0.5847646594047546, "epoch": 4.357628765792031, "grad_norm": 0.013849250972270966, "learning_rate": 0.0002, "loss": 0.5895295143127441, "mean_token_accuracy": 0.7575425952672958, "num_tokens": 20972211.0, "step": 562 }, { "entropy": 0.5863577350974083, "epoch": 4.365403304178814, "grad_norm": 0.01223720796406269, "learning_rate": 0.0002, "loss": 0.5942325592041016, "mean_token_accuracy": 0.7572259679436684, "num_tokens": 21009384.0, "step": 563 }, { "entropy": 0.5997140482068062, "epoch": 4.373177842565598, "grad_norm": 0.014335358515381813, "learning_rate": 0.0002, "loss": 0.6024245619773865, "mean_token_accuracy": 0.7510812431573868, "num_tokens": 21046739.0, "step": 564 }, { "entropy": 0.6076342239975929, "epoch": 4.380952380952381, "grad_norm": 0.012497556395828724, "learning_rate": 0.0002, "loss": 0.6062162518501282, "mean_token_accuracy": 0.7522109970450401, "num_tokens": 21084263.0, "step": 565 }, { "entropy": 0.6001847013831139, "epoch": 4.388726919339164, "grad_norm": 0.010952596552670002, "learning_rate": 0.0002, "loss": 0.6020297408103943, "mean_token_accuracy": 0.753420390188694, "num_tokens": 21121894.0, "step": 566 }, { "entropy": 0.6051000133156776, "epoch": 4.396501457725948, "grad_norm": 0.013345146551728249, "learning_rate": 0.0002, "loss": 0.6103641986846924, "mean_token_accuracy": 0.7505576461553574, "num_tokens": 21159434.0, "step": 567 }, { "entropy": 0.5888576209545135, "epoch": 4.404275996112731, "grad_norm": 0.011659773997962475, "learning_rate": 0.0002, "loss": 0.5904802680015564, "mean_token_accuracy": 0.7587999328970909, "num_tokens": 21197109.0, "step": 568 }, { "entropy": 0.6007365435361862, "epoch": 4.412050534499514, "grad_norm": 0.010827448219060898, "learning_rate": 0.0002, "loss": 0.6000881195068359, "mean_token_accuracy": 0.7543788328766823, "num_tokens": 21234413.0, "step": 569 }, { "entropy": 0.5974342674016953, "epoch": 4.419825072886297, "grad_norm": 0.012830649502575397, "learning_rate": 0.0002, "loss": 0.6020520925521851, "mean_token_accuracy": 0.7534354031085968, "num_tokens": 21271758.0, "step": 570 }, { "entropy": 0.6090180650353432, "epoch": 4.427599611273081, "grad_norm": 0.012071631848812103, "learning_rate": 0.0002, "loss": 0.6067869663238525, "mean_token_accuracy": 0.7518825978040695, "num_tokens": 21309387.0, "step": 571 }, { "entropy": 0.5914840847253799, "epoch": 4.4353741496598635, "grad_norm": 0.013224054127931595, "learning_rate": 0.0002, "loss": 0.595637857913971, "mean_token_accuracy": 0.7551431059837341, "num_tokens": 21346475.0, "step": 572 }, { "entropy": 0.5997625440359116, "epoch": 4.443148688046647, "grad_norm": 0.011799960397183895, "learning_rate": 0.0002, "loss": 0.602319598197937, "mean_token_accuracy": 0.7539779245853424, "num_tokens": 21383957.0, "step": 573 }, { "entropy": 0.6102292612195015, "epoch": 4.450923226433431, "grad_norm": 0.01201384887099266, "learning_rate": 0.0002, "loss": 0.6108826398849487, "mean_token_accuracy": 0.7517506182193756, "num_tokens": 21421332.0, "step": 574 }, { "entropy": 0.5991413816809654, "epoch": 4.458697764820214, "grad_norm": 0.010899091139435768, "learning_rate": 0.0002, "loss": 0.596094012260437, "mean_token_accuracy": 0.7565351948142052, "num_tokens": 21458719.0, "step": 575 }, { "entropy": 0.5933232456445694, "epoch": 4.466472303206997, "grad_norm": 0.010439079254865646, "learning_rate": 0.0002, "loss": 0.5930327773094177, "mean_token_accuracy": 0.7583755627274513, "num_tokens": 21496264.0, "step": 576 }, { "entropy": 0.6057801619172096, "epoch": 4.47424684159378, "grad_norm": 0.011234867386519909, "learning_rate": 0.0002, "loss": 0.6073678135871887, "mean_token_accuracy": 0.7530662715435028, "num_tokens": 21533621.0, "step": 577 }, { "entropy": 0.6064127087593079, "epoch": 4.482021379980564, "grad_norm": 0.01104860007762909, "learning_rate": 0.0002, "loss": 0.6121537685394287, "mean_token_accuracy": 0.7498331218957901, "num_tokens": 21570804.0, "step": 578 }, { "entropy": 0.5948187559843063, "epoch": 4.489795918367347, "grad_norm": 0.01251922082155943, "learning_rate": 0.0002, "loss": 0.598996102809906, "mean_token_accuracy": 0.7545123025774956, "num_tokens": 21607975.0, "step": 579 }, { "entropy": 0.614658959209919, "epoch": 4.49757045675413, "grad_norm": 0.010701852850615978, "learning_rate": 0.0002, "loss": 0.6137805581092834, "mean_token_accuracy": 0.7465793862938881, "num_tokens": 21645423.0, "step": 580 }, { "entropy": 0.5894118696451187, "epoch": 4.505344995140914, "grad_norm": 0.012251303531229496, "learning_rate": 0.0002, "loss": 0.5877728462219238, "mean_token_accuracy": 0.75811368227005, "num_tokens": 21682411.0, "step": 581 }, { "entropy": 0.6109742075204849, "epoch": 4.513119533527696, "grad_norm": 0.011500229127705097, "learning_rate": 0.0002, "loss": 0.6115055084228516, "mean_token_accuracy": 0.7521626874804497, "num_tokens": 21720167.0, "step": 582 }, { "entropy": 0.591577798128128, "epoch": 4.52089407191448, "grad_norm": 0.011309963651001453, "learning_rate": 0.0002, "loss": 0.5981800556182861, "mean_token_accuracy": 0.7563935667276382, "num_tokens": 21758012.0, "step": 583 }, { "entropy": 0.6063844040036201, "epoch": 4.528668610301263, "grad_norm": 0.014559866860508919, "learning_rate": 0.0002, "loss": 0.6146761178970337, "mean_token_accuracy": 0.7492925748229027, "num_tokens": 21795528.0, "step": 584 }, { "entropy": 0.5918325483798981, "epoch": 4.536443148688047, "grad_norm": 0.011580277234315872, "learning_rate": 0.0002, "loss": 0.5908594131469727, "mean_token_accuracy": 0.7565957456827164, "num_tokens": 21833000.0, "step": 585 }, { "entropy": 0.612893208861351, "epoch": 4.54421768707483, "grad_norm": 0.01330646313726902, "learning_rate": 0.0002, "loss": 0.6055165529251099, "mean_token_accuracy": 0.7545250579714775, "num_tokens": 21870418.0, "step": 586 }, { "entropy": 0.5842209830880165, "epoch": 4.551992225461613, "grad_norm": 0.012110188603401184, "learning_rate": 0.0002, "loss": 0.5849249362945557, "mean_token_accuracy": 0.7618754804134369, "num_tokens": 21907507.0, "step": 587 }, { "entropy": 0.6068574264645576, "epoch": 4.559766763848397, "grad_norm": 0.012672025710344315, "learning_rate": 0.0002, "loss": 0.6145685911178589, "mean_token_accuracy": 0.750059075653553, "num_tokens": 21944988.0, "step": 588 }, { "entropy": 0.5868222415447235, "epoch": 4.567541302235179, "grad_norm": 0.011733310297131538, "learning_rate": 0.0002, "loss": 0.5891362428665161, "mean_token_accuracy": 0.7605921477079391, "num_tokens": 21982183.0, "step": 589 }, { "entropy": 0.6040458679199219, "epoch": 4.575315840621963, "grad_norm": 0.010982259176671505, "learning_rate": 0.0002, "loss": 0.6011037230491638, "mean_token_accuracy": 0.7543822079896927, "num_tokens": 22019570.0, "step": 590 }, { "entropy": 0.5989029258489609, "epoch": 4.5830903790087465, "grad_norm": 0.012942496687173843, "learning_rate": 0.0002, "loss": 0.5922666788101196, "mean_token_accuracy": 0.7587461397051811, "num_tokens": 22056831.0, "step": 591 }, { "entropy": 0.5930005833506584, "epoch": 4.59086491739553, "grad_norm": 0.010408308357000351, "learning_rate": 0.0002, "loss": 0.5919668078422546, "mean_token_accuracy": 0.7574074566364288, "num_tokens": 22094356.0, "step": 592 }, { "entropy": 0.5869537368416786, "epoch": 4.598639455782313, "grad_norm": 0.013977079652249813, "learning_rate": 0.0002, "loss": 0.5976507663726807, "mean_token_accuracy": 0.7580091804265976, "num_tokens": 22131838.0, "step": 593 }, { "entropy": 0.5787304788827896, "epoch": 4.606413994169096, "grad_norm": 0.013945071026682854, "learning_rate": 0.0002, "loss": 0.5908917188644409, "mean_token_accuracy": 0.7597628980875015, "num_tokens": 22169036.0, "step": 594 }, { "entropy": 0.6027527749538422, "epoch": 4.61418853255588, "grad_norm": 0.00982499960809946, "learning_rate": 0.0002, "loss": 0.6021907925605774, "mean_token_accuracy": 0.7546107098460197, "num_tokens": 22206352.0, "step": 595 }, { "entropy": 0.6077359542250633, "epoch": 4.6219630709426625, "grad_norm": 0.011836841702461243, "learning_rate": 0.0002, "loss": 0.6049139499664307, "mean_token_accuracy": 0.7528544068336487, "num_tokens": 22243663.0, "step": 596 }, { "entropy": 0.5822278633713722, "epoch": 4.629737609329446, "grad_norm": 0.011577391996979713, "learning_rate": 0.0002, "loss": 0.5828737020492554, "mean_token_accuracy": 0.7616033405065536, "num_tokens": 22281074.0, "step": 597 }, { "entropy": 0.5920702815055847, "epoch": 4.6375121477162295, "grad_norm": 0.01129237376153469, "learning_rate": 0.0002, "loss": 0.5975418090820312, "mean_token_accuracy": 0.7549193054437637, "num_tokens": 22318190.0, "step": 598 }, { "entropy": 0.5989422127604485, "epoch": 4.645286686103013, "grad_norm": 0.014368323609232903, "learning_rate": 0.0002, "loss": 0.6041890978813171, "mean_token_accuracy": 0.7541765421628952, "num_tokens": 22355560.0, "step": 599 }, { "entropy": 0.602604515850544, "epoch": 4.653061224489796, "grad_norm": 0.012781691737473011, "learning_rate": 0.0002, "loss": 0.6051725149154663, "mean_token_accuracy": 0.7530051618814468, "num_tokens": 22393652.0, "step": 600 }, { "entropy": 0.6060863882303238, "epoch": 4.660835762876579, "grad_norm": 0.013375566340982914, "learning_rate": 0.0002, "loss": 0.6032074689865112, "mean_token_accuracy": 0.7527770921587944, "num_tokens": 22431345.0, "step": 601 }, { "entropy": 0.5950343683362007, "epoch": 4.668610301263363, "grad_norm": 0.012800985015928745, "learning_rate": 0.0002, "loss": 0.5933507084846497, "mean_token_accuracy": 0.7560804039239883, "num_tokens": 22469042.0, "step": 602 }, { "entropy": 0.5962737649679184, "epoch": 4.6763848396501455, "grad_norm": 0.014961260370910168, "learning_rate": 0.0002, "loss": 0.6006712913513184, "mean_token_accuracy": 0.7546053975820541, "num_tokens": 22506485.0, "step": 603 }, { "entropy": 0.606819398701191, "epoch": 4.684159378036929, "grad_norm": 0.011082889512181282, "learning_rate": 0.0002, "loss": 0.6065730452537537, "mean_token_accuracy": 0.7529779449105263, "num_tokens": 22544222.0, "step": 604 }, { "entropy": 0.577197976410389, "epoch": 4.691933916423713, "grad_norm": 0.014075525104999542, "learning_rate": 0.0002, "loss": 0.5835320949554443, "mean_token_accuracy": 0.7612094879150391, "num_tokens": 22581327.0, "step": 605 }, { "entropy": 0.6152481734752655, "epoch": 4.699708454810495, "grad_norm": 0.012122808955609798, "learning_rate": 0.0002, "loss": 0.6139184236526489, "mean_token_accuracy": 0.7484366744756699, "num_tokens": 22619089.0, "step": 606 }, { "entropy": 0.6120219603180885, "epoch": 4.707482993197279, "grad_norm": 0.011670667678117752, "learning_rate": 0.0002, "loss": 0.6125247478485107, "mean_token_accuracy": 0.7505181655287743, "num_tokens": 22656719.0, "step": 607 }, { "entropy": 0.5946462079882622, "epoch": 4.715257531584062, "grad_norm": 0.011501600034534931, "learning_rate": 0.0002, "loss": 0.600022554397583, "mean_token_accuracy": 0.7565812543034554, "num_tokens": 22694298.0, "step": 608 }, { "entropy": 0.5967997536063194, "epoch": 4.723032069970845, "grad_norm": 0.011824545450508595, "learning_rate": 0.0002, "loss": 0.6004019975662231, "mean_token_accuracy": 0.7516064792871475, "num_tokens": 22731785.0, "step": 609 }, { "entropy": 0.6012083142995834, "epoch": 4.730806608357629, "grad_norm": 0.009814469143748283, "learning_rate": 0.0002, "loss": 0.6001886129379272, "mean_token_accuracy": 0.7529330998659134, "num_tokens": 22769434.0, "step": 610 }, { "entropy": 0.6195448860526085, "epoch": 4.738581146744412, "grad_norm": 0.012913862243294716, "learning_rate": 0.0002, "loss": 0.6205934286117554, "mean_token_accuracy": 0.7455445975065231, "num_tokens": 22806676.0, "step": 611 }, { "entropy": 0.5957802012562752, "epoch": 4.746355685131196, "grad_norm": 0.011553781107068062, "learning_rate": 0.0002, "loss": 0.5980523824691772, "mean_token_accuracy": 0.7560853660106659, "num_tokens": 22843869.0, "step": 612 }, { "entropy": 0.6090810522437096, "epoch": 4.754130223517978, "grad_norm": 0.01271018385887146, "learning_rate": 0.0002, "loss": 0.6106667518615723, "mean_token_accuracy": 0.7504242658615112, "num_tokens": 22881762.0, "step": 613 }, { "entropy": 0.599302776157856, "epoch": 4.761904761904762, "grad_norm": 0.012581666931509972, "learning_rate": 0.0002, "loss": 0.5982247591018677, "mean_token_accuracy": 0.7549748122692108, "num_tokens": 22918922.0, "step": 614 }, { "entropy": 0.5844490081071854, "epoch": 4.769679300291545, "grad_norm": 0.011192350648343563, "learning_rate": 0.0002, "loss": 0.5844826698303223, "mean_token_accuracy": 0.7625714018940926, "num_tokens": 22956332.0, "step": 615 }, { "entropy": 0.5874569863080978, "epoch": 4.777453838678328, "grad_norm": 0.014751655049622059, "learning_rate": 0.0002, "loss": 0.5924921035766602, "mean_token_accuracy": 0.7579960823059082, "num_tokens": 22993598.0, "step": 616 }, { "entropy": 0.5977986827492714, "epoch": 4.785228377065112, "grad_norm": 0.011030304245650768, "learning_rate": 0.0002, "loss": 0.6010499000549316, "mean_token_accuracy": 0.7557829320430756, "num_tokens": 23031001.0, "step": 617 }, { "entropy": 0.599865585565567, "epoch": 4.793002915451895, "grad_norm": 0.011046946048736572, "learning_rate": 0.0002, "loss": 0.6028144359588623, "mean_token_accuracy": 0.7549864649772644, "num_tokens": 23068467.0, "step": 618 }, { "entropy": 0.6039430871605873, "epoch": 4.800777453838679, "grad_norm": 0.011677506379783154, "learning_rate": 0.0002, "loss": 0.6007229089736938, "mean_token_accuracy": 0.7543792948126793, "num_tokens": 23105954.0, "step": 619 }, { "entropy": 0.5956612825393677, "epoch": 4.808551992225461, "grad_norm": 0.011992014944553375, "learning_rate": 0.0002, "loss": 0.5964670181274414, "mean_token_accuracy": 0.7563618123531342, "num_tokens": 23143320.0, "step": 620 }, { "entropy": 0.5978101342916489, "epoch": 4.816326530612245, "grad_norm": 0.011897146701812744, "learning_rate": 0.0002, "loss": 0.6034868359565735, "mean_token_accuracy": 0.7537665143609047, "num_tokens": 23180916.0, "step": 621 }, { "entropy": 0.5931472703814507, "epoch": 4.8241010689990285, "grad_norm": 0.013459539040923119, "learning_rate": 0.0002, "loss": 0.6040017604827881, "mean_token_accuracy": 0.7539473846554756, "num_tokens": 23218627.0, "step": 622 }, { "entropy": 0.5916698947548866, "epoch": 4.831875607385811, "grad_norm": 0.011180682107806206, "learning_rate": 0.0002, "loss": 0.5919395685195923, "mean_token_accuracy": 0.7593255490064621, "num_tokens": 23255772.0, "step": 623 }, { "entropy": 0.6087042316794395, "epoch": 4.839650145772595, "grad_norm": 0.010437374003231525, "learning_rate": 0.0002, "loss": 0.6082122325897217, "mean_token_accuracy": 0.7515282183885574, "num_tokens": 23293061.0, "step": 624 }, { "entropy": 0.5966414213180542, "epoch": 4.847424684159378, "grad_norm": 0.011942134238779545, "learning_rate": 0.0002, "loss": 0.595150351524353, "mean_token_accuracy": 0.7563839182257652, "num_tokens": 23330109.0, "step": 625 }, { "entropy": 0.5881121456623077, "epoch": 4.855199222546162, "grad_norm": 0.011955403722822666, "learning_rate": 0.0002, "loss": 0.590496301651001, "mean_token_accuracy": 0.7592649832367897, "num_tokens": 23367496.0, "step": 626 }, { "entropy": 0.6133239194750786, "epoch": 4.862973760932944, "grad_norm": 0.012963500805199146, "learning_rate": 0.0002, "loss": 0.6236002445220947, "mean_token_accuracy": 0.7459099292755127, "num_tokens": 23404854.0, "step": 627 }, { "entropy": 0.5968378111720085, "epoch": 4.870748299319728, "grad_norm": 0.013238959014415741, "learning_rate": 0.0002, "loss": 0.5976919531822205, "mean_token_accuracy": 0.7568426579236984, "num_tokens": 23442227.0, "step": 628 }, { "entropy": 0.609023816883564, "epoch": 4.8785228377065115, "grad_norm": 0.012166466563940048, "learning_rate": 0.0002, "loss": 0.6067010164260864, "mean_token_accuracy": 0.7532210573554039, "num_tokens": 23479346.0, "step": 629 }, { "entropy": 0.6018581166863441, "epoch": 4.886297376093294, "grad_norm": 0.011096199974417686, "learning_rate": 0.0002, "loss": 0.5967071652412415, "mean_token_accuracy": 0.7587796524167061, "num_tokens": 23516484.0, "step": 630 }, { "entropy": 0.6068798899650574, "epoch": 4.894071914480078, "grad_norm": 0.0127568943426013, "learning_rate": 0.0002, "loss": 0.6059014797210693, "mean_token_accuracy": 0.7524421662092209, "num_tokens": 23553907.0, "step": 631 }, { "entropy": 0.5919808447360992, "epoch": 4.901846452866861, "grad_norm": 0.011789746582508087, "learning_rate": 0.0002, "loss": 0.596630334854126, "mean_token_accuracy": 0.757590651512146, "num_tokens": 23591693.0, "step": 632 }, { "entropy": 0.6100347265601158, "epoch": 4.909620991253644, "grad_norm": 0.013258693739771843, "learning_rate": 0.0002, "loss": 0.6171900033950806, "mean_token_accuracy": 0.7499294355511665, "num_tokens": 23629030.0, "step": 633 }, { "entropy": 0.5936124697327614, "epoch": 4.9173955296404275, "grad_norm": 0.011930654756724834, "learning_rate": 0.0002, "loss": 0.5924524664878845, "mean_token_accuracy": 0.7581655383110046, "num_tokens": 23666601.0, "step": 634 }, { "entropy": 0.6037433966994286, "epoch": 4.925170068027211, "grad_norm": 0.010547666810452938, "learning_rate": 0.0002, "loss": 0.6054027080535889, "mean_token_accuracy": 0.7513353079557419, "num_tokens": 23703928.0, "step": 635 }, { "entropy": 0.6012375876307487, "epoch": 4.932944606413994, "grad_norm": 0.013904466293752193, "learning_rate": 0.0002, "loss": 0.6056373119354248, "mean_token_accuracy": 0.7527650520205498, "num_tokens": 23741413.0, "step": 636 }, { "entropy": 0.6080401092767715, "epoch": 4.940719144800777, "grad_norm": 0.012218053452670574, "learning_rate": 0.0002, "loss": 0.6113067865371704, "mean_token_accuracy": 0.7506906762719154, "num_tokens": 23778797.0, "step": 637 }, { "entropy": 0.6042793691158295, "epoch": 4.948493683187561, "grad_norm": 0.012100595980882645, "learning_rate": 0.0002, "loss": 0.6038735508918762, "mean_token_accuracy": 0.7550994455814362, "num_tokens": 23816409.0, "step": 638 }, { "entropy": 0.5889951586723328, "epoch": 4.956268221574344, "grad_norm": 0.012997129000723362, "learning_rate": 0.0002, "loss": 0.5903059840202332, "mean_token_accuracy": 0.7594538182020187, "num_tokens": 23853723.0, "step": 639 }, { "entropy": 0.5925157070159912, "epoch": 4.964042759961127, "grad_norm": 0.015738792717456818, "learning_rate": 0.0002, "loss": 0.5936194658279419, "mean_token_accuracy": 0.7593093439936638, "num_tokens": 23891029.0, "step": 640 }, { "entropy": 0.5936921015381813, "epoch": 4.9718172983479105, "grad_norm": 0.01318391039967537, "learning_rate": 0.0002, "loss": 0.5958787202835083, "mean_token_accuracy": 0.7549382373690605, "num_tokens": 23928148.0, "step": 641 }, { "entropy": 0.6125310584902763, "epoch": 4.979591836734694, "grad_norm": 0.013194733299314976, "learning_rate": 0.0002, "loss": 0.6129195094108582, "mean_token_accuracy": 0.7493861764669418, "num_tokens": 23965085.0, "step": 642 }, { "entropy": 0.5964741930365562, "epoch": 4.987366375121477, "grad_norm": 0.013308845460414886, "learning_rate": 0.0002, "loss": 0.5979577302932739, "mean_token_accuracy": 0.7562628239393234, "num_tokens": 24002145.0, "step": 643 }, { "entropy": 0.5872825607657433, "epoch": 4.99514091350826, "grad_norm": 0.010709763504564762, "learning_rate": 0.0002, "loss": 0.5851190686225891, "mean_token_accuracy": 0.7606633305549622, "num_tokens": 24039501.0, "step": 644 }, { "entropy": 0.6111570835113526, "epoch": 5.0, "grad_norm": 0.012978802435100079, "learning_rate": 0.0002, "loss": 0.6106741428375244, "mean_token_accuracy": 0.749509060382843, "num_tokens": 24062815.0, "step": 645 } ], "logging_steps": 1, "max_steps": 645, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.2502112888923095e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }