diff --git "a/trainer_state.json" "b/trainer_state.json" --- "a/trainer_state.json" +++ "b/trainer_state.json" @@ -2,5418 +2,7768 @@ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, - "epoch": 10.0, + "epoch": 5.0, "eval_steps": 500, - "global_step": 540, + "global_step": 775, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { - "entropy": 1.2066851258277893, - "epoch": 0.018691588785046728, - "grad_norm": 0.7179942727088928, + "entropy": 1.1549250930547714, + "epoch": 0.006488240064882401, + "grad_norm": 0.24168352782726288, "learning_rate": 0.0002, - "loss": 2.6056714057922363, - "mean_token_accuracy": 0.5238651186227798, - "num_tokens": 78763.0, + "loss": 2.622039794921875, + "mean_token_accuracy": 0.5027666613459587, + "num_tokens": 36790.0, "step": 1 }, { - "entropy": 1.230730652809143, - "epoch": 0.037383177570093455, - "grad_norm": 0.39783212542533875, + "entropy": 1.274625539779663, + "epoch": 0.012976480129764802, + "grad_norm": 0.1995907425880432, "learning_rate": 0.0002, - "loss": 2.1227054595947266, - "mean_token_accuracy": 0.569368377327919, - "num_tokens": 158094.0, + "loss": 2.257164239883423, + "mean_token_accuracy": 0.5388679280877113, + "num_tokens": 74141.0, "step": 2 }, { - "entropy": 1.331688642501831, - "epoch": 0.056074766355140186, - "grad_norm": 0.37228652834892273, + "entropy": 1.4621597826480865, + "epoch": 0.019464720194647202, + "grad_norm": 0.14427633583545685, "learning_rate": 0.0002, - "loss": 1.8091474771499634, - "mean_token_accuracy": 0.592425987124443, - "num_tokens": 237343.0, + "loss": 1.8207428455352783, + "mean_token_accuracy": 0.5618570819497108, + "num_tokens": 111279.0, "step": 3 }, { - "entropy": 1.4335883259773254, - "epoch": 0.07476635514018691, - "grad_norm": 0.41868939995765686, + "entropy": 1.432983249425888, + "epoch": 0.025952960259529603, + "grad_norm": 0.11290092021226883, "learning_rate": 0.0002, - "loss": 1.6234431266784668, - "mean_token_accuracy": 0.5964363217353821, - "num_tokens": 314944.0, + "loss": 1.4740469455718994, + "mean_token_accuracy": 0.6100572720170021, + "num_tokens": 148749.0, "step": 4 }, { - "entropy": 1.409546136856079, - "epoch": 0.09345794392523364, - "grad_norm": 0.29376551508903503, + "entropy": 1.4418732523918152, + "epoch": 0.032441200324412, + "grad_norm": 0.13801905512809753, "learning_rate": 0.0002, - "loss": 1.4345183372497559, - "mean_token_accuracy": 0.6207377016544342, - "num_tokens": 395410.0, + "loss": 1.3789974451065063, + "mean_token_accuracy": 0.6047125160694122, + "num_tokens": 186530.0, "step": 5 }, { - "entropy": 1.398401916027069, - "epoch": 0.11214953271028037, - "grad_norm": 0.17153914272785187, + "entropy": 1.3603367805480957, + "epoch": 0.038929440389294405, + "grad_norm": 0.07707933336496353, "learning_rate": 0.0002, - "loss": 1.318544864654541, - "mean_token_accuracy": 0.6380362659692764, - "num_tokens": 474666.0, + "loss": 1.2482553720474243, + "mean_token_accuracy": 0.6377034857869148, + "num_tokens": 224090.0, "step": 6 }, { - "entropy": 1.3791473805904388, - "epoch": 0.1308411214953271, - "grad_norm": 0.13288195431232452, + "entropy": 1.2907896488904953, + "epoch": 0.0454176804541768, + "grad_norm": 0.05054641142487526, "learning_rate": 0.0002, - "loss": 1.2380807399749756, - "mean_token_accuracy": 0.646199494600296, - "num_tokens": 552886.0, + "loss": 1.1776490211486816, + "mean_token_accuracy": 0.6423852369189262, + "num_tokens": 261358.0, "step": 7 }, { - "entropy": 1.3407225608825684, - "epoch": 0.14953271028037382, - "grad_norm": 0.1418880969285965, + "entropy": 1.2394904792308807, + "epoch": 0.05190592051905921, + "grad_norm": 0.05160299688577652, "learning_rate": 0.0002, - "loss": 1.1673367023468018, - "mean_token_accuracy": 0.6485770791769028, - "num_tokens": 630368.0, + "loss": 1.1141722202301025, + "mean_token_accuracy": 0.6483801528811455, + "num_tokens": 298387.0, "step": 8 }, { - "entropy": 1.2557969391345978, - "epoch": 0.16822429906542055, - "grad_norm": 0.14714179933071136, + "entropy": 1.140880137681961, + "epoch": 0.058394160583941604, + "grad_norm": 0.05524353310465813, "learning_rate": 0.0002, - "loss": 1.0843346118927002, - "mean_token_accuracy": 0.6631819307804108, - "num_tokens": 710219.0, + "loss": 1.0428144931793213, + "mean_token_accuracy": 0.6648038625717163, + "num_tokens": 335681.0, "step": 9 }, { - "entropy": 1.1940588653087616, - "epoch": 0.18691588785046728, - "grad_norm": 0.14930284023284912, + "entropy": 1.0597130507230759, + "epoch": 0.064882400648824, + "grad_norm": 0.0610174834728241, "learning_rate": 0.0002, - "loss": 1.015075445175171, - "mean_token_accuracy": 0.679719015955925, - "num_tokens": 788388.0, + "loss": 0.9854335784912109, + "mean_token_accuracy": 0.6730685979127884, + "num_tokens": 373108.0, "step": 10 }, { - "entropy": 1.0720389187335968, - "epoch": 0.205607476635514, - "grad_norm": 0.10242773592472076, + "entropy": 0.9984031766653061, + "epoch": 0.07137064071370641, + "grad_norm": 0.05013473331928253, "learning_rate": 0.0002, - "loss": 0.937964141368866, - "mean_token_accuracy": 0.6943712085485458, - "num_tokens": 870578.0, + "loss": 0.9311432838439941, + "mean_token_accuracy": 0.6808731183409691, + "num_tokens": 410188.0, "step": 11 }, { - "entropy": 0.9909108728170395, - "epoch": 0.22429906542056074, - "grad_norm": 0.09138211607933044, + "entropy": 0.9519696608185768, + "epoch": 0.07785888077858881, + "grad_norm": 0.7003989219665527, "learning_rate": 0.0002, - "loss": 0.9100936651229858, - "mean_token_accuracy": 0.6939836889505386, - "num_tokens": 950766.0, + "loss": 0.9051742553710938, + "mean_token_accuracy": 0.6799700632691383, + "num_tokens": 447666.0, "step": 12 }, { - "entropy": 0.9221479296684265, - "epoch": 0.24299065420560748, - "grad_norm": 0.10024455189704895, + "entropy": 0.905988834798336, + "epoch": 0.08434712084347121, + "grad_norm": 0.05167749896645546, "learning_rate": 0.0002, - "loss": 0.8748308420181274, - "mean_token_accuracy": 0.6973191946744919, - "num_tokens": 1029253.0, + "loss": 0.8597391843795776, + "mean_token_accuracy": 0.6946859285235405, + "num_tokens": 484844.0, "step": 13 }, { - "entropy": 0.8531733900308609, - "epoch": 0.2616822429906542, - "grad_norm": 0.09876618534326553, + "entropy": 0.8613085150718689, + "epoch": 0.0908353609083536, + "grad_norm": 0.0768115222454071, "learning_rate": 0.0002, - "loss": 0.8316620588302612, - "mean_token_accuracy": 0.705431193113327, - "num_tokens": 1107714.0, + "loss": 0.8413710594177246, + "mean_token_accuracy": 0.6983600705862045, + "num_tokens": 521975.0, "step": 14 }, { - "entropy": 0.8102366924285889, - "epoch": 0.2803738317757009, - "grad_norm": 0.09547463059425354, + "entropy": 0.8102021664381027, + "epoch": 0.09732360097323602, + "grad_norm": 0.5994402170181274, "learning_rate": 0.0002, - "loss": 0.8144597411155701, - "mean_token_accuracy": 0.7082843035459518, - "num_tokens": 1187423.0, + "loss": 0.81607985496521, + "mean_token_accuracy": 0.7021179124712944, + "num_tokens": 558889.0, "step": 15 }, { - "entropy": 0.7830685824155807, - "epoch": 0.29906542056074764, - "grad_norm": 0.08728648722171783, + "entropy": 0.8057567626237869, + "epoch": 0.10381184103811841, + "grad_norm": 0.03823373466730118, "learning_rate": 0.0002, - "loss": 0.7878029346466064, - "mean_token_accuracy": 0.7123377323150635, - "num_tokens": 1266800.0, + "loss": 0.7905861139297485, + "mean_token_accuracy": 0.7055389359593391, + "num_tokens": 596455.0, "step": 16 }, { - "entropy": 0.771837130188942, - "epoch": 0.3177570093457944, - "grad_norm": 0.07688825577497482, + "entropy": 0.7923594415187836, + "epoch": 0.11030008110300081, + "grad_norm": 0.0739479511976242, "learning_rate": 0.0002, - "loss": 0.7640396356582642, - "mean_token_accuracy": 0.7166268229484558, - "num_tokens": 1345669.0, + "loss": 0.769114077091217, + "mean_token_accuracy": 0.7118282616138458, + "num_tokens": 634110.0, "step": 17 }, { - "entropy": 0.7662298083305359, - "epoch": 0.3364485981308411, - "grad_norm": 0.08384118229150772, + "entropy": 0.7812566831707954, + "epoch": 0.11678832116788321, + "grad_norm": 0.03668873757123947, "learning_rate": 0.0002, - "loss": 0.7458442449569702, - "mean_token_accuracy": 0.7201817631721497, - "num_tokens": 1424919.0, + "loss": 0.7668346762657166, + "mean_token_accuracy": 0.7075815051794052, + "num_tokens": 671655.0, "step": 18 }, { - "entropy": 0.7514005601406097, - "epoch": 0.35514018691588783, - "grad_norm": 0.08126289397478104, + "entropy": 0.7474964931607246, + "epoch": 0.12327656123276562, + "grad_norm": 0.041200920939445496, "learning_rate": 0.0002, - "loss": 0.7338656187057495, - "mean_token_accuracy": 0.7214008867740631, - "num_tokens": 1503286.0, + "loss": 0.7393766641616821, + "mean_token_accuracy": 0.716952882707119, + "num_tokens": 708824.0, "step": 19 }, { - "entropy": 0.7352934032678604, - "epoch": 0.37383177570093457, - "grad_norm": 0.0703548714518547, + "entropy": 0.7383133918046951, + "epoch": 0.129764801297648, + "grad_norm": 0.0367242768406868, "learning_rate": 0.0002, - "loss": 0.7204664945602417, - "mean_token_accuracy": 0.7259397804737091, - "num_tokens": 1582654.0, + "loss": 0.728330135345459, + "mean_token_accuracy": 0.7191555127501488, + "num_tokens": 746274.0, "step": 20 }, { - "entropy": 0.704582080245018, - "epoch": 0.3925233644859813, - "grad_norm": 0.0680006816983223, + "entropy": 0.7354703769087791, + "epoch": 0.1362530413625304, + "grad_norm": 0.039265185594558716, "learning_rate": 0.0002, - "loss": 0.6956260800361633, - "mean_token_accuracy": 0.7327138334512711, - "num_tokens": 1662345.0, + "loss": 0.7205026149749756, + "mean_token_accuracy": 0.7199463173747063, + "num_tokens": 783720.0, "step": 21 }, { - "entropy": 0.7041595876216888, - "epoch": 0.411214953271028, - "grad_norm": 0.07259424775838852, + "entropy": 0.7178014516830444, + "epoch": 0.14274128142741282, + "grad_norm": 0.03647130727767944, "learning_rate": 0.0002, - "loss": 0.7061991691589355, - "mean_token_accuracy": 0.7257621735334396, - "num_tokens": 1740618.0, + "loss": 0.7003612518310547, + "mean_token_accuracy": 0.7242974415421486, + "num_tokens": 821241.0, "step": 22 }, { - "entropy": 0.6996002197265625, - "epoch": 0.42990654205607476, - "grad_norm": 0.05930614843964577, + "entropy": 0.7019922286272049, + "epoch": 0.1492295214922952, + "grad_norm": 0.03146970644593239, "learning_rate": 0.0002, - "loss": 0.6944414377212524, - "mean_token_accuracy": 0.7298829406499863, - "num_tokens": 1818731.0, + "loss": 0.6875081062316895, + "mean_token_accuracy": 0.7302066311240196, + "num_tokens": 858171.0, "step": 23 }, { - "entropy": 0.6977217197418213, - "epoch": 0.4485981308411215, - "grad_norm": 0.059824682772159576, + "entropy": 0.691544882953167, + "epoch": 0.15571776155717762, + "grad_norm": 0.03450683504343033, "learning_rate": 0.0002, - "loss": 0.68711256980896, - "mean_token_accuracy": 0.7326766103506088, - "num_tokens": 1896889.0, + "loss": 0.6847634315490723, + "mean_token_accuracy": 0.7311759144067764, + "num_tokens": 895368.0, "step": 24 }, { - "entropy": 0.6951911151409149, - "epoch": 0.4672897196261682, - "grad_norm": 0.060844291001558304, + "entropy": 0.6791905760765076, + "epoch": 0.16220600162206, + "grad_norm": 0.029409531503915787, "learning_rate": 0.0002, - "loss": 0.681706428527832, - "mean_token_accuracy": 0.731402724981308, - "num_tokens": 1974795.0, + "loss": 0.672599732875824, + "mean_token_accuracy": 0.7371302843093872, + "num_tokens": 932589.0, "step": 25 }, { - "entropy": 0.6741717159748077, - "epoch": 0.48598130841121495, - "grad_norm": 0.05977668985724449, + "entropy": 0.6795228570699692, + "epoch": 0.16869424168694241, + "grad_norm": 0.029320087283849716, "learning_rate": 0.0002, - "loss": 0.6651660203933716, - "mean_token_accuracy": 0.7382005453109741, - "num_tokens": 2052366.0, + "loss": 0.6811176538467407, + "mean_token_accuracy": 0.7309242188930511, + "num_tokens": 969558.0, "step": 26 }, { - "entropy": 0.658872976899147, - "epoch": 0.5046728971962616, - "grad_norm": 0.05988093093037605, + "entropy": 0.6630020141601562, + "epoch": 0.17518248175182483, + "grad_norm": 0.025668611750006676, "learning_rate": 0.0002, - "loss": 0.6478220224380493, - "mean_token_accuracy": 0.7451245039701462, - "num_tokens": 2132623.0, + "loss": 0.6629281044006348, + "mean_token_accuracy": 0.7399500384926796, + "num_tokens": 1007155.0, "step": 27 }, { - "entropy": 0.6636136025190353, - "epoch": 0.5233644859813084, - "grad_norm": 0.05302215740084648, + "entropy": 0.6723117381334305, + "epoch": 0.1816707218167072, + "grad_norm": 0.025801967829465866, "learning_rate": 0.0002, - "loss": 0.6561492681503296, - "mean_token_accuracy": 0.742748498916626, - "num_tokens": 2212171.0, + "loss": 0.672906756401062, + "mean_token_accuracy": 0.7337809279561043, + "num_tokens": 1044459.0, "step": 28 }, { - "entropy": 0.6493570953607559, - "epoch": 0.5420560747663551, - "grad_norm": 0.058367419987916946, + "entropy": 0.671604260802269, + "epoch": 0.18815896188158962, + "grad_norm": 0.026239318773150444, "learning_rate": 0.0002, - "loss": 0.6493097543716431, - "mean_token_accuracy": 0.7458167970180511, - "num_tokens": 2290737.0, + "loss": 0.6697608828544617, + "mean_token_accuracy": 0.7337322384119034, + "num_tokens": 1081975.0, "step": 29 }, { - "entropy": 0.6432235687971115, - "epoch": 0.5607476635514018, - "grad_norm": 0.05448915436863899, + "entropy": 0.646067701280117, + "epoch": 0.19464720194647203, + "grad_norm": 0.02587837167084217, "learning_rate": 0.0002, - "loss": 0.6421418190002441, - "mean_token_accuracy": 0.7468905597925186, - "num_tokens": 2369888.0, + "loss": 0.6468892097473145, + "mean_token_accuracy": 0.7421439811587334, + "num_tokens": 1119148.0, "step": 30 }, { - "entropy": 0.641756996512413, - "epoch": 0.5794392523364486, - "grad_norm": 0.05883530527353287, + "entropy": 0.6522824168205261, + "epoch": 0.20113544201135442, + "grad_norm": 0.0248495414853096, "learning_rate": 0.0002, - "loss": 0.6386466026306152, - "mean_token_accuracy": 0.7485450953245163, - "num_tokens": 2450096.0, + "loss": 0.6558438539505005, + "mean_token_accuracy": 0.7381908968091011, + "num_tokens": 1156351.0, "step": 31 }, { - "entropy": 0.6456558853387833, - "epoch": 0.5981308411214953, - "grad_norm": 0.043611567467451096, + "entropy": 0.6425730809569359, + "epoch": 0.20762368207623683, + "grad_norm": 0.02851717919111252, "learning_rate": 0.0002, - "loss": 0.6375504732131958, - "mean_token_accuracy": 0.7480568140745163, - "num_tokens": 2529348.0, + "loss": 0.6539334654808044, + "mean_token_accuracy": 0.7376680299639702, + "num_tokens": 1193707.0, "step": 32 }, { - "entropy": 0.6468172371387482, - "epoch": 0.616822429906542, - "grad_norm": 0.05578931048512459, + "entropy": 0.6417841091752052, + "epoch": 0.2141119221411192, + "grad_norm": 0.02549365535378456, "learning_rate": 0.0002, - "loss": 0.6400123238563538, - "mean_token_accuracy": 0.7488409727811813, - "num_tokens": 2608327.0, + "loss": 0.6482184529304504, + "mean_token_accuracy": 0.7417171224951744, + "num_tokens": 1230700.0, "step": 33 }, { - "entropy": 0.6378584653139114, - "epoch": 0.6355140186915887, - "grad_norm": 0.04630431905388832, + "entropy": 0.6465194374322891, + "epoch": 0.22060016220600162, + "grad_norm": 0.025215625762939453, "learning_rate": 0.0002, - "loss": 0.6317487955093384, - "mean_token_accuracy": 0.7513478249311447, - "num_tokens": 2688604.0, + "loss": 0.6494179964065552, + "mean_token_accuracy": 0.7402999773621559, + "num_tokens": 1267782.0, "step": 34 }, { - "entropy": 0.6285719871520996, - "epoch": 0.6542056074766355, - "grad_norm": 0.04269322752952576, + "entropy": 0.6392467468976974, + "epoch": 0.22708840227088403, + "grad_norm": 0.023007551208138466, "learning_rate": 0.0002, - "loss": 0.6267668008804321, - "mean_token_accuracy": 0.7520004361867905, - "num_tokens": 2767770.0, + "loss": 0.6377967000007629, + "mean_token_accuracy": 0.7462463900446892, + "num_tokens": 1304976.0, "step": 35 }, { - "entropy": 0.613593116402626, - "epoch": 0.6728971962616822, - "grad_norm": 0.04195692762732506, + "entropy": 0.6491241455078125, + "epoch": 0.23357664233576642, + "grad_norm": 0.022631216794252396, "learning_rate": 0.0002, - "loss": 0.6151101589202881, - "mean_token_accuracy": 0.7558344155550003, - "num_tokens": 2846844.0, + "loss": 0.6419650316238403, + "mean_token_accuracy": 0.7427782192826271, + "num_tokens": 1342405.0, "step": 36 }, { - "entropy": 0.619237095117569, - "epoch": 0.6915887850467289, - "grad_norm": 0.04547283425927162, + "entropy": 0.6426859274506569, + "epoch": 0.24006488240064883, + "grad_norm": 0.020762791857123375, "learning_rate": 0.0002, - "loss": 0.6201531291007996, - "mean_token_accuracy": 0.7537788301706314, - "num_tokens": 2924106.0, + "loss": 0.638580322265625, + "mean_token_accuracy": 0.74485033005476, + "num_tokens": 1379588.0, "step": 37 }, { - "entropy": 0.6138854026794434, - "epoch": 0.7102803738317757, - "grad_norm": 0.045413266867399216, + "entropy": 0.6500778123736382, + "epoch": 0.24655312246553124, + "grad_norm": 0.01766084134578705, "learning_rate": 0.0002, - "loss": 0.6134829521179199, - "mean_token_accuracy": 0.7565835565328598, - "num_tokens": 3003024.0, + "loss": 0.6436338424682617, + "mean_token_accuracy": 0.7424680069088936, + "num_tokens": 1417229.0, "step": 38 }, { - "entropy": 0.620908111333847, - "epoch": 0.7289719626168224, - "grad_norm": 0.03639939799904823, + "entropy": 0.654863677918911, + "epoch": 0.25304136253041365, + "grad_norm": 0.018832355737686157, "learning_rate": 0.0002, - "loss": 0.6201748847961426, - "mean_token_accuracy": 0.7546153366565704, - "num_tokens": 3081301.0, + "loss": 0.6571300029754639, + "mean_token_accuracy": 0.7378578186035156, + "num_tokens": 1454802.0, "step": 39 }, { - "entropy": 0.6099251806735992, - "epoch": 0.7476635514018691, - "grad_norm": 0.03840401768684387, + "entropy": 0.6454419046640396, + "epoch": 0.259529602595296, + "grad_norm": 0.018613073974847794, "learning_rate": 0.0002, - "loss": 0.61121666431427, - "mean_token_accuracy": 0.7575128823518753, - "num_tokens": 3159456.0, + "loss": 0.6524553298950195, + "mean_token_accuracy": 0.7370505034923553, + "num_tokens": 1492073.0, "step": 40 }, { - "entropy": 0.6060190051794052, - "epoch": 0.7663551401869159, - "grad_norm": 0.03731069341301918, + "entropy": 0.6527602002024651, + "epoch": 0.2660178426601784, + "grad_norm": 0.01693454198539257, "learning_rate": 0.0002, - "loss": 0.6043084859848022, - "mean_token_accuracy": 0.7605673968791962, - "num_tokens": 3237706.0, + "loss": 0.6585220098495483, + "mean_token_accuracy": 0.73494041711092, + "num_tokens": 1529432.0, "step": 41 }, { - "entropy": 0.6159602850675583, - "epoch": 0.7850467289719626, - "grad_norm": 0.036441072821617126, + "entropy": 0.6482313647866249, + "epoch": 0.2725060827250608, + "grad_norm": 0.015154066495597363, "learning_rate": 0.0002, - "loss": 0.6172773838043213, - "mean_token_accuracy": 0.7549006193876266, - "num_tokens": 3316458.0, + "loss": 0.6487522125244141, + "mean_token_accuracy": 0.7386852130293846, + "num_tokens": 1566849.0, "step": 42 }, { - "entropy": 0.6140847951173782, - "epoch": 0.8037383177570093, - "grad_norm": 0.03407798334956169, + "entropy": 0.6501431986689568, + "epoch": 0.27899432278994324, + "grad_norm": 0.015506139025092125, "learning_rate": 0.0002, - "loss": 0.6130833625793457, - "mean_token_accuracy": 0.7558080703020096, - "num_tokens": 3395531.0, + "loss": 0.6508647203445435, + "mean_token_accuracy": 0.7396439164876938, + "num_tokens": 1603797.0, "step": 43 }, { - "entropy": 0.6078946739435196, - "epoch": 0.822429906542056, - "grad_norm": 0.03341364115476608, + "entropy": 0.6399750784039497, + "epoch": 0.28548256285482565, + "grad_norm": 0.014903928153216839, "learning_rate": 0.0002, - "loss": 0.6066131591796875, - "mean_token_accuracy": 0.7582335621118546, - "num_tokens": 3473820.0, + "loss": 0.639168381690979, + "mean_token_accuracy": 0.743517704308033, + "num_tokens": 1641043.0, "step": 44 }, { - "entropy": 0.6053218245506287, - "epoch": 0.8411214953271028, - "grad_norm": 0.02799089439213276, + "entropy": 0.6295603513717651, + "epoch": 0.291970802919708, + "grad_norm": 0.014574805274605751, "learning_rate": 0.0002, - "loss": 0.600709855556488, - "mean_token_accuracy": 0.7598105370998383, - "num_tokens": 3553354.0, + "loss": 0.6305776834487915, + "mean_token_accuracy": 0.746990330517292, + "num_tokens": 1677698.0, "step": 45 }, { - "entropy": 0.6008974015712738, - "epoch": 0.8598130841121495, - "grad_norm": 0.03266238048672676, + "entropy": 0.6334760338068008, + "epoch": 0.2984590429845904, + "grad_norm": 0.016435733065009117, "learning_rate": 0.0002, - "loss": 0.5975630879402161, - "mean_token_accuracy": 0.7631259560585022, - "num_tokens": 3632012.0, + "loss": 0.631117582321167, + "mean_token_accuracy": 0.7475783005356789, + "num_tokens": 1714954.0, "step": 46 }, { - "entropy": 0.6067604422569275, - "epoch": 0.8785046728971962, - "grad_norm": 0.03338483348488808, + "entropy": 0.6437651589512825, + "epoch": 0.30494728304947283, + "grad_norm": 0.016290629282593727, "learning_rate": 0.0002, - "loss": 0.6048734188079834, - "mean_token_accuracy": 0.7590593695640564, - "num_tokens": 3711139.0, + "loss": 0.6405509114265442, + "mean_token_accuracy": 0.7430335581302643, + "num_tokens": 1751913.0, "step": 47 }, { - "entropy": 0.5967728197574615, - "epoch": 0.897196261682243, - "grad_norm": 0.025535311549901962, + "entropy": 0.6363071575760841, + "epoch": 0.31143552311435524, + "grad_norm": 0.01479713711887598, "learning_rate": 0.0002, - "loss": 0.5967084765434265, - "mean_token_accuracy": 0.7615634948015213, - "num_tokens": 3790547.0, + "loss": 0.6342425346374512, + "mean_token_accuracy": 0.7451304048299789, + "num_tokens": 1789211.0, "step": 48 }, { - "entropy": 0.6170180141925812, - "epoch": 0.9158878504672897, - "grad_norm": 0.0306242685765028, + "entropy": 0.6442478150129318, + "epoch": 0.31792376317923765, + "grad_norm": 0.014846265316009521, "learning_rate": 0.0002, - "loss": 0.6141654253005981, - "mean_token_accuracy": 0.7549907118082047, - "num_tokens": 3868857.0, + "loss": 0.641524612903595, + "mean_token_accuracy": 0.7414352521300316, + "num_tokens": 1826606.0, "step": 49 }, { - "entropy": 0.6021094918251038, - "epoch": 0.9345794392523364, - "grad_norm": 0.03037024661898613, + "entropy": 0.6363928020000458, + "epoch": 0.32441200324412, + "grad_norm": 0.01481616124510765, "learning_rate": 0.0002, - "loss": 0.6032395362854004, - "mean_token_accuracy": 0.7590876370668411, - "num_tokens": 3948653.0, + "loss": 0.6363080739974976, + "mean_token_accuracy": 0.7444929406046867, + "num_tokens": 1863966.0, "step": 50 }, { - "entropy": 0.6060637980699539, - "epoch": 0.9532710280373832, - "grad_norm": 0.030959416180849075, + "entropy": 0.6335690394043922, + "epoch": 0.3309002433090024, + "grad_norm": 0.015328066423535347, "learning_rate": 0.0002, - "loss": 0.6047207117080688, - "mean_token_accuracy": 0.7576227784156799, - "num_tokens": 4027651.0, + "loss": 0.6387162208557129, + "mean_token_accuracy": 0.7436776608228683, + "num_tokens": 1900997.0, "step": 51 }, { - "entropy": 0.5999785810709, - "epoch": 0.9719626168224299, - "grad_norm": 0.03629245609045029, + "entropy": 0.6325219571590424, + "epoch": 0.33738848337388483, + "grad_norm": 0.015631280839443207, "learning_rate": 0.0002, - "loss": 0.6036806106567383, - "mean_token_accuracy": 0.7583939582109451, - "num_tokens": 4106355.0, + "loss": 0.6400341987609863, + "mean_token_accuracy": 0.7412212640047073, + "num_tokens": 1937974.0, "step": 52 }, { - "entropy": 0.6017800122499466, - "epoch": 0.9906542056074766, - "grad_norm": 0.038867365568876266, + "entropy": 0.63508290797472, + "epoch": 0.34387672343876724, + "grad_norm": 0.014866264536976814, "learning_rate": 0.0002, - "loss": 0.6031535863876343, - "mean_token_accuracy": 0.7586866319179535, - "num_tokens": 4185523.0, + "loss": 0.6396467089653015, + "mean_token_accuracy": 0.7431643679738045, + "num_tokens": 1975204.0, "step": 53 }, { - "entropy": 0.6058991253376007, - "epoch": 1.0, - "grad_norm": 0.02517516352236271, + "entropy": 0.6382915005087852, + "epoch": 0.35036496350364965, + "grad_norm": 0.013517456129193306, "learning_rate": 0.0002, - "loss": 0.6025224924087524, - "mean_token_accuracy": 0.7598057687282562, - "num_tokens": 4225197.0, + "loss": 0.6404691338539124, + "mean_token_accuracy": 0.7433327361941338, + "num_tokens": 2012218.0, "step": 54 }, { - "entropy": 0.6096542477607727, - "epoch": 1.0186915887850467, - "grad_norm": 0.03110332600772381, + "entropy": 0.6375824585556984, + "epoch": 0.35685320356853206, + "grad_norm": 0.015061435289680958, "learning_rate": 0.0002, - "loss": 0.6018860340118408, - "mean_token_accuracy": 0.760483518242836, - "num_tokens": 4305195.0, + "loss": 0.6400342583656311, + "mean_token_accuracy": 0.7421080023050308, + "num_tokens": 2049462.0, "step": 55 }, { - "entropy": 0.6131730824708939, - "epoch": 1.0373831775700935, - "grad_norm": 0.03143934905529022, + "entropy": 0.6377979964017868, + "epoch": 0.3633414436334144, + "grad_norm": 0.016312120482325554, "learning_rate": 0.0002, - "loss": 0.6093547344207764, - "mean_token_accuracy": 0.7554158419370651, - "num_tokens": 4383674.0, + "loss": 0.635837197303772, + "mean_token_accuracy": 0.7426418736577034, + "num_tokens": 2086665.0, "step": 56 }, { - "entropy": 0.6045864671468735, - "epoch": 1.0560747663551402, - "grad_norm": 0.02568645216524601, + "entropy": 0.6413707137107849, + "epoch": 0.36982968369829683, + "grad_norm": 0.012621643021702766, "learning_rate": 0.0002, - "loss": 0.6015181541442871, - "mean_token_accuracy": 0.758747324347496, - "num_tokens": 4462590.0, + "loss": 0.6389581561088562, + "mean_token_accuracy": 0.7432198747992516, + "num_tokens": 2124115.0, "step": 57 }, { - "entropy": 0.5954300314188004, - "epoch": 1.074766355140187, - "grad_norm": 0.02599039301276207, + "entropy": 0.6355349719524384, + "epoch": 0.37631792376317924, + "grad_norm": 0.01422160305082798, "learning_rate": 0.0002, - "loss": 0.59382164478302, - "mean_token_accuracy": 0.7613071352243423, - "num_tokens": 4542209.0, + "loss": 0.6343538165092468, + "mean_token_accuracy": 0.743286557495594, + "num_tokens": 2161345.0, "step": 58 }, { - "entropy": 0.5987758338451385, - "epoch": 1.0934579439252337, - "grad_norm": 0.026119234040379524, + "entropy": 0.6376762092113495, + "epoch": 0.38280616382806165, + "grad_norm": 0.014769963920116425, "learning_rate": 0.0002, - "loss": 0.5977290868759155, - "mean_token_accuracy": 0.7600577920675278, - "num_tokens": 4621289.0, + "loss": 0.6412167549133301, + "mean_token_accuracy": 0.7418163046240807, + "num_tokens": 2198636.0, "step": 59 }, { - "entropy": 0.6043910086154938, - "epoch": 1.1121495327102804, - "grad_norm": 0.027874266728758812, + "entropy": 0.6334660202264786, + "epoch": 0.38929440389294406, + "grad_norm": 0.014948038384318352, "learning_rate": 0.0002, - "loss": 0.5998106598854065, - "mean_token_accuracy": 0.7593644857406616, - "num_tokens": 4702264.0, + "loss": 0.6379479169845581, + "mean_token_accuracy": 0.7443428039550781, + "num_tokens": 2235377.0, "step": 60 }, { - "entropy": 0.6029744148254395, - "epoch": 1.1308411214953271, - "grad_norm": 0.024287983775138855, + "entropy": 0.632827527821064, + "epoch": 0.3957826439578264, + "grad_norm": 0.01332375779747963, "learning_rate": 0.0002, - "loss": 0.601834237575531, - "mean_token_accuracy": 0.759440615773201, - "num_tokens": 4781921.0, + "loss": 0.633344292640686, + "mean_token_accuracy": 0.7467714250087738, + "num_tokens": 2272588.0, "step": 61 }, { - "entropy": 0.6114215701818466, - "epoch": 1.1495327102803738, - "grad_norm": 0.029389025643467903, + "entropy": 0.632963553071022, + "epoch": 0.40227088402270883, + "grad_norm": 0.013366672210395336, "learning_rate": 0.0002, - "loss": 0.6087201237678528, - "mean_token_accuracy": 0.7564449906349182, - "num_tokens": 4861920.0, + "loss": 0.6344192028045654, + "mean_token_accuracy": 0.7444779649376869, + "num_tokens": 2310205.0, "step": 62 }, { - "entropy": 0.6049663573503494, - "epoch": 1.1682242990654206, - "grad_norm": 0.02526937425136566, + "entropy": 0.6468651965260506, + "epoch": 0.40875912408759124, + "grad_norm": 0.012876944616436958, "learning_rate": 0.0002, - "loss": 0.6054017543792725, - "mean_token_accuracy": 0.7583751827478409, - "num_tokens": 4940914.0, + "loss": 0.6487270593643188, + "mean_token_accuracy": 0.7404673770070076, + "num_tokens": 2347612.0, "step": 63 }, { - "entropy": 0.605153813958168, - "epoch": 1.1869158878504673, - "grad_norm": 0.023482007905840874, + "entropy": 0.6336022540926933, + "epoch": 0.41524736415247365, + "grad_norm": 0.011953601613640785, "learning_rate": 0.0002, - "loss": 0.6047523021697998, - "mean_token_accuracy": 0.7565990537405014, - "num_tokens": 5020328.0, + "loss": 0.6323578357696533, + "mean_token_accuracy": 0.7435265332460403, + "num_tokens": 2385324.0, "step": 64 }, { - "entropy": 0.6064505577087402, - "epoch": 1.205607476635514, - "grad_norm": 0.028204405680298805, + "entropy": 0.6421113535761833, + "epoch": 0.42173560421735606, + "grad_norm": 0.011578400619328022, "learning_rate": 0.0002, - "loss": 0.602495551109314, - "mean_token_accuracy": 0.758506640791893, - "num_tokens": 5099429.0, + "loss": 0.640021800994873, + "mean_token_accuracy": 0.7417890876531601, + "num_tokens": 2422386.0, "step": 65 }, { - "entropy": 0.6176208853721619, - "epoch": 1.2242990654205608, - "grad_norm": 0.0220986045897007, + "entropy": 0.6243318468332291, + "epoch": 0.4282238442822384, + "grad_norm": 0.01271536760032177, "learning_rate": 0.0002, - "loss": 0.6151657104492188, - "mean_token_accuracy": 0.7535989731550217, - "num_tokens": 5176684.0, + "loss": 0.6278913617134094, + "mean_token_accuracy": 0.7464011386036873, + "num_tokens": 2459184.0, "step": 66 }, { - "entropy": 0.5883279144763947, - "epoch": 1.2429906542056075, - "grad_norm": 0.02462647296488285, + "entropy": 0.6474096700549126, + "epoch": 0.43471208434712083, + "grad_norm": 0.011297891847789288, "learning_rate": 0.0002, - "loss": 0.5873193144798279, - "mean_token_accuracy": 0.7656737864017487, - "num_tokens": 5256058.0, + "loss": 0.649469256401062, + "mean_token_accuracy": 0.7372781112790108, + "num_tokens": 2496769.0, "step": 67 }, { - "entropy": 0.5964405983686447, - "epoch": 1.2616822429906542, - "grad_norm": 0.027081497013568878, + "entropy": 0.629207618534565, + "epoch": 0.44120032441200324, + "grad_norm": 0.01338763814419508, "learning_rate": 0.0002, - "loss": 0.5986899137496948, - "mean_token_accuracy": 0.7598204612731934, - "num_tokens": 5335338.0, + "loss": 0.6260238885879517, + "mean_token_accuracy": 0.7460990995168686, + "num_tokens": 2533774.0, "step": 68 }, { - "entropy": 0.595260500907898, - "epoch": 1.280373831775701, - "grad_norm": 0.02198946289718151, + "entropy": 0.6363127902150154, + "epoch": 0.44768856447688565, + "grad_norm": 0.01232822984457016, "learning_rate": 0.0002, - "loss": 0.5952171087265015, - "mean_token_accuracy": 0.7604967951774597, - "num_tokens": 5413582.0, + "loss": 0.6326106786727905, + "mean_token_accuracy": 0.7443196326494217, + "num_tokens": 2570775.0, "step": 69 }, { - "entropy": 0.5949370414018631, - "epoch": 1.2990654205607477, - "grad_norm": 0.027311844751238823, + "entropy": 0.632358968257904, + "epoch": 0.45417680454176806, + "grad_norm": 0.012171111069619656, "learning_rate": 0.0002, - "loss": 0.5914739370346069, - "mean_token_accuracy": 0.763220340013504, - "num_tokens": 5492704.0, + "loss": 0.6312543749809265, + "mean_token_accuracy": 0.745995283126831, + "num_tokens": 2608121.0, "step": 70 }, { - "entropy": 0.6006052494049072, - "epoch": 1.3177570093457944, - "grad_norm": 0.021869085729122162, + "entropy": 0.6332346796989441, + "epoch": 0.4606650446066504, + "grad_norm": 0.015379011631011963, "learning_rate": 0.0002, - "loss": 0.5958817601203918, - "mean_token_accuracy": 0.759731113910675, - "num_tokens": 5571133.0, + "loss": 0.6291565299034119, + "mean_token_accuracy": 0.7465488314628601, + "num_tokens": 2645664.0, "step": 71 }, { - "entropy": 0.6128104329109192, - "epoch": 1.3364485981308412, - "grad_norm": 0.026876263320446014, + "entropy": 0.6404105871915817, + "epoch": 0.46715328467153283, + "grad_norm": 0.011988981626927853, "learning_rate": 0.0002, - "loss": 0.612541913986206, - "mean_token_accuracy": 0.7541105449199677, - "num_tokens": 5648947.0, + "loss": 0.642942488193512, + "mean_token_accuracy": 0.7407120391726494, + "num_tokens": 2683394.0, "step": 72 }, { - "entropy": 0.6033170968294144, - "epoch": 1.355140186915888, - "grad_norm": 0.026047907769680023, + "entropy": 0.6460321098566055, + "epoch": 0.47364152473641524, + "grad_norm": 0.013498514890670776, "learning_rate": 0.0002, - "loss": 0.6022995114326477, - "mean_token_accuracy": 0.7580565810203552, - "num_tokens": 5727865.0, + "loss": 0.6516697406768799, + "mean_token_accuracy": 0.7381351664662361, + "num_tokens": 2720891.0, "step": 73 }, { - "entropy": 0.597144678235054, - "epoch": 1.3738317757009346, - "grad_norm": 0.02528836391866207, + "entropy": 0.6352040842175484, + "epoch": 0.48012976480129765, + "grad_norm": 0.013542759232223034, "learning_rate": 0.0002, - "loss": 0.5937597751617432, - "mean_token_accuracy": 0.761174738407135, - "num_tokens": 5806694.0, + "loss": 0.6443178653717041, + "mean_token_accuracy": 0.7414710223674774, + "num_tokens": 2758174.0, "step": 74 }, { - "entropy": 0.601003110408783, - "epoch": 1.3925233644859814, - "grad_norm": 0.024352161213755608, + "entropy": 0.6283697411417961, + "epoch": 0.48661800486618007, + "grad_norm": 0.014966949820518494, "learning_rate": 0.0002, - "loss": 0.5970538258552551, - "mean_token_accuracy": 0.7603916376829147, - "num_tokens": 5886675.0, + "loss": 0.6394721269607544, + "mean_token_accuracy": 0.7419639229774475, + "num_tokens": 2795106.0, "step": 75 }, { - "entropy": 0.6055264323949814, - "epoch": 1.411214953271028, - "grad_norm": 0.02295341156423092, + "entropy": 0.642236091196537, + "epoch": 0.4931062449310625, + "grad_norm": 0.015388374216854572, "learning_rate": 0.0002, - "loss": 0.6047403812408447, - "mean_token_accuracy": 0.7562543004751205, - "num_tokens": 5966272.0, + "loss": 0.6414813995361328, + "mean_token_accuracy": 0.7409433200955391, + "num_tokens": 2832247.0, "step": 76 }, { - "entropy": 0.6091946959495544, - "epoch": 1.4299065420560748, - "grad_norm": 0.027446286752820015, + "entropy": 0.6422772705554962, + "epoch": 0.49959448499594483, + "grad_norm": 0.013754413463175297, "learning_rate": 0.0002, - "loss": 0.6084959506988525, - "mean_token_accuracy": 0.7555825561285019, - "num_tokens": 6044286.0, + "loss": 0.6367785930633545, + "mean_token_accuracy": 0.7442163750529289, + "num_tokens": 2869526.0, "step": 77 }, { - "entropy": 0.6051345616579056, - "epoch": 1.4485981308411215, - "grad_norm": 0.02242988348007202, + "entropy": 0.653985932469368, + "epoch": 0.5060827250608273, + "grad_norm": 0.012936330400407314, "learning_rate": 0.0002, - "loss": 0.6049442291259766, - "mean_token_accuracy": 0.7556533664464951, - "num_tokens": 6123208.0, + "loss": 0.6488639712333679, + "mean_token_accuracy": 0.7398064211010933, + "num_tokens": 2906821.0, "step": 78 }, { - "entropy": 0.6011074483394623, - "epoch": 1.4672897196261683, - "grad_norm": 0.023782888427376747, + "entropy": 0.6418487578630447, + "epoch": 0.5125709651257097, + "grad_norm": 0.011183886788785458, "learning_rate": 0.0002, - "loss": 0.596901535987854, - "mean_token_accuracy": 0.7608011811971664, - "num_tokens": 6202897.0, + "loss": 0.639202356338501, + "mean_token_accuracy": 0.7434348165988922, + "num_tokens": 2944032.0, "step": 79 }, { - "entropy": 0.5916998535394669, - "epoch": 1.485981308411215, - "grad_norm": 0.022254550829529762, + "entropy": 0.6251209825277328, + "epoch": 0.519059205190592, + "grad_norm": 0.013851741328835487, "learning_rate": 0.0002, - "loss": 0.5927384495735168, - "mean_token_accuracy": 0.7623648941516876, - "num_tokens": 6281706.0, + "loss": 0.6242102384567261, + "mean_token_accuracy": 0.7505335137248039, + "num_tokens": 2981414.0, "step": 80 }, { - "entropy": 0.6035054922103882, - "epoch": 1.5046728971962615, - "grad_norm": 0.02131548523902893, + "entropy": 0.6139597967267036, + "epoch": 0.5255474452554745, + "grad_norm": 0.013575786724686623, "learning_rate": 0.0002, - "loss": 0.6067797541618347, - "mean_token_accuracy": 0.755115196108818, - "num_tokens": 6361239.0, + "loss": 0.6168844699859619, + "mean_token_accuracy": 0.7502986714243889, + "num_tokens": 3018494.0, "step": 81 }, { - "entropy": 0.6077107489109039, - "epoch": 1.5233644859813085, - "grad_norm": 0.025049913674592972, + "entropy": 0.6357163935899734, + "epoch": 0.5320356853203568, + "grad_norm": 0.012106247246265411, "learning_rate": 0.0002, - "loss": 0.6130092144012451, - "mean_token_accuracy": 0.7551602274179459, - "num_tokens": 6439682.0, + "loss": 0.6393176317214966, + "mean_token_accuracy": 0.743524856865406, + "num_tokens": 3055667.0, "step": 82 }, { - "entropy": 0.602842390537262, - "epoch": 1.542056074766355, - "grad_norm": 0.02274921163916588, + "entropy": 0.630703866481781, + "epoch": 0.5385239253852393, + "grad_norm": 0.011411616578698158, "learning_rate": 0.0002, - "loss": 0.6033390164375305, - "mean_token_accuracy": 0.7566068917512894, - "num_tokens": 6517795.0, + "loss": 0.6349452137947083, + "mean_token_accuracy": 0.7417918294668198, + "num_tokens": 3092980.0, "step": 83 }, { - "entropy": 0.5934896320104599, - "epoch": 1.560747663551402, - "grad_norm": 0.019730787724256516, + "entropy": 0.6312713250517845, + "epoch": 0.5450121654501217, + "grad_norm": 0.013269394636154175, "learning_rate": 0.0002, - "loss": 0.5883506536483765, - "mean_token_accuracy": 0.763173297047615, - "num_tokens": 6597109.0, + "loss": 0.6335923075675964, + "mean_token_accuracy": 0.7427873983979225, + "num_tokens": 3129991.0, "step": 84 }, { - "entropy": 0.5969595015048981, - "epoch": 1.5794392523364484, - "grad_norm": 0.023908721283078194, + "entropy": 0.6429375261068344, + "epoch": 0.551500405515004, + "grad_norm": 0.01290512178093195, "learning_rate": 0.0002, - "loss": 0.5954324007034302, - "mean_token_accuracy": 0.7612140029668808, - "num_tokens": 6676983.0, + "loss": 0.6390902996063232, + "mean_token_accuracy": 0.7440147623419762, + "num_tokens": 3167600.0, "step": 85 }, { - "entropy": 0.583121731877327, - "epoch": 1.5981308411214954, - "grad_norm": 0.020361311733722687, + "entropy": 0.6209964007139206, + "epoch": 0.5579886455798865, + "grad_norm": 0.011449260637164116, "learning_rate": 0.0002, - "loss": 0.5792651176452637, - "mean_token_accuracy": 0.7673831284046173, - "num_tokens": 6756180.0, + "loss": 0.6205590963363647, + "mean_token_accuracy": 0.7478290274739265, + "num_tokens": 3204616.0, "step": 86 }, { - "entropy": 0.5962767004966736, - "epoch": 1.616822429906542, - "grad_norm": 0.021907050162553787, + "entropy": 0.6387689039111137, + "epoch": 0.5644768856447688, + "grad_norm": 0.012288929894566536, "learning_rate": 0.0002, - "loss": 0.5951491594314575, - "mean_token_accuracy": 0.7604141533374786, - "num_tokens": 6835203.0, + "loss": 0.6413038372993469, + "mean_token_accuracy": 0.7402090132236481, + "num_tokens": 3241598.0, "step": 87 }, { - "entropy": 0.5975628942251205, - "epoch": 1.6355140186915889, - "grad_norm": 0.025554567575454712, + "entropy": 0.6296097934246063, + "epoch": 0.5709651257096513, + "grad_norm": 0.012685527093708515, "learning_rate": 0.0002, - "loss": 0.5959036350250244, - "mean_token_accuracy": 0.7604859173297882, - "num_tokens": 6914015.0, + "loss": 0.6300569772720337, + "mean_token_accuracy": 0.745740607380867, + "num_tokens": 3278904.0, "step": 88 }, { - "entropy": 0.5989606827497482, - "epoch": 1.6542056074766354, - "grad_norm": 0.01990366540849209, + "entropy": 0.6304027885198593, + "epoch": 0.5774533657745337, + "grad_norm": 0.012135171331465244, "learning_rate": 0.0002, - "loss": 0.5967363119125366, - "mean_token_accuracy": 0.7600581496953964, - "num_tokens": 6993444.0, + "loss": 0.6322764158248901, + "mean_token_accuracy": 0.7428491413593292, + "num_tokens": 3315916.0, "step": 89 }, { - "entropy": 0.5878342539072037, - "epoch": 1.6728971962616823, - "grad_norm": 0.0246729776263237, + "entropy": 0.6270208656787872, + "epoch": 0.583941605839416, + "grad_norm": 0.012634403072297573, "learning_rate": 0.0002, - "loss": 0.5855717062950134, - "mean_token_accuracy": 0.7647435963153839, - "num_tokens": 7073123.0, + "loss": 0.6289095878601074, + "mean_token_accuracy": 0.74432173371315, + "num_tokens": 3352975.0, "step": 90 }, { - "entropy": 0.5907899141311646, - "epoch": 1.6915887850467288, - "grad_norm": 0.01860217936336994, + "entropy": 0.6426985636353493, + "epoch": 0.5904298459042985, + "grad_norm": 0.012899120338261127, "learning_rate": 0.0002, - "loss": 0.5894824266433716, - "mean_token_accuracy": 0.7620080858469009, - "num_tokens": 7152412.0, + "loss": 0.6412180662155151, + "mean_token_accuracy": 0.7413002401590347, + "num_tokens": 3390460.0, "step": 91 }, { - "entropy": 0.5949963480234146, - "epoch": 1.7102803738317758, - "grad_norm": 0.02079867199063301, + "entropy": 0.6386194601655006, + "epoch": 0.5969180859691808, + "grad_norm": 0.011871455237269402, "learning_rate": 0.0002, - "loss": 0.5942832231521606, - "mean_token_accuracy": 0.7613794505596161, - "num_tokens": 7231659.0, + "loss": 0.6381049156188965, + "mean_token_accuracy": 0.7410541325807571, + "num_tokens": 3427650.0, "step": 92 }, { - "entropy": 0.603457123041153, - "epoch": 1.7289719626168223, - "grad_norm": 0.021803148090839386, + "entropy": 0.6219398155808449, + "epoch": 0.6034063260340633, + "grad_norm": 0.013389634899795055, "learning_rate": 0.0002, - "loss": 0.6034700274467468, - "mean_token_accuracy": 0.7573578655719757, - "num_tokens": 7308587.0, + "loss": 0.628428041934967, + "mean_token_accuracy": 0.7469312027096748, + "num_tokens": 3464664.0, "step": 93 }, { - "entropy": 0.6119105815887451, - "epoch": 1.7476635514018692, - "grad_norm": 0.025299299508333206, + "entropy": 0.6363367736339569, + "epoch": 0.6098945660989457, + "grad_norm": 0.010384561493992805, "learning_rate": 0.0002, - "loss": 0.6091461777687073, - "mean_token_accuracy": 0.7555771619081497, - "num_tokens": 7387591.0, + "loss": 0.6355550289154053, + "mean_token_accuracy": 0.742337591946125, + "num_tokens": 3502010.0, "step": 94 }, { - "entropy": 0.6056051701307297, - "epoch": 1.7663551401869158, - "grad_norm": 0.021394768729805946, + "entropy": 0.6357248276472092, + "epoch": 0.616382806163828, + "grad_norm": 0.010791895911097527, "learning_rate": 0.0002, - "loss": 0.5999703407287598, - "mean_token_accuracy": 0.7588638365268707, - "num_tokens": 7466317.0, + "loss": 0.6378734111785889, + "mean_token_accuracy": 0.7428740784525871, + "num_tokens": 3539472.0, "step": 95 }, { - "entropy": 0.5954627841711044, - "epoch": 1.7850467289719627, - "grad_norm": 0.02461361326277256, + "entropy": 0.6360966116189957, + "epoch": 0.6228710462287105, + "grad_norm": 0.010037368163466454, "learning_rate": 0.0002, - "loss": 0.5979853272438049, - "mean_token_accuracy": 0.75945945084095, - "num_tokens": 7546769.0, + "loss": 0.6382291316986084, + "mean_token_accuracy": 0.7439633831381798, + "num_tokens": 3576863.0, "step": 96 }, { - "entropy": 0.5966174304485321, - "epoch": 1.8037383177570092, - "grad_norm": 0.025569939985871315, + "entropy": 0.6299866884946823, + "epoch": 0.6293592862935928, + "grad_norm": 0.011554226279258728, "learning_rate": 0.0002, - "loss": 0.6006815433502197, - "mean_token_accuracy": 0.7578661143779755, - "num_tokens": 7624681.0, + "loss": 0.6333507895469666, + "mean_token_accuracy": 0.7430082336068153, + "num_tokens": 3613859.0, "step": 97 }, { - "entropy": 0.594436764717102, - "epoch": 1.8224299065420562, - "grad_norm": 0.020345669239759445, + "entropy": 0.6372612193226814, + "epoch": 0.6358475263584753, + "grad_norm": 0.012070685625076294, "learning_rate": 0.0002, - "loss": 0.597395122051239, - "mean_token_accuracy": 0.7583171874284744, - "num_tokens": 7703257.0, + "loss": 0.6347473859786987, + "mean_token_accuracy": 0.7440797835588455, + "num_tokens": 3651376.0, "step": 98 }, { - "entropy": 0.6004362404346466, - "epoch": 1.8411214953271027, - "grad_norm": 0.026212656870484352, + "entropy": 0.6408236473798752, + "epoch": 0.6423357664233577, + "grad_norm": 0.010936851613223553, "learning_rate": 0.0002, - "loss": 0.5976188778877258, - "mean_token_accuracy": 0.7598545700311661, - "num_tokens": 7781455.0, + "loss": 0.6386737823486328, + "mean_token_accuracy": 0.7431015446782112, + "num_tokens": 3688847.0, "step": 99 }, { - "entropy": 0.6042353212833405, - "epoch": 1.8598130841121496, - "grad_norm": 0.02437760680913925, + "entropy": 0.6442330852150917, + "epoch": 0.64882400648824, + "grad_norm": 0.01024035457521677, "learning_rate": 0.0002, - "loss": 0.6001909971237183, - "mean_token_accuracy": 0.7570216208696365, - "num_tokens": 7860292.0, + "loss": 0.6463708877563477, + "mean_token_accuracy": 0.7389701902866364, + "num_tokens": 3726347.0, "step": 100 }, { - "entropy": 0.6039856970310211, - "epoch": 1.8785046728971961, - "grad_norm": 0.02607814036309719, + "entropy": 0.6199506223201752, + "epoch": 0.6553122465531225, + "grad_norm": 0.01070485170930624, "learning_rate": 0.0002, - "loss": 0.5982059240341187, - "mean_token_accuracy": 0.7589994370937347, - "num_tokens": 7939144.0, + "loss": 0.6225665807723999, + "mean_token_accuracy": 0.7488372325897217, + "num_tokens": 3763687.0, "step": 101 }, { - "entropy": 0.595164492726326, - "epoch": 1.897196261682243, - "grad_norm": 0.020943354815244675, + "entropy": 0.6321059763431549, + "epoch": 0.6618004866180048, + "grad_norm": 0.010497628711163998, "learning_rate": 0.0002, - "loss": 0.593543291091919, - "mean_token_accuracy": 0.7612017840147018, - "num_tokens": 8018850.0, + "loss": 0.6386170387268066, + "mean_token_accuracy": 0.7398883476853371, + "num_tokens": 3801390.0, "step": 102 }, { - "entropy": 0.5922124683856964, - "epoch": 1.9158878504672896, - "grad_norm": 0.021710926666855812, + "entropy": 0.6317892819643021, + "epoch": 0.6682887266828873, + "grad_norm": 0.009558591060340405, "learning_rate": 0.0002, - "loss": 0.5924748182296753, - "mean_token_accuracy": 0.7613015025854111, - "num_tokens": 8097651.0, + "loss": 0.6320483684539795, + "mean_token_accuracy": 0.744752362370491, + "num_tokens": 3838836.0, "step": 103 }, { - "entropy": 0.5902406722307205, - "epoch": 1.9345794392523366, - "grad_norm": 0.02682112529873848, + "entropy": 0.6251348331570625, + "epoch": 0.6747769667477697, + "grad_norm": 0.012168657965958118, "learning_rate": 0.0002, - "loss": 0.5906952023506165, - "mean_token_accuracy": 0.7610596120357513, - "num_tokens": 8175432.0, + "loss": 0.624641478061676, + "mean_token_accuracy": 0.7455502301454544, + "num_tokens": 3876059.0, "step": 104 }, { - "entropy": 0.5985020995140076, - "epoch": 1.953271028037383, - "grad_norm": 0.021625829860568047, + "entropy": 0.6264195889234543, + "epoch": 0.681265206812652, + "grad_norm": 0.01135180238634348, "learning_rate": 0.0002, - "loss": 0.5948777198791504, - "mean_token_accuracy": 0.7605670243501663, - "num_tokens": 8254517.0, + "loss": 0.6254705190658569, + "mean_token_accuracy": 0.7437941655516624, + "num_tokens": 3913140.0, "step": 105 }, { - "entropy": 0.592091292142868, - "epoch": 1.97196261682243, - "grad_norm": 0.026733042672276497, + "entropy": 0.6271661967039108, + "epoch": 0.6877534468775345, + "grad_norm": 0.011404785327613354, "learning_rate": 0.0002, - "loss": 0.5928829908370972, - "mean_token_accuracy": 0.7605357766151428, - "num_tokens": 8332655.0, + "loss": 0.627234160900116, + "mean_token_accuracy": 0.7443915233016014, + "num_tokens": 3950197.0, "step": 106 }, { - "entropy": 0.602226734161377, - "epoch": 1.9906542056074765, - "grad_norm": 0.024320000782608986, + "entropy": 0.6316048800945282, + "epoch": 0.6942416869424168, + "grad_norm": 0.012731475755572319, "learning_rate": 0.0002, - "loss": 0.6039963960647583, - "mean_token_accuracy": 0.7566654533147812, - "num_tokens": 8411757.0, + "loss": 0.631871223449707, + "mean_token_accuracy": 0.7436823844909668, + "num_tokens": 3987880.0, "step": 107 }, { - "entropy": 0.5967253148555756, - "epoch": 2.0, - "grad_norm": 0.024751760065555573, + "entropy": 0.6351677849888802, + "epoch": 0.7007299270072993, + "grad_norm": 0.011057685129344463, "learning_rate": 0.0002, - "loss": 0.5935255885124207, - "mean_token_accuracy": 0.7621923387050629, - "num_tokens": 8450525.0, + "loss": 0.634377121925354, + "mean_token_accuracy": 0.7431640774011612, + "num_tokens": 4025490.0, "step": 108 }, { - "entropy": 0.5986887663602829, - "epoch": 2.0186915887850465, - "grad_norm": 0.023288823664188385, + "entropy": 0.6258664429187775, + "epoch": 0.7072181670721817, + "grad_norm": 0.012130603194236755, "learning_rate": 0.0002, - "loss": 0.5900849103927612, - "mean_token_accuracy": 0.7628316581249237, - "num_tokens": 8529518.0, + "loss": 0.628970742225647, + "mean_token_accuracy": 0.7431703954935074, + "num_tokens": 4062925.0, "step": 109 }, { - "entropy": 0.6044819355010986, - "epoch": 2.0373831775700935, - "grad_norm": 0.028756342828273773, + "entropy": 0.6371812373399734, + "epoch": 0.7137064071370641, + "grad_norm": 0.01057880837470293, "learning_rate": 0.0002, - "loss": 0.5983761548995972, - "mean_token_accuracy": 0.7610821276903152, - "num_tokens": 8608171.0, + "loss": 0.6419240236282349, + "mean_token_accuracy": 0.7392893806099892, + "num_tokens": 4100176.0, "step": 110 }, { - "entropy": 0.5922483056783676, - "epoch": 2.05607476635514, - "grad_norm": 0.0210813470184803, + "entropy": 0.6297428086400032, + "epoch": 0.7201946472019465, + "grad_norm": 0.01054214034229517, "learning_rate": 0.0002, - "loss": 0.5954931974411011, - "mean_token_accuracy": 0.7605789005756378, - "num_tokens": 8687290.0, + "loss": 0.6334270238876343, + "mean_token_accuracy": 0.7451630085706711, + "num_tokens": 4137649.0, "step": 111 }, { - "entropy": 0.5983303636312485, - "epoch": 2.074766355140187, - "grad_norm": 0.028979478403925896, + "entropy": 0.6174112483859062, + "epoch": 0.7266828872668288, + "grad_norm": 0.01192370243370533, "learning_rate": 0.0002, - "loss": 0.603399395942688, - "mean_token_accuracy": 0.7568083107471466, - "num_tokens": 8766472.0, + "loss": 0.6196002960205078, + "mean_token_accuracy": 0.748643770813942, + "num_tokens": 4174992.0, "step": 112 }, { - "entropy": 0.5887072533369064, - "epoch": 2.0934579439252334, - "grad_norm": 0.026534179225564003, + "entropy": 0.6409988701343536, + "epoch": 0.7331711273317113, + "grad_norm": 0.012110228650271893, "learning_rate": 0.0002, - "loss": 0.5949929356575012, - "mean_token_accuracy": 0.7597325891256332, - "num_tokens": 8846053.0, + "loss": 0.6420451402664185, + "mean_token_accuracy": 0.7404038235545158, + "num_tokens": 4212392.0, "step": 113 }, { - "entropy": 0.5866035968065262, - "epoch": 2.1121495327102804, - "grad_norm": 0.022542569786310196, + "entropy": 0.6189580634236336, + "epoch": 0.7396593673965937, + "grad_norm": 0.010546376928687096, "learning_rate": 0.0002, - "loss": 0.5825520157814026, - "mean_token_accuracy": 0.7647050321102142, - "num_tokens": 8924770.0, + "loss": 0.6227763891220093, + "mean_token_accuracy": 0.7471738830208778, + "num_tokens": 4249387.0, "step": 114 }, { - "entropy": 0.6025423407554626, - "epoch": 2.130841121495327, - "grad_norm": 0.02788623608648777, + "entropy": 0.6477556005120277, + "epoch": 0.7461476074614761, + "grad_norm": 0.012936307117342949, "learning_rate": 0.0002, - "loss": 0.5966792106628418, - "mean_token_accuracy": 0.7595364600419998, - "num_tokens": 9003585.0, + "loss": 0.6444486379623413, + "mean_token_accuracy": 0.7407133355736732, + "num_tokens": 4286813.0, "step": 115 }, { - "entropy": 0.5885701924562454, - "epoch": 2.149532710280374, - "grad_norm": 0.02178538590669632, + "entropy": 0.6388062611222267, + "epoch": 0.7526358475263585, + "grad_norm": 0.011020737700164318, "learning_rate": 0.0002, - "loss": 0.58498215675354, - "mean_token_accuracy": 0.7650727927684784, - "num_tokens": 9082999.0, + "loss": 0.6358926892280579, + "mean_token_accuracy": 0.7421080470085144, + "num_tokens": 4324068.0, "step": 116 }, { - "entropy": 0.600003108382225, - "epoch": 2.1682242990654204, - "grad_norm": 0.026978863403201103, + "entropy": 0.623978279531002, + "epoch": 0.7591240875912408, + "grad_norm": 0.011272276751697063, "learning_rate": 0.0002, - "loss": 0.6022127866744995, - "mean_token_accuracy": 0.7581324279308319, - "num_tokens": 9161688.0, + "loss": 0.6239657402038574, + "mean_token_accuracy": 0.7491330280900002, + "num_tokens": 4361117.0, "step": 117 }, { - "entropy": 0.5930540412664413, - "epoch": 2.1869158878504673, - "grad_norm": 0.025554828345775604, + "entropy": 0.6343322321772575, + "epoch": 0.7656123276561233, + "grad_norm": 0.011995693668723106, "learning_rate": 0.0002, - "loss": 0.5951005816459656, - "mean_token_accuracy": 0.7604358941316605, - "num_tokens": 9240469.0, + "loss": 0.635836124420166, + "mean_token_accuracy": 0.7406070083379745, + "num_tokens": 4398800.0, "step": 118 }, { - "entropy": 0.5965612530708313, - "epoch": 2.205607476635514, - "grad_norm": 0.020386407151818275, + "entropy": 0.6236653178930283, + "epoch": 0.7721005677210057, + "grad_norm": 0.012621116824448109, "learning_rate": 0.0002, - "loss": 0.5925002098083496, - "mean_token_accuracy": 0.7609757632017136, - "num_tokens": 9319306.0, + "loss": 0.6293167471885681, + "mean_token_accuracy": 0.7453652620315552, + "num_tokens": 4435941.0, "step": 119 }, { - "entropy": 0.5974278450012207, - "epoch": 2.2242990654205608, - "grad_norm": 0.02594870701432228, + "entropy": 0.6156119927763939, + "epoch": 0.7785888077858881, + "grad_norm": 0.010849852114915848, "learning_rate": 0.0002, - "loss": 0.5941160917282104, - "mean_token_accuracy": 0.760003000497818, - "num_tokens": 9399792.0, + "loss": 0.619170069694519, + "mean_token_accuracy": 0.7481161803007126, + "num_tokens": 4473532.0, "step": 120 }, { - "entropy": 0.6072829514741898, - "epoch": 2.2429906542056073, - "grad_norm": 0.022801121696829796, + "entropy": 0.6325643733143806, + "epoch": 0.7850770478507705, + "grad_norm": 0.012033924460411072, "learning_rate": 0.0002, - "loss": 0.6069557070732117, - "mean_token_accuracy": 0.7553433626890182, - "num_tokens": 9477182.0, + "loss": 0.6320570707321167, + "mean_token_accuracy": 0.745756022632122, + "num_tokens": 4510663.0, "step": 121 }, { - "entropy": 0.5936979353427887, - "epoch": 2.2616822429906542, - "grad_norm": 0.019751207903027534, + "entropy": 0.6439174935221672, + "epoch": 0.7915652879156528, + "grad_norm": 0.011160428635776043, "learning_rate": 0.0002, - "loss": 0.5905026197433472, - "mean_token_accuracy": 0.7626521587371826, - "num_tokens": 9556043.0, + "loss": 0.6456828117370605, + "mean_token_accuracy": 0.7372104227542877, + "num_tokens": 4548366.0, "step": 122 }, { - "entropy": 0.5964563935995102, - "epoch": 2.2803738317757007, - "grad_norm": 0.021466070786118507, + "entropy": 0.614606499671936, + "epoch": 0.7980535279805353, + "grad_norm": 0.012264038436114788, "learning_rate": 0.0002, - "loss": 0.5965335369110107, - "mean_token_accuracy": 0.7616595923900604, - "num_tokens": 9636288.0, + "loss": 0.6181074976921082, + "mean_token_accuracy": 0.7488836497068405, + "num_tokens": 4585220.0, "step": 123 }, { - "entropy": 0.5857243090867996, - "epoch": 2.2990654205607477, - "grad_norm": 0.02454223297536373, + "entropy": 0.6238071173429489, + "epoch": 0.8045417680454177, + "grad_norm": 0.010948721319437027, "learning_rate": 0.0002, - "loss": 0.5892512798309326, - "mean_token_accuracy": 0.762162521481514, - "num_tokens": 9715788.0, + "loss": 0.6282123327255249, + "mean_token_accuracy": 0.7447341307997704, + "num_tokens": 4622594.0, "step": 124 }, { - "entropy": 0.5936813354492188, - "epoch": 2.317757009345794, - "grad_norm": 0.019078049808740616, + "entropy": 0.6207244768738747, + "epoch": 0.8110300081103001, + "grad_norm": 0.011111956089735031, "learning_rate": 0.0002, - "loss": 0.5922213792800903, - "mean_token_accuracy": 0.7600427120923996, - "num_tokens": 9793512.0, + "loss": 0.6224273443222046, + "mean_token_accuracy": 0.748368538916111, + "num_tokens": 4659890.0, "step": 125 }, { - "entropy": 0.5969529002904892, - "epoch": 2.336448598130841, - "grad_norm": 0.019933439791202545, + "entropy": 0.6334651708602905, + "epoch": 0.8175182481751825, + "grad_norm": 0.01036700326949358, "learning_rate": 0.0002, - "loss": 0.5948631763458252, - "mean_token_accuracy": 0.7603116780519485, - "num_tokens": 9871266.0, + "loss": 0.6354086399078369, + "mean_token_accuracy": 0.742103323340416, + "num_tokens": 4697214.0, "step": 126 }, { - "entropy": 0.6052633076906204, - "epoch": 2.3551401869158877, - "grad_norm": 0.02256905473768711, + "entropy": 0.6321412995457649, + "epoch": 0.8240064882400648, + "grad_norm": 0.011659913696348667, "learning_rate": 0.0002, - "loss": 0.6023162603378296, - "mean_token_accuracy": 0.7571097612380981, - "num_tokens": 9951361.0, + "loss": 0.632038950920105, + "mean_token_accuracy": 0.7430339977145195, + "num_tokens": 4734306.0, "step": 127 }, { - "entropy": 0.5992947816848755, - "epoch": 2.3738317757009346, - "grad_norm": 0.019124582409858704, + "entropy": 0.6252134963870049, + "epoch": 0.8304947283049473, + "grad_norm": 0.010766416788101196, "learning_rate": 0.0002, - "loss": 0.59776771068573, - "mean_token_accuracy": 0.7580797523260117, - "num_tokens": 10030704.0, + "loss": 0.6210082173347473, + "mean_token_accuracy": 0.747887596487999, + "num_tokens": 4772005.0, "step": 128 }, { - "entropy": 0.5913878232240677, - "epoch": 2.392523364485981, - "grad_norm": 0.020428184419870377, + "entropy": 0.632231742143631, + "epoch": 0.8369829683698297, + "grad_norm": 0.009685291908681393, "learning_rate": 0.0002, - "loss": 0.5932009220123291, - "mean_token_accuracy": 0.7593762278556824, - "num_tokens": 10109097.0, + "loss": 0.6338882446289062, + "mean_token_accuracy": 0.7436560764908791, + "num_tokens": 4809261.0, "step": 129 }, { - "entropy": 0.5881628692150116, - "epoch": 2.411214953271028, - "grad_norm": 0.019032983109354973, + "entropy": 0.6244007870554924, + "epoch": 0.8434712084347121, + "grad_norm": 0.011300327256321907, "learning_rate": 0.0002, - "loss": 0.5873616933822632, - "mean_token_accuracy": 0.7626058608293533, - "num_tokens": 10189819.0, + "loss": 0.6297156810760498, + "mean_token_accuracy": 0.7441424131393433, + "num_tokens": 4846773.0, "step": 130 }, { - "entropy": 0.5958539843559265, - "epoch": 2.4299065420560746, - "grad_norm": 0.022081410512328148, + "entropy": 0.6212883591651917, + "epoch": 0.8499594484995945, + "grad_norm": 0.011122049763798714, "learning_rate": 0.0002, - "loss": 0.5977240800857544, - "mean_token_accuracy": 0.7586192786693573, - "num_tokens": 10268190.0, + "loss": 0.6272852420806885, + "mean_token_accuracy": 0.745480865240097, + "num_tokens": 4884087.0, "step": 131 }, { - "entropy": 0.5923604220151901, - "epoch": 2.4485981308411215, - "grad_norm": 0.018967753276228905, + "entropy": 0.6275059729814529, + "epoch": 0.8564476885644768, + "grad_norm": 0.011759513057768345, "learning_rate": 0.0002, - "loss": 0.5907920598983765, - "mean_token_accuracy": 0.7627393752336502, - "num_tokens": 10345719.0, + "loss": 0.6352666020393372, + "mean_token_accuracy": 0.741997979581356, + "num_tokens": 4921034.0, "step": 132 }, { - "entropy": 0.5843045115470886, - "epoch": 2.467289719626168, - "grad_norm": 0.02031179890036583, + "entropy": 0.6292549446225166, + "epoch": 0.8629359286293593, + "grad_norm": 0.010103589855134487, "learning_rate": 0.0002, - "loss": 0.5829470157623291, - "mean_token_accuracy": 0.7647084146738052, - "num_tokens": 10424933.0, + "loss": 0.6285660862922668, + "mean_token_accuracy": 0.7458189874887466, + "num_tokens": 4958394.0, "step": 133 }, { - "entropy": 0.596602737903595, - "epoch": 2.485981308411215, - "grad_norm": 0.019796643406152725, + "entropy": 0.6254143863916397, + "epoch": 0.8694241686942417, + "grad_norm": 0.009165394119918346, "learning_rate": 0.0002, - "loss": 0.595852792263031, - "mean_token_accuracy": 0.7595040202140808, - "num_tokens": 10504010.0, + "loss": 0.6281845569610596, + "mean_token_accuracy": 0.7441290989518166, + "num_tokens": 4995560.0, "step": 134 }, { - "entropy": 0.5987847000360489, - "epoch": 2.5046728971962615, - "grad_norm": 0.01805124618113041, + "entropy": 0.6326478272676468, + "epoch": 0.8759124087591241, + "grad_norm": 0.009857391007244587, "learning_rate": 0.0002, - "loss": 0.5960158109664917, - "mean_token_accuracy": 0.7604788392782211, - "num_tokens": 10582414.0, + "loss": 0.6341642141342163, + "mean_token_accuracy": 0.7431726306676865, + "num_tokens": 5032908.0, "step": 135 }, { - "entropy": 0.5917297601699829, - "epoch": 2.5233644859813085, - "grad_norm": 0.021082131192088127, + "entropy": 0.6411951705813408, + "epoch": 0.8824006488240065, + "grad_norm": 0.009912555105984211, "learning_rate": 0.0002, - "loss": 0.5902372598648071, - "mean_token_accuracy": 0.7612239867448807, - "num_tokens": 10661151.0, + "loss": 0.6402624845504761, + "mean_token_accuracy": 0.7418247908353806, + "num_tokens": 5070353.0, "step": 136 }, { - "entropy": 0.5957841575145721, - "epoch": 2.542056074766355, - "grad_norm": 0.019563838839530945, + "entropy": 0.6335436180233955, + "epoch": 0.8888888888888888, + "grad_norm": 0.010203655809164047, "learning_rate": 0.0002, - "loss": 0.5957234501838684, - "mean_token_accuracy": 0.758367732167244, - "num_tokens": 10739185.0, + "loss": 0.6348065137863159, + "mean_token_accuracy": 0.7417963817715645, + "num_tokens": 5107488.0, "step": 137 }, { - "entropy": 0.6024006307125092, - "epoch": 2.560747663551402, - "grad_norm": 0.01933375746011734, + "entropy": 0.6298110708594322, + "epoch": 0.8953771289537713, + "grad_norm": 0.009738304652273655, "learning_rate": 0.0002, - "loss": 0.6043826937675476, - "mean_token_accuracy": 0.7564682364463806, - "num_tokens": 10817785.0, + "loss": 0.6292046904563904, + "mean_token_accuracy": 0.7428107112646103, + "num_tokens": 5144774.0, "step": 138 }, { - "entropy": 0.5953152179718018, - "epoch": 2.5794392523364484, - "grad_norm": 0.020373884588479996, + "entropy": 0.621233694255352, + "epoch": 0.9018653690186537, + "grad_norm": 0.009310460649430752, "learning_rate": 0.0002, - "loss": 0.5951474905014038, - "mean_token_accuracy": 0.759823739528656, - "num_tokens": 10895828.0, + "loss": 0.6167433261871338, + "mean_token_accuracy": 0.7501207813620567, + "num_tokens": 5181712.0, "step": 139 }, { - "entropy": 0.5937645733356476, - "epoch": 2.5981308411214954, - "grad_norm": 0.019647756591439247, + "entropy": 0.6066861748695374, + "epoch": 0.9083536090835361, + "grad_norm": 0.010622376576066017, "learning_rate": 0.0002, - "loss": 0.5909141302108765, - "mean_token_accuracy": 0.7605070471763611, - "num_tokens": 10974768.0, + "loss": 0.6090973615646362, + "mean_token_accuracy": 0.7524907812476158, + "num_tokens": 5219096.0, "step": 140 }, { - "entropy": 0.6062350273132324, - "epoch": 2.616822429906542, - "grad_norm": 0.02389589697122574, + "entropy": 0.6264965310692787, + "epoch": 0.9148418491484185, + "grad_norm": 0.011424071155488491, "learning_rate": 0.0002, - "loss": 0.6018738746643066, - "mean_token_accuracy": 0.7562691420316696, - "num_tokens": 11055326.0, + "loss": 0.6337799429893494, + "mean_token_accuracy": 0.7431259453296661, + "num_tokens": 5256221.0, "step": 141 }, { - "entropy": 0.5986295640468597, - "epoch": 2.635514018691589, - "grad_norm": 0.018676772713661194, + "entropy": 0.6391952782869339, + "epoch": 0.9213300892133008, + "grad_norm": 0.009158595465123653, "learning_rate": 0.0002, - "loss": 0.5976943969726562, - "mean_token_accuracy": 0.758969247341156, - "num_tokens": 11133311.0, + "loss": 0.6384302973747253, + "mean_token_accuracy": 0.7389715909957886, + "num_tokens": 5293696.0, "step": 142 }, { - "entropy": 0.5892178267240524, - "epoch": 2.6542056074766354, - "grad_norm": 0.01959327794611454, + "entropy": 0.6427849903702736, + "epoch": 0.9278183292781833, + "grad_norm": 0.011200455017387867, "learning_rate": 0.0002, - "loss": 0.5930218696594238, - "mean_token_accuracy": 0.7599967420101166, - "num_tokens": 11212924.0, + "loss": 0.6386270523071289, + "mean_token_accuracy": 0.7409881576895714, + "num_tokens": 5330767.0, "step": 143 }, { - "entropy": 0.5876894295215607, - "epoch": 2.6728971962616823, - "grad_norm": 0.02165973000228405, + "entropy": 0.6417384147644043, + "epoch": 0.9343065693430657, + "grad_norm": 0.010727403685450554, "learning_rate": 0.0002, - "loss": 0.5930266976356506, - "mean_token_accuracy": 0.7615959346294403, - "num_tokens": 11292441.0, + "loss": 0.63932865858078, + "mean_token_accuracy": 0.7433461174368858, + "num_tokens": 5368288.0, "step": 144 }, { - "entropy": 0.5921325981616974, - "epoch": 2.691588785046729, - "grad_norm": 0.019541792571544647, + "entropy": 0.6349349692463875, + "epoch": 0.9407948094079481, + "grad_norm": 0.01087568886578083, "learning_rate": 0.0002, - "loss": 0.5935483574867249, - "mean_token_accuracy": 0.7591264247894287, - "num_tokens": 11370065.0, + "loss": 0.6332679986953735, + "mean_token_accuracy": 0.7431394383311272, + "num_tokens": 5405743.0, "step": 145 }, { - "entropy": 0.5976132452487946, - "epoch": 2.710280373831776, - "grad_norm": 0.018777787685394287, + "entropy": 0.6268604248762131, + "epoch": 0.9472830494728305, + "grad_norm": 0.009905870072543621, "learning_rate": 0.0002, - "loss": 0.5930612087249756, - "mean_token_accuracy": 0.7606300711631775, - "num_tokens": 11448141.0, + "loss": 0.6278096437454224, + "mean_token_accuracy": 0.7460607141256332, + "num_tokens": 5442824.0, "step": 146 }, { - "entropy": 0.5865790247917175, - "epoch": 2.7289719626168223, - "grad_norm": 0.019476981833577156, + "entropy": 0.6252990365028381, + "epoch": 0.9537712895377128, + "grad_norm": 0.011337473057210445, "learning_rate": 0.0002, - "loss": 0.584563136100769, - "mean_token_accuracy": 0.7639805823564529, - "num_tokens": 11527975.0, + "loss": 0.6313953399658203, + "mean_token_accuracy": 0.7449029609560966, + "num_tokens": 5480060.0, "step": 147 }, { - "entropy": 0.601652979850769, - "epoch": 2.7476635514018692, - "grad_norm": 0.020754467695951462, + "entropy": 0.6279519572854042, + "epoch": 0.9602595296025953, + "grad_norm": 0.011046580970287323, "learning_rate": 0.0002, - "loss": 0.5971537828445435, - "mean_token_accuracy": 0.7591513991355896, - "num_tokens": 11606011.0, + "loss": 0.6361185312271118, + "mean_token_accuracy": 0.7435570135712624, + "num_tokens": 5517276.0, "step": 148 }, { - "entropy": 0.5934069901704788, - "epoch": 2.7663551401869158, - "grad_norm": 0.0185554176568985, + "entropy": 0.6244647055864334, + "epoch": 0.9667477696674777, + "grad_norm": 0.010344677604734898, "learning_rate": 0.0002, - "loss": 0.5921209454536438, - "mean_token_accuracy": 0.7602465599775314, - "num_tokens": 11685000.0, + "loss": 0.6286739110946655, + "mean_token_accuracy": 0.7459346577525139, + "num_tokens": 5554772.0, "step": 149 }, { - "entropy": 0.5966046750545502, - "epoch": 2.7850467289719627, - "grad_norm": 0.022011004388332367, + "entropy": 0.625552199780941, + "epoch": 0.9732360097323601, + "grad_norm": 0.010485424660146236, "learning_rate": 0.0002, - "loss": 0.6005374789237976, - "mean_token_accuracy": 0.7573995739221573, - "num_tokens": 11763461.0, + "loss": 0.6246562600135803, + "mean_token_accuracy": 0.7459065243601799, + "num_tokens": 5592235.0, "step": 150 }, { - "entropy": 0.5875833630561829, - "epoch": 2.803738317757009, - "grad_norm": 0.021797338500618935, + "entropy": 0.650402158498764, + "epoch": 0.9797242497972425, + "grad_norm": 0.01180343609303236, "learning_rate": 0.0002, - "loss": 0.5878199338912964, - "mean_token_accuracy": 0.7617918699979782, - "num_tokens": 11841433.0, + "loss": 0.6489013433456421, + "mean_token_accuracy": 0.7372798472642899, + "num_tokens": 5629879.0, "step": 151 }, { - "entropy": 0.5691852122545242, - "epoch": 2.822429906542056, - "grad_norm": 0.019778162240982056, + "entropy": 0.625130906701088, + "epoch": 0.986212489862125, + "grad_norm": 0.010784060694277287, "learning_rate": 0.0002, - "loss": 0.5664920210838318, - "mean_token_accuracy": 0.7711170166730881, - "num_tokens": 11923054.0, + "loss": 0.6217543482780457, + "mean_token_accuracy": 0.7487893849611282, + "num_tokens": 5667174.0, "step": 152 }, { - "entropy": 0.5948211699724197, - "epoch": 2.8411214953271027, - "grad_norm": 0.025879517197608948, + "entropy": 0.6295798048377037, + "epoch": 0.9927007299270073, + "grad_norm": 0.00907177198678255, "learning_rate": 0.0002, - "loss": 0.5868144035339355, - "mean_token_accuracy": 0.7634373158216476, - "num_tokens": 12004145.0, + "loss": 0.6333097219467163, + "mean_token_accuracy": 0.7429074198007584, + "num_tokens": 5704388.0, "step": 153 }, { - "entropy": 0.5877972543239594, - "epoch": 2.8598130841121496, - "grad_norm": 0.021945485845208168, + "entropy": 0.6149610579013824, + "epoch": 0.9991889699918897, + "grad_norm": 0.010923929512500763, "learning_rate": 0.0002, - "loss": 0.5912054777145386, - "mean_token_accuracy": 0.7609079629182816, - "num_tokens": 12083572.0, + "loss": 0.6188989877700806, + "mean_token_accuracy": 0.7496026828885078, + "num_tokens": 5741236.0, "step": 154 }, { - "entropy": 0.596399575471878, - "epoch": 2.878504672897196, - "grad_norm": 0.02310393564403057, + "entropy": 0.6364340782165527, + "epoch": 1.0, + "grad_norm": 0.023092100396752357, "learning_rate": 0.0002, - "loss": 0.5992023944854736, - "mean_token_accuracy": 0.7590157091617584, - "num_tokens": 12163010.0, + "loss": 0.6314291954040527, + "mean_token_accuracy": 0.7433016300201416, + "num_tokens": 5745896.0, "step": 155 }, { - "entropy": 0.6026438027620316, - "epoch": 2.897196261682243, - "grad_norm": 0.02354845404624939, + "entropy": 0.6255532875657082, + "epoch": 1.0064882400648825, + "grad_norm": 0.010001299902796745, "learning_rate": 0.0002, - "loss": 0.6004827618598938, - "mean_token_accuracy": 0.7573492974042892, - "num_tokens": 12242021.0, + "loss": 0.6274809837341309, + "mean_token_accuracy": 0.7447079941630363, + "num_tokens": 5782887.0, "step": 156 }, { - "entropy": 0.6044338345527649, - "epoch": 2.9158878504672896, - "grad_norm": 0.017202777788043022, + "entropy": 0.6249469369649887, + "epoch": 1.0129764801297647, + "grad_norm": 0.010014750063419342, "learning_rate": 0.0002, - "loss": 0.6010818481445312, - "mean_token_accuracy": 0.7568353414535522, - "num_tokens": 12320543.0, + "loss": 0.6293044090270996, + "mean_token_accuracy": 0.743991531431675, + "num_tokens": 5820452.0, "step": 157 }, { - "entropy": 0.5929509401321411, - "epoch": 2.9345794392523366, - "grad_norm": 0.02025710418820381, + "entropy": 0.6250087693333626, + "epoch": 1.0194647201946472, + "grad_norm": 0.009554821066558361, "learning_rate": 0.0002, - "loss": 0.5914134979248047, - "mean_token_accuracy": 0.7599974423646927, - "num_tokens": 12399529.0, + "loss": 0.6216879487037659, + "mean_token_accuracy": 0.7472942620515823, + "num_tokens": 5857511.0, "step": 158 }, { - "entropy": 0.5920598953962326, - "epoch": 2.953271028037383, - "grad_norm": 0.0207651536911726, + "entropy": 0.6345709040760994, + "epoch": 1.0259529602595296, + "grad_norm": 0.010529364459216595, "learning_rate": 0.0002, - "loss": 0.5891057252883911, - "mean_token_accuracy": 0.7613909542560577, - "num_tokens": 12479234.0, + "loss": 0.6336644887924194, + "mean_token_accuracy": 0.7428694814443588, + "num_tokens": 5895426.0, "step": 159 }, { - "entropy": 0.599518284201622, - "epoch": 2.97196261682243, - "grad_norm": 0.021147435531020164, + "entropy": 0.6269640624523163, + "epoch": 1.0324412003244121, + "grad_norm": 0.010084465146064758, "learning_rate": 0.0002, - "loss": 0.600294828414917, - "mean_token_accuracy": 0.7578493654727936, - "num_tokens": 12557675.0, + "loss": 0.6298044919967651, + "mean_token_accuracy": 0.7432648167014122, + "num_tokens": 5932788.0, "step": 160 }, { - "entropy": 0.5950981378555298, - "epoch": 2.9906542056074765, - "grad_norm": 0.020992575213313103, + "entropy": 0.6268706321716309, + "epoch": 1.0389294403892944, + "grad_norm": 0.009462922811508179, "learning_rate": 0.0002, - "loss": 0.5942000150680542, - "mean_token_accuracy": 0.7601594924926758, - "num_tokens": 12636883.0, + "loss": 0.6329535245895386, + "mean_token_accuracy": 0.7419963404536247, + "num_tokens": 5970211.0, "step": 161 }, { - "entropy": 0.5946215093135834, - "epoch": 3.0, - "grad_norm": 0.025768527761101723, + "entropy": 0.6167154312133789, + "epoch": 1.0454176804541768, + "grad_norm": 0.009687564335763454, "learning_rate": 0.0002, - "loss": 0.5949423313140869, - "mean_token_accuracy": 0.7577188909053802, - "num_tokens": 12675677.0, + "loss": 0.6214160919189453, + "mean_token_accuracy": 0.7477982342243195, + "num_tokens": 6007676.0, "step": 162 }, { - "entropy": 0.5952535271644592, - "epoch": 3.0186915887850465, - "grad_norm": 0.019218550994992256, + "entropy": 0.6232415363192558, + "epoch": 1.0519059205190593, + "grad_norm": 0.011512194760143757, "learning_rate": 0.0002, - "loss": 0.5950205326080322, - "mean_token_accuracy": 0.7591802030801773, - "num_tokens": 12754544.0, + "loss": 0.6291061639785767, + "mean_token_accuracy": 0.743974357843399, + "num_tokens": 6044881.0, "step": 163 }, { - "entropy": 0.5869429856538773, - "epoch": 3.0373831775700935, - "grad_norm": 0.021725568920373917, + "entropy": 0.6384411826729774, + "epoch": 1.0583941605839415, + "grad_norm": 0.009664908982813358, "learning_rate": 0.0002, - "loss": 0.5894550681114197, - "mean_token_accuracy": 0.7605041265487671, - "num_tokens": 12834662.0, + "loss": 0.6418322920799255, + "mean_token_accuracy": 0.7393775209784508, + "num_tokens": 6081959.0, "step": 164 }, { - "entropy": 0.5999327003955841, - "epoch": 3.05607476635514, - "grad_norm": 0.02341764234006405, + "entropy": 0.6312756985425949, + "epoch": 1.064882400648824, + "grad_norm": 0.009909010492265224, "learning_rate": 0.0002, - "loss": 0.6024653911590576, - "mean_token_accuracy": 0.7566392123699188, - "num_tokens": 12913130.0, + "loss": 0.6294491291046143, + "mean_token_accuracy": 0.7447398081421852, + "num_tokens": 6119502.0, "step": 165 }, { - "entropy": 0.5968442261219025, - "epoch": 3.074766355140187, - "grad_norm": 0.01957128569483757, + "entropy": 0.6399073377251625, + "epoch": 1.0713706407137065, + "grad_norm": 0.009380994364619255, "learning_rate": 0.0002, - "loss": 0.5923704504966736, - "mean_token_accuracy": 0.7603843212127686, - "num_tokens": 12993868.0, + "loss": 0.6359134912490845, + "mean_token_accuracy": 0.7427374646067619, + "num_tokens": 6157187.0, "step": 166 }, { - "entropy": 0.5876279473304749, - "epoch": 3.0934579439252334, - "grad_norm": 0.025587067008018494, + "entropy": 0.6151667386293411, + "epoch": 1.0778588807785887, + "grad_norm": 0.008555393666028976, "learning_rate": 0.0002, - "loss": 0.5829859972000122, - "mean_token_accuracy": 0.7648214399814606, - "num_tokens": 13074131.0, + "loss": 0.6155805587768555, + "mean_token_accuracy": 0.7496763169765472, + "num_tokens": 6194222.0, "step": 167 }, { - "entropy": 0.5873458981513977, - "epoch": 3.1121495327102804, - "grad_norm": 0.02201727218925953, + "entropy": 0.6240349486470222, + "epoch": 1.0843471208434712, + "grad_norm": 0.008739444427192211, "learning_rate": 0.0002, - "loss": 0.5889235734939575, - "mean_token_accuracy": 0.7630662024021149, - "num_tokens": 13152894.0, + "loss": 0.6246569156646729, + "mean_token_accuracy": 0.7454928457736969, + "num_tokens": 6231423.0, "step": 168 }, { - "entropy": 0.5871318429708481, - "epoch": 3.130841121495327, - "grad_norm": 0.027795247733592987, + "entropy": 0.6332473009824753, + "epoch": 1.0908353609083536, + "grad_norm": 0.009752689860761166, "learning_rate": 0.0002, - "loss": 0.5916054844856262, - "mean_token_accuracy": 0.7616733014583588, - "num_tokens": 13232178.0, + "loss": 0.6364842653274536, + "mean_token_accuracy": 0.7410347387194633, + "num_tokens": 6268835.0, "step": 169 }, { - "entropy": 0.5886196792125702, - "epoch": 3.149532710280374, - "grad_norm": 0.01805286295711994, + "entropy": 0.6179100349545479, + "epoch": 1.0973236009732361, + "grad_norm": 0.010130702517926693, "learning_rate": 0.0002, - "loss": 0.5864452123641968, - "mean_token_accuracy": 0.7620666176080704, - "num_tokens": 13310344.0, + "loss": 0.6235646605491638, + "mean_token_accuracy": 0.7480539605021477, + "num_tokens": 6306169.0, "step": 170 }, { - "entropy": 0.6028583645820618, - "epoch": 3.1682242990654204, - "grad_norm": 0.024633541703224182, + "entropy": 0.6232842579483986, + "epoch": 1.1038118410381184, + "grad_norm": 0.00973625760525465, "learning_rate": 0.0002, - "loss": 0.5942882299423218, - "mean_token_accuracy": 0.7610559463500977, - "num_tokens": 13389650.0, + "loss": 0.6288238763809204, + "mean_token_accuracy": 0.7431181073188782, + "num_tokens": 6343047.0, "step": 171 }, { - "entropy": 0.6023786067962646, - "epoch": 3.1869158878504673, - "grad_norm": 0.024393081665039062, + "entropy": 0.6252638548612595, + "epoch": 1.1103000811030008, + "grad_norm": 0.009265839122235775, "learning_rate": 0.0002, - "loss": 0.5962838530540466, - "mean_token_accuracy": 0.759291335940361, - "num_tokens": 13467561.0, + "loss": 0.6260301470756531, + "mean_token_accuracy": 0.7449894994497299, + "num_tokens": 6380248.0, "step": 172 }, { - "entropy": 0.5901230871677399, - "epoch": 3.205607476635514, - "grad_norm": 0.023710792884230614, + "entropy": 0.6273873671889305, + "epoch": 1.1167883211678833, + "grad_norm": 0.009544978849589825, "learning_rate": 0.0002, - "loss": 0.5943902730941772, - "mean_token_accuracy": 0.7589634358882904, - "num_tokens": 13546021.0, + "loss": 0.624110996723175, + "mean_token_accuracy": 0.7455884218215942, + "num_tokens": 6417799.0, "step": 173 }, { - "entropy": 0.590122401714325, - "epoch": 3.2242990654205608, - "grad_norm": 0.02311398833990097, + "entropy": 0.6261554434895515, + "epoch": 1.1232765612327655, + "grad_norm": 0.009425261989235878, "learning_rate": 0.0002, - "loss": 0.596176266670227, - "mean_token_accuracy": 0.7589921206235886, - "num_tokens": 13624893.0, + "loss": 0.6238696575164795, + "mean_token_accuracy": 0.747870922088623, + "num_tokens": 6454969.0, "step": 174 }, { - "entropy": 0.5887411236763, - "epoch": 3.2429906542056073, - "grad_norm": 0.0215385053306818, + "entropy": 0.6361829712986946, + "epoch": 1.129764801297648, + "grad_norm": 0.009325449354946613, "learning_rate": 0.0002, - "loss": 0.5897305607795715, - "mean_token_accuracy": 0.7616126239299774, - "num_tokens": 13703582.0, + "loss": 0.6336718201637268, + "mean_token_accuracy": 0.7412231788039207, + "num_tokens": 6493115.0, "step": 175 }, { - "entropy": 0.5897439420223236, - "epoch": 3.2616822429906542, - "grad_norm": 0.02364741452038288, + "entropy": 0.626146711409092, + "epoch": 1.1362530413625305, + "grad_norm": 0.010177000425755978, "learning_rate": 0.0002, - "loss": 0.5889256000518799, - "mean_token_accuracy": 0.7620260119438171, - "num_tokens": 13781679.0, + "loss": 0.6264243125915527, + "mean_token_accuracy": 0.7452349737286568, + "num_tokens": 6530141.0, "step": 176 }, { - "entropy": 0.6066396534442902, - "epoch": 3.2803738317757007, - "grad_norm": 0.024549856781959534, + "entropy": 0.620332308113575, + "epoch": 1.142741281427413, + "grad_norm": 0.010463408194482327, "learning_rate": 0.0002, - "loss": 0.6063922643661499, - "mean_token_accuracy": 0.7544234395027161, - "num_tokens": 13860430.0, + "loss": 0.6263006329536438, + "mean_token_accuracy": 0.7455399706959724, + "num_tokens": 6567506.0, "step": 177 }, { - "entropy": 0.5902666449546814, - "epoch": 3.2990654205607477, - "grad_norm": 0.02692057006061077, + "entropy": 0.6137627214193344, + "epoch": 1.1492295214922952, + "grad_norm": 0.011479280889034271, "learning_rate": 0.0002, - "loss": 0.5886927843093872, - "mean_token_accuracy": 0.7610446214675903, - "num_tokens": 13939321.0, + "loss": 0.6208648681640625, + "mean_token_accuracy": 0.7491373345255852, + "num_tokens": 6604409.0, "step": 178 }, { - "entropy": 0.5902948081493378, - "epoch": 3.317757009345794, - "grad_norm": 0.019016796723008156, + "entropy": 0.6161536052823067, + "epoch": 1.1557177615571776, + "grad_norm": 0.010295857675373554, "learning_rate": 0.0002, - "loss": 0.584492027759552, - "mean_token_accuracy": 0.7628366202116013, - "num_tokens": 14019328.0, + "loss": 0.6196001768112183, + "mean_token_accuracy": 0.7471510693430901, + "num_tokens": 6641779.0, "step": 179 }, { - "entropy": 0.5843053162097931, - "epoch": 3.336448598130841, - "grad_norm": 0.02076794020831585, + "entropy": 0.615701287984848, + "epoch": 1.1622060016220601, + "grad_norm": 0.00977401528507471, "learning_rate": 0.0002, - "loss": 0.5817679166793823, - "mean_token_accuracy": 0.76412633061409, - "num_tokens": 14098406.0, + "loss": 0.6152433156967163, + "mean_token_accuracy": 0.7513743862509727, + "num_tokens": 6678811.0, "step": 180 }, { - "entropy": 0.5929713398218155, - "epoch": 3.3551401869158877, - "grad_norm": 0.022940950468182564, + "entropy": 0.6276117786765099, + "epoch": 1.1686942416869424, + "grad_norm": 0.009978534653782845, "learning_rate": 0.0002, - "loss": 0.5940371155738831, - "mean_token_accuracy": 0.7611016482114792, - "num_tokens": 14177564.0, + "loss": 0.6257454752922058, + "mean_token_accuracy": 0.7457039654254913, + "num_tokens": 6715971.0, "step": 181 }, { - "entropy": 0.5819283872842789, - "epoch": 3.3738317757009346, - "grad_norm": 0.01927620731294155, + "entropy": 0.622728981077671, + "epoch": 1.1751824817518248, + "grad_norm": 0.010105178691446781, "learning_rate": 0.0002, - "loss": 0.5849300622940063, - "mean_token_accuracy": 0.7633251845836639, - "num_tokens": 14255531.0, + "loss": 0.6200466156005859, + "mean_token_accuracy": 0.7463524416089058, + "num_tokens": 6753100.0, "step": 182 }, { - "entropy": 0.578275516629219, - "epoch": 3.392523364485981, - "grad_norm": 0.019883625209331512, + "entropy": 0.6278671473264694, + "epoch": 1.1816707218167073, + "grad_norm": 0.00981152057647705, "learning_rate": 0.0002, - "loss": 0.5792434215545654, - "mean_token_accuracy": 0.7661247700452805, - "num_tokens": 14334891.0, + "loss": 0.629209041595459, + "mean_token_accuracy": 0.7440850958228111, + "num_tokens": 6790606.0, "step": 183 }, { - "entropy": 0.5787920653820038, - "epoch": 3.411214953271028, - "grad_norm": 0.020030220970511436, + "entropy": 0.6340474411845207, + "epoch": 1.1881589618815895, + "grad_norm": 0.010966816917061806, "learning_rate": 0.0002, - "loss": 0.5766516923904419, - "mean_token_accuracy": 0.7661706358194351, - "num_tokens": 14413858.0, + "loss": 0.6343464851379395, + "mean_token_accuracy": 0.7423162013292313, + "num_tokens": 6827773.0, "step": 184 }, { - "entropy": 0.5973383039236069, - "epoch": 3.4299065420560746, - "grad_norm": 0.020308909937739372, + "entropy": 0.627871498465538, + "epoch": 1.194647201946472, + "grad_norm": 0.01046378631144762, "learning_rate": 0.0002, - "loss": 0.5918881297111511, - "mean_token_accuracy": 0.7606652081012726, - "num_tokens": 14492504.0, + "loss": 0.6280568838119507, + "mean_token_accuracy": 0.7452474683523178, + "num_tokens": 6865004.0, "step": 185 }, { - "entropy": 0.583291083574295, - "epoch": 3.4485981308411215, - "grad_norm": 0.020716240629553795, + "entropy": 0.632583849132061, + "epoch": 1.2011354420113545, + "grad_norm": 0.011151660233736038, "learning_rate": 0.0002, - "loss": 0.5781140327453613, - "mean_token_accuracy": 0.765817254781723, - "num_tokens": 14572853.0, + "loss": 0.6399388313293457, + "mean_token_accuracy": 0.7401903197169304, + "num_tokens": 6902199.0, "step": 186 }, { - "entropy": 0.5810463130474091, - "epoch": 3.467289719626168, - "grad_norm": 0.020133642479777336, + "entropy": 0.6207470819354057, + "epoch": 1.2076236820762367, + "grad_norm": 0.009539226070046425, "learning_rate": 0.0002, - "loss": 0.5826877355575562, - "mean_token_accuracy": 0.7634966522455215, - "num_tokens": 14651962.0, + "loss": 0.626314640045166, + "mean_token_accuracy": 0.7447792664170265, + "num_tokens": 6939345.0, "step": 187 }, { - "entropy": 0.57536381483078, - "epoch": 3.485981308411215, - "grad_norm": 0.020142007619142532, + "entropy": 0.6265325620770454, + "epoch": 1.2141119221411192, + "grad_norm": 0.010582523420453072, "learning_rate": 0.0002, - "loss": 0.5788486003875732, - "mean_token_accuracy": 0.7644489705562592, - "num_tokens": 14733151.0, + "loss": 0.6258584260940552, + "mean_token_accuracy": 0.7450206950306892, + "num_tokens": 6976749.0, "step": 188 }, { - "entropy": 0.5983182191848755, - "epoch": 3.5046728971962615, - "grad_norm": 0.018696345388889313, + "entropy": 0.6242929175496101, + "epoch": 1.2206001622060016, + "grad_norm": 0.010438770987093449, "learning_rate": 0.0002, - "loss": 0.5981752872467041, - "mean_token_accuracy": 0.7576424926519394, - "num_tokens": 14813025.0, + "loss": 0.6282113790512085, + "mean_token_accuracy": 0.7453068420290947, + "num_tokens": 7013986.0, "step": 189 }, { - "entropy": 0.6043048650026321, - "epoch": 3.5233644859813085, - "grad_norm": 0.022231722250580788, + "entropy": 0.6362300962209702, + "epoch": 1.2270884022708841, + "grad_norm": 0.009592331014573574, "learning_rate": 0.0002, - "loss": 0.5974507331848145, - "mean_token_accuracy": 0.7578679323196411, - "num_tokens": 14891780.0, + "loss": 0.6338801980018616, + "mean_token_accuracy": 0.7425767108798027, + "num_tokens": 7051122.0, "step": 190 }, { - "entropy": 0.6004075407981873, - "epoch": 3.542056074766355, - "grad_norm": 0.021045353263616562, + "entropy": 0.6142800450325012, + "epoch": 1.2335766423357664, + "grad_norm": 0.008985689841210842, "learning_rate": 0.0002, - "loss": 0.5976691246032715, - "mean_token_accuracy": 0.7593707591295242, - "num_tokens": 14970339.0, + "loss": 0.6143558025360107, + "mean_token_accuracy": 0.750966027379036, + "num_tokens": 7088050.0, "step": 191 }, { - "entropy": 0.5853922069072723, - "epoch": 3.560747663551402, - "grad_norm": 0.02037801779806614, + "entropy": 0.6302971392869949, + "epoch": 1.2400648824006488, + "grad_norm": 0.009001200087368488, "learning_rate": 0.0002, - "loss": 0.5871971845626831, - "mean_token_accuracy": 0.7610767930746078, - "num_tokens": 15050034.0, + "loss": 0.6324248313903809, + "mean_token_accuracy": 0.7426666542887688, + "num_tokens": 7125652.0, "step": 192 }, { - "entropy": 0.5899361073970795, - "epoch": 3.5794392523364484, - "grad_norm": 0.021168449893593788, + "entropy": 0.6278156340122223, + "epoch": 1.2465531224655313, + "grad_norm": 0.009873399510979652, "learning_rate": 0.0002, - "loss": 0.5936985015869141, - "mean_token_accuracy": 0.759898915886879, - "num_tokens": 15128028.0, + "loss": 0.6288595795631409, + "mean_token_accuracy": 0.7446199506521225, + "num_tokens": 7163209.0, "step": 193 }, { - "entropy": 0.5894113481044769, - "epoch": 3.5981308411214954, - "grad_norm": 0.019629884511232376, + "entropy": 0.6151107102632523, + "epoch": 1.2530413625304138, + "grad_norm": 0.010955240577459335, "learning_rate": 0.0002, - "loss": 0.5924787521362305, - "mean_token_accuracy": 0.7594863474369049, - "num_tokens": 15207165.0, + "loss": 0.6196198463439941, + "mean_token_accuracy": 0.7487600594758987, + "num_tokens": 7200676.0, "step": 194 }, { - "entropy": 0.59434375166893, - "epoch": 3.616822429906542, - "grad_norm": 0.01782124675810337, + "entropy": 0.624420776963234, + "epoch": 1.259529602595296, + "grad_norm": 0.009569366462528706, "learning_rate": 0.0002, - "loss": 0.5949936509132385, - "mean_token_accuracy": 0.759057804942131, - "num_tokens": 15286394.0, + "loss": 0.6245594024658203, + "mean_token_accuracy": 0.7455159053206444, + "num_tokens": 7237914.0, "step": 195 }, { - "entropy": 0.5976666957139969, - "epoch": 3.635514018691589, - "grad_norm": 0.019005272537469864, + "entropy": 0.62844218313694, + "epoch": 1.2660178426601785, + "grad_norm": 0.00903658103197813, "learning_rate": 0.0002, - "loss": 0.5931147933006287, - "mean_token_accuracy": 0.7595807015895844, - "num_tokens": 15365716.0, + "loss": 0.6268140077590942, + "mean_token_accuracy": 0.7442804053425789, + "num_tokens": 7275515.0, "step": 196 }, { - "entropy": 0.5822330415248871, - "epoch": 3.6542056074766354, - "grad_norm": 0.021969236433506012, + "entropy": 0.6202637255191803, + "epoch": 1.272506082725061, + "grad_norm": 0.00881174299865961, "learning_rate": 0.0002, - "loss": 0.5772209763526917, - "mean_token_accuracy": 0.7657969892024994, - "num_tokens": 15445001.0, + "loss": 0.6185364723205566, + "mean_token_accuracy": 0.7477486506104469, + "num_tokens": 7313158.0, "step": 197 }, { - "entropy": 0.5981509387493134, - "epoch": 3.6728971962616823, - "grad_norm": 0.01774434745311737, + "entropy": 0.6143034398555756, + "epoch": 1.2789943227899432, + "grad_norm": 0.010709850117564201, "learning_rate": 0.0002, - "loss": 0.5937886834144592, - "mean_token_accuracy": 0.7590377032756805, - "num_tokens": 15523368.0, + "loss": 0.6169742345809937, + "mean_token_accuracy": 0.7487710192799568, + "num_tokens": 7350030.0, "step": 198 }, { - "entropy": 0.5803258270025253, - "epoch": 3.691588785046729, - "grad_norm": 0.017782161012291908, + "entropy": 0.6223605200648308, + "epoch": 1.2854825628548256, + "grad_norm": 0.010480264201760292, "learning_rate": 0.0002, - "loss": 0.5816370248794556, - "mean_token_accuracy": 0.7656546384096146, - "num_tokens": 15601373.0, + "loss": 0.6294817924499512, + "mean_token_accuracy": 0.7423868179321289, + "num_tokens": 7387006.0, "step": 199 }, { - "entropy": 0.5881159752607346, - "epoch": 3.710280373831776, - "grad_norm": 0.023958368226885796, + "entropy": 0.6272002533078194, + "epoch": 1.2919708029197081, + "grad_norm": 0.009464031085371971, "learning_rate": 0.0002, - "loss": 0.5951263904571533, - "mean_token_accuracy": 0.7590856105089188, - "num_tokens": 15678762.0, + "loss": 0.6319963932037354, + "mean_token_accuracy": 0.7425662279129028, + "num_tokens": 7424425.0, "step": 200 }, { - "entropy": 0.5951340943574905, - "epoch": 3.7289719626168223, - "grad_norm": 0.019875694066286087, + "entropy": 0.6301053911447525, + "epoch": 1.2984590429845904, + "grad_norm": 0.009957416914403439, "learning_rate": 0.0002, - "loss": 0.595394492149353, - "mean_token_accuracy": 0.7592459321022034, - "num_tokens": 15757310.0, + "loss": 0.6337630748748779, + "mean_token_accuracy": 0.7440446689724922, + "num_tokens": 7461695.0, "step": 201 }, { - "entropy": 0.5929934829473495, - "epoch": 3.7476635514018692, - "grad_norm": 0.018640384078025818, + "entropy": 0.6238225474953651, + "epoch": 1.3049472830494728, + "grad_norm": 0.00954597070813179, "learning_rate": 0.0002, - "loss": 0.5888406038284302, - "mean_token_accuracy": 0.7608652859926224, - "num_tokens": 15835991.0, + "loss": 0.6226916909217834, + "mean_token_accuracy": 0.7449641600251198, + "num_tokens": 7498774.0, "step": 202 }, { - "entropy": 0.5996460020542145, - "epoch": 3.7663551401869158, - "grad_norm": 0.021940160542726517, + "entropy": 0.630424328148365, + "epoch": 1.3114355231143553, + "grad_norm": 0.0086854612454772, "learning_rate": 0.0002, - "loss": 0.5948377847671509, - "mean_token_accuracy": 0.7593396604061127, - "num_tokens": 15915033.0, + "loss": 0.6267648935317993, + "mean_token_accuracy": 0.745999850332737, + "num_tokens": 7535974.0, "step": 203 }, { - "entropy": 0.5859507322311401, - "epoch": 3.7850467289719627, - "grad_norm": 0.019842160865664482, + "entropy": 0.6177534386515617, + "epoch": 1.3179237631792375, + "grad_norm": 0.009849452413618565, "learning_rate": 0.0002, - "loss": 0.5832802057266235, - "mean_token_accuracy": 0.7638317793607712, - "num_tokens": 15994090.0, + "loss": 0.6153725385665894, + "mean_token_accuracy": 0.7507055774331093, + "num_tokens": 7572957.0, "step": 204 }, { - "entropy": 0.588510274887085, - "epoch": 3.803738317757009, - "grad_norm": 0.02117988094687462, + "entropy": 0.622411735355854, + "epoch": 1.32441200324412, + "grad_norm": 0.009472545236349106, "learning_rate": 0.0002, - "loss": 0.5909595489501953, - "mean_token_accuracy": 0.7599914968013763, - "num_tokens": 16073191.0, + "loss": 0.625112771987915, + "mean_token_accuracy": 0.7435147687792778, + "num_tokens": 7610380.0, "step": 205 }, { - "entropy": 0.5994965881109238, - "epoch": 3.822429906542056, - "grad_norm": 0.024261780083179474, + "entropy": 0.6200075596570969, + "epoch": 1.3309002433090025, + "grad_norm": 0.010570540092885494, "learning_rate": 0.0002, - "loss": 0.6034358143806458, - "mean_token_accuracy": 0.7556708604097366, - "num_tokens": 16151732.0, + "loss": 0.6272220611572266, + "mean_token_accuracy": 0.7441560178995132, + "num_tokens": 7647843.0, "step": 206 }, { - "entropy": 0.5854174643754959, - "epoch": 3.8411214953271027, - "grad_norm": 0.021501438692212105, + "entropy": 0.6281143799424171, + "epoch": 1.3373884833738847, + "grad_norm": 0.008813613094389439, "learning_rate": 0.0002, - "loss": 0.5888152122497559, - "mean_token_accuracy": 0.7620731145143509, - "num_tokens": 16231390.0, + "loss": 0.6328994631767273, + "mean_token_accuracy": 0.742665521800518, + "num_tokens": 7685138.0, "step": 207 }, { - "entropy": 0.6051391512155533, - "epoch": 3.8598130841121496, - "grad_norm": 0.01915089599788189, + "entropy": 0.6417431458830833, + "epoch": 1.3438767234387672, + "grad_norm": 0.00971722137182951, "learning_rate": 0.0002, - "loss": 0.6023332476615906, - "mean_token_accuracy": 0.7562840282917023, - "num_tokens": 16309103.0, + "loss": 0.6397589445114136, + "mean_token_accuracy": 0.7406186908483505, + "num_tokens": 7722781.0, "step": 208 }, { - "entropy": 0.6067698895931244, - "epoch": 3.878504672897196, - "grad_norm": 0.021229425445199013, + "entropy": 0.6444113031029701, + "epoch": 1.3503649635036497, + "grad_norm": 0.009866150096058846, "learning_rate": 0.0002, - "loss": 0.599652886390686, - "mean_token_accuracy": 0.7584574669599533, - "num_tokens": 16387337.0, + "loss": 0.6412906646728516, + "mean_token_accuracy": 0.7412897050380707, + "num_tokens": 7760109.0, "step": 209 }, { - "entropy": 0.5951249748468399, - "epoch": 3.897196261682243, - "grad_norm": 0.020794285461306572, + "entropy": 0.6214337572455406, + "epoch": 1.3568532035685321, + "grad_norm": 0.009207811206579208, "learning_rate": 0.0002, - "loss": 0.589394211769104, - "mean_token_accuracy": 0.7610641866922379, - "num_tokens": 16465143.0, + "loss": 0.6234208345413208, + "mean_token_accuracy": 0.7459528893232346, + "num_tokens": 7797532.0, "step": 210 }, { - "entropy": 0.5834344774484634, - "epoch": 3.9158878504672896, - "grad_norm": 0.021171296015381813, + "entropy": 0.6157770529389381, + "epoch": 1.3633414436334144, + "grad_norm": 0.01025467086583376, "learning_rate": 0.0002, - "loss": 0.587925374507904, - "mean_token_accuracy": 0.7619622200727463, - "num_tokens": 16543880.0, + "loss": 0.6178190112113953, + "mean_token_accuracy": 0.7505671828985214, + "num_tokens": 7834554.0, "step": 211 }, { - "entropy": 0.5819447487592697, - "epoch": 3.9345794392523366, - "grad_norm": 0.021571574732661247, + "entropy": 0.619218721985817, + "epoch": 1.3698296836982968, + "grad_norm": 0.01020651962608099, "learning_rate": 0.0002, - "loss": 0.5871191024780273, - "mean_token_accuracy": 0.7640725821256638, - "num_tokens": 16624144.0, + "loss": 0.6230384111404419, + "mean_token_accuracy": 0.7464535236358643, + "num_tokens": 7871899.0, "step": 212 }, { - "entropy": 0.5863354504108429, - "epoch": 3.953271028037383, - "grad_norm": 0.018521364778280258, + "entropy": 0.6242957413196564, + "epoch": 1.3763179237631793, + "grad_norm": 0.009102249518036842, "learning_rate": 0.0002, - "loss": 0.5881295204162598, - "mean_token_accuracy": 0.7625996768474579, - "num_tokens": 16702818.0, + "loss": 0.625146210193634, + "mean_token_accuracy": 0.7436935156583786, + "num_tokens": 7908550.0, "step": 213 }, { - "entropy": 0.5845038741827011, - "epoch": 3.97196261682243, - "grad_norm": 0.01778440922498703, + "entropy": 0.6318832859396935, + "epoch": 1.3828061638280618, + "grad_norm": 0.008958768099546432, "learning_rate": 0.0002, - "loss": 0.5809848308563232, - "mean_token_accuracy": 0.7636913359165192, - "num_tokens": 16781881.0, + "loss": 0.6291754245758057, + "mean_token_accuracy": 0.7419761046767235, + "num_tokens": 7945528.0, "step": 214 }, { - "entropy": 0.6045233011245728, - "epoch": 3.9906542056074765, - "grad_norm": 0.02102098986506462, + "entropy": 0.622461624443531, + "epoch": 1.389294403892944, + "grad_norm": 0.010115247219800949, "learning_rate": 0.0002, - "loss": 0.5983396768569946, - "mean_token_accuracy": 0.7578406184911728, - "num_tokens": 16860588.0, + "loss": 0.6236110329627991, + "mean_token_accuracy": 0.7462903261184692, + "num_tokens": 7982511.0, "step": 215 }, { - "entropy": 0.586735337972641, - "epoch": 4.0, - "grad_norm": 0.021059105172753334, + "entropy": 0.6254477724432945, + "epoch": 1.3957826439578265, + "grad_norm": 0.008989102207124233, "learning_rate": 0.0002, - "loss": 0.5811917781829834, - "mean_token_accuracy": 0.7643606066703796, - "num_tokens": 16900889.0, + "loss": 0.6284307241439819, + "mean_token_accuracy": 0.7429582253098488, + "num_tokens": 8019795.0, "step": 216 }, { - "entropy": 0.5940107554197311, - "epoch": 4.018691588785047, - "grad_norm": 0.018036525696516037, + "entropy": 0.6165763810276985, + "epoch": 1.402270884022709, + "grad_norm": 0.010876733809709549, "learning_rate": 0.0002, - "loss": 0.5917088985443115, - "mean_token_accuracy": 0.7601685523986816, - "num_tokens": 16979059.0, + "loss": 0.6224349737167358, + "mean_token_accuracy": 0.7477402463555336, + "num_tokens": 8057519.0, "step": 217 }, { - "entropy": 0.5794219076633453, - "epoch": 4.037383177570093, - "grad_norm": 0.02091035433113575, + "entropy": 0.6111054793000221, + "epoch": 1.4087591240875912, + "grad_norm": 0.008845480158925056, "learning_rate": 0.0002, - "loss": 0.5814393162727356, - "mean_token_accuracy": 0.7636075466871262, - "num_tokens": 17058416.0, + "loss": 0.6134991645812988, + "mean_token_accuracy": 0.7499867528676987, + "num_tokens": 8094863.0, "step": 218 }, { - "entropy": 0.5681750178337097, - "epoch": 4.05607476635514, - "grad_norm": 0.02142472006380558, + "entropy": 0.6361298933625221, + "epoch": 1.4152473641524737, + "grad_norm": 0.009090340696275234, "learning_rate": 0.0002, - "loss": 0.5742322206497192, - "mean_token_accuracy": 0.7665071785449982, - "num_tokens": 17138894.0, + "loss": 0.6369084715843201, + "mean_token_accuracy": 0.7387163192033768, + "num_tokens": 8132597.0, "step": 219 }, { - "entropy": 0.5883741974830627, - "epoch": 4.074766355140187, - "grad_norm": 0.018591072410345078, + "entropy": 0.6406821832060814, + "epoch": 1.4217356042173561, + "grad_norm": 0.0092760706320405, "learning_rate": 0.0002, - "loss": 0.5917633771896362, - "mean_token_accuracy": 0.7602983862161636, - "num_tokens": 17217518.0, + "loss": 0.6413878202438354, + "mean_token_accuracy": 0.7377218827605247, + "num_tokens": 8170263.0, "step": 220 }, { - "entropy": 0.586336225271225, - "epoch": 4.093457943925234, - "grad_norm": 0.018653078004717827, + "entropy": 0.6221970841288567, + "epoch": 1.4282238442822384, + "grad_norm": 0.009138553403317928, "learning_rate": 0.0002, - "loss": 0.5852929949760437, - "mean_token_accuracy": 0.7621860057115555, - "num_tokens": 17297429.0, + "loss": 0.6239045858383179, + "mean_token_accuracy": 0.7459966242313385, + "num_tokens": 8207517.0, "step": 221 }, { - "entropy": 0.5893379747867584, - "epoch": 4.11214953271028, - "grad_norm": 0.02176232449710369, + "entropy": 0.6360906660556793, + "epoch": 1.4347120843471208, + "grad_norm": 0.008928137831389904, "learning_rate": 0.0002, - "loss": 0.5851144790649414, - "mean_token_accuracy": 0.7623254060745239, - "num_tokens": 17375993.0, + "loss": 0.6395260095596313, + "mean_token_accuracy": 0.7385511174798012, + "num_tokens": 8244836.0, "step": 222 }, { - "entropy": 0.6061349809169769, - "epoch": 4.130841121495327, - "grad_norm": 0.019815821200609207, + "entropy": 0.6243730783462524, + "epoch": 1.4412003244120033, + "grad_norm": 0.009026050567626953, "learning_rate": 0.0002, - "loss": 0.6047327518463135, - "mean_token_accuracy": 0.7547261565923691, - "num_tokens": 17454782.0, + "loss": 0.6269445419311523, + "mean_token_accuracy": 0.7457072138786316, + "num_tokens": 8281919.0, "step": 223 }, { - "entropy": 0.5827231258153915, - "epoch": 4.149532710280374, - "grad_norm": 0.020148327574133873, + "entropy": 0.6337901726365089, + "epoch": 1.4476885644768855, + "grad_norm": 0.00801246426999569, "learning_rate": 0.0002, - "loss": 0.5840202569961548, - "mean_token_accuracy": 0.7633996903896332, - "num_tokens": 17533535.0, + "loss": 0.6330679059028625, + "mean_token_accuracy": 0.7426828071475029, + "num_tokens": 8319228.0, "step": 224 }, { - "entropy": 0.5854267328977585, - "epoch": 4.168224299065421, - "grad_norm": 0.02046262100338936, + "entropy": 0.631360612809658, + "epoch": 1.454176804541768, + "grad_norm": 0.009467655792832375, "learning_rate": 0.0002, - "loss": 0.5860427618026733, - "mean_token_accuracy": 0.7614548951387405, - "num_tokens": 17612055.0, + "loss": 0.6300734281539917, + "mean_token_accuracy": 0.7453820630908012, + "num_tokens": 8356483.0, "step": 225 }, { - "entropy": 0.5952410101890564, - "epoch": 4.186915887850467, - "grad_norm": 0.02046579122543335, + "entropy": 0.6360229924321175, + "epoch": 1.4606650446066505, + "grad_norm": 0.009358935989439487, "learning_rate": 0.0002, - "loss": 0.5909503698348999, - "mean_token_accuracy": 0.7594263106584549, - "num_tokens": 17691143.0, + "loss": 0.6341854929924011, + "mean_token_accuracy": 0.7435640841722488, + "num_tokens": 8393723.0, "step": 226 }, { - "entropy": 0.5892802178859711, - "epoch": 4.205607476635514, - "grad_norm": 0.02167705073952675, + "entropy": 0.6200751587748528, + "epoch": 1.4671532846715327, + "grad_norm": 0.008350496180355549, "learning_rate": 0.0002, - "loss": 0.5853694677352905, - "mean_token_accuracy": 0.76229228079319, - "num_tokens": 17770094.0, + "loss": 0.6218277215957642, + "mean_token_accuracy": 0.7479682192206383, + "num_tokens": 8431281.0, "step": 227 }, { - "entropy": 0.5899169147014618, - "epoch": 4.224299065420561, - "grad_norm": 0.022735821083188057, + "entropy": 0.6275244578719139, + "epoch": 1.4736415247364152, + "grad_norm": 0.009802248328924179, "learning_rate": 0.0002, - "loss": 0.5906339883804321, - "mean_token_accuracy": 0.7605825811624527, - "num_tokens": 17848840.0, + "loss": 0.6335194706916809, + "mean_token_accuracy": 0.7433927357196808, + "num_tokens": 8468465.0, "step": 228 }, { - "entropy": 0.5718450546264648, - "epoch": 4.242990654205608, - "grad_norm": 0.021596962586045265, + "entropy": 0.6231343746185303, + "epoch": 1.4801297648012977, + "grad_norm": 0.010109310038387775, "learning_rate": 0.0002, - "loss": 0.5731650590896606, - "mean_token_accuracy": 0.7678278982639313, - "num_tokens": 17928543.0, + "loss": 0.6223199367523193, + "mean_token_accuracy": 0.7451789528131485, + "num_tokens": 8505713.0, "step": 229 }, { - "entropy": 0.5924698412418365, - "epoch": 4.261682242990654, - "grad_norm": 0.019548065960407257, + "entropy": 0.6206792145967484, + "epoch": 1.4866180048661801, + "grad_norm": 0.010297620669007301, "learning_rate": 0.0002, - "loss": 0.5934122800827026, - "mean_token_accuracy": 0.7606871724128723, - "num_tokens": 18007377.0, + "loss": 0.6225035190582275, + "mean_token_accuracy": 0.7460876628756523, + "num_tokens": 8542783.0, "step": 230 }, { - "entropy": 0.6042954921722412, - "epoch": 4.280373831775701, - "grad_norm": 0.021219445392489433, + "entropy": 0.6291577965021133, + "epoch": 1.4931062449310626, + "grad_norm": 0.009544001892209053, "learning_rate": 0.0002, - "loss": 0.6020859479904175, - "mean_token_accuracy": 0.7561117857694626, - "num_tokens": 18086305.0, + "loss": 0.6289199590682983, + "mean_token_accuracy": 0.7454885393381119, + "num_tokens": 8580029.0, "step": 231 }, { - "entropy": 0.5859596431255341, - "epoch": 4.299065420560748, - "grad_norm": 0.020383305847644806, + "entropy": 0.6250879839062691, + "epoch": 1.4995944849959448, + "grad_norm": 0.008444451726973057, "learning_rate": 0.0002, - "loss": 0.5832017064094543, - "mean_token_accuracy": 0.762650728225708, - "num_tokens": 18166007.0, + "loss": 0.628132700920105, + "mean_token_accuracy": 0.7435998693108559, + "num_tokens": 8617067.0, "step": 232 }, { - "entropy": 0.5846229046583176, - "epoch": 4.317757009345795, - "grad_norm": 0.01955682970583439, + "entropy": 0.6236734315752983, + "epoch": 1.5060827250608273, + "grad_norm": 0.009344187565147877, "learning_rate": 0.0002, - "loss": 0.5832371115684509, - "mean_token_accuracy": 0.7625042945146561, - "num_tokens": 18244884.0, + "loss": 0.6258345246315002, + "mean_token_accuracy": 0.7458996251225471, + "num_tokens": 8654420.0, "step": 233 }, { - "entropy": 0.5895711481571198, - "epoch": 4.336448598130841, - "grad_norm": 0.01915646530687809, + "entropy": 0.6138928905129433, + "epoch": 1.5125709651257098, + "grad_norm": 0.009892390109598637, "learning_rate": 0.0002, - "loss": 0.591120719909668, - "mean_token_accuracy": 0.7605114132165909, - "num_tokens": 18322523.0, + "loss": 0.6232701539993286, + "mean_token_accuracy": 0.7446143329143524, + "num_tokens": 8691786.0, "step": 234 }, { - "entropy": 0.5956000238656998, - "epoch": 4.355140186915888, - "grad_norm": 0.020273521542549133, + "entropy": 0.6233969107270241, + "epoch": 1.519059205190592, + "grad_norm": 0.010160520672798157, "learning_rate": 0.0002, - "loss": 0.5929043292999268, - "mean_token_accuracy": 0.7591133713722229, - "num_tokens": 18400838.0, + "loss": 0.6211707592010498, + "mean_token_accuracy": 0.7472252398729324, + "num_tokens": 8729028.0, "step": 235 }, { - "entropy": 0.5959005355834961, - "epoch": 4.373831775700935, - "grad_norm": 0.020820753648877144, + "entropy": 0.6429286673665047, + "epoch": 1.5255474452554745, + "grad_norm": 0.0098539674654603, "learning_rate": 0.0002, - "loss": 0.5935447216033936, - "mean_token_accuracy": 0.7600593417882919, - "num_tokens": 18479961.0, + "loss": 0.6372069120407104, + "mean_token_accuracy": 0.7402112632989883, + "num_tokens": 8766503.0, "step": 236 }, { - "entropy": 0.5854752659797668, - "epoch": 4.392523364485982, - "grad_norm": 0.019046681001782417, + "entropy": 0.6305690258741379, + "epoch": 1.532035685320357, + "grad_norm": 0.009324081242084503, "learning_rate": 0.0002, - "loss": 0.5836696624755859, - "mean_token_accuracy": 0.7631508558988571, - "num_tokens": 18558893.0, + "loss": 0.6331846714019775, + "mean_token_accuracy": 0.7420341670513153, + "num_tokens": 8803595.0, "step": 237 }, { - "entropy": 0.5805842876434326, - "epoch": 4.411214953271028, - "grad_norm": 0.02072669006884098, + "entropy": 0.6305363178253174, + "epoch": 1.5385239253852392, + "grad_norm": 0.009419843554496765, "learning_rate": 0.0002, - "loss": 0.5796903967857361, - "mean_token_accuracy": 0.7648639678955078, - "num_tokens": 18636920.0, + "loss": 0.6305243968963623, + "mean_token_accuracy": 0.7442135661840439, + "num_tokens": 8840805.0, "step": 238 }, { - "entropy": 0.5842614471912384, - "epoch": 4.429906542056075, - "grad_norm": 0.021100452169775963, + "entropy": 0.6271083503961563, + "epoch": 1.5450121654501217, + "grad_norm": 0.008481448516249657, "learning_rate": 0.0002, - "loss": 0.5860409736633301, - "mean_token_accuracy": 0.7626742720603943, - "num_tokens": 18716615.0, + "loss": 0.628629207611084, + "mean_token_accuracy": 0.7426930069923401, + "num_tokens": 8877765.0, "step": 239 }, { - "entropy": 0.5835539698600769, - "epoch": 4.4485981308411215, - "grad_norm": 0.01936553232371807, + "entropy": 0.6074612811207771, + "epoch": 1.5515004055150041, + "grad_norm": 0.008962183259427547, "learning_rate": 0.0002, - "loss": 0.5853263139724731, - "mean_token_accuracy": 0.7634955793619156, - "num_tokens": 18796073.0, + "loss": 0.6033654808998108, + "mean_token_accuracy": 0.7540537416934967, + "num_tokens": 8915298.0, "step": 240 }, { - "entropy": 0.5898151844739914, - "epoch": 4.4672897196261685, - "grad_norm": 0.02180354669690132, + "entropy": 0.6332517638802528, + "epoch": 1.5579886455798864, + "grad_norm": 0.009697218425571918, "learning_rate": 0.0002, - "loss": 0.588620126247406, - "mean_token_accuracy": 0.7620908468961716, - "num_tokens": 18874321.0, + "loss": 0.6378505229949951, + "mean_token_accuracy": 0.7404668927192688, + "num_tokens": 8952480.0, "step": 241 }, { - "entropy": 0.5985790193080902, - "epoch": 4.485981308411215, - "grad_norm": 0.019755367189645767, + "entropy": 0.6220754161477089, + "epoch": 1.5644768856447688, + "grad_norm": 0.00962862279266119, "learning_rate": 0.0002, - "loss": 0.5967073440551758, - "mean_token_accuracy": 0.7568804025650024, - "num_tokens": 18952908.0, + "loss": 0.6282638907432556, + "mean_token_accuracy": 0.7437562346458435, + "num_tokens": 8990098.0, "step": 242 }, { - "entropy": 0.5842784494161606, - "epoch": 4.5046728971962615, - "grad_norm": 0.023035677149891853, + "entropy": 0.6257785856723785, + "epoch": 1.5709651257096513, + "grad_norm": 0.009893639013171196, "learning_rate": 0.0002, - "loss": 0.5853761434555054, - "mean_token_accuracy": 0.7622469514608383, - "num_tokens": 19033127.0, + "loss": 0.6297152042388916, + "mean_token_accuracy": 0.7440835684537888, + "num_tokens": 9026984.0, "step": 243 }, { - "entropy": 0.5959431380033493, - "epoch": 4.5233644859813085, - "grad_norm": 0.01961715891957283, + "entropy": 0.6254734173417091, + "epoch": 1.5774533657745335, + "grad_norm": 0.009527175687253475, "learning_rate": 0.0002, - "loss": 0.5963428020477295, - "mean_token_accuracy": 0.7580619305372238, - "num_tokens": 19112318.0, + "loss": 0.62839674949646, + "mean_token_accuracy": 0.7452434748411179, + "num_tokens": 9064358.0, "step": 244 }, { - "entropy": 0.5870704054832458, - "epoch": 4.542056074766355, - "grad_norm": 0.022338932380080223, + "entropy": 0.6305152326822281, + "epoch": 1.583941605839416, + "grad_norm": 0.009316297248005867, "learning_rate": 0.0002, - "loss": 0.5821323394775391, - "mean_token_accuracy": 0.7648284286260605, - "num_tokens": 19191913.0, + "loss": 0.6323485374450684, + "mean_token_accuracy": 0.74256681650877, + "num_tokens": 9101356.0, "step": 245 }, { - "entropy": 0.5891195833683014, - "epoch": 4.5607476635514015, - "grad_norm": 0.020034756511449814, + "entropy": 0.6291619464755058, + "epoch": 1.5904298459042985, + "grad_norm": 0.008978272788226604, "learning_rate": 0.0002, - "loss": 0.586045503616333, - "mean_token_accuracy": 0.7623850703239441, - "num_tokens": 19271876.0, + "loss": 0.6273784637451172, + "mean_token_accuracy": 0.7450171038508415, + "num_tokens": 9138713.0, "step": 246 }, { - "entropy": 0.5894780457019806, - "epoch": 4.579439252336448, - "grad_norm": 0.019152812659740448, + "entropy": 0.6248873770236969, + "epoch": 1.5969180859691807, + "grad_norm": 0.00856445450335741, "learning_rate": 0.0002, - "loss": 0.5905551910400391, - "mean_token_accuracy": 0.7604437470436096, - "num_tokens": 19350369.0, + "loss": 0.6265925168991089, + "mean_token_accuracy": 0.7451888769865036, + "num_tokens": 9175681.0, "step": 247 }, { - "entropy": 0.591143861413002, - "epoch": 4.598130841121495, - "grad_norm": 0.027622630819678307, + "entropy": 0.6189131289720535, + "epoch": 1.6034063260340634, + "grad_norm": 0.00968277920037508, "learning_rate": 0.0002, - "loss": 0.59825199842453, - "mean_token_accuracy": 0.7581405639648438, - "num_tokens": 19428773.0, + "loss": 0.62480229139328, + "mean_token_accuracy": 0.7459377571940422, + "num_tokens": 9213377.0, "step": 248 }, { - "entropy": 0.5909495502710342, - "epoch": 4.616822429906542, - "grad_norm": 0.021174976602196693, + "entropy": 0.6176823750138283, + "epoch": 1.6098945660989457, + "grad_norm": 0.008562079630792141, "learning_rate": 0.0002, - "loss": 0.5904080271720886, - "mean_token_accuracy": 0.7613418698310852, - "num_tokens": 19507298.0, + "loss": 0.6216596961021423, + "mean_token_accuracy": 0.7459762021899223, + "num_tokens": 9249919.0, "step": 249 }, { - "entropy": 0.5994816869497299, - "epoch": 4.635514018691588, - "grad_norm": 0.02356564812362194, + "entropy": 0.6210065707564354, + "epoch": 1.616382806163828, + "grad_norm": 0.009402911178767681, "learning_rate": 0.0002, - "loss": 0.5948832035064697, - "mean_token_accuracy": 0.7591896653175354, - "num_tokens": 19585802.0, + "loss": 0.6242903470993042, + "mean_token_accuracy": 0.7469801977276802, + "num_tokens": 9287219.0, "step": 250 }, { - "entropy": 0.5748025625944138, - "epoch": 4.654205607476635, - "grad_norm": 0.021352779120206833, + "entropy": 0.6323156431317329, + "epoch": 1.6228710462287106, + "grad_norm": 0.009092130698263645, "learning_rate": 0.0002, - "loss": 0.5704630017280579, - "mean_token_accuracy": 0.7698894888162613, - "num_tokens": 19666028.0, + "loss": 0.6306654810905457, + "mean_token_accuracy": 0.7425123229622841, + "num_tokens": 9324174.0, "step": 251 }, { - "entropy": 0.5918545722961426, - "epoch": 4.672897196261682, - "grad_norm": 0.026110973209142685, + "entropy": 0.6303895488381386, + "epoch": 1.6293592862935928, + "grad_norm": 0.009144228883087635, "learning_rate": 0.0002, - "loss": 0.5959534645080566, - "mean_token_accuracy": 0.7576208114624023, - "num_tokens": 19744495.0, + "loss": 0.6268880367279053, + "mean_token_accuracy": 0.7460083961486816, + "num_tokens": 9361494.0, "step": 252 }, { - "entropy": 0.5881817638874054, - "epoch": 4.691588785046729, - "grad_norm": 0.023665674030780792, + "entropy": 0.6353992223739624, + "epoch": 1.6358475263584753, + "grad_norm": 0.00928189791738987, "learning_rate": 0.0002, - "loss": 0.5900920033454895, - "mean_token_accuracy": 0.75875024497509, - "num_tokens": 19823204.0, + "loss": 0.6352483034133911, + "mean_token_accuracy": 0.7439208328723907, + "num_tokens": 9398944.0, "step": 253 }, { - "entropy": 0.5882778912782669, - "epoch": 4.710280373831775, - "grad_norm": 0.022530725225806236, + "entropy": 0.6256071850657463, + "epoch": 1.6423357664233578, + "grad_norm": 0.008181072771549225, "learning_rate": 0.0002, - "loss": 0.5867466926574707, - "mean_token_accuracy": 0.7620512098073959, - "num_tokens": 19901758.0, + "loss": 0.6292101144790649, + "mean_token_accuracy": 0.743871308863163, + "num_tokens": 9436011.0, "step": 254 }, { - "entropy": 0.5733254551887512, - "epoch": 4.728971962616822, - "grad_norm": 0.024119891226291656, + "entropy": 0.6333504095673561, + "epoch": 1.64882400648824, + "grad_norm": 0.009949415922164917, "learning_rate": 0.0002, - "loss": 0.5707401037216187, - "mean_token_accuracy": 0.7695588320493698, - "num_tokens": 19981817.0, + "loss": 0.6347252130508423, + "mean_token_accuracy": 0.7401739284396172, + "num_tokens": 9473110.0, "step": 255 }, { - "entropy": 0.5853608995676041, - "epoch": 4.747663551401869, - "grad_norm": 0.02340366318821907, + "entropy": 0.6310138329863548, + "epoch": 1.6553122465531225, + "grad_norm": 0.00846829917281866, "learning_rate": 0.0002, - "loss": 0.5855814218521118, - "mean_token_accuracy": 0.7639720290899277, - "num_tokens": 20060590.0, + "loss": 0.6339915990829468, + "mean_token_accuracy": 0.7427053153514862, + "num_tokens": 9510350.0, "step": 256 }, { - "entropy": 0.5997171998023987, - "epoch": 4.766355140186916, - "grad_norm": 0.02151717059314251, + "entropy": 0.6202550306916237, + "epoch": 1.661800486618005, + "grad_norm": 0.009316318668425083, "learning_rate": 0.0002, - "loss": 0.6026393175125122, - "mean_token_accuracy": 0.7556241452693939, - "num_tokens": 20138939.0, + "loss": 0.6241627335548401, + "mean_token_accuracy": 0.7441129460930824, + "num_tokens": 9547581.0, "step": 257 }, { - "entropy": 0.5747672617435455, - "epoch": 4.785046728971962, - "grad_norm": 0.024703452363610268, + "entropy": 0.640548974275589, + "epoch": 1.6682887266828872, + "grad_norm": 0.008892681449651718, "learning_rate": 0.0002, - "loss": 0.575732409954071, - "mean_token_accuracy": 0.7657794505357742, - "num_tokens": 20219498.0, + "loss": 0.6457140445709229, + "mean_token_accuracy": 0.736494742333889, + "num_tokens": 9584913.0, "step": 258 }, { - "entropy": 0.5892387628555298, - "epoch": 4.803738317757009, - "grad_norm": 0.020495539531111717, + "entropy": 0.6206653639674187, + "epoch": 1.6747769667477697, + "grad_norm": 0.008709060959517956, "learning_rate": 0.0002, - "loss": 0.5848783254623413, - "mean_token_accuracy": 0.7626757174730301, - "num_tokens": 20297931.0, + "loss": 0.6203189492225647, + "mean_token_accuracy": 0.7498921826481819, + "num_tokens": 9622351.0, "step": 259 }, { - "entropy": 0.5842539519071579, - "epoch": 4.822429906542056, - "grad_norm": 0.024631142616271973, + "entropy": 0.6282004490494728, + "epoch": 1.6812652068126521, + "grad_norm": 0.0090560931712389, "learning_rate": 0.0002, - "loss": 0.5821443796157837, - "mean_token_accuracy": 0.762598842382431, - "num_tokens": 20377397.0, + "loss": 0.6246728897094727, + "mean_token_accuracy": 0.746510811150074, + "num_tokens": 9659652.0, "step": 260 }, { - "entropy": 0.5811708569526672, - "epoch": 4.841121495327103, - "grad_norm": 0.019834479317069054, + "entropy": 0.6318396255373955, + "epoch": 1.6877534468775344, + "grad_norm": 0.007608218118548393, "learning_rate": 0.0002, - "loss": 0.5774982571601868, - "mean_token_accuracy": 0.7656573057174683, - "num_tokens": 20457183.0, + "loss": 0.62848961353302, + "mean_token_accuracy": 0.7440729290246964, + "num_tokens": 9697284.0, "step": 261 }, { - "entropy": 0.584972158074379, - "epoch": 4.859813084112149, - "grad_norm": 0.02263413555920124, + "entropy": 0.6200717613101006, + "epoch": 1.6942416869424168, + "grad_norm": 0.009493952617049217, "learning_rate": 0.0002, - "loss": 0.5836901068687439, - "mean_token_accuracy": 0.7635170221328735, - "num_tokens": 20536220.0, + "loss": 0.6228904724121094, + "mean_token_accuracy": 0.7480449378490448, + "num_tokens": 9734627.0, "step": 262 }, { - "entropy": 0.5772289782762527, - "epoch": 4.878504672897196, - "grad_norm": 0.022467754781246185, + "entropy": 0.6331067234277725, + "epoch": 1.7007299270072993, + "grad_norm": 0.008472482673823833, "learning_rate": 0.0002, - "loss": 0.574739396572113, - "mean_token_accuracy": 0.7662009298801422, - "num_tokens": 20615923.0, + "loss": 0.6337133646011353, + "mean_token_accuracy": 0.7426456362009048, + "num_tokens": 9772063.0, "step": 263 }, { - "entropy": 0.5771598666906357, - "epoch": 4.897196261682243, - "grad_norm": 0.025707783177495003, + "entropy": 0.6172152981162071, + "epoch": 1.7072181670721815, + "grad_norm": 0.008520574308931828, "learning_rate": 0.0002, - "loss": 0.5843824148178101, - "mean_token_accuracy": 0.7631357461214066, - "num_tokens": 20694883.0, + "loss": 0.6212704181671143, + "mean_token_accuracy": 0.7456109151244164, + "num_tokens": 9809281.0, "step": 264 }, { - "entropy": 0.5870597958564758, - "epoch": 4.91588785046729, - "grad_norm": 0.021971244364976883, + "entropy": 0.6255315691232681, + "epoch": 1.7137064071370642, + "grad_norm": 0.008351411670446396, "learning_rate": 0.0002, - "loss": 0.589478611946106, - "mean_token_accuracy": 0.7609104216098785, - "num_tokens": 20773561.0, + "loss": 0.6286416053771973, + "mean_token_accuracy": 0.7446007430553436, + "num_tokens": 9846539.0, "step": 265 }, { - "entropy": 0.5848358869552612, - "epoch": 4.934579439252336, - "grad_norm": 0.0271756611764431, + "entropy": 0.6238176673650742, + "epoch": 1.7201946472019465, + "grad_norm": 0.007990843616425991, "learning_rate": 0.0002, - "loss": 0.5806835293769836, - "mean_token_accuracy": 0.7638518363237381, - "num_tokens": 20852649.0, + "loss": 0.6225998401641846, + "mean_token_accuracy": 0.7458446845412254, + "num_tokens": 9884004.0, "step": 266 }, { - "entropy": 0.589514821767807, - "epoch": 4.953271028037383, - "grad_norm": 0.02279243804514408, + "entropy": 0.6216712817549706, + "epoch": 1.7266828872668287, + "grad_norm": 0.00867629423737526, "learning_rate": 0.0002, - "loss": 0.5852782726287842, - "mean_token_accuracy": 0.7629085779190063, - "num_tokens": 20930316.0, + "loss": 0.6247957944869995, + "mean_token_accuracy": 0.7463371530175209, + "num_tokens": 9921115.0, "step": 267 }, { - "entropy": 0.5957552790641785, - "epoch": 4.97196261682243, - "grad_norm": 0.020448876544833183, + "entropy": 0.6401625499129295, + "epoch": 1.7331711273317114, + "grad_norm": 0.00958551187068224, "learning_rate": 0.0002, - "loss": 0.5981478691101074, - "mean_token_accuracy": 0.7577082216739655, - "num_tokens": 21008020.0, + "loss": 0.6359888911247253, + "mean_token_accuracy": 0.742260254919529, + "num_tokens": 9958978.0, "step": 268 }, { - "entropy": 0.5856837332248688, - "epoch": 4.990654205607477, - "grad_norm": 0.02667153999209404, + "entropy": 0.6297059804201126, + "epoch": 1.7396593673965937, + "grad_norm": 0.009358945302665234, "learning_rate": 0.0002, - "loss": 0.5909496545791626, - "mean_token_accuracy": 0.7603503912687302, - "num_tokens": 21087720.0, + "loss": 0.6260662078857422, + "mean_token_accuracy": 0.7483563721179962, + "num_tokens": 9996046.0, "step": 269 }, { - "entropy": 0.6056640446186066, - "epoch": 5.0, - "grad_norm": 0.02682621218264103, + "entropy": 0.6102557927370071, + "epoch": 1.7461476074614761, + "grad_norm": 0.008488922379910946, "learning_rate": 0.0002, - "loss": 0.603358268737793, - "mean_token_accuracy": 0.7550290524959564, - "num_tokens": 21125912.0, + "loss": 0.6104397773742676, + "mean_token_accuracy": 0.7516083940863609, + "num_tokens": 10033145.0, "step": 270 }, { - "entropy": 0.5837572664022446, - "epoch": 5.018691588785047, - "grad_norm": 0.026227472350001335, + "entropy": 0.6110394448041916, + "epoch": 1.7526358475263586, + "grad_norm": 0.009671971201896667, "learning_rate": 0.0002, - "loss": 0.5720741748809814, - "mean_token_accuracy": 0.7683691382408142, - "num_tokens": 21204387.0, + "loss": 0.6171742081642151, + "mean_token_accuracy": 0.7473302856087685, + "num_tokens": 10070347.0, "step": 271 }, { - "entropy": 0.578724667429924, - "epoch": 5.037383177570093, - "grad_norm": 0.023315778002142906, + "entropy": 0.6102030426263809, + "epoch": 1.7591240875912408, + "grad_norm": 0.01004206482321024, "learning_rate": 0.0002, - "loss": 0.5750924348831177, - "mean_token_accuracy": 0.7657794952392578, - "num_tokens": 21283728.0, + "loss": 0.6197723746299744, + "mean_token_accuracy": 0.7478247955441475, + "num_tokens": 10107543.0, "step": 272 }, { - "entropy": 0.5838986188173294, - "epoch": 5.05607476635514, - "grad_norm": 0.020290400832891464, + "entropy": 0.6324944272637367, + "epoch": 1.7656123276561233, + "grad_norm": 0.008376670069992542, "learning_rate": 0.0002, - "loss": 0.5844892263412476, - "mean_token_accuracy": 0.7619540095329285, - "num_tokens": 21362457.0, + "loss": 0.6334455609321594, + "mean_token_accuracy": 0.7418324947357178, + "num_tokens": 10144562.0, "step": 273 }, { - "entropy": 0.5746825039386749, - "epoch": 5.074766355140187, - "grad_norm": 0.023446552455425262, + "entropy": 0.6232613623142242, + "epoch": 1.7721005677210058, + "grad_norm": 0.009440955705940723, "learning_rate": 0.0002, - "loss": 0.5793564319610596, - "mean_token_accuracy": 0.7645887285470963, - "num_tokens": 21440203.0, + "loss": 0.6198002099990845, + "mean_token_accuracy": 0.750127449631691, + "num_tokens": 10181837.0, "step": 274 }, { - "entropy": 0.5728374719619751, - "epoch": 5.093457943925234, - "grad_norm": 0.020337004214525223, + "entropy": 0.6218618527054787, + "epoch": 1.778588807785888, + "grad_norm": 0.008727550506591797, "learning_rate": 0.0002, - "loss": 0.5744699239730835, - "mean_token_accuracy": 0.7651638239622116, - "num_tokens": 21519380.0, + "loss": 0.6228897571563721, + "mean_token_accuracy": 0.7451170310378075, + "num_tokens": 10218887.0, "step": 275 }, { - "entropy": 0.5869368463754654, - "epoch": 5.11214953271028, - "grad_norm": 0.024822693318128586, + "entropy": 0.6297050788998604, + "epoch": 1.7850770478507705, + "grad_norm": 0.008303189650177956, "learning_rate": 0.0002, - "loss": 0.5826805830001831, - "mean_token_accuracy": 0.7643714398145676, - "num_tokens": 21598439.0, + "loss": 0.6325977444648743, + "mean_token_accuracy": 0.7429015561938286, + "num_tokens": 10256316.0, "step": 276 }, { - "entropy": 0.5783119201660156, - "epoch": 5.130841121495327, - "grad_norm": 0.02055417001247406, + "entropy": 0.6150370612740517, + "epoch": 1.791565287915653, + "grad_norm": 0.009460131637752056, "learning_rate": 0.0002, - "loss": 0.5751723051071167, - "mean_token_accuracy": 0.7667541205883026, - "num_tokens": 21678545.0, + "loss": 0.6189665198326111, + "mean_token_accuracy": 0.7513208463788033, + "num_tokens": 10292958.0, "step": 277 }, { - "entropy": 0.5900953710079193, - "epoch": 5.149532710280374, - "grad_norm": 0.021529069170355797, + "entropy": 0.6380631476640701, + "epoch": 1.7980535279805352, + "grad_norm": 0.008382478728890419, "learning_rate": 0.0002, - "loss": 0.5940208435058594, - "mean_token_accuracy": 0.758448600769043, - "num_tokens": 21755725.0, + "loss": 0.6411799192428589, + "mean_token_accuracy": 0.7389534488320351, + "num_tokens": 10330143.0, "step": 278 }, { - "entropy": 0.5827012360095978, - "epoch": 5.168224299065421, - "grad_norm": 0.030911732465028763, + "entropy": 0.6122751757502556, + "epoch": 1.8045417680454177, + "grad_norm": 0.0077201686799526215, "learning_rate": 0.0002, - "loss": 0.5863416194915771, - "mean_token_accuracy": 0.7614113390445709, - "num_tokens": 21834983.0, + "loss": 0.6154634356498718, + "mean_token_accuracy": 0.7478373274207115, + "num_tokens": 10367348.0, "step": 279 }, { - "entropy": 0.5782018750905991, - "epoch": 5.186915887850467, - "grad_norm": 0.022593926638364792, + "entropy": 0.6171681880950928, + "epoch": 1.8110300081103001, + "grad_norm": 0.014772728085517883, "learning_rate": 0.0002, - "loss": 0.5739820003509521, - "mean_token_accuracy": 0.7669774144887924, - "num_tokens": 21914036.0, + "loss": 0.6175127625465393, + "mean_token_accuracy": 0.7471248880028725, + "num_tokens": 10404586.0, "step": 280 }, { - "entropy": 0.5947683751583099, - "epoch": 5.205607476635514, - "grad_norm": 0.02552945725619793, + "entropy": 0.6203941032290459, + "epoch": 1.8175182481751824, + "grad_norm": 0.00933381449431181, "learning_rate": 0.0002, - "loss": 0.5868436694145203, - "mean_token_accuracy": 0.7614100873470306, - "num_tokens": 21993146.0, + "loss": 0.6234451532363892, + "mean_token_accuracy": 0.7449408918619156, + "num_tokens": 10441660.0, "step": 281 }, { - "entropy": 0.5864996314048767, - "epoch": 5.224299065420561, - "grad_norm": 0.02433052286505699, + "entropy": 0.6171698048710823, + "epoch": 1.8240064882400648, + "grad_norm": 0.02071473002433777, "learning_rate": 0.0002, - "loss": 0.5833629369735718, - "mean_token_accuracy": 0.7621068209409714, - "num_tokens": 22070765.0, + "loss": 0.6131167411804199, + "mean_token_accuracy": 0.7504094913601875, + "num_tokens": 10478740.0, "step": 282 }, { - "entropy": 0.5739980936050415, - "epoch": 5.242990654205608, - "grad_norm": 0.03387480974197388, + "entropy": 0.6204886436462402, + "epoch": 1.8304947283049473, + "grad_norm": 0.008232798427343369, "learning_rate": 0.0002, - "loss": 0.5857794880867004, - "mean_token_accuracy": 0.7629742175340652, - "num_tokens": 22149016.0, + "loss": 0.6195346117019653, + "mean_token_accuracy": 0.7477771490812302, + "num_tokens": 10515739.0, "step": 283 }, { - "entropy": 0.5784127712249756, - "epoch": 5.261682242990654, - "grad_norm": 0.02454730123281479, + "entropy": 0.6222864389419556, + "epoch": 1.8369829683698295, + "grad_norm": 0.008826926350593567, "learning_rate": 0.0002, - "loss": 0.5814563632011414, - "mean_token_accuracy": 0.7645214051008224, - "num_tokens": 22228077.0, + "loss": 0.6246115565299988, + "mean_token_accuracy": 0.7467887252569199, + "num_tokens": 10552926.0, "step": 284 }, { - "entropy": 0.5910583734512329, - "epoch": 5.280373831775701, - "grad_norm": 0.023027142509818077, + "entropy": 0.6199471354484558, + "epoch": 1.8434712084347122, + "grad_norm": 0.031130356714129448, "learning_rate": 0.0002, - "loss": 0.5844653844833374, - "mean_token_accuracy": 0.7618297934532166, - "num_tokens": 22308791.0, + "loss": 0.6234173774719238, + "mean_token_accuracy": 0.7465962916612625, + "num_tokens": 10590404.0, "step": 285 }, { - "entropy": 0.5918671190738678, - "epoch": 5.299065420560748, - "grad_norm": 0.028409529477357864, + "entropy": 0.6229867041110992, + "epoch": 1.8499594484995945, + "grad_norm": 0.009124074131250381, "learning_rate": 0.0002, - "loss": 0.583986759185791, - "mean_token_accuracy": 0.7624140679836273, - "num_tokens": 22388553.0, + "loss": 0.6230523586273193, + "mean_token_accuracy": 0.7485576421022415, + "num_tokens": 10628169.0, "step": 286 }, { - "entropy": 0.5927205830812454, - "epoch": 5.317757009345795, - "grad_norm": 0.020732548087835312, + "entropy": 0.6245164126157761, + "epoch": 1.8564476885644767, + "grad_norm": 0.04299340024590492, "learning_rate": 0.0002, - "loss": 0.5924677848815918, - "mean_token_accuracy": 0.7593077719211578, - "num_tokens": 22466926.0, + "loss": 0.6296451091766357, + "mean_token_accuracy": 0.746208980679512, + "num_tokens": 10665578.0, "step": 287 }, { - "entropy": 0.5829800367355347, - "epoch": 5.336448598130841, - "grad_norm": 0.03212112933397293, + "entropy": 0.6367667019367218, + "epoch": 1.8629359286293594, + "grad_norm": 0.008064360357820988, "learning_rate": 0.0002, - "loss": 0.5898263454437256, - "mean_token_accuracy": 0.7594864368438721, - "num_tokens": 22545473.0, + "loss": 0.6342769861221313, + "mean_token_accuracy": 0.7435217127203941, + "num_tokens": 10703123.0, "step": 288 }, { - "entropy": 0.5854717344045639, - "epoch": 5.355140186915888, - "grad_norm": 0.023481527343392372, + "entropy": 0.6245287135243416, + "epoch": 1.8694241686942417, + "grad_norm": 0.021351464092731476, "learning_rate": 0.0002, - "loss": 0.5866089463233948, - "mean_token_accuracy": 0.7612689137458801, - "num_tokens": 22624084.0, + "loss": 0.6260511875152588, + "mean_token_accuracy": 0.7465523779392242, + "num_tokens": 10740314.0, "step": 289 }, { - "entropy": 0.594966858625412, - "epoch": 5.373831775700935, - "grad_norm": 0.025457587093114853, + "entropy": 0.6212104111909866, + "epoch": 1.8759124087591241, + "grad_norm": 0.01059524156153202, "learning_rate": 0.0002, - "loss": 0.5871824026107788, - "mean_token_accuracy": 0.7623147368431091, - "num_tokens": 22702606.0, + "loss": 0.6210169792175293, + "mean_token_accuracy": 0.7475718706846237, + "num_tokens": 10777825.0, "step": 290 }, { - "entropy": 0.5951681286096573, - "epoch": 5.392523364485982, - "grad_norm": 0.02658168412744999, + "entropy": 0.6373793482780457, + "epoch": 1.8824006488240066, + "grad_norm": 0.008884789422154427, "learning_rate": 0.0002, - "loss": 0.5921801328659058, - "mean_token_accuracy": 0.7598440647125244, - "num_tokens": 22781840.0, + "loss": 0.6366032361984253, + "mean_token_accuracy": 0.7391576170921326, + "num_tokens": 10815225.0, "step": 291 }, { - "entropy": 0.5740289241075516, - "epoch": 5.411214953271028, - "grad_norm": 0.025105727836489677, + "entropy": 0.6392252072691917, + "epoch": 1.8888888888888888, + "grad_norm": 0.013435903936624527, "learning_rate": 0.0002, - "loss": 0.5768394470214844, - "mean_token_accuracy": 0.7659056484699249, - "num_tokens": 22861158.0, + "loss": 0.6392862796783447, + "mean_token_accuracy": 0.7395146489143372, + "num_tokens": 10852456.0, "step": 292 }, { - "entropy": 0.5927090644836426, - "epoch": 5.429906542056075, - "grad_norm": 0.027616171166300774, + "entropy": 0.6242144107818604, + "epoch": 1.8953771289537713, + "grad_norm": 0.009207301773130894, "learning_rate": 0.0002, - "loss": 0.5969903469085693, - "mean_token_accuracy": 0.7579035460948944, - "num_tokens": 22939419.0, + "loss": 0.6249897480010986, + "mean_token_accuracy": 0.7450198903679848, + "num_tokens": 10889534.0, "step": 293 }, { - "entropy": 0.5913174897432327, - "epoch": 5.4485981308411215, - "grad_norm": 0.023430990055203438, + "entropy": 0.6158905401825905, + "epoch": 1.9018653690186538, + "grad_norm": 0.009233659133315086, "learning_rate": 0.0002, - "loss": 0.584871768951416, - "mean_token_accuracy": 0.7618055790662766, - "num_tokens": 23018229.0, + "loss": 0.6220048069953918, + "mean_token_accuracy": 0.7474906519055367, + "num_tokens": 10927138.0, "step": 294 }, { - "entropy": 0.6013437658548355, - "epoch": 5.4672897196261685, - "grad_norm": 0.02779349498450756, + "entropy": 0.6057498604059219, + "epoch": 1.908353609083536, + "grad_norm": 0.00886959582567215, "learning_rate": 0.0002, - "loss": 0.596491813659668, - "mean_token_accuracy": 0.7574046552181244, - "num_tokens": 23097420.0, + "loss": 0.6085807085037231, + "mean_token_accuracy": 0.7527724504470825, + "num_tokens": 10964121.0, "step": 295 }, { - "entropy": 0.5900115221738815, - "epoch": 5.485981308411215, - "grad_norm": 0.02505963295698166, + "entropy": 0.6314896494150162, + "epoch": 1.9148418491484185, + "grad_norm": 0.00863397866487503, "learning_rate": 0.0002, - "loss": 0.5895775556564331, - "mean_token_accuracy": 0.760588601231575, - "num_tokens": 23176053.0, + "loss": 0.6325403451919556, + "mean_token_accuracy": 0.7428522482514381, + "num_tokens": 11001557.0, "step": 296 }, { - "entropy": 0.5766851752996445, - "epoch": 5.5046728971962615, - "grad_norm": 0.029174979776144028, + "entropy": 0.6221454739570618, + "epoch": 1.921330089213301, + "grad_norm": 0.009161150082945824, "learning_rate": 0.0002, - "loss": 0.5806823968887329, - "mean_token_accuracy": 0.7644506692886353, - "num_tokens": 23256066.0, + "loss": 0.6208068132400513, + "mean_token_accuracy": 0.7462965175509453, + "num_tokens": 11038904.0, "step": 297 }, { - "entropy": 0.5836054682731628, - "epoch": 5.5233644859813085, - "grad_norm": 0.023760344833135605, + "entropy": 0.6189481094479561, + "epoch": 1.9278183292781832, + "grad_norm": 0.008889259770512581, "learning_rate": 0.0002, - "loss": 0.5859720706939697, - "mean_token_accuracy": 0.7620792984962463, - "num_tokens": 23335050.0, + "loss": 0.6184496283531189, + "mean_token_accuracy": 0.7480250671505928, + "num_tokens": 11076150.0, "step": 298 }, { - "entropy": 0.5844072699546814, - "epoch": 5.542056074766355, - "grad_norm": 0.022240791469812393, + "entropy": 0.6238919943571091, + "epoch": 1.9343065693430657, + "grad_norm": 0.0090845488011837, "learning_rate": 0.0002, - "loss": 0.581206202507019, - "mean_token_accuracy": 0.7644935250282288, - "num_tokens": 23413527.0, + "loss": 0.6274781227111816, + "mean_token_accuracy": 0.744391493499279, + "num_tokens": 11113447.0, "step": 299 }, { - "entropy": 0.5935729742050171, - "epoch": 5.5607476635514015, - "grad_norm": 0.024417495355010033, + "entropy": 0.6231639310717583, + "epoch": 1.9407948094079481, + "grad_norm": 0.009156333282589912, "learning_rate": 0.0002, - "loss": 0.589938759803772, - "mean_token_accuracy": 0.7614579200744629, - "num_tokens": 23492631.0, + "loss": 0.6222721934318542, + "mean_token_accuracy": 0.7496197745203972, + "num_tokens": 11150750.0, "step": 300 }, { - "entropy": 0.5919747650623322, - "epoch": 5.579439252336448, - "grad_norm": 0.023943627253174782, + "entropy": 0.6238841712474823, + "epoch": 1.9472830494728304, + "grad_norm": 0.008916804566979408, "learning_rate": 0.0002, - "loss": 0.5906035304069519, - "mean_token_accuracy": 0.7593590617179871, - "num_tokens": 23570833.0, + "loss": 0.6307159066200256, + "mean_token_accuracy": 0.7432639226317406, + "num_tokens": 11187972.0, "step": 301 }, { - "entropy": 0.5831288248300552, - "epoch": 5.598130841121495, - "grad_norm": 0.025227652862668037, + "entropy": 0.628197155892849, + "epoch": 1.9537712895377128, + "grad_norm": 0.009915877133607864, "learning_rate": 0.0002, - "loss": 0.583688497543335, - "mean_token_accuracy": 0.7631240636110306, - "num_tokens": 23650408.0, + "loss": 0.6339118480682373, + "mean_token_accuracy": 0.741386704146862, + "num_tokens": 11225108.0, "step": 302 }, { - "entropy": 0.5717721283435822, - "epoch": 5.616822429906542, - "grad_norm": 0.021833831444382668, + "entropy": 0.6199254244565964, + "epoch": 1.9602595296025953, + "grad_norm": 0.008810635656118393, "learning_rate": 0.0002, - "loss": 0.5739642381668091, - "mean_token_accuracy": 0.7671074420213699, - "num_tokens": 23729933.0, + "loss": 0.6184746026992798, + "mean_token_accuracy": 0.7482490092515945, + "num_tokens": 11262735.0, "step": 303 }, { - "entropy": 0.5738316625356674, - "epoch": 5.635514018691588, - "grad_norm": 0.027755092829465866, + "entropy": 0.6206595823168755, + "epoch": 1.9667477696674776, + "grad_norm": 0.008489571511745453, "learning_rate": 0.0002, - "loss": 0.5777672529220581, - "mean_token_accuracy": 0.7638746052980423, - "num_tokens": 23809992.0, + "loss": 0.6251119375228882, + "mean_token_accuracy": 0.7444824799895287, + "num_tokens": 11299837.0, "step": 304 }, { - "entropy": 0.5943573713302612, - "epoch": 5.654205607476635, - "grad_norm": 0.024508560076355934, + "entropy": 0.6231965124607086, + "epoch": 1.9732360097323602, + "grad_norm": 0.008548264391720295, "learning_rate": 0.0002, - "loss": 0.5914307236671448, - "mean_token_accuracy": 0.7582877576351166, - "num_tokens": 23888866.0, + "loss": 0.6258702874183655, + "mean_token_accuracy": 0.7451799884438515, + "num_tokens": 11337335.0, "step": 305 }, { - "entropy": 0.582805335521698, - "epoch": 5.672897196261682, - "grad_norm": 0.02408367209136486, + "entropy": 0.6233715191483498, + "epoch": 1.9797242497972425, + "grad_norm": 0.008984974585473537, "learning_rate": 0.0002, - "loss": 0.5777289867401123, - "mean_token_accuracy": 0.766036868095398, - "num_tokens": 23969206.0, + "loss": 0.6242036819458008, + "mean_token_accuracy": 0.7449030429124832, + "num_tokens": 11375037.0, "step": 306 }, { - "entropy": 0.5912429988384247, - "epoch": 5.691588785046729, - "grad_norm": 0.02204861491918564, + "entropy": 0.6145095080137253, + "epoch": 1.986212489862125, + "grad_norm": 0.008570129983127117, "learning_rate": 0.0002, - "loss": 0.5905025601387024, - "mean_token_accuracy": 0.7602925002574921, - "num_tokens": 24047777.0, + "loss": 0.6161348819732666, + "mean_token_accuracy": 0.7494730427861214, + "num_tokens": 11412372.0, "step": 307 }, { - "entropy": 0.582305058836937, - "epoch": 5.710280373831775, - "grad_norm": 0.02204098179936409, + "entropy": 0.6227882578969002, + "epoch": 1.9927007299270074, + "grad_norm": 0.009132519364356995, "learning_rate": 0.0002, - "loss": 0.5845706462860107, - "mean_token_accuracy": 0.762296050786972, - "num_tokens": 24125999.0, + "loss": 0.6249089241027832, + "mean_token_accuracy": 0.7440183088183403, + "num_tokens": 11449566.0, "step": 308 }, { - "entropy": 0.5866653472185135, - "epoch": 5.728971962616822, - "grad_norm": 0.025352345779538155, + "entropy": 0.6210556477308273, + "epoch": 1.9991889699918897, + "grad_norm": 0.007969100028276443, "learning_rate": 0.0002, - "loss": 0.5904455184936523, - "mean_token_accuracy": 0.7604480236768723, - "num_tokens": 24204762.0, + "loss": 0.6244759559631348, + "mean_token_accuracy": 0.746830090880394, + "num_tokens": 11487152.0, "step": 309 }, { - "entropy": 0.5811505317687988, - "epoch": 5.747663551401869, - "grad_norm": 0.02347879484295845, + "entropy": 0.6104058027267456, + "epoch": 2.0, + "grad_norm": 0.019919538870453835, "learning_rate": 0.0002, - "loss": 0.5761972665786743, - "mean_token_accuracy": 0.766374871134758, - "num_tokens": 24283469.0, + "loss": 0.6209793090820312, + "mean_token_accuracy": 0.7482735514640808, + "num_tokens": 11491673.0, "step": 310 }, { - "entropy": 0.5975845456123352, - "epoch": 5.766355140186916, - "grad_norm": 0.022250916808843613, + "entropy": 0.6369761228561401, + "epoch": 2.0064882400648822, + "grad_norm": 0.011179310269653797, "learning_rate": 0.0002, - "loss": 0.5930895805358887, - "mean_token_accuracy": 0.7588881254196167, - "num_tokens": 24362733.0, + "loss": 0.6280978918075562, + "mean_token_accuracy": 0.7433952018618584, + "num_tokens": 11528991.0, "step": 311 }, { - "entropy": 0.5830185413360596, - "epoch": 5.785046728971962, - "grad_norm": 0.02017797715961933, + "entropy": 0.6231134757399559, + "epoch": 2.012976480129765, + "grad_norm": 0.012395660392940044, "learning_rate": 0.0002, - "loss": 0.5834226608276367, - "mean_token_accuracy": 0.7631048262119293, - "num_tokens": 24441132.0, + "loss": 0.6168753504753113, + "mean_token_accuracy": 0.7469241917133331, + "num_tokens": 11566174.0, "step": 312 }, { - "entropy": 0.5777293294668198, - "epoch": 5.803738317757009, - "grad_norm": 0.026559006422758102, + "entropy": 0.6361245587468147, + "epoch": 2.019464720194647, + "grad_norm": 0.010151471942663193, "learning_rate": 0.0002, - "loss": 0.5827245712280273, - "mean_token_accuracy": 0.7643077671527863, - "num_tokens": 24519646.0, + "loss": 0.6396852731704712, + "mean_token_accuracy": 0.7390208393335342, + "num_tokens": 11603660.0, "step": 313 }, { - "entropy": 0.5818401873111725, - "epoch": 5.822429906542056, - "grad_norm": 0.025208717212080956, + "entropy": 0.6205078735947609, + "epoch": 2.0259529602595294, + "grad_norm": 0.011173305101692677, "learning_rate": 0.0002, - "loss": 0.5849472880363464, - "mean_token_accuracy": 0.7625377178192139, - "num_tokens": 24599240.0, + "loss": 0.6290929317474365, + "mean_token_accuracy": 0.7439283728599548, + "num_tokens": 11640777.0, "step": 314 }, { - "entropy": 0.578282043337822, - "epoch": 5.841121495327103, - "grad_norm": 0.021883705630898476, + "entropy": 0.6196452155709267, + "epoch": 2.032441200324412, + "grad_norm": 0.011216065846383572, "learning_rate": 0.0002, - "loss": 0.5731823444366455, - "mean_token_accuracy": 0.7665036618709564, - "num_tokens": 24678919.0, + "loss": 0.6270949840545654, + "mean_token_accuracy": 0.7424712553620338, + "num_tokens": 11677826.0, "step": 315 }, { - "entropy": 0.5882506668567657, - "epoch": 5.859813084112149, - "grad_norm": 0.027508528903126717, + "entropy": 0.6094615831971169, + "epoch": 2.0389294403892944, + "grad_norm": 0.009836558252573013, "learning_rate": 0.0002, - "loss": 0.5805738568305969, - "mean_token_accuracy": 0.7643076032400131, - "num_tokens": 24759765.0, + "loss": 0.6110177040100098, + "mean_token_accuracy": 0.7522123828530312, + "num_tokens": 11714782.0, "step": 316 }, { - "entropy": 0.5644465982913971, - "epoch": 5.878504672897196, - "grad_norm": 0.02333572506904602, + "entropy": 0.6228377372026443, + "epoch": 2.0454176804541766, + "grad_norm": 0.009827308356761932, "learning_rate": 0.0002, - "loss": 0.5681304931640625, - "mean_token_accuracy": 0.768625870347023, - "num_tokens": 24838278.0, + "loss": 0.6198099851608276, + "mean_token_accuracy": 0.7482241690158844, + "num_tokens": 11751901.0, "step": 317 }, { - "entropy": 0.571717843413353, - "epoch": 5.897196261682243, - "grad_norm": 0.027057446539402008, + "entropy": 0.6236361563205719, + "epoch": 2.0519059205190593, + "grad_norm": 0.010331663303077221, "learning_rate": 0.0002, - "loss": 0.5760421752929688, - "mean_token_accuracy": 0.7669651806354523, - "num_tokens": 24916847.0, + "loss": 0.6171518564224243, + "mean_token_accuracy": 0.747296430170536, + "num_tokens": 11789727.0, "step": 318 }, { - "entropy": 0.5824219137430191, - "epoch": 5.91588785046729, - "grad_norm": 0.024362891912460327, + "entropy": 0.6258771196007729, + "epoch": 2.0583941605839415, + "grad_norm": 0.010642528533935547, "learning_rate": 0.0002, - "loss": 0.5817481279373169, - "mean_token_accuracy": 0.7647458910942078, - "num_tokens": 24996241.0, + "loss": 0.6271529197692871, + "mean_token_accuracy": 0.7447842955589294, + "num_tokens": 11826898.0, "step": 319 }, { - "entropy": 0.5849971771240234, - "epoch": 5.934579439252336, - "grad_norm": 0.02463519386947155, + "entropy": 0.6150587797164917, + "epoch": 2.0648824006488242, + "grad_norm": 0.009091152809560299, "learning_rate": 0.0002, - "loss": 0.582144558429718, - "mean_token_accuracy": 0.764634981751442, - "num_tokens": 25076927.0, + "loss": 0.6166321039199829, + "mean_token_accuracy": 0.7505485117435455, + "num_tokens": 11863842.0, "step": 320 }, { - "entropy": 0.6033434122800827, - "epoch": 5.953271028037383, - "grad_norm": 0.02771107293665409, + "entropy": 0.6226691231131554, + "epoch": 2.0713706407137065, + "grad_norm": 0.008850189857184887, "learning_rate": 0.0002, - "loss": 0.599830150604248, - "mean_token_accuracy": 0.7559361606836319, - "num_tokens": 25155040.0, + "loss": 0.6213895082473755, + "mean_token_accuracy": 0.7468440607190132, + "num_tokens": 11901235.0, "step": 321 }, { - "entropy": 0.581831768155098, - "epoch": 5.97196261682243, - "grad_norm": 0.02171648107469082, + "entropy": 0.634496659040451, + "epoch": 2.0778588807785887, + "grad_norm": 0.009685751050710678, "learning_rate": 0.0002, - "loss": 0.5809007883071899, - "mean_token_accuracy": 0.7641598880290985, - "num_tokens": 25233942.0, + "loss": 0.6369626522064209, + "mean_token_accuracy": 0.7408950179815292, + "num_tokens": 11938336.0, "step": 322 }, { - "entropy": 0.5758271366357803, - "epoch": 5.990654205607477, - "grad_norm": 0.02509225904941559, + "entropy": 0.6164573132991791, + "epoch": 2.0843471208434714, + "grad_norm": 0.010890510864555836, "learning_rate": 0.0002, - "loss": 0.5794141292572021, - "mean_token_accuracy": 0.7650892734527588, - "num_tokens": 25312004.0, + "loss": 0.6235396265983582, + "mean_token_accuracy": 0.7454954236745834, + "num_tokens": 11975368.0, "step": 323 }, { - "entropy": 0.5852536261081696, - "epoch": 6.0, - "grad_norm": 0.031556036323308945, + "entropy": 0.6137611418962479, + "epoch": 2.0908353609083536, + "grad_norm": 0.009321420453488827, "learning_rate": 0.0002, - "loss": 0.5901615023612976, - "mean_token_accuracy": 0.7596581876277924, - "num_tokens": 25351251.0, + "loss": 0.6175767183303833, + "mean_token_accuracy": 0.7478668764233589, + "num_tokens": 12012459.0, "step": 324 }, { - "entropy": 0.5906165093183517, - "epoch": 6.018691588785047, - "grad_norm": 0.021236663684248924, + "entropy": 0.6179320439696312, + "epoch": 2.097323600973236, + "grad_norm": 0.009330744855105877, "learning_rate": 0.0002, - "loss": 0.5863031148910522, - "mean_token_accuracy": 0.7612903267145157, - "num_tokens": 25429823.0, + "loss": 0.6184362173080444, + "mean_token_accuracy": 0.748590737581253, + "num_tokens": 12049829.0, "step": 325 }, { - "entropy": 0.5902242064476013, - "epoch": 6.037383177570093, - "grad_norm": 0.02503519505262375, + "entropy": 0.6192868947982788, + "epoch": 2.1038118410381186, + "grad_norm": 0.008818828500807285, "learning_rate": 0.0002, - "loss": 0.5857101678848267, - "mean_token_accuracy": 0.7612328678369522, - "num_tokens": 25509032.0, + "loss": 0.6174098253250122, + "mean_token_accuracy": 0.7478644922375679, + "num_tokens": 12087727.0, "step": 326 }, { - "entropy": 0.5882705599069595, - "epoch": 6.05607476635514, - "grad_norm": 0.022178243845701218, + "entropy": 0.626248262822628, + "epoch": 2.110300081103001, + "grad_norm": 0.008749144151806831, "learning_rate": 0.0002, - "loss": 0.5829363465309143, - "mean_token_accuracy": 0.7635704278945923, - "num_tokens": 25588440.0, + "loss": 0.6212329268455505, + "mean_token_accuracy": 0.747315414249897, + "num_tokens": 12124835.0, "step": 327 }, { - "entropy": 0.5852685421705246, - "epoch": 6.074766355140187, - "grad_norm": 0.02558092586696148, + "entropy": 0.625133216381073, + "epoch": 2.116788321167883, + "grad_norm": 0.009766868315637112, "learning_rate": 0.0002, - "loss": 0.5829890370368958, - "mean_token_accuracy": 0.7630147635936737, - "num_tokens": 25666862.0, + "loss": 0.624916136264801, + "mean_token_accuracy": 0.7457389757037163, + "num_tokens": 12162010.0, "step": 328 }, { - "entropy": 0.5755240172147751, - "epoch": 6.093457943925234, - "grad_norm": 0.03008244000375271, + "entropy": 0.6180580258369446, + "epoch": 2.1232765612327658, + "grad_norm": 0.010169712826609612, "learning_rate": 0.0002, - "loss": 0.5809780955314636, - "mean_token_accuracy": 0.7630897909402847, - "num_tokens": 25745492.0, + "loss": 0.6185243129730225, + "mean_token_accuracy": 0.7475102469325066, + "num_tokens": 12199560.0, "step": 329 }, { - "entropy": 0.592608630657196, - "epoch": 6.11214953271028, - "grad_norm": 0.02237210050225258, + "entropy": 0.618090882897377, + "epoch": 2.129764801297648, + "grad_norm": 0.010965410619974136, "learning_rate": 0.0002, - "loss": 0.5901657342910767, - "mean_token_accuracy": 0.7589312344789505, - "num_tokens": 25824245.0, + "loss": 0.628595232963562, + "mean_token_accuracy": 0.742675431072712, + "num_tokens": 12236987.0, "step": 330 }, { - "entropy": 0.5749453604221344, - "epoch": 6.130841121495327, - "grad_norm": 0.024231985211372375, + "entropy": 0.6243258565664291, + "epoch": 2.1362530413625302, + "grad_norm": 0.009334998205304146, "learning_rate": 0.0002, - "loss": 0.5709967613220215, - "mean_token_accuracy": 0.7677164077758789, - "num_tokens": 25903416.0, + "loss": 0.6280615329742432, + "mean_token_accuracy": 0.7434326112270355, + "num_tokens": 12274464.0, "step": 331 }, { - "entropy": 0.5901312232017517, - "epoch": 6.149532710280374, - "grad_norm": 0.025874990969896317, + "entropy": 0.6221758723258972, + "epoch": 2.142741281427413, + "grad_norm": 0.00768797192722559, "learning_rate": 0.0002, - "loss": 0.59079909324646, - "mean_token_accuracy": 0.7597486227750778, - "num_tokens": 25981127.0, + "loss": 0.6218302845954895, + "mean_token_accuracy": 0.7480092272162437, + "num_tokens": 12312027.0, "step": 332 }, { - "entropy": 0.5772260576486588, - "epoch": 6.168224299065421, - "grad_norm": 0.031823720782995224, + "entropy": 0.6239754110574722, + "epoch": 2.149229521492295, + "grad_norm": 0.007848316803574562, "learning_rate": 0.0002, - "loss": 0.585727334022522, - "mean_token_accuracy": 0.7610679566860199, - "num_tokens": 26060209.0, + "loss": 0.6233847141265869, + "mean_token_accuracy": 0.7466081529855728, + "num_tokens": 12349207.0, "step": 333 }, { - "entropy": 0.5794196575880051, - "epoch": 6.186915887850467, - "grad_norm": 0.02636229805648327, + "entropy": 0.6159957125782967, + "epoch": 2.1557177615571774, + "grad_norm": 0.009600339457392693, "learning_rate": 0.0002, - "loss": 0.576323390007019, - "mean_token_accuracy": 0.7644224166870117, - "num_tokens": 26138697.0, + "loss": 0.6117550134658813, + "mean_token_accuracy": 0.7508383393287659, + "num_tokens": 12386312.0, "step": 334 }, { - "entropy": 0.5810049474239349, - "epoch": 6.205607476635514, - "grad_norm": 0.02574821375310421, + "entropy": 0.6285756379365921, + "epoch": 2.16220600162206, + "grad_norm": 0.009564606472849846, "learning_rate": 0.0002, - "loss": 0.5759303569793701, - "mean_token_accuracy": 0.7661094963550568, - "num_tokens": 26217081.0, + "loss": 0.6304960250854492, + "mean_token_accuracy": 0.7436012774705887, + "num_tokens": 12423969.0, "step": 335 }, { - "entropy": 0.577182799577713, - "epoch": 6.224299065420561, - "grad_norm": 0.02286566235125065, + "entropy": 0.6194324493408203, + "epoch": 2.1686942416869424, + "grad_norm": 0.009417028166353703, "learning_rate": 0.0002, - "loss": 0.5750881433486938, - "mean_token_accuracy": 0.7653518319129944, - "num_tokens": 26295788.0, + "loss": 0.622604250907898, + "mean_token_accuracy": 0.7460262328386307, + "num_tokens": 12461498.0, "step": 336 }, { - "entropy": 0.5861713141202927, - "epoch": 6.242990654205608, - "grad_norm": 0.028622545301914215, + "entropy": 0.6123020723462105, + "epoch": 2.1751824817518246, + "grad_norm": 0.00952741876244545, "learning_rate": 0.0002, - "loss": 0.5886875987052917, - "mean_token_accuracy": 0.7594505399465561, - "num_tokens": 26375047.0, + "loss": 0.6190693378448486, + "mean_token_accuracy": 0.7473057582974434, + "num_tokens": 12498772.0, "step": 337 }, { - "entropy": 0.5752665996551514, - "epoch": 6.261682242990654, - "grad_norm": 0.023522673174738884, + "entropy": 0.6101055964827538, + "epoch": 2.1816707218167073, + "grad_norm": 0.00931888073682785, "learning_rate": 0.0002, - "loss": 0.5748910903930664, - "mean_token_accuracy": 0.766600638628006, - "num_tokens": 26453546.0, + "loss": 0.6161482334136963, + "mean_token_accuracy": 0.7476179748773575, + "num_tokens": 12535894.0, "step": 338 }, { - "entropy": 0.5716692358255386, - "epoch": 6.280373831775701, - "grad_norm": 0.025497497990727425, + "entropy": 0.6213592365384102, + "epoch": 2.1881589618815895, + "grad_norm": 0.008865389041602612, "learning_rate": 0.0002, - "loss": 0.5707880258560181, - "mean_token_accuracy": 0.7675977051258087, - "num_tokens": 26532437.0, + "loss": 0.6219321489334106, + "mean_token_accuracy": 0.7449849396944046, + "num_tokens": 12573498.0, "step": 339 }, { - "entropy": 0.5823859572410583, - "epoch": 6.299065420560748, - "grad_norm": 0.02345922775566578, + "entropy": 0.614892452955246, + "epoch": 2.1946472019464722, + "grad_norm": 0.009812900796532631, "learning_rate": 0.0002, - "loss": 0.5806757211685181, - "mean_token_accuracy": 0.7633695006370544, - "num_tokens": 26611054.0, + "loss": 0.6124197840690613, + "mean_token_accuracy": 0.7499328628182411, + "num_tokens": 12610465.0, "step": 340 }, { - "entropy": 0.577152207493782, - "epoch": 6.317757009345795, - "grad_norm": 0.03670202195644379, + "entropy": 0.6235473528504372, + "epoch": 2.2011354420113545, + "grad_norm": 0.009034697897732258, "learning_rate": 0.0002, - "loss": 0.5789405107498169, - "mean_token_accuracy": 0.7646550685167313, - "num_tokens": 26690138.0, + "loss": 0.6235278248786926, + "mean_token_accuracy": 0.7453176379203796, + "num_tokens": 12647446.0, "step": 341 }, { - "entropy": 0.5890039503574371, - "epoch": 6.336448598130841, - "grad_norm": 0.03328755870461464, + "entropy": 0.6155827194452286, + "epoch": 2.2076236820762367, + "grad_norm": 0.011849821545183659, "learning_rate": 0.0002, - "loss": 0.588995635509491, - "mean_token_accuracy": 0.7606080025434494, - "num_tokens": 26769925.0, + "loss": 0.6141517758369446, + "mean_token_accuracy": 0.7493102103471756, + "num_tokens": 12684339.0, "step": 342 }, { - "entropy": 0.5640043765306473, - "epoch": 6.355140186915888, - "grad_norm": 0.027529461309313774, + "entropy": 0.6220799088478088, + "epoch": 2.2141119221411194, + "grad_norm": 0.011021377518773079, "learning_rate": 0.0002, - "loss": 0.5621784925460815, - "mean_token_accuracy": 0.7716686129570007, - "num_tokens": 26849502.0, + "loss": 0.6232143640518188, + "mean_token_accuracy": 0.7435769438743591, + "num_tokens": 12722039.0, "step": 343 }, { - "entropy": 0.5703081637620926, - "epoch": 6.373831775700935, - "grad_norm": 0.029232876375317574, + "entropy": 0.60894425958395, + "epoch": 2.2206001622060016, + "grad_norm": 0.00959057454019785, "learning_rate": 0.0002, - "loss": 0.5690990090370178, - "mean_token_accuracy": 0.7682793736457825, - "num_tokens": 26928682.0, + "loss": 0.614958643913269, + "mean_token_accuracy": 0.7492904141545296, + "num_tokens": 12758559.0, "step": 344 }, { - "entropy": 0.5833006352186203, - "epoch": 6.392523364485982, - "grad_norm": 0.029239878058433533, + "entropy": 0.61026880890131, + "epoch": 2.227088402270884, + "grad_norm": 0.010138140991330147, "learning_rate": 0.0002, - "loss": 0.5839906930923462, - "mean_token_accuracy": 0.7636394202709198, - "num_tokens": 27007594.0, + "loss": 0.616437554359436, + "mean_token_accuracy": 0.7471959367394447, + "num_tokens": 12795759.0, "step": 345 }, { - "entropy": 0.5740661174058914, - "epoch": 6.411214953271028, - "grad_norm": 0.03573233261704445, + "entropy": 0.6212582364678383, + "epoch": 2.2335766423357666, + "grad_norm": 0.013862723484635353, "learning_rate": 0.0002, - "loss": 0.5750782489776611, - "mean_token_accuracy": 0.7659066617488861, - "num_tokens": 27086262.0, + "loss": 0.6215099692344666, + "mean_token_accuracy": 0.7478090971708298, + "num_tokens": 12833075.0, "step": 346 }, { - "entropy": 0.5843356847763062, - "epoch": 6.429906542056075, - "grad_norm": 0.03266820311546326, + "entropy": 0.6183774024248123, + "epoch": 2.240064882400649, + "grad_norm": 0.00895402580499649, "learning_rate": 0.0002, - "loss": 0.5765944719314575, - "mean_token_accuracy": 0.7660123109817505, - "num_tokens": 27166205.0, + "loss": 0.6187215447425842, + "mean_token_accuracy": 0.7494830936193466, + "num_tokens": 12870571.0, "step": 347 }, { - "entropy": 0.5712840706110001, - "epoch": 6.4485981308411215, - "grad_norm": 0.028312938287854195, + "entropy": 0.6210155412554741, + "epoch": 2.246553122465531, + "grad_norm": 0.041780415922403336, "learning_rate": 0.0002, - "loss": 0.5677918791770935, - "mean_token_accuracy": 0.7700672447681427, - "num_tokens": 27245542.0, + "loss": 0.6219582557678223, + "mean_token_accuracy": 0.7483534067869186, + "num_tokens": 12908163.0, "step": 348 }, { - "entropy": 0.5784569084644318, - "epoch": 6.4672897196261685, - "grad_norm": 0.03176464885473251, + "entropy": 0.6203203722834587, + "epoch": 2.2530413625304138, + "grad_norm": 0.02689778059720993, "learning_rate": 0.0002, - "loss": 0.5817923545837402, - "mean_token_accuracy": 0.7636367082595825, - "num_tokens": 27324606.0, + "loss": 0.6272082328796387, + "mean_token_accuracy": 0.7450312674045563, + "num_tokens": 12945330.0, "step": 349 }, { - "entropy": 0.58133964240551, - "epoch": 6.485981308411215, - "grad_norm": 0.02975059486925602, + "entropy": 0.6245186030864716, + "epoch": 2.259529602595296, + "grad_norm": 0.012432226911187172, "learning_rate": 0.0002, - "loss": 0.5827153325080872, - "mean_token_accuracy": 0.7636205703020096, - "num_tokens": 27403022.0, + "loss": 0.6235542297363281, + "mean_token_accuracy": 0.7462796568870544, + "num_tokens": 12982731.0, "step": 350 }, { - "entropy": 0.5791384875774384, - "epoch": 6.5046728971962615, - "grad_norm": 0.037513330578804016, + "entropy": 0.6220052242279053, + "epoch": 2.2660178426601782, + "grad_norm": 0.010308763943612576, "learning_rate": 0.0002, - "loss": 0.5764743089675903, - "mean_token_accuracy": 0.7667028158903122, - "num_tokens": 27482564.0, + "loss": 0.624070405960083, + "mean_token_accuracy": 0.743579313158989, + "num_tokens": 13019541.0, "step": 351 }, { - "entropy": 0.572890043258667, - "epoch": 6.5233644859813085, - "grad_norm": 0.028714006766676903, + "entropy": 0.64016043394804, + "epoch": 2.272506082725061, + "grad_norm": 0.010659064166247845, "learning_rate": 0.0002, - "loss": 0.5721226930618286, - "mean_token_accuracy": 0.7661556899547577, - "num_tokens": 27561557.0, + "loss": 0.636542558670044, + "mean_token_accuracy": 0.7407100200653076, + "num_tokens": 13057158.0, "step": 352 }, { - "entropy": 0.5851928144693375, - "epoch": 6.542056074766355, - "grad_norm": 0.04256724938750267, + "entropy": 0.6278761327266693, + "epoch": 2.278994322789943, + "grad_norm": 0.010416081175208092, "learning_rate": 0.0002, - "loss": 0.5871050357818604, - "mean_token_accuracy": 0.762816771864891, - "num_tokens": 27639557.0, + "loss": 0.62436842918396, + "mean_token_accuracy": 0.7455000206828117, + "num_tokens": 13094262.0, "step": 353 }, { - "entropy": 0.5750937461853027, - "epoch": 6.5607476635514015, - "grad_norm": 0.030066121369600296, + "entropy": 0.6232447475194931, + "epoch": 2.285482562854826, + "grad_norm": 0.009887438267469406, "learning_rate": 0.0002, - "loss": 0.5751978754997253, - "mean_token_accuracy": 0.7659846991300583, - "num_tokens": 27718059.0, + "loss": 0.6241923570632935, + "mean_token_accuracy": 0.7437829151749611, + "num_tokens": 13131360.0, "step": 354 }, { - "entropy": 0.567540854215622, - "epoch": 6.579439252336448, - "grad_norm": 0.04286859929561615, + "entropy": 0.6319752037525177, + "epoch": 2.291970802919708, + "grad_norm": 0.009396783076226711, "learning_rate": 0.0002, - "loss": 0.57082200050354, - "mean_token_accuracy": 0.7673868238925934, - "num_tokens": 27797774.0, + "loss": 0.6283852458000183, + "mean_token_accuracy": 0.7450494468212128, + "num_tokens": 13168644.0, "step": 355 }, { - "entropy": 0.5699326694011688, - "epoch": 6.598130841121495, - "grad_norm": 0.03684304282069206, + "entropy": 0.6192774921655655, + "epoch": 2.2984590429845904, + "grad_norm": 0.009457712061703205, "learning_rate": 0.0002, - "loss": 0.5703436136245728, - "mean_token_accuracy": 0.7681662887334824, - "num_tokens": 27877878.0, + "loss": 0.6166653633117676, + "mean_token_accuracy": 0.7473447695374489, + "num_tokens": 13205900.0, "step": 356 }, { - "entropy": 0.5923850387334824, - "epoch": 6.616822429906542, - "grad_norm": 0.04039483144879341, + "entropy": 0.616138719022274, + "epoch": 2.304947283049473, + "grad_norm": 0.009487454779446125, "learning_rate": 0.0002, - "loss": 0.5857964754104614, - "mean_token_accuracy": 0.7607691735029221, - "num_tokens": 27956164.0, + "loss": 0.6193556189537048, + "mean_token_accuracy": 0.746711365878582, + "num_tokens": 13243403.0, "step": 357 }, { - "entropy": 0.5853666663169861, - "epoch": 6.635514018691588, - "grad_norm": 0.034810423851013184, + "entropy": 0.6114000976085663, + "epoch": 2.3114355231143553, + "grad_norm": 0.010738314129412174, "learning_rate": 0.0002, - "loss": 0.5785076022148132, - "mean_token_accuracy": 0.7639980912208557, - "num_tokens": 28036636.0, + "loss": 0.6193853616714478, + "mean_token_accuracy": 0.7472727373242378, + "num_tokens": 13280595.0, "step": 358 }, { - "entropy": 0.5655460357666016, - "epoch": 6.654205607476635, - "grad_norm": 0.04020382836461067, + "entropy": 0.601548932492733, + "epoch": 2.3179237631792375, + "grad_norm": 0.010257442481815815, "learning_rate": 0.0002, - "loss": 0.5703827738761902, - "mean_token_accuracy": 0.767535388469696, - "num_tokens": 28114415.0, + "loss": 0.6057910919189453, + "mean_token_accuracy": 0.7506168782711029, + "num_tokens": 13317413.0, "step": 359 }, { - "entropy": 0.5866734981536865, - "epoch": 6.672897196261682, - "grad_norm": 0.03967415541410446, + "entropy": 0.6248240396380424, + "epoch": 2.3244120032441202, + "grad_norm": 0.009444781579077244, "learning_rate": 0.0002, - "loss": 0.5894461870193481, - "mean_token_accuracy": 0.7609697133302689, - "num_tokens": 28193663.0, + "loss": 0.6265978217124939, + "mean_token_accuracy": 0.7447159513831139, + "num_tokens": 13354442.0, "step": 360 }, { - "entropy": 0.59061299264431, - "epoch": 6.691588785046729, - "grad_norm": 0.041625600308179855, + "entropy": 0.6169225797057152, + "epoch": 2.3309002433090025, + "grad_norm": 0.010277079418301582, "learning_rate": 0.0002, - "loss": 0.5840169191360474, - "mean_token_accuracy": 0.763459637761116, - "num_tokens": 28272596.0, + "loss": 0.6173827648162842, + "mean_token_accuracy": 0.7486959248781204, + "num_tokens": 13392357.0, "step": 361 }, { - "entropy": 0.5873990952968597, - "epoch": 6.710280373831775, - "grad_norm": 0.03666547313332558, + "entropy": 0.6302815526723862, + "epoch": 2.3373884833738847, + "grad_norm": 0.009320929646492004, "learning_rate": 0.0002, - "loss": 0.581563413143158, - "mean_token_accuracy": 0.7643765062093735, - "num_tokens": 28350671.0, + "loss": 0.6289012432098389, + "mean_token_accuracy": 0.7438602596521378, + "num_tokens": 13429444.0, "step": 362 }, { - "entropy": 0.5714496225118637, - "epoch": 6.728971962616822, - "grad_norm": 0.035765308886766434, + "entropy": 0.6252695918083191, + "epoch": 2.3438767234387674, + "grad_norm": 0.00795667339116335, "learning_rate": 0.0002, - "loss": 0.5783935189247131, - "mean_token_accuracy": 0.7644345313310623, - "num_tokens": 28429350.0, + "loss": 0.6236270666122437, + "mean_token_accuracy": 0.7462895065546036, + "num_tokens": 13466973.0, "step": 363 }, { - "entropy": 0.5763610005378723, - "epoch": 6.747663551401869, - "grad_norm": 0.04010038077831268, + "entropy": 0.6325998455286026, + "epoch": 2.3503649635036497, + "grad_norm": 0.009790928103029728, "learning_rate": 0.0002, - "loss": 0.5831538438796997, - "mean_token_accuracy": 0.7639245241880417, - "num_tokens": 28507878.0, + "loss": 0.6316322088241577, + "mean_token_accuracy": 0.7428558766841888, + "num_tokens": 13504219.0, "step": 364 }, { - "entropy": 0.5884422659873962, - "epoch": 6.766355140186916, - "grad_norm": 0.0327216275036335, + "entropy": 0.6235339045524597, + "epoch": 2.356853203568532, + "grad_norm": 0.009260588325560093, "learning_rate": 0.0002, - "loss": 0.5833562016487122, - "mean_token_accuracy": 0.7639438211917877, - "num_tokens": 28586473.0, + "loss": 0.6231226921081543, + "mean_token_accuracy": 0.7452265918254852, + "num_tokens": 13541359.0, "step": 365 }, { - "entropy": 0.578765258193016, - "epoch": 6.785046728971962, - "grad_norm": 0.03694374859333038, + "entropy": 0.6141555160284042, + "epoch": 2.3633414436334146, + "grad_norm": 0.010724055580794811, "learning_rate": 0.0002, - "loss": 0.5703417658805847, - "mean_token_accuracy": 0.7693156599998474, - "num_tokens": 28666176.0, + "loss": 0.6217249631881714, + "mean_token_accuracy": 0.7470070049166679, + "num_tokens": 13578759.0, "step": 366 }, { - "entropy": 0.5803310126066208, - "epoch": 6.803738317757009, - "grad_norm": 0.030944958329200745, + "entropy": 0.6315039545297623, + "epoch": 2.369829683698297, + "grad_norm": 0.009067324921488762, "learning_rate": 0.0002, - "loss": 0.580040693283081, - "mean_token_accuracy": 0.7660168260335922, - "num_tokens": 28745637.0, + "loss": 0.634614109992981, + "mean_token_accuracy": 0.7410515621304512, + "num_tokens": 13616296.0, "step": 367 }, { - "entropy": 0.5808713585138321, - "epoch": 6.822429906542056, - "grad_norm": 0.03630272299051285, + "entropy": 0.6196957975625992, + "epoch": 2.376317923763179, + "grad_norm": 0.009248278103768826, "learning_rate": 0.0002, - "loss": 0.5874212980270386, - "mean_token_accuracy": 0.7598031908273697, - "num_tokens": 28822415.0, + "loss": 0.6189215183258057, + "mean_token_accuracy": 0.7481505498290062, + "num_tokens": 13653415.0, "step": 368 }, { - "entropy": 0.5853964239358902, - "epoch": 6.841121495327103, - "grad_norm": 0.032110489904880524, + "entropy": 0.6168980821967125, + "epoch": 2.3828061638280618, + "grad_norm": 0.010181935504078865, "learning_rate": 0.0002, - "loss": 0.586665153503418, - "mean_token_accuracy": 0.7622753381729126, - "num_tokens": 28900295.0, + "loss": 0.6161677837371826, + "mean_token_accuracy": 0.7499739304184914, + "num_tokens": 13690618.0, "step": 369 }, { - "entropy": 0.5945642292499542, - "epoch": 6.859813084112149, - "grad_norm": 0.026387203484773636, + "entropy": 0.6258252412080765, + "epoch": 2.389294403892944, + "grad_norm": 0.008928108029067516, "learning_rate": 0.0002, - "loss": 0.5878679752349854, - "mean_token_accuracy": 0.7614142149686813, - "num_tokens": 28979417.0, + "loss": 0.6290237903594971, + "mean_token_accuracy": 0.7429782524704933, + "num_tokens": 13727901.0, "step": 370 }, { - "entropy": 0.5783472508192062, - "epoch": 6.878504672897196, - "grad_norm": 0.031560156494379044, + "entropy": 0.6094075217843056, + "epoch": 2.3957826439578263, + "grad_norm": 0.009067908860743046, "learning_rate": 0.0002, - "loss": 0.5714523792266846, - "mean_token_accuracy": 0.7680636942386627, - "num_tokens": 29060256.0, + "loss": 0.6124044060707092, + "mean_token_accuracy": 0.7487504705786705, + "num_tokens": 13765097.0, "step": 371 }, { - "entropy": 0.5836873352527618, - "epoch": 6.897196261682243, - "grad_norm": 0.026852963492274284, + "entropy": 0.6190275996923447, + "epoch": 2.402270884022709, + "grad_norm": 0.009943855926394463, "learning_rate": 0.0002, - "loss": 0.5827068090438843, - "mean_token_accuracy": 0.7619643807411194, - "num_tokens": 29140811.0, + "loss": 0.6234393119812012, + "mean_token_accuracy": 0.7450670152902603, + "num_tokens": 13802604.0, "step": 372 }, { - "entropy": 0.5799173414707184, - "epoch": 6.91588785046729, - "grad_norm": 0.029336581006646156, + "entropy": 0.6125053241848946, + "epoch": 2.408759124087591, + "grad_norm": 0.009481463581323624, "learning_rate": 0.0002, - "loss": 0.5870332717895508, - "mean_token_accuracy": 0.7611389607191086, - "num_tokens": 29218919.0, + "loss": 0.6187013387680054, + "mean_token_accuracy": 0.7489439323544502, + "num_tokens": 13839487.0, "step": 373 }, { - "entropy": 0.578309491276741, - "epoch": 6.934579439252336, - "grad_norm": 0.030016575008630753, + "entropy": 0.6130451932549477, + "epoch": 2.4152473641524734, + "grad_norm": 0.008458724245429039, "learning_rate": 0.0002, - "loss": 0.5815063118934631, - "mean_token_accuracy": 0.7626699954271317, - "num_tokens": 29299051.0, + "loss": 0.614911675453186, + "mean_token_accuracy": 0.7505282834172249, + "num_tokens": 13876935.0, "step": 374 }, { - "entropy": 0.5871727913618088, - "epoch": 6.953271028037383, - "grad_norm": 0.026473497971892357, + "entropy": 0.6462682038545609, + "epoch": 2.421735604217356, + "grad_norm": 0.010083320550620556, "learning_rate": 0.0002, - "loss": 0.5825446248054504, - "mean_token_accuracy": 0.7642439305782318, - "num_tokens": 29378648.0, + "loss": 0.6467190980911255, + "mean_token_accuracy": 0.7378857955336571, + "num_tokens": 13914429.0, "step": 375 }, { - "entropy": 0.5949303209781647, - "epoch": 6.97196261682243, - "grad_norm": 0.029133882373571396, + "entropy": 0.6287035867571831, + "epoch": 2.4282238442822384, + "grad_norm": 0.008747600950300694, "learning_rate": 0.0002, - "loss": 0.5897645950317383, - "mean_token_accuracy": 0.7598071992397308, - "num_tokens": 29456791.0, + "loss": 0.6284276247024536, + "mean_token_accuracy": 0.7447932213544846, + "num_tokens": 13951880.0, "step": 376 }, { - "entropy": 0.5799039900302887, - "epoch": 6.990654205607477, - "grad_norm": 0.02209646999835968, + "entropy": 0.6305522173643112, + "epoch": 2.4347120843471206, + "grad_norm": 0.010268261656165123, "learning_rate": 0.0002, - "loss": 0.5738506317138672, - "mean_token_accuracy": 0.7665348201990128, - "num_tokens": 29535767.0, + "loss": 0.6298754215240479, + "mean_token_accuracy": 0.7451391518115997, + "num_tokens": 13989473.0, "step": 377 }, { - "entropy": 0.5705015957355499, - "epoch": 7.0, - "grad_norm": 0.03486085683107376, + "entropy": 0.6239131912589073, + "epoch": 2.4412003244120033, + "grad_norm": 0.00940751750022173, "learning_rate": 0.0002, - "loss": 0.5747893452644348, - "mean_token_accuracy": 0.7658974528312683, - "num_tokens": 29576698.0, + "loss": 0.6264931559562683, + "mean_token_accuracy": 0.7422467172145844, + "num_tokens": 14026832.0, "step": 378 }, { - "entropy": 0.5749023258686066, - "epoch": 7.018691588785047, - "grad_norm": 0.029213452711701393, + "entropy": 0.6218756884336472, + "epoch": 2.4476885644768855, + "grad_norm": 0.008956913836300373, "learning_rate": 0.0002, - "loss": 0.5739940404891968, - "mean_token_accuracy": 0.7652797847986221, - "num_tokens": 29655453.0, + "loss": 0.6260896325111389, + "mean_token_accuracy": 0.7415326088666916, + "num_tokens": 14064159.0, "step": 379 }, { - "entropy": 0.5714626312255859, - "epoch": 7.037383177570093, - "grad_norm": 0.023325830698013306, + "entropy": 0.6187591478228569, + "epoch": 2.4541768045417682, + "grad_norm": 0.008552344515919685, "learning_rate": 0.0002, - "loss": 0.5672348737716675, - "mean_token_accuracy": 0.7701223790645599, - "num_tokens": 29735726.0, + "loss": 0.6216272115707397, + "mean_token_accuracy": 0.7469553202390671, + "num_tokens": 14101277.0, "step": 380 }, { - "entropy": 0.5690907686948776, - "epoch": 7.05607476635514, - "grad_norm": 0.031354986131191254, + "entropy": 0.6129069477319717, + "epoch": 2.4606650446066505, + "grad_norm": 0.009866154752671719, "learning_rate": 0.0002, - "loss": 0.5650231838226318, - "mean_token_accuracy": 0.7709572166204453, - "num_tokens": 29814948.0, + "loss": 0.6184383630752563, + "mean_token_accuracy": 0.7457786872982979, + "num_tokens": 14138545.0, "step": 381 }, { - "entropy": 0.5705015808343887, - "epoch": 7.074766355140187, - "grad_norm": 0.023136666044592857, + "entropy": 0.6332196220755577, + "epoch": 2.4671532846715327, + "grad_norm": 0.007945130579173565, "learning_rate": 0.0002, - "loss": 0.5665818452835083, - "mean_token_accuracy": 0.7688614875078201, - "num_tokens": 29894457.0, + "loss": 0.6312772631645203, + "mean_token_accuracy": 0.7440632656216621, + "num_tokens": 14176229.0, "step": 382 }, { - "entropy": 0.5640405267477036, - "epoch": 7.093457943925234, - "grad_norm": 0.033995371311903, + "entropy": 0.6162554249167442, + "epoch": 2.4736415247364154, + "grad_norm": 0.00908781960606575, "learning_rate": 0.0002, - "loss": 0.5620932579040527, - "mean_token_accuracy": 0.7714024633169174, - "num_tokens": 29975233.0, + "loss": 0.6104109883308411, + "mean_token_accuracy": 0.7492068335413933, + "num_tokens": 14213375.0, "step": 383 }, { - "entropy": 0.5753348916769028, - "epoch": 7.11214953271028, - "grad_norm": 0.03603081405162811, + "entropy": 0.6241936013102531, + "epoch": 2.4801297648012977, + "grad_norm": 0.009399542585015297, "learning_rate": 0.0002, - "loss": 0.581680417060852, - "mean_token_accuracy": 0.7630927562713623, - "num_tokens": 30053632.0, + "loss": 0.6161544919013977, + "mean_token_accuracy": 0.7491407096385956, + "num_tokens": 14250696.0, "step": 384 }, { - "entropy": 0.5801223963499069, - "epoch": 7.130841121495327, - "grad_norm": 0.029232708737254143, + "entropy": 0.6147832497954369, + "epoch": 2.48661800486618, + "grad_norm": 0.007576434873044491, "learning_rate": 0.0002, - "loss": 0.5759778618812561, - "mean_token_accuracy": 0.764848455786705, - "num_tokens": 30132300.0, + "loss": 0.6159515976905823, + "mean_token_accuracy": 0.7494903281331062, + "num_tokens": 14287863.0, "step": 385 }, { - "entropy": 0.5866703689098358, - "epoch": 7.149532710280374, - "grad_norm": 0.03570999205112457, + "entropy": 0.6227882355451584, + "epoch": 2.4931062449310626, + "grad_norm": 0.009297952987253666, "learning_rate": 0.0002, - "loss": 0.5798372030258179, - "mean_token_accuracy": 0.763422429561615, - "num_tokens": 30210403.0, + "loss": 0.6279860734939575, + "mean_token_accuracy": 0.745159700512886, + "num_tokens": 14325371.0, "step": 386 }, { - "entropy": 0.5626991838216782, - "epoch": 7.168224299065421, - "grad_norm": 0.03066566027700901, + "entropy": 0.6066790446639061, + "epoch": 2.499594484995945, + "grad_norm": 0.009967000223696232, "learning_rate": 0.0002, - "loss": 0.5639806985855103, - "mean_token_accuracy": 0.7704606354236603, - "num_tokens": 30289334.0, + "loss": 0.6151248216629028, + "mean_token_accuracy": 0.7479714751243591, + "num_tokens": 14362698.0, "step": 387 }, { - "entropy": 0.5659942924976349, - "epoch": 7.186915887850467, - "grad_norm": 0.03829355165362358, + "entropy": 0.6248459070920944, + "epoch": 2.5060827250608275, + "grad_norm": 0.009727658703923225, "learning_rate": 0.0002, - "loss": 0.5711922645568848, - "mean_token_accuracy": 0.7667083889245987, - "num_tokens": 30367788.0, + "loss": 0.6268327236175537, + "mean_token_accuracy": 0.7463877573609352, + "num_tokens": 14399544.0, "step": 388 }, { - "entropy": 0.5780204236507416, - "epoch": 7.205607476635514, - "grad_norm": 0.026930075138807297, + "entropy": 0.6305608153343201, + "epoch": 2.5125709651257098, + "grad_norm": 0.008822647854685783, "learning_rate": 0.0002, - "loss": 0.5756471157073975, - "mean_token_accuracy": 0.7649676948785782, - "num_tokens": 30446365.0, + "loss": 0.6284365653991699, + "mean_token_accuracy": 0.7454124987125397, + "num_tokens": 14436877.0, "step": 389 }, { - "entropy": 0.5732643306255341, - "epoch": 7.224299065420561, - "grad_norm": 0.036685965955257416, + "entropy": 0.6289694681763649, + "epoch": 2.519059205190592, + "grad_norm": 0.009071394801139832, "learning_rate": 0.0002, - "loss": 0.5662911534309387, - "mean_token_accuracy": 0.7686476409435272, - "num_tokens": 30525763.0, + "loss": 0.6264450550079346, + "mean_token_accuracy": 0.7433068230748177, + "num_tokens": 14473915.0, "step": 390 }, { - "entropy": 0.5636216700077057, - "epoch": 7.242990654205608, - "grad_norm": 0.028072474524378777, + "entropy": 0.6271463260054588, + "epoch": 2.5255474452554747, + "grad_norm": 0.008187719620764256, "learning_rate": 0.0002, - "loss": 0.5616763830184937, - "mean_token_accuracy": 0.7721907496452332, - "num_tokens": 30606020.0, + "loss": 0.6289336085319519, + "mean_token_accuracy": 0.7423637583851814, + "num_tokens": 14511402.0, "step": 391 }, { - "entropy": 0.5680046379566193, - "epoch": 7.261682242990654, - "grad_norm": 0.037153203040361404, + "entropy": 0.6084585338830948, + "epoch": 2.532035685320357, + "grad_norm": 0.008899841457605362, "learning_rate": 0.0002, - "loss": 0.5728225708007812, - "mean_token_accuracy": 0.7663372904062271, - "num_tokens": 30684916.0, + "loss": 0.6130256652832031, + "mean_token_accuracy": 0.7509424611926079, + "num_tokens": 14548753.0, "step": 392 }, { - "entropy": 0.5744252055883408, - "epoch": 7.280373831775701, - "grad_norm": 0.02831830456852913, + "entropy": 0.6104612424969673, + "epoch": 2.538523925385239, + "grad_norm": 0.00985915120691061, "learning_rate": 0.0002, - "loss": 0.5753362774848938, - "mean_token_accuracy": 0.7671765983104706, - "num_tokens": 30763260.0, + "loss": 0.6200201511383057, + "mean_token_accuracy": 0.7466698288917542, + "num_tokens": 14586042.0, "step": 393 }, { - "entropy": 0.5881899744272232, - "epoch": 7.299065420560748, - "grad_norm": 0.03482871875166893, + "entropy": 0.6256568655371666, + "epoch": 2.545012165450122, + "grad_norm": 0.00867030955851078, "learning_rate": 0.0002, - "loss": 0.5832597613334656, - "mean_token_accuracy": 0.7622921317815781, - "num_tokens": 30841943.0, + "loss": 0.6292595267295837, + "mean_token_accuracy": 0.7430211529135704, + "num_tokens": 14623448.0, "step": 394 }, { - "entropy": 0.5729344636201859, - "epoch": 7.317757009345795, - "grad_norm": 0.03387274965643883, + "entropy": 0.6263261586427689, + "epoch": 2.551500405515004, + "grad_norm": 0.010737903416156769, "learning_rate": 0.0002, - "loss": 0.5740589499473572, - "mean_token_accuracy": 0.7642743289470673, - "num_tokens": 30920447.0, + "loss": 0.6249234676361084, + "mean_token_accuracy": 0.7444213852286339, + "num_tokens": 14660585.0, "step": 395 }, { - "entropy": 0.5637217462062836, - "epoch": 7.336448598130841, - "grad_norm": 0.028617210686206818, + "entropy": 0.6266406700015068, + "epoch": 2.5579886455798864, + "grad_norm": 0.008770007640123367, "learning_rate": 0.0002, - "loss": 0.5685332417488098, - "mean_token_accuracy": 0.768056258559227, - "num_tokens": 30998691.0, + "loss": 0.6228189468383789, + "mean_token_accuracy": 0.7473640963435173, + "num_tokens": 14697839.0, "step": 396 }, { - "entropy": 0.5718225091695786, - "epoch": 7.355140186915888, - "grad_norm": 0.028454070910811424, + "entropy": 0.6101134717464447, + "epoch": 2.564476885644769, + "grad_norm": 0.008944439701735973, "learning_rate": 0.0002, - "loss": 0.5710096955299377, - "mean_token_accuracy": 0.767062708735466, - "num_tokens": 31077693.0, + "loss": 0.6120374798774719, + "mean_token_accuracy": 0.7512135058641434, + "num_tokens": 14735253.0, "step": 397 }, { - "entropy": 0.5885006636381149, - "epoch": 7.373831775700935, - "grad_norm": 0.026537394151091576, + "entropy": 0.6294003054499626, + "epoch": 2.5709651257096513, + "grad_norm": 0.010403397493064404, "learning_rate": 0.0002, - "loss": 0.5815306901931763, - "mean_token_accuracy": 0.7627963721752167, - "num_tokens": 31157987.0, + "loss": 0.6361932754516602, + "mean_token_accuracy": 0.7407518178224564, + "num_tokens": 14772533.0, "step": 398 }, { - "entropy": 0.5804588943719864, - "epoch": 7.392523364485982, - "grad_norm": 0.029504472389817238, + "entropy": 0.6084831207990646, + "epoch": 2.5774533657745335, + "grad_norm": 0.007994825951755047, "learning_rate": 0.0002, - "loss": 0.575842022895813, - "mean_token_accuracy": 0.7651453614234924, - "num_tokens": 31237052.0, + "loss": 0.6090534329414368, + "mean_token_accuracy": 0.7516237422823906, + "num_tokens": 14809746.0, "step": 399 }, { - "entropy": 0.5789126753807068, - "epoch": 7.411214953271028, - "grad_norm": 0.03179961070418358, + "entropy": 0.6314651742577553, + "epoch": 2.5839416058394162, + "grad_norm": 0.010198352858424187, "learning_rate": 0.0002, - "loss": 0.5805697441101074, - "mean_token_accuracy": 0.7626224607229233, - "num_tokens": 31316295.0, + "loss": 0.6245699524879456, + "mean_token_accuracy": 0.7476952150464058, + "num_tokens": 14847650.0, "step": 400 }, { - "entropy": 0.5770617574453354, - "epoch": 7.429906542056075, - "grad_norm": 0.028732778504490852, + "entropy": 0.6174981743097305, + "epoch": 2.5904298459042985, + "grad_norm": 0.009044546633958817, "learning_rate": 0.0002, - "loss": 0.5769131183624268, - "mean_token_accuracy": 0.7638264745473862, - "num_tokens": 31395245.0, + "loss": 0.615368664264679, + "mean_token_accuracy": 0.7484294474124908, + "num_tokens": 14884930.0, "step": 401 }, { - "entropy": 0.5773504972457886, - "epoch": 7.4485981308411215, - "grad_norm": 0.030201883986592293, + "entropy": 0.6164123043417931, + "epoch": 2.5969180859691807, + "grad_norm": 0.008100450970232487, "learning_rate": 0.0002, - "loss": 0.5783373117446899, - "mean_token_accuracy": 0.7651851773262024, - "num_tokens": 31473942.0, + "loss": 0.620932936668396, + "mean_token_accuracy": 0.7468846142292023, + "num_tokens": 14922467.0, "step": 402 }, { - "entropy": 0.572372242808342, - "epoch": 7.4672897196261685, - "grad_norm": 0.030262500047683716, + "entropy": 0.6131496354937553, + "epoch": 2.6034063260340634, + "grad_norm": 0.01058341097086668, "learning_rate": 0.0002, - "loss": 0.5714971423149109, - "mean_token_accuracy": 0.7668078988790512, - "num_tokens": 31551761.0, + "loss": 0.6206756830215454, + "mean_token_accuracy": 0.7483528330922127, + "num_tokens": 14959768.0, "step": 403 }, { - "entropy": 0.5828695595264435, - "epoch": 7.485981308411215, - "grad_norm": 0.031323399394750595, + "entropy": 0.61551932990551, + "epoch": 2.6098945660989457, + "grad_norm": 0.008704769425094128, "learning_rate": 0.0002, - "loss": 0.578177809715271, - "mean_token_accuracy": 0.7639882117509842, - "num_tokens": 31630091.0, + "loss": 0.6186975240707397, + "mean_token_accuracy": 0.7474388629198074, + "num_tokens": 14996628.0, "step": 404 }, { - "entropy": 0.5827517062425613, - "epoch": 7.5046728971962615, - "grad_norm": 0.030732523649930954, + "entropy": 0.6159948483109474, + "epoch": 2.616382806163828, + "grad_norm": 0.009592502377927303, "learning_rate": 0.0002, - "loss": 0.5837417840957642, - "mean_token_accuracy": 0.7618696689605713, - "num_tokens": 31708952.0, + "loss": 0.6187817454338074, + "mean_token_accuracy": 0.7487591952085495, + "num_tokens": 15033592.0, "step": 405 }, { - "entropy": 0.5743730962276459, - "epoch": 7.5233644859813085, - "grad_norm": 0.03165881335735321, + "entropy": 0.6296302676200867, + "epoch": 2.6228710462287106, + "grad_norm": 0.009406859055161476, "learning_rate": 0.0002, - "loss": 0.5784010887145996, - "mean_token_accuracy": 0.7655890434980392, - "num_tokens": 31788434.0, + "loss": 0.6244117617607117, + "mean_token_accuracy": 0.7439019158482552, + "num_tokens": 15071235.0, "step": 406 }, { - "entropy": 0.5767014771699905, - "epoch": 7.542056074766355, - "grad_norm": 0.033420149236917496, + "entropy": 0.6396452710032463, + "epoch": 2.629359286293593, + "grad_norm": 0.009445966221392155, "learning_rate": 0.0002, - "loss": 0.5742257833480835, - "mean_token_accuracy": 0.7655230015516281, - "num_tokens": 31868440.0, + "loss": 0.634600043296814, + "mean_token_accuracy": 0.7421920970082283, + "num_tokens": 15108591.0, "step": 407 }, { - "entropy": 0.5853272676467896, - "epoch": 7.5607476635514015, - "grad_norm": 0.036208223551511765, + "entropy": 0.6241939589381218, + "epoch": 2.635847526358475, + "grad_norm": 0.008459821343421936, "learning_rate": 0.0002, - "loss": 0.5799100399017334, - "mean_token_accuracy": 0.7635609358549118, - "num_tokens": 31947381.0, + "loss": 0.6214285492897034, + "mean_token_accuracy": 0.745953157544136, + "num_tokens": 15146394.0, "step": 408 }, { - "entropy": 0.5662664473056793, - "epoch": 7.579439252336448, - "grad_norm": 0.034790199249982834, + "entropy": 0.6104935929179192, + "epoch": 2.6423357664233578, + "grad_norm": 0.010156887583434582, "learning_rate": 0.0002, - "loss": 0.5666247606277466, - "mean_token_accuracy": 0.768843486905098, - "num_tokens": 32025790.0, + "loss": 0.6155494451522827, + "mean_token_accuracy": 0.7467065751552582, + "num_tokens": 15183954.0, "step": 409 }, { - "entropy": 0.5646423548460007, - "epoch": 7.598130841121495, - "grad_norm": 0.03210895508527756, + "entropy": 0.6200908496975899, + "epoch": 2.64882400648824, + "grad_norm": 0.01134799886494875, "learning_rate": 0.0002, - "loss": 0.5644558072090149, - "mean_token_accuracy": 0.7712739408016205, - "num_tokens": 32105937.0, + "loss": 0.6298259496688843, + "mean_token_accuracy": 0.7434926256537437, + "num_tokens": 15221318.0, "step": 410 }, { - "entropy": 0.5722718238830566, - "epoch": 7.616822429906542, - "grad_norm": 0.04400765895843506, + "entropy": 0.6163679510354996, + "epoch": 2.6553122465531223, + "grad_norm": 0.008384560234844685, "learning_rate": 0.0002, - "loss": 0.576938271522522, - "mean_token_accuracy": 0.766321137547493, - "num_tokens": 32184675.0, + "loss": 0.6196904182434082, + "mean_token_accuracy": 0.7484511360526085, + "num_tokens": 15258714.0, "step": 411 }, { - "entropy": 0.5691269785165787, - "epoch": 7.635514018691588, - "grad_norm": 0.026371125131845474, + "entropy": 0.6290042921900749, + "epoch": 2.661800486618005, + "grad_norm": 0.011763868853449821, "learning_rate": 0.0002, - "loss": 0.5647107362747192, - "mean_token_accuracy": 0.7685294896364212, - "num_tokens": 32264427.0, + "loss": 0.623403787612915, + "mean_token_accuracy": 0.7461108565330505, + "num_tokens": 15295950.0, "step": 412 }, { - "entropy": 0.5793853551149368, - "epoch": 7.654205607476635, - "grad_norm": 0.034230053424835205, + "entropy": 0.6304820030927658, + "epoch": 2.668288726682887, + "grad_norm": 0.008899668231606483, "learning_rate": 0.0002, - "loss": 0.579481303691864, - "mean_token_accuracy": 0.7630301266908646, - "num_tokens": 32342836.0, + "loss": 0.6314485669136047, + "mean_token_accuracy": 0.7429024130105972, + "num_tokens": 15333333.0, "step": 413 }, { - "entropy": 0.5742208808660507, - "epoch": 7.672897196261682, - "grad_norm": 0.031009649857878685, + "entropy": 0.6225186064839363, + "epoch": 2.6747769667477694, + "grad_norm": 0.008537418209016323, "learning_rate": 0.0002, - "loss": 0.5699969530105591, - "mean_token_accuracy": 0.7685294300317764, - "num_tokens": 32421621.0, + "loss": 0.6211932897567749, + "mean_token_accuracy": 0.747981533408165, + "num_tokens": 15370982.0, "step": 414 }, { - "entropy": 0.5670227259397507, - "epoch": 7.691588785046729, - "grad_norm": 0.03162868693470955, + "entropy": 0.6107104495167732, + "epoch": 2.681265206812652, + "grad_norm": 0.01061639841645956, "learning_rate": 0.0002, - "loss": 0.5665925741195679, - "mean_token_accuracy": 0.7693023234605789, - "num_tokens": 32500845.0, + "loss": 0.6177730560302734, + "mean_token_accuracy": 0.7482814937829971, + "num_tokens": 15408426.0, "step": 415 }, { - "entropy": 0.5678260177373886, - "epoch": 7.710280373831775, - "grad_norm": 0.033084671944379807, + "entropy": 0.6148537546396255, + "epoch": 2.6877534468775344, + "grad_norm": 0.011781369335949421, "learning_rate": 0.0002, - "loss": 0.5648590922355652, - "mean_token_accuracy": 0.7698398530483246, - "num_tokens": 32579287.0, + "loss": 0.6236268281936646, + "mean_token_accuracy": 0.7474222108721733, + "num_tokens": 15445617.0, "step": 416 }, { - "entropy": 0.5775247514247894, - "epoch": 7.728971962616822, - "grad_norm": 0.043284881860017776, + "entropy": 0.6345531940460205, + "epoch": 2.6942416869424166, + "grad_norm": 0.008664336055517197, "learning_rate": 0.0002, - "loss": 0.5803564786911011, - "mean_token_accuracy": 0.7633648663759232, - "num_tokens": 32659251.0, + "loss": 0.6367125511169434, + "mean_token_accuracy": 0.7417123690247536, + "num_tokens": 15483295.0, "step": 417 }, { - "entropy": 0.5801283568143845, - "epoch": 7.747663551401869, - "grad_norm": 0.033718738704919815, + "entropy": 0.632311999797821, + "epoch": 2.7007299270072993, + "grad_norm": 0.010981544852256775, "learning_rate": 0.0002, - "loss": 0.5818736553192139, - "mean_token_accuracy": 0.762788325548172, - "num_tokens": 32736756.0, + "loss": 0.6256700158119202, + "mean_token_accuracy": 0.7448865845799446, + "num_tokens": 15520324.0, "step": 418 }, { - "entropy": 0.5818484872579575, - "epoch": 7.766355140186916, - "grad_norm": 0.03887256979942322, + "entropy": 0.6247982755303383, + "epoch": 2.7072181670721815, + "grad_norm": 0.010701069608330727, "learning_rate": 0.0002, - "loss": 0.5807799100875854, - "mean_token_accuracy": 0.7634662240743637, - "num_tokens": 32815653.0, + "loss": 0.6191861629486084, + "mean_token_accuracy": 0.747975766658783, + "num_tokens": 15557534.0, "step": 419 }, { - "entropy": 0.5854622423648834, - "epoch": 7.785046728971962, - "grad_norm": 0.032060056924819946, + "entropy": 0.6309525445103645, + "epoch": 2.7137064071370642, + "grad_norm": 0.008924427442252636, "learning_rate": 0.0002, - "loss": 0.5819664001464844, - "mean_token_accuracy": 0.7622562795877457, - "num_tokens": 32893976.0, + "loss": 0.6328113079071045, + "mean_token_accuracy": 0.741542711853981, + "num_tokens": 15594763.0, "step": 420 }, { - "entropy": 0.5702288597822189, - "epoch": 7.803738317757009, - "grad_norm": 0.0487007200717926, + "entropy": 0.6043407768011093, + "epoch": 2.7201946472019465, + "grad_norm": 0.008746204897761345, "learning_rate": 0.0002, - "loss": 0.5694952011108398, - "mean_token_accuracy": 0.767988994717598, - "num_tokens": 32973443.0, + "loss": 0.6077402830123901, + "mean_token_accuracy": 0.7525621652603149, + "num_tokens": 15631963.0, "step": 421 }, { - "entropy": 0.5743753612041473, - "epoch": 7.822429906542056, - "grad_norm": 0.03143998235464096, + "entropy": 0.623171254992485, + "epoch": 2.7266828872668287, + "grad_norm": 0.012448329478502274, "learning_rate": 0.0002, - "loss": 0.5762680768966675, - "mean_token_accuracy": 0.765287771821022, - "num_tokens": 33051336.0, + "loss": 0.6337227821350098, + "mean_token_accuracy": 0.7424034029245377, + "num_tokens": 15669213.0, "step": 422 }, { - "entropy": 0.580144464969635, - "epoch": 7.841121495327103, - "grad_norm": 0.04133511334657669, + "entropy": 0.6182989627122879, + "epoch": 2.7331711273317114, + "grad_norm": 0.00980245042592287, "learning_rate": 0.0002, - "loss": 0.5772802829742432, - "mean_token_accuracy": 0.765201061964035, - "num_tokens": 33129798.0, + "loss": 0.6246788501739502, + "mean_token_accuracy": 0.7442185133695602, + "num_tokens": 15706502.0, "step": 423 }, { - "entropy": 0.5860956609249115, - "epoch": 7.859813084112149, - "grad_norm": 0.03347109630703926, + "entropy": 0.6341974511742592, + "epoch": 2.7396593673965937, + "grad_norm": 0.010192792862653732, "learning_rate": 0.0002, - "loss": 0.5789963006973267, - "mean_token_accuracy": 0.7634441554546356, - "num_tokens": 33209273.0, + "loss": 0.6291946172714233, + "mean_token_accuracy": 0.7423791959881783, + "num_tokens": 15744210.0, "step": 424 }, { - "entropy": 0.5873236507177353, - "epoch": 7.878504672897196, - "grad_norm": 0.037143707275390625, + "entropy": 0.6213679686188698, + "epoch": 2.7461476074614763, + "grad_norm": 0.010065656155347824, "learning_rate": 0.0002, - "loss": 0.5865265727043152, - "mean_token_accuracy": 0.7612786442041397, - "num_tokens": 33288771.0, + "loss": 0.6173956394195557, + "mean_token_accuracy": 0.7478613257408142, + "num_tokens": 15781645.0, "step": 425 }, { - "entropy": 0.5686286091804504, - "epoch": 7.897196261682243, - "grad_norm": 0.03085118532180786, + "entropy": 0.6221437901258469, + "epoch": 2.7526358475263586, + "grad_norm": 0.0095105255022645, "learning_rate": 0.0002, - "loss": 0.5708251595497131, - "mean_token_accuracy": 0.7655164450407028, - "num_tokens": 33368400.0, + "loss": 0.6207852363586426, + "mean_token_accuracy": 0.7459077090024948, + "num_tokens": 15818882.0, "step": 426 }, { - "entropy": 0.5756514668464661, - "epoch": 7.91588785046729, - "grad_norm": 0.031129810959100723, + "entropy": 0.6309037730097771, + "epoch": 2.759124087591241, + "grad_norm": 0.008715137839317322, "learning_rate": 0.0002, - "loss": 0.5749300718307495, - "mean_token_accuracy": 0.765411451458931, - "num_tokens": 33447115.0, + "loss": 0.635662317276001, + "mean_token_accuracy": 0.7393417879939079, + "num_tokens": 15856215.0, "step": 427 }, { - "entropy": 0.5711506605148315, - "epoch": 7.934579439252336, - "grad_norm": 0.030737726017832756, + "entropy": 0.6107242554426193, + "epoch": 2.7656123276561235, + "grad_norm": 0.01041481178253889, "learning_rate": 0.0002, - "loss": 0.5667474269866943, - "mean_token_accuracy": 0.7683475613594055, - "num_tokens": 33527195.0, + "loss": 0.6185387372970581, + "mean_token_accuracy": 0.7483986243605614, + "num_tokens": 15892879.0, "step": 428 }, { - "entropy": 0.5755315274000168, - "epoch": 7.953271028037383, - "grad_norm": 0.029060108587145805, + "entropy": 0.6216551586985588, + "epoch": 2.7721005677210058, + "grad_norm": 0.0099997129291296, "learning_rate": 0.0002, - "loss": 0.5743991732597351, - "mean_token_accuracy": 0.7665413618087769, - "num_tokens": 33606110.0, + "loss": 0.6273539066314697, + "mean_token_accuracy": 0.7425299435853958, + "num_tokens": 15930440.0, "step": 429 }, { - "entropy": 0.5762781202793121, - "epoch": 7.97196261682243, - "grad_norm": 0.03172822669148445, + "entropy": 0.6228181794285774, + "epoch": 2.778588807785888, + "grad_norm": 0.009126834571361542, "learning_rate": 0.0002, - "loss": 0.5783078074455261, - "mean_token_accuracy": 0.7643001526594162, - "num_tokens": 33685445.0, + "loss": 0.6193030476570129, + "mean_token_accuracy": 0.748077854514122, + "num_tokens": 15967547.0, "step": 430 }, { - "entropy": 0.5830086320638657, - "epoch": 7.990654205607477, - "grad_norm": 0.03025674633681774, + "entropy": 0.6386850997805595, + "epoch": 2.7850770478507707, + "grad_norm": 0.00938471220433712, "learning_rate": 0.0002, - "loss": 0.58307945728302, - "mean_token_accuracy": 0.7618844658136368, - "num_tokens": 33763163.0, + "loss": 0.6340270042419434, + "mean_token_accuracy": 0.7409438043832779, + "num_tokens": 16004947.0, "step": 431 }, { - "entropy": 0.5734254121780396, - "epoch": 8.0, - "grad_norm": 0.044769272208213806, + "entropy": 0.6217259094119072, + "epoch": 2.791565287915653, + "grad_norm": 0.010031217709183693, "learning_rate": 0.0002, - "loss": 0.5759371519088745, - "mean_token_accuracy": 0.7648670375347137, - "num_tokens": 33802024.0, + "loss": 0.6190569400787354, + "mean_token_accuracy": 0.7476614862680435, + "num_tokens": 16041946.0, "step": 432 }, { - "entropy": 0.5717909038066864, - "epoch": 8.018691588785046, - "grad_norm": 0.03209570422768593, + "entropy": 0.6218375042080879, + "epoch": 2.798053527980535, + "grad_norm": 0.008579161949455738, "learning_rate": 0.0002, - "loss": 0.564399242401123, - "mean_token_accuracy": 0.7706466615200043, - "num_tokens": 33881555.0, + "loss": 0.6240730285644531, + "mean_token_accuracy": 0.746677428483963, + "num_tokens": 16078788.0, "step": 433 }, { - "entropy": 0.5607770830392838, - "epoch": 8.037383177570094, - "grad_norm": 0.04142817482352257, + "entropy": 0.627423033118248, + "epoch": 2.804541768045418, + "grad_norm": 0.010432623326778412, "learning_rate": 0.0002, - "loss": 0.5611358880996704, - "mean_token_accuracy": 0.7706198245286942, - "num_tokens": 33960478.0, + "loss": 0.6334057450294495, + "mean_token_accuracy": 0.7425751611590385, + "num_tokens": 16116073.0, "step": 434 }, { - "entropy": 0.5713176429271698, - "epoch": 8.05607476635514, - "grad_norm": 0.03570501133799553, + "entropy": 0.6249776631593704, + "epoch": 2.8110300081103, + "grad_norm": 0.01080512534826994, "learning_rate": 0.0002, - "loss": 0.5715903639793396, - "mean_token_accuracy": 0.7666511684656143, - "num_tokens": 34039461.0, + "loss": 0.6291300058364868, + "mean_token_accuracy": 0.7412911430001259, + "num_tokens": 16153421.0, "step": 435 }, { - "entropy": 0.5835350900888443, - "epoch": 8.074766355140186, - "grad_norm": 0.042137570679187775, + "entropy": 0.6199780628085136, + "epoch": 2.8175182481751824, + "grad_norm": 0.008089151233434677, "learning_rate": 0.0002, - "loss": 0.578724205493927, - "mean_token_accuracy": 0.7641146183013916, - "num_tokens": 34119055.0, + "loss": 0.6166943311691284, + "mean_token_accuracy": 0.7502307966351509, + "num_tokens": 16190692.0, "step": 436 }, { - "entropy": 0.5712213516235352, - "epoch": 8.093457943925234, - "grad_norm": 0.0390690453350544, + "entropy": 0.6264552250504494, + "epoch": 2.824006488240065, + "grad_norm": 0.009256084449589252, "learning_rate": 0.0002, - "loss": 0.5641062259674072, - "mean_token_accuracy": 0.7685039341449738, - "num_tokens": 34197572.0, + "loss": 0.6239896416664124, + "mean_token_accuracy": 0.7462676838040352, + "num_tokens": 16227626.0, "step": 437 }, { - "entropy": 0.5626108348369598, - "epoch": 8.11214953271028, - "grad_norm": 0.05106540396809578, + "entropy": 0.6257441863417625, + "epoch": 2.8304947283049473, + "grad_norm": 0.010192189365625381, "learning_rate": 0.0002, - "loss": 0.5654831528663635, - "mean_token_accuracy": 0.7689186930656433, - "num_tokens": 34277266.0, + "loss": 0.6272855997085571, + "mean_token_accuracy": 0.7451135069131851, + "num_tokens": 16264951.0, "step": 438 }, { - "entropy": 0.5697167217731476, - "epoch": 8.130841121495328, - "grad_norm": 0.043526820838451385, + "entropy": 0.6197425052523613, + "epoch": 2.8369829683698295, + "grad_norm": 0.00909087248146534, "learning_rate": 0.0002, - "loss": 0.5732031464576721, - "mean_token_accuracy": 0.7650811076164246, - "num_tokens": 34355043.0, + "loss": 0.6246816515922546, + "mean_token_accuracy": 0.7462664917111397, + "num_tokens": 16302276.0, "step": 439 }, { - "entropy": 0.5768076628446579, - "epoch": 8.149532710280374, - "grad_norm": 0.04215633124113083, + "entropy": 0.6187947019934654, + "epoch": 2.8434712084347122, + "grad_norm": 0.010161105543375015, "learning_rate": 0.0002, - "loss": 0.5718085765838623, - "mean_token_accuracy": 0.766776368021965, - "num_tokens": 34435449.0, + "loss": 0.6317975521087646, + "mean_token_accuracy": 0.7427225112915039, + "num_tokens": 16339652.0, "step": 440 }, { - "entropy": 0.5621174275875092, - "epoch": 8.16822429906542, - "grad_norm": 0.03552766144275665, + "entropy": 0.6189513206481934, + "epoch": 2.8499594484995945, + "grad_norm": 0.009055238217115402, "learning_rate": 0.0002, - "loss": 0.5604408979415894, - "mean_token_accuracy": 0.7712910920381546, - "num_tokens": 34513638.0, + "loss": 0.6247466802597046, + "mean_token_accuracy": 0.7450408861041069, + "num_tokens": 16376803.0, "step": 441 }, { - "entropy": 0.5522593855857849, - "epoch": 8.186915887850468, - "grad_norm": 0.05295529216527939, + "entropy": 0.6144088804721832, + "epoch": 2.8564476885644767, + "grad_norm": 0.008574709296226501, "learning_rate": 0.0002, - "loss": 0.560666024684906, - "mean_token_accuracy": 0.770970806479454, - "num_tokens": 34591894.0, + "loss": 0.618188738822937, + "mean_token_accuracy": 0.7477873042225838, + "num_tokens": 16413555.0, "step": 442 }, { - "entropy": 0.5586026161909103, - "epoch": 8.205607476635514, - "grad_norm": 0.045166611671447754, + "entropy": 0.6285263672471046, + "epoch": 2.8629359286293594, + "grad_norm": 0.01058571133762598, "learning_rate": 0.0002, - "loss": 0.5580676794052124, - "mean_token_accuracy": 0.7712274938821793, - "num_tokens": 34671649.0, + "loss": 0.6210506558418274, + "mean_token_accuracy": 0.7466302737593651, + "num_tokens": 16450235.0, "step": 443 }, { - "entropy": 0.5645840466022491, - "epoch": 8.22429906542056, - "grad_norm": 0.043214891105890274, + "entropy": 0.6278195902705193, + "epoch": 2.8694241686942417, + "grad_norm": 0.008600706234574318, "learning_rate": 0.0002, - "loss": 0.5546973347663879, - "mean_token_accuracy": 0.772943839430809, - "num_tokens": 34750535.0, + "loss": 0.6228291988372803, + "mean_token_accuracy": 0.7465885654091835, + "num_tokens": 16487688.0, "step": 444 }, { - "entropy": 0.566862940788269, - "epoch": 8.242990654205608, - "grad_norm": 0.05362832173705101, + "entropy": 0.6128537505865097, + "epoch": 2.875912408759124, + "grad_norm": 0.009188942611217499, "learning_rate": 0.0002, - "loss": 0.5646588802337646, - "mean_token_accuracy": 0.7682545930147171, - "num_tokens": 34829176.0, + "loss": 0.6115404367446899, + "mean_token_accuracy": 0.7511069476604462, + "num_tokens": 16525056.0, "step": 445 }, { - "entropy": 0.5670454204082489, - "epoch": 8.261682242990654, - "grad_norm": 0.05154046416282654, + "entropy": 0.6209624111652374, + "epoch": 2.8824006488240066, + "grad_norm": 0.009248930029571056, "learning_rate": 0.0002, - "loss": 0.5703809261322021, - "mean_token_accuracy": 0.7675753831863403, - "num_tokens": 34908547.0, + "loss": 0.6210386753082275, + "mean_token_accuracy": 0.7469235137104988, + "num_tokens": 16562914.0, "step": 446 }, { - "entropy": 0.5630051344633102, - "epoch": 8.280373831775702, - "grad_norm": 0.046372540295124054, + "entropy": 0.5965787023305893, + "epoch": 2.888888888888889, + "grad_norm": 0.0094021987169981, "learning_rate": 0.0002, - "loss": 0.5637614727020264, - "mean_token_accuracy": 0.7699243128299713, - "num_tokens": 34986705.0, + "loss": 0.6033673286437988, + "mean_token_accuracy": 0.7514390125870705, + "num_tokens": 16599899.0, "step": 447 }, { - "entropy": 0.5612086057662964, - "epoch": 8.299065420560748, - "grad_norm": 0.04247089475393295, + "entropy": 0.6115651428699493, + "epoch": 2.895377128953771, + "grad_norm": 0.01325083989650011, "learning_rate": 0.0002, - "loss": 0.5558289289474487, - "mean_token_accuracy": 0.7724988609552383, - "num_tokens": 35066634.0, + "loss": 0.6262028813362122, + "mean_token_accuracy": 0.7461578771471977, + "num_tokens": 16637011.0, "step": 448 }, { - "entropy": 0.5652319639921188, - "epoch": 8.317757009345794, - "grad_norm": 0.038978833705186844, + "entropy": 0.6188539639115334, + "epoch": 2.9018653690186538, + "grad_norm": 0.00891121570020914, "learning_rate": 0.0002, - "loss": 0.5635871887207031, - "mean_token_accuracy": 0.7691775411367416, - "num_tokens": 35145714.0, + "loss": 0.6159206628799438, + "mean_token_accuracy": 0.7494730055332184, + "num_tokens": 16673697.0, "step": 449 }, { - "entropy": 0.5542118549346924, - "epoch": 8.336448598130842, - "grad_norm": 0.04010032117366791, + "entropy": 0.6208583936095238, + "epoch": 2.908353609083536, + "grad_norm": 0.009828220121562481, "learning_rate": 0.0002, - "loss": 0.5565598011016846, - "mean_token_accuracy": 0.7727922797203064, - "num_tokens": 35225145.0, + "loss": 0.6155424118041992, + "mean_token_accuracy": 0.7491355165839195, + "num_tokens": 16710885.0, "step": 450 }, { - "entropy": 0.5695662796497345, - "epoch": 8.355140186915888, - "grad_norm": 0.03877483680844307, + "entropy": 0.6197483390569687, + "epoch": 2.9148418491484183, + "grad_norm": 0.008900245651602745, "learning_rate": 0.0002, - "loss": 0.5652719140052795, - "mean_token_accuracy": 0.7696373909711838, - "num_tokens": 35304911.0, + "loss": 0.6142081618309021, + "mean_token_accuracy": 0.748231329023838, + "num_tokens": 16748182.0, "step": 451 }, { - "entropy": 0.566323772072792, - "epoch": 8.373831775700934, - "grad_norm": 0.03444257006049156, + "entropy": 0.6212092339992523, + "epoch": 2.921330089213301, + "grad_norm": 0.00849118735641241, "learning_rate": 0.0002, - "loss": 0.5614066123962402, - "mean_token_accuracy": 0.7709103524684906, - "num_tokens": 35386357.0, + "loss": 0.6236221790313721, + "mean_token_accuracy": 0.7436698824167252, + "num_tokens": 16785028.0, "step": 452 }, { - "entropy": 0.5655058771371841, - "epoch": 8.392523364485982, - "grad_norm": 0.04712752252817154, + "entropy": 0.6107748746871948, + "epoch": 2.927818329278183, + "grad_norm": 0.009662901051342487, "learning_rate": 0.0002, - "loss": 0.5687972903251648, - "mean_token_accuracy": 0.7682380080223083, - "num_tokens": 35464875.0, + "loss": 0.6197327375411987, + "mean_token_accuracy": 0.7483203411102295, + "num_tokens": 16822318.0, "step": 453 }, { - "entropy": 0.5632896423339844, - "epoch": 8.411214953271028, - "grad_norm": 0.0352141447365284, + "entropy": 0.6189533397555351, + "epoch": 2.9343065693430654, + "grad_norm": 0.009161571972072124, "learning_rate": 0.0002, - "loss": 0.5623925924301147, - "mean_token_accuracy": 0.7705592215061188, - "num_tokens": 35543398.0, + "loss": 0.6221146583557129, + "mean_token_accuracy": 0.7479159906506538, + "num_tokens": 16859984.0, "step": 454 }, { - "entropy": 0.5786634534597397, - "epoch": 8.429906542056075, - "grad_norm": 0.04121265932917595, + "entropy": 0.6262816786766052, + "epoch": 2.940794809407948, + "grad_norm": 0.008490455336868763, "learning_rate": 0.0002, - "loss": 0.5740705728530884, - "mean_token_accuracy": 0.7659155428409576, - "num_tokens": 35622893.0, + "loss": 0.6270855069160461, + "mean_token_accuracy": 0.7452046275138855, + "num_tokens": 16897277.0, "step": 455 }, { - "entropy": 0.572764053940773, - "epoch": 8.448598130841122, - "grad_norm": 0.03707192838191986, + "entropy": 0.6230187118053436, + "epoch": 2.9472830494728304, + "grad_norm": 0.00920241978019476, "learning_rate": 0.0002, - "loss": 0.5670691728591919, - "mean_token_accuracy": 0.7682500779628754, - "num_tokens": 35701401.0, + "loss": 0.6212553977966309, + "mean_token_accuracy": 0.7461629658937454, + "num_tokens": 16934423.0, "step": 456 }, { - "entropy": 0.5609558075666428, - "epoch": 8.467289719626168, - "grad_norm": 0.04114922136068344, + "entropy": 0.6259749531745911, + "epoch": 2.9537712895377126, + "grad_norm": 0.008131385780870914, "learning_rate": 0.0002, - "loss": 0.5627433061599731, - "mean_token_accuracy": 0.7700482457876205, - "num_tokens": 35779899.0, + "loss": 0.6244622468948364, + "mean_token_accuracy": 0.7466467097401619, + "num_tokens": 16971857.0, "step": 457 }, { - "entropy": 0.5678876638412476, - "epoch": 8.485981308411215, - "grad_norm": 0.03938848152756691, + "entropy": 0.6159861534833908, + "epoch": 2.9602595296025953, + "grad_norm": 0.008032194338738918, "learning_rate": 0.0002, - "loss": 0.5726190805435181, - "mean_token_accuracy": 0.7662196010351181, - "num_tokens": 35857585.0, + "loss": 0.6193053722381592, + "mean_token_accuracy": 0.7479442283511162, + "num_tokens": 17008930.0, "step": 458 }, { - "entropy": 0.5759584605693817, - "epoch": 8.504672897196262, - "grad_norm": 0.04363275319337845, + "entropy": 0.617520272731781, + "epoch": 2.9667477696674776, + "grad_norm": 0.009034648537635803, "learning_rate": 0.0002, - "loss": 0.5743913054466248, - "mean_token_accuracy": 0.7650963664054871, - "num_tokens": 35935911.0, + "loss": 0.6226905584335327, + "mean_token_accuracy": 0.7449267134070396, + "num_tokens": 17046294.0, "step": 459 }, { - "entropy": 0.5694950520992279, - "epoch": 8.523364485981308, - "grad_norm": 0.03605388104915619, + "entropy": 0.6264740154147148, + "epoch": 2.9732360097323602, + "grad_norm": 0.008523489348590374, "learning_rate": 0.0002, - "loss": 0.5647161602973938, - "mean_token_accuracy": 0.7692456245422363, - "num_tokens": 36013948.0, + "loss": 0.6288236379623413, + "mean_token_accuracy": 0.7429340779781342, + "num_tokens": 17083358.0, "step": 460 }, { - "entropy": 0.5708936899900436, - "epoch": 8.542056074766355, - "grad_norm": 0.04307771846652031, + "entropy": 0.6205747723579407, + "epoch": 2.9797242497972425, + "grad_norm": 0.008030165918171406, "learning_rate": 0.0002, - "loss": 0.572138249874115, - "mean_token_accuracy": 0.7665975391864777, - "num_tokens": 36092952.0, + "loss": 0.6183617115020752, + "mean_token_accuracy": 0.7463237047195435, + "num_tokens": 17120761.0, "step": 461 }, { - "entropy": 0.5669836699962616, - "epoch": 8.560747663551401, - "grad_norm": 0.03957648202776909, + "entropy": 0.6367032006382942, + "epoch": 2.986212489862125, + "grad_norm": 0.009663688018918037, "learning_rate": 0.0002, - "loss": 0.567891001701355, - "mean_token_accuracy": 0.7687968164682388, - "num_tokens": 36171019.0, + "loss": 0.6329810619354248, + "mean_token_accuracy": 0.7433002442121506, + "num_tokens": 17158231.0, "step": 462 }, { - "entropy": 0.5661501735448837, - "epoch": 8.57943925233645, - "grad_norm": 0.037156861275434494, + "entropy": 0.626891016960144, + "epoch": 2.9927007299270074, + "grad_norm": 0.009945257566869259, "learning_rate": 0.0002, - "loss": 0.5598872900009155, - "mean_token_accuracy": 0.7714900076389313, - "num_tokens": 36249848.0, + "loss": 0.6275311708450317, + "mean_token_accuracy": 0.7450283095240593, + "num_tokens": 17195764.0, "step": 463 }, { - "entropy": 0.5739653706550598, - "epoch": 8.598130841121495, - "grad_norm": 0.0407034270465374, + "entropy": 0.6275185570120811, + "epoch": 2.9991889699918897, + "grad_norm": 0.008921638131141663, "learning_rate": 0.0002, - "loss": 0.5717343688011169, - "mean_token_accuracy": 0.7671405524015427, - "num_tokens": 36328929.0, + "loss": 0.6317576169967651, + "mean_token_accuracy": 0.7413767129182816, + "num_tokens": 17232867.0, "step": 464 }, { - "entropy": 0.5699207782745361, - "epoch": 8.616822429906541, - "grad_norm": 0.036081064492464066, + "entropy": 0.5935274362564087, + "epoch": 3.0, + "grad_norm": 0.02002483420073986, "learning_rate": 0.0002, - "loss": 0.5727741718292236, - "mean_token_accuracy": 0.766769751906395, - "num_tokens": 36407646.0, + "loss": 0.5921852588653564, + "mean_token_accuracy": 0.7577869892120361, + "num_tokens": 17237490.0, "step": 465 }, { - "entropy": 0.5586220026016235, - "epoch": 8.63551401869159, - "grad_norm": 0.03620290383696556, + "entropy": 0.610297404229641, + "epoch": 3.0064882400648822, + "grad_norm": 0.010434089228510857, "learning_rate": 0.0002, - "loss": 0.5579659938812256, - "mean_token_accuracy": 0.771889865398407, - "num_tokens": 36487160.0, + "loss": 0.6096053123474121, + "mean_token_accuracy": 0.7505725026130676, + "num_tokens": 17274381.0, "step": 466 }, { - "entropy": 0.5877305865287781, - "epoch": 8.654205607476635, - "grad_norm": 0.033869534730911255, + "entropy": 0.6093652322888374, + "epoch": 3.012976480129765, + "grad_norm": 0.011252244934439659, "learning_rate": 0.0002, - "loss": 0.5841851234436035, - "mean_token_accuracy": 0.7620754092931747, - "num_tokens": 36567160.0, + "loss": 0.6079680919647217, + "mean_token_accuracy": 0.751014731824398, + "num_tokens": 17311247.0, "step": 467 }, { - "entropy": 0.5693440735340118, - "epoch": 8.672897196261681, - "grad_norm": 0.0372026227414608, + "entropy": 0.6135042458772659, + "epoch": 3.019464720194647, + "grad_norm": 0.011452090926468372, "learning_rate": 0.0002, - "loss": 0.5639486312866211, - "mean_token_accuracy": 0.7693230509757996, - "num_tokens": 36647567.0, + "loss": 0.621872067451477, + "mean_token_accuracy": 0.7463375702500343, + "num_tokens": 17348490.0, "step": 468 }, { - "entropy": 0.5630517154932022, - "epoch": 8.69158878504673, - "grad_norm": 0.036731891334056854, + "entropy": 0.6276230961084366, + "epoch": 3.0259529602595294, + "grad_norm": 0.011181695386767387, "learning_rate": 0.0002, - "loss": 0.5677603483200073, - "mean_token_accuracy": 0.767775371670723, - "num_tokens": 36726634.0, + "loss": 0.6287038326263428, + "mean_token_accuracy": 0.7455412894487381, + "num_tokens": 17385419.0, "step": 469 }, { - "entropy": 0.5637719482183456, - "epoch": 8.710280373831775, - "grad_norm": 0.03504373878240585, + "entropy": 0.6226534396409988, + "epoch": 3.032441200324412, + "grad_norm": 0.00998624972999096, "learning_rate": 0.0002, - "loss": 0.5635030269622803, - "mean_token_accuracy": 0.7712674289941788, - "num_tokens": 36805361.0, + "loss": 0.6229760646820068, + "mean_token_accuracy": 0.7449204847216606, + "num_tokens": 17423056.0, "step": 470 }, { - "entropy": 0.5734125971794128, - "epoch": 8.728971962616823, - "grad_norm": 0.03756216913461685, + "entropy": 0.6008478105068207, + "epoch": 3.0389294403892944, + "grad_norm": 0.0095088891685009, "learning_rate": 0.0002, - "loss": 0.57008957862854, - "mean_token_accuracy": 0.7670037597417831, - "num_tokens": 36883849.0, + "loss": 0.6020908951759338, + "mean_token_accuracy": 0.7544899210333824, + "num_tokens": 17460157.0, "step": 471 }, { - "entropy": 0.5627129673957825, - "epoch": 8.74766355140187, - "grad_norm": 0.03570760041475296, + "entropy": 0.6252934113144875, + "epoch": 3.0454176804541766, + "grad_norm": 0.010803421959280968, "learning_rate": 0.0002, - "loss": 0.5617348551750183, - "mean_token_accuracy": 0.7711147964000702, - "num_tokens": 36963050.0, + "loss": 0.6294186115264893, + "mean_token_accuracy": 0.7426271066069603, + "num_tokens": 17497579.0, "step": 472 }, { - "entropy": 0.5754802078008652, - "epoch": 8.766355140186915, - "grad_norm": 0.04743500053882599, + "entropy": 0.6106472909450531, + "epoch": 3.0519059205190593, + "grad_norm": 0.010041839443147182, "learning_rate": 0.0002, - "loss": 0.5773271322250366, - "mean_token_accuracy": 0.763431116938591, - "num_tokens": 37041165.0, + "loss": 0.6172924041748047, + "mean_token_accuracy": 0.7476223781704903, + "num_tokens": 17534955.0, "step": 473 }, { - "entropy": 0.5732788294553757, - "epoch": 8.785046728971963, - "grad_norm": 0.04425869137048721, + "entropy": 0.6221166178584099, + "epoch": 3.0583941605839415, + "grad_norm": 0.009123523719608784, "learning_rate": 0.0002, - "loss": 0.5683580636978149, - "mean_token_accuracy": 0.7678799331188202, - "num_tokens": 37120193.0, + "loss": 0.6244035363197327, + "mean_token_accuracy": 0.7448302879929543, + "num_tokens": 17572150.0, "step": 474 }, { - "entropy": 0.5810448527336121, - "epoch": 8.80373831775701, - "grad_norm": 0.03165487200021744, + "entropy": 0.6102956235408783, + "epoch": 3.0648824006488242, + "grad_norm": 0.008510733023285866, "learning_rate": 0.0002, - "loss": 0.5795904397964478, - "mean_token_accuracy": 0.7625752538442612, - "num_tokens": 37198754.0, + "loss": 0.6107138991355896, + "mean_token_accuracy": 0.7484675496816635, + "num_tokens": 17609343.0, "step": 475 }, { - "entropy": 0.5730142742395401, - "epoch": 8.822429906542055, - "grad_norm": 0.04261263459920883, + "entropy": 0.6124226823449135, + "epoch": 3.0713706407137065, + "grad_norm": 0.009730803780257702, "learning_rate": 0.0002, - "loss": 0.5765471458435059, - "mean_token_accuracy": 0.7660854458808899, - "num_tokens": 37276721.0, + "loss": 0.6136341691017151, + "mean_token_accuracy": 0.7490884363651276, + "num_tokens": 17646448.0, "step": 476 }, { - "entropy": 0.5741526335477829, - "epoch": 8.841121495327103, - "grad_norm": 0.032484255731105804, + "entropy": 0.6132366731762886, + "epoch": 3.0778588807785887, + "grad_norm": 0.008984670974314213, "learning_rate": 0.0002, - "loss": 0.5710293650627136, - "mean_token_accuracy": 0.7682300359010696, - "num_tokens": 37355931.0, + "loss": 0.6176835298538208, + "mean_token_accuracy": 0.7453758120536804, + "num_tokens": 17683285.0, "step": 477 }, { - "entropy": 0.5785616040229797, - "epoch": 8.85981308411215, - "grad_norm": 0.038904186338186264, + "entropy": 0.6138317957520485, + "epoch": 3.0843471208434714, + "grad_norm": 0.009527822025120258, "learning_rate": 0.0002, - "loss": 0.5774451494216919, - "mean_token_accuracy": 0.7645587772130966, - "num_tokens": 37434220.0, + "loss": 0.6128236055374146, + "mean_token_accuracy": 0.7498287856578827, + "num_tokens": 17720424.0, "step": 478 }, { - "entropy": 0.5649435520172119, - "epoch": 8.878504672897197, - "grad_norm": 0.03235228732228279, + "entropy": 0.6150398552417755, + "epoch": 3.0908353609083536, + "grad_norm": 0.012212819419801235, "learning_rate": 0.0002, - "loss": 0.5644275546073914, - "mean_token_accuracy": 0.7696262449026108, - "num_tokens": 37512955.0, + "loss": 0.6184934377670288, + "mean_token_accuracy": 0.74715456366539, + "num_tokens": 17757738.0, "step": 479 }, { - "entropy": 0.5670848190784454, - "epoch": 8.897196261682243, - "grad_norm": 0.03787115588784218, + "entropy": 0.6138227432966232, + "epoch": 3.097323600973236, + "grad_norm": 0.009692898020148277, "learning_rate": 0.0002, - "loss": 0.5672973990440369, - "mean_token_accuracy": 0.7695111483335495, - "num_tokens": 37592916.0, + "loss": 0.615317165851593, + "mean_token_accuracy": 0.7491249144077301, + "num_tokens": 17794819.0, "step": 480 }, { - "entropy": 0.5635072439908981, - "epoch": 8.91588785046729, - "grad_norm": 0.039154935628175735, + "entropy": 0.6220738738775253, + "epoch": 3.1038118410381186, + "grad_norm": 0.009081809781491756, "learning_rate": 0.0002, - "loss": 0.5630161762237549, - "mean_token_accuracy": 0.7698703557252884, - "num_tokens": 37672769.0, + "loss": 0.6233057975769043, + "mean_token_accuracy": 0.7442603260278702, + "num_tokens": 17832045.0, "step": 481 }, { - "entropy": 0.5751306414604187, - "epoch": 8.934579439252337, - "grad_norm": 0.03351837024092674, + "entropy": 0.6058575734496117, + "epoch": 3.110300081103001, + "grad_norm": 0.009930483065545559, "learning_rate": 0.0002, - "loss": 0.5736410617828369, - "mean_token_accuracy": 0.7663961499929428, - "num_tokens": 37751335.0, + "loss": 0.6012391448020935, + "mean_token_accuracy": 0.7559900879859924, + "num_tokens": 17869448.0, "step": 482 }, { - "entropy": 0.5660780221223831, - "epoch": 8.953271028037383, - "grad_norm": 0.05055345594882965, + "entropy": 0.6158036887645721, + "epoch": 3.116788321167883, + "grad_norm": 0.009399381466209888, "learning_rate": 0.0002, - "loss": 0.5660668611526489, - "mean_token_accuracy": 0.7696817517280579, - "num_tokens": 37831244.0, + "loss": 0.6149718761444092, + "mean_token_accuracy": 0.7499518990516663, + "num_tokens": 17906111.0, "step": 483 }, { - "entropy": 0.5755114257335663, - "epoch": 8.97196261682243, - "grad_norm": 0.029924951493740082, + "entropy": 0.6169976964592934, + "epoch": 3.1232765612327658, + "grad_norm": 0.009214673191308975, "learning_rate": 0.0002, - "loss": 0.5722489356994629, - "mean_token_accuracy": 0.7663017213344574, - "num_tokens": 37909173.0, + "loss": 0.6195358037948608, + "mean_token_accuracy": 0.744194358587265, + "num_tokens": 17943306.0, "step": 484 }, { - "entropy": 0.5656759142875671, - "epoch": 8.990654205607477, - "grad_norm": 0.05582307279109955, + "entropy": 0.620849184691906, + "epoch": 3.129764801297648, + "grad_norm": 0.00997876189649105, "learning_rate": 0.0002, - "loss": 0.5674799680709839, - "mean_token_accuracy": 0.7680423557758331, - "num_tokens": 37987942.0, + "loss": 0.6267833113670349, + "mean_token_accuracy": 0.744784764945507, + "num_tokens": 17980613.0, "step": 485 }, { - "entropy": 0.5792860984802246, - "epoch": 9.0, - "grad_norm": 0.04136984795331955, + "entropy": 0.6128402128815651, + "epoch": 3.1362530413625302, + "grad_norm": 0.008573702536523342, "learning_rate": 0.0002, - "loss": 0.5720219612121582, - "mean_token_accuracy": 0.7673911452293396, - "num_tokens": 38027415.0, + "loss": 0.6157655715942383, + "mean_token_accuracy": 0.7487166821956635, + "num_tokens": 18017947.0, "step": 486 }, { - "entropy": 0.5568317472934723, - "epoch": 9.018691588785046, - "grad_norm": 0.04542655497789383, + "entropy": 0.622900165617466, + "epoch": 3.142741281427413, + "grad_norm": 0.009601105935871601, "learning_rate": 0.0002, - "loss": 0.5488422513008118, - "mean_token_accuracy": 0.7752774208784103, - "num_tokens": 38106838.0, + "loss": 0.6263000965118408, + "mean_token_accuracy": 0.7445476576685905, + "num_tokens": 18055764.0, "step": 487 }, { - "entropy": 0.5644272416830063, - "epoch": 9.037383177570094, - "grad_norm": 0.039940495043992996, + "entropy": 0.6130729392170906, + "epoch": 3.149229521492295, + "grad_norm": 0.008899933658540249, "learning_rate": 0.0002, - "loss": 0.5659648776054382, - "mean_token_accuracy": 0.7679545432329178, - "num_tokens": 38185916.0, + "loss": 0.6115667819976807, + "mean_token_accuracy": 0.7505542188882828, + "num_tokens": 18092869.0, "step": 488 }, { - "entropy": 0.5693039298057556, - "epoch": 9.05607476635514, - "grad_norm": 0.054858870804309845, + "entropy": 0.615093469619751, + "epoch": 3.1557177615571774, + "grad_norm": 0.009630289860069752, "learning_rate": 0.0002, - "loss": 0.5734539031982422, - "mean_token_accuracy": 0.7664594948291779, - "num_tokens": 38264460.0, + "loss": 0.6127116084098816, + "mean_token_accuracy": 0.74873948097229, + "num_tokens": 18130032.0, "step": 489 }, { - "entropy": 0.5590891689062119, - "epoch": 9.074766355140186, - "grad_norm": 0.0514463409781456, + "entropy": 0.6184138208627701, + "epoch": 3.16220600162206, + "grad_norm": 0.009784260764718056, "learning_rate": 0.0002, - "loss": 0.5518264174461365, - "mean_token_accuracy": 0.7742762863636017, - "num_tokens": 38344456.0, + "loss": 0.6196454763412476, + "mean_token_accuracy": 0.7479289025068283, + "num_tokens": 18167189.0, "step": 490 }, { - "entropy": 0.5555678457021713, - "epoch": 9.093457943925234, - "grad_norm": 0.041370172053575516, + "entropy": 0.6225049868226051, + "epoch": 3.1686942416869424, + "grad_norm": 0.009817374870181084, "learning_rate": 0.0002, - "loss": 0.5566983222961426, - "mean_token_accuracy": 0.7714695483446121, - "num_tokens": 38423617.0, + "loss": 0.6254591345787048, + "mean_token_accuracy": 0.7443916201591492, + "num_tokens": 18204423.0, "step": 491 }, { - "entropy": 0.5446047633886337, - "epoch": 9.11214953271028, - "grad_norm": 0.06446854770183563, + "entropy": 0.599067859351635, + "epoch": 3.1751824817518246, + "grad_norm": 0.009707923047244549, "learning_rate": 0.0002, - "loss": 0.55574631690979, - "mean_token_accuracy": 0.7727518975734711, - "num_tokens": 38501911.0, + "loss": 0.603665292263031, + "mean_token_accuracy": 0.7512796595692635, + "num_tokens": 18241647.0, "step": 492 }, { - "entropy": 0.5527215301990509, - "epoch": 9.130841121495328, - "grad_norm": 0.045423898845911026, + "entropy": 0.6269692480564117, + "epoch": 3.1816707218167073, + "grad_norm": 0.009654807858169079, "learning_rate": 0.0002, - "loss": 0.5502952337265015, - "mean_token_accuracy": 0.7772093117237091, - "num_tokens": 38581657.0, + "loss": 0.6272069215774536, + "mean_token_accuracy": 0.7451600208878517, + "num_tokens": 18278874.0, "step": 493 }, { - "entropy": 0.5689537227153778, - "epoch": 9.149532710280374, - "grad_norm": 0.04693090170621872, + "entropy": 0.60984867811203, + "epoch": 3.1881589618815895, + "grad_norm": 0.00973904225975275, "learning_rate": 0.0002, - "loss": 0.5581166744232178, - "mean_token_accuracy": 0.7714518308639526, - "num_tokens": 38661327.0, + "loss": 0.6120602488517761, + "mean_token_accuracy": 0.7500757128000259, + "num_tokens": 18316077.0, "step": 494 }, { - "entropy": 0.5627695322036743, - "epoch": 9.16822429906542, - "grad_norm": 0.038687728345394135, + "entropy": 0.6112287938594818, + "epoch": 3.1946472019464722, + "grad_norm": 0.010687717236578465, "learning_rate": 0.0002, - "loss": 0.5605401992797852, - "mean_token_accuracy": 0.770438477396965, - "num_tokens": 38739599.0, + "loss": 0.607744038105011, + "mean_token_accuracy": 0.7535340562462807, + "num_tokens": 18353199.0, "step": 495 }, { - "entropy": 0.5462548285722733, - "epoch": 9.186915887850468, - "grad_norm": 0.0521576888859272, + "entropy": 0.6153931394219398, + "epoch": 3.2011354420113545, + "grad_norm": 0.009243862703442574, "learning_rate": 0.0002, - "loss": 0.5529406070709229, - "mean_token_accuracy": 0.7740911543369293, - "num_tokens": 38818199.0, + "loss": 0.6182031035423279, + "mean_token_accuracy": 0.7475122958421707, + "num_tokens": 18390725.0, "step": 496 }, { - "entropy": 0.5611866265535355, - "epoch": 9.205607476635514, - "grad_norm": 0.04400985687971115, + "entropy": 0.6184414252638817, + "epoch": 3.2076236820762367, + "grad_norm": 0.009725847281515598, "learning_rate": 0.0002, - "loss": 0.5519530773162842, - "mean_token_accuracy": 0.774472787976265, - "num_tokens": 38898216.0, + "loss": 0.6202661395072937, + "mean_token_accuracy": 0.7463328316807747, + "num_tokens": 18428083.0, "step": 497 }, { - "entropy": 0.5600290298461914, - "epoch": 9.22429906542056, - "grad_norm": 0.04186929762363434, + "entropy": 0.6206400170922279, + "epoch": 3.2141119221411194, + "grad_norm": 0.009717848151922226, "learning_rate": 0.0002, - "loss": 0.5568031072616577, - "mean_token_accuracy": 0.7704694867134094, - "num_tokens": 38975808.0, + "loss": 0.6237635612487793, + "mean_token_accuracy": 0.7449309974908829, + "num_tokens": 18465093.0, "step": 498 }, { - "entropy": 0.5411058068275452, - "epoch": 9.242990654205608, - "grad_norm": 0.055334728211164474, + "entropy": 0.6063303649425507, + "epoch": 3.2206001622060016, + "grad_norm": 0.009384922683238983, "learning_rate": 0.0002, - "loss": 0.5467251539230347, - "mean_token_accuracy": 0.7770728468894958, - "num_tokens": 39056858.0, + "loss": 0.6071447134017944, + "mean_token_accuracy": 0.750182680785656, + "num_tokens": 18502351.0, "step": 499 }, { - "entropy": 0.5553129017353058, - "epoch": 9.261682242990654, - "grad_norm": 0.040604446083307266, + "entropy": 0.6171220317482948, + "epoch": 3.227088402270884, + "grad_norm": 0.010402821935713291, "learning_rate": 0.0002, - "loss": 0.5534853935241699, - "mean_token_accuracy": 0.7741707265377045, - "num_tokens": 39137258.0, + "loss": 0.6183167695999146, + "mean_token_accuracy": 0.7468552514910698, + "num_tokens": 18540172.0, "step": 500 }, { - "entropy": 0.5694791674613953, - "epoch": 9.280373831775702, - "grad_norm": 0.05060841515660286, + "entropy": 0.6202204376459122, + "epoch": 3.2335766423357666, + "grad_norm": 0.008789432235062122, "learning_rate": 0.0002, - "loss": 0.5628358125686646, - "mean_token_accuracy": 0.769134595990181, - "num_tokens": 39217134.0, + "loss": 0.6224135160446167, + "mean_token_accuracy": 0.745467983186245, + "num_tokens": 18577734.0, "step": 501 }, { - "entropy": 0.5658796727657318, - "epoch": 9.299065420560748, - "grad_norm": 0.050324369221925735, + "entropy": 0.6132732257246971, + "epoch": 3.240064882400649, + "grad_norm": 0.010597198270261288, "learning_rate": 0.0002, - "loss": 0.5642348527908325, - "mean_token_accuracy": 0.7691941559314728, - "num_tokens": 39296226.0, + "loss": 0.6129106283187866, + "mean_token_accuracy": 0.7499266192317009, + "num_tokens": 18614944.0, "step": 502 }, { - "entropy": 0.5391237288713455, - "epoch": 9.317757009345794, - "grad_norm": 0.054539285600185394, + "entropy": 0.6337689533829689, + "epoch": 3.246553122465531, + "grad_norm": 0.009572361595928669, "learning_rate": 0.0002, - "loss": 0.5483332872390747, - "mean_token_accuracy": 0.7765073031187057, - "num_tokens": 39375266.0, + "loss": 0.6304764747619629, + "mean_token_accuracy": 0.7434330955147743, + "num_tokens": 18651997.0, "step": 503 }, { - "entropy": 0.5603165626525879, - "epoch": 9.336448598130842, - "grad_norm": 0.042973097413778305, + "entropy": 0.6075436845421791, + "epoch": 3.2530413625304138, + "grad_norm": 0.00990824680775404, "learning_rate": 0.0002, - "loss": 0.5604079961776733, - "mean_token_accuracy": 0.7713109701871872, - "num_tokens": 39453754.0, + "loss": 0.6082068681716919, + "mean_token_accuracy": 0.7516702488064766, + "num_tokens": 18688674.0, "step": 504 }, { - "entropy": 0.5705735981464386, - "epoch": 9.355140186915888, - "grad_norm": 0.047841478139162064, + "entropy": 0.6139610409736633, + "epoch": 3.259529602595296, + "grad_norm": 0.010237157344818115, "learning_rate": 0.0002, - "loss": 0.5631089806556702, - "mean_token_accuracy": 0.7698779404163361, - "num_tokens": 39532715.0, + "loss": 0.6186607480049133, + "mean_token_accuracy": 0.7454981952905655, + "num_tokens": 18726405.0, "step": 505 }, { - "entropy": 0.5585284233093262, - "epoch": 9.373831775700934, - "grad_norm": 0.04569873958826065, + "entropy": 0.6063608303666115, + "epoch": 3.2660178426601782, + "grad_norm": 0.010847094468772411, "learning_rate": 0.0002, - "loss": 0.5519518852233887, - "mean_token_accuracy": 0.7755726873874664, - "num_tokens": 39611746.0, + "loss": 0.6137136816978455, + "mean_token_accuracy": 0.7497691661119461, + "num_tokens": 18763668.0, "step": 506 }, { - "entropy": 0.5604812204837799, - "epoch": 9.392523364485982, - "grad_norm": 0.052518170326948166, + "entropy": 0.6163499504327774, + "epoch": 3.272506082725061, + "grad_norm": 0.010017551481723785, "learning_rate": 0.0002, - "loss": 0.5635286569595337, - "mean_token_accuracy": 0.770183876156807, - "num_tokens": 39691136.0, + "loss": 0.6188673973083496, + "mean_token_accuracy": 0.7473317757248878, + "num_tokens": 18800872.0, "step": 507 }, { - "entropy": 0.5538004338741302, - "epoch": 9.411214953271028, - "grad_norm": 0.044914163649082184, + "entropy": 0.6251264810562134, + "epoch": 3.278994322789943, + "grad_norm": 0.011264265514910221, "learning_rate": 0.0002, - "loss": 0.5522688627243042, - "mean_token_accuracy": 0.7753826528787613, - "num_tokens": 39769624.0, + "loss": 0.6177271604537964, + "mean_token_accuracy": 0.7485972419381142, + "num_tokens": 18838150.0, "step": 508 }, { - "entropy": 0.5605034232139587, - "epoch": 9.429906542056075, - "grad_norm": 0.04380393773317337, + "entropy": 0.6273062154650688, + "epoch": 3.285482562854826, + "grad_norm": 0.010041182860732079, "learning_rate": 0.0002, - "loss": 0.5553767681121826, - "mean_token_accuracy": 0.7720271348953247, - "num_tokens": 39849011.0, + "loss": 0.6206075549125671, + "mean_token_accuracy": 0.7470289915800095, + "num_tokens": 18875738.0, "step": 509 }, { - "entropy": 0.5566978305578232, - "epoch": 9.448598130841122, - "grad_norm": 0.04671022295951843, + "entropy": 0.6267990991473198, + "epoch": 3.291970802919708, + "grad_norm": 0.011449483223259449, "learning_rate": 0.0002, - "loss": 0.5574364066123962, - "mean_token_accuracy": 0.7712553292512894, - "num_tokens": 39927938.0, + "loss": 0.6346527934074402, + "mean_token_accuracy": 0.7385271340608597, + "num_tokens": 18913137.0, "step": 510 }, { - "entropy": 0.5586736798286438, - "epoch": 9.467289719626168, - "grad_norm": 0.056707724928855896, + "entropy": 0.6025072038173676, + "epoch": 3.2984590429845904, + "grad_norm": 0.010422894731163979, "learning_rate": 0.0002, - "loss": 0.5596231818199158, - "mean_token_accuracy": 0.7711254358291626, - "num_tokens": 40006081.0, + "loss": 0.6072125434875488, + "mean_token_accuracy": 0.7508590817451477, + "num_tokens": 18950470.0, "step": 511 }, { - "entropy": 0.566216766834259, - "epoch": 9.485981308411215, - "grad_norm": 0.04336009919643402, + "entropy": 0.6073831468820572, + "epoch": 3.304947283049473, + "grad_norm": 0.010642215609550476, "learning_rate": 0.0002, - "loss": 0.5624270439147949, - "mean_token_accuracy": 0.7705419957637787, - "num_tokens": 40084773.0, + "loss": 0.6133738160133362, + "mean_token_accuracy": 0.7492869570851326, + "num_tokens": 18988313.0, "step": 512 }, { - "entropy": 0.5668596029281616, - "epoch": 9.504672897196262, - "grad_norm": 0.07046239823102951, + "entropy": 0.5974380895495415, + "epoch": 3.3114355231143553, + "grad_norm": 0.010486697778105736, "learning_rate": 0.0002, - "loss": 0.5715997815132141, - "mean_token_accuracy": 0.7684156596660614, - "num_tokens": 40163757.0, + "loss": 0.6020730137825012, + "mean_token_accuracy": 0.7548841238021851, + "num_tokens": 19024956.0, "step": 513 }, { - "entropy": 0.572264775633812, - "epoch": 9.523364485981308, - "grad_norm": 0.06164439395070076, + "entropy": 0.6128261536359787, + "epoch": 3.3179237631792375, + "grad_norm": 0.011510336771607399, "learning_rate": 0.0002, - "loss": 0.5664000511169434, - "mean_token_accuracy": 0.7686414867639542, - "num_tokens": 40242815.0, + "loss": 0.6143049001693726, + "mean_token_accuracy": 0.7480410858988762, + "num_tokens": 19062179.0, "step": 514 }, { - "entropy": 0.5551411956548691, - "epoch": 9.542056074766355, - "grad_norm": 0.053951751440763474, + "entropy": 0.6077246218919754, + "epoch": 3.3244120032441202, + "grad_norm": 0.010107292793691158, "learning_rate": 0.0002, - "loss": 0.5564425587654114, - "mean_token_accuracy": 0.7743828147649765, - "num_tokens": 40321756.0, + "loss": 0.6046852469444275, + "mean_token_accuracy": 0.7533954977989197, + "num_tokens": 19099090.0, "step": 515 }, { - "entropy": 0.5653344392776489, - "epoch": 9.560747663551401, - "grad_norm": 0.05632255598902702, + "entropy": 0.6247019246220589, + "epoch": 3.3309002433090025, + "grad_norm": 0.010466467589139938, "learning_rate": 0.0002, - "loss": 0.5728057622909546, - "mean_token_accuracy": 0.7655349224805832, - "num_tokens": 40398936.0, + "loss": 0.6306489706039429, + "mean_token_accuracy": 0.741244375705719, + "num_tokens": 19136307.0, "step": 516 }, { - "entropy": 0.5666876137256622, - "epoch": 9.57943925233645, - "grad_norm": 0.0477413646876812, + "entropy": 0.6153485924005508, + "epoch": 3.3373884833738847, + "grad_norm": 0.009494316764175892, "learning_rate": 0.0002, - "loss": 0.5577602982521057, - "mean_token_accuracy": 0.7715498358011246, - "num_tokens": 40477696.0, + "loss": 0.6167474985122681, + "mean_token_accuracy": 0.7500151321291924, + "num_tokens": 19173544.0, "step": 517 }, { - "entropy": 0.5684141516685486, - "epoch": 9.598130841121495, - "grad_norm": 0.04057633876800537, + "entropy": 0.6086971685290337, + "epoch": 3.3438767234387674, + "grad_norm": 0.009192675352096558, "learning_rate": 0.0002, - "loss": 0.560270369052887, - "mean_token_accuracy": 0.7696860134601593, - "num_tokens": 40556332.0, + "loss": 0.6096853017807007, + "mean_token_accuracy": 0.7501685246825218, + "num_tokens": 19210386.0, "step": 518 }, { - "entropy": 0.55315001308918, - "epoch": 9.616822429906541, - "grad_norm": 0.07429754734039307, + "entropy": 0.6297651901841164, + "epoch": 3.3503649635036497, + "grad_norm": 0.009902825579047203, "learning_rate": 0.0002, - "loss": 0.5606566667556763, - "mean_token_accuracy": 0.7719446271657944, - "num_tokens": 40634410.0, + "loss": 0.6314697265625, + "mean_token_accuracy": 0.7417091131210327, + "num_tokens": 19247761.0, "step": 519 }, { - "entropy": 0.5610033273696899, - "epoch": 9.63551401869159, - "grad_norm": 0.06447485834360123, + "entropy": 0.6149463355541229, + "epoch": 3.356853203568532, + "grad_norm": 0.009715819731354713, "learning_rate": 0.0002, - "loss": 0.5673164129257202, - "mean_token_accuracy": 0.7681170105934143, - "num_tokens": 40712496.0, + "loss": 0.6137614250183105, + "mean_token_accuracy": 0.7476155012845993, + "num_tokens": 19284908.0, "step": 520 }, { - "entropy": 0.5906848162412643, - "epoch": 9.654205607476635, - "grad_norm": 0.051934584975242615, + "entropy": 0.6115437000989914, + "epoch": 3.3633414436334146, + "grad_norm": 0.009652029722929, "learning_rate": 0.0002, - "loss": 0.5791685581207275, - "mean_token_accuracy": 0.764894962310791, - "num_tokens": 40790409.0, + "loss": 0.6114376783370972, + "mean_token_accuracy": 0.7499561905860901, + "num_tokens": 19321727.0, "step": 521 }, { - "entropy": 0.5693906992673874, - "epoch": 9.672897196261681, - "grad_norm": 0.05814937874674797, + "entropy": 0.6143479123711586, + "epoch": 3.369829683698297, + "grad_norm": 0.010150844231247902, "learning_rate": 0.0002, - "loss": 0.5632771849632263, - "mean_token_accuracy": 0.7700486779212952, - "num_tokens": 40870640.0, + "loss": 0.6162387132644653, + "mean_token_accuracy": 0.7469704374670982, + "num_tokens": 19359065.0, "step": 522 }, { - "entropy": 0.5577443987131119, - "epoch": 9.69158878504673, - "grad_norm": 0.05073021724820137, + "entropy": 0.6042628288269043, + "epoch": 3.376317923763179, + "grad_norm": 0.010199622251093388, "learning_rate": 0.0002, - "loss": 0.5627031326293945, - "mean_token_accuracy": 0.7702322006225586, - "num_tokens": 40949427.0, + "loss": 0.607587456703186, + "mean_token_accuracy": 0.7510121315717697, + "num_tokens": 19396140.0, "step": 523 }, { - "entropy": 0.5583484172821045, - "epoch": 9.710280373831775, - "grad_norm": 0.06356833130121231, + "entropy": 0.6103994250297546, + "epoch": 3.3828061638280618, + "grad_norm": 0.009757442399859428, "learning_rate": 0.0002, - "loss": 0.5622925162315369, - "mean_token_accuracy": 0.7712053507566452, - "num_tokens": 41028516.0, + "loss": 0.6118942499160767, + "mean_token_accuracy": 0.7493396252393723, + "num_tokens": 19433282.0, "step": 524 }, { - "entropy": 0.5624096095561981, - "epoch": 9.728971962616823, - "grad_norm": 0.051840588450431824, + "entropy": 0.6115303710103035, + "epoch": 3.389294403892944, + "grad_norm": 0.009843776933848858, "learning_rate": 0.0002, - "loss": 0.557092010974884, - "mean_token_accuracy": 0.7728729248046875, - "num_tokens": 41108171.0, + "loss": 0.6144024133682251, + "mean_token_accuracy": 0.7491987869143486, + "num_tokens": 19470735.0, "step": 525 }, { - "entropy": 0.5580566078424454, - "epoch": 9.74766355140187, - "grad_norm": 0.054242074489593506, + "entropy": 0.6124155074357986, + "epoch": 3.3957826439578263, + "grad_norm": 0.012832233682274818, "learning_rate": 0.0002, - "loss": 0.558272123336792, - "mean_token_accuracy": 0.7722387164831161, - "num_tokens": 41186785.0, + "loss": 0.6174359321594238, + "mean_token_accuracy": 0.7484075799584389, + "num_tokens": 19508279.0, "step": 526 }, { - "entropy": 0.5527939796447754, - "epoch": 9.766355140186915, - "grad_norm": 0.05423031747341156, + "entropy": 0.621652752161026, + "epoch": 3.402270884022709, + "grad_norm": 0.010444359853863716, "learning_rate": 0.0002, - "loss": 0.5510618090629578, - "mean_token_accuracy": 0.7753184139728546, - "num_tokens": 41266511.0, + "loss": 0.6202374696731567, + "mean_token_accuracy": 0.747683048248291, + "num_tokens": 19545629.0, "step": 527 }, { - "entropy": 0.5567087680101395, - "epoch": 9.785046728971963, - "grad_norm": 0.059091318398714066, + "entropy": 0.6133333742618561, + "epoch": 3.408759124087591, + "grad_norm": 0.01157453190535307, "learning_rate": 0.0002, - "loss": 0.5601646900177002, - "mean_token_accuracy": 0.7721138298511505, - "num_tokens": 41344767.0, + "loss": 0.6190609931945801, + "mean_token_accuracy": 0.7481984347105026, + "num_tokens": 19583135.0, "step": 528 }, { - "entropy": 0.5563396960496902, - "epoch": 9.80373831775701, - "grad_norm": 0.041039131581783295, + "entropy": 0.6031940132379532, + "epoch": 3.4152473641524734, + "grad_norm": 0.01220928505063057, "learning_rate": 0.0002, - "loss": 0.5506303310394287, - "mean_token_accuracy": 0.7754775285720825, - "num_tokens": 41424990.0, + "loss": 0.60877525806427, + "mean_token_accuracy": 0.7505937144160271, + "num_tokens": 19620410.0, "step": 529 }, { - "entropy": 0.567491352558136, - "epoch": 9.822429906542055, - "grad_norm": 0.05270151048898697, + "entropy": 0.6026583164930344, + "epoch": 3.421735604217356, + "grad_norm": 0.009105565026402473, "learning_rate": 0.0002, - "loss": 0.5634373426437378, - "mean_token_accuracy": 0.770146906375885, - "num_tokens": 41503925.0, + "loss": 0.6003735661506653, + "mean_token_accuracy": 0.7538656741380692, + "num_tokens": 19657757.0, "step": 530 }, { - "entropy": 0.5676887929439545, - "epoch": 9.841121495327103, - "grad_norm": 0.044822655618190765, + "entropy": 0.6212241724133492, + "epoch": 3.4282238442822384, + "grad_norm": 0.012120554223656654, "learning_rate": 0.0002, - "loss": 0.568418025970459, - "mean_token_accuracy": 0.7675944864749908, - "num_tokens": 41583158.0, + "loss": 0.6169411540031433, + "mean_token_accuracy": 0.7489817962050438, + "num_tokens": 19694775.0, "step": 531 }, { - "entropy": 0.5546302497386932, - "epoch": 9.85981308411215, - "grad_norm": 0.055056799203157425, + "entropy": 0.611191414296627, + "epoch": 3.4347120843471206, + "grad_norm": 0.010209856554865837, "learning_rate": 0.0002, - "loss": 0.5574401021003723, - "mean_token_accuracy": 0.7734245508909225, - "num_tokens": 41661822.0, + "loss": 0.6133028268814087, + "mean_token_accuracy": 0.7480586767196655, + "num_tokens": 19731954.0, "step": 532 }, { - "entropy": 0.5644202679395676, - "epoch": 9.878504672897197, - "grad_norm": 0.048922717571258545, + "entropy": 0.6154542937874794, + "epoch": 3.4412003244120033, + "grad_norm": 0.009237438440322876, "learning_rate": 0.0002, - "loss": 0.5685901641845703, - "mean_token_accuracy": 0.7667403668165207, - "num_tokens": 41740079.0, + "loss": 0.6181926131248474, + "mean_token_accuracy": 0.7482445612549782, + "num_tokens": 19769550.0, "step": 533 }, { - "entropy": 0.5666642636060715, - "epoch": 9.897196261682243, - "grad_norm": 0.048663362860679626, + "entropy": 0.6260659247636795, + "epoch": 3.4476885644768855, + "grad_norm": 0.011564482003450394, "learning_rate": 0.0002, - "loss": 0.5589666962623596, - "mean_token_accuracy": 0.7732465118169785, - "num_tokens": 41818436.0, + "loss": 0.6311028599739075, + "mean_token_accuracy": 0.7445508390665054, + "num_tokens": 19806694.0, "step": 534 }, { - "entropy": 0.5761356949806213, - "epoch": 9.91588785046729, - "grad_norm": 0.042342960834503174, + "entropy": 0.6114797592163086, + "epoch": 3.4541768045417682, + "grad_norm": 0.011250223033130169, "learning_rate": 0.0002, - "loss": 0.570763349533081, - "mean_token_accuracy": 0.7665978372097015, - "num_tokens": 41896161.0, + "loss": 0.6188318133354187, + "mean_token_accuracy": 0.7451098337769508, + "num_tokens": 19843897.0, "step": 535 }, { - "entropy": 0.5440604090690613, - "epoch": 9.934579439252337, - "grad_norm": 0.043155740946531296, + "entropy": 0.6260335817933083, + "epoch": 3.4606650446066505, + "grad_norm": 0.00978784915059805, "learning_rate": 0.0002, - "loss": 0.549519419670105, - "mean_token_accuracy": 0.7761891782283783, - "num_tokens": 41976573.0, + "loss": 0.6255401372909546, + "mean_token_accuracy": 0.7468025237321854, + "num_tokens": 19881321.0, "step": 536 }, { - "entropy": 0.5546491295099258, - "epoch": 9.953271028037383, - "grad_norm": 0.0412793830037117, + "entropy": 0.6212326288223267, + "epoch": 3.4671532846715327, + "grad_norm": 0.013453345745801926, "learning_rate": 0.0002, - "loss": 0.5588980913162231, - "mean_token_accuracy": 0.7721990048885345, - "num_tokens": 42055586.0, + "loss": 0.611083984375, + "mean_token_accuracy": 0.7521479055285454, + "num_tokens": 19918768.0, "step": 537 }, { - "entropy": 0.5679792314767838, - "epoch": 9.97196261682243, - "grad_norm": 0.03634324297308922, + "entropy": 0.6172696650028229, + "epoch": 3.4736415247364154, + "grad_norm": 0.010021936148405075, "learning_rate": 0.0002, - "loss": 0.5597659945487976, - "mean_token_accuracy": 0.7712419778108597, - "num_tokens": 42134080.0, + "loss": 0.6165583729743958, + "mean_token_accuracy": 0.7488679885864258, + "num_tokens": 19956374.0, "step": 538 }, { - "entropy": 0.5654930472373962, - "epoch": 9.990654205607477, - "grad_norm": 0.034971874207258224, + "entropy": 0.5984770804643631, + "epoch": 3.4801297648012977, + "grad_norm": 0.010912574827671051, "learning_rate": 0.0002, - "loss": 0.5591872334480286, - "mean_token_accuracy": 0.7716458737850189, - "num_tokens": 42212830.0, + "loss": 0.6038742065429688, + "mean_token_accuracy": 0.752843476831913, + "num_tokens": 19993165.0, "step": 539 }, { - "entropy": 0.5517400205135345, - "epoch": 10.0, - "grad_norm": 0.04363137111067772, + "entropy": 0.6006497591733932, + "epoch": 3.48661800486618, + "grad_norm": 0.010195601731538773, "learning_rate": 0.0002, - "loss": 0.5499259233474731, - "mean_token_accuracy": 0.7756347954273224, - "num_tokens": 42252523.0, + "loss": 0.6058304905891418, + "mean_token_accuracy": 0.7511888965964317, + "num_tokens": 20030632.0, "step": 540 + }, + { + "entropy": 0.603807657957077, + "epoch": 3.4931062449310626, + "grad_norm": 0.010789190419018269, + "learning_rate": 0.0002, + "loss": 0.6101077198982239, + "mean_token_accuracy": 0.7498170882463455, + "num_tokens": 20067720.0, + "step": 541 + }, + { + "entropy": 0.6094614043831825, + "epoch": 3.499594484995945, + "grad_norm": 0.010353523306548595, + "learning_rate": 0.0002, + "loss": 0.6108995676040649, + "mean_token_accuracy": 0.7505486905574799, + "num_tokens": 20105092.0, + "step": 542 + }, + { + "entropy": 0.6127925515174866, + "epoch": 3.5060827250608275, + "grad_norm": 0.011608858592808247, + "learning_rate": 0.0002, + "loss": 0.6113302111625671, + "mean_token_accuracy": 0.7498401030898094, + "num_tokens": 20142060.0, + "step": 543 + }, + { + "entropy": 0.6288227662444115, + "epoch": 3.5125709651257098, + "grad_norm": 0.00944559182971716, + "learning_rate": 0.0002, + "loss": 0.6295347213745117, + "mean_token_accuracy": 0.7438011020421982, + "num_tokens": 20179321.0, + "step": 544 + }, + { + "entropy": 0.6155826225876808, + "epoch": 3.519059205190592, + "grad_norm": 0.010050074197351933, + "learning_rate": 0.0002, + "loss": 0.6170110106468201, + "mean_token_accuracy": 0.7460537254810333, + "num_tokens": 20216788.0, + "step": 545 + }, + { + "entropy": 0.6109997108578682, + "epoch": 3.5255474452554747, + "grad_norm": 0.010288557037711143, + "learning_rate": 0.0002, + "loss": 0.6153451204299927, + "mean_token_accuracy": 0.747114397585392, + "num_tokens": 20254482.0, + "step": 546 + }, + { + "entropy": 0.6220259815454483, + "epoch": 3.532035685320357, + "grad_norm": 0.010569143109023571, + "learning_rate": 0.0002, + "loss": 0.6245878338813782, + "mean_token_accuracy": 0.745466060936451, + "num_tokens": 20291323.0, + "step": 547 + }, + { + "entropy": 0.6251974999904633, + "epoch": 3.538523925385239, + "grad_norm": 0.010512638837099075, + "learning_rate": 0.0002, + "loss": 0.6209877729415894, + "mean_token_accuracy": 0.7460760995745659, + "num_tokens": 20328541.0, + "step": 548 + }, + { + "entropy": 0.6372380778193474, + "epoch": 3.545012165450122, + "grad_norm": 0.009989661164581776, + "learning_rate": 0.0002, + "loss": 0.63493812084198, + "mean_token_accuracy": 0.7409111261367798, + "num_tokens": 20366154.0, + "step": 549 + }, + { + "entropy": 0.616200253367424, + "epoch": 3.551500405515004, + "grad_norm": 0.009802714921534061, + "learning_rate": 0.0002, + "loss": 0.6198533773422241, + "mean_token_accuracy": 0.7493973523378372, + "num_tokens": 20403539.0, + "step": 550 + }, + { + "entropy": 0.6109699085354805, + "epoch": 3.5579886455798864, + "grad_norm": 0.011730330996215343, + "learning_rate": 0.0002, + "loss": 0.6169507503509521, + "mean_token_accuracy": 0.7469825968146324, + "num_tokens": 20440857.0, + "step": 551 + }, + { + "entropy": 0.6107888966798782, + "epoch": 3.564476885644769, + "grad_norm": 0.010902747511863708, + "learning_rate": 0.0002, + "loss": 0.6169427633285522, + "mean_token_accuracy": 0.7473291158676147, + "num_tokens": 20478685.0, + "step": 552 + }, + { + "entropy": 0.6232053637504578, + "epoch": 3.5709651257096513, + "grad_norm": 0.01024220883846283, + "learning_rate": 0.0002, + "loss": 0.6223392486572266, + "mean_token_accuracy": 0.7471131235361099, + "num_tokens": 20516186.0, + "step": 553 + }, + { + "entropy": 0.6318716630339622, + "epoch": 3.5774533657745335, + "grad_norm": 0.00972492340952158, + "learning_rate": 0.0002, + "loss": 0.6295208930969238, + "mean_token_accuracy": 0.7421210557222366, + "num_tokens": 20553418.0, + "step": 554 + }, + { + "entropy": 0.6323020830750465, + "epoch": 3.5839416058394162, + "grad_norm": 0.009747047908604145, + "learning_rate": 0.0002, + "loss": 0.6291106343269348, + "mean_token_accuracy": 0.742633767426014, + "num_tokens": 20590921.0, + "step": 555 + }, + { + "entropy": 0.6193426549434662, + "epoch": 3.5904298459042985, + "grad_norm": 0.009529096074402332, + "learning_rate": 0.0002, + "loss": 0.622657299041748, + "mean_token_accuracy": 0.7454424574971199, + "num_tokens": 20628134.0, + "step": 556 + }, + { + "entropy": 0.606108270585537, + "epoch": 3.5969180859691807, + "grad_norm": 0.01090499758720398, + "learning_rate": 0.0002, + "loss": 0.6156042218208313, + "mean_token_accuracy": 0.7475811764597893, + "num_tokens": 20665529.0, + "step": 557 + }, + { + "entropy": 0.6024795696139336, + "epoch": 3.6034063260340634, + "grad_norm": 0.01122215110808611, + "learning_rate": 0.0002, + "loss": 0.6096351146697998, + "mean_token_accuracy": 0.7500594854354858, + "num_tokens": 20702623.0, + "step": 558 + }, + { + "entropy": 0.6050852239131927, + "epoch": 3.6098945660989457, + "grad_norm": 0.008911820128560066, + "learning_rate": 0.0002, + "loss": 0.6063804626464844, + "mean_token_accuracy": 0.750556543469429, + "num_tokens": 20739535.0, + "step": 559 + }, + { + "entropy": 0.6184356659650803, + "epoch": 3.616382806163828, + "grad_norm": 0.008947025053203106, + "learning_rate": 0.0002, + "loss": 0.6186281442642212, + "mean_token_accuracy": 0.7470304444432259, + "num_tokens": 20776900.0, + "step": 560 + }, + { + "entropy": 0.6115831136703491, + "epoch": 3.6228710462287106, + "grad_norm": 0.010605190880596638, + "learning_rate": 0.0002, + "loss": 0.6092396974563599, + "mean_token_accuracy": 0.750456377863884, + "num_tokens": 20814326.0, + "step": 561 + }, + { + "entropy": 0.6234035491943359, + "epoch": 3.629359286293593, + "grad_norm": 0.010619143024086952, + "learning_rate": 0.0002, + "loss": 0.622122585773468, + "mean_token_accuracy": 0.7449623718857765, + "num_tokens": 20851735.0, + "step": 562 + }, + { + "entropy": 0.6131063625216484, + "epoch": 3.635847526358475, + "grad_norm": 0.009914328344166279, + "learning_rate": 0.0002, + "loss": 0.6129999160766602, + "mean_token_accuracy": 0.7512071952223778, + "num_tokens": 20888959.0, + "step": 563 + }, + { + "entropy": 0.6103895530104637, + "epoch": 3.6423357664233578, + "grad_norm": 0.009590883739292622, + "learning_rate": 0.0002, + "loss": 0.6121896505355835, + "mean_token_accuracy": 0.7519041821360588, + "num_tokens": 20926880.0, + "step": 564 + }, + { + "entropy": 0.6107024624943733, + "epoch": 3.64882400648824, + "grad_norm": 0.010136992670595646, + "learning_rate": 0.0002, + "loss": 0.615648090839386, + "mean_token_accuracy": 0.7478983402252197, + "num_tokens": 20964278.0, + "step": 565 + }, + { + "entropy": 0.6019061878323555, + "epoch": 3.6553122465531223, + "grad_norm": 0.01197731215506792, + "learning_rate": 0.0002, + "loss": 0.6083622574806213, + "mean_token_accuracy": 0.752247080206871, + "num_tokens": 21001703.0, + "step": 566 + }, + { + "entropy": 0.6136230602860451, + "epoch": 3.661800486618005, + "grad_norm": 0.010383468121290207, + "learning_rate": 0.0002, + "loss": 0.6142981052398682, + "mean_token_accuracy": 0.750029981136322, + "num_tokens": 21039545.0, + "step": 567 + }, + { + "entropy": 0.6270170286297798, + "epoch": 3.668288726682887, + "grad_norm": 0.01222953386604786, + "learning_rate": 0.0002, + "loss": 0.622101902961731, + "mean_token_accuracy": 0.7463989406824112, + "num_tokens": 21076601.0, + "step": 568 + }, + { + "entropy": 0.635653018951416, + "epoch": 3.6747769667477694, + "grad_norm": 0.009029991924762726, + "learning_rate": 0.0002, + "loss": 0.6368217468261719, + "mean_token_accuracy": 0.739650160074234, + "num_tokens": 21113628.0, + "step": 569 + }, + { + "entropy": 0.6155265644192696, + "epoch": 3.681265206812652, + "grad_norm": 0.010669651441276073, + "learning_rate": 0.0002, + "loss": 0.6169142723083496, + "mean_token_accuracy": 0.7483588233590126, + "num_tokens": 21150841.0, + "step": 570 + }, + { + "entropy": 0.6179278939962387, + "epoch": 3.6877534468775344, + "grad_norm": 0.01090275775641203, + "learning_rate": 0.0002, + "loss": 0.620256781578064, + "mean_token_accuracy": 0.7459961548447609, + "num_tokens": 21188047.0, + "step": 571 + }, + { + "entropy": 0.6013471409678459, + "epoch": 3.6942416869424166, + "grad_norm": 0.013129356317222118, + "learning_rate": 0.0002, + "loss": 0.6093657612800598, + "mean_token_accuracy": 0.7505828440189362, + "num_tokens": 21224977.0, + "step": 572 + }, + { + "entropy": 0.6192966923117638, + "epoch": 3.7007299270072993, + "grad_norm": 0.01149990689009428, + "learning_rate": 0.0002, + "loss": 0.624458909034729, + "mean_token_accuracy": 0.7465271949768066, + "num_tokens": 21262229.0, + "step": 573 + }, + { + "entropy": 0.6305530145764351, + "epoch": 3.7072181670721815, + "grad_norm": 0.011260929517447948, + "learning_rate": 0.0002, + "loss": 0.6282562613487244, + "mean_token_accuracy": 0.7442766949534416, + "num_tokens": 21299934.0, + "step": 574 + }, + { + "entropy": 0.6216496974229813, + "epoch": 3.7137064071370642, + "grad_norm": 0.011454667896032333, + "learning_rate": 0.0002, + "loss": 0.6176272630691528, + "mean_token_accuracy": 0.7486661300063133, + "num_tokens": 21337298.0, + "step": 575 + }, + { + "entropy": 0.6251465007662773, + "epoch": 3.7201946472019465, + "grad_norm": 0.011989898979663849, + "learning_rate": 0.0002, + "loss": 0.6237755417823792, + "mean_token_accuracy": 0.7449339032173157, + "num_tokens": 21374338.0, + "step": 576 + }, + { + "entropy": 0.6160696297883987, + "epoch": 3.7266828872668287, + "grad_norm": 0.009978833608329296, + "learning_rate": 0.0002, + "loss": 0.6201364398002625, + "mean_token_accuracy": 0.7472834289073944, + "num_tokens": 21411412.0, + "step": 577 + }, + { + "entropy": 0.6086283698678017, + "epoch": 3.7331711273317114, + "grad_norm": 0.01127020176500082, + "learning_rate": 0.0002, + "loss": 0.6133439540863037, + "mean_token_accuracy": 0.7486971095204353, + "num_tokens": 21449184.0, + "step": 578 + }, + { + "entropy": 0.6155035272240639, + "epoch": 3.7396593673965937, + "grad_norm": 0.009915207512676716, + "learning_rate": 0.0002, + "loss": 0.6193184852600098, + "mean_token_accuracy": 0.7452678084373474, + "num_tokens": 21486452.0, + "step": 579 + }, + { + "entropy": 0.6227790787816048, + "epoch": 3.7461476074614763, + "grad_norm": 0.009025565348565578, + "learning_rate": 0.0002, + "loss": 0.6250243186950684, + "mean_token_accuracy": 0.7430055662989616, + "num_tokens": 21524049.0, + "step": 580 + }, + { + "entropy": 0.6145926639437675, + "epoch": 3.7526358475263586, + "grad_norm": 0.010546623729169369, + "learning_rate": 0.0002, + "loss": 0.6121389269828796, + "mean_token_accuracy": 0.7498128041625023, + "num_tokens": 21560910.0, + "step": 581 + }, + { + "entropy": 0.6132489815354347, + "epoch": 3.759124087591241, + "grad_norm": 0.01081460528075695, + "learning_rate": 0.0002, + "loss": 0.6121793389320374, + "mean_token_accuracy": 0.7495040893554688, + "num_tokens": 21598124.0, + "step": 582 + }, + { + "entropy": 0.6323688253760338, + "epoch": 3.7656123276561235, + "grad_norm": 0.010107534937560558, + "learning_rate": 0.0002, + "loss": 0.6294635534286499, + "mean_token_accuracy": 0.7433409690856934, + "num_tokens": 21635437.0, + "step": 583 + }, + { + "entropy": 0.6125660836696625, + "epoch": 3.7721005677210058, + "grad_norm": 0.00997902825474739, + "learning_rate": 0.0002, + "loss": 0.6156618595123291, + "mean_token_accuracy": 0.7480011209845543, + "num_tokens": 21672898.0, + "step": 584 + }, + { + "entropy": 0.6139216870069504, + "epoch": 3.778588807785888, + "grad_norm": 0.01199332345277071, + "learning_rate": 0.0002, + "loss": 0.6214488744735718, + "mean_token_accuracy": 0.748315691947937, + "num_tokens": 21710166.0, + "step": 585 + }, + { + "entropy": 0.5991447791457176, + "epoch": 3.7850770478507707, + "grad_norm": 0.01200946606695652, + "learning_rate": 0.0002, + "loss": 0.6080783605575562, + "mean_token_accuracy": 0.7511922717094421, + "num_tokens": 21746897.0, + "step": 586 + }, + { + "entropy": 0.6105977669358253, + "epoch": 3.791565287915653, + "grad_norm": 0.011675121262669563, + "learning_rate": 0.0002, + "loss": 0.6159127950668335, + "mean_token_accuracy": 0.7491589412093163, + "num_tokens": 21784354.0, + "step": 587 + }, + { + "entropy": 0.6225078999996185, + "epoch": 3.798053527980535, + "grad_norm": 0.00965933594852686, + "learning_rate": 0.0002, + "loss": 0.6214642524719238, + "mean_token_accuracy": 0.7455714717507362, + "num_tokens": 21821856.0, + "step": 588 + }, + { + "entropy": 0.627250537276268, + "epoch": 3.804541768045418, + "grad_norm": 0.010286493226885796, + "learning_rate": 0.0002, + "loss": 0.6219584345817566, + "mean_token_accuracy": 0.7479822859168053, + "num_tokens": 21858968.0, + "step": 589 + }, + { + "entropy": 0.6303782388567924, + "epoch": 3.8110300081103, + "grad_norm": 0.009684202261269093, + "learning_rate": 0.0002, + "loss": 0.629400372505188, + "mean_token_accuracy": 0.7433283776044846, + "num_tokens": 21896486.0, + "step": 590 + }, + { + "entropy": 0.6274826601147652, + "epoch": 3.8175182481751824, + "grad_norm": 0.00968723464757204, + "learning_rate": 0.0002, + "loss": 0.6308175325393677, + "mean_token_accuracy": 0.7409676983952522, + "num_tokens": 21933746.0, + "step": 591 + }, + { + "entropy": 0.607462614774704, + "epoch": 3.824006488240065, + "grad_norm": 0.010024085640907288, + "learning_rate": 0.0002, + "loss": 0.6111215353012085, + "mean_token_accuracy": 0.7507134452462196, + "num_tokens": 21970727.0, + "step": 592 + }, + { + "entropy": 0.6113528236746788, + "epoch": 3.8304947283049473, + "grad_norm": 0.009630702435970306, + "learning_rate": 0.0002, + "loss": 0.615958571434021, + "mean_token_accuracy": 0.7483637630939484, + "num_tokens": 22008126.0, + "step": 593 + }, + { + "entropy": 0.6118894517421722, + "epoch": 3.8369829683698295, + "grad_norm": 0.00891201663762331, + "learning_rate": 0.0002, + "loss": 0.6150209903717041, + "mean_token_accuracy": 0.7505509406328201, + "num_tokens": 22045058.0, + "step": 594 + }, + { + "entropy": 0.6181119605898857, + "epoch": 3.8434712084347122, + "grad_norm": 0.00870099663734436, + "learning_rate": 0.0002, + "loss": 0.6192715764045715, + "mean_token_accuracy": 0.7477136552333832, + "num_tokens": 22082485.0, + "step": 595 + }, + { + "entropy": 0.6250515654683113, + "epoch": 3.8499594484995945, + "grad_norm": 0.00869520753622055, + "learning_rate": 0.0002, + "loss": 0.6237080097198486, + "mean_token_accuracy": 0.7448958083987236, + "num_tokens": 22120186.0, + "step": 596 + }, + { + "entropy": 0.6200907677412033, + "epoch": 3.8564476885644767, + "grad_norm": 0.008723787032067776, + "learning_rate": 0.0002, + "loss": 0.6199079751968384, + "mean_token_accuracy": 0.7453882619738579, + "num_tokens": 22157538.0, + "step": 597 + }, + { + "entropy": 0.6176511943340302, + "epoch": 3.8629359286293594, + "grad_norm": 0.010193057358264923, + "learning_rate": 0.0002, + "loss": 0.6177176237106323, + "mean_token_accuracy": 0.7501931935548782, + "num_tokens": 22195003.0, + "step": 598 + }, + { + "entropy": 0.6236204281449318, + "epoch": 3.8694241686942417, + "grad_norm": 0.00979641918092966, + "learning_rate": 0.0002, + "loss": 0.6303654909133911, + "mean_token_accuracy": 0.7406158596277237, + "num_tokens": 22232607.0, + "step": 599 + }, + { + "entropy": 0.6202436164021492, + "epoch": 3.875912408759124, + "grad_norm": 0.010212398134171963, + "learning_rate": 0.0002, + "loss": 0.6213873028755188, + "mean_token_accuracy": 0.7464328482747078, + "num_tokens": 22269920.0, + "step": 600 + }, + { + "entropy": 0.613631397485733, + "epoch": 3.8824006488240066, + "grad_norm": 0.009876083582639694, + "learning_rate": 0.0002, + "loss": 0.6182212829589844, + "mean_token_accuracy": 0.7480113580822945, + "num_tokens": 22306694.0, + "step": 601 + }, + { + "entropy": 0.6167808622121811, + "epoch": 3.888888888888889, + "grad_norm": 0.010310813784599304, + "learning_rate": 0.0002, + "loss": 0.6251655220985413, + "mean_token_accuracy": 0.7455293834209442, + "num_tokens": 22343827.0, + "step": 602 + }, + { + "entropy": 0.6132790520787239, + "epoch": 3.895377128953771, + "grad_norm": 0.009235870093107224, + "learning_rate": 0.0002, + "loss": 0.6129046678543091, + "mean_token_accuracy": 0.7505499720573425, + "num_tokens": 22381214.0, + "step": 603 + }, + { + "entropy": 0.6209843009710312, + "epoch": 3.9018653690186538, + "grad_norm": 0.009926384314894676, + "learning_rate": 0.0002, + "loss": 0.6192604899406433, + "mean_token_accuracy": 0.7472119927406311, + "num_tokens": 22418601.0, + "step": 604 + }, + { + "entropy": 0.6364298164844513, + "epoch": 3.908353609083536, + "grad_norm": 0.011292664334177971, + "learning_rate": 0.0002, + "loss": 0.6354763507843018, + "mean_token_accuracy": 0.742254801094532, + "num_tokens": 22455732.0, + "step": 605 + }, + { + "entropy": 0.6375604569911957, + "epoch": 3.9148418491484183, + "grad_norm": 0.009769946336746216, + "learning_rate": 0.0002, + "loss": 0.6385936737060547, + "mean_token_accuracy": 0.7394958734512329, + "num_tokens": 22492996.0, + "step": 606 + }, + { + "entropy": 0.6145768612623215, + "epoch": 3.921330089213301, + "grad_norm": 0.010400141589343548, + "learning_rate": 0.0002, + "loss": 0.6150961518287659, + "mean_token_accuracy": 0.7494016960263252, + "num_tokens": 22530887.0, + "step": 607 + }, + { + "entropy": 0.6110121458768845, + "epoch": 3.927818329278183, + "grad_norm": 0.01383623294532299, + "learning_rate": 0.0002, + "loss": 0.6156477332115173, + "mean_token_accuracy": 0.7485735863447189, + "num_tokens": 22568066.0, + "step": 608 + }, + { + "entropy": 0.6164045110344887, + "epoch": 3.9343065693430654, + "grad_norm": 0.011148249730467796, + "learning_rate": 0.0002, + "loss": 0.6243358850479126, + "mean_token_accuracy": 0.7457598373293877, + "num_tokens": 22605687.0, + "step": 609 + }, + { + "entropy": 0.6160785332322121, + "epoch": 3.940794809407948, + "grad_norm": 0.011384137906134129, + "learning_rate": 0.0002, + "loss": 0.6210045218467712, + "mean_token_accuracy": 0.7471992895007133, + "num_tokens": 22642646.0, + "step": 610 + }, + { + "entropy": 0.6149823144078255, + "epoch": 3.9472830494728304, + "grad_norm": 0.012957974337041378, + "learning_rate": 0.0002, + "loss": 0.6171556711196899, + "mean_token_accuracy": 0.7489227131009102, + "num_tokens": 22679842.0, + "step": 611 + }, + { + "entropy": 0.6145467907190323, + "epoch": 3.9537712895377126, + "grad_norm": 0.010933002457022667, + "learning_rate": 0.0002, + "loss": 0.6167636513710022, + "mean_token_accuracy": 0.7463917657732964, + "num_tokens": 22717084.0, + "step": 612 + }, + { + "entropy": 0.6232969015836716, + "epoch": 3.9602595296025953, + "grad_norm": 0.009922384284436703, + "learning_rate": 0.0002, + "loss": 0.6252729892730713, + "mean_token_accuracy": 0.743752971291542, + "num_tokens": 22754399.0, + "step": 613 + }, + { + "entropy": 0.6329927816987038, + "epoch": 3.9667477696674776, + "grad_norm": 0.012450586073100567, + "learning_rate": 0.0002, + "loss": 0.6310559511184692, + "mean_token_accuracy": 0.7443704977631569, + "num_tokens": 22791668.0, + "step": 614 + }, + { + "entropy": 0.6241239309310913, + "epoch": 3.9732360097323602, + "grad_norm": 0.010473434813320637, + "learning_rate": 0.0002, + "loss": 0.6205140352249146, + "mean_token_accuracy": 0.7461888715624809, + "num_tokens": 22829072.0, + "step": 615 + }, + { + "entropy": 0.6387766450643539, + "epoch": 3.9797242497972425, + "grad_norm": 0.011033239774405956, + "learning_rate": 0.0002, + "loss": 0.638136088848114, + "mean_token_accuracy": 0.7390930280089378, + "num_tokens": 22866252.0, + "step": 616 + }, + { + "entropy": 0.6195501312613487, + "epoch": 3.986212489862125, + "grad_norm": 0.011396627873182297, + "learning_rate": 0.0002, + "loss": 0.6249865293502808, + "mean_token_accuracy": 0.7435013577342033, + "num_tokens": 22903910.0, + "step": 617 + }, + { + "entropy": 0.6073991656303406, + "epoch": 3.9927007299270074, + "grad_norm": 0.011404155753552914, + "learning_rate": 0.0002, + "loss": 0.6144699454307556, + "mean_token_accuracy": 0.7486153542995453, + "num_tokens": 22941419.0, + "step": 618 + }, + { + "entropy": 0.6133335530757904, + "epoch": 3.9991889699918897, + "grad_norm": 0.012148975394666195, + "learning_rate": 0.0002, + "loss": 0.6239128112792969, + "mean_token_accuracy": 0.744051106274128, + "num_tokens": 22978672.0, + "step": 619 + }, + { + "entropy": 0.6109002828598022, + "epoch": 4.0, + "grad_norm": 0.02331351302564144, + "learning_rate": 0.0002, + "loss": 0.6144630312919617, + "mean_token_accuracy": 0.7544165849685669, + "num_tokens": 22983289.0, + "step": 620 + }, + { + "entropy": 0.6217539757490158, + "epoch": 4.006488240064883, + "grad_norm": 0.013456643559038639, + "learning_rate": 0.0002, + "loss": 0.613330602645874, + "mean_token_accuracy": 0.7499688565731049, + "num_tokens": 23020412.0, + "step": 621 + }, + { + "entropy": 0.6039147675037384, + "epoch": 4.0129764801297645, + "grad_norm": 0.013175777159631252, + "learning_rate": 0.0002, + "loss": 0.597152829170227, + "mean_token_accuracy": 0.7552643939852715, + "num_tokens": 23057448.0, + "step": 622 + }, + { + "entropy": 0.6142989620566368, + "epoch": 4.019464720194647, + "grad_norm": 0.014114204794168472, + "learning_rate": 0.0002, + "loss": 0.6228339672088623, + "mean_token_accuracy": 0.744938038289547, + "num_tokens": 23094545.0, + "step": 623 + }, + { + "entropy": 0.6015428304672241, + "epoch": 4.02595296025953, + "grad_norm": 0.015099803917109966, + "learning_rate": 0.0002, + "loss": 0.6131606698036194, + "mean_token_accuracy": 0.7470837756991386, + "num_tokens": 23131965.0, + "step": 624 + }, + { + "entropy": 0.5885332375764847, + "epoch": 4.032441200324412, + "grad_norm": 0.014588817954063416, + "learning_rate": 0.0002, + "loss": 0.593397855758667, + "mean_token_accuracy": 0.7566570267081261, + "num_tokens": 23168813.0, + "step": 625 + }, + { + "entropy": 0.6016655787825584, + "epoch": 4.038929440389294, + "grad_norm": 0.012094132602214813, + "learning_rate": 0.0002, + "loss": 0.6046090126037598, + "mean_token_accuracy": 0.7522159889340401, + "num_tokens": 23205779.0, + "step": 626 + }, + { + "entropy": 0.6151943281292915, + "epoch": 4.045417680454177, + "grad_norm": 0.012667203322052956, + "learning_rate": 0.0002, + "loss": 0.6111838221549988, + "mean_token_accuracy": 0.7486316040158272, + "num_tokens": 23242684.0, + "step": 627 + }, + { + "entropy": 0.6105204373598099, + "epoch": 4.051905920519059, + "grad_norm": 0.011044032871723175, + "learning_rate": 0.0002, + "loss": 0.6119928956031799, + "mean_token_accuracy": 0.7496168315410614, + "num_tokens": 23279684.0, + "step": 628 + }, + { + "entropy": 0.6080695539712906, + "epoch": 4.0583941605839415, + "grad_norm": 0.012295052409172058, + "learning_rate": 0.0002, + "loss": 0.6104212999343872, + "mean_token_accuracy": 0.7498067244887352, + "num_tokens": 23316599.0, + "step": 629 + }, + { + "entropy": 0.6009281948208809, + "epoch": 4.064882400648824, + "grad_norm": 0.012583774514496326, + "learning_rate": 0.0002, + "loss": 0.6041219234466553, + "mean_token_accuracy": 0.7518585100769997, + "num_tokens": 23353800.0, + "step": 630 + }, + { + "entropy": 0.6015147417783737, + "epoch": 4.071370640713706, + "grad_norm": 0.011909936554729939, + "learning_rate": 0.0002, + "loss": 0.6030286550521851, + "mean_token_accuracy": 0.7531652525067329, + "num_tokens": 23390939.0, + "step": 631 + }, + { + "entropy": 0.6044563055038452, + "epoch": 4.077858880778589, + "grad_norm": 0.011805822141468525, + "learning_rate": 0.0002, + "loss": 0.6060421466827393, + "mean_token_accuracy": 0.7509199753403664, + "num_tokens": 23427956.0, + "step": 632 + }, + { + "entropy": 0.6049995571374893, + "epoch": 4.084347120843471, + "grad_norm": 0.012876358814537525, + "learning_rate": 0.0002, + "loss": 0.6117682456970215, + "mean_token_accuracy": 0.7485300377011299, + "num_tokens": 23465445.0, + "step": 633 + }, + { + "entropy": 0.6048118397593498, + "epoch": 4.090835360908353, + "grad_norm": 0.012466302141547203, + "learning_rate": 0.0002, + "loss": 0.6076602339744568, + "mean_token_accuracy": 0.7526114881038666, + "num_tokens": 23502361.0, + "step": 634 + }, + { + "entropy": 0.6199515163898468, + "epoch": 4.097323600973236, + "grad_norm": 0.013892917893826962, + "learning_rate": 0.0002, + "loss": 0.6193369626998901, + "mean_token_accuracy": 0.7488663196563721, + "num_tokens": 23540086.0, + "step": 635 + }, + { + "entropy": 0.6109070330858231, + "epoch": 4.103811841038119, + "grad_norm": 0.012778576463460922, + "learning_rate": 0.0002, + "loss": 0.6099793910980225, + "mean_token_accuracy": 0.7521104216575623, + "num_tokens": 23577435.0, + "step": 636 + }, + { + "entropy": 0.6217869147658348, + "epoch": 4.110300081103, + "grad_norm": 0.011083797551691532, + "learning_rate": 0.0002, + "loss": 0.6223993301391602, + "mean_token_accuracy": 0.7441250160336494, + "num_tokens": 23614892.0, + "step": 637 + }, + { + "entropy": 0.6092150881886482, + "epoch": 4.116788321167883, + "grad_norm": 0.011457768268883228, + "learning_rate": 0.0002, + "loss": 0.6109668016433716, + "mean_token_accuracy": 0.7505389377474785, + "num_tokens": 23652404.0, + "step": 638 + }, + { + "entropy": 0.5892162844538689, + "epoch": 4.123276561232766, + "grad_norm": 0.011224270798265934, + "learning_rate": 0.0002, + "loss": 0.5923285484313965, + "mean_token_accuracy": 0.7561718374490738, + "num_tokens": 23689182.0, + "step": 639 + }, + { + "entropy": 0.6155631691217422, + "epoch": 4.1297648012976484, + "grad_norm": 0.011392487213015556, + "learning_rate": 0.0002, + "loss": 0.6169704794883728, + "mean_token_accuracy": 0.7484367191791534, + "num_tokens": 23726827.0, + "step": 640 + }, + { + "entropy": 0.6134647503495216, + "epoch": 4.13625304136253, + "grad_norm": 0.01305895671248436, + "learning_rate": 0.0002, + "loss": 0.6227377653121948, + "mean_token_accuracy": 0.7455505281686783, + "num_tokens": 23764215.0, + "step": 641 + }, + { + "entropy": 0.6127767860889435, + "epoch": 4.142741281427413, + "grad_norm": 0.011744504794478416, + "learning_rate": 0.0002, + "loss": 0.6154167056083679, + "mean_token_accuracy": 0.7480334118008614, + "num_tokens": 23801609.0, + "step": 642 + }, + { + "entropy": 0.6113294437527657, + "epoch": 4.149229521492296, + "grad_norm": 0.013036824762821198, + "learning_rate": 0.0002, + "loss": 0.6141045093536377, + "mean_token_accuracy": 0.7493610754609108, + "num_tokens": 23839155.0, + "step": 643 + }, + { + "entropy": 0.6171691864728928, + "epoch": 4.155717761557177, + "grad_norm": 0.012765160761773586, + "learning_rate": 0.0002, + "loss": 0.6207258701324463, + "mean_token_accuracy": 0.7462699934840202, + "num_tokens": 23876532.0, + "step": 644 + }, + { + "entropy": 0.6020215824246407, + "epoch": 4.16220600162206, + "grad_norm": 0.011224629357457161, + "learning_rate": 0.0002, + "loss": 0.6040517091751099, + "mean_token_accuracy": 0.7520366311073303, + "num_tokens": 23913624.0, + "step": 645 + }, + { + "entropy": 0.6073898002505302, + "epoch": 4.168694241686943, + "grad_norm": 0.012669643387198448, + "learning_rate": 0.0002, + "loss": 0.6089828610420227, + "mean_token_accuracy": 0.751623198390007, + "num_tokens": 23951134.0, + "step": 646 + }, + { + "entropy": 0.6056643575429916, + "epoch": 4.175182481751825, + "grad_norm": 0.013099576346576214, + "learning_rate": 0.0002, + "loss": 0.6066282391548157, + "mean_token_accuracy": 0.7509062737226486, + "num_tokens": 23988712.0, + "step": 647 + }, + { + "entropy": 0.6190872266888618, + "epoch": 4.181670721816707, + "grad_norm": 0.013141883537173271, + "learning_rate": 0.0002, + "loss": 0.6172468662261963, + "mean_token_accuracy": 0.7470818608999252, + "num_tokens": 24025925.0, + "step": 648 + }, + { + "entropy": 0.6018052324652672, + "epoch": 4.18815896188159, + "grad_norm": 0.01188298873603344, + "learning_rate": 0.0002, + "loss": 0.6035501956939697, + "mean_token_accuracy": 0.7526876479387283, + "num_tokens": 24063159.0, + "step": 649 + }, + { + "entropy": 0.6047950685024261, + "epoch": 4.194647201946472, + "grad_norm": 0.014647013507783413, + "learning_rate": 0.0002, + "loss": 0.6088840961456299, + "mean_token_accuracy": 0.7501959800720215, + "num_tokens": 24100259.0, + "step": 650 + }, + { + "entropy": 0.6092503741383553, + "epoch": 4.2011354420113545, + "grad_norm": 0.012967122718691826, + "learning_rate": 0.0002, + "loss": 0.6154978275299072, + "mean_token_accuracy": 0.7469052001833916, + "num_tokens": 24137670.0, + "step": 651 + }, + { + "entropy": 0.6076086908578873, + "epoch": 4.207623682076237, + "grad_norm": 0.015226679854094982, + "learning_rate": 0.0002, + "loss": 0.6063575744628906, + "mean_token_accuracy": 0.7520931884646416, + "num_tokens": 24174990.0, + "step": 652 + }, + { + "entropy": 0.5980376899242401, + "epoch": 4.214111922141119, + "grad_norm": 0.01129455491900444, + "learning_rate": 0.0002, + "loss": 0.5961977243423462, + "mean_token_accuracy": 0.7564675956964493, + "num_tokens": 24212331.0, + "step": 653 + }, + { + "entropy": 0.6016443520784378, + "epoch": 4.220600162206002, + "grad_norm": 0.014820009469985962, + "learning_rate": 0.0002, + "loss": 0.6029236912727356, + "mean_token_accuracy": 0.7525514140725136, + "num_tokens": 24249375.0, + "step": 654 + }, + { + "entropy": 0.6087661758065224, + "epoch": 4.227088402270884, + "grad_norm": 0.0128677599132061, + "learning_rate": 0.0002, + "loss": 0.6112372279167175, + "mean_token_accuracy": 0.748601570725441, + "num_tokens": 24286871.0, + "step": 655 + }, + { + "entropy": 0.615173451602459, + "epoch": 4.233576642335766, + "grad_norm": 0.013609779067337513, + "learning_rate": 0.0002, + "loss": 0.6189801096916199, + "mean_token_accuracy": 0.7472759932279587, + "num_tokens": 24323996.0, + "step": 656 + }, + { + "entropy": 0.6089212968945503, + "epoch": 4.240064882400649, + "grad_norm": 0.013383638113737106, + "learning_rate": 0.0002, + "loss": 0.6078221797943115, + "mean_token_accuracy": 0.7503775134682655, + "num_tokens": 24361162.0, + "step": 657 + }, + { + "entropy": 0.6125769466161728, + "epoch": 4.2465531224655315, + "grad_norm": 0.01211923360824585, + "learning_rate": 0.0002, + "loss": 0.6157176494598389, + "mean_token_accuracy": 0.7472077012062073, + "num_tokens": 24398308.0, + "step": 658 + }, + { + "entropy": 0.6129145845770836, + "epoch": 4.253041362530413, + "grad_norm": 0.013655205257236958, + "learning_rate": 0.0002, + "loss": 0.6173056364059448, + "mean_token_accuracy": 0.7478220462799072, + "num_tokens": 24435361.0, + "step": 659 + }, + { + "entropy": 0.6286280378699303, + "epoch": 4.259529602595296, + "grad_norm": 0.012913207523524761, + "learning_rate": 0.0002, + "loss": 0.6232912540435791, + "mean_token_accuracy": 0.7459053471684456, + "num_tokens": 24472862.0, + "step": 660 + }, + { + "entropy": 0.6073895320296288, + "epoch": 4.266017842660179, + "grad_norm": 0.012715890072286129, + "learning_rate": 0.0002, + "loss": 0.6063985824584961, + "mean_token_accuracy": 0.7502154931426048, + "num_tokens": 24510378.0, + "step": 661 + }, + { + "entropy": 0.5987715944647789, + "epoch": 4.2725060827250605, + "grad_norm": 0.01144983246922493, + "learning_rate": 0.0002, + "loss": 0.603581964969635, + "mean_token_accuracy": 0.7529052719473839, + "num_tokens": 24547450.0, + "step": 662 + }, + { + "entropy": 0.6105594113469124, + "epoch": 4.278994322789943, + "grad_norm": 0.01477118767797947, + "learning_rate": 0.0002, + "loss": 0.6208908557891846, + "mean_token_accuracy": 0.7453452572226524, + "num_tokens": 24584414.0, + "step": 663 + }, + { + "entropy": 0.6013319417834282, + "epoch": 4.285482562854826, + "grad_norm": 0.011751738376915455, + "learning_rate": 0.0002, + "loss": 0.6031821966171265, + "mean_token_accuracy": 0.7529275268316269, + "num_tokens": 24621522.0, + "step": 664 + }, + { + "entropy": 0.6105660572648048, + "epoch": 4.291970802919708, + "grad_norm": 0.011309951543807983, + "learning_rate": 0.0002, + "loss": 0.6077959537506104, + "mean_token_accuracy": 0.7497444152832031, + "num_tokens": 24658985.0, + "step": 665 + }, + { + "entropy": 0.6143631562590599, + "epoch": 4.29845904298459, + "grad_norm": 0.01235566008836031, + "learning_rate": 0.0002, + "loss": 0.6165258884429932, + "mean_token_accuracy": 0.7466364279389381, + "num_tokens": 24696556.0, + "step": 666 + }, + { + "entropy": 0.6108560711145401, + "epoch": 4.304947283049473, + "grad_norm": 0.012649192474782467, + "learning_rate": 0.0002, + "loss": 0.6156973838806152, + "mean_token_accuracy": 0.7493721544742584, + "num_tokens": 24733563.0, + "step": 667 + }, + { + "entropy": 0.5972470939159393, + "epoch": 4.311435523114355, + "grad_norm": 0.012324381619691849, + "learning_rate": 0.0002, + "loss": 0.593143880367279, + "mean_token_accuracy": 0.7569256648421288, + "num_tokens": 24770521.0, + "step": 668 + }, + { + "entropy": 0.6238643601536751, + "epoch": 4.3179237631792375, + "grad_norm": 0.013767421245574951, + "learning_rate": 0.0002, + "loss": 0.6210561990737915, + "mean_token_accuracy": 0.7456039562821388, + "num_tokens": 24807746.0, + "step": 669 + }, + { + "entropy": 0.6074958592653275, + "epoch": 4.32441200324412, + "grad_norm": 0.012642712332308292, + "learning_rate": 0.0002, + "loss": 0.6104567646980286, + "mean_token_accuracy": 0.7498242110013962, + "num_tokens": 24844948.0, + "step": 670 + }, + { + "entropy": 0.6030944362282753, + "epoch": 4.330900243309002, + "grad_norm": 0.014455183409154415, + "learning_rate": 0.0002, + "loss": 0.6104896068572998, + "mean_token_accuracy": 0.751430056989193, + "num_tokens": 24882330.0, + "step": 671 + }, + { + "entropy": 0.6085335910320282, + "epoch": 4.337388483373885, + "grad_norm": 0.012203236110508442, + "learning_rate": 0.0002, + "loss": 0.6149730682373047, + "mean_token_accuracy": 0.748404935002327, + "num_tokens": 24919894.0, + "step": 672 + }, + { + "entropy": 0.6215960904955864, + "epoch": 4.343876723438767, + "grad_norm": 0.01517926249653101, + "learning_rate": 0.0002, + "loss": 0.6182515621185303, + "mean_token_accuracy": 0.7460620552301407, + "num_tokens": 24957338.0, + "step": 673 + }, + { + "entropy": 0.6206786409020424, + "epoch": 4.350364963503649, + "grad_norm": 0.012405015528202057, + "learning_rate": 0.0002, + "loss": 0.6114768385887146, + "mean_token_accuracy": 0.749580554664135, + "num_tokens": 24994430.0, + "step": 674 + }, + { + "entropy": 0.6176847890019417, + "epoch": 4.356853203568532, + "grad_norm": 0.012959569692611694, + "learning_rate": 0.0002, + "loss": 0.6179355382919312, + "mean_token_accuracy": 0.7443158105015755, + "num_tokens": 25031819.0, + "step": 675 + }, + { + "entropy": 0.6137174069881439, + "epoch": 4.363341443633415, + "grad_norm": 0.01568513549864292, + "learning_rate": 0.0002, + "loss": 0.6264492273330688, + "mean_token_accuracy": 0.7434774041175842, + "num_tokens": 25069321.0, + "step": 676 + }, + { + "entropy": 0.6073234900832176, + "epoch": 4.369829683698297, + "grad_norm": 0.01254733745008707, + "learning_rate": 0.0002, + "loss": 0.613095760345459, + "mean_token_accuracy": 0.7486145123839378, + "num_tokens": 25106724.0, + "step": 677 + }, + { + "entropy": 0.6180970370769501, + "epoch": 4.376317923763179, + "grad_norm": 0.01219653245061636, + "learning_rate": 0.0002, + "loss": 0.6162555813789368, + "mean_token_accuracy": 0.7453421652317047, + "num_tokens": 25144301.0, + "step": 678 + }, + { + "entropy": 0.6155680492520332, + "epoch": 4.382806163828062, + "grad_norm": 0.013878269121050835, + "learning_rate": 0.0002, + "loss": 0.6091170907020569, + "mean_token_accuracy": 0.750255212187767, + "num_tokens": 25181210.0, + "step": 679 + }, + { + "entropy": 0.6227680519223213, + "epoch": 4.3892944038929445, + "grad_norm": 0.01349555142223835, + "learning_rate": 0.0002, + "loss": 0.6250801086425781, + "mean_token_accuracy": 0.743384949862957, + "num_tokens": 25218262.0, + "step": 680 + }, + { + "entropy": 0.5870469063520432, + "epoch": 4.395782643957826, + "grad_norm": 0.012459780089557171, + "learning_rate": 0.0002, + "loss": 0.5922443270683289, + "mean_token_accuracy": 0.75776407122612, + "num_tokens": 25255586.0, + "step": 681 + }, + { + "entropy": 0.6126704216003418, + "epoch": 4.402270884022709, + "grad_norm": 0.012495280243456364, + "learning_rate": 0.0002, + "loss": 0.6199891567230225, + "mean_token_accuracy": 0.7477240189909935, + "num_tokens": 25293110.0, + "step": 682 + }, + { + "entropy": 0.6052056401968002, + "epoch": 4.408759124087592, + "grad_norm": 0.011480255052447319, + "learning_rate": 0.0002, + "loss": 0.6054994463920593, + "mean_token_accuracy": 0.7517327517271042, + "num_tokens": 25330240.0, + "step": 683 + }, + { + "entropy": 0.6134005859494209, + "epoch": 4.415247364152473, + "grad_norm": 0.013378560543060303, + "learning_rate": 0.0002, + "loss": 0.6032570600509644, + "mean_token_accuracy": 0.7544484660029411, + "num_tokens": 25367930.0, + "step": 684 + }, + { + "entropy": 0.6132281497120857, + "epoch": 4.421735604217356, + "grad_norm": 0.011817892082035542, + "learning_rate": 0.0002, + "loss": 0.6155675649642944, + "mean_token_accuracy": 0.7474397569894791, + "num_tokens": 25404927.0, + "step": 685 + }, + { + "entropy": 0.6157776713371277, + "epoch": 4.428223844282239, + "grad_norm": 0.013845066539943218, + "learning_rate": 0.0002, + "loss": 0.6208671927452087, + "mean_token_accuracy": 0.7460346668958664, + "num_tokens": 25441808.0, + "step": 686 + }, + { + "entropy": 0.6034616231918335, + "epoch": 4.434712084347121, + "grad_norm": 0.011209644377231598, + "learning_rate": 0.0002, + "loss": 0.6051755547523499, + "mean_token_accuracy": 0.751818560063839, + "num_tokens": 25478982.0, + "step": 687 + }, + { + "entropy": 0.6197097897529602, + "epoch": 4.441200324412003, + "grad_norm": 0.01221329253166914, + "learning_rate": 0.0002, + "loss": 0.624691367149353, + "mean_token_accuracy": 0.743960902094841, + "num_tokens": 25516230.0, + "step": 688 + }, + { + "entropy": 0.6036801412701607, + "epoch": 4.447688564476886, + "grad_norm": 0.011895528994500637, + "learning_rate": 0.0002, + "loss": 0.604611873626709, + "mean_token_accuracy": 0.7565013989806175, + "num_tokens": 25553987.0, + "step": 689 + }, + { + "entropy": 0.6126270368695259, + "epoch": 4.454176804541768, + "grad_norm": 0.014394382014870644, + "learning_rate": 0.0002, + "loss": 0.6157338619232178, + "mean_token_accuracy": 0.7499115914106369, + "num_tokens": 25591126.0, + "step": 690 + }, + { + "entropy": 0.6108303889632225, + "epoch": 4.4606650446066505, + "grad_norm": 0.014680239371955395, + "learning_rate": 0.0002, + "loss": 0.6087052822113037, + "mean_token_accuracy": 0.7516598179936409, + "num_tokens": 25628123.0, + "step": 691 + }, + { + "entropy": 0.6043496802449226, + "epoch": 4.467153284671533, + "grad_norm": 0.013057287782430649, + "learning_rate": 0.0002, + "loss": 0.6059702038764954, + "mean_token_accuracy": 0.7521848082542419, + "num_tokens": 25665273.0, + "step": 692 + }, + { + "entropy": 0.6091088205575943, + "epoch": 4.473641524736415, + "grad_norm": 0.012656234204769135, + "learning_rate": 0.0002, + "loss": 0.6140547394752502, + "mean_token_accuracy": 0.7490741834044456, + "num_tokens": 25702835.0, + "step": 693 + }, + { + "entropy": 0.6054038554430008, + "epoch": 4.480129764801298, + "grad_norm": 0.01144889835268259, + "learning_rate": 0.0002, + "loss": 0.6068828105926514, + "mean_token_accuracy": 0.7513371407985687, + "num_tokens": 25740321.0, + "step": 694 + }, + { + "entropy": 0.6075622960925102, + "epoch": 4.48661800486618, + "grad_norm": 0.014180710539221764, + "learning_rate": 0.0002, + "loss": 0.6113091707229614, + "mean_token_accuracy": 0.7500150203704834, + "num_tokens": 25777354.0, + "step": 695 + }, + { + "entropy": 0.6083768233656883, + "epoch": 4.493106244931062, + "grad_norm": 0.01257058884948492, + "learning_rate": 0.0002, + "loss": 0.613832950592041, + "mean_token_accuracy": 0.7493138536810875, + "num_tokens": 25814766.0, + "step": 696 + }, + { + "entropy": 0.6096158251166344, + "epoch": 4.499594484995945, + "grad_norm": 0.01403698232024908, + "learning_rate": 0.0002, + "loss": 0.606455385684967, + "mean_token_accuracy": 0.751399964094162, + "num_tokens": 25852032.0, + "step": 697 + }, + { + "entropy": 0.61270372569561, + "epoch": 4.5060827250608275, + "grad_norm": 0.013846375048160553, + "learning_rate": 0.0002, + "loss": 0.6081539988517761, + "mean_token_accuracy": 0.7516685873270035, + "num_tokens": 25889272.0, + "step": 698 + }, + { + "entropy": 0.6115692555904388, + "epoch": 4.512570965125709, + "grad_norm": 0.011561271734535694, + "learning_rate": 0.0002, + "loss": 0.6132485866546631, + "mean_token_accuracy": 0.7496950924396515, + "num_tokens": 25926376.0, + "step": 699 + }, + { + "entropy": 0.6165875196456909, + "epoch": 4.519059205190592, + "grad_norm": 0.014013632200658321, + "learning_rate": 0.0002, + "loss": 0.6210501194000244, + "mean_token_accuracy": 0.7466816902160645, + "num_tokens": 25964071.0, + "step": 700 + }, + { + "entropy": 0.6069151386618614, + "epoch": 4.525547445255475, + "grad_norm": 0.01162275206297636, + "learning_rate": 0.0002, + "loss": 0.6112617254257202, + "mean_token_accuracy": 0.7507427483797073, + "num_tokens": 26001770.0, + "step": 701 + }, + { + "entropy": 0.5982604473829269, + "epoch": 4.5320356853203565, + "grad_norm": 0.010527896694839, + "learning_rate": 0.0002, + "loss": 0.5975767374038696, + "mean_token_accuracy": 0.7562049925327301, + "num_tokens": 26038790.0, + "step": 702 + }, + { + "entropy": 0.6178539171814919, + "epoch": 4.538523925385239, + "grad_norm": 0.011301129125058651, + "learning_rate": 0.0002, + "loss": 0.6221362352371216, + "mean_token_accuracy": 0.743792898952961, + "num_tokens": 26076263.0, + "step": 703 + }, + { + "entropy": 0.6195997893810272, + "epoch": 4.545012165450122, + "grad_norm": 0.01180302631109953, + "learning_rate": 0.0002, + "loss": 0.618148922920227, + "mean_token_accuracy": 0.7460778802633286, + "num_tokens": 26113372.0, + "step": 704 + }, + { + "entropy": 0.6094764620065689, + "epoch": 4.551500405515004, + "grad_norm": 0.011488985270261765, + "learning_rate": 0.0002, + "loss": 0.6123408675193787, + "mean_token_accuracy": 0.7495540827512741, + "num_tokens": 26150197.0, + "step": 705 + }, + { + "entropy": 0.6152739748358727, + "epoch": 4.557988645579886, + "grad_norm": 0.011894487775862217, + "learning_rate": 0.0002, + "loss": 0.6184768676757812, + "mean_token_accuracy": 0.7447682395577431, + "num_tokens": 26187580.0, + "step": 706 + }, + { + "entropy": 0.6004127934575081, + "epoch": 4.564476885644769, + "grad_norm": 0.01042366586625576, + "learning_rate": 0.0002, + "loss": 0.6032600402832031, + "mean_token_accuracy": 0.7507253810763359, + "num_tokens": 26224583.0, + "step": 707 + }, + { + "entropy": 0.6170988976955414, + "epoch": 4.570965125709652, + "grad_norm": 0.012767941690981388, + "learning_rate": 0.0002, + "loss": 0.6203943490982056, + "mean_token_accuracy": 0.7446292862296104, + "num_tokens": 26261715.0, + "step": 708 + }, + { + "entropy": 0.6010770201683044, + "epoch": 4.5774533657745335, + "grad_norm": 0.010196649469435215, + "learning_rate": 0.0002, + "loss": 0.6022849082946777, + "mean_token_accuracy": 0.7530830800533295, + "num_tokens": 26298743.0, + "step": 709 + }, + { + "entropy": 0.6049724221229553, + "epoch": 4.583941605839416, + "grad_norm": 0.012646735645830631, + "learning_rate": 0.0002, + "loss": 0.6061745882034302, + "mean_token_accuracy": 0.7506730481982231, + "num_tokens": 26335489.0, + "step": 710 + }, + { + "entropy": 0.6168033257126808, + "epoch": 4.590429845904298, + "grad_norm": 0.013492587953805923, + "learning_rate": 0.0002, + "loss": 0.616999626159668, + "mean_token_accuracy": 0.7479605078697205, + "num_tokens": 26372489.0, + "step": 711 + }, + { + "entropy": 0.6182409450411797, + "epoch": 4.596918085969181, + "grad_norm": 0.010737297125160694, + "learning_rate": 0.0002, + "loss": 0.6131489276885986, + "mean_token_accuracy": 0.7496219426393509, + "num_tokens": 26409535.0, + "step": 712 + }, + { + "entropy": 0.6057656034827232, + "epoch": 4.603406326034063, + "grad_norm": 0.014007823541760445, + "learning_rate": 0.0002, + "loss": 0.6030014753341675, + "mean_token_accuracy": 0.7548240646719933, + "num_tokens": 26446279.0, + "step": 713 + }, + { + "entropy": 0.6160694062709808, + "epoch": 4.609894566098946, + "grad_norm": 0.012945987284183502, + "learning_rate": 0.0002, + "loss": 0.620917558670044, + "mean_token_accuracy": 0.7472490146756172, + "num_tokens": 26483525.0, + "step": 714 + }, + { + "entropy": 0.608958512544632, + "epoch": 4.616382806163828, + "grad_norm": 0.014964601024985313, + "learning_rate": 0.0002, + "loss": 0.6204575300216675, + "mean_token_accuracy": 0.7449859008193016, + "num_tokens": 26520720.0, + "step": 715 + }, + { + "entropy": 0.6118902638554573, + "epoch": 4.622871046228711, + "grad_norm": 0.011436744593083858, + "learning_rate": 0.0002, + "loss": 0.6165215969085693, + "mean_token_accuracy": 0.7477826401591301, + "num_tokens": 26557982.0, + "step": 716 + }, + { + "entropy": 0.6222316101193428, + "epoch": 4.629359286293592, + "grad_norm": 0.011866914108395576, + "learning_rate": 0.0002, + "loss": 0.6159400939941406, + "mean_token_accuracy": 0.7480059117078781, + "num_tokens": 26595389.0, + "step": 717 + }, + { + "entropy": 0.6267769560217857, + "epoch": 4.635847526358475, + "grad_norm": 0.012834588065743446, + "learning_rate": 0.0002, + "loss": 0.6215125322341919, + "mean_token_accuracy": 0.7467430606484413, + "num_tokens": 26632558.0, + "step": 718 + }, + { + "entropy": 0.6167991682887077, + "epoch": 4.642335766423358, + "grad_norm": 0.010781707242131233, + "learning_rate": 0.0002, + "loss": 0.6117191314697266, + "mean_token_accuracy": 0.7489187940955162, + "num_tokens": 26669534.0, + "step": 719 + }, + { + "entropy": 0.608165793120861, + "epoch": 4.6488240064882405, + "grad_norm": 0.013234053738415241, + "learning_rate": 0.0002, + "loss": 0.6105374097824097, + "mean_token_accuracy": 0.7508261948823929, + "num_tokens": 26707068.0, + "step": 720 + }, + { + "entropy": 0.6050869300961494, + "epoch": 4.655312246553122, + "grad_norm": 0.015265488997101784, + "learning_rate": 0.0002, + "loss": 0.6178677082061768, + "mean_token_accuracy": 0.7447132244706154, + "num_tokens": 26744214.0, + "step": 721 + }, + { + "entropy": 0.606209434568882, + "epoch": 4.661800486618005, + "grad_norm": 0.012334835715591908, + "learning_rate": 0.0002, + "loss": 0.6131197214126587, + "mean_token_accuracy": 0.7471205219626427, + "num_tokens": 26781504.0, + "step": 722 + }, + { + "entropy": 0.6154639571905136, + "epoch": 4.668288726682888, + "grad_norm": 0.011331942863762379, + "learning_rate": 0.0002, + "loss": 0.6135961413383484, + "mean_token_accuracy": 0.750006228685379, + "num_tokens": 26818648.0, + "step": 723 + }, + { + "entropy": 0.6127299889922142, + "epoch": 4.674776966747769, + "grad_norm": 0.013016032055020332, + "learning_rate": 0.0002, + "loss": 0.6065088510513306, + "mean_token_accuracy": 0.7515178844332695, + "num_tokens": 26856269.0, + "step": 724 + }, + { + "entropy": 0.6198037564754486, + "epoch": 4.681265206812652, + "grad_norm": 0.010600600391626358, + "learning_rate": 0.0002, + "loss": 0.6175575256347656, + "mean_token_accuracy": 0.748474046587944, + "num_tokens": 26893819.0, + "step": 725 + }, + { + "entropy": 0.6088383719325066, + "epoch": 4.687753446877535, + "grad_norm": 0.012035705149173737, + "learning_rate": 0.0002, + "loss": 0.6124040484428406, + "mean_token_accuracy": 0.7508236169815063, + "num_tokens": 26931388.0, + "step": 726 + }, + { + "entropy": 0.6097267419099808, + "epoch": 4.694241686942417, + "grad_norm": 0.013257896527647972, + "learning_rate": 0.0002, + "loss": 0.6185274720191956, + "mean_token_accuracy": 0.7469557821750641, + "num_tokens": 26968862.0, + "step": 727 + }, + { + "entropy": 0.6031776890158653, + "epoch": 4.700729927007299, + "grad_norm": 0.012637577950954437, + "learning_rate": 0.0002, + "loss": 0.6094907522201538, + "mean_token_accuracy": 0.7504973784089088, + "num_tokens": 27006297.0, + "step": 728 + }, + { + "entropy": 0.6267594248056412, + "epoch": 4.707218167072182, + "grad_norm": 0.012524669989943504, + "learning_rate": 0.0002, + "loss": 0.6284726858139038, + "mean_token_accuracy": 0.74198117852211, + "num_tokens": 27043660.0, + "step": 729 + }, + { + "entropy": 0.6199127435684204, + "epoch": 4.713706407137064, + "grad_norm": 0.011993559077382088, + "learning_rate": 0.0002, + "loss": 0.6179155707359314, + "mean_token_accuracy": 0.7490969151258469, + "num_tokens": 27080997.0, + "step": 730 + }, + { + "entropy": 0.619316965341568, + "epoch": 4.7201946472019465, + "grad_norm": 0.011862427927553654, + "learning_rate": 0.0002, + "loss": 0.6162521839141846, + "mean_token_accuracy": 0.7466591447591782, + "num_tokens": 27118582.0, + "step": 731 + }, + { + "entropy": 0.617161475121975, + "epoch": 4.726682887266829, + "grad_norm": 0.010898209176957607, + "learning_rate": 0.0002, + "loss": 0.6218090057373047, + "mean_token_accuracy": 0.7456279322504997, + "num_tokens": 27155770.0, + "step": 732 + }, + { + "entropy": 0.6097361296415329, + "epoch": 4.733171127331711, + "grad_norm": 0.012140274979174137, + "learning_rate": 0.0002, + "loss": 0.6126585602760315, + "mean_token_accuracy": 0.7512409463524818, + "num_tokens": 27193021.0, + "step": 733 + }, + { + "entropy": 0.5991591587662697, + "epoch": 4.739659367396594, + "grad_norm": 0.011335095390677452, + "learning_rate": 0.0002, + "loss": 0.6005336046218872, + "mean_token_accuracy": 0.7536215856671333, + "num_tokens": 27230104.0, + "step": 734 + }, + { + "entropy": 0.6187688335776329, + "epoch": 4.746147607461476, + "grad_norm": 0.011418522335588932, + "learning_rate": 0.0002, + "loss": 0.619892418384552, + "mean_token_accuracy": 0.7460336685180664, + "num_tokens": 27267697.0, + "step": 735 + }, + { + "entropy": 0.6177256479859352, + "epoch": 4.752635847526358, + "grad_norm": 0.01126981433480978, + "learning_rate": 0.0002, + "loss": 0.6184297204017639, + "mean_token_accuracy": 0.7480708360671997, + "num_tokens": 27304935.0, + "step": 736 + }, + { + "entropy": 0.6365424171090126, + "epoch": 4.759124087591241, + "grad_norm": 0.012852554209530354, + "learning_rate": 0.0002, + "loss": 0.6335437297821045, + "mean_token_accuracy": 0.7411114126443863, + "num_tokens": 27342734.0, + "step": 737 + }, + { + "entropy": 0.6231958642601967, + "epoch": 4.7656123276561235, + "grad_norm": 0.01126949768513441, + "learning_rate": 0.0002, + "loss": 0.6242541670799255, + "mean_token_accuracy": 0.7444687336683273, + "num_tokens": 27380129.0, + "step": 738 + }, + { + "entropy": 0.6135790795087814, + "epoch": 4.772100567721005, + "grad_norm": 0.011775590479373932, + "learning_rate": 0.0002, + "loss": 0.6142154335975647, + "mean_token_accuracy": 0.7484701201319695, + "num_tokens": 27417574.0, + "step": 739 + }, + { + "entropy": 0.5981535315513611, + "epoch": 4.778588807785888, + "grad_norm": 0.012303443625569344, + "learning_rate": 0.0002, + "loss": 0.6043405532836914, + "mean_token_accuracy": 0.7530733942985535, + "num_tokens": 27454673.0, + "step": 740 + }, + { + "entropy": 0.6199762895703316, + "epoch": 4.785077047850771, + "grad_norm": 0.011197846382856369, + "learning_rate": 0.0002, + "loss": 0.6214004158973694, + "mean_token_accuracy": 0.7454070076346397, + "num_tokens": 27492327.0, + "step": 741 + }, + { + "entropy": 0.6030875891447067, + "epoch": 4.7915652879156525, + "grad_norm": 0.012394090183079243, + "learning_rate": 0.0002, + "loss": 0.6037598848342896, + "mean_token_accuracy": 0.7523747533559799, + "num_tokens": 27529616.0, + "step": 742 + }, + { + "entropy": 0.613655112683773, + "epoch": 4.798053527980535, + "grad_norm": 0.010351658798754215, + "learning_rate": 0.0002, + "loss": 0.6146197319030762, + "mean_token_accuracy": 0.7493305876851082, + "num_tokens": 27567467.0, + "step": 743 + }, + { + "entropy": 0.609668679535389, + "epoch": 4.804541768045418, + "grad_norm": 0.010698414407670498, + "learning_rate": 0.0002, + "loss": 0.6130056381225586, + "mean_token_accuracy": 0.749318391084671, + "num_tokens": 27604340.0, + "step": 744 + }, + { + "entropy": 0.6055747121572495, + "epoch": 4.811030008110301, + "grad_norm": 0.011774055659770966, + "learning_rate": 0.0002, + "loss": 0.6064777374267578, + "mean_token_accuracy": 0.7513219490647316, + "num_tokens": 27641869.0, + "step": 745 + }, + { + "entropy": 0.6063344553112984, + "epoch": 4.817518248175182, + "grad_norm": 0.010040192864835262, + "learning_rate": 0.0002, + "loss": 0.6085660457611084, + "mean_token_accuracy": 0.7483800128102303, + "num_tokens": 27678992.0, + "step": 746 + }, + { + "entropy": 0.6175437271595001, + "epoch": 4.824006488240065, + "grad_norm": 0.011712496168911457, + "learning_rate": 0.0002, + "loss": 0.6189186573028564, + "mean_token_accuracy": 0.7486408054828644, + "num_tokens": 27716703.0, + "step": 747 + }, + { + "entropy": 0.6142439544200897, + "epoch": 4.830494728304947, + "grad_norm": 0.012662764638662338, + "learning_rate": 0.0002, + "loss": 0.614926815032959, + "mean_token_accuracy": 0.747495986521244, + "num_tokens": 27754004.0, + "step": 748 + }, + { + "entropy": 0.6087512150406837, + "epoch": 4.8369829683698295, + "grad_norm": 0.010618063621222973, + "learning_rate": 0.0002, + "loss": 0.6098265647888184, + "mean_token_accuracy": 0.7527805492281914, + "num_tokens": 27791212.0, + "step": 749 + }, + { + "entropy": 0.6073944419622421, + "epoch": 4.843471208434712, + "grad_norm": 0.011879456229507923, + "learning_rate": 0.0002, + "loss": 0.6084223389625549, + "mean_token_accuracy": 0.7535420805215836, + "num_tokens": 27828439.0, + "step": 750 + }, + { + "entropy": 0.6072632223367691, + "epoch": 4.849959448499595, + "grad_norm": 0.01333905290812254, + "learning_rate": 0.0002, + "loss": 0.6154837608337402, + "mean_token_accuracy": 0.7462009564042091, + "num_tokens": 27865908.0, + "step": 751 + }, + { + "entropy": 0.6182335615158081, + "epoch": 4.856447688564477, + "grad_norm": 0.012253145687282085, + "learning_rate": 0.0002, + "loss": 0.6162886619567871, + "mean_token_accuracy": 0.7482575252652168, + "num_tokens": 27903553.0, + "step": 752 + }, + { + "entropy": 0.623457059264183, + "epoch": 4.862935928629359, + "grad_norm": 0.012347408570349216, + "learning_rate": 0.0002, + "loss": 0.6175649166107178, + "mean_token_accuracy": 0.7451874390244484, + "num_tokens": 27940745.0, + "step": 753 + }, + { + "entropy": 0.6147228851914406, + "epoch": 4.869424168694241, + "grad_norm": 0.013636295683681965, + "learning_rate": 0.0002, + "loss": 0.6182140111923218, + "mean_token_accuracy": 0.7459222003817558, + "num_tokens": 27977798.0, + "step": 754 + }, + { + "entropy": 0.6009573265910149, + "epoch": 4.875912408759124, + "grad_norm": 0.011285821907222271, + "learning_rate": 0.0002, + "loss": 0.6073520183563232, + "mean_token_accuracy": 0.7508896961808205, + "num_tokens": 28014880.0, + "step": 755 + }, + { + "entropy": 0.5950382575392723, + "epoch": 4.882400648824007, + "grad_norm": 0.011523284018039703, + "learning_rate": 0.0002, + "loss": 0.6006320714950562, + "mean_token_accuracy": 0.7559562996029854, + "num_tokens": 28052148.0, + "step": 756 + }, + { + "entropy": 0.6160282120108604, + "epoch": 4.888888888888889, + "grad_norm": 0.011825107038021088, + "learning_rate": 0.0002, + "loss": 0.6167672872543335, + "mean_token_accuracy": 0.7469073683023453, + "num_tokens": 28089658.0, + "step": 757 + }, + { + "entropy": 0.6171636879444122, + "epoch": 4.895377128953771, + "grad_norm": 0.011352675966918468, + "learning_rate": 0.0002, + "loss": 0.6145755052566528, + "mean_token_accuracy": 0.746620424091816, + "num_tokens": 28127170.0, + "step": 758 + }, + { + "entropy": 0.608257532119751, + "epoch": 4.901865369018654, + "grad_norm": 0.012769036926329136, + "learning_rate": 0.0002, + "loss": 0.609970211982727, + "mean_token_accuracy": 0.7516561150550842, + "num_tokens": 28164347.0, + "step": 759 + }, + { + "entropy": 0.6164683550596237, + "epoch": 4.9083536090835365, + "grad_norm": 0.012305669486522675, + "learning_rate": 0.0002, + "loss": 0.6191939115524292, + "mean_token_accuracy": 0.7453163638710976, + "num_tokens": 28201799.0, + "step": 760 + }, + { + "entropy": 0.614104337990284, + "epoch": 4.914841849148418, + "grad_norm": 0.010976862162351608, + "learning_rate": 0.0002, + "loss": 0.6142949461936951, + "mean_token_accuracy": 0.7480729147791862, + "num_tokens": 28239441.0, + "step": 761 + }, + { + "entropy": 0.5957873240113258, + "epoch": 4.921330089213301, + "grad_norm": 0.011151162907481194, + "learning_rate": 0.0002, + "loss": 0.5960466265678406, + "mean_token_accuracy": 0.7578283548355103, + "num_tokens": 28276966.0, + "step": 762 + }, + { + "entropy": 0.6149696856737137, + "epoch": 4.927818329278184, + "grad_norm": 0.01262627262622118, + "learning_rate": 0.0002, + "loss": 0.6141815185546875, + "mean_token_accuracy": 0.7478419542312622, + "num_tokens": 28314493.0, + "step": 763 + }, + { + "entropy": 0.6079921796917915, + "epoch": 4.934306569343065, + "grad_norm": 0.012012857012450695, + "learning_rate": 0.0002, + "loss": 0.6085329055786133, + "mean_token_accuracy": 0.7516164556145668, + "num_tokens": 28352110.0, + "step": 764 + }, + { + "entropy": 0.606193870306015, + "epoch": 4.940794809407948, + "grad_norm": 0.012743561528623104, + "learning_rate": 0.0002, + "loss": 0.6102321147918701, + "mean_token_accuracy": 0.7491661831736565, + "num_tokens": 28389448.0, + "step": 765 + }, + { + "entropy": 0.6021564230322838, + "epoch": 4.947283049472831, + "grad_norm": 0.011576979421079159, + "learning_rate": 0.0002, + "loss": 0.6045505404472351, + "mean_token_accuracy": 0.7516537830233574, + "num_tokens": 28427005.0, + "step": 766 + }, + { + "entropy": 0.6197597831487656, + "epoch": 4.953771289537713, + "grad_norm": 0.013263656757771969, + "learning_rate": 0.0002, + "loss": 0.6234422922134399, + "mean_token_accuracy": 0.7442535609006882, + "num_tokens": 28464143.0, + "step": 767 + }, + { + "entropy": 0.5995957404375076, + "epoch": 4.960259529602595, + "grad_norm": 0.013597379438579082, + "learning_rate": 0.0002, + "loss": 0.608078122138977, + "mean_token_accuracy": 0.7510829046368599, + "num_tokens": 28501245.0, + "step": 768 + }, + { + "entropy": 0.5990025177598, + "epoch": 4.966747769667478, + "grad_norm": 0.011187846772372723, + "learning_rate": 0.0002, + "loss": 0.6021981835365295, + "mean_token_accuracy": 0.751527689397335, + "num_tokens": 28538395.0, + "step": 769 + }, + { + "entropy": 0.6094980016350746, + "epoch": 4.97323600973236, + "grad_norm": 0.011942482553422451, + "learning_rate": 0.0002, + "loss": 0.6086335182189941, + "mean_token_accuracy": 0.7511740922927856, + "num_tokens": 28575389.0, + "step": 770 + }, + { + "entropy": 0.607696995139122, + "epoch": 4.9797242497972425, + "grad_norm": 0.010719696059823036, + "learning_rate": 0.0002, + "loss": 0.6058928370475769, + "mean_token_accuracy": 0.7512983754277229, + "num_tokens": 28612614.0, + "step": 771 + }, + { + "entropy": 0.6127375960350037, + "epoch": 4.986212489862125, + "grad_norm": 0.011552160605788231, + "learning_rate": 0.0002, + "loss": 0.610999345779419, + "mean_token_accuracy": 0.7520032823085785, + "num_tokens": 28649626.0, + "step": 772 + }, + { + "entropy": 0.6094198897480965, + "epoch": 4.992700729927007, + "grad_norm": 0.010641835629940033, + "learning_rate": 0.0002, + "loss": 0.609566330909729, + "mean_token_accuracy": 0.7494478672742844, + "num_tokens": 28687121.0, + "step": 773 + }, + { + "entropy": 0.6135342344641685, + "epoch": 4.99918896999189, + "grad_norm": 0.010831725783646107, + "learning_rate": 0.0002, + "loss": 0.6144300103187561, + "mean_token_accuracy": 0.7496655061841011, + "num_tokens": 28724466.0, + "step": 774 + }, + { + "entropy": 0.6133913993835449, + "epoch": 5.0, + "grad_norm": 0.025664443150162697, + "learning_rate": 0.0002, + "loss": 0.6142559051513672, + "mean_token_accuracy": 0.7518454194068909, + "num_tokens": 28729104.0, + "step": 775 } ], "logging_steps": 1, - "max_steps": 540, + "max_steps": 775, "num_input_tokens_seen": 0, - "num_train_epochs": 10, + "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { @@ -5427,8 +7777,8 @@ "attributes": {} } }, - "total_flos": 2.7784501160281375e+18, - "train_batch_size": 16, + "total_flos": 2.6824700471332045e+18, + "train_batch_size": 4, "trial_name": null, "trial_params": null }