{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 775, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1549250930547714, "epoch": 0.006488240064882401, "grad_norm": 0.24168352782726288, "learning_rate": 0.0002, "loss": 2.622039794921875, "mean_token_accuracy": 0.5027666613459587, "num_tokens": 36790.0, "step": 1 }, { "entropy": 1.274625539779663, "epoch": 0.012976480129764802, "grad_norm": 0.1995907425880432, "learning_rate": 0.0002, "loss": 2.257164239883423, "mean_token_accuracy": 0.5388679280877113, "num_tokens": 74141.0, "step": 2 }, { "entropy": 1.4621597826480865, "epoch": 0.019464720194647202, "grad_norm": 0.14427633583545685, "learning_rate": 0.0002, "loss": 1.8207428455352783, "mean_token_accuracy": 0.5618570819497108, "num_tokens": 111279.0, "step": 3 }, { "entropy": 1.432983249425888, "epoch": 0.025952960259529603, "grad_norm": 0.11290092021226883, "learning_rate": 0.0002, "loss": 1.4740469455718994, "mean_token_accuracy": 0.6100572720170021, "num_tokens": 148749.0, "step": 4 }, { "entropy": 1.4418732523918152, "epoch": 0.032441200324412, "grad_norm": 0.13801905512809753, "learning_rate": 0.0002, "loss": 1.3789974451065063, "mean_token_accuracy": 0.6047125160694122, "num_tokens": 186530.0, "step": 5 }, { "entropy": 1.3603367805480957, "epoch": 0.038929440389294405, "grad_norm": 0.07707933336496353, "learning_rate": 0.0002, "loss": 1.2482553720474243, "mean_token_accuracy": 0.6377034857869148, "num_tokens": 224090.0, "step": 6 }, { "entropy": 1.2907896488904953, "epoch": 0.0454176804541768, "grad_norm": 0.05054641142487526, "learning_rate": 0.0002, "loss": 1.1776490211486816, "mean_token_accuracy": 0.6423852369189262, "num_tokens": 261358.0, "step": 7 }, { "entropy": 1.2394904792308807, "epoch": 0.05190592051905921, "grad_norm": 0.05160299688577652, "learning_rate": 0.0002, "loss": 1.1141722202301025, "mean_token_accuracy": 0.6483801528811455, "num_tokens": 298387.0, "step": 8 }, { "entropy": 1.140880137681961, "epoch": 0.058394160583941604, "grad_norm": 0.05524353310465813, "learning_rate": 0.0002, "loss": 1.0428144931793213, "mean_token_accuracy": 0.6648038625717163, "num_tokens": 335681.0, "step": 9 }, { "entropy": 1.0597130507230759, "epoch": 0.064882400648824, "grad_norm": 0.0610174834728241, "learning_rate": 0.0002, "loss": 0.9854335784912109, "mean_token_accuracy": 0.6730685979127884, "num_tokens": 373108.0, "step": 10 }, { "entropy": 0.9984031766653061, "epoch": 0.07137064071370641, "grad_norm": 0.05013473331928253, "learning_rate": 0.0002, "loss": 0.9311432838439941, "mean_token_accuracy": 0.6808731183409691, "num_tokens": 410188.0, "step": 11 }, { "entropy": 0.9519696608185768, "epoch": 0.07785888077858881, "grad_norm": 0.7003989219665527, "learning_rate": 0.0002, "loss": 0.9051742553710938, "mean_token_accuracy": 0.6799700632691383, "num_tokens": 447666.0, "step": 12 }, { "entropy": 0.905988834798336, "epoch": 0.08434712084347121, "grad_norm": 0.05167749896645546, "learning_rate": 0.0002, "loss": 0.8597391843795776, "mean_token_accuracy": 0.6946859285235405, "num_tokens": 484844.0, "step": 13 }, { "entropy": 0.8613085150718689, "epoch": 0.0908353609083536, "grad_norm": 0.0768115222454071, "learning_rate": 0.0002, "loss": 0.8413710594177246, "mean_token_accuracy": 0.6983600705862045, "num_tokens": 521975.0, "step": 14 }, { "entropy": 0.8102021664381027, "epoch": 0.09732360097323602, "grad_norm": 0.5994402170181274, "learning_rate": 0.0002, "loss": 0.81607985496521, "mean_token_accuracy": 0.7021179124712944, "num_tokens": 558889.0, "step": 15 }, { "entropy": 0.8057567626237869, "epoch": 0.10381184103811841, "grad_norm": 0.03823373466730118, "learning_rate": 0.0002, "loss": 0.7905861139297485, "mean_token_accuracy": 0.7055389359593391, "num_tokens": 596455.0, "step": 16 }, { "entropy": 0.7923594415187836, "epoch": 0.11030008110300081, "grad_norm": 0.0739479511976242, "learning_rate": 0.0002, "loss": 0.769114077091217, "mean_token_accuracy": 0.7118282616138458, "num_tokens": 634110.0, "step": 17 }, { "entropy": 0.7812566831707954, "epoch": 0.11678832116788321, "grad_norm": 0.03668873757123947, "learning_rate": 0.0002, "loss": 0.7668346762657166, "mean_token_accuracy": 0.7075815051794052, "num_tokens": 671655.0, "step": 18 }, { "entropy": 0.7474964931607246, "epoch": 0.12327656123276562, "grad_norm": 0.041200920939445496, "learning_rate": 0.0002, "loss": 0.7393766641616821, "mean_token_accuracy": 0.716952882707119, "num_tokens": 708824.0, "step": 19 }, { "entropy": 0.7383133918046951, "epoch": 0.129764801297648, "grad_norm": 0.0367242768406868, "learning_rate": 0.0002, "loss": 0.728330135345459, "mean_token_accuracy": 0.7191555127501488, "num_tokens": 746274.0, "step": 20 }, { "entropy": 0.7354703769087791, "epoch": 0.1362530413625304, "grad_norm": 0.039265185594558716, "learning_rate": 0.0002, "loss": 0.7205026149749756, "mean_token_accuracy": 0.7199463173747063, "num_tokens": 783720.0, "step": 21 }, { "entropy": 0.7178014516830444, "epoch": 0.14274128142741282, "grad_norm": 0.03647130727767944, "learning_rate": 0.0002, "loss": 0.7003612518310547, "mean_token_accuracy": 0.7242974415421486, "num_tokens": 821241.0, "step": 22 }, { "entropy": 0.7019922286272049, "epoch": 0.1492295214922952, "grad_norm": 0.03146970644593239, "learning_rate": 0.0002, "loss": 0.6875081062316895, "mean_token_accuracy": 0.7302066311240196, "num_tokens": 858171.0, "step": 23 }, { "entropy": 0.691544882953167, "epoch": 0.15571776155717762, "grad_norm": 0.03450683504343033, "learning_rate": 0.0002, "loss": 0.6847634315490723, "mean_token_accuracy": 0.7311759144067764, "num_tokens": 895368.0, "step": 24 }, { "entropy": 0.6791905760765076, "epoch": 0.16220600162206, "grad_norm": 0.029409531503915787, "learning_rate": 0.0002, "loss": 0.672599732875824, "mean_token_accuracy": 0.7371302843093872, "num_tokens": 932589.0, "step": 25 }, { "entropy": 0.6795228570699692, "epoch": 0.16869424168694241, "grad_norm": 0.029320087283849716, "learning_rate": 0.0002, "loss": 0.6811176538467407, "mean_token_accuracy": 0.7309242188930511, "num_tokens": 969558.0, "step": 26 }, { "entropy": 0.6630020141601562, "epoch": 0.17518248175182483, "grad_norm": 0.025668611750006676, "learning_rate": 0.0002, "loss": 0.6629281044006348, "mean_token_accuracy": 0.7399500384926796, "num_tokens": 1007155.0, "step": 27 }, { "entropy": 0.6723117381334305, "epoch": 0.1816707218167072, "grad_norm": 0.025801967829465866, "learning_rate": 0.0002, "loss": 0.672906756401062, "mean_token_accuracy": 0.7337809279561043, "num_tokens": 1044459.0, "step": 28 }, { "entropy": 0.671604260802269, "epoch": 0.18815896188158962, "grad_norm": 0.026239318773150444, "learning_rate": 0.0002, "loss": 0.6697608828544617, "mean_token_accuracy": 0.7337322384119034, "num_tokens": 1081975.0, "step": 29 }, { "entropy": 0.646067701280117, "epoch": 0.19464720194647203, "grad_norm": 0.02587837167084217, "learning_rate": 0.0002, "loss": 0.6468892097473145, "mean_token_accuracy": 0.7421439811587334, "num_tokens": 1119148.0, "step": 30 }, { "entropy": 0.6522824168205261, "epoch": 0.20113544201135442, "grad_norm": 0.0248495414853096, "learning_rate": 0.0002, "loss": 0.6558438539505005, "mean_token_accuracy": 0.7381908968091011, "num_tokens": 1156351.0, "step": 31 }, { "entropy": 0.6425730809569359, "epoch": 0.20762368207623683, "grad_norm": 0.02851717919111252, "learning_rate": 0.0002, "loss": 0.6539334654808044, "mean_token_accuracy": 0.7376680299639702, "num_tokens": 1193707.0, "step": 32 }, { "entropy": 0.6417841091752052, "epoch": 0.2141119221411192, "grad_norm": 0.02549365535378456, "learning_rate": 0.0002, "loss": 0.6482184529304504, "mean_token_accuracy": 0.7417171224951744, "num_tokens": 1230700.0, "step": 33 }, { "entropy": 0.6465194374322891, "epoch": 0.22060016220600162, "grad_norm": 0.025215625762939453, "learning_rate": 0.0002, "loss": 0.6494179964065552, "mean_token_accuracy": 0.7402999773621559, "num_tokens": 1267782.0, "step": 34 }, { "entropy": 0.6392467468976974, "epoch": 0.22708840227088403, "grad_norm": 0.023007551208138466, "learning_rate": 0.0002, "loss": 0.6377967000007629, "mean_token_accuracy": 0.7462463900446892, "num_tokens": 1304976.0, "step": 35 }, { "entropy": 0.6491241455078125, "epoch": 0.23357664233576642, "grad_norm": 0.022631216794252396, "learning_rate": 0.0002, "loss": 0.6419650316238403, "mean_token_accuracy": 0.7427782192826271, "num_tokens": 1342405.0, "step": 36 }, { "entropy": 0.6426859274506569, "epoch": 0.24006488240064883, "grad_norm": 0.020762791857123375, "learning_rate": 0.0002, "loss": 0.638580322265625, "mean_token_accuracy": 0.74485033005476, "num_tokens": 1379588.0, "step": 37 }, { "entropy": 0.6500778123736382, "epoch": 0.24655312246553124, "grad_norm": 0.01766084134578705, "learning_rate": 0.0002, "loss": 0.6436338424682617, "mean_token_accuracy": 0.7424680069088936, "num_tokens": 1417229.0, "step": 38 }, { "entropy": 0.654863677918911, "epoch": 0.25304136253041365, "grad_norm": 0.018832355737686157, "learning_rate": 0.0002, "loss": 0.6571300029754639, "mean_token_accuracy": 0.7378578186035156, "num_tokens": 1454802.0, "step": 39 }, { "entropy": 0.6454419046640396, "epoch": 0.259529602595296, "grad_norm": 0.018613073974847794, "learning_rate": 0.0002, "loss": 0.6524553298950195, "mean_token_accuracy": 0.7370505034923553, "num_tokens": 1492073.0, "step": 40 }, { "entropy": 0.6527602002024651, "epoch": 0.2660178426601784, "grad_norm": 0.01693454198539257, "learning_rate": 0.0002, "loss": 0.6585220098495483, "mean_token_accuracy": 0.73494041711092, "num_tokens": 1529432.0, "step": 41 }, { "entropy": 0.6482313647866249, "epoch": 0.2725060827250608, "grad_norm": 0.015154066495597363, "learning_rate": 0.0002, "loss": 0.6487522125244141, "mean_token_accuracy": 0.7386852130293846, "num_tokens": 1566849.0, "step": 42 }, { "entropy": 0.6501431986689568, "epoch": 0.27899432278994324, "grad_norm": 0.015506139025092125, "learning_rate": 0.0002, "loss": 0.6508647203445435, "mean_token_accuracy": 0.7396439164876938, "num_tokens": 1603797.0, "step": 43 }, { "entropy": 0.6399750784039497, "epoch": 0.28548256285482565, "grad_norm": 0.014903928153216839, "learning_rate": 0.0002, "loss": 0.639168381690979, "mean_token_accuracy": 0.743517704308033, "num_tokens": 1641043.0, "step": 44 }, { "entropy": 0.6295603513717651, "epoch": 0.291970802919708, "grad_norm": 0.014574805274605751, "learning_rate": 0.0002, "loss": 0.6305776834487915, "mean_token_accuracy": 0.746990330517292, "num_tokens": 1677698.0, "step": 45 }, { "entropy": 0.6334760338068008, "epoch": 0.2984590429845904, "grad_norm": 0.016435733065009117, "learning_rate": 0.0002, "loss": 0.631117582321167, "mean_token_accuracy": 0.7475783005356789, "num_tokens": 1714954.0, "step": 46 }, { "entropy": 0.6437651589512825, "epoch": 0.30494728304947283, "grad_norm": 0.016290629282593727, "learning_rate": 0.0002, "loss": 0.6405509114265442, "mean_token_accuracy": 0.7430335581302643, "num_tokens": 1751913.0, "step": 47 }, { "entropy": 0.6363071575760841, "epoch": 0.31143552311435524, "grad_norm": 0.01479713711887598, "learning_rate": 0.0002, "loss": 0.6342425346374512, "mean_token_accuracy": 0.7451304048299789, "num_tokens": 1789211.0, "step": 48 }, { "entropy": 0.6442478150129318, "epoch": 0.31792376317923765, "grad_norm": 0.014846265316009521, "learning_rate": 0.0002, "loss": 0.641524612903595, "mean_token_accuracy": 0.7414352521300316, "num_tokens": 1826606.0, "step": 49 }, { "entropy": 0.6363928020000458, "epoch": 0.32441200324412, "grad_norm": 0.01481616124510765, "learning_rate": 0.0002, "loss": 0.6363080739974976, "mean_token_accuracy": 0.7444929406046867, "num_tokens": 1863966.0, "step": 50 }, { "entropy": 0.6335690394043922, "epoch": 0.3309002433090024, "grad_norm": 0.015328066423535347, "learning_rate": 0.0002, "loss": 0.6387162208557129, "mean_token_accuracy": 0.7436776608228683, "num_tokens": 1900997.0, "step": 51 }, { "entropy": 0.6325219571590424, "epoch": 0.33738848337388483, "grad_norm": 0.015631280839443207, "learning_rate": 0.0002, "loss": 0.6400341987609863, "mean_token_accuracy": 0.7412212640047073, "num_tokens": 1937974.0, "step": 52 }, { "entropy": 0.63508290797472, "epoch": 0.34387672343876724, "grad_norm": 0.014866264536976814, "learning_rate": 0.0002, "loss": 0.6396467089653015, "mean_token_accuracy": 0.7431643679738045, "num_tokens": 1975204.0, "step": 53 }, { "entropy": 0.6382915005087852, "epoch": 0.35036496350364965, "grad_norm": 0.013517456129193306, "learning_rate": 0.0002, "loss": 0.6404691338539124, "mean_token_accuracy": 0.7433327361941338, "num_tokens": 2012218.0, "step": 54 }, { "entropy": 0.6375824585556984, "epoch": 0.35685320356853206, "grad_norm": 0.015061435289680958, "learning_rate": 0.0002, "loss": 0.6400342583656311, "mean_token_accuracy": 0.7421080023050308, "num_tokens": 2049462.0, "step": 55 }, { "entropy": 0.6377979964017868, "epoch": 0.3633414436334144, "grad_norm": 0.016312120482325554, "learning_rate": 0.0002, "loss": 0.635837197303772, "mean_token_accuracy": 0.7426418736577034, "num_tokens": 2086665.0, "step": 56 }, { "entropy": 0.6413707137107849, "epoch": 0.36982968369829683, "grad_norm": 0.012621643021702766, "learning_rate": 0.0002, "loss": 0.6389581561088562, "mean_token_accuracy": 0.7432198747992516, "num_tokens": 2124115.0, "step": 57 }, { "entropy": 0.6355349719524384, "epoch": 0.37631792376317924, "grad_norm": 0.01422160305082798, "learning_rate": 0.0002, "loss": 0.6343538165092468, "mean_token_accuracy": 0.743286557495594, "num_tokens": 2161345.0, "step": 58 }, { "entropy": 0.6376762092113495, "epoch": 0.38280616382806165, "grad_norm": 0.014769963920116425, "learning_rate": 0.0002, "loss": 0.6412167549133301, "mean_token_accuracy": 0.7418163046240807, "num_tokens": 2198636.0, "step": 59 }, { "entropy": 0.6334660202264786, "epoch": 0.38929440389294406, "grad_norm": 0.014948038384318352, "learning_rate": 0.0002, "loss": 0.6379479169845581, "mean_token_accuracy": 0.7443428039550781, "num_tokens": 2235377.0, "step": 60 }, { "entropy": 0.632827527821064, "epoch": 0.3957826439578264, "grad_norm": 0.01332375779747963, "learning_rate": 0.0002, "loss": 0.633344292640686, "mean_token_accuracy": 0.7467714250087738, "num_tokens": 2272588.0, "step": 61 }, { "entropy": 0.632963553071022, "epoch": 0.40227088402270883, "grad_norm": 0.013366672210395336, "learning_rate": 0.0002, "loss": 0.6344192028045654, "mean_token_accuracy": 0.7444779649376869, "num_tokens": 2310205.0, "step": 62 }, { "entropy": 0.6468651965260506, "epoch": 0.40875912408759124, "grad_norm": 0.012876944616436958, "learning_rate": 0.0002, "loss": 0.6487270593643188, "mean_token_accuracy": 0.7404673770070076, "num_tokens": 2347612.0, "step": 63 }, { "entropy": 0.6336022540926933, "epoch": 0.41524736415247365, "grad_norm": 0.011953601613640785, "learning_rate": 0.0002, "loss": 0.6323578357696533, "mean_token_accuracy": 0.7435265332460403, "num_tokens": 2385324.0, "step": 64 }, { "entropy": 0.6421113535761833, "epoch": 0.42173560421735606, "grad_norm": 0.011578400619328022, "learning_rate": 0.0002, "loss": 0.640021800994873, "mean_token_accuracy": 0.7417890876531601, "num_tokens": 2422386.0, "step": 65 }, { "entropy": 0.6243318468332291, "epoch": 0.4282238442822384, "grad_norm": 0.01271536760032177, "learning_rate": 0.0002, "loss": 0.6278913617134094, "mean_token_accuracy": 0.7464011386036873, "num_tokens": 2459184.0, "step": 66 }, { "entropy": 0.6474096700549126, "epoch": 0.43471208434712083, "grad_norm": 0.011297891847789288, "learning_rate": 0.0002, "loss": 0.649469256401062, "mean_token_accuracy": 0.7372781112790108, "num_tokens": 2496769.0, "step": 67 }, { "entropy": 0.629207618534565, "epoch": 0.44120032441200324, "grad_norm": 0.01338763814419508, "learning_rate": 0.0002, "loss": 0.6260238885879517, "mean_token_accuracy": 0.7460990995168686, "num_tokens": 2533774.0, "step": 68 }, { "entropy": 0.6363127902150154, "epoch": 0.44768856447688565, "grad_norm": 0.01232822984457016, "learning_rate": 0.0002, "loss": 0.6326106786727905, "mean_token_accuracy": 0.7443196326494217, "num_tokens": 2570775.0, "step": 69 }, { "entropy": 0.632358968257904, "epoch": 0.45417680454176806, "grad_norm": 0.012171111069619656, "learning_rate": 0.0002, "loss": 0.6312543749809265, "mean_token_accuracy": 0.745995283126831, "num_tokens": 2608121.0, "step": 70 }, { "entropy": 0.6332346796989441, "epoch": 0.4606650446066504, "grad_norm": 0.015379011631011963, "learning_rate": 0.0002, "loss": 0.6291565299034119, "mean_token_accuracy": 0.7465488314628601, "num_tokens": 2645664.0, "step": 71 }, { "entropy": 0.6404105871915817, "epoch": 0.46715328467153283, "grad_norm": 0.011988981626927853, "learning_rate": 0.0002, "loss": 0.642942488193512, "mean_token_accuracy": 0.7407120391726494, "num_tokens": 2683394.0, "step": 72 }, { "entropy": 0.6460321098566055, "epoch": 0.47364152473641524, "grad_norm": 0.013498514890670776, "learning_rate": 0.0002, "loss": 0.6516697406768799, "mean_token_accuracy": 0.7381351664662361, "num_tokens": 2720891.0, "step": 73 }, { "entropy": 0.6352040842175484, "epoch": 0.48012976480129765, "grad_norm": 0.013542759232223034, "learning_rate": 0.0002, "loss": 0.6443178653717041, "mean_token_accuracy": 0.7414710223674774, "num_tokens": 2758174.0, "step": 74 }, { "entropy": 0.6283697411417961, "epoch": 0.48661800486618007, "grad_norm": 0.014966949820518494, "learning_rate": 0.0002, "loss": 0.6394721269607544, "mean_token_accuracy": 0.7419639229774475, "num_tokens": 2795106.0, "step": 75 }, { "entropy": 0.642236091196537, "epoch": 0.4931062449310625, "grad_norm": 0.015388374216854572, "learning_rate": 0.0002, "loss": 0.6414813995361328, "mean_token_accuracy": 0.7409433200955391, "num_tokens": 2832247.0, "step": 76 }, { "entropy": 0.6422772705554962, "epoch": 0.49959448499594483, "grad_norm": 0.013754413463175297, "learning_rate": 0.0002, "loss": 0.6367785930633545, "mean_token_accuracy": 0.7442163750529289, "num_tokens": 2869526.0, "step": 77 }, { "entropy": 0.653985932469368, "epoch": 0.5060827250608273, "grad_norm": 0.012936330400407314, "learning_rate": 0.0002, "loss": 0.6488639712333679, "mean_token_accuracy": 0.7398064211010933, "num_tokens": 2906821.0, "step": 78 }, { "entropy": 0.6418487578630447, "epoch": 0.5125709651257097, "grad_norm": 0.011183886788785458, "learning_rate": 0.0002, "loss": 0.639202356338501, "mean_token_accuracy": 0.7434348165988922, "num_tokens": 2944032.0, "step": 79 }, { "entropy": 0.6251209825277328, "epoch": 0.519059205190592, "grad_norm": 0.013851741328835487, "learning_rate": 0.0002, "loss": 0.6242102384567261, "mean_token_accuracy": 0.7505335137248039, "num_tokens": 2981414.0, "step": 80 }, { "entropy": 0.6139597967267036, "epoch": 0.5255474452554745, "grad_norm": 0.013575786724686623, "learning_rate": 0.0002, "loss": 0.6168844699859619, "mean_token_accuracy": 0.7502986714243889, "num_tokens": 3018494.0, "step": 81 }, { "entropy": 0.6357163935899734, "epoch": 0.5320356853203568, "grad_norm": 0.012106247246265411, "learning_rate": 0.0002, "loss": 0.6393176317214966, "mean_token_accuracy": 0.743524856865406, "num_tokens": 3055667.0, "step": 82 }, { "entropy": 0.630703866481781, "epoch": 0.5385239253852393, "grad_norm": 0.011411616578698158, "learning_rate": 0.0002, "loss": 0.6349452137947083, "mean_token_accuracy": 0.7417918294668198, "num_tokens": 3092980.0, "step": 83 }, { "entropy": 0.6312713250517845, "epoch": 0.5450121654501217, "grad_norm": 0.013269394636154175, "learning_rate": 0.0002, "loss": 0.6335923075675964, "mean_token_accuracy": 0.7427873983979225, "num_tokens": 3129991.0, "step": 84 }, { "entropy": 0.6429375261068344, "epoch": 0.551500405515004, "grad_norm": 0.01290512178093195, "learning_rate": 0.0002, "loss": 0.6390902996063232, "mean_token_accuracy": 0.7440147623419762, "num_tokens": 3167600.0, "step": 85 }, { "entropy": 0.6209964007139206, "epoch": 0.5579886455798865, "grad_norm": 0.011449260637164116, "learning_rate": 0.0002, "loss": 0.6205590963363647, "mean_token_accuracy": 0.7478290274739265, "num_tokens": 3204616.0, "step": 86 }, { "entropy": 0.6387689039111137, "epoch": 0.5644768856447688, "grad_norm": 0.012288929894566536, "learning_rate": 0.0002, "loss": 0.6413038372993469, "mean_token_accuracy": 0.7402090132236481, "num_tokens": 3241598.0, "step": 87 }, { "entropy": 0.6296097934246063, "epoch": 0.5709651257096513, "grad_norm": 0.012685527093708515, "learning_rate": 0.0002, "loss": 0.6300569772720337, "mean_token_accuracy": 0.745740607380867, "num_tokens": 3278904.0, "step": 88 }, { "entropy": 0.6304027885198593, "epoch": 0.5774533657745337, "grad_norm": 0.012135171331465244, "learning_rate": 0.0002, "loss": 0.6322764158248901, "mean_token_accuracy": 0.7428491413593292, "num_tokens": 3315916.0, "step": 89 }, { "entropy": 0.6270208656787872, "epoch": 0.583941605839416, "grad_norm": 0.012634403072297573, "learning_rate": 0.0002, "loss": 0.6289095878601074, "mean_token_accuracy": 0.74432173371315, "num_tokens": 3352975.0, "step": 90 }, { "entropy": 0.6426985636353493, "epoch": 0.5904298459042985, "grad_norm": 0.012899120338261127, "learning_rate": 0.0002, "loss": 0.6412180662155151, "mean_token_accuracy": 0.7413002401590347, "num_tokens": 3390460.0, "step": 91 }, { "entropy": 0.6386194601655006, "epoch": 0.5969180859691808, "grad_norm": 0.011871455237269402, "learning_rate": 0.0002, "loss": 0.6381049156188965, "mean_token_accuracy": 0.7410541325807571, "num_tokens": 3427650.0, "step": 92 }, { "entropy": 0.6219398155808449, "epoch": 0.6034063260340633, "grad_norm": 0.013389634899795055, "learning_rate": 0.0002, "loss": 0.628428041934967, "mean_token_accuracy": 0.7469312027096748, "num_tokens": 3464664.0, "step": 93 }, { "entropy": 0.6363367736339569, "epoch": 0.6098945660989457, "grad_norm": 0.010384561493992805, "learning_rate": 0.0002, "loss": 0.6355550289154053, "mean_token_accuracy": 0.742337591946125, "num_tokens": 3502010.0, "step": 94 }, { "entropy": 0.6357248276472092, "epoch": 0.616382806163828, "grad_norm": 0.010791895911097527, "learning_rate": 0.0002, "loss": 0.6378734111785889, "mean_token_accuracy": 0.7428740784525871, "num_tokens": 3539472.0, "step": 95 }, { "entropy": 0.6360966116189957, "epoch": 0.6228710462287105, "grad_norm": 0.010037368163466454, "learning_rate": 0.0002, "loss": 0.6382291316986084, "mean_token_accuracy": 0.7439633831381798, "num_tokens": 3576863.0, "step": 96 }, { "entropy": 0.6299866884946823, "epoch": 0.6293592862935928, "grad_norm": 0.011554226279258728, "learning_rate": 0.0002, "loss": 0.6333507895469666, "mean_token_accuracy": 0.7430082336068153, "num_tokens": 3613859.0, "step": 97 }, { "entropy": 0.6372612193226814, "epoch": 0.6358475263584753, "grad_norm": 0.012070685625076294, "learning_rate": 0.0002, "loss": 0.6347473859786987, "mean_token_accuracy": 0.7440797835588455, "num_tokens": 3651376.0, "step": 98 }, { "entropy": 0.6408236473798752, "epoch": 0.6423357664233577, "grad_norm": 0.010936851613223553, "learning_rate": 0.0002, "loss": 0.6386737823486328, "mean_token_accuracy": 0.7431015446782112, "num_tokens": 3688847.0, "step": 99 }, { "entropy": 0.6442330852150917, "epoch": 0.64882400648824, "grad_norm": 0.01024035457521677, "learning_rate": 0.0002, "loss": 0.6463708877563477, "mean_token_accuracy": 0.7389701902866364, "num_tokens": 3726347.0, "step": 100 }, { "entropy": 0.6199506223201752, "epoch": 0.6553122465531225, "grad_norm": 0.01070485170930624, "learning_rate": 0.0002, "loss": 0.6225665807723999, "mean_token_accuracy": 0.7488372325897217, "num_tokens": 3763687.0, "step": 101 }, { "entropy": 0.6321059763431549, "epoch": 0.6618004866180048, "grad_norm": 0.010497628711163998, "learning_rate": 0.0002, "loss": 0.6386170387268066, "mean_token_accuracy": 0.7398883476853371, "num_tokens": 3801390.0, "step": 102 }, { "entropy": 0.6317892819643021, "epoch": 0.6682887266828873, "grad_norm": 0.009558591060340405, "learning_rate": 0.0002, "loss": 0.6320483684539795, "mean_token_accuracy": 0.744752362370491, "num_tokens": 3838836.0, "step": 103 }, { "entropy": 0.6251348331570625, "epoch": 0.6747769667477697, "grad_norm": 0.012168657965958118, "learning_rate": 0.0002, "loss": 0.624641478061676, "mean_token_accuracy": 0.7455502301454544, "num_tokens": 3876059.0, "step": 104 }, { "entropy": 0.6264195889234543, "epoch": 0.681265206812652, "grad_norm": 0.01135180238634348, "learning_rate": 0.0002, "loss": 0.6254705190658569, "mean_token_accuracy": 0.7437941655516624, "num_tokens": 3913140.0, "step": 105 }, { "entropy": 0.6271661967039108, "epoch": 0.6877534468775345, "grad_norm": 0.011404785327613354, "learning_rate": 0.0002, "loss": 0.627234160900116, "mean_token_accuracy": 0.7443915233016014, "num_tokens": 3950197.0, "step": 106 }, { "entropy": 0.6316048800945282, "epoch": 0.6942416869424168, "grad_norm": 0.012731475755572319, "learning_rate": 0.0002, "loss": 0.631871223449707, "mean_token_accuracy": 0.7436823844909668, "num_tokens": 3987880.0, "step": 107 }, { "entropy": 0.6351677849888802, "epoch": 0.7007299270072993, "grad_norm": 0.011057685129344463, "learning_rate": 0.0002, "loss": 0.634377121925354, "mean_token_accuracy": 0.7431640774011612, "num_tokens": 4025490.0, "step": 108 }, { "entropy": 0.6258664429187775, "epoch": 0.7072181670721817, "grad_norm": 0.012130603194236755, "learning_rate": 0.0002, "loss": 0.628970742225647, "mean_token_accuracy": 0.7431703954935074, "num_tokens": 4062925.0, "step": 109 }, { "entropy": 0.6371812373399734, "epoch": 0.7137064071370641, "grad_norm": 0.01057880837470293, "learning_rate": 0.0002, "loss": 0.6419240236282349, "mean_token_accuracy": 0.7392893806099892, "num_tokens": 4100176.0, "step": 110 }, { "entropy": 0.6297428086400032, "epoch": 0.7201946472019465, "grad_norm": 0.01054214034229517, "learning_rate": 0.0002, "loss": 0.6334270238876343, "mean_token_accuracy": 0.7451630085706711, "num_tokens": 4137649.0, "step": 111 }, { "entropy": 0.6174112483859062, "epoch": 0.7266828872668288, "grad_norm": 0.01192370243370533, "learning_rate": 0.0002, "loss": 0.6196002960205078, "mean_token_accuracy": 0.748643770813942, "num_tokens": 4174992.0, "step": 112 }, { "entropy": 0.6409988701343536, "epoch": 0.7331711273317113, "grad_norm": 0.012110228650271893, "learning_rate": 0.0002, "loss": 0.6420451402664185, "mean_token_accuracy": 0.7404038235545158, "num_tokens": 4212392.0, "step": 113 }, { "entropy": 0.6189580634236336, "epoch": 0.7396593673965937, "grad_norm": 0.010546376928687096, "learning_rate": 0.0002, "loss": 0.6227763891220093, "mean_token_accuracy": 0.7471738830208778, "num_tokens": 4249387.0, "step": 114 }, { "entropy": 0.6477556005120277, "epoch": 0.7461476074614761, "grad_norm": 0.012936307117342949, "learning_rate": 0.0002, "loss": 0.6444486379623413, "mean_token_accuracy": 0.7407133355736732, "num_tokens": 4286813.0, "step": 115 }, { "entropy": 0.6388062611222267, "epoch": 0.7526358475263585, "grad_norm": 0.011020737700164318, "learning_rate": 0.0002, "loss": 0.6358926892280579, "mean_token_accuracy": 0.7421080470085144, "num_tokens": 4324068.0, "step": 116 }, { "entropy": 0.623978279531002, "epoch": 0.7591240875912408, "grad_norm": 0.011272276751697063, "learning_rate": 0.0002, "loss": 0.6239657402038574, "mean_token_accuracy": 0.7491330280900002, "num_tokens": 4361117.0, "step": 117 }, { "entropy": 0.6343322321772575, "epoch": 0.7656123276561233, "grad_norm": 0.011995693668723106, "learning_rate": 0.0002, "loss": 0.635836124420166, "mean_token_accuracy": 0.7406070083379745, "num_tokens": 4398800.0, "step": 118 }, { "entropy": 0.6236653178930283, "epoch": 0.7721005677210057, "grad_norm": 0.012621116824448109, "learning_rate": 0.0002, "loss": 0.6293167471885681, "mean_token_accuracy": 0.7453652620315552, "num_tokens": 4435941.0, "step": 119 }, { "entropy": 0.6156119927763939, "epoch": 0.7785888077858881, "grad_norm": 0.010849852114915848, "learning_rate": 0.0002, "loss": 0.619170069694519, "mean_token_accuracy": 0.7481161803007126, "num_tokens": 4473532.0, "step": 120 }, { "entropy": 0.6325643733143806, "epoch": 0.7850770478507705, "grad_norm": 0.012033924460411072, "learning_rate": 0.0002, "loss": 0.6320570707321167, "mean_token_accuracy": 0.745756022632122, "num_tokens": 4510663.0, "step": 121 }, { "entropy": 0.6439174935221672, "epoch": 0.7915652879156528, "grad_norm": 0.011160428635776043, "learning_rate": 0.0002, "loss": 0.6456828117370605, "mean_token_accuracy": 0.7372104227542877, "num_tokens": 4548366.0, "step": 122 }, { "entropy": 0.614606499671936, "epoch": 0.7980535279805353, "grad_norm": 0.012264038436114788, "learning_rate": 0.0002, "loss": 0.6181074976921082, "mean_token_accuracy": 0.7488836497068405, "num_tokens": 4585220.0, "step": 123 }, { "entropy": 0.6238071173429489, "epoch": 0.8045417680454177, "grad_norm": 0.010948721319437027, "learning_rate": 0.0002, "loss": 0.6282123327255249, "mean_token_accuracy": 0.7447341307997704, "num_tokens": 4622594.0, "step": 124 }, { "entropy": 0.6207244768738747, "epoch": 0.8110300081103001, "grad_norm": 0.011111956089735031, "learning_rate": 0.0002, "loss": 0.6224273443222046, "mean_token_accuracy": 0.748368538916111, "num_tokens": 4659890.0, "step": 125 }, { "entropy": 0.6334651708602905, "epoch": 0.8175182481751825, "grad_norm": 0.01036700326949358, "learning_rate": 0.0002, "loss": 0.6354086399078369, "mean_token_accuracy": 0.742103323340416, "num_tokens": 4697214.0, "step": 126 }, { "entropy": 0.6321412995457649, "epoch": 0.8240064882400648, "grad_norm": 0.011659913696348667, "learning_rate": 0.0002, "loss": 0.632038950920105, "mean_token_accuracy": 0.7430339977145195, "num_tokens": 4734306.0, "step": 127 }, { "entropy": 0.6252134963870049, "epoch": 0.8304947283049473, "grad_norm": 0.010766416788101196, "learning_rate": 0.0002, "loss": 0.6210082173347473, "mean_token_accuracy": 0.747887596487999, "num_tokens": 4772005.0, "step": 128 }, { "entropy": 0.632231742143631, "epoch": 0.8369829683698297, "grad_norm": 0.009685291908681393, "learning_rate": 0.0002, "loss": 0.6338882446289062, "mean_token_accuracy": 0.7436560764908791, "num_tokens": 4809261.0, "step": 129 }, { "entropy": 0.6244007870554924, "epoch": 0.8434712084347121, "grad_norm": 0.011300327256321907, "learning_rate": 0.0002, "loss": 0.6297156810760498, "mean_token_accuracy": 0.7441424131393433, "num_tokens": 4846773.0, "step": 130 }, { "entropy": 0.6212883591651917, "epoch": 0.8499594484995945, "grad_norm": 0.011122049763798714, "learning_rate": 0.0002, "loss": 0.6272852420806885, "mean_token_accuracy": 0.745480865240097, "num_tokens": 4884087.0, "step": 131 }, { "entropy": 0.6275059729814529, "epoch": 0.8564476885644768, "grad_norm": 0.011759513057768345, "learning_rate": 0.0002, "loss": 0.6352666020393372, "mean_token_accuracy": 0.741997979581356, "num_tokens": 4921034.0, "step": 132 }, { "entropy": 0.6292549446225166, "epoch": 0.8629359286293593, "grad_norm": 0.010103589855134487, "learning_rate": 0.0002, "loss": 0.6285660862922668, "mean_token_accuracy": 0.7458189874887466, "num_tokens": 4958394.0, "step": 133 }, { "entropy": 0.6254143863916397, "epoch": 0.8694241686942417, "grad_norm": 0.009165394119918346, "learning_rate": 0.0002, "loss": 0.6281845569610596, "mean_token_accuracy": 0.7441290989518166, "num_tokens": 4995560.0, "step": 134 }, { "entropy": 0.6326478272676468, "epoch": 0.8759124087591241, "grad_norm": 0.009857391007244587, "learning_rate": 0.0002, "loss": 0.6341642141342163, "mean_token_accuracy": 0.7431726306676865, "num_tokens": 5032908.0, "step": 135 }, { "entropy": 0.6411951705813408, "epoch": 0.8824006488240065, "grad_norm": 0.009912555105984211, "learning_rate": 0.0002, "loss": 0.6402624845504761, "mean_token_accuracy": 0.7418247908353806, "num_tokens": 5070353.0, "step": 136 }, { "entropy": 0.6335436180233955, "epoch": 0.8888888888888888, "grad_norm": 0.010203655809164047, "learning_rate": 0.0002, "loss": 0.6348065137863159, "mean_token_accuracy": 0.7417963817715645, "num_tokens": 5107488.0, "step": 137 }, { "entropy": 0.6298110708594322, "epoch": 0.8953771289537713, "grad_norm": 0.009738304652273655, "learning_rate": 0.0002, "loss": 0.6292046904563904, "mean_token_accuracy": 0.7428107112646103, "num_tokens": 5144774.0, "step": 138 }, { "entropy": 0.621233694255352, "epoch": 0.9018653690186537, "grad_norm": 0.009310460649430752, "learning_rate": 0.0002, "loss": 0.6167433261871338, "mean_token_accuracy": 0.7501207813620567, "num_tokens": 5181712.0, "step": 139 }, { "entropy": 0.6066861748695374, "epoch": 0.9083536090835361, "grad_norm": 0.010622376576066017, "learning_rate": 0.0002, "loss": 0.6090973615646362, "mean_token_accuracy": 0.7524907812476158, "num_tokens": 5219096.0, "step": 140 }, { "entropy": 0.6264965310692787, "epoch": 0.9148418491484185, "grad_norm": 0.011424071155488491, "learning_rate": 0.0002, "loss": 0.6337799429893494, "mean_token_accuracy": 0.7431259453296661, "num_tokens": 5256221.0, "step": 141 }, { "entropy": 0.6391952782869339, "epoch": 0.9213300892133008, "grad_norm": 0.009158595465123653, "learning_rate": 0.0002, "loss": 0.6384302973747253, "mean_token_accuracy": 0.7389715909957886, "num_tokens": 5293696.0, "step": 142 }, { "entropy": 0.6427849903702736, "epoch": 0.9278183292781833, "grad_norm": 0.011200455017387867, "learning_rate": 0.0002, "loss": 0.6386270523071289, "mean_token_accuracy": 0.7409881576895714, "num_tokens": 5330767.0, "step": 143 }, { "entropy": 0.6417384147644043, "epoch": 0.9343065693430657, "grad_norm": 0.010727403685450554, "learning_rate": 0.0002, "loss": 0.63932865858078, "mean_token_accuracy": 0.7433461174368858, "num_tokens": 5368288.0, "step": 144 }, { "entropy": 0.6349349692463875, "epoch": 0.9407948094079481, "grad_norm": 0.01087568886578083, "learning_rate": 0.0002, "loss": 0.6332679986953735, "mean_token_accuracy": 0.7431394383311272, "num_tokens": 5405743.0, "step": 145 }, { "entropy": 0.6268604248762131, "epoch": 0.9472830494728305, "grad_norm": 0.009905870072543621, "learning_rate": 0.0002, "loss": 0.6278096437454224, "mean_token_accuracy": 0.7460607141256332, "num_tokens": 5442824.0, "step": 146 }, { "entropy": 0.6252990365028381, "epoch": 0.9537712895377128, "grad_norm": 0.011337473057210445, "learning_rate": 0.0002, "loss": 0.6313953399658203, "mean_token_accuracy": 0.7449029609560966, "num_tokens": 5480060.0, "step": 147 }, { "entropy": 0.6279519572854042, "epoch": 0.9602595296025953, "grad_norm": 0.011046580970287323, "learning_rate": 0.0002, "loss": 0.6361185312271118, "mean_token_accuracy": 0.7435570135712624, "num_tokens": 5517276.0, "step": 148 }, { "entropy": 0.6244647055864334, "epoch": 0.9667477696674777, "grad_norm": 0.010344677604734898, "learning_rate": 0.0002, "loss": 0.6286739110946655, "mean_token_accuracy": 0.7459346577525139, "num_tokens": 5554772.0, "step": 149 }, { "entropy": 0.625552199780941, "epoch": 0.9732360097323601, "grad_norm": 0.010485424660146236, "learning_rate": 0.0002, "loss": 0.6246562600135803, "mean_token_accuracy": 0.7459065243601799, "num_tokens": 5592235.0, "step": 150 }, { "entropy": 0.650402158498764, "epoch": 0.9797242497972425, "grad_norm": 0.01180343609303236, "learning_rate": 0.0002, "loss": 0.6489013433456421, "mean_token_accuracy": 0.7372798472642899, "num_tokens": 5629879.0, "step": 151 }, { "entropy": 0.625130906701088, "epoch": 0.986212489862125, "grad_norm": 0.010784060694277287, "learning_rate": 0.0002, "loss": 0.6217543482780457, "mean_token_accuracy": 0.7487893849611282, "num_tokens": 5667174.0, "step": 152 }, { "entropy": 0.6295798048377037, "epoch": 0.9927007299270073, "grad_norm": 0.00907177198678255, "learning_rate": 0.0002, "loss": 0.6333097219467163, "mean_token_accuracy": 0.7429074198007584, "num_tokens": 5704388.0, "step": 153 }, { "entropy": 0.6149610579013824, "epoch": 0.9991889699918897, "grad_norm": 0.010923929512500763, "learning_rate": 0.0002, "loss": 0.6188989877700806, "mean_token_accuracy": 0.7496026828885078, "num_tokens": 5741236.0, "step": 154 }, { "entropy": 0.6364340782165527, "epoch": 1.0, "grad_norm": 0.023092100396752357, "learning_rate": 0.0002, "loss": 0.6314291954040527, "mean_token_accuracy": 0.7433016300201416, "num_tokens": 5745896.0, "step": 155 }, { "entropy": 0.6255532875657082, "epoch": 1.0064882400648825, "grad_norm": 0.010001299902796745, "learning_rate": 0.0002, "loss": 0.6274809837341309, "mean_token_accuracy": 0.7447079941630363, "num_tokens": 5782887.0, "step": 156 }, { "entropy": 0.6249469369649887, "epoch": 1.0129764801297647, "grad_norm": 0.010014750063419342, "learning_rate": 0.0002, "loss": 0.6293044090270996, "mean_token_accuracy": 0.743991531431675, "num_tokens": 5820452.0, "step": 157 }, { "entropy": 0.6250087693333626, "epoch": 1.0194647201946472, "grad_norm": 0.009554821066558361, "learning_rate": 0.0002, "loss": 0.6216879487037659, "mean_token_accuracy": 0.7472942620515823, "num_tokens": 5857511.0, "step": 158 }, { "entropy": 0.6345709040760994, "epoch": 1.0259529602595296, "grad_norm": 0.010529364459216595, "learning_rate": 0.0002, "loss": 0.6336644887924194, "mean_token_accuracy": 0.7428694814443588, "num_tokens": 5895426.0, "step": 159 }, { "entropy": 0.6269640624523163, "epoch": 1.0324412003244121, "grad_norm": 0.010084465146064758, "learning_rate": 0.0002, "loss": 0.6298044919967651, "mean_token_accuracy": 0.7432648167014122, "num_tokens": 5932788.0, "step": 160 }, { "entropy": 0.6268706321716309, "epoch": 1.0389294403892944, "grad_norm": 0.009462922811508179, "learning_rate": 0.0002, "loss": 0.6329535245895386, "mean_token_accuracy": 0.7419963404536247, "num_tokens": 5970211.0, "step": 161 }, { "entropy": 0.6167154312133789, "epoch": 1.0454176804541768, "grad_norm": 0.009687564335763454, "learning_rate": 0.0002, "loss": 0.6214160919189453, "mean_token_accuracy": 0.7477982342243195, "num_tokens": 6007676.0, "step": 162 }, { "entropy": 0.6232415363192558, "epoch": 1.0519059205190593, "grad_norm": 0.011512194760143757, "learning_rate": 0.0002, "loss": 0.6291061639785767, "mean_token_accuracy": 0.743974357843399, "num_tokens": 6044881.0, "step": 163 }, { "entropy": 0.6384411826729774, "epoch": 1.0583941605839415, "grad_norm": 0.009664908982813358, "learning_rate": 0.0002, "loss": 0.6418322920799255, "mean_token_accuracy": 0.7393775209784508, "num_tokens": 6081959.0, "step": 164 }, { "entropy": 0.6312756985425949, "epoch": 1.064882400648824, "grad_norm": 0.009909010492265224, "learning_rate": 0.0002, "loss": 0.6294491291046143, "mean_token_accuracy": 0.7447398081421852, "num_tokens": 6119502.0, "step": 165 }, { "entropy": 0.6399073377251625, "epoch": 1.0713706407137065, "grad_norm": 0.009380994364619255, "learning_rate": 0.0002, "loss": 0.6359134912490845, "mean_token_accuracy": 0.7427374646067619, "num_tokens": 6157187.0, "step": 166 }, { "entropy": 0.6151667386293411, "epoch": 1.0778588807785887, "grad_norm": 0.008555393666028976, "learning_rate": 0.0002, "loss": 0.6155805587768555, "mean_token_accuracy": 0.7496763169765472, "num_tokens": 6194222.0, "step": 167 }, { "entropy": 0.6240349486470222, "epoch": 1.0843471208434712, "grad_norm": 0.008739444427192211, "learning_rate": 0.0002, "loss": 0.6246569156646729, "mean_token_accuracy": 0.7454928457736969, "num_tokens": 6231423.0, "step": 168 }, { "entropy": 0.6332473009824753, "epoch": 1.0908353609083536, "grad_norm": 0.009752689860761166, "learning_rate": 0.0002, "loss": 0.6364842653274536, "mean_token_accuracy": 0.7410347387194633, "num_tokens": 6268835.0, "step": 169 }, { "entropy": 0.6179100349545479, "epoch": 1.0973236009732361, "grad_norm": 0.010130702517926693, "learning_rate": 0.0002, "loss": 0.6235646605491638, "mean_token_accuracy": 0.7480539605021477, "num_tokens": 6306169.0, "step": 170 }, { "entropy": 0.6232842579483986, "epoch": 1.1038118410381184, "grad_norm": 0.00973625760525465, "learning_rate": 0.0002, "loss": 0.6288238763809204, "mean_token_accuracy": 0.7431181073188782, "num_tokens": 6343047.0, "step": 171 }, { "entropy": 0.6252638548612595, "epoch": 1.1103000811030008, "grad_norm": 0.009265839122235775, "learning_rate": 0.0002, "loss": 0.6260301470756531, "mean_token_accuracy": 0.7449894994497299, "num_tokens": 6380248.0, "step": 172 }, { "entropy": 0.6273873671889305, "epoch": 1.1167883211678833, "grad_norm": 0.009544978849589825, "learning_rate": 0.0002, "loss": 0.624110996723175, "mean_token_accuracy": 0.7455884218215942, "num_tokens": 6417799.0, "step": 173 }, { "entropy": 0.6261554434895515, "epoch": 1.1232765612327655, "grad_norm": 0.009425261989235878, "learning_rate": 0.0002, "loss": 0.6238696575164795, "mean_token_accuracy": 0.747870922088623, "num_tokens": 6454969.0, "step": 174 }, { "entropy": 0.6361829712986946, "epoch": 1.129764801297648, "grad_norm": 0.009325449354946613, "learning_rate": 0.0002, "loss": 0.6336718201637268, "mean_token_accuracy": 0.7412231788039207, "num_tokens": 6493115.0, "step": 175 }, { "entropy": 0.626146711409092, "epoch": 1.1362530413625305, "grad_norm": 0.010177000425755978, "learning_rate": 0.0002, "loss": 0.6264243125915527, "mean_token_accuracy": 0.7452349737286568, "num_tokens": 6530141.0, "step": 176 }, { "entropy": 0.620332308113575, "epoch": 1.142741281427413, "grad_norm": 0.010463408194482327, "learning_rate": 0.0002, "loss": 0.6263006329536438, "mean_token_accuracy": 0.7455399706959724, "num_tokens": 6567506.0, "step": 177 }, { "entropy": 0.6137627214193344, "epoch": 1.1492295214922952, "grad_norm": 0.011479280889034271, "learning_rate": 0.0002, "loss": 0.6208648681640625, "mean_token_accuracy": 0.7491373345255852, "num_tokens": 6604409.0, "step": 178 }, { "entropy": 0.6161536052823067, "epoch": 1.1557177615571776, "grad_norm": 0.010295857675373554, "learning_rate": 0.0002, "loss": 0.6196001768112183, "mean_token_accuracy": 0.7471510693430901, "num_tokens": 6641779.0, "step": 179 }, { "entropy": 0.615701287984848, "epoch": 1.1622060016220601, "grad_norm": 0.00977401528507471, "learning_rate": 0.0002, "loss": 0.6152433156967163, "mean_token_accuracy": 0.7513743862509727, "num_tokens": 6678811.0, "step": 180 }, { "entropy": 0.6276117786765099, "epoch": 1.1686942416869424, "grad_norm": 0.009978534653782845, "learning_rate": 0.0002, "loss": 0.6257454752922058, "mean_token_accuracy": 0.7457039654254913, "num_tokens": 6715971.0, "step": 181 }, { "entropy": 0.622728981077671, "epoch": 1.1751824817518248, "grad_norm": 0.010105178691446781, "learning_rate": 0.0002, "loss": 0.6200466156005859, "mean_token_accuracy": 0.7463524416089058, "num_tokens": 6753100.0, "step": 182 }, { "entropy": 0.6278671473264694, "epoch": 1.1816707218167073, "grad_norm": 0.00981152057647705, "learning_rate": 0.0002, "loss": 0.629209041595459, "mean_token_accuracy": 0.7440850958228111, "num_tokens": 6790606.0, "step": 183 }, { "entropy": 0.6340474411845207, "epoch": 1.1881589618815895, "grad_norm": 0.010966816917061806, "learning_rate": 0.0002, "loss": 0.6343464851379395, "mean_token_accuracy": 0.7423162013292313, "num_tokens": 6827773.0, "step": 184 }, { "entropy": 0.627871498465538, "epoch": 1.194647201946472, "grad_norm": 0.01046378631144762, "learning_rate": 0.0002, "loss": 0.6280568838119507, "mean_token_accuracy": 0.7452474683523178, "num_tokens": 6865004.0, "step": 185 }, { "entropy": 0.632583849132061, "epoch": 1.2011354420113545, "grad_norm": 0.011151660233736038, "learning_rate": 0.0002, "loss": 0.6399388313293457, "mean_token_accuracy": 0.7401903197169304, "num_tokens": 6902199.0, "step": 186 }, { "entropy": 0.6207470819354057, "epoch": 1.2076236820762367, "grad_norm": 0.009539226070046425, "learning_rate": 0.0002, "loss": 0.626314640045166, "mean_token_accuracy": 0.7447792664170265, "num_tokens": 6939345.0, "step": 187 }, { "entropy": 0.6265325620770454, "epoch": 1.2141119221411192, "grad_norm": 0.010582523420453072, "learning_rate": 0.0002, "loss": 0.6258584260940552, "mean_token_accuracy": 0.7450206950306892, "num_tokens": 6976749.0, "step": 188 }, { "entropy": 0.6242929175496101, "epoch": 1.2206001622060016, "grad_norm": 0.010438770987093449, "learning_rate": 0.0002, "loss": 0.6282113790512085, "mean_token_accuracy": 0.7453068420290947, "num_tokens": 7013986.0, "step": 189 }, { "entropy": 0.6362300962209702, "epoch": 1.2270884022708841, "grad_norm": 0.009592331014573574, "learning_rate": 0.0002, "loss": 0.6338801980018616, "mean_token_accuracy": 0.7425767108798027, "num_tokens": 7051122.0, "step": 190 }, { "entropy": 0.6142800450325012, "epoch": 1.2335766423357664, "grad_norm": 0.008985689841210842, "learning_rate": 0.0002, "loss": 0.6143558025360107, "mean_token_accuracy": 0.750966027379036, "num_tokens": 7088050.0, "step": 191 }, { "entropy": 0.6302971392869949, "epoch": 1.2400648824006488, "grad_norm": 0.009001200087368488, "learning_rate": 0.0002, "loss": 0.6324248313903809, "mean_token_accuracy": 0.7426666542887688, "num_tokens": 7125652.0, "step": 192 }, { "entropy": 0.6278156340122223, "epoch": 1.2465531224655313, "grad_norm": 0.009873399510979652, "learning_rate": 0.0002, "loss": 0.6288595795631409, "mean_token_accuracy": 0.7446199506521225, "num_tokens": 7163209.0, "step": 193 }, { "entropy": 0.6151107102632523, "epoch": 1.2530413625304138, "grad_norm": 0.010955240577459335, "learning_rate": 0.0002, "loss": 0.6196198463439941, "mean_token_accuracy": 0.7487600594758987, "num_tokens": 7200676.0, "step": 194 }, { "entropy": 0.624420776963234, "epoch": 1.259529602595296, "grad_norm": 0.009569366462528706, "learning_rate": 0.0002, "loss": 0.6245594024658203, "mean_token_accuracy": 0.7455159053206444, "num_tokens": 7237914.0, "step": 195 }, { "entropy": 0.62844218313694, "epoch": 1.2660178426601785, "grad_norm": 0.00903658103197813, "learning_rate": 0.0002, "loss": 0.6268140077590942, "mean_token_accuracy": 0.7442804053425789, "num_tokens": 7275515.0, "step": 196 }, { "entropy": 0.6202637255191803, "epoch": 1.272506082725061, "grad_norm": 0.00881174299865961, "learning_rate": 0.0002, "loss": 0.6185364723205566, "mean_token_accuracy": 0.7477486506104469, "num_tokens": 7313158.0, "step": 197 }, { "entropy": 0.6143034398555756, "epoch": 1.2789943227899432, "grad_norm": 0.010709850117564201, "learning_rate": 0.0002, "loss": 0.6169742345809937, "mean_token_accuracy": 0.7487710192799568, "num_tokens": 7350030.0, "step": 198 }, { "entropy": 0.6223605200648308, "epoch": 1.2854825628548256, "grad_norm": 0.010480264201760292, "learning_rate": 0.0002, "loss": 0.6294817924499512, "mean_token_accuracy": 0.7423868179321289, "num_tokens": 7387006.0, "step": 199 }, { "entropy": 0.6272002533078194, "epoch": 1.2919708029197081, "grad_norm": 0.009464031085371971, "learning_rate": 0.0002, "loss": 0.6319963932037354, "mean_token_accuracy": 0.7425662279129028, "num_tokens": 7424425.0, "step": 200 }, { "entropy": 0.6301053911447525, "epoch": 1.2984590429845904, "grad_norm": 0.009957416914403439, "learning_rate": 0.0002, "loss": 0.6337630748748779, "mean_token_accuracy": 0.7440446689724922, "num_tokens": 7461695.0, "step": 201 }, { "entropy": 0.6238225474953651, "epoch": 1.3049472830494728, "grad_norm": 0.00954597070813179, "learning_rate": 0.0002, "loss": 0.6226916909217834, "mean_token_accuracy": 0.7449641600251198, "num_tokens": 7498774.0, "step": 202 }, { "entropy": 0.630424328148365, "epoch": 1.3114355231143553, "grad_norm": 0.0086854612454772, "learning_rate": 0.0002, "loss": 0.6267648935317993, "mean_token_accuracy": 0.745999850332737, "num_tokens": 7535974.0, "step": 203 }, { "entropy": 0.6177534386515617, "epoch": 1.3179237631792375, "grad_norm": 0.009849452413618565, "learning_rate": 0.0002, "loss": 0.6153725385665894, "mean_token_accuracy": 0.7507055774331093, "num_tokens": 7572957.0, "step": 204 }, { "entropy": 0.622411735355854, "epoch": 1.32441200324412, "grad_norm": 0.009472545236349106, "learning_rate": 0.0002, "loss": 0.625112771987915, "mean_token_accuracy": 0.7435147687792778, "num_tokens": 7610380.0, "step": 205 }, { "entropy": 0.6200075596570969, "epoch": 1.3309002433090025, "grad_norm": 0.010570540092885494, "learning_rate": 0.0002, "loss": 0.6272220611572266, "mean_token_accuracy": 0.7441560178995132, "num_tokens": 7647843.0, "step": 206 }, { "entropy": 0.6281143799424171, "epoch": 1.3373884833738847, "grad_norm": 0.008813613094389439, "learning_rate": 0.0002, "loss": 0.6328994631767273, "mean_token_accuracy": 0.742665521800518, "num_tokens": 7685138.0, "step": 207 }, { "entropy": 0.6417431458830833, "epoch": 1.3438767234387672, "grad_norm": 0.00971722137182951, "learning_rate": 0.0002, "loss": 0.6397589445114136, "mean_token_accuracy": 0.7406186908483505, "num_tokens": 7722781.0, "step": 208 }, { "entropy": 0.6444113031029701, "epoch": 1.3503649635036497, "grad_norm": 0.009866150096058846, "learning_rate": 0.0002, "loss": 0.6412906646728516, "mean_token_accuracy": 0.7412897050380707, "num_tokens": 7760109.0, "step": 209 }, { "entropy": 0.6214337572455406, "epoch": 1.3568532035685321, "grad_norm": 0.009207811206579208, "learning_rate": 0.0002, "loss": 0.6234208345413208, "mean_token_accuracy": 0.7459528893232346, "num_tokens": 7797532.0, "step": 210 }, { "entropy": 0.6157770529389381, "epoch": 1.3633414436334144, "grad_norm": 0.01025467086583376, "learning_rate": 0.0002, "loss": 0.6178190112113953, "mean_token_accuracy": 0.7505671828985214, "num_tokens": 7834554.0, "step": 211 }, { "entropy": 0.619218721985817, "epoch": 1.3698296836982968, "grad_norm": 0.01020651962608099, "learning_rate": 0.0002, "loss": 0.6230384111404419, "mean_token_accuracy": 0.7464535236358643, "num_tokens": 7871899.0, "step": 212 }, { "entropy": 0.6242957413196564, "epoch": 1.3763179237631793, "grad_norm": 0.009102249518036842, "learning_rate": 0.0002, "loss": 0.625146210193634, "mean_token_accuracy": 0.7436935156583786, "num_tokens": 7908550.0, "step": 213 }, { "entropy": 0.6318832859396935, "epoch": 1.3828061638280618, "grad_norm": 0.008958768099546432, "learning_rate": 0.0002, "loss": 0.6291754245758057, "mean_token_accuracy": 0.7419761046767235, "num_tokens": 7945528.0, "step": 214 }, { "entropy": 0.622461624443531, "epoch": 1.389294403892944, "grad_norm": 0.010115247219800949, "learning_rate": 0.0002, "loss": 0.6236110329627991, "mean_token_accuracy": 0.7462903261184692, "num_tokens": 7982511.0, "step": 215 }, { "entropy": 0.6254477724432945, "epoch": 1.3957826439578265, "grad_norm": 0.008989102207124233, "learning_rate": 0.0002, "loss": 0.6284307241439819, "mean_token_accuracy": 0.7429582253098488, "num_tokens": 8019795.0, "step": 216 }, { "entropy": 0.6165763810276985, "epoch": 1.402270884022709, "grad_norm": 0.010876733809709549, "learning_rate": 0.0002, "loss": 0.6224349737167358, "mean_token_accuracy": 0.7477402463555336, "num_tokens": 8057519.0, "step": 217 }, { "entropy": 0.6111054793000221, "epoch": 1.4087591240875912, "grad_norm": 0.008845480158925056, "learning_rate": 0.0002, "loss": 0.6134991645812988, "mean_token_accuracy": 0.7499867528676987, "num_tokens": 8094863.0, "step": 218 }, { "entropy": 0.6361298933625221, "epoch": 1.4152473641524737, "grad_norm": 0.009090340696275234, "learning_rate": 0.0002, "loss": 0.6369084715843201, "mean_token_accuracy": 0.7387163192033768, "num_tokens": 8132597.0, "step": 219 }, { "entropy": 0.6406821832060814, "epoch": 1.4217356042173561, "grad_norm": 0.0092760706320405, "learning_rate": 0.0002, "loss": 0.6413878202438354, "mean_token_accuracy": 0.7377218827605247, "num_tokens": 8170263.0, "step": 220 }, { "entropy": 0.6221970841288567, "epoch": 1.4282238442822384, "grad_norm": 0.009138553403317928, "learning_rate": 0.0002, "loss": 0.6239045858383179, "mean_token_accuracy": 0.7459966242313385, "num_tokens": 8207517.0, "step": 221 }, { "entropy": 0.6360906660556793, "epoch": 1.4347120843471208, "grad_norm": 0.008928137831389904, "learning_rate": 0.0002, "loss": 0.6395260095596313, "mean_token_accuracy": 0.7385511174798012, "num_tokens": 8244836.0, "step": 222 }, { "entropy": 0.6243730783462524, "epoch": 1.4412003244120033, "grad_norm": 0.009026050567626953, "learning_rate": 0.0002, "loss": 0.6269445419311523, "mean_token_accuracy": 0.7457072138786316, "num_tokens": 8281919.0, "step": 223 }, { "entropy": 0.6337901726365089, "epoch": 1.4476885644768855, "grad_norm": 0.00801246426999569, "learning_rate": 0.0002, "loss": 0.6330679059028625, "mean_token_accuracy": 0.7426828071475029, "num_tokens": 8319228.0, "step": 224 }, { "entropy": 0.631360612809658, "epoch": 1.454176804541768, "grad_norm": 0.009467655792832375, "learning_rate": 0.0002, "loss": 0.6300734281539917, "mean_token_accuracy": 0.7453820630908012, "num_tokens": 8356483.0, "step": 225 }, { "entropy": 0.6360229924321175, "epoch": 1.4606650446066505, "grad_norm": 0.009358935989439487, "learning_rate": 0.0002, "loss": 0.6341854929924011, "mean_token_accuracy": 0.7435640841722488, "num_tokens": 8393723.0, "step": 226 }, { "entropy": 0.6200751587748528, "epoch": 1.4671532846715327, "grad_norm": 0.008350496180355549, "learning_rate": 0.0002, "loss": 0.6218277215957642, "mean_token_accuracy": 0.7479682192206383, "num_tokens": 8431281.0, "step": 227 }, { "entropy": 0.6275244578719139, "epoch": 1.4736415247364152, "grad_norm": 0.009802248328924179, "learning_rate": 0.0002, "loss": 0.6335194706916809, "mean_token_accuracy": 0.7433927357196808, "num_tokens": 8468465.0, "step": 228 }, { "entropy": 0.6231343746185303, "epoch": 1.4801297648012977, "grad_norm": 0.010109310038387775, "learning_rate": 0.0002, "loss": 0.6223199367523193, "mean_token_accuracy": 0.7451789528131485, "num_tokens": 8505713.0, "step": 229 }, { "entropy": 0.6206792145967484, "epoch": 1.4866180048661801, "grad_norm": 0.010297620669007301, "learning_rate": 0.0002, "loss": 0.6225035190582275, "mean_token_accuracy": 0.7460876628756523, "num_tokens": 8542783.0, "step": 230 }, { "entropy": 0.6291577965021133, "epoch": 1.4931062449310626, "grad_norm": 0.009544001892209053, "learning_rate": 0.0002, "loss": 0.6289199590682983, "mean_token_accuracy": 0.7454885393381119, "num_tokens": 8580029.0, "step": 231 }, { "entropy": 0.6250879839062691, "epoch": 1.4995944849959448, "grad_norm": 0.008444451726973057, "learning_rate": 0.0002, "loss": 0.628132700920105, "mean_token_accuracy": 0.7435998693108559, "num_tokens": 8617067.0, "step": 232 }, { "entropy": 0.6236734315752983, "epoch": 1.5060827250608273, "grad_norm": 0.009344187565147877, "learning_rate": 0.0002, "loss": 0.6258345246315002, "mean_token_accuracy": 0.7458996251225471, "num_tokens": 8654420.0, "step": 233 }, { "entropy": 0.6138928905129433, "epoch": 1.5125709651257098, "grad_norm": 0.009892390109598637, "learning_rate": 0.0002, "loss": 0.6232701539993286, "mean_token_accuracy": 0.7446143329143524, "num_tokens": 8691786.0, "step": 234 }, { "entropy": 0.6233969107270241, "epoch": 1.519059205190592, "grad_norm": 0.010160520672798157, "learning_rate": 0.0002, "loss": 0.6211707592010498, "mean_token_accuracy": 0.7472252398729324, "num_tokens": 8729028.0, "step": 235 }, { "entropy": 0.6429286673665047, "epoch": 1.5255474452554745, "grad_norm": 0.0098539674654603, "learning_rate": 0.0002, "loss": 0.6372069120407104, "mean_token_accuracy": 0.7402112632989883, "num_tokens": 8766503.0, "step": 236 }, { "entropy": 0.6305690258741379, "epoch": 1.532035685320357, "grad_norm": 0.009324081242084503, "learning_rate": 0.0002, "loss": 0.6331846714019775, "mean_token_accuracy": 0.7420341670513153, "num_tokens": 8803595.0, "step": 237 }, { "entropy": 0.6305363178253174, "epoch": 1.5385239253852392, "grad_norm": 0.009419843554496765, "learning_rate": 0.0002, "loss": 0.6305243968963623, "mean_token_accuracy": 0.7442135661840439, "num_tokens": 8840805.0, "step": 238 }, { "entropy": 0.6271083503961563, "epoch": 1.5450121654501217, "grad_norm": 0.008481448516249657, "learning_rate": 0.0002, "loss": 0.628629207611084, "mean_token_accuracy": 0.7426930069923401, "num_tokens": 8877765.0, "step": 239 }, { "entropy": 0.6074612811207771, "epoch": 1.5515004055150041, "grad_norm": 0.008962183259427547, "learning_rate": 0.0002, "loss": 0.6033654808998108, "mean_token_accuracy": 0.7540537416934967, "num_tokens": 8915298.0, "step": 240 }, { "entropy": 0.6332517638802528, "epoch": 1.5579886455798864, "grad_norm": 0.009697218425571918, "learning_rate": 0.0002, "loss": 0.6378505229949951, "mean_token_accuracy": 0.7404668927192688, "num_tokens": 8952480.0, "step": 241 }, { "entropy": 0.6220754161477089, "epoch": 1.5644768856447688, "grad_norm": 0.00962862279266119, "learning_rate": 0.0002, "loss": 0.6282638907432556, "mean_token_accuracy": 0.7437562346458435, "num_tokens": 8990098.0, "step": 242 }, { "entropy": 0.6257785856723785, "epoch": 1.5709651257096513, "grad_norm": 0.009893639013171196, "learning_rate": 0.0002, "loss": 0.6297152042388916, "mean_token_accuracy": 0.7440835684537888, "num_tokens": 9026984.0, "step": 243 }, { "entropy": 0.6254734173417091, "epoch": 1.5774533657745335, "grad_norm": 0.009527175687253475, "learning_rate": 0.0002, "loss": 0.62839674949646, "mean_token_accuracy": 0.7452434748411179, "num_tokens": 9064358.0, "step": 244 }, { "entropy": 0.6305152326822281, "epoch": 1.583941605839416, "grad_norm": 0.009316297248005867, "learning_rate": 0.0002, "loss": 0.6323485374450684, "mean_token_accuracy": 0.74256681650877, "num_tokens": 9101356.0, "step": 245 }, { "entropy": 0.6291619464755058, "epoch": 1.5904298459042985, "grad_norm": 0.008978272788226604, "learning_rate": 0.0002, "loss": 0.6273784637451172, "mean_token_accuracy": 0.7450171038508415, "num_tokens": 9138713.0, "step": 246 }, { "entropy": 0.6248873770236969, "epoch": 1.5969180859691807, "grad_norm": 0.00856445450335741, "learning_rate": 0.0002, "loss": 0.6265925168991089, "mean_token_accuracy": 0.7451888769865036, "num_tokens": 9175681.0, "step": 247 }, { "entropy": 0.6189131289720535, "epoch": 1.6034063260340634, "grad_norm": 0.00968277920037508, "learning_rate": 0.0002, "loss": 0.62480229139328, "mean_token_accuracy": 0.7459377571940422, "num_tokens": 9213377.0, "step": 248 }, { "entropy": 0.6176823750138283, "epoch": 1.6098945660989457, "grad_norm": 0.008562079630792141, "learning_rate": 0.0002, "loss": 0.6216596961021423, "mean_token_accuracy": 0.7459762021899223, "num_tokens": 9249919.0, "step": 249 }, { "entropy": 0.6210065707564354, "epoch": 1.616382806163828, "grad_norm": 0.009402911178767681, "learning_rate": 0.0002, "loss": 0.6242903470993042, "mean_token_accuracy": 0.7469801977276802, "num_tokens": 9287219.0, "step": 250 }, { "entropy": 0.6323156431317329, "epoch": 1.6228710462287106, "grad_norm": 0.009092130698263645, "learning_rate": 0.0002, "loss": 0.6306654810905457, "mean_token_accuracy": 0.7425123229622841, "num_tokens": 9324174.0, "step": 251 }, { "entropy": 0.6303895488381386, "epoch": 1.6293592862935928, "grad_norm": 0.009144228883087635, "learning_rate": 0.0002, "loss": 0.6268880367279053, "mean_token_accuracy": 0.7460083961486816, "num_tokens": 9361494.0, "step": 252 }, { "entropy": 0.6353992223739624, "epoch": 1.6358475263584753, "grad_norm": 0.00928189791738987, "learning_rate": 0.0002, "loss": 0.6352483034133911, "mean_token_accuracy": 0.7439208328723907, "num_tokens": 9398944.0, "step": 253 }, { "entropy": 0.6256071850657463, "epoch": 1.6423357664233578, "grad_norm": 0.008181072771549225, "learning_rate": 0.0002, "loss": 0.6292101144790649, "mean_token_accuracy": 0.743871308863163, "num_tokens": 9436011.0, "step": 254 }, { "entropy": 0.6333504095673561, "epoch": 1.64882400648824, "grad_norm": 0.009949415922164917, "learning_rate": 0.0002, "loss": 0.6347252130508423, "mean_token_accuracy": 0.7401739284396172, "num_tokens": 9473110.0, "step": 255 }, { "entropy": 0.6310138329863548, "epoch": 1.6553122465531225, "grad_norm": 0.00846829917281866, "learning_rate": 0.0002, "loss": 0.6339915990829468, "mean_token_accuracy": 0.7427053153514862, "num_tokens": 9510350.0, "step": 256 }, { "entropy": 0.6202550306916237, "epoch": 1.661800486618005, "grad_norm": 0.009316318668425083, "learning_rate": 0.0002, "loss": 0.6241627335548401, "mean_token_accuracy": 0.7441129460930824, "num_tokens": 9547581.0, "step": 257 }, { "entropy": 0.640548974275589, "epoch": 1.6682887266828872, "grad_norm": 0.008892681449651718, "learning_rate": 0.0002, "loss": 0.6457140445709229, "mean_token_accuracy": 0.736494742333889, "num_tokens": 9584913.0, "step": 258 }, { "entropy": 0.6206653639674187, "epoch": 1.6747769667477697, "grad_norm": 0.008709060959517956, "learning_rate": 0.0002, "loss": 0.6203189492225647, "mean_token_accuracy": 0.7498921826481819, "num_tokens": 9622351.0, "step": 259 }, { "entropy": 0.6282004490494728, "epoch": 1.6812652068126521, "grad_norm": 0.0090560931712389, "learning_rate": 0.0002, "loss": 0.6246728897094727, "mean_token_accuracy": 0.746510811150074, "num_tokens": 9659652.0, "step": 260 }, { "entropy": 0.6318396255373955, "epoch": 1.6877534468775344, "grad_norm": 0.007608218118548393, "learning_rate": 0.0002, "loss": 0.62848961353302, "mean_token_accuracy": 0.7440729290246964, "num_tokens": 9697284.0, "step": 261 }, { "entropy": 0.6200717613101006, "epoch": 1.6942416869424168, "grad_norm": 0.009493952617049217, "learning_rate": 0.0002, "loss": 0.6228904724121094, "mean_token_accuracy": 0.7480449378490448, "num_tokens": 9734627.0, "step": 262 }, { "entropy": 0.6331067234277725, "epoch": 1.7007299270072993, "grad_norm": 0.008472482673823833, "learning_rate": 0.0002, "loss": 0.6337133646011353, "mean_token_accuracy": 0.7426456362009048, "num_tokens": 9772063.0, "step": 263 }, { "entropy": 0.6172152981162071, "epoch": 1.7072181670721815, "grad_norm": 0.008520574308931828, "learning_rate": 0.0002, "loss": 0.6212704181671143, "mean_token_accuracy": 0.7456109151244164, "num_tokens": 9809281.0, "step": 264 }, { "entropy": 0.6255315691232681, "epoch": 1.7137064071370642, "grad_norm": 0.008351411670446396, "learning_rate": 0.0002, "loss": 0.6286416053771973, "mean_token_accuracy": 0.7446007430553436, "num_tokens": 9846539.0, "step": 265 }, { "entropy": 0.6238176673650742, "epoch": 1.7201946472019465, "grad_norm": 0.007990843616425991, "learning_rate": 0.0002, "loss": 0.6225998401641846, "mean_token_accuracy": 0.7458446845412254, "num_tokens": 9884004.0, "step": 266 }, { "entropy": 0.6216712817549706, "epoch": 1.7266828872668287, "grad_norm": 0.00867629423737526, "learning_rate": 0.0002, "loss": 0.6247957944869995, "mean_token_accuracy": 0.7463371530175209, "num_tokens": 9921115.0, "step": 267 }, { "entropy": 0.6401625499129295, "epoch": 1.7331711273317114, "grad_norm": 0.00958551187068224, "learning_rate": 0.0002, "loss": 0.6359888911247253, "mean_token_accuracy": 0.742260254919529, "num_tokens": 9958978.0, "step": 268 }, { "entropy": 0.6297059804201126, "epoch": 1.7396593673965937, "grad_norm": 0.009358945302665234, "learning_rate": 0.0002, "loss": 0.6260662078857422, "mean_token_accuracy": 0.7483563721179962, "num_tokens": 9996046.0, "step": 269 }, { "entropy": 0.6102557927370071, "epoch": 1.7461476074614761, "grad_norm": 0.008488922379910946, "learning_rate": 0.0002, "loss": 0.6104397773742676, "mean_token_accuracy": 0.7516083940863609, "num_tokens": 10033145.0, "step": 270 }, { "entropy": 0.6110394448041916, "epoch": 1.7526358475263586, "grad_norm": 0.009671971201896667, "learning_rate": 0.0002, "loss": 0.6171742081642151, "mean_token_accuracy": 0.7473302856087685, "num_tokens": 10070347.0, "step": 271 }, { "entropy": 0.6102030426263809, "epoch": 1.7591240875912408, "grad_norm": 0.01004206482321024, "learning_rate": 0.0002, "loss": 0.6197723746299744, "mean_token_accuracy": 0.7478247955441475, "num_tokens": 10107543.0, "step": 272 }, { "entropy": 0.6324944272637367, "epoch": 1.7656123276561233, "grad_norm": 0.008376670069992542, "learning_rate": 0.0002, "loss": 0.6334455609321594, "mean_token_accuracy": 0.7418324947357178, "num_tokens": 10144562.0, "step": 273 }, { "entropy": 0.6232613623142242, "epoch": 1.7721005677210058, "grad_norm": 0.009440955705940723, "learning_rate": 0.0002, "loss": 0.6198002099990845, "mean_token_accuracy": 0.750127449631691, "num_tokens": 10181837.0, "step": 274 }, { "entropy": 0.6218618527054787, "epoch": 1.778588807785888, "grad_norm": 0.008727550506591797, "learning_rate": 0.0002, "loss": 0.6228897571563721, "mean_token_accuracy": 0.7451170310378075, "num_tokens": 10218887.0, "step": 275 }, { "entropy": 0.6297050788998604, "epoch": 1.7850770478507705, "grad_norm": 0.008303189650177956, "learning_rate": 0.0002, "loss": 0.6325977444648743, "mean_token_accuracy": 0.7429015561938286, "num_tokens": 10256316.0, "step": 276 }, { "entropy": 0.6150370612740517, "epoch": 1.791565287915653, "grad_norm": 0.009460131637752056, "learning_rate": 0.0002, "loss": 0.6189665198326111, "mean_token_accuracy": 0.7513208463788033, "num_tokens": 10292958.0, "step": 277 }, { "entropy": 0.6380631476640701, "epoch": 1.7980535279805352, "grad_norm": 0.008382478728890419, "learning_rate": 0.0002, "loss": 0.6411799192428589, "mean_token_accuracy": 0.7389534488320351, "num_tokens": 10330143.0, "step": 278 }, { "entropy": 0.6122751757502556, "epoch": 1.8045417680454177, "grad_norm": 0.0077201686799526215, "learning_rate": 0.0002, "loss": 0.6154634356498718, "mean_token_accuracy": 0.7478373274207115, "num_tokens": 10367348.0, "step": 279 }, { "entropy": 0.6171681880950928, "epoch": 1.8110300081103001, "grad_norm": 0.014772728085517883, "learning_rate": 0.0002, "loss": 0.6175127625465393, "mean_token_accuracy": 0.7471248880028725, "num_tokens": 10404586.0, "step": 280 }, { "entropy": 0.6203941032290459, "epoch": 1.8175182481751824, "grad_norm": 0.00933381449431181, "learning_rate": 0.0002, "loss": 0.6234451532363892, "mean_token_accuracy": 0.7449408918619156, "num_tokens": 10441660.0, "step": 281 }, { "entropy": 0.6171698048710823, "epoch": 1.8240064882400648, "grad_norm": 0.02071473002433777, "learning_rate": 0.0002, "loss": 0.6131167411804199, "mean_token_accuracy": 0.7504094913601875, "num_tokens": 10478740.0, "step": 282 }, { "entropy": 0.6204886436462402, "epoch": 1.8304947283049473, "grad_norm": 0.008232798427343369, "learning_rate": 0.0002, "loss": 0.6195346117019653, "mean_token_accuracy": 0.7477771490812302, "num_tokens": 10515739.0, "step": 283 }, { "entropy": 0.6222864389419556, "epoch": 1.8369829683698295, "grad_norm": 0.008826926350593567, "learning_rate": 0.0002, "loss": 0.6246115565299988, "mean_token_accuracy": 0.7467887252569199, "num_tokens": 10552926.0, "step": 284 }, { "entropy": 0.6199471354484558, "epoch": 1.8434712084347122, "grad_norm": 0.031130356714129448, "learning_rate": 0.0002, "loss": 0.6234173774719238, "mean_token_accuracy": 0.7465962916612625, "num_tokens": 10590404.0, "step": 285 }, { "entropy": 0.6229867041110992, "epoch": 1.8499594484995945, "grad_norm": 0.009124074131250381, "learning_rate": 0.0002, "loss": 0.6230523586273193, "mean_token_accuracy": 0.7485576421022415, "num_tokens": 10628169.0, "step": 286 }, { "entropy": 0.6245164126157761, "epoch": 1.8564476885644767, "grad_norm": 0.04299340024590492, "learning_rate": 0.0002, "loss": 0.6296451091766357, "mean_token_accuracy": 0.746208980679512, "num_tokens": 10665578.0, "step": 287 }, { "entropy": 0.6367667019367218, "epoch": 1.8629359286293594, "grad_norm": 0.008064360357820988, "learning_rate": 0.0002, "loss": 0.6342769861221313, "mean_token_accuracy": 0.7435217127203941, "num_tokens": 10703123.0, "step": 288 }, { "entropy": 0.6245287135243416, "epoch": 1.8694241686942417, "grad_norm": 0.021351464092731476, "learning_rate": 0.0002, "loss": 0.6260511875152588, "mean_token_accuracy": 0.7465523779392242, "num_tokens": 10740314.0, "step": 289 }, { "entropy": 0.6212104111909866, "epoch": 1.8759124087591241, "grad_norm": 0.01059524156153202, "learning_rate": 0.0002, "loss": 0.6210169792175293, "mean_token_accuracy": 0.7475718706846237, "num_tokens": 10777825.0, "step": 290 }, { "entropy": 0.6373793482780457, "epoch": 1.8824006488240066, "grad_norm": 0.008884789422154427, "learning_rate": 0.0002, "loss": 0.6366032361984253, "mean_token_accuracy": 0.7391576170921326, "num_tokens": 10815225.0, "step": 291 }, { "entropy": 0.6392252072691917, "epoch": 1.8888888888888888, "grad_norm": 0.013435903936624527, "learning_rate": 0.0002, "loss": 0.6392862796783447, "mean_token_accuracy": 0.7395146489143372, "num_tokens": 10852456.0, "step": 292 }, { "entropy": 0.6242144107818604, "epoch": 1.8953771289537713, "grad_norm": 0.009207301773130894, "learning_rate": 0.0002, "loss": 0.6249897480010986, "mean_token_accuracy": 0.7450198903679848, "num_tokens": 10889534.0, "step": 293 }, { "entropy": 0.6158905401825905, "epoch": 1.9018653690186538, "grad_norm": 0.009233659133315086, "learning_rate": 0.0002, "loss": 0.6220048069953918, "mean_token_accuracy": 0.7474906519055367, "num_tokens": 10927138.0, "step": 294 }, { "entropy": 0.6057498604059219, "epoch": 1.908353609083536, "grad_norm": 0.00886959582567215, "learning_rate": 0.0002, "loss": 0.6085807085037231, "mean_token_accuracy": 0.7527724504470825, "num_tokens": 10964121.0, "step": 295 }, { "entropy": 0.6314896494150162, "epoch": 1.9148418491484185, "grad_norm": 0.00863397866487503, "learning_rate": 0.0002, "loss": 0.6325403451919556, "mean_token_accuracy": 0.7428522482514381, "num_tokens": 11001557.0, "step": 296 }, { "entropy": 0.6221454739570618, "epoch": 1.921330089213301, "grad_norm": 0.009161150082945824, "learning_rate": 0.0002, "loss": 0.6208068132400513, "mean_token_accuracy": 0.7462965175509453, "num_tokens": 11038904.0, "step": 297 }, { "entropy": 0.6189481094479561, "epoch": 1.9278183292781832, "grad_norm": 0.008889259770512581, "learning_rate": 0.0002, "loss": 0.6184496283531189, "mean_token_accuracy": 0.7480250671505928, "num_tokens": 11076150.0, "step": 298 }, { "entropy": 0.6238919943571091, "epoch": 1.9343065693430657, "grad_norm": 0.0090845488011837, "learning_rate": 0.0002, "loss": 0.6274781227111816, "mean_token_accuracy": 0.744391493499279, "num_tokens": 11113447.0, "step": 299 }, { "entropy": 0.6231639310717583, "epoch": 1.9407948094079481, "grad_norm": 0.009156333282589912, "learning_rate": 0.0002, "loss": 0.6222721934318542, "mean_token_accuracy": 0.7496197745203972, "num_tokens": 11150750.0, "step": 300 }, { "entropy": 0.6238841712474823, "epoch": 1.9472830494728304, "grad_norm": 0.008916804566979408, "learning_rate": 0.0002, "loss": 0.6307159066200256, "mean_token_accuracy": 0.7432639226317406, "num_tokens": 11187972.0, "step": 301 }, { "entropy": 0.628197155892849, "epoch": 1.9537712895377128, "grad_norm": 0.009915877133607864, "learning_rate": 0.0002, "loss": 0.6339118480682373, "mean_token_accuracy": 0.741386704146862, "num_tokens": 11225108.0, "step": 302 }, { "entropy": 0.6199254244565964, "epoch": 1.9602595296025953, "grad_norm": 0.008810635656118393, "learning_rate": 0.0002, "loss": 0.6184746026992798, "mean_token_accuracy": 0.7482490092515945, "num_tokens": 11262735.0, "step": 303 }, { "entropy": 0.6206595823168755, "epoch": 1.9667477696674776, "grad_norm": 0.008489571511745453, "learning_rate": 0.0002, "loss": 0.6251119375228882, "mean_token_accuracy": 0.7444824799895287, "num_tokens": 11299837.0, "step": 304 }, { "entropy": 0.6231965124607086, "epoch": 1.9732360097323602, "grad_norm": 0.008548264391720295, "learning_rate": 0.0002, "loss": 0.6258702874183655, "mean_token_accuracy": 0.7451799884438515, "num_tokens": 11337335.0, "step": 305 }, { "entropy": 0.6233715191483498, "epoch": 1.9797242497972425, "grad_norm": 0.008984974585473537, "learning_rate": 0.0002, "loss": 0.6242036819458008, "mean_token_accuracy": 0.7449030429124832, "num_tokens": 11375037.0, "step": 306 }, { "entropy": 0.6145095080137253, "epoch": 1.986212489862125, "grad_norm": 0.008570129983127117, "learning_rate": 0.0002, "loss": 0.6161348819732666, "mean_token_accuracy": 0.7494730427861214, "num_tokens": 11412372.0, "step": 307 }, { "entropy": 0.6227882578969002, "epoch": 1.9927007299270074, "grad_norm": 0.009132519364356995, "learning_rate": 0.0002, "loss": 0.6249089241027832, "mean_token_accuracy": 0.7440183088183403, "num_tokens": 11449566.0, "step": 308 }, { "entropy": 0.6210556477308273, "epoch": 1.9991889699918897, "grad_norm": 0.007969100028276443, "learning_rate": 0.0002, "loss": 0.6244759559631348, "mean_token_accuracy": 0.746830090880394, "num_tokens": 11487152.0, "step": 309 }, { "entropy": 0.6104058027267456, "epoch": 2.0, "grad_norm": 0.019919538870453835, "learning_rate": 0.0002, "loss": 0.6209793090820312, "mean_token_accuracy": 0.7482735514640808, "num_tokens": 11491673.0, "step": 310 }, { "entropy": 0.6369761228561401, "epoch": 2.0064882400648822, "grad_norm": 0.011179310269653797, "learning_rate": 0.0002, "loss": 0.6280978918075562, "mean_token_accuracy": 0.7433952018618584, "num_tokens": 11528991.0, "step": 311 }, { "entropy": 0.6231134757399559, "epoch": 2.012976480129765, "grad_norm": 0.012395660392940044, "learning_rate": 0.0002, "loss": 0.6168753504753113, "mean_token_accuracy": 0.7469241917133331, "num_tokens": 11566174.0, "step": 312 }, { "entropy": 0.6361245587468147, "epoch": 2.019464720194647, "grad_norm": 0.010151471942663193, "learning_rate": 0.0002, "loss": 0.6396852731704712, "mean_token_accuracy": 0.7390208393335342, "num_tokens": 11603660.0, "step": 313 }, { "entropy": 0.6205078735947609, "epoch": 2.0259529602595294, "grad_norm": 0.011173305101692677, "learning_rate": 0.0002, "loss": 0.6290929317474365, "mean_token_accuracy": 0.7439283728599548, "num_tokens": 11640777.0, "step": 314 }, { "entropy": 0.6196452155709267, "epoch": 2.032441200324412, "grad_norm": 0.011216065846383572, "learning_rate": 0.0002, "loss": 0.6270949840545654, "mean_token_accuracy": 0.7424712553620338, "num_tokens": 11677826.0, "step": 315 }, { "entropy": 0.6094615831971169, "epoch": 2.0389294403892944, "grad_norm": 0.009836558252573013, "learning_rate": 0.0002, "loss": 0.6110177040100098, "mean_token_accuracy": 0.7522123828530312, "num_tokens": 11714782.0, "step": 316 }, { "entropy": 0.6228377372026443, "epoch": 2.0454176804541766, "grad_norm": 0.009827308356761932, "learning_rate": 0.0002, "loss": 0.6198099851608276, "mean_token_accuracy": 0.7482241690158844, "num_tokens": 11751901.0, "step": 317 }, { "entropy": 0.6236361563205719, "epoch": 2.0519059205190593, "grad_norm": 0.010331663303077221, "learning_rate": 0.0002, "loss": 0.6171518564224243, "mean_token_accuracy": 0.747296430170536, "num_tokens": 11789727.0, "step": 318 }, { "entropy": 0.6258771196007729, "epoch": 2.0583941605839415, "grad_norm": 0.010642528533935547, "learning_rate": 0.0002, "loss": 0.6271529197692871, "mean_token_accuracy": 0.7447842955589294, "num_tokens": 11826898.0, "step": 319 }, { "entropy": 0.6150587797164917, "epoch": 2.0648824006488242, "grad_norm": 0.009091152809560299, "learning_rate": 0.0002, "loss": 0.6166321039199829, "mean_token_accuracy": 0.7505485117435455, "num_tokens": 11863842.0, "step": 320 }, { "entropy": 0.6226691231131554, "epoch": 2.0713706407137065, "grad_norm": 0.008850189857184887, "learning_rate": 0.0002, "loss": 0.6213895082473755, "mean_token_accuracy": 0.7468440607190132, "num_tokens": 11901235.0, "step": 321 }, { "entropy": 0.634496659040451, "epoch": 2.0778588807785887, "grad_norm": 0.009685751050710678, "learning_rate": 0.0002, "loss": 0.6369626522064209, "mean_token_accuracy": 0.7408950179815292, "num_tokens": 11938336.0, "step": 322 }, { "entropy": 0.6164573132991791, "epoch": 2.0843471208434714, "grad_norm": 0.010890510864555836, "learning_rate": 0.0002, "loss": 0.6235396265983582, "mean_token_accuracy": 0.7454954236745834, "num_tokens": 11975368.0, "step": 323 }, { "entropy": 0.6137611418962479, "epoch": 2.0908353609083536, "grad_norm": 0.009321420453488827, "learning_rate": 0.0002, "loss": 0.6175767183303833, "mean_token_accuracy": 0.7478668764233589, "num_tokens": 12012459.0, "step": 324 }, { "entropy": 0.6179320439696312, "epoch": 2.097323600973236, "grad_norm": 0.009330744855105877, "learning_rate": 0.0002, "loss": 0.6184362173080444, "mean_token_accuracy": 0.748590737581253, "num_tokens": 12049829.0, "step": 325 }, { "entropy": 0.6192868947982788, "epoch": 2.1038118410381186, "grad_norm": 0.008818828500807285, "learning_rate": 0.0002, "loss": 0.6174098253250122, "mean_token_accuracy": 0.7478644922375679, "num_tokens": 12087727.0, "step": 326 }, { "entropy": 0.626248262822628, "epoch": 2.110300081103001, "grad_norm": 0.008749144151806831, "learning_rate": 0.0002, "loss": 0.6212329268455505, "mean_token_accuracy": 0.747315414249897, "num_tokens": 12124835.0, "step": 327 }, { "entropy": 0.625133216381073, "epoch": 2.116788321167883, "grad_norm": 0.009766868315637112, "learning_rate": 0.0002, "loss": 0.624916136264801, "mean_token_accuracy": 0.7457389757037163, "num_tokens": 12162010.0, "step": 328 }, { "entropy": 0.6180580258369446, "epoch": 2.1232765612327658, "grad_norm": 0.010169712826609612, "learning_rate": 0.0002, "loss": 0.6185243129730225, "mean_token_accuracy": 0.7475102469325066, "num_tokens": 12199560.0, "step": 329 }, { "entropy": 0.618090882897377, "epoch": 2.129764801297648, "grad_norm": 0.010965410619974136, "learning_rate": 0.0002, "loss": 0.628595232963562, "mean_token_accuracy": 0.742675431072712, "num_tokens": 12236987.0, "step": 330 }, { "entropy": 0.6243258565664291, "epoch": 2.1362530413625302, "grad_norm": 0.009334998205304146, "learning_rate": 0.0002, "loss": 0.6280615329742432, "mean_token_accuracy": 0.7434326112270355, "num_tokens": 12274464.0, "step": 331 }, { "entropy": 0.6221758723258972, "epoch": 2.142741281427413, "grad_norm": 0.00768797192722559, "learning_rate": 0.0002, "loss": 0.6218302845954895, "mean_token_accuracy": 0.7480092272162437, "num_tokens": 12312027.0, "step": 332 }, { "entropy": 0.6239754110574722, "epoch": 2.149229521492295, "grad_norm": 0.007848316803574562, "learning_rate": 0.0002, "loss": 0.6233847141265869, "mean_token_accuracy": 0.7466081529855728, "num_tokens": 12349207.0, "step": 333 }, { "entropy": 0.6159957125782967, "epoch": 2.1557177615571774, "grad_norm": 0.009600339457392693, "learning_rate": 0.0002, "loss": 0.6117550134658813, "mean_token_accuracy": 0.7508383393287659, "num_tokens": 12386312.0, "step": 334 }, { "entropy": 0.6285756379365921, "epoch": 2.16220600162206, "grad_norm": 0.009564606472849846, "learning_rate": 0.0002, "loss": 0.6304960250854492, "mean_token_accuracy": 0.7436012774705887, "num_tokens": 12423969.0, "step": 335 }, { "entropy": 0.6194324493408203, "epoch": 2.1686942416869424, "grad_norm": 0.009417028166353703, "learning_rate": 0.0002, "loss": 0.622604250907898, "mean_token_accuracy": 0.7460262328386307, "num_tokens": 12461498.0, "step": 336 }, { "entropy": 0.6123020723462105, "epoch": 2.1751824817518246, "grad_norm": 0.00952741876244545, "learning_rate": 0.0002, "loss": 0.6190693378448486, "mean_token_accuracy": 0.7473057582974434, "num_tokens": 12498772.0, "step": 337 }, { "entropy": 0.6101055964827538, "epoch": 2.1816707218167073, "grad_norm": 0.00931888073682785, "learning_rate": 0.0002, "loss": 0.6161482334136963, "mean_token_accuracy": 0.7476179748773575, "num_tokens": 12535894.0, "step": 338 }, { "entropy": 0.6213592365384102, "epoch": 2.1881589618815895, "grad_norm": 0.008865389041602612, "learning_rate": 0.0002, "loss": 0.6219321489334106, "mean_token_accuracy": 0.7449849396944046, "num_tokens": 12573498.0, "step": 339 }, { "entropy": 0.614892452955246, "epoch": 2.1946472019464722, "grad_norm": 0.009812900796532631, "learning_rate": 0.0002, "loss": 0.6124197840690613, "mean_token_accuracy": 0.7499328628182411, "num_tokens": 12610465.0, "step": 340 }, { "entropy": 0.6235473528504372, "epoch": 2.2011354420113545, "grad_norm": 0.009034697897732258, "learning_rate": 0.0002, "loss": 0.6235278248786926, "mean_token_accuracy": 0.7453176379203796, "num_tokens": 12647446.0, "step": 341 }, { "entropy": 0.6155827194452286, "epoch": 2.2076236820762367, "grad_norm": 0.011849821545183659, "learning_rate": 0.0002, "loss": 0.6141517758369446, "mean_token_accuracy": 0.7493102103471756, "num_tokens": 12684339.0, "step": 342 }, { "entropy": 0.6220799088478088, "epoch": 2.2141119221411194, "grad_norm": 0.011021377518773079, "learning_rate": 0.0002, "loss": 0.6232143640518188, "mean_token_accuracy": 0.7435769438743591, "num_tokens": 12722039.0, "step": 343 }, { "entropy": 0.60894425958395, "epoch": 2.2206001622060016, "grad_norm": 0.00959057454019785, "learning_rate": 0.0002, "loss": 0.614958643913269, "mean_token_accuracy": 0.7492904141545296, "num_tokens": 12758559.0, "step": 344 }, { "entropy": 0.61026880890131, "epoch": 2.227088402270884, "grad_norm": 0.010138140991330147, "learning_rate": 0.0002, "loss": 0.616437554359436, "mean_token_accuracy": 0.7471959367394447, "num_tokens": 12795759.0, "step": 345 }, { "entropy": 0.6212582364678383, "epoch": 2.2335766423357666, "grad_norm": 0.013862723484635353, "learning_rate": 0.0002, "loss": 0.6215099692344666, "mean_token_accuracy": 0.7478090971708298, "num_tokens": 12833075.0, "step": 346 }, { "entropy": 0.6183774024248123, "epoch": 2.240064882400649, "grad_norm": 0.00895402580499649, "learning_rate": 0.0002, "loss": 0.6187215447425842, "mean_token_accuracy": 0.7494830936193466, "num_tokens": 12870571.0, "step": 347 }, { "entropy": 0.6210155412554741, "epoch": 2.246553122465531, "grad_norm": 0.041780415922403336, "learning_rate": 0.0002, "loss": 0.6219582557678223, "mean_token_accuracy": 0.7483534067869186, "num_tokens": 12908163.0, "step": 348 }, { "entropy": 0.6203203722834587, "epoch": 2.2530413625304138, "grad_norm": 0.02689778059720993, "learning_rate": 0.0002, "loss": 0.6272082328796387, "mean_token_accuracy": 0.7450312674045563, "num_tokens": 12945330.0, "step": 349 }, { "entropy": 0.6245186030864716, "epoch": 2.259529602595296, "grad_norm": 0.012432226911187172, "learning_rate": 0.0002, "loss": 0.6235542297363281, "mean_token_accuracy": 0.7462796568870544, "num_tokens": 12982731.0, "step": 350 }, { "entropy": 0.6220052242279053, "epoch": 2.2660178426601782, "grad_norm": 0.010308763943612576, "learning_rate": 0.0002, "loss": 0.624070405960083, "mean_token_accuracy": 0.743579313158989, "num_tokens": 13019541.0, "step": 351 }, { "entropy": 0.64016043394804, "epoch": 2.272506082725061, "grad_norm": 0.010659064166247845, "learning_rate": 0.0002, "loss": 0.636542558670044, "mean_token_accuracy": 0.7407100200653076, "num_tokens": 13057158.0, "step": 352 }, { "entropy": 0.6278761327266693, "epoch": 2.278994322789943, "grad_norm": 0.010416081175208092, "learning_rate": 0.0002, "loss": 0.62436842918396, "mean_token_accuracy": 0.7455000206828117, "num_tokens": 13094262.0, "step": 353 }, { "entropy": 0.6232447475194931, "epoch": 2.285482562854826, "grad_norm": 0.009887438267469406, "learning_rate": 0.0002, "loss": 0.6241923570632935, "mean_token_accuracy": 0.7437829151749611, "num_tokens": 13131360.0, "step": 354 }, { "entropy": 0.6319752037525177, "epoch": 2.291970802919708, "grad_norm": 0.009396783076226711, "learning_rate": 0.0002, "loss": 0.6283852458000183, "mean_token_accuracy": 0.7450494468212128, "num_tokens": 13168644.0, "step": 355 }, { "entropy": 0.6192774921655655, "epoch": 2.2984590429845904, "grad_norm": 0.009457712061703205, "learning_rate": 0.0002, "loss": 0.6166653633117676, "mean_token_accuracy": 0.7473447695374489, "num_tokens": 13205900.0, "step": 356 }, { "entropy": 0.616138719022274, "epoch": 2.304947283049473, "grad_norm": 0.009487454779446125, "learning_rate": 0.0002, "loss": 0.6193556189537048, "mean_token_accuracy": 0.746711365878582, "num_tokens": 13243403.0, "step": 357 }, { "entropy": 0.6114000976085663, "epoch": 2.3114355231143553, "grad_norm": 0.010738314129412174, "learning_rate": 0.0002, "loss": 0.6193853616714478, "mean_token_accuracy": 0.7472727373242378, "num_tokens": 13280595.0, "step": 358 }, { "entropy": 0.601548932492733, "epoch": 2.3179237631792375, "grad_norm": 0.010257442481815815, "learning_rate": 0.0002, "loss": 0.6057910919189453, "mean_token_accuracy": 0.7506168782711029, "num_tokens": 13317413.0, "step": 359 }, { "entropy": 0.6248240396380424, "epoch": 2.3244120032441202, "grad_norm": 0.009444781579077244, "learning_rate": 0.0002, "loss": 0.6265978217124939, "mean_token_accuracy": 0.7447159513831139, "num_tokens": 13354442.0, "step": 360 }, { "entropy": 0.6169225797057152, "epoch": 2.3309002433090025, "grad_norm": 0.010277079418301582, "learning_rate": 0.0002, "loss": 0.6173827648162842, "mean_token_accuracy": 0.7486959248781204, "num_tokens": 13392357.0, "step": 361 }, { "entropy": 0.6302815526723862, "epoch": 2.3373884833738847, "grad_norm": 0.009320929646492004, "learning_rate": 0.0002, "loss": 0.6289012432098389, "mean_token_accuracy": 0.7438602596521378, "num_tokens": 13429444.0, "step": 362 }, { "entropy": 0.6252695918083191, "epoch": 2.3438767234387674, "grad_norm": 0.00795667339116335, "learning_rate": 0.0002, "loss": 0.6236270666122437, "mean_token_accuracy": 0.7462895065546036, "num_tokens": 13466973.0, "step": 363 }, { "entropy": 0.6325998455286026, "epoch": 2.3503649635036497, "grad_norm": 0.009790928103029728, "learning_rate": 0.0002, "loss": 0.6316322088241577, "mean_token_accuracy": 0.7428558766841888, "num_tokens": 13504219.0, "step": 364 }, { "entropy": 0.6235339045524597, "epoch": 2.356853203568532, "grad_norm": 0.009260588325560093, "learning_rate": 0.0002, "loss": 0.6231226921081543, "mean_token_accuracy": 0.7452265918254852, "num_tokens": 13541359.0, "step": 365 }, { "entropy": 0.6141555160284042, "epoch": 2.3633414436334146, "grad_norm": 0.010724055580794811, "learning_rate": 0.0002, "loss": 0.6217249631881714, "mean_token_accuracy": 0.7470070049166679, "num_tokens": 13578759.0, "step": 366 }, { "entropy": 0.6315039545297623, "epoch": 2.369829683698297, "grad_norm": 0.009067324921488762, "learning_rate": 0.0002, "loss": 0.634614109992981, "mean_token_accuracy": 0.7410515621304512, "num_tokens": 13616296.0, "step": 367 }, { "entropy": 0.6196957975625992, "epoch": 2.376317923763179, "grad_norm": 0.009248278103768826, "learning_rate": 0.0002, "loss": 0.6189215183258057, "mean_token_accuracy": 0.7481505498290062, "num_tokens": 13653415.0, "step": 368 }, { "entropy": 0.6168980821967125, "epoch": 2.3828061638280618, "grad_norm": 0.010181935504078865, "learning_rate": 0.0002, "loss": 0.6161677837371826, "mean_token_accuracy": 0.7499739304184914, "num_tokens": 13690618.0, "step": 369 }, { "entropy": 0.6258252412080765, "epoch": 2.389294403892944, "grad_norm": 0.008928108029067516, "learning_rate": 0.0002, "loss": 0.6290237903594971, "mean_token_accuracy": 0.7429782524704933, "num_tokens": 13727901.0, "step": 370 }, { "entropy": 0.6094075217843056, "epoch": 2.3957826439578263, "grad_norm": 0.009067908860743046, "learning_rate": 0.0002, "loss": 0.6124044060707092, "mean_token_accuracy": 0.7487504705786705, "num_tokens": 13765097.0, "step": 371 }, { "entropy": 0.6190275996923447, "epoch": 2.402270884022709, "grad_norm": 0.009943855926394463, "learning_rate": 0.0002, "loss": 0.6234393119812012, "mean_token_accuracy": 0.7450670152902603, "num_tokens": 13802604.0, "step": 372 }, { "entropy": 0.6125053241848946, "epoch": 2.408759124087591, "grad_norm": 0.009481463581323624, "learning_rate": 0.0002, "loss": 0.6187013387680054, "mean_token_accuracy": 0.7489439323544502, "num_tokens": 13839487.0, "step": 373 }, { "entropy": 0.6130451932549477, "epoch": 2.4152473641524734, "grad_norm": 0.008458724245429039, "learning_rate": 0.0002, "loss": 0.614911675453186, "mean_token_accuracy": 0.7505282834172249, "num_tokens": 13876935.0, "step": 374 }, { "entropy": 0.6462682038545609, "epoch": 2.421735604217356, "grad_norm": 0.010083320550620556, "learning_rate": 0.0002, "loss": 0.6467190980911255, "mean_token_accuracy": 0.7378857955336571, "num_tokens": 13914429.0, "step": 375 }, { "entropy": 0.6287035867571831, "epoch": 2.4282238442822384, "grad_norm": 0.008747600950300694, "learning_rate": 0.0002, "loss": 0.6284276247024536, "mean_token_accuracy": 0.7447932213544846, "num_tokens": 13951880.0, "step": 376 }, { "entropy": 0.6305522173643112, "epoch": 2.4347120843471206, "grad_norm": 0.010268261656165123, "learning_rate": 0.0002, "loss": 0.6298754215240479, "mean_token_accuracy": 0.7451391518115997, "num_tokens": 13989473.0, "step": 377 }, { "entropy": 0.6239131912589073, "epoch": 2.4412003244120033, "grad_norm": 0.00940751750022173, "learning_rate": 0.0002, "loss": 0.6264931559562683, "mean_token_accuracy": 0.7422467172145844, "num_tokens": 14026832.0, "step": 378 }, { "entropy": 0.6218756884336472, "epoch": 2.4476885644768855, "grad_norm": 0.008956913836300373, "learning_rate": 0.0002, "loss": 0.6260896325111389, "mean_token_accuracy": 0.7415326088666916, "num_tokens": 14064159.0, "step": 379 }, { "entropy": 0.6187591478228569, "epoch": 2.4541768045417682, "grad_norm": 0.008552344515919685, "learning_rate": 0.0002, "loss": 0.6216272115707397, "mean_token_accuracy": 0.7469553202390671, "num_tokens": 14101277.0, "step": 380 }, { "entropy": 0.6129069477319717, "epoch": 2.4606650446066505, "grad_norm": 0.009866154752671719, "learning_rate": 0.0002, "loss": 0.6184383630752563, "mean_token_accuracy": 0.7457786872982979, "num_tokens": 14138545.0, "step": 381 }, { "entropy": 0.6332196220755577, "epoch": 2.4671532846715327, "grad_norm": 0.007945130579173565, "learning_rate": 0.0002, "loss": 0.6312772631645203, "mean_token_accuracy": 0.7440632656216621, "num_tokens": 14176229.0, "step": 382 }, { "entropy": 0.6162554249167442, "epoch": 2.4736415247364154, "grad_norm": 0.00908781960606575, "learning_rate": 0.0002, "loss": 0.6104109883308411, "mean_token_accuracy": 0.7492068335413933, "num_tokens": 14213375.0, "step": 383 }, { "entropy": 0.6241936013102531, "epoch": 2.4801297648012977, "grad_norm": 0.009399542585015297, "learning_rate": 0.0002, "loss": 0.6161544919013977, "mean_token_accuracy": 0.7491407096385956, "num_tokens": 14250696.0, "step": 384 }, { "entropy": 0.6147832497954369, "epoch": 2.48661800486618, "grad_norm": 0.007576434873044491, "learning_rate": 0.0002, "loss": 0.6159515976905823, "mean_token_accuracy": 0.7494903281331062, "num_tokens": 14287863.0, "step": 385 }, { "entropy": 0.6227882355451584, "epoch": 2.4931062449310626, "grad_norm": 0.009297952987253666, "learning_rate": 0.0002, "loss": 0.6279860734939575, "mean_token_accuracy": 0.745159700512886, "num_tokens": 14325371.0, "step": 386 }, { "entropy": 0.6066790446639061, "epoch": 2.499594484995945, "grad_norm": 0.009967000223696232, "learning_rate": 0.0002, "loss": 0.6151248216629028, "mean_token_accuracy": 0.7479714751243591, "num_tokens": 14362698.0, "step": 387 }, { "entropy": 0.6248459070920944, "epoch": 2.5060827250608275, "grad_norm": 0.009727658703923225, "learning_rate": 0.0002, "loss": 0.6268327236175537, "mean_token_accuracy": 0.7463877573609352, "num_tokens": 14399544.0, "step": 388 }, { "entropy": 0.6305608153343201, "epoch": 2.5125709651257098, "grad_norm": 0.008822647854685783, "learning_rate": 0.0002, "loss": 0.6284365653991699, "mean_token_accuracy": 0.7454124987125397, "num_tokens": 14436877.0, "step": 389 }, { "entropy": 0.6289694681763649, "epoch": 2.519059205190592, "grad_norm": 0.009071394801139832, "learning_rate": 0.0002, "loss": 0.6264450550079346, "mean_token_accuracy": 0.7433068230748177, "num_tokens": 14473915.0, "step": 390 }, { "entropy": 0.6271463260054588, "epoch": 2.5255474452554747, "grad_norm": 0.008187719620764256, "learning_rate": 0.0002, "loss": 0.6289336085319519, "mean_token_accuracy": 0.7423637583851814, "num_tokens": 14511402.0, "step": 391 }, { "entropy": 0.6084585338830948, "epoch": 2.532035685320357, "grad_norm": 0.008899841457605362, "learning_rate": 0.0002, "loss": 0.6130256652832031, "mean_token_accuracy": 0.7509424611926079, "num_tokens": 14548753.0, "step": 392 }, { "entropy": 0.6104612424969673, "epoch": 2.538523925385239, "grad_norm": 0.00985915120691061, "learning_rate": 0.0002, "loss": 0.6200201511383057, "mean_token_accuracy": 0.7466698288917542, "num_tokens": 14586042.0, "step": 393 }, { "entropy": 0.6256568655371666, "epoch": 2.545012165450122, "grad_norm": 0.00867030955851078, "learning_rate": 0.0002, "loss": 0.6292595267295837, "mean_token_accuracy": 0.7430211529135704, "num_tokens": 14623448.0, "step": 394 }, { "entropy": 0.6263261586427689, "epoch": 2.551500405515004, "grad_norm": 0.010737903416156769, "learning_rate": 0.0002, "loss": 0.6249234676361084, "mean_token_accuracy": 0.7444213852286339, "num_tokens": 14660585.0, "step": 395 }, { "entropy": 0.6266406700015068, "epoch": 2.5579886455798864, "grad_norm": 0.008770007640123367, "learning_rate": 0.0002, "loss": 0.6228189468383789, "mean_token_accuracy": 0.7473640963435173, "num_tokens": 14697839.0, "step": 396 }, { "entropy": 0.6101134717464447, "epoch": 2.564476885644769, "grad_norm": 0.008944439701735973, "learning_rate": 0.0002, "loss": 0.6120374798774719, "mean_token_accuracy": 0.7512135058641434, "num_tokens": 14735253.0, "step": 397 }, { "entropy": 0.6294003054499626, "epoch": 2.5709651257096513, "grad_norm": 0.010403397493064404, "learning_rate": 0.0002, "loss": 0.6361932754516602, "mean_token_accuracy": 0.7407518178224564, "num_tokens": 14772533.0, "step": 398 }, { "entropy": 0.6084831207990646, "epoch": 2.5774533657745335, "grad_norm": 0.007994825951755047, "learning_rate": 0.0002, "loss": 0.6090534329414368, "mean_token_accuracy": 0.7516237422823906, "num_tokens": 14809746.0, "step": 399 }, { "entropy": 0.6314651742577553, "epoch": 2.5839416058394162, "grad_norm": 0.010198352858424187, "learning_rate": 0.0002, "loss": 0.6245699524879456, "mean_token_accuracy": 0.7476952150464058, "num_tokens": 14847650.0, "step": 400 }, { "entropy": 0.6174981743097305, "epoch": 2.5904298459042985, "grad_norm": 0.009044546633958817, "learning_rate": 0.0002, "loss": 0.615368664264679, "mean_token_accuracy": 0.7484294474124908, "num_tokens": 14884930.0, "step": 401 }, { "entropy": 0.6164123043417931, "epoch": 2.5969180859691807, "grad_norm": 0.008100450970232487, "learning_rate": 0.0002, "loss": 0.620932936668396, "mean_token_accuracy": 0.7468846142292023, "num_tokens": 14922467.0, "step": 402 }, { "entropy": 0.6131496354937553, "epoch": 2.6034063260340634, "grad_norm": 0.01058341097086668, "learning_rate": 0.0002, "loss": 0.6206756830215454, "mean_token_accuracy": 0.7483528330922127, "num_tokens": 14959768.0, "step": 403 }, { "entropy": 0.61551932990551, "epoch": 2.6098945660989457, "grad_norm": 0.008704769425094128, "learning_rate": 0.0002, "loss": 0.6186975240707397, "mean_token_accuracy": 0.7474388629198074, "num_tokens": 14996628.0, "step": 404 }, { "entropy": 0.6159948483109474, "epoch": 2.616382806163828, "grad_norm": 0.009592502377927303, "learning_rate": 0.0002, "loss": 0.6187817454338074, "mean_token_accuracy": 0.7487591952085495, "num_tokens": 15033592.0, "step": 405 }, { "entropy": 0.6296302676200867, "epoch": 2.6228710462287106, "grad_norm": 0.009406859055161476, "learning_rate": 0.0002, "loss": 0.6244117617607117, "mean_token_accuracy": 0.7439019158482552, "num_tokens": 15071235.0, "step": 406 }, { "entropy": 0.6396452710032463, "epoch": 2.629359286293593, "grad_norm": 0.009445966221392155, "learning_rate": 0.0002, "loss": 0.634600043296814, "mean_token_accuracy": 0.7421920970082283, "num_tokens": 15108591.0, "step": 407 }, { "entropy": 0.6241939589381218, "epoch": 2.635847526358475, "grad_norm": 0.008459821343421936, "learning_rate": 0.0002, "loss": 0.6214285492897034, "mean_token_accuracy": 0.745953157544136, "num_tokens": 15146394.0, "step": 408 }, { "entropy": 0.6104935929179192, "epoch": 2.6423357664233578, "grad_norm": 0.010156887583434582, "learning_rate": 0.0002, "loss": 0.6155494451522827, "mean_token_accuracy": 0.7467065751552582, "num_tokens": 15183954.0, "step": 409 }, { "entropy": 0.6200908496975899, "epoch": 2.64882400648824, "grad_norm": 0.01134799886494875, "learning_rate": 0.0002, "loss": 0.6298259496688843, "mean_token_accuracy": 0.7434926256537437, "num_tokens": 15221318.0, "step": 410 }, { "entropy": 0.6163679510354996, "epoch": 2.6553122465531223, "grad_norm": 0.008384560234844685, "learning_rate": 0.0002, "loss": 0.6196904182434082, "mean_token_accuracy": 0.7484511360526085, "num_tokens": 15258714.0, "step": 411 }, { "entropy": 0.6290042921900749, "epoch": 2.661800486618005, "grad_norm": 0.011763868853449821, "learning_rate": 0.0002, "loss": 0.623403787612915, "mean_token_accuracy": 0.7461108565330505, "num_tokens": 15295950.0, "step": 412 }, { "entropy": 0.6304820030927658, "epoch": 2.668288726682887, "grad_norm": 0.008899668231606483, "learning_rate": 0.0002, "loss": 0.6314485669136047, "mean_token_accuracy": 0.7429024130105972, "num_tokens": 15333333.0, "step": 413 }, { "entropy": 0.6225186064839363, "epoch": 2.6747769667477694, "grad_norm": 0.008537418209016323, "learning_rate": 0.0002, "loss": 0.6211932897567749, "mean_token_accuracy": 0.747981533408165, "num_tokens": 15370982.0, "step": 414 }, { "entropy": 0.6107104495167732, "epoch": 2.681265206812652, "grad_norm": 0.01061639841645956, "learning_rate": 0.0002, "loss": 0.6177730560302734, "mean_token_accuracy": 0.7482814937829971, "num_tokens": 15408426.0, "step": 415 }, { "entropy": 0.6148537546396255, "epoch": 2.6877534468775344, "grad_norm": 0.011781369335949421, "learning_rate": 0.0002, "loss": 0.6236268281936646, "mean_token_accuracy": 0.7474222108721733, "num_tokens": 15445617.0, "step": 416 }, { "entropy": 0.6345531940460205, "epoch": 2.6942416869424166, "grad_norm": 0.008664336055517197, "learning_rate": 0.0002, "loss": 0.6367125511169434, "mean_token_accuracy": 0.7417123690247536, "num_tokens": 15483295.0, "step": 417 }, { "entropy": 0.632311999797821, "epoch": 2.7007299270072993, "grad_norm": 0.010981544852256775, "learning_rate": 0.0002, "loss": 0.6256700158119202, "mean_token_accuracy": 0.7448865845799446, "num_tokens": 15520324.0, "step": 418 }, { "entropy": 0.6247982755303383, "epoch": 2.7072181670721815, "grad_norm": 0.010701069608330727, "learning_rate": 0.0002, "loss": 0.6191861629486084, "mean_token_accuracy": 0.747975766658783, "num_tokens": 15557534.0, "step": 419 }, { "entropy": 0.6309525445103645, "epoch": 2.7137064071370642, "grad_norm": 0.008924427442252636, "learning_rate": 0.0002, "loss": 0.6328113079071045, "mean_token_accuracy": 0.741542711853981, "num_tokens": 15594763.0, "step": 420 }, { "entropy": 0.6043407768011093, "epoch": 2.7201946472019465, "grad_norm": 0.008746204897761345, "learning_rate": 0.0002, "loss": 0.6077402830123901, "mean_token_accuracy": 0.7525621652603149, "num_tokens": 15631963.0, "step": 421 }, { "entropy": 0.623171254992485, "epoch": 2.7266828872668287, "grad_norm": 0.012448329478502274, "learning_rate": 0.0002, "loss": 0.6337227821350098, "mean_token_accuracy": 0.7424034029245377, "num_tokens": 15669213.0, "step": 422 }, { "entropy": 0.6182989627122879, "epoch": 2.7331711273317114, "grad_norm": 0.00980245042592287, "learning_rate": 0.0002, "loss": 0.6246788501739502, "mean_token_accuracy": 0.7442185133695602, "num_tokens": 15706502.0, "step": 423 }, { "entropy": 0.6341974511742592, "epoch": 2.7396593673965937, "grad_norm": 0.010192792862653732, "learning_rate": 0.0002, "loss": 0.6291946172714233, "mean_token_accuracy": 0.7423791959881783, "num_tokens": 15744210.0, "step": 424 }, { "entropy": 0.6213679686188698, "epoch": 2.7461476074614763, "grad_norm": 0.010065656155347824, "learning_rate": 0.0002, "loss": 0.6173956394195557, "mean_token_accuracy": 0.7478613257408142, "num_tokens": 15781645.0, "step": 425 }, { "entropy": 0.6221437901258469, "epoch": 2.7526358475263586, "grad_norm": 0.0095105255022645, "learning_rate": 0.0002, "loss": 0.6207852363586426, "mean_token_accuracy": 0.7459077090024948, "num_tokens": 15818882.0, "step": 426 }, { "entropy": 0.6309037730097771, "epoch": 2.759124087591241, "grad_norm": 0.008715137839317322, "learning_rate": 0.0002, "loss": 0.635662317276001, "mean_token_accuracy": 0.7393417879939079, "num_tokens": 15856215.0, "step": 427 }, { "entropy": 0.6107242554426193, "epoch": 2.7656123276561235, "grad_norm": 0.01041481178253889, "learning_rate": 0.0002, "loss": 0.6185387372970581, "mean_token_accuracy": 0.7483986243605614, "num_tokens": 15892879.0, "step": 428 }, { "entropy": 0.6216551586985588, "epoch": 2.7721005677210058, "grad_norm": 0.0099997129291296, "learning_rate": 0.0002, "loss": 0.6273539066314697, "mean_token_accuracy": 0.7425299435853958, "num_tokens": 15930440.0, "step": 429 }, { "entropy": 0.6228181794285774, "epoch": 2.778588807785888, "grad_norm": 0.009126834571361542, "learning_rate": 0.0002, "loss": 0.6193030476570129, "mean_token_accuracy": 0.748077854514122, "num_tokens": 15967547.0, "step": 430 }, { "entropy": 0.6386850997805595, "epoch": 2.7850770478507707, "grad_norm": 0.00938471220433712, "learning_rate": 0.0002, "loss": 0.6340270042419434, "mean_token_accuracy": 0.7409438043832779, "num_tokens": 16004947.0, "step": 431 }, { "entropy": 0.6217259094119072, "epoch": 2.791565287915653, "grad_norm": 0.010031217709183693, "learning_rate": 0.0002, "loss": 0.6190569400787354, "mean_token_accuracy": 0.7476614862680435, "num_tokens": 16041946.0, "step": 432 }, { "entropy": 0.6218375042080879, "epoch": 2.798053527980535, "grad_norm": 0.008579161949455738, "learning_rate": 0.0002, "loss": 0.6240730285644531, "mean_token_accuracy": 0.746677428483963, "num_tokens": 16078788.0, "step": 433 }, { "entropy": 0.627423033118248, "epoch": 2.804541768045418, "grad_norm": 0.010432623326778412, "learning_rate": 0.0002, "loss": 0.6334057450294495, "mean_token_accuracy": 0.7425751611590385, "num_tokens": 16116073.0, "step": 434 }, { "entropy": 0.6249776631593704, "epoch": 2.8110300081103, "grad_norm": 0.01080512534826994, "learning_rate": 0.0002, "loss": 0.6291300058364868, "mean_token_accuracy": 0.7412911430001259, "num_tokens": 16153421.0, "step": 435 }, { "entropy": 0.6199780628085136, "epoch": 2.8175182481751824, "grad_norm": 0.008089151233434677, "learning_rate": 0.0002, "loss": 0.6166943311691284, "mean_token_accuracy": 0.7502307966351509, "num_tokens": 16190692.0, "step": 436 }, { "entropy": 0.6264552250504494, "epoch": 2.824006488240065, "grad_norm": 0.009256084449589252, "learning_rate": 0.0002, "loss": 0.6239896416664124, "mean_token_accuracy": 0.7462676838040352, "num_tokens": 16227626.0, "step": 437 }, { "entropy": 0.6257441863417625, "epoch": 2.8304947283049473, "grad_norm": 0.010192189365625381, "learning_rate": 0.0002, "loss": 0.6272855997085571, "mean_token_accuracy": 0.7451135069131851, "num_tokens": 16264951.0, "step": 438 }, { "entropy": 0.6197425052523613, "epoch": 2.8369829683698295, "grad_norm": 0.00909087248146534, "learning_rate": 0.0002, "loss": 0.6246816515922546, "mean_token_accuracy": 0.7462664917111397, "num_tokens": 16302276.0, "step": 439 }, { "entropy": 0.6187947019934654, "epoch": 2.8434712084347122, "grad_norm": 0.010161105543375015, "learning_rate": 0.0002, "loss": 0.6317975521087646, "mean_token_accuracy": 0.7427225112915039, "num_tokens": 16339652.0, "step": 440 }, { "entropy": 0.6189513206481934, "epoch": 2.8499594484995945, "grad_norm": 0.009055238217115402, "learning_rate": 0.0002, "loss": 0.6247466802597046, "mean_token_accuracy": 0.7450408861041069, "num_tokens": 16376803.0, "step": 441 }, { "entropy": 0.6144088804721832, "epoch": 2.8564476885644767, "grad_norm": 0.008574709296226501, "learning_rate": 0.0002, "loss": 0.618188738822937, "mean_token_accuracy": 0.7477873042225838, "num_tokens": 16413555.0, "step": 442 }, { "entropy": 0.6285263672471046, "epoch": 2.8629359286293594, "grad_norm": 0.01058571133762598, "learning_rate": 0.0002, "loss": 0.6210506558418274, "mean_token_accuracy": 0.7466302737593651, "num_tokens": 16450235.0, "step": 443 }, { "entropy": 0.6278195902705193, "epoch": 2.8694241686942417, "grad_norm": 0.008600706234574318, "learning_rate": 0.0002, "loss": 0.6228291988372803, "mean_token_accuracy": 0.7465885654091835, "num_tokens": 16487688.0, "step": 444 }, { "entropy": 0.6128537505865097, "epoch": 2.875912408759124, "grad_norm": 0.009188942611217499, "learning_rate": 0.0002, "loss": 0.6115404367446899, "mean_token_accuracy": 0.7511069476604462, "num_tokens": 16525056.0, "step": 445 }, { "entropy": 0.6209624111652374, "epoch": 2.8824006488240066, "grad_norm": 0.009248930029571056, "learning_rate": 0.0002, "loss": 0.6210386753082275, "mean_token_accuracy": 0.7469235137104988, "num_tokens": 16562914.0, "step": 446 }, { "entropy": 0.5965787023305893, "epoch": 2.888888888888889, "grad_norm": 0.0094021987169981, "learning_rate": 0.0002, "loss": 0.6033673286437988, "mean_token_accuracy": 0.7514390125870705, "num_tokens": 16599899.0, "step": 447 }, { "entropy": 0.6115651428699493, "epoch": 2.895377128953771, "grad_norm": 0.01325083989650011, "learning_rate": 0.0002, "loss": 0.6262028813362122, "mean_token_accuracy": 0.7461578771471977, "num_tokens": 16637011.0, "step": 448 }, { "entropy": 0.6188539639115334, "epoch": 2.9018653690186538, "grad_norm": 0.00891121570020914, "learning_rate": 0.0002, "loss": 0.6159206628799438, "mean_token_accuracy": 0.7494730055332184, "num_tokens": 16673697.0, "step": 449 }, { "entropy": 0.6208583936095238, "epoch": 2.908353609083536, "grad_norm": 0.009828220121562481, "learning_rate": 0.0002, "loss": 0.6155424118041992, "mean_token_accuracy": 0.7491355165839195, "num_tokens": 16710885.0, "step": 450 }, { "entropy": 0.6197483390569687, "epoch": 2.9148418491484183, "grad_norm": 0.008900245651602745, "learning_rate": 0.0002, "loss": 0.6142081618309021, "mean_token_accuracy": 0.748231329023838, "num_tokens": 16748182.0, "step": 451 }, { "entropy": 0.6212092339992523, "epoch": 2.921330089213301, "grad_norm": 0.00849118735641241, "learning_rate": 0.0002, "loss": 0.6236221790313721, "mean_token_accuracy": 0.7436698824167252, "num_tokens": 16785028.0, "step": 452 }, { "entropy": 0.6107748746871948, "epoch": 2.927818329278183, "grad_norm": 0.009662901051342487, "learning_rate": 0.0002, "loss": 0.6197327375411987, "mean_token_accuracy": 0.7483203411102295, "num_tokens": 16822318.0, "step": 453 }, { "entropy": 0.6189533397555351, "epoch": 2.9343065693430654, "grad_norm": 0.009161571972072124, "learning_rate": 0.0002, "loss": 0.6221146583557129, "mean_token_accuracy": 0.7479159906506538, "num_tokens": 16859984.0, "step": 454 }, { "entropy": 0.6262816786766052, "epoch": 2.940794809407948, "grad_norm": 0.008490455336868763, "learning_rate": 0.0002, "loss": 0.6270855069160461, "mean_token_accuracy": 0.7452046275138855, "num_tokens": 16897277.0, "step": 455 }, { "entropy": 0.6230187118053436, "epoch": 2.9472830494728304, "grad_norm": 0.00920241978019476, "learning_rate": 0.0002, "loss": 0.6212553977966309, "mean_token_accuracy": 0.7461629658937454, "num_tokens": 16934423.0, "step": 456 }, { "entropy": 0.6259749531745911, "epoch": 2.9537712895377126, "grad_norm": 0.008131385780870914, "learning_rate": 0.0002, "loss": 0.6244622468948364, "mean_token_accuracy": 0.7466467097401619, "num_tokens": 16971857.0, "step": 457 }, { "entropy": 0.6159861534833908, "epoch": 2.9602595296025953, "grad_norm": 0.008032194338738918, "learning_rate": 0.0002, "loss": 0.6193053722381592, "mean_token_accuracy": 0.7479442283511162, "num_tokens": 17008930.0, "step": 458 }, { "entropy": 0.617520272731781, "epoch": 2.9667477696674776, "grad_norm": 0.009034648537635803, "learning_rate": 0.0002, "loss": 0.6226905584335327, "mean_token_accuracy": 0.7449267134070396, "num_tokens": 17046294.0, "step": 459 }, { "entropy": 0.6264740154147148, "epoch": 2.9732360097323602, "grad_norm": 0.008523489348590374, "learning_rate": 0.0002, "loss": 0.6288236379623413, "mean_token_accuracy": 0.7429340779781342, "num_tokens": 17083358.0, "step": 460 }, { "entropy": 0.6205747723579407, "epoch": 2.9797242497972425, "grad_norm": 0.008030165918171406, "learning_rate": 0.0002, "loss": 0.6183617115020752, "mean_token_accuracy": 0.7463237047195435, "num_tokens": 17120761.0, "step": 461 }, { "entropy": 0.6367032006382942, "epoch": 2.986212489862125, "grad_norm": 0.009663688018918037, "learning_rate": 0.0002, "loss": 0.6329810619354248, "mean_token_accuracy": 0.7433002442121506, "num_tokens": 17158231.0, "step": 462 }, { "entropy": 0.626891016960144, "epoch": 2.9927007299270074, "grad_norm": 0.009945257566869259, "learning_rate": 0.0002, "loss": 0.6275311708450317, "mean_token_accuracy": 0.7450283095240593, "num_tokens": 17195764.0, "step": 463 }, { "entropy": 0.6275185570120811, "epoch": 2.9991889699918897, "grad_norm": 0.008921638131141663, "learning_rate": 0.0002, "loss": 0.6317576169967651, "mean_token_accuracy": 0.7413767129182816, "num_tokens": 17232867.0, "step": 464 }, { "entropy": 0.5935274362564087, "epoch": 3.0, "grad_norm": 0.02002483420073986, "learning_rate": 0.0002, "loss": 0.5921852588653564, "mean_token_accuracy": 0.7577869892120361, "num_tokens": 17237490.0, "step": 465 }, { "entropy": 0.610297404229641, "epoch": 3.0064882400648822, "grad_norm": 0.010434089228510857, "learning_rate": 0.0002, "loss": 0.6096053123474121, "mean_token_accuracy": 0.7505725026130676, "num_tokens": 17274381.0, "step": 466 }, { "entropy": 0.6093652322888374, "epoch": 3.012976480129765, "grad_norm": 0.011252244934439659, "learning_rate": 0.0002, "loss": 0.6079680919647217, "mean_token_accuracy": 0.751014731824398, "num_tokens": 17311247.0, "step": 467 }, { "entropy": 0.6135042458772659, "epoch": 3.019464720194647, "grad_norm": 0.011452090926468372, "learning_rate": 0.0002, "loss": 0.621872067451477, "mean_token_accuracy": 0.7463375702500343, "num_tokens": 17348490.0, "step": 468 }, { "entropy": 0.6276230961084366, "epoch": 3.0259529602595294, "grad_norm": 0.011181695386767387, "learning_rate": 0.0002, "loss": 0.6287038326263428, "mean_token_accuracy": 0.7455412894487381, "num_tokens": 17385419.0, "step": 469 }, { "entropy": 0.6226534396409988, "epoch": 3.032441200324412, "grad_norm": 0.00998624972999096, "learning_rate": 0.0002, "loss": 0.6229760646820068, "mean_token_accuracy": 0.7449204847216606, "num_tokens": 17423056.0, "step": 470 }, { "entropy": 0.6008478105068207, "epoch": 3.0389294403892944, "grad_norm": 0.0095088891685009, "learning_rate": 0.0002, "loss": 0.6020908951759338, "mean_token_accuracy": 0.7544899210333824, "num_tokens": 17460157.0, "step": 471 }, { "entropy": 0.6252934113144875, "epoch": 3.0454176804541766, "grad_norm": 0.010803421959280968, "learning_rate": 0.0002, "loss": 0.6294186115264893, "mean_token_accuracy": 0.7426271066069603, "num_tokens": 17497579.0, "step": 472 }, { "entropy": 0.6106472909450531, "epoch": 3.0519059205190593, "grad_norm": 0.010041839443147182, "learning_rate": 0.0002, "loss": 0.6172924041748047, "mean_token_accuracy": 0.7476223781704903, "num_tokens": 17534955.0, "step": 473 }, { "entropy": 0.6221166178584099, "epoch": 3.0583941605839415, "grad_norm": 0.009123523719608784, "learning_rate": 0.0002, "loss": 0.6244035363197327, "mean_token_accuracy": 0.7448302879929543, "num_tokens": 17572150.0, "step": 474 }, { "entropy": 0.6102956235408783, "epoch": 3.0648824006488242, "grad_norm": 0.008510733023285866, "learning_rate": 0.0002, "loss": 0.6107138991355896, "mean_token_accuracy": 0.7484675496816635, "num_tokens": 17609343.0, "step": 475 }, { "entropy": 0.6124226823449135, "epoch": 3.0713706407137065, "grad_norm": 0.009730803780257702, "learning_rate": 0.0002, "loss": 0.6136341691017151, "mean_token_accuracy": 0.7490884363651276, "num_tokens": 17646448.0, "step": 476 }, { "entropy": 0.6132366731762886, "epoch": 3.0778588807785887, "grad_norm": 0.008984670974314213, "learning_rate": 0.0002, "loss": 0.6176835298538208, "mean_token_accuracy": 0.7453758120536804, "num_tokens": 17683285.0, "step": 477 }, { "entropy": 0.6138317957520485, "epoch": 3.0843471208434714, "grad_norm": 0.009527822025120258, "learning_rate": 0.0002, "loss": 0.6128236055374146, "mean_token_accuracy": 0.7498287856578827, "num_tokens": 17720424.0, "step": 478 }, { "entropy": 0.6150398552417755, "epoch": 3.0908353609083536, "grad_norm": 0.012212819419801235, "learning_rate": 0.0002, "loss": 0.6184934377670288, "mean_token_accuracy": 0.74715456366539, "num_tokens": 17757738.0, "step": 479 }, { "entropy": 0.6138227432966232, "epoch": 3.097323600973236, "grad_norm": 0.009692898020148277, "learning_rate": 0.0002, "loss": 0.615317165851593, "mean_token_accuracy": 0.7491249144077301, "num_tokens": 17794819.0, "step": 480 }, { "entropy": 0.6220738738775253, "epoch": 3.1038118410381186, "grad_norm": 0.009081809781491756, "learning_rate": 0.0002, "loss": 0.6233057975769043, "mean_token_accuracy": 0.7442603260278702, "num_tokens": 17832045.0, "step": 481 }, { "entropy": 0.6058575734496117, "epoch": 3.110300081103001, "grad_norm": 0.009930483065545559, "learning_rate": 0.0002, "loss": 0.6012391448020935, "mean_token_accuracy": 0.7559900879859924, "num_tokens": 17869448.0, "step": 482 }, { "entropy": 0.6158036887645721, "epoch": 3.116788321167883, "grad_norm": 0.009399381466209888, "learning_rate": 0.0002, "loss": 0.6149718761444092, "mean_token_accuracy": 0.7499518990516663, "num_tokens": 17906111.0, "step": 483 }, { "entropy": 0.6169976964592934, "epoch": 3.1232765612327658, "grad_norm": 0.009214673191308975, "learning_rate": 0.0002, "loss": 0.6195358037948608, "mean_token_accuracy": 0.744194358587265, "num_tokens": 17943306.0, "step": 484 }, { "entropy": 0.620849184691906, "epoch": 3.129764801297648, "grad_norm": 0.00997876189649105, "learning_rate": 0.0002, "loss": 0.6267833113670349, "mean_token_accuracy": 0.744784764945507, "num_tokens": 17980613.0, "step": 485 }, { "entropy": 0.6128402128815651, "epoch": 3.1362530413625302, "grad_norm": 0.008573702536523342, "learning_rate": 0.0002, "loss": 0.6157655715942383, "mean_token_accuracy": 0.7487166821956635, "num_tokens": 18017947.0, "step": 486 }, { "entropy": 0.622900165617466, "epoch": 3.142741281427413, "grad_norm": 0.009601105935871601, "learning_rate": 0.0002, "loss": 0.6263000965118408, "mean_token_accuracy": 0.7445476576685905, "num_tokens": 18055764.0, "step": 487 }, { "entropy": 0.6130729392170906, "epoch": 3.149229521492295, "grad_norm": 0.008899933658540249, "learning_rate": 0.0002, "loss": 0.6115667819976807, "mean_token_accuracy": 0.7505542188882828, "num_tokens": 18092869.0, "step": 488 }, { "entropy": 0.615093469619751, "epoch": 3.1557177615571774, "grad_norm": 0.009630289860069752, "learning_rate": 0.0002, "loss": 0.6127116084098816, "mean_token_accuracy": 0.74873948097229, "num_tokens": 18130032.0, "step": 489 }, { "entropy": 0.6184138208627701, "epoch": 3.16220600162206, "grad_norm": 0.009784260764718056, "learning_rate": 0.0002, "loss": 0.6196454763412476, "mean_token_accuracy": 0.7479289025068283, "num_tokens": 18167189.0, "step": 490 }, { "entropy": 0.6225049868226051, "epoch": 3.1686942416869424, "grad_norm": 0.009817374870181084, "learning_rate": 0.0002, "loss": 0.6254591345787048, "mean_token_accuracy": 0.7443916201591492, "num_tokens": 18204423.0, "step": 491 }, { "entropy": 0.599067859351635, "epoch": 3.1751824817518246, "grad_norm": 0.009707923047244549, "learning_rate": 0.0002, "loss": 0.603665292263031, "mean_token_accuracy": 0.7512796595692635, "num_tokens": 18241647.0, "step": 492 }, { "entropy": 0.6269692480564117, "epoch": 3.1816707218167073, "grad_norm": 0.009654807858169079, "learning_rate": 0.0002, "loss": 0.6272069215774536, "mean_token_accuracy": 0.7451600208878517, "num_tokens": 18278874.0, "step": 493 }, { "entropy": 0.60984867811203, "epoch": 3.1881589618815895, "grad_norm": 0.00973904225975275, "learning_rate": 0.0002, "loss": 0.6120602488517761, "mean_token_accuracy": 0.7500757128000259, "num_tokens": 18316077.0, "step": 494 }, { "entropy": 0.6112287938594818, "epoch": 3.1946472019464722, "grad_norm": 0.010687717236578465, "learning_rate": 0.0002, "loss": 0.607744038105011, "mean_token_accuracy": 0.7535340562462807, "num_tokens": 18353199.0, "step": 495 }, { "entropy": 0.6153931394219398, "epoch": 3.2011354420113545, "grad_norm": 0.009243862703442574, "learning_rate": 0.0002, "loss": 0.6182031035423279, "mean_token_accuracy": 0.7475122958421707, "num_tokens": 18390725.0, "step": 496 }, { "entropy": 0.6184414252638817, "epoch": 3.2076236820762367, "grad_norm": 0.009725847281515598, "learning_rate": 0.0002, "loss": 0.6202661395072937, "mean_token_accuracy": 0.7463328316807747, "num_tokens": 18428083.0, "step": 497 }, { "entropy": 0.6206400170922279, "epoch": 3.2141119221411194, "grad_norm": 0.009717848151922226, "learning_rate": 0.0002, "loss": 0.6237635612487793, "mean_token_accuracy": 0.7449309974908829, "num_tokens": 18465093.0, "step": 498 }, { "entropy": 0.6063303649425507, "epoch": 3.2206001622060016, "grad_norm": 0.009384922683238983, "learning_rate": 0.0002, "loss": 0.6071447134017944, "mean_token_accuracy": 0.750182680785656, "num_tokens": 18502351.0, "step": 499 }, { "entropy": 0.6171220317482948, "epoch": 3.227088402270884, "grad_norm": 0.010402821935713291, "learning_rate": 0.0002, "loss": 0.6183167695999146, "mean_token_accuracy": 0.7468552514910698, "num_tokens": 18540172.0, "step": 500 }, { "entropy": 0.6202204376459122, "epoch": 3.2335766423357666, "grad_norm": 0.008789432235062122, "learning_rate": 0.0002, "loss": 0.6224135160446167, "mean_token_accuracy": 0.745467983186245, "num_tokens": 18577734.0, "step": 501 }, { "entropy": 0.6132732257246971, "epoch": 3.240064882400649, "grad_norm": 0.010597198270261288, "learning_rate": 0.0002, "loss": 0.6129106283187866, "mean_token_accuracy": 0.7499266192317009, "num_tokens": 18614944.0, "step": 502 }, { "entropy": 0.6337689533829689, "epoch": 3.246553122465531, "grad_norm": 0.009572361595928669, "learning_rate": 0.0002, "loss": 0.6304764747619629, "mean_token_accuracy": 0.7434330955147743, "num_tokens": 18651997.0, "step": 503 }, { "entropy": 0.6075436845421791, "epoch": 3.2530413625304138, "grad_norm": 0.00990824680775404, "learning_rate": 0.0002, "loss": 0.6082068681716919, "mean_token_accuracy": 0.7516702488064766, "num_tokens": 18688674.0, "step": 504 }, { "entropy": 0.6139610409736633, "epoch": 3.259529602595296, "grad_norm": 0.010237157344818115, "learning_rate": 0.0002, "loss": 0.6186607480049133, "mean_token_accuracy": 0.7454981952905655, "num_tokens": 18726405.0, "step": 505 }, { "entropy": 0.6063608303666115, "epoch": 3.2660178426601782, "grad_norm": 0.010847094468772411, "learning_rate": 0.0002, "loss": 0.6137136816978455, "mean_token_accuracy": 0.7497691661119461, "num_tokens": 18763668.0, "step": 506 }, { "entropy": 0.6163499504327774, "epoch": 3.272506082725061, "grad_norm": 0.010017551481723785, "learning_rate": 0.0002, "loss": 0.6188673973083496, "mean_token_accuracy": 0.7473317757248878, "num_tokens": 18800872.0, "step": 507 }, { "entropy": 0.6251264810562134, "epoch": 3.278994322789943, "grad_norm": 0.011264265514910221, "learning_rate": 0.0002, "loss": 0.6177271604537964, "mean_token_accuracy": 0.7485972419381142, "num_tokens": 18838150.0, "step": 508 }, { "entropy": 0.6273062154650688, "epoch": 3.285482562854826, "grad_norm": 0.010041182860732079, "learning_rate": 0.0002, "loss": 0.6206075549125671, "mean_token_accuracy": 0.7470289915800095, "num_tokens": 18875738.0, "step": 509 }, { "entropy": 0.6267990991473198, "epoch": 3.291970802919708, "grad_norm": 0.011449483223259449, "learning_rate": 0.0002, "loss": 0.6346527934074402, "mean_token_accuracy": 0.7385271340608597, "num_tokens": 18913137.0, "step": 510 }, { "entropy": 0.6025072038173676, "epoch": 3.2984590429845904, "grad_norm": 0.010422894731163979, "learning_rate": 0.0002, "loss": 0.6072125434875488, "mean_token_accuracy": 0.7508590817451477, "num_tokens": 18950470.0, "step": 511 }, { "entropy": 0.6073831468820572, "epoch": 3.304947283049473, "grad_norm": 0.010642215609550476, "learning_rate": 0.0002, "loss": 0.6133738160133362, "mean_token_accuracy": 0.7492869570851326, "num_tokens": 18988313.0, "step": 512 }, { "entropy": 0.5974380895495415, "epoch": 3.3114355231143553, "grad_norm": 0.010486697778105736, "learning_rate": 0.0002, "loss": 0.6020730137825012, "mean_token_accuracy": 0.7548841238021851, "num_tokens": 19024956.0, "step": 513 }, { "entropy": 0.6128261536359787, "epoch": 3.3179237631792375, "grad_norm": 0.011510336771607399, "learning_rate": 0.0002, "loss": 0.6143049001693726, "mean_token_accuracy": 0.7480410858988762, "num_tokens": 19062179.0, "step": 514 }, { "entropy": 0.6077246218919754, "epoch": 3.3244120032441202, "grad_norm": 0.010107292793691158, "learning_rate": 0.0002, "loss": 0.6046852469444275, "mean_token_accuracy": 0.7533954977989197, "num_tokens": 19099090.0, "step": 515 }, { "entropy": 0.6247019246220589, "epoch": 3.3309002433090025, "grad_norm": 0.010466467589139938, "learning_rate": 0.0002, "loss": 0.6306489706039429, "mean_token_accuracy": 0.741244375705719, "num_tokens": 19136307.0, "step": 516 }, { "entropy": 0.6153485924005508, "epoch": 3.3373884833738847, "grad_norm": 0.009494316764175892, "learning_rate": 0.0002, "loss": 0.6167474985122681, "mean_token_accuracy": 0.7500151321291924, "num_tokens": 19173544.0, "step": 517 }, { "entropy": 0.6086971685290337, "epoch": 3.3438767234387674, "grad_norm": 0.009192675352096558, "learning_rate": 0.0002, "loss": 0.6096853017807007, "mean_token_accuracy": 0.7501685246825218, "num_tokens": 19210386.0, "step": 518 }, { "entropy": 0.6297651901841164, "epoch": 3.3503649635036497, "grad_norm": 0.009902825579047203, "learning_rate": 0.0002, "loss": 0.6314697265625, "mean_token_accuracy": 0.7417091131210327, "num_tokens": 19247761.0, "step": 519 }, { "entropy": 0.6149463355541229, "epoch": 3.356853203568532, "grad_norm": 0.009715819731354713, "learning_rate": 0.0002, "loss": 0.6137614250183105, "mean_token_accuracy": 0.7476155012845993, "num_tokens": 19284908.0, "step": 520 }, { "entropy": 0.6115437000989914, "epoch": 3.3633414436334146, "grad_norm": 0.009652029722929, "learning_rate": 0.0002, "loss": 0.6114376783370972, "mean_token_accuracy": 0.7499561905860901, "num_tokens": 19321727.0, "step": 521 }, { "entropy": 0.6143479123711586, "epoch": 3.369829683698297, "grad_norm": 0.010150844231247902, "learning_rate": 0.0002, "loss": 0.6162387132644653, "mean_token_accuracy": 0.7469704374670982, "num_tokens": 19359065.0, "step": 522 }, { "entropy": 0.6042628288269043, "epoch": 3.376317923763179, "grad_norm": 0.010199622251093388, "learning_rate": 0.0002, "loss": 0.607587456703186, "mean_token_accuracy": 0.7510121315717697, "num_tokens": 19396140.0, "step": 523 }, { "entropy": 0.6103994250297546, "epoch": 3.3828061638280618, "grad_norm": 0.009757442399859428, "learning_rate": 0.0002, "loss": 0.6118942499160767, "mean_token_accuracy": 0.7493396252393723, "num_tokens": 19433282.0, "step": 524 }, { "entropy": 0.6115303710103035, "epoch": 3.389294403892944, "grad_norm": 0.009843776933848858, "learning_rate": 0.0002, "loss": 0.6144024133682251, "mean_token_accuracy": 0.7491987869143486, "num_tokens": 19470735.0, "step": 525 }, { "entropy": 0.6124155074357986, "epoch": 3.3957826439578263, "grad_norm": 0.012832233682274818, "learning_rate": 0.0002, "loss": 0.6174359321594238, "mean_token_accuracy": 0.7484075799584389, "num_tokens": 19508279.0, "step": 526 }, { "entropy": 0.621652752161026, "epoch": 3.402270884022709, "grad_norm": 0.010444359853863716, "learning_rate": 0.0002, "loss": 0.6202374696731567, "mean_token_accuracy": 0.747683048248291, "num_tokens": 19545629.0, "step": 527 }, { "entropy": 0.6133333742618561, "epoch": 3.408759124087591, "grad_norm": 0.01157453190535307, "learning_rate": 0.0002, "loss": 0.6190609931945801, "mean_token_accuracy": 0.7481984347105026, "num_tokens": 19583135.0, "step": 528 }, { "entropy": 0.6031940132379532, "epoch": 3.4152473641524734, "grad_norm": 0.01220928505063057, "learning_rate": 0.0002, "loss": 0.60877525806427, "mean_token_accuracy": 0.7505937144160271, "num_tokens": 19620410.0, "step": 529 }, { "entropy": 0.6026583164930344, "epoch": 3.421735604217356, "grad_norm": 0.009105565026402473, "learning_rate": 0.0002, "loss": 0.6003735661506653, "mean_token_accuracy": 0.7538656741380692, "num_tokens": 19657757.0, "step": 530 }, { "entropy": 0.6212241724133492, "epoch": 3.4282238442822384, "grad_norm": 0.012120554223656654, "learning_rate": 0.0002, "loss": 0.6169411540031433, "mean_token_accuracy": 0.7489817962050438, "num_tokens": 19694775.0, "step": 531 }, { "entropy": 0.611191414296627, "epoch": 3.4347120843471206, "grad_norm": 0.010209856554865837, "learning_rate": 0.0002, "loss": 0.6133028268814087, "mean_token_accuracy": 0.7480586767196655, "num_tokens": 19731954.0, "step": 532 }, { "entropy": 0.6154542937874794, "epoch": 3.4412003244120033, "grad_norm": 0.009237438440322876, "learning_rate": 0.0002, "loss": 0.6181926131248474, "mean_token_accuracy": 0.7482445612549782, "num_tokens": 19769550.0, "step": 533 }, { "entropy": 0.6260659247636795, "epoch": 3.4476885644768855, "grad_norm": 0.011564482003450394, "learning_rate": 0.0002, "loss": 0.6311028599739075, "mean_token_accuracy": 0.7445508390665054, "num_tokens": 19806694.0, "step": 534 }, { "entropy": 0.6114797592163086, "epoch": 3.4541768045417682, "grad_norm": 0.011250223033130169, "learning_rate": 0.0002, "loss": 0.6188318133354187, "mean_token_accuracy": 0.7451098337769508, "num_tokens": 19843897.0, "step": 535 }, { "entropy": 0.6260335817933083, "epoch": 3.4606650446066505, "grad_norm": 0.00978784915059805, "learning_rate": 0.0002, "loss": 0.6255401372909546, "mean_token_accuracy": 0.7468025237321854, "num_tokens": 19881321.0, "step": 536 }, { "entropy": 0.6212326288223267, "epoch": 3.4671532846715327, "grad_norm": 0.013453345745801926, "learning_rate": 0.0002, "loss": 0.611083984375, "mean_token_accuracy": 0.7521479055285454, "num_tokens": 19918768.0, "step": 537 }, { "entropy": 0.6172696650028229, "epoch": 3.4736415247364154, "grad_norm": 0.010021936148405075, "learning_rate": 0.0002, "loss": 0.6165583729743958, "mean_token_accuracy": 0.7488679885864258, "num_tokens": 19956374.0, "step": 538 }, { "entropy": 0.5984770804643631, "epoch": 3.4801297648012977, "grad_norm": 0.010912574827671051, "learning_rate": 0.0002, "loss": 0.6038742065429688, "mean_token_accuracy": 0.752843476831913, "num_tokens": 19993165.0, "step": 539 }, { "entropy": 0.6006497591733932, "epoch": 3.48661800486618, "grad_norm": 0.010195601731538773, "learning_rate": 0.0002, "loss": 0.6058304905891418, "mean_token_accuracy": 0.7511888965964317, "num_tokens": 20030632.0, "step": 540 }, { "entropy": 0.603807657957077, "epoch": 3.4931062449310626, "grad_norm": 0.010789190419018269, "learning_rate": 0.0002, "loss": 0.6101077198982239, "mean_token_accuracy": 0.7498170882463455, "num_tokens": 20067720.0, "step": 541 }, { "entropy": 0.6094614043831825, "epoch": 3.499594484995945, "grad_norm": 0.010353523306548595, "learning_rate": 0.0002, "loss": 0.6108995676040649, "mean_token_accuracy": 0.7505486905574799, "num_tokens": 20105092.0, "step": 542 }, { "entropy": 0.6127925515174866, "epoch": 3.5060827250608275, "grad_norm": 0.011608858592808247, "learning_rate": 0.0002, "loss": 0.6113302111625671, "mean_token_accuracy": 0.7498401030898094, "num_tokens": 20142060.0, "step": 543 }, { "entropy": 0.6288227662444115, "epoch": 3.5125709651257098, "grad_norm": 0.00944559182971716, "learning_rate": 0.0002, "loss": 0.6295347213745117, "mean_token_accuracy": 0.7438011020421982, "num_tokens": 20179321.0, "step": 544 }, { "entropy": 0.6155826225876808, "epoch": 3.519059205190592, "grad_norm": 0.010050074197351933, "learning_rate": 0.0002, "loss": 0.6170110106468201, "mean_token_accuracy": 0.7460537254810333, "num_tokens": 20216788.0, "step": 545 }, { "entropy": 0.6109997108578682, "epoch": 3.5255474452554747, "grad_norm": 0.010288557037711143, "learning_rate": 0.0002, "loss": 0.6153451204299927, "mean_token_accuracy": 0.747114397585392, "num_tokens": 20254482.0, "step": 546 }, { "entropy": 0.6220259815454483, "epoch": 3.532035685320357, "grad_norm": 0.010569143109023571, "learning_rate": 0.0002, "loss": 0.6245878338813782, "mean_token_accuracy": 0.745466060936451, "num_tokens": 20291323.0, "step": 547 }, { "entropy": 0.6251974999904633, "epoch": 3.538523925385239, "grad_norm": 0.010512638837099075, "learning_rate": 0.0002, "loss": 0.6209877729415894, "mean_token_accuracy": 0.7460760995745659, "num_tokens": 20328541.0, "step": 548 }, { "entropy": 0.6372380778193474, "epoch": 3.545012165450122, "grad_norm": 0.009989661164581776, "learning_rate": 0.0002, "loss": 0.63493812084198, "mean_token_accuracy": 0.7409111261367798, "num_tokens": 20366154.0, "step": 549 }, { "entropy": 0.616200253367424, "epoch": 3.551500405515004, "grad_norm": 0.009802714921534061, "learning_rate": 0.0002, "loss": 0.6198533773422241, "mean_token_accuracy": 0.7493973523378372, "num_tokens": 20403539.0, "step": 550 }, { "entropy": 0.6109699085354805, "epoch": 3.5579886455798864, "grad_norm": 0.011730330996215343, "learning_rate": 0.0002, "loss": 0.6169507503509521, "mean_token_accuracy": 0.7469825968146324, "num_tokens": 20440857.0, "step": 551 }, { "entropy": 0.6107888966798782, "epoch": 3.564476885644769, "grad_norm": 0.010902747511863708, "learning_rate": 0.0002, "loss": 0.6169427633285522, "mean_token_accuracy": 0.7473291158676147, "num_tokens": 20478685.0, "step": 552 }, { "entropy": 0.6232053637504578, "epoch": 3.5709651257096513, "grad_norm": 0.01024220883846283, "learning_rate": 0.0002, "loss": 0.6223392486572266, "mean_token_accuracy": 0.7471131235361099, "num_tokens": 20516186.0, "step": 553 }, { "entropy": 0.6318716630339622, "epoch": 3.5774533657745335, "grad_norm": 0.00972492340952158, "learning_rate": 0.0002, "loss": 0.6295208930969238, "mean_token_accuracy": 0.7421210557222366, "num_tokens": 20553418.0, "step": 554 }, { "entropy": 0.6323020830750465, "epoch": 3.5839416058394162, "grad_norm": 0.009747047908604145, "learning_rate": 0.0002, "loss": 0.6291106343269348, "mean_token_accuracy": 0.742633767426014, "num_tokens": 20590921.0, "step": 555 }, { "entropy": 0.6193426549434662, "epoch": 3.5904298459042985, "grad_norm": 0.009529096074402332, "learning_rate": 0.0002, "loss": 0.622657299041748, "mean_token_accuracy": 0.7454424574971199, "num_tokens": 20628134.0, "step": 556 }, { "entropy": 0.606108270585537, "epoch": 3.5969180859691807, "grad_norm": 0.01090499758720398, "learning_rate": 0.0002, "loss": 0.6156042218208313, "mean_token_accuracy": 0.7475811764597893, "num_tokens": 20665529.0, "step": 557 }, { "entropy": 0.6024795696139336, "epoch": 3.6034063260340634, "grad_norm": 0.01122215110808611, "learning_rate": 0.0002, "loss": 0.6096351146697998, "mean_token_accuracy": 0.7500594854354858, "num_tokens": 20702623.0, "step": 558 }, { "entropy": 0.6050852239131927, "epoch": 3.6098945660989457, "grad_norm": 0.008911820128560066, "learning_rate": 0.0002, "loss": 0.6063804626464844, "mean_token_accuracy": 0.750556543469429, "num_tokens": 20739535.0, "step": 559 }, { "entropy": 0.6184356659650803, "epoch": 3.616382806163828, "grad_norm": 0.008947025053203106, "learning_rate": 0.0002, "loss": 0.6186281442642212, "mean_token_accuracy": 0.7470304444432259, "num_tokens": 20776900.0, "step": 560 }, { "entropy": 0.6115831136703491, "epoch": 3.6228710462287106, "grad_norm": 0.010605190880596638, "learning_rate": 0.0002, "loss": 0.6092396974563599, "mean_token_accuracy": 0.750456377863884, "num_tokens": 20814326.0, "step": 561 }, { "entropy": 0.6234035491943359, "epoch": 3.629359286293593, "grad_norm": 0.010619143024086952, "learning_rate": 0.0002, "loss": 0.622122585773468, "mean_token_accuracy": 0.7449623718857765, "num_tokens": 20851735.0, "step": 562 }, { "entropy": 0.6131063625216484, "epoch": 3.635847526358475, "grad_norm": 0.009914328344166279, "learning_rate": 0.0002, "loss": 0.6129999160766602, "mean_token_accuracy": 0.7512071952223778, "num_tokens": 20888959.0, "step": 563 }, { "entropy": 0.6103895530104637, "epoch": 3.6423357664233578, "grad_norm": 0.009590883739292622, "learning_rate": 0.0002, "loss": 0.6121896505355835, "mean_token_accuracy": 0.7519041821360588, "num_tokens": 20926880.0, "step": 564 }, { "entropy": 0.6107024624943733, "epoch": 3.64882400648824, "grad_norm": 0.010136992670595646, "learning_rate": 0.0002, "loss": 0.615648090839386, "mean_token_accuracy": 0.7478983402252197, "num_tokens": 20964278.0, "step": 565 }, { "entropy": 0.6019061878323555, "epoch": 3.6553122465531223, "grad_norm": 0.01197731215506792, "learning_rate": 0.0002, "loss": 0.6083622574806213, "mean_token_accuracy": 0.752247080206871, "num_tokens": 21001703.0, "step": 566 }, { "entropy": 0.6136230602860451, "epoch": 3.661800486618005, "grad_norm": 0.010383468121290207, "learning_rate": 0.0002, "loss": 0.6142981052398682, "mean_token_accuracy": 0.750029981136322, "num_tokens": 21039545.0, "step": 567 }, { "entropy": 0.6270170286297798, "epoch": 3.668288726682887, "grad_norm": 0.01222953386604786, "learning_rate": 0.0002, "loss": 0.622101902961731, "mean_token_accuracy": 0.7463989406824112, "num_tokens": 21076601.0, "step": 568 }, { "entropy": 0.635653018951416, "epoch": 3.6747769667477694, "grad_norm": 0.009029991924762726, "learning_rate": 0.0002, "loss": 0.6368217468261719, "mean_token_accuracy": 0.739650160074234, "num_tokens": 21113628.0, "step": 569 }, { "entropy": 0.6155265644192696, "epoch": 3.681265206812652, "grad_norm": 0.010669651441276073, "learning_rate": 0.0002, "loss": 0.6169142723083496, "mean_token_accuracy": 0.7483588233590126, "num_tokens": 21150841.0, "step": 570 }, { "entropy": 0.6179278939962387, "epoch": 3.6877534468775344, "grad_norm": 0.01090275775641203, "learning_rate": 0.0002, "loss": 0.620256781578064, "mean_token_accuracy": 0.7459961548447609, "num_tokens": 21188047.0, "step": 571 }, { "entropy": 0.6013471409678459, "epoch": 3.6942416869424166, "grad_norm": 0.013129356317222118, "learning_rate": 0.0002, "loss": 0.6093657612800598, "mean_token_accuracy": 0.7505828440189362, "num_tokens": 21224977.0, "step": 572 }, { "entropy": 0.6192966923117638, "epoch": 3.7007299270072993, "grad_norm": 0.01149990689009428, "learning_rate": 0.0002, "loss": 0.624458909034729, "mean_token_accuracy": 0.7465271949768066, "num_tokens": 21262229.0, "step": 573 }, { "entropy": 0.6305530145764351, "epoch": 3.7072181670721815, "grad_norm": 0.011260929517447948, "learning_rate": 0.0002, "loss": 0.6282562613487244, "mean_token_accuracy": 0.7442766949534416, "num_tokens": 21299934.0, "step": 574 }, { "entropy": 0.6216496974229813, "epoch": 3.7137064071370642, "grad_norm": 0.011454667896032333, "learning_rate": 0.0002, "loss": 0.6176272630691528, "mean_token_accuracy": 0.7486661300063133, "num_tokens": 21337298.0, "step": 575 }, { "entropy": 0.6251465007662773, "epoch": 3.7201946472019465, "grad_norm": 0.011989898979663849, "learning_rate": 0.0002, "loss": 0.6237755417823792, "mean_token_accuracy": 0.7449339032173157, "num_tokens": 21374338.0, "step": 576 }, { "entropy": 0.6160696297883987, "epoch": 3.7266828872668287, "grad_norm": 0.009978833608329296, "learning_rate": 0.0002, "loss": 0.6201364398002625, "mean_token_accuracy": 0.7472834289073944, "num_tokens": 21411412.0, "step": 577 }, { "entropy": 0.6086283698678017, "epoch": 3.7331711273317114, "grad_norm": 0.01127020176500082, "learning_rate": 0.0002, "loss": 0.6133439540863037, "mean_token_accuracy": 0.7486971095204353, "num_tokens": 21449184.0, "step": 578 }, { "entropy": 0.6155035272240639, "epoch": 3.7396593673965937, "grad_norm": 0.009915207512676716, "learning_rate": 0.0002, "loss": 0.6193184852600098, "mean_token_accuracy": 0.7452678084373474, "num_tokens": 21486452.0, "step": 579 }, { "entropy": 0.6227790787816048, "epoch": 3.7461476074614763, "grad_norm": 0.009025565348565578, "learning_rate": 0.0002, "loss": 0.6250243186950684, "mean_token_accuracy": 0.7430055662989616, "num_tokens": 21524049.0, "step": 580 }, { "entropy": 0.6145926639437675, "epoch": 3.7526358475263586, "grad_norm": 0.010546623729169369, "learning_rate": 0.0002, "loss": 0.6121389269828796, "mean_token_accuracy": 0.7498128041625023, "num_tokens": 21560910.0, "step": 581 }, { "entropy": 0.6132489815354347, "epoch": 3.759124087591241, "grad_norm": 0.01081460528075695, "learning_rate": 0.0002, "loss": 0.6121793389320374, "mean_token_accuracy": 0.7495040893554688, "num_tokens": 21598124.0, "step": 582 }, { "entropy": 0.6323688253760338, "epoch": 3.7656123276561235, "grad_norm": 0.010107534937560558, "learning_rate": 0.0002, "loss": 0.6294635534286499, "mean_token_accuracy": 0.7433409690856934, "num_tokens": 21635437.0, "step": 583 }, { "entropy": 0.6125660836696625, "epoch": 3.7721005677210058, "grad_norm": 0.00997902825474739, "learning_rate": 0.0002, "loss": 0.6156618595123291, "mean_token_accuracy": 0.7480011209845543, "num_tokens": 21672898.0, "step": 584 }, { "entropy": 0.6139216870069504, "epoch": 3.778588807785888, "grad_norm": 0.01199332345277071, "learning_rate": 0.0002, "loss": 0.6214488744735718, "mean_token_accuracy": 0.748315691947937, "num_tokens": 21710166.0, "step": 585 }, { "entropy": 0.5991447791457176, "epoch": 3.7850770478507707, "grad_norm": 0.01200946606695652, "learning_rate": 0.0002, "loss": 0.6080783605575562, "mean_token_accuracy": 0.7511922717094421, "num_tokens": 21746897.0, "step": 586 }, { "entropy": 0.6105977669358253, "epoch": 3.791565287915653, "grad_norm": 0.011675121262669563, "learning_rate": 0.0002, "loss": 0.6159127950668335, "mean_token_accuracy": 0.7491589412093163, "num_tokens": 21784354.0, "step": 587 }, { "entropy": 0.6225078999996185, "epoch": 3.798053527980535, "grad_norm": 0.00965933594852686, "learning_rate": 0.0002, "loss": 0.6214642524719238, "mean_token_accuracy": 0.7455714717507362, "num_tokens": 21821856.0, "step": 588 }, { "entropy": 0.627250537276268, "epoch": 3.804541768045418, "grad_norm": 0.010286493226885796, "learning_rate": 0.0002, "loss": 0.6219584345817566, "mean_token_accuracy": 0.7479822859168053, "num_tokens": 21858968.0, "step": 589 }, { "entropy": 0.6303782388567924, "epoch": 3.8110300081103, "grad_norm": 0.009684202261269093, "learning_rate": 0.0002, "loss": 0.629400372505188, "mean_token_accuracy": 0.7433283776044846, "num_tokens": 21896486.0, "step": 590 }, { "entropy": 0.6274826601147652, "epoch": 3.8175182481751824, "grad_norm": 0.00968723464757204, "learning_rate": 0.0002, "loss": 0.6308175325393677, "mean_token_accuracy": 0.7409676983952522, "num_tokens": 21933746.0, "step": 591 }, { "entropy": 0.607462614774704, "epoch": 3.824006488240065, "grad_norm": 0.010024085640907288, "learning_rate": 0.0002, "loss": 0.6111215353012085, "mean_token_accuracy": 0.7507134452462196, "num_tokens": 21970727.0, "step": 592 }, { "entropy": 0.6113528236746788, "epoch": 3.8304947283049473, "grad_norm": 0.009630702435970306, "learning_rate": 0.0002, "loss": 0.615958571434021, "mean_token_accuracy": 0.7483637630939484, "num_tokens": 22008126.0, "step": 593 }, { "entropy": 0.6118894517421722, "epoch": 3.8369829683698295, "grad_norm": 0.00891201663762331, "learning_rate": 0.0002, "loss": 0.6150209903717041, "mean_token_accuracy": 0.7505509406328201, "num_tokens": 22045058.0, "step": 594 }, { "entropy": 0.6181119605898857, "epoch": 3.8434712084347122, "grad_norm": 0.00870099663734436, "learning_rate": 0.0002, "loss": 0.6192715764045715, "mean_token_accuracy": 0.7477136552333832, "num_tokens": 22082485.0, "step": 595 }, { "entropy": 0.6250515654683113, "epoch": 3.8499594484995945, "grad_norm": 0.00869520753622055, "learning_rate": 0.0002, "loss": 0.6237080097198486, "mean_token_accuracy": 0.7448958083987236, "num_tokens": 22120186.0, "step": 596 }, { "entropy": 0.6200907677412033, "epoch": 3.8564476885644767, "grad_norm": 0.008723787032067776, "learning_rate": 0.0002, "loss": 0.6199079751968384, "mean_token_accuracy": 0.7453882619738579, "num_tokens": 22157538.0, "step": 597 }, { "entropy": 0.6176511943340302, "epoch": 3.8629359286293594, "grad_norm": 0.010193057358264923, "learning_rate": 0.0002, "loss": 0.6177176237106323, "mean_token_accuracy": 0.7501931935548782, "num_tokens": 22195003.0, "step": 598 }, { "entropy": 0.6236204281449318, "epoch": 3.8694241686942417, "grad_norm": 0.00979641918092966, "learning_rate": 0.0002, "loss": 0.6303654909133911, "mean_token_accuracy": 0.7406158596277237, "num_tokens": 22232607.0, "step": 599 }, { "entropy": 0.6202436164021492, "epoch": 3.875912408759124, "grad_norm": 0.010212398134171963, "learning_rate": 0.0002, "loss": 0.6213873028755188, "mean_token_accuracy": 0.7464328482747078, "num_tokens": 22269920.0, "step": 600 }, { "entropy": 0.613631397485733, "epoch": 3.8824006488240066, "grad_norm": 0.009876083582639694, "learning_rate": 0.0002, "loss": 0.6182212829589844, "mean_token_accuracy": 0.7480113580822945, "num_tokens": 22306694.0, "step": 601 }, { "entropy": 0.6167808622121811, "epoch": 3.888888888888889, "grad_norm": 0.010310813784599304, "learning_rate": 0.0002, "loss": 0.6251655220985413, "mean_token_accuracy": 0.7455293834209442, "num_tokens": 22343827.0, "step": 602 }, { "entropy": 0.6132790520787239, "epoch": 3.895377128953771, "grad_norm": 0.009235870093107224, "learning_rate": 0.0002, "loss": 0.6129046678543091, "mean_token_accuracy": 0.7505499720573425, "num_tokens": 22381214.0, "step": 603 }, { "entropy": 0.6209843009710312, "epoch": 3.9018653690186538, "grad_norm": 0.009926384314894676, "learning_rate": 0.0002, "loss": 0.6192604899406433, "mean_token_accuracy": 0.7472119927406311, "num_tokens": 22418601.0, "step": 604 }, { "entropy": 0.6364298164844513, "epoch": 3.908353609083536, "grad_norm": 0.011292664334177971, "learning_rate": 0.0002, "loss": 0.6354763507843018, "mean_token_accuracy": 0.742254801094532, "num_tokens": 22455732.0, "step": 605 }, { "entropy": 0.6375604569911957, "epoch": 3.9148418491484183, "grad_norm": 0.009769946336746216, "learning_rate": 0.0002, "loss": 0.6385936737060547, "mean_token_accuracy": 0.7394958734512329, "num_tokens": 22492996.0, "step": 606 }, { "entropy": 0.6145768612623215, "epoch": 3.921330089213301, "grad_norm": 0.010400141589343548, "learning_rate": 0.0002, "loss": 0.6150961518287659, "mean_token_accuracy": 0.7494016960263252, "num_tokens": 22530887.0, "step": 607 }, { "entropy": 0.6110121458768845, "epoch": 3.927818329278183, "grad_norm": 0.01383623294532299, "learning_rate": 0.0002, "loss": 0.6156477332115173, "mean_token_accuracy": 0.7485735863447189, "num_tokens": 22568066.0, "step": 608 }, { "entropy": 0.6164045110344887, "epoch": 3.9343065693430654, "grad_norm": 0.011148249730467796, "learning_rate": 0.0002, "loss": 0.6243358850479126, "mean_token_accuracy": 0.7457598373293877, "num_tokens": 22605687.0, "step": 609 }, { "entropy": 0.6160785332322121, "epoch": 3.940794809407948, "grad_norm": 0.011384137906134129, "learning_rate": 0.0002, "loss": 0.6210045218467712, "mean_token_accuracy": 0.7471992895007133, "num_tokens": 22642646.0, "step": 610 }, { "entropy": 0.6149823144078255, "epoch": 3.9472830494728304, "grad_norm": 0.012957974337041378, "learning_rate": 0.0002, "loss": 0.6171556711196899, "mean_token_accuracy": 0.7489227131009102, "num_tokens": 22679842.0, "step": 611 }, { "entropy": 0.6145467907190323, "epoch": 3.9537712895377126, "grad_norm": 0.010933002457022667, "learning_rate": 0.0002, "loss": 0.6167636513710022, "mean_token_accuracy": 0.7463917657732964, "num_tokens": 22717084.0, "step": 612 }, { "entropy": 0.6232969015836716, "epoch": 3.9602595296025953, "grad_norm": 0.009922384284436703, "learning_rate": 0.0002, "loss": 0.6252729892730713, "mean_token_accuracy": 0.743752971291542, "num_tokens": 22754399.0, "step": 613 }, { "entropy": 0.6329927816987038, "epoch": 3.9667477696674776, "grad_norm": 0.012450586073100567, "learning_rate": 0.0002, "loss": 0.6310559511184692, "mean_token_accuracy": 0.7443704977631569, "num_tokens": 22791668.0, "step": 614 }, { "entropy": 0.6241239309310913, "epoch": 3.9732360097323602, "grad_norm": 0.010473434813320637, "learning_rate": 0.0002, "loss": 0.6205140352249146, "mean_token_accuracy": 0.7461888715624809, "num_tokens": 22829072.0, "step": 615 }, { "entropy": 0.6387766450643539, "epoch": 3.9797242497972425, "grad_norm": 0.011033239774405956, "learning_rate": 0.0002, "loss": 0.638136088848114, "mean_token_accuracy": 0.7390930280089378, "num_tokens": 22866252.0, "step": 616 }, { "entropy": 0.6195501312613487, "epoch": 3.986212489862125, "grad_norm": 0.011396627873182297, "learning_rate": 0.0002, "loss": 0.6249865293502808, "mean_token_accuracy": 0.7435013577342033, "num_tokens": 22903910.0, "step": 617 }, { "entropy": 0.6073991656303406, "epoch": 3.9927007299270074, "grad_norm": 0.011404155753552914, "learning_rate": 0.0002, "loss": 0.6144699454307556, "mean_token_accuracy": 0.7486153542995453, "num_tokens": 22941419.0, "step": 618 }, { "entropy": 0.6133335530757904, "epoch": 3.9991889699918897, "grad_norm": 0.012148975394666195, "learning_rate": 0.0002, "loss": 0.6239128112792969, "mean_token_accuracy": 0.744051106274128, "num_tokens": 22978672.0, "step": 619 }, { "entropy": 0.6109002828598022, "epoch": 4.0, "grad_norm": 0.02331351302564144, "learning_rate": 0.0002, "loss": 0.6144630312919617, "mean_token_accuracy": 0.7544165849685669, "num_tokens": 22983289.0, "step": 620 }, { "entropy": 0.6217539757490158, "epoch": 4.006488240064883, "grad_norm": 0.013456643559038639, "learning_rate": 0.0002, "loss": 0.613330602645874, "mean_token_accuracy": 0.7499688565731049, "num_tokens": 23020412.0, "step": 621 }, { "entropy": 0.6039147675037384, "epoch": 4.0129764801297645, "grad_norm": 0.013175777159631252, "learning_rate": 0.0002, "loss": 0.597152829170227, "mean_token_accuracy": 0.7552643939852715, "num_tokens": 23057448.0, "step": 622 }, { "entropy": 0.6142989620566368, "epoch": 4.019464720194647, "grad_norm": 0.014114204794168472, "learning_rate": 0.0002, "loss": 0.6228339672088623, "mean_token_accuracy": 0.744938038289547, "num_tokens": 23094545.0, "step": 623 }, { "entropy": 0.6015428304672241, "epoch": 4.02595296025953, "grad_norm": 0.015099803917109966, "learning_rate": 0.0002, "loss": 0.6131606698036194, "mean_token_accuracy": 0.7470837756991386, "num_tokens": 23131965.0, "step": 624 }, { "entropy": 0.5885332375764847, "epoch": 4.032441200324412, "grad_norm": 0.014588817954063416, "learning_rate": 0.0002, "loss": 0.593397855758667, "mean_token_accuracy": 0.7566570267081261, "num_tokens": 23168813.0, "step": 625 }, { "entropy": 0.6016655787825584, "epoch": 4.038929440389294, "grad_norm": 0.012094132602214813, "learning_rate": 0.0002, "loss": 0.6046090126037598, "mean_token_accuracy": 0.7522159889340401, "num_tokens": 23205779.0, "step": 626 }, { "entropy": 0.6151943281292915, "epoch": 4.045417680454177, "grad_norm": 0.012667203322052956, "learning_rate": 0.0002, "loss": 0.6111838221549988, "mean_token_accuracy": 0.7486316040158272, "num_tokens": 23242684.0, "step": 627 }, { "entropy": 0.6105204373598099, "epoch": 4.051905920519059, "grad_norm": 0.011044032871723175, "learning_rate": 0.0002, "loss": 0.6119928956031799, "mean_token_accuracy": 0.7496168315410614, "num_tokens": 23279684.0, "step": 628 }, { "entropy": 0.6080695539712906, "epoch": 4.0583941605839415, "grad_norm": 0.012295052409172058, "learning_rate": 0.0002, "loss": 0.6104212999343872, "mean_token_accuracy": 0.7498067244887352, "num_tokens": 23316599.0, "step": 629 }, { "entropy": 0.6009281948208809, "epoch": 4.064882400648824, "grad_norm": 0.012583774514496326, "learning_rate": 0.0002, "loss": 0.6041219234466553, "mean_token_accuracy": 0.7518585100769997, "num_tokens": 23353800.0, "step": 630 }, { "entropy": 0.6015147417783737, "epoch": 4.071370640713706, "grad_norm": 0.011909936554729939, "learning_rate": 0.0002, "loss": 0.6030286550521851, "mean_token_accuracy": 0.7531652525067329, "num_tokens": 23390939.0, "step": 631 }, { "entropy": 0.6044563055038452, "epoch": 4.077858880778589, "grad_norm": 0.011805822141468525, "learning_rate": 0.0002, "loss": 0.6060421466827393, "mean_token_accuracy": 0.7509199753403664, "num_tokens": 23427956.0, "step": 632 }, { "entropy": 0.6049995571374893, "epoch": 4.084347120843471, "grad_norm": 0.012876358814537525, "learning_rate": 0.0002, "loss": 0.6117682456970215, "mean_token_accuracy": 0.7485300377011299, "num_tokens": 23465445.0, "step": 633 }, { "entropy": 0.6048118397593498, "epoch": 4.090835360908353, "grad_norm": 0.012466302141547203, "learning_rate": 0.0002, "loss": 0.6076602339744568, "mean_token_accuracy": 0.7526114881038666, "num_tokens": 23502361.0, "step": 634 }, { "entropy": 0.6199515163898468, "epoch": 4.097323600973236, "grad_norm": 0.013892917893826962, "learning_rate": 0.0002, "loss": 0.6193369626998901, "mean_token_accuracy": 0.7488663196563721, "num_tokens": 23540086.0, "step": 635 }, { "entropy": 0.6109070330858231, "epoch": 4.103811841038119, "grad_norm": 0.012778576463460922, "learning_rate": 0.0002, "loss": 0.6099793910980225, "mean_token_accuracy": 0.7521104216575623, "num_tokens": 23577435.0, "step": 636 }, { "entropy": 0.6217869147658348, "epoch": 4.110300081103, "grad_norm": 0.011083797551691532, "learning_rate": 0.0002, "loss": 0.6223993301391602, "mean_token_accuracy": 0.7441250160336494, "num_tokens": 23614892.0, "step": 637 }, { "entropy": 0.6092150881886482, "epoch": 4.116788321167883, "grad_norm": 0.011457768268883228, "learning_rate": 0.0002, "loss": 0.6109668016433716, "mean_token_accuracy": 0.7505389377474785, "num_tokens": 23652404.0, "step": 638 }, { "entropy": 0.5892162844538689, "epoch": 4.123276561232766, "grad_norm": 0.011224270798265934, "learning_rate": 0.0002, "loss": 0.5923285484313965, "mean_token_accuracy": 0.7561718374490738, "num_tokens": 23689182.0, "step": 639 }, { "entropy": 0.6155631691217422, "epoch": 4.1297648012976484, "grad_norm": 0.011392487213015556, "learning_rate": 0.0002, "loss": 0.6169704794883728, "mean_token_accuracy": 0.7484367191791534, "num_tokens": 23726827.0, "step": 640 }, { "entropy": 0.6134647503495216, "epoch": 4.13625304136253, "grad_norm": 0.01305895671248436, "learning_rate": 0.0002, "loss": 0.6227377653121948, "mean_token_accuracy": 0.7455505281686783, "num_tokens": 23764215.0, "step": 641 }, { "entropy": 0.6127767860889435, "epoch": 4.142741281427413, "grad_norm": 0.011744504794478416, "learning_rate": 0.0002, "loss": 0.6154167056083679, "mean_token_accuracy": 0.7480334118008614, "num_tokens": 23801609.0, "step": 642 }, { "entropy": 0.6113294437527657, "epoch": 4.149229521492296, "grad_norm": 0.013036824762821198, "learning_rate": 0.0002, "loss": 0.6141045093536377, "mean_token_accuracy": 0.7493610754609108, "num_tokens": 23839155.0, "step": 643 }, { "entropy": 0.6171691864728928, "epoch": 4.155717761557177, "grad_norm": 0.012765160761773586, "learning_rate": 0.0002, "loss": 0.6207258701324463, "mean_token_accuracy": 0.7462699934840202, "num_tokens": 23876532.0, "step": 644 }, { "entropy": 0.6020215824246407, "epoch": 4.16220600162206, "grad_norm": 0.011224629357457161, "learning_rate": 0.0002, "loss": 0.6040517091751099, "mean_token_accuracy": 0.7520366311073303, "num_tokens": 23913624.0, "step": 645 }, { "entropy": 0.6073898002505302, "epoch": 4.168694241686943, "grad_norm": 0.012669643387198448, "learning_rate": 0.0002, "loss": 0.6089828610420227, "mean_token_accuracy": 0.751623198390007, "num_tokens": 23951134.0, "step": 646 }, { "entropy": 0.6056643575429916, "epoch": 4.175182481751825, "grad_norm": 0.013099576346576214, "learning_rate": 0.0002, "loss": 0.6066282391548157, "mean_token_accuracy": 0.7509062737226486, "num_tokens": 23988712.0, "step": 647 }, { "entropy": 0.6190872266888618, "epoch": 4.181670721816707, "grad_norm": 0.013141883537173271, "learning_rate": 0.0002, "loss": 0.6172468662261963, "mean_token_accuracy": 0.7470818608999252, "num_tokens": 24025925.0, "step": 648 }, { "entropy": 0.6018052324652672, "epoch": 4.18815896188159, "grad_norm": 0.01188298873603344, "learning_rate": 0.0002, "loss": 0.6035501956939697, "mean_token_accuracy": 0.7526876479387283, "num_tokens": 24063159.0, "step": 649 }, { "entropy": 0.6047950685024261, "epoch": 4.194647201946472, "grad_norm": 0.014647013507783413, "learning_rate": 0.0002, "loss": 0.6088840961456299, "mean_token_accuracy": 0.7501959800720215, "num_tokens": 24100259.0, "step": 650 }, { "entropy": 0.6092503741383553, "epoch": 4.2011354420113545, "grad_norm": 0.012967122718691826, "learning_rate": 0.0002, "loss": 0.6154978275299072, "mean_token_accuracy": 0.7469052001833916, "num_tokens": 24137670.0, "step": 651 }, { "entropy": 0.6076086908578873, "epoch": 4.207623682076237, "grad_norm": 0.015226679854094982, "learning_rate": 0.0002, "loss": 0.6063575744628906, "mean_token_accuracy": 0.7520931884646416, "num_tokens": 24174990.0, "step": 652 }, { "entropy": 0.5980376899242401, "epoch": 4.214111922141119, "grad_norm": 0.01129455491900444, "learning_rate": 0.0002, "loss": 0.5961977243423462, "mean_token_accuracy": 0.7564675956964493, "num_tokens": 24212331.0, "step": 653 }, { "entropy": 0.6016443520784378, "epoch": 4.220600162206002, "grad_norm": 0.014820009469985962, "learning_rate": 0.0002, "loss": 0.6029236912727356, "mean_token_accuracy": 0.7525514140725136, "num_tokens": 24249375.0, "step": 654 }, { "entropy": 0.6087661758065224, "epoch": 4.227088402270884, "grad_norm": 0.0128677599132061, "learning_rate": 0.0002, "loss": 0.6112372279167175, "mean_token_accuracy": 0.748601570725441, "num_tokens": 24286871.0, "step": 655 }, { "entropy": 0.615173451602459, "epoch": 4.233576642335766, "grad_norm": 0.013609779067337513, "learning_rate": 0.0002, "loss": 0.6189801096916199, "mean_token_accuracy": 0.7472759932279587, "num_tokens": 24323996.0, "step": 656 }, { "entropy": 0.6089212968945503, "epoch": 4.240064882400649, "grad_norm": 0.013383638113737106, "learning_rate": 0.0002, "loss": 0.6078221797943115, "mean_token_accuracy": 0.7503775134682655, "num_tokens": 24361162.0, "step": 657 }, { "entropy": 0.6125769466161728, "epoch": 4.2465531224655315, "grad_norm": 0.01211923360824585, "learning_rate": 0.0002, "loss": 0.6157176494598389, "mean_token_accuracy": 0.7472077012062073, "num_tokens": 24398308.0, "step": 658 }, { "entropy": 0.6129145845770836, "epoch": 4.253041362530413, "grad_norm": 0.013655205257236958, "learning_rate": 0.0002, "loss": 0.6173056364059448, "mean_token_accuracy": 0.7478220462799072, "num_tokens": 24435361.0, "step": 659 }, { "entropy": 0.6286280378699303, "epoch": 4.259529602595296, "grad_norm": 0.012913207523524761, "learning_rate": 0.0002, "loss": 0.6232912540435791, "mean_token_accuracy": 0.7459053471684456, "num_tokens": 24472862.0, "step": 660 }, { "entropy": 0.6073895320296288, "epoch": 4.266017842660179, "grad_norm": 0.012715890072286129, "learning_rate": 0.0002, "loss": 0.6063985824584961, "mean_token_accuracy": 0.7502154931426048, "num_tokens": 24510378.0, "step": 661 }, { "entropy": 0.5987715944647789, "epoch": 4.2725060827250605, "grad_norm": 0.01144983246922493, "learning_rate": 0.0002, "loss": 0.603581964969635, "mean_token_accuracy": 0.7529052719473839, "num_tokens": 24547450.0, "step": 662 }, { "entropy": 0.6105594113469124, "epoch": 4.278994322789943, "grad_norm": 0.01477118767797947, "learning_rate": 0.0002, "loss": 0.6208908557891846, "mean_token_accuracy": 0.7453452572226524, "num_tokens": 24584414.0, "step": 663 }, { "entropy": 0.6013319417834282, "epoch": 4.285482562854826, "grad_norm": 0.011751738376915455, "learning_rate": 0.0002, "loss": 0.6031821966171265, "mean_token_accuracy": 0.7529275268316269, "num_tokens": 24621522.0, "step": 664 }, { "entropy": 0.6105660572648048, "epoch": 4.291970802919708, "grad_norm": 0.011309951543807983, "learning_rate": 0.0002, "loss": 0.6077959537506104, "mean_token_accuracy": 0.7497444152832031, "num_tokens": 24658985.0, "step": 665 }, { "entropy": 0.6143631562590599, "epoch": 4.29845904298459, "grad_norm": 0.01235566008836031, "learning_rate": 0.0002, "loss": 0.6165258884429932, "mean_token_accuracy": 0.7466364279389381, "num_tokens": 24696556.0, "step": 666 }, { "entropy": 0.6108560711145401, "epoch": 4.304947283049473, "grad_norm": 0.012649192474782467, "learning_rate": 0.0002, "loss": 0.6156973838806152, "mean_token_accuracy": 0.7493721544742584, "num_tokens": 24733563.0, "step": 667 }, { "entropy": 0.5972470939159393, "epoch": 4.311435523114355, "grad_norm": 0.012324381619691849, "learning_rate": 0.0002, "loss": 0.593143880367279, "mean_token_accuracy": 0.7569256648421288, "num_tokens": 24770521.0, "step": 668 }, { "entropy": 0.6238643601536751, "epoch": 4.3179237631792375, "grad_norm": 0.013767421245574951, "learning_rate": 0.0002, "loss": 0.6210561990737915, "mean_token_accuracy": 0.7456039562821388, "num_tokens": 24807746.0, "step": 669 }, { "entropy": 0.6074958592653275, "epoch": 4.32441200324412, "grad_norm": 0.012642712332308292, "learning_rate": 0.0002, "loss": 0.6104567646980286, "mean_token_accuracy": 0.7498242110013962, "num_tokens": 24844948.0, "step": 670 }, { "entropy": 0.6030944362282753, "epoch": 4.330900243309002, "grad_norm": 0.014455183409154415, "learning_rate": 0.0002, "loss": 0.6104896068572998, "mean_token_accuracy": 0.751430056989193, "num_tokens": 24882330.0, "step": 671 }, { "entropy": 0.6085335910320282, "epoch": 4.337388483373885, "grad_norm": 0.012203236110508442, "learning_rate": 0.0002, "loss": 0.6149730682373047, "mean_token_accuracy": 0.748404935002327, "num_tokens": 24919894.0, "step": 672 }, { "entropy": 0.6215960904955864, "epoch": 4.343876723438767, "grad_norm": 0.01517926249653101, "learning_rate": 0.0002, "loss": 0.6182515621185303, "mean_token_accuracy": 0.7460620552301407, "num_tokens": 24957338.0, "step": 673 }, { "entropy": 0.6206786409020424, "epoch": 4.350364963503649, "grad_norm": 0.012405015528202057, "learning_rate": 0.0002, "loss": 0.6114768385887146, "mean_token_accuracy": 0.749580554664135, "num_tokens": 24994430.0, "step": 674 }, { "entropy": 0.6176847890019417, "epoch": 4.356853203568532, "grad_norm": 0.012959569692611694, "learning_rate": 0.0002, "loss": 0.6179355382919312, "mean_token_accuracy": 0.7443158105015755, "num_tokens": 25031819.0, "step": 675 }, { "entropy": 0.6137174069881439, "epoch": 4.363341443633415, "grad_norm": 0.01568513549864292, "learning_rate": 0.0002, "loss": 0.6264492273330688, "mean_token_accuracy": 0.7434774041175842, "num_tokens": 25069321.0, "step": 676 }, { "entropy": 0.6073234900832176, "epoch": 4.369829683698297, "grad_norm": 0.01254733745008707, "learning_rate": 0.0002, "loss": 0.613095760345459, "mean_token_accuracy": 0.7486145123839378, "num_tokens": 25106724.0, "step": 677 }, { "entropy": 0.6180970370769501, "epoch": 4.376317923763179, "grad_norm": 0.01219653245061636, "learning_rate": 0.0002, "loss": 0.6162555813789368, "mean_token_accuracy": 0.7453421652317047, "num_tokens": 25144301.0, "step": 678 }, { "entropy": 0.6155680492520332, "epoch": 4.382806163828062, "grad_norm": 0.013878269121050835, "learning_rate": 0.0002, "loss": 0.6091170907020569, "mean_token_accuracy": 0.750255212187767, "num_tokens": 25181210.0, "step": 679 }, { "entropy": 0.6227680519223213, "epoch": 4.3892944038929445, "grad_norm": 0.01349555142223835, "learning_rate": 0.0002, "loss": 0.6250801086425781, "mean_token_accuracy": 0.743384949862957, "num_tokens": 25218262.0, "step": 680 }, { "entropy": 0.5870469063520432, "epoch": 4.395782643957826, "grad_norm": 0.012459780089557171, "learning_rate": 0.0002, "loss": 0.5922443270683289, "mean_token_accuracy": 0.75776407122612, "num_tokens": 25255586.0, "step": 681 }, { "entropy": 0.6126704216003418, "epoch": 4.402270884022709, "grad_norm": 0.012495280243456364, "learning_rate": 0.0002, "loss": 0.6199891567230225, "mean_token_accuracy": 0.7477240189909935, "num_tokens": 25293110.0, "step": 682 }, { "entropy": 0.6052056401968002, "epoch": 4.408759124087592, "grad_norm": 0.011480255052447319, "learning_rate": 0.0002, "loss": 0.6054994463920593, "mean_token_accuracy": 0.7517327517271042, "num_tokens": 25330240.0, "step": 683 }, { "entropy": 0.6134005859494209, "epoch": 4.415247364152473, "grad_norm": 0.013378560543060303, "learning_rate": 0.0002, "loss": 0.6032570600509644, "mean_token_accuracy": 0.7544484660029411, "num_tokens": 25367930.0, "step": 684 }, { "entropy": 0.6132281497120857, "epoch": 4.421735604217356, "grad_norm": 0.011817892082035542, "learning_rate": 0.0002, "loss": 0.6155675649642944, "mean_token_accuracy": 0.7474397569894791, "num_tokens": 25404927.0, "step": 685 }, { "entropy": 0.6157776713371277, "epoch": 4.428223844282239, "grad_norm": 0.013845066539943218, "learning_rate": 0.0002, "loss": 0.6208671927452087, "mean_token_accuracy": 0.7460346668958664, "num_tokens": 25441808.0, "step": 686 }, { "entropy": 0.6034616231918335, "epoch": 4.434712084347121, "grad_norm": 0.011209644377231598, "learning_rate": 0.0002, "loss": 0.6051755547523499, "mean_token_accuracy": 0.751818560063839, "num_tokens": 25478982.0, "step": 687 }, { "entropy": 0.6197097897529602, "epoch": 4.441200324412003, "grad_norm": 0.01221329253166914, "learning_rate": 0.0002, "loss": 0.624691367149353, "mean_token_accuracy": 0.743960902094841, "num_tokens": 25516230.0, "step": 688 }, { "entropy": 0.6036801412701607, "epoch": 4.447688564476886, "grad_norm": 0.011895528994500637, "learning_rate": 0.0002, "loss": 0.604611873626709, "mean_token_accuracy": 0.7565013989806175, "num_tokens": 25553987.0, "step": 689 }, { "entropy": 0.6126270368695259, "epoch": 4.454176804541768, "grad_norm": 0.014394382014870644, "learning_rate": 0.0002, "loss": 0.6157338619232178, "mean_token_accuracy": 0.7499115914106369, "num_tokens": 25591126.0, "step": 690 }, { "entropy": 0.6108303889632225, "epoch": 4.4606650446066505, "grad_norm": 0.014680239371955395, "learning_rate": 0.0002, "loss": 0.6087052822113037, "mean_token_accuracy": 0.7516598179936409, "num_tokens": 25628123.0, "step": 691 }, { "entropy": 0.6043496802449226, "epoch": 4.467153284671533, "grad_norm": 0.013057287782430649, "learning_rate": 0.0002, "loss": 0.6059702038764954, "mean_token_accuracy": 0.7521848082542419, "num_tokens": 25665273.0, "step": 692 }, { "entropy": 0.6091088205575943, "epoch": 4.473641524736415, "grad_norm": 0.012656234204769135, "learning_rate": 0.0002, "loss": 0.6140547394752502, "mean_token_accuracy": 0.7490741834044456, "num_tokens": 25702835.0, "step": 693 }, { "entropy": 0.6054038554430008, "epoch": 4.480129764801298, "grad_norm": 0.01144889835268259, "learning_rate": 0.0002, "loss": 0.6068828105926514, "mean_token_accuracy": 0.7513371407985687, "num_tokens": 25740321.0, "step": 694 }, { "entropy": 0.6075622960925102, "epoch": 4.48661800486618, "grad_norm": 0.014180710539221764, "learning_rate": 0.0002, "loss": 0.6113091707229614, "mean_token_accuracy": 0.7500150203704834, "num_tokens": 25777354.0, "step": 695 }, { "entropy": 0.6083768233656883, "epoch": 4.493106244931062, "grad_norm": 0.01257058884948492, "learning_rate": 0.0002, "loss": 0.613832950592041, "mean_token_accuracy": 0.7493138536810875, "num_tokens": 25814766.0, "step": 696 }, { "entropy": 0.6096158251166344, "epoch": 4.499594484995945, "grad_norm": 0.01403698232024908, "learning_rate": 0.0002, "loss": 0.606455385684967, "mean_token_accuracy": 0.751399964094162, "num_tokens": 25852032.0, "step": 697 }, { "entropy": 0.61270372569561, "epoch": 4.5060827250608275, "grad_norm": 0.013846375048160553, "learning_rate": 0.0002, "loss": 0.6081539988517761, "mean_token_accuracy": 0.7516685873270035, "num_tokens": 25889272.0, "step": 698 }, { "entropy": 0.6115692555904388, "epoch": 4.512570965125709, "grad_norm": 0.011561271734535694, "learning_rate": 0.0002, "loss": 0.6132485866546631, "mean_token_accuracy": 0.7496950924396515, "num_tokens": 25926376.0, "step": 699 }, { "entropy": 0.6165875196456909, "epoch": 4.519059205190592, "grad_norm": 0.014013632200658321, "learning_rate": 0.0002, "loss": 0.6210501194000244, "mean_token_accuracy": 0.7466816902160645, "num_tokens": 25964071.0, "step": 700 }, { "entropy": 0.6069151386618614, "epoch": 4.525547445255475, "grad_norm": 0.01162275206297636, "learning_rate": 0.0002, "loss": 0.6112617254257202, "mean_token_accuracy": 0.7507427483797073, "num_tokens": 26001770.0, "step": 701 }, { "entropy": 0.5982604473829269, "epoch": 4.5320356853203565, "grad_norm": 0.010527896694839, "learning_rate": 0.0002, "loss": 0.5975767374038696, "mean_token_accuracy": 0.7562049925327301, "num_tokens": 26038790.0, "step": 702 }, { "entropy": 0.6178539171814919, "epoch": 4.538523925385239, "grad_norm": 0.011301129125058651, "learning_rate": 0.0002, "loss": 0.6221362352371216, "mean_token_accuracy": 0.743792898952961, "num_tokens": 26076263.0, "step": 703 }, { "entropy": 0.6195997893810272, "epoch": 4.545012165450122, "grad_norm": 0.01180302631109953, "learning_rate": 0.0002, "loss": 0.618148922920227, "mean_token_accuracy": 0.7460778802633286, "num_tokens": 26113372.0, "step": 704 }, { "entropy": 0.6094764620065689, "epoch": 4.551500405515004, "grad_norm": 0.011488985270261765, "learning_rate": 0.0002, "loss": 0.6123408675193787, "mean_token_accuracy": 0.7495540827512741, "num_tokens": 26150197.0, "step": 705 }, { "entropy": 0.6152739748358727, "epoch": 4.557988645579886, "grad_norm": 0.011894487775862217, "learning_rate": 0.0002, "loss": 0.6184768676757812, "mean_token_accuracy": 0.7447682395577431, "num_tokens": 26187580.0, "step": 706 }, { "entropy": 0.6004127934575081, "epoch": 4.564476885644769, "grad_norm": 0.01042366586625576, "learning_rate": 0.0002, "loss": 0.6032600402832031, "mean_token_accuracy": 0.7507253810763359, "num_tokens": 26224583.0, "step": 707 }, { "entropy": 0.6170988976955414, "epoch": 4.570965125709652, "grad_norm": 0.012767941690981388, "learning_rate": 0.0002, "loss": 0.6203943490982056, "mean_token_accuracy": 0.7446292862296104, "num_tokens": 26261715.0, "step": 708 }, { "entropy": 0.6010770201683044, "epoch": 4.5774533657745335, "grad_norm": 0.010196649469435215, "learning_rate": 0.0002, "loss": 0.6022849082946777, "mean_token_accuracy": 0.7530830800533295, "num_tokens": 26298743.0, "step": 709 }, { "entropy": 0.6049724221229553, "epoch": 4.583941605839416, "grad_norm": 0.012646735645830631, "learning_rate": 0.0002, "loss": 0.6061745882034302, "mean_token_accuracy": 0.7506730481982231, "num_tokens": 26335489.0, "step": 710 }, { "entropy": 0.6168033257126808, "epoch": 4.590429845904298, "grad_norm": 0.013492587953805923, "learning_rate": 0.0002, "loss": 0.616999626159668, "mean_token_accuracy": 0.7479605078697205, "num_tokens": 26372489.0, "step": 711 }, { "entropy": 0.6182409450411797, "epoch": 4.596918085969181, "grad_norm": 0.010737297125160694, "learning_rate": 0.0002, "loss": 0.6131489276885986, "mean_token_accuracy": 0.7496219426393509, "num_tokens": 26409535.0, "step": 712 }, { "entropy": 0.6057656034827232, "epoch": 4.603406326034063, "grad_norm": 0.014007823541760445, "learning_rate": 0.0002, "loss": 0.6030014753341675, "mean_token_accuracy": 0.7548240646719933, "num_tokens": 26446279.0, "step": 713 }, { "entropy": 0.6160694062709808, "epoch": 4.609894566098946, "grad_norm": 0.012945987284183502, "learning_rate": 0.0002, "loss": 0.620917558670044, "mean_token_accuracy": 0.7472490146756172, "num_tokens": 26483525.0, "step": 714 }, { "entropy": 0.608958512544632, "epoch": 4.616382806163828, "grad_norm": 0.014964601024985313, "learning_rate": 0.0002, "loss": 0.6204575300216675, "mean_token_accuracy": 0.7449859008193016, "num_tokens": 26520720.0, "step": 715 }, { "entropy": 0.6118902638554573, "epoch": 4.622871046228711, "grad_norm": 0.011436744593083858, "learning_rate": 0.0002, "loss": 0.6165215969085693, "mean_token_accuracy": 0.7477826401591301, "num_tokens": 26557982.0, "step": 716 }, { "entropy": 0.6222316101193428, "epoch": 4.629359286293592, "grad_norm": 0.011866914108395576, "learning_rate": 0.0002, "loss": 0.6159400939941406, "mean_token_accuracy": 0.7480059117078781, "num_tokens": 26595389.0, "step": 717 }, { "entropy": 0.6267769560217857, "epoch": 4.635847526358475, "grad_norm": 0.012834588065743446, "learning_rate": 0.0002, "loss": 0.6215125322341919, "mean_token_accuracy": 0.7467430606484413, "num_tokens": 26632558.0, "step": 718 }, { "entropy": 0.6167991682887077, "epoch": 4.642335766423358, "grad_norm": 0.010781707242131233, "learning_rate": 0.0002, "loss": 0.6117191314697266, "mean_token_accuracy": 0.7489187940955162, "num_tokens": 26669534.0, "step": 719 }, { "entropy": 0.608165793120861, "epoch": 4.6488240064882405, "grad_norm": 0.013234053738415241, "learning_rate": 0.0002, "loss": 0.6105374097824097, "mean_token_accuracy": 0.7508261948823929, "num_tokens": 26707068.0, "step": 720 }, { "entropy": 0.6050869300961494, "epoch": 4.655312246553122, "grad_norm": 0.015265488997101784, "learning_rate": 0.0002, "loss": 0.6178677082061768, "mean_token_accuracy": 0.7447132244706154, "num_tokens": 26744214.0, "step": 721 }, { "entropy": 0.606209434568882, "epoch": 4.661800486618005, "grad_norm": 0.012334835715591908, "learning_rate": 0.0002, "loss": 0.6131197214126587, "mean_token_accuracy": 0.7471205219626427, "num_tokens": 26781504.0, "step": 722 }, { "entropy": 0.6154639571905136, "epoch": 4.668288726682888, "grad_norm": 0.011331942863762379, "learning_rate": 0.0002, "loss": 0.6135961413383484, "mean_token_accuracy": 0.750006228685379, "num_tokens": 26818648.0, "step": 723 }, { "entropy": 0.6127299889922142, "epoch": 4.674776966747769, "grad_norm": 0.013016032055020332, "learning_rate": 0.0002, "loss": 0.6065088510513306, "mean_token_accuracy": 0.7515178844332695, "num_tokens": 26856269.0, "step": 724 }, { "entropy": 0.6198037564754486, "epoch": 4.681265206812652, "grad_norm": 0.010600600391626358, "learning_rate": 0.0002, "loss": 0.6175575256347656, "mean_token_accuracy": 0.748474046587944, "num_tokens": 26893819.0, "step": 725 }, { "entropy": 0.6088383719325066, "epoch": 4.687753446877535, "grad_norm": 0.012035705149173737, "learning_rate": 0.0002, "loss": 0.6124040484428406, "mean_token_accuracy": 0.7508236169815063, "num_tokens": 26931388.0, "step": 726 }, { "entropy": 0.6097267419099808, "epoch": 4.694241686942417, "grad_norm": 0.013257896527647972, "learning_rate": 0.0002, "loss": 0.6185274720191956, "mean_token_accuracy": 0.7469557821750641, "num_tokens": 26968862.0, "step": 727 }, { "entropy": 0.6031776890158653, "epoch": 4.700729927007299, "grad_norm": 0.012637577950954437, "learning_rate": 0.0002, "loss": 0.6094907522201538, "mean_token_accuracy": 0.7504973784089088, "num_tokens": 27006297.0, "step": 728 }, { "entropy": 0.6267594248056412, "epoch": 4.707218167072182, "grad_norm": 0.012524669989943504, "learning_rate": 0.0002, "loss": 0.6284726858139038, "mean_token_accuracy": 0.74198117852211, "num_tokens": 27043660.0, "step": 729 }, { "entropy": 0.6199127435684204, "epoch": 4.713706407137064, "grad_norm": 0.011993559077382088, "learning_rate": 0.0002, "loss": 0.6179155707359314, "mean_token_accuracy": 0.7490969151258469, "num_tokens": 27080997.0, "step": 730 }, { "entropy": 0.619316965341568, "epoch": 4.7201946472019465, "grad_norm": 0.011862427927553654, "learning_rate": 0.0002, "loss": 0.6162521839141846, "mean_token_accuracy": 0.7466591447591782, "num_tokens": 27118582.0, "step": 731 }, { "entropy": 0.617161475121975, "epoch": 4.726682887266829, "grad_norm": 0.010898209176957607, "learning_rate": 0.0002, "loss": 0.6218090057373047, "mean_token_accuracy": 0.7456279322504997, "num_tokens": 27155770.0, "step": 732 }, { "entropy": 0.6097361296415329, "epoch": 4.733171127331711, "grad_norm": 0.012140274979174137, "learning_rate": 0.0002, "loss": 0.6126585602760315, "mean_token_accuracy": 0.7512409463524818, "num_tokens": 27193021.0, "step": 733 }, { "entropy": 0.5991591587662697, "epoch": 4.739659367396594, "grad_norm": 0.011335095390677452, "learning_rate": 0.0002, "loss": 0.6005336046218872, "mean_token_accuracy": 0.7536215856671333, "num_tokens": 27230104.0, "step": 734 }, { "entropy": 0.6187688335776329, "epoch": 4.746147607461476, "grad_norm": 0.011418522335588932, "learning_rate": 0.0002, "loss": 0.619892418384552, "mean_token_accuracy": 0.7460336685180664, "num_tokens": 27267697.0, "step": 735 }, { "entropy": 0.6177256479859352, "epoch": 4.752635847526358, "grad_norm": 0.01126981433480978, "learning_rate": 0.0002, "loss": 0.6184297204017639, "mean_token_accuracy": 0.7480708360671997, "num_tokens": 27304935.0, "step": 736 }, { "entropy": 0.6365424171090126, "epoch": 4.759124087591241, "grad_norm": 0.012852554209530354, "learning_rate": 0.0002, "loss": 0.6335437297821045, "mean_token_accuracy": 0.7411114126443863, "num_tokens": 27342734.0, "step": 737 }, { "entropy": 0.6231958642601967, "epoch": 4.7656123276561235, "grad_norm": 0.01126949768513441, "learning_rate": 0.0002, "loss": 0.6242541670799255, "mean_token_accuracy": 0.7444687336683273, "num_tokens": 27380129.0, "step": 738 }, { "entropy": 0.6135790795087814, "epoch": 4.772100567721005, "grad_norm": 0.011775590479373932, "learning_rate": 0.0002, "loss": 0.6142154335975647, "mean_token_accuracy": 0.7484701201319695, "num_tokens": 27417574.0, "step": 739 }, { "entropy": 0.5981535315513611, "epoch": 4.778588807785888, "grad_norm": 0.012303443625569344, "learning_rate": 0.0002, "loss": 0.6043405532836914, "mean_token_accuracy": 0.7530733942985535, "num_tokens": 27454673.0, "step": 740 }, { "entropy": 0.6199762895703316, "epoch": 4.785077047850771, "grad_norm": 0.011197846382856369, "learning_rate": 0.0002, "loss": 0.6214004158973694, "mean_token_accuracy": 0.7454070076346397, "num_tokens": 27492327.0, "step": 741 }, { "entropy": 0.6030875891447067, "epoch": 4.7915652879156525, "grad_norm": 0.012394090183079243, "learning_rate": 0.0002, "loss": 0.6037598848342896, "mean_token_accuracy": 0.7523747533559799, "num_tokens": 27529616.0, "step": 742 }, { "entropy": 0.613655112683773, "epoch": 4.798053527980535, "grad_norm": 0.010351658798754215, "learning_rate": 0.0002, "loss": 0.6146197319030762, "mean_token_accuracy": 0.7493305876851082, "num_tokens": 27567467.0, "step": 743 }, { "entropy": 0.609668679535389, "epoch": 4.804541768045418, "grad_norm": 0.010698414407670498, "learning_rate": 0.0002, "loss": 0.6130056381225586, "mean_token_accuracy": 0.749318391084671, "num_tokens": 27604340.0, "step": 744 }, { "entropy": 0.6055747121572495, "epoch": 4.811030008110301, "grad_norm": 0.011774055659770966, "learning_rate": 0.0002, "loss": 0.6064777374267578, "mean_token_accuracy": 0.7513219490647316, "num_tokens": 27641869.0, "step": 745 }, { "entropy": 0.6063344553112984, "epoch": 4.817518248175182, "grad_norm": 0.010040192864835262, "learning_rate": 0.0002, "loss": 0.6085660457611084, "mean_token_accuracy": 0.7483800128102303, "num_tokens": 27678992.0, "step": 746 }, { "entropy": 0.6175437271595001, "epoch": 4.824006488240065, "grad_norm": 0.011712496168911457, "learning_rate": 0.0002, "loss": 0.6189186573028564, "mean_token_accuracy": 0.7486408054828644, "num_tokens": 27716703.0, "step": 747 }, { "entropy": 0.6142439544200897, "epoch": 4.830494728304947, "grad_norm": 0.012662764638662338, "learning_rate": 0.0002, "loss": 0.614926815032959, "mean_token_accuracy": 0.747495986521244, "num_tokens": 27754004.0, "step": 748 }, { "entropy": 0.6087512150406837, "epoch": 4.8369829683698295, "grad_norm": 0.010618063621222973, "learning_rate": 0.0002, "loss": 0.6098265647888184, "mean_token_accuracy": 0.7527805492281914, "num_tokens": 27791212.0, "step": 749 }, { "entropy": 0.6073944419622421, "epoch": 4.843471208434712, "grad_norm": 0.011879456229507923, "learning_rate": 0.0002, "loss": 0.6084223389625549, "mean_token_accuracy": 0.7535420805215836, "num_tokens": 27828439.0, "step": 750 }, { "entropy": 0.6072632223367691, "epoch": 4.849959448499595, "grad_norm": 0.01333905290812254, "learning_rate": 0.0002, "loss": 0.6154837608337402, "mean_token_accuracy": 0.7462009564042091, "num_tokens": 27865908.0, "step": 751 }, { "entropy": 0.6182335615158081, "epoch": 4.856447688564477, "grad_norm": 0.012253145687282085, "learning_rate": 0.0002, "loss": 0.6162886619567871, "mean_token_accuracy": 0.7482575252652168, "num_tokens": 27903553.0, "step": 752 }, { "entropy": 0.623457059264183, "epoch": 4.862935928629359, "grad_norm": 0.012347408570349216, "learning_rate": 0.0002, "loss": 0.6175649166107178, "mean_token_accuracy": 0.7451874390244484, "num_tokens": 27940745.0, "step": 753 }, { "entropy": 0.6147228851914406, "epoch": 4.869424168694241, "grad_norm": 0.013636295683681965, "learning_rate": 0.0002, "loss": 0.6182140111923218, "mean_token_accuracy": 0.7459222003817558, "num_tokens": 27977798.0, "step": 754 }, { "entropy": 0.6009573265910149, "epoch": 4.875912408759124, "grad_norm": 0.011285821907222271, "learning_rate": 0.0002, "loss": 0.6073520183563232, "mean_token_accuracy": 0.7508896961808205, "num_tokens": 28014880.0, "step": 755 }, { "entropy": 0.5950382575392723, "epoch": 4.882400648824007, "grad_norm": 0.011523284018039703, "learning_rate": 0.0002, "loss": 0.6006320714950562, "mean_token_accuracy": 0.7559562996029854, "num_tokens": 28052148.0, "step": 756 }, { "entropy": 0.6160282120108604, "epoch": 4.888888888888889, "grad_norm": 0.011825107038021088, "learning_rate": 0.0002, "loss": 0.6167672872543335, "mean_token_accuracy": 0.7469073683023453, "num_tokens": 28089658.0, "step": 757 }, { "entropy": 0.6171636879444122, "epoch": 4.895377128953771, "grad_norm": 0.011352675966918468, "learning_rate": 0.0002, "loss": 0.6145755052566528, "mean_token_accuracy": 0.746620424091816, "num_tokens": 28127170.0, "step": 758 }, { "entropy": 0.608257532119751, "epoch": 4.901865369018654, "grad_norm": 0.012769036926329136, "learning_rate": 0.0002, "loss": 0.609970211982727, "mean_token_accuracy": 0.7516561150550842, "num_tokens": 28164347.0, "step": 759 }, { "entropy": 0.6164683550596237, "epoch": 4.9083536090835365, "grad_norm": 0.012305669486522675, "learning_rate": 0.0002, "loss": 0.6191939115524292, "mean_token_accuracy": 0.7453163638710976, "num_tokens": 28201799.0, "step": 760 }, { "entropy": 0.614104337990284, "epoch": 4.914841849148418, "grad_norm": 0.010976862162351608, "learning_rate": 0.0002, "loss": 0.6142949461936951, "mean_token_accuracy": 0.7480729147791862, "num_tokens": 28239441.0, "step": 761 }, { "entropy": 0.5957873240113258, "epoch": 4.921330089213301, "grad_norm": 0.011151162907481194, "learning_rate": 0.0002, "loss": 0.5960466265678406, "mean_token_accuracy": 0.7578283548355103, "num_tokens": 28276966.0, "step": 762 }, { "entropy": 0.6149696856737137, "epoch": 4.927818329278184, "grad_norm": 0.01262627262622118, "learning_rate": 0.0002, "loss": 0.6141815185546875, "mean_token_accuracy": 0.7478419542312622, "num_tokens": 28314493.0, "step": 763 }, { "entropy": 0.6079921796917915, "epoch": 4.934306569343065, "grad_norm": 0.012012857012450695, "learning_rate": 0.0002, "loss": 0.6085329055786133, "mean_token_accuracy": 0.7516164556145668, "num_tokens": 28352110.0, "step": 764 }, { "entropy": 0.606193870306015, "epoch": 4.940794809407948, "grad_norm": 0.012743561528623104, "learning_rate": 0.0002, "loss": 0.6102321147918701, "mean_token_accuracy": 0.7491661831736565, "num_tokens": 28389448.0, "step": 765 }, { "entropy": 0.6021564230322838, "epoch": 4.947283049472831, "grad_norm": 0.011576979421079159, "learning_rate": 0.0002, "loss": 0.6045505404472351, "mean_token_accuracy": 0.7516537830233574, "num_tokens": 28427005.0, "step": 766 }, { "entropy": 0.6197597831487656, "epoch": 4.953771289537713, "grad_norm": 0.013263656757771969, "learning_rate": 0.0002, "loss": 0.6234422922134399, "mean_token_accuracy": 0.7442535609006882, "num_tokens": 28464143.0, "step": 767 }, { "entropy": 0.5995957404375076, "epoch": 4.960259529602595, "grad_norm": 0.013597379438579082, "learning_rate": 0.0002, "loss": 0.608078122138977, "mean_token_accuracy": 0.7510829046368599, "num_tokens": 28501245.0, "step": 768 }, { "entropy": 0.5990025177598, "epoch": 4.966747769667478, "grad_norm": 0.011187846772372723, "learning_rate": 0.0002, "loss": 0.6021981835365295, "mean_token_accuracy": 0.751527689397335, "num_tokens": 28538395.0, "step": 769 }, { "entropy": 0.6094980016350746, "epoch": 4.97323600973236, "grad_norm": 0.011942482553422451, "learning_rate": 0.0002, "loss": 0.6086335182189941, "mean_token_accuracy": 0.7511740922927856, "num_tokens": 28575389.0, "step": 770 }, { "entropy": 0.607696995139122, "epoch": 4.9797242497972425, "grad_norm": 0.010719696059823036, "learning_rate": 0.0002, "loss": 0.6058928370475769, "mean_token_accuracy": 0.7512983754277229, "num_tokens": 28612614.0, "step": 771 }, { "entropy": 0.6127375960350037, "epoch": 4.986212489862125, "grad_norm": 0.011552160605788231, "learning_rate": 0.0002, "loss": 0.610999345779419, "mean_token_accuracy": 0.7520032823085785, "num_tokens": 28649626.0, "step": 772 }, { "entropy": 0.6094198897480965, "epoch": 4.992700729927007, "grad_norm": 0.010641835629940033, "learning_rate": 0.0002, "loss": 0.609566330909729, "mean_token_accuracy": 0.7494478672742844, "num_tokens": 28687121.0, "step": 773 }, { "entropy": 0.6135342344641685, "epoch": 4.99918896999189, "grad_norm": 0.010831725783646107, "learning_rate": 0.0002, "loss": 0.6144300103187561, "mean_token_accuracy": 0.7496655061841011, "num_tokens": 28724466.0, "step": 774 }, { "entropy": 0.6133913993835449, "epoch": 5.0, "grad_norm": 0.025664443150162697, "learning_rate": 0.0002, "loss": 0.6142559051513672, "mean_token_accuracy": 0.7518454194068909, "num_tokens": 28729104.0, "step": 775 } ], "logging_steps": 1, "max_steps": 775, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.6824700471332045e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }