eac123's picture
Upload final checkpoint (checkpoint-775)
272cedf verified
Raw
History Blame Contribute Delete
224 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 775,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.1549250930547714,
"epoch": 0.006488240064882401,
"grad_norm": 0.24168352782726288,
"learning_rate": 0.0002,
"loss": 2.622039794921875,
"mean_token_accuracy": 0.5027666613459587,
"num_tokens": 36790.0,
"step": 1
},
{
"entropy": 1.274625539779663,
"epoch": 0.012976480129764802,
"grad_norm": 0.1995907425880432,
"learning_rate": 0.0002,
"loss": 2.257164239883423,
"mean_token_accuracy": 0.5388679280877113,
"num_tokens": 74141.0,
"step": 2
},
{
"entropy": 1.4621597826480865,
"epoch": 0.019464720194647202,
"grad_norm": 0.14427633583545685,
"learning_rate": 0.0002,
"loss": 1.8207428455352783,
"mean_token_accuracy": 0.5618570819497108,
"num_tokens": 111279.0,
"step": 3
},
{
"entropy": 1.432983249425888,
"epoch": 0.025952960259529603,
"grad_norm": 0.11290092021226883,
"learning_rate": 0.0002,
"loss": 1.4740469455718994,
"mean_token_accuracy": 0.6100572720170021,
"num_tokens": 148749.0,
"step": 4
},
{
"entropy": 1.4418732523918152,
"epoch": 0.032441200324412,
"grad_norm": 0.13801905512809753,
"learning_rate": 0.0002,
"loss": 1.3789974451065063,
"mean_token_accuracy": 0.6047125160694122,
"num_tokens": 186530.0,
"step": 5
},
{
"entropy": 1.3603367805480957,
"epoch": 0.038929440389294405,
"grad_norm": 0.07707933336496353,
"learning_rate": 0.0002,
"loss": 1.2482553720474243,
"mean_token_accuracy": 0.6377034857869148,
"num_tokens": 224090.0,
"step": 6
},
{
"entropy": 1.2907896488904953,
"epoch": 0.0454176804541768,
"grad_norm": 0.05054641142487526,
"learning_rate": 0.0002,
"loss": 1.1776490211486816,
"mean_token_accuracy": 0.6423852369189262,
"num_tokens": 261358.0,
"step": 7
},
{
"entropy": 1.2394904792308807,
"epoch": 0.05190592051905921,
"grad_norm": 0.05160299688577652,
"learning_rate": 0.0002,
"loss": 1.1141722202301025,
"mean_token_accuracy": 0.6483801528811455,
"num_tokens": 298387.0,
"step": 8
},
{
"entropy": 1.140880137681961,
"epoch": 0.058394160583941604,
"grad_norm": 0.05524353310465813,
"learning_rate": 0.0002,
"loss": 1.0428144931793213,
"mean_token_accuracy": 0.6648038625717163,
"num_tokens": 335681.0,
"step": 9
},
{
"entropy": 1.0597130507230759,
"epoch": 0.064882400648824,
"grad_norm": 0.0610174834728241,
"learning_rate": 0.0002,
"loss": 0.9854335784912109,
"mean_token_accuracy": 0.6730685979127884,
"num_tokens": 373108.0,
"step": 10
},
{
"entropy": 0.9984031766653061,
"epoch": 0.07137064071370641,
"grad_norm": 0.05013473331928253,
"learning_rate": 0.0002,
"loss": 0.9311432838439941,
"mean_token_accuracy": 0.6808731183409691,
"num_tokens": 410188.0,
"step": 11
},
{
"entropy": 0.9519696608185768,
"epoch": 0.07785888077858881,
"grad_norm": 0.7003989219665527,
"learning_rate": 0.0002,
"loss": 0.9051742553710938,
"mean_token_accuracy": 0.6799700632691383,
"num_tokens": 447666.0,
"step": 12
},
{
"entropy": 0.905988834798336,
"epoch": 0.08434712084347121,
"grad_norm": 0.05167749896645546,
"learning_rate": 0.0002,
"loss": 0.8597391843795776,
"mean_token_accuracy": 0.6946859285235405,
"num_tokens": 484844.0,
"step": 13
},
{
"entropy": 0.8613085150718689,
"epoch": 0.0908353609083536,
"grad_norm": 0.0768115222454071,
"learning_rate": 0.0002,
"loss": 0.8413710594177246,
"mean_token_accuracy": 0.6983600705862045,
"num_tokens": 521975.0,
"step": 14
},
{
"entropy": 0.8102021664381027,
"epoch": 0.09732360097323602,
"grad_norm": 0.5994402170181274,
"learning_rate": 0.0002,
"loss": 0.81607985496521,
"mean_token_accuracy": 0.7021179124712944,
"num_tokens": 558889.0,
"step": 15
},
{
"entropy": 0.8057567626237869,
"epoch": 0.10381184103811841,
"grad_norm": 0.03823373466730118,
"learning_rate": 0.0002,
"loss": 0.7905861139297485,
"mean_token_accuracy": 0.7055389359593391,
"num_tokens": 596455.0,
"step": 16
},
{
"entropy": 0.7923594415187836,
"epoch": 0.11030008110300081,
"grad_norm": 0.0739479511976242,
"learning_rate": 0.0002,
"loss": 0.769114077091217,
"mean_token_accuracy": 0.7118282616138458,
"num_tokens": 634110.0,
"step": 17
},
{
"entropy": 0.7812566831707954,
"epoch": 0.11678832116788321,
"grad_norm": 0.03668873757123947,
"learning_rate": 0.0002,
"loss": 0.7668346762657166,
"mean_token_accuracy": 0.7075815051794052,
"num_tokens": 671655.0,
"step": 18
},
{
"entropy": 0.7474964931607246,
"epoch": 0.12327656123276562,
"grad_norm": 0.041200920939445496,
"learning_rate": 0.0002,
"loss": 0.7393766641616821,
"mean_token_accuracy": 0.716952882707119,
"num_tokens": 708824.0,
"step": 19
},
{
"entropy": 0.7383133918046951,
"epoch": 0.129764801297648,
"grad_norm": 0.0367242768406868,
"learning_rate": 0.0002,
"loss": 0.728330135345459,
"mean_token_accuracy": 0.7191555127501488,
"num_tokens": 746274.0,
"step": 20
},
{
"entropy": 0.7354703769087791,
"epoch": 0.1362530413625304,
"grad_norm": 0.039265185594558716,
"learning_rate": 0.0002,
"loss": 0.7205026149749756,
"mean_token_accuracy": 0.7199463173747063,
"num_tokens": 783720.0,
"step": 21
},
{
"entropy": 0.7178014516830444,
"epoch": 0.14274128142741282,
"grad_norm": 0.03647130727767944,
"learning_rate": 0.0002,
"loss": 0.7003612518310547,
"mean_token_accuracy": 0.7242974415421486,
"num_tokens": 821241.0,
"step": 22
},
{
"entropy": 0.7019922286272049,
"epoch": 0.1492295214922952,
"grad_norm": 0.03146970644593239,
"learning_rate": 0.0002,
"loss": 0.6875081062316895,
"mean_token_accuracy": 0.7302066311240196,
"num_tokens": 858171.0,
"step": 23
},
{
"entropy": 0.691544882953167,
"epoch": 0.15571776155717762,
"grad_norm": 0.03450683504343033,
"learning_rate": 0.0002,
"loss": 0.6847634315490723,
"mean_token_accuracy": 0.7311759144067764,
"num_tokens": 895368.0,
"step": 24
},
{
"entropy": 0.6791905760765076,
"epoch": 0.16220600162206,
"grad_norm": 0.029409531503915787,
"learning_rate": 0.0002,
"loss": 0.672599732875824,
"mean_token_accuracy": 0.7371302843093872,
"num_tokens": 932589.0,
"step": 25
},
{
"entropy": 0.6795228570699692,
"epoch": 0.16869424168694241,
"grad_norm": 0.029320087283849716,
"learning_rate": 0.0002,
"loss": 0.6811176538467407,
"mean_token_accuracy": 0.7309242188930511,
"num_tokens": 969558.0,
"step": 26
},
{
"entropy": 0.6630020141601562,
"epoch": 0.17518248175182483,
"grad_norm": 0.025668611750006676,
"learning_rate": 0.0002,
"loss": 0.6629281044006348,
"mean_token_accuracy": 0.7399500384926796,
"num_tokens": 1007155.0,
"step": 27
},
{
"entropy": 0.6723117381334305,
"epoch": 0.1816707218167072,
"grad_norm": 0.025801967829465866,
"learning_rate": 0.0002,
"loss": 0.672906756401062,
"mean_token_accuracy": 0.7337809279561043,
"num_tokens": 1044459.0,
"step": 28
},
{
"entropy": 0.671604260802269,
"epoch": 0.18815896188158962,
"grad_norm": 0.026239318773150444,
"learning_rate": 0.0002,
"loss": 0.6697608828544617,
"mean_token_accuracy": 0.7337322384119034,
"num_tokens": 1081975.0,
"step": 29
},
{
"entropy": 0.646067701280117,
"epoch": 0.19464720194647203,
"grad_norm": 0.02587837167084217,
"learning_rate": 0.0002,
"loss": 0.6468892097473145,
"mean_token_accuracy": 0.7421439811587334,
"num_tokens": 1119148.0,
"step": 30
},
{
"entropy": 0.6522824168205261,
"epoch": 0.20113544201135442,
"grad_norm": 0.0248495414853096,
"learning_rate": 0.0002,
"loss": 0.6558438539505005,
"mean_token_accuracy": 0.7381908968091011,
"num_tokens": 1156351.0,
"step": 31
},
{
"entropy": 0.6425730809569359,
"epoch": 0.20762368207623683,
"grad_norm": 0.02851717919111252,
"learning_rate": 0.0002,
"loss": 0.6539334654808044,
"mean_token_accuracy": 0.7376680299639702,
"num_tokens": 1193707.0,
"step": 32
},
{
"entropy": 0.6417841091752052,
"epoch": 0.2141119221411192,
"grad_norm": 0.02549365535378456,
"learning_rate": 0.0002,
"loss": 0.6482184529304504,
"mean_token_accuracy": 0.7417171224951744,
"num_tokens": 1230700.0,
"step": 33
},
{
"entropy": 0.6465194374322891,
"epoch": 0.22060016220600162,
"grad_norm": 0.025215625762939453,
"learning_rate": 0.0002,
"loss": 0.6494179964065552,
"mean_token_accuracy": 0.7402999773621559,
"num_tokens": 1267782.0,
"step": 34
},
{
"entropy": 0.6392467468976974,
"epoch": 0.22708840227088403,
"grad_norm": 0.023007551208138466,
"learning_rate": 0.0002,
"loss": 0.6377967000007629,
"mean_token_accuracy": 0.7462463900446892,
"num_tokens": 1304976.0,
"step": 35
},
{
"entropy": 0.6491241455078125,
"epoch": 0.23357664233576642,
"grad_norm": 0.022631216794252396,
"learning_rate": 0.0002,
"loss": 0.6419650316238403,
"mean_token_accuracy": 0.7427782192826271,
"num_tokens": 1342405.0,
"step": 36
},
{
"entropy": 0.6426859274506569,
"epoch": 0.24006488240064883,
"grad_norm": 0.020762791857123375,
"learning_rate": 0.0002,
"loss": 0.638580322265625,
"mean_token_accuracy": 0.74485033005476,
"num_tokens": 1379588.0,
"step": 37
},
{
"entropy": 0.6500778123736382,
"epoch": 0.24655312246553124,
"grad_norm": 0.01766084134578705,
"learning_rate": 0.0002,
"loss": 0.6436338424682617,
"mean_token_accuracy": 0.7424680069088936,
"num_tokens": 1417229.0,
"step": 38
},
{
"entropy": 0.654863677918911,
"epoch": 0.25304136253041365,
"grad_norm": 0.018832355737686157,
"learning_rate": 0.0002,
"loss": 0.6571300029754639,
"mean_token_accuracy": 0.7378578186035156,
"num_tokens": 1454802.0,
"step": 39
},
{
"entropy": 0.6454419046640396,
"epoch": 0.259529602595296,
"grad_norm": 0.018613073974847794,
"learning_rate": 0.0002,
"loss": 0.6524553298950195,
"mean_token_accuracy": 0.7370505034923553,
"num_tokens": 1492073.0,
"step": 40
},
{
"entropy": 0.6527602002024651,
"epoch": 0.2660178426601784,
"grad_norm": 0.01693454198539257,
"learning_rate": 0.0002,
"loss": 0.6585220098495483,
"mean_token_accuracy": 0.73494041711092,
"num_tokens": 1529432.0,
"step": 41
},
{
"entropy": 0.6482313647866249,
"epoch": 0.2725060827250608,
"grad_norm": 0.015154066495597363,
"learning_rate": 0.0002,
"loss": 0.6487522125244141,
"mean_token_accuracy": 0.7386852130293846,
"num_tokens": 1566849.0,
"step": 42
},
{
"entropy": 0.6501431986689568,
"epoch": 0.27899432278994324,
"grad_norm": 0.015506139025092125,
"learning_rate": 0.0002,
"loss": 0.6508647203445435,
"mean_token_accuracy": 0.7396439164876938,
"num_tokens": 1603797.0,
"step": 43
},
{
"entropy": 0.6399750784039497,
"epoch": 0.28548256285482565,
"grad_norm": 0.014903928153216839,
"learning_rate": 0.0002,
"loss": 0.639168381690979,
"mean_token_accuracy": 0.743517704308033,
"num_tokens": 1641043.0,
"step": 44
},
{
"entropy": 0.6295603513717651,
"epoch": 0.291970802919708,
"grad_norm": 0.014574805274605751,
"learning_rate": 0.0002,
"loss": 0.6305776834487915,
"mean_token_accuracy": 0.746990330517292,
"num_tokens": 1677698.0,
"step": 45
},
{
"entropy": 0.6334760338068008,
"epoch": 0.2984590429845904,
"grad_norm": 0.016435733065009117,
"learning_rate": 0.0002,
"loss": 0.631117582321167,
"mean_token_accuracy": 0.7475783005356789,
"num_tokens": 1714954.0,
"step": 46
},
{
"entropy": 0.6437651589512825,
"epoch": 0.30494728304947283,
"grad_norm": 0.016290629282593727,
"learning_rate": 0.0002,
"loss": 0.6405509114265442,
"mean_token_accuracy": 0.7430335581302643,
"num_tokens": 1751913.0,
"step": 47
},
{
"entropy": 0.6363071575760841,
"epoch": 0.31143552311435524,
"grad_norm": 0.01479713711887598,
"learning_rate": 0.0002,
"loss": 0.6342425346374512,
"mean_token_accuracy": 0.7451304048299789,
"num_tokens": 1789211.0,
"step": 48
},
{
"entropy": 0.6442478150129318,
"epoch": 0.31792376317923765,
"grad_norm": 0.014846265316009521,
"learning_rate": 0.0002,
"loss": 0.641524612903595,
"mean_token_accuracy": 0.7414352521300316,
"num_tokens": 1826606.0,
"step": 49
},
{
"entropy": 0.6363928020000458,
"epoch": 0.32441200324412,
"grad_norm": 0.01481616124510765,
"learning_rate": 0.0002,
"loss": 0.6363080739974976,
"mean_token_accuracy": 0.7444929406046867,
"num_tokens": 1863966.0,
"step": 50
},
{
"entropy": 0.6335690394043922,
"epoch": 0.3309002433090024,
"grad_norm": 0.015328066423535347,
"learning_rate": 0.0002,
"loss": 0.6387162208557129,
"mean_token_accuracy": 0.7436776608228683,
"num_tokens": 1900997.0,
"step": 51
},
{
"entropy": 0.6325219571590424,
"epoch": 0.33738848337388483,
"grad_norm": 0.015631280839443207,
"learning_rate": 0.0002,
"loss": 0.6400341987609863,
"mean_token_accuracy": 0.7412212640047073,
"num_tokens": 1937974.0,
"step": 52
},
{
"entropy": 0.63508290797472,
"epoch": 0.34387672343876724,
"grad_norm": 0.014866264536976814,
"learning_rate": 0.0002,
"loss": 0.6396467089653015,
"mean_token_accuracy": 0.7431643679738045,
"num_tokens": 1975204.0,
"step": 53
},
{
"entropy": 0.6382915005087852,
"epoch": 0.35036496350364965,
"grad_norm": 0.013517456129193306,
"learning_rate": 0.0002,
"loss": 0.6404691338539124,
"mean_token_accuracy": 0.7433327361941338,
"num_tokens": 2012218.0,
"step": 54
},
{
"entropy": 0.6375824585556984,
"epoch": 0.35685320356853206,
"grad_norm": 0.015061435289680958,
"learning_rate": 0.0002,
"loss": 0.6400342583656311,
"mean_token_accuracy": 0.7421080023050308,
"num_tokens": 2049462.0,
"step": 55
},
{
"entropy": 0.6377979964017868,
"epoch": 0.3633414436334144,
"grad_norm": 0.016312120482325554,
"learning_rate": 0.0002,
"loss": 0.635837197303772,
"mean_token_accuracy": 0.7426418736577034,
"num_tokens": 2086665.0,
"step": 56
},
{
"entropy": 0.6413707137107849,
"epoch": 0.36982968369829683,
"grad_norm": 0.012621643021702766,
"learning_rate": 0.0002,
"loss": 0.6389581561088562,
"mean_token_accuracy": 0.7432198747992516,
"num_tokens": 2124115.0,
"step": 57
},
{
"entropy": 0.6355349719524384,
"epoch": 0.37631792376317924,
"grad_norm": 0.01422160305082798,
"learning_rate": 0.0002,
"loss": 0.6343538165092468,
"mean_token_accuracy": 0.743286557495594,
"num_tokens": 2161345.0,
"step": 58
},
{
"entropy": 0.6376762092113495,
"epoch": 0.38280616382806165,
"grad_norm": 0.014769963920116425,
"learning_rate": 0.0002,
"loss": 0.6412167549133301,
"mean_token_accuracy": 0.7418163046240807,
"num_tokens": 2198636.0,
"step": 59
},
{
"entropy": 0.6334660202264786,
"epoch": 0.38929440389294406,
"grad_norm": 0.014948038384318352,
"learning_rate": 0.0002,
"loss": 0.6379479169845581,
"mean_token_accuracy": 0.7443428039550781,
"num_tokens": 2235377.0,
"step": 60
},
{
"entropy": 0.632827527821064,
"epoch": 0.3957826439578264,
"grad_norm": 0.01332375779747963,
"learning_rate": 0.0002,
"loss": 0.633344292640686,
"mean_token_accuracy": 0.7467714250087738,
"num_tokens": 2272588.0,
"step": 61
},
{
"entropy": 0.632963553071022,
"epoch": 0.40227088402270883,
"grad_norm": 0.013366672210395336,
"learning_rate": 0.0002,
"loss": 0.6344192028045654,
"mean_token_accuracy": 0.7444779649376869,
"num_tokens": 2310205.0,
"step": 62
},
{
"entropy": 0.6468651965260506,
"epoch": 0.40875912408759124,
"grad_norm": 0.012876944616436958,
"learning_rate": 0.0002,
"loss": 0.6487270593643188,
"mean_token_accuracy": 0.7404673770070076,
"num_tokens": 2347612.0,
"step": 63
},
{
"entropy": 0.6336022540926933,
"epoch": 0.41524736415247365,
"grad_norm": 0.011953601613640785,
"learning_rate": 0.0002,
"loss": 0.6323578357696533,
"mean_token_accuracy": 0.7435265332460403,
"num_tokens": 2385324.0,
"step": 64
},
{
"entropy": 0.6421113535761833,
"epoch": 0.42173560421735606,
"grad_norm": 0.011578400619328022,
"learning_rate": 0.0002,
"loss": 0.640021800994873,
"mean_token_accuracy": 0.7417890876531601,
"num_tokens": 2422386.0,
"step": 65
},
{
"entropy": 0.6243318468332291,
"epoch": 0.4282238442822384,
"grad_norm": 0.01271536760032177,
"learning_rate": 0.0002,
"loss": 0.6278913617134094,
"mean_token_accuracy": 0.7464011386036873,
"num_tokens": 2459184.0,
"step": 66
},
{
"entropy": 0.6474096700549126,
"epoch": 0.43471208434712083,
"grad_norm": 0.011297891847789288,
"learning_rate": 0.0002,
"loss": 0.649469256401062,
"mean_token_accuracy": 0.7372781112790108,
"num_tokens": 2496769.0,
"step": 67
},
{
"entropy": 0.629207618534565,
"epoch": 0.44120032441200324,
"grad_norm": 0.01338763814419508,
"learning_rate": 0.0002,
"loss": 0.6260238885879517,
"mean_token_accuracy": 0.7460990995168686,
"num_tokens": 2533774.0,
"step": 68
},
{
"entropy": 0.6363127902150154,
"epoch": 0.44768856447688565,
"grad_norm": 0.01232822984457016,
"learning_rate": 0.0002,
"loss": 0.6326106786727905,
"mean_token_accuracy": 0.7443196326494217,
"num_tokens": 2570775.0,
"step": 69
},
{
"entropy": 0.632358968257904,
"epoch": 0.45417680454176806,
"grad_norm": 0.012171111069619656,
"learning_rate": 0.0002,
"loss": 0.6312543749809265,
"mean_token_accuracy": 0.745995283126831,
"num_tokens": 2608121.0,
"step": 70
},
{
"entropy": 0.6332346796989441,
"epoch": 0.4606650446066504,
"grad_norm": 0.015379011631011963,
"learning_rate": 0.0002,
"loss": 0.6291565299034119,
"mean_token_accuracy": 0.7465488314628601,
"num_tokens": 2645664.0,
"step": 71
},
{
"entropy": 0.6404105871915817,
"epoch": 0.46715328467153283,
"grad_norm": 0.011988981626927853,
"learning_rate": 0.0002,
"loss": 0.642942488193512,
"mean_token_accuracy": 0.7407120391726494,
"num_tokens": 2683394.0,
"step": 72
},
{
"entropy": 0.6460321098566055,
"epoch": 0.47364152473641524,
"grad_norm": 0.013498514890670776,
"learning_rate": 0.0002,
"loss": 0.6516697406768799,
"mean_token_accuracy": 0.7381351664662361,
"num_tokens": 2720891.0,
"step": 73
},
{
"entropy": 0.6352040842175484,
"epoch": 0.48012976480129765,
"grad_norm": 0.013542759232223034,
"learning_rate": 0.0002,
"loss": 0.6443178653717041,
"mean_token_accuracy": 0.7414710223674774,
"num_tokens": 2758174.0,
"step": 74
},
{
"entropy": 0.6283697411417961,
"epoch": 0.48661800486618007,
"grad_norm": 0.014966949820518494,
"learning_rate": 0.0002,
"loss": 0.6394721269607544,
"mean_token_accuracy": 0.7419639229774475,
"num_tokens": 2795106.0,
"step": 75
},
{
"entropy": 0.642236091196537,
"epoch": 0.4931062449310625,
"grad_norm": 0.015388374216854572,
"learning_rate": 0.0002,
"loss": 0.6414813995361328,
"mean_token_accuracy": 0.7409433200955391,
"num_tokens": 2832247.0,
"step": 76
},
{
"entropy": 0.6422772705554962,
"epoch": 0.49959448499594483,
"grad_norm": 0.013754413463175297,
"learning_rate": 0.0002,
"loss": 0.6367785930633545,
"mean_token_accuracy": 0.7442163750529289,
"num_tokens": 2869526.0,
"step": 77
},
{
"entropy": 0.653985932469368,
"epoch": 0.5060827250608273,
"grad_norm": 0.012936330400407314,
"learning_rate": 0.0002,
"loss": 0.6488639712333679,
"mean_token_accuracy": 0.7398064211010933,
"num_tokens": 2906821.0,
"step": 78
},
{
"entropy": 0.6418487578630447,
"epoch": 0.5125709651257097,
"grad_norm": 0.011183886788785458,
"learning_rate": 0.0002,
"loss": 0.639202356338501,
"mean_token_accuracy": 0.7434348165988922,
"num_tokens": 2944032.0,
"step": 79
},
{
"entropy": 0.6251209825277328,
"epoch": 0.519059205190592,
"grad_norm": 0.013851741328835487,
"learning_rate": 0.0002,
"loss": 0.6242102384567261,
"mean_token_accuracy": 0.7505335137248039,
"num_tokens": 2981414.0,
"step": 80
},
{
"entropy": 0.6139597967267036,
"epoch": 0.5255474452554745,
"grad_norm": 0.013575786724686623,
"learning_rate": 0.0002,
"loss": 0.6168844699859619,
"mean_token_accuracy": 0.7502986714243889,
"num_tokens": 3018494.0,
"step": 81
},
{
"entropy": 0.6357163935899734,
"epoch": 0.5320356853203568,
"grad_norm": 0.012106247246265411,
"learning_rate": 0.0002,
"loss": 0.6393176317214966,
"mean_token_accuracy": 0.743524856865406,
"num_tokens": 3055667.0,
"step": 82
},
{
"entropy": 0.630703866481781,
"epoch": 0.5385239253852393,
"grad_norm": 0.011411616578698158,
"learning_rate": 0.0002,
"loss": 0.6349452137947083,
"mean_token_accuracy": 0.7417918294668198,
"num_tokens": 3092980.0,
"step": 83
},
{
"entropy": 0.6312713250517845,
"epoch": 0.5450121654501217,
"grad_norm": 0.013269394636154175,
"learning_rate": 0.0002,
"loss": 0.6335923075675964,
"mean_token_accuracy": 0.7427873983979225,
"num_tokens": 3129991.0,
"step": 84
},
{
"entropy": 0.6429375261068344,
"epoch": 0.551500405515004,
"grad_norm": 0.01290512178093195,
"learning_rate": 0.0002,
"loss": 0.6390902996063232,
"mean_token_accuracy": 0.7440147623419762,
"num_tokens": 3167600.0,
"step": 85
},
{
"entropy": 0.6209964007139206,
"epoch": 0.5579886455798865,
"grad_norm": 0.011449260637164116,
"learning_rate": 0.0002,
"loss": 0.6205590963363647,
"mean_token_accuracy": 0.7478290274739265,
"num_tokens": 3204616.0,
"step": 86
},
{
"entropy": 0.6387689039111137,
"epoch": 0.5644768856447688,
"grad_norm": 0.012288929894566536,
"learning_rate": 0.0002,
"loss": 0.6413038372993469,
"mean_token_accuracy": 0.7402090132236481,
"num_tokens": 3241598.0,
"step": 87
},
{
"entropy": 0.6296097934246063,
"epoch": 0.5709651257096513,
"grad_norm": 0.012685527093708515,
"learning_rate": 0.0002,
"loss": 0.6300569772720337,
"mean_token_accuracy": 0.745740607380867,
"num_tokens": 3278904.0,
"step": 88
},
{
"entropy": 0.6304027885198593,
"epoch": 0.5774533657745337,
"grad_norm": 0.012135171331465244,
"learning_rate": 0.0002,
"loss": 0.6322764158248901,
"mean_token_accuracy": 0.7428491413593292,
"num_tokens": 3315916.0,
"step": 89
},
{
"entropy": 0.6270208656787872,
"epoch": 0.583941605839416,
"grad_norm": 0.012634403072297573,
"learning_rate": 0.0002,
"loss": 0.6289095878601074,
"mean_token_accuracy": 0.74432173371315,
"num_tokens": 3352975.0,
"step": 90
},
{
"entropy": 0.6426985636353493,
"epoch": 0.5904298459042985,
"grad_norm": 0.012899120338261127,
"learning_rate": 0.0002,
"loss": 0.6412180662155151,
"mean_token_accuracy": 0.7413002401590347,
"num_tokens": 3390460.0,
"step": 91
},
{
"entropy": 0.6386194601655006,
"epoch": 0.5969180859691808,
"grad_norm": 0.011871455237269402,
"learning_rate": 0.0002,
"loss": 0.6381049156188965,
"mean_token_accuracy": 0.7410541325807571,
"num_tokens": 3427650.0,
"step": 92
},
{
"entropy": 0.6219398155808449,
"epoch": 0.6034063260340633,
"grad_norm": 0.013389634899795055,
"learning_rate": 0.0002,
"loss": 0.628428041934967,
"mean_token_accuracy": 0.7469312027096748,
"num_tokens": 3464664.0,
"step": 93
},
{
"entropy": 0.6363367736339569,
"epoch": 0.6098945660989457,
"grad_norm": 0.010384561493992805,
"learning_rate": 0.0002,
"loss": 0.6355550289154053,
"mean_token_accuracy": 0.742337591946125,
"num_tokens": 3502010.0,
"step": 94
},
{
"entropy": 0.6357248276472092,
"epoch": 0.616382806163828,
"grad_norm": 0.010791895911097527,
"learning_rate": 0.0002,
"loss": 0.6378734111785889,
"mean_token_accuracy": 0.7428740784525871,
"num_tokens": 3539472.0,
"step": 95
},
{
"entropy": 0.6360966116189957,
"epoch": 0.6228710462287105,
"grad_norm": 0.010037368163466454,
"learning_rate": 0.0002,
"loss": 0.6382291316986084,
"mean_token_accuracy": 0.7439633831381798,
"num_tokens": 3576863.0,
"step": 96
},
{
"entropy": 0.6299866884946823,
"epoch": 0.6293592862935928,
"grad_norm": 0.011554226279258728,
"learning_rate": 0.0002,
"loss": 0.6333507895469666,
"mean_token_accuracy": 0.7430082336068153,
"num_tokens": 3613859.0,
"step": 97
},
{
"entropy": 0.6372612193226814,
"epoch": 0.6358475263584753,
"grad_norm": 0.012070685625076294,
"learning_rate": 0.0002,
"loss": 0.6347473859786987,
"mean_token_accuracy": 0.7440797835588455,
"num_tokens": 3651376.0,
"step": 98
},
{
"entropy": 0.6408236473798752,
"epoch": 0.6423357664233577,
"grad_norm": 0.010936851613223553,
"learning_rate": 0.0002,
"loss": 0.6386737823486328,
"mean_token_accuracy": 0.7431015446782112,
"num_tokens": 3688847.0,
"step": 99
},
{
"entropy": 0.6442330852150917,
"epoch": 0.64882400648824,
"grad_norm": 0.01024035457521677,
"learning_rate": 0.0002,
"loss": 0.6463708877563477,
"mean_token_accuracy": 0.7389701902866364,
"num_tokens": 3726347.0,
"step": 100
},
{
"entropy": 0.6199506223201752,
"epoch": 0.6553122465531225,
"grad_norm": 0.01070485170930624,
"learning_rate": 0.0002,
"loss": 0.6225665807723999,
"mean_token_accuracy": 0.7488372325897217,
"num_tokens": 3763687.0,
"step": 101
},
{
"entropy": 0.6321059763431549,
"epoch": 0.6618004866180048,
"grad_norm": 0.010497628711163998,
"learning_rate": 0.0002,
"loss": 0.6386170387268066,
"mean_token_accuracy": 0.7398883476853371,
"num_tokens": 3801390.0,
"step": 102
},
{
"entropy": 0.6317892819643021,
"epoch": 0.6682887266828873,
"grad_norm": 0.009558591060340405,
"learning_rate": 0.0002,
"loss": 0.6320483684539795,
"mean_token_accuracy": 0.744752362370491,
"num_tokens": 3838836.0,
"step": 103
},
{
"entropy": 0.6251348331570625,
"epoch": 0.6747769667477697,
"grad_norm": 0.012168657965958118,
"learning_rate": 0.0002,
"loss": 0.624641478061676,
"mean_token_accuracy": 0.7455502301454544,
"num_tokens": 3876059.0,
"step": 104
},
{
"entropy": 0.6264195889234543,
"epoch": 0.681265206812652,
"grad_norm": 0.01135180238634348,
"learning_rate": 0.0002,
"loss": 0.6254705190658569,
"mean_token_accuracy": 0.7437941655516624,
"num_tokens": 3913140.0,
"step": 105
},
{
"entropy": 0.6271661967039108,
"epoch": 0.6877534468775345,
"grad_norm": 0.011404785327613354,
"learning_rate": 0.0002,
"loss": 0.627234160900116,
"mean_token_accuracy": 0.7443915233016014,
"num_tokens": 3950197.0,
"step": 106
},
{
"entropy": 0.6316048800945282,
"epoch": 0.6942416869424168,
"grad_norm": 0.012731475755572319,
"learning_rate": 0.0002,
"loss": 0.631871223449707,
"mean_token_accuracy": 0.7436823844909668,
"num_tokens": 3987880.0,
"step": 107
},
{
"entropy": 0.6351677849888802,
"epoch": 0.7007299270072993,
"grad_norm": 0.011057685129344463,
"learning_rate": 0.0002,
"loss": 0.634377121925354,
"mean_token_accuracy": 0.7431640774011612,
"num_tokens": 4025490.0,
"step": 108
},
{
"entropy": 0.6258664429187775,
"epoch": 0.7072181670721817,
"grad_norm": 0.012130603194236755,
"learning_rate": 0.0002,
"loss": 0.628970742225647,
"mean_token_accuracy": 0.7431703954935074,
"num_tokens": 4062925.0,
"step": 109
},
{
"entropy": 0.6371812373399734,
"epoch": 0.7137064071370641,
"grad_norm": 0.01057880837470293,
"learning_rate": 0.0002,
"loss": 0.6419240236282349,
"mean_token_accuracy": 0.7392893806099892,
"num_tokens": 4100176.0,
"step": 110
},
{
"entropy": 0.6297428086400032,
"epoch": 0.7201946472019465,
"grad_norm": 0.01054214034229517,
"learning_rate": 0.0002,
"loss": 0.6334270238876343,
"mean_token_accuracy": 0.7451630085706711,
"num_tokens": 4137649.0,
"step": 111
},
{
"entropy": 0.6174112483859062,
"epoch": 0.7266828872668288,
"grad_norm": 0.01192370243370533,
"learning_rate": 0.0002,
"loss": 0.6196002960205078,
"mean_token_accuracy": 0.748643770813942,
"num_tokens": 4174992.0,
"step": 112
},
{
"entropy": 0.6409988701343536,
"epoch": 0.7331711273317113,
"grad_norm": 0.012110228650271893,
"learning_rate": 0.0002,
"loss": 0.6420451402664185,
"mean_token_accuracy": 0.7404038235545158,
"num_tokens": 4212392.0,
"step": 113
},
{
"entropy": 0.6189580634236336,
"epoch": 0.7396593673965937,
"grad_norm": 0.010546376928687096,
"learning_rate": 0.0002,
"loss": 0.6227763891220093,
"mean_token_accuracy": 0.7471738830208778,
"num_tokens": 4249387.0,
"step": 114
},
{
"entropy": 0.6477556005120277,
"epoch": 0.7461476074614761,
"grad_norm": 0.012936307117342949,
"learning_rate": 0.0002,
"loss": 0.6444486379623413,
"mean_token_accuracy": 0.7407133355736732,
"num_tokens": 4286813.0,
"step": 115
},
{
"entropy": 0.6388062611222267,
"epoch": 0.7526358475263585,
"grad_norm": 0.011020737700164318,
"learning_rate": 0.0002,
"loss": 0.6358926892280579,
"mean_token_accuracy": 0.7421080470085144,
"num_tokens": 4324068.0,
"step": 116
},
{
"entropy": 0.623978279531002,
"epoch": 0.7591240875912408,
"grad_norm": 0.011272276751697063,
"learning_rate": 0.0002,
"loss": 0.6239657402038574,
"mean_token_accuracy": 0.7491330280900002,
"num_tokens": 4361117.0,
"step": 117
},
{
"entropy": 0.6343322321772575,
"epoch": 0.7656123276561233,
"grad_norm": 0.011995693668723106,
"learning_rate": 0.0002,
"loss": 0.635836124420166,
"mean_token_accuracy": 0.7406070083379745,
"num_tokens": 4398800.0,
"step": 118
},
{
"entropy": 0.6236653178930283,
"epoch": 0.7721005677210057,
"grad_norm": 0.012621116824448109,
"learning_rate": 0.0002,
"loss": 0.6293167471885681,
"mean_token_accuracy": 0.7453652620315552,
"num_tokens": 4435941.0,
"step": 119
},
{
"entropy": 0.6156119927763939,
"epoch": 0.7785888077858881,
"grad_norm": 0.010849852114915848,
"learning_rate": 0.0002,
"loss": 0.619170069694519,
"mean_token_accuracy": 0.7481161803007126,
"num_tokens": 4473532.0,
"step": 120
},
{
"entropy": 0.6325643733143806,
"epoch": 0.7850770478507705,
"grad_norm": 0.012033924460411072,
"learning_rate": 0.0002,
"loss": 0.6320570707321167,
"mean_token_accuracy": 0.745756022632122,
"num_tokens": 4510663.0,
"step": 121
},
{
"entropy": 0.6439174935221672,
"epoch": 0.7915652879156528,
"grad_norm": 0.011160428635776043,
"learning_rate": 0.0002,
"loss": 0.6456828117370605,
"mean_token_accuracy": 0.7372104227542877,
"num_tokens": 4548366.0,
"step": 122
},
{
"entropy": 0.614606499671936,
"epoch": 0.7980535279805353,
"grad_norm": 0.012264038436114788,
"learning_rate": 0.0002,
"loss": 0.6181074976921082,
"mean_token_accuracy": 0.7488836497068405,
"num_tokens": 4585220.0,
"step": 123
},
{
"entropy": 0.6238071173429489,
"epoch": 0.8045417680454177,
"grad_norm": 0.010948721319437027,
"learning_rate": 0.0002,
"loss": 0.6282123327255249,
"mean_token_accuracy": 0.7447341307997704,
"num_tokens": 4622594.0,
"step": 124
},
{
"entropy": 0.6207244768738747,
"epoch": 0.8110300081103001,
"grad_norm": 0.011111956089735031,
"learning_rate": 0.0002,
"loss": 0.6224273443222046,
"mean_token_accuracy": 0.748368538916111,
"num_tokens": 4659890.0,
"step": 125
},
{
"entropy": 0.6334651708602905,
"epoch": 0.8175182481751825,
"grad_norm": 0.01036700326949358,
"learning_rate": 0.0002,
"loss": 0.6354086399078369,
"mean_token_accuracy": 0.742103323340416,
"num_tokens": 4697214.0,
"step": 126
},
{
"entropy": 0.6321412995457649,
"epoch": 0.8240064882400648,
"grad_norm": 0.011659913696348667,
"learning_rate": 0.0002,
"loss": 0.632038950920105,
"mean_token_accuracy": 0.7430339977145195,
"num_tokens": 4734306.0,
"step": 127
},
{
"entropy": 0.6252134963870049,
"epoch": 0.8304947283049473,
"grad_norm": 0.010766416788101196,
"learning_rate": 0.0002,
"loss": 0.6210082173347473,
"mean_token_accuracy": 0.747887596487999,
"num_tokens": 4772005.0,
"step": 128
},
{
"entropy": 0.632231742143631,
"epoch": 0.8369829683698297,
"grad_norm": 0.009685291908681393,
"learning_rate": 0.0002,
"loss": 0.6338882446289062,
"mean_token_accuracy": 0.7436560764908791,
"num_tokens": 4809261.0,
"step": 129
},
{
"entropy": 0.6244007870554924,
"epoch": 0.8434712084347121,
"grad_norm": 0.011300327256321907,
"learning_rate": 0.0002,
"loss": 0.6297156810760498,
"mean_token_accuracy": 0.7441424131393433,
"num_tokens": 4846773.0,
"step": 130
},
{
"entropy": 0.6212883591651917,
"epoch": 0.8499594484995945,
"grad_norm": 0.011122049763798714,
"learning_rate": 0.0002,
"loss": 0.6272852420806885,
"mean_token_accuracy": 0.745480865240097,
"num_tokens": 4884087.0,
"step": 131
},
{
"entropy": 0.6275059729814529,
"epoch": 0.8564476885644768,
"grad_norm": 0.011759513057768345,
"learning_rate": 0.0002,
"loss": 0.6352666020393372,
"mean_token_accuracy": 0.741997979581356,
"num_tokens": 4921034.0,
"step": 132
},
{
"entropy": 0.6292549446225166,
"epoch": 0.8629359286293593,
"grad_norm": 0.010103589855134487,
"learning_rate": 0.0002,
"loss": 0.6285660862922668,
"mean_token_accuracy": 0.7458189874887466,
"num_tokens": 4958394.0,
"step": 133
},
{
"entropy": 0.6254143863916397,
"epoch": 0.8694241686942417,
"grad_norm": 0.009165394119918346,
"learning_rate": 0.0002,
"loss": 0.6281845569610596,
"mean_token_accuracy": 0.7441290989518166,
"num_tokens": 4995560.0,
"step": 134
},
{
"entropy": 0.6326478272676468,
"epoch": 0.8759124087591241,
"grad_norm": 0.009857391007244587,
"learning_rate": 0.0002,
"loss": 0.6341642141342163,
"mean_token_accuracy": 0.7431726306676865,
"num_tokens": 5032908.0,
"step": 135
},
{
"entropy": 0.6411951705813408,
"epoch": 0.8824006488240065,
"grad_norm": 0.009912555105984211,
"learning_rate": 0.0002,
"loss": 0.6402624845504761,
"mean_token_accuracy": 0.7418247908353806,
"num_tokens": 5070353.0,
"step": 136
},
{
"entropy": 0.6335436180233955,
"epoch": 0.8888888888888888,
"grad_norm": 0.010203655809164047,
"learning_rate": 0.0002,
"loss": 0.6348065137863159,
"mean_token_accuracy": 0.7417963817715645,
"num_tokens": 5107488.0,
"step": 137
},
{
"entropy": 0.6298110708594322,
"epoch": 0.8953771289537713,
"grad_norm": 0.009738304652273655,
"learning_rate": 0.0002,
"loss": 0.6292046904563904,
"mean_token_accuracy": 0.7428107112646103,
"num_tokens": 5144774.0,
"step": 138
},
{
"entropy": 0.621233694255352,
"epoch": 0.9018653690186537,
"grad_norm": 0.009310460649430752,
"learning_rate": 0.0002,
"loss": 0.6167433261871338,
"mean_token_accuracy": 0.7501207813620567,
"num_tokens": 5181712.0,
"step": 139
},
{
"entropy": 0.6066861748695374,
"epoch": 0.9083536090835361,
"grad_norm": 0.010622376576066017,
"learning_rate": 0.0002,
"loss": 0.6090973615646362,
"mean_token_accuracy": 0.7524907812476158,
"num_tokens": 5219096.0,
"step": 140
},
{
"entropy": 0.6264965310692787,
"epoch": 0.9148418491484185,
"grad_norm": 0.011424071155488491,
"learning_rate": 0.0002,
"loss": 0.6337799429893494,
"mean_token_accuracy": 0.7431259453296661,
"num_tokens": 5256221.0,
"step": 141
},
{
"entropy": 0.6391952782869339,
"epoch": 0.9213300892133008,
"grad_norm": 0.009158595465123653,
"learning_rate": 0.0002,
"loss": 0.6384302973747253,
"mean_token_accuracy": 0.7389715909957886,
"num_tokens": 5293696.0,
"step": 142
},
{
"entropy": 0.6427849903702736,
"epoch": 0.9278183292781833,
"grad_norm": 0.011200455017387867,
"learning_rate": 0.0002,
"loss": 0.6386270523071289,
"mean_token_accuracy": 0.7409881576895714,
"num_tokens": 5330767.0,
"step": 143
},
{
"entropy": 0.6417384147644043,
"epoch": 0.9343065693430657,
"grad_norm": 0.010727403685450554,
"learning_rate": 0.0002,
"loss": 0.63932865858078,
"mean_token_accuracy": 0.7433461174368858,
"num_tokens": 5368288.0,
"step": 144
},
{
"entropy": 0.6349349692463875,
"epoch": 0.9407948094079481,
"grad_norm": 0.01087568886578083,
"learning_rate": 0.0002,
"loss": 0.6332679986953735,
"mean_token_accuracy": 0.7431394383311272,
"num_tokens": 5405743.0,
"step": 145
},
{
"entropy": 0.6268604248762131,
"epoch": 0.9472830494728305,
"grad_norm": 0.009905870072543621,
"learning_rate": 0.0002,
"loss": 0.6278096437454224,
"mean_token_accuracy": 0.7460607141256332,
"num_tokens": 5442824.0,
"step": 146
},
{
"entropy": 0.6252990365028381,
"epoch": 0.9537712895377128,
"grad_norm": 0.011337473057210445,
"learning_rate": 0.0002,
"loss": 0.6313953399658203,
"mean_token_accuracy": 0.7449029609560966,
"num_tokens": 5480060.0,
"step": 147
},
{
"entropy": 0.6279519572854042,
"epoch": 0.9602595296025953,
"grad_norm": 0.011046580970287323,
"learning_rate": 0.0002,
"loss": 0.6361185312271118,
"mean_token_accuracy": 0.7435570135712624,
"num_tokens": 5517276.0,
"step": 148
},
{
"entropy": 0.6244647055864334,
"epoch": 0.9667477696674777,
"grad_norm": 0.010344677604734898,
"learning_rate": 0.0002,
"loss": 0.6286739110946655,
"mean_token_accuracy": 0.7459346577525139,
"num_tokens": 5554772.0,
"step": 149
},
{
"entropy": 0.625552199780941,
"epoch": 0.9732360097323601,
"grad_norm": 0.010485424660146236,
"learning_rate": 0.0002,
"loss": 0.6246562600135803,
"mean_token_accuracy": 0.7459065243601799,
"num_tokens": 5592235.0,
"step": 150
},
{
"entropy": 0.650402158498764,
"epoch": 0.9797242497972425,
"grad_norm": 0.01180343609303236,
"learning_rate": 0.0002,
"loss": 0.6489013433456421,
"mean_token_accuracy": 0.7372798472642899,
"num_tokens": 5629879.0,
"step": 151
},
{
"entropy": 0.625130906701088,
"epoch": 0.986212489862125,
"grad_norm": 0.010784060694277287,
"learning_rate": 0.0002,
"loss": 0.6217543482780457,
"mean_token_accuracy": 0.7487893849611282,
"num_tokens": 5667174.0,
"step": 152
},
{
"entropy": 0.6295798048377037,
"epoch": 0.9927007299270073,
"grad_norm": 0.00907177198678255,
"learning_rate": 0.0002,
"loss": 0.6333097219467163,
"mean_token_accuracy": 0.7429074198007584,
"num_tokens": 5704388.0,
"step": 153
},
{
"entropy": 0.6149610579013824,
"epoch": 0.9991889699918897,
"grad_norm": 0.010923929512500763,
"learning_rate": 0.0002,
"loss": 0.6188989877700806,
"mean_token_accuracy": 0.7496026828885078,
"num_tokens": 5741236.0,
"step": 154
},
{
"entropy": 0.6364340782165527,
"epoch": 1.0,
"grad_norm": 0.023092100396752357,
"learning_rate": 0.0002,
"loss": 0.6314291954040527,
"mean_token_accuracy": 0.7433016300201416,
"num_tokens": 5745896.0,
"step": 155
},
{
"entropy": 0.6255532875657082,
"epoch": 1.0064882400648825,
"grad_norm": 0.010001299902796745,
"learning_rate": 0.0002,
"loss": 0.6274809837341309,
"mean_token_accuracy": 0.7447079941630363,
"num_tokens": 5782887.0,
"step": 156
},
{
"entropy": 0.6249469369649887,
"epoch": 1.0129764801297647,
"grad_norm": 0.010014750063419342,
"learning_rate": 0.0002,
"loss": 0.6293044090270996,
"mean_token_accuracy": 0.743991531431675,
"num_tokens": 5820452.0,
"step": 157
},
{
"entropy": 0.6250087693333626,
"epoch": 1.0194647201946472,
"grad_norm": 0.009554821066558361,
"learning_rate": 0.0002,
"loss": 0.6216879487037659,
"mean_token_accuracy": 0.7472942620515823,
"num_tokens": 5857511.0,
"step": 158
},
{
"entropy": 0.6345709040760994,
"epoch": 1.0259529602595296,
"grad_norm": 0.010529364459216595,
"learning_rate": 0.0002,
"loss": 0.6336644887924194,
"mean_token_accuracy": 0.7428694814443588,
"num_tokens": 5895426.0,
"step": 159
},
{
"entropy": 0.6269640624523163,
"epoch": 1.0324412003244121,
"grad_norm": 0.010084465146064758,
"learning_rate": 0.0002,
"loss": 0.6298044919967651,
"mean_token_accuracy": 0.7432648167014122,
"num_tokens": 5932788.0,
"step": 160
},
{
"entropy": 0.6268706321716309,
"epoch": 1.0389294403892944,
"grad_norm": 0.009462922811508179,
"learning_rate": 0.0002,
"loss": 0.6329535245895386,
"mean_token_accuracy": 0.7419963404536247,
"num_tokens": 5970211.0,
"step": 161
},
{
"entropy": 0.6167154312133789,
"epoch": 1.0454176804541768,
"grad_norm": 0.009687564335763454,
"learning_rate": 0.0002,
"loss": 0.6214160919189453,
"mean_token_accuracy": 0.7477982342243195,
"num_tokens": 6007676.0,
"step": 162
},
{
"entropy": 0.6232415363192558,
"epoch": 1.0519059205190593,
"grad_norm": 0.011512194760143757,
"learning_rate": 0.0002,
"loss": 0.6291061639785767,
"mean_token_accuracy": 0.743974357843399,
"num_tokens": 6044881.0,
"step": 163
},
{
"entropy": 0.6384411826729774,
"epoch": 1.0583941605839415,
"grad_norm": 0.009664908982813358,
"learning_rate": 0.0002,
"loss": 0.6418322920799255,
"mean_token_accuracy": 0.7393775209784508,
"num_tokens": 6081959.0,
"step": 164
},
{
"entropy": 0.6312756985425949,
"epoch": 1.064882400648824,
"grad_norm": 0.009909010492265224,
"learning_rate": 0.0002,
"loss": 0.6294491291046143,
"mean_token_accuracy": 0.7447398081421852,
"num_tokens": 6119502.0,
"step": 165
},
{
"entropy": 0.6399073377251625,
"epoch": 1.0713706407137065,
"grad_norm": 0.009380994364619255,
"learning_rate": 0.0002,
"loss": 0.6359134912490845,
"mean_token_accuracy": 0.7427374646067619,
"num_tokens": 6157187.0,
"step": 166
},
{
"entropy": 0.6151667386293411,
"epoch": 1.0778588807785887,
"grad_norm": 0.008555393666028976,
"learning_rate": 0.0002,
"loss": 0.6155805587768555,
"mean_token_accuracy": 0.7496763169765472,
"num_tokens": 6194222.0,
"step": 167
},
{
"entropy": 0.6240349486470222,
"epoch": 1.0843471208434712,
"grad_norm": 0.008739444427192211,
"learning_rate": 0.0002,
"loss": 0.6246569156646729,
"mean_token_accuracy": 0.7454928457736969,
"num_tokens": 6231423.0,
"step": 168
},
{
"entropy": 0.6332473009824753,
"epoch": 1.0908353609083536,
"grad_norm": 0.009752689860761166,
"learning_rate": 0.0002,
"loss": 0.6364842653274536,
"mean_token_accuracy": 0.7410347387194633,
"num_tokens": 6268835.0,
"step": 169
},
{
"entropy": 0.6179100349545479,
"epoch": 1.0973236009732361,
"grad_norm": 0.010130702517926693,
"learning_rate": 0.0002,
"loss": 0.6235646605491638,
"mean_token_accuracy": 0.7480539605021477,
"num_tokens": 6306169.0,
"step": 170
},
{
"entropy": 0.6232842579483986,
"epoch": 1.1038118410381184,
"grad_norm": 0.00973625760525465,
"learning_rate": 0.0002,
"loss": 0.6288238763809204,
"mean_token_accuracy": 0.7431181073188782,
"num_tokens": 6343047.0,
"step": 171
},
{
"entropy": 0.6252638548612595,
"epoch": 1.1103000811030008,
"grad_norm": 0.009265839122235775,
"learning_rate": 0.0002,
"loss": 0.6260301470756531,
"mean_token_accuracy": 0.7449894994497299,
"num_tokens": 6380248.0,
"step": 172
},
{
"entropy": 0.6273873671889305,
"epoch": 1.1167883211678833,
"grad_norm": 0.009544978849589825,
"learning_rate": 0.0002,
"loss": 0.624110996723175,
"mean_token_accuracy": 0.7455884218215942,
"num_tokens": 6417799.0,
"step": 173
},
{
"entropy": 0.6261554434895515,
"epoch": 1.1232765612327655,
"grad_norm": 0.009425261989235878,
"learning_rate": 0.0002,
"loss": 0.6238696575164795,
"mean_token_accuracy": 0.747870922088623,
"num_tokens": 6454969.0,
"step": 174
},
{
"entropy": 0.6361829712986946,
"epoch": 1.129764801297648,
"grad_norm": 0.009325449354946613,
"learning_rate": 0.0002,
"loss": 0.6336718201637268,
"mean_token_accuracy": 0.7412231788039207,
"num_tokens": 6493115.0,
"step": 175
},
{
"entropy": 0.626146711409092,
"epoch": 1.1362530413625305,
"grad_norm": 0.010177000425755978,
"learning_rate": 0.0002,
"loss": 0.6264243125915527,
"mean_token_accuracy": 0.7452349737286568,
"num_tokens": 6530141.0,
"step": 176
},
{
"entropy": 0.620332308113575,
"epoch": 1.142741281427413,
"grad_norm": 0.010463408194482327,
"learning_rate": 0.0002,
"loss": 0.6263006329536438,
"mean_token_accuracy": 0.7455399706959724,
"num_tokens": 6567506.0,
"step": 177
},
{
"entropy": 0.6137627214193344,
"epoch": 1.1492295214922952,
"grad_norm": 0.011479280889034271,
"learning_rate": 0.0002,
"loss": 0.6208648681640625,
"mean_token_accuracy": 0.7491373345255852,
"num_tokens": 6604409.0,
"step": 178
},
{
"entropy": 0.6161536052823067,
"epoch": 1.1557177615571776,
"grad_norm": 0.010295857675373554,
"learning_rate": 0.0002,
"loss": 0.6196001768112183,
"mean_token_accuracy": 0.7471510693430901,
"num_tokens": 6641779.0,
"step": 179
},
{
"entropy": 0.615701287984848,
"epoch": 1.1622060016220601,
"grad_norm": 0.00977401528507471,
"learning_rate": 0.0002,
"loss": 0.6152433156967163,
"mean_token_accuracy": 0.7513743862509727,
"num_tokens": 6678811.0,
"step": 180
},
{
"entropy": 0.6276117786765099,
"epoch": 1.1686942416869424,
"grad_norm": 0.009978534653782845,
"learning_rate": 0.0002,
"loss": 0.6257454752922058,
"mean_token_accuracy": 0.7457039654254913,
"num_tokens": 6715971.0,
"step": 181
},
{
"entropy": 0.622728981077671,
"epoch": 1.1751824817518248,
"grad_norm": 0.010105178691446781,
"learning_rate": 0.0002,
"loss": 0.6200466156005859,
"mean_token_accuracy": 0.7463524416089058,
"num_tokens": 6753100.0,
"step": 182
},
{
"entropy": 0.6278671473264694,
"epoch": 1.1816707218167073,
"grad_norm": 0.00981152057647705,
"learning_rate": 0.0002,
"loss": 0.629209041595459,
"mean_token_accuracy": 0.7440850958228111,
"num_tokens": 6790606.0,
"step": 183
},
{
"entropy": 0.6340474411845207,
"epoch": 1.1881589618815895,
"grad_norm": 0.010966816917061806,
"learning_rate": 0.0002,
"loss": 0.6343464851379395,
"mean_token_accuracy": 0.7423162013292313,
"num_tokens": 6827773.0,
"step": 184
},
{
"entropy": 0.627871498465538,
"epoch": 1.194647201946472,
"grad_norm": 0.01046378631144762,
"learning_rate": 0.0002,
"loss": 0.6280568838119507,
"mean_token_accuracy": 0.7452474683523178,
"num_tokens": 6865004.0,
"step": 185
},
{
"entropy": 0.632583849132061,
"epoch": 1.2011354420113545,
"grad_norm": 0.011151660233736038,
"learning_rate": 0.0002,
"loss": 0.6399388313293457,
"mean_token_accuracy": 0.7401903197169304,
"num_tokens": 6902199.0,
"step": 186
},
{
"entropy": 0.6207470819354057,
"epoch": 1.2076236820762367,
"grad_norm": 0.009539226070046425,
"learning_rate": 0.0002,
"loss": 0.626314640045166,
"mean_token_accuracy": 0.7447792664170265,
"num_tokens": 6939345.0,
"step": 187
},
{
"entropy": 0.6265325620770454,
"epoch": 1.2141119221411192,
"grad_norm": 0.010582523420453072,
"learning_rate": 0.0002,
"loss": 0.6258584260940552,
"mean_token_accuracy": 0.7450206950306892,
"num_tokens": 6976749.0,
"step": 188
},
{
"entropy": 0.6242929175496101,
"epoch": 1.2206001622060016,
"grad_norm": 0.010438770987093449,
"learning_rate": 0.0002,
"loss": 0.6282113790512085,
"mean_token_accuracy": 0.7453068420290947,
"num_tokens": 7013986.0,
"step": 189
},
{
"entropy": 0.6362300962209702,
"epoch": 1.2270884022708841,
"grad_norm": 0.009592331014573574,
"learning_rate": 0.0002,
"loss": 0.6338801980018616,
"mean_token_accuracy": 0.7425767108798027,
"num_tokens": 7051122.0,
"step": 190
},
{
"entropy": 0.6142800450325012,
"epoch": 1.2335766423357664,
"grad_norm": 0.008985689841210842,
"learning_rate": 0.0002,
"loss": 0.6143558025360107,
"mean_token_accuracy": 0.750966027379036,
"num_tokens": 7088050.0,
"step": 191
},
{
"entropy": 0.6302971392869949,
"epoch": 1.2400648824006488,
"grad_norm": 0.009001200087368488,
"learning_rate": 0.0002,
"loss": 0.6324248313903809,
"mean_token_accuracy": 0.7426666542887688,
"num_tokens": 7125652.0,
"step": 192
},
{
"entropy": 0.6278156340122223,
"epoch": 1.2465531224655313,
"grad_norm": 0.009873399510979652,
"learning_rate": 0.0002,
"loss": 0.6288595795631409,
"mean_token_accuracy": 0.7446199506521225,
"num_tokens": 7163209.0,
"step": 193
},
{
"entropy": 0.6151107102632523,
"epoch": 1.2530413625304138,
"grad_norm": 0.010955240577459335,
"learning_rate": 0.0002,
"loss": 0.6196198463439941,
"mean_token_accuracy": 0.7487600594758987,
"num_tokens": 7200676.0,
"step": 194
},
{
"entropy": 0.624420776963234,
"epoch": 1.259529602595296,
"grad_norm": 0.009569366462528706,
"learning_rate": 0.0002,
"loss": 0.6245594024658203,
"mean_token_accuracy": 0.7455159053206444,
"num_tokens": 7237914.0,
"step": 195
},
{
"entropy": 0.62844218313694,
"epoch": 1.2660178426601785,
"grad_norm": 0.00903658103197813,
"learning_rate": 0.0002,
"loss": 0.6268140077590942,
"mean_token_accuracy": 0.7442804053425789,
"num_tokens": 7275515.0,
"step": 196
},
{
"entropy": 0.6202637255191803,
"epoch": 1.272506082725061,
"grad_norm": 0.00881174299865961,
"learning_rate": 0.0002,
"loss": 0.6185364723205566,
"mean_token_accuracy": 0.7477486506104469,
"num_tokens": 7313158.0,
"step": 197
},
{
"entropy": 0.6143034398555756,
"epoch": 1.2789943227899432,
"grad_norm": 0.010709850117564201,
"learning_rate": 0.0002,
"loss": 0.6169742345809937,
"mean_token_accuracy": 0.7487710192799568,
"num_tokens": 7350030.0,
"step": 198
},
{
"entropy": 0.6223605200648308,
"epoch": 1.2854825628548256,
"grad_norm": 0.010480264201760292,
"learning_rate": 0.0002,
"loss": 0.6294817924499512,
"mean_token_accuracy": 0.7423868179321289,
"num_tokens": 7387006.0,
"step": 199
},
{
"entropy": 0.6272002533078194,
"epoch": 1.2919708029197081,
"grad_norm": 0.009464031085371971,
"learning_rate": 0.0002,
"loss": 0.6319963932037354,
"mean_token_accuracy": 0.7425662279129028,
"num_tokens": 7424425.0,
"step": 200
},
{
"entropy": 0.6301053911447525,
"epoch": 1.2984590429845904,
"grad_norm": 0.009957416914403439,
"learning_rate": 0.0002,
"loss": 0.6337630748748779,
"mean_token_accuracy": 0.7440446689724922,
"num_tokens": 7461695.0,
"step": 201
},
{
"entropy": 0.6238225474953651,
"epoch": 1.3049472830494728,
"grad_norm": 0.00954597070813179,
"learning_rate": 0.0002,
"loss": 0.6226916909217834,
"mean_token_accuracy": 0.7449641600251198,
"num_tokens": 7498774.0,
"step": 202
},
{
"entropy": 0.630424328148365,
"epoch": 1.3114355231143553,
"grad_norm": 0.0086854612454772,
"learning_rate": 0.0002,
"loss": 0.6267648935317993,
"mean_token_accuracy": 0.745999850332737,
"num_tokens": 7535974.0,
"step": 203
},
{
"entropy": 0.6177534386515617,
"epoch": 1.3179237631792375,
"grad_norm": 0.009849452413618565,
"learning_rate": 0.0002,
"loss": 0.6153725385665894,
"mean_token_accuracy": 0.7507055774331093,
"num_tokens": 7572957.0,
"step": 204
},
{
"entropy": 0.622411735355854,
"epoch": 1.32441200324412,
"grad_norm": 0.009472545236349106,
"learning_rate": 0.0002,
"loss": 0.625112771987915,
"mean_token_accuracy": 0.7435147687792778,
"num_tokens": 7610380.0,
"step": 205
},
{
"entropy": 0.6200075596570969,
"epoch": 1.3309002433090025,
"grad_norm": 0.010570540092885494,
"learning_rate": 0.0002,
"loss": 0.6272220611572266,
"mean_token_accuracy": 0.7441560178995132,
"num_tokens": 7647843.0,
"step": 206
},
{
"entropy": 0.6281143799424171,
"epoch": 1.3373884833738847,
"grad_norm": 0.008813613094389439,
"learning_rate": 0.0002,
"loss": 0.6328994631767273,
"mean_token_accuracy": 0.742665521800518,
"num_tokens": 7685138.0,
"step": 207
},
{
"entropy": 0.6417431458830833,
"epoch": 1.3438767234387672,
"grad_norm": 0.00971722137182951,
"learning_rate": 0.0002,
"loss": 0.6397589445114136,
"mean_token_accuracy": 0.7406186908483505,
"num_tokens": 7722781.0,
"step": 208
},
{
"entropy": 0.6444113031029701,
"epoch": 1.3503649635036497,
"grad_norm": 0.009866150096058846,
"learning_rate": 0.0002,
"loss": 0.6412906646728516,
"mean_token_accuracy": 0.7412897050380707,
"num_tokens": 7760109.0,
"step": 209
},
{
"entropy": 0.6214337572455406,
"epoch": 1.3568532035685321,
"grad_norm": 0.009207811206579208,
"learning_rate": 0.0002,
"loss": 0.6234208345413208,
"mean_token_accuracy": 0.7459528893232346,
"num_tokens": 7797532.0,
"step": 210
},
{
"entropy": 0.6157770529389381,
"epoch": 1.3633414436334144,
"grad_norm": 0.01025467086583376,
"learning_rate": 0.0002,
"loss": 0.6178190112113953,
"mean_token_accuracy": 0.7505671828985214,
"num_tokens": 7834554.0,
"step": 211
},
{
"entropy": 0.619218721985817,
"epoch": 1.3698296836982968,
"grad_norm": 0.01020651962608099,
"learning_rate": 0.0002,
"loss": 0.6230384111404419,
"mean_token_accuracy": 0.7464535236358643,
"num_tokens": 7871899.0,
"step": 212
},
{
"entropy": 0.6242957413196564,
"epoch": 1.3763179237631793,
"grad_norm": 0.009102249518036842,
"learning_rate": 0.0002,
"loss": 0.625146210193634,
"mean_token_accuracy": 0.7436935156583786,
"num_tokens": 7908550.0,
"step": 213
},
{
"entropy": 0.6318832859396935,
"epoch": 1.3828061638280618,
"grad_norm": 0.008958768099546432,
"learning_rate": 0.0002,
"loss": 0.6291754245758057,
"mean_token_accuracy": 0.7419761046767235,
"num_tokens": 7945528.0,
"step": 214
},
{
"entropy": 0.622461624443531,
"epoch": 1.389294403892944,
"grad_norm": 0.010115247219800949,
"learning_rate": 0.0002,
"loss": 0.6236110329627991,
"mean_token_accuracy": 0.7462903261184692,
"num_tokens": 7982511.0,
"step": 215
},
{
"entropy": 0.6254477724432945,
"epoch": 1.3957826439578265,
"grad_norm": 0.008989102207124233,
"learning_rate": 0.0002,
"loss": 0.6284307241439819,
"mean_token_accuracy": 0.7429582253098488,
"num_tokens": 8019795.0,
"step": 216
},
{
"entropy": 0.6165763810276985,
"epoch": 1.402270884022709,
"grad_norm": 0.010876733809709549,
"learning_rate": 0.0002,
"loss": 0.6224349737167358,
"mean_token_accuracy": 0.7477402463555336,
"num_tokens": 8057519.0,
"step": 217
},
{
"entropy": 0.6111054793000221,
"epoch": 1.4087591240875912,
"grad_norm": 0.008845480158925056,
"learning_rate": 0.0002,
"loss": 0.6134991645812988,
"mean_token_accuracy": 0.7499867528676987,
"num_tokens": 8094863.0,
"step": 218
},
{
"entropy": 0.6361298933625221,
"epoch": 1.4152473641524737,
"grad_norm": 0.009090340696275234,
"learning_rate": 0.0002,
"loss": 0.6369084715843201,
"mean_token_accuracy": 0.7387163192033768,
"num_tokens": 8132597.0,
"step": 219
},
{
"entropy": 0.6406821832060814,
"epoch": 1.4217356042173561,
"grad_norm": 0.0092760706320405,
"learning_rate": 0.0002,
"loss": 0.6413878202438354,
"mean_token_accuracy": 0.7377218827605247,
"num_tokens": 8170263.0,
"step": 220
},
{
"entropy": 0.6221970841288567,
"epoch": 1.4282238442822384,
"grad_norm": 0.009138553403317928,
"learning_rate": 0.0002,
"loss": 0.6239045858383179,
"mean_token_accuracy": 0.7459966242313385,
"num_tokens": 8207517.0,
"step": 221
},
{
"entropy": 0.6360906660556793,
"epoch": 1.4347120843471208,
"grad_norm": 0.008928137831389904,
"learning_rate": 0.0002,
"loss": 0.6395260095596313,
"mean_token_accuracy": 0.7385511174798012,
"num_tokens": 8244836.0,
"step": 222
},
{
"entropy": 0.6243730783462524,
"epoch": 1.4412003244120033,
"grad_norm": 0.009026050567626953,
"learning_rate": 0.0002,
"loss": 0.6269445419311523,
"mean_token_accuracy": 0.7457072138786316,
"num_tokens": 8281919.0,
"step": 223
},
{
"entropy": 0.6337901726365089,
"epoch": 1.4476885644768855,
"grad_norm": 0.00801246426999569,
"learning_rate": 0.0002,
"loss": 0.6330679059028625,
"mean_token_accuracy": 0.7426828071475029,
"num_tokens": 8319228.0,
"step": 224
},
{
"entropy": 0.631360612809658,
"epoch": 1.454176804541768,
"grad_norm": 0.009467655792832375,
"learning_rate": 0.0002,
"loss": 0.6300734281539917,
"mean_token_accuracy": 0.7453820630908012,
"num_tokens": 8356483.0,
"step": 225
},
{
"entropy": 0.6360229924321175,
"epoch": 1.4606650446066505,
"grad_norm": 0.009358935989439487,
"learning_rate": 0.0002,
"loss": 0.6341854929924011,
"mean_token_accuracy": 0.7435640841722488,
"num_tokens": 8393723.0,
"step": 226
},
{
"entropy": 0.6200751587748528,
"epoch": 1.4671532846715327,
"grad_norm": 0.008350496180355549,
"learning_rate": 0.0002,
"loss": 0.6218277215957642,
"mean_token_accuracy": 0.7479682192206383,
"num_tokens": 8431281.0,
"step": 227
},
{
"entropy": 0.6275244578719139,
"epoch": 1.4736415247364152,
"grad_norm": 0.009802248328924179,
"learning_rate": 0.0002,
"loss": 0.6335194706916809,
"mean_token_accuracy": 0.7433927357196808,
"num_tokens": 8468465.0,
"step": 228
},
{
"entropy": 0.6231343746185303,
"epoch": 1.4801297648012977,
"grad_norm": 0.010109310038387775,
"learning_rate": 0.0002,
"loss": 0.6223199367523193,
"mean_token_accuracy": 0.7451789528131485,
"num_tokens": 8505713.0,
"step": 229
},
{
"entropy": 0.6206792145967484,
"epoch": 1.4866180048661801,
"grad_norm": 0.010297620669007301,
"learning_rate": 0.0002,
"loss": 0.6225035190582275,
"mean_token_accuracy": 0.7460876628756523,
"num_tokens": 8542783.0,
"step": 230
},
{
"entropy": 0.6291577965021133,
"epoch": 1.4931062449310626,
"grad_norm": 0.009544001892209053,
"learning_rate": 0.0002,
"loss": 0.6289199590682983,
"mean_token_accuracy": 0.7454885393381119,
"num_tokens": 8580029.0,
"step": 231
},
{
"entropy": 0.6250879839062691,
"epoch": 1.4995944849959448,
"grad_norm": 0.008444451726973057,
"learning_rate": 0.0002,
"loss": 0.628132700920105,
"mean_token_accuracy": 0.7435998693108559,
"num_tokens": 8617067.0,
"step": 232
},
{
"entropy": 0.6236734315752983,
"epoch": 1.5060827250608273,
"grad_norm": 0.009344187565147877,
"learning_rate": 0.0002,
"loss": 0.6258345246315002,
"mean_token_accuracy": 0.7458996251225471,
"num_tokens": 8654420.0,
"step": 233
},
{
"entropy": 0.6138928905129433,
"epoch": 1.5125709651257098,
"grad_norm": 0.009892390109598637,
"learning_rate": 0.0002,
"loss": 0.6232701539993286,
"mean_token_accuracy": 0.7446143329143524,
"num_tokens": 8691786.0,
"step": 234
},
{
"entropy": 0.6233969107270241,
"epoch": 1.519059205190592,
"grad_norm": 0.010160520672798157,
"learning_rate": 0.0002,
"loss": 0.6211707592010498,
"mean_token_accuracy": 0.7472252398729324,
"num_tokens": 8729028.0,
"step": 235
},
{
"entropy": 0.6429286673665047,
"epoch": 1.5255474452554745,
"grad_norm": 0.0098539674654603,
"learning_rate": 0.0002,
"loss": 0.6372069120407104,
"mean_token_accuracy": 0.7402112632989883,
"num_tokens": 8766503.0,
"step": 236
},
{
"entropy": 0.6305690258741379,
"epoch": 1.532035685320357,
"grad_norm": 0.009324081242084503,
"learning_rate": 0.0002,
"loss": 0.6331846714019775,
"mean_token_accuracy": 0.7420341670513153,
"num_tokens": 8803595.0,
"step": 237
},
{
"entropy": 0.6305363178253174,
"epoch": 1.5385239253852392,
"grad_norm": 0.009419843554496765,
"learning_rate": 0.0002,
"loss": 0.6305243968963623,
"mean_token_accuracy": 0.7442135661840439,
"num_tokens": 8840805.0,
"step": 238
},
{
"entropy": 0.6271083503961563,
"epoch": 1.5450121654501217,
"grad_norm": 0.008481448516249657,
"learning_rate": 0.0002,
"loss": 0.628629207611084,
"mean_token_accuracy": 0.7426930069923401,
"num_tokens": 8877765.0,
"step": 239
},
{
"entropy": 0.6074612811207771,
"epoch": 1.5515004055150041,
"grad_norm": 0.008962183259427547,
"learning_rate": 0.0002,
"loss": 0.6033654808998108,
"mean_token_accuracy": 0.7540537416934967,
"num_tokens": 8915298.0,
"step": 240
},
{
"entropy": 0.6332517638802528,
"epoch": 1.5579886455798864,
"grad_norm": 0.009697218425571918,
"learning_rate": 0.0002,
"loss": 0.6378505229949951,
"mean_token_accuracy": 0.7404668927192688,
"num_tokens": 8952480.0,
"step": 241
},
{
"entropy": 0.6220754161477089,
"epoch": 1.5644768856447688,
"grad_norm": 0.00962862279266119,
"learning_rate": 0.0002,
"loss": 0.6282638907432556,
"mean_token_accuracy": 0.7437562346458435,
"num_tokens": 8990098.0,
"step": 242
},
{
"entropy": 0.6257785856723785,
"epoch": 1.5709651257096513,
"grad_norm": 0.009893639013171196,
"learning_rate": 0.0002,
"loss": 0.6297152042388916,
"mean_token_accuracy": 0.7440835684537888,
"num_tokens": 9026984.0,
"step": 243
},
{
"entropy": 0.6254734173417091,
"epoch": 1.5774533657745335,
"grad_norm": 0.009527175687253475,
"learning_rate": 0.0002,
"loss": 0.62839674949646,
"mean_token_accuracy": 0.7452434748411179,
"num_tokens": 9064358.0,
"step": 244
},
{
"entropy": 0.6305152326822281,
"epoch": 1.583941605839416,
"grad_norm": 0.009316297248005867,
"learning_rate": 0.0002,
"loss": 0.6323485374450684,
"mean_token_accuracy": 0.74256681650877,
"num_tokens": 9101356.0,
"step": 245
},
{
"entropy": 0.6291619464755058,
"epoch": 1.5904298459042985,
"grad_norm": 0.008978272788226604,
"learning_rate": 0.0002,
"loss": 0.6273784637451172,
"mean_token_accuracy": 0.7450171038508415,
"num_tokens": 9138713.0,
"step": 246
},
{
"entropy": 0.6248873770236969,
"epoch": 1.5969180859691807,
"grad_norm": 0.00856445450335741,
"learning_rate": 0.0002,
"loss": 0.6265925168991089,
"mean_token_accuracy": 0.7451888769865036,
"num_tokens": 9175681.0,
"step": 247
},
{
"entropy": 0.6189131289720535,
"epoch": 1.6034063260340634,
"grad_norm": 0.00968277920037508,
"learning_rate": 0.0002,
"loss": 0.62480229139328,
"mean_token_accuracy": 0.7459377571940422,
"num_tokens": 9213377.0,
"step": 248
},
{
"entropy": 0.6176823750138283,
"epoch": 1.6098945660989457,
"grad_norm": 0.008562079630792141,
"learning_rate": 0.0002,
"loss": 0.6216596961021423,
"mean_token_accuracy": 0.7459762021899223,
"num_tokens": 9249919.0,
"step": 249
},
{
"entropy": 0.6210065707564354,
"epoch": 1.616382806163828,
"grad_norm": 0.009402911178767681,
"learning_rate": 0.0002,
"loss": 0.6242903470993042,
"mean_token_accuracy": 0.7469801977276802,
"num_tokens": 9287219.0,
"step": 250
},
{
"entropy": 0.6323156431317329,
"epoch": 1.6228710462287106,
"grad_norm": 0.009092130698263645,
"learning_rate": 0.0002,
"loss": 0.6306654810905457,
"mean_token_accuracy": 0.7425123229622841,
"num_tokens": 9324174.0,
"step": 251
},
{
"entropy": 0.6303895488381386,
"epoch": 1.6293592862935928,
"grad_norm": 0.009144228883087635,
"learning_rate": 0.0002,
"loss": 0.6268880367279053,
"mean_token_accuracy": 0.7460083961486816,
"num_tokens": 9361494.0,
"step": 252
},
{
"entropy": 0.6353992223739624,
"epoch": 1.6358475263584753,
"grad_norm": 0.00928189791738987,
"learning_rate": 0.0002,
"loss": 0.6352483034133911,
"mean_token_accuracy": 0.7439208328723907,
"num_tokens": 9398944.0,
"step": 253
},
{
"entropy": 0.6256071850657463,
"epoch": 1.6423357664233578,
"grad_norm": 0.008181072771549225,
"learning_rate": 0.0002,
"loss": 0.6292101144790649,
"mean_token_accuracy": 0.743871308863163,
"num_tokens": 9436011.0,
"step": 254
},
{
"entropy": 0.6333504095673561,
"epoch": 1.64882400648824,
"grad_norm": 0.009949415922164917,
"learning_rate": 0.0002,
"loss": 0.6347252130508423,
"mean_token_accuracy": 0.7401739284396172,
"num_tokens": 9473110.0,
"step": 255
},
{
"entropy": 0.6310138329863548,
"epoch": 1.6553122465531225,
"grad_norm": 0.00846829917281866,
"learning_rate": 0.0002,
"loss": 0.6339915990829468,
"mean_token_accuracy": 0.7427053153514862,
"num_tokens": 9510350.0,
"step": 256
},
{
"entropy": 0.6202550306916237,
"epoch": 1.661800486618005,
"grad_norm": 0.009316318668425083,
"learning_rate": 0.0002,
"loss": 0.6241627335548401,
"mean_token_accuracy": 0.7441129460930824,
"num_tokens": 9547581.0,
"step": 257
},
{
"entropy": 0.640548974275589,
"epoch": 1.6682887266828872,
"grad_norm": 0.008892681449651718,
"learning_rate": 0.0002,
"loss": 0.6457140445709229,
"mean_token_accuracy": 0.736494742333889,
"num_tokens": 9584913.0,
"step": 258
},
{
"entropy": 0.6206653639674187,
"epoch": 1.6747769667477697,
"grad_norm": 0.008709060959517956,
"learning_rate": 0.0002,
"loss": 0.6203189492225647,
"mean_token_accuracy": 0.7498921826481819,
"num_tokens": 9622351.0,
"step": 259
},
{
"entropy": 0.6282004490494728,
"epoch": 1.6812652068126521,
"grad_norm": 0.0090560931712389,
"learning_rate": 0.0002,
"loss": 0.6246728897094727,
"mean_token_accuracy": 0.746510811150074,
"num_tokens": 9659652.0,
"step": 260
},
{
"entropy": 0.6318396255373955,
"epoch": 1.6877534468775344,
"grad_norm": 0.007608218118548393,
"learning_rate": 0.0002,
"loss": 0.62848961353302,
"mean_token_accuracy": 0.7440729290246964,
"num_tokens": 9697284.0,
"step": 261
},
{
"entropy": 0.6200717613101006,
"epoch": 1.6942416869424168,
"grad_norm": 0.009493952617049217,
"learning_rate": 0.0002,
"loss": 0.6228904724121094,
"mean_token_accuracy": 0.7480449378490448,
"num_tokens": 9734627.0,
"step": 262
},
{
"entropy": 0.6331067234277725,
"epoch": 1.7007299270072993,
"grad_norm": 0.008472482673823833,
"learning_rate": 0.0002,
"loss": 0.6337133646011353,
"mean_token_accuracy": 0.7426456362009048,
"num_tokens": 9772063.0,
"step": 263
},
{
"entropy": 0.6172152981162071,
"epoch": 1.7072181670721815,
"grad_norm": 0.008520574308931828,
"learning_rate": 0.0002,
"loss": 0.6212704181671143,
"mean_token_accuracy": 0.7456109151244164,
"num_tokens": 9809281.0,
"step": 264
},
{
"entropy": 0.6255315691232681,
"epoch": 1.7137064071370642,
"grad_norm": 0.008351411670446396,
"learning_rate": 0.0002,
"loss": 0.6286416053771973,
"mean_token_accuracy": 0.7446007430553436,
"num_tokens": 9846539.0,
"step": 265
},
{
"entropy": 0.6238176673650742,
"epoch": 1.7201946472019465,
"grad_norm": 0.007990843616425991,
"learning_rate": 0.0002,
"loss": 0.6225998401641846,
"mean_token_accuracy": 0.7458446845412254,
"num_tokens": 9884004.0,
"step": 266
},
{
"entropy": 0.6216712817549706,
"epoch": 1.7266828872668287,
"grad_norm": 0.00867629423737526,
"learning_rate": 0.0002,
"loss": 0.6247957944869995,
"mean_token_accuracy": 0.7463371530175209,
"num_tokens": 9921115.0,
"step": 267
},
{
"entropy": 0.6401625499129295,
"epoch": 1.7331711273317114,
"grad_norm": 0.00958551187068224,
"learning_rate": 0.0002,
"loss": 0.6359888911247253,
"mean_token_accuracy": 0.742260254919529,
"num_tokens": 9958978.0,
"step": 268
},
{
"entropy": 0.6297059804201126,
"epoch": 1.7396593673965937,
"grad_norm": 0.009358945302665234,
"learning_rate": 0.0002,
"loss": 0.6260662078857422,
"mean_token_accuracy": 0.7483563721179962,
"num_tokens": 9996046.0,
"step": 269
},
{
"entropy": 0.6102557927370071,
"epoch": 1.7461476074614761,
"grad_norm": 0.008488922379910946,
"learning_rate": 0.0002,
"loss": 0.6104397773742676,
"mean_token_accuracy": 0.7516083940863609,
"num_tokens": 10033145.0,
"step": 270
},
{
"entropy": 0.6110394448041916,
"epoch": 1.7526358475263586,
"grad_norm": 0.009671971201896667,
"learning_rate": 0.0002,
"loss": 0.6171742081642151,
"mean_token_accuracy": 0.7473302856087685,
"num_tokens": 10070347.0,
"step": 271
},
{
"entropy": 0.6102030426263809,
"epoch": 1.7591240875912408,
"grad_norm": 0.01004206482321024,
"learning_rate": 0.0002,
"loss": 0.6197723746299744,
"mean_token_accuracy": 0.7478247955441475,
"num_tokens": 10107543.0,
"step": 272
},
{
"entropy": 0.6324944272637367,
"epoch": 1.7656123276561233,
"grad_norm": 0.008376670069992542,
"learning_rate": 0.0002,
"loss": 0.6334455609321594,
"mean_token_accuracy": 0.7418324947357178,
"num_tokens": 10144562.0,
"step": 273
},
{
"entropy": 0.6232613623142242,
"epoch": 1.7721005677210058,
"grad_norm": 0.009440955705940723,
"learning_rate": 0.0002,
"loss": 0.6198002099990845,
"mean_token_accuracy": 0.750127449631691,
"num_tokens": 10181837.0,
"step": 274
},
{
"entropy": 0.6218618527054787,
"epoch": 1.778588807785888,
"grad_norm": 0.008727550506591797,
"learning_rate": 0.0002,
"loss": 0.6228897571563721,
"mean_token_accuracy": 0.7451170310378075,
"num_tokens": 10218887.0,
"step": 275
},
{
"entropy": 0.6297050788998604,
"epoch": 1.7850770478507705,
"grad_norm": 0.008303189650177956,
"learning_rate": 0.0002,
"loss": 0.6325977444648743,
"mean_token_accuracy": 0.7429015561938286,
"num_tokens": 10256316.0,
"step": 276
},
{
"entropy": 0.6150370612740517,
"epoch": 1.791565287915653,
"grad_norm": 0.009460131637752056,
"learning_rate": 0.0002,
"loss": 0.6189665198326111,
"mean_token_accuracy": 0.7513208463788033,
"num_tokens": 10292958.0,
"step": 277
},
{
"entropy": 0.6380631476640701,
"epoch": 1.7980535279805352,
"grad_norm": 0.008382478728890419,
"learning_rate": 0.0002,
"loss": 0.6411799192428589,
"mean_token_accuracy": 0.7389534488320351,
"num_tokens": 10330143.0,
"step": 278
},
{
"entropy": 0.6122751757502556,
"epoch": 1.8045417680454177,
"grad_norm": 0.0077201686799526215,
"learning_rate": 0.0002,
"loss": 0.6154634356498718,
"mean_token_accuracy": 0.7478373274207115,
"num_tokens": 10367348.0,
"step": 279
},
{
"entropy": 0.6171681880950928,
"epoch": 1.8110300081103001,
"grad_norm": 0.014772728085517883,
"learning_rate": 0.0002,
"loss": 0.6175127625465393,
"mean_token_accuracy": 0.7471248880028725,
"num_tokens": 10404586.0,
"step": 280
},
{
"entropy": 0.6203941032290459,
"epoch": 1.8175182481751824,
"grad_norm": 0.00933381449431181,
"learning_rate": 0.0002,
"loss": 0.6234451532363892,
"mean_token_accuracy": 0.7449408918619156,
"num_tokens": 10441660.0,
"step": 281
},
{
"entropy": 0.6171698048710823,
"epoch": 1.8240064882400648,
"grad_norm": 0.02071473002433777,
"learning_rate": 0.0002,
"loss": 0.6131167411804199,
"mean_token_accuracy": 0.7504094913601875,
"num_tokens": 10478740.0,
"step": 282
},
{
"entropy": 0.6204886436462402,
"epoch": 1.8304947283049473,
"grad_norm": 0.008232798427343369,
"learning_rate": 0.0002,
"loss": 0.6195346117019653,
"mean_token_accuracy": 0.7477771490812302,
"num_tokens": 10515739.0,
"step": 283
},
{
"entropy": 0.6222864389419556,
"epoch": 1.8369829683698295,
"grad_norm": 0.008826926350593567,
"learning_rate": 0.0002,
"loss": 0.6246115565299988,
"mean_token_accuracy": 0.7467887252569199,
"num_tokens": 10552926.0,
"step": 284
},
{
"entropy": 0.6199471354484558,
"epoch": 1.8434712084347122,
"grad_norm": 0.031130356714129448,
"learning_rate": 0.0002,
"loss": 0.6234173774719238,
"mean_token_accuracy": 0.7465962916612625,
"num_tokens": 10590404.0,
"step": 285
},
{
"entropy": 0.6229867041110992,
"epoch": 1.8499594484995945,
"grad_norm": 0.009124074131250381,
"learning_rate": 0.0002,
"loss": 0.6230523586273193,
"mean_token_accuracy": 0.7485576421022415,
"num_tokens": 10628169.0,
"step": 286
},
{
"entropy": 0.6245164126157761,
"epoch": 1.8564476885644767,
"grad_norm": 0.04299340024590492,
"learning_rate": 0.0002,
"loss": 0.6296451091766357,
"mean_token_accuracy": 0.746208980679512,
"num_tokens": 10665578.0,
"step": 287
},
{
"entropy": 0.6367667019367218,
"epoch": 1.8629359286293594,
"grad_norm": 0.008064360357820988,
"learning_rate": 0.0002,
"loss": 0.6342769861221313,
"mean_token_accuracy": 0.7435217127203941,
"num_tokens": 10703123.0,
"step": 288
},
{
"entropy": 0.6245287135243416,
"epoch": 1.8694241686942417,
"grad_norm": 0.021351464092731476,
"learning_rate": 0.0002,
"loss": 0.6260511875152588,
"mean_token_accuracy": 0.7465523779392242,
"num_tokens": 10740314.0,
"step": 289
},
{
"entropy": 0.6212104111909866,
"epoch": 1.8759124087591241,
"grad_norm": 0.01059524156153202,
"learning_rate": 0.0002,
"loss": 0.6210169792175293,
"mean_token_accuracy": 0.7475718706846237,
"num_tokens": 10777825.0,
"step": 290
},
{
"entropy": 0.6373793482780457,
"epoch": 1.8824006488240066,
"grad_norm": 0.008884789422154427,
"learning_rate": 0.0002,
"loss": 0.6366032361984253,
"mean_token_accuracy": 0.7391576170921326,
"num_tokens": 10815225.0,
"step": 291
},
{
"entropy": 0.6392252072691917,
"epoch": 1.8888888888888888,
"grad_norm": 0.013435903936624527,
"learning_rate": 0.0002,
"loss": 0.6392862796783447,
"mean_token_accuracy": 0.7395146489143372,
"num_tokens": 10852456.0,
"step": 292
},
{
"entropy": 0.6242144107818604,
"epoch": 1.8953771289537713,
"grad_norm": 0.009207301773130894,
"learning_rate": 0.0002,
"loss": 0.6249897480010986,
"mean_token_accuracy": 0.7450198903679848,
"num_tokens": 10889534.0,
"step": 293
},
{
"entropy": 0.6158905401825905,
"epoch": 1.9018653690186538,
"grad_norm": 0.009233659133315086,
"learning_rate": 0.0002,
"loss": 0.6220048069953918,
"mean_token_accuracy": 0.7474906519055367,
"num_tokens": 10927138.0,
"step": 294
},
{
"entropy": 0.6057498604059219,
"epoch": 1.908353609083536,
"grad_norm": 0.00886959582567215,
"learning_rate": 0.0002,
"loss": 0.6085807085037231,
"mean_token_accuracy": 0.7527724504470825,
"num_tokens": 10964121.0,
"step": 295
},
{
"entropy": 0.6314896494150162,
"epoch": 1.9148418491484185,
"grad_norm": 0.00863397866487503,
"learning_rate": 0.0002,
"loss": 0.6325403451919556,
"mean_token_accuracy": 0.7428522482514381,
"num_tokens": 11001557.0,
"step": 296
},
{
"entropy": 0.6221454739570618,
"epoch": 1.921330089213301,
"grad_norm": 0.009161150082945824,
"learning_rate": 0.0002,
"loss": 0.6208068132400513,
"mean_token_accuracy": 0.7462965175509453,
"num_tokens": 11038904.0,
"step": 297
},
{
"entropy": 0.6189481094479561,
"epoch": 1.9278183292781832,
"grad_norm": 0.008889259770512581,
"learning_rate": 0.0002,
"loss": 0.6184496283531189,
"mean_token_accuracy": 0.7480250671505928,
"num_tokens": 11076150.0,
"step": 298
},
{
"entropy": 0.6238919943571091,
"epoch": 1.9343065693430657,
"grad_norm": 0.0090845488011837,
"learning_rate": 0.0002,
"loss": 0.6274781227111816,
"mean_token_accuracy": 0.744391493499279,
"num_tokens": 11113447.0,
"step": 299
},
{
"entropy": 0.6231639310717583,
"epoch": 1.9407948094079481,
"grad_norm": 0.009156333282589912,
"learning_rate": 0.0002,
"loss": 0.6222721934318542,
"mean_token_accuracy": 0.7496197745203972,
"num_tokens": 11150750.0,
"step": 300
},
{
"entropy": 0.6238841712474823,
"epoch": 1.9472830494728304,
"grad_norm": 0.008916804566979408,
"learning_rate": 0.0002,
"loss": 0.6307159066200256,
"mean_token_accuracy": 0.7432639226317406,
"num_tokens": 11187972.0,
"step": 301
},
{
"entropy": 0.628197155892849,
"epoch": 1.9537712895377128,
"grad_norm": 0.009915877133607864,
"learning_rate": 0.0002,
"loss": 0.6339118480682373,
"mean_token_accuracy": 0.741386704146862,
"num_tokens": 11225108.0,
"step": 302
},
{
"entropy": 0.6199254244565964,
"epoch": 1.9602595296025953,
"grad_norm": 0.008810635656118393,
"learning_rate": 0.0002,
"loss": 0.6184746026992798,
"mean_token_accuracy": 0.7482490092515945,
"num_tokens": 11262735.0,
"step": 303
},
{
"entropy": 0.6206595823168755,
"epoch": 1.9667477696674776,
"grad_norm": 0.008489571511745453,
"learning_rate": 0.0002,
"loss": 0.6251119375228882,
"mean_token_accuracy": 0.7444824799895287,
"num_tokens": 11299837.0,
"step": 304
},
{
"entropy": 0.6231965124607086,
"epoch": 1.9732360097323602,
"grad_norm": 0.008548264391720295,
"learning_rate": 0.0002,
"loss": 0.6258702874183655,
"mean_token_accuracy": 0.7451799884438515,
"num_tokens": 11337335.0,
"step": 305
},
{
"entropy": 0.6233715191483498,
"epoch": 1.9797242497972425,
"grad_norm": 0.008984974585473537,
"learning_rate": 0.0002,
"loss": 0.6242036819458008,
"mean_token_accuracy": 0.7449030429124832,
"num_tokens": 11375037.0,
"step": 306
},
{
"entropy": 0.6145095080137253,
"epoch": 1.986212489862125,
"grad_norm": 0.008570129983127117,
"learning_rate": 0.0002,
"loss": 0.6161348819732666,
"mean_token_accuracy": 0.7494730427861214,
"num_tokens": 11412372.0,
"step": 307
},
{
"entropy": 0.6227882578969002,
"epoch": 1.9927007299270074,
"grad_norm": 0.009132519364356995,
"learning_rate": 0.0002,
"loss": 0.6249089241027832,
"mean_token_accuracy": 0.7440183088183403,
"num_tokens": 11449566.0,
"step": 308
},
{
"entropy": 0.6210556477308273,
"epoch": 1.9991889699918897,
"grad_norm": 0.007969100028276443,
"learning_rate": 0.0002,
"loss": 0.6244759559631348,
"mean_token_accuracy": 0.746830090880394,
"num_tokens": 11487152.0,
"step": 309
},
{
"entropy": 0.6104058027267456,
"epoch": 2.0,
"grad_norm": 0.019919538870453835,
"learning_rate": 0.0002,
"loss": 0.6209793090820312,
"mean_token_accuracy": 0.7482735514640808,
"num_tokens": 11491673.0,
"step": 310
},
{
"entropy": 0.6369761228561401,
"epoch": 2.0064882400648822,
"grad_norm": 0.011179310269653797,
"learning_rate": 0.0002,
"loss": 0.6280978918075562,
"mean_token_accuracy": 0.7433952018618584,
"num_tokens": 11528991.0,
"step": 311
},
{
"entropy": 0.6231134757399559,
"epoch": 2.012976480129765,
"grad_norm": 0.012395660392940044,
"learning_rate": 0.0002,
"loss": 0.6168753504753113,
"mean_token_accuracy": 0.7469241917133331,
"num_tokens": 11566174.0,
"step": 312
},
{
"entropy": 0.6361245587468147,
"epoch": 2.019464720194647,
"grad_norm": 0.010151471942663193,
"learning_rate": 0.0002,
"loss": 0.6396852731704712,
"mean_token_accuracy": 0.7390208393335342,
"num_tokens": 11603660.0,
"step": 313
},
{
"entropy": 0.6205078735947609,
"epoch": 2.0259529602595294,
"grad_norm": 0.011173305101692677,
"learning_rate": 0.0002,
"loss": 0.6290929317474365,
"mean_token_accuracy": 0.7439283728599548,
"num_tokens": 11640777.0,
"step": 314
},
{
"entropy": 0.6196452155709267,
"epoch": 2.032441200324412,
"grad_norm": 0.011216065846383572,
"learning_rate": 0.0002,
"loss": 0.6270949840545654,
"mean_token_accuracy": 0.7424712553620338,
"num_tokens": 11677826.0,
"step": 315
},
{
"entropy": 0.6094615831971169,
"epoch": 2.0389294403892944,
"grad_norm": 0.009836558252573013,
"learning_rate": 0.0002,
"loss": 0.6110177040100098,
"mean_token_accuracy": 0.7522123828530312,
"num_tokens": 11714782.0,
"step": 316
},
{
"entropy": 0.6228377372026443,
"epoch": 2.0454176804541766,
"grad_norm": 0.009827308356761932,
"learning_rate": 0.0002,
"loss": 0.6198099851608276,
"mean_token_accuracy": 0.7482241690158844,
"num_tokens": 11751901.0,
"step": 317
},
{
"entropy": 0.6236361563205719,
"epoch": 2.0519059205190593,
"grad_norm": 0.010331663303077221,
"learning_rate": 0.0002,
"loss": 0.6171518564224243,
"mean_token_accuracy": 0.747296430170536,
"num_tokens": 11789727.0,
"step": 318
},
{
"entropy": 0.6258771196007729,
"epoch": 2.0583941605839415,
"grad_norm": 0.010642528533935547,
"learning_rate": 0.0002,
"loss": 0.6271529197692871,
"mean_token_accuracy": 0.7447842955589294,
"num_tokens": 11826898.0,
"step": 319
},
{
"entropy": 0.6150587797164917,
"epoch": 2.0648824006488242,
"grad_norm": 0.009091152809560299,
"learning_rate": 0.0002,
"loss": 0.6166321039199829,
"mean_token_accuracy": 0.7505485117435455,
"num_tokens": 11863842.0,
"step": 320
},
{
"entropy": 0.6226691231131554,
"epoch": 2.0713706407137065,
"grad_norm": 0.008850189857184887,
"learning_rate": 0.0002,
"loss": 0.6213895082473755,
"mean_token_accuracy": 0.7468440607190132,
"num_tokens": 11901235.0,
"step": 321
},
{
"entropy": 0.634496659040451,
"epoch": 2.0778588807785887,
"grad_norm": 0.009685751050710678,
"learning_rate": 0.0002,
"loss": 0.6369626522064209,
"mean_token_accuracy": 0.7408950179815292,
"num_tokens": 11938336.0,
"step": 322
},
{
"entropy": 0.6164573132991791,
"epoch": 2.0843471208434714,
"grad_norm": 0.010890510864555836,
"learning_rate": 0.0002,
"loss": 0.6235396265983582,
"mean_token_accuracy": 0.7454954236745834,
"num_tokens": 11975368.0,
"step": 323
},
{
"entropy": 0.6137611418962479,
"epoch": 2.0908353609083536,
"grad_norm": 0.009321420453488827,
"learning_rate": 0.0002,
"loss": 0.6175767183303833,
"mean_token_accuracy": 0.7478668764233589,
"num_tokens": 12012459.0,
"step": 324
},
{
"entropy": 0.6179320439696312,
"epoch": 2.097323600973236,
"grad_norm": 0.009330744855105877,
"learning_rate": 0.0002,
"loss": 0.6184362173080444,
"mean_token_accuracy": 0.748590737581253,
"num_tokens": 12049829.0,
"step": 325
},
{
"entropy": 0.6192868947982788,
"epoch": 2.1038118410381186,
"grad_norm": 0.008818828500807285,
"learning_rate": 0.0002,
"loss": 0.6174098253250122,
"mean_token_accuracy": 0.7478644922375679,
"num_tokens": 12087727.0,
"step": 326
},
{
"entropy": 0.626248262822628,
"epoch": 2.110300081103001,
"grad_norm": 0.008749144151806831,
"learning_rate": 0.0002,
"loss": 0.6212329268455505,
"mean_token_accuracy": 0.747315414249897,
"num_tokens": 12124835.0,
"step": 327
},
{
"entropy": 0.625133216381073,
"epoch": 2.116788321167883,
"grad_norm": 0.009766868315637112,
"learning_rate": 0.0002,
"loss": 0.624916136264801,
"mean_token_accuracy": 0.7457389757037163,
"num_tokens": 12162010.0,
"step": 328
},
{
"entropy": 0.6180580258369446,
"epoch": 2.1232765612327658,
"grad_norm": 0.010169712826609612,
"learning_rate": 0.0002,
"loss": 0.6185243129730225,
"mean_token_accuracy": 0.7475102469325066,
"num_tokens": 12199560.0,
"step": 329
},
{
"entropy": 0.618090882897377,
"epoch": 2.129764801297648,
"grad_norm": 0.010965410619974136,
"learning_rate": 0.0002,
"loss": 0.628595232963562,
"mean_token_accuracy": 0.742675431072712,
"num_tokens": 12236987.0,
"step": 330
},
{
"entropy": 0.6243258565664291,
"epoch": 2.1362530413625302,
"grad_norm": 0.009334998205304146,
"learning_rate": 0.0002,
"loss": 0.6280615329742432,
"mean_token_accuracy": 0.7434326112270355,
"num_tokens": 12274464.0,
"step": 331
},
{
"entropy": 0.6221758723258972,
"epoch": 2.142741281427413,
"grad_norm": 0.00768797192722559,
"learning_rate": 0.0002,
"loss": 0.6218302845954895,
"mean_token_accuracy": 0.7480092272162437,
"num_tokens": 12312027.0,
"step": 332
},
{
"entropy": 0.6239754110574722,
"epoch": 2.149229521492295,
"grad_norm": 0.007848316803574562,
"learning_rate": 0.0002,
"loss": 0.6233847141265869,
"mean_token_accuracy": 0.7466081529855728,
"num_tokens": 12349207.0,
"step": 333
},
{
"entropy": 0.6159957125782967,
"epoch": 2.1557177615571774,
"grad_norm": 0.009600339457392693,
"learning_rate": 0.0002,
"loss": 0.6117550134658813,
"mean_token_accuracy": 0.7508383393287659,
"num_tokens": 12386312.0,
"step": 334
},
{
"entropy": 0.6285756379365921,
"epoch": 2.16220600162206,
"grad_norm": 0.009564606472849846,
"learning_rate": 0.0002,
"loss": 0.6304960250854492,
"mean_token_accuracy": 0.7436012774705887,
"num_tokens": 12423969.0,
"step": 335
},
{
"entropy": 0.6194324493408203,
"epoch": 2.1686942416869424,
"grad_norm": 0.009417028166353703,
"learning_rate": 0.0002,
"loss": 0.622604250907898,
"mean_token_accuracy": 0.7460262328386307,
"num_tokens": 12461498.0,
"step": 336
},
{
"entropy": 0.6123020723462105,
"epoch": 2.1751824817518246,
"grad_norm": 0.00952741876244545,
"learning_rate": 0.0002,
"loss": 0.6190693378448486,
"mean_token_accuracy": 0.7473057582974434,
"num_tokens": 12498772.0,
"step": 337
},
{
"entropy": 0.6101055964827538,
"epoch": 2.1816707218167073,
"grad_norm": 0.00931888073682785,
"learning_rate": 0.0002,
"loss": 0.6161482334136963,
"mean_token_accuracy": 0.7476179748773575,
"num_tokens": 12535894.0,
"step": 338
},
{
"entropy": 0.6213592365384102,
"epoch": 2.1881589618815895,
"grad_norm": 0.008865389041602612,
"learning_rate": 0.0002,
"loss": 0.6219321489334106,
"mean_token_accuracy": 0.7449849396944046,
"num_tokens": 12573498.0,
"step": 339
},
{
"entropy": 0.614892452955246,
"epoch": 2.1946472019464722,
"grad_norm": 0.009812900796532631,
"learning_rate": 0.0002,
"loss": 0.6124197840690613,
"mean_token_accuracy": 0.7499328628182411,
"num_tokens": 12610465.0,
"step": 340
},
{
"entropy": 0.6235473528504372,
"epoch": 2.2011354420113545,
"grad_norm": 0.009034697897732258,
"learning_rate": 0.0002,
"loss": 0.6235278248786926,
"mean_token_accuracy": 0.7453176379203796,
"num_tokens": 12647446.0,
"step": 341
},
{
"entropy": 0.6155827194452286,
"epoch": 2.2076236820762367,
"grad_norm": 0.011849821545183659,
"learning_rate": 0.0002,
"loss": 0.6141517758369446,
"mean_token_accuracy": 0.7493102103471756,
"num_tokens": 12684339.0,
"step": 342
},
{
"entropy": 0.6220799088478088,
"epoch": 2.2141119221411194,
"grad_norm": 0.011021377518773079,
"learning_rate": 0.0002,
"loss": 0.6232143640518188,
"mean_token_accuracy": 0.7435769438743591,
"num_tokens": 12722039.0,
"step": 343
},
{
"entropy": 0.60894425958395,
"epoch": 2.2206001622060016,
"grad_norm": 0.00959057454019785,
"learning_rate": 0.0002,
"loss": 0.614958643913269,
"mean_token_accuracy": 0.7492904141545296,
"num_tokens": 12758559.0,
"step": 344
},
{
"entropy": 0.61026880890131,
"epoch": 2.227088402270884,
"grad_norm": 0.010138140991330147,
"learning_rate": 0.0002,
"loss": 0.616437554359436,
"mean_token_accuracy": 0.7471959367394447,
"num_tokens": 12795759.0,
"step": 345
},
{
"entropy": 0.6212582364678383,
"epoch": 2.2335766423357666,
"grad_norm": 0.013862723484635353,
"learning_rate": 0.0002,
"loss": 0.6215099692344666,
"mean_token_accuracy": 0.7478090971708298,
"num_tokens": 12833075.0,
"step": 346
},
{
"entropy": 0.6183774024248123,
"epoch": 2.240064882400649,
"grad_norm": 0.00895402580499649,
"learning_rate": 0.0002,
"loss": 0.6187215447425842,
"mean_token_accuracy": 0.7494830936193466,
"num_tokens": 12870571.0,
"step": 347
},
{
"entropy": 0.6210155412554741,
"epoch": 2.246553122465531,
"grad_norm": 0.041780415922403336,
"learning_rate": 0.0002,
"loss": 0.6219582557678223,
"mean_token_accuracy": 0.7483534067869186,
"num_tokens": 12908163.0,
"step": 348
},
{
"entropy": 0.6203203722834587,
"epoch": 2.2530413625304138,
"grad_norm": 0.02689778059720993,
"learning_rate": 0.0002,
"loss": 0.6272082328796387,
"mean_token_accuracy": 0.7450312674045563,
"num_tokens": 12945330.0,
"step": 349
},
{
"entropy": 0.6245186030864716,
"epoch": 2.259529602595296,
"grad_norm": 0.012432226911187172,
"learning_rate": 0.0002,
"loss": 0.6235542297363281,
"mean_token_accuracy": 0.7462796568870544,
"num_tokens": 12982731.0,
"step": 350
},
{
"entropy": 0.6220052242279053,
"epoch": 2.2660178426601782,
"grad_norm": 0.010308763943612576,
"learning_rate": 0.0002,
"loss": 0.624070405960083,
"mean_token_accuracy": 0.743579313158989,
"num_tokens": 13019541.0,
"step": 351
},
{
"entropy": 0.64016043394804,
"epoch": 2.272506082725061,
"grad_norm": 0.010659064166247845,
"learning_rate": 0.0002,
"loss": 0.636542558670044,
"mean_token_accuracy": 0.7407100200653076,
"num_tokens": 13057158.0,
"step": 352
},
{
"entropy": 0.6278761327266693,
"epoch": 2.278994322789943,
"grad_norm": 0.010416081175208092,
"learning_rate": 0.0002,
"loss": 0.62436842918396,
"mean_token_accuracy": 0.7455000206828117,
"num_tokens": 13094262.0,
"step": 353
},
{
"entropy": 0.6232447475194931,
"epoch": 2.285482562854826,
"grad_norm": 0.009887438267469406,
"learning_rate": 0.0002,
"loss": 0.6241923570632935,
"mean_token_accuracy": 0.7437829151749611,
"num_tokens": 13131360.0,
"step": 354
},
{
"entropy": 0.6319752037525177,
"epoch": 2.291970802919708,
"grad_norm": 0.009396783076226711,
"learning_rate": 0.0002,
"loss": 0.6283852458000183,
"mean_token_accuracy": 0.7450494468212128,
"num_tokens": 13168644.0,
"step": 355
},
{
"entropy": 0.6192774921655655,
"epoch": 2.2984590429845904,
"grad_norm": 0.009457712061703205,
"learning_rate": 0.0002,
"loss": 0.6166653633117676,
"mean_token_accuracy": 0.7473447695374489,
"num_tokens": 13205900.0,
"step": 356
},
{
"entropy": 0.616138719022274,
"epoch": 2.304947283049473,
"grad_norm": 0.009487454779446125,
"learning_rate": 0.0002,
"loss": 0.6193556189537048,
"mean_token_accuracy": 0.746711365878582,
"num_tokens": 13243403.0,
"step": 357
},
{
"entropy": 0.6114000976085663,
"epoch": 2.3114355231143553,
"grad_norm": 0.010738314129412174,
"learning_rate": 0.0002,
"loss": 0.6193853616714478,
"mean_token_accuracy": 0.7472727373242378,
"num_tokens": 13280595.0,
"step": 358
},
{
"entropy": 0.601548932492733,
"epoch": 2.3179237631792375,
"grad_norm": 0.010257442481815815,
"learning_rate": 0.0002,
"loss": 0.6057910919189453,
"mean_token_accuracy": 0.7506168782711029,
"num_tokens": 13317413.0,
"step": 359
},
{
"entropy": 0.6248240396380424,
"epoch": 2.3244120032441202,
"grad_norm": 0.009444781579077244,
"learning_rate": 0.0002,
"loss": 0.6265978217124939,
"mean_token_accuracy": 0.7447159513831139,
"num_tokens": 13354442.0,
"step": 360
},
{
"entropy": 0.6169225797057152,
"epoch": 2.3309002433090025,
"grad_norm": 0.010277079418301582,
"learning_rate": 0.0002,
"loss": 0.6173827648162842,
"mean_token_accuracy": 0.7486959248781204,
"num_tokens": 13392357.0,
"step": 361
},
{
"entropy": 0.6302815526723862,
"epoch": 2.3373884833738847,
"grad_norm": 0.009320929646492004,
"learning_rate": 0.0002,
"loss": 0.6289012432098389,
"mean_token_accuracy": 0.7438602596521378,
"num_tokens": 13429444.0,
"step": 362
},
{
"entropy": 0.6252695918083191,
"epoch": 2.3438767234387674,
"grad_norm": 0.00795667339116335,
"learning_rate": 0.0002,
"loss": 0.6236270666122437,
"mean_token_accuracy": 0.7462895065546036,
"num_tokens": 13466973.0,
"step": 363
},
{
"entropy": 0.6325998455286026,
"epoch": 2.3503649635036497,
"grad_norm": 0.009790928103029728,
"learning_rate": 0.0002,
"loss": 0.6316322088241577,
"mean_token_accuracy": 0.7428558766841888,
"num_tokens": 13504219.0,
"step": 364
},
{
"entropy": 0.6235339045524597,
"epoch": 2.356853203568532,
"grad_norm": 0.009260588325560093,
"learning_rate": 0.0002,
"loss": 0.6231226921081543,
"mean_token_accuracy": 0.7452265918254852,
"num_tokens": 13541359.0,
"step": 365
},
{
"entropy": 0.6141555160284042,
"epoch": 2.3633414436334146,
"grad_norm": 0.010724055580794811,
"learning_rate": 0.0002,
"loss": 0.6217249631881714,
"mean_token_accuracy": 0.7470070049166679,
"num_tokens": 13578759.0,
"step": 366
},
{
"entropy": 0.6315039545297623,
"epoch": 2.369829683698297,
"grad_norm": 0.009067324921488762,
"learning_rate": 0.0002,
"loss": 0.634614109992981,
"mean_token_accuracy": 0.7410515621304512,
"num_tokens": 13616296.0,
"step": 367
},
{
"entropy": 0.6196957975625992,
"epoch": 2.376317923763179,
"grad_norm": 0.009248278103768826,
"learning_rate": 0.0002,
"loss": 0.6189215183258057,
"mean_token_accuracy": 0.7481505498290062,
"num_tokens": 13653415.0,
"step": 368
},
{
"entropy": 0.6168980821967125,
"epoch": 2.3828061638280618,
"grad_norm": 0.010181935504078865,
"learning_rate": 0.0002,
"loss": 0.6161677837371826,
"mean_token_accuracy": 0.7499739304184914,
"num_tokens": 13690618.0,
"step": 369
},
{
"entropy": 0.6258252412080765,
"epoch": 2.389294403892944,
"grad_norm": 0.008928108029067516,
"learning_rate": 0.0002,
"loss": 0.6290237903594971,
"mean_token_accuracy": 0.7429782524704933,
"num_tokens": 13727901.0,
"step": 370
},
{
"entropy": 0.6094075217843056,
"epoch": 2.3957826439578263,
"grad_norm": 0.009067908860743046,
"learning_rate": 0.0002,
"loss": 0.6124044060707092,
"mean_token_accuracy": 0.7487504705786705,
"num_tokens": 13765097.0,
"step": 371
},
{
"entropy": 0.6190275996923447,
"epoch": 2.402270884022709,
"grad_norm": 0.009943855926394463,
"learning_rate": 0.0002,
"loss": 0.6234393119812012,
"mean_token_accuracy": 0.7450670152902603,
"num_tokens": 13802604.0,
"step": 372
},
{
"entropy": 0.6125053241848946,
"epoch": 2.408759124087591,
"grad_norm": 0.009481463581323624,
"learning_rate": 0.0002,
"loss": 0.6187013387680054,
"mean_token_accuracy": 0.7489439323544502,
"num_tokens": 13839487.0,
"step": 373
},
{
"entropy": 0.6130451932549477,
"epoch": 2.4152473641524734,
"grad_norm": 0.008458724245429039,
"learning_rate": 0.0002,
"loss": 0.614911675453186,
"mean_token_accuracy": 0.7505282834172249,
"num_tokens": 13876935.0,
"step": 374
},
{
"entropy": 0.6462682038545609,
"epoch": 2.421735604217356,
"grad_norm": 0.010083320550620556,
"learning_rate": 0.0002,
"loss": 0.6467190980911255,
"mean_token_accuracy": 0.7378857955336571,
"num_tokens": 13914429.0,
"step": 375
},
{
"entropy": 0.6287035867571831,
"epoch": 2.4282238442822384,
"grad_norm": 0.008747600950300694,
"learning_rate": 0.0002,
"loss": 0.6284276247024536,
"mean_token_accuracy": 0.7447932213544846,
"num_tokens": 13951880.0,
"step": 376
},
{
"entropy": 0.6305522173643112,
"epoch": 2.4347120843471206,
"grad_norm": 0.010268261656165123,
"learning_rate": 0.0002,
"loss": 0.6298754215240479,
"mean_token_accuracy": 0.7451391518115997,
"num_tokens": 13989473.0,
"step": 377
},
{
"entropy": 0.6239131912589073,
"epoch": 2.4412003244120033,
"grad_norm": 0.00940751750022173,
"learning_rate": 0.0002,
"loss": 0.6264931559562683,
"mean_token_accuracy": 0.7422467172145844,
"num_tokens": 14026832.0,
"step": 378
},
{
"entropy": 0.6218756884336472,
"epoch": 2.4476885644768855,
"grad_norm": 0.008956913836300373,
"learning_rate": 0.0002,
"loss": 0.6260896325111389,
"mean_token_accuracy": 0.7415326088666916,
"num_tokens": 14064159.0,
"step": 379
},
{
"entropy": 0.6187591478228569,
"epoch": 2.4541768045417682,
"grad_norm": 0.008552344515919685,
"learning_rate": 0.0002,
"loss": 0.6216272115707397,
"mean_token_accuracy": 0.7469553202390671,
"num_tokens": 14101277.0,
"step": 380
},
{
"entropy": 0.6129069477319717,
"epoch": 2.4606650446066505,
"grad_norm": 0.009866154752671719,
"learning_rate": 0.0002,
"loss": 0.6184383630752563,
"mean_token_accuracy": 0.7457786872982979,
"num_tokens": 14138545.0,
"step": 381
},
{
"entropy": 0.6332196220755577,
"epoch": 2.4671532846715327,
"grad_norm": 0.007945130579173565,
"learning_rate": 0.0002,
"loss": 0.6312772631645203,
"mean_token_accuracy": 0.7440632656216621,
"num_tokens": 14176229.0,
"step": 382
},
{
"entropy": 0.6162554249167442,
"epoch": 2.4736415247364154,
"grad_norm": 0.00908781960606575,
"learning_rate": 0.0002,
"loss": 0.6104109883308411,
"mean_token_accuracy": 0.7492068335413933,
"num_tokens": 14213375.0,
"step": 383
},
{
"entropy": 0.6241936013102531,
"epoch": 2.4801297648012977,
"grad_norm": 0.009399542585015297,
"learning_rate": 0.0002,
"loss": 0.6161544919013977,
"mean_token_accuracy": 0.7491407096385956,
"num_tokens": 14250696.0,
"step": 384
},
{
"entropy": 0.6147832497954369,
"epoch": 2.48661800486618,
"grad_norm": 0.007576434873044491,
"learning_rate": 0.0002,
"loss": 0.6159515976905823,
"mean_token_accuracy": 0.7494903281331062,
"num_tokens": 14287863.0,
"step": 385
},
{
"entropy": 0.6227882355451584,
"epoch": 2.4931062449310626,
"grad_norm": 0.009297952987253666,
"learning_rate": 0.0002,
"loss": 0.6279860734939575,
"mean_token_accuracy": 0.745159700512886,
"num_tokens": 14325371.0,
"step": 386
},
{
"entropy": 0.6066790446639061,
"epoch": 2.499594484995945,
"grad_norm": 0.009967000223696232,
"learning_rate": 0.0002,
"loss": 0.6151248216629028,
"mean_token_accuracy": 0.7479714751243591,
"num_tokens": 14362698.0,
"step": 387
},
{
"entropy": 0.6248459070920944,
"epoch": 2.5060827250608275,
"grad_norm": 0.009727658703923225,
"learning_rate": 0.0002,
"loss": 0.6268327236175537,
"mean_token_accuracy": 0.7463877573609352,
"num_tokens": 14399544.0,
"step": 388
},
{
"entropy": 0.6305608153343201,
"epoch": 2.5125709651257098,
"grad_norm": 0.008822647854685783,
"learning_rate": 0.0002,
"loss": 0.6284365653991699,
"mean_token_accuracy": 0.7454124987125397,
"num_tokens": 14436877.0,
"step": 389
},
{
"entropy": 0.6289694681763649,
"epoch": 2.519059205190592,
"grad_norm": 0.009071394801139832,
"learning_rate": 0.0002,
"loss": 0.6264450550079346,
"mean_token_accuracy": 0.7433068230748177,
"num_tokens": 14473915.0,
"step": 390
},
{
"entropy": 0.6271463260054588,
"epoch": 2.5255474452554747,
"grad_norm": 0.008187719620764256,
"learning_rate": 0.0002,
"loss": 0.6289336085319519,
"mean_token_accuracy": 0.7423637583851814,
"num_tokens": 14511402.0,
"step": 391
},
{
"entropy": 0.6084585338830948,
"epoch": 2.532035685320357,
"grad_norm": 0.008899841457605362,
"learning_rate": 0.0002,
"loss": 0.6130256652832031,
"mean_token_accuracy": 0.7509424611926079,
"num_tokens": 14548753.0,
"step": 392
},
{
"entropy": 0.6104612424969673,
"epoch": 2.538523925385239,
"grad_norm": 0.00985915120691061,
"learning_rate": 0.0002,
"loss": 0.6200201511383057,
"mean_token_accuracy": 0.7466698288917542,
"num_tokens": 14586042.0,
"step": 393
},
{
"entropy": 0.6256568655371666,
"epoch": 2.545012165450122,
"grad_norm": 0.00867030955851078,
"learning_rate": 0.0002,
"loss": 0.6292595267295837,
"mean_token_accuracy": 0.7430211529135704,
"num_tokens": 14623448.0,
"step": 394
},
{
"entropy": 0.6263261586427689,
"epoch": 2.551500405515004,
"grad_norm": 0.010737903416156769,
"learning_rate": 0.0002,
"loss": 0.6249234676361084,
"mean_token_accuracy": 0.7444213852286339,
"num_tokens": 14660585.0,
"step": 395
},
{
"entropy": 0.6266406700015068,
"epoch": 2.5579886455798864,
"grad_norm": 0.008770007640123367,
"learning_rate": 0.0002,
"loss": 0.6228189468383789,
"mean_token_accuracy": 0.7473640963435173,
"num_tokens": 14697839.0,
"step": 396
},
{
"entropy": 0.6101134717464447,
"epoch": 2.564476885644769,
"grad_norm": 0.008944439701735973,
"learning_rate": 0.0002,
"loss": 0.6120374798774719,
"mean_token_accuracy": 0.7512135058641434,
"num_tokens": 14735253.0,
"step": 397
},
{
"entropy": 0.6294003054499626,
"epoch": 2.5709651257096513,
"grad_norm": 0.010403397493064404,
"learning_rate": 0.0002,
"loss": 0.6361932754516602,
"mean_token_accuracy": 0.7407518178224564,
"num_tokens": 14772533.0,
"step": 398
},
{
"entropy": 0.6084831207990646,
"epoch": 2.5774533657745335,
"grad_norm": 0.007994825951755047,
"learning_rate": 0.0002,
"loss": 0.6090534329414368,
"mean_token_accuracy": 0.7516237422823906,
"num_tokens": 14809746.0,
"step": 399
},
{
"entropy": 0.6314651742577553,
"epoch": 2.5839416058394162,
"grad_norm": 0.010198352858424187,
"learning_rate": 0.0002,
"loss": 0.6245699524879456,
"mean_token_accuracy": 0.7476952150464058,
"num_tokens": 14847650.0,
"step": 400
},
{
"entropy": 0.6174981743097305,
"epoch": 2.5904298459042985,
"grad_norm": 0.009044546633958817,
"learning_rate": 0.0002,
"loss": 0.615368664264679,
"mean_token_accuracy": 0.7484294474124908,
"num_tokens": 14884930.0,
"step": 401
},
{
"entropy": 0.6164123043417931,
"epoch": 2.5969180859691807,
"grad_norm": 0.008100450970232487,
"learning_rate": 0.0002,
"loss": 0.620932936668396,
"mean_token_accuracy": 0.7468846142292023,
"num_tokens": 14922467.0,
"step": 402
},
{
"entropy": 0.6131496354937553,
"epoch": 2.6034063260340634,
"grad_norm": 0.01058341097086668,
"learning_rate": 0.0002,
"loss": 0.6206756830215454,
"mean_token_accuracy": 0.7483528330922127,
"num_tokens": 14959768.0,
"step": 403
},
{
"entropy": 0.61551932990551,
"epoch": 2.6098945660989457,
"grad_norm": 0.008704769425094128,
"learning_rate": 0.0002,
"loss": 0.6186975240707397,
"mean_token_accuracy": 0.7474388629198074,
"num_tokens": 14996628.0,
"step": 404
},
{
"entropy": 0.6159948483109474,
"epoch": 2.616382806163828,
"grad_norm": 0.009592502377927303,
"learning_rate": 0.0002,
"loss": 0.6187817454338074,
"mean_token_accuracy": 0.7487591952085495,
"num_tokens": 15033592.0,
"step": 405
},
{
"entropy": 0.6296302676200867,
"epoch": 2.6228710462287106,
"grad_norm": 0.009406859055161476,
"learning_rate": 0.0002,
"loss": 0.6244117617607117,
"mean_token_accuracy": 0.7439019158482552,
"num_tokens": 15071235.0,
"step": 406
},
{
"entropy": 0.6396452710032463,
"epoch": 2.629359286293593,
"grad_norm": 0.009445966221392155,
"learning_rate": 0.0002,
"loss": 0.634600043296814,
"mean_token_accuracy": 0.7421920970082283,
"num_tokens": 15108591.0,
"step": 407
},
{
"entropy": 0.6241939589381218,
"epoch": 2.635847526358475,
"grad_norm": 0.008459821343421936,
"learning_rate": 0.0002,
"loss": 0.6214285492897034,
"mean_token_accuracy": 0.745953157544136,
"num_tokens": 15146394.0,
"step": 408
},
{
"entropy": 0.6104935929179192,
"epoch": 2.6423357664233578,
"grad_norm": 0.010156887583434582,
"learning_rate": 0.0002,
"loss": 0.6155494451522827,
"mean_token_accuracy": 0.7467065751552582,
"num_tokens": 15183954.0,
"step": 409
},
{
"entropy": 0.6200908496975899,
"epoch": 2.64882400648824,
"grad_norm": 0.01134799886494875,
"learning_rate": 0.0002,
"loss": 0.6298259496688843,
"mean_token_accuracy": 0.7434926256537437,
"num_tokens": 15221318.0,
"step": 410
},
{
"entropy": 0.6163679510354996,
"epoch": 2.6553122465531223,
"grad_norm": 0.008384560234844685,
"learning_rate": 0.0002,
"loss": 0.6196904182434082,
"mean_token_accuracy": 0.7484511360526085,
"num_tokens": 15258714.0,
"step": 411
},
{
"entropy": 0.6290042921900749,
"epoch": 2.661800486618005,
"grad_norm": 0.011763868853449821,
"learning_rate": 0.0002,
"loss": 0.623403787612915,
"mean_token_accuracy": 0.7461108565330505,
"num_tokens": 15295950.0,
"step": 412
},
{
"entropy": 0.6304820030927658,
"epoch": 2.668288726682887,
"grad_norm": 0.008899668231606483,
"learning_rate": 0.0002,
"loss": 0.6314485669136047,
"mean_token_accuracy": 0.7429024130105972,
"num_tokens": 15333333.0,
"step": 413
},
{
"entropy": 0.6225186064839363,
"epoch": 2.6747769667477694,
"grad_norm": 0.008537418209016323,
"learning_rate": 0.0002,
"loss": 0.6211932897567749,
"mean_token_accuracy": 0.747981533408165,
"num_tokens": 15370982.0,
"step": 414
},
{
"entropy": 0.6107104495167732,
"epoch": 2.681265206812652,
"grad_norm": 0.01061639841645956,
"learning_rate": 0.0002,
"loss": 0.6177730560302734,
"mean_token_accuracy": 0.7482814937829971,
"num_tokens": 15408426.0,
"step": 415
},
{
"entropy": 0.6148537546396255,
"epoch": 2.6877534468775344,
"grad_norm": 0.011781369335949421,
"learning_rate": 0.0002,
"loss": 0.6236268281936646,
"mean_token_accuracy": 0.7474222108721733,
"num_tokens": 15445617.0,
"step": 416
},
{
"entropy": 0.6345531940460205,
"epoch": 2.6942416869424166,
"grad_norm": 0.008664336055517197,
"learning_rate": 0.0002,
"loss": 0.6367125511169434,
"mean_token_accuracy": 0.7417123690247536,
"num_tokens": 15483295.0,
"step": 417
},
{
"entropy": 0.632311999797821,
"epoch": 2.7007299270072993,
"grad_norm": 0.010981544852256775,
"learning_rate": 0.0002,
"loss": 0.6256700158119202,
"mean_token_accuracy": 0.7448865845799446,
"num_tokens": 15520324.0,
"step": 418
},
{
"entropy": 0.6247982755303383,
"epoch": 2.7072181670721815,
"grad_norm": 0.010701069608330727,
"learning_rate": 0.0002,
"loss": 0.6191861629486084,
"mean_token_accuracy": 0.747975766658783,
"num_tokens": 15557534.0,
"step": 419
},
{
"entropy": 0.6309525445103645,
"epoch": 2.7137064071370642,
"grad_norm": 0.008924427442252636,
"learning_rate": 0.0002,
"loss": 0.6328113079071045,
"mean_token_accuracy": 0.741542711853981,
"num_tokens": 15594763.0,
"step": 420
},
{
"entropy": 0.6043407768011093,
"epoch": 2.7201946472019465,
"grad_norm": 0.008746204897761345,
"learning_rate": 0.0002,
"loss": 0.6077402830123901,
"mean_token_accuracy": 0.7525621652603149,
"num_tokens": 15631963.0,
"step": 421
},
{
"entropy": 0.623171254992485,
"epoch": 2.7266828872668287,
"grad_norm": 0.012448329478502274,
"learning_rate": 0.0002,
"loss": 0.6337227821350098,
"mean_token_accuracy": 0.7424034029245377,
"num_tokens": 15669213.0,
"step": 422
},
{
"entropy": 0.6182989627122879,
"epoch": 2.7331711273317114,
"grad_norm": 0.00980245042592287,
"learning_rate": 0.0002,
"loss": 0.6246788501739502,
"mean_token_accuracy": 0.7442185133695602,
"num_tokens": 15706502.0,
"step": 423
},
{
"entropy": 0.6341974511742592,
"epoch": 2.7396593673965937,
"grad_norm": 0.010192792862653732,
"learning_rate": 0.0002,
"loss": 0.6291946172714233,
"mean_token_accuracy": 0.7423791959881783,
"num_tokens": 15744210.0,
"step": 424
},
{
"entropy": 0.6213679686188698,
"epoch": 2.7461476074614763,
"grad_norm": 0.010065656155347824,
"learning_rate": 0.0002,
"loss": 0.6173956394195557,
"mean_token_accuracy": 0.7478613257408142,
"num_tokens": 15781645.0,
"step": 425
},
{
"entropy": 0.6221437901258469,
"epoch": 2.7526358475263586,
"grad_norm": 0.0095105255022645,
"learning_rate": 0.0002,
"loss": 0.6207852363586426,
"mean_token_accuracy": 0.7459077090024948,
"num_tokens": 15818882.0,
"step": 426
},
{
"entropy": 0.6309037730097771,
"epoch": 2.759124087591241,
"grad_norm": 0.008715137839317322,
"learning_rate": 0.0002,
"loss": 0.635662317276001,
"mean_token_accuracy": 0.7393417879939079,
"num_tokens": 15856215.0,
"step": 427
},
{
"entropy": 0.6107242554426193,
"epoch": 2.7656123276561235,
"grad_norm": 0.01041481178253889,
"learning_rate": 0.0002,
"loss": 0.6185387372970581,
"mean_token_accuracy": 0.7483986243605614,
"num_tokens": 15892879.0,
"step": 428
},
{
"entropy": 0.6216551586985588,
"epoch": 2.7721005677210058,
"grad_norm": 0.0099997129291296,
"learning_rate": 0.0002,
"loss": 0.6273539066314697,
"mean_token_accuracy": 0.7425299435853958,
"num_tokens": 15930440.0,
"step": 429
},
{
"entropy": 0.6228181794285774,
"epoch": 2.778588807785888,
"grad_norm": 0.009126834571361542,
"learning_rate": 0.0002,
"loss": 0.6193030476570129,
"mean_token_accuracy": 0.748077854514122,
"num_tokens": 15967547.0,
"step": 430
},
{
"entropy": 0.6386850997805595,
"epoch": 2.7850770478507707,
"grad_norm": 0.00938471220433712,
"learning_rate": 0.0002,
"loss": 0.6340270042419434,
"mean_token_accuracy": 0.7409438043832779,
"num_tokens": 16004947.0,
"step": 431
},
{
"entropy": 0.6217259094119072,
"epoch": 2.791565287915653,
"grad_norm": 0.010031217709183693,
"learning_rate": 0.0002,
"loss": 0.6190569400787354,
"mean_token_accuracy": 0.7476614862680435,
"num_tokens": 16041946.0,
"step": 432
},
{
"entropy": 0.6218375042080879,
"epoch": 2.798053527980535,
"grad_norm": 0.008579161949455738,
"learning_rate": 0.0002,
"loss": 0.6240730285644531,
"mean_token_accuracy": 0.746677428483963,
"num_tokens": 16078788.0,
"step": 433
},
{
"entropy": 0.627423033118248,
"epoch": 2.804541768045418,
"grad_norm": 0.010432623326778412,
"learning_rate": 0.0002,
"loss": 0.6334057450294495,
"mean_token_accuracy": 0.7425751611590385,
"num_tokens": 16116073.0,
"step": 434
},
{
"entropy": 0.6249776631593704,
"epoch": 2.8110300081103,
"grad_norm": 0.01080512534826994,
"learning_rate": 0.0002,
"loss": 0.6291300058364868,
"mean_token_accuracy": 0.7412911430001259,
"num_tokens": 16153421.0,
"step": 435
},
{
"entropy": 0.6199780628085136,
"epoch": 2.8175182481751824,
"grad_norm": 0.008089151233434677,
"learning_rate": 0.0002,
"loss": 0.6166943311691284,
"mean_token_accuracy": 0.7502307966351509,
"num_tokens": 16190692.0,
"step": 436
},
{
"entropy": 0.6264552250504494,
"epoch": 2.824006488240065,
"grad_norm": 0.009256084449589252,
"learning_rate": 0.0002,
"loss": 0.6239896416664124,
"mean_token_accuracy": 0.7462676838040352,
"num_tokens": 16227626.0,
"step": 437
},
{
"entropy": 0.6257441863417625,
"epoch": 2.8304947283049473,
"grad_norm": 0.010192189365625381,
"learning_rate": 0.0002,
"loss": 0.6272855997085571,
"mean_token_accuracy": 0.7451135069131851,
"num_tokens": 16264951.0,
"step": 438
},
{
"entropy": 0.6197425052523613,
"epoch": 2.8369829683698295,
"grad_norm": 0.00909087248146534,
"learning_rate": 0.0002,
"loss": 0.6246816515922546,
"mean_token_accuracy": 0.7462664917111397,
"num_tokens": 16302276.0,
"step": 439
},
{
"entropy": 0.6187947019934654,
"epoch": 2.8434712084347122,
"grad_norm": 0.010161105543375015,
"learning_rate": 0.0002,
"loss": 0.6317975521087646,
"mean_token_accuracy": 0.7427225112915039,
"num_tokens": 16339652.0,
"step": 440
},
{
"entropy": 0.6189513206481934,
"epoch": 2.8499594484995945,
"grad_norm": 0.009055238217115402,
"learning_rate": 0.0002,
"loss": 0.6247466802597046,
"mean_token_accuracy": 0.7450408861041069,
"num_tokens": 16376803.0,
"step": 441
},
{
"entropy": 0.6144088804721832,
"epoch": 2.8564476885644767,
"grad_norm": 0.008574709296226501,
"learning_rate": 0.0002,
"loss": 0.618188738822937,
"mean_token_accuracy": 0.7477873042225838,
"num_tokens": 16413555.0,
"step": 442
},
{
"entropy": 0.6285263672471046,
"epoch": 2.8629359286293594,
"grad_norm": 0.01058571133762598,
"learning_rate": 0.0002,
"loss": 0.6210506558418274,
"mean_token_accuracy": 0.7466302737593651,
"num_tokens": 16450235.0,
"step": 443
},
{
"entropy": 0.6278195902705193,
"epoch": 2.8694241686942417,
"grad_norm": 0.008600706234574318,
"learning_rate": 0.0002,
"loss": 0.6228291988372803,
"mean_token_accuracy": 0.7465885654091835,
"num_tokens": 16487688.0,
"step": 444
},
{
"entropy": 0.6128537505865097,
"epoch": 2.875912408759124,
"grad_norm": 0.009188942611217499,
"learning_rate": 0.0002,
"loss": 0.6115404367446899,
"mean_token_accuracy": 0.7511069476604462,
"num_tokens": 16525056.0,
"step": 445
},
{
"entropy": 0.6209624111652374,
"epoch": 2.8824006488240066,
"grad_norm": 0.009248930029571056,
"learning_rate": 0.0002,
"loss": 0.6210386753082275,
"mean_token_accuracy": 0.7469235137104988,
"num_tokens": 16562914.0,
"step": 446
},
{
"entropy": 0.5965787023305893,
"epoch": 2.888888888888889,
"grad_norm": 0.0094021987169981,
"learning_rate": 0.0002,
"loss": 0.6033673286437988,
"mean_token_accuracy": 0.7514390125870705,
"num_tokens": 16599899.0,
"step": 447
},
{
"entropy": 0.6115651428699493,
"epoch": 2.895377128953771,
"grad_norm": 0.01325083989650011,
"learning_rate": 0.0002,
"loss": 0.6262028813362122,
"mean_token_accuracy": 0.7461578771471977,
"num_tokens": 16637011.0,
"step": 448
},
{
"entropy": 0.6188539639115334,
"epoch": 2.9018653690186538,
"grad_norm": 0.00891121570020914,
"learning_rate": 0.0002,
"loss": 0.6159206628799438,
"mean_token_accuracy": 0.7494730055332184,
"num_tokens": 16673697.0,
"step": 449
},
{
"entropy": 0.6208583936095238,
"epoch": 2.908353609083536,
"grad_norm": 0.009828220121562481,
"learning_rate": 0.0002,
"loss": 0.6155424118041992,
"mean_token_accuracy": 0.7491355165839195,
"num_tokens": 16710885.0,
"step": 450
},
{
"entropy": 0.6197483390569687,
"epoch": 2.9148418491484183,
"grad_norm": 0.008900245651602745,
"learning_rate": 0.0002,
"loss": 0.6142081618309021,
"mean_token_accuracy": 0.748231329023838,
"num_tokens": 16748182.0,
"step": 451
},
{
"entropy": 0.6212092339992523,
"epoch": 2.921330089213301,
"grad_norm": 0.00849118735641241,
"learning_rate": 0.0002,
"loss": 0.6236221790313721,
"mean_token_accuracy": 0.7436698824167252,
"num_tokens": 16785028.0,
"step": 452
},
{
"entropy": 0.6107748746871948,
"epoch": 2.927818329278183,
"grad_norm": 0.009662901051342487,
"learning_rate": 0.0002,
"loss": 0.6197327375411987,
"mean_token_accuracy": 0.7483203411102295,
"num_tokens": 16822318.0,
"step": 453
},
{
"entropy": 0.6189533397555351,
"epoch": 2.9343065693430654,
"grad_norm": 0.009161571972072124,
"learning_rate": 0.0002,
"loss": 0.6221146583557129,
"mean_token_accuracy": 0.7479159906506538,
"num_tokens": 16859984.0,
"step": 454
},
{
"entropy": 0.6262816786766052,
"epoch": 2.940794809407948,
"grad_norm": 0.008490455336868763,
"learning_rate": 0.0002,
"loss": 0.6270855069160461,
"mean_token_accuracy": 0.7452046275138855,
"num_tokens": 16897277.0,
"step": 455
},
{
"entropy": 0.6230187118053436,
"epoch": 2.9472830494728304,
"grad_norm": 0.00920241978019476,
"learning_rate": 0.0002,
"loss": 0.6212553977966309,
"mean_token_accuracy": 0.7461629658937454,
"num_tokens": 16934423.0,
"step": 456
},
{
"entropy": 0.6259749531745911,
"epoch": 2.9537712895377126,
"grad_norm": 0.008131385780870914,
"learning_rate": 0.0002,
"loss": 0.6244622468948364,
"mean_token_accuracy": 0.7466467097401619,
"num_tokens": 16971857.0,
"step": 457
},
{
"entropy": 0.6159861534833908,
"epoch": 2.9602595296025953,
"grad_norm": 0.008032194338738918,
"learning_rate": 0.0002,
"loss": 0.6193053722381592,
"mean_token_accuracy": 0.7479442283511162,
"num_tokens": 17008930.0,
"step": 458
},
{
"entropy": 0.617520272731781,
"epoch": 2.9667477696674776,
"grad_norm": 0.009034648537635803,
"learning_rate": 0.0002,
"loss": 0.6226905584335327,
"mean_token_accuracy": 0.7449267134070396,
"num_tokens": 17046294.0,
"step": 459
},
{
"entropy": 0.6264740154147148,
"epoch": 2.9732360097323602,
"grad_norm": 0.008523489348590374,
"learning_rate": 0.0002,
"loss": 0.6288236379623413,
"mean_token_accuracy": 0.7429340779781342,
"num_tokens": 17083358.0,
"step": 460
},
{
"entropy": 0.6205747723579407,
"epoch": 2.9797242497972425,
"grad_norm": 0.008030165918171406,
"learning_rate": 0.0002,
"loss": 0.6183617115020752,
"mean_token_accuracy": 0.7463237047195435,
"num_tokens": 17120761.0,
"step": 461
},
{
"entropy": 0.6367032006382942,
"epoch": 2.986212489862125,
"grad_norm": 0.009663688018918037,
"learning_rate": 0.0002,
"loss": 0.6329810619354248,
"mean_token_accuracy": 0.7433002442121506,
"num_tokens": 17158231.0,
"step": 462
},
{
"entropy": 0.626891016960144,
"epoch": 2.9927007299270074,
"grad_norm": 0.009945257566869259,
"learning_rate": 0.0002,
"loss": 0.6275311708450317,
"mean_token_accuracy": 0.7450283095240593,
"num_tokens": 17195764.0,
"step": 463
},
{
"entropy": 0.6275185570120811,
"epoch": 2.9991889699918897,
"grad_norm": 0.008921638131141663,
"learning_rate": 0.0002,
"loss": 0.6317576169967651,
"mean_token_accuracy": 0.7413767129182816,
"num_tokens": 17232867.0,
"step": 464
},
{
"entropy": 0.5935274362564087,
"epoch": 3.0,
"grad_norm": 0.02002483420073986,
"learning_rate": 0.0002,
"loss": 0.5921852588653564,
"mean_token_accuracy": 0.7577869892120361,
"num_tokens": 17237490.0,
"step": 465
},
{
"entropy": 0.610297404229641,
"epoch": 3.0064882400648822,
"grad_norm": 0.010434089228510857,
"learning_rate": 0.0002,
"loss": 0.6096053123474121,
"mean_token_accuracy": 0.7505725026130676,
"num_tokens": 17274381.0,
"step": 466
},
{
"entropy": 0.6093652322888374,
"epoch": 3.012976480129765,
"grad_norm": 0.011252244934439659,
"learning_rate": 0.0002,
"loss": 0.6079680919647217,
"mean_token_accuracy": 0.751014731824398,
"num_tokens": 17311247.0,
"step": 467
},
{
"entropy": 0.6135042458772659,
"epoch": 3.019464720194647,
"grad_norm": 0.011452090926468372,
"learning_rate": 0.0002,
"loss": 0.621872067451477,
"mean_token_accuracy": 0.7463375702500343,
"num_tokens": 17348490.0,
"step": 468
},
{
"entropy": 0.6276230961084366,
"epoch": 3.0259529602595294,
"grad_norm": 0.011181695386767387,
"learning_rate": 0.0002,
"loss": 0.6287038326263428,
"mean_token_accuracy": 0.7455412894487381,
"num_tokens": 17385419.0,
"step": 469
},
{
"entropy": 0.6226534396409988,
"epoch": 3.032441200324412,
"grad_norm": 0.00998624972999096,
"learning_rate": 0.0002,
"loss": 0.6229760646820068,
"mean_token_accuracy": 0.7449204847216606,
"num_tokens": 17423056.0,
"step": 470
},
{
"entropy": 0.6008478105068207,
"epoch": 3.0389294403892944,
"grad_norm": 0.0095088891685009,
"learning_rate": 0.0002,
"loss": 0.6020908951759338,
"mean_token_accuracy": 0.7544899210333824,
"num_tokens": 17460157.0,
"step": 471
},
{
"entropy": 0.6252934113144875,
"epoch": 3.0454176804541766,
"grad_norm": 0.010803421959280968,
"learning_rate": 0.0002,
"loss": 0.6294186115264893,
"mean_token_accuracy": 0.7426271066069603,
"num_tokens": 17497579.0,
"step": 472
},
{
"entropy": 0.6106472909450531,
"epoch": 3.0519059205190593,
"grad_norm": 0.010041839443147182,
"learning_rate": 0.0002,
"loss": 0.6172924041748047,
"mean_token_accuracy": 0.7476223781704903,
"num_tokens": 17534955.0,
"step": 473
},
{
"entropy": 0.6221166178584099,
"epoch": 3.0583941605839415,
"grad_norm": 0.009123523719608784,
"learning_rate": 0.0002,
"loss": 0.6244035363197327,
"mean_token_accuracy": 0.7448302879929543,
"num_tokens": 17572150.0,
"step": 474
},
{
"entropy": 0.6102956235408783,
"epoch": 3.0648824006488242,
"grad_norm": 0.008510733023285866,
"learning_rate": 0.0002,
"loss": 0.6107138991355896,
"mean_token_accuracy": 0.7484675496816635,
"num_tokens": 17609343.0,
"step": 475
},
{
"entropy": 0.6124226823449135,
"epoch": 3.0713706407137065,
"grad_norm": 0.009730803780257702,
"learning_rate": 0.0002,
"loss": 0.6136341691017151,
"mean_token_accuracy": 0.7490884363651276,
"num_tokens": 17646448.0,
"step": 476
},
{
"entropy": 0.6132366731762886,
"epoch": 3.0778588807785887,
"grad_norm": 0.008984670974314213,
"learning_rate": 0.0002,
"loss": 0.6176835298538208,
"mean_token_accuracy": 0.7453758120536804,
"num_tokens": 17683285.0,
"step": 477
},
{
"entropy": 0.6138317957520485,
"epoch": 3.0843471208434714,
"grad_norm": 0.009527822025120258,
"learning_rate": 0.0002,
"loss": 0.6128236055374146,
"mean_token_accuracy": 0.7498287856578827,
"num_tokens": 17720424.0,
"step": 478
},
{
"entropy": 0.6150398552417755,
"epoch": 3.0908353609083536,
"grad_norm": 0.012212819419801235,
"learning_rate": 0.0002,
"loss": 0.6184934377670288,
"mean_token_accuracy": 0.74715456366539,
"num_tokens": 17757738.0,
"step": 479
},
{
"entropy": 0.6138227432966232,
"epoch": 3.097323600973236,
"grad_norm": 0.009692898020148277,
"learning_rate": 0.0002,
"loss": 0.615317165851593,
"mean_token_accuracy": 0.7491249144077301,
"num_tokens": 17794819.0,
"step": 480
},
{
"entropy": 0.6220738738775253,
"epoch": 3.1038118410381186,
"grad_norm": 0.009081809781491756,
"learning_rate": 0.0002,
"loss": 0.6233057975769043,
"mean_token_accuracy": 0.7442603260278702,
"num_tokens": 17832045.0,
"step": 481
},
{
"entropy": 0.6058575734496117,
"epoch": 3.110300081103001,
"grad_norm": 0.009930483065545559,
"learning_rate": 0.0002,
"loss": 0.6012391448020935,
"mean_token_accuracy": 0.7559900879859924,
"num_tokens": 17869448.0,
"step": 482
},
{
"entropy": 0.6158036887645721,
"epoch": 3.116788321167883,
"grad_norm": 0.009399381466209888,
"learning_rate": 0.0002,
"loss": 0.6149718761444092,
"mean_token_accuracy": 0.7499518990516663,
"num_tokens": 17906111.0,
"step": 483
},
{
"entropy": 0.6169976964592934,
"epoch": 3.1232765612327658,
"grad_norm": 0.009214673191308975,
"learning_rate": 0.0002,
"loss": 0.6195358037948608,
"mean_token_accuracy": 0.744194358587265,
"num_tokens": 17943306.0,
"step": 484
},
{
"entropy": 0.620849184691906,
"epoch": 3.129764801297648,
"grad_norm": 0.00997876189649105,
"learning_rate": 0.0002,
"loss": 0.6267833113670349,
"mean_token_accuracy": 0.744784764945507,
"num_tokens": 17980613.0,
"step": 485
},
{
"entropy": 0.6128402128815651,
"epoch": 3.1362530413625302,
"grad_norm": 0.008573702536523342,
"learning_rate": 0.0002,
"loss": 0.6157655715942383,
"mean_token_accuracy": 0.7487166821956635,
"num_tokens": 18017947.0,
"step": 486
},
{
"entropy": 0.622900165617466,
"epoch": 3.142741281427413,
"grad_norm": 0.009601105935871601,
"learning_rate": 0.0002,
"loss": 0.6263000965118408,
"mean_token_accuracy": 0.7445476576685905,
"num_tokens": 18055764.0,
"step": 487
},
{
"entropy": 0.6130729392170906,
"epoch": 3.149229521492295,
"grad_norm": 0.008899933658540249,
"learning_rate": 0.0002,
"loss": 0.6115667819976807,
"mean_token_accuracy": 0.7505542188882828,
"num_tokens": 18092869.0,
"step": 488
},
{
"entropy": 0.615093469619751,
"epoch": 3.1557177615571774,
"grad_norm": 0.009630289860069752,
"learning_rate": 0.0002,
"loss": 0.6127116084098816,
"mean_token_accuracy": 0.74873948097229,
"num_tokens": 18130032.0,
"step": 489
},
{
"entropy": 0.6184138208627701,
"epoch": 3.16220600162206,
"grad_norm": 0.009784260764718056,
"learning_rate": 0.0002,
"loss": 0.6196454763412476,
"mean_token_accuracy": 0.7479289025068283,
"num_tokens": 18167189.0,
"step": 490
},
{
"entropy": 0.6225049868226051,
"epoch": 3.1686942416869424,
"grad_norm": 0.009817374870181084,
"learning_rate": 0.0002,
"loss": 0.6254591345787048,
"mean_token_accuracy": 0.7443916201591492,
"num_tokens": 18204423.0,
"step": 491
},
{
"entropy": 0.599067859351635,
"epoch": 3.1751824817518246,
"grad_norm": 0.009707923047244549,
"learning_rate": 0.0002,
"loss": 0.603665292263031,
"mean_token_accuracy": 0.7512796595692635,
"num_tokens": 18241647.0,
"step": 492
},
{
"entropy": 0.6269692480564117,
"epoch": 3.1816707218167073,
"grad_norm": 0.009654807858169079,
"learning_rate": 0.0002,
"loss": 0.6272069215774536,
"mean_token_accuracy": 0.7451600208878517,
"num_tokens": 18278874.0,
"step": 493
},
{
"entropy": 0.60984867811203,
"epoch": 3.1881589618815895,
"grad_norm": 0.00973904225975275,
"learning_rate": 0.0002,
"loss": 0.6120602488517761,
"mean_token_accuracy": 0.7500757128000259,
"num_tokens": 18316077.0,
"step": 494
},
{
"entropy": 0.6112287938594818,
"epoch": 3.1946472019464722,
"grad_norm": 0.010687717236578465,
"learning_rate": 0.0002,
"loss": 0.607744038105011,
"mean_token_accuracy": 0.7535340562462807,
"num_tokens": 18353199.0,
"step": 495
},
{
"entropy": 0.6153931394219398,
"epoch": 3.2011354420113545,
"grad_norm": 0.009243862703442574,
"learning_rate": 0.0002,
"loss": 0.6182031035423279,
"mean_token_accuracy": 0.7475122958421707,
"num_tokens": 18390725.0,
"step": 496
},
{
"entropy": 0.6184414252638817,
"epoch": 3.2076236820762367,
"grad_norm": 0.009725847281515598,
"learning_rate": 0.0002,
"loss": 0.6202661395072937,
"mean_token_accuracy": 0.7463328316807747,
"num_tokens": 18428083.0,
"step": 497
},
{
"entropy": 0.6206400170922279,
"epoch": 3.2141119221411194,
"grad_norm": 0.009717848151922226,
"learning_rate": 0.0002,
"loss": 0.6237635612487793,
"mean_token_accuracy": 0.7449309974908829,
"num_tokens": 18465093.0,
"step": 498
},
{
"entropy": 0.6063303649425507,
"epoch": 3.2206001622060016,
"grad_norm": 0.009384922683238983,
"learning_rate": 0.0002,
"loss": 0.6071447134017944,
"mean_token_accuracy": 0.750182680785656,
"num_tokens": 18502351.0,
"step": 499
},
{
"entropy": 0.6171220317482948,
"epoch": 3.227088402270884,
"grad_norm": 0.010402821935713291,
"learning_rate": 0.0002,
"loss": 0.6183167695999146,
"mean_token_accuracy": 0.7468552514910698,
"num_tokens": 18540172.0,
"step": 500
},
{
"entropy": 0.6202204376459122,
"epoch": 3.2335766423357666,
"grad_norm": 0.008789432235062122,
"learning_rate": 0.0002,
"loss": 0.6224135160446167,
"mean_token_accuracy": 0.745467983186245,
"num_tokens": 18577734.0,
"step": 501
},
{
"entropy": 0.6132732257246971,
"epoch": 3.240064882400649,
"grad_norm": 0.010597198270261288,
"learning_rate": 0.0002,
"loss": 0.6129106283187866,
"mean_token_accuracy": 0.7499266192317009,
"num_tokens": 18614944.0,
"step": 502
},
{
"entropy": 0.6337689533829689,
"epoch": 3.246553122465531,
"grad_norm": 0.009572361595928669,
"learning_rate": 0.0002,
"loss": 0.6304764747619629,
"mean_token_accuracy": 0.7434330955147743,
"num_tokens": 18651997.0,
"step": 503
},
{
"entropy": 0.6075436845421791,
"epoch": 3.2530413625304138,
"grad_norm": 0.00990824680775404,
"learning_rate": 0.0002,
"loss": 0.6082068681716919,
"mean_token_accuracy": 0.7516702488064766,
"num_tokens": 18688674.0,
"step": 504
},
{
"entropy": 0.6139610409736633,
"epoch": 3.259529602595296,
"grad_norm": 0.010237157344818115,
"learning_rate": 0.0002,
"loss": 0.6186607480049133,
"mean_token_accuracy": 0.7454981952905655,
"num_tokens": 18726405.0,
"step": 505
},
{
"entropy": 0.6063608303666115,
"epoch": 3.2660178426601782,
"grad_norm": 0.010847094468772411,
"learning_rate": 0.0002,
"loss": 0.6137136816978455,
"mean_token_accuracy": 0.7497691661119461,
"num_tokens": 18763668.0,
"step": 506
},
{
"entropy": 0.6163499504327774,
"epoch": 3.272506082725061,
"grad_norm": 0.010017551481723785,
"learning_rate": 0.0002,
"loss": 0.6188673973083496,
"mean_token_accuracy": 0.7473317757248878,
"num_tokens": 18800872.0,
"step": 507
},
{
"entropy": 0.6251264810562134,
"epoch": 3.278994322789943,
"grad_norm": 0.011264265514910221,
"learning_rate": 0.0002,
"loss": 0.6177271604537964,
"mean_token_accuracy": 0.7485972419381142,
"num_tokens": 18838150.0,
"step": 508
},
{
"entropy": 0.6273062154650688,
"epoch": 3.285482562854826,
"grad_norm": 0.010041182860732079,
"learning_rate": 0.0002,
"loss": 0.6206075549125671,
"mean_token_accuracy": 0.7470289915800095,
"num_tokens": 18875738.0,
"step": 509
},
{
"entropy": 0.6267990991473198,
"epoch": 3.291970802919708,
"grad_norm": 0.011449483223259449,
"learning_rate": 0.0002,
"loss": 0.6346527934074402,
"mean_token_accuracy": 0.7385271340608597,
"num_tokens": 18913137.0,
"step": 510
},
{
"entropy": 0.6025072038173676,
"epoch": 3.2984590429845904,
"grad_norm": 0.010422894731163979,
"learning_rate": 0.0002,
"loss": 0.6072125434875488,
"mean_token_accuracy": 0.7508590817451477,
"num_tokens": 18950470.0,
"step": 511
},
{
"entropy": 0.6073831468820572,
"epoch": 3.304947283049473,
"grad_norm": 0.010642215609550476,
"learning_rate": 0.0002,
"loss": 0.6133738160133362,
"mean_token_accuracy": 0.7492869570851326,
"num_tokens": 18988313.0,
"step": 512
},
{
"entropy": 0.5974380895495415,
"epoch": 3.3114355231143553,
"grad_norm": 0.010486697778105736,
"learning_rate": 0.0002,
"loss": 0.6020730137825012,
"mean_token_accuracy": 0.7548841238021851,
"num_tokens": 19024956.0,
"step": 513
},
{
"entropy": 0.6128261536359787,
"epoch": 3.3179237631792375,
"grad_norm": 0.011510336771607399,
"learning_rate": 0.0002,
"loss": 0.6143049001693726,
"mean_token_accuracy": 0.7480410858988762,
"num_tokens": 19062179.0,
"step": 514
},
{
"entropy": 0.6077246218919754,
"epoch": 3.3244120032441202,
"grad_norm": 0.010107292793691158,
"learning_rate": 0.0002,
"loss": 0.6046852469444275,
"mean_token_accuracy": 0.7533954977989197,
"num_tokens": 19099090.0,
"step": 515
},
{
"entropy": 0.6247019246220589,
"epoch": 3.3309002433090025,
"grad_norm": 0.010466467589139938,
"learning_rate": 0.0002,
"loss": 0.6306489706039429,
"mean_token_accuracy": 0.741244375705719,
"num_tokens": 19136307.0,
"step": 516
},
{
"entropy": 0.6153485924005508,
"epoch": 3.3373884833738847,
"grad_norm": 0.009494316764175892,
"learning_rate": 0.0002,
"loss": 0.6167474985122681,
"mean_token_accuracy": 0.7500151321291924,
"num_tokens": 19173544.0,
"step": 517
},
{
"entropy": 0.6086971685290337,
"epoch": 3.3438767234387674,
"grad_norm": 0.009192675352096558,
"learning_rate": 0.0002,
"loss": 0.6096853017807007,
"mean_token_accuracy": 0.7501685246825218,
"num_tokens": 19210386.0,
"step": 518
},
{
"entropy": 0.6297651901841164,
"epoch": 3.3503649635036497,
"grad_norm": 0.009902825579047203,
"learning_rate": 0.0002,
"loss": 0.6314697265625,
"mean_token_accuracy": 0.7417091131210327,
"num_tokens": 19247761.0,
"step": 519
},
{
"entropy": 0.6149463355541229,
"epoch": 3.356853203568532,
"grad_norm": 0.009715819731354713,
"learning_rate": 0.0002,
"loss": 0.6137614250183105,
"mean_token_accuracy": 0.7476155012845993,
"num_tokens": 19284908.0,
"step": 520
},
{
"entropy": 0.6115437000989914,
"epoch": 3.3633414436334146,
"grad_norm": 0.009652029722929,
"learning_rate": 0.0002,
"loss": 0.6114376783370972,
"mean_token_accuracy": 0.7499561905860901,
"num_tokens": 19321727.0,
"step": 521
},
{
"entropy": 0.6143479123711586,
"epoch": 3.369829683698297,
"grad_norm": 0.010150844231247902,
"learning_rate": 0.0002,
"loss": 0.6162387132644653,
"mean_token_accuracy": 0.7469704374670982,
"num_tokens": 19359065.0,
"step": 522
},
{
"entropy": 0.6042628288269043,
"epoch": 3.376317923763179,
"grad_norm": 0.010199622251093388,
"learning_rate": 0.0002,
"loss": 0.607587456703186,
"mean_token_accuracy": 0.7510121315717697,
"num_tokens": 19396140.0,
"step": 523
},
{
"entropy": 0.6103994250297546,
"epoch": 3.3828061638280618,
"grad_norm": 0.009757442399859428,
"learning_rate": 0.0002,
"loss": 0.6118942499160767,
"mean_token_accuracy": 0.7493396252393723,
"num_tokens": 19433282.0,
"step": 524
},
{
"entropy": 0.6115303710103035,
"epoch": 3.389294403892944,
"grad_norm": 0.009843776933848858,
"learning_rate": 0.0002,
"loss": 0.6144024133682251,
"mean_token_accuracy": 0.7491987869143486,
"num_tokens": 19470735.0,
"step": 525
},
{
"entropy": 0.6124155074357986,
"epoch": 3.3957826439578263,
"grad_norm": 0.012832233682274818,
"learning_rate": 0.0002,
"loss": 0.6174359321594238,
"mean_token_accuracy": 0.7484075799584389,
"num_tokens": 19508279.0,
"step": 526
},
{
"entropy": 0.621652752161026,
"epoch": 3.402270884022709,
"grad_norm": 0.010444359853863716,
"learning_rate": 0.0002,
"loss": 0.6202374696731567,
"mean_token_accuracy": 0.747683048248291,
"num_tokens": 19545629.0,
"step": 527
},
{
"entropy": 0.6133333742618561,
"epoch": 3.408759124087591,
"grad_norm": 0.01157453190535307,
"learning_rate": 0.0002,
"loss": 0.6190609931945801,
"mean_token_accuracy": 0.7481984347105026,
"num_tokens": 19583135.0,
"step": 528
},
{
"entropy": 0.6031940132379532,
"epoch": 3.4152473641524734,
"grad_norm": 0.01220928505063057,
"learning_rate": 0.0002,
"loss": 0.60877525806427,
"mean_token_accuracy": 0.7505937144160271,
"num_tokens": 19620410.0,
"step": 529
},
{
"entropy": 0.6026583164930344,
"epoch": 3.421735604217356,
"grad_norm": 0.009105565026402473,
"learning_rate": 0.0002,
"loss": 0.6003735661506653,
"mean_token_accuracy": 0.7538656741380692,
"num_tokens": 19657757.0,
"step": 530
},
{
"entropy": 0.6212241724133492,
"epoch": 3.4282238442822384,
"grad_norm": 0.012120554223656654,
"learning_rate": 0.0002,
"loss": 0.6169411540031433,
"mean_token_accuracy": 0.7489817962050438,
"num_tokens": 19694775.0,
"step": 531
},
{
"entropy": 0.611191414296627,
"epoch": 3.4347120843471206,
"grad_norm": 0.010209856554865837,
"learning_rate": 0.0002,
"loss": 0.6133028268814087,
"mean_token_accuracy": 0.7480586767196655,
"num_tokens": 19731954.0,
"step": 532
},
{
"entropy": 0.6154542937874794,
"epoch": 3.4412003244120033,
"grad_norm": 0.009237438440322876,
"learning_rate": 0.0002,
"loss": 0.6181926131248474,
"mean_token_accuracy": 0.7482445612549782,
"num_tokens": 19769550.0,
"step": 533
},
{
"entropy": 0.6260659247636795,
"epoch": 3.4476885644768855,
"grad_norm": 0.011564482003450394,
"learning_rate": 0.0002,
"loss": 0.6311028599739075,
"mean_token_accuracy": 0.7445508390665054,
"num_tokens": 19806694.0,
"step": 534
},
{
"entropy": 0.6114797592163086,
"epoch": 3.4541768045417682,
"grad_norm": 0.011250223033130169,
"learning_rate": 0.0002,
"loss": 0.6188318133354187,
"mean_token_accuracy": 0.7451098337769508,
"num_tokens": 19843897.0,
"step": 535
},
{
"entropy": 0.6260335817933083,
"epoch": 3.4606650446066505,
"grad_norm": 0.00978784915059805,
"learning_rate": 0.0002,
"loss": 0.6255401372909546,
"mean_token_accuracy": 0.7468025237321854,
"num_tokens": 19881321.0,
"step": 536
},
{
"entropy": 0.6212326288223267,
"epoch": 3.4671532846715327,
"grad_norm": 0.013453345745801926,
"learning_rate": 0.0002,
"loss": 0.611083984375,
"mean_token_accuracy": 0.7521479055285454,
"num_tokens": 19918768.0,
"step": 537
},
{
"entropy": 0.6172696650028229,
"epoch": 3.4736415247364154,
"grad_norm": 0.010021936148405075,
"learning_rate": 0.0002,
"loss": 0.6165583729743958,
"mean_token_accuracy": 0.7488679885864258,
"num_tokens": 19956374.0,
"step": 538
},
{
"entropy": 0.5984770804643631,
"epoch": 3.4801297648012977,
"grad_norm": 0.010912574827671051,
"learning_rate": 0.0002,
"loss": 0.6038742065429688,
"mean_token_accuracy": 0.752843476831913,
"num_tokens": 19993165.0,
"step": 539
},
{
"entropy": 0.6006497591733932,
"epoch": 3.48661800486618,
"grad_norm": 0.010195601731538773,
"learning_rate": 0.0002,
"loss": 0.6058304905891418,
"mean_token_accuracy": 0.7511888965964317,
"num_tokens": 20030632.0,
"step": 540
},
{
"entropy": 0.603807657957077,
"epoch": 3.4931062449310626,
"grad_norm": 0.010789190419018269,
"learning_rate": 0.0002,
"loss": 0.6101077198982239,
"mean_token_accuracy": 0.7498170882463455,
"num_tokens": 20067720.0,
"step": 541
},
{
"entropy": 0.6094614043831825,
"epoch": 3.499594484995945,
"grad_norm": 0.010353523306548595,
"learning_rate": 0.0002,
"loss": 0.6108995676040649,
"mean_token_accuracy": 0.7505486905574799,
"num_tokens": 20105092.0,
"step": 542
},
{
"entropy": 0.6127925515174866,
"epoch": 3.5060827250608275,
"grad_norm": 0.011608858592808247,
"learning_rate": 0.0002,
"loss": 0.6113302111625671,
"mean_token_accuracy": 0.7498401030898094,
"num_tokens": 20142060.0,
"step": 543
},
{
"entropy": 0.6288227662444115,
"epoch": 3.5125709651257098,
"grad_norm": 0.00944559182971716,
"learning_rate": 0.0002,
"loss": 0.6295347213745117,
"mean_token_accuracy": 0.7438011020421982,
"num_tokens": 20179321.0,
"step": 544
},
{
"entropy": 0.6155826225876808,
"epoch": 3.519059205190592,
"grad_norm": 0.010050074197351933,
"learning_rate": 0.0002,
"loss": 0.6170110106468201,
"mean_token_accuracy": 0.7460537254810333,
"num_tokens": 20216788.0,
"step": 545
},
{
"entropy": 0.6109997108578682,
"epoch": 3.5255474452554747,
"grad_norm": 0.010288557037711143,
"learning_rate": 0.0002,
"loss": 0.6153451204299927,
"mean_token_accuracy": 0.747114397585392,
"num_tokens": 20254482.0,
"step": 546
},
{
"entropy": 0.6220259815454483,
"epoch": 3.532035685320357,
"grad_norm": 0.010569143109023571,
"learning_rate": 0.0002,
"loss": 0.6245878338813782,
"mean_token_accuracy": 0.745466060936451,
"num_tokens": 20291323.0,
"step": 547
},
{
"entropy": 0.6251974999904633,
"epoch": 3.538523925385239,
"grad_norm": 0.010512638837099075,
"learning_rate": 0.0002,
"loss": 0.6209877729415894,
"mean_token_accuracy": 0.7460760995745659,
"num_tokens": 20328541.0,
"step": 548
},
{
"entropy": 0.6372380778193474,
"epoch": 3.545012165450122,
"grad_norm": 0.009989661164581776,
"learning_rate": 0.0002,
"loss": 0.63493812084198,
"mean_token_accuracy": 0.7409111261367798,
"num_tokens": 20366154.0,
"step": 549
},
{
"entropy": 0.616200253367424,
"epoch": 3.551500405515004,
"grad_norm": 0.009802714921534061,
"learning_rate": 0.0002,
"loss": 0.6198533773422241,
"mean_token_accuracy": 0.7493973523378372,
"num_tokens": 20403539.0,
"step": 550
},
{
"entropy": 0.6109699085354805,
"epoch": 3.5579886455798864,
"grad_norm": 0.011730330996215343,
"learning_rate": 0.0002,
"loss": 0.6169507503509521,
"mean_token_accuracy": 0.7469825968146324,
"num_tokens": 20440857.0,
"step": 551
},
{
"entropy": 0.6107888966798782,
"epoch": 3.564476885644769,
"grad_norm": 0.010902747511863708,
"learning_rate": 0.0002,
"loss": 0.6169427633285522,
"mean_token_accuracy": 0.7473291158676147,
"num_tokens": 20478685.0,
"step": 552
},
{
"entropy": 0.6232053637504578,
"epoch": 3.5709651257096513,
"grad_norm": 0.01024220883846283,
"learning_rate": 0.0002,
"loss": 0.6223392486572266,
"mean_token_accuracy": 0.7471131235361099,
"num_tokens": 20516186.0,
"step": 553
},
{
"entropy": 0.6318716630339622,
"epoch": 3.5774533657745335,
"grad_norm": 0.00972492340952158,
"learning_rate": 0.0002,
"loss": 0.6295208930969238,
"mean_token_accuracy": 0.7421210557222366,
"num_tokens": 20553418.0,
"step": 554
},
{
"entropy": 0.6323020830750465,
"epoch": 3.5839416058394162,
"grad_norm": 0.009747047908604145,
"learning_rate": 0.0002,
"loss": 0.6291106343269348,
"mean_token_accuracy": 0.742633767426014,
"num_tokens": 20590921.0,
"step": 555
},
{
"entropy": 0.6193426549434662,
"epoch": 3.5904298459042985,
"grad_norm": 0.009529096074402332,
"learning_rate": 0.0002,
"loss": 0.622657299041748,
"mean_token_accuracy": 0.7454424574971199,
"num_tokens": 20628134.0,
"step": 556
},
{
"entropy": 0.606108270585537,
"epoch": 3.5969180859691807,
"grad_norm": 0.01090499758720398,
"learning_rate": 0.0002,
"loss": 0.6156042218208313,
"mean_token_accuracy": 0.7475811764597893,
"num_tokens": 20665529.0,
"step": 557
},
{
"entropy": 0.6024795696139336,
"epoch": 3.6034063260340634,
"grad_norm": 0.01122215110808611,
"learning_rate": 0.0002,
"loss": 0.6096351146697998,
"mean_token_accuracy": 0.7500594854354858,
"num_tokens": 20702623.0,
"step": 558
},
{
"entropy": 0.6050852239131927,
"epoch": 3.6098945660989457,
"grad_norm": 0.008911820128560066,
"learning_rate": 0.0002,
"loss": 0.6063804626464844,
"mean_token_accuracy": 0.750556543469429,
"num_tokens": 20739535.0,
"step": 559
},
{
"entropy": 0.6184356659650803,
"epoch": 3.616382806163828,
"grad_norm": 0.008947025053203106,
"learning_rate": 0.0002,
"loss": 0.6186281442642212,
"mean_token_accuracy": 0.7470304444432259,
"num_tokens": 20776900.0,
"step": 560
},
{
"entropy": 0.6115831136703491,
"epoch": 3.6228710462287106,
"grad_norm": 0.010605190880596638,
"learning_rate": 0.0002,
"loss": 0.6092396974563599,
"mean_token_accuracy": 0.750456377863884,
"num_tokens": 20814326.0,
"step": 561
},
{
"entropy": 0.6234035491943359,
"epoch": 3.629359286293593,
"grad_norm": 0.010619143024086952,
"learning_rate": 0.0002,
"loss": 0.622122585773468,
"mean_token_accuracy": 0.7449623718857765,
"num_tokens": 20851735.0,
"step": 562
},
{
"entropy": 0.6131063625216484,
"epoch": 3.635847526358475,
"grad_norm": 0.009914328344166279,
"learning_rate": 0.0002,
"loss": 0.6129999160766602,
"mean_token_accuracy": 0.7512071952223778,
"num_tokens": 20888959.0,
"step": 563
},
{
"entropy": 0.6103895530104637,
"epoch": 3.6423357664233578,
"grad_norm": 0.009590883739292622,
"learning_rate": 0.0002,
"loss": 0.6121896505355835,
"mean_token_accuracy": 0.7519041821360588,
"num_tokens": 20926880.0,
"step": 564
},
{
"entropy": 0.6107024624943733,
"epoch": 3.64882400648824,
"grad_norm": 0.010136992670595646,
"learning_rate": 0.0002,
"loss": 0.615648090839386,
"mean_token_accuracy": 0.7478983402252197,
"num_tokens": 20964278.0,
"step": 565
},
{
"entropy": 0.6019061878323555,
"epoch": 3.6553122465531223,
"grad_norm": 0.01197731215506792,
"learning_rate": 0.0002,
"loss": 0.6083622574806213,
"mean_token_accuracy": 0.752247080206871,
"num_tokens": 21001703.0,
"step": 566
},
{
"entropy": 0.6136230602860451,
"epoch": 3.661800486618005,
"grad_norm": 0.010383468121290207,
"learning_rate": 0.0002,
"loss": 0.6142981052398682,
"mean_token_accuracy": 0.750029981136322,
"num_tokens": 21039545.0,
"step": 567
},
{
"entropy": 0.6270170286297798,
"epoch": 3.668288726682887,
"grad_norm": 0.01222953386604786,
"learning_rate": 0.0002,
"loss": 0.622101902961731,
"mean_token_accuracy": 0.7463989406824112,
"num_tokens": 21076601.0,
"step": 568
},
{
"entropy": 0.635653018951416,
"epoch": 3.6747769667477694,
"grad_norm": 0.009029991924762726,
"learning_rate": 0.0002,
"loss": 0.6368217468261719,
"mean_token_accuracy": 0.739650160074234,
"num_tokens": 21113628.0,
"step": 569
},
{
"entropy": 0.6155265644192696,
"epoch": 3.681265206812652,
"grad_norm": 0.010669651441276073,
"learning_rate": 0.0002,
"loss": 0.6169142723083496,
"mean_token_accuracy": 0.7483588233590126,
"num_tokens": 21150841.0,
"step": 570
},
{
"entropy": 0.6179278939962387,
"epoch": 3.6877534468775344,
"grad_norm": 0.01090275775641203,
"learning_rate": 0.0002,
"loss": 0.620256781578064,
"mean_token_accuracy": 0.7459961548447609,
"num_tokens": 21188047.0,
"step": 571
},
{
"entropy": 0.6013471409678459,
"epoch": 3.6942416869424166,
"grad_norm": 0.013129356317222118,
"learning_rate": 0.0002,
"loss": 0.6093657612800598,
"mean_token_accuracy": 0.7505828440189362,
"num_tokens": 21224977.0,
"step": 572
},
{
"entropy": 0.6192966923117638,
"epoch": 3.7007299270072993,
"grad_norm": 0.01149990689009428,
"learning_rate": 0.0002,
"loss": 0.624458909034729,
"mean_token_accuracy": 0.7465271949768066,
"num_tokens": 21262229.0,
"step": 573
},
{
"entropy": 0.6305530145764351,
"epoch": 3.7072181670721815,
"grad_norm": 0.011260929517447948,
"learning_rate": 0.0002,
"loss": 0.6282562613487244,
"mean_token_accuracy": 0.7442766949534416,
"num_tokens": 21299934.0,
"step": 574
},
{
"entropy": 0.6216496974229813,
"epoch": 3.7137064071370642,
"grad_norm": 0.011454667896032333,
"learning_rate": 0.0002,
"loss": 0.6176272630691528,
"mean_token_accuracy": 0.7486661300063133,
"num_tokens": 21337298.0,
"step": 575
},
{
"entropy": 0.6251465007662773,
"epoch": 3.7201946472019465,
"grad_norm": 0.011989898979663849,
"learning_rate": 0.0002,
"loss": 0.6237755417823792,
"mean_token_accuracy": 0.7449339032173157,
"num_tokens": 21374338.0,
"step": 576
},
{
"entropy": 0.6160696297883987,
"epoch": 3.7266828872668287,
"grad_norm": 0.009978833608329296,
"learning_rate": 0.0002,
"loss": 0.6201364398002625,
"mean_token_accuracy": 0.7472834289073944,
"num_tokens": 21411412.0,
"step": 577
},
{
"entropy": 0.6086283698678017,
"epoch": 3.7331711273317114,
"grad_norm": 0.01127020176500082,
"learning_rate": 0.0002,
"loss": 0.6133439540863037,
"mean_token_accuracy": 0.7486971095204353,
"num_tokens": 21449184.0,
"step": 578
},
{
"entropy": 0.6155035272240639,
"epoch": 3.7396593673965937,
"grad_norm": 0.009915207512676716,
"learning_rate": 0.0002,
"loss": 0.6193184852600098,
"mean_token_accuracy": 0.7452678084373474,
"num_tokens": 21486452.0,
"step": 579
},
{
"entropy": 0.6227790787816048,
"epoch": 3.7461476074614763,
"grad_norm": 0.009025565348565578,
"learning_rate": 0.0002,
"loss": 0.6250243186950684,
"mean_token_accuracy": 0.7430055662989616,
"num_tokens": 21524049.0,
"step": 580
},
{
"entropy": 0.6145926639437675,
"epoch": 3.7526358475263586,
"grad_norm": 0.010546623729169369,
"learning_rate": 0.0002,
"loss": 0.6121389269828796,
"mean_token_accuracy": 0.7498128041625023,
"num_tokens": 21560910.0,
"step": 581
},
{
"entropy": 0.6132489815354347,
"epoch": 3.759124087591241,
"grad_norm": 0.01081460528075695,
"learning_rate": 0.0002,
"loss": 0.6121793389320374,
"mean_token_accuracy": 0.7495040893554688,
"num_tokens": 21598124.0,
"step": 582
},
{
"entropy": 0.6323688253760338,
"epoch": 3.7656123276561235,
"grad_norm": 0.010107534937560558,
"learning_rate": 0.0002,
"loss": 0.6294635534286499,
"mean_token_accuracy": 0.7433409690856934,
"num_tokens": 21635437.0,
"step": 583
},
{
"entropy": 0.6125660836696625,
"epoch": 3.7721005677210058,
"grad_norm": 0.00997902825474739,
"learning_rate": 0.0002,
"loss": 0.6156618595123291,
"mean_token_accuracy": 0.7480011209845543,
"num_tokens": 21672898.0,
"step": 584
},
{
"entropy": 0.6139216870069504,
"epoch": 3.778588807785888,
"grad_norm": 0.01199332345277071,
"learning_rate": 0.0002,
"loss": 0.6214488744735718,
"mean_token_accuracy": 0.748315691947937,
"num_tokens": 21710166.0,
"step": 585
},
{
"entropy": 0.5991447791457176,
"epoch": 3.7850770478507707,
"grad_norm": 0.01200946606695652,
"learning_rate": 0.0002,
"loss": 0.6080783605575562,
"mean_token_accuracy": 0.7511922717094421,
"num_tokens": 21746897.0,
"step": 586
},
{
"entropy": 0.6105977669358253,
"epoch": 3.791565287915653,
"grad_norm": 0.011675121262669563,
"learning_rate": 0.0002,
"loss": 0.6159127950668335,
"mean_token_accuracy": 0.7491589412093163,
"num_tokens": 21784354.0,
"step": 587
},
{
"entropy": 0.6225078999996185,
"epoch": 3.798053527980535,
"grad_norm": 0.00965933594852686,
"learning_rate": 0.0002,
"loss": 0.6214642524719238,
"mean_token_accuracy": 0.7455714717507362,
"num_tokens": 21821856.0,
"step": 588
},
{
"entropy": 0.627250537276268,
"epoch": 3.804541768045418,
"grad_norm": 0.010286493226885796,
"learning_rate": 0.0002,
"loss": 0.6219584345817566,
"mean_token_accuracy": 0.7479822859168053,
"num_tokens": 21858968.0,
"step": 589
},
{
"entropy": 0.6303782388567924,
"epoch": 3.8110300081103,
"grad_norm": 0.009684202261269093,
"learning_rate": 0.0002,
"loss": 0.629400372505188,
"mean_token_accuracy": 0.7433283776044846,
"num_tokens": 21896486.0,
"step": 590
},
{
"entropy": 0.6274826601147652,
"epoch": 3.8175182481751824,
"grad_norm": 0.00968723464757204,
"learning_rate": 0.0002,
"loss": 0.6308175325393677,
"mean_token_accuracy": 0.7409676983952522,
"num_tokens": 21933746.0,
"step": 591
},
{
"entropy": 0.607462614774704,
"epoch": 3.824006488240065,
"grad_norm": 0.010024085640907288,
"learning_rate": 0.0002,
"loss": 0.6111215353012085,
"mean_token_accuracy": 0.7507134452462196,
"num_tokens": 21970727.0,
"step": 592
},
{
"entropy": 0.6113528236746788,
"epoch": 3.8304947283049473,
"grad_norm": 0.009630702435970306,
"learning_rate": 0.0002,
"loss": 0.615958571434021,
"mean_token_accuracy": 0.7483637630939484,
"num_tokens": 22008126.0,
"step": 593
},
{
"entropy": 0.6118894517421722,
"epoch": 3.8369829683698295,
"grad_norm": 0.00891201663762331,
"learning_rate": 0.0002,
"loss": 0.6150209903717041,
"mean_token_accuracy": 0.7505509406328201,
"num_tokens": 22045058.0,
"step": 594
},
{
"entropy": 0.6181119605898857,
"epoch": 3.8434712084347122,
"grad_norm": 0.00870099663734436,
"learning_rate": 0.0002,
"loss": 0.6192715764045715,
"mean_token_accuracy": 0.7477136552333832,
"num_tokens": 22082485.0,
"step": 595
},
{
"entropy": 0.6250515654683113,
"epoch": 3.8499594484995945,
"grad_norm": 0.00869520753622055,
"learning_rate": 0.0002,
"loss": 0.6237080097198486,
"mean_token_accuracy": 0.7448958083987236,
"num_tokens": 22120186.0,
"step": 596
},
{
"entropy": 0.6200907677412033,
"epoch": 3.8564476885644767,
"grad_norm": 0.008723787032067776,
"learning_rate": 0.0002,
"loss": 0.6199079751968384,
"mean_token_accuracy": 0.7453882619738579,
"num_tokens": 22157538.0,
"step": 597
},
{
"entropy": 0.6176511943340302,
"epoch": 3.8629359286293594,
"grad_norm": 0.010193057358264923,
"learning_rate": 0.0002,
"loss": 0.6177176237106323,
"mean_token_accuracy": 0.7501931935548782,
"num_tokens": 22195003.0,
"step": 598
},
{
"entropy": 0.6236204281449318,
"epoch": 3.8694241686942417,
"grad_norm": 0.00979641918092966,
"learning_rate": 0.0002,
"loss": 0.6303654909133911,
"mean_token_accuracy": 0.7406158596277237,
"num_tokens": 22232607.0,
"step": 599
},
{
"entropy": 0.6202436164021492,
"epoch": 3.875912408759124,
"grad_norm": 0.010212398134171963,
"learning_rate": 0.0002,
"loss": 0.6213873028755188,
"mean_token_accuracy": 0.7464328482747078,
"num_tokens": 22269920.0,
"step": 600
},
{
"entropy": 0.613631397485733,
"epoch": 3.8824006488240066,
"grad_norm": 0.009876083582639694,
"learning_rate": 0.0002,
"loss": 0.6182212829589844,
"mean_token_accuracy": 0.7480113580822945,
"num_tokens": 22306694.0,
"step": 601
},
{
"entropy": 0.6167808622121811,
"epoch": 3.888888888888889,
"grad_norm": 0.010310813784599304,
"learning_rate": 0.0002,
"loss": 0.6251655220985413,
"mean_token_accuracy": 0.7455293834209442,
"num_tokens": 22343827.0,
"step": 602
},
{
"entropy": 0.6132790520787239,
"epoch": 3.895377128953771,
"grad_norm": 0.009235870093107224,
"learning_rate": 0.0002,
"loss": 0.6129046678543091,
"mean_token_accuracy": 0.7505499720573425,
"num_tokens": 22381214.0,
"step": 603
},
{
"entropy": 0.6209843009710312,
"epoch": 3.9018653690186538,
"grad_norm": 0.009926384314894676,
"learning_rate": 0.0002,
"loss": 0.6192604899406433,
"mean_token_accuracy": 0.7472119927406311,
"num_tokens": 22418601.0,
"step": 604
},
{
"entropy": 0.6364298164844513,
"epoch": 3.908353609083536,
"grad_norm": 0.011292664334177971,
"learning_rate": 0.0002,
"loss": 0.6354763507843018,
"mean_token_accuracy": 0.742254801094532,
"num_tokens": 22455732.0,
"step": 605
},
{
"entropy": 0.6375604569911957,
"epoch": 3.9148418491484183,
"grad_norm": 0.009769946336746216,
"learning_rate": 0.0002,
"loss": 0.6385936737060547,
"mean_token_accuracy": 0.7394958734512329,
"num_tokens": 22492996.0,
"step": 606
},
{
"entropy": 0.6145768612623215,
"epoch": 3.921330089213301,
"grad_norm": 0.010400141589343548,
"learning_rate": 0.0002,
"loss": 0.6150961518287659,
"mean_token_accuracy": 0.7494016960263252,
"num_tokens": 22530887.0,
"step": 607
},
{
"entropy": 0.6110121458768845,
"epoch": 3.927818329278183,
"grad_norm": 0.01383623294532299,
"learning_rate": 0.0002,
"loss": 0.6156477332115173,
"mean_token_accuracy": 0.7485735863447189,
"num_tokens": 22568066.0,
"step": 608
},
{
"entropy": 0.6164045110344887,
"epoch": 3.9343065693430654,
"grad_norm": 0.011148249730467796,
"learning_rate": 0.0002,
"loss": 0.6243358850479126,
"mean_token_accuracy": 0.7457598373293877,
"num_tokens": 22605687.0,
"step": 609
},
{
"entropy": 0.6160785332322121,
"epoch": 3.940794809407948,
"grad_norm": 0.011384137906134129,
"learning_rate": 0.0002,
"loss": 0.6210045218467712,
"mean_token_accuracy": 0.7471992895007133,
"num_tokens": 22642646.0,
"step": 610
},
{
"entropy": 0.6149823144078255,
"epoch": 3.9472830494728304,
"grad_norm": 0.012957974337041378,
"learning_rate": 0.0002,
"loss": 0.6171556711196899,
"mean_token_accuracy": 0.7489227131009102,
"num_tokens": 22679842.0,
"step": 611
},
{
"entropy": 0.6145467907190323,
"epoch": 3.9537712895377126,
"grad_norm": 0.010933002457022667,
"learning_rate": 0.0002,
"loss": 0.6167636513710022,
"mean_token_accuracy": 0.7463917657732964,
"num_tokens": 22717084.0,
"step": 612
},
{
"entropy": 0.6232969015836716,
"epoch": 3.9602595296025953,
"grad_norm": 0.009922384284436703,
"learning_rate": 0.0002,
"loss": 0.6252729892730713,
"mean_token_accuracy": 0.743752971291542,
"num_tokens": 22754399.0,
"step": 613
},
{
"entropy": 0.6329927816987038,
"epoch": 3.9667477696674776,
"grad_norm": 0.012450586073100567,
"learning_rate": 0.0002,
"loss": 0.6310559511184692,
"mean_token_accuracy": 0.7443704977631569,
"num_tokens": 22791668.0,
"step": 614
},
{
"entropy": 0.6241239309310913,
"epoch": 3.9732360097323602,
"grad_norm": 0.010473434813320637,
"learning_rate": 0.0002,
"loss": 0.6205140352249146,
"mean_token_accuracy": 0.7461888715624809,
"num_tokens": 22829072.0,
"step": 615
},
{
"entropy": 0.6387766450643539,
"epoch": 3.9797242497972425,
"grad_norm": 0.011033239774405956,
"learning_rate": 0.0002,
"loss": 0.638136088848114,
"mean_token_accuracy": 0.7390930280089378,
"num_tokens": 22866252.0,
"step": 616
},
{
"entropy": 0.6195501312613487,
"epoch": 3.986212489862125,
"grad_norm": 0.011396627873182297,
"learning_rate": 0.0002,
"loss": 0.6249865293502808,
"mean_token_accuracy": 0.7435013577342033,
"num_tokens": 22903910.0,
"step": 617
},
{
"entropy": 0.6073991656303406,
"epoch": 3.9927007299270074,
"grad_norm": 0.011404155753552914,
"learning_rate": 0.0002,
"loss": 0.6144699454307556,
"mean_token_accuracy": 0.7486153542995453,
"num_tokens": 22941419.0,
"step": 618
},
{
"entropy": 0.6133335530757904,
"epoch": 3.9991889699918897,
"grad_norm": 0.012148975394666195,
"learning_rate": 0.0002,
"loss": 0.6239128112792969,
"mean_token_accuracy": 0.744051106274128,
"num_tokens": 22978672.0,
"step": 619
},
{
"entropy": 0.6109002828598022,
"epoch": 4.0,
"grad_norm": 0.02331351302564144,
"learning_rate": 0.0002,
"loss": 0.6144630312919617,
"mean_token_accuracy": 0.7544165849685669,
"num_tokens": 22983289.0,
"step": 620
},
{
"entropy": 0.6217539757490158,
"epoch": 4.006488240064883,
"grad_norm": 0.013456643559038639,
"learning_rate": 0.0002,
"loss": 0.613330602645874,
"mean_token_accuracy": 0.7499688565731049,
"num_tokens": 23020412.0,
"step": 621
},
{
"entropy": 0.6039147675037384,
"epoch": 4.0129764801297645,
"grad_norm": 0.013175777159631252,
"learning_rate": 0.0002,
"loss": 0.597152829170227,
"mean_token_accuracy": 0.7552643939852715,
"num_tokens": 23057448.0,
"step": 622
},
{
"entropy": 0.6142989620566368,
"epoch": 4.019464720194647,
"grad_norm": 0.014114204794168472,
"learning_rate": 0.0002,
"loss": 0.6228339672088623,
"mean_token_accuracy": 0.744938038289547,
"num_tokens": 23094545.0,
"step": 623
},
{
"entropy": 0.6015428304672241,
"epoch": 4.02595296025953,
"grad_norm": 0.015099803917109966,
"learning_rate": 0.0002,
"loss": 0.6131606698036194,
"mean_token_accuracy": 0.7470837756991386,
"num_tokens": 23131965.0,
"step": 624
},
{
"entropy": 0.5885332375764847,
"epoch": 4.032441200324412,
"grad_norm": 0.014588817954063416,
"learning_rate": 0.0002,
"loss": 0.593397855758667,
"mean_token_accuracy": 0.7566570267081261,
"num_tokens": 23168813.0,
"step": 625
},
{
"entropy": 0.6016655787825584,
"epoch": 4.038929440389294,
"grad_norm": 0.012094132602214813,
"learning_rate": 0.0002,
"loss": 0.6046090126037598,
"mean_token_accuracy": 0.7522159889340401,
"num_tokens": 23205779.0,
"step": 626
},
{
"entropy": 0.6151943281292915,
"epoch": 4.045417680454177,
"grad_norm": 0.012667203322052956,
"learning_rate": 0.0002,
"loss": 0.6111838221549988,
"mean_token_accuracy": 0.7486316040158272,
"num_tokens": 23242684.0,
"step": 627
},
{
"entropy": 0.6105204373598099,
"epoch": 4.051905920519059,
"grad_norm": 0.011044032871723175,
"learning_rate": 0.0002,
"loss": 0.6119928956031799,
"mean_token_accuracy": 0.7496168315410614,
"num_tokens": 23279684.0,
"step": 628
},
{
"entropy": 0.6080695539712906,
"epoch": 4.0583941605839415,
"grad_norm": 0.012295052409172058,
"learning_rate": 0.0002,
"loss": 0.6104212999343872,
"mean_token_accuracy": 0.7498067244887352,
"num_tokens": 23316599.0,
"step": 629
},
{
"entropy": 0.6009281948208809,
"epoch": 4.064882400648824,
"grad_norm": 0.012583774514496326,
"learning_rate": 0.0002,
"loss": 0.6041219234466553,
"mean_token_accuracy": 0.7518585100769997,
"num_tokens": 23353800.0,
"step": 630
},
{
"entropy": 0.6015147417783737,
"epoch": 4.071370640713706,
"grad_norm": 0.011909936554729939,
"learning_rate": 0.0002,
"loss": 0.6030286550521851,
"mean_token_accuracy": 0.7531652525067329,
"num_tokens": 23390939.0,
"step": 631
},
{
"entropy": 0.6044563055038452,
"epoch": 4.077858880778589,
"grad_norm": 0.011805822141468525,
"learning_rate": 0.0002,
"loss": 0.6060421466827393,
"mean_token_accuracy": 0.7509199753403664,
"num_tokens": 23427956.0,
"step": 632
},
{
"entropy": 0.6049995571374893,
"epoch": 4.084347120843471,
"grad_norm": 0.012876358814537525,
"learning_rate": 0.0002,
"loss": 0.6117682456970215,
"mean_token_accuracy": 0.7485300377011299,
"num_tokens": 23465445.0,
"step": 633
},
{
"entropy": 0.6048118397593498,
"epoch": 4.090835360908353,
"grad_norm": 0.012466302141547203,
"learning_rate": 0.0002,
"loss": 0.6076602339744568,
"mean_token_accuracy": 0.7526114881038666,
"num_tokens": 23502361.0,
"step": 634
},
{
"entropy": 0.6199515163898468,
"epoch": 4.097323600973236,
"grad_norm": 0.013892917893826962,
"learning_rate": 0.0002,
"loss": 0.6193369626998901,
"mean_token_accuracy": 0.7488663196563721,
"num_tokens": 23540086.0,
"step": 635
},
{
"entropy": 0.6109070330858231,
"epoch": 4.103811841038119,
"grad_norm": 0.012778576463460922,
"learning_rate": 0.0002,
"loss": 0.6099793910980225,
"mean_token_accuracy": 0.7521104216575623,
"num_tokens": 23577435.0,
"step": 636
},
{
"entropy": 0.6217869147658348,
"epoch": 4.110300081103,
"grad_norm": 0.011083797551691532,
"learning_rate": 0.0002,
"loss": 0.6223993301391602,
"mean_token_accuracy": 0.7441250160336494,
"num_tokens": 23614892.0,
"step": 637
},
{
"entropy": 0.6092150881886482,
"epoch": 4.116788321167883,
"grad_norm": 0.011457768268883228,
"learning_rate": 0.0002,
"loss": 0.6109668016433716,
"mean_token_accuracy": 0.7505389377474785,
"num_tokens": 23652404.0,
"step": 638
},
{
"entropy": 0.5892162844538689,
"epoch": 4.123276561232766,
"grad_norm": 0.011224270798265934,
"learning_rate": 0.0002,
"loss": 0.5923285484313965,
"mean_token_accuracy": 0.7561718374490738,
"num_tokens": 23689182.0,
"step": 639
},
{
"entropy": 0.6155631691217422,
"epoch": 4.1297648012976484,
"grad_norm": 0.011392487213015556,
"learning_rate": 0.0002,
"loss": 0.6169704794883728,
"mean_token_accuracy": 0.7484367191791534,
"num_tokens": 23726827.0,
"step": 640
},
{
"entropy": 0.6134647503495216,
"epoch": 4.13625304136253,
"grad_norm": 0.01305895671248436,
"learning_rate": 0.0002,
"loss": 0.6227377653121948,
"mean_token_accuracy": 0.7455505281686783,
"num_tokens": 23764215.0,
"step": 641
},
{
"entropy": 0.6127767860889435,
"epoch": 4.142741281427413,
"grad_norm": 0.011744504794478416,
"learning_rate": 0.0002,
"loss": 0.6154167056083679,
"mean_token_accuracy": 0.7480334118008614,
"num_tokens": 23801609.0,
"step": 642
},
{
"entropy": 0.6113294437527657,
"epoch": 4.149229521492296,
"grad_norm": 0.013036824762821198,
"learning_rate": 0.0002,
"loss": 0.6141045093536377,
"mean_token_accuracy": 0.7493610754609108,
"num_tokens": 23839155.0,
"step": 643
},
{
"entropy": 0.6171691864728928,
"epoch": 4.155717761557177,
"grad_norm": 0.012765160761773586,
"learning_rate": 0.0002,
"loss": 0.6207258701324463,
"mean_token_accuracy": 0.7462699934840202,
"num_tokens": 23876532.0,
"step": 644
},
{
"entropy": 0.6020215824246407,
"epoch": 4.16220600162206,
"grad_norm": 0.011224629357457161,
"learning_rate": 0.0002,
"loss": 0.6040517091751099,
"mean_token_accuracy": 0.7520366311073303,
"num_tokens": 23913624.0,
"step": 645
},
{
"entropy": 0.6073898002505302,
"epoch": 4.168694241686943,
"grad_norm": 0.012669643387198448,
"learning_rate": 0.0002,
"loss": 0.6089828610420227,
"mean_token_accuracy": 0.751623198390007,
"num_tokens": 23951134.0,
"step": 646
},
{
"entropy": 0.6056643575429916,
"epoch": 4.175182481751825,
"grad_norm": 0.013099576346576214,
"learning_rate": 0.0002,
"loss": 0.6066282391548157,
"mean_token_accuracy": 0.7509062737226486,
"num_tokens": 23988712.0,
"step": 647
},
{
"entropy": 0.6190872266888618,
"epoch": 4.181670721816707,
"grad_norm": 0.013141883537173271,
"learning_rate": 0.0002,
"loss": 0.6172468662261963,
"mean_token_accuracy": 0.7470818608999252,
"num_tokens": 24025925.0,
"step": 648
},
{
"entropy": 0.6018052324652672,
"epoch": 4.18815896188159,
"grad_norm": 0.01188298873603344,
"learning_rate": 0.0002,
"loss": 0.6035501956939697,
"mean_token_accuracy": 0.7526876479387283,
"num_tokens": 24063159.0,
"step": 649
},
{
"entropy": 0.6047950685024261,
"epoch": 4.194647201946472,
"grad_norm": 0.014647013507783413,
"learning_rate": 0.0002,
"loss": 0.6088840961456299,
"mean_token_accuracy": 0.7501959800720215,
"num_tokens": 24100259.0,
"step": 650
},
{
"entropy": 0.6092503741383553,
"epoch": 4.2011354420113545,
"grad_norm": 0.012967122718691826,
"learning_rate": 0.0002,
"loss": 0.6154978275299072,
"mean_token_accuracy": 0.7469052001833916,
"num_tokens": 24137670.0,
"step": 651
},
{
"entropy": 0.6076086908578873,
"epoch": 4.207623682076237,
"grad_norm": 0.015226679854094982,
"learning_rate": 0.0002,
"loss": 0.6063575744628906,
"mean_token_accuracy": 0.7520931884646416,
"num_tokens": 24174990.0,
"step": 652
},
{
"entropy": 0.5980376899242401,
"epoch": 4.214111922141119,
"grad_norm": 0.01129455491900444,
"learning_rate": 0.0002,
"loss": 0.5961977243423462,
"mean_token_accuracy": 0.7564675956964493,
"num_tokens": 24212331.0,
"step": 653
},
{
"entropy": 0.6016443520784378,
"epoch": 4.220600162206002,
"grad_norm": 0.014820009469985962,
"learning_rate": 0.0002,
"loss": 0.6029236912727356,
"mean_token_accuracy": 0.7525514140725136,
"num_tokens": 24249375.0,
"step": 654
},
{
"entropy": 0.6087661758065224,
"epoch": 4.227088402270884,
"grad_norm": 0.0128677599132061,
"learning_rate": 0.0002,
"loss": 0.6112372279167175,
"mean_token_accuracy": 0.748601570725441,
"num_tokens": 24286871.0,
"step": 655
},
{
"entropy": 0.615173451602459,
"epoch": 4.233576642335766,
"grad_norm": 0.013609779067337513,
"learning_rate": 0.0002,
"loss": 0.6189801096916199,
"mean_token_accuracy": 0.7472759932279587,
"num_tokens": 24323996.0,
"step": 656
},
{
"entropy": 0.6089212968945503,
"epoch": 4.240064882400649,
"grad_norm": 0.013383638113737106,
"learning_rate": 0.0002,
"loss": 0.6078221797943115,
"mean_token_accuracy": 0.7503775134682655,
"num_tokens": 24361162.0,
"step": 657
},
{
"entropy": 0.6125769466161728,
"epoch": 4.2465531224655315,
"grad_norm": 0.01211923360824585,
"learning_rate": 0.0002,
"loss": 0.6157176494598389,
"mean_token_accuracy": 0.7472077012062073,
"num_tokens": 24398308.0,
"step": 658
},
{
"entropy": 0.6129145845770836,
"epoch": 4.253041362530413,
"grad_norm": 0.013655205257236958,
"learning_rate": 0.0002,
"loss": 0.6173056364059448,
"mean_token_accuracy": 0.7478220462799072,
"num_tokens": 24435361.0,
"step": 659
},
{
"entropy": 0.6286280378699303,
"epoch": 4.259529602595296,
"grad_norm": 0.012913207523524761,
"learning_rate": 0.0002,
"loss": 0.6232912540435791,
"mean_token_accuracy": 0.7459053471684456,
"num_tokens": 24472862.0,
"step": 660
},
{
"entropy": 0.6073895320296288,
"epoch": 4.266017842660179,
"grad_norm": 0.012715890072286129,
"learning_rate": 0.0002,
"loss": 0.6063985824584961,
"mean_token_accuracy": 0.7502154931426048,
"num_tokens": 24510378.0,
"step": 661
},
{
"entropy": 0.5987715944647789,
"epoch": 4.2725060827250605,
"grad_norm": 0.01144983246922493,
"learning_rate": 0.0002,
"loss": 0.603581964969635,
"mean_token_accuracy": 0.7529052719473839,
"num_tokens": 24547450.0,
"step": 662
},
{
"entropy": 0.6105594113469124,
"epoch": 4.278994322789943,
"grad_norm": 0.01477118767797947,
"learning_rate": 0.0002,
"loss": 0.6208908557891846,
"mean_token_accuracy": 0.7453452572226524,
"num_tokens": 24584414.0,
"step": 663
},
{
"entropy": 0.6013319417834282,
"epoch": 4.285482562854826,
"grad_norm": 0.011751738376915455,
"learning_rate": 0.0002,
"loss": 0.6031821966171265,
"mean_token_accuracy": 0.7529275268316269,
"num_tokens": 24621522.0,
"step": 664
},
{
"entropy": 0.6105660572648048,
"epoch": 4.291970802919708,
"grad_norm": 0.011309951543807983,
"learning_rate": 0.0002,
"loss": 0.6077959537506104,
"mean_token_accuracy": 0.7497444152832031,
"num_tokens": 24658985.0,
"step": 665
},
{
"entropy": 0.6143631562590599,
"epoch": 4.29845904298459,
"grad_norm": 0.01235566008836031,
"learning_rate": 0.0002,
"loss": 0.6165258884429932,
"mean_token_accuracy": 0.7466364279389381,
"num_tokens": 24696556.0,
"step": 666
},
{
"entropy": 0.6108560711145401,
"epoch": 4.304947283049473,
"grad_norm": 0.012649192474782467,
"learning_rate": 0.0002,
"loss": 0.6156973838806152,
"mean_token_accuracy": 0.7493721544742584,
"num_tokens": 24733563.0,
"step": 667
},
{
"entropy": 0.5972470939159393,
"epoch": 4.311435523114355,
"grad_norm": 0.012324381619691849,
"learning_rate": 0.0002,
"loss": 0.593143880367279,
"mean_token_accuracy": 0.7569256648421288,
"num_tokens": 24770521.0,
"step": 668
},
{
"entropy": 0.6238643601536751,
"epoch": 4.3179237631792375,
"grad_norm": 0.013767421245574951,
"learning_rate": 0.0002,
"loss": 0.6210561990737915,
"mean_token_accuracy": 0.7456039562821388,
"num_tokens": 24807746.0,
"step": 669
},
{
"entropy": 0.6074958592653275,
"epoch": 4.32441200324412,
"grad_norm": 0.012642712332308292,
"learning_rate": 0.0002,
"loss": 0.6104567646980286,
"mean_token_accuracy": 0.7498242110013962,
"num_tokens": 24844948.0,
"step": 670
},
{
"entropy": 0.6030944362282753,
"epoch": 4.330900243309002,
"grad_norm": 0.014455183409154415,
"learning_rate": 0.0002,
"loss": 0.6104896068572998,
"mean_token_accuracy": 0.751430056989193,
"num_tokens": 24882330.0,
"step": 671
},
{
"entropy": 0.6085335910320282,
"epoch": 4.337388483373885,
"grad_norm": 0.012203236110508442,
"learning_rate": 0.0002,
"loss": 0.6149730682373047,
"mean_token_accuracy": 0.748404935002327,
"num_tokens": 24919894.0,
"step": 672
},
{
"entropy": 0.6215960904955864,
"epoch": 4.343876723438767,
"grad_norm": 0.01517926249653101,
"learning_rate": 0.0002,
"loss": 0.6182515621185303,
"mean_token_accuracy": 0.7460620552301407,
"num_tokens": 24957338.0,
"step": 673
},
{
"entropy": 0.6206786409020424,
"epoch": 4.350364963503649,
"grad_norm": 0.012405015528202057,
"learning_rate": 0.0002,
"loss": 0.6114768385887146,
"mean_token_accuracy": 0.749580554664135,
"num_tokens": 24994430.0,
"step": 674
},
{
"entropy": 0.6176847890019417,
"epoch": 4.356853203568532,
"grad_norm": 0.012959569692611694,
"learning_rate": 0.0002,
"loss": 0.6179355382919312,
"mean_token_accuracy": 0.7443158105015755,
"num_tokens": 25031819.0,
"step": 675
},
{
"entropy": 0.6137174069881439,
"epoch": 4.363341443633415,
"grad_norm": 0.01568513549864292,
"learning_rate": 0.0002,
"loss": 0.6264492273330688,
"mean_token_accuracy": 0.7434774041175842,
"num_tokens": 25069321.0,
"step": 676
},
{
"entropy": 0.6073234900832176,
"epoch": 4.369829683698297,
"grad_norm": 0.01254733745008707,
"learning_rate": 0.0002,
"loss": 0.613095760345459,
"mean_token_accuracy": 0.7486145123839378,
"num_tokens": 25106724.0,
"step": 677
},
{
"entropy": 0.6180970370769501,
"epoch": 4.376317923763179,
"grad_norm": 0.01219653245061636,
"learning_rate": 0.0002,
"loss": 0.6162555813789368,
"mean_token_accuracy": 0.7453421652317047,
"num_tokens": 25144301.0,
"step": 678
},
{
"entropy": 0.6155680492520332,
"epoch": 4.382806163828062,
"grad_norm": 0.013878269121050835,
"learning_rate": 0.0002,
"loss": 0.6091170907020569,
"mean_token_accuracy": 0.750255212187767,
"num_tokens": 25181210.0,
"step": 679
},
{
"entropy": 0.6227680519223213,
"epoch": 4.3892944038929445,
"grad_norm": 0.01349555142223835,
"learning_rate": 0.0002,
"loss": 0.6250801086425781,
"mean_token_accuracy": 0.743384949862957,
"num_tokens": 25218262.0,
"step": 680
},
{
"entropy": 0.5870469063520432,
"epoch": 4.395782643957826,
"grad_norm": 0.012459780089557171,
"learning_rate": 0.0002,
"loss": 0.5922443270683289,
"mean_token_accuracy": 0.75776407122612,
"num_tokens": 25255586.0,
"step": 681
},
{
"entropy": 0.6126704216003418,
"epoch": 4.402270884022709,
"grad_norm": 0.012495280243456364,
"learning_rate": 0.0002,
"loss": 0.6199891567230225,
"mean_token_accuracy": 0.7477240189909935,
"num_tokens": 25293110.0,
"step": 682
},
{
"entropy": 0.6052056401968002,
"epoch": 4.408759124087592,
"grad_norm": 0.011480255052447319,
"learning_rate": 0.0002,
"loss": 0.6054994463920593,
"mean_token_accuracy": 0.7517327517271042,
"num_tokens": 25330240.0,
"step": 683
},
{
"entropy": 0.6134005859494209,
"epoch": 4.415247364152473,
"grad_norm": 0.013378560543060303,
"learning_rate": 0.0002,
"loss": 0.6032570600509644,
"mean_token_accuracy": 0.7544484660029411,
"num_tokens": 25367930.0,
"step": 684
},
{
"entropy": 0.6132281497120857,
"epoch": 4.421735604217356,
"grad_norm": 0.011817892082035542,
"learning_rate": 0.0002,
"loss": 0.6155675649642944,
"mean_token_accuracy": 0.7474397569894791,
"num_tokens": 25404927.0,
"step": 685
},
{
"entropy": 0.6157776713371277,
"epoch": 4.428223844282239,
"grad_norm": 0.013845066539943218,
"learning_rate": 0.0002,
"loss": 0.6208671927452087,
"mean_token_accuracy": 0.7460346668958664,
"num_tokens": 25441808.0,
"step": 686
},
{
"entropy": 0.6034616231918335,
"epoch": 4.434712084347121,
"grad_norm": 0.011209644377231598,
"learning_rate": 0.0002,
"loss": 0.6051755547523499,
"mean_token_accuracy": 0.751818560063839,
"num_tokens": 25478982.0,
"step": 687
},
{
"entropy": 0.6197097897529602,
"epoch": 4.441200324412003,
"grad_norm": 0.01221329253166914,
"learning_rate": 0.0002,
"loss": 0.624691367149353,
"mean_token_accuracy": 0.743960902094841,
"num_tokens": 25516230.0,
"step": 688
},
{
"entropy": 0.6036801412701607,
"epoch": 4.447688564476886,
"grad_norm": 0.011895528994500637,
"learning_rate": 0.0002,
"loss": 0.604611873626709,
"mean_token_accuracy": 0.7565013989806175,
"num_tokens": 25553987.0,
"step": 689
},
{
"entropy": 0.6126270368695259,
"epoch": 4.454176804541768,
"grad_norm": 0.014394382014870644,
"learning_rate": 0.0002,
"loss": 0.6157338619232178,
"mean_token_accuracy": 0.7499115914106369,
"num_tokens": 25591126.0,
"step": 690
},
{
"entropy": 0.6108303889632225,
"epoch": 4.4606650446066505,
"grad_norm": 0.014680239371955395,
"learning_rate": 0.0002,
"loss": 0.6087052822113037,
"mean_token_accuracy": 0.7516598179936409,
"num_tokens": 25628123.0,
"step": 691
},
{
"entropy": 0.6043496802449226,
"epoch": 4.467153284671533,
"grad_norm": 0.013057287782430649,
"learning_rate": 0.0002,
"loss": 0.6059702038764954,
"mean_token_accuracy": 0.7521848082542419,
"num_tokens": 25665273.0,
"step": 692
},
{
"entropy": 0.6091088205575943,
"epoch": 4.473641524736415,
"grad_norm": 0.012656234204769135,
"learning_rate": 0.0002,
"loss": 0.6140547394752502,
"mean_token_accuracy": 0.7490741834044456,
"num_tokens": 25702835.0,
"step": 693
},
{
"entropy": 0.6054038554430008,
"epoch": 4.480129764801298,
"grad_norm": 0.01144889835268259,
"learning_rate": 0.0002,
"loss": 0.6068828105926514,
"mean_token_accuracy": 0.7513371407985687,
"num_tokens": 25740321.0,
"step": 694
},
{
"entropy": 0.6075622960925102,
"epoch": 4.48661800486618,
"grad_norm": 0.014180710539221764,
"learning_rate": 0.0002,
"loss": 0.6113091707229614,
"mean_token_accuracy": 0.7500150203704834,
"num_tokens": 25777354.0,
"step": 695
},
{
"entropy": 0.6083768233656883,
"epoch": 4.493106244931062,
"grad_norm": 0.01257058884948492,
"learning_rate": 0.0002,
"loss": 0.613832950592041,
"mean_token_accuracy": 0.7493138536810875,
"num_tokens": 25814766.0,
"step": 696
},
{
"entropy": 0.6096158251166344,
"epoch": 4.499594484995945,
"grad_norm": 0.01403698232024908,
"learning_rate": 0.0002,
"loss": 0.606455385684967,
"mean_token_accuracy": 0.751399964094162,
"num_tokens": 25852032.0,
"step": 697
},
{
"entropy": 0.61270372569561,
"epoch": 4.5060827250608275,
"grad_norm": 0.013846375048160553,
"learning_rate": 0.0002,
"loss": 0.6081539988517761,
"mean_token_accuracy": 0.7516685873270035,
"num_tokens": 25889272.0,
"step": 698
},
{
"entropy": 0.6115692555904388,
"epoch": 4.512570965125709,
"grad_norm": 0.011561271734535694,
"learning_rate": 0.0002,
"loss": 0.6132485866546631,
"mean_token_accuracy": 0.7496950924396515,
"num_tokens": 25926376.0,
"step": 699
},
{
"entropy": 0.6165875196456909,
"epoch": 4.519059205190592,
"grad_norm": 0.014013632200658321,
"learning_rate": 0.0002,
"loss": 0.6210501194000244,
"mean_token_accuracy": 0.7466816902160645,
"num_tokens": 25964071.0,
"step": 700
},
{
"entropy": 0.6069151386618614,
"epoch": 4.525547445255475,
"grad_norm": 0.01162275206297636,
"learning_rate": 0.0002,
"loss": 0.6112617254257202,
"mean_token_accuracy": 0.7507427483797073,
"num_tokens": 26001770.0,
"step": 701
},
{
"entropy": 0.5982604473829269,
"epoch": 4.5320356853203565,
"grad_norm": 0.010527896694839,
"learning_rate": 0.0002,
"loss": 0.5975767374038696,
"mean_token_accuracy": 0.7562049925327301,
"num_tokens": 26038790.0,
"step": 702
},
{
"entropy": 0.6178539171814919,
"epoch": 4.538523925385239,
"grad_norm": 0.011301129125058651,
"learning_rate": 0.0002,
"loss": 0.6221362352371216,
"mean_token_accuracy": 0.743792898952961,
"num_tokens": 26076263.0,
"step": 703
},
{
"entropy": 0.6195997893810272,
"epoch": 4.545012165450122,
"grad_norm": 0.01180302631109953,
"learning_rate": 0.0002,
"loss": 0.618148922920227,
"mean_token_accuracy": 0.7460778802633286,
"num_tokens": 26113372.0,
"step": 704
},
{
"entropy": 0.6094764620065689,
"epoch": 4.551500405515004,
"grad_norm": 0.011488985270261765,
"learning_rate": 0.0002,
"loss": 0.6123408675193787,
"mean_token_accuracy": 0.7495540827512741,
"num_tokens": 26150197.0,
"step": 705
},
{
"entropy": 0.6152739748358727,
"epoch": 4.557988645579886,
"grad_norm": 0.011894487775862217,
"learning_rate": 0.0002,
"loss": 0.6184768676757812,
"mean_token_accuracy": 0.7447682395577431,
"num_tokens": 26187580.0,
"step": 706
},
{
"entropy": 0.6004127934575081,
"epoch": 4.564476885644769,
"grad_norm": 0.01042366586625576,
"learning_rate": 0.0002,
"loss": 0.6032600402832031,
"mean_token_accuracy": 0.7507253810763359,
"num_tokens": 26224583.0,
"step": 707
},
{
"entropy": 0.6170988976955414,
"epoch": 4.570965125709652,
"grad_norm": 0.012767941690981388,
"learning_rate": 0.0002,
"loss": 0.6203943490982056,
"mean_token_accuracy": 0.7446292862296104,
"num_tokens": 26261715.0,
"step": 708
},
{
"entropy": 0.6010770201683044,
"epoch": 4.5774533657745335,
"grad_norm": 0.010196649469435215,
"learning_rate": 0.0002,
"loss": 0.6022849082946777,
"mean_token_accuracy": 0.7530830800533295,
"num_tokens": 26298743.0,
"step": 709
},
{
"entropy": 0.6049724221229553,
"epoch": 4.583941605839416,
"grad_norm": 0.012646735645830631,
"learning_rate": 0.0002,
"loss": 0.6061745882034302,
"mean_token_accuracy": 0.7506730481982231,
"num_tokens": 26335489.0,
"step": 710
},
{
"entropy": 0.6168033257126808,
"epoch": 4.590429845904298,
"grad_norm": 0.013492587953805923,
"learning_rate": 0.0002,
"loss": 0.616999626159668,
"mean_token_accuracy": 0.7479605078697205,
"num_tokens": 26372489.0,
"step": 711
},
{
"entropy": 0.6182409450411797,
"epoch": 4.596918085969181,
"grad_norm": 0.010737297125160694,
"learning_rate": 0.0002,
"loss": 0.6131489276885986,
"mean_token_accuracy": 0.7496219426393509,
"num_tokens": 26409535.0,
"step": 712
},
{
"entropy": 0.6057656034827232,
"epoch": 4.603406326034063,
"grad_norm": 0.014007823541760445,
"learning_rate": 0.0002,
"loss": 0.6030014753341675,
"mean_token_accuracy": 0.7548240646719933,
"num_tokens": 26446279.0,
"step": 713
},
{
"entropy": 0.6160694062709808,
"epoch": 4.609894566098946,
"grad_norm": 0.012945987284183502,
"learning_rate": 0.0002,
"loss": 0.620917558670044,
"mean_token_accuracy": 0.7472490146756172,
"num_tokens": 26483525.0,
"step": 714
},
{
"entropy": 0.608958512544632,
"epoch": 4.616382806163828,
"grad_norm": 0.014964601024985313,
"learning_rate": 0.0002,
"loss": 0.6204575300216675,
"mean_token_accuracy": 0.7449859008193016,
"num_tokens": 26520720.0,
"step": 715
},
{
"entropy": 0.6118902638554573,
"epoch": 4.622871046228711,
"grad_norm": 0.011436744593083858,
"learning_rate": 0.0002,
"loss": 0.6165215969085693,
"mean_token_accuracy": 0.7477826401591301,
"num_tokens": 26557982.0,
"step": 716
},
{
"entropy": 0.6222316101193428,
"epoch": 4.629359286293592,
"grad_norm": 0.011866914108395576,
"learning_rate": 0.0002,
"loss": 0.6159400939941406,
"mean_token_accuracy": 0.7480059117078781,
"num_tokens": 26595389.0,
"step": 717
},
{
"entropy": 0.6267769560217857,
"epoch": 4.635847526358475,
"grad_norm": 0.012834588065743446,
"learning_rate": 0.0002,
"loss": 0.6215125322341919,
"mean_token_accuracy": 0.7467430606484413,
"num_tokens": 26632558.0,
"step": 718
},
{
"entropy": 0.6167991682887077,
"epoch": 4.642335766423358,
"grad_norm": 0.010781707242131233,
"learning_rate": 0.0002,
"loss": 0.6117191314697266,
"mean_token_accuracy": 0.7489187940955162,
"num_tokens": 26669534.0,
"step": 719
},
{
"entropy": 0.608165793120861,
"epoch": 4.6488240064882405,
"grad_norm": 0.013234053738415241,
"learning_rate": 0.0002,
"loss": 0.6105374097824097,
"mean_token_accuracy": 0.7508261948823929,
"num_tokens": 26707068.0,
"step": 720
},
{
"entropy": 0.6050869300961494,
"epoch": 4.655312246553122,
"grad_norm": 0.015265488997101784,
"learning_rate": 0.0002,
"loss": 0.6178677082061768,
"mean_token_accuracy": 0.7447132244706154,
"num_tokens": 26744214.0,
"step": 721
},
{
"entropy": 0.606209434568882,
"epoch": 4.661800486618005,
"grad_norm": 0.012334835715591908,
"learning_rate": 0.0002,
"loss": 0.6131197214126587,
"mean_token_accuracy": 0.7471205219626427,
"num_tokens": 26781504.0,
"step": 722
},
{
"entropy": 0.6154639571905136,
"epoch": 4.668288726682888,
"grad_norm": 0.011331942863762379,
"learning_rate": 0.0002,
"loss": 0.6135961413383484,
"mean_token_accuracy": 0.750006228685379,
"num_tokens": 26818648.0,
"step": 723
},
{
"entropy": 0.6127299889922142,
"epoch": 4.674776966747769,
"grad_norm": 0.013016032055020332,
"learning_rate": 0.0002,
"loss": 0.6065088510513306,
"mean_token_accuracy": 0.7515178844332695,
"num_tokens": 26856269.0,
"step": 724
},
{
"entropy": 0.6198037564754486,
"epoch": 4.681265206812652,
"grad_norm": 0.010600600391626358,
"learning_rate": 0.0002,
"loss": 0.6175575256347656,
"mean_token_accuracy": 0.748474046587944,
"num_tokens": 26893819.0,
"step": 725
},
{
"entropy": 0.6088383719325066,
"epoch": 4.687753446877535,
"grad_norm": 0.012035705149173737,
"learning_rate": 0.0002,
"loss": 0.6124040484428406,
"mean_token_accuracy": 0.7508236169815063,
"num_tokens": 26931388.0,
"step": 726
},
{
"entropy": 0.6097267419099808,
"epoch": 4.694241686942417,
"grad_norm": 0.013257896527647972,
"learning_rate": 0.0002,
"loss": 0.6185274720191956,
"mean_token_accuracy": 0.7469557821750641,
"num_tokens": 26968862.0,
"step": 727
},
{
"entropy": 0.6031776890158653,
"epoch": 4.700729927007299,
"grad_norm": 0.012637577950954437,
"learning_rate": 0.0002,
"loss": 0.6094907522201538,
"mean_token_accuracy": 0.7504973784089088,
"num_tokens": 27006297.0,
"step": 728
},
{
"entropy": 0.6267594248056412,
"epoch": 4.707218167072182,
"grad_norm": 0.012524669989943504,
"learning_rate": 0.0002,
"loss": 0.6284726858139038,
"mean_token_accuracy": 0.74198117852211,
"num_tokens": 27043660.0,
"step": 729
},
{
"entropy": 0.6199127435684204,
"epoch": 4.713706407137064,
"grad_norm": 0.011993559077382088,
"learning_rate": 0.0002,
"loss": 0.6179155707359314,
"mean_token_accuracy": 0.7490969151258469,
"num_tokens": 27080997.0,
"step": 730
},
{
"entropy": 0.619316965341568,
"epoch": 4.7201946472019465,
"grad_norm": 0.011862427927553654,
"learning_rate": 0.0002,
"loss": 0.6162521839141846,
"mean_token_accuracy": 0.7466591447591782,
"num_tokens": 27118582.0,
"step": 731
},
{
"entropy": 0.617161475121975,
"epoch": 4.726682887266829,
"grad_norm": 0.010898209176957607,
"learning_rate": 0.0002,
"loss": 0.6218090057373047,
"mean_token_accuracy": 0.7456279322504997,
"num_tokens": 27155770.0,
"step": 732
},
{
"entropy": 0.6097361296415329,
"epoch": 4.733171127331711,
"grad_norm": 0.012140274979174137,
"learning_rate": 0.0002,
"loss": 0.6126585602760315,
"mean_token_accuracy": 0.7512409463524818,
"num_tokens": 27193021.0,
"step": 733
},
{
"entropy": 0.5991591587662697,
"epoch": 4.739659367396594,
"grad_norm": 0.011335095390677452,
"learning_rate": 0.0002,
"loss": 0.6005336046218872,
"mean_token_accuracy": 0.7536215856671333,
"num_tokens": 27230104.0,
"step": 734
},
{
"entropy": 0.6187688335776329,
"epoch": 4.746147607461476,
"grad_norm": 0.011418522335588932,
"learning_rate": 0.0002,
"loss": 0.619892418384552,
"mean_token_accuracy": 0.7460336685180664,
"num_tokens": 27267697.0,
"step": 735
},
{
"entropy": 0.6177256479859352,
"epoch": 4.752635847526358,
"grad_norm": 0.01126981433480978,
"learning_rate": 0.0002,
"loss": 0.6184297204017639,
"mean_token_accuracy": 0.7480708360671997,
"num_tokens": 27304935.0,
"step": 736
},
{
"entropy": 0.6365424171090126,
"epoch": 4.759124087591241,
"grad_norm": 0.012852554209530354,
"learning_rate": 0.0002,
"loss": 0.6335437297821045,
"mean_token_accuracy": 0.7411114126443863,
"num_tokens": 27342734.0,
"step": 737
},
{
"entropy": 0.6231958642601967,
"epoch": 4.7656123276561235,
"grad_norm": 0.01126949768513441,
"learning_rate": 0.0002,
"loss": 0.6242541670799255,
"mean_token_accuracy": 0.7444687336683273,
"num_tokens": 27380129.0,
"step": 738
},
{
"entropy": 0.6135790795087814,
"epoch": 4.772100567721005,
"grad_norm": 0.011775590479373932,
"learning_rate": 0.0002,
"loss": 0.6142154335975647,
"mean_token_accuracy": 0.7484701201319695,
"num_tokens": 27417574.0,
"step": 739
},
{
"entropy": 0.5981535315513611,
"epoch": 4.778588807785888,
"grad_norm": 0.012303443625569344,
"learning_rate": 0.0002,
"loss": 0.6043405532836914,
"mean_token_accuracy": 0.7530733942985535,
"num_tokens": 27454673.0,
"step": 740
},
{
"entropy": 0.6199762895703316,
"epoch": 4.785077047850771,
"grad_norm": 0.011197846382856369,
"learning_rate": 0.0002,
"loss": 0.6214004158973694,
"mean_token_accuracy": 0.7454070076346397,
"num_tokens": 27492327.0,
"step": 741
},
{
"entropy": 0.6030875891447067,
"epoch": 4.7915652879156525,
"grad_norm": 0.012394090183079243,
"learning_rate": 0.0002,
"loss": 0.6037598848342896,
"mean_token_accuracy": 0.7523747533559799,
"num_tokens": 27529616.0,
"step": 742
},
{
"entropy": 0.613655112683773,
"epoch": 4.798053527980535,
"grad_norm": 0.010351658798754215,
"learning_rate": 0.0002,
"loss": 0.6146197319030762,
"mean_token_accuracy": 0.7493305876851082,
"num_tokens": 27567467.0,
"step": 743
},
{
"entropy": 0.609668679535389,
"epoch": 4.804541768045418,
"grad_norm": 0.010698414407670498,
"learning_rate": 0.0002,
"loss": 0.6130056381225586,
"mean_token_accuracy": 0.749318391084671,
"num_tokens": 27604340.0,
"step": 744
},
{
"entropy": 0.6055747121572495,
"epoch": 4.811030008110301,
"grad_norm": 0.011774055659770966,
"learning_rate": 0.0002,
"loss": 0.6064777374267578,
"mean_token_accuracy": 0.7513219490647316,
"num_tokens": 27641869.0,
"step": 745
},
{
"entropy": 0.6063344553112984,
"epoch": 4.817518248175182,
"grad_norm": 0.010040192864835262,
"learning_rate": 0.0002,
"loss": 0.6085660457611084,
"mean_token_accuracy": 0.7483800128102303,
"num_tokens": 27678992.0,
"step": 746
},
{
"entropy": 0.6175437271595001,
"epoch": 4.824006488240065,
"grad_norm": 0.011712496168911457,
"learning_rate": 0.0002,
"loss": 0.6189186573028564,
"mean_token_accuracy": 0.7486408054828644,
"num_tokens": 27716703.0,
"step": 747
},
{
"entropy": 0.6142439544200897,
"epoch": 4.830494728304947,
"grad_norm": 0.012662764638662338,
"learning_rate": 0.0002,
"loss": 0.614926815032959,
"mean_token_accuracy": 0.747495986521244,
"num_tokens": 27754004.0,
"step": 748
},
{
"entropy": 0.6087512150406837,
"epoch": 4.8369829683698295,
"grad_norm": 0.010618063621222973,
"learning_rate": 0.0002,
"loss": 0.6098265647888184,
"mean_token_accuracy": 0.7527805492281914,
"num_tokens": 27791212.0,
"step": 749
},
{
"entropy": 0.6073944419622421,
"epoch": 4.843471208434712,
"grad_norm": 0.011879456229507923,
"learning_rate": 0.0002,
"loss": 0.6084223389625549,
"mean_token_accuracy": 0.7535420805215836,
"num_tokens": 27828439.0,
"step": 750
},
{
"entropy": 0.6072632223367691,
"epoch": 4.849959448499595,
"grad_norm": 0.01333905290812254,
"learning_rate": 0.0002,
"loss": 0.6154837608337402,
"mean_token_accuracy": 0.7462009564042091,
"num_tokens": 27865908.0,
"step": 751
},
{
"entropy": 0.6182335615158081,
"epoch": 4.856447688564477,
"grad_norm": 0.012253145687282085,
"learning_rate": 0.0002,
"loss": 0.6162886619567871,
"mean_token_accuracy": 0.7482575252652168,
"num_tokens": 27903553.0,
"step": 752
},
{
"entropy": 0.623457059264183,
"epoch": 4.862935928629359,
"grad_norm": 0.012347408570349216,
"learning_rate": 0.0002,
"loss": 0.6175649166107178,
"mean_token_accuracy": 0.7451874390244484,
"num_tokens": 27940745.0,
"step": 753
},
{
"entropy": 0.6147228851914406,
"epoch": 4.869424168694241,
"grad_norm": 0.013636295683681965,
"learning_rate": 0.0002,
"loss": 0.6182140111923218,
"mean_token_accuracy": 0.7459222003817558,
"num_tokens": 27977798.0,
"step": 754
},
{
"entropy": 0.6009573265910149,
"epoch": 4.875912408759124,
"grad_norm": 0.011285821907222271,
"learning_rate": 0.0002,
"loss": 0.6073520183563232,
"mean_token_accuracy": 0.7508896961808205,
"num_tokens": 28014880.0,
"step": 755
},
{
"entropy": 0.5950382575392723,
"epoch": 4.882400648824007,
"grad_norm": 0.011523284018039703,
"learning_rate": 0.0002,
"loss": 0.6006320714950562,
"mean_token_accuracy": 0.7559562996029854,
"num_tokens": 28052148.0,
"step": 756
},
{
"entropy": 0.6160282120108604,
"epoch": 4.888888888888889,
"grad_norm": 0.011825107038021088,
"learning_rate": 0.0002,
"loss": 0.6167672872543335,
"mean_token_accuracy": 0.7469073683023453,
"num_tokens": 28089658.0,
"step": 757
},
{
"entropy": 0.6171636879444122,
"epoch": 4.895377128953771,
"grad_norm": 0.011352675966918468,
"learning_rate": 0.0002,
"loss": 0.6145755052566528,
"mean_token_accuracy": 0.746620424091816,
"num_tokens": 28127170.0,
"step": 758
},
{
"entropy": 0.608257532119751,
"epoch": 4.901865369018654,
"grad_norm": 0.012769036926329136,
"learning_rate": 0.0002,
"loss": 0.609970211982727,
"mean_token_accuracy": 0.7516561150550842,
"num_tokens": 28164347.0,
"step": 759
},
{
"entropy": 0.6164683550596237,
"epoch": 4.9083536090835365,
"grad_norm": 0.012305669486522675,
"learning_rate": 0.0002,
"loss": 0.6191939115524292,
"mean_token_accuracy": 0.7453163638710976,
"num_tokens": 28201799.0,
"step": 760
},
{
"entropy": 0.614104337990284,
"epoch": 4.914841849148418,
"grad_norm": 0.010976862162351608,
"learning_rate": 0.0002,
"loss": 0.6142949461936951,
"mean_token_accuracy": 0.7480729147791862,
"num_tokens": 28239441.0,
"step": 761
},
{
"entropy": 0.5957873240113258,
"epoch": 4.921330089213301,
"grad_norm": 0.011151162907481194,
"learning_rate": 0.0002,
"loss": 0.5960466265678406,
"mean_token_accuracy": 0.7578283548355103,
"num_tokens": 28276966.0,
"step": 762
},
{
"entropy": 0.6149696856737137,
"epoch": 4.927818329278184,
"grad_norm": 0.01262627262622118,
"learning_rate": 0.0002,
"loss": 0.6141815185546875,
"mean_token_accuracy": 0.7478419542312622,
"num_tokens": 28314493.0,
"step": 763
},
{
"entropy": 0.6079921796917915,
"epoch": 4.934306569343065,
"grad_norm": 0.012012857012450695,
"learning_rate": 0.0002,
"loss": 0.6085329055786133,
"mean_token_accuracy": 0.7516164556145668,
"num_tokens": 28352110.0,
"step": 764
},
{
"entropy": 0.606193870306015,
"epoch": 4.940794809407948,
"grad_norm": 0.012743561528623104,
"learning_rate": 0.0002,
"loss": 0.6102321147918701,
"mean_token_accuracy": 0.7491661831736565,
"num_tokens": 28389448.0,
"step": 765
},
{
"entropy": 0.6021564230322838,
"epoch": 4.947283049472831,
"grad_norm": 0.011576979421079159,
"learning_rate": 0.0002,
"loss": 0.6045505404472351,
"mean_token_accuracy": 0.7516537830233574,
"num_tokens": 28427005.0,
"step": 766
},
{
"entropy": 0.6197597831487656,
"epoch": 4.953771289537713,
"grad_norm": 0.013263656757771969,
"learning_rate": 0.0002,
"loss": 0.6234422922134399,
"mean_token_accuracy": 0.7442535609006882,
"num_tokens": 28464143.0,
"step": 767
},
{
"entropy": 0.5995957404375076,
"epoch": 4.960259529602595,
"grad_norm": 0.013597379438579082,
"learning_rate": 0.0002,
"loss": 0.608078122138977,
"mean_token_accuracy": 0.7510829046368599,
"num_tokens": 28501245.0,
"step": 768
},
{
"entropy": 0.5990025177598,
"epoch": 4.966747769667478,
"grad_norm": 0.011187846772372723,
"learning_rate": 0.0002,
"loss": 0.6021981835365295,
"mean_token_accuracy": 0.751527689397335,
"num_tokens": 28538395.0,
"step": 769
},
{
"entropy": 0.6094980016350746,
"epoch": 4.97323600973236,
"grad_norm": 0.011942482553422451,
"learning_rate": 0.0002,
"loss": 0.6086335182189941,
"mean_token_accuracy": 0.7511740922927856,
"num_tokens": 28575389.0,
"step": 770
},
{
"entropy": 0.607696995139122,
"epoch": 4.9797242497972425,
"grad_norm": 0.010719696059823036,
"learning_rate": 0.0002,
"loss": 0.6058928370475769,
"mean_token_accuracy": 0.7512983754277229,
"num_tokens": 28612614.0,
"step": 771
},
{
"entropy": 0.6127375960350037,
"epoch": 4.986212489862125,
"grad_norm": 0.011552160605788231,
"learning_rate": 0.0002,
"loss": 0.610999345779419,
"mean_token_accuracy": 0.7520032823085785,
"num_tokens": 28649626.0,
"step": 772
},
{
"entropy": 0.6094198897480965,
"epoch": 4.992700729927007,
"grad_norm": 0.010641835629940033,
"learning_rate": 0.0002,
"loss": 0.609566330909729,
"mean_token_accuracy": 0.7494478672742844,
"num_tokens": 28687121.0,
"step": 773
},
{
"entropy": 0.6135342344641685,
"epoch": 4.99918896999189,
"grad_norm": 0.010831725783646107,
"learning_rate": 0.0002,
"loss": 0.6144300103187561,
"mean_token_accuracy": 0.7496655061841011,
"num_tokens": 28724466.0,
"step": 774
},
{
"entropy": 0.6133913993835449,
"epoch": 5.0,
"grad_norm": 0.025664443150162697,
"learning_rate": 0.0002,
"loss": 0.6142559051513672,
"mean_token_accuracy": 0.7518454194068909,
"num_tokens": 28729104.0,
"step": 775
}
],
"logging_steps": 1,
"max_steps": 775,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.6824700471332045e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}