eac123's picture
Upload final checkpoint (checkpoint-645)
5ddc5b7 verified
Raw
History Blame
187 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 645,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.1461779922246933,
"epoch": 0.007774538386783284,
"grad_norm": 0.2348785102367401,
"learning_rate": 0.0002,
"loss": 2.5822062492370605,
"mean_token_accuracy": 0.5106955841183662,
"num_tokens": 37728.0,
"step": 1
},
{
"entropy": 1.2709465026855469,
"epoch": 0.015549076773566569,
"grad_norm": 0.19847582280635834,
"learning_rate": 0.0002,
"loss": 2.256243944168091,
"mean_token_accuracy": 0.5385559350252151,
"num_tokens": 74823.0,
"step": 2
},
{
"entropy": 1.457642063498497,
"epoch": 0.023323615160349854,
"grad_norm": 0.14325936138629913,
"learning_rate": 0.0002,
"loss": 1.8135013580322266,
"mean_token_accuracy": 0.5658686235547066,
"num_tokens": 112223.0,
"step": 3
},
{
"entropy": 1.4453874379396439,
"epoch": 0.031098153547133137,
"grad_norm": 0.11537832021713257,
"learning_rate": 0.0002,
"loss": 1.4907238483428955,
"mean_token_accuracy": 0.6095475852489471,
"num_tokens": 149646.0,
"step": 4
},
{
"entropy": 1.4222392737865448,
"epoch": 0.038872691933916424,
"grad_norm": 0.14347851276397705,
"learning_rate": 0.0002,
"loss": 1.3716599941253662,
"mean_token_accuracy": 0.614239789545536,
"num_tokens": 186807.0,
"step": 5
},
{
"entropy": 1.3676332831382751,
"epoch": 0.04664723032069971,
"grad_norm": 0.07458607107400894,
"learning_rate": 0.0002,
"loss": 1.2618626356124878,
"mean_token_accuracy": 0.6355780363082886,
"num_tokens": 224243.0,
"step": 6
},
{
"entropy": 1.2903779596090317,
"epoch": 0.05442176870748299,
"grad_norm": 0.050369806587696075,
"learning_rate": 0.0002,
"loss": 1.1705503463745117,
"mean_token_accuracy": 0.6446279659867287,
"num_tokens": 261678.0,
"step": 7
},
{
"entropy": 1.231130599975586,
"epoch": 0.062196307094266275,
"grad_norm": 0.05470636859536171,
"learning_rate": 0.0002,
"loss": 1.0978062152862549,
"mean_token_accuracy": 0.6580947414040565,
"num_tokens": 298703.0,
"step": 8
},
{
"entropy": 1.1396304965019226,
"epoch": 0.06997084548104957,
"grad_norm": 0.05549474433064461,
"learning_rate": 0.0002,
"loss": 1.026996374130249,
"mean_token_accuracy": 0.6708663776516914,
"num_tokens": 336240.0,
"step": 9
},
{
"entropy": 1.0528622567653656,
"epoch": 0.07774538386783285,
"grad_norm": 0.05926097184419632,
"learning_rate": 0.0002,
"loss": 0.9768505096435547,
"mean_token_accuracy": 0.6747338622808456,
"num_tokens": 373808.0,
"step": 10
},
{
"entropy": 0.978929877281189,
"epoch": 0.08551992225461613,
"grad_norm": 0.08427942544221878,
"learning_rate": 0.0002,
"loss": 0.9218605756759644,
"mean_token_accuracy": 0.6868897452950478,
"num_tokens": 410822.0,
"step": 11
},
{
"entropy": 0.9272410869598389,
"epoch": 0.09329446064139942,
"grad_norm": 0.0502631776034832,
"learning_rate": 0.0002,
"loss": 0.8876349925994873,
"mean_token_accuracy": 0.688661016523838,
"num_tokens": 447975.0,
"step": 12
},
{
"entropy": 0.860072985291481,
"epoch": 0.1010689990281827,
"grad_norm": 0.04337044060230255,
"learning_rate": 0.0002,
"loss": 0.8350162506103516,
"mean_token_accuracy": 0.7001973986625671,
"num_tokens": 485476.0,
"step": 13
},
{
"entropy": 0.7882575914263725,
"epoch": 0.10884353741496598,
"grad_norm": 0.06162057816982269,
"learning_rate": 0.0002,
"loss": 0.8057988882064819,
"mean_token_accuracy": 0.7050592303276062,
"num_tokens": 522792.0,
"step": 14
},
{
"entropy": 0.7824503108859062,
"epoch": 0.11661807580174927,
"grad_norm": 0.03932056203484535,
"learning_rate": 0.0002,
"loss": 0.7716900110244751,
"mean_token_accuracy": 0.7123773470520973,
"num_tokens": 559845.0,
"step": 15
},
{
"entropy": 0.7571921274065971,
"epoch": 0.12439261418853255,
"grad_norm": 0.03887049853801727,
"learning_rate": 0.0002,
"loss": 0.7427914142608643,
"mean_token_accuracy": 0.721781499683857,
"num_tokens": 596752.0,
"step": 16
},
{
"entropy": 0.7445609271526337,
"epoch": 0.13216715257531583,
"grad_norm": 0.037259574979543686,
"learning_rate": 0.0002,
"loss": 0.7245944738388062,
"mean_token_accuracy": 0.7208689078688622,
"num_tokens": 634143.0,
"step": 17
},
{
"entropy": 0.7450662180781364,
"epoch": 0.13994169096209913,
"grad_norm": 0.03612779080867767,
"learning_rate": 0.0002,
"loss": 0.7255409955978394,
"mean_token_accuracy": 0.7214401289820671,
"num_tokens": 671585.0,
"step": 18
},
{
"entropy": 0.7271910980343819,
"epoch": 0.1477162293488824,
"grad_norm": 0.03141465783119202,
"learning_rate": 0.0002,
"loss": 0.7076310515403748,
"mean_token_accuracy": 0.7255471646785736,
"num_tokens": 708756.0,
"step": 19
},
{
"entropy": 0.7060252502560616,
"epoch": 0.1554907677356657,
"grad_norm": 0.035933561623096466,
"learning_rate": 0.0002,
"loss": 0.6859346628189087,
"mean_token_accuracy": 0.732830710709095,
"num_tokens": 746139.0,
"step": 20
},
{
"entropy": 0.6829683035612106,
"epoch": 0.16326530612244897,
"grad_norm": 0.03822736069560051,
"learning_rate": 0.0002,
"loss": 0.6772962212562561,
"mean_token_accuracy": 0.7338771298527718,
"num_tokens": 783417.0,
"step": 21
},
{
"entropy": 0.6782366037368774,
"epoch": 0.17103984450923226,
"grad_norm": 0.031850460916757584,
"learning_rate": 0.0002,
"loss": 0.6737133264541626,
"mean_token_accuracy": 0.7363682463765144,
"num_tokens": 820745.0,
"step": 22
},
{
"entropy": 0.6792467907071114,
"epoch": 0.17881438289601556,
"grad_norm": 0.031343962997198105,
"learning_rate": 0.0002,
"loss": 0.6833145618438721,
"mean_token_accuracy": 0.7314189001917839,
"num_tokens": 858477.0,
"step": 23
},
{
"entropy": 0.6493787094950676,
"epoch": 0.18658892128279883,
"grad_norm": 0.028227699920535088,
"learning_rate": 0.0002,
"loss": 0.6512086987495422,
"mean_token_accuracy": 0.7448033019900322,
"num_tokens": 895754.0,
"step": 24
},
{
"entropy": 0.6527747735381126,
"epoch": 0.19436345966958213,
"grad_norm": 0.02940857782959938,
"learning_rate": 0.0002,
"loss": 0.6458977460861206,
"mean_token_accuracy": 0.7454173043370247,
"num_tokens": 933200.0,
"step": 25
},
{
"entropy": 0.6647381633520126,
"epoch": 0.2021379980563654,
"grad_norm": 0.03015323169529438,
"learning_rate": 0.0002,
"loss": 0.6591448783874512,
"mean_token_accuracy": 0.7374408692121506,
"num_tokens": 970838.0,
"step": 26
},
{
"entropy": 0.6438521891832352,
"epoch": 0.2099125364431487,
"grad_norm": 0.035360876470804214,
"learning_rate": 0.0002,
"loss": 0.6528849601745605,
"mean_token_accuracy": 0.7403199598193169,
"num_tokens": 1008094.0,
"step": 27
},
{
"entropy": 0.6399626433849335,
"epoch": 0.21768707482993196,
"grad_norm": 0.02637004852294922,
"learning_rate": 0.0002,
"loss": 0.6530839204788208,
"mean_token_accuracy": 0.7398090362548828,
"num_tokens": 1045463.0,
"step": 28
},
{
"entropy": 0.6436624526977539,
"epoch": 0.22546161321671526,
"grad_norm": 0.02592352218925953,
"learning_rate": 0.0002,
"loss": 0.6487458944320679,
"mean_token_accuracy": 0.7412822172045708,
"num_tokens": 1083139.0,
"step": 29
},
{
"entropy": 0.653114914894104,
"epoch": 0.23323615160349853,
"grad_norm": 0.018322035670280457,
"learning_rate": 0.0002,
"loss": 0.6511994004249573,
"mean_token_accuracy": 0.7411110699176788,
"num_tokens": 1120783.0,
"step": 30
},
{
"entropy": 0.642485961318016,
"epoch": 0.24101068999028183,
"grad_norm": 0.021689819172024727,
"learning_rate": 0.0002,
"loss": 0.644116222858429,
"mean_token_accuracy": 0.7440010756254196,
"num_tokens": 1158207.0,
"step": 31
},
{
"entropy": 0.6343450918793678,
"epoch": 0.2487852283770651,
"grad_norm": 0.02071012370288372,
"learning_rate": 0.0002,
"loss": 0.6319076418876648,
"mean_token_accuracy": 0.7487388849258423,
"num_tokens": 1195845.0,
"step": 32
},
{
"entropy": 0.6410091295838356,
"epoch": 0.2565597667638484,
"grad_norm": 0.025183040648698807,
"learning_rate": 0.0002,
"loss": 0.6358401775360107,
"mean_token_accuracy": 0.7465788945555687,
"num_tokens": 1233366.0,
"step": 33
},
{
"entropy": 0.6519959643483162,
"epoch": 0.26433430515063167,
"grad_norm": 0.017367947846651077,
"learning_rate": 0.0002,
"loss": 0.6433607339859009,
"mean_token_accuracy": 0.7429918646812439,
"num_tokens": 1270710.0,
"step": 34
},
{
"entropy": 0.6490929946303368,
"epoch": 0.272108843537415,
"grad_norm": 0.023137487471103668,
"learning_rate": 0.0002,
"loss": 0.6468774676322937,
"mean_token_accuracy": 0.7406889051198959,
"num_tokens": 1308095.0,
"step": 35
},
{
"entropy": 0.6438097059726715,
"epoch": 0.27988338192419826,
"grad_norm": 0.016993502154946327,
"learning_rate": 0.0002,
"loss": 0.6424656510353088,
"mean_token_accuracy": 0.7413171753287315,
"num_tokens": 1345646.0,
"step": 36
},
{
"entropy": 0.6314259544014931,
"epoch": 0.28765792031098153,
"grad_norm": 0.016146596521139145,
"learning_rate": 0.0002,
"loss": 0.6370364427566528,
"mean_token_accuracy": 0.7465247958898544,
"num_tokens": 1382928.0,
"step": 37
},
{
"entropy": 0.6270746886730194,
"epoch": 0.2954324586977648,
"grad_norm": 0.019162772223353386,
"learning_rate": 0.0002,
"loss": 0.6330348253250122,
"mean_token_accuracy": 0.747043713927269,
"num_tokens": 1420089.0,
"step": 38
},
{
"entropy": 0.6293222159147263,
"epoch": 0.3032069970845481,
"grad_norm": 0.01702946238219738,
"learning_rate": 0.0002,
"loss": 0.6317635178565979,
"mean_token_accuracy": 0.7488930821418762,
"num_tokens": 1457216.0,
"step": 39
},
{
"entropy": 0.6111311987042427,
"epoch": 0.3109815354713314,
"grad_norm": 0.015137894079089165,
"learning_rate": 0.0002,
"loss": 0.6177330017089844,
"mean_token_accuracy": 0.753462478518486,
"num_tokens": 1494415.0,
"step": 40
},
{
"entropy": 0.6119553595781326,
"epoch": 0.31875607385811466,
"grad_norm": 0.014271042309701443,
"learning_rate": 0.0002,
"loss": 0.6184912919998169,
"mean_token_accuracy": 0.7530097812414169,
"num_tokens": 1531665.0,
"step": 41
},
{
"entropy": 0.627587340772152,
"epoch": 0.32653061224489793,
"grad_norm": 0.01676957495510578,
"learning_rate": 0.0002,
"loss": 0.628797173500061,
"mean_token_accuracy": 0.7489041686058044,
"num_tokens": 1568905.0,
"step": 42
},
{
"entropy": 0.6380143910646439,
"epoch": 0.33430515063168126,
"grad_norm": 0.013997296802699566,
"learning_rate": 0.0002,
"loss": 0.6401110291481018,
"mean_token_accuracy": 0.7437692731618881,
"num_tokens": 1606022.0,
"step": 43
},
{
"entropy": 0.6236186027526855,
"epoch": 0.34207968901846453,
"grad_norm": 0.013737027533352375,
"learning_rate": 0.0002,
"loss": 0.622249960899353,
"mean_token_accuracy": 0.7506565973162651,
"num_tokens": 1643817.0,
"step": 44
},
{
"entropy": 0.6351634711027145,
"epoch": 0.3498542274052478,
"grad_norm": 0.013750840909779072,
"learning_rate": 0.0002,
"loss": 0.6342694163322449,
"mean_token_accuracy": 0.7469271644949913,
"num_tokens": 1681417.0,
"step": 45
},
{
"entropy": 0.6226040348410606,
"epoch": 0.3576287657920311,
"grad_norm": 0.015259931795299053,
"learning_rate": 0.0002,
"loss": 0.6237019896507263,
"mean_token_accuracy": 0.7505070269107819,
"num_tokens": 1718574.0,
"step": 46
},
{
"entropy": 0.6210184469819069,
"epoch": 0.3654033041788144,
"grad_norm": 0.013225192204117775,
"learning_rate": 0.0002,
"loss": 0.6187986135482788,
"mean_token_accuracy": 0.7520730867981911,
"num_tokens": 1756095.0,
"step": 47
},
{
"entropy": 0.6205598041415215,
"epoch": 0.37317784256559766,
"grad_norm": 0.012887167744338512,
"learning_rate": 0.0002,
"loss": 0.6181526780128479,
"mean_token_accuracy": 0.7511478438973427,
"num_tokens": 1793392.0,
"step": 48
},
{
"entropy": 0.629549115896225,
"epoch": 0.38095238095238093,
"grad_norm": 0.013227855786681175,
"learning_rate": 0.0002,
"loss": 0.6304742097854614,
"mean_token_accuracy": 0.7472723796963692,
"num_tokens": 1830606.0,
"step": 49
},
{
"entropy": 0.6296898201107979,
"epoch": 0.38872691933916426,
"grad_norm": 0.015021155588328838,
"learning_rate": 0.0002,
"loss": 0.6288135647773743,
"mean_token_accuracy": 0.7465364933013916,
"num_tokens": 1868232.0,
"step": 50
},
{
"entropy": 0.6357625275850296,
"epoch": 0.3965014577259475,
"grad_norm": 0.011794226244091988,
"learning_rate": 0.0002,
"loss": 0.6371973156929016,
"mean_token_accuracy": 0.7450965940952301,
"num_tokens": 1905598.0,
"step": 51
},
{
"entropy": 0.6295278668403625,
"epoch": 0.4042759961127308,
"grad_norm": 0.012368254363536835,
"learning_rate": 0.0002,
"loss": 0.6367925405502319,
"mean_token_accuracy": 0.7448450028896332,
"num_tokens": 1942785.0,
"step": 52
},
{
"entropy": 0.6321664452552795,
"epoch": 0.41205053449951407,
"grad_norm": 0.011660202406346798,
"learning_rate": 0.0002,
"loss": 0.6337926983833313,
"mean_token_accuracy": 0.7433984354138374,
"num_tokens": 1980646.0,
"step": 53
},
{
"entropy": 0.6304126009345055,
"epoch": 0.4198250728862974,
"grad_norm": 0.012000083923339844,
"learning_rate": 0.0002,
"loss": 0.6315821409225464,
"mean_token_accuracy": 0.7455745488405228,
"num_tokens": 2018148.0,
"step": 54
},
{
"entropy": 0.6312398687005043,
"epoch": 0.42759961127308066,
"grad_norm": 0.012478172779083252,
"learning_rate": 0.0002,
"loss": 0.6293996572494507,
"mean_token_accuracy": 0.7464256510138512,
"num_tokens": 2055123.0,
"step": 55
},
{
"entropy": 0.6144075095653534,
"epoch": 0.43537414965986393,
"grad_norm": 0.010203132405877113,
"learning_rate": 0.0002,
"loss": 0.6101412773132324,
"mean_token_accuracy": 0.7551510035991669,
"num_tokens": 2092759.0,
"step": 56
},
{
"entropy": 0.6334135234355927,
"epoch": 0.44314868804664725,
"grad_norm": 0.012491037137806416,
"learning_rate": 0.0002,
"loss": 0.6366456747055054,
"mean_token_accuracy": 0.7441563606262207,
"num_tokens": 2130468.0,
"step": 57
},
{
"entropy": 0.6204067915678024,
"epoch": 0.4509232264334305,
"grad_norm": 0.012662500143051147,
"learning_rate": 0.0002,
"loss": 0.6225067377090454,
"mean_token_accuracy": 0.7498065009713173,
"num_tokens": 2167896.0,
"step": 58
},
{
"entropy": 0.626205176115036,
"epoch": 0.4586977648202138,
"grad_norm": 0.011919913813471794,
"learning_rate": 0.0002,
"loss": 0.6297718286514282,
"mean_token_accuracy": 0.7457590103149414,
"num_tokens": 2204991.0,
"step": 59
},
{
"entropy": 0.6314920708537102,
"epoch": 0.46647230320699706,
"grad_norm": 0.011844294145703316,
"learning_rate": 0.0002,
"loss": 0.6283063888549805,
"mean_token_accuracy": 0.7473507225513458,
"num_tokens": 2242421.0,
"step": 60
},
{
"entropy": 0.629265584051609,
"epoch": 0.4742468415937804,
"grad_norm": 0.012998970225453377,
"learning_rate": 0.0002,
"loss": 0.6303939819335938,
"mean_token_accuracy": 0.7454146966338158,
"num_tokens": 2279756.0,
"step": 61
},
{
"entropy": 0.6266416981816292,
"epoch": 0.48202137998056366,
"grad_norm": 0.010719172656536102,
"learning_rate": 0.0002,
"loss": 0.6256165504455566,
"mean_token_accuracy": 0.7477178424596786,
"num_tokens": 2317119.0,
"step": 62
},
{
"entropy": 0.6031938791275024,
"epoch": 0.4897959183673469,
"grad_norm": 0.011259288527071476,
"learning_rate": 0.0002,
"loss": 0.5979391932487488,
"mean_token_accuracy": 0.7593775168061256,
"num_tokens": 2354598.0,
"step": 63
},
{
"entropy": 0.6359111741185188,
"epoch": 0.4975704567541302,
"grad_norm": 0.01182929240167141,
"learning_rate": 0.0002,
"loss": 0.6360020041465759,
"mean_token_accuracy": 0.7429406046867371,
"num_tokens": 2391824.0,
"step": 64
},
{
"entropy": 0.6270973086357117,
"epoch": 0.5053449951409135,
"grad_norm": 0.01080579124391079,
"learning_rate": 0.0002,
"loss": 0.6288405060768127,
"mean_token_accuracy": 0.7458023801445961,
"num_tokens": 2428949.0,
"step": 65
},
{
"entropy": 0.6371860653162003,
"epoch": 0.5131195335276968,
"grad_norm": 0.012401307933032513,
"learning_rate": 0.0002,
"loss": 0.6441806554794312,
"mean_token_accuracy": 0.7399793341755867,
"num_tokens": 2466079.0,
"step": 66
},
{
"entropy": 0.6057624816894531,
"epoch": 0.5208940719144801,
"grad_norm": 0.012216067872941494,
"learning_rate": 0.0002,
"loss": 0.6104533672332764,
"mean_token_accuracy": 0.754143625497818,
"num_tokens": 2503686.0,
"step": 67
},
{
"entropy": 0.6143222749233246,
"epoch": 0.5286686103012633,
"grad_norm": 0.010598300956189632,
"learning_rate": 0.0002,
"loss": 0.617759108543396,
"mean_token_accuracy": 0.7507391050457954,
"num_tokens": 2541428.0,
"step": 68
},
{
"entropy": 0.6160529032349586,
"epoch": 0.5364431486880467,
"grad_norm": 0.010992376133799553,
"learning_rate": 0.0002,
"loss": 0.6156395673751831,
"mean_token_accuracy": 0.7503774240612984,
"num_tokens": 2578762.0,
"step": 69
},
{
"entropy": 0.6199713721871376,
"epoch": 0.54421768707483,
"grad_norm": 0.01134777907282114,
"learning_rate": 0.0002,
"loss": 0.6140978932380676,
"mean_token_accuracy": 0.7530878558754921,
"num_tokens": 2616254.0,
"step": 70
},
{
"entropy": 0.6425308436155319,
"epoch": 0.5519922254616132,
"grad_norm": 0.011413667351007462,
"learning_rate": 0.0002,
"loss": 0.63960862159729,
"mean_token_accuracy": 0.7409021556377411,
"num_tokens": 2653615.0,
"step": 71
},
{
"entropy": 0.6269439905881882,
"epoch": 0.5597667638483965,
"grad_norm": 0.011452693492174149,
"learning_rate": 0.0002,
"loss": 0.6268940567970276,
"mean_token_accuracy": 0.7482407689094543,
"num_tokens": 2691144.0,
"step": 72
},
{
"entropy": 0.6223431453108788,
"epoch": 0.5675413022351797,
"grad_norm": 0.011051226407289505,
"learning_rate": 0.0002,
"loss": 0.627192497253418,
"mean_token_accuracy": 0.7496485412120819,
"num_tokens": 2728868.0,
"step": 73
},
{
"entropy": 0.6142039522528648,
"epoch": 0.5753158406219631,
"grad_norm": 0.010462508536875248,
"learning_rate": 0.0002,
"loss": 0.6176329851150513,
"mean_token_accuracy": 0.7508676871657372,
"num_tokens": 2766300.0,
"step": 74
},
{
"entropy": 0.6121213287115097,
"epoch": 0.5830903790087464,
"grad_norm": 0.01290794089436531,
"learning_rate": 0.0002,
"loss": 0.6207513809204102,
"mean_token_accuracy": 0.7499961778521538,
"num_tokens": 2803656.0,
"step": 75
},
{
"entropy": 0.6135914027690887,
"epoch": 0.5908649173955296,
"grad_norm": 0.009645558893680573,
"learning_rate": 0.0002,
"loss": 0.6158081293106079,
"mean_token_accuracy": 0.7523107752203941,
"num_tokens": 2841367.0,
"step": 76
},
{
"entropy": 0.6079287081956863,
"epoch": 0.5986394557823129,
"grad_norm": 0.010133286938071251,
"learning_rate": 0.0002,
"loss": 0.6089348196983337,
"mean_token_accuracy": 0.7539728805422783,
"num_tokens": 2878743.0,
"step": 77
},
{
"entropy": 0.619053803384304,
"epoch": 0.6064139941690962,
"grad_norm": 0.011026635766029358,
"learning_rate": 0.0002,
"loss": 0.6179240942001343,
"mean_token_accuracy": 0.752836562693119,
"num_tokens": 2916083.0,
"step": 78
},
{
"entropy": 0.6179199442267418,
"epoch": 0.6141885325558795,
"grad_norm": 0.009910841472446918,
"learning_rate": 0.0002,
"loss": 0.6233879923820496,
"mean_token_accuracy": 0.7482481822371483,
"num_tokens": 2953599.0,
"step": 79
},
{
"entropy": 0.6186161413788795,
"epoch": 0.6219630709426628,
"grad_norm": 0.00901505071669817,
"learning_rate": 0.0002,
"loss": 0.6190614700317383,
"mean_token_accuracy": 0.7501069083809853,
"num_tokens": 2990903.0,
"step": 80
},
{
"entropy": 0.6112105250358582,
"epoch": 0.6297376093294461,
"grad_norm": 0.011348889209330082,
"learning_rate": 0.0002,
"loss": 0.6137362718582153,
"mean_token_accuracy": 0.7515707835555077,
"num_tokens": 3028013.0,
"step": 81
},
{
"entropy": 0.631052277982235,
"epoch": 0.6375121477162293,
"grad_norm": 0.012229959480464458,
"learning_rate": 0.0002,
"loss": 0.6278471946716309,
"mean_token_accuracy": 0.7475830912590027,
"num_tokens": 3065444.0,
"step": 82
},
{
"entropy": 0.6256950199604034,
"epoch": 0.6452866861030127,
"grad_norm": 0.009951086714863777,
"learning_rate": 0.0002,
"loss": 0.6218305826187134,
"mean_token_accuracy": 0.7465297132730484,
"num_tokens": 3102683.0,
"step": 83
},
{
"entropy": 0.6196548789739609,
"epoch": 0.6530612244897959,
"grad_norm": 0.010236121714115143,
"learning_rate": 0.0002,
"loss": 0.6180955767631531,
"mean_token_accuracy": 0.7518158033490181,
"num_tokens": 3140271.0,
"step": 84
},
{
"entropy": 0.6243495345115662,
"epoch": 0.6608357628765792,
"grad_norm": 0.011498089879751205,
"learning_rate": 0.0002,
"loss": 0.6245218515396118,
"mean_token_accuracy": 0.7478918880224228,
"num_tokens": 3177703.0,
"step": 85
},
{
"entropy": 0.619852252304554,
"epoch": 0.6686103012633625,
"grad_norm": 0.009944644756615162,
"learning_rate": 0.0002,
"loss": 0.6247724294662476,
"mean_token_accuracy": 0.7476306930184364,
"num_tokens": 3215349.0,
"step": 86
},
{
"entropy": 0.6298213005065918,
"epoch": 0.6763848396501457,
"grad_norm": 0.009104517288506031,
"learning_rate": 0.0002,
"loss": 0.6307124495506287,
"mean_token_accuracy": 0.7444773614406586,
"num_tokens": 3252965.0,
"step": 87
},
{
"entropy": 0.617066778242588,
"epoch": 0.6841593780369291,
"grad_norm": 0.009981841780245304,
"learning_rate": 0.0002,
"loss": 0.6200389862060547,
"mean_token_accuracy": 0.7506762072443962,
"num_tokens": 3290319.0,
"step": 88
},
{
"entropy": 0.6173762008547783,
"epoch": 0.6919339164237124,
"grad_norm": 0.010542662814259529,
"learning_rate": 0.0002,
"loss": 0.6204540729522705,
"mean_token_accuracy": 0.7490114718675613,
"num_tokens": 3328270.0,
"step": 89
},
{
"entropy": 0.6311885267496109,
"epoch": 0.6997084548104956,
"grad_norm": 0.009542804211378098,
"learning_rate": 0.0002,
"loss": 0.630376935005188,
"mean_token_accuracy": 0.7458378821611404,
"num_tokens": 3365973.0,
"step": 90
},
{
"entropy": 0.6197073757648468,
"epoch": 0.7074829931972789,
"grad_norm": 0.009216145612299442,
"learning_rate": 0.0002,
"loss": 0.6229982376098633,
"mean_token_accuracy": 0.7472847774624825,
"num_tokens": 3403209.0,
"step": 91
},
{
"entropy": 0.6161768138408661,
"epoch": 0.7152575315840622,
"grad_norm": 0.0102296257391572,
"learning_rate": 0.0002,
"loss": 0.6171408891677856,
"mean_token_accuracy": 0.7507107704877853,
"num_tokens": 3440047.0,
"step": 92
},
{
"entropy": 0.6355379894375801,
"epoch": 0.7230320699708455,
"grad_norm": 0.011433378793299198,
"learning_rate": 0.0002,
"loss": 0.6368508338928223,
"mean_token_accuracy": 0.7425181716680527,
"num_tokens": 3477583.0,
"step": 93
},
{
"entropy": 0.6173990294337273,
"epoch": 0.7308066083576288,
"grad_norm": 0.009371397085487843,
"learning_rate": 0.0002,
"loss": 0.6161597371101379,
"mean_token_accuracy": 0.752352699637413,
"num_tokens": 3515443.0,
"step": 94
},
{
"entropy": 0.6139659285545349,
"epoch": 0.738581146744412,
"grad_norm": 0.00992497242987156,
"learning_rate": 0.0002,
"loss": 0.6122086644172668,
"mean_token_accuracy": 0.7519859671592712,
"num_tokens": 3552895.0,
"step": 95
},
{
"entropy": 0.6270382553339005,
"epoch": 0.7463556851311953,
"grad_norm": 0.009038747288286686,
"learning_rate": 0.0002,
"loss": 0.6263892650604248,
"mean_token_accuracy": 0.7476321458816528,
"num_tokens": 3590558.0,
"step": 96
},
{
"entropy": 0.6252292916178703,
"epoch": 0.7541302235179786,
"grad_norm": 0.008724549785256386,
"learning_rate": 0.0002,
"loss": 0.6235740184783936,
"mean_token_accuracy": 0.7499061301350594,
"num_tokens": 3628009.0,
"step": 97
},
{
"entropy": 0.6164776980876923,
"epoch": 0.7619047619047619,
"grad_norm": 0.009640969336032867,
"learning_rate": 0.0002,
"loss": 0.6190721988677979,
"mean_token_accuracy": 0.7499102726578712,
"num_tokens": 3665592.0,
"step": 98
},
{
"entropy": 0.6058400347828865,
"epoch": 0.7696793002915452,
"grad_norm": 0.010068013332784176,
"learning_rate": 0.0002,
"loss": 0.6085440516471863,
"mean_token_accuracy": 0.7550365477800369,
"num_tokens": 3702702.0,
"step": 99
},
{
"entropy": 0.6062669232487679,
"epoch": 0.7774538386783285,
"grad_norm": 0.009750640951097012,
"learning_rate": 0.0002,
"loss": 0.6106675267219543,
"mean_token_accuracy": 0.753579393029213,
"num_tokens": 3739974.0,
"step": 100
},
{
"entropy": 0.6228908747434616,
"epoch": 0.7852283770651117,
"grad_norm": 0.010727898217737675,
"learning_rate": 0.0002,
"loss": 0.6273207664489746,
"mean_token_accuracy": 0.7462224960327148,
"num_tokens": 3777563.0,
"step": 101
},
{
"entropy": 0.623473547399044,
"epoch": 0.793002915451895,
"grad_norm": 0.00916969496756792,
"learning_rate": 0.0002,
"loss": 0.6267216205596924,
"mean_token_accuracy": 0.7489331811666489,
"num_tokens": 3815209.0,
"step": 102
},
{
"entropy": 0.6183424741029739,
"epoch": 0.8007774538386784,
"grad_norm": 0.009042995050549507,
"learning_rate": 0.0002,
"loss": 0.6215161681175232,
"mean_token_accuracy": 0.7501572594046593,
"num_tokens": 3853109.0,
"step": 103
},
{
"entropy": 0.6086031794548035,
"epoch": 0.8085519922254616,
"grad_norm": 0.010368067771196365,
"learning_rate": 0.0002,
"loss": 0.6092633008956909,
"mean_token_accuracy": 0.7548685073852539,
"num_tokens": 3890248.0,
"step": 104
},
{
"entropy": 0.6166428253054619,
"epoch": 0.8163265306122449,
"grad_norm": 0.009941854514181614,
"learning_rate": 0.0002,
"loss": 0.6201497316360474,
"mean_token_accuracy": 0.746953047811985,
"num_tokens": 3927797.0,
"step": 105
},
{
"entropy": 0.6270147785544395,
"epoch": 0.8241010689990281,
"grad_norm": 0.0085823442786932,
"learning_rate": 0.0002,
"loss": 0.6264973878860474,
"mean_token_accuracy": 0.746023453772068,
"num_tokens": 3965467.0,
"step": 106
},
{
"entropy": 0.6165590658783913,
"epoch": 0.8318756073858115,
"grad_norm": 0.009966393932700157,
"learning_rate": 0.0002,
"loss": 0.6136085987091064,
"mean_token_accuracy": 0.7522286921739578,
"num_tokens": 4002647.0,
"step": 107
},
{
"entropy": 0.6224516704678535,
"epoch": 0.8396501457725948,
"grad_norm": 0.01067335158586502,
"learning_rate": 0.0002,
"loss": 0.6225627660751343,
"mean_token_accuracy": 0.7488038167357445,
"num_tokens": 4039990.0,
"step": 108
},
{
"entropy": 0.6210483014583588,
"epoch": 0.847424684159378,
"grad_norm": 0.010811593383550644,
"learning_rate": 0.0002,
"loss": 0.6203762292861938,
"mean_token_accuracy": 0.7501420751214027,
"num_tokens": 4077461.0,
"step": 109
},
{
"entropy": 0.6205326095223427,
"epoch": 0.8551992225461613,
"grad_norm": 0.009125830605626106,
"learning_rate": 0.0002,
"loss": 0.623924732208252,
"mean_token_accuracy": 0.7463032528758049,
"num_tokens": 4115100.0,
"step": 110
},
{
"entropy": 0.6294923424720764,
"epoch": 0.8629737609329446,
"grad_norm": 0.008677372708916664,
"learning_rate": 0.0002,
"loss": 0.6358845233917236,
"mean_token_accuracy": 0.7433422952890396,
"num_tokens": 4152751.0,
"step": 111
},
{
"entropy": 0.615186795592308,
"epoch": 0.8707482993197279,
"grad_norm": 0.012182718142867088,
"learning_rate": 0.0002,
"loss": 0.6257232427597046,
"mean_token_accuracy": 0.7469102591276169,
"num_tokens": 4189807.0,
"step": 112
},
{
"entropy": 0.6161832436919212,
"epoch": 0.8785228377065112,
"grad_norm": 0.009921083226799965,
"learning_rate": 0.0002,
"loss": 0.6149104237556458,
"mean_token_accuracy": 0.7501650750637054,
"num_tokens": 4227148.0,
"step": 113
},
{
"entropy": 0.6069425120949745,
"epoch": 0.8862973760932945,
"grad_norm": 0.010401617735624313,
"learning_rate": 0.0002,
"loss": 0.6072876453399658,
"mean_token_accuracy": 0.7546068653464317,
"num_tokens": 4264665.0,
"step": 114
},
{
"entropy": 0.6115981489419937,
"epoch": 0.8940719144800777,
"grad_norm": 0.009178240783512592,
"learning_rate": 0.0002,
"loss": 0.6142789125442505,
"mean_token_accuracy": 0.7516015693545341,
"num_tokens": 4301705.0,
"step": 115
},
{
"entropy": 0.6232319623231888,
"epoch": 0.901846452866861,
"grad_norm": 0.011550409719347954,
"learning_rate": 0.0002,
"loss": 0.6232004165649414,
"mean_token_accuracy": 0.7479738518595695,
"num_tokens": 4339005.0,
"step": 116
},
{
"entropy": 0.6050816774368286,
"epoch": 0.9096209912536443,
"grad_norm": 0.009149852208793163,
"learning_rate": 0.0002,
"loss": 0.6073260307312012,
"mean_token_accuracy": 0.7553000226616859,
"num_tokens": 4376492.0,
"step": 117
},
{
"entropy": 0.6323671862483025,
"epoch": 0.9173955296404276,
"grad_norm": 0.01042769942432642,
"learning_rate": 0.0002,
"loss": 0.6354271769523621,
"mean_token_accuracy": 0.742473192512989,
"num_tokens": 4414516.0,
"step": 118
},
{
"entropy": 0.6279568076133728,
"epoch": 0.9251700680272109,
"grad_norm": 0.009754139930009842,
"learning_rate": 0.0002,
"loss": 0.6289409399032593,
"mean_token_accuracy": 0.7444217056035995,
"num_tokens": 4452210.0,
"step": 119
},
{
"entropy": 0.6090738251805305,
"epoch": 0.9329446064139941,
"grad_norm": 0.011155272834002972,
"learning_rate": 0.0002,
"loss": 0.61219322681427,
"mean_token_accuracy": 0.7522945404052734,
"num_tokens": 4489567.0,
"step": 120
},
{
"entropy": 0.6002820879220963,
"epoch": 0.9407191448007775,
"grad_norm": 0.009737227112054825,
"learning_rate": 0.0002,
"loss": 0.6018539071083069,
"mean_token_accuracy": 0.757467195391655,
"num_tokens": 4527111.0,
"step": 121
},
{
"entropy": 0.6134138256311417,
"epoch": 0.9484936831875608,
"grad_norm": 0.010466666892170906,
"learning_rate": 0.0002,
"loss": 0.6216229200363159,
"mean_token_accuracy": 0.7486356720328331,
"num_tokens": 4564450.0,
"step": 122
},
{
"entropy": 0.6079460605978966,
"epoch": 0.956268221574344,
"grad_norm": 0.008756682276725769,
"learning_rate": 0.0002,
"loss": 0.6086549758911133,
"mean_token_accuracy": 0.7539011463522911,
"num_tokens": 4601781.0,
"step": 123
},
{
"entropy": 0.612805612385273,
"epoch": 0.9640427599611273,
"grad_norm": 0.009290359914302826,
"learning_rate": 0.0002,
"loss": 0.6137915849685669,
"mean_token_accuracy": 0.752314880490303,
"num_tokens": 4639256.0,
"step": 124
},
{
"entropy": 0.6211065128445625,
"epoch": 0.9718172983479106,
"grad_norm": 0.010166316293179989,
"learning_rate": 0.0002,
"loss": 0.6211485266685486,
"mean_token_accuracy": 0.7476831749081612,
"num_tokens": 4676689.0,
"step": 125
},
{
"entropy": 0.6219009906053543,
"epoch": 0.9795918367346939,
"grad_norm": 0.009910349734127522,
"learning_rate": 0.0002,
"loss": 0.6177939176559448,
"mean_token_accuracy": 0.7506504207849503,
"num_tokens": 4714123.0,
"step": 126
},
{
"entropy": 0.6336647123098373,
"epoch": 0.9873663751214772,
"grad_norm": 0.00899409968405962,
"learning_rate": 0.0002,
"loss": 0.6283681392669678,
"mean_token_accuracy": 0.7467537075281143,
"num_tokens": 4751822.0,
"step": 127
},
{
"entropy": 0.6106422170996666,
"epoch": 0.9951409135082604,
"grad_norm": 0.009350291453301907,
"learning_rate": 0.0002,
"loss": 0.6105437278747559,
"mean_token_accuracy": 0.7529440075159073,
"num_tokens": 4789003.0,
"step": 128
},
{
"entropy": 0.6007849931716919,
"epoch": 1.0,
"grad_norm": 0.011687238700687885,
"learning_rate": 0.0002,
"loss": 0.6050734519958496,
"mean_token_accuracy": 0.7555755734443664,
"num_tokens": 4812561.0,
"step": 129
},
{
"entropy": 0.6145111918449402,
"epoch": 1.0077745383867833,
"grad_norm": 0.00996165256947279,
"learning_rate": 0.0002,
"loss": 0.6200628280639648,
"mean_token_accuracy": 0.7501887455582619,
"num_tokens": 4849863.0,
"step": 130
},
{
"entropy": 0.6117109283804893,
"epoch": 1.0155490767735667,
"grad_norm": 0.009831785224378109,
"learning_rate": 0.0002,
"loss": 0.6182730793952942,
"mean_token_accuracy": 0.7466977462172508,
"num_tokens": 4887693.0,
"step": 131
},
{
"entropy": 0.6117515116930008,
"epoch": 1.0233236151603498,
"grad_norm": 0.007678937632590532,
"learning_rate": 0.0002,
"loss": 0.6126781105995178,
"mean_token_accuracy": 0.7521011829376221,
"num_tokens": 4925266.0,
"step": 132
},
{
"entropy": 0.6145991012454033,
"epoch": 1.031098153547133,
"grad_norm": 0.00878220982849598,
"learning_rate": 0.0002,
"loss": 0.6143695116043091,
"mean_token_accuracy": 0.7531941831111908,
"num_tokens": 4962307.0,
"step": 133
},
{
"entropy": 0.6105677559971809,
"epoch": 1.0388726919339164,
"grad_norm": 0.009893382899463177,
"learning_rate": 0.0002,
"loss": 0.6073343753814697,
"mean_token_accuracy": 0.7548379600048065,
"num_tokens": 4999709.0,
"step": 134
},
{
"entropy": 0.6226058155298233,
"epoch": 1.0466472303206997,
"grad_norm": 0.01014266349375248,
"learning_rate": 0.0002,
"loss": 0.6212986707687378,
"mean_token_accuracy": 0.7492796331644058,
"num_tokens": 5036991.0,
"step": 135
},
{
"entropy": 0.6036651879549026,
"epoch": 1.054421768707483,
"grad_norm": 0.008363187313079834,
"learning_rate": 0.0002,
"loss": 0.6068825721740723,
"mean_token_accuracy": 0.753925733268261,
"num_tokens": 5074058.0,
"step": 136
},
{
"entropy": 0.6133922636508942,
"epoch": 1.0621963070942664,
"grad_norm": 0.00871324259787798,
"learning_rate": 0.0002,
"loss": 0.6173220276832581,
"mean_token_accuracy": 0.7509826496243477,
"num_tokens": 5111393.0,
"step": 137
},
{
"entropy": 0.622228629887104,
"epoch": 1.0699708454810495,
"grad_norm": 0.010760784149169922,
"learning_rate": 0.0002,
"loss": 0.629308819770813,
"mean_token_accuracy": 0.7456969246268272,
"num_tokens": 5148886.0,
"step": 138
},
{
"entropy": 0.6098063141107559,
"epoch": 1.0777453838678328,
"grad_norm": 0.010240385308861732,
"learning_rate": 0.0002,
"loss": 0.6158695220947266,
"mean_token_accuracy": 0.7498040646314621,
"num_tokens": 5186054.0,
"step": 139
},
{
"entropy": 0.6184578239917755,
"epoch": 1.0855199222546161,
"grad_norm": 0.010335118509829044,
"learning_rate": 0.0002,
"loss": 0.6153397560119629,
"mean_token_accuracy": 0.7500413805246353,
"num_tokens": 5223497.0,
"step": 140
},
{
"entropy": 0.626154899597168,
"epoch": 1.0932944606413995,
"grad_norm": 0.009573339484632015,
"learning_rate": 0.0002,
"loss": 0.6198714971542358,
"mean_token_accuracy": 0.7480529472231865,
"num_tokens": 5261284.0,
"step": 141
},
{
"entropy": 0.6239576488733292,
"epoch": 1.1010689990281828,
"grad_norm": 0.01078983023762703,
"learning_rate": 0.0002,
"loss": 0.6222984790802002,
"mean_token_accuracy": 0.7482637241482735,
"num_tokens": 5298391.0,
"step": 142
},
{
"entropy": 0.6052972301840782,
"epoch": 1.1088435374149659,
"grad_norm": 0.009443830698728561,
"learning_rate": 0.0002,
"loss": 0.6056097745895386,
"mean_token_accuracy": 0.755977600812912,
"num_tokens": 5335665.0,
"step": 143
},
{
"entropy": 0.6082469522953033,
"epoch": 1.1166180758017492,
"grad_norm": 0.008718990720808506,
"learning_rate": 0.0002,
"loss": 0.6119707822799683,
"mean_token_accuracy": 0.7540762051939964,
"num_tokens": 5373467.0,
"step": 144
},
{
"entropy": 0.6099165305495262,
"epoch": 1.1243926141885325,
"grad_norm": 0.00886059831827879,
"learning_rate": 0.0002,
"loss": 0.6144919395446777,
"mean_token_accuracy": 0.7509082928299904,
"num_tokens": 5410699.0,
"step": 145
},
{
"entropy": 0.606502428650856,
"epoch": 1.1321671525753159,
"grad_norm": 0.009656739421188831,
"learning_rate": 0.0002,
"loss": 0.6092766523361206,
"mean_token_accuracy": 0.7524644657969475,
"num_tokens": 5448145.0,
"step": 146
},
{
"entropy": 0.6240331009030342,
"epoch": 1.1399416909620992,
"grad_norm": 0.009215152822434902,
"learning_rate": 0.0002,
"loss": 0.6283767819404602,
"mean_token_accuracy": 0.7434803545475006,
"num_tokens": 5485424.0,
"step": 147
},
{
"entropy": 0.6154414415359497,
"epoch": 1.1477162293488825,
"grad_norm": 0.009418639354407787,
"learning_rate": 0.0002,
"loss": 0.6141241192817688,
"mean_token_accuracy": 0.752318486571312,
"num_tokens": 5522963.0,
"step": 148
},
{
"entropy": 0.6115295439958572,
"epoch": 1.1554907677356656,
"grad_norm": 0.008995896205306053,
"learning_rate": 0.0002,
"loss": 0.6093723773956299,
"mean_token_accuracy": 0.7540601193904877,
"num_tokens": 5560173.0,
"step": 149
},
{
"entropy": 0.6168172955513,
"epoch": 1.163265306122449,
"grad_norm": 0.007887676358222961,
"learning_rate": 0.0002,
"loss": 0.6149598360061646,
"mean_token_accuracy": 0.7500165104866028,
"num_tokens": 5597781.0,
"step": 150
},
{
"entropy": 0.6069798469543457,
"epoch": 1.1710398445092323,
"grad_norm": 0.008911027573049068,
"learning_rate": 0.0002,
"loss": 0.6064385771751404,
"mean_token_accuracy": 0.7551223114132881,
"num_tokens": 5635360.0,
"step": 151
},
{
"entropy": 0.6170337721705437,
"epoch": 1.1788143828960156,
"grad_norm": 0.008784991689026356,
"learning_rate": 0.0002,
"loss": 0.6199371814727783,
"mean_token_accuracy": 0.7501093670725822,
"num_tokens": 5673236.0,
"step": 152
},
{
"entropy": 0.6042322665452957,
"epoch": 1.186588921282799,
"grad_norm": 0.008859240449965,
"learning_rate": 0.0002,
"loss": 0.6099147200584412,
"mean_token_accuracy": 0.7529143393039703,
"num_tokens": 5710364.0,
"step": 153
},
{
"entropy": 0.6032149121165276,
"epoch": 1.194363459669582,
"grad_norm": 0.008698609657585621,
"learning_rate": 0.0002,
"loss": 0.6091040372848511,
"mean_token_accuracy": 0.7545271888375282,
"num_tokens": 5747783.0,
"step": 154
},
{
"entropy": 0.5934446603059769,
"epoch": 1.2021379980563653,
"grad_norm": 0.009365703910589218,
"learning_rate": 0.0002,
"loss": 0.6000581979751587,
"mean_token_accuracy": 0.7570822536945343,
"num_tokens": 5784550.0,
"step": 155
},
{
"entropy": 0.6240461468696594,
"epoch": 1.2099125364431487,
"grad_norm": 0.00959563348442316,
"learning_rate": 0.0002,
"loss": 0.6229224801063538,
"mean_token_accuracy": 0.7504049837589264,
"num_tokens": 5822051.0,
"step": 156
},
{
"entropy": 0.6372882649302483,
"epoch": 1.217687074829932,
"grad_norm": 0.008253706619143486,
"learning_rate": 0.0002,
"loss": 0.6363227367401123,
"mean_token_accuracy": 0.7415706738829613,
"num_tokens": 5859606.0,
"step": 157
},
{
"entropy": 0.6115364283323288,
"epoch": 1.2254616132167153,
"grad_norm": 0.009423714131116867,
"learning_rate": 0.0002,
"loss": 0.6082147359848022,
"mean_token_accuracy": 0.7525753974914551,
"num_tokens": 5897144.0,
"step": 158
},
{
"entropy": 0.6259980425238609,
"epoch": 1.2332361516034984,
"grad_norm": 0.008684671483933926,
"learning_rate": 0.0002,
"loss": 0.6272211074829102,
"mean_token_accuracy": 0.7443205043673515,
"num_tokens": 5934271.0,
"step": 159
},
{
"entropy": 0.6230324283242226,
"epoch": 1.2410106899902817,
"grad_norm": 0.008543766103684902,
"learning_rate": 0.0002,
"loss": 0.6271595358848572,
"mean_token_accuracy": 0.7448511347174644,
"num_tokens": 5971696.0,
"step": 160
},
{
"entropy": 0.6094089895486832,
"epoch": 1.248785228377065,
"grad_norm": 0.008484925143420696,
"learning_rate": 0.0002,
"loss": 0.611902117729187,
"mean_token_accuracy": 0.751502238214016,
"num_tokens": 6009264.0,
"step": 161
},
{
"entropy": 0.6298199594020844,
"epoch": 1.2565597667638484,
"grad_norm": 0.009336225688457489,
"learning_rate": 0.0002,
"loss": 0.6334519386291504,
"mean_token_accuracy": 0.7432255297899246,
"num_tokens": 6046764.0,
"step": 162
},
{
"entropy": 0.6082314997911453,
"epoch": 1.2643343051506317,
"grad_norm": 0.008643310517072678,
"learning_rate": 0.0002,
"loss": 0.6062188148498535,
"mean_token_accuracy": 0.7549923211336136,
"num_tokens": 6084129.0,
"step": 163
},
{
"entropy": 0.6305336207151413,
"epoch": 1.272108843537415,
"grad_norm": 0.009341283701360226,
"learning_rate": 0.0002,
"loss": 0.6319139003753662,
"mean_token_accuracy": 0.7440996170043945,
"num_tokens": 6121588.0,
"step": 164
},
{
"entropy": 0.6267635151743889,
"epoch": 1.2798833819241984,
"grad_norm": 0.00801732949912548,
"learning_rate": 0.0002,
"loss": 0.6295123100280762,
"mean_token_accuracy": 0.7461825907230377,
"num_tokens": 6158885.0,
"step": 165
},
{
"entropy": 0.6146969944238663,
"epoch": 1.2876579203109815,
"grad_norm": 0.009981551207602024,
"learning_rate": 0.0002,
"loss": 0.611693263053894,
"mean_token_accuracy": 0.7518708109855652,
"num_tokens": 6196224.0,
"step": 166
},
{
"entropy": 0.61357232183218,
"epoch": 1.2954324586977648,
"grad_norm": 0.009115675464272499,
"learning_rate": 0.0002,
"loss": 0.6161482930183411,
"mean_token_accuracy": 0.7504228800535202,
"num_tokens": 6233989.0,
"step": 167
},
{
"entropy": 0.6055504828691483,
"epoch": 1.3032069970845481,
"grad_norm": 0.009081711992621422,
"learning_rate": 0.0002,
"loss": 0.6060025691986084,
"mean_token_accuracy": 0.7522977739572525,
"num_tokens": 6271394.0,
"step": 168
},
{
"entropy": 0.6105418056249619,
"epoch": 1.3109815354713314,
"grad_norm": 0.009730422869324684,
"learning_rate": 0.0002,
"loss": 0.6106258630752563,
"mean_token_accuracy": 0.753718800842762,
"num_tokens": 6308814.0,
"step": 169
},
{
"entropy": 0.6137099266052246,
"epoch": 1.3187560738581148,
"grad_norm": 0.009750008583068848,
"learning_rate": 0.0002,
"loss": 0.6176519393920898,
"mean_token_accuracy": 0.7496867552399635,
"num_tokens": 6346282.0,
"step": 170
},
{
"entropy": 0.6076096817851067,
"epoch": 1.3265306122448979,
"grad_norm": 0.00966191291809082,
"learning_rate": 0.0002,
"loss": 0.6177955865859985,
"mean_token_accuracy": 0.7480223625898361,
"num_tokens": 6383602.0,
"step": 171
},
{
"entropy": 0.6195629611611366,
"epoch": 1.3343051506316812,
"grad_norm": 0.008418413810431957,
"learning_rate": 0.0002,
"loss": 0.6202820539474487,
"mean_token_accuracy": 0.7488253712654114,
"num_tokens": 6421035.0,
"step": 172
},
{
"entropy": 0.6313579976558685,
"epoch": 1.3420796890184645,
"grad_norm": 0.009207581169903278,
"learning_rate": 0.0002,
"loss": 0.6277562379837036,
"mean_token_accuracy": 0.7459008172154427,
"num_tokens": 6458322.0,
"step": 173
},
{
"entropy": 0.6184266805648804,
"epoch": 1.3498542274052479,
"grad_norm": 0.009536071680486202,
"learning_rate": 0.0002,
"loss": 0.6161496639251709,
"mean_token_accuracy": 0.7486988604068756,
"num_tokens": 6495621.0,
"step": 174
},
{
"entropy": 0.6189115419983864,
"epoch": 1.3576287657920312,
"grad_norm": 0.0097253592684865,
"learning_rate": 0.0002,
"loss": 0.6185729503631592,
"mean_token_accuracy": 0.7469287514686584,
"num_tokens": 6532892.0,
"step": 175
},
{
"entropy": 0.6204129755496979,
"epoch": 1.3654033041788143,
"grad_norm": 0.008999030105769634,
"learning_rate": 0.0002,
"loss": 0.6241609454154968,
"mean_token_accuracy": 0.7467619553208351,
"num_tokens": 6570420.0,
"step": 176
},
{
"entropy": 0.6034655645489693,
"epoch": 1.3731778425655976,
"grad_norm": 0.009542280808091164,
"learning_rate": 0.0002,
"loss": 0.6092945337295532,
"mean_token_accuracy": 0.7532089725136757,
"num_tokens": 6607782.0,
"step": 177
},
{
"entropy": 0.5901695042848587,
"epoch": 1.380952380952381,
"grad_norm": 0.009766815230250359,
"learning_rate": 0.0002,
"loss": 0.5972245335578918,
"mean_token_accuracy": 0.7562905699014664,
"num_tokens": 6644876.0,
"step": 178
},
{
"entropy": 0.6139540746808052,
"epoch": 1.3887269193391643,
"grad_norm": 0.00885457918047905,
"learning_rate": 0.0002,
"loss": 0.6145105361938477,
"mean_token_accuracy": 0.7494652420282364,
"num_tokens": 6682153.0,
"step": 179
},
{
"entropy": 0.6128789633512497,
"epoch": 1.3965014577259476,
"grad_norm": 0.008380657061934471,
"learning_rate": 0.0002,
"loss": 0.6103215217590332,
"mean_token_accuracy": 0.7528893128037453,
"num_tokens": 6719589.0,
"step": 180
},
{
"entropy": 0.6158252954483032,
"epoch": 1.4042759961127307,
"grad_norm": 0.008612860925495625,
"learning_rate": 0.0002,
"loss": 0.6157952547073364,
"mean_token_accuracy": 0.7490102499723434,
"num_tokens": 6757256.0,
"step": 181
},
{
"entropy": 0.6120009869337082,
"epoch": 1.412050534499514,
"grad_norm": 0.008242498151957989,
"learning_rate": 0.0002,
"loss": 0.610822319984436,
"mean_token_accuracy": 0.7527074217796326,
"num_tokens": 6794427.0,
"step": 182
},
{
"entropy": 0.607716366648674,
"epoch": 1.4198250728862973,
"grad_norm": 0.00903896614909172,
"learning_rate": 0.0002,
"loss": 0.6105165481567383,
"mean_token_accuracy": 0.7544176280498505,
"num_tokens": 6831592.0,
"step": 183
},
{
"entropy": 0.6083493009209633,
"epoch": 1.4275996112730807,
"grad_norm": 0.007915884256362915,
"learning_rate": 0.0002,
"loss": 0.611156165599823,
"mean_token_accuracy": 0.7522151321172714,
"num_tokens": 6869182.0,
"step": 184
},
{
"entropy": 0.6225397288799286,
"epoch": 1.435374149659864,
"grad_norm": 0.009225807152688503,
"learning_rate": 0.0002,
"loss": 0.6281070709228516,
"mean_token_accuracy": 0.7460536956787109,
"num_tokens": 6906740.0,
"step": 185
},
{
"entropy": 0.6144149005413055,
"epoch": 1.4431486880466473,
"grad_norm": 0.010468881577253342,
"learning_rate": 0.0002,
"loss": 0.6134935617446899,
"mean_token_accuracy": 0.7510944902896881,
"num_tokens": 6944215.0,
"step": 186
},
{
"entropy": 0.6219450011849403,
"epoch": 1.4509232264334306,
"grad_norm": 0.008004755713045597,
"learning_rate": 0.0002,
"loss": 0.6226309537887573,
"mean_token_accuracy": 0.7474055960774422,
"num_tokens": 6981266.0,
"step": 187
},
{
"entropy": 0.6094852611422539,
"epoch": 1.4586977648202137,
"grad_norm": 0.00825564842671156,
"learning_rate": 0.0002,
"loss": 0.6140962839126587,
"mean_token_accuracy": 0.7508443966507912,
"num_tokens": 7018562.0,
"step": 188
},
{
"entropy": 0.6202999800443649,
"epoch": 1.466472303206997,
"grad_norm": 0.00858406163752079,
"learning_rate": 0.0002,
"loss": 0.6255123615264893,
"mean_token_accuracy": 0.744349479675293,
"num_tokens": 7055995.0,
"step": 189
},
{
"entropy": 0.620690606534481,
"epoch": 1.4742468415937804,
"grad_norm": 0.008920849300920963,
"learning_rate": 0.0002,
"loss": 0.6179178357124329,
"mean_token_accuracy": 0.7499353438615799,
"num_tokens": 7093265.0,
"step": 190
},
{
"entropy": 0.6239896044135094,
"epoch": 1.4820213799805637,
"grad_norm": 0.00956004112958908,
"learning_rate": 0.0002,
"loss": 0.6228440999984741,
"mean_token_accuracy": 0.7463066428899765,
"num_tokens": 7130758.0,
"step": 191
},
{
"entropy": 0.6123484745621681,
"epoch": 1.489795918367347,
"grad_norm": 0.009270581416785717,
"learning_rate": 0.0002,
"loss": 0.6113156080245972,
"mean_token_accuracy": 0.752521239221096,
"num_tokens": 7168712.0,
"step": 192
},
{
"entropy": 0.616000160574913,
"epoch": 1.4975704567541301,
"grad_norm": 0.010770791210234165,
"learning_rate": 0.0002,
"loss": 0.6215670108795166,
"mean_token_accuracy": 0.7469163537025452,
"num_tokens": 7205815.0,
"step": 193
},
{
"entropy": 0.6254132762551308,
"epoch": 1.5053449951409135,
"grad_norm": 0.008934563025832176,
"learning_rate": 0.0002,
"loss": 0.627918541431427,
"mean_token_accuracy": 0.7457368895411491,
"num_tokens": 7243319.0,
"step": 194
},
{
"entropy": 0.6185151413083076,
"epoch": 1.5131195335276968,
"grad_norm": 0.008593689650297165,
"learning_rate": 0.0002,
"loss": 0.6180027723312378,
"mean_token_accuracy": 0.7505958154797554,
"num_tokens": 7280988.0,
"step": 195
},
{
"entropy": 0.6063526794314384,
"epoch": 1.5208940719144801,
"grad_norm": 0.01172675471752882,
"learning_rate": 0.0002,
"loss": 0.6113625764846802,
"mean_token_accuracy": 0.7508470490574837,
"num_tokens": 7318322.0,
"step": 196
},
{
"entropy": 0.6110472977161407,
"epoch": 1.5286686103012634,
"grad_norm": 0.009914939291775227,
"learning_rate": 0.0002,
"loss": 0.6066443920135498,
"mean_token_accuracy": 0.7531256228685379,
"num_tokens": 7355926.0,
"step": 197
},
{
"entropy": 0.6154029294848442,
"epoch": 1.5364431486880465,
"grad_norm": 0.008429116569459438,
"learning_rate": 0.0002,
"loss": 0.6149218678474426,
"mean_token_accuracy": 0.7508518844842911,
"num_tokens": 7393433.0,
"step": 198
},
{
"entropy": 0.622289851307869,
"epoch": 1.54421768707483,
"grad_norm": 0.06439514458179474,
"learning_rate": 0.0002,
"loss": 0.631239116191864,
"mean_token_accuracy": 0.7464239746332169,
"num_tokens": 7431062.0,
"step": 199
},
{
"entropy": 0.619748018682003,
"epoch": 1.5519922254616132,
"grad_norm": 0.014919525012373924,
"learning_rate": 0.0002,
"loss": 0.6189074516296387,
"mean_token_accuracy": 0.7492179349064827,
"num_tokens": 7468637.0,
"step": 200
},
{
"entropy": 0.6060447245836258,
"epoch": 1.5597667638483965,
"grad_norm": 0.019268253818154335,
"learning_rate": 0.0002,
"loss": 0.6034001708030701,
"mean_token_accuracy": 0.7538621947169304,
"num_tokens": 7506043.0,
"step": 201
},
{
"entropy": 0.6062331944704056,
"epoch": 1.5675413022351798,
"grad_norm": 0.013310298323631287,
"learning_rate": 0.0002,
"loss": 0.6041976809501648,
"mean_token_accuracy": 0.7555137276649475,
"num_tokens": 7543352.0,
"step": 202
},
{
"entropy": 0.6137887313961983,
"epoch": 1.575315840621963,
"grad_norm": 0.010207262821495533,
"learning_rate": 0.0002,
"loss": 0.6102935671806335,
"mean_token_accuracy": 0.7525052726268768,
"num_tokens": 7580867.0,
"step": 203
},
{
"entropy": 0.6222132593393326,
"epoch": 1.5830903790087465,
"grad_norm": 0.013623848557472229,
"learning_rate": 0.0002,
"loss": 0.6228193044662476,
"mean_token_accuracy": 0.7474973797798157,
"num_tokens": 7618160.0,
"step": 204
},
{
"entropy": 0.6147656589746475,
"epoch": 1.5908649173955296,
"grad_norm": 0.011189316399395466,
"learning_rate": 0.0002,
"loss": 0.6171211004257202,
"mean_token_accuracy": 0.750194676220417,
"num_tokens": 7655454.0,
"step": 205
},
{
"entropy": 0.6172639206051826,
"epoch": 1.598639455782313,
"grad_norm": 0.010384263470768929,
"learning_rate": 0.0002,
"loss": 0.6146183013916016,
"mean_token_accuracy": 0.7520541921257973,
"num_tokens": 7693399.0,
"step": 206
},
{
"entropy": 0.6170154958963394,
"epoch": 1.6064139941690962,
"grad_norm": 0.01584717258810997,
"learning_rate": 0.0002,
"loss": 0.6188840866088867,
"mean_token_accuracy": 0.7489955052733421,
"num_tokens": 7730827.0,
"step": 207
},
{
"entropy": 0.6163731887936592,
"epoch": 1.6141885325558794,
"grad_norm": 0.018742689862847328,
"learning_rate": 0.0002,
"loss": 0.6233645677566528,
"mean_token_accuracy": 0.7474886327981949,
"num_tokens": 7768375.0,
"step": 208
},
{
"entropy": 0.6161412820219994,
"epoch": 1.621963070942663,
"grad_norm": 0.00972844660282135,
"learning_rate": 0.0002,
"loss": 0.622969388961792,
"mean_token_accuracy": 0.747713029384613,
"num_tokens": 7806087.0,
"step": 209
},
{
"entropy": 0.6096204742789268,
"epoch": 1.629737609329446,
"grad_norm": 0.008969136513769627,
"learning_rate": 0.0002,
"loss": 0.6155728697776794,
"mean_token_accuracy": 0.7519758120179176,
"num_tokens": 7843539.0,
"step": 210
},
{
"entropy": 0.6264154762029648,
"epoch": 1.6375121477162293,
"grad_norm": 0.009598297998309135,
"learning_rate": 0.0002,
"loss": 0.6284589767456055,
"mean_token_accuracy": 0.7461679801344872,
"num_tokens": 7881097.0,
"step": 211
},
{
"entropy": 0.6087732166051865,
"epoch": 1.6452866861030127,
"grad_norm": 0.012110014446079731,
"learning_rate": 0.0002,
"loss": 0.6086750626564026,
"mean_token_accuracy": 0.7552923634648323,
"num_tokens": 7918507.0,
"step": 212
},
{
"entropy": 0.6052073761820793,
"epoch": 1.6530612244897958,
"grad_norm": 0.009252856485545635,
"learning_rate": 0.0002,
"loss": 0.6080942153930664,
"mean_token_accuracy": 0.7508447393774986,
"num_tokens": 7955564.0,
"step": 213
},
{
"entropy": 0.6120294705033302,
"epoch": 1.6608357628765793,
"grad_norm": 0.00877399556338787,
"learning_rate": 0.0002,
"loss": 0.614532470703125,
"mean_token_accuracy": 0.7511213645339012,
"num_tokens": 7992945.0,
"step": 214
},
{
"entropy": 0.6241516917943954,
"epoch": 1.6686103012633624,
"grad_norm": 0.01109123881906271,
"learning_rate": 0.0002,
"loss": 0.626361608505249,
"mean_token_accuracy": 0.7474541217088699,
"num_tokens": 8030734.0,
"step": 215
},
{
"entropy": 0.6194194927811623,
"epoch": 1.6763848396501457,
"grad_norm": 0.009091328829526901,
"learning_rate": 0.0002,
"loss": 0.6160167455673218,
"mean_token_accuracy": 0.7495900243520737,
"num_tokens": 8067927.0,
"step": 216
},
{
"entropy": 0.6229095980525017,
"epoch": 1.684159378036929,
"grad_norm": 0.01083504967391491,
"learning_rate": 0.0002,
"loss": 0.6173299551010132,
"mean_token_accuracy": 0.7501125037670135,
"num_tokens": 8105627.0,
"step": 217
},
{
"entropy": 0.6194786503911018,
"epoch": 1.6919339164237124,
"grad_norm": 0.008784794248640537,
"learning_rate": 0.0002,
"loss": 0.6191180944442749,
"mean_token_accuracy": 0.748157188296318,
"num_tokens": 8143034.0,
"step": 218
},
{
"entropy": 0.6127319037914276,
"epoch": 1.6997084548104957,
"grad_norm": 0.008322956040501595,
"learning_rate": 0.0002,
"loss": 0.6156037449836731,
"mean_token_accuracy": 0.7487869411706924,
"num_tokens": 8180596.0,
"step": 219
},
{
"entropy": 0.6223913356661797,
"epoch": 1.7074829931972788,
"grad_norm": 0.008480758406221867,
"learning_rate": 0.0002,
"loss": 0.6275689601898193,
"mean_token_accuracy": 0.7448212057352066,
"num_tokens": 8218297.0,
"step": 220
},
{
"entropy": 0.6217603012919426,
"epoch": 1.7152575315840624,
"grad_norm": 0.008550974540412426,
"learning_rate": 0.0002,
"loss": 0.6251344680786133,
"mean_token_accuracy": 0.74727413803339,
"num_tokens": 8255632.0,
"step": 221
},
{
"entropy": 0.6164599433541298,
"epoch": 1.7230320699708455,
"grad_norm": 0.008577285334467888,
"learning_rate": 0.0002,
"loss": 0.6166675090789795,
"mean_token_accuracy": 0.7512230649590492,
"num_tokens": 8292769.0,
"step": 222
},
{
"entropy": 0.619569830596447,
"epoch": 1.7308066083576288,
"grad_norm": 0.008122924715280533,
"learning_rate": 0.0002,
"loss": 0.6211944818496704,
"mean_token_accuracy": 0.7477053627371788,
"num_tokens": 8330358.0,
"step": 223
},
{
"entropy": 0.6090706288814545,
"epoch": 1.738581146744412,
"grad_norm": 0.008728940039873123,
"learning_rate": 0.0002,
"loss": 0.6092976927757263,
"mean_token_accuracy": 0.7530095875263214,
"num_tokens": 8367398.0,
"step": 224
},
{
"entropy": 0.617340199649334,
"epoch": 1.7463556851311952,
"grad_norm": 0.007776155136525631,
"learning_rate": 0.0002,
"loss": 0.6156238913536072,
"mean_token_accuracy": 0.7495973780751228,
"num_tokens": 8404907.0,
"step": 225
},
{
"entropy": 0.6192676723003387,
"epoch": 1.7541302235179788,
"grad_norm": 0.008142861537635326,
"learning_rate": 0.0002,
"loss": 0.6212935447692871,
"mean_token_accuracy": 0.7502573132514954,
"num_tokens": 8442551.0,
"step": 226
},
{
"entropy": 0.6181206256151199,
"epoch": 1.7619047619047619,
"grad_norm": 0.009585011750459671,
"learning_rate": 0.0002,
"loss": 0.625989556312561,
"mean_token_accuracy": 0.7449588850140572,
"num_tokens": 8480048.0,
"step": 227
},
{
"entropy": 0.6096160188317299,
"epoch": 1.7696793002915452,
"grad_norm": 0.008407268673181534,
"learning_rate": 0.0002,
"loss": 0.6082819700241089,
"mean_token_accuracy": 0.7547600343823433,
"num_tokens": 8517427.0,
"step": 228
},
{
"entropy": 0.6192163527011871,
"epoch": 1.7774538386783285,
"grad_norm": 0.007702583912760019,
"learning_rate": 0.0002,
"loss": 0.6174746751785278,
"mean_token_accuracy": 0.7493149042129517,
"num_tokens": 8554570.0,
"step": 229
},
{
"entropy": 0.6089940667152405,
"epoch": 1.7852283770651116,
"grad_norm": 0.007490647025406361,
"learning_rate": 0.0002,
"loss": 0.6111437082290649,
"mean_token_accuracy": 0.7528351470828056,
"num_tokens": 8591761.0,
"step": 230
},
{
"entropy": 0.6070573329925537,
"epoch": 1.7930029154518952,
"grad_norm": 0.008878695778548717,
"learning_rate": 0.0002,
"loss": 0.6092367172241211,
"mean_token_accuracy": 0.7542654424905777,
"num_tokens": 8628522.0,
"step": 231
},
{
"entropy": 0.617328479886055,
"epoch": 1.8007774538386783,
"grad_norm": 0.008331574499607086,
"learning_rate": 0.0002,
"loss": 0.6187005043029785,
"mean_token_accuracy": 0.7479601725935936,
"num_tokens": 8666140.0,
"step": 232
},
{
"entropy": 0.6115391552448273,
"epoch": 1.8085519922254616,
"grad_norm": 0.0087031414732337,
"learning_rate": 0.0002,
"loss": 0.6169438362121582,
"mean_token_accuracy": 0.7492516785860062,
"num_tokens": 8703399.0,
"step": 233
},
{
"entropy": 0.6166737154126167,
"epoch": 1.816326530612245,
"grad_norm": 0.008778571151196957,
"learning_rate": 0.0002,
"loss": 0.6192659139633179,
"mean_token_accuracy": 0.7489692941308022,
"num_tokens": 8741141.0,
"step": 234
},
{
"entropy": 0.6278815269470215,
"epoch": 1.824101068999028,
"grad_norm": 0.008317695930600166,
"learning_rate": 0.0002,
"loss": 0.6227933168411255,
"mean_token_accuracy": 0.7477347627282143,
"num_tokens": 8778706.0,
"step": 235
},
{
"entropy": 0.612150214612484,
"epoch": 1.8318756073858116,
"grad_norm": 0.008878265507519245,
"learning_rate": 0.0002,
"loss": 0.6094038486480713,
"mean_token_accuracy": 0.7539248242974281,
"num_tokens": 8815790.0,
"step": 236
},
{
"entropy": 0.637272298336029,
"epoch": 1.8396501457725947,
"grad_norm": 0.007240319158881903,
"learning_rate": 0.0002,
"loss": 0.6381018757820129,
"mean_token_accuracy": 0.7397879138588905,
"num_tokens": 8853228.0,
"step": 237
},
{
"entropy": 0.6079713776707649,
"epoch": 1.847424684159378,
"grad_norm": 0.008403577841818333,
"learning_rate": 0.0002,
"loss": 0.6132397651672363,
"mean_token_accuracy": 0.750219389796257,
"num_tokens": 8890524.0,
"step": 238
},
{
"entropy": 0.6004362255334854,
"epoch": 1.8551992225461613,
"grad_norm": 0.008654654026031494,
"learning_rate": 0.0002,
"loss": 0.6059733629226685,
"mean_token_accuracy": 0.7544897198677063,
"num_tokens": 8927518.0,
"step": 239
},
{
"entropy": 0.6205713227391243,
"epoch": 1.8629737609329446,
"grad_norm": 0.008852572180330753,
"learning_rate": 0.0002,
"loss": 0.6241973638534546,
"mean_token_accuracy": 0.7456497400999069,
"num_tokens": 8964770.0,
"step": 240
},
{
"entropy": 0.6309987902641296,
"epoch": 1.870748299319728,
"grad_norm": 0.00919515173882246,
"learning_rate": 0.0002,
"loss": 0.6267882585525513,
"mean_token_accuracy": 0.7451199591159821,
"num_tokens": 9002039.0,
"step": 241
},
{
"entropy": 0.6201007068157196,
"epoch": 1.878522837706511,
"grad_norm": 0.008951977826654911,
"learning_rate": 0.0002,
"loss": 0.6155404448509216,
"mean_token_accuracy": 0.7500432655215263,
"num_tokens": 9040052.0,
"step": 242
},
{
"entropy": 0.6137275472283363,
"epoch": 1.8862973760932946,
"grad_norm": 0.008249848149716854,
"learning_rate": 0.0002,
"loss": 0.6162374019622803,
"mean_token_accuracy": 0.7486926540732384,
"num_tokens": 9077331.0,
"step": 243
},
{
"entropy": 0.6179945692420006,
"epoch": 1.8940719144800777,
"grad_norm": 0.008306370116770267,
"learning_rate": 0.0002,
"loss": 0.6247057914733887,
"mean_token_accuracy": 0.7457103058695793,
"num_tokens": 9114582.0,
"step": 244
},
{
"entropy": 0.6145003139972687,
"epoch": 1.901846452866861,
"grad_norm": 0.009250648319721222,
"learning_rate": 0.0002,
"loss": 0.6231353282928467,
"mean_token_accuracy": 0.7480179741978645,
"num_tokens": 9152485.0,
"step": 245
},
{
"entropy": 0.6100682318210602,
"epoch": 1.9096209912536444,
"grad_norm": 0.008305463939905167,
"learning_rate": 0.0002,
"loss": 0.61110520362854,
"mean_token_accuracy": 0.7516937106847763,
"num_tokens": 9189875.0,
"step": 246
},
{
"entropy": 0.6206101104617119,
"epoch": 1.9173955296404275,
"grad_norm": 0.009909824468195438,
"learning_rate": 0.0002,
"loss": 0.6180837154388428,
"mean_token_accuracy": 0.7495366632938385,
"num_tokens": 9227450.0,
"step": 247
},
{
"entropy": 0.6217730790376663,
"epoch": 1.925170068027211,
"grad_norm": 0.008246448822319508,
"learning_rate": 0.0002,
"loss": 0.6189583539962769,
"mean_token_accuracy": 0.7493142858147621,
"num_tokens": 9265223.0,
"step": 248
},
{
"entropy": 0.6133992001414299,
"epoch": 1.9329446064139941,
"grad_norm": 0.007729528471827507,
"learning_rate": 0.0002,
"loss": 0.6164335608482361,
"mean_token_accuracy": 0.7500994428992271,
"num_tokens": 9302597.0,
"step": 249
},
{
"entropy": 0.596331886947155,
"epoch": 1.9407191448007775,
"grad_norm": 0.00885640550404787,
"learning_rate": 0.0002,
"loss": 0.6054399013519287,
"mean_token_accuracy": 0.7546022981405258,
"num_tokens": 9339665.0,
"step": 250
},
{
"entropy": 0.6010145470499992,
"epoch": 1.9484936831875608,
"grad_norm": 0.00908851157873869,
"learning_rate": 0.0002,
"loss": 0.6051974296569824,
"mean_token_accuracy": 0.7543318867683411,
"num_tokens": 9376514.0,
"step": 251
},
{
"entropy": 0.6160777136683464,
"epoch": 1.9562682215743439,
"grad_norm": 0.008100342005491257,
"learning_rate": 0.0002,
"loss": 0.6146577000617981,
"mean_token_accuracy": 0.7485847100615501,
"num_tokens": 9414214.0,
"step": 252
},
{
"entropy": 0.6268075257539749,
"epoch": 1.9640427599611274,
"grad_norm": 0.009163864888250828,
"learning_rate": 0.0002,
"loss": 0.6204258799552917,
"mean_token_accuracy": 0.7494765147566795,
"num_tokens": 9451946.0,
"step": 253
},
{
"entropy": 0.6106092482805252,
"epoch": 1.9718172983479105,
"grad_norm": 0.007819678634405136,
"learning_rate": 0.0002,
"loss": 0.6087175011634827,
"mean_token_accuracy": 0.7527309507131577,
"num_tokens": 9489076.0,
"step": 254
},
{
"entropy": 0.6168656274676323,
"epoch": 1.9795918367346939,
"grad_norm": 0.007515368517488241,
"learning_rate": 0.0002,
"loss": 0.6177273392677307,
"mean_token_accuracy": 0.751363955438137,
"num_tokens": 9526620.0,
"step": 255
},
{
"entropy": 0.6079138219356537,
"epoch": 1.9873663751214772,
"grad_norm": 0.009815288707613945,
"learning_rate": 0.0002,
"loss": 0.6155093312263489,
"mean_token_accuracy": 0.7523162961006165,
"num_tokens": 9564466.0,
"step": 256
},
{
"entropy": 0.6036990880966187,
"epoch": 1.9951409135082603,
"grad_norm": 0.008685542270541191,
"learning_rate": 0.0002,
"loss": 0.6101571917533875,
"mean_token_accuracy": 0.7522860541939735,
"num_tokens": 9601565.0,
"step": 257
},
{
"entropy": 0.6164417505264282,
"epoch": 2.0,
"grad_norm": 0.010608273558318615,
"learning_rate": 0.0002,
"loss": 0.6168809533119202,
"mean_token_accuracy": 0.7516962647438049,
"num_tokens": 9625165.0,
"step": 258
},
{
"entropy": 0.6057095304131508,
"epoch": 2.007774538386783,
"grad_norm": 0.009618077427148819,
"learning_rate": 0.0002,
"loss": 0.6003708839416504,
"mean_token_accuracy": 0.7543603405356407,
"num_tokens": 9662658.0,
"step": 259
},
{
"entropy": 0.6160204112529755,
"epoch": 2.0155490767735667,
"grad_norm": 0.007366312202066183,
"learning_rate": 0.0002,
"loss": 0.6107323169708252,
"mean_token_accuracy": 0.751634031534195,
"num_tokens": 9700423.0,
"step": 260
},
{
"entropy": 0.6157180666923523,
"epoch": 2.0233236151603498,
"grad_norm": 0.008381242863833904,
"learning_rate": 0.0002,
"loss": 0.6190871596336365,
"mean_token_accuracy": 0.7481335178017616,
"num_tokens": 9737692.0,
"step": 261
},
{
"entropy": 0.6075473129749298,
"epoch": 2.0310981535471333,
"grad_norm": 0.010082116350531578,
"learning_rate": 0.0002,
"loss": 0.6141625642776489,
"mean_token_accuracy": 0.7516499608755112,
"num_tokens": 9775062.0,
"step": 262
},
{
"entropy": 0.6151047423481941,
"epoch": 2.0388726919339164,
"grad_norm": 0.009529951959848404,
"learning_rate": 0.0002,
"loss": 0.6205469965934753,
"mean_token_accuracy": 0.7464399412274361,
"num_tokens": 9812526.0,
"step": 263
},
{
"entropy": 0.6053090617060661,
"epoch": 2.0466472303206995,
"grad_norm": 0.008532468229532242,
"learning_rate": 0.0002,
"loss": 0.604971170425415,
"mean_token_accuracy": 0.7544130459427834,
"num_tokens": 9849685.0,
"step": 264
},
{
"entropy": 0.6305021941661835,
"epoch": 2.054421768707483,
"grad_norm": 0.009080994874238968,
"learning_rate": 0.0002,
"loss": 0.6241769790649414,
"mean_token_accuracy": 0.7455881908535957,
"num_tokens": 9887441.0,
"step": 265
},
{
"entropy": 0.6111467704176903,
"epoch": 2.062196307094266,
"grad_norm": 0.008834858424961567,
"learning_rate": 0.0002,
"loss": 0.6073428392410278,
"mean_token_accuracy": 0.7530370578169823,
"num_tokens": 9924611.0,
"step": 266
},
{
"entropy": 0.6218099594116211,
"epoch": 2.0699708454810497,
"grad_norm": 0.009297652170062065,
"learning_rate": 0.0002,
"loss": 0.6261637806892395,
"mean_token_accuracy": 0.7442486062645912,
"num_tokens": 9962409.0,
"step": 267
},
{
"entropy": 0.620900422334671,
"epoch": 2.077745383867833,
"grad_norm": 0.012807542458176613,
"learning_rate": 0.0002,
"loss": 0.6319394111633301,
"mean_token_accuracy": 0.7447366267442703,
"num_tokens": 9999911.0,
"step": 268
},
{
"entropy": 0.6219062060117722,
"epoch": 2.0855199222546164,
"grad_norm": 0.008311600424349308,
"learning_rate": 0.0002,
"loss": 0.6196457147598267,
"mean_token_accuracy": 0.7454339265823364,
"num_tokens": 10037309.0,
"step": 269
},
{
"entropy": 0.6179447770118713,
"epoch": 2.0932944606413995,
"grad_norm": 0.010762435384094715,
"learning_rate": 0.0002,
"loss": 0.6135507822036743,
"mean_token_accuracy": 0.7513665333390236,
"num_tokens": 10074802.0,
"step": 270
},
{
"entropy": 0.6114057898521423,
"epoch": 2.1010689990281826,
"grad_norm": 0.009498962201178074,
"learning_rate": 0.0002,
"loss": 0.6119563579559326,
"mean_token_accuracy": 0.7511925473809242,
"num_tokens": 10112087.0,
"step": 271
},
{
"entropy": 0.5985657572746277,
"epoch": 2.108843537414966,
"grad_norm": 0.00927242822945118,
"learning_rate": 0.0002,
"loss": 0.6077044010162354,
"mean_token_accuracy": 0.751846119761467,
"num_tokens": 10149470.0,
"step": 272
},
{
"entropy": 0.5983473360538483,
"epoch": 2.116618075801749,
"grad_norm": 0.011125227436423302,
"learning_rate": 0.0002,
"loss": 0.6070785522460938,
"mean_token_accuracy": 0.7521045431494713,
"num_tokens": 10187018.0,
"step": 273
},
{
"entropy": 0.6010436862707138,
"epoch": 2.1243926141885328,
"grad_norm": 0.008612287230789661,
"learning_rate": 0.0002,
"loss": 0.6019182205200195,
"mean_token_accuracy": 0.7563453242182732,
"num_tokens": 10224534.0,
"step": 274
},
{
"entropy": 0.6097739785909653,
"epoch": 2.132167152575316,
"grad_norm": 0.009082912467420101,
"learning_rate": 0.0002,
"loss": 0.6092417240142822,
"mean_token_accuracy": 0.7527365237474442,
"num_tokens": 10261606.0,
"step": 275
},
{
"entropy": 0.6300967186689377,
"epoch": 2.139941690962099,
"grad_norm": 0.00942782312631607,
"learning_rate": 0.0002,
"loss": 0.6258421540260315,
"mean_token_accuracy": 0.7469290718436241,
"num_tokens": 10299180.0,
"step": 276
},
{
"entropy": 0.6028410047292709,
"epoch": 2.1477162293488825,
"grad_norm": 0.008522949181497097,
"learning_rate": 0.0002,
"loss": 0.6008127927780151,
"mean_token_accuracy": 0.7564279735088348,
"num_tokens": 10336360.0,
"step": 277
},
{
"entropy": 0.6102243736386299,
"epoch": 2.1554907677356656,
"grad_norm": 0.010031149722635746,
"learning_rate": 0.0002,
"loss": 0.6199367046356201,
"mean_token_accuracy": 0.7469272315502167,
"num_tokens": 10373565.0,
"step": 278
},
{
"entropy": 0.6027829498052597,
"epoch": 2.163265306122449,
"grad_norm": 0.008753525093197823,
"learning_rate": 0.0002,
"loss": 0.6074038147926331,
"mean_token_accuracy": 0.7534594535827637,
"num_tokens": 10411197.0,
"step": 279
},
{
"entropy": 0.6299364790320396,
"epoch": 2.1710398445092323,
"grad_norm": 0.007901565171778202,
"learning_rate": 0.0002,
"loss": 0.6327069401741028,
"mean_token_accuracy": 0.7429891973733902,
"num_tokens": 10448851.0,
"step": 280
},
{
"entropy": 0.623109444975853,
"epoch": 2.1788143828960154,
"grad_norm": 0.008401944302022457,
"learning_rate": 0.0002,
"loss": 0.6217602491378784,
"mean_token_accuracy": 0.7446876764297485,
"num_tokens": 10486285.0,
"step": 281
},
{
"entropy": 0.5951671376824379,
"epoch": 2.186588921282799,
"grad_norm": 0.009740160778164864,
"learning_rate": 0.0002,
"loss": 0.5930252075195312,
"mean_token_accuracy": 0.7590748071670532,
"num_tokens": 10523187.0,
"step": 282
},
{
"entropy": 0.6063435301184654,
"epoch": 2.194363459669582,
"grad_norm": 0.008115135133266449,
"learning_rate": 0.0002,
"loss": 0.6058975458145142,
"mean_token_accuracy": 0.7546751350164413,
"num_tokens": 10560619.0,
"step": 283
},
{
"entropy": 0.6197424605488777,
"epoch": 2.2021379980563656,
"grad_norm": 0.007982614450156689,
"learning_rate": 0.0002,
"loss": 0.6196328401565552,
"mean_token_accuracy": 0.7473800256848335,
"num_tokens": 10597952.0,
"step": 284
},
{
"entropy": 0.5975362882018089,
"epoch": 2.2099125364431487,
"grad_norm": 0.008934210054576397,
"learning_rate": 0.0002,
"loss": 0.6019341945648193,
"mean_token_accuracy": 0.7551193311810493,
"num_tokens": 10635474.0,
"step": 285
},
{
"entropy": 0.6057508885860443,
"epoch": 2.2176870748299318,
"grad_norm": 0.007894222624599934,
"learning_rate": 0.0002,
"loss": 0.6054433584213257,
"mean_token_accuracy": 0.7555015385150909,
"num_tokens": 10672866.0,
"step": 286
},
{
"entropy": 0.6011307016015053,
"epoch": 2.2254616132167153,
"grad_norm": 0.008009341545403004,
"learning_rate": 0.0002,
"loss": 0.6015121936798096,
"mean_token_accuracy": 0.7533531039953232,
"num_tokens": 10710119.0,
"step": 287
},
{
"entropy": 0.6083035543560982,
"epoch": 2.2332361516034984,
"grad_norm": 0.008571778424084187,
"learning_rate": 0.0002,
"loss": 0.6072158813476562,
"mean_token_accuracy": 0.7525660693645477,
"num_tokens": 10747533.0,
"step": 288
},
{
"entropy": 0.596297912299633,
"epoch": 2.241010689990282,
"grad_norm": 0.007835134863853455,
"learning_rate": 0.0002,
"loss": 0.6007227897644043,
"mean_token_accuracy": 0.75400510430336,
"num_tokens": 10784600.0,
"step": 289
},
{
"entropy": 0.6027623787522316,
"epoch": 2.248785228377065,
"grad_norm": 0.00971238687634468,
"learning_rate": 0.0002,
"loss": 0.6095942258834839,
"mean_token_accuracy": 0.753618136048317,
"num_tokens": 10822085.0,
"step": 290
},
{
"entropy": 0.596187099814415,
"epoch": 2.256559766763848,
"grad_norm": 0.008036565966904163,
"learning_rate": 0.0002,
"loss": 0.5973517298698425,
"mean_token_accuracy": 0.7577640637755394,
"num_tokens": 10859362.0,
"step": 291
},
{
"entropy": 0.6243500411510468,
"epoch": 2.2643343051506317,
"grad_norm": 0.00934487022459507,
"learning_rate": 0.0002,
"loss": 0.6226072311401367,
"mean_token_accuracy": 0.7454966679215431,
"num_tokens": 10896757.0,
"step": 292
},
{
"entropy": 0.6136296838521957,
"epoch": 2.272108843537415,
"grad_norm": 0.008677436038851738,
"learning_rate": 0.0002,
"loss": 0.615119457244873,
"mean_token_accuracy": 0.750088632106781,
"num_tokens": 10934016.0,
"step": 293
},
{
"entropy": 0.5983113646507263,
"epoch": 2.2798833819241984,
"grad_norm": 0.007704727817326784,
"learning_rate": 0.0002,
"loss": 0.5992428064346313,
"mean_token_accuracy": 0.7575259953737259,
"num_tokens": 10971732.0,
"step": 294
},
{
"entropy": 0.602768175303936,
"epoch": 2.2876579203109815,
"grad_norm": 0.008800746873021126,
"learning_rate": 0.0002,
"loss": 0.6059098243713379,
"mean_token_accuracy": 0.7514860853552818,
"num_tokens": 11009363.0,
"step": 295
},
{
"entropy": 0.6180300787091255,
"epoch": 2.295432458697765,
"grad_norm": 0.009863065555691719,
"learning_rate": 0.0002,
"loss": 0.6232578754425049,
"mean_token_accuracy": 0.7460011914372444,
"num_tokens": 11046850.0,
"step": 296
},
{
"entropy": 0.615628756582737,
"epoch": 2.303206997084548,
"grad_norm": 0.00794578343629837,
"learning_rate": 0.0002,
"loss": 0.6193504929542542,
"mean_token_accuracy": 0.7466345354914665,
"num_tokens": 11084028.0,
"step": 297
},
{
"entropy": 0.6079032048583031,
"epoch": 2.3109815354713312,
"grad_norm": 0.008673022501170635,
"learning_rate": 0.0002,
"loss": 0.6060619354248047,
"mean_token_accuracy": 0.7532483711838722,
"num_tokens": 11121691.0,
"step": 298
},
{
"entropy": 0.6126295253634453,
"epoch": 2.3187560738581148,
"grad_norm": 0.010211586020886898,
"learning_rate": 0.0002,
"loss": 0.6097185611724854,
"mean_token_accuracy": 0.7503807097673416,
"num_tokens": 11159118.0,
"step": 299
},
{
"entropy": 0.6223906055092812,
"epoch": 2.326530612244898,
"grad_norm": 0.007925095036625862,
"learning_rate": 0.0002,
"loss": 0.6250431537628174,
"mean_token_accuracy": 0.7459972500801086,
"num_tokens": 11196522.0,
"step": 300
},
{
"entropy": 0.6105447709560394,
"epoch": 2.3343051506316814,
"grad_norm": 0.008913103491067886,
"learning_rate": 0.0002,
"loss": 0.616736114025116,
"mean_token_accuracy": 0.749770350754261,
"num_tokens": 11234173.0,
"step": 301
},
{
"entropy": 0.6050237938761711,
"epoch": 2.3420796890184645,
"grad_norm": 0.00913191493600607,
"learning_rate": 0.0002,
"loss": 0.6078106164932251,
"mean_token_accuracy": 0.7534833922982216,
"num_tokens": 11271528.0,
"step": 302
},
{
"entropy": 0.624389261007309,
"epoch": 2.3498542274052476,
"grad_norm": 0.00800058338791132,
"learning_rate": 0.0002,
"loss": 0.624384880065918,
"mean_token_accuracy": 0.7484247088432312,
"num_tokens": 11309275.0,
"step": 303
},
{
"entropy": 0.621875673532486,
"epoch": 2.357628765792031,
"grad_norm": 0.009797596372663975,
"learning_rate": 0.0002,
"loss": 0.6190812587738037,
"mean_token_accuracy": 0.7491643279790878,
"num_tokens": 11346386.0,
"step": 304
},
{
"entropy": 0.6205748915672302,
"epoch": 2.3654033041788143,
"grad_norm": 0.009043901227414608,
"learning_rate": 0.0002,
"loss": 0.616840124130249,
"mean_token_accuracy": 0.7496623322367668,
"num_tokens": 11383273.0,
"step": 305
},
{
"entropy": 0.5943257734179497,
"epoch": 2.373177842565598,
"grad_norm": 0.009680100716650486,
"learning_rate": 0.0002,
"loss": 0.6005733013153076,
"mean_token_accuracy": 0.7566492632031441,
"num_tokens": 11420226.0,
"step": 306
},
{
"entropy": 0.5875989943742752,
"epoch": 2.380952380952381,
"grad_norm": 0.009831924922764301,
"learning_rate": 0.0002,
"loss": 0.5920431613922119,
"mean_token_accuracy": 0.758441336452961,
"num_tokens": 11457658.0,
"step": 307
},
{
"entropy": 0.605907216668129,
"epoch": 2.388726919339164,
"grad_norm": 0.008310995064675808,
"learning_rate": 0.0002,
"loss": 0.606610894203186,
"mean_token_accuracy": 0.7539205178618431,
"num_tokens": 11495093.0,
"step": 308
},
{
"entropy": 0.6085820719599724,
"epoch": 2.3965014577259476,
"grad_norm": 0.008422457613050938,
"learning_rate": 0.0002,
"loss": 0.6112357378005981,
"mean_token_accuracy": 0.7495599314570427,
"num_tokens": 11532305.0,
"step": 309
},
{
"entropy": 0.6038077920675278,
"epoch": 2.4042759961127307,
"grad_norm": 0.009313938207924366,
"learning_rate": 0.0002,
"loss": 0.6037260293960571,
"mean_token_accuracy": 0.7537373602390289,
"num_tokens": 11569956.0,
"step": 310
},
{
"entropy": 0.6088597327470779,
"epoch": 2.4120505344995142,
"grad_norm": 0.008129115216434002,
"learning_rate": 0.0002,
"loss": 0.6097284555435181,
"mean_token_accuracy": 0.752282939851284,
"num_tokens": 11607580.0,
"step": 311
},
{
"entropy": 0.6035630702972412,
"epoch": 2.4198250728862973,
"grad_norm": 0.010189153254032135,
"learning_rate": 0.0002,
"loss": 0.6098878383636475,
"mean_token_accuracy": 0.7509205341339111,
"num_tokens": 11645065.0,
"step": 312
},
{
"entropy": 0.5988744720816612,
"epoch": 2.427599611273081,
"grad_norm": 0.008477658964693546,
"learning_rate": 0.0002,
"loss": 0.600048840045929,
"mean_token_accuracy": 0.7566671743988991,
"num_tokens": 11682523.0,
"step": 313
},
{
"entropy": 0.604704961180687,
"epoch": 2.435374149659864,
"grad_norm": 0.009996007196605206,
"learning_rate": 0.0002,
"loss": 0.6124827861785889,
"mean_token_accuracy": 0.7483595088124275,
"num_tokens": 11719829.0,
"step": 314
},
{
"entropy": 0.6142484471201897,
"epoch": 2.443148688046647,
"grad_norm": 0.008275930769741535,
"learning_rate": 0.0002,
"loss": 0.6168549060821533,
"mean_token_accuracy": 0.7509273141622543,
"num_tokens": 11757130.0,
"step": 315
},
{
"entropy": 0.618528425693512,
"epoch": 2.4509232264334306,
"grad_norm": 0.00913267582654953,
"learning_rate": 0.0002,
"loss": 0.6144739985466003,
"mean_token_accuracy": 0.7495302185416222,
"num_tokens": 11794646.0,
"step": 316
},
{
"entropy": 0.6221663355827332,
"epoch": 2.4586977648202137,
"grad_norm": 0.008833467960357666,
"learning_rate": 0.0002,
"loss": 0.6160144805908203,
"mean_token_accuracy": 0.7488524913787842,
"num_tokens": 11832667.0,
"step": 317
},
{
"entropy": 0.6151534616947174,
"epoch": 2.466472303206997,
"grad_norm": 0.008367245085537434,
"learning_rate": 0.0002,
"loss": 0.6178625226020813,
"mean_token_accuracy": 0.7469210624694824,
"num_tokens": 11870196.0,
"step": 318
},
{
"entropy": 0.599577471613884,
"epoch": 2.4742468415937804,
"grad_norm": 0.008229793980717659,
"learning_rate": 0.0002,
"loss": 0.6013622283935547,
"mean_token_accuracy": 0.7555016428232193,
"num_tokens": 11907738.0,
"step": 319
},
{
"entropy": 0.6037501096725464,
"epoch": 2.4820213799805635,
"grad_norm": 0.009975764900445938,
"learning_rate": 0.0002,
"loss": 0.6080362796783447,
"mean_token_accuracy": 0.754118837416172,
"num_tokens": 11945154.0,
"step": 320
},
{
"entropy": 0.6234212592244148,
"epoch": 2.489795918367347,
"grad_norm": 0.009158926084637642,
"learning_rate": 0.0002,
"loss": 0.6259138584136963,
"mean_token_accuracy": 0.7461888268589973,
"num_tokens": 11983030.0,
"step": 321
},
{
"entropy": 0.6105703264474869,
"epoch": 2.49757045675413,
"grad_norm": 0.009549647569656372,
"learning_rate": 0.0002,
"loss": 0.6138617992401123,
"mean_token_accuracy": 0.7500449195504189,
"num_tokens": 12020106.0,
"step": 322
},
{
"entropy": 0.5886913314461708,
"epoch": 2.5053449951409137,
"grad_norm": 0.009142185561358929,
"learning_rate": 0.0002,
"loss": 0.5951993465423584,
"mean_token_accuracy": 0.7568985298275948,
"num_tokens": 12057274.0,
"step": 323
},
{
"entropy": 0.6163628548383713,
"epoch": 2.513119533527697,
"grad_norm": 0.008757554925978184,
"learning_rate": 0.0002,
"loss": 0.6170852184295654,
"mean_token_accuracy": 0.749226838350296,
"num_tokens": 12094665.0,
"step": 324
},
{
"entropy": 0.6229220703244209,
"epoch": 2.52089407191448,
"grad_norm": 0.007944419980049133,
"learning_rate": 0.0002,
"loss": 0.6211696267127991,
"mean_token_accuracy": 0.749010942876339,
"num_tokens": 12132302.0,
"step": 325
},
{
"entropy": 0.6257840767502785,
"epoch": 2.5286686103012634,
"grad_norm": 0.008713958784937859,
"learning_rate": 0.0002,
"loss": 0.6223682165145874,
"mean_token_accuracy": 0.7470938488841057,
"num_tokens": 12169510.0,
"step": 326
},
{
"entropy": 0.6103069111704826,
"epoch": 2.5364431486880465,
"grad_norm": 0.008112641051411629,
"learning_rate": 0.0002,
"loss": 0.6112810969352722,
"mean_token_accuracy": 0.7517933994531631,
"num_tokens": 12206878.0,
"step": 327
},
{
"entropy": 0.6295960918068886,
"epoch": 2.54421768707483,
"grad_norm": 0.009597997181117535,
"learning_rate": 0.0002,
"loss": 0.6329588890075684,
"mean_token_accuracy": 0.7417808771133423,
"num_tokens": 12244230.0,
"step": 328
},
{
"entropy": 0.6144092008471489,
"epoch": 2.551992225461613,
"grad_norm": 0.007173395249992609,
"learning_rate": 0.0002,
"loss": 0.6167792081832886,
"mean_token_accuracy": 0.750128723680973,
"num_tokens": 12281944.0,
"step": 329
},
{
"entropy": 0.6102811768651009,
"epoch": 2.5597667638483967,
"grad_norm": 0.00874980166554451,
"learning_rate": 0.0002,
"loss": 0.6081819534301758,
"mean_token_accuracy": 0.7545690611004829,
"num_tokens": 12319144.0,
"step": 330
},
{
"entropy": 0.6088513135910034,
"epoch": 2.56754130223518,
"grad_norm": 0.007437287364155054,
"learning_rate": 0.0002,
"loss": 0.610903799533844,
"mean_token_accuracy": 0.7525679916143417,
"num_tokens": 12356752.0,
"step": 331
},
{
"entropy": 0.605910450220108,
"epoch": 2.575315840621963,
"grad_norm": 0.008948191069066525,
"learning_rate": 0.0002,
"loss": 0.6137778759002686,
"mean_token_accuracy": 0.7502530664205551,
"num_tokens": 12394388.0,
"step": 332
},
{
"entropy": 0.6148117780685425,
"epoch": 2.5830903790087465,
"grad_norm": 0.008310764096677303,
"learning_rate": 0.0002,
"loss": 0.6203396320343018,
"mean_token_accuracy": 0.7478612065315247,
"num_tokens": 12431583.0,
"step": 333
},
{
"entropy": 0.6049426943063736,
"epoch": 2.5908649173955296,
"grad_norm": 0.00928961019963026,
"learning_rate": 0.0002,
"loss": 0.6102631688117981,
"mean_token_accuracy": 0.7530224993824959,
"num_tokens": 12469057.0,
"step": 334
},
{
"entropy": 0.6105730906128883,
"epoch": 2.5986394557823127,
"grad_norm": 0.008061802014708519,
"learning_rate": 0.0002,
"loss": 0.6099789142608643,
"mean_token_accuracy": 0.7517432495951653,
"num_tokens": 12506375.0,
"step": 335
},
{
"entropy": 0.6109907403588295,
"epoch": 2.6064139941690962,
"grad_norm": 0.008131072856485844,
"learning_rate": 0.0002,
"loss": 0.6083254814147949,
"mean_token_accuracy": 0.7539641037583351,
"num_tokens": 12543683.0,
"step": 336
},
{
"entropy": 0.60856644064188,
"epoch": 2.6141885325558794,
"grad_norm": 0.008039598353207111,
"learning_rate": 0.0002,
"loss": 0.6059796810150146,
"mean_token_accuracy": 0.7539034485816956,
"num_tokens": 12581164.0,
"step": 337
},
{
"entropy": 0.6075717508792877,
"epoch": 2.621963070942663,
"grad_norm": 0.007622460834681988,
"learning_rate": 0.0002,
"loss": 0.6058254241943359,
"mean_token_accuracy": 0.755204826593399,
"num_tokens": 12618385.0,
"step": 338
},
{
"entropy": 0.6058209240436554,
"epoch": 2.629737609329446,
"grad_norm": 0.009571490809321404,
"learning_rate": 0.0002,
"loss": 0.6132853031158447,
"mean_token_accuracy": 0.7517998144030571,
"num_tokens": 12656198.0,
"step": 339
},
{
"entropy": 0.609808899462223,
"epoch": 2.6375121477162295,
"grad_norm": 0.009121098555624485,
"learning_rate": 0.0002,
"loss": 0.6116859912872314,
"mean_token_accuracy": 0.7522552087903023,
"num_tokens": 12693619.0,
"step": 340
},
{
"entropy": 0.5982947275042534,
"epoch": 2.6452866861030127,
"grad_norm": 0.007683332543820143,
"learning_rate": 0.0002,
"loss": 0.6035135984420776,
"mean_token_accuracy": 0.7554004937410355,
"num_tokens": 12731247.0,
"step": 341
},
{
"entropy": 0.6199963241815567,
"epoch": 2.6530612244897958,
"grad_norm": 0.008116503246128559,
"learning_rate": 0.0002,
"loss": 0.6209834814071655,
"mean_token_accuracy": 0.7469918876886368,
"num_tokens": 12768639.0,
"step": 342
},
{
"entropy": 0.611749030649662,
"epoch": 2.6608357628765793,
"grad_norm": 0.009202837944030762,
"learning_rate": 0.0002,
"loss": 0.609596848487854,
"mean_token_accuracy": 0.7527265250682831,
"num_tokens": 12805843.0,
"step": 343
},
{
"entropy": 0.6049032211303711,
"epoch": 2.6686103012633624,
"grad_norm": 0.008622320368885994,
"learning_rate": 0.0002,
"loss": 0.6062831282615662,
"mean_token_accuracy": 0.7529996708035469,
"num_tokens": 12843334.0,
"step": 344
},
{
"entropy": 0.6080296412110329,
"epoch": 2.6763848396501455,
"grad_norm": 0.010344683192670345,
"learning_rate": 0.0002,
"loss": 0.6155232787132263,
"mean_token_accuracy": 0.7492252364754677,
"num_tokens": 12881114.0,
"step": 345
},
{
"entropy": 0.6105146557092667,
"epoch": 2.684159378036929,
"grad_norm": 0.00811974797397852,
"learning_rate": 0.0002,
"loss": 0.61601722240448,
"mean_token_accuracy": 0.7480410560965538,
"num_tokens": 12918628.0,
"step": 346
},
{
"entropy": 0.616872251033783,
"epoch": 2.6919339164237126,
"grad_norm": 0.009087933227419853,
"learning_rate": 0.0002,
"loss": 0.6140284538269043,
"mean_token_accuracy": 0.7496198862791061,
"num_tokens": 12955856.0,
"step": 347
},
{
"entropy": 0.6135741174221039,
"epoch": 2.6997084548104957,
"grad_norm": 0.008728091605007648,
"learning_rate": 0.0002,
"loss": 0.6116735935211182,
"mean_token_accuracy": 0.7527862265706062,
"num_tokens": 12993282.0,
"step": 348
},
{
"entropy": 0.6206527948379517,
"epoch": 2.707482993197279,
"grad_norm": 0.008598288521170616,
"learning_rate": 0.0002,
"loss": 0.6233333349227905,
"mean_token_accuracy": 0.7463840544223785,
"num_tokens": 13030919.0,
"step": 349
},
{
"entropy": 0.608021192252636,
"epoch": 2.7152575315840624,
"grad_norm": 0.008716718293726444,
"learning_rate": 0.0002,
"loss": 0.612204909324646,
"mean_token_accuracy": 0.7511651292443275,
"num_tokens": 13068022.0,
"step": 350
},
{
"entropy": 0.6055907234549522,
"epoch": 2.7230320699708455,
"grad_norm": 0.007125901058316231,
"learning_rate": 0.0002,
"loss": 0.6055992841720581,
"mean_token_accuracy": 0.753873273730278,
"num_tokens": 13105324.0,
"step": 351
},
{
"entropy": 0.6134061738848686,
"epoch": 2.7308066083576286,
"grad_norm": 0.007964730262756348,
"learning_rate": 0.0002,
"loss": 0.6122632026672363,
"mean_token_accuracy": 0.7516495808959007,
"num_tokens": 13143067.0,
"step": 352
},
{
"entropy": 0.6035361513495445,
"epoch": 2.738581146744412,
"grad_norm": 0.008376477286219597,
"learning_rate": 0.0002,
"loss": 0.6055692434310913,
"mean_token_accuracy": 0.7536868900060654,
"num_tokens": 13180307.0,
"step": 353
},
{
"entropy": 0.6108582690358162,
"epoch": 2.746355685131195,
"grad_norm": 0.008256555534899235,
"learning_rate": 0.0002,
"loss": 0.6159192323684692,
"mean_token_accuracy": 0.7500140145421028,
"num_tokens": 13217651.0,
"step": 354
},
{
"entropy": 0.6065188273787498,
"epoch": 2.7541302235179788,
"grad_norm": 0.007910750806331635,
"learning_rate": 0.0002,
"loss": 0.6087648868560791,
"mean_token_accuracy": 0.7539975792169571,
"num_tokens": 13255245.0,
"step": 355
},
{
"entropy": 0.6058445647358894,
"epoch": 2.761904761904762,
"grad_norm": 0.007995028980076313,
"learning_rate": 0.0002,
"loss": 0.6082870960235596,
"mean_token_accuracy": 0.7520255744457245,
"num_tokens": 13293244.0,
"step": 356
},
{
"entropy": 0.6188160851597786,
"epoch": 2.7696793002915454,
"grad_norm": 0.008255942724645138,
"learning_rate": 0.0002,
"loss": 0.615801990032196,
"mean_token_accuracy": 0.7498086243867874,
"num_tokens": 13330234.0,
"step": 357
},
{
"entropy": 0.6236889883875847,
"epoch": 2.7774538386783285,
"grad_norm": 0.007726432289928198,
"learning_rate": 0.0002,
"loss": 0.6215789914131165,
"mean_token_accuracy": 0.7462954670190811,
"num_tokens": 13367753.0,
"step": 358
},
{
"entropy": 0.6057674139738083,
"epoch": 2.7852283770651116,
"grad_norm": 0.007486944552510977,
"learning_rate": 0.0002,
"loss": 0.6107175946235657,
"mean_token_accuracy": 0.7536005079746246,
"num_tokens": 13405367.0,
"step": 359
},
{
"entropy": 0.6108546778559685,
"epoch": 2.793002915451895,
"grad_norm": 0.00800468772649765,
"learning_rate": 0.0002,
"loss": 0.6151923537254333,
"mean_token_accuracy": 0.7498300299048424,
"num_tokens": 13442458.0,
"step": 360
},
{
"entropy": 0.611615277826786,
"epoch": 2.8007774538386783,
"grad_norm": 0.008358453400433064,
"learning_rate": 0.0002,
"loss": 0.6143432855606079,
"mean_token_accuracy": 0.7498634308576584,
"num_tokens": 13479706.0,
"step": 361
},
{
"entropy": 0.6097937971353531,
"epoch": 2.8085519922254614,
"grad_norm": 0.008056551218032837,
"learning_rate": 0.0002,
"loss": 0.6140632629394531,
"mean_token_accuracy": 0.7493433877825737,
"num_tokens": 13517106.0,
"step": 362
},
{
"entropy": 0.6036530286073685,
"epoch": 2.816326530612245,
"grad_norm": 0.008669313974678516,
"learning_rate": 0.0002,
"loss": 0.604174792766571,
"mean_token_accuracy": 0.755392961204052,
"num_tokens": 13554029.0,
"step": 363
},
{
"entropy": 0.6074316874146461,
"epoch": 2.824101068999028,
"grad_norm": 0.008313254453241825,
"learning_rate": 0.0002,
"loss": 0.6034117937088013,
"mean_token_accuracy": 0.7538974210619926,
"num_tokens": 13591496.0,
"step": 364
},
{
"entropy": 0.625335082411766,
"epoch": 2.8318756073858116,
"grad_norm": 0.00826285034418106,
"learning_rate": 0.0002,
"loss": 0.6179195642471313,
"mean_token_accuracy": 0.7473107278347015,
"num_tokens": 13629175.0,
"step": 365
},
{
"entropy": 0.6023752987384796,
"epoch": 2.8396501457725947,
"grad_norm": 0.008760266937315464,
"learning_rate": 0.0002,
"loss": 0.6035041809082031,
"mean_token_accuracy": 0.752547599375248,
"num_tokens": 13666378.0,
"step": 366
},
{
"entropy": 0.6186700463294983,
"epoch": 2.847424684159378,
"grad_norm": 0.009422390721738338,
"learning_rate": 0.0002,
"loss": 0.6255558133125305,
"mean_token_accuracy": 0.7451329976320267,
"num_tokens": 13704147.0,
"step": 367
},
{
"entropy": 0.6027014032006264,
"epoch": 2.8551992225461613,
"grad_norm": 0.007943754084408283,
"learning_rate": 0.0002,
"loss": 0.6077042818069458,
"mean_token_accuracy": 0.7518687173724174,
"num_tokens": 13741252.0,
"step": 368
},
{
"entropy": 0.6081340312957764,
"epoch": 2.8629737609329444,
"grad_norm": 0.008472657762467861,
"learning_rate": 0.0002,
"loss": 0.6082110404968262,
"mean_token_accuracy": 0.7499295845627785,
"num_tokens": 13778637.0,
"step": 369
},
{
"entropy": 0.6041673645377159,
"epoch": 2.870748299319728,
"grad_norm": 0.008525537326931953,
"learning_rate": 0.0002,
"loss": 0.6059847474098206,
"mean_token_accuracy": 0.7531944662332535,
"num_tokens": 13816076.0,
"step": 370
},
{
"entropy": 0.6156945377588272,
"epoch": 2.878522837706511,
"grad_norm": 0.007397054228931665,
"learning_rate": 0.0002,
"loss": 0.6175694465637207,
"mean_token_accuracy": 0.7489196062088013,
"num_tokens": 13853700.0,
"step": 371
},
{
"entropy": 0.6109963580965996,
"epoch": 2.8862973760932946,
"grad_norm": 0.008632549084722996,
"learning_rate": 0.0002,
"loss": 0.6189043521881104,
"mean_token_accuracy": 0.7480105683207512,
"num_tokens": 13890909.0,
"step": 372
},
{
"entropy": 0.60771045088768,
"epoch": 2.8940719144800777,
"grad_norm": 0.008767201565206051,
"learning_rate": 0.0002,
"loss": 0.6133548021316528,
"mean_token_accuracy": 0.7522530779242516,
"num_tokens": 13928292.0,
"step": 373
},
{
"entropy": 0.6067496612668037,
"epoch": 2.9018464528668613,
"grad_norm": 0.007676385343074799,
"learning_rate": 0.0002,
"loss": 0.60523521900177,
"mean_token_accuracy": 0.754976786673069,
"num_tokens": 13965803.0,
"step": 374
},
{
"entropy": 0.6119726821780205,
"epoch": 2.9096209912536444,
"grad_norm": 0.007059477269649506,
"learning_rate": 0.0002,
"loss": 0.6106954216957092,
"mean_token_accuracy": 0.7522552087903023,
"num_tokens": 14002852.0,
"step": 375
},
{
"entropy": 0.6248558238148689,
"epoch": 2.9173955296404275,
"grad_norm": 0.008261643350124359,
"learning_rate": 0.0002,
"loss": 0.6251908540725708,
"mean_token_accuracy": 0.7473416924476624,
"num_tokens": 14040214.0,
"step": 376
},
{
"entropy": 0.6125365421175957,
"epoch": 2.925170068027211,
"grad_norm": 0.00803174264729023,
"learning_rate": 0.0002,
"loss": 0.6121209859848022,
"mean_token_accuracy": 0.7514154240489006,
"num_tokens": 14077708.0,
"step": 377
},
{
"entropy": 0.6050901785492897,
"epoch": 2.932944606413994,
"grad_norm": 0.007550297304987907,
"learning_rate": 0.0002,
"loss": 0.6031768321990967,
"mean_token_accuracy": 0.7547935023903847,
"num_tokens": 14115081.0,
"step": 378
},
{
"entropy": 0.5867772176861763,
"epoch": 2.9407191448007772,
"grad_norm": 0.007504226174205542,
"learning_rate": 0.0002,
"loss": 0.586522102355957,
"mean_token_accuracy": 0.7607723250985146,
"num_tokens": 14152707.0,
"step": 379
},
{
"entropy": 0.6053405031561852,
"epoch": 2.9484936831875608,
"grad_norm": 0.007515515200793743,
"learning_rate": 0.0002,
"loss": 0.6078545451164246,
"mean_token_accuracy": 0.7521200627088547,
"num_tokens": 14190102.0,
"step": 380
},
{
"entropy": 0.6189891770482063,
"epoch": 2.956268221574344,
"grad_norm": 0.009104753844439983,
"learning_rate": 0.0002,
"loss": 0.6249637603759766,
"mean_token_accuracy": 0.745013989508152,
"num_tokens": 14227592.0,
"step": 381
},
{
"entropy": 0.6138845458626747,
"epoch": 2.9640427599611274,
"grad_norm": 0.008113187737762928,
"learning_rate": 0.0002,
"loss": 0.6206336617469788,
"mean_token_accuracy": 0.7456697672605515,
"num_tokens": 14264742.0,
"step": 382
},
{
"entropy": 0.6130691468715668,
"epoch": 2.9718172983479105,
"grad_norm": 0.009299568831920624,
"learning_rate": 0.0002,
"loss": 0.6096789836883545,
"mean_token_accuracy": 0.7523899152874947,
"num_tokens": 14302195.0,
"step": 383
},
{
"entropy": 0.6205710843205452,
"epoch": 2.979591836734694,
"grad_norm": 0.009512864053249359,
"learning_rate": 0.0002,
"loss": 0.6156758069992065,
"mean_token_accuracy": 0.7508921846747398,
"num_tokens": 14339245.0,
"step": 384
},
{
"entropy": 0.6069811135530472,
"epoch": 2.987366375121477,
"grad_norm": 0.007910305634140968,
"learning_rate": 0.0002,
"loss": 0.6085284948348999,
"mean_token_accuracy": 0.753339558839798,
"num_tokens": 14376587.0,
"step": 385
},
{
"entropy": 0.6119454056024551,
"epoch": 2.9951409135082603,
"grad_norm": 0.009647355414927006,
"learning_rate": 0.0002,
"loss": 0.6212526559829712,
"mean_token_accuracy": 0.7483848258852959,
"num_tokens": 14414269.0,
"step": 386
},
{
"entropy": 0.5991271257400512,
"epoch": 3.0,
"grad_norm": 0.010158240795135498,
"learning_rate": 0.0002,
"loss": 0.6065676212310791,
"mean_token_accuracy": 0.7547077178955078,
"num_tokens": 14437732.0,
"step": 387
},
{
"entropy": 0.6155622974038124,
"epoch": 3.007774538386783,
"grad_norm": 0.007469667587429285,
"learning_rate": 0.0002,
"loss": 0.610929012298584,
"mean_token_accuracy": 0.7500728666782379,
"num_tokens": 14475215.0,
"step": 388
},
{
"entropy": 0.6059615164995193,
"epoch": 3.0155490767735667,
"grad_norm": 0.008237253874540329,
"learning_rate": 0.0002,
"loss": 0.6052074432373047,
"mean_token_accuracy": 0.75154148042202,
"num_tokens": 14512098.0,
"step": 389
},
{
"entropy": 0.6095065400004387,
"epoch": 3.0233236151603498,
"grad_norm": 0.008823649026453495,
"learning_rate": 0.0002,
"loss": 0.6052320599555969,
"mean_token_accuracy": 0.7540639191865921,
"num_tokens": 14549796.0,
"step": 390
},
{
"entropy": 0.5965104550123215,
"epoch": 3.0310981535471333,
"grad_norm": 0.008173096925020218,
"learning_rate": 0.0002,
"loss": 0.5943379998207092,
"mean_token_accuracy": 0.7575219720602036,
"num_tokens": 14587236.0,
"step": 391
},
{
"entropy": 0.6153795942664146,
"epoch": 3.0388726919339164,
"grad_norm": 0.011041256599128246,
"learning_rate": 0.0002,
"loss": 0.6242270469665527,
"mean_token_accuracy": 0.7458753809332848,
"num_tokens": 14624782.0,
"step": 392
},
{
"entropy": 0.5972734019160271,
"epoch": 3.0466472303206995,
"grad_norm": 0.008677808567881584,
"learning_rate": 0.0002,
"loss": 0.5998678207397461,
"mean_token_accuracy": 0.7576502561569214,
"num_tokens": 14662174.0,
"step": 393
},
{
"entropy": 0.6102932617068291,
"epoch": 3.054421768707483,
"grad_norm": 0.010088201612234116,
"learning_rate": 0.0002,
"loss": 0.6051709651947021,
"mean_token_accuracy": 0.7535885870456696,
"num_tokens": 14699746.0,
"step": 394
},
{
"entropy": 0.6008228436112404,
"epoch": 3.062196307094266,
"grad_norm": 0.008312424644827843,
"learning_rate": 0.0002,
"loss": 0.6032264232635498,
"mean_token_accuracy": 0.7517057359218597,
"num_tokens": 14737247.0,
"step": 395
},
{
"entropy": 0.5989790633320808,
"epoch": 3.0699708454810497,
"grad_norm": 0.008239499293267727,
"learning_rate": 0.0002,
"loss": 0.6043699979782104,
"mean_token_accuracy": 0.7529819533228874,
"num_tokens": 14774702.0,
"step": 396
},
{
"entropy": 0.6045716553926468,
"epoch": 3.077745383867833,
"grad_norm": 0.01003638468682766,
"learning_rate": 0.0002,
"loss": 0.6113682985305786,
"mean_token_accuracy": 0.7505319342017174,
"num_tokens": 14811886.0,
"step": 397
},
{
"entropy": 0.6115910932421684,
"epoch": 3.0855199222546164,
"grad_norm": 0.009529519826173782,
"learning_rate": 0.0002,
"loss": 0.6107526421546936,
"mean_token_accuracy": 0.7507694736123085,
"num_tokens": 14848988.0,
"step": 398
},
{
"entropy": 0.6084096133708954,
"epoch": 3.0932944606413995,
"grad_norm": 0.010617745108902454,
"learning_rate": 0.0002,
"loss": 0.6034584045410156,
"mean_token_accuracy": 0.753932997584343,
"num_tokens": 14886459.0,
"step": 399
},
{
"entropy": 0.6054683178663254,
"epoch": 3.1010689990281826,
"grad_norm": 0.008427645079791546,
"learning_rate": 0.0002,
"loss": 0.603972852230072,
"mean_token_accuracy": 0.7547962665557861,
"num_tokens": 14924071.0,
"step": 400
},
{
"entropy": 0.5898149386048317,
"epoch": 3.108843537414966,
"grad_norm": 0.009828660637140274,
"learning_rate": 0.0002,
"loss": 0.5968987941741943,
"mean_token_accuracy": 0.7556750178337097,
"num_tokens": 14961693.0,
"step": 401
},
{
"entropy": 0.5877138301730156,
"epoch": 3.116618075801749,
"grad_norm": 0.010062897577881813,
"learning_rate": 0.0002,
"loss": 0.5967484712600708,
"mean_token_accuracy": 0.7571568712592125,
"num_tokens": 14998846.0,
"step": 402
},
{
"entropy": 0.5948435962200165,
"epoch": 3.1243926141885328,
"grad_norm": 0.008929714560508728,
"learning_rate": 0.0002,
"loss": 0.596827507019043,
"mean_token_accuracy": 0.7577486112713814,
"num_tokens": 15036731.0,
"step": 403
},
{
"entropy": 0.6053501963615417,
"epoch": 3.132167152575316,
"grad_norm": 0.009441581554710865,
"learning_rate": 0.0002,
"loss": 0.6060553789138794,
"mean_token_accuracy": 0.7532980218529701,
"num_tokens": 15074609.0,
"step": 404
},
{
"entropy": 0.6139290183782578,
"epoch": 3.139941690962099,
"grad_norm": 0.009152664802968502,
"learning_rate": 0.0002,
"loss": 0.6124223470687866,
"mean_token_accuracy": 0.7500443160533905,
"num_tokens": 15112062.0,
"step": 405
},
{
"entropy": 0.5967981591820717,
"epoch": 3.1477162293488825,
"grad_norm": 0.009577469900250435,
"learning_rate": 0.0002,
"loss": 0.60134357213974,
"mean_token_accuracy": 0.75638198107481,
"num_tokens": 15149260.0,
"step": 406
},
{
"entropy": 0.6026358082890511,
"epoch": 3.1554907677356656,
"grad_norm": 0.008992240764200687,
"learning_rate": 0.0002,
"loss": 0.6071676015853882,
"mean_token_accuracy": 0.7526509240269661,
"num_tokens": 15186342.0,
"step": 407
},
{
"entropy": 0.6130121350288391,
"epoch": 3.163265306122449,
"grad_norm": 0.009787038899958134,
"learning_rate": 0.0002,
"loss": 0.616807222366333,
"mean_token_accuracy": 0.7485663071274757,
"num_tokens": 15224037.0,
"step": 408
},
{
"entropy": 0.6062626764178276,
"epoch": 3.1710398445092323,
"grad_norm": 0.009504587389528751,
"learning_rate": 0.0002,
"loss": 0.6050899624824524,
"mean_token_accuracy": 0.7536401823163033,
"num_tokens": 15261579.0,
"step": 409
},
{
"entropy": 0.6065879017114639,
"epoch": 3.1788143828960154,
"grad_norm": 0.008364197798073292,
"learning_rate": 0.0002,
"loss": 0.6022209525108337,
"mean_token_accuracy": 0.7534467577934265,
"num_tokens": 15299024.0,
"step": 410
},
{
"entropy": 0.6233559027314186,
"epoch": 3.186588921282799,
"grad_norm": 0.010281233116984367,
"learning_rate": 0.0002,
"loss": 0.6214974522590637,
"mean_token_accuracy": 0.7470389008522034,
"num_tokens": 15336558.0,
"step": 411
},
{
"entropy": 0.6087061986327171,
"epoch": 3.194363459669582,
"grad_norm": 0.00957780983299017,
"learning_rate": 0.0002,
"loss": 0.6129252910614014,
"mean_token_accuracy": 0.7495343014597893,
"num_tokens": 15374032.0,
"step": 412
},
{
"entropy": 0.596970833837986,
"epoch": 3.2021379980563656,
"grad_norm": 0.00984536949545145,
"learning_rate": 0.0002,
"loss": 0.5985467433929443,
"mean_token_accuracy": 0.7565372809767723,
"num_tokens": 15411483.0,
"step": 413
},
{
"entropy": 0.5959193110466003,
"epoch": 3.2099125364431487,
"grad_norm": 0.010170173831284046,
"learning_rate": 0.0002,
"loss": 0.599077045917511,
"mean_token_accuracy": 0.756831057369709,
"num_tokens": 15448812.0,
"step": 414
},
{
"entropy": 0.6122774854302406,
"epoch": 3.2176870748299318,
"grad_norm": 0.00988403894007206,
"learning_rate": 0.0002,
"loss": 0.6123433113098145,
"mean_token_accuracy": 0.7474271655082703,
"num_tokens": 15486225.0,
"step": 415
},
{
"entropy": 0.5967384874820709,
"epoch": 3.2254616132167153,
"grad_norm": 0.010967456735670567,
"learning_rate": 0.0002,
"loss": 0.60502028465271,
"mean_token_accuracy": 0.75384970754385,
"num_tokens": 15523563.0,
"step": 416
},
{
"entropy": 0.5971691235899925,
"epoch": 3.2332361516034984,
"grad_norm": 0.009652617387473583,
"learning_rate": 0.0002,
"loss": 0.596883237361908,
"mean_token_accuracy": 0.7563904896378517,
"num_tokens": 15561284.0,
"step": 417
},
{
"entropy": 0.5993461608886719,
"epoch": 3.241010689990282,
"grad_norm": 0.01028553955256939,
"learning_rate": 0.0002,
"loss": 0.5969662666320801,
"mean_token_accuracy": 0.7561450004577637,
"num_tokens": 15598518.0,
"step": 418
},
{
"entropy": 0.6052126884460449,
"epoch": 3.248785228377065,
"grad_norm": 0.009491597302258015,
"learning_rate": 0.0002,
"loss": 0.6018233299255371,
"mean_token_accuracy": 0.754707433283329,
"num_tokens": 15636077.0,
"step": 419
},
{
"entropy": 0.5944898948073387,
"epoch": 3.256559766763848,
"grad_norm": 0.009509161114692688,
"learning_rate": 0.0002,
"loss": 0.598441481590271,
"mean_token_accuracy": 0.7549791261553764,
"num_tokens": 15673148.0,
"step": 420
},
{
"entropy": 0.5968391299247742,
"epoch": 3.2643343051506317,
"grad_norm": 0.012232691049575806,
"learning_rate": 0.0002,
"loss": 0.6061251163482666,
"mean_token_accuracy": 0.7526469007134438,
"num_tokens": 15710778.0,
"step": 421
},
{
"entropy": 0.6134240105748177,
"epoch": 3.272108843537415,
"grad_norm": 0.00959104672074318,
"learning_rate": 0.0002,
"loss": 0.6182757616043091,
"mean_token_accuracy": 0.7455755323171616,
"num_tokens": 15748509.0,
"step": 422
},
{
"entropy": 0.6232677772641182,
"epoch": 3.2798833819241984,
"grad_norm": 0.008630241267383099,
"learning_rate": 0.0002,
"loss": 0.6197680234909058,
"mean_token_accuracy": 0.7470053881406784,
"num_tokens": 15786160.0,
"step": 423
},
{
"entropy": 0.613219253718853,
"epoch": 3.2876579203109815,
"grad_norm": 0.0128620695322752,
"learning_rate": 0.0002,
"loss": 0.607075572013855,
"mean_token_accuracy": 0.7511464059352875,
"num_tokens": 15823826.0,
"step": 424
},
{
"entropy": 0.6041038259863853,
"epoch": 3.295432458697765,
"grad_norm": 0.011236878111958504,
"learning_rate": 0.0002,
"loss": 0.6055868864059448,
"mean_token_accuracy": 0.7537136226892471,
"num_tokens": 15861102.0,
"step": 425
},
{
"entropy": 0.6037536263465881,
"epoch": 3.303206997084548,
"grad_norm": 0.01190877053886652,
"learning_rate": 0.0002,
"loss": 0.6142691373825073,
"mean_token_accuracy": 0.7493078485131264,
"num_tokens": 15898770.0,
"step": 426
},
{
"entropy": 0.5997900441288948,
"epoch": 3.3109815354713312,
"grad_norm": 0.01027680840343237,
"learning_rate": 0.0002,
"loss": 0.606103777885437,
"mean_token_accuracy": 0.7539091035723686,
"num_tokens": 15936500.0,
"step": 427
},
{
"entropy": 0.611216127872467,
"epoch": 3.3187560738581148,
"grad_norm": 0.011017821729183197,
"learning_rate": 0.0002,
"loss": 0.6174614429473877,
"mean_token_accuracy": 0.7461550533771515,
"num_tokens": 15974513.0,
"step": 428
},
{
"entropy": 0.6048758924007416,
"epoch": 3.326530612244898,
"grad_norm": 0.010105214081704617,
"learning_rate": 0.0002,
"loss": 0.6031618118286133,
"mean_token_accuracy": 0.7546434104442596,
"num_tokens": 16012014.0,
"step": 429
},
{
"entropy": 0.6172537207603455,
"epoch": 3.3343051506316814,
"grad_norm": 0.009731764905154705,
"learning_rate": 0.0002,
"loss": 0.6138004064559937,
"mean_token_accuracy": 0.7473105862736702,
"num_tokens": 16049595.0,
"step": 430
},
{
"entropy": 0.601245328783989,
"epoch": 3.3420796890184645,
"grad_norm": 0.010152102448046207,
"learning_rate": 0.0002,
"loss": 0.6028028726577759,
"mean_token_accuracy": 0.7536987066268921,
"num_tokens": 16087175.0,
"step": 431
},
{
"entropy": 0.6049877479672432,
"epoch": 3.3498542274052476,
"grad_norm": 0.008624416776001453,
"learning_rate": 0.0002,
"loss": 0.6070842742919922,
"mean_token_accuracy": 0.7543686851859093,
"num_tokens": 16124434.0,
"step": 432
},
{
"entropy": 0.6113510951399803,
"epoch": 3.357628765792031,
"grad_norm": 0.00979162473231554,
"learning_rate": 0.0002,
"loss": 0.614505410194397,
"mean_token_accuracy": 0.7483974099159241,
"num_tokens": 16161797.0,
"step": 433
},
{
"entropy": 0.6149813681840897,
"epoch": 3.3654033041788143,
"grad_norm": 0.009648281149566174,
"learning_rate": 0.0002,
"loss": 0.6138153076171875,
"mean_token_accuracy": 0.7505435049533844,
"num_tokens": 16199386.0,
"step": 434
},
{
"entropy": 0.6114403232932091,
"epoch": 3.373177842565598,
"grad_norm": 0.00991707295179367,
"learning_rate": 0.0002,
"loss": 0.6108669638633728,
"mean_token_accuracy": 0.7510098665952682,
"num_tokens": 16236951.0,
"step": 435
},
{
"entropy": 0.6059002429246902,
"epoch": 3.380952380952381,
"grad_norm": 0.009901657700538635,
"learning_rate": 0.0002,
"loss": 0.6064650416374207,
"mean_token_accuracy": 0.7527595311403275,
"num_tokens": 16274203.0,
"step": 436
},
{
"entropy": 0.6086044162511826,
"epoch": 3.388726919339164,
"grad_norm": 0.011115623638033867,
"learning_rate": 0.0002,
"loss": 0.609772801399231,
"mean_token_accuracy": 0.7524074539542198,
"num_tokens": 16311856.0,
"step": 437
},
{
"entropy": 0.6069784238934517,
"epoch": 3.3965014577259476,
"grad_norm": 0.009795066900551319,
"learning_rate": 0.0002,
"loss": 0.60982745885849,
"mean_token_accuracy": 0.7514877542853355,
"num_tokens": 16349625.0,
"step": 438
},
{
"entropy": 0.602266825735569,
"epoch": 3.4042759961127307,
"grad_norm": 0.009143724106252193,
"learning_rate": 0.0002,
"loss": 0.6032094359397888,
"mean_token_accuracy": 0.7547830194234848,
"num_tokens": 16387358.0,
"step": 439
},
{
"entropy": 0.5899055674672127,
"epoch": 3.4120505344995142,
"grad_norm": 0.009034923277795315,
"learning_rate": 0.0002,
"loss": 0.5931638479232788,
"mean_token_accuracy": 0.7577911838889122,
"num_tokens": 16424225.0,
"step": 440
},
{
"entropy": 0.5923598855733871,
"epoch": 3.4198250728862973,
"grad_norm": 0.00976620800793171,
"learning_rate": 0.0002,
"loss": 0.5963320732116699,
"mean_token_accuracy": 0.7556646093726158,
"num_tokens": 16461363.0,
"step": 441
},
{
"entropy": 0.6050904020667076,
"epoch": 3.427599611273081,
"grad_norm": 0.010530819185078144,
"learning_rate": 0.0002,
"loss": 0.6116576194763184,
"mean_token_accuracy": 0.7500759586691856,
"num_tokens": 16498597.0,
"step": 442
},
{
"entropy": 0.6166655048727989,
"epoch": 3.435374149659864,
"grad_norm": 0.009784851223230362,
"learning_rate": 0.0002,
"loss": 0.6191204786300659,
"mean_token_accuracy": 0.7476971745491028,
"num_tokens": 16535886.0,
"step": 443
},
{
"entropy": 0.6059679165482521,
"epoch": 3.443148688046647,
"grad_norm": 0.009777678176760674,
"learning_rate": 0.0002,
"loss": 0.600814700126648,
"mean_token_accuracy": 0.7545428648591042,
"num_tokens": 16573204.0,
"step": 444
},
{
"entropy": 0.6082785129547119,
"epoch": 3.4509232264334306,
"grad_norm": 0.009606909938156605,
"learning_rate": 0.0002,
"loss": 0.6063122153282166,
"mean_token_accuracy": 0.7535424381494522,
"num_tokens": 16610341.0,
"step": 445
},
{
"entropy": 0.6118370518088341,
"epoch": 3.4586977648202137,
"grad_norm": 0.009755875915288925,
"learning_rate": 0.0002,
"loss": 0.6115654706954956,
"mean_token_accuracy": 0.7514548450708389,
"num_tokens": 16648078.0,
"step": 446
},
{
"entropy": 0.5936368778347969,
"epoch": 3.466472303206997,
"grad_norm": 0.011094003915786743,
"learning_rate": 0.0002,
"loss": 0.6031495332717896,
"mean_token_accuracy": 0.75296650826931,
"num_tokens": 16684979.0,
"step": 447
},
{
"entropy": 0.5946005135774612,
"epoch": 3.4742468415937804,
"grad_norm": 0.00817946158349514,
"learning_rate": 0.0002,
"loss": 0.597072184085846,
"mean_token_accuracy": 0.756522886455059,
"num_tokens": 16722537.0,
"step": 448
},
{
"entropy": 0.6108994483947754,
"epoch": 3.4820213799805635,
"grad_norm": 0.0094683188945055,
"learning_rate": 0.0002,
"loss": 0.6126965284347534,
"mean_token_accuracy": 0.750556543469429,
"num_tokens": 16759490.0,
"step": 449
},
{
"entropy": 0.6224265471100807,
"epoch": 3.489795918367347,
"grad_norm": 0.009895196184515953,
"learning_rate": 0.0002,
"loss": 0.6202942132949829,
"mean_token_accuracy": 0.7480411902070045,
"num_tokens": 16797135.0,
"step": 450
},
{
"entropy": 0.597562313079834,
"epoch": 3.49757045675413,
"grad_norm": 0.00880007166415453,
"learning_rate": 0.0002,
"loss": 0.5973268151283264,
"mean_token_accuracy": 0.7553020343184471,
"num_tokens": 16834270.0,
"step": 451
},
{
"entropy": 0.5932627841830254,
"epoch": 3.5053449951409137,
"grad_norm": 0.009338297881186008,
"learning_rate": 0.0002,
"loss": 0.5983443856239319,
"mean_token_accuracy": 0.7540717199444771,
"num_tokens": 16871670.0,
"step": 452
},
{
"entropy": 0.603311225771904,
"epoch": 3.513119533527697,
"grad_norm": 0.009173530153930187,
"learning_rate": 0.0002,
"loss": 0.6072041988372803,
"mean_token_accuracy": 0.752394326031208,
"num_tokens": 16909221.0,
"step": 453
},
{
"entropy": 0.6008370220661163,
"epoch": 3.52089407191448,
"grad_norm": 0.009413264691829681,
"learning_rate": 0.0002,
"loss": 0.6025704145431519,
"mean_token_accuracy": 0.7541562095284462,
"num_tokens": 16946802.0,
"step": 454
},
{
"entropy": 0.6156598478555679,
"epoch": 3.5286686103012634,
"grad_norm": 0.009066940285265446,
"learning_rate": 0.0002,
"loss": 0.6163049936294556,
"mean_token_accuracy": 0.7471535354852676,
"num_tokens": 16983926.0,
"step": 455
},
{
"entropy": 0.6066097542643547,
"epoch": 3.5364431486880465,
"grad_norm": 0.008060373365879059,
"learning_rate": 0.0002,
"loss": 0.6057984828948975,
"mean_token_accuracy": 0.753935232758522,
"num_tokens": 17021676.0,
"step": 456
},
{
"entropy": 0.5982315316796303,
"epoch": 3.54421768707483,
"grad_norm": 0.008438881486654282,
"learning_rate": 0.0002,
"loss": 0.6000136137008667,
"mean_token_accuracy": 0.7557498961687088,
"num_tokens": 17059698.0,
"step": 457
},
{
"entropy": 0.6007475033402443,
"epoch": 3.551992225461613,
"grad_norm": 0.008833416737616062,
"learning_rate": 0.0002,
"loss": 0.6044740676879883,
"mean_token_accuracy": 0.7540414854884148,
"num_tokens": 17096952.0,
"step": 458
},
{
"entropy": 0.6120948642492294,
"epoch": 3.5597667638483967,
"grad_norm": 0.010080665349960327,
"learning_rate": 0.0002,
"loss": 0.6188148260116577,
"mean_token_accuracy": 0.7483313381671906,
"num_tokens": 17134663.0,
"step": 459
},
{
"entropy": 0.6083438396453857,
"epoch": 3.56754130223518,
"grad_norm": 0.009289734996855259,
"learning_rate": 0.0002,
"loss": 0.6083492636680603,
"mean_token_accuracy": 0.7500124499201775,
"num_tokens": 17172169.0,
"step": 460
},
{
"entropy": 0.6143280863761902,
"epoch": 3.575315840621963,
"grad_norm": 0.010136788710951805,
"learning_rate": 0.0002,
"loss": 0.6146470308303833,
"mean_token_accuracy": 0.749954454600811,
"num_tokens": 17209481.0,
"step": 461
},
{
"entropy": 0.6075241789221764,
"epoch": 3.5830903790087465,
"grad_norm": 0.008481534197926521,
"learning_rate": 0.0002,
"loss": 0.6094347238540649,
"mean_token_accuracy": 0.7524155974388123,
"num_tokens": 17246466.0,
"step": 462
},
{
"entropy": 0.6080920621752739,
"epoch": 3.5908649173955296,
"grad_norm": 0.009619004093110561,
"learning_rate": 0.0002,
"loss": 0.6094264984130859,
"mean_token_accuracy": 0.752539336681366,
"num_tokens": 17284014.0,
"step": 463
},
{
"entropy": 0.5951874181628227,
"epoch": 3.5986394557823127,
"grad_norm": 0.010971908457577229,
"learning_rate": 0.0002,
"loss": 0.5968849062919617,
"mean_token_accuracy": 0.7571029588580132,
"num_tokens": 17321447.0,
"step": 464
},
{
"entropy": 0.600244015455246,
"epoch": 3.6064139941690962,
"grad_norm": 0.009995541535317898,
"learning_rate": 0.0002,
"loss": 0.6033259630203247,
"mean_token_accuracy": 0.7534294128417969,
"num_tokens": 17358802.0,
"step": 465
},
{
"entropy": 0.6006019562482834,
"epoch": 3.6141885325558794,
"grad_norm": 0.008752602152526379,
"learning_rate": 0.0002,
"loss": 0.6017124652862549,
"mean_token_accuracy": 0.756244920194149,
"num_tokens": 17396188.0,
"step": 466
},
{
"entropy": 0.6169783622026443,
"epoch": 3.621963070942663,
"grad_norm": 0.010406076908111572,
"learning_rate": 0.0002,
"loss": 0.6129188537597656,
"mean_token_accuracy": 0.7500476241111755,
"num_tokens": 17433577.0,
"step": 467
},
{
"entropy": 0.6030160784721375,
"epoch": 3.629737609329446,
"grad_norm": 0.009500440210103989,
"learning_rate": 0.0002,
"loss": 0.6009221076965332,
"mean_token_accuracy": 0.7557852789759636,
"num_tokens": 17471102.0,
"step": 468
},
{
"entropy": 0.5835254713892937,
"epoch": 3.6375121477162295,
"grad_norm": 0.009339805692434311,
"learning_rate": 0.0002,
"loss": 0.5876451730728149,
"mean_token_accuracy": 0.7601824253797531,
"num_tokens": 17508438.0,
"step": 469
},
{
"entropy": 0.6057174652814865,
"epoch": 3.6452866861030127,
"grad_norm": 0.010681871324777603,
"learning_rate": 0.0002,
"loss": 0.6165672540664673,
"mean_token_accuracy": 0.7476890683174133,
"num_tokens": 17546176.0,
"step": 470
},
{
"entropy": 0.6023501753807068,
"epoch": 3.6530612244897958,
"grad_norm": 0.009493213146924973,
"learning_rate": 0.0002,
"loss": 0.6091412305831909,
"mean_token_accuracy": 0.7539057731628418,
"num_tokens": 17583501.0,
"step": 471
},
{
"entropy": 0.6135850101709366,
"epoch": 3.6608357628765793,
"grad_norm": 0.009873135015368462,
"learning_rate": 0.0002,
"loss": 0.6167327165603638,
"mean_token_accuracy": 0.7497850060462952,
"num_tokens": 17620694.0,
"step": 472
},
{
"entropy": 0.6023069024085999,
"epoch": 3.6686103012633624,
"grad_norm": 0.009261439554393291,
"learning_rate": 0.0002,
"loss": 0.5992604494094849,
"mean_token_accuracy": 0.7568845972418785,
"num_tokens": 17657846.0,
"step": 473
},
{
"entropy": 0.6220817118883133,
"epoch": 3.6763848396501455,
"grad_norm": 0.008002927526831627,
"learning_rate": 0.0002,
"loss": 0.6206220984458923,
"mean_token_accuracy": 0.7471845746040344,
"num_tokens": 17695493.0,
"step": 474
},
{
"entropy": 0.6081802695989609,
"epoch": 3.684159378036929,
"grad_norm": 0.008587166666984558,
"learning_rate": 0.0002,
"loss": 0.607234001159668,
"mean_token_accuracy": 0.755810484290123,
"num_tokens": 17732856.0,
"step": 475
},
{
"entropy": 0.6025589928030968,
"epoch": 3.6919339164237126,
"grad_norm": 0.009315953589975834,
"learning_rate": 0.0002,
"loss": 0.6054584383964539,
"mean_token_accuracy": 0.7516716048121452,
"num_tokens": 17769974.0,
"step": 476
},
{
"entropy": 0.6041041016578674,
"epoch": 3.6997084548104957,
"grad_norm": 0.009252023883163929,
"learning_rate": 0.0002,
"loss": 0.6035861968994141,
"mean_token_accuracy": 0.754462331533432,
"num_tokens": 17807234.0,
"step": 477
},
{
"entropy": 0.6150568872690201,
"epoch": 3.707482993197279,
"grad_norm": 0.009806321002542973,
"learning_rate": 0.0002,
"loss": 0.6143267154693604,
"mean_token_accuracy": 0.7500679716467857,
"num_tokens": 17844713.0,
"step": 478
},
{
"entropy": 0.6017017439007759,
"epoch": 3.7152575315840624,
"grad_norm": 0.009355618618428707,
"learning_rate": 0.0002,
"loss": 0.6050205230712891,
"mean_token_accuracy": 0.7535286843776703,
"num_tokens": 17882167.0,
"step": 479
},
{
"entropy": 0.6020700857043266,
"epoch": 3.7230320699708455,
"grad_norm": 0.010259266011416912,
"learning_rate": 0.0002,
"loss": 0.6069679856300354,
"mean_token_accuracy": 0.7521628364920616,
"num_tokens": 17919373.0,
"step": 480
},
{
"entropy": 0.6041392460465431,
"epoch": 3.7308066083576286,
"grad_norm": 0.008957406505942345,
"learning_rate": 0.0002,
"loss": 0.6065245270729065,
"mean_token_accuracy": 0.7511508986353874,
"num_tokens": 17956544.0,
"step": 481
},
{
"entropy": 0.6143322214484215,
"epoch": 3.738581146744412,
"grad_norm": 0.010185849852859974,
"learning_rate": 0.0002,
"loss": 0.6167340278625488,
"mean_token_accuracy": 0.7486473768949509,
"num_tokens": 17993752.0,
"step": 482
},
{
"entropy": 0.597200371325016,
"epoch": 3.746355685131195,
"grad_norm": 0.009210821241140366,
"learning_rate": 0.0002,
"loss": 0.5978806018829346,
"mean_token_accuracy": 0.7557302191853523,
"num_tokens": 18031025.0,
"step": 483
},
{
"entropy": 0.6069202646613121,
"epoch": 3.7541302235179788,
"grad_norm": 0.011117368005216122,
"learning_rate": 0.0002,
"loss": 0.6108845472335815,
"mean_token_accuracy": 0.7496053129434586,
"num_tokens": 18067927.0,
"step": 484
},
{
"entropy": 0.6041139885783195,
"epoch": 3.761904761904762,
"grad_norm": 0.00938522256910801,
"learning_rate": 0.0002,
"loss": 0.6076387166976929,
"mean_token_accuracy": 0.7511148899793625,
"num_tokens": 18105521.0,
"step": 485
},
{
"entropy": 0.5986451655626297,
"epoch": 3.7696793002915454,
"grad_norm": 0.009973375126719475,
"learning_rate": 0.0002,
"loss": 0.6053519248962402,
"mean_token_accuracy": 0.7534126862883568,
"num_tokens": 18142635.0,
"step": 486
},
{
"entropy": 0.6009933426976204,
"epoch": 3.7774538386783285,
"grad_norm": 0.008744049817323685,
"learning_rate": 0.0002,
"loss": 0.6009329557418823,
"mean_token_accuracy": 0.7565900459885597,
"num_tokens": 18179737.0,
"step": 487
},
{
"entropy": 0.6145603656768799,
"epoch": 3.7852283770651116,
"grad_norm": 0.008431525900959969,
"learning_rate": 0.0002,
"loss": 0.6102414727210999,
"mean_token_accuracy": 0.7497778162360191,
"num_tokens": 18216997.0,
"step": 488
},
{
"entropy": 0.6055081114172935,
"epoch": 3.793002915451895,
"grad_norm": 0.00999277364462614,
"learning_rate": 0.0002,
"loss": 0.6034255623817444,
"mean_token_accuracy": 0.7561624273657799,
"num_tokens": 18254319.0,
"step": 489
},
{
"entropy": 0.5926950201392174,
"epoch": 3.8007774538386783,
"grad_norm": 0.008595049381256104,
"learning_rate": 0.0002,
"loss": 0.5922105312347412,
"mean_token_accuracy": 0.7585625573992729,
"num_tokens": 18291224.0,
"step": 490
},
{
"entropy": 0.6234352439641953,
"epoch": 3.8085519922254614,
"grad_norm": 0.009778706356883049,
"learning_rate": 0.0002,
"loss": 0.628953754901886,
"mean_token_accuracy": 0.743121363222599,
"num_tokens": 18328744.0,
"step": 491
},
{
"entropy": 0.6095947250723839,
"epoch": 3.816326530612245,
"grad_norm": 0.009355447255074978,
"learning_rate": 0.0002,
"loss": 0.6148620843887329,
"mean_token_accuracy": 0.7512015551328659,
"num_tokens": 18366284.0,
"step": 492
},
{
"entropy": 0.6000761389732361,
"epoch": 3.824101068999028,
"grad_norm": 0.00857703946530819,
"learning_rate": 0.0002,
"loss": 0.604392409324646,
"mean_token_accuracy": 0.7549523860216141,
"num_tokens": 18403721.0,
"step": 493
},
{
"entropy": 0.5995704010128975,
"epoch": 3.8318756073858116,
"grad_norm": 0.010483372025191784,
"learning_rate": 0.0002,
"loss": 0.6008812785148621,
"mean_token_accuracy": 0.7550973892211914,
"num_tokens": 18440931.0,
"step": 494
},
{
"entropy": 0.6065568849444389,
"epoch": 3.8396501457725947,
"grad_norm": 0.00975153036415577,
"learning_rate": 0.0002,
"loss": 0.6107536554336548,
"mean_token_accuracy": 0.7495853081345558,
"num_tokens": 18478285.0,
"step": 495
},
{
"entropy": 0.6092389151453972,
"epoch": 3.847424684159378,
"grad_norm": 0.008589878678321838,
"learning_rate": 0.0002,
"loss": 0.6096630096435547,
"mean_token_accuracy": 0.7536827027797699,
"num_tokens": 18515709.0,
"step": 496
},
{
"entropy": 0.5968381017446518,
"epoch": 3.8551992225461613,
"grad_norm": 0.011193851009011269,
"learning_rate": 0.0002,
"loss": 0.6000962257385254,
"mean_token_accuracy": 0.7573477849364281,
"num_tokens": 18553032.0,
"step": 497
},
{
"entropy": 0.6045369654893875,
"epoch": 3.8629737609329444,
"grad_norm": 0.009280527010560036,
"learning_rate": 0.0002,
"loss": 0.6028830409049988,
"mean_token_accuracy": 0.7542475759983063,
"num_tokens": 18590308.0,
"step": 498
},
{
"entropy": 0.6031981706619263,
"epoch": 3.870748299319728,
"grad_norm": 0.009086862206459045,
"learning_rate": 0.0002,
"loss": 0.6040035486221313,
"mean_token_accuracy": 0.7532067000865936,
"num_tokens": 18627503.0,
"step": 499
},
{
"entropy": 0.6000340953469276,
"epoch": 3.878522837706511,
"grad_norm": 0.008906064555048943,
"learning_rate": 0.0002,
"loss": 0.6016078591346741,
"mean_token_accuracy": 0.7553933039307594,
"num_tokens": 18664999.0,
"step": 500
},
{
"entropy": 0.613756813108921,
"epoch": 3.8862973760932946,
"grad_norm": 0.00961924996227026,
"learning_rate": 0.0002,
"loss": 0.6131439208984375,
"mean_token_accuracy": 0.7474770769476891,
"num_tokens": 18702736.0,
"step": 501
},
{
"entropy": 0.6073272302746773,
"epoch": 3.8940719144800777,
"grad_norm": 0.008611987344920635,
"learning_rate": 0.0002,
"loss": 0.6086411476135254,
"mean_token_accuracy": 0.7537659332156181,
"num_tokens": 18740002.0,
"step": 502
},
{
"entropy": 0.5979632884263992,
"epoch": 3.9018464528668613,
"grad_norm": 0.008601277135312557,
"learning_rate": 0.0002,
"loss": 0.5986984968185425,
"mean_token_accuracy": 0.7558256238698959,
"num_tokens": 18777409.0,
"step": 503
},
{
"entropy": 0.5990572273731232,
"epoch": 3.9096209912536444,
"grad_norm": 0.009787015616893768,
"learning_rate": 0.0002,
"loss": 0.5969674587249756,
"mean_token_accuracy": 0.7572850733995438,
"num_tokens": 18814832.0,
"step": 504
},
{
"entropy": 0.5952424928545952,
"epoch": 3.9173955296404275,
"grad_norm": 0.009869958274066448,
"learning_rate": 0.0002,
"loss": 0.600977897644043,
"mean_token_accuracy": 0.7555051743984222,
"num_tokens": 18852288.0,
"step": 505
},
{
"entropy": 0.5953851416707039,
"epoch": 3.925170068027211,
"grad_norm": 0.009635512717068195,
"learning_rate": 0.0002,
"loss": 0.5988470315933228,
"mean_token_accuracy": 0.7552962228655815,
"num_tokens": 18889544.0,
"step": 506
},
{
"entropy": 0.6188566163182259,
"epoch": 3.932944606413994,
"grad_norm": 0.00981516670435667,
"learning_rate": 0.0002,
"loss": 0.6207889914512634,
"mean_token_accuracy": 0.748513400554657,
"num_tokens": 18927252.0,
"step": 507
},
{
"entropy": 0.6106720492243767,
"epoch": 3.9407191448007772,
"grad_norm": 0.011930068954825401,
"learning_rate": 0.0002,
"loss": 0.6130895614624023,
"mean_token_accuracy": 0.7500510811805725,
"num_tokens": 18964681.0,
"step": 508
},
{
"entropy": 0.6134953126311302,
"epoch": 3.9484936831875608,
"grad_norm": 0.009485729970037937,
"learning_rate": 0.0002,
"loss": 0.6170802116394043,
"mean_token_accuracy": 0.7490968182682991,
"num_tokens": 19002066.0,
"step": 509
},
{
"entropy": 0.6209791451692581,
"epoch": 3.956268221574344,
"grad_norm": 0.009478907100856304,
"learning_rate": 0.0002,
"loss": 0.6176908612251282,
"mean_token_accuracy": 0.7488641366362572,
"num_tokens": 19039553.0,
"step": 510
},
{
"entropy": 0.6174532473087311,
"epoch": 3.9640427599611274,
"grad_norm": 0.010146988555788994,
"learning_rate": 0.0002,
"loss": 0.6160500049591064,
"mean_token_accuracy": 0.7503278478980064,
"num_tokens": 19076777.0,
"step": 511
},
{
"entropy": 0.6139644980430603,
"epoch": 3.9718172983479105,
"grad_norm": 0.009649143554270267,
"learning_rate": 0.0002,
"loss": 0.6151527166366577,
"mean_token_accuracy": 0.7500214949250221,
"num_tokens": 19114295.0,
"step": 512
},
{
"entropy": 0.5903387889266014,
"epoch": 3.979591836734694,
"grad_norm": 0.009517780505120754,
"learning_rate": 0.0002,
"loss": 0.5949221253395081,
"mean_token_accuracy": 0.7585930302739143,
"num_tokens": 19151608.0,
"step": 513
},
{
"entropy": 0.60362558811903,
"epoch": 3.987366375121477,
"grad_norm": 0.008633180521428585,
"learning_rate": 0.0002,
"loss": 0.606721818447113,
"mean_token_accuracy": 0.7524262145161629,
"num_tokens": 19189092.0,
"step": 514
},
{
"entropy": 0.6161174476146698,
"epoch": 3.9951409135082603,
"grad_norm": 0.00904986634850502,
"learning_rate": 0.0002,
"loss": 0.6170212030410767,
"mean_token_accuracy": 0.7481908574700356,
"num_tokens": 19226930.0,
"step": 515
},
{
"entropy": 0.6157908320426941,
"epoch": 4.0,
"grad_norm": 0.011043760925531387,
"learning_rate": 0.0002,
"loss": 0.6197408437728882,
"mean_token_accuracy": 0.7473827481269837,
"num_tokens": 19250261.0,
"step": 516
},
{
"entropy": 0.5984989553689957,
"epoch": 4.0077745383867835,
"grad_norm": 0.010571295395493507,
"learning_rate": 0.0002,
"loss": 0.5962023138999939,
"mean_token_accuracy": 0.7551586180925369,
"num_tokens": 19287781.0,
"step": 517
},
{
"entropy": 0.5755362883210182,
"epoch": 4.015549076773566,
"grad_norm": 0.01085303071886301,
"learning_rate": 0.0002,
"loss": 0.5781339406967163,
"mean_token_accuracy": 0.763518862426281,
"num_tokens": 19324763.0,
"step": 518
},
{
"entropy": 0.5975531563162804,
"epoch": 4.02332361516035,
"grad_norm": 0.009798814542591572,
"learning_rate": 0.0002,
"loss": 0.6017999649047852,
"mean_token_accuracy": 0.7532066255807877,
"num_tokens": 19362451.0,
"step": 519
},
{
"entropy": 0.5838107392191887,
"epoch": 4.031098153547133,
"grad_norm": 0.011370974592864513,
"learning_rate": 0.0002,
"loss": 0.5857977867126465,
"mean_token_accuracy": 0.7589215487241745,
"num_tokens": 19399597.0,
"step": 520
},
{
"entropy": 0.586229719221592,
"epoch": 4.038872691933917,
"grad_norm": 0.010519232600927353,
"learning_rate": 0.0002,
"loss": 0.5870205760002136,
"mean_token_accuracy": 0.7586957290768623,
"num_tokens": 19436947.0,
"step": 521
},
{
"entropy": 0.5909631699323654,
"epoch": 4.0466472303206995,
"grad_norm": 0.011675548739731312,
"learning_rate": 0.0002,
"loss": 0.5927350521087646,
"mean_token_accuracy": 0.7586767747998238,
"num_tokens": 19474464.0,
"step": 522
},
{
"entropy": 0.602616548538208,
"epoch": 4.054421768707483,
"grad_norm": 0.01183371152728796,
"learning_rate": 0.0002,
"loss": 0.6010576486587524,
"mean_token_accuracy": 0.753461204469204,
"num_tokens": 19512364.0,
"step": 523
},
{
"entropy": 0.5877483561635017,
"epoch": 4.062196307094267,
"grad_norm": 0.011604937724769115,
"learning_rate": 0.0002,
"loss": 0.5869612693786621,
"mean_token_accuracy": 0.7605117782950401,
"num_tokens": 19549629.0,
"step": 524
},
{
"entropy": 0.5913394093513489,
"epoch": 4.069970845481049,
"grad_norm": 0.010066917166113853,
"learning_rate": 0.0002,
"loss": 0.5947997570037842,
"mean_token_accuracy": 0.755763366818428,
"num_tokens": 19586996.0,
"step": 525
},
{
"entropy": 0.5896845906972885,
"epoch": 4.077745383867833,
"grad_norm": 0.013865236192941666,
"learning_rate": 0.0002,
"loss": 0.5975737571716309,
"mean_token_accuracy": 0.756596714258194,
"num_tokens": 19624454.0,
"step": 526
},
{
"entropy": 0.6071945577859879,
"epoch": 4.085519922254616,
"grad_norm": 0.01125173456966877,
"learning_rate": 0.0002,
"loss": 0.6075310707092285,
"mean_token_accuracy": 0.7516418322920799,
"num_tokens": 19662369.0,
"step": 527
},
{
"entropy": 0.6004839465022087,
"epoch": 4.093294460641399,
"grad_norm": 0.012244274839758873,
"learning_rate": 0.0002,
"loss": 0.5988795161247253,
"mean_token_accuracy": 0.7533307895064354,
"num_tokens": 19699833.0,
"step": 528
},
{
"entropy": 0.5805928781628609,
"epoch": 4.101068999028183,
"grad_norm": 0.012553567998111248,
"learning_rate": 0.0002,
"loss": 0.5836637616157532,
"mean_token_accuracy": 0.7613400369882584,
"num_tokens": 19736626.0,
"step": 529
},
{
"entropy": 0.5802028924226761,
"epoch": 4.108843537414966,
"grad_norm": 0.013091178610920906,
"learning_rate": 0.0002,
"loss": 0.5839430093765259,
"mean_token_accuracy": 0.7619325369596481,
"num_tokens": 19773772.0,
"step": 530
},
{
"entropy": 0.5931153893470764,
"epoch": 4.11661807580175,
"grad_norm": 0.0117764538154006,
"learning_rate": 0.0002,
"loss": 0.598299503326416,
"mean_token_accuracy": 0.755822129547596,
"num_tokens": 19810974.0,
"step": 531
},
{
"entropy": 0.6081870496273041,
"epoch": 4.124392614188532,
"grad_norm": 0.013240421190857887,
"learning_rate": 0.0002,
"loss": 0.6058256030082703,
"mean_token_accuracy": 0.7531123831868172,
"num_tokens": 19848433.0,
"step": 532
},
{
"entropy": 0.6002762466669083,
"epoch": 4.132167152575316,
"grad_norm": 0.010874156840145588,
"learning_rate": 0.0002,
"loss": 0.5934455990791321,
"mean_token_accuracy": 0.7567582130432129,
"num_tokens": 19885930.0,
"step": 533
},
{
"entropy": 0.604529857635498,
"epoch": 4.139941690962099,
"grad_norm": 0.011289739049971104,
"learning_rate": 0.0002,
"loss": 0.6058647632598877,
"mean_token_accuracy": 0.7521885484457016,
"num_tokens": 19923130.0,
"step": 534
},
{
"entropy": 0.5959961265325546,
"epoch": 4.147716229348882,
"grad_norm": 0.0105770044028759,
"learning_rate": 0.0002,
"loss": 0.5998325347900391,
"mean_token_accuracy": 0.7545555010437965,
"num_tokens": 19960651.0,
"step": 535
},
{
"entropy": 0.6115074902772903,
"epoch": 4.155490767735666,
"grad_norm": 0.01272744033485651,
"learning_rate": 0.0002,
"loss": 0.6133629083633423,
"mean_token_accuracy": 0.7504753991961479,
"num_tokens": 19998458.0,
"step": 536
},
{
"entropy": 0.5959336087107658,
"epoch": 4.163265306122449,
"grad_norm": 0.01114166434854269,
"learning_rate": 0.0002,
"loss": 0.5921066403388977,
"mean_token_accuracy": 0.7599503472447395,
"num_tokens": 20035742.0,
"step": 537
},
{
"entropy": 0.6055325567722321,
"epoch": 4.171039844509233,
"grad_norm": 0.01163046807050705,
"learning_rate": 0.0002,
"loss": 0.6048938035964966,
"mean_token_accuracy": 0.7535717412829399,
"num_tokens": 20073263.0,
"step": 538
},
{
"entropy": 0.5937555730342865,
"epoch": 4.178814382896015,
"grad_norm": 0.010925386101007462,
"learning_rate": 0.0002,
"loss": 0.5978741645812988,
"mean_token_accuracy": 0.7580423355102539,
"num_tokens": 20110930.0,
"step": 539
},
{
"entropy": 0.6025584638118744,
"epoch": 4.186588921282799,
"grad_norm": 0.013231265358626842,
"learning_rate": 0.0002,
"loss": 0.6098158955574036,
"mean_token_accuracy": 0.7506869807839394,
"num_tokens": 20148878.0,
"step": 540
},
{
"entropy": 0.5955850780010223,
"epoch": 4.1943634596695825,
"grad_norm": 0.01381654478609562,
"learning_rate": 0.0002,
"loss": 0.6050733327865601,
"mean_token_accuracy": 0.7540115043520927,
"num_tokens": 20186590.0,
"step": 541
},
{
"entropy": 0.6100573241710663,
"epoch": 4.202137998056365,
"grad_norm": 0.01217405591160059,
"learning_rate": 0.0002,
"loss": 0.6091620922088623,
"mean_token_accuracy": 0.7501495629549026,
"num_tokens": 20224026.0,
"step": 542
},
{
"entropy": 0.6055784001946449,
"epoch": 4.209912536443149,
"grad_norm": 0.01034702267497778,
"learning_rate": 0.0002,
"loss": 0.6047437191009521,
"mean_token_accuracy": 0.7533470839262009,
"num_tokens": 20261538.0,
"step": 543
},
{
"entropy": 0.5968894883990288,
"epoch": 4.217687074829932,
"grad_norm": 0.013704034499824047,
"learning_rate": 0.0002,
"loss": 0.6015293002128601,
"mean_token_accuracy": 0.7537187412381172,
"num_tokens": 20298484.0,
"step": 544
},
{
"entropy": 0.5940377935767174,
"epoch": 4.225461613216715,
"grad_norm": 0.011667119339108467,
"learning_rate": 0.0002,
"loss": 0.5925427079200745,
"mean_token_accuracy": 0.7584238648414612,
"num_tokens": 20336353.0,
"step": 545
},
{
"entropy": 0.6106893792748451,
"epoch": 4.233236151603498,
"grad_norm": 0.01224418543279171,
"learning_rate": 0.0002,
"loss": 0.611664891242981,
"mean_token_accuracy": 0.7507496625185013,
"num_tokens": 20374019.0,
"step": 546
},
{
"entropy": 0.6042328551411629,
"epoch": 4.241010689990282,
"grad_norm": 0.01316764671355486,
"learning_rate": 0.0002,
"loss": 0.6062799096107483,
"mean_token_accuracy": 0.7534623667597771,
"num_tokens": 20411398.0,
"step": 547
},
{
"entropy": 0.6105416268110275,
"epoch": 4.2487852283770655,
"grad_norm": 0.012853113003075123,
"learning_rate": 0.0002,
"loss": 0.6092797517776489,
"mean_token_accuracy": 0.7522982135415077,
"num_tokens": 20448672.0,
"step": 548
},
{
"entropy": 0.5981989204883575,
"epoch": 4.256559766763848,
"grad_norm": 0.011458336375653744,
"learning_rate": 0.0002,
"loss": 0.5959842205047607,
"mean_token_accuracy": 0.7573426440358162,
"num_tokens": 20486126.0,
"step": 549
},
{
"entropy": 0.5939232558012009,
"epoch": 4.264334305150632,
"grad_norm": 0.013793280348181725,
"learning_rate": 0.0002,
"loss": 0.6013151407241821,
"mean_token_accuracy": 0.7532796338200569,
"num_tokens": 20523335.0,
"step": 550
},
{
"entropy": 0.5925507992506027,
"epoch": 4.272108843537415,
"grad_norm": 0.012333216145634651,
"learning_rate": 0.0002,
"loss": 0.5946025848388672,
"mean_token_accuracy": 0.7598577961325645,
"num_tokens": 20560754.0,
"step": 551
},
{
"entropy": 0.6068093478679657,
"epoch": 4.279883381924198,
"grad_norm": 0.012082048691809177,
"learning_rate": 0.0002,
"loss": 0.6070762872695923,
"mean_token_accuracy": 0.7520242631435394,
"num_tokens": 20598383.0,
"step": 552
},
{
"entropy": 0.5919818729162216,
"epoch": 4.2876579203109815,
"grad_norm": 0.011891715228557587,
"learning_rate": 0.0002,
"loss": 0.5928791761398315,
"mean_token_accuracy": 0.7572562247514725,
"num_tokens": 20635386.0,
"step": 553
},
{
"entropy": 0.6074100211262703,
"epoch": 4.295432458697765,
"grad_norm": 0.014123337343335152,
"learning_rate": 0.0002,
"loss": 0.6073712706565857,
"mean_token_accuracy": 0.751992791891098,
"num_tokens": 20672892.0,
"step": 554
},
{
"entropy": 0.5886855572462082,
"epoch": 4.303206997084548,
"grad_norm": 0.0101819122210145,
"learning_rate": 0.0002,
"loss": 0.5912100076675415,
"mean_token_accuracy": 0.7583736777305603,
"num_tokens": 20710466.0,
"step": 555
},
{
"entropy": 0.6005367860198021,
"epoch": 4.310981535471331,
"grad_norm": 0.014812132343649864,
"learning_rate": 0.0002,
"loss": 0.6055353879928589,
"mean_token_accuracy": 0.7521958500146866,
"num_tokens": 20747846.0,
"step": 556
},
{
"entropy": 0.5981654673814774,
"epoch": 4.318756073858115,
"grad_norm": 0.011666829697787762,
"learning_rate": 0.0002,
"loss": 0.597842276096344,
"mean_token_accuracy": 0.7551755681633949,
"num_tokens": 20784741.0,
"step": 557
},
{
"entropy": 0.5991752445697784,
"epoch": 4.326530612244898,
"grad_norm": 0.012378910556435585,
"learning_rate": 0.0002,
"loss": 0.5976471900939941,
"mean_token_accuracy": 0.7547527700662613,
"num_tokens": 20822385.0,
"step": 558
},
{
"entropy": 0.6060795336961746,
"epoch": 4.334305150631681,
"grad_norm": 0.012490339577198029,
"learning_rate": 0.0002,
"loss": 0.6054461002349854,
"mean_token_accuracy": 0.7526181265711784,
"num_tokens": 20860006.0,
"step": 559
},
{
"entropy": 0.6072399467229843,
"epoch": 4.3420796890184645,
"grad_norm": 0.014051525853574276,
"learning_rate": 0.0002,
"loss": 0.6056400537490845,
"mean_token_accuracy": 0.7516866251826286,
"num_tokens": 20897385.0,
"step": 560
},
{
"entropy": 0.5980757176876068,
"epoch": 4.349854227405248,
"grad_norm": 0.011723170056939125,
"learning_rate": 0.0002,
"loss": 0.5963304042816162,
"mean_token_accuracy": 0.758495531976223,
"num_tokens": 20934914.0,
"step": 561
},
{
"entropy": 0.5847646594047546,
"epoch": 4.357628765792031,
"grad_norm": 0.013849250972270966,
"learning_rate": 0.0002,
"loss": 0.5895295143127441,
"mean_token_accuracy": 0.7575425952672958,
"num_tokens": 20972211.0,
"step": 562
},
{
"entropy": 0.5863577350974083,
"epoch": 4.365403304178814,
"grad_norm": 0.01223720796406269,
"learning_rate": 0.0002,
"loss": 0.5942325592041016,
"mean_token_accuracy": 0.7572259679436684,
"num_tokens": 21009384.0,
"step": 563
},
{
"entropy": 0.5997140482068062,
"epoch": 4.373177842565598,
"grad_norm": 0.014335358515381813,
"learning_rate": 0.0002,
"loss": 0.6024245619773865,
"mean_token_accuracy": 0.7510812431573868,
"num_tokens": 21046739.0,
"step": 564
},
{
"entropy": 0.6076342239975929,
"epoch": 4.380952380952381,
"grad_norm": 0.012497556395828724,
"learning_rate": 0.0002,
"loss": 0.6062162518501282,
"mean_token_accuracy": 0.7522109970450401,
"num_tokens": 21084263.0,
"step": 565
},
{
"entropy": 0.6001847013831139,
"epoch": 4.388726919339164,
"grad_norm": 0.010952596552670002,
"learning_rate": 0.0002,
"loss": 0.6020297408103943,
"mean_token_accuracy": 0.753420390188694,
"num_tokens": 21121894.0,
"step": 566
},
{
"entropy": 0.6051000133156776,
"epoch": 4.396501457725948,
"grad_norm": 0.013345146551728249,
"learning_rate": 0.0002,
"loss": 0.6103641986846924,
"mean_token_accuracy": 0.7505576461553574,
"num_tokens": 21159434.0,
"step": 567
},
{
"entropy": 0.5888576209545135,
"epoch": 4.404275996112731,
"grad_norm": 0.011659773997962475,
"learning_rate": 0.0002,
"loss": 0.5904802680015564,
"mean_token_accuracy": 0.7587999328970909,
"num_tokens": 21197109.0,
"step": 568
},
{
"entropy": 0.6007365435361862,
"epoch": 4.412050534499514,
"grad_norm": 0.010827448219060898,
"learning_rate": 0.0002,
"loss": 0.6000881195068359,
"mean_token_accuracy": 0.7543788328766823,
"num_tokens": 21234413.0,
"step": 569
},
{
"entropy": 0.5974342674016953,
"epoch": 4.419825072886297,
"grad_norm": 0.012830649502575397,
"learning_rate": 0.0002,
"loss": 0.6020520925521851,
"mean_token_accuracy": 0.7534354031085968,
"num_tokens": 21271758.0,
"step": 570
},
{
"entropy": 0.6090180650353432,
"epoch": 4.427599611273081,
"grad_norm": 0.012071631848812103,
"learning_rate": 0.0002,
"loss": 0.6067869663238525,
"mean_token_accuracy": 0.7518825978040695,
"num_tokens": 21309387.0,
"step": 571
},
{
"entropy": 0.5914840847253799,
"epoch": 4.4353741496598635,
"grad_norm": 0.013224054127931595,
"learning_rate": 0.0002,
"loss": 0.595637857913971,
"mean_token_accuracy": 0.7551431059837341,
"num_tokens": 21346475.0,
"step": 572
},
{
"entropy": 0.5997625440359116,
"epoch": 4.443148688046647,
"grad_norm": 0.011799960397183895,
"learning_rate": 0.0002,
"loss": 0.602319598197937,
"mean_token_accuracy": 0.7539779245853424,
"num_tokens": 21383957.0,
"step": 573
},
{
"entropy": 0.6102292612195015,
"epoch": 4.450923226433431,
"grad_norm": 0.01201384887099266,
"learning_rate": 0.0002,
"loss": 0.6108826398849487,
"mean_token_accuracy": 0.7517506182193756,
"num_tokens": 21421332.0,
"step": 574
},
{
"entropy": 0.5991413816809654,
"epoch": 4.458697764820214,
"grad_norm": 0.010899091139435768,
"learning_rate": 0.0002,
"loss": 0.596094012260437,
"mean_token_accuracy": 0.7565351948142052,
"num_tokens": 21458719.0,
"step": 575
},
{
"entropy": 0.5933232456445694,
"epoch": 4.466472303206997,
"grad_norm": 0.010439079254865646,
"learning_rate": 0.0002,
"loss": 0.5930327773094177,
"mean_token_accuracy": 0.7583755627274513,
"num_tokens": 21496264.0,
"step": 576
},
{
"entropy": 0.6057801619172096,
"epoch": 4.47424684159378,
"grad_norm": 0.011234867386519909,
"learning_rate": 0.0002,
"loss": 0.6073678135871887,
"mean_token_accuracy": 0.7530662715435028,
"num_tokens": 21533621.0,
"step": 577
},
{
"entropy": 0.6064127087593079,
"epoch": 4.482021379980564,
"grad_norm": 0.01104860007762909,
"learning_rate": 0.0002,
"loss": 0.6121537685394287,
"mean_token_accuracy": 0.7498331218957901,
"num_tokens": 21570804.0,
"step": 578
},
{
"entropy": 0.5948187559843063,
"epoch": 4.489795918367347,
"grad_norm": 0.01251922082155943,
"learning_rate": 0.0002,
"loss": 0.598996102809906,
"mean_token_accuracy": 0.7545123025774956,
"num_tokens": 21607975.0,
"step": 579
},
{
"entropy": 0.614658959209919,
"epoch": 4.49757045675413,
"grad_norm": 0.010701852850615978,
"learning_rate": 0.0002,
"loss": 0.6137805581092834,
"mean_token_accuracy": 0.7465793862938881,
"num_tokens": 21645423.0,
"step": 580
},
{
"entropy": 0.5894118696451187,
"epoch": 4.505344995140914,
"grad_norm": 0.012251303531229496,
"learning_rate": 0.0002,
"loss": 0.5877728462219238,
"mean_token_accuracy": 0.75811368227005,
"num_tokens": 21682411.0,
"step": 581
},
{
"entropy": 0.6109742075204849,
"epoch": 4.513119533527696,
"grad_norm": 0.011500229127705097,
"learning_rate": 0.0002,
"loss": 0.6115055084228516,
"mean_token_accuracy": 0.7521626874804497,
"num_tokens": 21720167.0,
"step": 582
},
{
"entropy": 0.591577798128128,
"epoch": 4.52089407191448,
"grad_norm": 0.011309963651001453,
"learning_rate": 0.0002,
"loss": 0.5981800556182861,
"mean_token_accuracy": 0.7563935667276382,
"num_tokens": 21758012.0,
"step": 583
},
{
"entropy": 0.6063844040036201,
"epoch": 4.528668610301263,
"grad_norm": 0.014559866860508919,
"learning_rate": 0.0002,
"loss": 0.6146761178970337,
"mean_token_accuracy": 0.7492925748229027,
"num_tokens": 21795528.0,
"step": 584
},
{
"entropy": 0.5918325483798981,
"epoch": 4.536443148688047,
"grad_norm": 0.011580277234315872,
"learning_rate": 0.0002,
"loss": 0.5908594131469727,
"mean_token_accuracy": 0.7565957456827164,
"num_tokens": 21833000.0,
"step": 585
},
{
"entropy": 0.612893208861351,
"epoch": 4.54421768707483,
"grad_norm": 0.01330646313726902,
"learning_rate": 0.0002,
"loss": 0.6055165529251099,
"mean_token_accuracy": 0.7545250579714775,
"num_tokens": 21870418.0,
"step": 586
},
{
"entropy": 0.5842209830880165,
"epoch": 4.551992225461613,
"grad_norm": 0.012110188603401184,
"learning_rate": 0.0002,
"loss": 0.5849249362945557,
"mean_token_accuracy": 0.7618754804134369,
"num_tokens": 21907507.0,
"step": 587
},
{
"entropy": 0.6068574264645576,
"epoch": 4.559766763848397,
"grad_norm": 0.012672025710344315,
"learning_rate": 0.0002,
"loss": 0.6145685911178589,
"mean_token_accuracy": 0.750059075653553,
"num_tokens": 21944988.0,
"step": 588
},
{
"entropy": 0.5868222415447235,
"epoch": 4.567541302235179,
"grad_norm": 0.011733310297131538,
"learning_rate": 0.0002,
"loss": 0.5891362428665161,
"mean_token_accuracy": 0.7605921477079391,
"num_tokens": 21982183.0,
"step": 589
},
{
"entropy": 0.6040458679199219,
"epoch": 4.575315840621963,
"grad_norm": 0.010982259176671505,
"learning_rate": 0.0002,
"loss": 0.6011037230491638,
"mean_token_accuracy": 0.7543822079896927,
"num_tokens": 22019570.0,
"step": 590
},
{
"entropy": 0.5989029258489609,
"epoch": 4.5830903790087465,
"grad_norm": 0.012942496687173843,
"learning_rate": 0.0002,
"loss": 0.5922666788101196,
"mean_token_accuracy": 0.7587461397051811,
"num_tokens": 22056831.0,
"step": 591
},
{
"entropy": 0.5930005833506584,
"epoch": 4.59086491739553,
"grad_norm": 0.010408308357000351,
"learning_rate": 0.0002,
"loss": 0.5919668078422546,
"mean_token_accuracy": 0.7574074566364288,
"num_tokens": 22094356.0,
"step": 592
},
{
"entropy": 0.5869537368416786,
"epoch": 4.598639455782313,
"grad_norm": 0.013977079652249813,
"learning_rate": 0.0002,
"loss": 0.5976507663726807,
"mean_token_accuracy": 0.7580091804265976,
"num_tokens": 22131838.0,
"step": 593
},
{
"entropy": 0.5787304788827896,
"epoch": 4.606413994169096,
"grad_norm": 0.013945071026682854,
"learning_rate": 0.0002,
"loss": 0.5908917188644409,
"mean_token_accuracy": 0.7597628980875015,
"num_tokens": 22169036.0,
"step": 594
},
{
"entropy": 0.6027527749538422,
"epoch": 4.61418853255588,
"grad_norm": 0.00982499960809946,
"learning_rate": 0.0002,
"loss": 0.6021907925605774,
"mean_token_accuracy": 0.7546107098460197,
"num_tokens": 22206352.0,
"step": 595
},
{
"entropy": 0.6077359542250633,
"epoch": 4.6219630709426625,
"grad_norm": 0.011836841702461243,
"learning_rate": 0.0002,
"loss": 0.6049139499664307,
"mean_token_accuracy": 0.7528544068336487,
"num_tokens": 22243663.0,
"step": 596
},
{
"entropy": 0.5822278633713722,
"epoch": 4.629737609329446,
"grad_norm": 0.011577391996979713,
"learning_rate": 0.0002,
"loss": 0.5828737020492554,
"mean_token_accuracy": 0.7616033405065536,
"num_tokens": 22281074.0,
"step": 597
},
{
"entropy": 0.5920702815055847,
"epoch": 4.6375121477162295,
"grad_norm": 0.01129237376153469,
"learning_rate": 0.0002,
"loss": 0.5975418090820312,
"mean_token_accuracy": 0.7549193054437637,
"num_tokens": 22318190.0,
"step": 598
},
{
"entropy": 0.5989422127604485,
"epoch": 4.645286686103013,
"grad_norm": 0.014368323609232903,
"learning_rate": 0.0002,
"loss": 0.6041890978813171,
"mean_token_accuracy": 0.7541765421628952,
"num_tokens": 22355560.0,
"step": 599
},
{
"entropy": 0.602604515850544,
"epoch": 4.653061224489796,
"grad_norm": 0.012781691737473011,
"learning_rate": 0.0002,
"loss": 0.6051725149154663,
"mean_token_accuracy": 0.7530051618814468,
"num_tokens": 22393652.0,
"step": 600
},
{
"entropy": 0.6060863882303238,
"epoch": 4.660835762876579,
"grad_norm": 0.013375566340982914,
"learning_rate": 0.0002,
"loss": 0.6032074689865112,
"mean_token_accuracy": 0.7527770921587944,
"num_tokens": 22431345.0,
"step": 601
},
{
"entropy": 0.5950343683362007,
"epoch": 4.668610301263363,
"grad_norm": 0.012800985015928745,
"learning_rate": 0.0002,
"loss": 0.5933507084846497,
"mean_token_accuracy": 0.7560804039239883,
"num_tokens": 22469042.0,
"step": 602
},
{
"entropy": 0.5962737649679184,
"epoch": 4.6763848396501455,
"grad_norm": 0.014961260370910168,
"learning_rate": 0.0002,
"loss": 0.6006712913513184,
"mean_token_accuracy": 0.7546053975820541,
"num_tokens": 22506485.0,
"step": 603
},
{
"entropy": 0.606819398701191,
"epoch": 4.684159378036929,
"grad_norm": 0.011082889512181282,
"learning_rate": 0.0002,
"loss": 0.6065730452537537,
"mean_token_accuracy": 0.7529779449105263,
"num_tokens": 22544222.0,
"step": 604
},
{
"entropy": 0.577197976410389,
"epoch": 4.691933916423713,
"grad_norm": 0.014075525104999542,
"learning_rate": 0.0002,
"loss": 0.5835320949554443,
"mean_token_accuracy": 0.7612094879150391,
"num_tokens": 22581327.0,
"step": 605
},
{
"entropy": 0.6152481734752655,
"epoch": 4.699708454810495,
"grad_norm": 0.012122808955609798,
"learning_rate": 0.0002,
"loss": 0.6139184236526489,
"mean_token_accuracy": 0.7484366744756699,
"num_tokens": 22619089.0,
"step": 606
},
{
"entropy": 0.6120219603180885,
"epoch": 4.707482993197279,
"grad_norm": 0.011670667678117752,
"learning_rate": 0.0002,
"loss": 0.6125247478485107,
"mean_token_accuracy": 0.7505181655287743,
"num_tokens": 22656719.0,
"step": 607
},
{
"entropy": 0.5946462079882622,
"epoch": 4.715257531584062,
"grad_norm": 0.011501600034534931,
"learning_rate": 0.0002,
"loss": 0.600022554397583,
"mean_token_accuracy": 0.7565812543034554,
"num_tokens": 22694298.0,
"step": 608
},
{
"entropy": 0.5967997536063194,
"epoch": 4.723032069970845,
"grad_norm": 0.011824545450508595,
"learning_rate": 0.0002,
"loss": 0.6004019975662231,
"mean_token_accuracy": 0.7516064792871475,
"num_tokens": 22731785.0,
"step": 609
},
{
"entropy": 0.6012083142995834,
"epoch": 4.730806608357629,
"grad_norm": 0.009814469143748283,
"learning_rate": 0.0002,
"loss": 0.6001886129379272,
"mean_token_accuracy": 0.7529330998659134,
"num_tokens": 22769434.0,
"step": 610
},
{
"entropy": 0.6195448860526085,
"epoch": 4.738581146744412,
"grad_norm": 0.012913862243294716,
"learning_rate": 0.0002,
"loss": 0.6205934286117554,
"mean_token_accuracy": 0.7455445975065231,
"num_tokens": 22806676.0,
"step": 611
},
{
"entropy": 0.5957802012562752,
"epoch": 4.746355685131196,
"grad_norm": 0.011553781107068062,
"learning_rate": 0.0002,
"loss": 0.5980523824691772,
"mean_token_accuracy": 0.7560853660106659,
"num_tokens": 22843869.0,
"step": 612
},
{
"entropy": 0.6090810522437096,
"epoch": 4.754130223517978,
"grad_norm": 0.01271018385887146,
"learning_rate": 0.0002,
"loss": 0.6106667518615723,
"mean_token_accuracy": 0.7504242658615112,
"num_tokens": 22881762.0,
"step": 613
},
{
"entropy": 0.599302776157856,
"epoch": 4.761904761904762,
"grad_norm": 0.012581666931509972,
"learning_rate": 0.0002,
"loss": 0.5982247591018677,
"mean_token_accuracy": 0.7549748122692108,
"num_tokens": 22918922.0,
"step": 614
},
{
"entropy": 0.5844490081071854,
"epoch": 4.769679300291545,
"grad_norm": 0.011192350648343563,
"learning_rate": 0.0002,
"loss": 0.5844826698303223,
"mean_token_accuracy": 0.7625714018940926,
"num_tokens": 22956332.0,
"step": 615
},
{
"entropy": 0.5874569863080978,
"epoch": 4.777453838678328,
"grad_norm": 0.014751655049622059,
"learning_rate": 0.0002,
"loss": 0.5924921035766602,
"mean_token_accuracy": 0.7579960823059082,
"num_tokens": 22993598.0,
"step": 616
},
{
"entropy": 0.5977986827492714,
"epoch": 4.785228377065112,
"grad_norm": 0.011030304245650768,
"learning_rate": 0.0002,
"loss": 0.6010499000549316,
"mean_token_accuracy": 0.7557829320430756,
"num_tokens": 23031001.0,
"step": 617
},
{
"entropy": 0.599865585565567,
"epoch": 4.793002915451895,
"grad_norm": 0.011046946048736572,
"learning_rate": 0.0002,
"loss": 0.6028144359588623,
"mean_token_accuracy": 0.7549864649772644,
"num_tokens": 23068467.0,
"step": 618
},
{
"entropy": 0.6039430871605873,
"epoch": 4.800777453838679,
"grad_norm": 0.011677506379783154,
"learning_rate": 0.0002,
"loss": 0.6007229089736938,
"mean_token_accuracy": 0.7543792948126793,
"num_tokens": 23105954.0,
"step": 619
},
{
"entropy": 0.5956612825393677,
"epoch": 4.808551992225461,
"grad_norm": 0.011992014944553375,
"learning_rate": 0.0002,
"loss": 0.5964670181274414,
"mean_token_accuracy": 0.7563618123531342,
"num_tokens": 23143320.0,
"step": 620
},
{
"entropy": 0.5978101342916489,
"epoch": 4.816326530612245,
"grad_norm": 0.011897146701812744,
"learning_rate": 0.0002,
"loss": 0.6034868359565735,
"mean_token_accuracy": 0.7537665143609047,
"num_tokens": 23180916.0,
"step": 621
},
{
"entropy": 0.5931472703814507,
"epoch": 4.8241010689990285,
"grad_norm": 0.013459539040923119,
"learning_rate": 0.0002,
"loss": 0.6040017604827881,
"mean_token_accuracy": 0.7539473846554756,
"num_tokens": 23218627.0,
"step": 622
},
{
"entropy": 0.5916698947548866,
"epoch": 4.831875607385811,
"grad_norm": 0.011180682107806206,
"learning_rate": 0.0002,
"loss": 0.5919395685195923,
"mean_token_accuracy": 0.7593255490064621,
"num_tokens": 23255772.0,
"step": 623
},
{
"entropy": 0.6087042316794395,
"epoch": 4.839650145772595,
"grad_norm": 0.010437374003231525,
"learning_rate": 0.0002,
"loss": 0.6082122325897217,
"mean_token_accuracy": 0.7515282183885574,
"num_tokens": 23293061.0,
"step": 624
},
{
"entropy": 0.5966414213180542,
"epoch": 4.847424684159378,
"grad_norm": 0.011942134238779545,
"learning_rate": 0.0002,
"loss": 0.595150351524353,
"mean_token_accuracy": 0.7563839182257652,
"num_tokens": 23330109.0,
"step": 625
},
{
"entropy": 0.5881121456623077,
"epoch": 4.855199222546162,
"grad_norm": 0.011955403722822666,
"learning_rate": 0.0002,
"loss": 0.590496301651001,
"mean_token_accuracy": 0.7592649832367897,
"num_tokens": 23367496.0,
"step": 626
},
{
"entropy": 0.6133239194750786,
"epoch": 4.862973760932944,
"grad_norm": 0.012963500805199146,
"learning_rate": 0.0002,
"loss": 0.6236002445220947,
"mean_token_accuracy": 0.7459099292755127,
"num_tokens": 23404854.0,
"step": 627
},
{
"entropy": 0.5968378111720085,
"epoch": 4.870748299319728,
"grad_norm": 0.013238959014415741,
"learning_rate": 0.0002,
"loss": 0.5976919531822205,
"mean_token_accuracy": 0.7568426579236984,
"num_tokens": 23442227.0,
"step": 628
},
{
"entropy": 0.609023816883564,
"epoch": 4.8785228377065115,
"grad_norm": 0.012166466563940048,
"learning_rate": 0.0002,
"loss": 0.6067010164260864,
"mean_token_accuracy": 0.7532210573554039,
"num_tokens": 23479346.0,
"step": 629
},
{
"entropy": 0.6018581166863441,
"epoch": 4.886297376093294,
"grad_norm": 0.011096199974417686,
"learning_rate": 0.0002,
"loss": 0.5967071652412415,
"mean_token_accuracy": 0.7587796524167061,
"num_tokens": 23516484.0,
"step": 630
},
{
"entropy": 0.6068798899650574,
"epoch": 4.894071914480078,
"grad_norm": 0.0127568943426013,
"learning_rate": 0.0002,
"loss": 0.6059014797210693,
"mean_token_accuracy": 0.7524421662092209,
"num_tokens": 23553907.0,
"step": 631
},
{
"entropy": 0.5919808447360992,
"epoch": 4.901846452866861,
"grad_norm": 0.011789746582508087,
"learning_rate": 0.0002,
"loss": 0.596630334854126,
"mean_token_accuracy": 0.757590651512146,
"num_tokens": 23591693.0,
"step": 632
},
{
"entropy": 0.6100347265601158,
"epoch": 4.909620991253644,
"grad_norm": 0.013258693739771843,
"learning_rate": 0.0002,
"loss": 0.6171900033950806,
"mean_token_accuracy": 0.7499294355511665,
"num_tokens": 23629030.0,
"step": 633
},
{
"entropy": 0.5936124697327614,
"epoch": 4.9173955296404275,
"grad_norm": 0.011930654756724834,
"learning_rate": 0.0002,
"loss": 0.5924524664878845,
"mean_token_accuracy": 0.7581655383110046,
"num_tokens": 23666601.0,
"step": 634
},
{
"entropy": 0.6037433966994286,
"epoch": 4.925170068027211,
"grad_norm": 0.010547666810452938,
"learning_rate": 0.0002,
"loss": 0.6054027080535889,
"mean_token_accuracy": 0.7513353079557419,
"num_tokens": 23703928.0,
"step": 635
},
{
"entropy": 0.6012375876307487,
"epoch": 4.932944606413994,
"grad_norm": 0.013904466293752193,
"learning_rate": 0.0002,
"loss": 0.6056373119354248,
"mean_token_accuracy": 0.7527650520205498,
"num_tokens": 23741413.0,
"step": 636
},
{
"entropy": 0.6080401092767715,
"epoch": 4.940719144800777,
"grad_norm": 0.012218053452670574,
"learning_rate": 0.0002,
"loss": 0.6113067865371704,
"mean_token_accuracy": 0.7506906762719154,
"num_tokens": 23778797.0,
"step": 637
},
{
"entropy": 0.6042793691158295,
"epoch": 4.948493683187561,
"grad_norm": 0.012100595980882645,
"learning_rate": 0.0002,
"loss": 0.6038735508918762,
"mean_token_accuracy": 0.7550994455814362,
"num_tokens": 23816409.0,
"step": 638
},
{
"entropy": 0.5889951586723328,
"epoch": 4.956268221574344,
"grad_norm": 0.012997129000723362,
"learning_rate": 0.0002,
"loss": 0.5903059840202332,
"mean_token_accuracy": 0.7594538182020187,
"num_tokens": 23853723.0,
"step": 639
},
{
"entropy": 0.5925157070159912,
"epoch": 4.964042759961127,
"grad_norm": 0.015738792717456818,
"learning_rate": 0.0002,
"loss": 0.5936194658279419,
"mean_token_accuracy": 0.7593093439936638,
"num_tokens": 23891029.0,
"step": 640
},
{
"entropy": 0.5936921015381813,
"epoch": 4.9718172983479105,
"grad_norm": 0.01318391039967537,
"learning_rate": 0.0002,
"loss": 0.5958787202835083,
"mean_token_accuracy": 0.7549382373690605,
"num_tokens": 23928148.0,
"step": 641
},
{
"entropy": 0.6125310584902763,
"epoch": 4.979591836734694,
"grad_norm": 0.013194733299314976,
"learning_rate": 0.0002,
"loss": 0.6129195094108582,
"mean_token_accuracy": 0.7493861764669418,
"num_tokens": 23965085.0,
"step": 642
},
{
"entropy": 0.5964741930365562,
"epoch": 4.987366375121477,
"grad_norm": 0.013308845460414886,
"learning_rate": 0.0002,
"loss": 0.5979577302932739,
"mean_token_accuracy": 0.7562628239393234,
"num_tokens": 24002145.0,
"step": 643
},
{
"entropy": 0.5872825607657433,
"epoch": 4.99514091350826,
"grad_norm": 0.010709763504564762,
"learning_rate": 0.0002,
"loss": 0.5851190686225891,
"mean_token_accuracy": 0.7606633305549622,
"num_tokens": 24039501.0,
"step": 644
},
{
"entropy": 0.6111570835113526,
"epoch": 5.0,
"grad_norm": 0.012978802435100079,
"learning_rate": 0.0002,
"loss": 0.6106741428375244,
"mean_token_accuracy": 0.749509060382843,
"num_tokens": 24062815.0,
"step": 645
}
],
"logging_steps": 1,
"max_steps": 645,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.2502112888923095e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}