eac123's picture
Upload final checkpoint (checkpoint-770)
4c556f9 verified
Raw
History Blame
223 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 770,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.1441087871789932,
"epoch": 0.006498781478472786,
"grad_norm": 0.22594086825847626,
"learning_rate": 0.0002,
"loss": 2.612501859664917,
"mean_token_accuracy": 0.5085290372371674,
"num_tokens": 37502.0,
"step": 1
},
{
"entropy": 1.2685535103082657,
"epoch": 0.012997562956945572,
"grad_norm": 0.1942373365163803,
"learning_rate": 0.0002,
"loss": 2.2667126655578613,
"mean_token_accuracy": 0.5350659266114235,
"num_tokens": 75406.0,
"step": 2
},
{
"entropy": 1.4654520899057388,
"epoch": 0.01949634443541836,
"grad_norm": 0.13897432386875153,
"learning_rate": 0.0002,
"loss": 1.8304898738861084,
"mean_token_accuracy": 0.5590623021125793,
"num_tokens": 112903.0,
"step": 3
},
{
"entropy": 1.4532236605882645,
"epoch": 0.025995125913891144,
"grad_norm": 0.11201836168766022,
"learning_rate": 0.0002,
"loss": 1.496299147605896,
"mean_token_accuracy": 0.6046230122447014,
"num_tokens": 150359.0,
"step": 4
},
{
"entropy": 1.4331371188163757,
"epoch": 0.03249390739236393,
"grad_norm": 0.14954882860183716,
"learning_rate": 0.0002,
"loss": 1.3865656852722168,
"mean_token_accuracy": 0.6091600209474564,
"num_tokens": 187830.0,
"step": 5
},
{
"entropy": 1.3669009655714035,
"epoch": 0.03899268887083672,
"grad_norm": 0.09565649181604385,
"learning_rate": 0.0002,
"loss": 1.2659735679626465,
"mean_token_accuracy": 0.6358497440814972,
"num_tokens": 225297.0,
"step": 6
},
{
"entropy": 1.2914617359638214,
"epoch": 0.045491470349309504,
"grad_norm": 0.0539422333240509,
"learning_rate": 0.0002,
"loss": 1.1662700176239014,
"mean_token_accuracy": 0.6492680311203003,
"num_tokens": 262906.0,
"step": 7
},
{
"entropy": 1.249274119734764,
"epoch": 0.05199025182778229,
"grad_norm": 0.051388416439294815,
"learning_rate": 0.0002,
"loss": 1.1255854368209839,
"mean_token_accuracy": 0.6475581750273705,
"num_tokens": 300403.0,
"step": 8
},
{
"entropy": 1.1595238000154495,
"epoch": 0.05848903330625508,
"grad_norm": 0.057235199958086014,
"learning_rate": 0.0002,
"loss": 1.0490708351135254,
"mean_token_accuracy": 0.6654231324791908,
"num_tokens": 337487.0,
"step": 9
},
{
"entropy": 1.0685205161571503,
"epoch": 0.06498781478472786,
"grad_norm": 0.0577155165374279,
"learning_rate": 0.0002,
"loss": 0.97551429271698,
"mean_token_accuracy": 0.6776877418160439,
"num_tokens": 374847.0,
"step": 10
},
{
"entropy": 0.9968453124165535,
"epoch": 0.07148659626320066,
"grad_norm": 0.04976983740925789,
"learning_rate": 0.0002,
"loss": 0.9292951822280884,
"mean_token_accuracy": 0.6831405088305473,
"num_tokens": 412186.0,
"step": 11
},
{
"entropy": 0.9424244612455368,
"epoch": 0.07798537774167344,
"grad_norm": 0.37462693452835083,
"learning_rate": 0.0002,
"loss": 0.8883110284805298,
"mean_token_accuracy": 0.6893546730279922,
"num_tokens": 449659.0,
"step": 12
},
{
"entropy": 0.9025738090276718,
"epoch": 0.08448415922014622,
"grad_norm": 0.04783688113093376,
"learning_rate": 0.0002,
"loss": 0.8548192977905273,
"mean_token_accuracy": 0.6972228810191154,
"num_tokens": 487236.0,
"step": 13
},
{
"entropy": 0.8390183448791504,
"epoch": 0.09098294069861901,
"grad_norm": 0.06745485961437225,
"learning_rate": 0.0002,
"loss": 0.8280504941940308,
"mean_token_accuracy": 0.7010790929198265,
"num_tokens": 524798.0,
"step": 14
},
{
"entropy": 0.7939982861280441,
"epoch": 0.09748172217709179,
"grad_norm": 0.10931341350078583,
"learning_rate": 0.0002,
"loss": 0.8073402643203735,
"mean_token_accuracy": 0.702845998108387,
"num_tokens": 561826.0,
"step": 15
},
{
"entropy": 0.762756697833538,
"epoch": 0.10398050365556458,
"grad_norm": 0.03783512860536575,
"learning_rate": 0.0002,
"loss": 0.7596306800842285,
"mean_token_accuracy": 0.7148320376873016,
"num_tokens": 599249.0,
"step": 16
},
{
"entropy": 0.7585324719548225,
"epoch": 0.11047928513403736,
"grad_norm": 0.039289139211177826,
"learning_rate": 0.0002,
"loss": 0.7472726106643677,
"mean_token_accuracy": 0.7169229537248611,
"num_tokens": 636495.0,
"step": 17
},
{
"entropy": 0.7434245273470879,
"epoch": 0.11697806661251016,
"grad_norm": 0.04286178946495056,
"learning_rate": 0.0002,
"loss": 0.7349382638931274,
"mean_token_accuracy": 0.7195246070623398,
"num_tokens": 674172.0,
"step": 18
},
{
"entropy": 0.7307169139385223,
"epoch": 0.12347684809098294,
"grad_norm": 0.03696495294570923,
"learning_rate": 0.0002,
"loss": 0.7205268144607544,
"mean_token_accuracy": 0.7222909703850746,
"num_tokens": 711746.0,
"step": 19
},
{
"entropy": 0.724890224635601,
"epoch": 0.12997562956945571,
"grad_norm": 0.03647635132074356,
"learning_rate": 0.0002,
"loss": 0.7131904363632202,
"mean_token_accuracy": 0.7218770682811737,
"num_tokens": 748966.0,
"step": 20
},
{
"entropy": 0.7279537171125412,
"epoch": 0.1364744110479285,
"grad_norm": 0.033042650669813156,
"learning_rate": 0.0002,
"loss": 0.7094431519508362,
"mean_token_accuracy": 0.7240697368979454,
"num_tokens": 786631.0,
"step": 21
},
{
"entropy": 0.7210045382380486,
"epoch": 0.1429731925264013,
"grad_norm": 0.033061351627111435,
"learning_rate": 0.0002,
"loss": 0.7019110918045044,
"mean_token_accuracy": 0.7280351296067238,
"num_tokens": 823906.0,
"step": 22
},
{
"entropy": 0.6902946382761002,
"epoch": 0.14947197400487408,
"grad_norm": 0.03491866961121559,
"learning_rate": 0.0002,
"loss": 0.683687150478363,
"mean_token_accuracy": 0.7348670437932014,
"num_tokens": 860977.0,
"step": 23
},
{
"entropy": 0.6839202269911766,
"epoch": 0.15597075548334688,
"grad_norm": 0.030243346467614174,
"learning_rate": 0.0002,
"loss": 0.673778772354126,
"mean_token_accuracy": 0.7354807555675507,
"num_tokens": 898933.0,
"step": 24
},
{
"entropy": 0.6664924547076225,
"epoch": 0.16246953696181965,
"grad_norm": 0.026247479021549225,
"learning_rate": 0.0002,
"loss": 0.6572352051734924,
"mean_token_accuracy": 0.7394573912024498,
"num_tokens": 935795.0,
"step": 25
},
{
"entropy": 0.6681515946984291,
"epoch": 0.16896831844029245,
"grad_norm": 0.03119724616408348,
"learning_rate": 0.0002,
"loss": 0.6646086573600769,
"mean_token_accuracy": 0.7379100769758224,
"num_tokens": 973280.0,
"step": 26
},
{
"entropy": 0.6617112681269646,
"epoch": 0.17546709991876522,
"grad_norm": 0.031551606953144073,
"learning_rate": 0.0002,
"loss": 0.6585603952407837,
"mean_token_accuracy": 0.7389705181121826,
"num_tokens": 1010622.0,
"step": 27
},
{
"entropy": 0.6501665636897087,
"epoch": 0.18196588139723802,
"grad_norm": 0.02211320586502552,
"learning_rate": 0.0002,
"loss": 0.6490904092788696,
"mean_token_accuracy": 0.7440381571650505,
"num_tokens": 1047900.0,
"step": 28
},
{
"entropy": 0.6470993533730507,
"epoch": 0.18846466287571081,
"grad_norm": 0.027688423171639442,
"learning_rate": 0.0002,
"loss": 0.6543895602226257,
"mean_token_accuracy": 0.7402380779385567,
"num_tokens": 1085392.0,
"step": 29
},
{
"entropy": 0.6416624039411545,
"epoch": 0.19496344435418358,
"grad_norm": 0.025217361748218536,
"learning_rate": 0.0002,
"loss": 0.651384711265564,
"mean_token_accuracy": 0.7433382496237755,
"num_tokens": 1122465.0,
"step": 30
},
{
"entropy": 0.6523652598261833,
"epoch": 0.20146222583265638,
"grad_norm": 0.025227373465895653,
"learning_rate": 0.0002,
"loss": 0.6592613458633423,
"mean_token_accuracy": 0.7378358989953995,
"num_tokens": 1160451.0,
"step": 31
},
{
"entropy": 0.6369072422385216,
"epoch": 0.20796100731112915,
"grad_norm": 0.021375838667154312,
"learning_rate": 0.0002,
"loss": 0.6419180631637573,
"mean_token_accuracy": 0.7449744045734406,
"num_tokens": 1198041.0,
"step": 32
},
{
"entropy": 0.6256191805005074,
"epoch": 0.21445978878960195,
"grad_norm": 0.03092559427022934,
"learning_rate": 0.0002,
"loss": 0.6407320499420166,
"mean_token_accuracy": 0.7460681945085526,
"num_tokens": 1235291.0,
"step": 33
},
{
"entropy": 0.6299648508429527,
"epoch": 0.22095857026807472,
"grad_norm": 0.021124541759490967,
"learning_rate": 0.0002,
"loss": 0.6359473466873169,
"mean_token_accuracy": 0.7471542730927467,
"num_tokens": 1272686.0,
"step": 34
},
{
"entropy": 0.6513500586152077,
"epoch": 0.22745735174654752,
"grad_norm": 0.020855363458395004,
"learning_rate": 0.0002,
"loss": 0.6451584100723267,
"mean_token_accuracy": 0.7422506660223007,
"num_tokens": 1310182.0,
"step": 35
},
{
"entropy": 0.6261186450719833,
"epoch": 0.23395613322502032,
"grad_norm": 0.019606754183769226,
"learning_rate": 0.0002,
"loss": 0.6181178092956543,
"mean_token_accuracy": 0.7557711079716682,
"num_tokens": 1347558.0,
"step": 36
},
{
"entropy": 0.6535262390971184,
"epoch": 0.2404549147034931,
"grad_norm": 0.016229776665568352,
"learning_rate": 0.0002,
"loss": 0.6474911570549011,
"mean_token_accuracy": 0.7401541844010353,
"num_tokens": 1385217.0,
"step": 37
},
{
"entropy": 0.6392895579338074,
"epoch": 0.2469536961819659,
"grad_norm": 0.01589571312069893,
"learning_rate": 0.0002,
"loss": 0.6345689296722412,
"mean_token_accuracy": 0.7464647218585014,
"num_tokens": 1422439.0,
"step": 38
},
{
"entropy": 0.6444704979658127,
"epoch": 0.25345247766043866,
"grad_norm": 0.019169991835951805,
"learning_rate": 0.0002,
"loss": 0.6417882442474365,
"mean_token_accuracy": 0.7431693077087402,
"num_tokens": 1459951.0,
"step": 39
},
{
"entropy": 0.6366401016712189,
"epoch": 0.25995125913891143,
"grad_norm": 0.016541991382837296,
"learning_rate": 0.0002,
"loss": 0.6387360095977783,
"mean_token_accuracy": 0.7458900958299637,
"num_tokens": 1497263.0,
"step": 40
},
{
"entropy": 0.6309419572353363,
"epoch": 0.26645004061738425,
"grad_norm": 0.02144729532301426,
"learning_rate": 0.0002,
"loss": 0.635954737663269,
"mean_token_accuracy": 0.7469696402549744,
"num_tokens": 1534631.0,
"step": 41
},
{
"entropy": 0.6426582857966423,
"epoch": 0.272948822095857,
"grad_norm": 0.017918268218636513,
"learning_rate": 0.0002,
"loss": 0.6445891261100769,
"mean_token_accuracy": 0.7427951768040657,
"num_tokens": 1572110.0,
"step": 42
},
{
"entropy": 0.6238497421145439,
"epoch": 0.2794476035743298,
"grad_norm": 0.016322394832968712,
"learning_rate": 0.0002,
"loss": 0.6238967180252075,
"mean_token_accuracy": 0.7503543570637703,
"num_tokens": 1608997.0,
"step": 43
},
{
"entropy": 0.6374280378222466,
"epoch": 0.2859463850528026,
"grad_norm": 0.0153085608035326,
"learning_rate": 0.0002,
"loss": 0.6364343762397766,
"mean_token_accuracy": 0.745714507997036,
"num_tokens": 1646556.0,
"step": 44
},
{
"entropy": 0.6222607344388962,
"epoch": 0.2924451665312754,
"grad_norm": 0.016996094956994057,
"learning_rate": 0.0002,
"loss": 0.6201090812683105,
"mean_token_accuracy": 0.7516758143901825,
"num_tokens": 1683700.0,
"step": 45
},
{
"entropy": 0.636712834239006,
"epoch": 0.29894394800974816,
"grad_norm": 0.016749687492847443,
"learning_rate": 0.0002,
"loss": 0.6368897557258606,
"mean_token_accuracy": 0.746493011713028,
"num_tokens": 1720661.0,
"step": 46
},
{
"entropy": 0.6459397748112679,
"epoch": 0.30544272948822093,
"grad_norm": 0.011651836335659027,
"learning_rate": 0.0002,
"loss": 0.6419233083724976,
"mean_token_accuracy": 0.7443490549921989,
"num_tokens": 1758131.0,
"step": 47
},
{
"entropy": 0.6379885226488113,
"epoch": 0.31194151096669376,
"grad_norm": 0.013901753351092339,
"learning_rate": 0.0002,
"loss": 0.6361222267150879,
"mean_token_accuracy": 0.746205136179924,
"num_tokens": 1795397.0,
"step": 48
},
{
"entropy": 0.6377697363495827,
"epoch": 0.31844029244516653,
"grad_norm": 0.014066919684410095,
"learning_rate": 0.0002,
"loss": 0.6356197595596313,
"mean_token_accuracy": 0.7455531656742096,
"num_tokens": 1832991.0,
"step": 49
},
{
"entropy": 0.6351528614759445,
"epoch": 0.3249390739236393,
"grad_norm": 0.013286196626722813,
"learning_rate": 0.0002,
"loss": 0.6371215581893921,
"mean_token_accuracy": 0.7454295605421066,
"num_tokens": 1870273.0,
"step": 50
},
{
"entropy": 0.6069519519805908,
"epoch": 0.3314378554021121,
"grad_norm": 0.013732723891735077,
"learning_rate": 0.0002,
"loss": 0.6103472709655762,
"mean_token_accuracy": 0.7536283582448959,
"num_tokens": 1907528.0,
"step": 51
},
{
"entropy": 0.6297546997666359,
"epoch": 0.3379366368805849,
"grad_norm": 0.013711776584386826,
"learning_rate": 0.0002,
"loss": 0.6334048509597778,
"mean_token_accuracy": 0.745865486562252,
"num_tokens": 1945255.0,
"step": 52
},
{
"entropy": 0.6280607059597969,
"epoch": 0.34443541835905767,
"grad_norm": 0.01293123047798872,
"learning_rate": 0.0002,
"loss": 0.6310492753982544,
"mean_token_accuracy": 0.7467462942004204,
"num_tokens": 1982630.0,
"step": 53
},
{
"entropy": 0.6271316409111023,
"epoch": 0.35093419983753044,
"grad_norm": 0.01478263083845377,
"learning_rate": 0.0002,
"loss": 0.6254487037658691,
"mean_token_accuracy": 0.7497461065649986,
"num_tokens": 2020399.0,
"step": 54
},
{
"entropy": 0.6377271711826324,
"epoch": 0.35743298131600326,
"grad_norm": 0.013956044800579548,
"learning_rate": 0.0002,
"loss": 0.6360988020896912,
"mean_token_accuracy": 0.7437145560979843,
"num_tokens": 2057803.0,
"step": 55
},
{
"entropy": 0.6247914582490921,
"epoch": 0.36393176279447603,
"grad_norm": 0.014322548173367977,
"learning_rate": 0.0002,
"loss": 0.6240888833999634,
"mean_token_accuracy": 0.7484056130051613,
"num_tokens": 2094784.0,
"step": 56
},
{
"entropy": 0.6302464827895164,
"epoch": 0.3704305442729488,
"grad_norm": 0.011746145784854889,
"learning_rate": 0.0002,
"loss": 0.633884608745575,
"mean_token_accuracy": 0.7437854781746864,
"num_tokens": 2132466.0,
"step": 57
},
{
"entropy": 0.6274847015738487,
"epoch": 0.37692932575142163,
"grad_norm": 0.013853202573955059,
"learning_rate": 0.0002,
"loss": 0.6355714797973633,
"mean_token_accuracy": 0.7430111691355705,
"num_tokens": 2169906.0,
"step": 58
},
{
"entropy": 0.6265148296952248,
"epoch": 0.3834281072298944,
"grad_norm": 0.01277268398553133,
"learning_rate": 0.0002,
"loss": 0.6335763335227966,
"mean_token_accuracy": 0.7446934059262276,
"num_tokens": 2207365.0,
"step": 59
},
{
"entropy": 0.6214065626263618,
"epoch": 0.38992688870836717,
"grad_norm": 0.010742721147835255,
"learning_rate": 0.0002,
"loss": 0.6200428009033203,
"mean_token_accuracy": 0.748136468231678,
"num_tokens": 2244334.0,
"step": 60
},
{
"entropy": 0.6408857852220535,
"epoch": 0.39642567018683994,
"grad_norm": 0.011468583717942238,
"learning_rate": 0.0002,
"loss": 0.6358450651168823,
"mean_token_accuracy": 0.7437937930226326,
"num_tokens": 2281670.0,
"step": 61
},
{
"entropy": 0.6396703198552132,
"epoch": 0.40292445166531277,
"grad_norm": 0.011673662811517715,
"learning_rate": 0.0002,
"loss": 0.6363998651504517,
"mean_token_accuracy": 0.7431989163160324,
"num_tokens": 2318924.0,
"step": 62
},
{
"entropy": 0.6249052062630653,
"epoch": 0.40942323314378554,
"grad_norm": 0.0118953175842762,
"learning_rate": 0.0002,
"loss": 0.6213114261627197,
"mean_token_accuracy": 0.7500982582569122,
"num_tokens": 2356317.0,
"step": 63
},
{
"entropy": 0.6271346360445023,
"epoch": 0.4159220146222583,
"grad_norm": 0.012425282970070839,
"learning_rate": 0.0002,
"loss": 0.6213847398757935,
"mean_token_accuracy": 0.7495132237672806,
"num_tokens": 2393601.0,
"step": 64
},
{
"entropy": 0.629973016679287,
"epoch": 0.42242079610073113,
"grad_norm": 0.011852126568555832,
"learning_rate": 0.0002,
"loss": 0.6328772306442261,
"mean_token_accuracy": 0.7433357834815979,
"num_tokens": 2430713.0,
"step": 65
},
{
"entropy": 0.625373125076294,
"epoch": 0.4289195775792039,
"grad_norm": 0.011082636192440987,
"learning_rate": 0.0002,
"loss": 0.6278108954429626,
"mean_token_accuracy": 0.7462311089038849,
"num_tokens": 2468332.0,
"step": 66
},
{
"entropy": 0.6213006973266602,
"epoch": 0.4354183590576767,
"grad_norm": 0.012099278159439564,
"learning_rate": 0.0002,
"loss": 0.6325806975364685,
"mean_token_accuracy": 0.748037800192833,
"num_tokens": 2505751.0,
"step": 67
},
{
"entropy": 0.6149301454424858,
"epoch": 0.44191714053614944,
"grad_norm": 0.011624482460319996,
"learning_rate": 0.0002,
"loss": 0.6194391250610352,
"mean_token_accuracy": 0.7509394213557243,
"num_tokens": 2543314.0,
"step": 68
},
{
"entropy": 0.6199035122990608,
"epoch": 0.44841592201462227,
"grad_norm": 0.010423528961837292,
"learning_rate": 0.0002,
"loss": 0.6224488615989685,
"mean_token_accuracy": 0.749529704451561,
"num_tokens": 2580776.0,
"step": 69
},
{
"entropy": 0.6317284181714058,
"epoch": 0.45491470349309504,
"grad_norm": 0.010865025222301483,
"learning_rate": 0.0002,
"loss": 0.6270354986190796,
"mean_token_accuracy": 0.7461089566349983,
"num_tokens": 2618167.0,
"step": 70
},
{
"entropy": 0.6248530969023705,
"epoch": 0.4614134849715678,
"grad_norm": 0.010545512661337852,
"learning_rate": 0.0002,
"loss": 0.6243047714233398,
"mean_token_accuracy": 0.7491967007517815,
"num_tokens": 2655748.0,
"step": 71
},
{
"entropy": 0.6242939457297325,
"epoch": 0.46791226645004064,
"grad_norm": 0.01175450999289751,
"learning_rate": 0.0002,
"loss": 0.6177983283996582,
"mean_token_accuracy": 0.7500801458954811,
"num_tokens": 2693338.0,
"step": 72
},
{
"entropy": 0.6458104699850082,
"epoch": 0.4744110479285134,
"grad_norm": 0.009623173624277115,
"learning_rate": 0.0002,
"loss": 0.6407941579818726,
"mean_token_accuracy": 0.7437473684549332,
"num_tokens": 2730673.0,
"step": 73
},
{
"entropy": 0.6289036273956299,
"epoch": 0.4809098294069862,
"grad_norm": 0.010831008665263653,
"learning_rate": 0.0002,
"loss": 0.6292392015457153,
"mean_token_accuracy": 0.749647282063961,
"num_tokens": 2768101.0,
"step": 74
},
{
"entropy": 0.6329901814460754,
"epoch": 0.487408610885459,
"grad_norm": 0.013034787029027939,
"learning_rate": 0.0002,
"loss": 0.6349586248397827,
"mean_token_accuracy": 0.7437526881694794,
"num_tokens": 2805877.0,
"step": 75
},
{
"entropy": 0.6201201230287552,
"epoch": 0.4939073923639318,
"grad_norm": 0.010362153872847557,
"learning_rate": 0.0002,
"loss": 0.6222230195999146,
"mean_token_accuracy": 0.749205470085144,
"num_tokens": 2843002.0,
"step": 76
},
{
"entropy": 0.6270335763692856,
"epoch": 0.5004061738424046,
"grad_norm": 0.01038055308163166,
"learning_rate": 0.0002,
"loss": 0.6268460154533386,
"mean_token_accuracy": 0.7455538734793663,
"num_tokens": 2880433.0,
"step": 77
},
{
"entropy": 0.6266148760914803,
"epoch": 0.5069049553208773,
"grad_norm": 0.011833865195512772,
"learning_rate": 0.0002,
"loss": 0.6316983699798584,
"mean_token_accuracy": 0.7472645714879036,
"num_tokens": 2917833.0,
"step": 78
},
{
"entropy": 0.6177176311612129,
"epoch": 0.5134037367993501,
"grad_norm": 0.012312863022089005,
"learning_rate": 0.0002,
"loss": 0.620547890663147,
"mean_token_accuracy": 0.7489045560359955,
"num_tokens": 2955261.0,
"step": 79
},
{
"entropy": 0.6255826130509377,
"epoch": 0.5199025182778229,
"grad_norm": 0.011764319613575935,
"learning_rate": 0.0002,
"loss": 0.6278033256530762,
"mean_token_accuracy": 0.7475135996937752,
"num_tokens": 2992205.0,
"step": 80
},
{
"entropy": 0.6303588896989822,
"epoch": 0.5264012997562957,
"grad_norm": 0.01056460291147232,
"learning_rate": 0.0002,
"loss": 0.6343796253204346,
"mean_token_accuracy": 0.7422873452305794,
"num_tokens": 3029696.0,
"step": 81
},
{
"entropy": 0.6168110445141792,
"epoch": 0.5329000812347685,
"grad_norm": 0.010063163004815578,
"learning_rate": 0.0002,
"loss": 0.6208071112632751,
"mean_token_accuracy": 0.7490193694829941,
"num_tokens": 3067080.0,
"step": 82
},
{
"entropy": 0.6252159550786018,
"epoch": 0.5393988627132412,
"grad_norm": 0.010448803193867207,
"learning_rate": 0.0002,
"loss": 0.6253081560134888,
"mean_token_accuracy": 0.7478374615311623,
"num_tokens": 3104286.0,
"step": 83
},
{
"entropy": 0.6273334473371506,
"epoch": 0.545897644191714,
"grad_norm": 0.010500379838049412,
"learning_rate": 0.0002,
"loss": 0.6298959255218506,
"mean_token_accuracy": 0.7449745014309883,
"num_tokens": 3141685.0,
"step": 84
},
{
"entropy": 0.6271170675754547,
"epoch": 0.5523964256701869,
"grad_norm": 0.011779806576669216,
"learning_rate": 0.0002,
"loss": 0.6241638660430908,
"mean_token_accuracy": 0.7471632659435272,
"num_tokens": 3178925.0,
"step": 85
},
{
"entropy": 0.6358036622405052,
"epoch": 0.5588952071486596,
"grad_norm": 0.010791173204779625,
"learning_rate": 0.0002,
"loss": 0.6331329941749573,
"mean_token_accuracy": 0.7441665381193161,
"num_tokens": 3216076.0,
"step": 86
},
{
"entropy": 0.6320113763213158,
"epoch": 0.5653939886271324,
"grad_norm": 0.009891759604215622,
"learning_rate": 0.0002,
"loss": 0.6326582431793213,
"mean_token_accuracy": 0.7445697784423828,
"num_tokens": 3253700.0,
"step": 87
},
{
"entropy": 0.6250990331172943,
"epoch": 0.5718927701056052,
"grad_norm": 0.013541702181100845,
"learning_rate": 0.0002,
"loss": 0.6289629936218262,
"mean_token_accuracy": 0.745047003030777,
"num_tokens": 3291250.0,
"step": 88
},
{
"entropy": 0.6287946552038193,
"epoch": 0.578391551584078,
"grad_norm": 0.009651604108512402,
"learning_rate": 0.0002,
"loss": 0.6300573348999023,
"mean_token_accuracy": 0.7451979964971542,
"num_tokens": 3328548.0,
"step": 89
},
{
"entropy": 0.6240335181355476,
"epoch": 0.5848903330625508,
"grad_norm": 0.009283720515668392,
"learning_rate": 0.0002,
"loss": 0.6263805031776428,
"mean_token_accuracy": 0.7456449046730995,
"num_tokens": 3365327.0,
"step": 90
},
{
"entropy": 0.6241980046033859,
"epoch": 0.5913891145410236,
"grad_norm": 0.010714948177337646,
"learning_rate": 0.0002,
"loss": 0.625645637512207,
"mean_token_accuracy": 0.7471252828836441,
"num_tokens": 3402757.0,
"step": 91
},
{
"entropy": 0.628009632229805,
"epoch": 0.5978878960194963,
"grad_norm": 0.012750590220093727,
"learning_rate": 0.0002,
"loss": 0.6261017322540283,
"mean_token_accuracy": 0.7465066090226173,
"num_tokens": 3440031.0,
"step": 92
},
{
"entropy": 0.6196997240185738,
"epoch": 0.6043866774979691,
"grad_norm": 0.011183288879692554,
"learning_rate": 0.0002,
"loss": 0.6222946047782898,
"mean_token_accuracy": 0.7507361546158791,
"num_tokens": 3477362.0,
"step": 93
},
{
"entropy": 0.6370684951543808,
"epoch": 0.6108854589764419,
"grad_norm": 0.010141120292246342,
"learning_rate": 0.0002,
"loss": 0.638361930847168,
"mean_token_accuracy": 0.7412139847874641,
"num_tokens": 3514709.0,
"step": 94
},
{
"entropy": 0.6254898384213448,
"epoch": 0.6173842404549147,
"grad_norm": 0.009656463749706745,
"learning_rate": 0.0002,
"loss": 0.6284251809120178,
"mean_token_accuracy": 0.7460697740316391,
"num_tokens": 3552355.0,
"step": 95
},
{
"entropy": 0.626992717385292,
"epoch": 0.6238830219333875,
"grad_norm": 0.01039013173431158,
"learning_rate": 0.0002,
"loss": 0.632388174533844,
"mean_token_accuracy": 0.7448238283395767,
"num_tokens": 3590160.0,
"step": 96
},
{
"entropy": 0.6212045699357986,
"epoch": 0.6303818034118602,
"grad_norm": 0.011750632897019386,
"learning_rate": 0.0002,
"loss": 0.623359203338623,
"mean_token_accuracy": 0.7481106221675873,
"num_tokens": 3627240.0,
"step": 97
},
{
"entropy": 0.6192934885621071,
"epoch": 0.6368805848903331,
"grad_norm": 0.009845283813774586,
"learning_rate": 0.0002,
"loss": 0.6226494312286377,
"mean_token_accuracy": 0.7480833828449249,
"num_tokens": 3664279.0,
"step": 98
},
{
"entropy": 0.6310721859335899,
"epoch": 0.6433793663688059,
"grad_norm": 0.011091063730418682,
"learning_rate": 0.0002,
"loss": 0.6305258274078369,
"mean_token_accuracy": 0.7463658377528191,
"num_tokens": 3701955.0,
"step": 99
},
{
"entropy": 0.6249227002263069,
"epoch": 0.6498781478472786,
"grad_norm": 0.009939444251358509,
"learning_rate": 0.0002,
"loss": 0.6257964372634888,
"mean_token_accuracy": 0.7479037865996361,
"num_tokens": 3739298.0,
"step": 100
},
{
"entropy": 0.6227108985185623,
"epoch": 0.6563769293257514,
"grad_norm": 0.010004580952227116,
"learning_rate": 0.0002,
"loss": 0.6256003379821777,
"mean_token_accuracy": 0.7474573701620102,
"num_tokens": 3776806.0,
"step": 101
},
{
"entropy": 0.6166384890675545,
"epoch": 0.6628757108042242,
"grad_norm": 0.010987838730216026,
"learning_rate": 0.0002,
"loss": 0.6182519197463989,
"mean_token_accuracy": 0.7499695047736168,
"num_tokens": 3813941.0,
"step": 102
},
{
"entropy": 0.6348938420414925,
"epoch": 0.669374492282697,
"grad_norm": 0.011195721104741096,
"learning_rate": 0.0002,
"loss": 0.6304492950439453,
"mean_token_accuracy": 0.7462876811623573,
"num_tokens": 3851698.0,
"step": 103
},
{
"entropy": 0.6282550320029259,
"epoch": 0.6758732737611698,
"grad_norm": 0.010595601983368397,
"learning_rate": 0.0002,
"loss": 0.6273945569992065,
"mean_token_accuracy": 0.7473014816641808,
"num_tokens": 3888988.0,
"step": 104
},
{
"entropy": 0.6324817091226578,
"epoch": 0.6823720552396426,
"grad_norm": 0.009895245544612408,
"learning_rate": 0.0002,
"loss": 0.632161557674408,
"mean_token_accuracy": 0.7444497495889664,
"num_tokens": 3925974.0,
"step": 105
},
{
"entropy": 0.6199614554643631,
"epoch": 0.6888708367181153,
"grad_norm": 0.010299347341060638,
"learning_rate": 0.0002,
"loss": 0.6227681636810303,
"mean_token_accuracy": 0.746825821697712,
"num_tokens": 3962869.0,
"step": 106
},
{
"entropy": 0.6321764960885048,
"epoch": 0.6953696181965882,
"grad_norm": 0.010949746705591679,
"learning_rate": 0.0002,
"loss": 0.6333647966384888,
"mean_token_accuracy": 0.7444829195737839,
"num_tokens": 4000443.0,
"step": 107
},
{
"entropy": 0.6052318215370178,
"epoch": 0.7018683996750609,
"grad_norm": 0.010511154308915138,
"learning_rate": 0.0002,
"loss": 0.6079590916633606,
"mean_token_accuracy": 0.7547851428389549,
"num_tokens": 4037560.0,
"step": 108
},
{
"entropy": 0.6213503628969193,
"epoch": 0.7083671811535337,
"grad_norm": 0.009959033690392971,
"learning_rate": 0.0002,
"loss": 0.622962236404419,
"mean_token_accuracy": 0.7485458552837372,
"num_tokens": 4075139.0,
"step": 109
},
{
"entropy": 0.6228557601571083,
"epoch": 0.7148659626320065,
"grad_norm": 0.009467214345932007,
"learning_rate": 0.0002,
"loss": 0.6287202835083008,
"mean_token_accuracy": 0.7456526011228561,
"num_tokens": 4112628.0,
"step": 110
},
{
"entropy": 0.6176012232899666,
"epoch": 0.7213647441104792,
"grad_norm": 0.009703468531370163,
"learning_rate": 0.0002,
"loss": 0.6198960542678833,
"mean_token_accuracy": 0.7511189430952072,
"num_tokens": 4150384.0,
"step": 111
},
{
"entropy": 0.6364283263683319,
"epoch": 0.7278635255889521,
"grad_norm": 0.009932373650372028,
"learning_rate": 0.0002,
"loss": 0.6412342190742493,
"mean_token_accuracy": 0.742191307246685,
"num_tokens": 4187483.0,
"step": 112
},
{
"entropy": 0.6340491250157356,
"epoch": 0.7343623070674249,
"grad_norm": 0.009394255466759205,
"learning_rate": 0.0002,
"loss": 0.632526695728302,
"mean_token_accuracy": 0.7457142248749733,
"num_tokens": 4224861.0,
"step": 113
},
{
"entropy": 0.626609705388546,
"epoch": 0.7408610885458976,
"grad_norm": 0.010729662142693996,
"learning_rate": 0.0002,
"loss": 0.6251577138900757,
"mean_token_accuracy": 0.7473985999822617,
"num_tokens": 4261958.0,
"step": 114
},
{
"entropy": 0.6041073203086853,
"epoch": 0.7473598700243704,
"grad_norm": 0.010525292716920376,
"learning_rate": 0.0002,
"loss": 0.599025309085846,
"mean_token_accuracy": 0.7583419680595398,
"num_tokens": 4299462.0,
"step": 115
},
{
"entropy": 0.6210100278258324,
"epoch": 0.7538586515028433,
"grad_norm": 0.009981499053537846,
"learning_rate": 0.0002,
"loss": 0.6192715167999268,
"mean_token_accuracy": 0.7496819868683815,
"num_tokens": 4336903.0,
"step": 116
},
{
"entropy": 0.6161150112748146,
"epoch": 0.760357432981316,
"grad_norm": 0.009832478128373623,
"learning_rate": 0.0002,
"loss": 0.6186830401420593,
"mean_token_accuracy": 0.7503286600112915,
"num_tokens": 4374156.0,
"step": 117
},
{
"entropy": 0.6233196780085564,
"epoch": 0.7668562144597888,
"grad_norm": 0.009722237475216389,
"learning_rate": 0.0002,
"loss": 0.6274971961975098,
"mean_token_accuracy": 0.7461902946233749,
"num_tokens": 4411885.0,
"step": 118
},
{
"entropy": 0.6291887611150742,
"epoch": 0.7733549959382616,
"grad_norm": 0.01063536573201418,
"learning_rate": 0.0002,
"loss": 0.6366918087005615,
"mean_token_accuracy": 0.7416415438055992,
"num_tokens": 4449209.0,
"step": 119
},
{
"entropy": 0.6099276095628738,
"epoch": 0.7798537774167343,
"grad_norm": 0.010151992551982403,
"learning_rate": 0.0002,
"loss": 0.6134237051010132,
"mean_token_accuracy": 0.7496887296438217,
"num_tokens": 4486909.0,
"step": 120
},
{
"entropy": 0.6280336380004883,
"epoch": 0.7863525588952072,
"grad_norm": 0.011214104481041431,
"learning_rate": 0.0002,
"loss": 0.6303111910820007,
"mean_token_accuracy": 0.743942454457283,
"num_tokens": 4524269.0,
"step": 121
},
{
"entropy": 0.624128632247448,
"epoch": 0.7928513403736799,
"grad_norm": 0.01028621755540371,
"learning_rate": 0.0002,
"loss": 0.6248451471328735,
"mean_token_accuracy": 0.7479912042617798,
"num_tokens": 4561643.0,
"step": 122
},
{
"entropy": 0.6252302676439285,
"epoch": 0.7993501218521527,
"grad_norm": 0.01105236541479826,
"learning_rate": 0.0002,
"loss": 0.6249452233314514,
"mean_token_accuracy": 0.7472440227866173,
"num_tokens": 4599086.0,
"step": 123
},
{
"entropy": 0.6296864897012711,
"epoch": 0.8058489033306255,
"grad_norm": 0.009404209442436695,
"learning_rate": 0.0002,
"loss": 0.6316344738006592,
"mean_token_accuracy": 0.7425857782363892,
"num_tokens": 4636471.0,
"step": 124
},
{
"entropy": 0.6118782311677933,
"epoch": 0.8123476848090982,
"grad_norm": 0.010075677186250687,
"learning_rate": 0.0002,
"loss": 0.6151276230812073,
"mean_token_accuracy": 0.7537136599421501,
"num_tokens": 4673814.0,
"step": 125
},
{
"entropy": 0.6220783665776253,
"epoch": 0.8188464662875711,
"grad_norm": 0.01058894768357277,
"learning_rate": 0.0002,
"loss": 0.623919665813446,
"mean_token_accuracy": 0.7449487373232841,
"num_tokens": 4711348.0,
"step": 126
},
{
"entropy": 0.6320341899991035,
"epoch": 0.8253452477660439,
"grad_norm": 0.009438078850507736,
"learning_rate": 0.0002,
"loss": 0.635218620300293,
"mean_token_accuracy": 0.7428243607282639,
"num_tokens": 4748964.0,
"step": 127
},
{
"entropy": 0.608184851706028,
"epoch": 0.8318440292445166,
"grad_norm": 0.00950313825160265,
"learning_rate": 0.0002,
"loss": 0.608941376209259,
"mean_token_accuracy": 0.7540178000926971,
"num_tokens": 4786015.0,
"step": 128
},
{
"entropy": 0.6191292628645897,
"epoch": 0.8383428107229894,
"grad_norm": 0.00933976098895073,
"learning_rate": 0.0002,
"loss": 0.6211662292480469,
"mean_token_accuracy": 0.7470189183950424,
"num_tokens": 4823477.0,
"step": 129
},
{
"entropy": 0.6169113591313362,
"epoch": 0.8448415922014623,
"grad_norm": 0.00967735517770052,
"learning_rate": 0.0002,
"loss": 0.6221678256988525,
"mean_token_accuracy": 0.7482811883091927,
"num_tokens": 4860492.0,
"step": 130
},
{
"entropy": 0.6181379705667496,
"epoch": 0.851340373679935,
"grad_norm": 0.010275167413055897,
"learning_rate": 0.0002,
"loss": 0.6256829500198364,
"mean_token_accuracy": 0.7461275234818459,
"num_tokens": 4897310.0,
"step": 131
},
{
"entropy": 0.6289433836936951,
"epoch": 0.8578391551584078,
"grad_norm": 0.010724073275923729,
"learning_rate": 0.0002,
"loss": 0.6285852193832397,
"mean_token_accuracy": 0.7468666434288025,
"num_tokens": 4935222.0,
"step": 132
},
{
"entropy": 0.6300692111253738,
"epoch": 0.8643379366368806,
"grad_norm": 0.009074898436665535,
"learning_rate": 0.0002,
"loss": 0.6281343698501587,
"mean_token_accuracy": 0.7458086088299751,
"num_tokens": 4972549.0,
"step": 133
},
{
"entropy": 0.6445952579379082,
"epoch": 0.8708367181153533,
"grad_norm": 0.009369590319693089,
"learning_rate": 0.0002,
"loss": 0.6381428837776184,
"mean_token_accuracy": 0.7420760691165924,
"num_tokens": 5010593.0,
"step": 134
},
{
"entropy": 0.6136679574847221,
"epoch": 0.8773354995938262,
"grad_norm": 0.01232313271611929,
"learning_rate": 0.0002,
"loss": 0.6184711456298828,
"mean_token_accuracy": 0.7486978471279144,
"num_tokens": 5047468.0,
"step": 135
},
{
"entropy": 0.6270027384161949,
"epoch": 0.8838342810722989,
"grad_norm": 0.010591822676360607,
"learning_rate": 0.0002,
"loss": 0.6306672692298889,
"mean_token_accuracy": 0.7446641474962234,
"num_tokens": 5084586.0,
"step": 136
},
{
"entropy": 0.6240550950169563,
"epoch": 0.8903330625507717,
"grad_norm": 0.009444071911275387,
"learning_rate": 0.0002,
"loss": 0.6233399510383606,
"mean_token_accuracy": 0.749994620680809,
"num_tokens": 5122453.0,
"step": 137
},
{
"entropy": 0.6302881464362144,
"epoch": 0.8968318440292445,
"grad_norm": 0.009541204199194908,
"learning_rate": 0.0002,
"loss": 0.6329821348190308,
"mean_token_accuracy": 0.7429886758327484,
"num_tokens": 5160031.0,
"step": 138
},
{
"entropy": 0.6242454648017883,
"epoch": 0.9033306255077173,
"grad_norm": 0.01136871799826622,
"learning_rate": 0.0002,
"loss": 0.628311038017273,
"mean_token_accuracy": 0.7444250509142876,
"num_tokens": 5197538.0,
"step": 139
},
{
"entropy": 0.6239208057522774,
"epoch": 0.9098294069861901,
"grad_norm": 0.009039361029863358,
"learning_rate": 0.0002,
"loss": 0.6212806105613708,
"mean_token_accuracy": 0.7484918162226677,
"num_tokens": 5234839.0,
"step": 140
},
{
"entropy": 0.6303699910640717,
"epoch": 0.9163281884646629,
"grad_norm": 0.008452481590211391,
"learning_rate": 0.0002,
"loss": 0.6276811361312866,
"mean_token_accuracy": 0.7478921040892601,
"num_tokens": 5272501.0,
"step": 141
},
{
"entropy": 0.6282826215028763,
"epoch": 0.9228269699431356,
"grad_norm": 0.009988308884203434,
"learning_rate": 0.0002,
"loss": 0.6308070421218872,
"mean_token_accuracy": 0.744203083217144,
"num_tokens": 5310068.0,
"step": 142
},
{
"entropy": 0.6363607943058014,
"epoch": 0.9293257514216084,
"grad_norm": 0.010694671422243118,
"learning_rate": 0.0002,
"loss": 0.6361459493637085,
"mean_token_accuracy": 0.7425540909171104,
"num_tokens": 5347594.0,
"step": 143
},
{
"entropy": 0.6332810074090958,
"epoch": 0.9358245329000813,
"grad_norm": 0.008342958055436611,
"learning_rate": 0.0002,
"loss": 0.6327856779098511,
"mean_token_accuracy": 0.7445112019777298,
"num_tokens": 5385240.0,
"step": 144
},
{
"entropy": 0.622712031006813,
"epoch": 0.942323314378554,
"grad_norm": 0.009324009530246258,
"learning_rate": 0.0002,
"loss": 0.622111439704895,
"mean_token_accuracy": 0.7491918131709099,
"num_tokens": 5423063.0,
"step": 145
},
{
"entropy": 0.6331967115402222,
"epoch": 0.9488220958570268,
"grad_norm": 0.009456835687160492,
"learning_rate": 0.0002,
"loss": 0.635155200958252,
"mean_token_accuracy": 0.7427491322159767,
"num_tokens": 5460300.0,
"step": 146
},
{
"entropy": 0.6007715612649918,
"epoch": 0.9553208773354996,
"grad_norm": 0.009612048044800758,
"learning_rate": 0.0002,
"loss": 0.6061209440231323,
"mean_token_accuracy": 0.7546330019831657,
"num_tokens": 5497104.0,
"step": 147
},
{
"entropy": 0.623559907078743,
"epoch": 0.9618196588139724,
"grad_norm": 0.009891507215797901,
"learning_rate": 0.0002,
"loss": 0.6299046874046326,
"mean_token_accuracy": 0.7460341230034828,
"num_tokens": 5534717.0,
"step": 148
},
{
"entropy": 0.6161656081676483,
"epoch": 0.9683184402924452,
"grad_norm": 0.009623561054468155,
"learning_rate": 0.0002,
"loss": 0.6207596659660339,
"mean_token_accuracy": 0.7484462484717369,
"num_tokens": 5572155.0,
"step": 149
},
{
"entropy": 0.6296671330928802,
"epoch": 0.974817221770918,
"grad_norm": 0.009666231460869312,
"learning_rate": 0.0002,
"loss": 0.6299723386764526,
"mean_token_accuracy": 0.7442828044295311,
"num_tokens": 5609434.0,
"step": 150
},
{
"entropy": 0.635062001645565,
"epoch": 0.9813160032493907,
"grad_norm": 0.009376533329486847,
"learning_rate": 0.0002,
"loss": 0.6303079128265381,
"mean_token_accuracy": 0.7447433397173882,
"num_tokens": 5646893.0,
"step": 151
},
{
"entropy": 0.630713015794754,
"epoch": 0.9878147847278635,
"grad_norm": 0.009512092918157578,
"learning_rate": 0.0002,
"loss": 0.6241896152496338,
"mean_token_accuracy": 0.745731770992279,
"num_tokens": 5684403.0,
"step": 152
},
{
"entropy": 0.623988039791584,
"epoch": 0.9943135662063363,
"grad_norm": 0.00946712028235197,
"learning_rate": 0.0002,
"loss": 0.6251310110092163,
"mean_token_accuracy": 0.7487976476550102,
"num_tokens": 5721608.0,
"step": 153
},
{
"entropy": 0.5962605476379395,
"epoch": 1.0,
"grad_norm": 0.010017761029303074,
"learning_rate": 0.0002,
"loss": 0.6195710897445679,
"mean_token_accuracy": 0.754073713506971,
"num_tokens": 5737850.0,
"step": 154
},
{
"entropy": 0.6159528121352196,
"epoch": 1.0064987814784727,
"grad_norm": 0.011626223102211952,
"learning_rate": 0.0002,
"loss": 0.6283953785896301,
"mean_token_accuracy": 0.7437271103262901,
"num_tokens": 5775226.0,
"step": 155
},
{
"entropy": 0.6398139446973801,
"epoch": 1.0129975629569457,
"grad_norm": 0.009600057266652584,
"learning_rate": 0.0002,
"loss": 0.6418601274490356,
"mean_token_accuracy": 0.7394955083727837,
"num_tokens": 5812842.0,
"step": 156
},
{
"entropy": 0.6106663420796394,
"epoch": 1.0194963444354184,
"grad_norm": 0.01011701114475727,
"learning_rate": 0.0002,
"loss": 0.6077284812927246,
"mean_token_accuracy": 0.754165381193161,
"num_tokens": 5850157.0,
"step": 157
},
{
"entropy": 0.6355043426156044,
"epoch": 1.025995125913891,
"grad_norm": 0.009700894355773926,
"learning_rate": 0.0002,
"loss": 0.6273776888847351,
"mean_token_accuracy": 0.7454625219106674,
"num_tokens": 5887576.0,
"step": 158
},
{
"entropy": 0.629393994808197,
"epoch": 1.032493907392364,
"grad_norm": 0.007958617061376572,
"learning_rate": 0.0002,
"loss": 0.6252051591873169,
"mean_token_accuracy": 0.7460998743772507,
"num_tokens": 5925165.0,
"step": 159
},
{
"entropy": 0.6266166046261787,
"epoch": 1.0389926888708367,
"grad_norm": 0.00998145341873169,
"learning_rate": 0.0002,
"loss": 0.6290674209594727,
"mean_token_accuracy": 0.7430498450994492,
"num_tokens": 5962505.0,
"step": 160
},
{
"entropy": 0.6140859052538872,
"epoch": 1.0454914703493094,
"grad_norm": 0.010381487198174,
"learning_rate": 0.0002,
"loss": 0.6180790662765503,
"mean_token_accuracy": 0.7507300451397896,
"num_tokens": 5999871.0,
"step": 161
},
{
"entropy": 0.6197154447436333,
"epoch": 1.0519902518277824,
"grad_norm": 0.009876130148768425,
"learning_rate": 0.0002,
"loss": 0.6249828338623047,
"mean_token_accuracy": 0.7454148605465889,
"num_tokens": 6037575.0,
"step": 162
},
{
"entropy": 0.6122508272528648,
"epoch": 1.058489033306255,
"grad_norm": 0.008684883825480938,
"learning_rate": 0.0002,
"loss": 0.6138869524002075,
"mean_token_accuracy": 0.7517640963196754,
"num_tokens": 6074892.0,
"step": 163
},
{
"entropy": 0.6194281056523323,
"epoch": 1.0649878147847278,
"grad_norm": 0.010471724905073643,
"learning_rate": 0.0002,
"loss": 0.6223649978637695,
"mean_token_accuracy": 0.7462374493479729,
"num_tokens": 6112197.0,
"step": 164
},
{
"entropy": 0.6203417181968689,
"epoch": 1.0714865962632008,
"grad_norm": 0.00992770865559578,
"learning_rate": 0.0002,
"loss": 0.6209006309509277,
"mean_token_accuracy": 0.7480901628732681,
"num_tokens": 6149571.0,
"step": 165
},
{
"entropy": 0.6099580377340317,
"epoch": 1.0779853777416735,
"grad_norm": 0.00981567706912756,
"learning_rate": 0.0002,
"loss": 0.6166203022003174,
"mean_token_accuracy": 0.7501059100031853,
"num_tokens": 6186570.0,
"step": 166
},
{
"entropy": 0.6217071712017059,
"epoch": 1.0844841592201462,
"grad_norm": 0.009364967234432697,
"learning_rate": 0.0002,
"loss": 0.6240255236625671,
"mean_token_accuracy": 0.7475733831524849,
"num_tokens": 6224124.0,
"step": 167
},
{
"entropy": 0.6265001520514488,
"epoch": 1.090982940698619,
"grad_norm": 0.009150683879852295,
"learning_rate": 0.0002,
"loss": 0.6249997615814209,
"mean_token_accuracy": 0.7465919181704521,
"num_tokens": 6261544.0,
"step": 168
},
{
"entropy": 0.6337415799498558,
"epoch": 1.0974817221770918,
"grad_norm": 0.009555370546877384,
"learning_rate": 0.0002,
"loss": 0.6337403059005737,
"mean_token_accuracy": 0.7431929185986519,
"num_tokens": 6298708.0,
"step": 169
},
{
"entropy": 0.6212407127022743,
"epoch": 1.1039805036555645,
"grad_norm": 0.009204280562698841,
"learning_rate": 0.0002,
"loss": 0.6198785305023193,
"mean_token_accuracy": 0.7490911036729813,
"num_tokens": 6336357.0,
"step": 170
},
{
"entropy": 0.6211022287607193,
"epoch": 1.1104792851340373,
"grad_norm": 0.010933548212051392,
"learning_rate": 0.0002,
"loss": 0.6218096017837524,
"mean_token_accuracy": 0.7478840723633766,
"num_tokens": 6373815.0,
"step": 171
},
{
"entropy": 0.6218304485082626,
"epoch": 1.1169780666125102,
"grad_norm": 0.007957971654832363,
"learning_rate": 0.0002,
"loss": 0.6211934089660645,
"mean_token_accuracy": 0.7479007542133331,
"num_tokens": 6411469.0,
"step": 172
},
{
"entropy": 0.623476430773735,
"epoch": 1.123476848090983,
"grad_norm": 0.008693872950971127,
"learning_rate": 0.0002,
"loss": 0.628318727016449,
"mean_token_accuracy": 0.7435088455677032,
"num_tokens": 6448782.0,
"step": 173
},
{
"entropy": 0.6133372634649277,
"epoch": 1.1299756295694556,
"grad_norm": 0.010963717475533485,
"learning_rate": 0.0002,
"loss": 0.6166828274726868,
"mean_token_accuracy": 0.7512464672327042,
"num_tokens": 6485790.0,
"step": 174
},
{
"entropy": 0.6234560832381248,
"epoch": 1.1364744110479286,
"grad_norm": 0.009953116998076439,
"learning_rate": 0.0002,
"loss": 0.6275191903114319,
"mean_token_accuracy": 0.7457004636526108,
"num_tokens": 6523433.0,
"step": 175
},
{
"entropy": 0.612127959728241,
"epoch": 1.1429731925264013,
"grad_norm": 0.008568039163947105,
"learning_rate": 0.0002,
"loss": 0.6111507415771484,
"mean_token_accuracy": 0.7523760348558426,
"num_tokens": 6560764.0,
"step": 176
},
{
"entropy": 0.6384553462266922,
"epoch": 1.149471974004874,
"grad_norm": 0.010018682107329369,
"learning_rate": 0.0002,
"loss": 0.6336829662322998,
"mean_token_accuracy": 0.743287555873394,
"num_tokens": 6598409.0,
"step": 177
},
{
"entropy": 0.6272930577397346,
"epoch": 1.155970755483347,
"grad_norm": 0.009546359069645405,
"learning_rate": 0.0002,
"loss": 0.626544713973999,
"mean_token_accuracy": 0.7449387013912201,
"num_tokens": 6636067.0,
"step": 178
},
{
"entropy": 0.6086627542972565,
"epoch": 1.1624695369618196,
"grad_norm": 0.009319686330854893,
"learning_rate": 0.0002,
"loss": 0.6141277551651001,
"mean_token_accuracy": 0.7520448267459869,
"num_tokens": 6673446.0,
"step": 179
},
{
"entropy": 0.5994155630469322,
"epoch": 1.1689683184402924,
"grad_norm": 0.011318805627524853,
"learning_rate": 0.0002,
"loss": 0.6087459325790405,
"mean_token_accuracy": 0.7519726976752281,
"num_tokens": 6710715.0,
"step": 180
},
{
"entropy": 0.6187063455581665,
"epoch": 1.1754670999187653,
"grad_norm": 0.009100009687244892,
"learning_rate": 0.0002,
"loss": 0.6213230490684509,
"mean_token_accuracy": 0.7466496899724007,
"num_tokens": 6748737.0,
"step": 181
},
{
"entropy": 0.6402401477098465,
"epoch": 1.181965881397238,
"grad_norm": 0.009086531586945057,
"learning_rate": 0.0002,
"loss": 0.636063277721405,
"mean_token_accuracy": 0.7429427057504654,
"num_tokens": 6785555.0,
"step": 182
},
{
"entropy": 0.6275543943047523,
"epoch": 1.1884646628757107,
"grad_norm": 0.00983697734773159,
"learning_rate": 0.0002,
"loss": 0.6195461750030518,
"mean_token_accuracy": 0.7482333034276962,
"num_tokens": 6822608.0,
"step": 183
},
{
"entropy": 0.6261148154735565,
"epoch": 1.1949634443541837,
"grad_norm": 0.008595704101026058,
"learning_rate": 0.0002,
"loss": 0.6235471963882446,
"mean_token_accuracy": 0.7465647235512733,
"num_tokens": 6860107.0,
"step": 184
},
{
"entropy": 0.615828700363636,
"epoch": 1.2014622258326564,
"grad_norm": 0.010348568670451641,
"learning_rate": 0.0002,
"loss": 0.6194600462913513,
"mean_token_accuracy": 0.7490681707859039,
"num_tokens": 6897202.0,
"step": 185
},
{
"entropy": 0.6132261380553246,
"epoch": 1.207961007311129,
"grad_norm": 0.010876818560063839,
"learning_rate": 0.0002,
"loss": 0.6224918365478516,
"mean_token_accuracy": 0.7479420974850655,
"num_tokens": 6934670.0,
"step": 186
},
{
"entropy": 0.6103203073143959,
"epoch": 1.214459788789602,
"grad_norm": 0.009953301399946213,
"learning_rate": 0.0002,
"loss": 0.6190877556800842,
"mean_token_accuracy": 0.7497604489326477,
"num_tokens": 6971658.0,
"step": 187
},
{
"entropy": 0.617573581635952,
"epoch": 1.2209585702680747,
"grad_norm": 0.00837781187146902,
"learning_rate": 0.0002,
"loss": 0.617588996887207,
"mean_token_accuracy": 0.7494269385933876,
"num_tokens": 7009123.0,
"step": 188
},
{
"entropy": 0.629171572625637,
"epoch": 1.2274573517465475,
"grad_norm": 0.008275787346065044,
"learning_rate": 0.0002,
"loss": 0.6283445358276367,
"mean_token_accuracy": 0.7444169595837593,
"num_tokens": 7046906.0,
"step": 189
},
{
"entropy": 0.6318405717611313,
"epoch": 1.2339561332250204,
"grad_norm": 0.008116304874420166,
"learning_rate": 0.0002,
"loss": 0.6320441365242004,
"mean_token_accuracy": 0.7443558126688004,
"num_tokens": 7084180.0,
"step": 190
},
{
"entropy": 0.6146104484796524,
"epoch": 1.2404549147034931,
"grad_norm": 0.009803351014852524,
"learning_rate": 0.0002,
"loss": 0.6140527725219727,
"mean_token_accuracy": 0.7488429099321365,
"num_tokens": 7121475.0,
"step": 191
},
{
"entropy": 0.6153127253055573,
"epoch": 1.2469536961819658,
"grad_norm": 0.007825122214853764,
"learning_rate": 0.0002,
"loss": 0.6195809245109558,
"mean_token_accuracy": 0.7493974566459656,
"num_tokens": 7158753.0,
"step": 192
},
{
"entropy": 0.6186842620372772,
"epoch": 1.2534524776604385,
"grad_norm": 0.00928817130625248,
"learning_rate": 0.0002,
"loss": 0.6203854084014893,
"mean_token_accuracy": 0.748259611427784,
"num_tokens": 7195797.0,
"step": 193
},
{
"entropy": 0.6210475564002991,
"epoch": 1.2599512591389115,
"grad_norm": 0.010004797019064426,
"learning_rate": 0.0002,
"loss": 0.6249719858169556,
"mean_token_accuracy": 0.7474558278918266,
"num_tokens": 7233547.0,
"step": 194
},
{
"entropy": 0.6319233104586601,
"epoch": 1.2664500406173842,
"grad_norm": 0.010124076157808304,
"learning_rate": 0.0002,
"loss": 0.6346510648727417,
"mean_token_accuracy": 0.7430363744497299,
"num_tokens": 7271165.0,
"step": 195
},
{
"entropy": 0.6228615492582321,
"epoch": 1.2729488220958571,
"grad_norm": 0.00920382421463728,
"learning_rate": 0.0002,
"loss": 0.6211229562759399,
"mean_token_accuracy": 0.7490492090582848,
"num_tokens": 7308659.0,
"step": 196
},
{
"entropy": 0.6310986131429672,
"epoch": 1.2794476035743299,
"grad_norm": 0.009224419482052326,
"learning_rate": 0.0002,
"loss": 0.626353919506073,
"mean_token_accuracy": 0.7454532235860825,
"num_tokens": 7346203.0,
"step": 197
},
{
"entropy": 0.610854484140873,
"epoch": 1.2859463850528026,
"grad_norm": 0.009150652214884758,
"learning_rate": 0.0002,
"loss": 0.6110652685165405,
"mean_token_accuracy": 0.7504596933722496,
"num_tokens": 7383470.0,
"step": 198
},
{
"entropy": 0.6061088666319847,
"epoch": 1.2924451665312753,
"grad_norm": 0.008921864442527294,
"learning_rate": 0.0002,
"loss": 0.611494779586792,
"mean_token_accuracy": 0.7522832676768303,
"num_tokens": 7420939.0,
"step": 199
},
{
"entropy": 0.6130355596542358,
"epoch": 1.2989439480097482,
"grad_norm": 0.009989106096327305,
"learning_rate": 0.0002,
"loss": 0.6249145269393921,
"mean_token_accuracy": 0.7437470331788063,
"num_tokens": 7458037.0,
"step": 200
},
{
"entropy": 0.6245267316699028,
"epoch": 1.305442729488221,
"grad_norm": 0.008322354406118393,
"learning_rate": 0.0002,
"loss": 0.6295627355575562,
"mean_token_accuracy": 0.7449559271335602,
"num_tokens": 7495466.0,
"step": 201
},
{
"entropy": 0.6188690215349197,
"epoch": 1.3119415109666939,
"grad_norm": 0.008306242525577545,
"learning_rate": 0.0002,
"loss": 0.6199623942375183,
"mean_token_accuracy": 0.7464429587125778,
"num_tokens": 7533028.0,
"step": 202
},
{
"entropy": 0.6284244954586029,
"epoch": 1.3184402924451666,
"grad_norm": 0.008912610821425915,
"learning_rate": 0.0002,
"loss": 0.6269126534461975,
"mean_token_accuracy": 0.7451603710651398,
"num_tokens": 7570454.0,
"step": 203
},
{
"entropy": 0.6253558248281479,
"epoch": 1.3249390739236393,
"grad_norm": 0.009339334443211555,
"learning_rate": 0.0002,
"loss": 0.6178290247917175,
"mean_token_accuracy": 0.749000295996666,
"num_tokens": 7607813.0,
"step": 204
},
{
"entropy": 0.6330921202898026,
"epoch": 1.331437855402112,
"grad_norm": 0.009055222384631634,
"learning_rate": 0.0002,
"loss": 0.627162754535675,
"mean_token_accuracy": 0.7448414042592049,
"num_tokens": 7645571.0,
"step": 205
},
{
"entropy": 0.612213708460331,
"epoch": 1.337936636880585,
"grad_norm": 0.00788091029971838,
"learning_rate": 0.0002,
"loss": 0.6103406548500061,
"mean_token_accuracy": 0.7524209767580032,
"num_tokens": 7682827.0,
"step": 206
},
{
"entropy": 0.6196805313229561,
"epoch": 1.3444354183590577,
"grad_norm": 0.0074918679893016815,
"learning_rate": 0.0002,
"loss": 0.6231103539466858,
"mean_token_accuracy": 0.7457561120390892,
"num_tokens": 7720532.0,
"step": 207
},
{
"entropy": 0.6148431301116943,
"epoch": 1.3509341998375304,
"grad_norm": 0.008005033247172832,
"learning_rate": 0.0002,
"loss": 0.6224607825279236,
"mean_token_accuracy": 0.7475835010409355,
"num_tokens": 7757914.0,
"step": 208
},
{
"entropy": 0.6162410527467728,
"epoch": 1.3574329813160033,
"grad_norm": 0.008755719289183617,
"learning_rate": 0.0002,
"loss": 0.6230734586715698,
"mean_token_accuracy": 0.7474293559789658,
"num_tokens": 7795111.0,
"step": 209
},
{
"entropy": 0.6132988333702087,
"epoch": 1.363931762794476,
"grad_norm": 0.008136742748320103,
"learning_rate": 0.0002,
"loss": 0.6189343929290771,
"mean_token_accuracy": 0.7504551187157631,
"num_tokens": 7832380.0,
"step": 210
},
{
"entropy": 0.62418133020401,
"epoch": 1.3704305442729487,
"grad_norm": 0.007090510334819555,
"learning_rate": 0.0002,
"loss": 0.6275556087493896,
"mean_token_accuracy": 0.744689516723156,
"num_tokens": 7869774.0,
"step": 211
},
{
"entropy": 0.6151341274380684,
"epoch": 1.3769293257514217,
"grad_norm": 0.008890950120985508,
"learning_rate": 0.0002,
"loss": 0.6140053272247314,
"mean_token_accuracy": 0.7508121132850647,
"num_tokens": 7906943.0,
"step": 212
},
{
"entropy": 0.6221983805298805,
"epoch": 1.3834281072298944,
"grad_norm": 0.009338715113699436,
"learning_rate": 0.0002,
"loss": 0.6216065883636475,
"mean_token_accuracy": 0.7504482716321945,
"num_tokens": 7944646.0,
"step": 213
},
{
"entropy": 0.6131090745329857,
"epoch": 1.3899268887083671,
"grad_norm": 0.00849352777004242,
"learning_rate": 0.0002,
"loss": 0.6095527410507202,
"mean_token_accuracy": 0.7533553466200829,
"num_tokens": 7982267.0,
"step": 214
},
{
"entropy": 0.6085495501756668,
"epoch": 1.39642567018684,
"grad_norm": 0.007540795486420393,
"learning_rate": 0.0002,
"loss": 0.6092317700386047,
"mean_token_accuracy": 0.7533180490136147,
"num_tokens": 8019466.0,
"step": 215
},
{
"entropy": 0.6296884343028069,
"epoch": 1.4029244516653128,
"grad_norm": 0.009902682155370712,
"learning_rate": 0.0002,
"loss": 0.6364089250564575,
"mean_token_accuracy": 0.7428499311208725,
"num_tokens": 8057400.0,
"step": 216
},
{
"entropy": 0.6165885776281357,
"epoch": 1.4094232331437855,
"grad_norm": 0.00911257229745388,
"learning_rate": 0.0002,
"loss": 0.6247788071632385,
"mean_token_accuracy": 0.7464938163757324,
"num_tokens": 8094904.0,
"step": 217
},
{
"entropy": 0.6157428845763206,
"epoch": 1.4159220146222582,
"grad_norm": 0.007997944951057434,
"learning_rate": 0.0002,
"loss": 0.6201274394989014,
"mean_token_accuracy": 0.7489686757326126,
"num_tokens": 8132290.0,
"step": 218
},
{
"entropy": 0.6217053309082985,
"epoch": 1.4224207961007311,
"grad_norm": 0.00811337772756815,
"learning_rate": 0.0002,
"loss": 0.6197227239608765,
"mean_token_accuracy": 0.7485419660806656,
"num_tokens": 8169791.0,
"step": 219
},
{
"entropy": 0.615436315536499,
"epoch": 1.4289195775792038,
"grad_norm": 0.008888707496225834,
"learning_rate": 0.0002,
"loss": 0.6124907732009888,
"mean_token_accuracy": 0.751116119325161,
"num_tokens": 8207092.0,
"step": 220
},
{
"entropy": 0.6246543675661087,
"epoch": 1.4354183590576768,
"grad_norm": 0.008732281625270844,
"learning_rate": 0.0002,
"loss": 0.623694658279419,
"mean_token_accuracy": 0.7458877414464951,
"num_tokens": 8244309.0,
"step": 221
},
{
"entropy": 0.6304584518074989,
"epoch": 1.4419171405361495,
"grad_norm": 0.009999740868806839,
"learning_rate": 0.0002,
"loss": 0.6301021575927734,
"mean_token_accuracy": 0.7443124279379845,
"num_tokens": 8281764.0,
"step": 222
},
{
"entropy": 0.6228891983628273,
"epoch": 1.4484159220146222,
"grad_norm": 0.009084641933441162,
"learning_rate": 0.0002,
"loss": 0.623934268951416,
"mean_token_accuracy": 0.746678814291954,
"num_tokens": 8319204.0,
"step": 223
},
{
"entropy": 0.6163553223013878,
"epoch": 1.454914703493095,
"grad_norm": 0.008567318320274353,
"learning_rate": 0.0002,
"loss": 0.6207892894744873,
"mean_token_accuracy": 0.7486568316817284,
"num_tokens": 8356629.0,
"step": 224
},
{
"entropy": 0.6088405475020409,
"epoch": 1.4614134849715679,
"grad_norm": 0.00832637120038271,
"learning_rate": 0.0002,
"loss": 0.612472414970398,
"mean_token_accuracy": 0.7514082416892052,
"num_tokens": 8394033.0,
"step": 225
},
{
"entropy": 0.614930123090744,
"epoch": 1.4679122664500406,
"grad_norm": 0.008623549714684486,
"learning_rate": 0.0002,
"loss": 0.6192766427993774,
"mean_token_accuracy": 0.7488296180963516,
"num_tokens": 8431411.0,
"step": 226
},
{
"entropy": 0.6123254001140594,
"epoch": 1.4744110479285135,
"grad_norm": 0.008329757489264011,
"learning_rate": 0.0002,
"loss": 0.614305317401886,
"mean_token_accuracy": 0.7501704543828964,
"num_tokens": 8468845.0,
"step": 227
},
{
"entropy": 0.6353933066129684,
"epoch": 1.4809098294069862,
"grad_norm": 0.010329898446798325,
"learning_rate": 0.0002,
"loss": 0.6299945712089539,
"mean_token_accuracy": 0.7446781396865845,
"num_tokens": 8506494.0,
"step": 228
},
{
"entropy": 0.6230698823928833,
"epoch": 1.487408610885459,
"grad_norm": 0.008529371581971645,
"learning_rate": 0.0002,
"loss": 0.6179029941558838,
"mean_token_accuracy": 0.7506388053297997,
"num_tokens": 8543863.0,
"step": 229
},
{
"entropy": 0.6087015345692635,
"epoch": 1.4939073923639317,
"grad_norm": 0.008635671809315681,
"learning_rate": 0.0002,
"loss": 0.6120889186859131,
"mean_token_accuracy": 0.7521615102887154,
"num_tokens": 8580998.0,
"step": 230
},
{
"entropy": 0.6111158281564713,
"epoch": 1.5004061738424046,
"grad_norm": 0.009943103417754173,
"learning_rate": 0.0002,
"loss": 0.6142638921737671,
"mean_token_accuracy": 0.7509952187538147,
"num_tokens": 8618445.0,
"step": 231
},
{
"entropy": 0.6176108121871948,
"epoch": 1.5069049553208773,
"grad_norm": 0.007991382852196693,
"learning_rate": 0.0002,
"loss": 0.619983434677124,
"mean_token_accuracy": 0.7502688392996788,
"num_tokens": 8655969.0,
"step": 232
},
{
"entropy": 0.6207513734698296,
"epoch": 1.5134037367993503,
"grad_norm": 0.0076866415329277515,
"learning_rate": 0.0002,
"loss": 0.626140296459198,
"mean_token_accuracy": 0.7469011545181274,
"num_tokens": 8693748.0,
"step": 233
},
{
"entropy": 0.6301305815577507,
"epoch": 1.519902518277823,
"grad_norm": 0.007992899045348167,
"learning_rate": 0.0002,
"loss": 0.6301756501197815,
"mean_token_accuracy": 0.744783528149128,
"num_tokens": 8730930.0,
"step": 234
},
{
"entropy": 0.6271040365099907,
"epoch": 1.5264012997562957,
"grad_norm": 0.008258827030658722,
"learning_rate": 0.0002,
"loss": 0.6266668438911438,
"mean_token_accuracy": 0.746114693582058,
"num_tokens": 8768377.0,
"step": 235
},
{
"entropy": 0.6152656748890877,
"epoch": 1.5329000812347684,
"grad_norm": 0.0098560880869627,
"learning_rate": 0.0002,
"loss": 0.6164472103118896,
"mean_token_accuracy": 0.7489713951945305,
"num_tokens": 8805779.0,
"step": 236
},
{
"entropy": 0.6294426172971725,
"epoch": 1.5393988627132411,
"grad_norm": 0.008523919619619846,
"learning_rate": 0.0002,
"loss": 0.6326299905776978,
"mean_token_accuracy": 0.742644876241684,
"num_tokens": 8843123.0,
"step": 237
},
{
"entropy": 0.6143188178539276,
"epoch": 1.545897644191714,
"grad_norm": 0.007758335676044226,
"learning_rate": 0.0002,
"loss": 0.6136566996574402,
"mean_token_accuracy": 0.7520029693841934,
"num_tokens": 8880249.0,
"step": 238
},
{
"entropy": 0.627038024365902,
"epoch": 1.552396425670187,
"grad_norm": 0.00911460816860199,
"learning_rate": 0.0002,
"loss": 0.6299710869789124,
"mean_token_accuracy": 0.7446892932057381,
"num_tokens": 8917829.0,
"step": 239
},
{
"entropy": 0.6183791384100914,
"epoch": 1.5588952071486597,
"grad_norm": 0.008657646365463734,
"learning_rate": 0.0002,
"loss": 0.6220093965530396,
"mean_token_accuracy": 0.7485999315977097,
"num_tokens": 8955243.0,
"step": 240
},
{
"entropy": 0.6323986351490021,
"epoch": 1.5653939886271324,
"grad_norm": 0.0085441330447793,
"learning_rate": 0.0002,
"loss": 0.6361583471298218,
"mean_token_accuracy": 0.7442645356059074,
"num_tokens": 8992960.0,
"step": 241
},
{
"entropy": 0.6108334213495255,
"epoch": 1.5718927701056051,
"grad_norm": 0.007725970819592476,
"learning_rate": 0.0002,
"loss": 0.6101396083831787,
"mean_token_accuracy": 0.7506669163703918,
"num_tokens": 9030523.0,
"step": 242
},
{
"entropy": 0.6231397688388824,
"epoch": 1.5783915515840778,
"grad_norm": 0.008767355233430862,
"learning_rate": 0.0002,
"loss": 0.622745156288147,
"mean_token_accuracy": 0.7461344972252846,
"num_tokens": 9067759.0,
"step": 243
},
{
"entropy": 0.627980038523674,
"epoch": 1.5848903330625508,
"grad_norm": 0.00843246839940548,
"learning_rate": 0.0002,
"loss": 0.632775604724884,
"mean_token_accuracy": 0.7432630062103271,
"num_tokens": 9105200.0,
"step": 244
},
{
"entropy": 0.6222330331802368,
"epoch": 1.5913891145410237,
"grad_norm": 0.008817244321107864,
"learning_rate": 0.0002,
"loss": 0.625479519367218,
"mean_token_accuracy": 0.7454850673675537,
"num_tokens": 9142588.0,
"step": 245
},
{
"entropy": 0.6129688546061516,
"epoch": 1.5978878960194964,
"grad_norm": 0.009856261312961578,
"learning_rate": 0.0002,
"loss": 0.6199933886528015,
"mean_token_accuracy": 0.7487855926156044,
"num_tokens": 9179884.0,
"step": 246
},
{
"entropy": 0.6239286884665489,
"epoch": 1.6043866774979691,
"grad_norm": 0.008906936272978783,
"learning_rate": 0.0002,
"loss": 0.6204976439476013,
"mean_token_accuracy": 0.7508985996246338,
"num_tokens": 9217103.0,
"step": 247
},
{
"entropy": 0.6336326971650124,
"epoch": 1.6108854589764419,
"grad_norm": 0.011355509981513023,
"learning_rate": 0.0002,
"loss": 0.6262732744216919,
"mean_token_accuracy": 0.7465848848223686,
"num_tokens": 9254644.0,
"step": 248
},
{
"entropy": 0.6203413605690002,
"epoch": 1.6173842404549146,
"grad_norm": 0.007735299877822399,
"learning_rate": 0.0002,
"loss": 0.6212904453277588,
"mean_token_accuracy": 0.7472884654998779,
"num_tokens": 9291724.0,
"step": 249
},
{
"entropy": 0.6144890040159225,
"epoch": 1.6238830219333875,
"grad_norm": 0.007746159564703703,
"learning_rate": 0.0002,
"loss": 0.619687557220459,
"mean_token_accuracy": 0.7471293359994888,
"num_tokens": 9328841.0,
"step": 250
},
{
"entropy": 0.6305414438247681,
"epoch": 1.6303818034118602,
"grad_norm": 0.010060657747089863,
"learning_rate": 0.0002,
"loss": 0.6419017314910889,
"mean_token_accuracy": 0.7386629730463028,
"num_tokens": 9366411.0,
"step": 251
},
{
"entropy": 0.6339073181152344,
"epoch": 1.6368805848903332,
"grad_norm": 0.007909824140369892,
"learning_rate": 0.0002,
"loss": 0.6384083032608032,
"mean_token_accuracy": 0.7414835765957832,
"num_tokens": 9403421.0,
"step": 252
},
{
"entropy": 0.6129219457507133,
"epoch": 1.6433793663688059,
"grad_norm": 0.007407526019960642,
"learning_rate": 0.0002,
"loss": 0.6125075817108154,
"mean_token_accuracy": 0.752901516854763,
"num_tokens": 9440793.0,
"step": 253
},
{
"entropy": 0.6255052834749222,
"epoch": 1.6498781478472786,
"grad_norm": 0.008314264938235283,
"learning_rate": 0.0002,
"loss": 0.6215559244155884,
"mean_token_accuracy": 0.7486165389418602,
"num_tokens": 9477882.0,
"step": 254
},
{
"entropy": 0.6231755018234253,
"epoch": 1.6563769293257513,
"grad_norm": 0.0075997961685061455,
"learning_rate": 0.0002,
"loss": 0.6211115121841431,
"mean_token_accuracy": 0.7495426833629608,
"num_tokens": 9515444.0,
"step": 255
},
{
"entropy": 0.6108886152505875,
"epoch": 1.6628757108042242,
"grad_norm": 0.007718959823250771,
"learning_rate": 0.0002,
"loss": 0.6141905784606934,
"mean_token_accuracy": 0.7495709583163261,
"num_tokens": 9552755.0,
"step": 256
},
{
"entropy": 0.6075874269008636,
"epoch": 1.669374492282697,
"grad_norm": 0.008023767732083797,
"learning_rate": 0.0002,
"loss": 0.6125887632369995,
"mean_token_accuracy": 0.7506251037120819,
"num_tokens": 9590261.0,
"step": 257
},
{
"entropy": 0.6148701831698418,
"epoch": 1.67587327376117,
"grad_norm": 0.008702424354851246,
"learning_rate": 0.0002,
"loss": 0.6215870380401611,
"mean_token_accuracy": 0.7478265091776848,
"num_tokens": 9627758.0,
"step": 258
},
{
"entropy": 0.6036238297820091,
"epoch": 1.6823720552396426,
"grad_norm": 0.007766771595925093,
"learning_rate": 0.0002,
"loss": 0.6084332466125488,
"mean_token_accuracy": 0.7513664737343788,
"num_tokens": 9664761.0,
"step": 259
},
{
"entropy": 0.6297216266393661,
"epoch": 1.6888708367181153,
"grad_norm": 0.009538715705275536,
"learning_rate": 0.0002,
"loss": 0.6225094795227051,
"mean_token_accuracy": 0.7476939931511879,
"num_tokens": 9702161.0,
"step": 260
},
{
"entropy": 0.6292383894324303,
"epoch": 1.695369618196588,
"grad_norm": 0.00895692128688097,
"learning_rate": 0.0002,
"loss": 0.6246432065963745,
"mean_token_accuracy": 0.7490787208080292,
"num_tokens": 9739248.0,
"step": 261
},
{
"entropy": 0.6182943060994148,
"epoch": 1.7018683996750608,
"grad_norm": 0.008069152012467384,
"learning_rate": 0.0002,
"loss": 0.6146731972694397,
"mean_token_accuracy": 0.7493266090750694,
"num_tokens": 9776948.0,
"step": 262
},
{
"entropy": 0.6093627437949181,
"epoch": 1.7083671811535337,
"grad_norm": 0.00886097177863121,
"learning_rate": 0.0002,
"loss": 0.6172748804092407,
"mean_token_accuracy": 0.7474698126316071,
"num_tokens": 9814118.0,
"step": 263
},
{
"entropy": 0.599872387945652,
"epoch": 1.7148659626320066,
"grad_norm": 0.009245996363461018,
"learning_rate": 0.0002,
"loss": 0.6081432700157166,
"mean_token_accuracy": 0.7528064101934433,
"num_tokens": 9851508.0,
"step": 264
},
{
"entropy": 0.6169805154204369,
"epoch": 1.7213647441104794,
"grad_norm": 0.009072757326066494,
"learning_rate": 0.0002,
"loss": 0.6274439096450806,
"mean_token_accuracy": 0.7459535896778107,
"num_tokens": 9889084.0,
"step": 265
},
{
"entropy": 0.6127713099122047,
"epoch": 1.727863525588952,
"grad_norm": 0.0077358693815767765,
"learning_rate": 0.0002,
"loss": 0.6177385449409485,
"mean_token_accuracy": 0.7487060204148293,
"num_tokens": 9926415.0,
"step": 266
},
{
"entropy": 0.6123405247926712,
"epoch": 1.7343623070674248,
"grad_norm": 0.00807071104645729,
"learning_rate": 0.0002,
"loss": 0.6082473397254944,
"mean_token_accuracy": 0.7525108605623245,
"num_tokens": 9963968.0,
"step": 267
},
{
"entropy": 0.616507887840271,
"epoch": 1.7408610885458975,
"grad_norm": 0.008352074772119522,
"learning_rate": 0.0002,
"loss": 0.6156948804855347,
"mean_token_accuracy": 0.7471591085195541,
"num_tokens": 10001164.0,
"step": 268
},
{
"entropy": 0.6224628537893295,
"epoch": 1.7473598700243704,
"grad_norm": 0.00863809883594513,
"learning_rate": 0.0002,
"loss": 0.6212406158447266,
"mean_token_accuracy": 0.7489727661013603,
"num_tokens": 10038309.0,
"step": 269
},
{
"entropy": 0.6216438189148903,
"epoch": 1.7538586515028434,
"grad_norm": 0.00882699340581894,
"learning_rate": 0.0002,
"loss": 0.6236106157302856,
"mean_token_accuracy": 0.7466619610786438,
"num_tokens": 10075167.0,
"step": 270
},
{
"entropy": 0.6243376582860947,
"epoch": 1.760357432981316,
"grad_norm": 0.008083442226052284,
"learning_rate": 0.0002,
"loss": 0.6196388006210327,
"mean_token_accuracy": 0.7481562867760658,
"num_tokens": 10112463.0,
"step": 271
},
{
"entropy": 0.6375504732131958,
"epoch": 1.7668562144597888,
"grad_norm": 0.009407855570316315,
"learning_rate": 0.0002,
"loss": 0.6351386308670044,
"mean_token_accuracy": 0.7419685274362564,
"num_tokens": 10150145.0,
"step": 272
},
{
"entropy": 0.6064025089144707,
"epoch": 1.7733549959382615,
"grad_norm": 0.008066139183938503,
"learning_rate": 0.0002,
"loss": 0.6098955273628235,
"mean_token_accuracy": 0.7515333816409111,
"num_tokens": 10187476.0,
"step": 273
},
{
"entropy": 0.609002947807312,
"epoch": 1.7798537774167342,
"grad_norm": 0.0090776477009058,
"learning_rate": 0.0002,
"loss": 0.6182198524475098,
"mean_token_accuracy": 0.749611884355545,
"num_tokens": 10224722.0,
"step": 274
},
{
"entropy": 0.6023535504937172,
"epoch": 1.7863525588952072,
"grad_norm": 0.008943675085902214,
"learning_rate": 0.0002,
"loss": 0.6131588220596313,
"mean_token_accuracy": 0.7517130747437477,
"num_tokens": 10262008.0,
"step": 275
},
{
"entropy": 0.6100214198231697,
"epoch": 1.7928513403736799,
"grad_norm": 0.00780687527731061,
"learning_rate": 0.0002,
"loss": 0.6113550066947937,
"mean_token_accuracy": 0.7519525811076164,
"num_tokens": 10299484.0,
"step": 276
},
{
"entropy": 0.6407601237297058,
"epoch": 1.7993501218521528,
"grad_norm": 0.008408503606915474,
"learning_rate": 0.0002,
"loss": 0.6413571834564209,
"mean_token_accuracy": 0.7412156239151955,
"num_tokens": 10337204.0,
"step": 277
},
{
"entropy": 0.6267746239900589,
"epoch": 1.8058489033306255,
"grad_norm": 0.00864301435649395,
"learning_rate": 0.0002,
"loss": 0.6232145428657532,
"mean_token_accuracy": 0.7470541223883629,
"num_tokens": 10374550.0,
"step": 278
},
{
"entropy": 0.6293241009116173,
"epoch": 1.8123476848090982,
"grad_norm": 0.00788764376193285,
"learning_rate": 0.0002,
"loss": 0.624733567237854,
"mean_token_accuracy": 0.7457406893372536,
"num_tokens": 10412206.0,
"step": 279
},
{
"entropy": 0.6171272769570351,
"epoch": 1.818846466287571,
"grad_norm": 0.006805213168263435,
"learning_rate": 0.0002,
"loss": 0.6169811487197876,
"mean_token_accuracy": 0.7512501701712608,
"num_tokens": 10449535.0,
"step": 280
},
{
"entropy": 0.6095528453588486,
"epoch": 1.825345247766044,
"grad_norm": 0.007181530352681875,
"learning_rate": 0.0002,
"loss": 0.6091392040252686,
"mean_token_accuracy": 0.752260759472847,
"num_tokens": 10487049.0,
"step": 281
},
{
"entropy": 0.61494529992342,
"epoch": 1.8318440292445166,
"grad_norm": 0.008495395071804523,
"learning_rate": 0.0002,
"loss": 0.6144075393676758,
"mean_token_accuracy": 0.7521442621946335,
"num_tokens": 10524737.0,
"step": 282
},
{
"entropy": 0.6196796670556068,
"epoch": 1.8383428107229896,
"grad_norm": 0.00890264380723238,
"learning_rate": 0.0002,
"loss": 0.6239107847213745,
"mean_token_accuracy": 0.7463233023881912,
"num_tokens": 10562188.0,
"step": 283
},
{
"entropy": 0.5968083441257477,
"epoch": 1.8448415922014623,
"grad_norm": 0.007078610826283693,
"learning_rate": 0.0002,
"loss": 0.5999591946601868,
"mean_token_accuracy": 0.7574170976877213,
"num_tokens": 10599566.0,
"step": 284
},
{
"entropy": 0.6290047243237495,
"epoch": 1.851340373679935,
"grad_norm": 0.0070074331015348434,
"learning_rate": 0.0002,
"loss": 0.6321331262588501,
"mean_token_accuracy": 0.7435007244348526,
"num_tokens": 10637008.0,
"step": 285
},
{
"entropy": 0.6198180019855499,
"epoch": 1.8578391551584077,
"grad_norm": 0.0070502436719834805,
"learning_rate": 0.0002,
"loss": 0.6187317967414856,
"mean_token_accuracy": 0.7489558085799217,
"num_tokens": 10674608.0,
"step": 286
},
{
"entropy": 0.6114784702658653,
"epoch": 1.8643379366368806,
"grad_norm": 0.009826047345995903,
"learning_rate": 0.0002,
"loss": 0.6103346347808838,
"mean_token_accuracy": 0.7504026591777802,
"num_tokens": 10711947.0,
"step": 287
},
{
"entropy": 0.6145703047513962,
"epoch": 1.8708367181153533,
"grad_norm": 0.008549013175070286,
"learning_rate": 0.0002,
"loss": 0.6118488311767578,
"mean_token_accuracy": 0.7518711537122726,
"num_tokens": 10749467.0,
"step": 288
},
{
"entropy": 0.6132736206054688,
"epoch": 1.8773354995938263,
"grad_norm": 0.00803026370704174,
"learning_rate": 0.0002,
"loss": 0.6166672706604004,
"mean_token_accuracy": 0.749387837946415,
"num_tokens": 10786750.0,
"step": 289
},
{
"entropy": 0.6266130581498146,
"epoch": 1.883834281072299,
"grad_norm": 0.008134995587170124,
"learning_rate": 0.0002,
"loss": 0.6310341358184814,
"mean_token_accuracy": 0.743694357573986,
"num_tokens": 10823914.0,
"step": 290
},
{
"entropy": 0.6153042837977409,
"epoch": 1.8903330625507717,
"grad_norm": 0.009320992045104504,
"learning_rate": 0.0002,
"loss": 0.6227383613586426,
"mean_token_accuracy": 0.7482397258281708,
"num_tokens": 10861283.0,
"step": 291
},
{
"entropy": 0.6265768557786942,
"epoch": 1.8968318440292444,
"grad_norm": 0.009208294562995434,
"learning_rate": 0.0002,
"loss": 0.6274023056030273,
"mean_token_accuracy": 0.7459790334105492,
"num_tokens": 10898650.0,
"step": 292
},
{
"entropy": 0.6209842190146446,
"epoch": 1.9033306255077171,
"grad_norm": 0.007123781833797693,
"learning_rate": 0.0002,
"loss": 0.6167253255844116,
"mean_token_accuracy": 0.7506068870425224,
"num_tokens": 10936405.0,
"step": 293
},
{
"entropy": 0.6177584528923035,
"epoch": 1.90982940698619,
"grad_norm": 0.0075668166391551495,
"learning_rate": 0.0002,
"loss": 0.6163274049758911,
"mean_token_accuracy": 0.7489276751875877,
"num_tokens": 10973923.0,
"step": 294
},
{
"entropy": 0.6218736097216606,
"epoch": 1.916328188464663,
"grad_norm": 0.0085530336946249,
"learning_rate": 0.0002,
"loss": 0.6214455366134644,
"mean_token_accuracy": 0.747297577559948,
"num_tokens": 11011183.0,
"step": 295
},
{
"entropy": 0.6203776001930237,
"epoch": 1.9228269699431357,
"grad_norm": 0.008531006053090096,
"learning_rate": 0.0002,
"loss": 0.6233081817626953,
"mean_token_accuracy": 0.7472613751888275,
"num_tokens": 11048409.0,
"step": 296
},
{
"entropy": 0.6170744299888611,
"epoch": 1.9293257514216084,
"grad_norm": 0.006794555112719536,
"learning_rate": 0.0002,
"loss": 0.6177318096160889,
"mean_token_accuracy": 0.7481219694018364,
"num_tokens": 11085854.0,
"step": 297
},
{
"entropy": 0.6205914691090584,
"epoch": 1.9358245329000812,
"grad_norm": 0.00894018355756998,
"learning_rate": 0.0002,
"loss": 0.6211514472961426,
"mean_token_accuracy": 0.7470626905560493,
"num_tokens": 11122678.0,
"step": 298
},
{
"entropy": 0.6179786175489426,
"epoch": 1.9423233143785539,
"grad_norm": 0.008218267932534218,
"learning_rate": 0.0002,
"loss": 0.6211084723472595,
"mean_token_accuracy": 0.7481166496872902,
"num_tokens": 11160207.0,
"step": 299
},
{
"entropy": 0.6241402998566628,
"epoch": 1.9488220958570268,
"grad_norm": 0.008334561251103878,
"learning_rate": 0.0002,
"loss": 0.6270841360092163,
"mean_token_accuracy": 0.7478617802262306,
"num_tokens": 11197850.0,
"step": 300
},
{
"entropy": 0.6133561357855797,
"epoch": 1.9553208773354998,
"grad_norm": 0.0071178278885781765,
"learning_rate": 0.0002,
"loss": 0.6169086694717407,
"mean_token_accuracy": 0.7505014687776566,
"num_tokens": 11235129.0,
"step": 301
},
{
"entropy": 0.6112445220351219,
"epoch": 1.9618196588139725,
"grad_norm": 0.00821610540151596,
"learning_rate": 0.0002,
"loss": 0.6131574511528015,
"mean_token_accuracy": 0.7517394497990608,
"num_tokens": 11272140.0,
"step": 302
},
{
"entropy": 0.6255387738347054,
"epoch": 1.9683184402924452,
"grad_norm": 0.009108194150030613,
"learning_rate": 0.0002,
"loss": 0.6270141005516052,
"mean_token_accuracy": 0.7442326322197914,
"num_tokens": 11309074.0,
"step": 303
},
{
"entropy": 0.6138653978705406,
"epoch": 1.974817221770918,
"grad_norm": 0.007860496640205383,
"learning_rate": 0.0002,
"loss": 0.6152341961860657,
"mean_token_accuracy": 0.7488235086202621,
"num_tokens": 11346694.0,
"step": 304
},
{
"entropy": 0.6311385780572891,
"epoch": 1.9813160032493906,
"grad_norm": 0.008101027458906174,
"learning_rate": 0.0002,
"loss": 0.6344274282455444,
"mean_token_accuracy": 0.7414661273360252,
"num_tokens": 11384229.0,
"step": 305
},
{
"entropy": 0.6193428635597229,
"epoch": 1.9878147847278635,
"grad_norm": 0.007910770364105701,
"learning_rate": 0.0002,
"loss": 0.6175734400749207,
"mean_token_accuracy": 0.7502587288618088,
"num_tokens": 11421788.0,
"step": 306
},
{
"entropy": 0.6222855523228645,
"epoch": 1.9943135662063363,
"grad_norm": 0.008522240445017815,
"learning_rate": 0.0002,
"loss": 0.623339831829071,
"mean_token_accuracy": 0.7481605112552643,
"num_tokens": 11459154.0,
"step": 307
},
{
"entropy": 0.6278953552246094,
"epoch": 2.0,
"grad_norm": 0.008388028480112553,
"learning_rate": 0.0002,
"loss": 0.6375839710235596,
"mean_token_accuracy": 0.7482074073382786,
"num_tokens": 11475381.0,
"step": 308
},
{
"entropy": 0.613355465233326,
"epoch": 2.0064987814784727,
"grad_norm": 0.00827846396714449,
"learning_rate": 0.0002,
"loss": 0.6111053228378296,
"mean_token_accuracy": 0.7524029165506363,
"num_tokens": 11512446.0,
"step": 309
},
{
"entropy": 0.6208668798208237,
"epoch": 2.0129975629569454,
"grad_norm": 0.008557752706110477,
"learning_rate": 0.0002,
"loss": 0.6219561100006104,
"mean_token_accuracy": 0.7458884716033936,
"num_tokens": 11549773.0,
"step": 310
},
{
"entropy": 0.6194536536931992,
"epoch": 2.019496344435418,
"grad_norm": 0.009552874602377415,
"learning_rate": 0.0002,
"loss": 0.624874472618103,
"mean_token_accuracy": 0.7470095753669739,
"num_tokens": 11587104.0,
"step": 311
},
{
"entropy": 0.6137440055608749,
"epoch": 2.0259951259138913,
"grad_norm": 0.008704678155481815,
"learning_rate": 0.0002,
"loss": 0.6167584657669067,
"mean_token_accuracy": 0.7494626566767693,
"num_tokens": 11624387.0,
"step": 312
},
{
"entropy": 0.6213903650641441,
"epoch": 2.032493907392364,
"grad_norm": 0.007905784994363785,
"learning_rate": 0.0002,
"loss": 0.622920036315918,
"mean_token_accuracy": 0.7466430589556694,
"num_tokens": 11661928.0,
"step": 313
},
{
"entropy": 0.608438141644001,
"epoch": 2.0389926888708367,
"grad_norm": 0.008782708086073399,
"learning_rate": 0.0002,
"loss": 0.6084336638450623,
"mean_token_accuracy": 0.7526147440075874,
"num_tokens": 11699518.0,
"step": 314
},
{
"entropy": 0.6130177453160286,
"epoch": 2.0454914703493094,
"grad_norm": 0.009063824079930782,
"learning_rate": 0.0002,
"loss": 0.6168864965438843,
"mean_token_accuracy": 0.7494284063577652,
"num_tokens": 11737013.0,
"step": 315
},
{
"entropy": 0.6137471869587898,
"epoch": 2.051990251827782,
"grad_norm": 0.008271057158708572,
"learning_rate": 0.0002,
"loss": 0.6143357753753662,
"mean_token_accuracy": 0.7498123943805695,
"num_tokens": 11774346.0,
"step": 316
},
{
"entropy": 0.6195183843374252,
"epoch": 2.058489033306255,
"grad_norm": 0.007240446750074625,
"learning_rate": 0.0002,
"loss": 0.6194902062416077,
"mean_token_accuracy": 0.7464936003088951,
"num_tokens": 11811650.0,
"step": 317
},
{
"entropy": 0.6273763924837112,
"epoch": 2.064987814784728,
"grad_norm": 0.009513584896922112,
"learning_rate": 0.0002,
"loss": 0.6216360330581665,
"mean_token_accuracy": 0.7472178563475609,
"num_tokens": 11849227.0,
"step": 318
},
{
"entropy": 0.6146251261234283,
"epoch": 2.0714865962632008,
"grad_norm": 0.007890078239142895,
"learning_rate": 0.0002,
"loss": 0.6166911721229553,
"mean_token_accuracy": 0.7501556724309921,
"num_tokens": 11886732.0,
"step": 319
},
{
"entropy": 0.5975739285349846,
"epoch": 2.0779853777416735,
"grad_norm": 0.009085185825824738,
"learning_rate": 0.0002,
"loss": 0.6020256280899048,
"mean_token_accuracy": 0.7525540143251419,
"num_tokens": 11923954.0,
"step": 320
},
{
"entropy": 0.6165630891919136,
"epoch": 2.084484159220146,
"grad_norm": 0.006837225519120693,
"learning_rate": 0.0002,
"loss": 0.6179453134536743,
"mean_token_accuracy": 0.7491353005170822,
"num_tokens": 11961305.0,
"step": 321
},
{
"entropy": 0.6221051812171936,
"epoch": 2.090982940698619,
"grad_norm": 0.007578800432384014,
"learning_rate": 0.0002,
"loss": 0.6233739852905273,
"mean_token_accuracy": 0.7461354285478592,
"num_tokens": 11998561.0,
"step": 322
},
{
"entropy": 0.6175716295838356,
"epoch": 2.0974817221770916,
"grad_norm": 0.008444663137197495,
"learning_rate": 0.0002,
"loss": 0.6204410791397095,
"mean_token_accuracy": 0.7468695417046547,
"num_tokens": 12035916.0,
"step": 323
},
{
"entropy": 0.6165966615080833,
"epoch": 2.1039805036555648,
"grad_norm": 0.008185302838683128,
"learning_rate": 0.0002,
"loss": 0.6171708106994629,
"mean_token_accuracy": 0.7481535449624062,
"num_tokens": 12073704.0,
"step": 324
},
{
"entropy": 0.6210658326745033,
"epoch": 2.1104792851340375,
"grad_norm": 0.0074119968339800835,
"learning_rate": 0.0002,
"loss": 0.6183840036392212,
"mean_token_accuracy": 0.7473175972700119,
"num_tokens": 12111357.0,
"step": 325
},
{
"entropy": 0.617885060608387,
"epoch": 2.11697806661251,
"grad_norm": 0.007906505838036537,
"learning_rate": 0.0002,
"loss": 0.6161532998085022,
"mean_token_accuracy": 0.7496127933263779,
"num_tokens": 12148879.0,
"step": 326
},
{
"entropy": 0.6197918429970741,
"epoch": 2.123476848090983,
"grad_norm": 0.007352263201028109,
"learning_rate": 0.0002,
"loss": 0.6218726634979248,
"mean_token_accuracy": 0.7473544403910637,
"num_tokens": 12186546.0,
"step": 327
},
{
"entropy": 0.6142667904496193,
"epoch": 2.1299756295694556,
"grad_norm": 0.008285868912935257,
"learning_rate": 0.0002,
"loss": 0.6169737577438354,
"mean_token_accuracy": 0.7486495152115822,
"num_tokens": 12223727.0,
"step": 328
},
{
"entropy": 0.6135031282901764,
"epoch": 2.1364744110479283,
"grad_norm": 0.00797727145254612,
"learning_rate": 0.0002,
"loss": 0.6149879097938538,
"mean_token_accuracy": 0.7501881718635559,
"num_tokens": 12261432.0,
"step": 329
},
{
"entropy": 0.614725299179554,
"epoch": 2.1429731925264015,
"grad_norm": 0.0077530802227556705,
"learning_rate": 0.0002,
"loss": 0.6197780966758728,
"mean_token_accuracy": 0.7476382106542587,
"num_tokens": 12298773.0,
"step": 330
},
{
"entropy": 0.6204890534281731,
"epoch": 2.149471974004874,
"grad_norm": 0.007455397862941027,
"learning_rate": 0.0002,
"loss": 0.6217861175537109,
"mean_token_accuracy": 0.7472267374396324,
"num_tokens": 12335838.0,
"step": 331
},
{
"entropy": 0.6141664981842041,
"epoch": 2.155970755483347,
"grad_norm": 0.007735258899629116,
"learning_rate": 0.0002,
"loss": 0.619376540184021,
"mean_token_accuracy": 0.7473561838269234,
"num_tokens": 12373171.0,
"step": 332
},
{
"entropy": 0.6120809391140938,
"epoch": 2.1624695369618196,
"grad_norm": 0.008401036262512207,
"learning_rate": 0.0002,
"loss": 0.6154431700706482,
"mean_token_accuracy": 0.7471263483166695,
"num_tokens": 12410549.0,
"step": 333
},
{
"entropy": 0.6145179942250252,
"epoch": 2.1689683184402924,
"grad_norm": 0.00904724933207035,
"learning_rate": 0.0002,
"loss": 0.6087259650230408,
"mean_token_accuracy": 0.7501003369688988,
"num_tokens": 12447788.0,
"step": 334
},
{
"entropy": 0.6214614436030388,
"epoch": 2.175467099918765,
"grad_norm": 0.007604485843330622,
"learning_rate": 0.0002,
"loss": 0.6169778108596802,
"mean_token_accuracy": 0.7492403090000153,
"num_tokens": 12485368.0,
"step": 335
},
{
"entropy": 0.6146392300724983,
"epoch": 2.181965881397238,
"grad_norm": 0.008299093693494797,
"learning_rate": 0.0002,
"loss": 0.6154477596282959,
"mean_token_accuracy": 0.7474880516529083,
"num_tokens": 12522590.0,
"step": 336
},
{
"entropy": 0.6179040372371674,
"epoch": 2.188464662875711,
"grad_norm": 0.009656457230448723,
"learning_rate": 0.0002,
"loss": 0.6244622468948364,
"mean_token_accuracy": 0.74583899974823,
"num_tokens": 12559957.0,
"step": 337
},
{
"entropy": 0.6236468479037285,
"epoch": 2.1949634443541837,
"grad_norm": 0.008342688903212547,
"learning_rate": 0.0002,
"loss": 0.6273738145828247,
"mean_token_accuracy": 0.7441191673278809,
"num_tokens": 12597080.0,
"step": 338
},
{
"entropy": 0.6155964732170105,
"epoch": 2.2014622258326564,
"grad_norm": 0.008706323802471161,
"learning_rate": 0.0002,
"loss": 0.6139167547225952,
"mean_token_accuracy": 0.7505380213260651,
"num_tokens": 12634470.0,
"step": 339
},
{
"entropy": 0.6147474870085716,
"epoch": 2.207961007311129,
"grad_norm": 0.009130026213824749,
"learning_rate": 0.0002,
"loss": 0.6147286891937256,
"mean_token_accuracy": 0.7490043491125107,
"num_tokens": 12671909.0,
"step": 340
},
{
"entropy": 0.6133714243769646,
"epoch": 2.214459788789602,
"grad_norm": 0.008477689698338509,
"learning_rate": 0.0002,
"loss": 0.6187378168106079,
"mean_token_accuracy": 0.7469930872321129,
"num_tokens": 12708771.0,
"step": 341
},
{
"entropy": 0.6298847869038582,
"epoch": 2.2209585702680745,
"grad_norm": 0.009632086381316185,
"learning_rate": 0.0002,
"loss": 0.6292200684547424,
"mean_token_accuracy": 0.7443962469696999,
"num_tokens": 12746208.0,
"step": 342
},
{
"entropy": 0.6298182159662247,
"epoch": 2.2274573517465477,
"grad_norm": 0.007817580364644527,
"learning_rate": 0.0002,
"loss": 0.6289129853248596,
"mean_token_accuracy": 0.7439332380890846,
"num_tokens": 12783644.0,
"step": 343
},
{
"entropy": 0.6162709593772888,
"epoch": 2.2339561332250204,
"grad_norm": 0.009011663496494293,
"learning_rate": 0.0002,
"loss": 0.6142280101776123,
"mean_token_accuracy": 0.7506413981318474,
"num_tokens": 12821007.0,
"step": 344
},
{
"entropy": 0.6286559477448463,
"epoch": 2.240454914703493,
"grad_norm": 0.009188450872898102,
"learning_rate": 0.0002,
"loss": 0.6286423206329346,
"mean_token_accuracy": 0.7440641894936562,
"num_tokens": 12858516.0,
"step": 345
},
{
"entropy": 0.6245385706424713,
"epoch": 2.246953696181966,
"grad_norm": 0.009156906045973301,
"learning_rate": 0.0002,
"loss": 0.6278682947158813,
"mean_token_accuracy": 0.7443269118666649,
"num_tokens": 12895999.0,
"step": 346
},
{
"entropy": 0.6157897710800171,
"epoch": 2.2534524776604385,
"grad_norm": 0.007890370674431324,
"learning_rate": 0.0002,
"loss": 0.6214807033538818,
"mean_token_accuracy": 0.7472835406661034,
"num_tokens": 12933354.0,
"step": 347
},
{
"entropy": 0.6123293116688728,
"epoch": 2.2599512591389113,
"grad_norm": 0.007912621833384037,
"learning_rate": 0.0002,
"loss": 0.6164427995681763,
"mean_token_accuracy": 0.7487083747982979,
"num_tokens": 12970559.0,
"step": 348
},
{
"entropy": 0.6260915771126747,
"epoch": 2.2664500406173844,
"grad_norm": 0.008234160020947456,
"learning_rate": 0.0002,
"loss": 0.6222859621047974,
"mean_token_accuracy": 0.7458368241786957,
"num_tokens": 13008283.0,
"step": 349
},
{
"entropy": 0.6248592287302017,
"epoch": 2.272948822095857,
"grad_norm": 0.009832987561821938,
"learning_rate": 0.0002,
"loss": 0.6199322938919067,
"mean_token_accuracy": 0.7477703094482422,
"num_tokens": 13045527.0,
"step": 350
},
{
"entropy": 0.6275637075304985,
"epoch": 2.27944760357433,
"grad_norm": 0.008727029897272587,
"learning_rate": 0.0002,
"loss": 0.632993221282959,
"mean_token_accuracy": 0.7412514090538025,
"num_tokens": 13082974.0,
"step": 351
},
{
"entropy": 0.6118641197681427,
"epoch": 2.2859463850528026,
"grad_norm": 0.009624680504202843,
"learning_rate": 0.0002,
"loss": 0.6219325065612793,
"mean_token_accuracy": 0.7466080039739609,
"num_tokens": 13120093.0,
"step": 352
},
{
"entropy": 0.5959088578820229,
"epoch": 2.2924451665312753,
"grad_norm": 0.007752889767289162,
"learning_rate": 0.0002,
"loss": 0.5983707904815674,
"mean_token_accuracy": 0.755429819226265,
"num_tokens": 13157659.0,
"step": 353
},
{
"entropy": 0.6112657487392426,
"epoch": 2.298943948009748,
"grad_norm": 0.008281555026769638,
"learning_rate": 0.0002,
"loss": 0.6082602143287659,
"mean_token_accuracy": 0.7516218572854996,
"num_tokens": 13194647.0,
"step": 354
},
{
"entropy": 0.6122025474905968,
"epoch": 2.305442729488221,
"grad_norm": 0.008959132246673107,
"learning_rate": 0.0002,
"loss": 0.6142069101333618,
"mean_token_accuracy": 0.7516066282987595,
"num_tokens": 13231933.0,
"step": 355
},
{
"entropy": 0.610342264175415,
"epoch": 2.311941510966694,
"grad_norm": 0.0076917321421206,
"learning_rate": 0.0002,
"loss": 0.6098777055740356,
"mean_token_accuracy": 0.7534263134002686,
"num_tokens": 13269472.0,
"step": 356
},
{
"entropy": 0.6236057877540588,
"epoch": 2.3184402924451666,
"grad_norm": 0.008514189161360264,
"learning_rate": 0.0002,
"loss": 0.6241997480392456,
"mean_token_accuracy": 0.7468095943331718,
"num_tokens": 13307269.0,
"step": 357
},
{
"entropy": 0.6160306110978127,
"epoch": 2.3249390739236393,
"grad_norm": 0.009143211878836155,
"learning_rate": 0.0002,
"loss": 0.6196573972702026,
"mean_token_accuracy": 0.7480775937438011,
"num_tokens": 13344551.0,
"step": 358
},
{
"entropy": 0.6120478510856628,
"epoch": 2.331437855402112,
"grad_norm": 0.007592627312988043,
"learning_rate": 0.0002,
"loss": 0.6155714392662048,
"mean_token_accuracy": 0.7500782683491707,
"num_tokens": 13382127.0,
"step": 359
},
{
"entropy": 0.6234208717942238,
"epoch": 2.3379366368805847,
"grad_norm": 0.008143738843500614,
"learning_rate": 0.0002,
"loss": 0.6278046369552612,
"mean_token_accuracy": 0.7446608766913414,
"num_tokens": 13419810.0,
"step": 360
},
{
"entropy": 0.6157349273562431,
"epoch": 2.3444354183590574,
"grad_norm": 0.008566657081246376,
"learning_rate": 0.0002,
"loss": 0.6156420707702637,
"mean_token_accuracy": 0.7479202896356583,
"num_tokens": 13457273.0,
"step": 361
},
{
"entropy": 0.6180937066674232,
"epoch": 2.3509341998375306,
"grad_norm": 0.008304375223815441,
"learning_rate": 0.0002,
"loss": 0.622611403465271,
"mean_token_accuracy": 0.7477732971310616,
"num_tokens": 13494536.0,
"step": 362
},
{
"entropy": 0.6232565492391586,
"epoch": 2.3574329813160033,
"grad_norm": 0.008868128061294556,
"learning_rate": 0.0002,
"loss": 0.6260833740234375,
"mean_token_accuracy": 0.7459229752421379,
"num_tokens": 13531864.0,
"step": 363
},
{
"entropy": 0.6254989579319954,
"epoch": 2.363931762794476,
"grad_norm": 0.008256005123257637,
"learning_rate": 0.0002,
"loss": 0.6260857582092285,
"mean_token_accuracy": 0.7447438836097717,
"num_tokens": 13569443.0,
"step": 364
},
{
"entropy": 0.6221200376749039,
"epoch": 2.3704305442729487,
"grad_norm": 0.009361873380839825,
"learning_rate": 0.0002,
"loss": 0.6180988550186157,
"mean_token_accuracy": 0.7470216527581215,
"num_tokens": 13606513.0,
"step": 365
},
{
"entropy": 0.616127498447895,
"epoch": 2.3769293257514215,
"grad_norm": 0.008144999854266644,
"learning_rate": 0.0002,
"loss": 0.6137336492538452,
"mean_token_accuracy": 0.7496519684791565,
"num_tokens": 13643706.0,
"step": 366
},
{
"entropy": 0.6194290667772293,
"epoch": 2.3834281072298946,
"grad_norm": 0.008278160355985165,
"learning_rate": 0.0002,
"loss": 0.6232280135154724,
"mean_token_accuracy": 0.7481147646903992,
"num_tokens": 13680957.0,
"step": 367
},
{
"entropy": 0.6192846670746803,
"epoch": 2.3899268887083673,
"grad_norm": 0.010223917663097382,
"learning_rate": 0.0002,
"loss": 0.6253848075866699,
"mean_token_accuracy": 0.744193010032177,
"num_tokens": 13717903.0,
"step": 368
},
{
"entropy": 0.6221625953912735,
"epoch": 2.39642567018684,
"grad_norm": 0.008200163953006268,
"learning_rate": 0.0002,
"loss": 0.6191288232803345,
"mean_token_accuracy": 0.74726802110672,
"num_tokens": 13755260.0,
"step": 369
},
{
"entropy": 0.6163566559553146,
"epoch": 2.4029244516653128,
"grad_norm": 0.007974907755851746,
"learning_rate": 0.0002,
"loss": 0.6134728193283081,
"mean_token_accuracy": 0.7508314996957779,
"num_tokens": 13792517.0,
"step": 370
},
{
"entropy": 0.6114080101251602,
"epoch": 2.4094232331437855,
"grad_norm": 0.008343557827174664,
"learning_rate": 0.0002,
"loss": 0.6111307144165039,
"mean_token_accuracy": 0.7514908611774445,
"num_tokens": 13829760.0,
"step": 371
},
{
"entropy": 0.5953814163804054,
"epoch": 2.415922014622258,
"grad_norm": 0.01898498833179474,
"learning_rate": 0.0002,
"loss": 0.5988050699234009,
"mean_token_accuracy": 0.7543381601572037,
"num_tokens": 13867370.0,
"step": 372
},
{
"entropy": 0.6071057021617889,
"epoch": 2.422420796100731,
"grad_norm": 0.023124704137444496,
"learning_rate": 0.0002,
"loss": 0.6178369522094727,
"mean_token_accuracy": 0.747986689209938,
"num_tokens": 13904625.0,
"step": 373
},
{
"entropy": 0.6107468456029892,
"epoch": 2.428919577579204,
"grad_norm": 0.01215590164065361,
"learning_rate": 0.0002,
"loss": 0.6207199096679688,
"mean_token_accuracy": 0.7475155666470528,
"num_tokens": 13942489.0,
"step": 374
},
{
"entropy": 0.6124749183654785,
"epoch": 2.435418359057677,
"grad_norm": 0.012728074565529823,
"learning_rate": 0.0002,
"loss": 0.6103756427764893,
"mean_token_accuracy": 0.7500820159912109,
"num_tokens": 13980205.0,
"step": 375
},
{
"entropy": 0.6109942868351936,
"epoch": 2.4419171405361495,
"grad_norm": 0.009368120692670345,
"learning_rate": 0.0002,
"loss": 0.6066494584083557,
"mean_token_accuracy": 0.7536064460873604,
"num_tokens": 14017641.0,
"step": 376
},
{
"entropy": 0.624424010515213,
"epoch": 2.448415922014622,
"grad_norm": 0.016890961676836014,
"learning_rate": 0.0002,
"loss": 0.614218533039093,
"mean_token_accuracy": 0.7494603618979454,
"num_tokens": 14054677.0,
"step": 377
},
{
"entropy": 0.6255820393562317,
"epoch": 2.454914703493095,
"grad_norm": 0.009696394205093384,
"learning_rate": 0.0002,
"loss": 0.6304793357849121,
"mean_token_accuracy": 0.7434439361095428,
"num_tokens": 14091764.0,
"step": 378
},
{
"entropy": 0.621983028948307,
"epoch": 2.4614134849715676,
"grad_norm": 0.020173629745841026,
"learning_rate": 0.0002,
"loss": 0.6257689595222473,
"mean_token_accuracy": 0.745697520673275,
"num_tokens": 14129278.0,
"step": 379
},
{
"entropy": 0.6207767054438591,
"epoch": 2.467912266450041,
"grad_norm": 0.008954247459769249,
"learning_rate": 0.0002,
"loss": 0.6241703033447266,
"mean_token_accuracy": 0.750006191432476,
"num_tokens": 14167232.0,
"step": 380
},
{
"entropy": 0.6112791821360588,
"epoch": 2.4744110479285135,
"grad_norm": 0.009806505404412746,
"learning_rate": 0.0002,
"loss": 0.6147319078445435,
"mean_token_accuracy": 0.7495506927371025,
"num_tokens": 14204632.0,
"step": 381
},
{
"entropy": 0.6135937720537186,
"epoch": 2.4809098294069862,
"grad_norm": 0.008928372524678707,
"learning_rate": 0.0002,
"loss": 0.6139630079269409,
"mean_token_accuracy": 0.7506385967135429,
"num_tokens": 14242352.0,
"step": 382
},
{
"entropy": 0.6150240004062653,
"epoch": 2.487408610885459,
"grad_norm": 0.015955505892634392,
"learning_rate": 0.0002,
"loss": 0.6152509450912476,
"mean_token_accuracy": 0.7515363991260529,
"num_tokens": 14280058.0,
"step": 383
},
{
"entropy": 0.6128680855035782,
"epoch": 2.4939073923639317,
"grad_norm": 0.009567083790898323,
"learning_rate": 0.0002,
"loss": 0.6167535781860352,
"mean_token_accuracy": 0.748919777572155,
"num_tokens": 14317661.0,
"step": 384
},
{
"entropy": 0.626237154006958,
"epoch": 2.5004061738424044,
"grad_norm": 0.01046669203788042,
"learning_rate": 0.0002,
"loss": 0.6324093341827393,
"mean_token_accuracy": 0.7444325461983681,
"num_tokens": 14355367.0,
"step": 385
},
{
"entropy": 0.6202276349067688,
"epoch": 2.506904955320877,
"grad_norm": 0.007664418779313564,
"learning_rate": 0.0002,
"loss": 0.6191686987876892,
"mean_token_accuracy": 0.7475631311535835,
"num_tokens": 14393315.0,
"step": 386
},
{
"entropy": 0.6242005750536919,
"epoch": 2.5134037367993503,
"grad_norm": 0.00844619981944561,
"learning_rate": 0.0002,
"loss": 0.621794581413269,
"mean_token_accuracy": 0.7481283098459244,
"num_tokens": 14430853.0,
"step": 387
},
{
"entropy": 0.6239676773548126,
"epoch": 2.519902518277823,
"grad_norm": 0.008689953945577145,
"learning_rate": 0.0002,
"loss": 0.6237965226173401,
"mean_token_accuracy": 0.7461953610181808,
"num_tokens": 14468292.0,
"step": 388
},
{
"entropy": 0.6107499524950981,
"epoch": 2.5264012997562957,
"grad_norm": 0.009505955502390862,
"learning_rate": 0.0002,
"loss": 0.6074596643447876,
"mean_token_accuracy": 0.7525542005896568,
"num_tokens": 14505921.0,
"step": 389
},
{
"entropy": 0.6142911538481712,
"epoch": 2.5329000812347684,
"grad_norm": 0.009658354334533215,
"learning_rate": 0.0002,
"loss": 0.6198441982269287,
"mean_token_accuracy": 0.7489058822393417,
"num_tokens": 14543384.0,
"step": 390
},
{
"entropy": 0.6049473881721497,
"epoch": 2.539398862713241,
"grad_norm": 0.010726661421358585,
"learning_rate": 0.0002,
"loss": 0.6118952631950378,
"mean_token_accuracy": 0.7526208385825157,
"num_tokens": 14580935.0,
"step": 391
},
{
"entropy": 0.5964333266019821,
"epoch": 2.5458976441917143,
"grad_norm": 0.00981208123266697,
"learning_rate": 0.0002,
"loss": 0.6057010889053345,
"mean_token_accuracy": 0.7543943077325821,
"num_tokens": 14618074.0,
"step": 392
},
{
"entropy": 0.6099359169602394,
"epoch": 2.552396425670187,
"grad_norm": 0.009079058654606342,
"learning_rate": 0.0002,
"loss": 0.6084835529327393,
"mean_token_accuracy": 0.7520028725266457,
"num_tokens": 14655186.0,
"step": 393
},
{
"entropy": 0.6173275411128998,
"epoch": 2.5588952071486597,
"grad_norm": 0.009335207752883434,
"learning_rate": 0.0002,
"loss": 0.6102230548858643,
"mean_token_accuracy": 0.7514491975307465,
"num_tokens": 14692383.0,
"step": 394
},
{
"entropy": 0.6305418461561203,
"epoch": 2.5653939886271324,
"grad_norm": 0.009312084876000881,
"learning_rate": 0.0002,
"loss": 0.6281323432922363,
"mean_token_accuracy": 0.7421899363398552,
"num_tokens": 14729446.0,
"step": 395
},
{
"entropy": 0.6119675636291504,
"epoch": 2.571892770105605,
"grad_norm": 0.00806971825659275,
"learning_rate": 0.0002,
"loss": 0.6118816137313843,
"mean_token_accuracy": 0.7502529993653297,
"num_tokens": 14766917.0,
"step": 396
},
{
"entropy": 0.6194342076778412,
"epoch": 2.578391551584078,
"grad_norm": 0.009102623909711838,
"learning_rate": 0.0002,
"loss": 0.625906229019165,
"mean_token_accuracy": 0.7444874346256256,
"num_tokens": 14804635.0,
"step": 397
},
{
"entropy": 0.6129268780350685,
"epoch": 2.5848903330625506,
"grad_norm": 0.010471413843333721,
"learning_rate": 0.0002,
"loss": 0.6221112012863159,
"mean_token_accuracy": 0.7463114410638809,
"num_tokens": 14842380.0,
"step": 398
},
{
"entropy": 0.6111740916967392,
"epoch": 2.5913891145410237,
"grad_norm": 0.008378157392144203,
"learning_rate": 0.0002,
"loss": 0.6132410764694214,
"mean_token_accuracy": 0.7493879497051239,
"num_tokens": 14879441.0,
"step": 399
},
{
"entropy": 0.6207928210496902,
"epoch": 2.5978878960194964,
"grad_norm": 0.008037488907575607,
"learning_rate": 0.0002,
"loss": 0.6196093559265137,
"mean_token_accuracy": 0.7491321563720703,
"num_tokens": 14916731.0,
"step": 400
},
{
"entropy": 0.6349622085690498,
"epoch": 2.604386677497969,
"grad_norm": 0.00913564208894968,
"learning_rate": 0.0002,
"loss": 0.6318038702011108,
"mean_token_accuracy": 0.7420522123575211,
"num_tokens": 14954276.0,
"step": 401
},
{
"entropy": 0.6019857749342918,
"epoch": 2.610885458976442,
"grad_norm": 0.008696068078279495,
"learning_rate": 0.0002,
"loss": 0.600864052772522,
"mean_token_accuracy": 0.7552035823464394,
"num_tokens": 14991349.0,
"step": 402
},
{
"entropy": 0.6017836257815361,
"epoch": 2.6173842404549146,
"grad_norm": 0.008207019418478012,
"learning_rate": 0.0002,
"loss": 0.6038705706596375,
"mean_token_accuracy": 0.7532704323530197,
"num_tokens": 15028601.0,
"step": 403
},
{
"entropy": 0.6120554357767105,
"epoch": 2.6238830219333877,
"grad_norm": 0.008753425441682339,
"learning_rate": 0.0002,
"loss": 0.6164306998252869,
"mean_token_accuracy": 0.7496815398335457,
"num_tokens": 15066182.0,
"step": 404
},
{
"entropy": 0.6131924018263817,
"epoch": 2.6303818034118605,
"grad_norm": 0.008548066020011902,
"learning_rate": 0.0002,
"loss": 0.6181113719940186,
"mean_token_accuracy": 0.7491538524627686,
"num_tokens": 15103340.0,
"step": 405
},
{
"entropy": 0.6061984226107597,
"epoch": 2.636880584890333,
"grad_norm": 0.009016766212880611,
"learning_rate": 0.0002,
"loss": 0.6121985912322998,
"mean_token_accuracy": 0.7507323697209358,
"num_tokens": 15140594.0,
"step": 406
},
{
"entropy": 0.6165529787540436,
"epoch": 2.643379366368806,
"grad_norm": 0.007676286157220602,
"learning_rate": 0.0002,
"loss": 0.6143813133239746,
"mean_token_accuracy": 0.7518013492226601,
"num_tokens": 15178037.0,
"step": 407
},
{
"entropy": 0.6116887852549553,
"epoch": 2.6498781478472786,
"grad_norm": 0.007873927243053913,
"learning_rate": 0.0002,
"loss": 0.6096634268760681,
"mean_token_accuracy": 0.7518724203109741,
"num_tokens": 15215362.0,
"step": 408
},
{
"entropy": 0.6075077503919601,
"epoch": 2.6563769293257513,
"grad_norm": 0.007256446871906519,
"learning_rate": 0.0002,
"loss": 0.6078198552131653,
"mean_token_accuracy": 0.7537789046764374,
"num_tokens": 15252624.0,
"step": 409
},
{
"entropy": 0.6106631234288216,
"epoch": 2.662875710804224,
"grad_norm": 0.009321639314293861,
"learning_rate": 0.0002,
"loss": 0.6120110750198364,
"mean_token_accuracy": 0.7512669935822487,
"num_tokens": 15290298.0,
"step": 410
},
{
"entropy": 0.6318610459566116,
"epoch": 2.6693744922826967,
"grad_norm": 0.008198688738048077,
"learning_rate": 0.0002,
"loss": 0.6370584964752197,
"mean_token_accuracy": 0.740862101316452,
"num_tokens": 15327374.0,
"step": 411
},
{
"entropy": 0.6139440014958382,
"epoch": 2.67587327376117,
"grad_norm": 0.008440233767032623,
"learning_rate": 0.0002,
"loss": 0.6130324602127075,
"mean_token_accuracy": 0.7509049624204636,
"num_tokens": 15364313.0,
"step": 412
},
{
"entropy": 0.6132312193512917,
"epoch": 2.6823720552396426,
"grad_norm": 0.00764568243175745,
"learning_rate": 0.0002,
"loss": 0.6143498420715332,
"mean_token_accuracy": 0.7499875500798225,
"num_tokens": 15401585.0,
"step": 413
},
{
"entropy": 0.6295821517705917,
"epoch": 2.6888708367181153,
"grad_norm": 0.00870992336422205,
"learning_rate": 0.0002,
"loss": 0.6297035217285156,
"mean_token_accuracy": 0.7440814226865768,
"num_tokens": 15439063.0,
"step": 414
},
{
"entropy": 0.6159479022026062,
"epoch": 2.695369618196588,
"grad_norm": 0.007172968704253435,
"learning_rate": 0.0002,
"loss": 0.6142174005508423,
"mean_token_accuracy": 0.7487895339727402,
"num_tokens": 15476100.0,
"step": 415
},
{
"entropy": 0.6020728126168251,
"epoch": 2.7018683996750608,
"grad_norm": 0.007704848889261484,
"learning_rate": 0.0002,
"loss": 0.6082124710083008,
"mean_token_accuracy": 0.752522885799408,
"num_tokens": 15513167.0,
"step": 416
},
{
"entropy": 0.6281116902828217,
"epoch": 2.708367181153534,
"grad_norm": 0.00924444105476141,
"learning_rate": 0.0002,
"loss": 0.6312050819396973,
"mean_token_accuracy": 0.7460011318325996,
"num_tokens": 15550739.0,
"step": 417
},
{
"entropy": 0.6233636066317558,
"epoch": 2.7148659626320066,
"grad_norm": 0.008710985071957111,
"learning_rate": 0.0002,
"loss": 0.6260718107223511,
"mean_token_accuracy": 0.744461327791214,
"num_tokens": 15587950.0,
"step": 418
},
{
"entropy": 0.6195387095212936,
"epoch": 2.7213647441104794,
"grad_norm": 0.007183417212218046,
"learning_rate": 0.0002,
"loss": 0.6212611198425293,
"mean_token_accuracy": 0.746867798268795,
"num_tokens": 15625008.0,
"step": 419
},
{
"entropy": 0.6109424605965614,
"epoch": 2.727863525588952,
"grad_norm": 0.0077791716903448105,
"learning_rate": 0.0002,
"loss": 0.6113884449005127,
"mean_token_accuracy": 0.7505641579627991,
"num_tokens": 15662159.0,
"step": 420
},
{
"entropy": 0.6187275499105453,
"epoch": 2.734362307067425,
"grad_norm": 0.008177550509572029,
"learning_rate": 0.0002,
"loss": 0.6187748908996582,
"mean_token_accuracy": 0.7493242397904396,
"num_tokens": 15699404.0,
"step": 421
},
{
"entropy": 0.6269592270255089,
"epoch": 2.7408610885458975,
"grad_norm": 0.00797547772526741,
"learning_rate": 0.0002,
"loss": 0.6266059875488281,
"mean_token_accuracy": 0.7470143884420395,
"num_tokens": 15736867.0,
"step": 422
},
{
"entropy": 0.6187637895345688,
"epoch": 2.74735987002437,
"grad_norm": 0.008009313605725765,
"learning_rate": 0.0002,
"loss": 0.6174246072769165,
"mean_token_accuracy": 0.748706616461277,
"num_tokens": 15774518.0,
"step": 423
},
{
"entropy": 0.6222201958298683,
"epoch": 2.7538586515028434,
"grad_norm": 0.00828398484736681,
"learning_rate": 0.0002,
"loss": 0.6254167556762695,
"mean_token_accuracy": 0.7451123148202896,
"num_tokens": 15811807.0,
"step": 424
},
{
"entropy": 0.6253098249435425,
"epoch": 2.760357432981316,
"grad_norm": 0.0075772651471197605,
"learning_rate": 0.0002,
"loss": 0.6270281076431274,
"mean_token_accuracy": 0.744781106710434,
"num_tokens": 15849715.0,
"step": 425
},
{
"entropy": 0.6165027767419815,
"epoch": 2.766856214459789,
"grad_norm": 0.00784947071224451,
"learning_rate": 0.0002,
"loss": 0.6173769235610962,
"mean_token_accuracy": 0.748318687081337,
"num_tokens": 15886927.0,
"step": 426
},
{
"entropy": 0.6187942251563072,
"epoch": 2.7733549959382615,
"grad_norm": 0.007960534654557705,
"learning_rate": 0.0002,
"loss": 0.6190329790115356,
"mean_token_accuracy": 0.7482394725084305,
"num_tokens": 15924820.0,
"step": 427
},
{
"entropy": 0.6049096137285233,
"epoch": 2.7798537774167342,
"grad_norm": 0.007044166326522827,
"learning_rate": 0.0002,
"loss": 0.608286440372467,
"mean_token_accuracy": 0.7529338300228119,
"num_tokens": 15962031.0,
"step": 428
},
{
"entropy": 0.6067706495523453,
"epoch": 2.7863525588952074,
"grad_norm": 0.008417103439569473,
"learning_rate": 0.0002,
"loss": 0.6071891188621521,
"mean_token_accuracy": 0.7529254406690598,
"num_tokens": 15999271.0,
"step": 429
},
{
"entropy": 0.608584851026535,
"epoch": 2.79285134037368,
"grad_norm": 0.0066911159083247185,
"learning_rate": 0.0002,
"loss": 0.6128258109092712,
"mean_token_accuracy": 0.7512886077165604,
"num_tokens": 16036782.0,
"step": 430
},
{
"entropy": 0.6173116937279701,
"epoch": 2.799350121852153,
"grad_norm": 0.007603482808917761,
"learning_rate": 0.0002,
"loss": 0.6212354898452759,
"mean_token_accuracy": 0.7506462633609772,
"num_tokens": 16074488.0,
"step": 431
},
{
"entropy": 0.612823948264122,
"epoch": 2.8058489033306255,
"grad_norm": 0.008489524014294147,
"learning_rate": 0.0002,
"loss": 0.6168191432952881,
"mean_token_accuracy": 0.7491662427783012,
"num_tokens": 16112183.0,
"step": 432
},
{
"entropy": 0.6224610134959221,
"epoch": 2.8123476848090982,
"grad_norm": 0.0072684078477323055,
"learning_rate": 0.0002,
"loss": 0.6210014820098877,
"mean_token_accuracy": 0.7473989799618721,
"num_tokens": 16149570.0,
"step": 433
},
{
"entropy": 0.6252987831830978,
"epoch": 2.818846466287571,
"grad_norm": 0.008009562268853188,
"learning_rate": 0.0002,
"loss": 0.6273704171180725,
"mean_token_accuracy": 0.7445142269134521,
"num_tokens": 16187156.0,
"step": 434
},
{
"entropy": 0.6278671100735664,
"epoch": 2.8253452477660437,
"grad_norm": 0.007072070613503456,
"learning_rate": 0.0002,
"loss": 0.6284614205360413,
"mean_token_accuracy": 0.743632547557354,
"num_tokens": 16224612.0,
"step": 435
},
{
"entropy": 0.619408093392849,
"epoch": 2.8318440292445164,
"grad_norm": 0.007810318376868963,
"learning_rate": 0.0002,
"loss": 0.6186745166778564,
"mean_token_accuracy": 0.7505189552903175,
"num_tokens": 16261848.0,
"step": 436
},
{
"entropy": 0.617984876036644,
"epoch": 2.8383428107229896,
"grad_norm": 0.007404230069369078,
"learning_rate": 0.0002,
"loss": 0.6218393445014954,
"mean_token_accuracy": 0.746470145881176,
"num_tokens": 16299536.0,
"step": 437
},
{
"entropy": 0.6115261316299438,
"epoch": 2.8448415922014623,
"grad_norm": 0.007786816451698542,
"learning_rate": 0.0002,
"loss": 0.6147224307060242,
"mean_token_accuracy": 0.7512907087802887,
"num_tokens": 16336727.0,
"step": 438
},
{
"entropy": 0.610576219856739,
"epoch": 2.851340373679935,
"grad_norm": 0.007572745438665152,
"learning_rate": 0.0002,
"loss": 0.6138074994087219,
"mean_token_accuracy": 0.7504170089960098,
"num_tokens": 16374001.0,
"step": 439
},
{
"entropy": 0.6278978139162064,
"epoch": 2.8578391551584077,
"grad_norm": 0.007563670165836811,
"learning_rate": 0.0002,
"loss": 0.6268113851547241,
"mean_token_accuracy": 0.7438701540231705,
"num_tokens": 16411469.0,
"step": 440
},
{
"entropy": 0.6234687641263008,
"epoch": 2.864337936636881,
"grad_norm": 0.007766201626509428,
"learning_rate": 0.0002,
"loss": 0.6241582632064819,
"mean_token_accuracy": 0.7458857893943787,
"num_tokens": 16449061.0,
"step": 441
},
{
"entropy": 0.6170031577348709,
"epoch": 2.8708367181153536,
"grad_norm": 0.0072515420615673065,
"learning_rate": 0.0002,
"loss": 0.6164381504058838,
"mean_token_accuracy": 0.7487066686153412,
"num_tokens": 16486116.0,
"step": 442
},
{
"entropy": 0.6071048676967621,
"epoch": 2.8773354995938263,
"grad_norm": 0.007729642558842897,
"learning_rate": 0.0002,
"loss": 0.6061218976974487,
"mean_token_accuracy": 0.7546169012784958,
"num_tokens": 16523581.0,
"step": 443
},
{
"entropy": 0.6005209162831306,
"epoch": 2.883834281072299,
"grad_norm": 0.009296285919845104,
"learning_rate": 0.0002,
"loss": 0.608015775680542,
"mean_token_accuracy": 0.7522506862878799,
"num_tokens": 16560766.0,
"step": 444
},
{
"entropy": 0.6114199981093407,
"epoch": 2.8903330625507717,
"grad_norm": 0.009450486861169338,
"learning_rate": 0.0002,
"loss": 0.61246258020401,
"mean_token_accuracy": 0.7513059675693512,
"num_tokens": 16597924.0,
"step": 445
},
{
"entropy": 0.6163241118192673,
"epoch": 2.8968318440292444,
"grad_norm": 0.007840070873498917,
"learning_rate": 0.0002,
"loss": 0.6163046360015869,
"mean_token_accuracy": 0.7482790276408195,
"num_tokens": 16635707.0,
"step": 446
},
{
"entropy": 0.6230868250131607,
"epoch": 2.903330625507717,
"grad_norm": 0.00791420228779316,
"learning_rate": 0.0002,
"loss": 0.627612829208374,
"mean_token_accuracy": 0.7418907359242439,
"num_tokens": 16673272.0,
"step": 447
},
{
"entropy": 0.6148254349827766,
"epoch": 2.90982940698619,
"grad_norm": 0.008231899701058865,
"learning_rate": 0.0002,
"loss": 0.615432620048523,
"mean_token_accuracy": 0.74872937053442,
"num_tokens": 16710307.0,
"step": 448
},
{
"entropy": 0.6145784482359886,
"epoch": 2.916328188464663,
"grad_norm": 0.008206733502447605,
"learning_rate": 0.0002,
"loss": 0.6162281036376953,
"mean_token_accuracy": 0.7497396990656853,
"num_tokens": 16747541.0,
"step": 449
},
{
"entropy": 0.6129453554749489,
"epoch": 2.9228269699431357,
"grad_norm": 0.008618887513875961,
"learning_rate": 0.0002,
"loss": 0.6113362312316895,
"mean_token_accuracy": 0.7538808137178421,
"num_tokens": 16784808.0,
"step": 450
},
{
"entropy": 0.6318705305457115,
"epoch": 2.9293257514216084,
"grad_norm": 0.00894182175397873,
"learning_rate": 0.0002,
"loss": 0.6285560131072998,
"mean_token_accuracy": 0.7439467459917068,
"num_tokens": 16822571.0,
"step": 451
},
{
"entropy": 0.6192348748445511,
"epoch": 2.935824532900081,
"grad_norm": 0.0075249881483614445,
"learning_rate": 0.0002,
"loss": 0.6225606203079224,
"mean_token_accuracy": 0.7450770661234856,
"num_tokens": 16860236.0,
"step": 452
},
{
"entropy": 0.6156643033027649,
"epoch": 2.942323314378554,
"grad_norm": 0.008608740754425526,
"learning_rate": 0.0002,
"loss": 0.6196963787078857,
"mean_token_accuracy": 0.7487252280116081,
"num_tokens": 16897505.0,
"step": 453
},
{
"entropy": 0.6020097509026527,
"epoch": 2.948822095857027,
"grad_norm": 0.008554862812161446,
"learning_rate": 0.0002,
"loss": 0.6057189702987671,
"mean_token_accuracy": 0.7535376027226448,
"num_tokens": 16934723.0,
"step": 454
},
{
"entropy": 0.6096286401152611,
"epoch": 2.9553208773354998,
"grad_norm": 0.008194280788302422,
"learning_rate": 0.0002,
"loss": 0.6100919842720032,
"mean_token_accuracy": 0.7543619722127914,
"num_tokens": 16972160.0,
"step": 455
},
{
"entropy": 0.6101824045181274,
"epoch": 2.9618196588139725,
"grad_norm": 0.008089696057140827,
"learning_rate": 0.0002,
"loss": 0.6100078225135803,
"mean_token_accuracy": 0.7519838437438011,
"num_tokens": 17009553.0,
"step": 456
},
{
"entropy": 0.6134164482355118,
"epoch": 2.968318440292445,
"grad_norm": 0.008095222525298595,
"learning_rate": 0.0002,
"loss": 0.61534583568573,
"mean_token_accuracy": 0.7492899596691132,
"num_tokens": 17046859.0,
"step": 457
},
{
"entropy": 0.6219535619020462,
"epoch": 2.974817221770918,
"grad_norm": 0.008277404122054577,
"learning_rate": 0.0002,
"loss": 0.6226615905761719,
"mean_token_accuracy": 0.7486208230257034,
"num_tokens": 17083891.0,
"step": 458
},
{
"entropy": 0.6230077967047691,
"epoch": 2.9813160032493906,
"grad_norm": 0.007576305419206619,
"learning_rate": 0.0002,
"loss": 0.6215830445289612,
"mean_token_accuracy": 0.7478786036372185,
"num_tokens": 17121415.0,
"step": 459
},
{
"entropy": 0.6288741081953049,
"epoch": 2.9878147847278633,
"grad_norm": 0.007517755497246981,
"learning_rate": 0.0002,
"loss": 0.6266385912895203,
"mean_token_accuracy": 0.7459503784775734,
"num_tokens": 17159316.0,
"step": 460
},
{
"entropy": 0.6128450557589531,
"epoch": 2.994313566206336,
"grad_norm": 0.0082389609888196,
"learning_rate": 0.0002,
"loss": 0.6180654764175415,
"mean_token_accuracy": 0.7501172721385956,
"num_tokens": 17196686.0,
"step": 461
},
{
"entropy": 0.6104621972356524,
"epoch": 3.0,
"grad_norm": 0.009389652870595455,
"learning_rate": 0.0002,
"loss": 0.6207214593887329,
"mean_token_accuracy": 0.7534014242036002,
"num_tokens": 17212985.0,
"step": 462
},
{
"entropy": 0.6010295078158379,
"epoch": 3.0064987814784727,
"grad_norm": 0.007540151942521334,
"learning_rate": 0.0002,
"loss": 0.604315996170044,
"mean_token_accuracy": 0.7545758932828903,
"num_tokens": 17250548.0,
"step": 463
},
{
"entropy": 0.6099191755056381,
"epoch": 3.0129975629569454,
"grad_norm": 0.007964324206113815,
"learning_rate": 0.0002,
"loss": 0.6118016839027405,
"mean_token_accuracy": 0.7505887746810913,
"num_tokens": 17288088.0,
"step": 464
},
{
"entropy": 0.6099814623594284,
"epoch": 3.019496344435418,
"grad_norm": 0.009010368958115578,
"learning_rate": 0.0002,
"loss": 0.6133589744567871,
"mean_token_accuracy": 0.7495384216308594,
"num_tokens": 17325896.0,
"step": 465
},
{
"entropy": 0.6108173504471779,
"epoch": 3.0259951259138913,
"grad_norm": 0.008082750253379345,
"learning_rate": 0.0002,
"loss": 0.6106899380683899,
"mean_token_accuracy": 0.7496122866868973,
"num_tokens": 17363618.0,
"step": 466
},
{
"entropy": 0.6203465834259987,
"epoch": 3.032493907392364,
"grad_norm": 0.00794974435120821,
"learning_rate": 0.0002,
"loss": 0.62054044008255,
"mean_token_accuracy": 0.7457421347498894,
"num_tokens": 17401213.0,
"step": 467
},
{
"entropy": 0.6201630383729935,
"epoch": 3.0389926888708367,
"grad_norm": 0.00949027854949236,
"learning_rate": 0.0002,
"loss": 0.6232575178146362,
"mean_token_accuracy": 0.746864065527916,
"num_tokens": 17438437.0,
"step": 468
},
{
"entropy": 0.6282624080777168,
"epoch": 3.0454914703493094,
"grad_norm": 0.007857941091060638,
"learning_rate": 0.0002,
"loss": 0.6256210207939148,
"mean_token_accuracy": 0.7441679313778877,
"num_tokens": 17476273.0,
"step": 469
},
{
"entropy": 0.6105262786149979,
"epoch": 3.051990251827782,
"grad_norm": 0.008467303588986397,
"learning_rate": 0.0002,
"loss": 0.6100492477416992,
"mean_token_accuracy": 0.7501196339726448,
"num_tokens": 17513496.0,
"step": 470
},
{
"entropy": 0.6016805246472359,
"epoch": 3.058489033306255,
"grad_norm": 0.009371851570904255,
"learning_rate": 0.0002,
"loss": 0.604375958442688,
"mean_token_accuracy": 0.7524744868278503,
"num_tokens": 17551200.0,
"step": 471
},
{
"entropy": 0.6073808148503304,
"epoch": 3.064987814784728,
"grad_norm": 0.008492433466017246,
"learning_rate": 0.0002,
"loss": 0.6094343662261963,
"mean_token_accuracy": 0.752588301897049,
"num_tokens": 17588356.0,
"step": 472
},
{
"entropy": 0.6179896369576454,
"epoch": 3.0714865962632008,
"grad_norm": 0.008540020324289799,
"learning_rate": 0.0002,
"loss": 0.6210522055625916,
"mean_token_accuracy": 0.7460785582661629,
"num_tokens": 17625982.0,
"step": 473
},
{
"entropy": 0.6018861308693886,
"epoch": 3.0779853777416735,
"grad_norm": 0.008742019534111023,
"learning_rate": 0.0002,
"loss": 0.6078682541847229,
"mean_token_accuracy": 0.7513778060674667,
"num_tokens": 17663418.0,
"step": 474
},
{
"entropy": 0.633279986679554,
"epoch": 3.084484159220146,
"grad_norm": 0.0082003865391016,
"learning_rate": 0.0002,
"loss": 0.6310751438140869,
"mean_token_accuracy": 0.7428691610693932,
"num_tokens": 17700640.0,
"step": 475
},
{
"entropy": 0.6102183759212494,
"epoch": 3.090982940698619,
"grad_norm": 0.008503621444106102,
"learning_rate": 0.0002,
"loss": 0.6114936470985413,
"mean_token_accuracy": 0.7529326751828194,
"num_tokens": 17738330.0,
"step": 476
},
{
"entropy": 0.6162742525339127,
"epoch": 3.0974817221770916,
"grad_norm": 0.008936957456171513,
"learning_rate": 0.0002,
"loss": 0.6209756135940552,
"mean_token_accuracy": 0.7465755268931389,
"num_tokens": 17775715.0,
"step": 477
},
{
"entropy": 0.6141496077179909,
"epoch": 3.1039805036555648,
"grad_norm": 0.009372946806252003,
"learning_rate": 0.0002,
"loss": 0.617496132850647,
"mean_token_accuracy": 0.7488722130656242,
"num_tokens": 17813252.0,
"step": 478
},
{
"entropy": 0.6128992438316345,
"epoch": 3.1104792851340375,
"grad_norm": 0.009246407076716423,
"learning_rate": 0.0002,
"loss": 0.6153603792190552,
"mean_token_accuracy": 0.7489981204271317,
"num_tokens": 17850593.0,
"step": 479
},
{
"entropy": 0.6109244301915169,
"epoch": 3.11697806661251,
"grad_norm": 0.008360042236745358,
"learning_rate": 0.0002,
"loss": 0.6110379099845886,
"mean_token_accuracy": 0.7517814785242081,
"num_tokens": 17887433.0,
"step": 480
},
{
"entropy": 0.6216762438416481,
"epoch": 3.123476848090983,
"grad_norm": 0.008575825951993465,
"learning_rate": 0.0002,
"loss": 0.6188209652900696,
"mean_token_accuracy": 0.7479925602674484,
"num_tokens": 17924477.0,
"step": 481
},
{
"entropy": 0.617570586502552,
"epoch": 3.1299756295694556,
"grad_norm": 0.00846293568611145,
"learning_rate": 0.0002,
"loss": 0.6159199476242065,
"mean_token_accuracy": 0.7518654763698578,
"num_tokens": 17961735.0,
"step": 482
},
{
"entropy": 0.591516949236393,
"epoch": 3.1364744110479283,
"grad_norm": 0.009447102434933186,
"learning_rate": 0.0002,
"loss": 0.5986469984054565,
"mean_token_accuracy": 0.7579966932535172,
"num_tokens": 17998853.0,
"step": 483
},
{
"entropy": 0.6149769946932793,
"epoch": 3.1429731925264015,
"grad_norm": 0.010652805678546429,
"learning_rate": 0.0002,
"loss": 0.62315833568573,
"mean_token_accuracy": 0.7443839907646179,
"num_tokens": 18036498.0,
"step": 484
},
{
"entropy": 0.6224213317036629,
"epoch": 3.149471974004874,
"grad_norm": 0.008841714821755886,
"learning_rate": 0.0002,
"loss": 0.6213138103485107,
"mean_token_accuracy": 0.7460580617189407,
"num_tokens": 18073792.0,
"step": 485
},
{
"entropy": 0.624303974211216,
"epoch": 3.155970755483347,
"grad_norm": 0.008476318791508675,
"learning_rate": 0.0002,
"loss": 0.6206566691398621,
"mean_token_accuracy": 0.7465843260288239,
"num_tokens": 18110931.0,
"step": 486
},
{
"entropy": 0.6057487353682518,
"epoch": 3.1624695369618196,
"grad_norm": 0.007340795826166868,
"learning_rate": 0.0002,
"loss": 0.6085374355316162,
"mean_token_accuracy": 0.7520734146237373,
"num_tokens": 18148230.0,
"step": 487
},
{
"entropy": 0.5987089648842812,
"epoch": 3.1689683184402924,
"grad_norm": 0.008576547726988792,
"learning_rate": 0.0002,
"loss": 0.5994081497192383,
"mean_token_accuracy": 0.7560673728585243,
"num_tokens": 18185429.0,
"step": 488
},
{
"entropy": 0.6201451569795609,
"epoch": 3.175467099918765,
"grad_norm": 0.009309273213148117,
"learning_rate": 0.0002,
"loss": 0.6250134706497192,
"mean_token_accuracy": 0.7440272644162178,
"num_tokens": 18222845.0,
"step": 489
},
{
"entropy": 0.6149864792823792,
"epoch": 3.181965881397238,
"grad_norm": 0.00817920919507742,
"learning_rate": 0.0002,
"loss": 0.6165604591369629,
"mean_token_accuracy": 0.7469800040125847,
"num_tokens": 18260522.0,
"step": 490
},
{
"entropy": 0.6081833988428116,
"epoch": 3.188464662875711,
"grad_norm": 0.008727415464818478,
"learning_rate": 0.0002,
"loss": 0.6095278263092041,
"mean_token_accuracy": 0.7511461302638054,
"num_tokens": 18298119.0,
"step": 491
},
{
"entropy": 0.6011826619505882,
"epoch": 3.1949634443541837,
"grad_norm": 0.008403414860367775,
"learning_rate": 0.0002,
"loss": 0.6023063659667969,
"mean_token_accuracy": 0.7541341111063957,
"num_tokens": 18335516.0,
"step": 492
},
{
"entropy": 0.614462248980999,
"epoch": 3.2014622258326564,
"grad_norm": 0.008592899888753891,
"learning_rate": 0.0002,
"loss": 0.611116886138916,
"mean_token_accuracy": 0.7512200325727463,
"num_tokens": 18373224.0,
"step": 493
},
{
"entropy": 0.6118571162223816,
"epoch": 3.207961007311129,
"grad_norm": 0.008299244567751884,
"learning_rate": 0.0002,
"loss": 0.6136075258255005,
"mean_token_accuracy": 0.749468058347702,
"num_tokens": 18410845.0,
"step": 494
},
{
"entropy": 0.6049928665161133,
"epoch": 3.214459788789602,
"grad_norm": 0.010410244576632977,
"learning_rate": 0.0002,
"loss": 0.6083844304084778,
"mean_token_accuracy": 0.751271091401577,
"num_tokens": 18448238.0,
"step": 495
},
{
"entropy": 0.6233940199017525,
"epoch": 3.2209585702680745,
"grad_norm": 0.009204378351569176,
"learning_rate": 0.0002,
"loss": 0.6272657513618469,
"mean_token_accuracy": 0.7432866543531418,
"num_tokens": 18486015.0,
"step": 496
},
{
"entropy": 0.6218753755092621,
"epoch": 3.2274573517465477,
"grad_norm": 0.00954593438655138,
"learning_rate": 0.0002,
"loss": 0.6218851208686829,
"mean_token_accuracy": 0.7457900047302246,
"num_tokens": 18523424.0,
"step": 497
},
{
"entropy": 0.6145913749933243,
"epoch": 3.2339561332250204,
"grad_norm": 0.009425587020814419,
"learning_rate": 0.0002,
"loss": 0.6123300194740295,
"mean_token_accuracy": 0.7488762065768242,
"num_tokens": 18560844.0,
"step": 498
},
{
"entropy": 0.6112263351678848,
"epoch": 3.240454914703493,
"grad_norm": 0.009846451692283154,
"learning_rate": 0.0002,
"loss": 0.6109277606010437,
"mean_token_accuracy": 0.7503840625286102,
"num_tokens": 18598457.0,
"step": 499
},
{
"entropy": 0.6025180518627167,
"epoch": 3.246953696181966,
"grad_norm": 0.00901762768626213,
"learning_rate": 0.0002,
"loss": 0.6064941883087158,
"mean_token_accuracy": 0.7513880282640457,
"num_tokens": 18635799.0,
"step": 500
},
{
"entropy": 0.6062363162636757,
"epoch": 3.2534524776604385,
"grad_norm": 0.008631935343146324,
"learning_rate": 0.0002,
"loss": 0.610137939453125,
"mean_token_accuracy": 0.751276396214962,
"num_tokens": 18673367.0,
"step": 501
},
{
"entropy": 0.6029994338750839,
"epoch": 3.2599512591389113,
"grad_norm": 0.008083198219537735,
"learning_rate": 0.0002,
"loss": 0.605480968952179,
"mean_token_accuracy": 0.7522158473730087,
"num_tokens": 18710845.0,
"step": 502
},
{
"entropy": 0.6004190221428871,
"epoch": 3.2664500406173844,
"grad_norm": 0.009547607973217964,
"learning_rate": 0.0002,
"loss": 0.5966814756393433,
"mean_token_accuracy": 0.7567247301340103,
"num_tokens": 18748254.0,
"step": 503
},
{
"entropy": 0.6217415705323219,
"epoch": 3.272948822095857,
"grad_norm": 0.008327828720211983,
"learning_rate": 0.0002,
"loss": 0.6205904483795166,
"mean_token_accuracy": 0.746347539126873,
"num_tokens": 18785876.0,
"step": 504
},
{
"entropy": 0.6177750676870346,
"epoch": 3.27944760357433,
"grad_norm": 0.008332877419888973,
"learning_rate": 0.0002,
"loss": 0.6175146102905273,
"mean_token_accuracy": 0.7480292990803719,
"num_tokens": 18823559.0,
"step": 505
},
{
"entropy": 0.6048281341791153,
"epoch": 3.2859463850528026,
"grad_norm": 0.010307500138878822,
"learning_rate": 0.0002,
"loss": 0.608547568321228,
"mean_token_accuracy": 0.7522715479135513,
"num_tokens": 18860761.0,
"step": 506
},
{
"entropy": 0.6015286520123482,
"epoch": 3.2924451665312753,
"grad_norm": 0.008793864399194717,
"learning_rate": 0.0002,
"loss": 0.6076687574386597,
"mean_token_accuracy": 0.7535560503602028,
"num_tokens": 18898017.0,
"step": 507
},
{
"entropy": 0.6203228533267975,
"epoch": 3.298943948009748,
"grad_norm": 0.008433851413428783,
"learning_rate": 0.0002,
"loss": 0.627921462059021,
"mean_token_accuracy": 0.743441991508007,
"num_tokens": 18935451.0,
"step": 508
},
{
"entropy": 0.61593446880579,
"epoch": 3.305442729488221,
"grad_norm": 0.00970753189176321,
"learning_rate": 0.0002,
"loss": 0.617050290107727,
"mean_token_accuracy": 0.7470974624156952,
"num_tokens": 18972874.0,
"step": 509
},
{
"entropy": 0.6080862656235695,
"epoch": 3.311941510966694,
"grad_norm": 0.008601192384958267,
"learning_rate": 0.0002,
"loss": 0.613648533821106,
"mean_token_accuracy": 0.7485402300953865,
"num_tokens": 19010386.0,
"step": 510
},
{
"entropy": 0.6165401563048363,
"epoch": 3.3184402924451666,
"grad_norm": 0.009453460574150085,
"learning_rate": 0.0002,
"loss": 0.6146738529205322,
"mean_token_accuracy": 0.7489698827266693,
"num_tokens": 19048086.0,
"step": 511
},
{
"entropy": 0.6097732856869698,
"epoch": 3.3249390739236393,
"grad_norm": 0.008702411316335201,
"learning_rate": 0.0002,
"loss": 0.6121372580528259,
"mean_token_accuracy": 0.7501634210348129,
"num_tokens": 19085297.0,
"step": 512
},
{
"entropy": 0.6050214320421219,
"epoch": 3.331437855402112,
"grad_norm": 0.008775223046541214,
"learning_rate": 0.0002,
"loss": 0.6089086532592773,
"mean_token_accuracy": 0.7513034492731094,
"num_tokens": 19122838.0,
"step": 513
},
{
"entropy": 0.6079926937818527,
"epoch": 3.3379366368805847,
"grad_norm": 0.009299266152083874,
"learning_rate": 0.0002,
"loss": 0.6124639511108398,
"mean_token_accuracy": 0.751487672328949,
"num_tokens": 19160495.0,
"step": 514
},
{
"entropy": 0.6141983196139336,
"epoch": 3.3444354183590574,
"grad_norm": 0.00953013077378273,
"learning_rate": 0.0002,
"loss": 0.614948570728302,
"mean_token_accuracy": 0.7482777014374733,
"num_tokens": 19197772.0,
"step": 515
},
{
"entropy": 0.6166125014424324,
"epoch": 3.3509341998375306,
"grad_norm": 0.01042372826486826,
"learning_rate": 0.0002,
"loss": 0.6166562438011169,
"mean_token_accuracy": 0.7489292994141579,
"num_tokens": 19235537.0,
"step": 516
},
{
"entropy": 0.6107529476284981,
"epoch": 3.3574329813160033,
"grad_norm": 0.009182547219097614,
"learning_rate": 0.0002,
"loss": 0.6094313263893127,
"mean_token_accuracy": 0.75286765396595,
"num_tokens": 19272557.0,
"step": 517
},
{
"entropy": 0.5976028516888618,
"epoch": 3.363931762794476,
"grad_norm": 0.00928069930523634,
"learning_rate": 0.0002,
"loss": 0.6000387668609619,
"mean_token_accuracy": 0.7556054145097733,
"num_tokens": 19309498.0,
"step": 518
},
{
"entropy": 0.6023745760321617,
"epoch": 3.3704305442729487,
"grad_norm": 0.008411030285060406,
"learning_rate": 0.0002,
"loss": 0.6067807674407959,
"mean_token_accuracy": 0.7529009878635406,
"num_tokens": 19346735.0,
"step": 519
},
{
"entropy": 0.6122680082917213,
"epoch": 3.3769293257514215,
"grad_norm": 0.008953915908932686,
"learning_rate": 0.0002,
"loss": 0.6159105896949768,
"mean_token_accuracy": 0.7494169026613235,
"num_tokens": 19384153.0,
"step": 520
},
{
"entropy": 0.6186133921146393,
"epoch": 3.3834281072298946,
"grad_norm": 0.008217048831284046,
"learning_rate": 0.0002,
"loss": 0.6203353404998779,
"mean_token_accuracy": 0.7473497167229652,
"num_tokens": 19421655.0,
"step": 521
},
{
"entropy": 0.6094240248203278,
"epoch": 3.3899268887083673,
"grad_norm": 0.00980299897491932,
"learning_rate": 0.0002,
"loss": 0.6119738221168518,
"mean_token_accuracy": 0.7499380633234978,
"num_tokens": 19458894.0,
"step": 522
},
{
"entropy": 0.6254991963505745,
"epoch": 3.39642567018684,
"grad_norm": 0.008415239863097668,
"learning_rate": 0.0002,
"loss": 0.623593807220459,
"mean_token_accuracy": 0.7472219467163086,
"num_tokens": 19496818.0,
"step": 523
},
{
"entropy": 0.6295105367898941,
"epoch": 3.4029244516653128,
"grad_norm": 0.009312564507126808,
"learning_rate": 0.0002,
"loss": 0.6262437105178833,
"mean_token_accuracy": 0.7448465451598167,
"num_tokens": 19534274.0,
"step": 524
},
{
"entropy": 0.6126851290464401,
"epoch": 3.4094232331437855,
"grad_norm": 0.00861976109445095,
"learning_rate": 0.0002,
"loss": 0.6097316145896912,
"mean_token_accuracy": 0.7525606751441956,
"num_tokens": 19571856.0,
"step": 525
},
{
"entropy": 0.6135350093245506,
"epoch": 3.415922014622258,
"grad_norm": 0.008309995755553246,
"learning_rate": 0.0002,
"loss": 0.6160346269607544,
"mean_token_accuracy": 0.7493128851056099,
"num_tokens": 19609319.0,
"step": 526
},
{
"entropy": 0.6100683584809303,
"epoch": 3.422420796100731,
"grad_norm": 0.011379679664969444,
"learning_rate": 0.0002,
"loss": 0.6197912096977234,
"mean_token_accuracy": 0.7495440766215324,
"num_tokens": 19647036.0,
"step": 527
},
{
"entropy": 0.6129766032099724,
"epoch": 3.428919577579204,
"grad_norm": 0.00879785604774952,
"learning_rate": 0.0002,
"loss": 0.6192106008529663,
"mean_token_accuracy": 0.7462450638413429,
"num_tokens": 19684528.0,
"step": 528
},
{
"entropy": 0.6183054521679878,
"epoch": 3.435418359057677,
"grad_norm": 0.009570072405040264,
"learning_rate": 0.0002,
"loss": 0.61530601978302,
"mean_token_accuracy": 0.7494653314352036,
"num_tokens": 19721829.0,
"step": 529
},
{
"entropy": 0.6237875148653984,
"epoch": 3.4419171405361495,
"grad_norm": 0.009924475103616714,
"learning_rate": 0.0002,
"loss": 0.620090126991272,
"mean_token_accuracy": 0.7470209151506424,
"num_tokens": 19759470.0,
"step": 530
},
{
"entropy": 0.6056384146213531,
"epoch": 3.448415922014622,
"grad_norm": 0.008861211128532887,
"learning_rate": 0.0002,
"loss": 0.6051967144012451,
"mean_token_accuracy": 0.7524856179952621,
"num_tokens": 19797055.0,
"step": 531
},
{
"entropy": 0.6045270711183548,
"epoch": 3.454914703493095,
"grad_norm": 0.009311981499195099,
"learning_rate": 0.0002,
"loss": 0.6111881136894226,
"mean_token_accuracy": 0.7494307532906532,
"num_tokens": 19834144.0,
"step": 532
},
{
"entropy": 0.6097549796104431,
"epoch": 3.4614134849715676,
"grad_norm": 0.010919635184109211,
"learning_rate": 0.0002,
"loss": 0.6160416007041931,
"mean_token_accuracy": 0.7504306137561798,
"num_tokens": 19871286.0,
"step": 533
},
{
"entropy": 0.6024704650044441,
"epoch": 3.467912266450041,
"grad_norm": 0.008416552096605301,
"learning_rate": 0.0002,
"loss": 0.6058158278465271,
"mean_token_accuracy": 0.7539756521582603,
"num_tokens": 19908849.0,
"step": 534
},
{
"entropy": 0.611225888133049,
"epoch": 3.4744110479285135,
"grad_norm": 0.008921737782657146,
"learning_rate": 0.0002,
"loss": 0.6157783269882202,
"mean_token_accuracy": 0.7485576719045639,
"num_tokens": 19945976.0,
"step": 535
},
{
"entropy": 0.5882637947797775,
"epoch": 3.4809098294069862,
"grad_norm": 0.009470734745264053,
"learning_rate": 0.0002,
"loss": 0.5855636596679688,
"mean_token_accuracy": 0.7615584507584572,
"num_tokens": 19983147.0,
"step": 536
},
{
"entropy": 0.607180692255497,
"epoch": 3.487408610885459,
"grad_norm": 0.00895584374666214,
"learning_rate": 0.0002,
"loss": 0.6034247875213623,
"mean_token_accuracy": 0.7542741522192955,
"num_tokens": 20020743.0,
"step": 537
},
{
"entropy": 0.6082776561379433,
"epoch": 3.4939073923639317,
"grad_norm": 0.00874309055507183,
"learning_rate": 0.0002,
"loss": 0.6111589074134827,
"mean_token_accuracy": 0.7497387602925301,
"num_tokens": 20058341.0,
"step": 538
},
{
"entropy": 0.6162533760070801,
"epoch": 3.5004061738424044,
"grad_norm": 0.009585198014974594,
"learning_rate": 0.0002,
"loss": 0.6244966387748718,
"mean_token_accuracy": 0.7475337833166122,
"num_tokens": 20095636.0,
"step": 539
},
{
"entropy": 0.6105955466628075,
"epoch": 3.506904955320877,
"grad_norm": 0.009461835958063602,
"learning_rate": 0.0002,
"loss": 0.6156846880912781,
"mean_token_accuracy": 0.7479056641459465,
"num_tokens": 20132551.0,
"step": 540
},
{
"entropy": 0.621313750743866,
"epoch": 3.5134037367993503,
"grad_norm": 0.008541502989828587,
"learning_rate": 0.0002,
"loss": 0.6199691295623779,
"mean_token_accuracy": 0.7473711222410202,
"num_tokens": 20169837.0,
"step": 541
},
{
"entropy": 0.6165328845381737,
"epoch": 3.519902518277823,
"grad_norm": 0.009770420379936695,
"learning_rate": 0.0002,
"loss": 0.6142412424087524,
"mean_token_accuracy": 0.7502679750323296,
"num_tokens": 20207307.0,
"step": 542
},
{
"entropy": 0.6032826527953148,
"epoch": 3.5264012997562957,
"grad_norm": 0.010346473194658756,
"learning_rate": 0.0002,
"loss": 0.6011192798614502,
"mean_token_accuracy": 0.754242517054081,
"num_tokens": 20244685.0,
"step": 543
},
{
"entropy": 0.6191048100590706,
"epoch": 3.5329000812347684,
"grad_norm": 0.008168449625372887,
"learning_rate": 0.0002,
"loss": 0.6207705736160278,
"mean_token_accuracy": 0.74729173630476,
"num_tokens": 20281823.0,
"step": 544
},
{
"entropy": 0.6121908649802208,
"epoch": 3.539398862713241,
"grad_norm": 0.007879077456891537,
"learning_rate": 0.0002,
"loss": 0.6121616363525391,
"mean_token_accuracy": 0.7506422027945518,
"num_tokens": 20319307.0,
"step": 545
},
{
"entropy": 0.6186290234327316,
"epoch": 3.5458976441917143,
"grad_norm": 0.00905434787273407,
"learning_rate": 0.0002,
"loss": 0.6185810565948486,
"mean_token_accuracy": 0.7475248873233795,
"num_tokens": 20356848.0,
"step": 546
},
{
"entropy": 0.6139393672347069,
"epoch": 3.552396425670187,
"grad_norm": 0.008824498392641544,
"learning_rate": 0.0002,
"loss": 0.6151487827301025,
"mean_token_accuracy": 0.7489016950130463,
"num_tokens": 20394203.0,
"step": 547
},
{
"entropy": 0.6207469254732132,
"epoch": 3.5588952071486597,
"grad_norm": 0.008396871387958527,
"learning_rate": 0.0002,
"loss": 0.6218851804733276,
"mean_token_accuracy": 0.7459322214126587,
"num_tokens": 20431870.0,
"step": 548
},
{
"entropy": 0.62169548869133,
"epoch": 3.5653939886271324,
"grad_norm": 0.00874373223632574,
"learning_rate": 0.0002,
"loss": 0.6228454113006592,
"mean_token_accuracy": 0.749803364276886,
"num_tokens": 20469261.0,
"step": 549
},
{
"entropy": 0.6220152676105499,
"epoch": 3.571892770105605,
"grad_norm": 0.008933790028095245,
"learning_rate": 0.0002,
"loss": 0.6208291053771973,
"mean_token_accuracy": 0.7474985867738724,
"num_tokens": 20506396.0,
"step": 550
},
{
"entropy": 0.6153115481138229,
"epoch": 3.578391551584078,
"grad_norm": 0.008625194430351257,
"learning_rate": 0.0002,
"loss": 0.6176726818084717,
"mean_token_accuracy": 0.7483843564987183,
"num_tokens": 20543594.0,
"step": 551
},
{
"entropy": 0.6194273307919502,
"epoch": 3.5848903330625506,
"grad_norm": 0.009513880126178265,
"learning_rate": 0.0002,
"loss": 0.6259117126464844,
"mean_token_accuracy": 0.7455350533127785,
"num_tokens": 20580976.0,
"step": 552
},
{
"entropy": 0.6218870356678963,
"epoch": 3.5913891145410237,
"grad_norm": 0.010471499525010586,
"learning_rate": 0.0002,
"loss": 0.6255429983139038,
"mean_token_accuracy": 0.745422936975956,
"num_tokens": 20618155.0,
"step": 553
},
{
"entropy": 0.6044272035360336,
"epoch": 3.5978878960194964,
"grad_norm": 0.009206542745232582,
"learning_rate": 0.0002,
"loss": 0.6089117527008057,
"mean_token_accuracy": 0.7523582801222801,
"num_tokens": 20655356.0,
"step": 554
},
{
"entropy": 0.6034605354070663,
"epoch": 3.604386677497969,
"grad_norm": 0.01001272164285183,
"learning_rate": 0.0002,
"loss": 0.6080043315887451,
"mean_token_accuracy": 0.7542883977293968,
"num_tokens": 20692368.0,
"step": 555
},
{
"entropy": 0.6126068532466888,
"epoch": 3.610885458976442,
"grad_norm": 0.008411637507379055,
"learning_rate": 0.0002,
"loss": 0.6143564581871033,
"mean_token_accuracy": 0.7496707290410995,
"num_tokens": 20729532.0,
"step": 556
},
{
"entropy": 0.6092226430773735,
"epoch": 3.6173842404549146,
"grad_norm": 0.00788223184645176,
"learning_rate": 0.0002,
"loss": 0.6080750226974487,
"mean_token_accuracy": 0.7521450445055962,
"num_tokens": 20767316.0,
"step": 557
},
{
"entropy": 0.6103739887475967,
"epoch": 3.6238830219333877,
"grad_norm": 0.008947784081101418,
"learning_rate": 0.0002,
"loss": 0.6110090613365173,
"mean_token_accuracy": 0.751432754099369,
"num_tokens": 20804682.0,
"step": 558
},
{
"entropy": 0.6072618737816811,
"epoch": 3.6303818034118605,
"grad_norm": 0.008321145549416542,
"learning_rate": 0.0002,
"loss": 0.6072537899017334,
"mean_token_accuracy": 0.7519486770033836,
"num_tokens": 20842038.0,
"step": 559
},
{
"entropy": 0.614497110247612,
"epoch": 3.636880584890333,
"grad_norm": 0.009164758026599884,
"learning_rate": 0.0002,
"loss": 0.6098246574401855,
"mean_token_accuracy": 0.752671018242836,
"num_tokens": 20879197.0,
"step": 560
},
{
"entropy": 0.6094550266861916,
"epoch": 3.643379366368806,
"grad_norm": 0.007844182662665844,
"learning_rate": 0.0002,
"loss": 0.6068869829177856,
"mean_token_accuracy": 0.7533254846930504,
"num_tokens": 20916501.0,
"step": 561
},
{
"entropy": 0.6086015179753304,
"epoch": 3.6498781478472786,
"grad_norm": 0.008045290596783161,
"learning_rate": 0.0002,
"loss": 0.606809139251709,
"mean_token_accuracy": 0.7527647316455841,
"num_tokens": 20954134.0,
"step": 562
},
{
"entropy": 0.6285906434059143,
"epoch": 3.6563769293257513,
"grad_norm": 0.010104804299771786,
"learning_rate": 0.0002,
"loss": 0.6331174373626709,
"mean_token_accuracy": 0.7419461309909821,
"num_tokens": 20992017.0,
"step": 563
},
{
"entropy": 0.6020278707146645,
"epoch": 3.662875710804224,
"grad_norm": 0.01021239347755909,
"learning_rate": 0.0002,
"loss": 0.6128239035606384,
"mean_token_accuracy": 0.7514787241816521,
"num_tokens": 21029653.0,
"step": 564
},
{
"entropy": 0.6191821396350861,
"epoch": 3.6693744922826967,
"grad_norm": 0.009272433817386627,
"learning_rate": 0.0002,
"loss": 0.6228241324424744,
"mean_token_accuracy": 0.7464863955974579,
"num_tokens": 21067220.0,
"step": 565
},
{
"entropy": 0.6111209839582443,
"epoch": 3.67587327376117,
"grad_norm": 0.01010363083332777,
"learning_rate": 0.0002,
"loss": 0.6085663437843323,
"mean_token_accuracy": 0.7533030211925507,
"num_tokens": 21105021.0,
"step": 566
},
{
"entropy": 0.6244448721408844,
"epoch": 3.6823720552396426,
"grad_norm": 0.008229166269302368,
"learning_rate": 0.0002,
"loss": 0.6232364177703857,
"mean_token_accuracy": 0.7465489506721497,
"num_tokens": 21142672.0,
"step": 567
},
{
"entropy": 0.6002631187438965,
"epoch": 3.6888708367181153,
"grad_norm": 0.00970839336514473,
"learning_rate": 0.0002,
"loss": 0.6064876914024353,
"mean_token_accuracy": 0.7520908117294312,
"num_tokens": 21179768.0,
"step": 568
},
{
"entropy": 0.606594480574131,
"epoch": 3.695369618196588,
"grad_norm": 0.00952630303800106,
"learning_rate": 0.0002,
"loss": 0.6108591556549072,
"mean_token_accuracy": 0.751940131187439,
"num_tokens": 21217131.0,
"step": 569
},
{
"entropy": 0.6083743423223495,
"epoch": 3.7018683996750608,
"grad_norm": 0.008894224651157856,
"learning_rate": 0.0002,
"loss": 0.6050914525985718,
"mean_token_accuracy": 0.7556580603122711,
"num_tokens": 21254612.0,
"step": 570
},
{
"entropy": 0.6244188398122787,
"epoch": 3.708367181153534,
"grad_norm": 0.00945176463574171,
"learning_rate": 0.0002,
"loss": 0.6213344931602478,
"mean_token_accuracy": 0.7479386925697327,
"num_tokens": 21292008.0,
"step": 571
},
{
"entropy": 0.6202782392501831,
"epoch": 3.7148659626320066,
"grad_norm": 0.007808351423591375,
"learning_rate": 0.0002,
"loss": 0.618791937828064,
"mean_token_accuracy": 0.7479956671595573,
"num_tokens": 21329211.0,
"step": 572
},
{
"entropy": 0.6083357259631157,
"epoch": 3.7213647441104794,
"grad_norm": 0.009738109074532986,
"learning_rate": 0.0002,
"loss": 0.6082479953765869,
"mean_token_accuracy": 0.7511337921023369,
"num_tokens": 21366830.0,
"step": 573
},
{
"entropy": 0.6160146668553352,
"epoch": 3.727863525588952,
"grad_norm": 0.008708451874554157,
"learning_rate": 0.0002,
"loss": 0.6203808784484863,
"mean_token_accuracy": 0.749162532389164,
"num_tokens": 21404012.0,
"step": 574
},
{
"entropy": 0.6103571355342865,
"epoch": 3.734362307067425,
"grad_norm": 0.008490422740578651,
"learning_rate": 0.0002,
"loss": 0.6149444580078125,
"mean_token_accuracy": 0.7492819800972939,
"num_tokens": 21441418.0,
"step": 575
},
{
"entropy": 0.6097893342375755,
"epoch": 3.7408610885458975,
"grad_norm": 0.008159926161170006,
"learning_rate": 0.0002,
"loss": 0.6121622323989868,
"mean_token_accuracy": 0.7502710297703743,
"num_tokens": 21478959.0,
"step": 576
},
{
"entropy": 0.608406588435173,
"epoch": 3.74735987002437,
"grad_norm": 0.007408132776618004,
"learning_rate": 0.0002,
"loss": 0.6112476587295532,
"mean_token_accuracy": 0.7514019384980202,
"num_tokens": 21516469.0,
"step": 577
},
{
"entropy": 0.6059915721416473,
"epoch": 3.7538586515028434,
"grad_norm": 0.007707294542342424,
"learning_rate": 0.0002,
"loss": 0.6102927923202515,
"mean_token_accuracy": 0.7524895742535591,
"num_tokens": 21553955.0,
"step": 578
},
{
"entropy": 0.6110079139471054,
"epoch": 3.760357432981316,
"grad_norm": 0.008303117007017136,
"learning_rate": 0.0002,
"loss": 0.6116464734077454,
"mean_token_accuracy": 0.7515735402703285,
"num_tokens": 21591222.0,
"step": 579
},
{
"entropy": 0.6157199367880821,
"epoch": 3.766856214459789,
"grad_norm": 0.008788561448454857,
"learning_rate": 0.0002,
"loss": 0.6139419078826904,
"mean_token_accuracy": 0.7500691562891006,
"num_tokens": 21628586.0,
"step": 580
},
{
"entropy": 0.6189565733075142,
"epoch": 3.7733549959382615,
"grad_norm": 0.008861690759658813,
"learning_rate": 0.0002,
"loss": 0.6205735802650452,
"mean_token_accuracy": 0.7461571544408798,
"num_tokens": 21665902.0,
"step": 581
},
{
"entropy": 0.6169708073139191,
"epoch": 3.7798537774167342,
"grad_norm": 0.00858966913074255,
"learning_rate": 0.0002,
"loss": 0.616493284702301,
"mean_token_accuracy": 0.7478131875395775,
"num_tokens": 21703347.0,
"step": 582
},
{
"entropy": 0.6013945862650871,
"epoch": 3.7863525588952074,
"grad_norm": 0.007991503924131393,
"learning_rate": 0.0002,
"loss": 0.6024019718170166,
"mean_token_accuracy": 0.7541673332452774,
"num_tokens": 21740476.0,
"step": 583
},
{
"entropy": 0.6127390787005424,
"epoch": 3.79285134037368,
"grad_norm": 0.008759486488997936,
"learning_rate": 0.0002,
"loss": 0.6142678260803223,
"mean_token_accuracy": 0.7489368915557861,
"num_tokens": 21777903.0,
"step": 584
},
{
"entropy": 0.6033598631620407,
"epoch": 3.799350121852153,
"grad_norm": 0.008402034640312195,
"learning_rate": 0.0002,
"loss": 0.6062989234924316,
"mean_token_accuracy": 0.7526213079690933,
"num_tokens": 21815411.0,
"step": 585
},
{
"entropy": 0.6237991526722908,
"epoch": 3.8058489033306255,
"grad_norm": 0.008741356432437897,
"learning_rate": 0.0002,
"loss": 0.6236557960510254,
"mean_token_accuracy": 0.7458471432328224,
"num_tokens": 21852563.0,
"step": 586
},
{
"entropy": 0.6021682396531105,
"epoch": 3.8123476848090982,
"grad_norm": 0.009454802609980106,
"learning_rate": 0.0002,
"loss": 0.6056302785873413,
"mean_token_accuracy": 0.7534916624426842,
"num_tokens": 21889751.0,
"step": 587
},
{
"entropy": 0.6037532165646553,
"epoch": 3.818846466287571,
"grad_norm": 0.008019194938242435,
"learning_rate": 0.0002,
"loss": 0.6062440872192383,
"mean_token_accuracy": 0.75218416005373,
"num_tokens": 21927225.0,
"step": 588
},
{
"entropy": 0.6175741031765938,
"epoch": 3.8253452477660437,
"grad_norm": 0.010461182333528996,
"learning_rate": 0.0002,
"loss": 0.6219437122344971,
"mean_token_accuracy": 0.7449553832411766,
"num_tokens": 21964899.0,
"step": 589
},
{
"entropy": 0.6165783628821373,
"epoch": 3.8318440292445164,
"grad_norm": 0.007971042767167091,
"learning_rate": 0.0002,
"loss": 0.6164169311523438,
"mean_token_accuracy": 0.7500692084431648,
"num_tokens": 22001937.0,
"step": 590
},
{
"entropy": 0.6328809410333633,
"epoch": 3.8383428107229896,
"grad_norm": 0.019222697243094444,
"learning_rate": 0.0002,
"loss": 0.629861056804657,
"mean_token_accuracy": 0.7441875413060188,
"num_tokens": 22039681.0,
"step": 591
},
{
"entropy": 0.6060463637113571,
"epoch": 3.8448415922014623,
"grad_norm": 0.008333687670528889,
"learning_rate": 0.0002,
"loss": 0.6049051880836487,
"mean_token_accuracy": 0.7526820749044418,
"num_tokens": 22077083.0,
"step": 592
},
{
"entropy": 0.626244343817234,
"epoch": 3.851340373679935,
"grad_norm": 0.011930772103369236,
"learning_rate": 0.0002,
"loss": 0.6302248239517212,
"mean_token_accuracy": 0.7435696348547935,
"num_tokens": 22114449.0,
"step": 593
},
{
"entropy": 0.60886500030756,
"epoch": 3.8578391551584077,
"grad_norm": 0.00879514031112194,
"learning_rate": 0.0002,
"loss": 0.6156384944915771,
"mean_token_accuracy": 0.7500656992197037,
"num_tokens": 22151803.0,
"step": 594
},
{
"entropy": 0.6130397766828537,
"epoch": 3.864337936636881,
"grad_norm": 0.008800708688795567,
"learning_rate": 0.0002,
"loss": 0.6132546663284302,
"mean_token_accuracy": 0.7525083422660828,
"num_tokens": 22188933.0,
"step": 595
},
{
"entropy": 0.62311190366745,
"epoch": 3.8708367181153536,
"grad_norm": 0.0075268070213496685,
"learning_rate": 0.0002,
"loss": 0.624302864074707,
"mean_token_accuracy": 0.7459553778171539,
"num_tokens": 22226349.0,
"step": 596
},
{
"entropy": 0.6084966883063316,
"epoch": 3.8773354995938263,
"grad_norm": 0.008235939778387547,
"learning_rate": 0.0002,
"loss": 0.6065037250518799,
"mean_token_accuracy": 0.7519035413861275,
"num_tokens": 22263929.0,
"step": 597
},
{
"entropy": 0.599085658788681,
"epoch": 3.883834281072299,
"grad_norm": 0.008155166171491146,
"learning_rate": 0.0002,
"loss": 0.60195392370224,
"mean_token_accuracy": 0.7546913474798203,
"num_tokens": 22301001.0,
"step": 598
},
{
"entropy": 0.6163361445069313,
"epoch": 3.8903330625507717,
"grad_norm": 0.009046819061040878,
"learning_rate": 0.0002,
"loss": 0.6153905987739563,
"mean_token_accuracy": 0.7495288848876953,
"num_tokens": 22338602.0,
"step": 599
},
{
"entropy": 0.612362690269947,
"epoch": 3.8968318440292444,
"grad_norm": 0.008970526047050953,
"learning_rate": 0.0002,
"loss": 0.6125571131706238,
"mean_token_accuracy": 0.7503594160079956,
"num_tokens": 22375832.0,
"step": 600
},
{
"entropy": 0.5970166251063347,
"epoch": 3.903330625507717,
"grad_norm": 0.010594755411148071,
"learning_rate": 0.0002,
"loss": 0.6027450561523438,
"mean_token_accuracy": 0.7523306459188461,
"num_tokens": 22412582.0,
"step": 601
},
{
"entropy": 0.6120518818497658,
"epoch": 3.90982940698619,
"grad_norm": 0.008573422208428383,
"learning_rate": 0.0002,
"loss": 0.619284451007843,
"mean_token_accuracy": 0.7469367831945419,
"num_tokens": 22449548.0,
"step": 602
},
{
"entropy": 0.6074809059500694,
"epoch": 3.916328188464663,
"grad_norm": 0.008411690592765808,
"learning_rate": 0.0002,
"loss": 0.609643280506134,
"mean_token_accuracy": 0.7513059079647064,
"num_tokens": 22486961.0,
"step": 603
},
{
"entropy": 0.6189433708786964,
"epoch": 3.9228269699431357,
"grad_norm": 0.008104969747364521,
"learning_rate": 0.0002,
"loss": 0.6152623891830444,
"mean_token_accuracy": 0.7489224672317505,
"num_tokens": 22524327.0,
"step": 604
},
{
"entropy": 0.6386607512831688,
"epoch": 3.9293257514216084,
"grad_norm": 0.007721316535025835,
"learning_rate": 0.0002,
"loss": 0.6365233659744263,
"mean_token_accuracy": 0.7393748313188553,
"num_tokens": 22561540.0,
"step": 605
},
{
"entropy": 0.6104080379009247,
"epoch": 3.935824532900081,
"grad_norm": 0.009160472080111504,
"learning_rate": 0.0002,
"loss": 0.6058955192565918,
"mean_token_accuracy": 0.7527115345001221,
"num_tokens": 22598714.0,
"step": 606
},
{
"entropy": 0.6066436171531677,
"epoch": 3.942323314378554,
"grad_norm": 0.00924257654696703,
"learning_rate": 0.0002,
"loss": 0.6112688779830933,
"mean_token_accuracy": 0.7510428801178932,
"num_tokens": 22636168.0,
"step": 607
},
{
"entropy": 0.6113385632634163,
"epoch": 3.948822095857027,
"grad_norm": 0.009213161654770374,
"learning_rate": 0.0002,
"loss": 0.6169242858886719,
"mean_token_accuracy": 0.7488819509744644,
"num_tokens": 22673222.0,
"step": 608
},
{
"entropy": 0.6157431975007057,
"epoch": 3.9553208773354998,
"grad_norm": 0.00805346667766571,
"learning_rate": 0.0002,
"loss": 0.6147987842559814,
"mean_token_accuracy": 0.7497100383043289,
"num_tokens": 22710362.0,
"step": 609
},
{
"entropy": 0.6155053228139877,
"epoch": 3.9618196588139725,
"grad_norm": 0.008978918194770813,
"learning_rate": 0.0002,
"loss": 0.614108681678772,
"mean_token_accuracy": 0.7489725723862648,
"num_tokens": 22747892.0,
"step": 610
},
{
"entropy": 0.6131211444735527,
"epoch": 3.968318440292445,
"grad_norm": 0.010324759408831596,
"learning_rate": 0.0002,
"loss": 0.6139857769012451,
"mean_token_accuracy": 0.7501854747533798,
"num_tokens": 22784987.0,
"step": 611
},
{
"entropy": 0.6161521598696709,
"epoch": 3.974817221770918,
"grad_norm": 0.009645137935876846,
"learning_rate": 0.0002,
"loss": 0.6184964179992676,
"mean_token_accuracy": 0.748919740319252,
"num_tokens": 22822604.0,
"step": 612
},
{
"entropy": 0.6195979118347168,
"epoch": 3.9813160032493906,
"grad_norm": 0.008733006194233894,
"learning_rate": 0.0002,
"loss": 0.6204901933670044,
"mean_token_accuracy": 0.7458331510424614,
"num_tokens": 22859577.0,
"step": 613
},
{
"entropy": 0.6223805174231529,
"epoch": 3.9878147847278633,
"grad_norm": 0.008579275570809841,
"learning_rate": 0.0002,
"loss": 0.6251469850540161,
"mean_token_accuracy": 0.7441524565219879,
"num_tokens": 22897065.0,
"step": 614
},
{
"entropy": 0.6099046468734741,
"epoch": 3.994313566206336,
"grad_norm": 0.009405579417943954,
"learning_rate": 0.0002,
"loss": 0.6134316921234131,
"mean_token_accuracy": 0.7505489960312843,
"num_tokens": 22934240.0,
"step": 615
},
{
"entropy": 0.5790954487664359,
"epoch": 4.0,
"grad_norm": 0.011152846738696098,
"learning_rate": 0.0002,
"loss": 0.6086491346359253,
"mean_token_accuracy": 0.7593175172805786,
"num_tokens": 22950408.0,
"step": 616
},
{
"entropy": 0.6060308367013931,
"epoch": 4.006498781478473,
"grad_norm": 0.008177882991731167,
"learning_rate": 0.0002,
"loss": 0.6047600507736206,
"mean_token_accuracy": 0.7523083239793777,
"num_tokens": 22987854.0,
"step": 617
},
{
"entropy": 0.60086639970541,
"epoch": 4.012997562956945,
"grad_norm": 0.009073281660676003,
"learning_rate": 0.0002,
"loss": 0.5952266454696655,
"mean_token_accuracy": 0.7580123767256737,
"num_tokens": 23025377.0,
"step": 618
},
{
"entropy": 0.5975999683141708,
"epoch": 4.019496344435418,
"grad_norm": 0.00987546518445015,
"learning_rate": 0.0002,
"loss": 0.596405565738678,
"mean_token_accuracy": 0.7551270872354507,
"num_tokens": 23062634.0,
"step": 619
},
{
"entropy": 0.6007415279746056,
"epoch": 4.025995125913891,
"grad_norm": 0.008907251060009003,
"learning_rate": 0.0002,
"loss": 0.6056969165802002,
"mean_token_accuracy": 0.752616822719574,
"num_tokens": 23099758.0,
"step": 620
},
{
"entropy": 0.5893639698624611,
"epoch": 4.032493907392364,
"grad_norm": 0.010224535129964352,
"learning_rate": 0.0002,
"loss": 0.5967025756835938,
"mean_token_accuracy": 0.7561892941594124,
"num_tokens": 23137072.0,
"step": 621
},
{
"entropy": 0.60489272326231,
"epoch": 4.038992688870836,
"grad_norm": 0.011304826475679874,
"learning_rate": 0.0002,
"loss": 0.6063746213912964,
"mean_token_accuracy": 0.7524363398551941,
"num_tokens": 23174098.0,
"step": 622
},
{
"entropy": 0.6080682426691055,
"epoch": 4.04549147034931,
"grad_norm": 0.009452976286411285,
"learning_rate": 0.0002,
"loss": 0.6047728061676025,
"mean_token_accuracy": 0.7509661018848419,
"num_tokens": 23211396.0,
"step": 623
},
{
"entropy": 0.6045035719871521,
"epoch": 4.051990251827783,
"grad_norm": 0.010957913473248482,
"learning_rate": 0.0002,
"loss": 0.6045751571655273,
"mean_token_accuracy": 0.7534721195697784,
"num_tokens": 23248640.0,
"step": 624
},
{
"entropy": 0.6037070825695992,
"epoch": 4.058489033306255,
"grad_norm": 0.011129945516586304,
"learning_rate": 0.0002,
"loss": 0.6084102392196655,
"mean_token_accuracy": 0.7514655515551567,
"num_tokens": 23286103.0,
"step": 625
},
{
"entropy": 0.6091515198349953,
"epoch": 4.064987814784728,
"grad_norm": 0.011563125997781754,
"learning_rate": 0.0002,
"loss": 0.6175334453582764,
"mean_token_accuracy": 0.7468038350343704,
"num_tokens": 23323689.0,
"step": 626
},
{
"entropy": 0.624121755361557,
"epoch": 4.071486596263201,
"grad_norm": 0.010375406593084335,
"learning_rate": 0.0002,
"loss": 0.6241302490234375,
"mean_token_accuracy": 0.7438605725765228,
"num_tokens": 23361119.0,
"step": 627
},
{
"entropy": 0.6100181490182877,
"epoch": 4.0779853777416735,
"grad_norm": 0.011141455732285976,
"learning_rate": 0.0002,
"loss": 0.6070010662078857,
"mean_token_accuracy": 0.7539649158716202,
"num_tokens": 23398396.0,
"step": 628
},
{
"entropy": 0.6109626740217209,
"epoch": 4.084484159220146,
"grad_norm": 0.008930398151278496,
"learning_rate": 0.0002,
"loss": 0.610953688621521,
"mean_token_accuracy": 0.7503283470869064,
"num_tokens": 23435949.0,
"step": 629
},
{
"entropy": 0.5975475162267685,
"epoch": 4.090982940698619,
"grad_norm": 0.00977004412561655,
"learning_rate": 0.0002,
"loss": 0.6004647612571716,
"mean_token_accuracy": 0.755259171128273,
"num_tokens": 23473365.0,
"step": 630
},
{
"entropy": 0.5996551141142845,
"epoch": 4.097481722177092,
"grad_norm": 0.009881756268441677,
"learning_rate": 0.0002,
"loss": 0.6020142436027527,
"mean_token_accuracy": 0.7552994042634964,
"num_tokens": 23510883.0,
"step": 631
},
{
"entropy": 0.6100725084543228,
"epoch": 4.103980503655564,
"grad_norm": 0.009554548189043999,
"learning_rate": 0.0002,
"loss": 0.60805743932724,
"mean_token_accuracy": 0.749746523797512,
"num_tokens": 23548279.0,
"step": 632
},
{
"entropy": 0.604118101298809,
"epoch": 4.110479285134037,
"grad_norm": 0.0090833380818367,
"learning_rate": 0.0002,
"loss": 0.6060141324996948,
"mean_token_accuracy": 0.7535399347543716,
"num_tokens": 23585460.0,
"step": 633
},
{
"entropy": 0.6112289279699326,
"epoch": 4.11697806661251,
"grad_norm": 0.009132446721196175,
"learning_rate": 0.0002,
"loss": 0.6089117527008057,
"mean_token_accuracy": 0.7522810772061348,
"num_tokens": 23623069.0,
"step": 634
},
{
"entropy": 0.5981876626610756,
"epoch": 4.123476848090983,
"grad_norm": 0.009694000706076622,
"learning_rate": 0.0002,
"loss": 0.6000718474388123,
"mean_token_accuracy": 0.7525889277458191,
"num_tokens": 23660201.0,
"step": 635
},
{
"entropy": 0.6080240532755852,
"epoch": 4.129975629569456,
"grad_norm": 0.009349804371595383,
"learning_rate": 0.0002,
"loss": 0.6115583181381226,
"mean_token_accuracy": 0.7498094886541367,
"num_tokens": 23697467.0,
"step": 636
},
{
"entropy": 0.6051702946424484,
"epoch": 4.136474411047929,
"grad_norm": 0.00995174515992403,
"learning_rate": 0.0002,
"loss": 0.6054593324661255,
"mean_token_accuracy": 0.7512011528015137,
"num_tokens": 23734887.0,
"step": 637
},
{
"entropy": 0.6021575108170509,
"epoch": 4.1429731925264015,
"grad_norm": 0.011656476184725761,
"learning_rate": 0.0002,
"loss": 0.6069491505622864,
"mean_token_accuracy": 0.7523794695734978,
"num_tokens": 23772003.0,
"step": 638
},
{
"entropy": 0.6030121594667435,
"epoch": 4.149471974004874,
"grad_norm": 0.009891415014863014,
"learning_rate": 0.0002,
"loss": 0.604573667049408,
"mean_token_accuracy": 0.7512457966804504,
"num_tokens": 23809089.0,
"step": 639
},
{
"entropy": 0.5972474366426468,
"epoch": 4.155970755483347,
"grad_norm": 0.011574115604162216,
"learning_rate": 0.0002,
"loss": 0.5955284833908081,
"mean_token_accuracy": 0.7579837068915367,
"num_tokens": 23846256.0,
"step": 640
},
{
"entropy": 0.6166966333985329,
"epoch": 4.16246953696182,
"grad_norm": 0.010048413649201393,
"learning_rate": 0.0002,
"loss": 0.6198529005050659,
"mean_token_accuracy": 0.7490389570593834,
"num_tokens": 23884254.0,
"step": 641
},
{
"entropy": 0.5962498784065247,
"epoch": 4.168968318440292,
"grad_norm": 0.011094493791460991,
"learning_rate": 0.0002,
"loss": 0.6002663969993591,
"mean_token_accuracy": 0.7531006932258606,
"num_tokens": 23921748.0,
"step": 642
},
{
"entropy": 0.6103070974349976,
"epoch": 4.175467099918765,
"grad_norm": 0.0102005023509264,
"learning_rate": 0.0002,
"loss": 0.6120426654815674,
"mean_token_accuracy": 0.7472726628184319,
"num_tokens": 23959118.0,
"step": 643
},
{
"entropy": 0.6111981943249702,
"epoch": 4.181965881397238,
"grad_norm": 0.010743658058345318,
"learning_rate": 0.0002,
"loss": 0.608763575553894,
"mean_token_accuracy": 0.7516906931996346,
"num_tokens": 23996874.0,
"step": 644
},
{
"entropy": 0.6073967814445496,
"epoch": 4.1884646628757105,
"grad_norm": 0.011524532921612263,
"learning_rate": 0.0002,
"loss": 0.6078468561172485,
"mean_token_accuracy": 0.750710740685463,
"num_tokens": 24034180.0,
"step": 645
},
{
"entropy": 0.6122067421674728,
"epoch": 4.194963444354183,
"grad_norm": 0.009897702373564243,
"learning_rate": 0.0002,
"loss": 0.613964319229126,
"mean_token_accuracy": 0.7508190050721169,
"num_tokens": 24071959.0,
"step": 646
},
{
"entropy": 0.6176895946264267,
"epoch": 4.201462225832657,
"grad_norm": 0.010724211111664772,
"learning_rate": 0.0002,
"loss": 0.6206725835800171,
"mean_token_accuracy": 0.7463300824165344,
"num_tokens": 24109459.0,
"step": 647
},
{
"entropy": 0.6166289448738098,
"epoch": 4.2079610073111295,
"grad_norm": 0.011503348127007484,
"learning_rate": 0.0002,
"loss": 0.6165927052497864,
"mean_token_accuracy": 0.7491984441876411,
"num_tokens": 24146901.0,
"step": 648
},
{
"entropy": 0.6203835979104042,
"epoch": 4.214459788789602,
"grad_norm": 0.010957739315927029,
"learning_rate": 0.0002,
"loss": 0.6207370758056641,
"mean_token_accuracy": 0.7465796917676926,
"num_tokens": 24184105.0,
"step": 649
},
{
"entropy": 0.608573280274868,
"epoch": 4.220958570268075,
"grad_norm": 0.012403266504406929,
"learning_rate": 0.0002,
"loss": 0.6109322309494019,
"mean_token_accuracy": 0.7499670162796974,
"num_tokens": 24221373.0,
"step": 650
},
{
"entropy": 0.61744424700737,
"epoch": 4.227457351746548,
"grad_norm": 0.010664467699825764,
"learning_rate": 0.0002,
"loss": 0.6191272735595703,
"mean_token_accuracy": 0.7458655536174774,
"num_tokens": 24259291.0,
"step": 651
},
{
"entropy": 0.601327195763588,
"epoch": 4.23395613322502,
"grad_norm": 0.012125416658818722,
"learning_rate": 0.0002,
"loss": 0.6103509664535522,
"mean_token_accuracy": 0.7481491416692734,
"num_tokens": 24296467.0,
"step": 652
},
{
"entropy": 0.6011637076735497,
"epoch": 4.240454914703493,
"grad_norm": 0.011278907768428326,
"learning_rate": 0.0002,
"loss": 0.6051167845726013,
"mean_token_accuracy": 0.7522369399666786,
"num_tokens": 24334038.0,
"step": 653
},
{
"entropy": 0.624407596886158,
"epoch": 4.246953696181966,
"grad_norm": 0.011394547298550606,
"learning_rate": 0.0002,
"loss": 0.6223498582839966,
"mean_token_accuracy": 0.7456056624650955,
"num_tokens": 24371361.0,
"step": 654
},
{
"entropy": 0.6008864194154739,
"epoch": 4.2534524776604385,
"grad_norm": 0.010803118348121643,
"learning_rate": 0.0002,
"loss": 0.595673680305481,
"mean_token_accuracy": 0.7541809007525444,
"num_tokens": 24408760.0,
"step": 655
},
{
"entropy": 0.6180669814348221,
"epoch": 4.259951259138911,
"grad_norm": 0.010789727792143822,
"learning_rate": 0.0002,
"loss": 0.6144995093345642,
"mean_token_accuracy": 0.7488504275679588,
"num_tokens": 24446067.0,
"step": 656
},
{
"entropy": 0.5908245071768761,
"epoch": 4.266450040617384,
"grad_norm": 0.013646950013935566,
"learning_rate": 0.0002,
"loss": 0.5992537140846252,
"mean_token_accuracy": 0.7573117613792419,
"num_tokens": 24483475.0,
"step": 657
},
{
"entropy": 0.6028355807065964,
"epoch": 4.272948822095857,
"grad_norm": 0.012632039375603199,
"learning_rate": 0.0002,
"loss": 0.6093482971191406,
"mean_token_accuracy": 0.7510194182395935,
"num_tokens": 24520599.0,
"step": 658
},
{
"entropy": 0.6133154481649399,
"epoch": 4.279447603574329,
"grad_norm": 0.009593473747372627,
"learning_rate": 0.0002,
"loss": 0.6142933964729309,
"mean_token_accuracy": 0.749172069132328,
"num_tokens": 24557970.0,
"step": 659
},
{
"entropy": 0.6059748083353043,
"epoch": 4.285946385052803,
"grad_norm": 0.010930807329714298,
"learning_rate": 0.0002,
"loss": 0.6034088134765625,
"mean_token_accuracy": 0.7542562857270241,
"num_tokens": 24595447.0,
"step": 660
},
{
"entropy": 0.6150760650634766,
"epoch": 4.292445166531276,
"grad_norm": 0.012249140068888664,
"learning_rate": 0.0002,
"loss": 0.6127879023551941,
"mean_token_accuracy": 0.7484256699681282,
"num_tokens": 24632972.0,
"step": 661
},
{
"entropy": 0.6088320016860962,
"epoch": 4.298943948009748,
"grad_norm": 0.010698465630412102,
"learning_rate": 0.0002,
"loss": 0.611052930355072,
"mean_token_accuracy": 0.7510727941989899,
"num_tokens": 24670189.0,
"step": 662
},
{
"entropy": 0.5984915345907211,
"epoch": 4.305442729488221,
"grad_norm": 0.012718550860881805,
"learning_rate": 0.0002,
"loss": 0.6050142049789429,
"mean_token_accuracy": 0.7525518760085106,
"num_tokens": 24706956.0,
"step": 663
},
{
"entropy": 0.6053661406040192,
"epoch": 4.311941510966694,
"grad_norm": 0.00997387245297432,
"learning_rate": 0.0002,
"loss": 0.6083434820175171,
"mean_token_accuracy": 0.7501671761274338,
"num_tokens": 24744572.0,
"step": 664
},
{
"entropy": 0.5996779799461365,
"epoch": 4.318440292445167,
"grad_norm": 0.009505977854132652,
"learning_rate": 0.0002,
"loss": 0.6021357774734497,
"mean_token_accuracy": 0.753576286137104,
"num_tokens": 24782008.0,
"step": 665
},
{
"entropy": 0.6148371547460556,
"epoch": 4.324939073923639,
"grad_norm": 0.010230735875666142,
"learning_rate": 0.0002,
"loss": 0.6132264137268066,
"mean_token_accuracy": 0.7497095540165901,
"num_tokens": 24819250.0,
"step": 666
},
{
"entropy": 0.6186807677149773,
"epoch": 4.331437855402112,
"grad_norm": 0.011359174735844135,
"learning_rate": 0.0002,
"loss": 0.616733193397522,
"mean_token_accuracy": 0.7471146136522293,
"num_tokens": 24856525.0,
"step": 667
},
{
"entropy": 0.5949462577700615,
"epoch": 4.337936636880585,
"grad_norm": 0.009301742538809776,
"learning_rate": 0.0002,
"loss": 0.5954026579856873,
"mean_token_accuracy": 0.7579122558236122,
"num_tokens": 24893833.0,
"step": 668
},
{
"entropy": 0.6139709204435349,
"epoch": 4.344435418359057,
"grad_norm": 0.009777146391570568,
"learning_rate": 0.0002,
"loss": 0.6152162551879883,
"mean_token_accuracy": 0.7482587099075317,
"num_tokens": 24931302.0,
"step": 669
},
{
"entropy": 0.6105548739433289,
"epoch": 4.35093419983753,
"grad_norm": 0.009922128170728683,
"learning_rate": 0.0002,
"loss": 0.6112467646598816,
"mean_token_accuracy": 0.7494839727878571,
"num_tokens": 24968727.0,
"step": 670
},
{
"entropy": 0.6040442362427711,
"epoch": 4.357432981316003,
"grad_norm": 0.009872304275631905,
"learning_rate": 0.0002,
"loss": 0.6058943271636963,
"mean_token_accuracy": 0.7517568320035934,
"num_tokens": 25006181.0,
"step": 671
},
{
"entropy": 0.6142793446779251,
"epoch": 4.363931762794476,
"grad_norm": 0.009624022990465164,
"learning_rate": 0.0002,
"loss": 0.6160279512405396,
"mean_token_accuracy": 0.7462561428546906,
"num_tokens": 25043335.0,
"step": 672
},
{
"entropy": 0.6127363592386246,
"epoch": 4.370430544272949,
"grad_norm": 0.00913744606077671,
"learning_rate": 0.0002,
"loss": 0.6129778027534485,
"mean_token_accuracy": 0.750290147960186,
"num_tokens": 25081246.0,
"step": 673
},
{
"entropy": 0.6002702713012695,
"epoch": 4.376929325751422,
"grad_norm": 0.010623721405863762,
"learning_rate": 0.0002,
"loss": 0.6051443815231323,
"mean_token_accuracy": 0.7518057897686958,
"num_tokens": 25118440.0,
"step": 674
},
{
"entropy": 0.6069729775190353,
"epoch": 4.383428107229895,
"grad_norm": 0.011354091577231884,
"learning_rate": 0.0002,
"loss": 0.6139703989028931,
"mean_token_accuracy": 0.7482916563749313,
"num_tokens": 25155694.0,
"step": 675
},
{
"entropy": 0.6122787147760391,
"epoch": 4.389926888708367,
"grad_norm": 0.009671922773122787,
"learning_rate": 0.0002,
"loss": 0.6111292839050293,
"mean_token_accuracy": 0.7500254139304161,
"num_tokens": 25192885.0,
"step": 676
},
{
"entropy": 0.6137835532426834,
"epoch": 4.39642567018684,
"grad_norm": 0.009973683394491673,
"learning_rate": 0.0002,
"loss": 0.6136457920074463,
"mean_token_accuracy": 0.7491521015763283,
"num_tokens": 25230234.0,
"step": 677
},
{
"entropy": 0.6145277097821236,
"epoch": 4.402924451665313,
"grad_norm": 0.010024932213127613,
"learning_rate": 0.0002,
"loss": 0.612713634967804,
"mean_token_accuracy": 0.7496964707970619,
"num_tokens": 25267657.0,
"step": 678
},
{
"entropy": 0.6107024550437927,
"epoch": 4.4094232331437855,
"grad_norm": 0.009390750899910927,
"learning_rate": 0.0002,
"loss": 0.6097205281257629,
"mean_token_accuracy": 0.7498994544148445,
"num_tokens": 25305087.0,
"step": 679
},
{
"entropy": 0.6041795536875725,
"epoch": 4.415922014622258,
"grad_norm": 0.012812652625143528,
"learning_rate": 0.0002,
"loss": 0.6109946370124817,
"mean_token_accuracy": 0.7516659647226334,
"num_tokens": 25342187.0,
"step": 680
},
{
"entropy": 0.5976850837469101,
"epoch": 4.422420796100731,
"grad_norm": 0.010710278525948524,
"learning_rate": 0.0002,
"loss": 0.6007599830627441,
"mean_token_accuracy": 0.7541299387812614,
"num_tokens": 25379496.0,
"step": 681
},
{
"entropy": 0.6042672917246819,
"epoch": 4.428919577579204,
"grad_norm": 0.011890453286468983,
"learning_rate": 0.0002,
"loss": 0.6084088087081909,
"mean_token_accuracy": 0.7506248950958252,
"num_tokens": 25416619.0,
"step": 682
},
{
"entropy": 0.5986599251627922,
"epoch": 4.435418359057676,
"grad_norm": 0.010659754276275635,
"learning_rate": 0.0002,
"loss": 0.5982859134674072,
"mean_token_accuracy": 0.7548331841826439,
"num_tokens": 25453693.0,
"step": 683
},
{
"entropy": 0.616942897439003,
"epoch": 4.441917140536149,
"grad_norm": 0.01076586078852415,
"learning_rate": 0.0002,
"loss": 0.6122304201126099,
"mean_token_accuracy": 0.7499786019325256,
"num_tokens": 25491062.0,
"step": 684
},
{
"entropy": 0.6103186085820198,
"epoch": 4.448415922014623,
"grad_norm": 0.010572830215096474,
"learning_rate": 0.0002,
"loss": 0.6094003915786743,
"mean_token_accuracy": 0.7506365403532982,
"num_tokens": 25528185.0,
"step": 685
},
{
"entropy": 0.5939375460147858,
"epoch": 4.454914703493095,
"grad_norm": 0.011964102275669575,
"learning_rate": 0.0002,
"loss": 0.6006197333335876,
"mean_token_accuracy": 0.7550608739256859,
"num_tokens": 25565262.0,
"step": 686
},
{
"entropy": 0.6017919331789017,
"epoch": 4.461413484971568,
"grad_norm": 0.013583175837993622,
"learning_rate": 0.0002,
"loss": 0.6119198203086853,
"mean_token_accuracy": 0.7524380683898926,
"num_tokens": 25602632.0,
"step": 687
},
{
"entropy": 0.6157395392656326,
"epoch": 4.467912266450041,
"grad_norm": 0.009645634330809116,
"learning_rate": 0.0002,
"loss": 0.6124662160873413,
"mean_token_accuracy": 0.7506381198763847,
"num_tokens": 25640141.0,
"step": 688
},
{
"entropy": 0.6060995981097221,
"epoch": 4.4744110479285135,
"grad_norm": 0.011023740284144878,
"learning_rate": 0.0002,
"loss": 0.604090690612793,
"mean_token_accuracy": 0.7523544281721115,
"num_tokens": 25676930.0,
"step": 689
},
{
"entropy": 0.6346146166324615,
"epoch": 4.480909829406986,
"grad_norm": 0.010563536547124386,
"learning_rate": 0.0002,
"loss": 0.6303510665893555,
"mean_token_accuracy": 0.7432904541492462,
"num_tokens": 25714523.0,
"step": 690
},
{
"entropy": 0.6144333481788635,
"epoch": 4.487408610885459,
"grad_norm": 0.010604371316730976,
"learning_rate": 0.0002,
"loss": 0.6150377988815308,
"mean_token_accuracy": 0.74857547134161,
"num_tokens": 25751872.0,
"step": 691
},
{
"entropy": 0.5893413797020912,
"epoch": 4.493907392363932,
"grad_norm": 0.010374541394412518,
"learning_rate": 0.0002,
"loss": 0.59273362159729,
"mean_token_accuracy": 0.7577084898948669,
"num_tokens": 25789255.0,
"step": 692
},
{
"entropy": 0.5985084772109985,
"epoch": 4.500406173842404,
"grad_norm": 0.010325289331376553,
"learning_rate": 0.0002,
"loss": 0.5997466444969177,
"mean_token_accuracy": 0.7552184760570526,
"num_tokens": 25826911.0,
"step": 693
},
{
"entropy": 0.6087296083569527,
"epoch": 4.506904955320877,
"grad_norm": 0.012259433045983315,
"learning_rate": 0.0002,
"loss": 0.6142268776893616,
"mean_token_accuracy": 0.7504933401942253,
"num_tokens": 25864195.0,
"step": 694
},
{
"entropy": 0.5923497229814529,
"epoch": 4.51340373679935,
"grad_norm": 0.011389669962227345,
"learning_rate": 0.0002,
"loss": 0.597306489944458,
"mean_token_accuracy": 0.7565679550170898,
"num_tokens": 25901656.0,
"step": 695
},
{
"entropy": 0.6001605242490768,
"epoch": 4.5199025182778225,
"grad_norm": 0.009456605650484562,
"learning_rate": 0.0002,
"loss": 0.6000933051109314,
"mean_token_accuracy": 0.7530366033315659,
"num_tokens": 25939491.0,
"step": 696
},
{
"entropy": 0.5900749191641808,
"epoch": 4.526401299756296,
"grad_norm": 0.011240561492741108,
"learning_rate": 0.0002,
"loss": 0.59348464012146,
"mean_token_accuracy": 0.7567196115851402,
"num_tokens": 25976506.0,
"step": 697
},
{
"entropy": 0.5967278108000755,
"epoch": 4.532900081234769,
"grad_norm": 0.010507924482226372,
"learning_rate": 0.0002,
"loss": 0.6000585556030273,
"mean_token_accuracy": 0.7546230331063271,
"num_tokens": 26013826.0,
"step": 698
},
{
"entropy": 0.5980387553572655,
"epoch": 4.5393988627132416,
"grad_norm": 0.01707952283322811,
"learning_rate": 0.0002,
"loss": 0.6007162928581238,
"mean_token_accuracy": 0.7539133131504059,
"num_tokens": 26051676.0,
"step": 699
},
{
"entropy": 0.6002839356660843,
"epoch": 4.545897644191714,
"grad_norm": 0.01148629654198885,
"learning_rate": 0.0002,
"loss": 0.6052761077880859,
"mean_token_accuracy": 0.7534726038575172,
"num_tokens": 26088813.0,
"step": 700
},
{
"entropy": 0.6063856557011604,
"epoch": 4.552396425670187,
"grad_norm": 0.04600154981017113,
"learning_rate": 0.0002,
"loss": 0.6116973161697388,
"mean_token_accuracy": 0.7503002285957336,
"num_tokens": 26126381.0,
"step": 701
},
{
"entropy": 0.6121505573391914,
"epoch": 4.55889520714866,
"grad_norm": 0.01381687168031931,
"learning_rate": 0.0002,
"loss": 0.6069159507751465,
"mean_token_accuracy": 0.7519886940717697,
"num_tokens": 26163482.0,
"step": 702
},
{
"entropy": 0.6286856532096863,
"epoch": 4.565393988627132,
"grad_norm": 0.010802995413541794,
"learning_rate": 0.0002,
"loss": 0.6213472485542297,
"mean_token_accuracy": 0.7473803609609604,
"num_tokens": 26200948.0,
"step": 703
},
{
"entropy": 0.6292322054505348,
"epoch": 4.571892770105605,
"grad_norm": 0.01318847481161356,
"learning_rate": 0.0002,
"loss": 0.6286896467208862,
"mean_token_accuracy": 0.7422280386090279,
"num_tokens": 26238501.0,
"step": 704
},
{
"entropy": 0.61526670306921,
"epoch": 4.578391551584078,
"grad_norm": 0.012318129651248455,
"learning_rate": 0.0002,
"loss": 0.6191307306289673,
"mean_token_accuracy": 0.7456179112195969,
"num_tokens": 26276241.0,
"step": 705
},
{
"entropy": 0.5996731072664261,
"epoch": 4.584890333062551,
"grad_norm": 0.01126960851252079,
"learning_rate": 0.0002,
"loss": 0.5998624563217163,
"mean_token_accuracy": 0.7562123388051987,
"num_tokens": 26313858.0,
"step": 706
},
{
"entropy": 0.6051791980862617,
"epoch": 4.591389114541023,
"grad_norm": 0.008872485719621181,
"learning_rate": 0.0002,
"loss": 0.6033820509910583,
"mean_token_accuracy": 0.7548251152038574,
"num_tokens": 26351577.0,
"step": 707
},
{
"entropy": 0.603697344660759,
"epoch": 4.597887896019496,
"grad_norm": 0.01154793705791235,
"learning_rate": 0.0002,
"loss": 0.6016978025436401,
"mean_token_accuracy": 0.7543343156576157,
"num_tokens": 26388978.0,
"step": 708
},
{
"entropy": 0.6170104667544365,
"epoch": 4.604386677497969,
"grad_norm": 0.01096999179571867,
"learning_rate": 0.0002,
"loss": 0.622772216796875,
"mean_token_accuracy": 0.7449462041258812,
"num_tokens": 26426264.0,
"step": 709
},
{
"entropy": 0.6072003245353699,
"epoch": 4.610885458976442,
"grad_norm": 0.010877830907702446,
"learning_rate": 0.0002,
"loss": 0.6076858639717102,
"mean_token_accuracy": 0.7529691979289055,
"num_tokens": 26463914.0,
"step": 710
},
{
"entropy": 0.6025268062949181,
"epoch": 4.617384240454915,
"grad_norm": 0.011258685030043125,
"learning_rate": 0.0002,
"loss": 0.6081684231758118,
"mean_token_accuracy": 0.751194529235363,
"num_tokens": 26501178.0,
"step": 711
},
{
"entropy": 0.6161645799875259,
"epoch": 4.623883021933388,
"grad_norm": 0.011774537153542042,
"learning_rate": 0.0002,
"loss": 0.6219759583473206,
"mean_token_accuracy": 0.7475455403327942,
"num_tokens": 26538587.0,
"step": 712
},
{
"entropy": 0.61099823564291,
"epoch": 4.6303818034118605,
"grad_norm": 0.011626939289271832,
"learning_rate": 0.0002,
"loss": 0.6097919940948486,
"mean_token_accuracy": 0.7494744956493378,
"num_tokens": 26576055.0,
"step": 713
},
{
"entropy": 0.5967102572321892,
"epoch": 4.636880584890333,
"grad_norm": 0.011615315452218056,
"learning_rate": 0.0002,
"loss": 0.5964145660400391,
"mean_token_accuracy": 0.7566935420036316,
"num_tokens": 26613206.0,
"step": 714
},
{
"entropy": 0.6024897918105125,
"epoch": 4.643379366368806,
"grad_norm": 0.011359010823071003,
"learning_rate": 0.0002,
"loss": 0.6033364534378052,
"mean_token_accuracy": 0.75516776740551,
"num_tokens": 26650906.0,
"step": 715
},
{
"entropy": 0.6127264201641083,
"epoch": 4.649878147847279,
"grad_norm": 0.011858063749969006,
"learning_rate": 0.0002,
"loss": 0.6169857382774353,
"mean_token_accuracy": 0.7504541873931885,
"num_tokens": 26688277.0,
"step": 716
},
{
"entropy": 0.6103435754776001,
"epoch": 4.656376929325751,
"grad_norm": 0.012304591946303844,
"learning_rate": 0.0002,
"loss": 0.6171730756759644,
"mean_token_accuracy": 0.7490719556808472,
"num_tokens": 26725704.0,
"step": 717
},
{
"entropy": 0.6082026064395905,
"epoch": 4.662875710804224,
"grad_norm": 0.00955925416201353,
"learning_rate": 0.0002,
"loss": 0.6081550121307373,
"mean_token_accuracy": 0.7512648478150368,
"num_tokens": 26762897.0,
"step": 718
},
{
"entropy": 0.615670770406723,
"epoch": 4.669374492282697,
"grad_norm": 0.011302441358566284,
"learning_rate": 0.0002,
"loss": 0.6137043833732605,
"mean_token_accuracy": 0.7484593465924263,
"num_tokens": 26799617.0,
"step": 719
},
{
"entropy": 0.6008039489388466,
"epoch": 4.6758732737611695,
"grad_norm": 0.010860615409910679,
"learning_rate": 0.0002,
"loss": 0.5949652194976807,
"mean_token_accuracy": 0.7573561295866966,
"num_tokens": 26836935.0,
"step": 720
},
{
"entropy": 0.6153427511453629,
"epoch": 4.682372055239643,
"grad_norm": 0.01038694754242897,
"learning_rate": 0.0002,
"loss": 0.6163858771324158,
"mean_token_accuracy": 0.7477854266762733,
"num_tokens": 26874482.0,
"step": 721
},
{
"entropy": 0.6078703328967094,
"epoch": 4.688870836718115,
"grad_norm": 0.011593160219490528,
"learning_rate": 0.0002,
"loss": 0.6154011487960815,
"mean_token_accuracy": 0.7504984140396118,
"num_tokens": 26912012.0,
"step": 722
},
{
"entropy": 0.6097044795751572,
"epoch": 4.6953696181965885,
"grad_norm": 0.011452315375208855,
"learning_rate": 0.0002,
"loss": 0.6159889698028564,
"mean_token_accuracy": 0.7497701123356819,
"num_tokens": 26949190.0,
"step": 723
},
{
"entropy": 0.6035362407565117,
"epoch": 4.701868399675061,
"grad_norm": 0.009807482361793518,
"learning_rate": 0.0002,
"loss": 0.6073694229125977,
"mean_token_accuracy": 0.7511623874306679,
"num_tokens": 26986593.0,
"step": 724
},
{
"entropy": 0.6145569458603859,
"epoch": 4.708367181153534,
"grad_norm": 0.009589890018105507,
"learning_rate": 0.0002,
"loss": 0.615104079246521,
"mean_token_accuracy": 0.7482927516102791,
"num_tokens": 27023613.0,
"step": 725
},
{
"entropy": 0.6154572740197182,
"epoch": 4.714865962632007,
"grad_norm": 0.01081397570669651,
"learning_rate": 0.0002,
"loss": 0.6108368635177612,
"mean_token_accuracy": 0.7491915374994278,
"num_tokens": 27061197.0,
"step": 726
},
{
"entropy": 0.620484970510006,
"epoch": 4.721364744110479,
"grad_norm": 0.009981570765376091,
"learning_rate": 0.0002,
"loss": 0.6177104711532593,
"mean_token_accuracy": 0.7493368536233902,
"num_tokens": 27098608.0,
"step": 727
},
{
"entropy": 0.6061017587780952,
"epoch": 4.727863525588952,
"grad_norm": 0.011618540622293949,
"learning_rate": 0.0002,
"loss": 0.6062725186347961,
"mean_token_accuracy": 0.7519984692335129,
"num_tokens": 27136501.0,
"step": 728
},
{
"entropy": 0.6067364290356636,
"epoch": 4.734362307067425,
"grad_norm": 0.009954583831131458,
"learning_rate": 0.0002,
"loss": 0.6102150678634644,
"mean_token_accuracy": 0.7502684965729713,
"num_tokens": 27173703.0,
"step": 729
},
{
"entropy": 0.605129785835743,
"epoch": 4.7408610885458975,
"grad_norm": 0.012882952578365803,
"learning_rate": 0.0002,
"loss": 0.6149674654006958,
"mean_token_accuracy": 0.7470449358224869,
"num_tokens": 27210993.0,
"step": 730
},
{
"entropy": 0.6143843829631805,
"epoch": 4.74735987002437,
"grad_norm": 0.010333128273487091,
"learning_rate": 0.0002,
"loss": 0.6135010719299316,
"mean_token_accuracy": 0.7495505511760712,
"num_tokens": 27248544.0,
"step": 731
},
{
"entropy": 0.619462713599205,
"epoch": 4.753858651502843,
"grad_norm": 0.009751244448125362,
"learning_rate": 0.0002,
"loss": 0.6161588430404663,
"mean_token_accuracy": 0.7501519843935966,
"num_tokens": 27286017.0,
"step": 732
},
{
"entropy": 0.6085372492671013,
"epoch": 4.760357432981316,
"grad_norm": 0.01087701041251421,
"learning_rate": 0.0002,
"loss": 0.6058393716812134,
"mean_token_accuracy": 0.7525414749979973,
"num_tokens": 27323456.0,
"step": 733
},
{
"entropy": 0.6052304580807686,
"epoch": 4.766856214459789,
"grad_norm": 0.010626486502587795,
"learning_rate": 0.0002,
"loss": 0.6062231063842773,
"mean_token_accuracy": 0.7521145865321159,
"num_tokens": 27360812.0,
"step": 734
},
{
"entropy": 0.609903909265995,
"epoch": 4.773354995938262,
"grad_norm": 0.010470789857208729,
"learning_rate": 0.0002,
"loss": 0.6119512319564819,
"mean_token_accuracy": 0.7512121498584747,
"num_tokens": 27398510.0,
"step": 735
},
{
"entropy": 0.6010274812579155,
"epoch": 4.779853777416735,
"grad_norm": 0.009013401344418526,
"learning_rate": 0.0002,
"loss": 0.6045113205909729,
"mean_token_accuracy": 0.7538518905639648,
"num_tokens": 27435677.0,
"step": 736
},
{
"entropy": 0.6044503897428513,
"epoch": 4.786352558895207,
"grad_norm": 0.009969563223421574,
"learning_rate": 0.0002,
"loss": 0.6042656898498535,
"mean_token_accuracy": 0.7533875405788422,
"num_tokens": 27472951.0,
"step": 737
},
{
"entropy": 0.6085273697972298,
"epoch": 4.79285134037368,
"grad_norm": 0.010333449579775333,
"learning_rate": 0.0002,
"loss": 0.6119939088821411,
"mean_token_accuracy": 0.7497808411717415,
"num_tokens": 27510678.0,
"step": 738
},
{
"entropy": 0.5953918546438217,
"epoch": 4.799350121852153,
"grad_norm": 0.011067725718021393,
"learning_rate": 0.0002,
"loss": 0.6043837070465088,
"mean_token_accuracy": 0.7549910023808479,
"num_tokens": 27548061.0,
"step": 739
},
{
"entropy": 0.6027686223387718,
"epoch": 4.8058489033306255,
"grad_norm": 0.010080584324896336,
"learning_rate": 0.0002,
"loss": 0.6062842011451721,
"mean_token_accuracy": 0.752067320048809,
"num_tokens": 27585301.0,
"step": 740
},
{
"entropy": 0.6061441823840141,
"epoch": 4.812347684809098,
"grad_norm": 0.009884923696517944,
"learning_rate": 0.0002,
"loss": 0.6060526371002197,
"mean_token_accuracy": 0.7508253157138824,
"num_tokens": 27622471.0,
"step": 741
},
{
"entropy": 0.6114162281155586,
"epoch": 4.818846466287571,
"grad_norm": 0.009803572669625282,
"learning_rate": 0.0002,
"loss": 0.6056950092315674,
"mean_token_accuracy": 0.7509299144148827,
"num_tokens": 27659725.0,
"step": 742
},
{
"entropy": 0.604758232831955,
"epoch": 4.825345247766044,
"grad_norm": 0.009157917462289333,
"learning_rate": 0.0002,
"loss": 0.6060429811477661,
"mean_token_accuracy": 0.7535065114498138,
"num_tokens": 27697579.0,
"step": 743
},
{
"entropy": 0.6063171178102493,
"epoch": 4.831844029244516,
"grad_norm": 0.010433568619191647,
"learning_rate": 0.0002,
"loss": 0.6129876971244812,
"mean_token_accuracy": 0.7488505020737648,
"num_tokens": 27735152.0,
"step": 744
},
{
"entropy": 0.6220549941062927,
"epoch": 4.838342810722989,
"grad_norm": 0.009133824147284031,
"learning_rate": 0.0002,
"loss": 0.6260920166969299,
"mean_token_accuracy": 0.7444146424531937,
"num_tokens": 27772809.0,
"step": 745
},
{
"entropy": 0.6151563301682472,
"epoch": 4.844841592201462,
"grad_norm": 0.009275715798139572,
"learning_rate": 0.0002,
"loss": 0.6143773794174194,
"mean_token_accuracy": 0.7501434609293938,
"num_tokens": 27810585.0,
"step": 746
},
{
"entropy": 0.6030779108405113,
"epoch": 4.851340373679935,
"grad_norm": 0.009752030484378338,
"learning_rate": 0.0002,
"loss": 0.6026537418365479,
"mean_token_accuracy": 0.7538170889019966,
"num_tokens": 27848177.0,
"step": 747
},
{
"entropy": 0.6034507304430008,
"epoch": 4.857839155158408,
"grad_norm": 0.009275935590267181,
"learning_rate": 0.0002,
"loss": 0.6020852327346802,
"mean_token_accuracy": 0.7548267766833305,
"num_tokens": 27885820.0,
"step": 748
},
{
"entropy": 0.5959972590208054,
"epoch": 4.864337936636881,
"grad_norm": 0.01019821036607027,
"learning_rate": 0.0002,
"loss": 0.5997313857078552,
"mean_token_accuracy": 0.7544100061058998,
"num_tokens": 27923215.0,
"step": 749
},
{
"entropy": 0.5984265580773354,
"epoch": 4.870836718115354,
"grad_norm": 0.010381966829299927,
"learning_rate": 0.0002,
"loss": 0.5997567176818848,
"mean_token_accuracy": 0.754194863140583,
"num_tokens": 27960378.0,
"step": 750
},
{
"entropy": 0.6121873781085014,
"epoch": 4.877335499593826,
"grad_norm": 0.010476244613528252,
"learning_rate": 0.0002,
"loss": 0.6164151430130005,
"mean_token_accuracy": 0.747443437576294,
"num_tokens": 27997671.0,
"step": 751
},
{
"entropy": 0.6084479093551636,
"epoch": 4.883834281072299,
"grad_norm": 0.011203959584236145,
"learning_rate": 0.0002,
"loss": 0.608171820640564,
"mean_token_accuracy": 0.75231072306633,
"num_tokens": 28034897.0,
"step": 752
},
{
"entropy": 0.6147375106811523,
"epoch": 4.890333062550772,
"grad_norm": 0.009496328420937061,
"learning_rate": 0.0002,
"loss": 0.6129316091537476,
"mean_token_accuracy": 0.7494983300566673,
"num_tokens": 28072034.0,
"step": 753
},
{
"entropy": 0.6106340512633324,
"epoch": 4.896831844029244,
"grad_norm": 0.011393910273909569,
"learning_rate": 0.0002,
"loss": 0.6084151268005371,
"mean_token_accuracy": 0.7524324804544449,
"num_tokens": 28109258.0,
"step": 754
},
{
"entropy": 0.600101962685585,
"epoch": 4.903330625507717,
"grad_norm": 0.010883449576795101,
"learning_rate": 0.0002,
"loss": 0.6043680906295776,
"mean_token_accuracy": 0.7542835772037506,
"num_tokens": 28146570.0,
"step": 755
},
{
"entropy": 0.6109775528311729,
"epoch": 4.90982940698619,
"grad_norm": 0.010207289829850197,
"learning_rate": 0.0002,
"loss": 0.6150296926498413,
"mean_token_accuracy": 0.7493007630109787,
"num_tokens": 28183579.0,
"step": 756
},
{
"entropy": 0.597320593893528,
"epoch": 4.916328188464663,
"grad_norm": 0.010998498648405075,
"learning_rate": 0.0002,
"loss": 0.599211573600769,
"mean_token_accuracy": 0.7554142326116562,
"num_tokens": 28220767.0,
"step": 757
},
{
"entropy": 0.6176287531852722,
"epoch": 4.922826969943135,
"grad_norm": 0.012422211468219757,
"learning_rate": 0.0002,
"loss": 0.6129187941551208,
"mean_token_accuracy": 0.7506537437438965,
"num_tokens": 28258324.0,
"step": 758
},
{
"entropy": 0.604163758456707,
"epoch": 4.929325751421608,
"grad_norm": 0.010133393108844757,
"learning_rate": 0.0002,
"loss": 0.6023921966552734,
"mean_token_accuracy": 0.7550497874617577,
"num_tokens": 28295946.0,
"step": 759
},
{
"entropy": 0.6072142794728279,
"epoch": 4.935824532900082,
"grad_norm": 0.011114662513136864,
"learning_rate": 0.0002,
"loss": 0.6146305799484253,
"mean_token_accuracy": 0.7498172372579575,
"num_tokens": 28333200.0,
"step": 760
},
{
"entropy": 0.6026475057005882,
"epoch": 4.942323314378554,
"grad_norm": 0.010693948715925217,
"learning_rate": 0.0002,
"loss": 0.6080969572067261,
"mean_token_accuracy": 0.7521899044513702,
"num_tokens": 28370788.0,
"step": 761
},
{
"entropy": 0.6020209938287735,
"epoch": 4.948822095857027,
"grad_norm": 0.010837409645318985,
"learning_rate": 0.0002,
"loss": 0.6070795059204102,
"mean_token_accuracy": 0.7505692467093468,
"num_tokens": 28407932.0,
"step": 762
},
{
"entropy": 0.612369492650032,
"epoch": 4.9553208773355,
"grad_norm": 0.010154753923416138,
"learning_rate": 0.0002,
"loss": 0.6116279363632202,
"mean_token_accuracy": 0.7497418820858002,
"num_tokens": 28445493.0,
"step": 763
},
{
"entropy": 0.6173591017723083,
"epoch": 4.9618196588139725,
"grad_norm": 0.008918640203773975,
"learning_rate": 0.0002,
"loss": 0.61656254529953,
"mean_token_accuracy": 0.7493520677089691,
"num_tokens": 28483286.0,
"step": 764
},
{
"entropy": 0.6011045426130295,
"epoch": 4.968318440292445,
"grad_norm": 0.011289622634649277,
"learning_rate": 0.0002,
"loss": 0.6005913019180298,
"mean_token_accuracy": 0.7565959766507149,
"num_tokens": 28520772.0,
"step": 765
},
{
"entropy": 0.6143112033605576,
"epoch": 4.974817221770918,
"grad_norm": 0.009968056343495846,
"learning_rate": 0.0002,
"loss": 0.6112393140792847,
"mean_token_accuracy": 0.7505759075284004,
"num_tokens": 28558593.0,
"step": 766
},
{
"entropy": 0.609484076499939,
"epoch": 4.981316003249391,
"grad_norm": 0.00863439030945301,
"learning_rate": 0.0002,
"loss": 0.6094443798065186,
"mean_token_accuracy": 0.753460243344307,
"num_tokens": 28596214.0,
"step": 767
},
{
"entropy": 0.6114853024482727,
"epoch": 4.987814784727863,
"grad_norm": 0.008814731612801552,
"learning_rate": 0.0002,
"loss": 0.6125534772872925,
"mean_token_accuracy": 0.7496102303266525,
"num_tokens": 28634065.0,
"step": 768
},
{
"entropy": 0.6083709001541138,
"epoch": 4.994313566206336,
"grad_norm": 0.012475132942199707,
"learning_rate": 0.0002,
"loss": 0.6144940853118896,
"mean_token_accuracy": 0.7477302476763725,
"num_tokens": 28671577.0,
"step": 769
},
{
"entropy": 0.6027948686054775,
"epoch": 5.0,
"grad_norm": 0.009683027863502502,
"learning_rate": 0.0002,
"loss": 0.6097056865692139,
"mean_token_accuracy": 0.7535298126084464,
"num_tokens": 28688115.0,
"step": 770
}
],
"logging_steps": 1,
"max_steps": 770,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.685759473330422e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}