eac123's picture
Upload final checkpoint (checkpoint-785)
a51a775 verified
Raw
History Blame Contribute Delete
219 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 785,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.1603021323680878,
"epoch": 0.0064,
"grad_norm": 0.22975344955921173,
"learning_rate": 0.0002,
"loss": 2.6077966690063477,
"mean_token_accuracy": 0.4999677650630474,
"num_tokens": 37716.0,
"step": 1
},
{
"entropy": 1.2748871892690659,
"epoch": 0.0128,
"grad_norm": 0.2017921358346939,
"learning_rate": 0.0002,
"loss": 2.2619409561157227,
"mean_token_accuracy": 0.5358003973960876,
"num_tokens": 75123.0,
"step": 2
},
{
"entropy": 1.4657676070928574,
"epoch": 0.0192,
"grad_norm": 0.13960610330104828,
"learning_rate": 0.0002,
"loss": 1.8277919292449951,
"mean_token_accuracy": 0.5620946511626244,
"num_tokens": 112455.0,
"step": 3
},
{
"entropy": 1.4639433324337006,
"epoch": 0.0256,
"grad_norm": 0.1115739569067955,
"learning_rate": 0.0002,
"loss": 1.5044896602630615,
"mean_token_accuracy": 0.6032674387097359,
"num_tokens": 150168.0,
"step": 4
},
{
"entropy": 1.4306974858045578,
"epoch": 0.032,
"grad_norm": 0.1513909250497818,
"learning_rate": 0.0002,
"loss": 1.3954216241836548,
"mean_token_accuracy": 0.607626736164093,
"num_tokens": 187390.0,
"step": 5
},
{
"entropy": 1.3751554787158966,
"epoch": 0.0384,
"grad_norm": 0.07965348660945892,
"learning_rate": 0.0002,
"loss": 1.2835979461669922,
"mean_token_accuracy": 0.6308266744017601,
"num_tokens": 224660.0,
"step": 6
},
{
"entropy": 1.3173644244670868,
"epoch": 0.0448,
"grad_norm": 0.049434103071689606,
"learning_rate": 0.0002,
"loss": 1.2139647006988525,
"mean_token_accuracy": 0.6277531310915947,
"num_tokens": 262611.0,
"step": 7
},
{
"entropy": 1.2547403424978256,
"epoch": 0.0512,
"grad_norm": 0.0511409156024456,
"learning_rate": 0.0002,
"loss": 1.1280027627944946,
"mean_token_accuracy": 0.6461542472243309,
"num_tokens": 300183.0,
"step": 8
},
{
"entropy": 1.1726891100406647,
"epoch": 0.0576,
"grad_norm": 0.05379360541701317,
"learning_rate": 0.0002,
"loss": 1.0599746704101562,
"mean_token_accuracy": 0.6579638719558716,
"num_tokens": 338051.0,
"step": 9
},
{
"entropy": 1.0671324282884598,
"epoch": 0.064,
"grad_norm": 0.060306161642074585,
"learning_rate": 0.0002,
"loss": 0.9810148477554321,
"mean_token_accuracy": 0.6758092492818832,
"num_tokens": 375360.0,
"step": 10
},
{
"entropy": 1.0067108944058418,
"epoch": 0.0704,
"grad_norm": 0.051368217915296555,
"learning_rate": 0.0002,
"loss": 0.9359661340713501,
"mean_token_accuracy": 0.6835062801837921,
"num_tokens": 412957.0,
"step": 11
},
{
"entropy": 0.9524737820029259,
"epoch": 0.0768,
"grad_norm": 0.5623471140861511,
"learning_rate": 0.0002,
"loss": 0.8969950675964355,
"mean_token_accuracy": 0.6872275173664093,
"num_tokens": 450706.0,
"step": 12
},
{
"entropy": 0.9274985566735268,
"epoch": 0.0832,
"grad_norm": 0.05319288372993469,
"learning_rate": 0.0002,
"loss": 0.8793208599090576,
"mean_token_accuracy": 0.6885223314166069,
"num_tokens": 487960.0,
"step": 13
},
{
"entropy": 0.8979481309652328,
"epoch": 0.0896,
"grad_norm": 0.21191297471523285,
"learning_rate": 0.0002,
"loss": 0.8658405542373657,
"mean_token_accuracy": 0.6915783286094666,
"num_tokens": 525195.0,
"step": 14
},
{
"entropy": 0.8346997126936913,
"epoch": 0.096,
"grad_norm": 0.05889149382710457,
"learning_rate": 0.0002,
"loss": 0.8389202356338501,
"mean_token_accuracy": 0.6947608664631844,
"num_tokens": 562338.0,
"step": 15
},
{
"entropy": 0.8163095191121101,
"epoch": 0.1024,
"grad_norm": 0.04048901051282883,
"learning_rate": 0.0002,
"loss": 0.8089202642440796,
"mean_token_accuracy": 0.7007258981466293,
"num_tokens": 600135.0,
"step": 16
},
{
"entropy": 0.7877696678042412,
"epoch": 0.1088,
"grad_norm": 0.039190541952848434,
"learning_rate": 0.0002,
"loss": 0.7770611047744751,
"mean_token_accuracy": 0.7096988186240196,
"num_tokens": 637693.0,
"step": 17
},
{
"entropy": 0.7828011736273766,
"epoch": 0.1152,
"grad_norm": 0.04370075836777687,
"learning_rate": 0.0002,
"loss": 0.7714797258377075,
"mean_token_accuracy": 0.7088576778769493,
"num_tokens": 675327.0,
"step": 18
},
{
"entropy": 0.7552840113639832,
"epoch": 0.1216,
"grad_norm": 0.04059312492609024,
"learning_rate": 0.0002,
"loss": 0.7444543838500977,
"mean_token_accuracy": 0.7163014858961105,
"num_tokens": 712985.0,
"step": 19
},
{
"entropy": 0.7549928575754166,
"epoch": 0.128,
"grad_norm": 0.03694331273436546,
"learning_rate": 0.0002,
"loss": 0.7338740229606628,
"mean_token_accuracy": 0.7175227254629135,
"num_tokens": 750710.0,
"step": 20
},
{
"entropy": 0.7592482566833496,
"epoch": 0.1344,
"grad_norm": 0.04042579606175423,
"learning_rate": 0.0002,
"loss": 0.7357518076896667,
"mean_token_accuracy": 0.7131277471780777,
"num_tokens": 788255.0,
"step": 21
},
{
"entropy": 0.7549540996551514,
"epoch": 0.1408,
"grad_norm": 0.03494592010974884,
"learning_rate": 0.0002,
"loss": 0.7316156625747681,
"mean_token_accuracy": 0.7107274830341339,
"num_tokens": 826086.0,
"step": 22
},
{
"entropy": 0.722670815885067,
"epoch": 0.1472,
"grad_norm": 0.031072545796632767,
"learning_rate": 0.0002,
"loss": 0.7062587738037109,
"mean_token_accuracy": 0.7226787135004997,
"num_tokens": 864023.0,
"step": 23
},
{
"entropy": 0.7071146741509438,
"epoch": 0.1536,
"grad_norm": 0.03113628178834915,
"learning_rate": 0.0002,
"loss": 0.7100369334220886,
"mean_token_accuracy": 0.7202128395438194,
"num_tokens": 901749.0,
"step": 24
},
{
"entropy": 0.6773204877972603,
"epoch": 0.16,
"grad_norm": 0.03384184464812279,
"learning_rate": 0.0002,
"loss": 0.6899121999740601,
"mean_token_accuracy": 0.7300205677747726,
"num_tokens": 939298.0,
"step": 25
},
{
"entropy": 0.6714279726147652,
"epoch": 0.1664,
"grad_norm": 0.03193815425038338,
"learning_rate": 0.0002,
"loss": 0.6869939565658569,
"mean_token_accuracy": 0.7289758324623108,
"num_tokens": 976724.0,
"step": 26
},
{
"entropy": 0.6800564154982567,
"epoch": 0.1728,
"grad_norm": 0.02955479919910431,
"learning_rate": 0.0002,
"loss": 0.68382728099823,
"mean_token_accuracy": 0.729714535176754,
"num_tokens": 1013951.0,
"step": 27
},
{
"entropy": 0.6879034861922264,
"epoch": 0.1792,
"grad_norm": 0.025940844789147377,
"learning_rate": 0.0002,
"loss": 0.6867204904556274,
"mean_token_accuracy": 0.7293097972869873,
"num_tokens": 1051525.0,
"step": 28
},
{
"entropy": 0.6878452003002167,
"epoch": 0.1856,
"grad_norm": 0.02489350363612175,
"learning_rate": 0.0002,
"loss": 0.6796096563339233,
"mean_token_accuracy": 0.7287048920989037,
"num_tokens": 1089369.0,
"step": 29
},
{
"entropy": 0.6869403198361397,
"epoch": 0.192,
"grad_norm": 0.025337131693959236,
"learning_rate": 0.0002,
"loss": 0.678722620010376,
"mean_token_accuracy": 0.7302690520882607,
"num_tokens": 1126844.0,
"step": 30
},
{
"entropy": 0.6806962639093399,
"epoch": 0.1984,
"grad_norm": 0.02659286931157112,
"learning_rate": 0.0002,
"loss": 0.6713651418685913,
"mean_token_accuracy": 0.7335517108440399,
"num_tokens": 1164699.0,
"step": 31
},
{
"entropy": 0.676600731909275,
"epoch": 0.2048,
"grad_norm": 0.024583281949162483,
"learning_rate": 0.0002,
"loss": 0.674942135810852,
"mean_token_accuracy": 0.7303079515695572,
"num_tokens": 1201884.0,
"step": 32
},
{
"entropy": 0.6764877885580063,
"epoch": 0.2112,
"grad_norm": 0.019307173788547516,
"learning_rate": 0.0002,
"loss": 0.6733279228210449,
"mean_token_accuracy": 0.732945054769516,
"num_tokens": 1239141.0,
"step": 33
},
{
"entropy": 0.6605517789721489,
"epoch": 0.2176,
"grad_norm": 0.020387521013617516,
"learning_rate": 0.0002,
"loss": 0.6627103090286255,
"mean_token_accuracy": 0.737023763358593,
"num_tokens": 1276671.0,
"step": 34
},
{
"entropy": 0.6582437306642532,
"epoch": 0.224,
"grad_norm": 0.020866557955741882,
"learning_rate": 0.0002,
"loss": 0.666618824005127,
"mean_token_accuracy": 0.7362421080470085,
"num_tokens": 1314330.0,
"step": 35
},
{
"entropy": 0.6579794958233833,
"epoch": 0.2304,
"grad_norm": 0.01998458243906498,
"learning_rate": 0.0002,
"loss": 0.6648584008216858,
"mean_token_accuracy": 0.7348862290382385,
"num_tokens": 1351870.0,
"step": 36
},
{
"entropy": 0.6570402011275291,
"epoch": 0.2368,
"grad_norm": 0.021064545959234238,
"learning_rate": 0.0002,
"loss": 0.666895866394043,
"mean_token_accuracy": 0.7330928146839142,
"num_tokens": 1389586.0,
"step": 37
},
{
"entropy": 0.6450310498476028,
"epoch": 0.2432,
"grad_norm": 0.02274121530354023,
"learning_rate": 0.0002,
"loss": 0.6487395763397217,
"mean_token_accuracy": 0.7399148046970367,
"num_tokens": 1427289.0,
"step": 38
},
{
"entropy": 0.6655421927571297,
"epoch": 0.2496,
"grad_norm": 0.019761748611927032,
"learning_rate": 0.0002,
"loss": 0.6655306816101074,
"mean_token_accuracy": 0.7331964820623398,
"num_tokens": 1464754.0,
"step": 39
},
{
"entropy": 0.6678934022784233,
"epoch": 0.256,
"grad_norm": 0.020196782425045967,
"learning_rate": 0.0002,
"loss": 0.6606800556182861,
"mean_token_accuracy": 0.7348242327570915,
"num_tokens": 1502466.0,
"step": 40
},
{
"entropy": 0.6633569970726967,
"epoch": 0.2624,
"grad_norm": 0.01856420934200287,
"learning_rate": 0.0002,
"loss": 0.6598410606384277,
"mean_token_accuracy": 0.7345370575785637,
"num_tokens": 1539911.0,
"step": 41
},
{
"entropy": 0.6672858148813248,
"epoch": 0.2688,
"grad_norm": 0.019625825807452202,
"learning_rate": 0.0002,
"loss": 0.6584136486053467,
"mean_token_accuracy": 0.7353677749633789,
"num_tokens": 1577459.0,
"step": 42
},
{
"entropy": 0.6759661063551903,
"epoch": 0.2752,
"grad_norm": 0.019913548603653908,
"learning_rate": 0.0002,
"loss": 0.6726773977279663,
"mean_token_accuracy": 0.729034997522831,
"num_tokens": 1615462.0,
"step": 43
},
{
"entropy": 0.6660498529672623,
"epoch": 0.2816,
"grad_norm": 0.014487133361399174,
"learning_rate": 0.0002,
"loss": 0.6681607961654663,
"mean_token_accuracy": 0.7323712110519409,
"num_tokens": 1652949.0,
"step": 44
},
{
"entropy": 0.6481832191348076,
"epoch": 0.288,
"grad_norm": 0.01776648312807083,
"learning_rate": 0.0002,
"loss": 0.6530840396881104,
"mean_token_accuracy": 0.7379923015832901,
"num_tokens": 1690313.0,
"step": 45
},
{
"entropy": 0.6430671736598015,
"epoch": 0.2944,
"grad_norm": 0.018955176696181297,
"learning_rate": 0.0002,
"loss": 0.6464742422103882,
"mean_token_accuracy": 0.7409427240490913,
"num_tokens": 1727486.0,
"step": 46
},
{
"entropy": 0.6565458923578262,
"epoch": 0.3008,
"grad_norm": 0.015031078830361366,
"learning_rate": 0.0002,
"loss": 0.6587884426116943,
"mean_token_accuracy": 0.7355991005897522,
"num_tokens": 1765413.0,
"step": 47
},
{
"entropy": 0.6365433260798454,
"epoch": 0.3072,
"grad_norm": 0.017183614894747734,
"learning_rate": 0.0002,
"loss": 0.6374931335449219,
"mean_token_accuracy": 0.7455704137682915,
"num_tokens": 1803010.0,
"step": 48
},
{
"entropy": 0.6563282832503319,
"epoch": 0.3136,
"grad_norm": 0.01428211573511362,
"learning_rate": 0.0002,
"loss": 0.6553747057914734,
"mean_token_accuracy": 0.7369147315621376,
"num_tokens": 1840622.0,
"step": 49
},
{
"entropy": 0.6499469205737114,
"epoch": 0.32,
"grad_norm": 0.01203683577477932,
"learning_rate": 0.0002,
"loss": 0.6548190116882324,
"mean_token_accuracy": 0.736673392355442,
"num_tokens": 1877938.0,
"step": 50
},
{
"entropy": 0.6385157108306885,
"epoch": 0.3264,
"grad_norm": 0.013347586616873741,
"learning_rate": 0.0002,
"loss": 0.6381226778030396,
"mean_token_accuracy": 0.7450113892555237,
"num_tokens": 1915406.0,
"step": 51
},
{
"entropy": 0.6538697853684425,
"epoch": 0.3328,
"grad_norm": 0.012674320489168167,
"learning_rate": 0.0002,
"loss": 0.6501171588897705,
"mean_token_accuracy": 0.739890843629837,
"num_tokens": 1952912.0,
"step": 52
},
{
"entropy": 0.6603258103132248,
"epoch": 0.3392,
"grad_norm": 0.01250320952385664,
"learning_rate": 0.0002,
"loss": 0.6589174270629883,
"mean_token_accuracy": 0.7365714758634567,
"num_tokens": 1990472.0,
"step": 53
},
{
"entropy": 0.656892940402031,
"epoch": 0.3456,
"grad_norm": 0.01285612117499113,
"learning_rate": 0.0002,
"loss": 0.6544902324676514,
"mean_token_accuracy": 0.7372777089476585,
"num_tokens": 2028004.0,
"step": 54
},
{
"entropy": 0.6557554453611374,
"epoch": 0.352,
"grad_norm": 0.013015029951930046,
"learning_rate": 0.0002,
"loss": 0.6539305448532104,
"mean_token_accuracy": 0.7372152432799339,
"num_tokens": 2065450.0,
"step": 55
},
{
"entropy": 0.6432914957404137,
"epoch": 0.3584,
"grad_norm": 0.01194705069065094,
"learning_rate": 0.0002,
"loss": 0.6476873755455017,
"mean_token_accuracy": 0.7385553196072578,
"num_tokens": 2103001.0,
"step": 56
},
{
"entropy": 0.665123961865902,
"epoch": 0.3648,
"grad_norm": 0.014306853525340557,
"learning_rate": 0.0002,
"loss": 0.6692231893539429,
"mean_token_accuracy": 0.7308292016386986,
"num_tokens": 2140766.0,
"step": 57
},
{
"entropy": 0.6395360752940178,
"epoch": 0.3712,
"grad_norm": 0.012413417920470238,
"learning_rate": 0.0002,
"loss": 0.6425060033798218,
"mean_token_accuracy": 0.7416690960526466,
"num_tokens": 2178215.0,
"step": 58
},
{
"entropy": 0.6377176344394684,
"epoch": 0.3776,
"grad_norm": 0.011347637511789799,
"learning_rate": 0.0002,
"loss": 0.6416236162185669,
"mean_token_accuracy": 0.7413541078567505,
"num_tokens": 2215834.0,
"step": 59
},
{
"entropy": 0.6470205709338188,
"epoch": 0.384,
"grad_norm": 0.013059594668447971,
"learning_rate": 0.0002,
"loss": 0.6504924297332764,
"mean_token_accuracy": 0.7374131381511688,
"num_tokens": 2253236.0,
"step": 60
},
{
"entropy": 0.6510438621044159,
"epoch": 0.3904,
"grad_norm": 0.010343637317419052,
"learning_rate": 0.0002,
"loss": 0.6483369469642639,
"mean_token_accuracy": 0.7396193742752075,
"num_tokens": 2290556.0,
"step": 61
},
{
"entropy": 0.6448361873626709,
"epoch": 0.3968,
"grad_norm": 0.01215020939707756,
"learning_rate": 0.0002,
"loss": 0.6442714929580688,
"mean_token_accuracy": 0.7406364679336548,
"num_tokens": 2327838.0,
"step": 62
},
{
"entropy": 0.6578632816672325,
"epoch": 0.4032,
"grad_norm": 0.013611266389489174,
"learning_rate": 0.0002,
"loss": 0.650489330291748,
"mean_token_accuracy": 0.737756036221981,
"num_tokens": 2365216.0,
"step": 63
},
{
"entropy": 0.6599203571677208,
"epoch": 0.4096,
"grad_norm": 0.013333442620933056,
"learning_rate": 0.0002,
"loss": 0.6547380089759827,
"mean_token_accuracy": 0.7386084869503975,
"num_tokens": 2403044.0,
"step": 64
},
{
"entropy": 0.6421995609998703,
"epoch": 0.416,
"grad_norm": 0.013022989965975285,
"learning_rate": 0.0002,
"loss": 0.6451696157455444,
"mean_token_accuracy": 0.7419813498854637,
"num_tokens": 2440509.0,
"step": 65
},
{
"entropy": 0.6482381522655487,
"epoch": 0.4224,
"grad_norm": 0.011019188910722733,
"learning_rate": 0.0002,
"loss": 0.6525042057037354,
"mean_token_accuracy": 0.7360658198595047,
"num_tokens": 2477977.0,
"step": 66
},
{
"entropy": 0.6513727456331253,
"epoch": 0.4288,
"grad_norm": 0.011377367191016674,
"learning_rate": 0.0002,
"loss": 0.6533432006835938,
"mean_token_accuracy": 0.7368385717272758,
"num_tokens": 2515504.0,
"step": 67
},
{
"entropy": 0.6338299661874771,
"epoch": 0.4352,
"grad_norm": 0.012209996581077576,
"learning_rate": 0.0002,
"loss": 0.6345840692520142,
"mean_token_accuracy": 0.7449672818183899,
"num_tokens": 2552725.0,
"step": 68
},
{
"entropy": 0.6595024093985558,
"epoch": 0.4416,
"grad_norm": 0.011869995854794979,
"learning_rate": 0.0002,
"loss": 0.6633318066596985,
"mean_token_accuracy": 0.7312925457954407,
"num_tokens": 2590334.0,
"step": 69
},
{
"entropy": 0.6419216245412827,
"epoch": 0.448,
"grad_norm": 0.011688044294714928,
"learning_rate": 0.0002,
"loss": 0.6422508955001831,
"mean_token_accuracy": 0.7409501895308495,
"num_tokens": 2628114.0,
"step": 70
},
{
"entropy": 0.6486918181180954,
"epoch": 0.4544,
"grad_norm": 0.012189529836177826,
"learning_rate": 0.0002,
"loss": 0.6435794830322266,
"mean_token_accuracy": 0.7398836389183998,
"num_tokens": 2665938.0,
"step": 71
},
{
"entropy": 0.6421536579728127,
"epoch": 0.4608,
"grad_norm": 0.01274161972105503,
"learning_rate": 0.0002,
"loss": 0.639503538608551,
"mean_token_accuracy": 0.7419992312788963,
"num_tokens": 2703327.0,
"step": 72
},
{
"entropy": 0.6552243158221245,
"epoch": 0.4672,
"grad_norm": 0.011226268485188484,
"learning_rate": 0.0002,
"loss": 0.6587808132171631,
"mean_token_accuracy": 0.7335348948836327,
"num_tokens": 2740612.0,
"step": 73
},
{
"entropy": 0.6495375782251358,
"epoch": 0.4736,
"grad_norm": 0.01099670771509409,
"learning_rate": 0.0002,
"loss": 0.6522738933563232,
"mean_token_accuracy": 0.7379574105143547,
"num_tokens": 2778351.0,
"step": 74
},
{
"entropy": 0.6299872100353241,
"epoch": 0.48,
"grad_norm": 0.011653655208647251,
"learning_rate": 0.0002,
"loss": 0.635120153427124,
"mean_token_accuracy": 0.7442547604441643,
"num_tokens": 2815733.0,
"step": 75
},
{
"entropy": 0.646803118288517,
"epoch": 0.4864,
"grad_norm": 0.011539405211806297,
"learning_rate": 0.0002,
"loss": 0.6486905813217163,
"mean_token_accuracy": 0.7385760024189949,
"num_tokens": 2853606.0,
"step": 76
},
{
"entropy": 0.6475054696202278,
"epoch": 0.4928,
"grad_norm": 0.011377925053238869,
"learning_rate": 0.0002,
"loss": 0.6478685140609741,
"mean_token_accuracy": 0.7385416328907013,
"num_tokens": 2891146.0,
"step": 77
},
{
"entropy": 0.6380101665854454,
"epoch": 0.4992,
"grad_norm": 0.011224031448364258,
"learning_rate": 0.0002,
"loss": 0.6410291194915771,
"mean_token_accuracy": 0.7412817031145096,
"num_tokens": 2928562.0,
"step": 78
},
{
"entropy": 0.6493655145168304,
"epoch": 0.5056,
"grad_norm": 0.010403023101389408,
"learning_rate": 0.0002,
"loss": 0.6491314768791199,
"mean_token_accuracy": 0.7371294796466827,
"num_tokens": 2966281.0,
"step": 79
},
{
"entropy": 0.6337103247642517,
"epoch": 0.512,
"grad_norm": 0.012346550822257996,
"learning_rate": 0.0002,
"loss": 0.6318129301071167,
"mean_token_accuracy": 0.7457293793559074,
"num_tokens": 3003719.0,
"step": 80
},
{
"entropy": 0.6503832414746284,
"epoch": 0.5184,
"grad_norm": 0.012706570327281952,
"learning_rate": 0.0002,
"loss": 0.6492017507553101,
"mean_token_accuracy": 0.7375014126300812,
"num_tokens": 3041261.0,
"step": 81
},
{
"entropy": 0.6609693467617035,
"epoch": 0.5248,
"grad_norm": 0.010637188330292702,
"learning_rate": 0.0002,
"loss": 0.6600979566574097,
"mean_token_accuracy": 0.7335498854517937,
"num_tokens": 3078968.0,
"step": 82
},
{
"entropy": 0.6473255082964897,
"epoch": 0.5312,
"grad_norm": 0.01124926470220089,
"learning_rate": 0.0002,
"loss": 0.6503981351852417,
"mean_token_accuracy": 0.7380518168210983,
"num_tokens": 3116811.0,
"step": 83
},
{
"entropy": 0.6533865705132484,
"epoch": 0.5376,
"grad_norm": 0.012132731266319752,
"learning_rate": 0.0002,
"loss": 0.6592696309089661,
"mean_token_accuracy": 0.733529195189476,
"num_tokens": 3154474.0,
"step": 84
},
{
"entropy": 0.639193020761013,
"epoch": 0.544,
"grad_norm": 0.011734750121831894,
"learning_rate": 0.0002,
"loss": 0.6403356790542603,
"mean_token_accuracy": 0.7433002889156342,
"num_tokens": 3192006.0,
"step": 85
},
{
"entropy": 0.6401269435882568,
"epoch": 0.5504,
"grad_norm": 0.010875481180846691,
"learning_rate": 0.0002,
"loss": 0.6439944505691528,
"mean_token_accuracy": 0.7402178049087524,
"num_tokens": 3229461.0,
"step": 86
},
{
"entropy": 0.6467242240905762,
"epoch": 0.5568,
"grad_norm": 0.01122159045189619,
"learning_rate": 0.0002,
"loss": 0.65086829662323,
"mean_token_accuracy": 0.7366317883133888,
"num_tokens": 3266854.0,
"step": 87
},
{
"entropy": 0.6459343954920769,
"epoch": 0.5632,
"grad_norm": 0.01132342778146267,
"learning_rate": 0.0002,
"loss": 0.6473137140274048,
"mean_token_accuracy": 0.7397668585181236,
"num_tokens": 3304594.0,
"step": 88
},
{
"entropy": 0.6517693251371384,
"epoch": 0.5696,
"grad_norm": 0.01150190457701683,
"learning_rate": 0.0002,
"loss": 0.647284746170044,
"mean_token_accuracy": 0.7392672076821327,
"num_tokens": 3341878.0,
"step": 89
},
{
"entropy": 0.6644957289099693,
"epoch": 0.576,
"grad_norm": 0.011668134480714798,
"learning_rate": 0.0002,
"loss": 0.6594465970993042,
"mean_token_accuracy": 0.7339938580989838,
"num_tokens": 3379626.0,
"step": 90
},
{
"entropy": 0.6448649242520332,
"epoch": 0.5824,
"grad_norm": 0.012058609165251255,
"learning_rate": 0.0002,
"loss": 0.6404842734336853,
"mean_token_accuracy": 0.7406293153762817,
"num_tokens": 3417230.0,
"step": 91
},
{
"entropy": 0.6402811780571938,
"epoch": 0.5888,
"grad_norm": 0.011592954397201538,
"learning_rate": 0.0002,
"loss": 0.6447786092758179,
"mean_token_accuracy": 0.7402076348662376,
"num_tokens": 3454690.0,
"step": 92
},
{
"entropy": 0.6428509131073952,
"epoch": 0.5952,
"grad_norm": 0.012272155843675137,
"learning_rate": 0.0002,
"loss": 0.6479693651199341,
"mean_token_accuracy": 0.7390052601695061,
"num_tokens": 3492182.0,
"step": 93
},
{
"entropy": 0.6426275372505188,
"epoch": 0.6016,
"grad_norm": 0.01083293091505766,
"learning_rate": 0.0002,
"loss": 0.644639253616333,
"mean_token_accuracy": 0.740093432366848,
"num_tokens": 3530068.0,
"step": 94
},
{
"entropy": 0.626714438199997,
"epoch": 0.608,
"grad_norm": 0.010761498473584652,
"learning_rate": 0.0002,
"loss": 0.628358006477356,
"mean_token_accuracy": 0.746553897857666,
"num_tokens": 3567305.0,
"step": 95
},
{
"entropy": 0.6431040018796921,
"epoch": 0.6144,
"grad_norm": 0.012162288650870323,
"learning_rate": 0.0002,
"loss": 0.6470193862915039,
"mean_token_accuracy": 0.7389233484864235,
"num_tokens": 3604807.0,
"step": 96
},
{
"entropy": 0.645052507519722,
"epoch": 0.6208,
"grad_norm": 0.010187218897044659,
"learning_rate": 0.0002,
"loss": 0.6489447951316833,
"mean_token_accuracy": 0.738676629960537,
"num_tokens": 3642594.0,
"step": 97
},
{
"entropy": 0.6390751749277115,
"epoch": 0.6272,
"grad_norm": 0.01165873184800148,
"learning_rate": 0.0002,
"loss": 0.643662691116333,
"mean_token_accuracy": 0.7390685454010963,
"num_tokens": 3680543.0,
"step": 98
},
{
"entropy": 0.6514940857887268,
"epoch": 0.6336,
"grad_norm": 0.010981060564517975,
"learning_rate": 0.0002,
"loss": 0.6510151624679565,
"mean_token_accuracy": 0.7382907196879387,
"num_tokens": 3717970.0,
"step": 99
},
{
"entropy": 0.6472062841057777,
"epoch": 0.64,
"grad_norm": 0.012016931548714638,
"learning_rate": 0.0002,
"loss": 0.6510175466537476,
"mean_token_accuracy": 0.7374041378498077,
"num_tokens": 3755566.0,
"step": 100
},
{
"entropy": 0.6526609882712364,
"epoch": 0.6464,
"grad_norm": 0.010779659263789654,
"learning_rate": 0.0002,
"loss": 0.6495513916015625,
"mean_token_accuracy": 0.7356445118784904,
"num_tokens": 3793159.0,
"step": 101
},
{
"entropy": 0.6481966897845268,
"epoch": 0.6528,
"grad_norm": 0.010695680044591427,
"learning_rate": 0.0002,
"loss": 0.6442012786865234,
"mean_token_accuracy": 0.7392323464155197,
"num_tokens": 3830925.0,
"step": 102
},
{
"entropy": 0.6423428729176521,
"epoch": 0.6592,
"grad_norm": 0.009773760102689266,
"learning_rate": 0.0002,
"loss": 0.6454004049301147,
"mean_token_accuracy": 0.7405061349272728,
"num_tokens": 3868672.0,
"step": 103
},
{
"entropy": 0.6281508877873421,
"epoch": 0.6656,
"grad_norm": 0.01067226193845272,
"learning_rate": 0.0002,
"loss": 0.6323127150535583,
"mean_token_accuracy": 0.743611678481102,
"num_tokens": 3905993.0,
"step": 104
},
{
"entropy": 0.6415385156869888,
"epoch": 0.672,
"grad_norm": 0.01100232359021902,
"learning_rate": 0.0002,
"loss": 0.6450967192649841,
"mean_token_accuracy": 0.741372749209404,
"num_tokens": 3943387.0,
"step": 105
},
{
"entropy": 0.6479355171322823,
"epoch": 0.6784,
"grad_norm": 0.011068901047110558,
"learning_rate": 0.0002,
"loss": 0.6533315777778625,
"mean_token_accuracy": 0.7338352426886559,
"num_tokens": 3981143.0,
"step": 106
},
{
"entropy": 0.6498983204364777,
"epoch": 0.6848,
"grad_norm": 0.010501043871045113,
"learning_rate": 0.0002,
"loss": 0.6492184400558472,
"mean_token_accuracy": 0.7377433255314827,
"num_tokens": 4018874.0,
"step": 107
},
{
"entropy": 0.6513847932219505,
"epoch": 0.6912,
"grad_norm": 0.012076501734554768,
"learning_rate": 0.0002,
"loss": 0.6527359485626221,
"mean_token_accuracy": 0.7364412918686867,
"num_tokens": 4056434.0,
"step": 108
},
{
"entropy": 0.6415090262889862,
"epoch": 0.6976,
"grad_norm": 0.01073481049388647,
"learning_rate": 0.0002,
"loss": 0.6410619020462036,
"mean_token_accuracy": 0.740181528031826,
"num_tokens": 4094245.0,
"step": 109
},
{
"entropy": 0.6442006528377533,
"epoch": 0.704,
"grad_norm": 0.011465134099125862,
"learning_rate": 0.0002,
"loss": 0.6447471380233765,
"mean_token_accuracy": 0.7409348115324974,
"num_tokens": 4131358.0,
"step": 110
},
{
"entropy": 0.6425353735685349,
"epoch": 0.7104,
"grad_norm": 0.011008083820343018,
"learning_rate": 0.0002,
"loss": 0.6414906978607178,
"mean_token_accuracy": 0.7418420538306236,
"num_tokens": 4169051.0,
"step": 111
},
{
"entropy": 0.65395537763834,
"epoch": 0.7168,
"grad_norm": 0.010419737547636032,
"learning_rate": 0.0002,
"loss": 0.6524069309234619,
"mean_token_accuracy": 0.736035592854023,
"num_tokens": 4206785.0,
"step": 112
},
{
"entropy": 0.6436598747968674,
"epoch": 0.7232,
"grad_norm": 0.01072368398308754,
"learning_rate": 0.0002,
"loss": 0.646194338798523,
"mean_token_accuracy": 0.7391205802559853,
"num_tokens": 4243952.0,
"step": 113
},
{
"entropy": 0.6517779007554054,
"epoch": 0.7296,
"grad_norm": 0.010077660903334618,
"learning_rate": 0.0002,
"loss": 0.6503125429153442,
"mean_token_accuracy": 0.7375629469752312,
"num_tokens": 4281302.0,
"step": 114
},
{
"entropy": 0.6431594043970108,
"epoch": 0.736,
"grad_norm": 0.009454594925045967,
"learning_rate": 0.0002,
"loss": 0.647723913192749,
"mean_token_accuracy": 0.7380199134349823,
"num_tokens": 4318445.0,
"step": 115
},
{
"entropy": 0.6490769982337952,
"epoch": 0.7424,
"grad_norm": 0.010790850967168808,
"learning_rate": 0.0002,
"loss": 0.6519957780838013,
"mean_token_accuracy": 0.7370847165584564,
"num_tokens": 4356069.0,
"step": 116
},
{
"entropy": 0.6421378776431084,
"epoch": 0.7488,
"grad_norm": 0.011676953174173832,
"learning_rate": 0.0002,
"loss": 0.6456701755523682,
"mean_token_accuracy": 0.7384574711322784,
"num_tokens": 4393886.0,
"step": 117
},
{
"entropy": 0.6397042796015739,
"epoch": 0.7552,
"grad_norm": 0.009942916221916676,
"learning_rate": 0.0002,
"loss": 0.6421793699264526,
"mean_token_accuracy": 0.7401494830846786,
"num_tokens": 4431050.0,
"step": 118
},
{
"entropy": 0.6442151814699173,
"epoch": 0.7616,
"grad_norm": 0.010225712321698666,
"learning_rate": 0.0002,
"loss": 0.6509747505187988,
"mean_token_accuracy": 0.7365128919482231,
"num_tokens": 4468708.0,
"step": 119
},
{
"entropy": 0.6483751237392426,
"epoch": 0.768,
"grad_norm": 0.010288415476679802,
"learning_rate": 0.0002,
"loss": 0.6510953903198242,
"mean_token_accuracy": 0.7370466068387032,
"num_tokens": 4506387.0,
"step": 120
},
{
"entropy": 0.6402674838900566,
"epoch": 0.7744,
"grad_norm": 0.011825313791632652,
"learning_rate": 0.0002,
"loss": 0.6385786533355713,
"mean_token_accuracy": 0.7403052300214767,
"num_tokens": 4544227.0,
"step": 121
},
{
"entropy": 0.6531669348478317,
"epoch": 0.7808,
"grad_norm": 0.009835828095674515,
"learning_rate": 0.0002,
"loss": 0.6538360118865967,
"mean_token_accuracy": 0.73631202429533,
"num_tokens": 4581868.0,
"step": 122
},
{
"entropy": 0.6490024328231812,
"epoch": 0.7872,
"grad_norm": 0.01063550915569067,
"learning_rate": 0.0002,
"loss": 0.6501119136810303,
"mean_token_accuracy": 0.7366527765989304,
"num_tokens": 4619257.0,
"step": 123
},
{
"entropy": 0.6489348411560059,
"epoch": 0.7936,
"grad_norm": 0.009436458349227905,
"learning_rate": 0.0002,
"loss": 0.6502528786659241,
"mean_token_accuracy": 0.7353222295641899,
"num_tokens": 4656790.0,
"step": 124
},
{
"entropy": 0.6380393132567406,
"epoch": 0.8,
"grad_norm": 0.009827700443565845,
"learning_rate": 0.0002,
"loss": 0.640160322189331,
"mean_token_accuracy": 0.7403444275259972,
"num_tokens": 4694256.0,
"step": 125
},
{
"entropy": 0.6383800283074379,
"epoch": 0.8064,
"grad_norm": 0.009908480569720268,
"learning_rate": 0.0002,
"loss": 0.6422752737998962,
"mean_token_accuracy": 0.7412146180868149,
"num_tokens": 4731993.0,
"step": 126
},
{
"entropy": 0.6368249654769897,
"epoch": 0.8128,
"grad_norm": 0.011256285011768341,
"learning_rate": 0.0002,
"loss": 0.6375234723091125,
"mean_token_accuracy": 0.7389892339706421,
"num_tokens": 4769564.0,
"step": 127
},
{
"entropy": 0.6328444108366966,
"epoch": 0.8192,
"grad_norm": 0.009496535174548626,
"learning_rate": 0.0002,
"loss": 0.6372179985046387,
"mean_token_accuracy": 0.7419247180223465,
"num_tokens": 4807156.0,
"step": 128
},
{
"entropy": 0.6487380862236023,
"epoch": 0.8256,
"grad_norm": 0.010182644240558147,
"learning_rate": 0.0002,
"loss": 0.651898980140686,
"mean_token_accuracy": 0.7349159717559814,
"num_tokens": 4844688.0,
"step": 129
},
{
"entropy": 0.637291207909584,
"epoch": 0.832,
"grad_norm": 0.009813020937144756,
"learning_rate": 0.0002,
"loss": 0.6357983350753784,
"mean_token_accuracy": 0.7435917556285858,
"num_tokens": 4882067.0,
"step": 130
},
{
"entropy": 0.6475042626261711,
"epoch": 0.8384,
"grad_norm": 0.009938180446624756,
"learning_rate": 0.0002,
"loss": 0.6457779407501221,
"mean_token_accuracy": 0.7377768382430077,
"num_tokens": 4919683.0,
"step": 131
},
{
"entropy": 0.6361658647656441,
"epoch": 0.8448,
"grad_norm": 0.01157945767045021,
"learning_rate": 0.0002,
"loss": 0.6357731819152832,
"mean_token_accuracy": 0.7428592145442963,
"num_tokens": 4957344.0,
"step": 132
},
{
"entropy": 0.6509395390748978,
"epoch": 0.8512,
"grad_norm": 0.010125997476279736,
"learning_rate": 0.0002,
"loss": 0.6515601873397827,
"mean_token_accuracy": 0.7356820181012154,
"num_tokens": 4994764.0,
"step": 133
},
{
"entropy": 0.6364396661520004,
"epoch": 0.8576,
"grad_norm": 0.01021180022507906,
"learning_rate": 0.0002,
"loss": 0.6399521827697754,
"mean_token_accuracy": 0.7389387339353561,
"num_tokens": 5032302.0,
"step": 134
},
{
"entropy": 0.6350365057587624,
"epoch": 0.864,
"grad_norm": 0.010611058212816715,
"learning_rate": 0.0002,
"loss": 0.6368668675422668,
"mean_token_accuracy": 0.7429890111088753,
"num_tokens": 5069759.0,
"step": 135
},
{
"entropy": 0.6327914297580719,
"epoch": 0.8704,
"grad_norm": 0.009575539268553257,
"learning_rate": 0.0002,
"loss": 0.6354016065597534,
"mean_token_accuracy": 0.7427869364619255,
"num_tokens": 5107295.0,
"step": 136
},
{
"entropy": 0.6594432219862938,
"epoch": 0.8768,
"grad_norm": 0.00979944784194231,
"learning_rate": 0.0002,
"loss": 0.6595268249511719,
"mean_token_accuracy": 0.7346527501940727,
"num_tokens": 5145124.0,
"step": 137
},
{
"entropy": 0.6408862993121147,
"epoch": 0.8832,
"grad_norm": 0.011191108264029026,
"learning_rate": 0.0002,
"loss": 0.6428693532943726,
"mean_token_accuracy": 0.7407258599996567,
"num_tokens": 5182599.0,
"step": 138
},
{
"entropy": 0.6376849785447121,
"epoch": 0.8896,
"grad_norm": 0.010853955522179604,
"learning_rate": 0.0002,
"loss": 0.6410936713218689,
"mean_token_accuracy": 0.7405535206198692,
"num_tokens": 5220168.0,
"step": 139
},
{
"entropy": 0.6452121436595917,
"epoch": 0.896,
"grad_norm": 0.010287974961102009,
"learning_rate": 0.0002,
"loss": 0.6451249122619629,
"mean_token_accuracy": 0.7396348267793655,
"num_tokens": 5257986.0,
"step": 140
},
{
"entropy": 0.6390210688114166,
"epoch": 0.9024,
"grad_norm": 0.011026793159544468,
"learning_rate": 0.0002,
"loss": 0.644250750541687,
"mean_token_accuracy": 0.7396276742219925,
"num_tokens": 5295673.0,
"step": 141
},
{
"entropy": 0.6457666233181953,
"epoch": 0.9088,
"grad_norm": 0.00994186196476221,
"learning_rate": 0.0002,
"loss": 0.6455720663070679,
"mean_token_accuracy": 0.7386891022324562,
"num_tokens": 5333647.0,
"step": 142
},
{
"entropy": 0.6408794969320297,
"epoch": 0.9152,
"grad_norm": 0.011928732506930828,
"learning_rate": 0.0002,
"loss": 0.6402020454406738,
"mean_token_accuracy": 0.742262989282608,
"num_tokens": 5371718.0,
"step": 143
},
{
"entropy": 0.6543991938233376,
"epoch": 0.9216,
"grad_norm": 0.010643723420798779,
"learning_rate": 0.0002,
"loss": 0.6522170305252075,
"mean_token_accuracy": 0.735626682639122,
"num_tokens": 5409417.0,
"step": 144
},
{
"entropy": 0.6360428184270859,
"epoch": 0.928,
"grad_norm": 0.010354955680668354,
"learning_rate": 0.0002,
"loss": 0.633360743522644,
"mean_token_accuracy": 0.7439651861786842,
"num_tokens": 5447224.0,
"step": 145
},
{
"entropy": 0.6295241191983223,
"epoch": 0.9344,
"grad_norm": 0.009584055282175541,
"learning_rate": 0.0002,
"loss": 0.6330816745758057,
"mean_token_accuracy": 0.743884801864624,
"num_tokens": 5484456.0,
"step": 146
},
{
"entropy": 0.6305922344326973,
"epoch": 0.9408,
"grad_norm": 0.012600995600223541,
"learning_rate": 0.0002,
"loss": 0.6410214900970459,
"mean_token_accuracy": 0.7401221916079521,
"num_tokens": 5521974.0,
"step": 147
},
{
"entropy": 0.6405795589089394,
"epoch": 0.9472,
"grad_norm": 0.012624030001461506,
"learning_rate": 0.0002,
"loss": 0.6476458311080933,
"mean_token_accuracy": 0.7366938292980194,
"num_tokens": 5559577.0,
"step": 148
},
{
"entropy": 0.6548889800906181,
"epoch": 0.9536,
"grad_norm": 0.009168867953121662,
"learning_rate": 0.0002,
"loss": 0.6527200937271118,
"mean_token_accuracy": 0.7344470545649529,
"num_tokens": 5597209.0,
"step": 149
},
{
"entropy": 0.6553688123822212,
"epoch": 0.96,
"grad_norm": 0.011672625318169594,
"learning_rate": 0.0002,
"loss": 0.6522246599197388,
"mean_token_accuracy": 0.735475592315197,
"num_tokens": 5634927.0,
"step": 150
},
{
"entropy": 0.6557204276323318,
"epoch": 0.9664,
"grad_norm": 0.010263725183904171,
"learning_rate": 0.0002,
"loss": 0.6540011167526245,
"mean_token_accuracy": 0.7331173792481422,
"num_tokens": 5672469.0,
"step": 151
},
{
"entropy": 0.6292876526713371,
"epoch": 0.9728,
"grad_norm": 0.009562517516314983,
"learning_rate": 0.0002,
"loss": 0.6356937289237976,
"mean_token_accuracy": 0.7415798529982567,
"num_tokens": 5709851.0,
"step": 152
},
{
"entropy": 0.6344784423708916,
"epoch": 0.9792,
"grad_norm": 0.010696685872972012,
"learning_rate": 0.0002,
"loss": 0.6421383023262024,
"mean_token_accuracy": 0.7404361814260483,
"num_tokens": 5747183.0,
"step": 153
},
{
"entropy": 0.6344292610883713,
"epoch": 0.9856,
"grad_norm": 0.01072372030466795,
"learning_rate": 0.0002,
"loss": 0.6366742253303528,
"mean_token_accuracy": 0.7436658665537834,
"num_tokens": 5785030.0,
"step": 154
},
{
"entropy": 0.64640112221241,
"epoch": 0.992,
"grad_norm": 0.009201000444591045,
"learning_rate": 0.0002,
"loss": 0.6510665416717529,
"mean_token_accuracy": 0.7334160059690475,
"num_tokens": 5822675.0,
"step": 155
},
{
"entropy": 0.6349588707089424,
"epoch": 0.9984,
"grad_norm": 0.009053889662027359,
"learning_rate": 0.0002,
"loss": 0.6340664625167847,
"mean_token_accuracy": 0.743820808827877,
"num_tokens": 5860056.0,
"step": 156
},
{
"entropy": 0.6518890261650085,
"epoch": 1.0,
"grad_norm": 0.01602179929614067,
"learning_rate": 0.0002,
"loss": 0.6524105072021484,
"mean_token_accuracy": 0.7354754209518433,
"num_tokens": 5869314.0,
"step": 157
},
{
"entropy": 0.6527635008096695,
"epoch": 1.0064,
"grad_norm": 0.011629520915448666,
"learning_rate": 0.0002,
"loss": 0.648344099521637,
"mean_token_accuracy": 0.7363307550549507,
"num_tokens": 5907492.0,
"step": 158
},
{
"entropy": 0.6342032626271248,
"epoch": 1.0128,
"grad_norm": 0.009327917359769344,
"learning_rate": 0.0002,
"loss": 0.6365879774093628,
"mean_token_accuracy": 0.7422033324837685,
"num_tokens": 5945150.0,
"step": 159
},
{
"entropy": 0.6452426686882973,
"epoch": 1.0192,
"grad_norm": 0.009940714575350285,
"learning_rate": 0.0002,
"loss": 0.6485167741775513,
"mean_token_accuracy": 0.7388251274824142,
"num_tokens": 5983293.0,
"step": 160
},
{
"entropy": 0.6330019310116768,
"epoch": 1.0256,
"grad_norm": 0.010047292336821556,
"learning_rate": 0.0002,
"loss": 0.6353905200958252,
"mean_token_accuracy": 0.7421540543437004,
"num_tokens": 6020861.0,
"step": 161
},
{
"entropy": 0.6366018727421761,
"epoch": 1.032,
"grad_norm": 0.010758111253380775,
"learning_rate": 0.0002,
"loss": 0.6427363157272339,
"mean_token_accuracy": 0.7399178668856621,
"num_tokens": 6058895.0,
"step": 162
},
{
"entropy": 0.6386806666851044,
"epoch": 1.0384,
"grad_norm": 0.010479118674993515,
"learning_rate": 0.0002,
"loss": 0.6465561389923096,
"mean_token_accuracy": 0.7374918833374977,
"num_tokens": 6096481.0,
"step": 163
},
{
"entropy": 0.6303133890032768,
"epoch": 1.0448,
"grad_norm": 0.009492664597928524,
"learning_rate": 0.0002,
"loss": 0.6275724172592163,
"mean_token_accuracy": 0.7442837283015251,
"num_tokens": 6133720.0,
"step": 164
},
{
"entropy": 0.641479380428791,
"epoch": 1.0512,
"grad_norm": 0.011456873267889023,
"learning_rate": 0.0002,
"loss": 0.6362390518188477,
"mean_token_accuracy": 0.741039365530014,
"num_tokens": 6171551.0,
"step": 165
},
{
"entropy": 0.635175496339798,
"epoch": 1.0576,
"grad_norm": 0.009045133367180824,
"learning_rate": 0.0002,
"loss": 0.636081874370575,
"mean_token_accuracy": 0.7414724603295326,
"num_tokens": 6209178.0,
"step": 166
},
{
"entropy": 0.6251291632652283,
"epoch": 1.064,
"grad_norm": 0.013078802265226841,
"learning_rate": 0.0002,
"loss": 0.6349364519119263,
"mean_token_accuracy": 0.7421944439411163,
"num_tokens": 6246417.0,
"step": 167
},
{
"entropy": 0.6297666281461716,
"epoch": 1.0704,
"grad_norm": 0.011462744325399399,
"learning_rate": 0.0002,
"loss": 0.6320569515228271,
"mean_token_accuracy": 0.7444151639938354,
"num_tokens": 6284425.0,
"step": 168
},
{
"entropy": 0.6380733549594879,
"epoch": 1.0768,
"grad_norm": 0.009066379629075527,
"learning_rate": 0.0002,
"loss": 0.6397888660430908,
"mean_token_accuracy": 0.7402750551700592,
"num_tokens": 6321885.0,
"step": 169
},
{
"entropy": 0.6488857790827751,
"epoch": 1.0832,
"grad_norm": 0.010398726910352707,
"learning_rate": 0.0002,
"loss": 0.6441566944122314,
"mean_token_accuracy": 0.7384657263755798,
"num_tokens": 6359780.0,
"step": 170
},
{
"entropy": 0.6515408530831337,
"epoch": 1.0896,
"grad_norm": 0.011355352587997913,
"learning_rate": 0.0002,
"loss": 0.6486490964889526,
"mean_token_accuracy": 0.7374377101659775,
"num_tokens": 6397361.0,
"step": 171
},
{
"entropy": 0.6507275626063347,
"epoch": 1.096,
"grad_norm": 0.008314304985105991,
"learning_rate": 0.0002,
"loss": 0.6553799510002136,
"mean_token_accuracy": 0.7341008260846138,
"num_tokens": 6434762.0,
"step": 172
},
{
"entropy": 0.6377227902412415,
"epoch": 1.1024,
"grad_norm": 0.010710292495787144,
"learning_rate": 0.0002,
"loss": 0.647055983543396,
"mean_token_accuracy": 0.7381266057491302,
"num_tokens": 6472429.0,
"step": 173
},
{
"entropy": 0.6286719441413879,
"epoch": 1.1088,
"grad_norm": 0.010212961584329605,
"learning_rate": 0.0002,
"loss": 0.6336620450019836,
"mean_token_accuracy": 0.7432440966367722,
"num_tokens": 6509562.0,
"step": 174
},
{
"entropy": 0.633246898651123,
"epoch": 1.1152,
"grad_norm": 0.008904446847736835,
"learning_rate": 0.0002,
"loss": 0.634044885635376,
"mean_token_accuracy": 0.7444055899977684,
"num_tokens": 6547088.0,
"step": 175
},
{
"entropy": 0.6382523626089096,
"epoch": 1.1216,
"grad_norm": 0.010376264341175556,
"learning_rate": 0.0002,
"loss": 0.6372156143188477,
"mean_token_accuracy": 0.7388828843832016,
"num_tokens": 6584424.0,
"step": 176
},
{
"entropy": 0.6464436203241348,
"epoch": 1.1280000000000001,
"grad_norm": 0.011439846828579903,
"learning_rate": 0.0002,
"loss": 0.6371127963066101,
"mean_token_accuracy": 0.7424579933285713,
"num_tokens": 6622393.0,
"step": 177
},
{
"entropy": 0.6296398118138313,
"epoch": 1.1344,
"grad_norm": 0.009771931916475296,
"learning_rate": 0.0002,
"loss": 0.6298056840896606,
"mean_token_accuracy": 0.7466778457164764,
"num_tokens": 6660099.0,
"step": 178
},
{
"entropy": 0.637910395860672,
"epoch": 1.1408,
"grad_norm": 0.010232111439108849,
"learning_rate": 0.0002,
"loss": 0.6460920572280884,
"mean_token_accuracy": 0.738376684486866,
"num_tokens": 6697941.0,
"step": 179
},
{
"entropy": 0.634870246052742,
"epoch": 1.1472,
"grad_norm": 0.010192861780524254,
"learning_rate": 0.0002,
"loss": 0.6416190266609192,
"mean_token_accuracy": 0.7403257936239243,
"num_tokens": 6735661.0,
"step": 180
},
{
"entropy": 0.6310748159885406,
"epoch": 1.1536,
"grad_norm": 0.01060323603451252,
"learning_rate": 0.0002,
"loss": 0.6375827193260193,
"mean_token_accuracy": 0.7393625825643539,
"num_tokens": 6772921.0,
"step": 181
},
{
"entropy": 0.6480697020888329,
"epoch": 1.16,
"grad_norm": 0.01187078095972538,
"learning_rate": 0.0002,
"loss": 0.6427325010299683,
"mean_token_accuracy": 0.7374937310814857,
"num_tokens": 6810167.0,
"step": 182
},
{
"entropy": 0.64576156437397,
"epoch": 1.1663999999999999,
"grad_norm": 0.009763217531144619,
"learning_rate": 0.0002,
"loss": 0.6441277861595154,
"mean_token_accuracy": 0.7376614883542061,
"num_tokens": 6848110.0,
"step": 183
},
{
"entropy": 0.6370326280593872,
"epoch": 1.1728,
"grad_norm": 0.009325532242655754,
"learning_rate": 0.0002,
"loss": 0.6410567760467529,
"mean_token_accuracy": 0.7398818284273148,
"num_tokens": 6885422.0,
"step": 184
},
{
"entropy": 0.6284242644906044,
"epoch": 1.1792,
"grad_norm": 0.010027528740465641,
"learning_rate": 0.0002,
"loss": 0.6299871206283569,
"mean_token_accuracy": 0.7442184612154961,
"num_tokens": 6922828.0,
"step": 185
},
{
"entropy": 0.6239589303731918,
"epoch": 1.1856,
"grad_norm": 0.012052655220031738,
"learning_rate": 0.0002,
"loss": 0.632190465927124,
"mean_token_accuracy": 0.7433017045259476,
"num_tokens": 6959969.0,
"step": 186
},
{
"entropy": 0.6507940962910652,
"epoch": 1.192,
"grad_norm": 0.010141950100660324,
"learning_rate": 0.0002,
"loss": 0.6531009078025818,
"mean_token_accuracy": 0.7333656772971153,
"num_tokens": 6997337.0,
"step": 187
},
{
"entropy": 0.6532803177833557,
"epoch": 1.1984,
"grad_norm": 0.010835838504135609,
"learning_rate": 0.0002,
"loss": 0.6479194164276123,
"mean_token_accuracy": 0.7359819039702415,
"num_tokens": 7034795.0,
"step": 188
},
{
"entropy": 0.6465721130371094,
"epoch": 1.2048,
"grad_norm": 0.011012948118150234,
"learning_rate": 0.0002,
"loss": 0.6399669051170349,
"mean_token_accuracy": 0.743029810488224,
"num_tokens": 7072227.0,
"step": 189
},
{
"entropy": 0.643355593085289,
"epoch": 1.2112,
"grad_norm": 0.0094833392649889,
"learning_rate": 0.0002,
"loss": 0.6482529640197754,
"mean_token_accuracy": 0.7374711334705353,
"num_tokens": 7110108.0,
"step": 190
},
{
"entropy": 0.6375522390007973,
"epoch": 1.2176,
"grad_norm": 0.010187760926783085,
"learning_rate": 0.0002,
"loss": 0.6461261510848999,
"mean_token_accuracy": 0.7388442009687424,
"num_tokens": 7147610.0,
"step": 191
},
{
"entropy": 0.6215626671910286,
"epoch": 1.224,
"grad_norm": 0.009307745844125748,
"learning_rate": 0.0002,
"loss": 0.6269906163215637,
"mean_token_accuracy": 0.7465217709541321,
"num_tokens": 7184782.0,
"step": 192
},
{
"entropy": 0.6429780498147011,
"epoch": 1.2304,
"grad_norm": 0.009042990393936634,
"learning_rate": 0.0002,
"loss": 0.648235559463501,
"mean_token_accuracy": 0.7354854270815849,
"num_tokens": 7222549.0,
"step": 193
},
{
"entropy": 0.6526690945029259,
"epoch": 1.2368000000000001,
"grad_norm": 0.010063275694847107,
"learning_rate": 0.0002,
"loss": 0.6548038721084595,
"mean_token_accuracy": 0.7341009303927422,
"num_tokens": 7260409.0,
"step": 194
},
{
"entropy": 0.6345907151699066,
"epoch": 1.2432,
"grad_norm": 0.010623205453157425,
"learning_rate": 0.0002,
"loss": 0.6308838129043579,
"mean_token_accuracy": 0.7419967949390411,
"num_tokens": 7297937.0,
"step": 195
},
{
"entropy": 0.6445695832371712,
"epoch": 1.2496,
"grad_norm": 0.010199649259448051,
"learning_rate": 0.0002,
"loss": 0.6364445686340332,
"mean_token_accuracy": 0.7410052716732025,
"num_tokens": 7335147.0,
"step": 196
},
{
"entropy": 0.6346744820475578,
"epoch": 1.256,
"grad_norm": 0.009105252102017403,
"learning_rate": 0.0002,
"loss": 0.6322548985481262,
"mean_token_accuracy": 0.7424812093377113,
"num_tokens": 7372946.0,
"step": 197
},
{
"entropy": 0.619812473654747,
"epoch": 1.2624,
"grad_norm": 0.009648271836340427,
"learning_rate": 0.0002,
"loss": 0.626278817653656,
"mean_token_accuracy": 0.7455899342894554,
"num_tokens": 7410415.0,
"step": 198
},
{
"entropy": 0.6315840631723404,
"epoch": 1.2688,
"grad_norm": 0.009451290592551231,
"learning_rate": 0.0002,
"loss": 0.6375157833099365,
"mean_token_accuracy": 0.7421969324350357,
"num_tokens": 7448206.0,
"step": 199
},
{
"entropy": 0.6275417804718018,
"epoch": 1.2752,
"grad_norm": 0.009674392640590668,
"learning_rate": 0.0002,
"loss": 0.6342942714691162,
"mean_token_accuracy": 0.74417594820261,
"num_tokens": 7485553.0,
"step": 200
},
{
"entropy": 0.6313388273119926,
"epoch": 1.2816,
"grad_norm": 0.008578372187912464,
"learning_rate": 0.0002,
"loss": 0.6364251375198364,
"mean_token_accuracy": 0.7415003478527069,
"num_tokens": 7523107.0,
"step": 201
},
{
"entropy": 0.6285647079348564,
"epoch": 1.288,
"grad_norm": 0.007911495864391327,
"learning_rate": 0.0002,
"loss": 0.6274697780609131,
"mean_token_accuracy": 0.7439461648464203,
"num_tokens": 7560637.0,
"step": 202
},
{
"entropy": 0.6555930450558662,
"epoch": 1.2944,
"grad_norm": 0.00908783357590437,
"learning_rate": 0.0002,
"loss": 0.6531112194061279,
"mean_token_accuracy": 0.7365255653858185,
"num_tokens": 7598202.0,
"step": 203
},
{
"entropy": 0.6405614539980888,
"epoch": 1.3008,
"grad_norm": 0.008850960060954094,
"learning_rate": 0.0002,
"loss": 0.6386165022850037,
"mean_token_accuracy": 0.7407704368233681,
"num_tokens": 7635602.0,
"step": 204
},
{
"entropy": 0.6183491796255112,
"epoch": 1.3072,
"grad_norm": 0.009933196939527988,
"learning_rate": 0.0002,
"loss": 0.6215780973434448,
"mean_token_accuracy": 0.7468694671988487,
"num_tokens": 7672796.0,
"step": 205
},
{
"entropy": 0.6282857060432434,
"epoch": 1.3136,
"grad_norm": 0.009941700845956802,
"learning_rate": 0.0002,
"loss": 0.6309329271316528,
"mean_token_accuracy": 0.7419614642858505,
"num_tokens": 7710123.0,
"step": 206
},
{
"entropy": 0.6409614756703377,
"epoch": 1.32,
"grad_norm": 0.009079815819859505,
"learning_rate": 0.0002,
"loss": 0.6415680050849915,
"mean_token_accuracy": 0.7399025559425354,
"num_tokens": 7747853.0,
"step": 207
},
{
"entropy": 0.6362860053777695,
"epoch": 1.3264,
"grad_norm": 0.009475532919168472,
"learning_rate": 0.0002,
"loss": 0.639657735824585,
"mean_token_accuracy": 0.740733340382576,
"num_tokens": 7785809.0,
"step": 208
},
{
"entropy": 0.648863323032856,
"epoch": 1.3328,
"grad_norm": 0.00897946022450924,
"learning_rate": 0.0002,
"loss": 0.6453667879104614,
"mean_token_accuracy": 0.7376150414347649,
"num_tokens": 7823564.0,
"step": 209
},
{
"entropy": 0.6473242938518524,
"epoch": 1.3392,
"grad_norm": 0.00988426897674799,
"learning_rate": 0.0002,
"loss": 0.6461673974990845,
"mean_token_accuracy": 0.7394340336322784,
"num_tokens": 7861487.0,
"step": 210
},
{
"entropy": 0.6313100084662437,
"epoch": 1.3456000000000001,
"grad_norm": 0.011011740192770958,
"learning_rate": 0.0002,
"loss": 0.6353209614753723,
"mean_token_accuracy": 0.7412855923175812,
"num_tokens": 7898738.0,
"step": 211
},
{
"entropy": 0.6332249045372009,
"epoch": 1.3519999999999999,
"grad_norm": 0.009350410662591457,
"learning_rate": 0.0002,
"loss": 0.6443768739700317,
"mean_token_accuracy": 0.7384829372167587,
"num_tokens": 7936394.0,
"step": 212
},
{
"entropy": 0.6210881397128105,
"epoch": 1.3584,
"grad_norm": 0.010020367801189423,
"learning_rate": 0.0002,
"loss": 0.6294596195220947,
"mean_token_accuracy": 0.7448422238230705,
"num_tokens": 7974219.0,
"step": 213
},
{
"entropy": 0.6376784816384315,
"epoch": 1.3648,
"grad_norm": 0.00982749741524458,
"learning_rate": 0.0002,
"loss": 0.6414127945899963,
"mean_token_accuracy": 0.7404457107186317,
"num_tokens": 8011498.0,
"step": 214
},
{
"entropy": 0.6365342438220978,
"epoch": 1.3712,
"grad_norm": 0.007822374813258648,
"learning_rate": 0.0002,
"loss": 0.6363272666931152,
"mean_token_accuracy": 0.7404549047350883,
"num_tokens": 8048792.0,
"step": 215
},
{
"entropy": 0.6440632939338684,
"epoch": 1.3776,
"grad_norm": 0.009724266827106476,
"learning_rate": 0.0002,
"loss": 0.6365130543708801,
"mean_token_accuracy": 0.7415405437350273,
"num_tokens": 8086606.0,
"step": 216
},
{
"entropy": 0.6494074836373329,
"epoch": 1.384,
"grad_norm": 0.009119455702602863,
"learning_rate": 0.0002,
"loss": 0.645447850227356,
"mean_token_accuracy": 0.7357565984129906,
"num_tokens": 8124114.0,
"step": 217
},
{
"entropy": 0.6484241932630539,
"epoch": 1.3904,
"grad_norm": 0.009591936133801937,
"learning_rate": 0.0002,
"loss": 0.6502270698547363,
"mean_token_accuracy": 0.7375201731920242,
"num_tokens": 8162048.0,
"step": 218
},
{
"entropy": 0.6512304544448853,
"epoch": 1.3968,
"grad_norm": 0.008009335026144981,
"learning_rate": 0.0002,
"loss": 0.6536368131637573,
"mean_token_accuracy": 0.735274650156498,
"num_tokens": 8199794.0,
"step": 219
},
{
"entropy": 0.6484591439366341,
"epoch": 1.4032,
"grad_norm": 0.0092353206127882,
"learning_rate": 0.0002,
"loss": 0.6539183259010315,
"mean_token_accuracy": 0.7346156910061836,
"num_tokens": 8237281.0,
"step": 220
},
{
"entropy": 0.6388984844088554,
"epoch": 1.4096,
"grad_norm": 0.009845041669905186,
"learning_rate": 0.0002,
"loss": 0.6434773206710815,
"mean_token_accuracy": 0.7382834777235985,
"num_tokens": 8274814.0,
"step": 221
},
{
"entropy": 0.6463811621069908,
"epoch": 1.416,
"grad_norm": 0.008870167657732964,
"learning_rate": 0.0002,
"loss": 0.6482495665550232,
"mean_token_accuracy": 0.7370684891939163,
"num_tokens": 8312525.0,
"step": 222
},
{
"entropy": 0.6367313861846924,
"epoch": 1.4224,
"grad_norm": 0.008752333000302315,
"learning_rate": 0.0002,
"loss": 0.6363902688026428,
"mean_token_accuracy": 0.7398954927921295,
"num_tokens": 8350434.0,
"step": 223
},
{
"entropy": 0.6389205679297447,
"epoch": 1.4288,
"grad_norm": 0.009939228184521198,
"learning_rate": 0.0002,
"loss": 0.6399004459381104,
"mean_token_accuracy": 0.739352636039257,
"num_tokens": 8387935.0,
"step": 224
},
{
"entropy": 0.6301346495747566,
"epoch": 1.4352,
"grad_norm": 0.01083251554518938,
"learning_rate": 0.0002,
"loss": 0.6333423256874084,
"mean_token_accuracy": 0.7439003512263298,
"num_tokens": 8425350.0,
"step": 225
},
{
"entropy": 0.6417813748121262,
"epoch": 1.4416,
"grad_norm": 0.008651083335280418,
"learning_rate": 0.0002,
"loss": 0.6453697681427002,
"mean_token_accuracy": 0.7393379509449005,
"num_tokens": 8462747.0,
"step": 226
},
{
"entropy": 0.6465223357081413,
"epoch": 1.448,
"grad_norm": 0.010395637713372707,
"learning_rate": 0.0002,
"loss": 0.6427249908447266,
"mean_token_accuracy": 0.7377897799015045,
"num_tokens": 8500639.0,
"step": 227
},
{
"entropy": 0.637003168463707,
"epoch": 1.4544000000000001,
"grad_norm": 0.00956573337316513,
"learning_rate": 0.0002,
"loss": 0.6341052055358887,
"mean_token_accuracy": 0.7431980520486832,
"num_tokens": 8538277.0,
"step": 228
},
{
"entropy": 0.6219193041324615,
"epoch": 1.4607999999999999,
"grad_norm": 0.009173355996608734,
"learning_rate": 0.0002,
"loss": 0.6226502060890198,
"mean_token_accuracy": 0.7491968795657158,
"num_tokens": 8576252.0,
"step": 229
},
{
"entropy": 0.6295832619071007,
"epoch": 1.4672,
"grad_norm": 0.009499134495854378,
"learning_rate": 0.0002,
"loss": 0.6385797262191772,
"mean_token_accuracy": 0.740376353263855,
"num_tokens": 8613847.0,
"step": 230
},
{
"entropy": 0.6238328814506531,
"epoch": 1.4736,
"grad_norm": 0.009796243160963058,
"learning_rate": 0.0002,
"loss": 0.633277177810669,
"mean_token_accuracy": 0.7418293952941895,
"num_tokens": 8651305.0,
"step": 231
},
{
"entropy": 0.6379890963435173,
"epoch": 1.48,
"grad_norm": 0.00879639107733965,
"learning_rate": 0.0002,
"loss": 0.6392139196395874,
"mean_token_accuracy": 0.7400495782494545,
"num_tokens": 8688955.0,
"step": 232
},
{
"entropy": 0.639459103345871,
"epoch": 1.4864,
"grad_norm": 0.00866638869047165,
"learning_rate": 0.0002,
"loss": 0.6354138255119324,
"mean_token_accuracy": 0.7424653545022011,
"num_tokens": 8726561.0,
"step": 233
},
{
"entropy": 0.6338846683502197,
"epoch": 1.4928,
"grad_norm": 0.008886488154530525,
"learning_rate": 0.0002,
"loss": 0.6311143636703491,
"mean_token_accuracy": 0.7435080260038376,
"num_tokens": 8763633.0,
"step": 234
},
{
"entropy": 0.6329428404569626,
"epoch": 1.4992,
"grad_norm": 0.008422540500760078,
"learning_rate": 0.0002,
"loss": 0.6340688467025757,
"mean_token_accuracy": 0.7437330037355423,
"num_tokens": 8801223.0,
"step": 235
},
{
"entropy": 0.6404994279146194,
"epoch": 1.5056,
"grad_norm": 0.008861835114657879,
"learning_rate": 0.0002,
"loss": 0.6435329914093018,
"mean_token_accuracy": 0.7402794137597084,
"num_tokens": 8838852.0,
"step": 236
},
{
"entropy": 0.6229164972901344,
"epoch": 1.512,
"grad_norm": 0.01079252827912569,
"learning_rate": 0.0002,
"loss": 0.6297635436058044,
"mean_token_accuracy": 0.7451627627015114,
"num_tokens": 8876215.0,
"step": 237
},
{
"entropy": 0.645681232213974,
"epoch": 1.5184,
"grad_norm": 0.00952441431581974,
"learning_rate": 0.0002,
"loss": 0.6496944427490234,
"mean_token_accuracy": 0.7374964207410812,
"num_tokens": 8913833.0,
"step": 238
},
{
"entropy": 0.6374045237898827,
"epoch": 1.5248,
"grad_norm": 0.010180641897022724,
"learning_rate": 0.0002,
"loss": 0.631719172000885,
"mean_token_accuracy": 0.7413778752088547,
"num_tokens": 8951296.0,
"step": 239
},
{
"entropy": 0.6539132967591286,
"epoch": 1.5312000000000001,
"grad_norm": 0.011931417509913445,
"learning_rate": 0.0002,
"loss": 0.6448370218276978,
"mean_token_accuracy": 0.7378397807478905,
"num_tokens": 8988896.0,
"step": 240
},
{
"entropy": 0.6414381936192513,
"epoch": 1.5375999999999999,
"grad_norm": 0.00920459907501936,
"learning_rate": 0.0002,
"loss": 0.6397557258605957,
"mean_token_accuracy": 0.7399087175726891,
"num_tokens": 9026747.0,
"step": 241
},
{
"entropy": 0.6196104139089584,
"epoch": 1.544,
"grad_norm": 0.011374457739293575,
"learning_rate": 0.0002,
"loss": 0.6309009194374084,
"mean_token_accuracy": 0.743213526904583,
"num_tokens": 9064429.0,
"step": 242
},
{
"entropy": 0.6261283829808235,
"epoch": 1.5504,
"grad_norm": 0.011355147697031498,
"learning_rate": 0.0002,
"loss": 0.6374455690383911,
"mean_token_accuracy": 0.7419503480195999,
"num_tokens": 9102195.0,
"step": 243
},
{
"entropy": 0.6445719599723816,
"epoch": 1.5568,
"grad_norm": 0.009919662959873676,
"learning_rate": 0.0002,
"loss": 0.6474390029907227,
"mean_token_accuracy": 0.7369806244969368,
"num_tokens": 9139609.0,
"step": 244
},
{
"entropy": 0.6413188800215721,
"epoch": 1.5632000000000001,
"grad_norm": 0.00855494849383831,
"learning_rate": 0.0002,
"loss": 0.641474187374115,
"mean_token_accuracy": 0.7400150150060654,
"num_tokens": 9177293.0,
"step": 245
},
{
"entropy": 0.637481302022934,
"epoch": 1.5695999999999999,
"grad_norm": 0.00973748043179512,
"learning_rate": 0.0002,
"loss": 0.6346510648727417,
"mean_token_accuracy": 0.7417012825608253,
"num_tokens": 9214895.0,
"step": 246
},
{
"entropy": 0.6503799557685852,
"epoch": 1.576,
"grad_norm": 0.007979532703757286,
"learning_rate": 0.0002,
"loss": 0.6497414112091064,
"mean_token_accuracy": 0.7372497469186783,
"num_tokens": 9252813.0,
"step": 247
},
{
"entropy": 0.6455269455909729,
"epoch": 1.5824,
"grad_norm": 0.008097643963992596,
"learning_rate": 0.0002,
"loss": 0.6451165676116943,
"mean_token_accuracy": 0.7385182455182076,
"num_tokens": 9290181.0,
"step": 248
},
{
"entropy": 0.644989550113678,
"epoch": 1.5888,
"grad_norm": 0.010681331157684326,
"learning_rate": 0.0002,
"loss": 0.6487670540809631,
"mean_token_accuracy": 0.7362834960222244,
"num_tokens": 9327721.0,
"step": 249
},
{
"entropy": 0.6285341307520866,
"epoch": 1.5952,
"grad_norm": 0.008401221595704556,
"learning_rate": 0.0002,
"loss": 0.6307709217071533,
"mean_token_accuracy": 0.7442108020186424,
"num_tokens": 9365266.0,
"step": 250
},
{
"entropy": 0.6323808878660202,
"epoch": 1.6016,
"grad_norm": 0.008853926323354244,
"learning_rate": 0.0002,
"loss": 0.6337858438491821,
"mean_token_accuracy": 0.7412157282233238,
"num_tokens": 9403484.0,
"step": 251
},
{
"entropy": 0.6329245269298553,
"epoch": 1.608,
"grad_norm": 0.009235359728336334,
"learning_rate": 0.0002,
"loss": 0.6332880258560181,
"mean_token_accuracy": 0.743882454931736,
"num_tokens": 9441086.0,
"step": 252
},
{
"entropy": 0.6339508295059204,
"epoch": 1.6143999999999998,
"grad_norm": 0.008013821206986904,
"learning_rate": 0.0002,
"loss": 0.63725346326828,
"mean_token_accuracy": 0.7408271208405495,
"num_tokens": 9478771.0,
"step": 253
},
{
"entropy": 0.6374928578734398,
"epoch": 1.6208,
"grad_norm": 0.009221353568136692,
"learning_rate": 0.0002,
"loss": 0.6384063959121704,
"mean_token_accuracy": 0.7406769022345543,
"num_tokens": 9516166.0,
"step": 254
},
{
"entropy": 0.6367692276835442,
"epoch": 1.6272,
"grad_norm": 0.00975379254668951,
"learning_rate": 0.0002,
"loss": 0.6376797556877136,
"mean_token_accuracy": 0.7408984154462814,
"num_tokens": 9553885.0,
"step": 255
},
{
"entropy": 0.6397164911031723,
"epoch": 1.6336,
"grad_norm": 0.009269645437598228,
"learning_rate": 0.0002,
"loss": 0.6477100849151611,
"mean_token_accuracy": 0.7368867322802544,
"num_tokens": 9591274.0,
"step": 256
},
{
"entropy": 0.6350990980863571,
"epoch": 1.6400000000000001,
"grad_norm": 0.007825898006558418,
"learning_rate": 0.0002,
"loss": 0.6354209184646606,
"mean_token_accuracy": 0.7403729483485222,
"num_tokens": 9628921.0,
"step": 257
},
{
"entropy": 0.6429452896118164,
"epoch": 1.6463999999999999,
"grad_norm": 0.009811664931476116,
"learning_rate": 0.0002,
"loss": 0.6441528797149658,
"mean_token_accuracy": 0.7374731153249741,
"num_tokens": 9666769.0,
"step": 258
},
{
"entropy": 0.6346355751156807,
"epoch": 1.6528,
"grad_norm": 0.010059292428195477,
"learning_rate": 0.0002,
"loss": 0.6366721391677856,
"mean_token_accuracy": 0.7407139092683792,
"num_tokens": 9704033.0,
"step": 259
},
{
"entropy": 0.6290543302893639,
"epoch": 1.6592,
"grad_norm": 0.008349488489329815,
"learning_rate": 0.0002,
"loss": 0.6278114914894104,
"mean_token_accuracy": 0.7450250014662743,
"num_tokens": 9741540.0,
"step": 260
},
{
"entropy": 0.6501712873578072,
"epoch": 1.6656,
"grad_norm": 0.009427984245121479,
"learning_rate": 0.0002,
"loss": 0.6549891829490662,
"mean_token_accuracy": 0.7353075668215752,
"num_tokens": 9779201.0,
"step": 261
},
{
"entropy": 0.6343263909220695,
"epoch": 1.6720000000000002,
"grad_norm": 0.008428818546235561,
"learning_rate": 0.0002,
"loss": 0.6368517875671387,
"mean_token_accuracy": 0.7391695827245712,
"num_tokens": 9816683.0,
"step": 262
},
{
"entropy": 0.649608425796032,
"epoch": 1.6784,
"grad_norm": 0.008335414342582226,
"learning_rate": 0.0002,
"loss": 0.6505298614501953,
"mean_token_accuracy": 0.7356899008154869,
"num_tokens": 9854491.0,
"step": 263
},
{
"entropy": 0.6355179324746132,
"epoch": 1.6848,
"grad_norm": 0.009246018715202808,
"learning_rate": 0.0002,
"loss": 0.6331362128257751,
"mean_token_accuracy": 0.741562083363533,
"num_tokens": 9891893.0,
"step": 264
},
{
"entropy": 0.6557022258639336,
"epoch": 1.6912,
"grad_norm": 0.008260353468358517,
"learning_rate": 0.0002,
"loss": 0.6587477922439575,
"mean_token_accuracy": 0.7323677465319633,
"num_tokens": 9929548.0,
"step": 265
},
{
"entropy": 0.6404315456748009,
"epoch": 1.6976,
"grad_norm": 0.009794406592845917,
"learning_rate": 0.0002,
"loss": 0.6475528478622437,
"mean_token_accuracy": 0.7362662330269814,
"num_tokens": 9967059.0,
"step": 266
},
{
"entropy": 0.63386220484972,
"epoch": 1.704,
"grad_norm": 0.008251597173511982,
"learning_rate": 0.0002,
"loss": 0.6386945247650146,
"mean_token_accuracy": 0.7404668778181076,
"num_tokens": 10004660.0,
"step": 267
},
{
"entropy": 0.6313491612672806,
"epoch": 1.7104,
"grad_norm": 0.00842359196394682,
"learning_rate": 0.0002,
"loss": 0.6330629587173462,
"mean_token_accuracy": 0.7405205965042114,
"num_tokens": 10042002.0,
"step": 268
},
{
"entropy": 0.6439215540885925,
"epoch": 1.7168,
"grad_norm": 0.008792798034846783,
"learning_rate": 0.0002,
"loss": 0.64313805103302,
"mean_token_accuracy": 0.7380542382597923,
"num_tokens": 10079455.0,
"step": 269
},
{
"entropy": 0.6456866934895515,
"epoch": 1.7231999999999998,
"grad_norm": 0.008770551532506943,
"learning_rate": 0.0002,
"loss": 0.6415017247200012,
"mean_token_accuracy": 0.7395961955189705,
"num_tokens": 10117042.0,
"step": 270
},
{
"entropy": 0.6421365886926651,
"epoch": 1.7296,
"grad_norm": 0.008746870793402195,
"learning_rate": 0.0002,
"loss": 0.6441514492034912,
"mean_token_accuracy": 0.7391441687941551,
"num_tokens": 10154684.0,
"step": 271
},
{
"entropy": 0.6459959074854851,
"epoch": 1.736,
"grad_norm": 0.008375383913516998,
"learning_rate": 0.0002,
"loss": 0.6512868404388428,
"mean_token_accuracy": 0.7382498681545258,
"num_tokens": 10192405.0,
"step": 272
},
{
"entropy": 0.6390120834112167,
"epoch": 1.7424,
"grad_norm": 0.009461523965001106,
"learning_rate": 0.0002,
"loss": 0.6469432711601257,
"mean_token_accuracy": 0.7358321473002434,
"num_tokens": 10230330.0,
"step": 273
},
{
"entropy": 0.6369089707732201,
"epoch": 1.7488000000000001,
"grad_norm": 0.008092108182609081,
"learning_rate": 0.0002,
"loss": 0.6383406519889832,
"mean_token_accuracy": 0.7406154125928879,
"num_tokens": 10267525.0,
"step": 274
},
{
"entropy": 0.6338964253664017,
"epoch": 1.7551999999999999,
"grad_norm": 0.008980642072856426,
"learning_rate": 0.0002,
"loss": 0.633415937423706,
"mean_token_accuracy": 0.7437249273061752,
"num_tokens": 10304863.0,
"step": 275
},
{
"entropy": 0.6264254227280617,
"epoch": 1.7616,
"grad_norm": 0.008377771824598312,
"learning_rate": 0.0002,
"loss": 0.6282482743263245,
"mean_token_accuracy": 0.7431060671806335,
"num_tokens": 10342202.0,
"step": 276
},
{
"entropy": 0.6434390917420387,
"epoch": 1.768,
"grad_norm": 0.008159980177879333,
"learning_rate": 0.0002,
"loss": 0.646558403968811,
"mean_token_accuracy": 0.7382596433162689,
"num_tokens": 10379740.0,
"step": 277
},
{
"entropy": 0.6326303333044052,
"epoch": 1.7744,
"grad_norm": 0.008124861866235733,
"learning_rate": 0.0002,
"loss": 0.6332470178604126,
"mean_token_accuracy": 0.7423404455184937,
"num_tokens": 10417746.0,
"step": 278
},
{
"entropy": 0.6520350500941277,
"epoch": 1.7808000000000002,
"grad_norm": 0.009632322005927563,
"learning_rate": 0.0002,
"loss": 0.6571191549301147,
"mean_token_accuracy": 0.7318461984395981,
"num_tokens": 10455758.0,
"step": 279
},
{
"entropy": 0.6354654431343079,
"epoch": 1.7872,
"grad_norm": 0.008794812485575676,
"learning_rate": 0.0002,
"loss": 0.6319587230682373,
"mean_token_accuracy": 0.7421321347355843,
"num_tokens": 10493098.0,
"step": 280
},
{
"entropy": 0.6494236141443253,
"epoch": 1.7936,
"grad_norm": 0.00833588931709528,
"learning_rate": 0.0002,
"loss": 0.6512980461120605,
"mean_token_accuracy": 0.7350147068500519,
"num_tokens": 10530840.0,
"step": 281
},
{
"entropy": 0.6404789388179779,
"epoch": 1.8,
"grad_norm": 0.009666857309639454,
"learning_rate": 0.0002,
"loss": 0.6438995599746704,
"mean_token_accuracy": 0.7382337227463722,
"num_tokens": 10568316.0,
"step": 282
},
{
"entropy": 0.628923237323761,
"epoch": 1.8064,
"grad_norm": 0.010019267909228802,
"learning_rate": 0.0002,
"loss": 0.6307887434959412,
"mean_token_accuracy": 0.7422001957893372,
"num_tokens": 10605621.0,
"step": 283
},
{
"entropy": 0.6334665641188622,
"epoch": 1.8128,
"grad_norm": 0.00908628199249506,
"learning_rate": 0.0002,
"loss": 0.6341119408607483,
"mean_token_accuracy": 0.7430456355214119,
"num_tokens": 10642983.0,
"step": 284
},
{
"entropy": 0.6285069659352303,
"epoch": 1.8192,
"grad_norm": 0.008308637887239456,
"learning_rate": 0.0002,
"loss": 0.6301131248474121,
"mean_token_accuracy": 0.7429656311869621,
"num_tokens": 10680597.0,
"step": 285
},
{
"entropy": 0.6323676705360413,
"epoch": 1.8256000000000001,
"grad_norm": 0.008813594467937946,
"learning_rate": 0.0002,
"loss": 0.6346842050552368,
"mean_token_accuracy": 0.7398638725280762,
"num_tokens": 10718004.0,
"step": 286
},
{
"entropy": 0.6334202289581299,
"epoch": 1.8319999999999999,
"grad_norm": 0.009448044933378696,
"learning_rate": 0.0002,
"loss": 0.640605092048645,
"mean_token_accuracy": 0.7379657998681068,
"num_tokens": 10755392.0,
"step": 287
},
{
"entropy": 0.6541434079408646,
"epoch": 1.8384,
"grad_norm": 0.00910591334104538,
"learning_rate": 0.0002,
"loss": 0.6537045240402222,
"mean_token_accuracy": 0.7336858883500099,
"num_tokens": 10792841.0,
"step": 288
},
{
"entropy": 0.6449815109372139,
"epoch": 1.8448,
"grad_norm": 0.010256773792207241,
"learning_rate": 0.0002,
"loss": 0.6409913301467896,
"mean_token_accuracy": 0.739972397685051,
"num_tokens": 10830422.0,
"step": 289
},
{
"entropy": 0.6341065391898155,
"epoch": 1.8512,
"grad_norm": 0.007780797313898802,
"learning_rate": 0.0002,
"loss": 0.6369997262954712,
"mean_token_accuracy": 0.7405647411942482,
"num_tokens": 10867712.0,
"step": 290
},
{
"entropy": 0.6363702341914177,
"epoch": 1.8576000000000001,
"grad_norm": 0.008313016034662724,
"learning_rate": 0.0002,
"loss": 0.6386253833770752,
"mean_token_accuracy": 0.7408165112137794,
"num_tokens": 10905152.0,
"step": 291
},
{
"entropy": 0.6477962657809258,
"epoch": 1.8639999999999999,
"grad_norm": 0.007996824570000172,
"learning_rate": 0.0002,
"loss": 0.649878740310669,
"mean_token_accuracy": 0.7363680452108383,
"num_tokens": 10942566.0,
"step": 292
},
{
"entropy": 0.6444478929042816,
"epoch": 1.8704,
"grad_norm": 0.009034682996571064,
"learning_rate": 0.0002,
"loss": 0.64991295337677,
"mean_token_accuracy": 0.7348211482167244,
"num_tokens": 10979522.0,
"step": 293
},
{
"entropy": 0.6329373270273209,
"epoch": 1.8768,
"grad_norm": 0.009291103109717369,
"learning_rate": 0.0002,
"loss": 0.6315436363220215,
"mean_token_accuracy": 0.7441153600811958,
"num_tokens": 11016799.0,
"step": 294
},
{
"entropy": 0.6502094119787216,
"epoch": 1.8832,
"grad_norm": 0.0096050426363945,
"learning_rate": 0.0002,
"loss": 0.6489418148994446,
"mean_token_accuracy": 0.7356565669178963,
"num_tokens": 11054518.0,
"step": 295
},
{
"entropy": 0.6323768645524979,
"epoch": 1.8896,
"grad_norm": 0.008002777583897114,
"learning_rate": 0.0002,
"loss": 0.635691225528717,
"mean_token_accuracy": 0.7405551075935364,
"num_tokens": 11091967.0,
"step": 296
},
{
"entropy": 0.6422302722930908,
"epoch": 1.896,
"grad_norm": 0.008403711952269077,
"learning_rate": 0.0002,
"loss": 0.6455032825469971,
"mean_token_accuracy": 0.7383149340748787,
"num_tokens": 11129384.0,
"step": 297
},
{
"entropy": 0.6316574737429619,
"epoch": 1.9024,
"grad_norm": 0.00967500451952219,
"learning_rate": 0.0002,
"loss": 0.6350202560424805,
"mean_token_accuracy": 0.7421634197235107,
"num_tokens": 11166669.0,
"step": 298
},
{
"entropy": 0.6459977030754089,
"epoch": 1.9088,
"grad_norm": 0.00876573659479618,
"learning_rate": 0.0002,
"loss": 0.6403264999389648,
"mean_token_accuracy": 0.7382558658719063,
"num_tokens": 11204332.0,
"step": 299
},
{
"entropy": 0.6415895000100136,
"epoch": 1.9152,
"grad_norm": 0.009217560291290283,
"learning_rate": 0.0002,
"loss": 0.6415034532546997,
"mean_token_accuracy": 0.7386994808912277,
"num_tokens": 11241726.0,
"step": 300
},
{
"entropy": 0.6311015710234642,
"epoch": 1.9216,
"grad_norm": 0.00828156340867281,
"learning_rate": 0.0002,
"loss": 0.630814790725708,
"mean_token_accuracy": 0.7444434463977814,
"num_tokens": 11279304.0,
"step": 301
},
{
"entropy": 0.6455347687005997,
"epoch": 1.928,
"grad_norm": 0.00847472995519638,
"learning_rate": 0.0002,
"loss": 0.6488364934921265,
"mean_token_accuracy": 0.7379944175481796,
"num_tokens": 11316642.0,
"step": 302
},
{
"entropy": 0.6381795853376389,
"epoch": 1.9344000000000001,
"grad_norm": 0.010508674196898937,
"learning_rate": 0.0002,
"loss": 0.6469117403030396,
"mean_token_accuracy": 0.7371617555618286,
"num_tokens": 11354142.0,
"step": 303
},
{
"entropy": 0.6340028718113899,
"epoch": 1.9407999999999999,
"grad_norm": 0.008417687378823757,
"learning_rate": 0.0002,
"loss": 0.638616681098938,
"mean_token_accuracy": 0.7400232255458832,
"num_tokens": 11391584.0,
"step": 304
},
{
"entropy": 0.641148068010807,
"epoch": 1.9472,
"grad_norm": 0.009189863689243793,
"learning_rate": 0.0002,
"loss": 0.6417672038078308,
"mean_token_accuracy": 0.7394173890352249,
"num_tokens": 11429141.0,
"step": 305
},
{
"entropy": 0.6361806094646454,
"epoch": 1.9536,
"grad_norm": 0.009170212782919407,
"learning_rate": 0.0002,
"loss": 0.6348021626472473,
"mean_token_accuracy": 0.741854839026928,
"num_tokens": 11466566.0,
"step": 306
},
{
"entropy": 0.6448198854923248,
"epoch": 1.96,
"grad_norm": 0.008513331413269043,
"learning_rate": 0.0002,
"loss": 0.6473972797393799,
"mean_token_accuracy": 0.7364873364567757,
"num_tokens": 11503681.0,
"step": 307
},
{
"entropy": 0.6346408724784851,
"epoch": 1.9664000000000001,
"grad_norm": 0.010691906325519085,
"learning_rate": 0.0002,
"loss": 0.6393898725509644,
"mean_token_accuracy": 0.7428330779075623,
"num_tokens": 11541361.0,
"step": 308
},
{
"entropy": 0.6447126045823097,
"epoch": 1.9727999999999999,
"grad_norm": 0.009089854545891285,
"learning_rate": 0.0002,
"loss": 0.6462785601615906,
"mean_token_accuracy": 0.7361640483140945,
"num_tokens": 11578943.0,
"step": 309
},
{
"entropy": 0.6443200558423996,
"epoch": 1.9792,
"grad_norm": 0.007877051830291748,
"learning_rate": 0.0002,
"loss": 0.6410749554634094,
"mean_token_accuracy": 0.7393750101327896,
"num_tokens": 11616900.0,
"step": 310
},
{
"entropy": 0.6526265293359756,
"epoch": 1.9856,
"grad_norm": 0.007553855888545513,
"learning_rate": 0.0002,
"loss": 0.6491004824638367,
"mean_token_accuracy": 0.7368245124816895,
"num_tokens": 11654118.0,
"step": 311
},
{
"entropy": 0.6361679136753082,
"epoch": 1.992,
"grad_norm": 0.0077677839435637,
"learning_rate": 0.0002,
"loss": 0.6400581002235413,
"mean_token_accuracy": 0.7392396479845047,
"num_tokens": 11691819.0,
"step": 312
},
{
"entropy": 0.6478787511587143,
"epoch": 1.9984,
"grad_norm": 0.008330225013196468,
"learning_rate": 0.0002,
"loss": 0.6550832390785217,
"mean_token_accuracy": 0.7333075851202011,
"num_tokens": 11729371.0,
"step": 313
},
{
"entropy": 0.647148609161377,
"epoch": 2.0,
"grad_norm": 0.014249460771679878,
"learning_rate": 0.0002,
"loss": 0.6511927843093872,
"mean_token_accuracy": 0.7351100444793701,
"num_tokens": 11738913.0,
"step": 314
},
{
"entropy": 0.6428509056568146,
"epoch": 2.0064,
"grad_norm": 0.012224607169628143,
"learning_rate": 0.0002,
"loss": 0.6413295865058899,
"mean_token_accuracy": 0.7383991628885269,
"num_tokens": 11776564.0,
"step": 315
},
{
"entropy": 0.6307617798447609,
"epoch": 2.0128,
"grad_norm": 0.00805046409368515,
"learning_rate": 0.0002,
"loss": 0.6318984031677246,
"mean_token_accuracy": 0.7424051091074944,
"num_tokens": 11813755.0,
"step": 316
},
{
"entropy": 0.6430513709783554,
"epoch": 2.0192,
"grad_norm": 0.007973214611411095,
"learning_rate": 0.0002,
"loss": 0.6426272392272949,
"mean_token_accuracy": 0.7385435774922371,
"num_tokens": 11851558.0,
"step": 317
},
{
"entropy": 0.6318764910101891,
"epoch": 2.0256,
"grad_norm": 0.012760069221258163,
"learning_rate": 0.0002,
"loss": 0.6337249875068665,
"mean_token_accuracy": 0.7423495799303055,
"num_tokens": 11889166.0,
"step": 318
},
{
"entropy": 0.655825637280941,
"epoch": 2.032,
"grad_norm": 0.008295831270515919,
"learning_rate": 0.0002,
"loss": 0.6574875712394714,
"mean_token_accuracy": 0.7304191887378693,
"num_tokens": 11926828.0,
"step": 319
},
{
"entropy": 0.646898128092289,
"epoch": 2.0384,
"grad_norm": 0.0076156072318553925,
"learning_rate": 0.0002,
"loss": 0.6442586183547974,
"mean_token_accuracy": 0.7376453951001167,
"num_tokens": 11964281.0,
"step": 320
},
{
"entropy": 0.6386341005563736,
"epoch": 2.0448,
"grad_norm": 0.008703756146132946,
"learning_rate": 0.0002,
"loss": 0.6401532888412476,
"mean_token_accuracy": 0.7430068925023079,
"num_tokens": 12001686.0,
"step": 321
},
{
"entropy": 0.6369054093956947,
"epoch": 2.0512,
"grad_norm": 0.008225949481129646,
"learning_rate": 0.0002,
"loss": 0.6394542455673218,
"mean_token_accuracy": 0.7397433742880821,
"num_tokens": 12039411.0,
"step": 322
},
{
"entropy": 0.6331326514482498,
"epoch": 2.0576,
"grad_norm": 0.009685281664133072,
"learning_rate": 0.0002,
"loss": 0.6398283839225769,
"mean_token_accuracy": 0.7404422760009766,
"num_tokens": 12076768.0,
"step": 323
},
{
"entropy": 0.6296347230672836,
"epoch": 2.064,
"grad_norm": 0.008879579603672028,
"learning_rate": 0.0002,
"loss": 0.632715106010437,
"mean_token_accuracy": 0.7417664974927902,
"num_tokens": 12114584.0,
"step": 324
},
{
"entropy": 0.6318413317203522,
"epoch": 2.0704,
"grad_norm": 0.008431381545960903,
"learning_rate": 0.0002,
"loss": 0.6331377029418945,
"mean_token_accuracy": 0.7394522577524185,
"num_tokens": 12152129.0,
"step": 325
},
{
"entropy": 0.6365228146314621,
"epoch": 2.0768,
"grad_norm": 0.008421050384640694,
"learning_rate": 0.0002,
"loss": 0.6375148296356201,
"mean_token_accuracy": 0.7391103804111481,
"num_tokens": 12189530.0,
"step": 326
},
{
"entropy": 0.6343080475926399,
"epoch": 2.0832,
"grad_norm": 0.008700543083250523,
"learning_rate": 0.0002,
"loss": 0.640760600566864,
"mean_token_accuracy": 0.737753376364708,
"num_tokens": 12227254.0,
"step": 327
},
{
"entropy": 0.6292807161808014,
"epoch": 2.0896,
"grad_norm": 0.008493369445204735,
"learning_rate": 0.0002,
"loss": 0.6337940692901611,
"mean_token_accuracy": 0.7432547584176064,
"num_tokens": 12264717.0,
"step": 328
},
{
"entropy": 0.6373203322291374,
"epoch": 2.096,
"grad_norm": 0.008298007771372795,
"learning_rate": 0.0002,
"loss": 0.6361969709396362,
"mean_token_accuracy": 0.7403373941779137,
"num_tokens": 12301926.0,
"step": 329
},
{
"entropy": 0.645341120660305,
"epoch": 2.1024,
"grad_norm": 0.009415465407073498,
"learning_rate": 0.0002,
"loss": 0.6422229409217834,
"mean_token_accuracy": 0.7388109862804413,
"num_tokens": 12339358.0,
"step": 330
},
{
"entropy": 0.6284746676683426,
"epoch": 2.1088,
"grad_norm": 0.00816258043050766,
"learning_rate": 0.0002,
"loss": 0.6270098090171814,
"mean_token_accuracy": 0.7465712875127792,
"num_tokens": 12376845.0,
"step": 331
},
{
"entropy": 0.618787370622158,
"epoch": 2.1152,
"grad_norm": 0.010069424286484718,
"learning_rate": 0.0002,
"loss": 0.6233252286911011,
"mean_token_accuracy": 0.7466351315379143,
"num_tokens": 12414270.0,
"step": 332
},
{
"entropy": 0.6204424351453781,
"epoch": 2.1216,
"grad_norm": 0.011632254347205162,
"learning_rate": 0.0002,
"loss": 0.6273159384727478,
"mean_token_accuracy": 0.7449653670191765,
"num_tokens": 12451814.0,
"step": 333
},
{
"entropy": 0.6244671940803528,
"epoch": 2.128,
"grad_norm": 0.007731855846941471,
"learning_rate": 0.0002,
"loss": 0.6259894371032715,
"mean_token_accuracy": 0.7442785128951073,
"num_tokens": 12489174.0,
"step": 334
},
{
"entropy": 0.6379582434892654,
"epoch": 2.1344,
"grad_norm": 0.009793682023882866,
"learning_rate": 0.0002,
"loss": 0.6348966360092163,
"mean_token_accuracy": 0.740781731903553,
"num_tokens": 12526495.0,
"step": 335
},
{
"entropy": 0.6337939351797104,
"epoch": 2.1408,
"grad_norm": 0.00962368305772543,
"learning_rate": 0.0002,
"loss": 0.6337376832962036,
"mean_token_accuracy": 0.741876944899559,
"num_tokens": 12563862.0,
"step": 336
},
{
"entropy": 0.6327385306358337,
"epoch": 2.1471999999999998,
"grad_norm": 0.008747846819460392,
"learning_rate": 0.0002,
"loss": 0.6306090354919434,
"mean_token_accuracy": 0.7432660833001137,
"num_tokens": 12601147.0,
"step": 337
},
{
"entropy": 0.6386691257357597,
"epoch": 2.1536,
"grad_norm": 0.008939294144511223,
"learning_rate": 0.0002,
"loss": 0.6422123908996582,
"mean_token_accuracy": 0.7385012805461884,
"num_tokens": 12638941.0,
"step": 338
},
{
"entropy": 0.6356615126132965,
"epoch": 2.16,
"grad_norm": 0.008577845059335232,
"learning_rate": 0.0002,
"loss": 0.6377971768379211,
"mean_token_accuracy": 0.7411153167486191,
"num_tokens": 12676252.0,
"step": 339
},
{
"entropy": 0.6395266354084015,
"epoch": 2.1664,
"grad_norm": 0.009049834683537483,
"learning_rate": 0.0002,
"loss": 0.6420882344245911,
"mean_token_accuracy": 0.7383701205253601,
"num_tokens": 12713835.0,
"step": 340
},
{
"entropy": 0.6292238682508469,
"epoch": 2.1728,
"grad_norm": 0.008495191112160683,
"learning_rate": 0.0002,
"loss": 0.6327275037765503,
"mean_token_accuracy": 0.7408149838447571,
"num_tokens": 12751620.0,
"step": 341
},
{
"entropy": 0.639611691236496,
"epoch": 2.1792,
"grad_norm": 0.009403538890182972,
"learning_rate": 0.0002,
"loss": 0.6445578336715698,
"mean_token_accuracy": 0.7371161133050919,
"num_tokens": 12789311.0,
"step": 342
},
{
"entropy": 0.6382555812597275,
"epoch": 2.1856,
"grad_norm": 0.008258577436208725,
"learning_rate": 0.0002,
"loss": 0.6395673751831055,
"mean_token_accuracy": 0.7395190820097923,
"num_tokens": 12826828.0,
"step": 343
},
{
"entropy": 0.6255771890282631,
"epoch": 2.192,
"grad_norm": 0.008409053087234497,
"learning_rate": 0.0002,
"loss": 0.6285756826400757,
"mean_token_accuracy": 0.7443142682313919,
"num_tokens": 12864340.0,
"step": 344
},
{
"entropy": 0.6310818865895271,
"epoch": 2.1984,
"grad_norm": 0.009435487911105156,
"learning_rate": 0.0002,
"loss": 0.6294571161270142,
"mean_token_accuracy": 0.7434982731938362,
"num_tokens": 12902046.0,
"step": 345
},
{
"entropy": 0.6311678513884544,
"epoch": 2.2048,
"grad_norm": 0.008755765855312347,
"learning_rate": 0.0002,
"loss": 0.6339205503463745,
"mean_token_accuracy": 0.740614227950573,
"num_tokens": 12939744.0,
"step": 346
},
{
"entropy": 0.6452009528875351,
"epoch": 2.2112,
"grad_norm": 0.008575056679546833,
"learning_rate": 0.0002,
"loss": 0.644209623336792,
"mean_token_accuracy": 0.7392476424574852,
"num_tokens": 12977341.0,
"step": 347
},
{
"entropy": 0.6338612660765648,
"epoch": 2.2176,
"grad_norm": 0.007798387669026852,
"learning_rate": 0.0002,
"loss": 0.6330971121788025,
"mean_token_accuracy": 0.7440877333283424,
"num_tokens": 13015002.0,
"step": 348
},
{
"entropy": 0.6385946869850159,
"epoch": 2.224,
"grad_norm": 0.009336304850876331,
"learning_rate": 0.0002,
"loss": 0.6359999179840088,
"mean_token_accuracy": 0.741933673620224,
"num_tokens": 13052683.0,
"step": 349
},
{
"entropy": 0.6185505017638206,
"epoch": 2.2304,
"grad_norm": 0.009118903428316116,
"learning_rate": 0.0002,
"loss": 0.6220842599868774,
"mean_token_accuracy": 0.7472022995352745,
"num_tokens": 13089828.0,
"step": 350
},
{
"entropy": 0.6268252283334732,
"epoch": 2.2368,
"grad_norm": 0.0092701381072402,
"learning_rate": 0.0002,
"loss": 0.6330834627151489,
"mean_token_accuracy": 0.7435643449425697,
"num_tokens": 13127264.0,
"step": 351
},
{
"entropy": 0.6323676556348801,
"epoch": 2.2432,
"grad_norm": 0.010936826467514038,
"learning_rate": 0.0002,
"loss": 0.6385864615440369,
"mean_token_accuracy": 0.7403518706560135,
"num_tokens": 13164850.0,
"step": 352
},
{
"entropy": 0.6403925344347954,
"epoch": 2.2496,
"grad_norm": 0.009062140248715878,
"learning_rate": 0.0002,
"loss": 0.6446559429168701,
"mean_token_accuracy": 0.737325981259346,
"num_tokens": 13202818.0,
"step": 353
},
{
"entropy": 0.6653745025396347,
"epoch": 2.2560000000000002,
"grad_norm": 0.008989578112959862,
"learning_rate": 0.0002,
"loss": 0.6635587215423584,
"mean_token_accuracy": 0.7302659377455711,
"num_tokens": 13240741.0,
"step": 354
},
{
"entropy": 0.6176604405045509,
"epoch": 2.2624,
"grad_norm": 0.011122855357825756,
"learning_rate": 0.0002,
"loss": 0.6100451350212097,
"mean_token_accuracy": 0.7515672147274017,
"num_tokens": 13278017.0,
"step": 355
},
{
"entropy": 0.6418539881706238,
"epoch": 2.2688,
"grad_norm": 0.009430945850908756,
"learning_rate": 0.0002,
"loss": 0.6456764340400696,
"mean_token_accuracy": 0.7369844615459442,
"num_tokens": 13315575.0,
"step": 356
},
{
"entropy": 0.6377789452672005,
"epoch": 2.2752,
"grad_norm": 0.01120819989591837,
"learning_rate": 0.0002,
"loss": 0.6447769999504089,
"mean_token_accuracy": 0.7389207035303116,
"num_tokens": 13353349.0,
"step": 357
},
{
"entropy": 0.6309510096907616,
"epoch": 2.2816,
"grad_norm": 0.01070281770080328,
"learning_rate": 0.0002,
"loss": 0.639892578125,
"mean_token_accuracy": 0.7402263358235359,
"num_tokens": 13390831.0,
"step": 358
},
{
"entropy": 0.6376594752073288,
"epoch": 2.288,
"grad_norm": 0.008750580251216888,
"learning_rate": 0.0002,
"loss": 0.6361696720123291,
"mean_token_accuracy": 0.7411545366048813,
"num_tokens": 13428400.0,
"step": 359
},
{
"entropy": 0.6379339694976807,
"epoch": 2.2944,
"grad_norm": 0.01135624572634697,
"learning_rate": 0.0002,
"loss": 0.6322520971298218,
"mean_token_accuracy": 0.7416113168001175,
"num_tokens": 13465745.0,
"step": 360
},
{
"entropy": 0.6344308853149414,
"epoch": 2.3008,
"grad_norm": 0.008200406096875668,
"learning_rate": 0.0002,
"loss": 0.6279163360595703,
"mean_token_accuracy": 0.7453168705105782,
"num_tokens": 13503838.0,
"step": 361
},
{
"entropy": 0.6380530670285225,
"epoch": 2.3072,
"grad_norm": 0.011549552902579308,
"learning_rate": 0.0002,
"loss": 0.6419570446014404,
"mean_token_accuracy": 0.7404475137591362,
"num_tokens": 13541929.0,
"step": 362
},
{
"entropy": 0.6338977962732315,
"epoch": 2.3136,
"grad_norm": 0.009041829034686089,
"learning_rate": 0.0002,
"loss": 0.6397197842597961,
"mean_token_accuracy": 0.7420290112495422,
"num_tokens": 13579161.0,
"step": 363
},
{
"entropy": 0.6449583545327187,
"epoch": 2.32,
"grad_norm": 0.009089567698538303,
"learning_rate": 0.0002,
"loss": 0.6466807126998901,
"mean_token_accuracy": 0.7365088015794754,
"num_tokens": 13616744.0,
"step": 364
},
{
"entropy": 0.642234593629837,
"epoch": 2.3264,
"grad_norm": 0.009368225000798702,
"learning_rate": 0.0002,
"loss": 0.6429442167282104,
"mean_token_accuracy": 0.7369751259684563,
"num_tokens": 13654392.0,
"step": 365
},
{
"entropy": 0.6480699181556702,
"epoch": 2.3327999999999998,
"grad_norm": 0.008836016058921814,
"learning_rate": 0.0002,
"loss": 0.6484840512275696,
"mean_token_accuracy": 0.7375075444579124,
"num_tokens": 13691824.0,
"step": 366
},
{
"entropy": 0.6319603100419044,
"epoch": 2.3392,
"grad_norm": 0.008661167696118355,
"learning_rate": 0.0002,
"loss": 0.6352815628051758,
"mean_token_accuracy": 0.7423906549811363,
"num_tokens": 13729838.0,
"step": 367
},
{
"entropy": 0.6437906175851822,
"epoch": 2.3456,
"grad_norm": 0.009302763268351555,
"learning_rate": 0.0002,
"loss": 0.6494675874710083,
"mean_token_accuracy": 0.7354337424039841,
"num_tokens": 13767404.0,
"step": 368
},
{
"entropy": 0.6363216936588287,
"epoch": 2.352,
"grad_norm": 0.009825549088418484,
"learning_rate": 0.0002,
"loss": 0.640619158744812,
"mean_token_accuracy": 0.7399841696023941,
"num_tokens": 13805320.0,
"step": 369
},
{
"entropy": 0.6430623680353165,
"epoch": 2.3584,
"grad_norm": 0.008325744420289993,
"learning_rate": 0.0002,
"loss": 0.6433535814285278,
"mean_token_accuracy": 0.7388209700584412,
"num_tokens": 13843211.0,
"step": 370
},
{
"entropy": 0.6459617763757706,
"epoch": 2.3648,
"grad_norm": 0.009273998439311981,
"learning_rate": 0.0002,
"loss": 0.6418501138687134,
"mean_token_accuracy": 0.7380605787038803,
"num_tokens": 13880860.0,
"step": 371
},
{
"entropy": 0.6389967799186707,
"epoch": 2.3712,
"grad_norm": 0.009662107564508915,
"learning_rate": 0.0002,
"loss": 0.6336321830749512,
"mean_token_accuracy": 0.7438643798232079,
"num_tokens": 13918761.0,
"step": 372
},
{
"entropy": 0.638178676366806,
"epoch": 2.3776,
"grad_norm": 0.009039600379765034,
"learning_rate": 0.0002,
"loss": 0.642177164554596,
"mean_token_accuracy": 0.7402292564511299,
"num_tokens": 13956629.0,
"step": 373
},
{
"entropy": 0.6183496937155724,
"epoch": 2.384,
"grad_norm": 0.00997725035995245,
"learning_rate": 0.0002,
"loss": 0.6257633566856384,
"mean_token_accuracy": 0.7432282716035843,
"num_tokens": 13993705.0,
"step": 374
},
{
"entropy": 0.6249210014939308,
"epoch": 2.3904,
"grad_norm": 0.007910847663879395,
"learning_rate": 0.0002,
"loss": 0.625819981098175,
"mean_token_accuracy": 0.7441049888730049,
"num_tokens": 14031321.0,
"step": 375
},
{
"entropy": 0.6479079499840736,
"epoch": 2.3968,
"grad_norm": 0.00891756173223257,
"learning_rate": 0.0002,
"loss": 0.6501407623291016,
"mean_token_accuracy": 0.7355809286236763,
"num_tokens": 14069143.0,
"step": 376
},
{
"entropy": 0.6394218653440475,
"epoch": 2.4032,
"grad_norm": 0.00850125402212143,
"learning_rate": 0.0002,
"loss": 0.6394637823104858,
"mean_token_accuracy": 0.7385919019579887,
"num_tokens": 14106711.0,
"step": 377
},
{
"entropy": 0.6354732289910316,
"epoch": 2.4096,
"grad_norm": 0.008283271454274654,
"learning_rate": 0.0002,
"loss": 0.6353892087936401,
"mean_token_accuracy": 0.7419078797101974,
"num_tokens": 14144364.0,
"step": 378
},
{
"entropy": 0.6316136568784714,
"epoch": 2.416,
"grad_norm": 0.009771537035703659,
"learning_rate": 0.0002,
"loss": 0.6347823143005371,
"mean_token_accuracy": 0.7427188232541084,
"num_tokens": 14181995.0,
"step": 379
},
{
"entropy": 0.6375484988093376,
"epoch": 2.4224,
"grad_norm": 0.008568905293941498,
"learning_rate": 0.0002,
"loss": 0.6410992741584778,
"mean_token_accuracy": 0.7378129065036774,
"num_tokens": 14219687.0,
"step": 380
},
{
"entropy": 0.6333465948700905,
"epoch": 2.4288,
"grad_norm": 0.007412395905703306,
"learning_rate": 0.0002,
"loss": 0.6309605836868286,
"mean_token_accuracy": 0.7434795945882797,
"num_tokens": 14257055.0,
"step": 381
},
{
"entropy": 0.6269642487168312,
"epoch": 2.4352,
"grad_norm": 0.008765887469053268,
"learning_rate": 0.0002,
"loss": 0.6296891570091248,
"mean_token_accuracy": 0.7441322207450867,
"num_tokens": 14294332.0,
"step": 382
},
{
"entropy": 0.6352812573313713,
"epoch": 2.4416,
"grad_norm": 0.009595113806426525,
"learning_rate": 0.0002,
"loss": 0.6348291039466858,
"mean_token_accuracy": 0.7420725524425507,
"num_tokens": 14331865.0,
"step": 383
},
{
"entropy": 0.6441971585154533,
"epoch": 2.448,
"grad_norm": 0.008584806695580482,
"learning_rate": 0.0002,
"loss": 0.6498426198959351,
"mean_token_accuracy": 0.7357524335384369,
"num_tokens": 14369788.0,
"step": 384
},
{
"entropy": 0.6287561655044556,
"epoch": 2.4544,
"grad_norm": 0.008044449612498283,
"learning_rate": 0.0002,
"loss": 0.6315615177154541,
"mean_token_accuracy": 0.7426558956503868,
"num_tokens": 14407482.0,
"step": 385
},
{
"entropy": 0.6339204907417297,
"epoch": 2.4608,
"grad_norm": 0.007299972232431173,
"learning_rate": 0.0002,
"loss": 0.6352561116218567,
"mean_token_accuracy": 0.74134461581707,
"num_tokens": 14445123.0,
"step": 386
},
{
"entropy": 0.6295419782400131,
"epoch": 2.4672,
"grad_norm": 0.008794458582997322,
"learning_rate": 0.0002,
"loss": 0.6306071281433105,
"mean_token_accuracy": 0.7435100376605988,
"num_tokens": 14482719.0,
"step": 387
},
{
"entropy": 0.622240737080574,
"epoch": 2.4736000000000002,
"grad_norm": 0.008617876097559929,
"learning_rate": 0.0002,
"loss": 0.6234915256500244,
"mean_token_accuracy": 0.7468436509370804,
"num_tokens": 14520261.0,
"step": 388
},
{
"entropy": 0.6362800300121307,
"epoch": 2.48,
"grad_norm": 0.008423526771366596,
"learning_rate": 0.0002,
"loss": 0.641099214553833,
"mean_token_accuracy": 0.7397967800498009,
"num_tokens": 14557676.0,
"step": 389
},
{
"entropy": 0.6532713696360588,
"epoch": 2.4864,
"grad_norm": 0.008641418069601059,
"learning_rate": 0.0002,
"loss": 0.6506437063217163,
"mean_token_accuracy": 0.7350734695792198,
"num_tokens": 14595548.0,
"step": 390
},
{
"entropy": 0.6302274093031883,
"epoch": 2.4928,
"grad_norm": 0.00921640731394291,
"learning_rate": 0.0002,
"loss": 0.6322726607322693,
"mean_token_accuracy": 0.7424062266945839,
"num_tokens": 14632684.0,
"step": 391
},
{
"entropy": 0.6293173208832741,
"epoch": 2.4992,
"grad_norm": 0.008461368270218372,
"learning_rate": 0.0002,
"loss": 0.6278185844421387,
"mean_token_accuracy": 0.744764506816864,
"num_tokens": 14670523.0,
"step": 392
},
{
"entropy": 0.6276180446147919,
"epoch": 2.5056000000000003,
"grad_norm": 0.008572320453822613,
"learning_rate": 0.0002,
"loss": 0.631564736366272,
"mean_token_accuracy": 0.7426915839314461,
"num_tokens": 14708031.0,
"step": 393
},
{
"entropy": 0.6308008059859276,
"epoch": 2.512,
"grad_norm": 0.008926871232688427,
"learning_rate": 0.0002,
"loss": 0.633114755153656,
"mean_token_accuracy": 0.7416298165917397,
"num_tokens": 14745679.0,
"step": 394
},
{
"entropy": 0.6268336623907089,
"epoch": 2.5183999999999997,
"grad_norm": 0.008902951143682003,
"learning_rate": 0.0002,
"loss": 0.627051830291748,
"mean_token_accuracy": 0.7439748197793961,
"num_tokens": 14783397.0,
"step": 395
},
{
"entropy": 0.634651429951191,
"epoch": 2.5248,
"grad_norm": 0.00856532622128725,
"learning_rate": 0.0002,
"loss": 0.6363992691040039,
"mean_token_accuracy": 0.7408565506339073,
"num_tokens": 14820870.0,
"step": 396
},
{
"entropy": 0.6315286681056023,
"epoch": 2.5312,
"grad_norm": 0.009570743888616562,
"learning_rate": 0.0002,
"loss": 0.6403943300247192,
"mean_token_accuracy": 0.7384237721562386,
"num_tokens": 14858066.0,
"step": 397
},
{
"entropy": 0.6313930228352547,
"epoch": 2.5376,
"grad_norm": 0.007634198758751154,
"learning_rate": 0.0002,
"loss": 0.63489830493927,
"mean_token_accuracy": 0.740663692355156,
"num_tokens": 14895686.0,
"step": 398
},
{
"entropy": 0.6275153756141663,
"epoch": 2.544,
"grad_norm": 0.00890920590609312,
"learning_rate": 0.0002,
"loss": 0.6264928579330444,
"mean_token_accuracy": 0.7460935115814209,
"num_tokens": 14933293.0,
"step": 399
},
{
"entropy": 0.6245445236563683,
"epoch": 2.5504,
"grad_norm": 0.009081481955945492,
"learning_rate": 0.0002,
"loss": 0.6231961250305176,
"mean_token_accuracy": 0.7458623945713043,
"num_tokens": 14970626.0,
"step": 400
},
{
"entropy": 0.6321042701601982,
"epoch": 2.5568,
"grad_norm": 0.01011180505156517,
"learning_rate": 0.0002,
"loss": 0.6376926898956299,
"mean_token_accuracy": 0.7382810115814209,
"num_tokens": 15008147.0,
"step": 401
},
{
"entropy": 0.6281652376055717,
"epoch": 2.5632,
"grad_norm": 0.008269083686172962,
"learning_rate": 0.0002,
"loss": 0.6288952231407166,
"mean_token_accuracy": 0.7468898370862007,
"num_tokens": 15045200.0,
"step": 402
},
{
"entropy": 0.6325756087899208,
"epoch": 2.5696,
"grad_norm": 0.009284023195505142,
"learning_rate": 0.0002,
"loss": 0.6372162103652954,
"mean_token_accuracy": 0.7393135726451874,
"num_tokens": 15082728.0,
"step": 403
},
{
"entropy": 0.6326915472745895,
"epoch": 2.576,
"grad_norm": 0.008368260227143764,
"learning_rate": 0.0002,
"loss": 0.6289712190628052,
"mean_token_accuracy": 0.7438352182507515,
"num_tokens": 15120176.0,
"step": 404
},
{
"entropy": 0.6458227932453156,
"epoch": 2.5824,
"grad_norm": 0.008600444532930851,
"learning_rate": 0.0002,
"loss": 0.6437180042266846,
"mean_token_accuracy": 0.7360183447599411,
"num_tokens": 15157874.0,
"step": 405
},
{
"entropy": 0.6378503367304802,
"epoch": 2.5888,
"grad_norm": 0.008291950449347496,
"learning_rate": 0.0002,
"loss": 0.6357482075691223,
"mean_token_accuracy": 0.7405651807785034,
"num_tokens": 15195757.0,
"step": 406
},
{
"entropy": 0.6248553469777107,
"epoch": 2.5952,
"grad_norm": 0.009239988401532173,
"learning_rate": 0.0002,
"loss": 0.6330691576004028,
"mean_token_accuracy": 0.7403087541460991,
"num_tokens": 15232888.0,
"step": 407
},
{
"entropy": 0.6266547441482544,
"epoch": 2.6016,
"grad_norm": 0.008323184214532375,
"learning_rate": 0.0002,
"loss": 0.6295891404151917,
"mean_token_accuracy": 0.7445848137140274,
"num_tokens": 15270471.0,
"step": 408
},
{
"entropy": 0.6273859366774559,
"epoch": 2.608,
"grad_norm": 0.008808370679616928,
"learning_rate": 0.0002,
"loss": 0.6343215107917786,
"mean_token_accuracy": 0.7426254749298096,
"num_tokens": 15307996.0,
"step": 409
},
{
"entropy": 0.649120107293129,
"epoch": 2.6144,
"grad_norm": 0.008977086283266544,
"learning_rate": 0.0002,
"loss": 0.6475695371627808,
"mean_token_accuracy": 0.7367869392037392,
"num_tokens": 15345526.0,
"step": 410
},
{
"entropy": 0.6383312568068504,
"epoch": 2.6208,
"grad_norm": 0.009833469986915588,
"learning_rate": 0.0002,
"loss": 0.6327086091041565,
"mean_token_accuracy": 0.7418203428387642,
"num_tokens": 15382760.0,
"step": 411
},
{
"entropy": 0.6142470389604568,
"epoch": 2.6272,
"grad_norm": 0.007820895873010159,
"learning_rate": 0.0002,
"loss": 0.614084780216217,
"mean_token_accuracy": 0.7492156624794006,
"num_tokens": 15420133.0,
"step": 412
},
{
"entropy": 0.6232952103018761,
"epoch": 2.6336,
"grad_norm": 0.010564403608441353,
"learning_rate": 0.0002,
"loss": 0.6333082318305969,
"mean_token_accuracy": 0.7423960939049721,
"num_tokens": 15457883.0,
"step": 413
},
{
"entropy": 0.6330999732017517,
"epoch": 2.64,
"grad_norm": 0.009710205718874931,
"learning_rate": 0.0002,
"loss": 0.6388413906097412,
"mean_token_accuracy": 0.7408091574907303,
"num_tokens": 15495425.0,
"step": 414
},
{
"entropy": 0.6545180752873421,
"epoch": 2.6464,
"grad_norm": 0.00887272972613573,
"learning_rate": 0.0002,
"loss": 0.6515014171600342,
"mean_token_accuracy": 0.7343106046319008,
"num_tokens": 15532965.0,
"step": 415
},
{
"entropy": 0.6397780776023865,
"epoch": 2.6528,
"grad_norm": 0.008293447084724903,
"learning_rate": 0.0002,
"loss": 0.6368398666381836,
"mean_token_accuracy": 0.7398713007569313,
"num_tokens": 15570436.0,
"step": 416
},
{
"entropy": 0.6291993260383606,
"epoch": 2.6592000000000002,
"grad_norm": 0.008709436282515526,
"learning_rate": 0.0002,
"loss": 0.6272790431976318,
"mean_token_accuracy": 0.745321199297905,
"num_tokens": 15607874.0,
"step": 417
},
{
"entropy": 0.648408018052578,
"epoch": 2.6656,
"grad_norm": 0.009814375080168247,
"learning_rate": 0.0002,
"loss": 0.6569237112998962,
"mean_token_accuracy": 0.7306895926594734,
"num_tokens": 15645823.0,
"step": 418
},
{
"entropy": 0.6370497196912766,
"epoch": 2.672,
"grad_norm": 0.00858649704605341,
"learning_rate": 0.0002,
"loss": 0.6417921781539917,
"mean_token_accuracy": 0.738996684551239,
"num_tokens": 15683110.0,
"step": 419
},
{
"entropy": 0.6393727734684944,
"epoch": 2.6784,
"grad_norm": 0.009777788072824478,
"learning_rate": 0.0002,
"loss": 0.6401950120925903,
"mean_token_accuracy": 0.7391480058431625,
"num_tokens": 15720611.0,
"step": 420
},
{
"entropy": 0.63716159760952,
"epoch": 2.6848,
"grad_norm": 0.008626547642052174,
"learning_rate": 0.0002,
"loss": 0.6399793028831482,
"mean_token_accuracy": 0.739508643746376,
"num_tokens": 15758221.0,
"step": 421
},
{
"entropy": 0.6414335444569588,
"epoch": 2.6912000000000003,
"grad_norm": 0.009168457239866257,
"learning_rate": 0.0002,
"loss": 0.6497803926467896,
"mean_token_accuracy": 0.7342201620340347,
"num_tokens": 15795862.0,
"step": 422
},
{
"entropy": 0.6342490315437317,
"epoch": 2.6976,
"grad_norm": 0.009793863631784916,
"learning_rate": 0.0002,
"loss": 0.6359165906906128,
"mean_token_accuracy": 0.7401581779122353,
"num_tokens": 15833350.0,
"step": 423
},
{
"entropy": 0.6518041715025902,
"epoch": 2.7039999999999997,
"grad_norm": 0.0076965210027992725,
"learning_rate": 0.0002,
"loss": 0.649188756942749,
"mean_token_accuracy": 0.735841915011406,
"num_tokens": 15871335.0,
"step": 424
},
{
"entropy": 0.6324848383665085,
"epoch": 2.7104,
"grad_norm": 0.007825566455721855,
"learning_rate": 0.0002,
"loss": 0.6314542293548584,
"mean_token_accuracy": 0.7424084842205048,
"num_tokens": 15909163.0,
"step": 425
},
{
"entropy": 0.6271793767809868,
"epoch": 2.7168,
"grad_norm": 0.007992296479642391,
"learning_rate": 0.0002,
"loss": 0.6311610341072083,
"mean_token_accuracy": 0.7418703660368919,
"num_tokens": 15946937.0,
"step": 426
},
{
"entropy": 0.6191146075725555,
"epoch": 2.7232,
"grad_norm": 0.007840313948690891,
"learning_rate": 0.0002,
"loss": 0.6227446794509888,
"mean_token_accuracy": 0.7470360621809959,
"num_tokens": 15984420.0,
"step": 427
},
{
"entropy": 0.6226735487580299,
"epoch": 2.7296,
"grad_norm": 0.007951436564326286,
"learning_rate": 0.0002,
"loss": 0.6275327205657959,
"mean_token_accuracy": 0.7467052638530731,
"num_tokens": 16021985.0,
"step": 428
},
{
"entropy": 0.6366565078496933,
"epoch": 2.7359999999999998,
"grad_norm": 0.007951410487294197,
"learning_rate": 0.0002,
"loss": 0.6385185122489929,
"mean_token_accuracy": 0.7392742782831192,
"num_tokens": 16059718.0,
"step": 429
},
{
"entropy": 0.6241059601306915,
"epoch": 2.7424,
"grad_norm": 0.008495664224028587,
"learning_rate": 0.0002,
"loss": 0.6223422288894653,
"mean_token_accuracy": 0.7480814754962921,
"num_tokens": 16096969.0,
"step": 430
},
{
"entropy": 0.6395189017057419,
"epoch": 2.7488,
"grad_norm": 0.008117246441543102,
"learning_rate": 0.0002,
"loss": 0.6383851766586304,
"mean_token_accuracy": 0.7399205639958382,
"num_tokens": 16135311.0,
"step": 431
},
{
"entropy": 0.6342849209904671,
"epoch": 2.7552,
"grad_norm": 0.007573962211608887,
"learning_rate": 0.0002,
"loss": 0.6357378959655762,
"mean_token_accuracy": 0.7413295134902,
"num_tokens": 16173264.0,
"step": 432
},
{
"entropy": 0.6290313079953194,
"epoch": 2.7616,
"grad_norm": 0.00819240789860487,
"learning_rate": 0.0002,
"loss": 0.6312831044197083,
"mean_token_accuracy": 0.7436259835958481,
"num_tokens": 16210940.0,
"step": 433
},
{
"entropy": 0.6433441936969757,
"epoch": 2.768,
"grad_norm": 0.00860763993114233,
"learning_rate": 0.0002,
"loss": 0.6448662877082825,
"mean_token_accuracy": 0.7353287860751152,
"num_tokens": 16248287.0,
"step": 434
},
{
"entropy": 0.6330644562840462,
"epoch": 2.7744,
"grad_norm": 0.0077530574053525925,
"learning_rate": 0.0002,
"loss": 0.6352605819702148,
"mean_token_accuracy": 0.7418182790279388,
"num_tokens": 16285750.0,
"step": 435
},
{
"entropy": 0.6248625069856644,
"epoch": 2.7808,
"grad_norm": 0.007953410036861897,
"learning_rate": 0.0002,
"loss": 0.6288837790489197,
"mean_token_accuracy": 0.7424777820706367,
"num_tokens": 16322871.0,
"step": 436
},
{
"entropy": 0.6338153034448624,
"epoch": 2.7872,
"grad_norm": 0.008173540234565735,
"learning_rate": 0.0002,
"loss": 0.6316856145858765,
"mean_token_accuracy": 0.743153415620327,
"num_tokens": 16360741.0,
"step": 437
},
{
"entropy": 0.6180099546909332,
"epoch": 2.7936,
"grad_norm": 0.008011853322386742,
"learning_rate": 0.0002,
"loss": 0.6195465922355652,
"mean_token_accuracy": 0.7491164207458496,
"num_tokens": 16398052.0,
"step": 438
},
{
"entropy": 0.6288798898458481,
"epoch": 2.8,
"grad_norm": 0.008486307226121426,
"learning_rate": 0.0002,
"loss": 0.6308120489120483,
"mean_token_accuracy": 0.7431682348251343,
"num_tokens": 16435504.0,
"step": 439
},
{
"entropy": 0.6349303498864174,
"epoch": 2.8064,
"grad_norm": 0.009010681882500648,
"learning_rate": 0.0002,
"loss": 0.632607102394104,
"mean_token_accuracy": 0.7425792217254639,
"num_tokens": 16473212.0,
"step": 440
},
{
"entropy": 0.630001574754715,
"epoch": 2.8128,
"grad_norm": 0.008531573228538036,
"learning_rate": 0.0002,
"loss": 0.6290241479873657,
"mean_token_accuracy": 0.7448351979255676,
"num_tokens": 16510183.0,
"step": 441
},
{
"entropy": 0.6317692324519157,
"epoch": 2.8192,
"grad_norm": 0.008379535749554634,
"learning_rate": 0.0002,
"loss": 0.6360982656478882,
"mean_token_accuracy": 0.7403805702924728,
"num_tokens": 16547649.0,
"step": 442
},
{
"entropy": 0.6221532076597214,
"epoch": 2.8256,
"grad_norm": 0.00981364119797945,
"learning_rate": 0.0002,
"loss": 0.6305652856826782,
"mean_token_accuracy": 0.7410502806305885,
"num_tokens": 16584772.0,
"step": 443
},
{
"entropy": 0.6281775683164597,
"epoch": 2.832,
"grad_norm": 0.009363848716020584,
"learning_rate": 0.0002,
"loss": 0.6325273513793945,
"mean_token_accuracy": 0.7412790656089783,
"num_tokens": 16622377.0,
"step": 444
},
{
"entropy": 0.6282860860228539,
"epoch": 2.8384,
"grad_norm": 0.008815777488052845,
"learning_rate": 0.0002,
"loss": 0.6224972009658813,
"mean_token_accuracy": 0.7473303973674774,
"num_tokens": 16659850.0,
"step": 445
},
{
"entropy": 0.6256547048687935,
"epoch": 2.8448,
"grad_norm": 0.008997517637908459,
"learning_rate": 0.0002,
"loss": 0.6249480247497559,
"mean_token_accuracy": 0.744784526526928,
"num_tokens": 16697507.0,
"step": 446
},
{
"entropy": 0.6432123258709908,
"epoch": 2.8512,
"grad_norm": 0.007546784356236458,
"learning_rate": 0.0002,
"loss": 0.6468585133552551,
"mean_token_accuracy": 0.7387454062700272,
"num_tokens": 16735166.0,
"step": 447
},
{
"entropy": 0.6291612312197685,
"epoch": 2.8576,
"grad_norm": 0.008677622303366661,
"learning_rate": 0.0002,
"loss": 0.6363067030906677,
"mean_token_accuracy": 0.7402229011058807,
"num_tokens": 16772700.0,
"step": 448
},
{
"entropy": 0.6394010931253433,
"epoch": 2.864,
"grad_norm": 0.008233144879341125,
"learning_rate": 0.0002,
"loss": 0.6435496807098389,
"mean_token_accuracy": 0.7371494546532631,
"num_tokens": 16810206.0,
"step": 449
},
{
"entropy": 0.6323223188519478,
"epoch": 2.8704,
"grad_norm": 0.009190903976559639,
"learning_rate": 0.0002,
"loss": 0.6313977837562561,
"mean_token_accuracy": 0.74195995926857,
"num_tokens": 16847440.0,
"step": 450
},
{
"entropy": 0.6317964419722557,
"epoch": 2.8768000000000002,
"grad_norm": 0.008045881986618042,
"learning_rate": 0.0002,
"loss": 0.6350542306900024,
"mean_token_accuracy": 0.7399737685918808,
"num_tokens": 16884842.0,
"step": 451
},
{
"entropy": 0.6307216063141823,
"epoch": 2.8832,
"grad_norm": 0.008613558486104012,
"learning_rate": 0.0002,
"loss": 0.6330459117889404,
"mean_token_accuracy": 0.7425104603171349,
"num_tokens": 16922153.0,
"step": 452
},
{
"entropy": 0.6381876915693283,
"epoch": 2.8895999999999997,
"grad_norm": 0.008792484179139137,
"learning_rate": 0.0002,
"loss": 0.6396152973175049,
"mean_token_accuracy": 0.7395381852984428,
"num_tokens": 16959837.0,
"step": 453
},
{
"entropy": 0.6402597278356552,
"epoch": 2.896,
"grad_norm": 0.008886914700269699,
"learning_rate": 0.0002,
"loss": 0.6391183137893677,
"mean_token_accuracy": 0.7400619834661484,
"num_tokens": 16997252.0,
"step": 454
},
{
"entropy": 0.6395518109202385,
"epoch": 2.9024,
"grad_norm": 0.008145366795361042,
"learning_rate": 0.0002,
"loss": 0.6410524845123291,
"mean_token_accuracy": 0.7384562343358994,
"num_tokens": 17034792.0,
"step": 455
},
{
"entropy": 0.6335340291261673,
"epoch": 2.9088000000000003,
"grad_norm": 0.008513481356203556,
"learning_rate": 0.0002,
"loss": 0.6360284686088562,
"mean_token_accuracy": 0.7419657409191132,
"num_tokens": 17072806.0,
"step": 456
},
{
"entropy": 0.6339850574731827,
"epoch": 2.9152,
"grad_norm": 0.00826951116323471,
"learning_rate": 0.0002,
"loss": 0.6338396668434143,
"mean_token_accuracy": 0.7435676008462906,
"num_tokens": 17110256.0,
"step": 457
},
{
"entropy": 0.6330336853861809,
"epoch": 2.9215999999999998,
"grad_norm": 0.008118857629597187,
"learning_rate": 0.0002,
"loss": 0.6347401738166809,
"mean_token_accuracy": 0.7419733926653862,
"num_tokens": 17147669.0,
"step": 458
},
{
"entropy": 0.6518657803535461,
"epoch": 2.928,
"grad_norm": 0.008373484946787357,
"learning_rate": 0.0002,
"loss": 0.6521078944206238,
"mean_token_accuracy": 0.7351536229252815,
"num_tokens": 17185406.0,
"step": 459
},
{
"entropy": 0.6362840831279755,
"epoch": 2.9344,
"grad_norm": 0.00781342200934887,
"learning_rate": 0.0002,
"loss": 0.6393336057662964,
"mean_token_accuracy": 0.7391062676906586,
"num_tokens": 17223104.0,
"step": 460
},
{
"entropy": 0.6365083158016205,
"epoch": 2.9408,
"grad_norm": 0.010520093142986298,
"learning_rate": 0.0002,
"loss": 0.643227219581604,
"mean_token_accuracy": 0.7367514818906784,
"num_tokens": 17260499.0,
"step": 461
},
{
"entropy": 0.6365673765540123,
"epoch": 2.9472,
"grad_norm": 0.008144881576299667,
"learning_rate": 0.0002,
"loss": 0.6345622539520264,
"mean_token_accuracy": 0.7417429983615875,
"num_tokens": 17298154.0,
"step": 462
},
{
"entropy": 0.6422977894544601,
"epoch": 2.9536,
"grad_norm": 0.007375301793217659,
"learning_rate": 0.0002,
"loss": 0.6420764923095703,
"mean_token_accuracy": 0.737017072737217,
"num_tokens": 17336075.0,
"step": 463
},
{
"entropy": 0.6339726597070694,
"epoch": 2.96,
"grad_norm": 0.008432124741375446,
"learning_rate": 0.0002,
"loss": 0.6357682347297668,
"mean_token_accuracy": 0.742248572409153,
"num_tokens": 17373430.0,
"step": 464
},
{
"entropy": 0.6369189694523811,
"epoch": 2.9664,
"grad_norm": 0.008471203036606312,
"learning_rate": 0.0002,
"loss": 0.6386595964431763,
"mean_token_accuracy": 0.7397382780909538,
"num_tokens": 17411298.0,
"step": 465
},
{
"entropy": 0.6291254833340645,
"epoch": 2.9728,
"grad_norm": 0.007794877514243126,
"learning_rate": 0.0002,
"loss": 0.6330430507659912,
"mean_token_accuracy": 0.743395060300827,
"num_tokens": 17448723.0,
"step": 466
},
{
"entropy": 0.6243666335940361,
"epoch": 2.9792,
"grad_norm": 0.008405648171901703,
"learning_rate": 0.0002,
"loss": 0.6291847229003906,
"mean_token_accuracy": 0.7437793165445328,
"num_tokens": 17486207.0,
"step": 467
},
{
"entropy": 0.6350819692015648,
"epoch": 2.9856,
"grad_norm": 0.008273884654045105,
"learning_rate": 0.0002,
"loss": 0.6370283365249634,
"mean_token_accuracy": 0.7423520013689995,
"num_tokens": 17524019.0,
"step": 468
},
{
"entropy": 0.6391937509179115,
"epoch": 2.992,
"grad_norm": 0.008686189539730549,
"learning_rate": 0.0002,
"loss": 0.6426953077316284,
"mean_token_accuracy": 0.7379648461937904,
"num_tokens": 17561604.0,
"step": 469
},
{
"entropy": 0.6394234076142311,
"epoch": 2.9984,
"grad_norm": 0.008572033606469631,
"learning_rate": 0.0002,
"loss": 0.6405370235443115,
"mean_token_accuracy": 0.7394323572516441,
"num_tokens": 17599047.0,
"step": 470
},
{
"entropy": 0.646001398563385,
"epoch": 3.0,
"grad_norm": 0.016055934131145477,
"learning_rate": 0.0002,
"loss": 0.654330313205719,
"mean_token_accuracy": 0.7357074916362762,
"num_tokens": 17608447.0,
"step": 471
},
{
"entropy": 0.6399871557950974,
"epoch": 3.0064,
"grad_norm": 0.010128894820809364,
"learning_rate": 0.0002,
"loss": 0.630492091178894,
"mean_token_accuracy": 0.7438428327441216,
"num_tokens": 17646580.0,
"step": 472
},
{
"entropy": 0.6400877311825752,
"epoch": 3.0128,
"grad_norm": 0.0109670115634799,
"learning_rate": 0.0002,
"loss": 0.6348856687545776,
"mean_token_accuracy": 0.7409028187394142,
"num_tokens": 17684203.0,
"step": 473
},
{
"entropy": 0.6349283009767532,
"epoch": 3.0192,
"grad_norm": 0.010457641445100307,
"learning_rate": 0.0002,
"loss": 0.6400600671768188,
"mean_token_accuracy": 0.7396369203925133,
"num_tokens": 17721781.0,
"step": 474
},
{
"entropy": 0.6234990581870079,
"epoch": 3.0256,
"grad_norm": 0.01080863457173109,
"learning_rate": 0.0002,
"loss": 0.6308765411376953,
"mean_token_accuracy": 0.7440793961286545,
"num_tokens": 17759054.0,
"step": 475
},
{
"entropy": 0.6226209849119186,
"epoch": 3.032,
"grad_norm": 0.010244046337902546,
"learning_rate": 0.0002,
"loss": 0.6284743547439575,
"mean_token_accuracy": 0.7413820326328278,
"num_tokens": 17796583.0,
"step": 476
},
{
"entropy": 0.626485787332058,
"epoch": 3.0384,
"grad_norm": 0.00895832572132349,
"learning_rate": 0.0002,
"loss": 0.6250468492507935,
"mean_token_accuracy": 0.7454337328672409,
"num_tokens": 17833917.0,
"step": 477
},
{
"entropy": 0.6430812701582909,
"epoch": 3.0448,
"grad_norm": 0.011450681835412979,
"learning_rate": 0.0002,
"loss": 0.636460542678833,
"mean_token_accuracy": 0.737629309296608,
"num_tokens": 17871185.0,
"step": 478
},
{
"entropy": 0.6313450038433075,
"epoch": 3.0512,
"grad_norm": 0.010822657495737076,
"learning_rate": 0.0002,
"loss": 0.6283341646194458,
"mean_token_accuracy": 0.7447119951248169,
"num_tokens": 17909021.0,
"step": 479
},
{
"entropy": 0.616793729364872,
"epoch": 3.0576,
"grad_norm": 0.012827937491238117,
"learning_rate": 0.0002,
"loss": 0.6257752180099487,
"mean_token_accuracy": 0.7451038733124733,
"num_tokens": 17946561.0,
"step": 480
},
{
"entropy": 0.6195474341511726,
"epoch": 3.064,
"grad_norm": 0.011573764495551586,
"learning_rate": 0.0002,
"loss": 0.630095899105072,
"mean_token_accuracy": 0.7431527376174927,
"num_tokens": 17983774.0,
"step": 481
},
{
"entropy": 0.6207288056612015,
"epoch": 3.0704,
"grad_norm": 0.008784581907093525,
"learning_rate": 0.0002,
"loss": 0.6228084564208984,
"mean_token_accuracy": 0.7441780641674995,
"num_tokens": 18021797.0,
"step": 482
},
{
"entropy": 0.6219965890049934,
"epoch": 3.0768,
"grad_norm": 0.009525037370622158,
"learning_rate": 0.0002,
"loss": 0.6203585863113403,
"mean_token_accuracy": 0.7454776242375374,
"num_tokens": 18059600.0,
"step": 483
},
{
"entropy": 0.6240369379520416,
"epoch": 3.0832,
"grad_norm": 0.010099082253873348,
"learning_rate": 0.0002,
"loss": 0.6236456632614136,
"mean_token_accuracy": 0.7461361885070801,
"num_tokens": 18097249.0,
"step": 484
},
{
"entropy": 0.6231376677751541,
"epoch": 3.0896,
"grad_norm": 0.009384946897625923,
"learning_rate": 0.0002,
"loss": 0.6250054240226746,
"mean_token_accuracy": 0.7437941208481789,
"num_tokens": 18134395.0,
"step": 485
},
{
"entropy": 0.6311322897672653,
"epoch": 3.096,
"grad_norm": 0.010897154919803143,
"learning_rate": 0.0002,
"loss": 0.6397508978843689,
"mean_token_accuracy": 0.7386776655912399,
"num_tokens": 18171963.0,
"step": 486
},
{
"entropy": 0.62527284771204,
"epoch": 3.1024,
"grad_norm": 0.009014398790895939,
"learning_rate": 0.0002,
"loss": 0.629889726638794,
"mean_token_accuracy": 0.7426332533359528,
"num_tokens": 18209290.0,
"step": 487
},
{
"entropy": 0.6315117180347443,
"epoch": 3.1088,
"grad_norm": 0.010383408516645432,
"learning_rate": 0.0002,
"loss": 0.6257723569869995,
"mean_token_accuracy": 0.7457722872495651,
"num_tokens": 18247004.0,
"step": 488
},
{
"entropy": 0.6517661288380623,
"epoch": 3.1152,
"grad_norm": 0.009840711019933224,
"learning_rate": 0.0002,
"loss": 0.6448700428009033,
"mean_token_accuracy": 0.7368841990828514,
"num_tokens": 18284521.0,
"step": 489
},
{
"entropy": 0.6304850652813911,
"epoch": 3.1216,
"grad_norm": 0.009999154135584831,
"learning_rate": 0.0002,
"loss": 0.6314412951469421,
"mean_token_accuracy": 0.7430186495184898,
"num_tokens": 18321986.0,
"step": 490
},
{
"entropy": 0.6318495348095894,
"epoch": 3.128,
"grad_norm": 0.011276421137154102,
"learning_rate": 0.0002,
"loss": 0.6365323066711426,
"mean_token_accuracy": 0.7421404719352722,
"num_tokens": 18359940.0,
"step": 491
},
{
"entropy": 0.6343097537755966,
"epoch": 3.1344,
"grad_norm": 0.009451535530388355,
"learning_rate": 0.0002,
"loss": 0.6381996273994446,
"mean_token_accuracy": 0.7415077835321426,
"num_tokens": 18397600.0,
"step": 492
},
{
"entropy": 0.6369383260607719,
"epoch": 3.1408,
"grad_norm": 0.009595794603228569,
"learning_rate": 0.0002,
"loss": 0.6356371641159058,
"mean_token_accuracy": 0.7401534095406532,
"num_tokens": 18435100.0,
"step": 493
},
{
"entropy": 0.6311136037111282,
"epoch": 3.1471999999999998,
"grad_norm": 0.011402090080082417,
"learning_rate": 0.0002,
"loss": 0.630678117275238,
"mean_token_accuracy": 0.7420787587761879,
"num_tokens": 18472437.0,
"step": 494
},
{
"entropy": 0.6152165159583092,
"epoch": 3.1536,
"grad_norm": 0.009202217683196068,
"learning_rate": 0.0002,
"loss": 0.6150789260864258,
"mean_token_accuracy": 0.749266542494297,
"num_tokens": 18509694.0,
"step": 495
},
{
"entropy": 0.6187552213668823,
"epoch": 3.16,
"grad_norm": 0.012286514043807983,
"learning_rate": 0.0002,
"loss": 0.6278830170631409,
"mean_token_accuracy": 0.7449735552072525,
"num_tokens": 18547270.0,
"step": 496
},
{
"entropy": 0.624017171561718,
"epoch": 3.1664,
"grad_norm": 0.009709254838526249,
"learning_rate": 0.0002,
"loss": 0.6308646202087402,
"mean_token_accuracy": 0.7407297566533089,
"num_tokens": 18584781.0,
"step": 497
},
{
"entropy": 0.6381459310650826,
"epoch": 3.1728,
"grad_norm": 0.010118975304067135,
"learning_rate": 0.0002,
"loss": 0.6422901153564453,
"mean_token_accuracy": 0.7380207404494286,
"num_tokens": 18622605.0,
"step": 498
},
{
"entropy": 0.6330775320529938,
"epoch": 3.1792,
"grad_norm": 0.010614707134664059,
"learning_rate": 0.0002,
"loss": 0.626909613609314,
"mean_token_accuracy": 0.7434390485286713,
"num_tokens": 18660181.0,
"step": 499
},
{
"entropy": 0.6467690318822861,
"epoch": 3.1856,
"grad_norm": 0.011636339128017426,
"learning_rate": 0.0002,
"loss": 0.6417078971862793,
"mean_token_accuracy": 0.7391890659928322,
"num_tokens": 18697960.0,
"step": 500
},
{
"entropy": 0.642953485250473,
"epoch": 3.192,
"grad_norm": 0.009976604022085667,
"learning_rate": 0.0002,
"loss": 0.6437498331069946,
"mean_token_accuracy": 0.7397104203701019,
"num_tokens": 18735678.0,
"step": 501
},
{
"entropy": 0.6099938452243805,
"epoch": 3.1984,
"grad_norm": 0.012410764582455158,
"learning_rate": 0.0002,
"loss": 0.6217681169509888,
"mean_token_accuracy": 0.7468984425067902,
"num_tokens": 18773294.0,
"step": 502
},
{
"entropy": 0.6207045987248421,
"epoch": 3.2048,
"grad_norm": 0.01231430098414421,
"learning_rate": 0.0002,
"loss": 0.6315573453903198,
"mean_token_accuracy": 0.7444091141223907,
"num_tokens": 18810845.0,
"step": 503
},
{
"entropy": 0.6327609792351723,
"epoch": 3.2112,
"grad_norm": 0.009783076122403145,
"learning_rate": 0.0002,
"loss": 0.6313201189041138,
"mean_token_accuracy": 0.7418917194008827,
"num_tokens": 18848236.0,
"step": 504
},
{
"entropy": 0.6450697854161263,
"epoch": 3.2176,
"grad_norm": 0.011842023581266403,
"learning_rate": 0.0002,
"loss": 0.6390271186828613,
"mean_token_accuracy": 0.7399028763175011,
"num_tokens": 18885816.0,
"step": 505
},
{
"entropy": 0.6308076307177544,
"epoch": 3.224,
"grad_norm": 0.009748830460011959,
"learning_rate": 0.0002,
"loss": 0.6288598775863647,
"mean_token_accuracy": 0.7437896579504013,
"num_tokens": 18923477.0,
"step": 506
},
{
"entropy": 0.6379056051373482,
"epoch": 3.2304,
"grad_norm": 0.009498417377471924,
"learning_rate": 0.0002,
"loss": 0.6368851661682129,
"mean_token_accuracy": 0.740045078098774,
"num_tokens": 18960975.0,
"step": 507
},
{
"entropy": 0.6196693256497383,
"epoch": 3.2368,
"grad_norm": 0.010206184349954128,
"learning_rate": 0.0002,
"loss": 0.6276986598968506,
"mean_token_accuracy": 0.7443438991904259,
"num_tokens": 18998695.0,
"step": 508
},
{
"entropy": 0.6081546768546104,
"epoch": 3.2432,
"grad_norm": 0.011067412793636322,
"learning_rate": 0.0002,
"loss": 0.617774248123169,
"mean_token_accuracy": 0.7473630830645561,
"num_tokens": 19036024.0,
"step": 509
},
{
"entropy": 0.621229961514473,
"epoch": 3.2496,
"grad_norm": 0.009409903548657894,
"learning_rate": 0.0002,
"loss": 0.6242153644561768,
"mean_token_accuracy": 0.7461365386843681,
"num_tokens": 19073279.0,
"step": 510
},
{
"entropy": 0.6359136626124382,
"epoch": 3.2560000000000002,
"grad_norm": 0.01134317647665739,
"learning_rate": 0.0002,
"loss": 0.6272875070571899,
"mean_token_accuracy": 0.7440386563539505,
"num_tokens": 19110879.0,
"step": 511
},
{
"entropy": 0.6344882696866989,
"epoch": 3.2624,
"grad_norm": 0.009477692656219006,
"learning_rate": 0.0002,
"loss": 0.6296730041503906,
"mean_token_accuracy": 0.7432499378919601,
"num_tokens": 19148500.0,
"step": 512
},
{
"entropy": 0.6398265957832336,
"epoch": 3.2688,
"grad_norm": 0.009287470020353794,
"learning_rate": 0.0002,
"loss": 0.6409690976142883,
"mean_token_accuracy": 0.7397137433290482,
"num_tokens": 19186265.0,
"step": 513
},
{
"entropy": 0.6291618198156357,
"epoch": 3.2752,
"grad_norm": 0.010224799625575542,
"learning_rate": 0.0002,
"loss": 0.6341534852981567,
"mean_token_accuracy": 0.7401559799909592,
"num_tokens": 19224100.0,
"step": 514
},
{
"entropy": 0.6363715305924416,
"epoch": 3.2816,
"grad_norm": 0.009469510987401009,
"learning_rate": 0.0002,
"loss": 0.6414492130279541,
"mean_token_accuracy": 0.7395576015114784,
"num_tokens": 19261530.0,
"step": 515
},
{
"entropy": 0.623082734644413,
"epoch": 3.288,
"grad_norm": 0.009947684593498707,
"learning_rate": 0.0002,
"loss": 0.6218703985214233,
"mean_token_accuracy": 0.7470062673091888,
"num_tokens": 19299016.0,
"step": 516
},
{
"entropy": 0.6309391483664513,
"epoch": 3.2944,
"grad_norm": 0.008808617480099201,
"learning_rate": 0.0002,
"loss": 0.6311261653900146,
"mean_token_accuracy": 0.7421472296118736,
"num_tokens": 19336795.0,
"step": 517
},
{
"entropy": 0.6172879338264465,
"epoch": 3.3008,
"grad_norm": 0.009716369211673737,
"learning_rate": 0.0002,
"loss": 0.6209211945533752,
"mean_token_accuracy": 0.7458591684699059,
"num_tokens": 19374516.0,
"step": 518
},
{
"entropy": 0.624429427087307,
"epoch": 3.3072,
"grad_norm": 0.00985341053456068,
"learning_rate": 0.0002,
"loss": 0.6280737519264221,
"mean_token_accuracy": 0.7443241253495216,
"num_tokens": 19412000.0,
"step": 519
},
{
"entropy": 0.6387547329068184,
"epoch": 3.3136,
"grad_norm": 0.010449756868183613,
"learning_rate": 0.0002,
"loss": 0.6452560424804688,
"mean_token_accuracy": 0.7374782711267471,
"num_tokens": 19449428.0,
"step": 520
},
{
"entropy": 0.6452173292636871,
"epoch": 3.32,
"grad_norm": 0.010232311673462391,
"learning_rate": 0.0002,
"loss": 0.6446540355682373,
"mean_token_accuracy": 0.7369571030139923,
"num_tokens": 19486584.0,
"step": 521
},
{
"entropy": 0.6503598615527153,
"epoch": 3.3264,
"grad_norm": 0.009941341355443,
"learning_rate": 0.0002,
"loss": 0.6453627347946167,
"mean_token_accuracy": 0.736748069524765,
"num_tokens": 19524352.0,
"step": 522
},
{
"entropy": 0.6315410137176514,
"epoch": 3.3327999999999998,
"grad_norm": 0.011314695701003075,
"learning_rate": 0.0002,
"loss": 0.6289575099945068,
"mean_token_accuracy": 0.7419339716434479,
"num_tokens": 19561915.0,
"step": 523
},
{
"entropy": 0.6262854412198067,
"epoch": 3.3392,
"grad_norm": 0.010391976684331894,
"learning_rate": 0.0002,
"loss": 0.6323624849319458,
"mean_token_accuracy": 0.7404907718300819,
"num_tokens": 19599545.0,
"step": 524
},
{
"entropy": 0.6337175592780113,
"epoch": 3.3456,
"grad_norm": 0.011693738400936127,
"learning_rate": 0.0002,
"loss": 0.6432880163192749,
"mean_token_accuracy": 0.7387639954686165,
"num_tokens": 19637116.0,
"step": 525
},
{
"entropy": 0.633139468729496,
"epoch": 3.352,
"grad_norm": 0.009820731356739998,
"learning_rate": 0.0002,
"loss": 0.6332041621208191,
"mean_token_accuracy": 0.7423391342163086,
"num_tokens": 19674921.0,
"step": 526
},
{
"entropy": 0.6280725598335266,
"epoch": 3.3584,
"grad_norm": 0.009054291062057018,
"learning_rate": 0.0002,
"loss": 0.628294825553894,
"mean_token_accuracy": 0.7419228628277779,
"num_tokens": 19712717.0,
"step": 527
},
{
"entropy": 0.6336539536714554,
"epoch": 3.3648,
"grad_norm": 0.010253396816551685,
"learning_rate": 0.0002,
"loss": 0.6339755654335022,
"mean_token_accuracy": 0.7397957965731621,
"num_tokens": 19749941.0,
"step": 528
},
{
"entropy": 0.6203584149479866,
"epoch": 3.3712,
"grad_norm": 0.009867236949503422,
"learning_rate": 0.0002,
"loss": 0.6247453689575195,
"mean_token_accuracy": 0.7431770488619804,
"num_tokens": 19787178.0,
"step": 529
},
{
"entropy": 0.6316971704363823,
"epoch": 3.3776,
"grad_norm": 0.009513068944215775,
"learning_rate": 0.0002,
"loss": 0.6362742781639099,
"mean_token_accuracy": 0.737493634223938,
"num_tokens": 19824578.0,
"step": 530
},
{
"entropy": 0.6340960711240768,
"epoch": 3.384,
"grad_norm": 0.009593709371984005,
"learning_rate": 0.0002,
"loss": 0.6331235766410828,
"mean_token_accuracy": 0.7399430274963379,
"num_tokens": 19862390.0,
"step": 531
},
{
"entropy": 0.6132048889994621,
"epoch": 3.3904,
"grad_norm": 0.010046555660665035,
"learning_rate": 0.0002,
"loss": 0.6161696910858154,
"mean_token_accuracy": 0.7499357238411903,
"num_tokens": 19899845.0,
"step": 532
},
{
"entropy": 0.6227102503180504,
"epoch": 3.3968,
"grad_norm": 0.010463609360158443,
"learning_rate": 0.0002,
"loss": 0.6273203492164612,
"mean_token_accuracy": 0.7455707415938377,
"num_tokens": 19937650.0,
"step": 533
},
{
"entropy": 0.6323057189583778,
"epoch": 3.4032,
"grad_norm": 0.011215063743293285,
"learning_rate": 0.0002,
"loss": 0.6333843469619751,
"mean_token_accuracy": 0.7426166757941246,
"num_tokens": 19975460.0,
"step": 534
},
{
"entropy": 0.6401225328445435,
"epoch": 3.4096,
"grad_norm": 0.009196775034070015,
"learning_rate": 0.0002,
"loss": 0.6394823789596558,
"mean_token_accuracy": 0.738113172352314,
"num_tokens": 20013373.0,
"step": 535
},
{
"entropy": 0.6456998661160469,
"epoch": 3.416,
"grad_norm": 0.010047613643109798,
"learning_rate": 0.0002,
"loss": 0.6439746618270874,
"mean_token_accuracy": 0.7357992008328438,
"num_tokens": 20051018.0,
"step": 536
},
{
"entropy": 0.6272638514637947,
"epoch": 3.4224,
"grad_norm": 0.011030818335711956,
"learning_rate": 0.0002,
"loss": 0.6313672065734863,
"mean_token_accuracy": 0.7423597574234009,
"num_tokens": 20088324.0,
"step": 537
},
{
"entropy": 0.6197195202112198,
"epoch": 3.4288,
"grad_norm": 0.010905069299042225,
"learning_rate": 0.0002,
"loss": 0.6300115585327148,
"mean_token_accuracy": 0.7445831671357155,
"num_tokens": 20125821.0,
"step": 538
},
{
"entropy": 0.616571269929409,
"epoch": 3.4352,
"grad_norm": 0.00983978621661663,
"learning_rate": 0.0002,
"loss": 0.6236230134963989,
"mean_token_accuracy": 0.7451280057430267,
"num_tokens": 20163266.0,
"step": 539
},
{
"entropy": 0.6327468827366829,
"epoch": 3.4416,
"grad_norm": 0.00972190871834755,
"learning_rate": 0.0002,
"loss": 0.6347957849502563,
"mean_token_accuracy": 0.7411710619926453,
"num_tokens": 20201024.0,
"step": 540
},
{
"entropy": 0.6288504004478455,
"epoch": 3.448,
"grad_norm": 0.011150616221129894,
"learning_rate": 0.0002,
"loss": 0.6228883266448975,
"mean_token_accuracy": 0.7468400076031685,
"num_tokens": 20238093.0,
"step": 541
},
{
"entropy": 0.6300643384456635,
"epoch": 3.4544,
"grad_norm": 0.01008420716971159,
"learning_rate": 0.0002,
"loss": 0.6263501048088074,
"mean_token_accuracy": 0.7454875409603119,
"num_tokens": 20275846.0,
"step": 542
},
{
"entropy": 0.621397003531456,
"epoch": 3.4608,
"grad_norm": 0.009655226953327656,
"learning_rate": 0.0002,
"loss": 0.626434862613678,
"mean_token_accuracy": 0.7454000115394592,
"num_tokens": 20313165.0,
"step": 543
},
{
"entropy": 0.625905841588974,
"epoch": 3.4672,
"grad_norm": 0.012401984073221684,
"learning_rate": 0.0002,
"loss": 0.6340878009796143,
"mean_token_accuracy": 0.74062430113554,
"num_tokens": 20351212.0,
"step": 544
},
{
"entropy": 0.6408397778868675,
"epoch": 3.4736000000000002,
"grad_norm": 0.010497737675905228,
"learning_rate": 0.0002,
"loss": 0.6416893601417542,
"mean_token_accuracy": 0.7387349084019661,
"num_tokens": 20388632.0,
"step": 545
},
{
"entropy": 0.6322543397545815,
"epoch": 3.48,
"grad_norm": 0.010267537087202072,
"learning_rate": 0.0002,
"loss": 0.6245300769805908,
"mean_token_accuracy": 0.7472849115729332,
"num_tokens": 20426503.0,
"step": 546
},
{
"entropy": 0.6428259909152985,
"epoch": 3.4864,
"grad_norm": 0.010037362575531006,
"learning_rate": 0.0002,
"loss": 0.6373123526573181,
"mean_token_accuracy": 0.7395420894026756,
"num_tokens": 20464010.0,
"step": 547
},
{
"entropy": 0.6270901411771774,
"epoch": 3.4928,
"grad_norm": 0.008532303385436535,
"learning_rate": 0.0002,
"loss": 0.6293808221817017,
"mean_token_accuracy": 0.7432048991322517,
"num_tokens": 20501515.0,
"step": 548
},
{
"entropy": 0.6149459034204483,
"epoch": 3.4992,
"grad_norm": 0.009804856963455677,
"learning_rate": 0.0002,
"loss": 0.6234340667724609,
"mean_token_accuracy": 0.7474272325634956,
"num_tokens": 20539328.0,
"step": 549
},
{
"entropy": 0.6115493848919868,
"epoch": 3.5056000000000003,
"grad_norm": 0.01168244518339634,
"learning_rate": 0.0002,
"loss": 0.6256985068321228,
"mean_token_accuracy": 0.7442245110869408,
"num_tokens": 20576414.0,
"step": 550
},
{
"entropy": 0.6242030709981918,
"epoch": 3.512,
"grad_norm": 0.00905383937060833,
"learning_rate": 0.0002,
"loss": 0.6286660432815552,
"mean_token_accuracy": 0.7437908053398132,
"num_tokens": 20614078.0,
"step": 551
},
{
"entropy": 0.6304361894726753,
"epoch": 3.5183999999999997,
"grad_norm": 0.008661957457661629,
"learning_rate": 0.0002,
"loss": 0.6304973363876343,
"mean_token_accuracy": 0.7443248927593231,
"num_tokens": 20651484.0,
"step": 552
},
{
"entropy": 0.6485093608498573,
"epoch": 3.5248,
"grad_norm": 0.008023140951991081,
"learning_rate": 0.0002,
"loss": 0.64768385887146,
"mean_token_accuracy": 0.7372199594974518,
"num_tokens": 20688874.0,
"step": 553
},
{
"entropy": 0.6480056494474411,
"epoch": 3.5312,
"grad_norm": 0.009417054243385792,
"learning_rate": 0.0002,
"loss": 0.6428097486495972,
"mean_token_accuracy": 0.7367473617196083,
"num_tokens": 20726632.0,
"step": 554
},
{
"entropy": 0.6245403215289116,
"epoch": 3.5376,
"grad_norm": 0.008958806283771992,
"learning_rate": 0.0002,
"loss": 0.6215206980705261,
"mean_token_accuracy": 0.745918445289135,
"num_tokens": 20764598.0,
"step": 555
},
{
"entropy": 0.6468629390001297,
"epoch": 3.544,
"grad_norm": 0.009944718331098557,
"learning_rate": 0.0002,
"loss": 0.6501193046569824,
"mean_token_accuracy": 0.7350190952420235,
"num_tokens": 20802384.0,
"step": 556
},
{
"entropy": 0.6288837715983391,
"epoch": 3.5504,
"grad_norm": 0.009102506563067436,
"learning_rate": 0.0002,
"loss": 0.6321202516555786,
"mean_token_accuracy": 0.7416860312223434,
"num_tokens": 20839585.0,
"step": 557
},
{
"entropy": 0.6316198781132698,
"epoch": 3.5568,
"grad_norm": 0.009831351228058338,
"learning_rate": 0.0002,
"loss": 0.6349937319755554,
"mean_token_accuracy": 0.7422218322753906,
"num_tokens": 20877319.0,
"step": 558
},
{
"entropy": 0.640017494559288,
"epoch": 3.5632,
"grad_norm": 0.00992864090949297,
"learning_rate": 0.0002,
"loss": 0.6386250853538513,
"mean_token_accuracy": 0.7408555001020432,
"num_tokens": 20915060.0,
"step": 559
},
{
"entropy": 0.650281272828579,
"epoch": 3.5696,
"grad_norm": 0.008609931915998459,
"learning_rate": 0.0002,
"loss": 0.6503854393959045,
"mean_token_accuracy": 0.7330696955323219,
"num_tokens": 20953081.0,
"step": 560
},
{
"entropy": 0.6279073059558868,
"epoch": 3.576,
"grad_norm": 0.01186640840023756,
"learning_rate": 0.0002,
"loss": 0.627372145652771,
"mean_token_accuracy": 0.7447227090597153,
"num_tokens": 20990338.0,
"step": 561
},
{
"entropy": 0.634159728884697,
"epoch": 3.5824,
"grad_norm": 0.008970306254923344,
"learning_rate": 0.0002,
"loss": 0.6346087455749512,
"mean_token_accuracy": 0.7415203601121902,
"num_tokens": 21028096.0,
"step": 562
},
{
"entropy": 0.633803091943264,
"epoch": 3.5888,
"grad_norm": 0.011358493939042091,
"learning_rate": 0.0002,
"loss": 0.6442689895629883,
"mean_token_accuracy": 0.7374193891882896,
"num_tokens": 21065835.0,
"step": 563
},
{
"entropy": 0.623796708881855,
"epoch": 3.5952,
"grad_norm": 0.011994842439889908,
"learning_rate": 0.0002,
"loss": 0.6334537267684937,
"mean_token_accuracy": 0.7415754497051239,
"num_tokens": 21103469.0,
"step": 564
},
{
"entropy": 0.635470986366272,
"epoch": 3.6016,
"grad_norm": 0.009826122783124447,
"learning_rate": 0.0002,
"loss": 0.6419943571090698,
"mean_token_accuracy": 0.7378642708063126,
"num_tokens": 21141513.0,
"step": 565
},
{
"entropy": 0.6463486775755882,
"epoch": 3.608,
"grad_norm": 0.010555503889918327,
"learning_rate": 0.0002,
"loss": 0.640326738357544,
"mean_token_accuracy": 0.7372942119836807,
"num_tokens": 21178927.0,
"step": 566
},
{
"entropy": 0.6457525193691254,
"epoch": 3.6144,
"grad_norm": 0.010458976030349731,
"learning_rate": 0.0002,
"loss": 0.6402060985565186,
"mean_token_accuracy": 0.7400226071476936,
"num_tokens": 21216291.0,
"step": 567
},
{
"entropy": 0.633650466799736,
"epoch": 3.6208,
"grad_norm": 0.009390798397362232,
"learning_rate": 0.0002,
"loss": 0.6331945657730103,
"mean_token_accuracy": 0.7403992488980293,
"num_tokens": 21253727.0,
"step": 568
},
{
"entropy": 0.632075347006321,
"epoch": 3.6272,
"grad_norm": 0.01025348249822855,
"learning_rate": 0.0002,
"loss": 0.6355302333831787,
"mean_token_accuracy": 0.7413225471973419,
"num_tokens": 21291493.0,
"step": 569
},
{
"entropy": 0.6219524443149567,
"epoch": 3.6336,
"grad_norm": 0.011700067669153214,
"learning_rate": 0.0002,
"loss": 0.6319601535797119,
"mean_token_accuracy": 0.7412790209054947,
"num_tokens": 21329474.0,
"step": 570
},
{
"entropy": 0.6328660994768143,
"epoch": 3.64,
"grad_norm": 0.009544705040752888,
"learning_rate": 0.0002,
"loss": 0.6347973346710205,
"mean_token_accuracy": 0.742459200322628,
"num_tokens": 21367274.0,
"step": 571
},
{
"entropy": 0.6382363438606262,
"epoch": 3.6464,
"grad_norm": 0.009506464004516602,
"learning_rate": 0.0002,
"loss": 0.632327675819397,
"mean_token_accuracy": 0.741349458694458,
"num_tokens": 21405027.0,
"step": 572
},
{
"entropy": 0.6429821029305458,
"epoch": 3.6528,
"grad_norm": 0.008949574083089828,
"learning_rate": 0.0002,
"loss": 0.6385926008224487,
"mean_token_accuracy": 0.7412813901901245,
"num_tokens": 21442485.0,
"step": 573
},
{
"entropy": 0.6392761990427971,
"epoch": 3.6592000000000002,
"grad_norm": 0.008819608017802238,
"learning_rate": 0.0002,
"loss": 0.6387146711349487,
"mean_token_accuracy": 0.7381789684295654,
"num_tokens": 21480245.0,
"step": 574
},
{
"entropy": 0.6092662885785103,
"epoch": 3.6656,
"grad_norm": 0.009008620865643024,
"learning_rate": 0.0002,
"loss": 0.6131871342658997,
"mean_token_accuracy": 0.7484863623976707,
"num_tokens": 21517658.0,
"step": 575
},
{
"entropy": 0.6172466725111008,
"epoch": 3.672,
"grad_norm": 0.008723135106265545,
"learning_rate": 0.0002,
"loss": 0.6228119730949402,
"mean_token_accuracy": 0.747119203209877,
"num_tokens": 21555161.0,
"step": 576
},
{
"entropy": 0.6264480575919151,
"epoch": 3.6784,
"grad_norm": 0.008482584729790688,
"learning_rate": 0.0002,
"loss": 0.6291134357452393,
"mean_token_accuracy": 0.7445547953248024,
"num_tokens": 21592408.0,
"step": 577
},
{
"entropy": 0.635237880051136,
"epoch": 3.6848,
"grad_norm": 0.00850406102836132,
"learning_rate": 0.0002,
"loss": 0.6362268328666687,
"mean_token_accuracy": 0.7393738552927971,
"num_tokens": 21630282.0,
"step": 578
},
{
"entropy": 0.6200535595417023,
"epoch": 3.6912000000000003,
"grad_norm": 0.009778933599591255,
"learning_rate": 0.0002,
"loss": 0.6221815347671509,
"mean_token_accuracy": 0.7469090595841408,
"num_tokens": 21667708.0,
"step": 579
},
{
"entropy": 0.63077662140131,
"epoch": 3.6976,
"grad_norm": 0.009218033403158188,
"learning_rate": 0.0002,
"loss": 0.6323422193527222,
"mean_token_accuracy": 0.7421467453241348,
"num_tokens": 21705244.0,
"step": 580
},
{
"entropy": 0.6420226320624352,
"epoch": 3.7039999999999997,
"grad_norm": 0.009507461450994015,
"learning_rate": 0.0002,
"loss": 0.6403417587280273,
"mean_token_accuracy": 0.739894188940525,
"num_tokens": 21743055.0,
"step": 581
},
{
"entropy": 0.6300998106598854,
"epoch": 3.7104,
"grad_norm": 0.009341172873973846,
"learning_rate": 0.0002,
"loss": 0.6311365962028503,
"mean_token_accuracy": 0.7414052486419678,
"num_tokens": 21780375.0,
"step": 582
},
{
"entropy": 0.6306213289499283,
"epoch": 3.7168,
"grad_norm": 0.010440697893500328,
"learning_rate": 0.0002,
"loss": 0.6373945474624634,
"mean_token_accuracy": 0.7419358193874359,
"num_tokens": 21817708.0,
"step": 583
},
{
"entropy": 0.6163543164730072,
"epoch": 3.7232,
"grad_norm": 0.009331561625003815,
"learning_rate": 0.0002,
"loss": 0.6209964156150818,
"mean_token_accuracy": 0.7463705316185951,
"num_tokens": 21854937.0,
"step": 584
},
{
"entropy": 0.6321230009198189,
"epoch": 3.7296,
"grad_norm": 0.00952980387955904,
"learning_rate": 0.0002,
"loss": 0.6340712308883667,
"mean_token_accuracy": 0.7384133115410805,
"num_tokens": 21892727.0,
"step": 585
},
{
"entropy": 0.6275918409228325,
"epoch": 3.7359999999999998,
"grad_norm": 0.009358996525406837,
"learning_rate": 0.0002,
"loss": 0.6279775500297546,
"mean_token_accuracy": 0.7420656681060791,
"num_tokens": 21930361.0,
"step": 586
},
{
"entropy": 0.6374326348304749,
"epoch": 3.7424,
"grad_norm": 0.00851542316377163,
"learning_rate": 0.0002,
"loss": 0.6387336254119873,
"mean_token_accuracy": 0.7408188581466675,
"num_tokens": 21967769.0,
"step": 587
},
{
"entropy": 0.6265183612704277,
"epoch": 3.7488,
"grad_norm": 0.010128417983651161,
"learning_rate": 0.0002,
"loss": 0.6304729580879211,
"mean_token_accuracy": 0.74308130890131,
"num_tokens": 22005268.0,
"step": 588
},
{
"entropy": 0.6259055137634277,
"epoch": 3.7552,
"grad_norm": 0.00949757732450962,
"learning_rate": 0.0002,
"loss": 0.6271415948867798,
"mean_token_accuracy": 0.7445643469691277,
"num_tokens": 22042740.0,
"step": 589
},
{
"entropy": 0.621527373790741,
"epoch": 3.7616,
"grad_norm": 0.011297403834760189,
"learning_rate": 0.0002,
"loss": 0.6193302869796753,
"mean_token_accuracy": 0.7481779083609581,
"num_tokens": 22080705.0,
"step": 590
},
{
"entropy": 0.6351140215992928,
"epoch": 3.768,
"grad_norm": 0.01007875707000494,
"learning_rate": 0.0002,
"loss": 0.636103093624115,
"mean_token_accuracy": 0.7403137609362602,
"num_tokens": 22118187.0,
"step": 591
},
{
"entropy": 0.6164060086011887,
"epoch": 3.7744,
"grad_norm": 0.00851944275200367,
"learning_rate": 0.0002,
"loss": 0.620150089263916,
"mean_token_accuracy": 0.7468870654702187,
"num_tokens": 22155780.0,
"step": 592
},
{
"entropy": 0.6220516487956047,
"epoch": 3.7808,
"grad_norm": 0.011541093699634075,
"learning_rate": 0.0002,
"loss": 0.6253345012664795,
"mean_token_accuracy": 0.7459988221526146,
"num_tokens": 22193401.0,
"step": 593
},
{
"entropy": 0.6525481268763542,
"epoch": 3.7872,
"grad_norm": 0.009819903410971165,
"learning_rate": 0.0002,
"loss": 0.6519078016281128,
"mean_token_accuracy": 0.7341204807162285,
"num_tokens": 22230608.0,
"step": 594
},
{
"entropy": 0.6331318765878677,
"epoch": 3.7936,
"grad_norm": 0.010822438634932041,
"learning_rate": 0.0002,
"loss": 0.627253532409668,
"mean_token_accuracy": 0.7452663481235504,
"num_tokens": 22268376.0,
"step": 595
},
{
"entropy": 0.6378331705927849,
"epoch": 3.8,
"grad_norm": 0.010335801169276237,
"learning_rate": 0.0002,
"loss": 0.6402156949043274,
"mean_token_accuracy": 0.7388675063848495,
"num_tokens": 22305874.0,
"step": 596
},
{
"entropy": 0.6241042613983154,
"epoch": 3.8064,
"grad_norm": 0.011212136596441269,
"learning_rate": 0.0002,
"loss": 0.6346319913864136,
"mean_token_accuracy": 0.7422374039888382,
"num_tokens": 22343270.0,
"step": 597
},
{
"entropy": 0.6304724365472794,
"epoch": 3.8128,
"grad_norm": 0.010530945844948292,
"learning_rate": 0.0002,
"loss": 0.6360510587692261,
"mean_token_accuracy": 0.7418438643217087,
"num_tokens": 22380767.0,
"step": 598
},
{
"entropy": 0.630512535572052,
"epoch": 3.8192,
"grad_norm": 0.01047790888696909,
"learning_rate": 0.0002,
"loss": 0.6310948133468628,
"mean_token_accuracy": 0.7418612614274025,
"num_tokens": 22417973.0,
"step": 599
},
{
"entropy": 0.6289901584386826,
"epoch": 3.8256,
"grad_norm": 0.009985234588384628,
"learning_rate": 0.0002,
"loss": 0.6236091256141663,
"mean_token_accuracy": 0.745183065533638,
"num_tokens": 22455401.0,
"step": 600
},
{
"entropy": 0.6390504911541939,
"epoch": 3.832,
"grad_norm": 0.009776836261153221,
"learning_rate": 0.0002,
"loss": 0.6361709237098694,
"mean_token_accuracy": 0.7415382042527199,
"num_tokens": 22493019.0,
"step": 601
},
{
"entropy": 0.6260226741433144,
"epoch": 3.8384,
"grad_norm": 0.009412144310772419,
"learning_rate": 0.0002,
"loss": 0.62882399559021,
"mean_token_accuracy": 0.7436661571264267,
"num_tokens": 22530628.0,
"step": 602
},
{
"entropy": 0.6180827915668488,
"epoch": 3.8448,
"grad_norm": 0.009917755611240864,
"learning_rate": 0.0002,
"loss": 0.6258498430252075,
"mean_token_accuracy": 0.7454487532377243,
"num_tokens": 22568202.0,
"step": 603
},
{
"entropy": 0.6200235038995743,
"epoch": 3.8512,
"grad_norm": 0.010199918411672115,
"learning_rate": 0.0002,
"loss": 0.6277583837509155,
"mean_token_accuracy": 0.7435891628265381,
"num_tokens": 22605838.0,
"step": 604
},
{
"entropy": 0.6254613697528839,
"epoch": 3.8576,
"grad_norm": 0.009225446730852127,
"learning_rate": 0.0002,
"loss": 0.6330975294113159,
"mean_token_accuracy": 0.7417056709527969,
"num_tokens": 22643315.0,
"step": 605
},
{
"entropy": 0.6374992206692696,
"epoch": 3.864,
"grad_norm": 0.009426961652934551,
"learning_rate": 0.0002,
"loss": 0.6333073377609253,
"mean_token_accuracy": 0.743529699742794,
"num_tokens": 22681260.0,
"step": 606
},
{
"entropy": 0.6427751928567886,
"epoch": 3.8704,
"grad_norm": 0.01109833549708128,
"learning_rate": 0.0002,
"loss": 0.6365841627120972,
"mean_token_accuracy": 0.740449033677578,
"num_tokens": 22718725.0,
"step": 607
},
{
"entropy": 0.6293874457478523,
"epoch": 3.8768000000000002,
"grad_norm": 0.009044543839991093,
"learning_rate": 0.0002,
"loss": 0.6291689872741699,
"mean_token_accuracy": 0.7439134269952774,
"num_tokens": 22756018.0,
"step": 608
},
{
"entropy": 0.6215147376060486,
"epoch": 3.8832,
"grad_norm": 0.010903657414019108,
"learning_rate": 0.0002,
"loss": 0.6296993494033813,
"mean_token_accuracy": 0.7446267232298851,
"num_tokens": 22793251.0,
"step": 609
},
{
"entropy": 0.6157297044992447,
"epoch": 3.8895999999999997,
"grad_norm": 0.010149014182388783,
"learning_rate": 0.0002,
"loss": 0.6224344968795776,
"mean_token_accuracy": 0.7450227364897728,
"num_tokens": 22830782.0,
"step": 610
},
{
"entropy": 0.6204625591635704,
"epoch": 3.896,
"grad_norm": 0.008899394422769547,
"learning_rate": 0.0002,
"loss": 0.6236724257469177,
"mean_token_accuracy": 0.7457845434546471,
"num_tokens": 22868292.0,
"step": 611
},
{
"entropy": 0.6289186328649521,
"epoch": 3.9024,
"grad_norm": 0.009715489111840725,
"learning_rate": 0.0002,
"loss": 0.6255042552947998,
"mean_token_accuracy": 0.743945874273777,
"num_tokens": 22905960.0,
"step": 612
},
{
"entropy": 0.6272325441241264,
"epoch": 3.9088000000000003,
"grad_norm": 0.010841017588973045,
"learning_rate": 0.0002,
"loss": 0.6241690516471863,
"mean_token_accuracy": 0.7436103969812393,
"num_tokens": 22943043.0,
"step": 613
},
{
"entropy": 0.6414704546332359,
"epoch": 3.9152,
"grad_norm": 0.009553831070661545,
"learning_rate": 0.0002,
"loss": 0.6447999477386475,
"mean_token_accuracy": 0.7391496151685715,
"num_tokens": 22980557.0,
"step": 614
},
{
"entropy": 0.6307174563407898,
"epoch": 3.9215999999999998,
"grad_norm": 0.009158959612250328,
"learning_rate": 0.0002,
"loss": 0.6336820721626282,
"mean_token_accuracy": 0.7413525283336639,
"num_tokens": 23018134.0,
"step": 615
},
{
"entropy": 0.6336700096726418,
"epoch": 3.928,
"grad_norm": 0.010397304780781269,
"learning_rate": 0.0002,
"loss": 0.6412237882614136,
"mean_token_accuracy": 0.7389427125453949,
"num_tokens": 23055656.0,
"step": 616
},
{
"entropy": 0.6292953938245773,
"epoch": 3.9344,
"grad_norm": 0.009029161185026169,
"learning_rate": 0.0002,
"loss": 0.6302052736282349,
"mean_token_accuracy": 0.7432261779904366,
"num_tokens": 23093414.0,
"step": 617
},
{
"entropy": 0.6511750519275665,
"epoch": 3.9408,
"grad_norm": 0.011078661307692528,
"learning_rate": 0.0002,
"loss": 0.6470860242843628,
"mean_token_accuracy": 0.7365722432732582,
"num_tokens": 23131307.0,
"step": 618
},
{
"entropy": 0.640938051044941,
"epoch": 3.9472,
"grad_norm": 0.009597877971827984,
"learning_rate": 0.0002,
"loss": 0.6369379758834839,
"mean_token_accuracy": 0.7396447286009789,
"num_tokens": 23168894.0,
"step": 619
},
{
"entropy": 0.6210119426250458,
"epoch": 3.9536,
"grad_norm": 0.010679766535758972,
"learning_rate": 0.0002,
"loss": 0.6260274052619934,
"mean_token_accuracy": 0.7466530501842499,
"num_tokens": 23206378.0,
"step": 620
},
{
"entropy": 0.615054301917553,
"epoch": 3.96,
"grad_norm": 0.010784207843244076,
"learning_rate": 0.0002,
"loss": 0.6229560375213623,
"mean_token_accuracy": 0.7456069514155388,
"num_tokens": 23243675.0,
"step": 621
},
{
"entropy": 0.6250587999820709,
"epoch": 3.9664,
"grad_norm": 0.009625584818422794,
"learning_rate": 0.0002,
"loss": 0.6281651258468628,
"mean_token_accuracy": 0.7444300353527069,
"num_tokens": 23281000.0,
"step": 622
},
{
"entropy": 0.6295294389128685,
"epoch": 3.9728,
"grad_norm": 0.009764077141880989,
"learning_rate": 0.0002,
"loss": 0.6305609941482544,
"mean_token_accuracy": 0.7441380247473717,
"num_tokens": 23318554.0,
"step": 623
},
{
"entropy": 0.619350254535675,
"epoch": 3.9792,
"grad_norm": 0.009161337278783321,
"learning_rate": 0.0002,
"loss": 0.6201272010803223,
"mean_token_accuracy": 0.7485333606600761,
"num_tokens": 23355649.0,
"step": 624
},
{
"entropy": 0.6401965990662575,
"epoch": 3.9856,
"grad_norm": 0.010438468307256699,
"learning_rate": 0.0002,
"loss": 0.6402089595794678,
"mean_token_accuracy": 0.7383991852402687,
"num_tokens": 23393568.0,
"step": 625
},
{
"entropy": 0.6330313384532928,
"epoch": 3.992,
"grad_norm": 0.009565716609358788,
"learning_rate": 0.0002,
"loss": 0.6326834559440613,
"mean_token_accuracy": 0.7425080984830856,
"num_tokens": 23431086.0,
"step": 626
},
{
"entropy": 0.6277460902929306,
"epoch": 3.9984,
"grad_norm": 0.009916098788380623,
"learning_rate": 0.0002,
"loss": 0.6327950954437256,
"mean_token_accuracy": 0.7417906895279884,
"num_tokens": 23468619.0,
"step": 627
},
{
"entropy": 0.6479776203632355,
"epoch": 4.0,
"grad_norm": 0.016998078674077988,
"learning_rate": 0.0002,
"loss": 0.6533247828483582,
"mean_token_accuracy": 0.7333799302577972,
"num_tokens": 23477894.0,
"step": 628
},
{
"entropy": 0.6334798634052277,
"epoch": 4.0064,
"grad_norm": 0.011177260428667068,
"learning_rate": 0.0002,
"loss": 0.6274731159210205,
"mean_token_accuracy": 0.7418768331408501,
"num_tokens": 23515512.0,
"step": 629
},
{
"entropy": 0.6426746100187302,
"epoch": 4.0128,
"grad_norm": 0.010523858480155468,
"learning_rate": 0.0002,
"loss": 0.639644980430603,
"mean_token_accuracy": 0.738319605588913,
"num_tokens": 23553199.0,
"step": 630
},
{
"entropy": 0.6350331977009773,
"epoch": 4.0192,
"grad_norm": 0.013215194456279278,
"learning_rate": 0.0002,
"loss": 0.6405128836631775,
"mean_token_accuracy": 0.739054262638092,
"num_tokens": 23590684.0,
"step": 631
},
{
"entropy": 0.6201648041605949,
"epoch": 4.0256,
"grad_norm": 0.00981956534087658,
"learning_rate": 0.0002,
"loss": 0.6236424446105957,
"mean_token_accuracy": 0.7453638687729836,
"num_tokens": 23628151.0,
"step": 632
},
{
"entropy": 0.6195686236023903,
"epoch": 4.032,
"grad_norm": 0.011942672543227673,
"learning_rate": 0.0002,
"loss": 0.6226350665092468,
"mean_token_accuracy": 0.7457711473107338,
"num_tokens": 23665791.0,
"step": 633
},
{
"entropy": 0.621765486896038,
"epoch": 4.0384,
"grad_norm": 0.011674079112708569,
"learning_rate": 0.0002,
"loss": 0.6212641000747681,
"mean_token_accuracy": 0.7444254085421562,
"num_tokens": 23703897.0,
"step": 634
},
{
"entropy": 0.6218401342630386,
"epoch": 4.0448,
"grad_norm": 0.011382197961211205,
"learning_rate": 0.0002,
"loss": 0.6188787221908569,
"mean_token_accuracy": 0.7439982444047928,
"num_tokens": 23741726.0,
"step": 635
},
{
"entropy": 0.6302961930632591,
"epoch": 4.0512,
"grad_norm": 0.0122229540720582,
"learning_rate": 0.0002,
"loss": 0.6310756802558899,
"mean_token_accuracy": 0.7416332587599754,
"num_tokens": 23779347.0,
"step": 636
},
{
"entropy": 0.6179258972406387,
"epoch": 4.0576,
"grad_norm": 0.013323783874511719,
"learning_rate": 0.0002,
"loss": 0.6242649555206299,
"mean_token_accuracy": 0.7424203455448151,
"num_tokens": 23816946.0,
"step": 637
},
{
"entropy": 0.6160242184996605,
"epoch": 4.064,
"grad_norm": 0.011928076855838299,
"learning_rate": 0.0002,
"loss": 0.6227492094039917,
"mean_token_accuracy": 0.7461478784680367,
"num_tokens": 23854267.0,
"step": 638
},
{
"entropy": 0.6243119761347771,
"epoch": 4.0704,
"grad_norm": 0.01218615286052227,
"learning_rate": 0.0002,
"loss": 0.6247442960739136,
"mean_token_accuracy": 0.7416555359959602,
"num_tokens": 23891647.0,
"step": 639
},
{
"entropy": 0.6283975690603256,
"epoch": 4.0768,
"grad_norm": 0.011089140549302101,
"learning_rate": 0.0002,
"loss": 0.6262081861495972,
"mean_token_accuracy": 0.7418273463845253,
"num_tokens": 23928978.0,
"step": 640
},
{
"entropy": 0.6230043172836304,
"epoch": 4.0832,
"grad_norm": 0.010514283552765846,
"learning_rate": 0.0002,
"loss": 0.6210086345672607,
"mean_token_accuracy": 0.7470921650528908,
"num_tokens": 23966589.0,
"step": 641
},
{
"entropy": 0.6316242590546608,
"epoch": 4.0896,
"grad_norm": 0.010836183093488216,
"learning_rate": 0.0002,
"loss": 0.6322799324989319,
"mean_token_accuracy": 0.7397365495562553,
"num_tokens": 24004549.0,
"step": 642
},
{
"entropy": 0.6093735992908478,
"epoch": 4.096,
"grad_norm": 0.010521575808525085,
"learning_rate": 0.0002,
"loss": 0.6142085790634155,
"mean_token_accuracy": 0.7481302842497826,
"num_tokens": 24041703.0,
"step": 643
},
{
"entropy": 0.6217071115970612,
"epoch": 4.1024,
"grad_norm": 0.01190858706831932,
"learning_rate": 0.0002,
"loss": 0.6301581859588623,
"mean_token_accuracy": 0.7421037778258324,
"num_tokens": 24079260.0,
"step": 644
},
{
"entropy": 0.6213275268673897,
"epoch": 4.1088,
"grad_norm": 0.010940197855234146,
"learning_rate": 0.0002,
"loss": 0.6227558851242065,
"mean_token_accuracy": 0.7450557425618172,
"num_tokens": 24116868.0,
"step": 645
},
{
"entropy": 0.6183237135410309,
"epoch": 4.1152,
"grad_norm": 0.01106048934161663,
"learning_rate": 0.0002,
"loss": 0.62211012840271,
"mean_token_accuracy": 0.7469884529709816,
"num_tokens": 24154196.0,
"step": 646
},
{
"entropy": 0.6235630884766579,
"epoch": 4.1216,
"grad_norm": 0.01147097535431385,
"learning_rate": 0.0002,
"loss": 0.6238754987716675,
"mean_token_accuracy": 0.7457621321082115,
"num_tokens": 24191940.0,
"step": 647
},
{
"entropy": 0.628976970911026,
"epoch": 4.128,
"grad_norm": 0.0103966249153018,
"learning_rate": 0.0002,
"loss": 0.6279858946800232,
"mean_token_accuracy": 0.7433076053857803,
"num_tokens": 24229689.0,
"step": 648
},
{
"entropy": 0.6148188188672066,
"epoch": 4.1344,
"grad_norm": 0.012693977914750576,
"learning_rate": 0.0002,
"loss": 0.6150864362716675,
"mean_token_accuracy": 0.7493811547756195,
"num_tokens": 24267208.0,
"step": 649
},
{
"entropy": 0.6325013488531113,
"epoch": 4.1408,
"grad_norm": 0.010917159728705883,
"learning_rate": 0.0002,
"loss": 0.629578709602356,
"mean_token_accuracy": 0.742595799267292,
"num_tokens": 24305147.0,
"step": 650
},
{
"entropy": 0.6269365176558495,
"epoch": 4.1472,
"grad_norm": 0.011673609726130962,
"learning_rate": 0.0002,
"loss": 0.6288695931434631,
"mean_token_accuracy": 0.7425840869545937,
"num_tokens": 24342617.0,
"step": 651
},
{
"entropy": 0.6115541234612465,
"epoch": 4.1536,
"grad_norm": 0.012632826343178749,
"learning_rate": 0.0002,
"loss": 0.6173226833343506,
"mean_token_accuracy": 0.7491206377744675,
"num_tokens": 24379680.0,
"step": 652
},
{
"entropy": 0.605757087469101,
"epoch": 4.16,
"grad_norm": 0.012048393487930298,
"learning_rate": 0.0002,
"loss": 0.6072964668273926,
"mean_token_accuracy": 0.7492575421929359,
"num_tokens": 24416439.0,
"step": 653
},
{
"entropy": 0.6210080906748772,
"epoch": 4.1664,
"grad_norm": 0.010533303022384644,
"learning_rate": 0.0002,
"loss": 0.6225767731666565,
"mean_token_accuracy": 0.7443814054131508,
"num_tokens": 24454195.0,
"step": 654
},
{
"entropy": 0.6205269917845726,
"epoch": 4.1728,
"grad_norm": 0.012937111780047417,
"learning_rate": 0.0002,
"loss": 0.621825635433197,
"mean_token_accuracy": 0.7476101964712143,
"num_tokens": 24491632.0,
"step": 655
},
{
"entropy": 0.6158983781933784,
"epoch": 4.1792,
"grad_norm": 0.011887785978615284,
"learning_rate": 0.0002,
"loss": 0.6177083253860474,
"mean_token_accuracy": 0.7477908208966255,
"num_tokens": 24529207.0,
"step": 656
},
{
"entropy": 0.6310747787356377,
"epoch": 4.1856,
"grad_norm": 0.01170266792178154,
"learning_rate": 0.0002,
"loss": 0.6338661313056946,
"mean_token_accuracy": 0.7413427755236626,
"num_tokens": 24566764.0,
"step": 657
},
{
"entropy": 0.632545068860054,
"epoch": 4.192,
"grad_norm": 0.012931435368955135,
"learning_rate": 0.0002,
"loss": 0.6379810571670532,
"mean_token_accuracy": 0.7372681424021721,
"num_tokens": 24604691.0,
"step": 658
},
{
"entropy": 0.6272072345018387,
"epoch": 4.1984,
"grad_norm": 0.012254653498530388,
"learning_rate": 0.0002,
"loss": 0.6317451000213623,
"mean_token_accuracy": 0.7407561391592026,
"num_tokens": 24642250.0,
"step": 659
},
{
"entropy": 0.6200175136327744,
"epoch": 4.2048,
"grad_norm": 0.012181897647678852,
"learning_rate": 0.0002,
"loss": 0.6207621097564697,
"mean_token_accuracy": 0.7452465370297432,
"num_tokens": 24679770.0,
"step": 660
},
{
"entropy": 0.6108414232730865,
"epoch": 4.2112,
"grad_norm": 0.010735893622040749,
"learning_rate": 0.0002,
"loss": 0.6087774038314819,
"mean_token_accuracy": 0.7506056129932404,
"num_tokens": 24717292.0,
"step": 661
},
{
"entropy": 0.6238648667931557,
"epoch": 4.2176,
"grad_norm": 0.010975925251841545,
"learning_rate": 0.0002,
"loss": 0.6241613626480103,
"mean_token_accuracy": 0.7450825273990631,
"num_tokens": 24754935.0,
"step": 662
},
{
"entropy": 0.6437125504016876,
"epoch": 4.224,
"grad_norm": 0.01447360310703516,
"learning_rate": 0.0002,
"loss": 0.6416766047477722,
"mean_token_accuracy": 0.7382775098085403,
"num_tokens": 24792852.0,
"step": 663
},
{
"entropy": 0.6239062771201134,
"epoch": 4.2304,
"grad_norm": 0.014347578398883343,
"learning_rate": 0.0002,
"loss": 0.6313333511352539,
"mean_token_accuracy": 0.7430859357118607,
"num_tokens": 24830405.0,
"step": 664
},
{
"entropy": 0.622043676674366,
"epoch": 4.2368,
"grad_norm": 0.01144686434417963,
"learning_rate": 0.0002,
"loss": 0.6238901615142822,
"mean_token_accuracy": 0.7450033724308014,
"num_tokens": 24867891.0,
"step": 665
},
{
"entropy": 0.6423631235957146,
"epoch": 4.2432,
"grad_norm": 0.012929810211062431,
"learning_rate": 0.0002,
"loss": 0.6390476226806641,
"mean_token_accuracy": 0.7388838231563568,
"num_tokens": 24905463.0,
"step": 666
},
{
"entropy": 0.6159037128090858,
"epoch": 4.2496,
"grad_norm": 0.012308385223150253,
"learning_rate": 0.0002,
"loss": 0.6162548065185547,
"mean_token_accuracy": 0.7489078938961029,
"num_tokens": 24942905.0,
"step": 667
},
{
"entropy": 0.6265198811888695,
"epoch": 4.256,
"grad_norm": 0.01269616186618805,
"learning_rate": 0.0002,
"loss": 0.6306416988372803,
"mean_token_accuracy": 0.7422251328825951,
"num_tokens": 24980486.0,
"step": 668
},
{
"entropy": 0.6116967797279358,
"epoch": 4.2624,
"grad_norm": 0.012161326594650745,
"learning_rate": 0.0002,
"loss": 0.6166009902954102,
"mean_token_accuracy": 0.747859038412571,
"num_tokens": 25018467.0,
"step": 669
},
{
"entropy": 0.6185164824128151,
"epoch": 4.2688,
"grad_norm": 0.012251926586031914,
"learning_rate": 0.0002,
"loss": 0.6215794682502747,
"mean_token_accuracy": 0.7451242059469223,
"num_tokens": 25056006.0,
"step": 670
},
{
"entropy": 0.6283984705805779,
"epoch": 4.2752,
"grad_norm": 0.011603674851357937,
"learning_rate": 0.0002,
"loss": 0.627375066280365,
"mean_token_accuracy": 0.7432128861546516,
"num_tokens": 25093408.0,
"step": 671
},
{
"entropy": 0.609025202691555,
"epoch": 4.2816,
"grad_norm": 0.011993130668997765,
"learning_rate": 0.0002,
"loss": 0.6099145412445068,
"mean_token_accuracy": 0.7511600032448769,
"num_tokens": 25130524.0,
"step": 672
},
{
"entropy": 0.6234938055276871,
"epoch": 4.288,
"grad_norm": 0.010231442749500275,
"learning_rate": 0.0002,
"loss": 0.6248447299003601,
"mean_token_accuracy": 0.7447694912552834,
"num_tokens": 25168063.0,
"step": 673
},
{
"entropy": 0.6148969978094101,
"epoch": 4.2943999999999996,
"grad_norm": 0.012821062467992306,
"learning_rate": 0.0002,
"loss": 0.6163221001625061,
"mean_token_accuracy": 0.7478527128696442,
"num_tokens": 25205806.0,
"step": 674
},
{
"entropy": 0.6235463097691536,
"epoch": 4.3008,
"grad_norm": 0.012431120499968529,
"learning_rate": 0.0002,
"loss": 0.6214525699615479,
"mean_token_accuracy": 0.744065910577774,
"num_tokens": 25243417.0,
"step": 675
},
{
"entropy": 0.6208379119634628,
"epoch": 4.3072,
"grad_norm": 0.011580659076571465,
"learning_rate": 0.0002,
"loss": 0.626810610294342,
"mean_token_accuracy": 0.7434930577874184,
"num_tokens": 25281000.0,
"step": 676
},
{
"entropy": 0.6189445853233337,
"epoch": 4.3136,
"grad_norm": 0.013887791894376278,
"learning_rate": 0.0002,
"loss": 0.6251901388168335,
"mean_token_accuracy": 0.7435762509703636,
"num_tokens": 25318324.0,
"step": 677
},
{
"entropy": 0.623921662569046,
"epoch": 4.32,
"grad_norm": 0.011908493936061859,
"learning_rate": 0.0002,
"loss": 0.6203892230987549,
"mean_token_accuracy": 0.7473464608192444,
"num_tokens": 25356360.0,
"step": 678
},
{
"entropy": 0.631057970225811,
"epoch": 4.3264,
"grad_norm": 0.013283537700772285,
"learning_rate": 0.0002,
"loss": 0.6287419199943542,
"mean_token_accuracy": 0.7408920601010323,
"num_tokens": 25393819.0,
"step": 679
},
{
"entropy": 0.6219344884157181,
"epoch": 4.3328,
"grad_norm": 0.011869650334119797,
"learning_rate": 0.0002,
"loss": 0.6282262802124023,
"mean_token_accuracy": 0.7440148293972015,
"num_tokens": 25431318.0,
"step": 680
},
{
"entropy": 0.6188084334135056,
"epoch": 4.3392,
"grad_norm": 0.010526369325816631,
"learning_rate": 0.0002,
"loss": 0.6230930685997009,
"mean_token_accuracy": 0.7453781887888908,
"num_tokens": 25468847.0,
"step": 681
},
{
"entropy": 0.6212713718414307,
"epoch": 4.3456,
"grad_norm": 0.011861243285238743,
"learning_rate": 0.0002,
"loss": 0.6226496696472168,
"mean_token_accuracy": 0.745365597307682,
"num_tokens": 25506347.0,
"step": 682
},
{
"entropy": 0.6259190738201141,
"epoch": 4.352,
"grad_norm": 0.010720842517912388,
"learning_rate": 0.0002,
"loss": 0.6282031536102295,
"mean_token_accuracy": 0.7432122975587845,
"num_tokens": 25543772.0,
"step": 683
},
{
"entropy": 0.6237253770232201,
"epoch": 4.3584,
"grad_norm": 0.01095424685627222,
"learning_rate": 0.0002,
"loss": 0.6262202262878418,
"mean_token_accuracy": 0.7435847371816635,
"num_tokens": 25581352.0,
"step": 684
},
{
"entropy": 0.6245952621102333,
"epoch": 4.3648,
"grad_norm": 0.010688689537346363,
"learning_rate": 0.0002,
"loss": 0.6216722726821899,
"mean_token_accuracy": 0.7473671957850456,
"num_tokens": 25619317.0,
"step": 685
},
{
"entropy": 0.6425120159983635,
"epoch": 4.3712,
"grad_norm": 0.011959290131926537,
"learning_rate": 0.0002,
"loss": 0.6369903087615967,
"mean_token_accuracy": 0.7412149682641029,
"num_tokens": 25657031.0,
"step": 686
},
{
"entropy": 0.6215310096740723,
"epoch": 4.3776,
"grad_norm": 0.01260219793766737,
"learning_rate": 0.0002,
"loss": 0.6221766471862793,
"mean_token_accuracy": 0.7461507469415665,
"num_tokens": 25694491.0,
"step": 687
},
{
"entropy": 0.6162081435322762,
"epoch": 4.384,
"grad_norm": 0.011745546013116837,
"learning_rate": 0.0002,
"loss": 0.6214650869369507,
"mean_token_accuracy": 0.7467240393161774,
"num_tokens": 25731722.0,
"step": 688
},
{
"entropy": 0.6213862374424934,
"epoch": 4.3904,
"grad_norm": 0.012498460710048676,
"learning_rate": 0.0002,
"loss": 0.6276631355285645,
"mean_token_accuracy": 0.7429244071245193,
"num_tokens": 25769429.0,
"step": 689
},
{
"entropy": 0.6275434419512749,
"epoch": 4.3968,
"grad_norm": 0.012363743036985397,
"learning_rate": 0.0002,
"loss": 0.6299156546592712,
"mean_token_accuracy": 0.742164358496666,
"num_tokens": 25807155.0,
"step": 690
},
{
"entropy": 0.6255523934960365,
"epoch": 4.4032,
"grad_norm": 0.012337331660091877,
"learning_rate": 0.0002,
"loss": 0.6276605725288391,
"mean_token_accuracy": 0.7422888278961182,
"num_tokens": 25844832.0,
"step": 691
},
{
"entropy": 0.618801973760128,
"epoch": 4.4096,
"grad_norm": 0.011720724403858185,
"learning_rate": 0.0002,
"loss": 0.6215369701385498,
"mean_token_accuracy": 0.7449894100427628,
"num_tokens": 25882641.0,
"step": 692
},
{
"entropy": 0.6298277974128723,
"epoch": 4.416,
"grad_norm": 0.011312286369502544,
"learning_rate": 0.0002,
"loss": 0.6291104555130005,
"mean_token_accuracy": 0.7415849938988686,
"num_tokens": 25920171.0,
"step": 693
},
{
"entropy": 0.6253160834312439,
"epoch": 4.4224,
"grad_norm": 0.011473000049591064,
"learning_rate": 0.0002,
"loss": 0.6265097856521606,
"mean_token_accuracy": 0.745900847017765,
"num_tokens": 25957661.0,
"step": 694
},
{
"entropy": 0.6151653453707695,
"epoch": 4.4288,
"grad_norm": 0.011200590059161186,
"learning_rate": 0.0002,
"loss": 0.6186162829399109,
"mean_token_accuracy": 0.7460164353251457,
"num_tokens": 25995288.0,
"step": 695
},
{
"entropy": 0.6358339488506317,
"epoch": 4.4352,
"grad_norm": 0.012506633065640926,
"learning_rate": 0.0002,
"loss": 0.6417111158370972,
"mean_token_accuracy": 0.7386213764548302,
"num_tokens": 26033219.0,
"step": 696
},
{
"entropy": 0.6197969987988472,
"epoch": 4.4416,
"grad_norm": 0.009830954484641552,
"learning_rate": 0.0002,
"loss": 0.6201560497283936,
"mean_token_accuracy": 0.7456861957907677,
"num_tokens": 26071131.0,
"step": 697
},
{
"entropy": 0.6429072171449661,
"epoch": 4.448,
"grad_norm": 0.011239229701459408,
"learning_rate": 0.0002,
"loss": 0.6405913829803467,
"mean_token_accuracy": 0.7353242784738541,
"num_tokens": 26108632.0,
"step": 698
},
{
"entropy": 0.6173607632517815,
"epoch": 4.4544,
"grad_norm": 0.012541512958705425,
"learning_rate": 0.0002,
"loss": 0.6168667078018188,
"mean_token_accuracy": 0.7472453713417053,
"num_tokens": 26145646.0,
"step": 699
},
{
"entropy": 0.6328746154904366,
"epoch": 4.4608,
"grad_norm": 0.011488271877169609,
"learning_rate": 0.0002,
"loss": 0.6352975368499756,
"mean_token_accuracy": 0.7387456595897675,
"num_tokens": 26183067.0,
"step": 700
},
{
"entropy": 0.6217170506715775,
"epoch": 4.4672,
"grad_norm": 0.010990316979587078,
"learning_rate": 0.0002,
"loss": 0.6259629726409912,
"mean_token_accuracy": 0.7441816553473473,
"num_tokens": 26220393.0,
"step": 701
},
{
"entropy": 0.609848141670227,
"epoch": 4.4736,
"grad_norm": 0.013483099639415741,
"learning_rate": 0.0002,
"loss": 0.6171920299530029,
"mean_token_accuracy": 0.7466985434293747,
"num_tokens": 26257715.0,
"step": 702
},
{
"entropy": 0.6218430995941162,
"epoch": 4.48,
"grad_norm": 0.011730284430086613,
"learning_rate": 0.0002,
"loss": 0.623494565486908,
"mean_token_accuracy": 0.7454787790775299,
"num_tokens": 26295447.0,
"step": 703
},
{
"entropy": 0.620815634727478,
"epoch": 4.4864,
"grad_norm": 0.010400974191725254,
"learning_rate": 0.0002,
"loss": 0.6193233132362366,
"mean_token_accuracy": 0.7462346330285072,
"num_tokens": 26332908.0,
"step": 704
},
{
"entropy": 0.6146924197673798,
"epoch": 4.4928,
"grad_norm": 0.01097558531910181,
"learning_rate": 0.0002,
"loss": 0.6141451001167297,
"mean_token_accuracy": 0.7498283833265305,
"num_tokens": 26370265.0,
"step": 705
},
{
"entropy": 0.6297887563705444,
"epoch": 4.4992,
"grad_norm": 0.011810330674052238,
"learning_rate": 0.0002,
"loss": 0.6298263669013977,
"mean_token_accuracy": 0.7408022508025169,
"num_tokens": 26407870.0,
"step": 706
},
{
"entropy": 0.6215150058269501,
"epoch": 4.5056,
"grad_norm": 0.009892682544887066,
"learning_rate": 0.0002,
"loss": 0.6210182905197144,
"mean_token_accuracy": 0.7464409321546555,
"num_tokens": 26445509.0,
"step": 707
},
{
"entropy": 0.6281390488147736,
"epoch": 4.5120000000000005,
"grad_norm": 0.011692460626363754,
"learning_rate": 0.0002,
"loss": 0.6285613179206848,
"mean_token_accuracy": 0.7438349798321724,
"num_tokens": 26483669.0,
"step": 708
},
{
"entropy": 0.6214175447821617,
"epoch": 4.5184,
"grad_norm": 0.011380224488675594,
"learning_rate": 0.0002,
"loss": 0.6210340261459351,
"mean_token_accuracy": 0.7459113150835037,
"num_tokens": 26521265.0,
"step": 709
},
{
"entropy": 0.6104562729597092,
"epoch": 4.5248,
"grad_norm": 0.01076613087207079,
"learning_rate": 0.0002,
"loss": 0.6165965795516968,
"mean_token_accuracy": 0.7475461736321449,
"num_tokens": 26558711.0,
"step": 710
},
{
"entropy": 0.6271610110998154,
"epoch": 4.5312,
"grad_norm": 0.010785672813653946,
"learning_rate": 0.0002,
"loss": 0.6283934116363525,
"mean_token_accuracy": 0.7444132044911385,
"num_tokens": 26596482.0,
"step": 711
},
{
"entropy": 0.6205542087554932,
"epoch": 4.5376,
"grad_norm": 0.010699622333049774,
"learning_rate": 0.0002,
"loss": 0.61879563331604,
"mean_token_accuracy": 0.7464459612965584,
"num_tokens": 26634130.0,
"step": 712
},
{
"entropy": 0.6333268582820892,
"epoch": 4.5440000000000005,
"grad_norm": 0.01175402756780386,
"learning_rate": 0.0002,
"loss": 0.6315722465515137,
"mean_token_accuracy": 0.7412132248282433,
"num_tokens": 26671733.0,
"step": 713
},
{
"entropy": 0.6141394674777985,
"epoch": 4.5504,
"grad_norm": 0.01065735798329115,
"learning_rate": 0.0002,
"loss": 0.6193619966506958,
"mean_token_accuracy": 0.7467841058969498,
"num_tokens": 26708976.0,
"step": 714
},
{
"entropy": 0.6316620260477066,
"epoch": 4.5568,
"grad_norm": 0.01289924792945385,
"learning_rate": 0.0002,
"loss": 0.6370086669921875,
"mean_token_accuracy": 0.7389457300305367,
"num_tokens": 26746597.0,
"step": 715
},
{
"entropy": 0.6334016472101212,
"epoch": 4.5632,
"grad_norm": 0.01159643568098545,
"learning_rate": 0.0002,
"loss": 0.6357477307319641,
"mean_token_accuracy": 0.7415767312049866,
"num_tokens": 26784347.0,
"step": 716
},
{
"entropy": 0.6209512129426003,
"epoch": 4.5696,
"grad_norm": 0.012357997708022594,
"learning_rate": 0.0002,
"loss": 0.620951235294342,
"mean_token_accuracy": 0.7445131912827492,
"num_tokens": 26821369.0,
"step": 717
},
{
"entropy": 0.6184145584702492,
"epoch": 4.576,
"grad_norm": 0.011790684424340725,
"learning_rate": 0.0002,
"loss": 0.6185816526412964,
"mean_token_accuracy": 0.7467178478837013,
"num_tokens": 26858658.0,
"step": 718
},
{
"entropy": 0.6372607722878456,
"epoch": 4.5824,
"grad_norm": 0.011222328059375286,
"learning_rate": 0.0002,
"loss": 0.6393177509307861,
"mean_token_accuracy": 0.7393923178315163,
"num_tokens": 26896679.0,
"step": 719
},
{
"entropy": 0.6263199970126152,
"epoch": 4.5888,
"grad_norm": 0.01184337493032217,
"learning_rate": 0.0002,
"loss": 0.6317442059516907,
"mean_token_accuracy": 0.7412994503974915,
"num_tokens": 26934191.0,
"step": 720
},
{
"entropy": 0.6313236430287361,
"epoch": 4.5952,
"grad_norm": 0.012818049639463425,
"learning_rate": 0.0002,
"loss": 0.6400792002677917,
"mean_token_accuracy": 0.7399108409881592,
"num_tokens": 26971795.0,
"step": 721
},
{
"entropy": 0.6408603191375732,
"epoch": 4.6016,
"grad_norm": 0.011262350715696812,
"learning_rate": 0.0002,
"loss": 0.6372708678245544,
"mean_token_accuracy": 0.7409083321690559,
"num_tokens": 27009541.0,
"step": 722
},
{
"entropy": 0.6237692162394524,
"epoch": 4.608,
"grad_norm": 0.01265136618167162,
"learning_rate": 0.0002,
"loss": 0.6219276189804077,
"mean_token_accuracy": 0.74643175303936,
"num_tokens": 27047207.0,
"step": 723
},
{
"entropy": 0.6229505017399788,
"epoch": 4.6144,
"grad_norm": 0.01034928485751152,
"learning_rate": 0.0002,
"loss": 0.6240932941436768,
"mean_token_accuracy": 0.7452475875616074,
"num_tokens": 27084670.0,
"step": 724
},
{
"entropy": 0.6106055229902267,
"epoch": 4.6208,
"grad_norm": 0.012862354516983032,
"learning_rate": 0.0002,
"loss": 0.6164753437042236,
"mean_token_accuracy": 0.7482388094067574,
"num_tokens": 27122124.0,
"step": 725
},
{
"entropy": 0.6230287775397301,
"epoch": 4.6272,
"grad_norm": 0.012530112639069557,
"learning_rate": 0.0002,
"loss": 0.6248811483383179,
"mean_token_accuracy": 0.745893694460392,
"num_tokens": 27159984.0,
"step": 726
},
{
"entropy": 0.6258671432733536,
"epoch": 4.6336,
"grad_norm": 0.011710980907082558,
"learning_rate": 0.0002,
"loss": 0.6271563768386841,
"mean_token_accuracy": 0.7450519576668739,
"num_tokens": 27197583.0,
"step": 727
},
{
"entropy": 0.6244168281555176,
"epoch": 4.64,
"grad_norm": 0.012283277697861195,
"learning_rate": 0.0002,
"loss": 0.6260854005813599,
"mean_token_accuracy": 0.7433378919959068,
"num_tokens": 27235084.0,
"step": 728
},
{
"entropy": 0.6399951577186584,
"epoch": 4.6464,
"grad_norm": 0.010510124266147614,
"learning_rate": 0.0002,
"loss": 0.6376748085021973,
"mean_token_accuracy": 0.7380894720554352,
"num_tokens": 27272833.0,
"step": 729
},
{
"entropy": 0.6234357804059982,
"epoch": 4.6528,
"grad_norm": 0.014871729537844658,
"learning_rate": 0.0002,
"loss": 0.6165429353713989,
"mean_token_accuracy": 0.7468608766794205,
"num_tokens": 27310301.0,
"step": 730
},
{
"entropy": 0.6247937902808189,
"epoch": 4.6592,
"grad_norm": 0.010685059241950512,
"learning_rate": 0.0002,
"loss": 0.6294916868209839,
"mean_token_accuracy": 0.7414043098688126,
"num_tokens": 27347720.0,
"step": 731
},
{
"entropy": 0.6104548647999763,
"epoch": 4.6655999999999995,
"grad_norm": 0.018121415749192238,
"learning_rate": 0.0002,
"loss": 0.6216402053833008,
"mean_token_accuracy": 0.7466417998075485,
"num_tokens": 27385336.0,
"step": 732
},
{
"entropy": 0.6151935011148453,
"epoch": 4.672,
"grad_norm": 0.010607750155031681,
"learning_rate": 0.0002,
"loss": 0.6190038323402405,
"mean_token_accuracy": 0.7471088394522667,
"num_tokens": 27422696.0,
"step": 733
},
{
"entropy": 0.625689759850502,
"epoch": 4.6784,
"grad_norm": 0.014054366387426853,
"learning_rate": 0.0002,
"loss": 0.6243985295295715,
"mean_token_accuracy": 0.7436644211411476,
"num_tokens": 27460268.0,
"step": 734
},
{
"entropy": 0.6268169730901718,
"epoch": 4.6848,
"grad_norm": 0.012450247071683407,
"learning_rate": 0.0002,
"loss": 0.6240094900131226,
"mean_token_accuracy": 0.743643693625927,
"num_tokens": 27498085.0,
"step": 735
},
{
"entropy": 0.6271230131387711,
"epoch": 4.6912,
"grad_norm": 0.011883650906383991,
"learning_rate": 0.0002,
"loss": 0.6317532062530518,
"mean_token_accuracy": 0.7423899173736572,
"num_tokens": 27535478.0,
"step": 736
},
{
"entropy": 0.6135580986738205,
"epoch": 4.6975999999999996,
"grad_norm": 0.014882571063935757,
"learning_rate": 0.0002,
"loss": 0.6232122182846069,
"mean_token_accuracy": 0.7451476007699966,
"num_tokens": 27572692.0,
"step": 737
},
{
"entropy": 0.6177224218845367,
"epoch": 4.704,
"grad_norm": 0.011081320233643055,
"learning_rate": 0.0002,
"loss": 0.6193344593048096,
"mean_token_accuracy": 0.7470099404454231,
"num_tokens": 27610526.0,
"step": 738
},
{
"entropy": 0.618368849158287,
"epoch": 4.7104,
"grad_norm": 0.01142704114317894,
"learning_rate": 0.0002,
"loss": 0.618331789970398,
"mean_token_accuracy": 0.7472382485866547,
"num_tokens": 27648029.0,
"step": 739
},
{
"entropy": 0.6240565925836563,
"epoch": 4.7168,
"grad_norm": 0.011985547840595245,
"learning_rate": 0.0002,
"loss": 0.624761700630188,
"mean_token_accuracy": 0.7442751675844193,
"num_tokens": 27685924.0,
"step": 740
},
{
"entropy": 0.6319902166724205,
"epoch": 4.7232,
"grad_norm": 0.012069285847246647,
"learning_rate": 0.0002,
"loss": 0.6318994164466858,
"mean_token_accuracy": 0.739115908741951,
"num_tokens": 27723816.0,
"step": 741
},
{
"entropy": 0.6412005797028542,
"epoch": 4.7296,
"grad_norm": 0.01274879090487957,
"learning_rate": 0.0002,
"loss": 0.6381031274795532,
"mean_token_accuracy": 0.7396308556199074,
"num_tokens": 27761867.0,
"step": 742
},
{
"entropy": 0.6192675158381462,
"epoch": 4.736,
"grad_norm": 0.00995372049510479,
"learning_rate": 0.0002,
"loss": 0.62370765209198,
"mean_token_accuracy": 0.7466439455747604,
"num_tokens": 27799496.0,
"step": 743
},
{
"entropy": 0.6180000007152557,
"epoch": 4.7424,
"grad_norm": 0.012485142797231674,
"learning_rate": 0.0002,
"loss": 0.618539035320282,
"mean_token_accuracy": 0.7472988590598106,
"num_tokens": 27836904.0,
"step": 744
},
{
"entropy": 0.6233759000897408,
"epoch": 4.7488,
"grad_norm": 0.01297292672097683,
"learning_rate": 0.0002,
"loss": 0.6253551244735718,
"mean_token_accuracy": 0.743793860077858,
"num_tokens": 27874562.0,
"step": 745
},
{
"entropy": 0.6195263043045998,
"epoch": 4.7552,
"grad_norm": 0.013405952602624893,
"learning_rate": 0.0002,
"loss": 0.6302239298820496,
"mean_token_accuracy": 0.7412486523389816,
"num_tokens": 27911903.0,
"step": 746
},
{
"entropy": 0.6423712894320488,
"epoch": 4.7616,
"grad_norm": 0.011862635612487793,
"learning_rate": 0.0002,
"loss": 0.6428091526031494,
"mean_token_accuracy": 0.735967144370079,
"num_tokens": 27949551.0,
"step": 747
},
{
"entropy": 0.6365993991494179,
"epoch": 4.768,
"grad_norm": 0.011519255116581917,
"learning_rate": 0.0002,
"loss": 0.6331340074539185,
"mean_token_accuracy": 0.7445235848426819,
"num_tokens": 27987167.0,
"step": 748
},
{
"entropy": 0.6285323649644852,
"epoch": 4.7744,
"grad_norm": 0.011068753898143768,
"learning_rate": 0.0002,
"loss": 0.6295030117034912,
"mean_token_accuracy": 0.7423546016216278,
"num_tokens": 28024667.0,
"step": 749
},
{
"entropy": 0.6225018426775932,
"epoch": 4.7808,
"grad_norm": 0.012251611799001694,
"learning_rate": 0.0002,
"loss": 0.6240028142929077,
"mean_token_accuracy": 0.7458074688911438,
"num_tokens": 28062045.0,
"step": 750
},
{
"entropy": 0.6218413189053535,
"epoch": 4.7872,
"grad_norm": 0.011230433359742165,
"learning_rate": 0.0002,
"loss": 0.625887393951416,
"mean_token_accuracy": 0.7432527989149094,
"num_tokens": 28099618.0,
"step": 751
},
{
"entropy": 0.605789877474308,
"epoch": 4.7936,
"grad_norm": 0.01227335911244154,
"learning_rate": 0.0002,
"loss": 0.6102015376091003,
"mean_token_accuracy": 0.7511238679289818,
"num_tokens": 28137039.0,
"step": 752
},
{
"entropy": 0.6157144531607628,
"epoch": 4.8,
"grad_norm": 0.01124510820955038,
"learning_rate": 0.0002,
"loss": 0.6144552230834961,
"mean_token_accuracy": 0.7501148656010628,
"num_tokens": 28174015.0,
"step": 753
},
{
"entropy": 0.6372276619076729,
"epoch": 4.8064,
"grad_norm": 0.012294857762753963,
"learning_rate": 0.0002,
"loss": 0.6344669461250305,
"mean_token_accuracy": 0.7430569604039192,
"num_tokens": 28211765.0,
"step": 754
},
{
"entropy": 0.618014894425869,
"epoch": 4.8128,
"grad_norm": 0.01041495706886053,
"learning_rate": 0.0002,
"loss": 0.6209543943405151,
"mean_token_accuracy": 0.7452011853456497,
"num_tokens": 28249441.0,
"step": 755
},
{
"entropy": 0.6153213605284691,
"epoch": 4.8192,
"grad_norm": 0.012670926749706268,
"learning_rate": 0.0002,
"loss": 0.6228734254837036,
"mean_token_accuracy": 0.7460622638463974,
"num_tokens": 28286854.0,
"step": 756
},
{
"entropy": 0.6158452033996582,
"epoch": 4.8256,
"grad_norm": 0.012129560112953186,
"learning_rate": 0.0002,
"loss": 0.6199190020561218,
"mean_token_accuracy": 0.747655563056469,
"num_tokens": 28323945.0,
"step": 757
},
{
"entropy": 0.6290484443306923,
"epoch": 4.832,
"grad_norm": 0.01301377359777689,
"learning_rate": 0.0002,
"loss": 0.6258755922317505,
"mean_token_accuracy": 0.7452258318662643,
"num_tokens": 28361641.0,
"step": 758
},
{
"entropy": 0.634510226547718,
"epoch": 4.8384,
"grad_norm": 0.011934357695281506,
"learning_rate": 0.0002,
"loss": 0.6296937465667725,
"mean_token_accuracy": 0.742583654820919,
"num_tokens": 28399119.0,
"step": 759
},
{
"entropy": 0.6339060291647911,
"epoch": 4.8448,
"grad_norm": 0.010478752665221691,
"learning_rate": 0.0002,
"loss": 0.6356696486473083,
"mean_token_accuracy": 0.7409758344292641,
"num_tokens": 28436921.0,
"step": 760
},
{
"entropy": 0.6190384924411774,
"epoch": 4.8512,
"grad_norm": 0.013402252458035946,
"learning_rate": 0.0002,
"loss": 0.6263437271118164,
"mean_token_accuracy": 0.7457704097032547,
"num_tokens": 28474709.0,
"step": 761
},
{
"entropy": 0.6296346411108971,
"epoch": 4.8576,
"grad_norm": 0.01403774507343769,
"learning_rate": 0.0002,
"loss": 0.6382781267166138,
"mean_token_accuracy": 0.740397572517395,
"num_tokens": 28512263.0,
"step": 762
},
{
"entropy": 0.6387407630681992,
"epoch": 4.864,
"grad_norm": 0.010807156562805176,
"learning_rate": 0.0002,
"loss": 0.6353914141654968,
"mean_token_accuracy": 0.7394013479351997,
"num_tokens": 28549975.0,
"step": 763
},
{
"entropy": 0.6354725807905197,
"epoch": 4.8704,
"grad_norm": 0.013257911428809166,
"learning_rate": 0.0002,
"loss": 0.6323150396347046,
"mean_token_accuracy": 0.7414470240473747,
"num_tokens": 28587095.0,
"step": 764
},
{
"entropy": 0.6424222439527512,
"epoch": 4.8768,
"grad_norm": 0.012375367805361748,
"learning_rate": 0.0002,
"loss": 0.64325350522995,
"mean_token_accuracy": 0.7369028478860855,
"num_tokens": 28624868.0,
"step": 765
},
{
"entropy": 0.6223215311765671,
"epoch": 4.8832,
"grad_norm": 0.013609180226922035,
"learning_rate": 0.0002,
"loss": 0.6308131217956543,
"mean_token_accuracy": 0.7428993359208107,
"num_tokens": 28662266.0,
"step": 766
},
{
"entropy": 0.6198636963963509,
"epoch": 4.8896,
"grad_norm": 0.011831787414848804,
"learning_rate": 0.0002,
"loss": 0.6238384246826172,
"mean_token_accuracy": 0.7449830919504166,
"num_tokens": 28700199.0,
"step": 767
},
{
"entropy": 0.6371955797076225,
"epoch": 4.896,
"grad_norm": 0.011555573903024197,
"learning_rate": 0.0002,
"loss": 0.6325588822364807,
"mean_token_accuracy": 0.7409590929746628,
"num_tokens": 28737979.0,
"step": 768
},
{
"entropy": 0.6182679012417793,
"epoch": 4.9024,
"grad_norm": 0.01133381575345993,
"learning_rate": 0.0002,
"loss": 0.6179029941558838,
"mean_token_accuracy": 0.7483383342623711,
"num_tokens": 28775432.0,
"step": 769
},
{
"entropy": 0.6291498392820358,
"epoch": 4.9088,
"grad_norm": 0.010519672185182571,
"learning_rate": 0.0002,
"loss": 0.6308712363243103,
"mean_token_accuracy": 0.7437527477741241,
"num_tokens": 28812536.0,
"step": 770
},
{
"entropy": 0.6246335506439209,
"epoch": 4.9152000000000005,
"grad_norm": 0.013134768232703209,
"learning_rate": 0.0002,
"loss": 0.6342728734016418,
"mean_token_accuracy": 0.7407044470310211,
"num_tokens": 28850060.0,
"step": 771
},
{
"entropy": 0.6130682453513145,
"epoch": 4.9216,
"grad_norm": 0.010492725297808647,
"learning_rate": 0.0002,
"loss": 0.6162416934967041,
"mean_token_accuracy": 0.7491699755191803,
"num_tokens": 28887643.0,
"step": 772
},
{
"entropy": 0.6313211023807526,
"epoch": 4.928,
"grad_norm": 0.011192471720278263,
"learning_rate": 0.0002,
"loss": 0.631119966506958,
"mean_token_accuracy": 0.741656944155693,
"num_tokens": 28925297.0,
"step": 773
},
{
"entropy": 0.6132954135537148,
"epoch": 4.9344,
"grad_norm": 0.00988168828189373,
"learning_rate": 0.0002,
"loss": 0.6083347201347351,
"mean_token_accuracy": 0.7506287023425102,
"num_tokens": 28962437.0,
"step": 774
},
{
"entropy": 0.6186309084296227,
"epoch": 4.9408,
"grad_norm": 0.011386038735508919,
"learning_rate": 0.0002,
"loss": 0.6201795339584351,
"mean_token_accuracy": 0.7484031617641449,
"num_tokens": 28999874.0,
"step": 775
},
{
"entropy": 0.6235462054610252,
"epoch": 4.9472000000000005,
"grad_norm": 0.011064821854233742,
"learning_rate": 0.0002,
"loss": 0.6267992258071899,
"mean_token_accuracy": 0.7443990632891655,
"num_tokens": 29037497.0,
"step": 776
},
{
"entropy": 0.6196893155574799,
"epoch": 4.9536,
"grad_norm": 0.012706468813121319,
"learning_rate": 0.0002,
"loss": 0.6288238763809204,
"mean_token_accuracy": 0.7432743161916733,
"num_tokens": 29074815.0,
"step": 777
},
{
"entropy": 0.6359954103827477,
"epoch": 4.96,
"grad_norm": 0.01185152493417263,
"learning_rate": 0.0002,
"loss": 0.6353201866149902,
"mean_token_accuracy": 0.7408851012587547,
"num_tokens": 29112518.0,
"step": 778
},
{
"entropy": 0.6222160458564758,
"epoch": 4.9664,
"grad_norm": 0.011700387112796307,
"learning_rate": 0.0002,
"loss": 0.6173217296600342,
"mean_token_accuracy": 0.7465430647134781,
"num_tokens": 29150199.0,
"step": 779
},
{
"entropy": 0.6329935416579247,
"epoch": 4.9728,
"grad_norm": 0.011351538822054863,
"learning_rate": 0.0002,
"loss": 0.6344210505485535,
"mean_token_accuracy": 0.7397899106144905,
"num_tokens": 29187985.0,
"step": 780
},
{
"entropy": 0.6197427585721016,
"epoch": 4.9792,
"grad_norm": 0.013295335695147514,
"learning_rate": 0.0002,
"loss": 0.6274314522743225,
"mean_token_accuracy": 0.742200955748558,
"num_tokens": 29225578.0,
"step": 781
},
{
"entropy": 0.6366394832730293,
"epoch": 4.9856,
"grad_norm": 0.011197940446436405,
"learning_rate": 0.0002,
"loss": 0.6420581340789795,
"mean_token_accuracy": 0.7372548654675484,
"num_tokens": 29263081.0,
"step": 782
},
{
"entropy": 0.623991571366787,
"epoch": 4.992,
"grad_norm": 0.012578215450048447,
"learning_rate": 0.0002,
"loss": 0.6253401041030884,
"mean_token_accuracy": 0.7438567355275154,
"num_tokens": 29300476.0,
"step": 783
},
{
"entropy": 0.6156981587409973,
"epoch": 4.9984,
"grad_norm": 0.010751175694167614,
"learning_rate": 0.0002,
"loss": 0.616902232170105,
"mean_token_accuracy": 0.7490730434656143,
"num_tokens": 29337892.0,
"step": 784
},
{
"entropy": 0.6212073564529419,
"epoch": 5.0,
"grad_norm": 0.0221311803907156,
"learning_rate": 0.0002,
"loss": 0.6252682209014893,
"mean_token_accuracy": 0.7461582720279694,
"num_tokens": 29347371.0,
"step": 785
}
],
"logging_steps": 1,
"max_steps": 785,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.7322491635624837e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}