fpadovani's picture
Training checkpoint: step 500
1b375bf verified
Raw
History Blame
28 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.01568037131119265,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.651023864746094,
"epoch": 0.00015680371311192648,
"grad_norm": 11.5625,
"learning_rate": 2e-06,
"loss": 10.8028,
"mean_token_accuracy": 6.958942394703626e-05,
"num_tokens": 14082.0,
"step": 5
},
{
"entropy": 10.651004600524903,
"epoch": 0.00031360742622385296,
"grad_norm": 11.375,
"learning_rate": 4.5e-06,
"loss": 10.7633,
"mean_token_accuracy": 6.574622238986194e-05,
"num_tokens": 29900.0,
"step": 10
},
{
"entropy": 10.650343418121338,
"epoch": 0.00047041113933577947,
"grad_norm": 8.4375,
"learning_rate": 7e-06,
"loss": 10.5185,
"mean_token_accuracy": 0.01316747289383784,
"num_tokens": 43394.0,
"step": 15
},
{
"entropy": 10.64456491470337,
"epoch": 0.0006272148524477059,
"grad_norm": 5.34375,
"learning_rate": 9.5e-06,
"loss": 10.2603,
"mean_token_accuracy": 0.03233455698937178,
"num_tokens": 58563.0,
"step": 20
},
{
"entropy": 10.616307353973388,
"epoch": 0.0007840185655596325,
"grad_norm": 3.609375,
"learning_rate": 1.2e-05,
"loss": 9.9833,
"mean_token_accuracy": 0.034109539538621905,
"num_tokens": 73923.0,
"step": 25
},
{
"entropy": 10.588720226287842,
"epoch": 0.0009408222786715589,
"grad_norm": 2.984375,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.8466,
"mean_token_accuracy": 0.03426761133596301,
"num_tokens": 87652.0,
"step": 30
},
{
"entropy": 10.595056247711181,
"epoch": 0.0010976259917834855,
"grad_norm": 2.671875,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.7741,
"mean_token_accuracy": 0.031784738413989544,
"num_tokens": 101369.0,
"step": 35
},
{
"entropy": 10.59932107925415,
"epoch": 0.0012544297048954118,
"grad_norm": 2.515625,
"learning_rate": 1.95e-05,
"loss": 9.6922,
"mean_token_accuracy": 0.03506205677986145,
"num_tokens": 114428.0,
"step": 40
},
{
"entropy": 10.581777667999267,
"epoch": 0.0014112334180073384,
"grad_norm": 2.3125,
"learning_rate": 2.2e-05,
"loss": 9.706,
"mean_token_accuracy": 0.03386611118912697,
"num_tokens": 130472.0,
"step": 45
},
{
"entropy": 10.577643585205077,
"epoch": 0.001568037131119265,
"grad_norm": 2.40625,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.6852,
"mean_token_accuracy": 0.030213401652872562,
"num_tokens": 144077.0,
"step": 50
},
{
"entropy": 10.59252758026123,
"epoch": 0.0017248408442311913,
"grad_norm": 2.15625,
"learning_rate": 2.7e-05,
"loss": 9.6373,
"mean_token_accuracy": 0.03242910895496607,
"num_tokens": 158941.0,
"step": 55
},
{
"entropy": 10.579074954986572,
"epoch": 0.0018816445573431179,
"grad_norm": 2.140625,
"learning_rate": 2.95e-05,
"loss": 9.563,
"mean_token_accuracy": 0.02959225047379732,
"num_tokens": 174362.0,
"step": 60
},
{
"entropy": 10.570305156707764,
"epoch": 0.002038448270455044,
"grad_norm": 2.09375,
"learning_rate": 3.2e-05,
"loss": 9.4485,
"mean_token_accuracy": 0.033058703131973746,
"num_tokens": 190929.0,
"step": 65
},
{
"entropy": 10.55489387512207,
"epoch": 0.002195251983566971,
"grad_norm": 2.015625,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.3387,
"mean_token_accuracy": 0.033958965167403224,
"num_tokens": 203660.0,
"step": 70
},
{
"entropy": 10.530017757415772,
"epoch": 0.0023520556966788973,
"grad_norm": 2.0625,
"learning_rate": 3.7e-05,
"loss": 9.2826,
"mean_token_accuracy": 0.027879416570067407,
"num_tokens": 218421.0,
"step": 75
},
{
"entropy": 10.534087371826171,
"epoch": 0.0025088594097908237,
"grad_norm": 2.09375,
"learning_rate": 3.95e-05,
"loss": 9.1439,
"mean_token_accuracy": 0.03472804371267557,
"num_tokens": 233734.0,
"step": 80
},
{
"entropy": 10.496679878234863,
"epoch": 0.0026656631229027505,
"grad_norm": 1.9765625,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.0182,
"mean_token_accuracy": 0.02818337455391884,
"num_tokens": 247105.0,
"step": 85
},
{
"entropy": 10.467080688476562,
"epoch": 0.002822466836014677,
"grad_norm": 1.9140625,
"learning_rate": 4.45e-05,
"loss": 8.928,
"mean_token_accuracy": 0.03165087569504976,
"num_tokens": 262487.0,
"step": 90
},
{
"entropy": 10.403542804718018,
"epoch": 0.002979270549126603,
"grad_norm": 1.9921875,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.7777,
"mean_token_accuracy": 0.036813986487686634,
"num_tokens": 276705.0,
"step": 95
},
{
"entropy": 10.354411220550537,
"epoch": 0.00313607426223853,
"grad_norm": 1.9765625,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.6775,
"mean_token_accuracy": 0.04005452003329992,
"num_tokens": 291031.0,
"step": 100
},
{
"entropy": 10.269740104675293,
"epoch": 0.0032928779753504563,
"grad_norm": 1.890625,
"learning_rate": 5.2e-05,
"loss": 8.5069,
"mean_token_accuracy": 0.040437552519142626,
"num_tokens": 305444.0,
"step": 105
},
{
"entropy": 10.179180717468261,
"epoch": 0.0034496816884623826,
"grad_norm": 1.8671875,
"learning_rate": 5.45e-05,
"loss": 8.3811,
"mean_token_accuracy": 0.04589438661932945,
"num_tokens": 321168.0,
"step": 110
},
{
"entropy": 10.070209217071532,
"epoch": 0.0036064854015743094,
"grad_norm": 1.7265625,
"learning_rate": 5.7e-05,
"loss": 8.1795,
"mean_token_accuracy": 0.05213871449232101,
"num_tokens": 334988.0,
"step": 115
},
{
"entropy": 9.922878646850586,
"epoch": 0.0037632891146862357,
"grad_norm": 1.6796875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.0559,
"mean_token_accuracy": 0.05347799621522427,
"num_tokens": 349049.0,
"step": 120
},
{
"entropy": 9.7627742767334,
"epoch": 0.0039200928277981625,
"grad_norm": 1.765625,
"learning_rate": 6.2e-05,
"loss": 8.0302,
"mean_token_accuracy": 0.05416244864463806,
"num_tokens": 365497.0,
"step": 125
},
{
"entropy": 9.585789394378661,
"epoch": 0.004076896540910088,
"grad_norm": 1.5,
"learning_rate": 6.450000000000001e-05,
"loss": 7.8073,
"mean_token_accuracy": 0.05755908451974392,
"num_tokens": 380324.0,
"step": 130
},
{
"entropy": 9.368918418884277,
"epoch": 0.004233700254022015,
"grad_norm": 1.59375,
"learning_rate": 6.7e-05,
"loss": 7.6844,
"mean_token_accuracy": 0.06051859185099602,
"num_tokens": 393766.0,
"step": 135
},
{
"entropy": 9.158668899536133,
"epoch": 0.004390503967133942,
"grad_norm": 1.4296875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.6272,
"mean_token_accuracy": 0.06358711272478104,
"num_tokens": 409369.0,
"step": 140
},
{
"entropy": 8.945510005950927,
"epoch": 0.004547307680245868,
"grad_norm": 1.546875,
"learning_rate": 7.2e-05,
"loss": 7.5019,
"mean_token_accuracy": 0.06252376027405263,
"num_tokens": 425475.0,
"step": 145
},
{
"entropy": 8.711659908294678,
"epoch": 0.004704111393357795,
"grad_norm": 1.59375,
"learning_rate": 7.45e-05,
"loss": 7.3832,
"mean_token_accuracy": 0.06495344713330269,
"num_tokens": 440853.0,
"step": 150
},
{
"entropy": 8.498833179473877,
"epoch": 0.0048609151064697214,
"grad_norm": 1.609375,
"learning_rate": 7.7e-05,
"loss": 7.3471,
"mean_token_accuracy": 0.06971911787986755,
"num_tokens": 457407.0,
"step": 155
},
{
"entropy": 8.355002212524415,
"epoch": 0.005017718819581647,
"grad_norm": 1.09375,
"learning_rate": 7.950000000000001e-05,
"loss": 7.2971,
"mean_token_accuracy": 0.06931432262063027,
"num_tokens": 472813.0,
"step": 160
},
{
"entropy": 8.208080291748047,
"epoch": 0.005174522532693574,
"grad_norm": 1.5,
"learning_rate": 8.2e-05,
"loss": 7.3059,
"mean_token_accuracy": 0.06723905019462109,
"num_tokens": 489742.0,
"step": 165
},
{
"entropy": 8.143133544921875,
"epoch": 0.005331326245805501,
"grad_norm": 1.4375,
"learning_rate": 8.450000000000001e-05,
"loss": 7.2399,
"mean_token_accuracy": 0.06843472644686699,
"num_tokens": 503493.0,
"step": 170
},
{
"entropy": 8.036779308319092,
"epoch": 0.005488129958917427,
"grad_norm": 1.1796875,
"learning_rate": 8.7e-05,
"loss": 7.1275,
"mean_token_accuracy": 0.07654446959495545,
"num_tokens": 520143.0,
"step": 175
},
{
"entropy": 7.934807920455933,
"epoch": 0.005644933672029354,
"grad_norm": 1.3203125,
"learning_rate": 8.95e-05,
"loss": 7.232,
"mean_token_accuracy": 0.06283588744699956,
"num_tokens": 534776.0,
"step": 180
},
{
"entropy": 7.953633880615234,
"epoch": 0.00580173738514128,
"grad_norm": 1.3359375,
"learning_rate": 9.2e-05,
"loss": 7.2097,
"mean_token_accuracy": 0.06803618557751179,
"num_tokens": 550256.0,
"step": 185
},
{
"entropy": 7.894899654388428,
"epoch": 0.005958541098253206,
"grad_norm": 1.1796875,
"learning_rate": 9.45e-05,
"loss": 7.2178,
"mean_token_accuracy": 0.0686919379979372,
"num_tokens": 564797.0,
"step": 190
},
{
"entropy": 7.844494724273682,
"epoch": 0.006115344811365133,
"grad_norm": 1.1953125,
"learning_rate": 9.7e-05,
"loss": 6.9952,
"mean_token_accuracy": 0.0732124924659729,
"num_tokens": 579721.0,
"step": 195
},
{
"entropy": 7.716418170928955,
"epoch": 0.00627214852447706,
"grad_norm": 1.359375,
"learning_rate": 9.95e-05,
"loss": 6.9564,
"mean_token_accuracy": 0.07807120829820632,
"num_tokens": 593431.0,
"step": 200
},
{
"entropy": 7.715715551376343,
"epoch": 0.006428952237588986,
"grad_norm": 1.6796875,
"learning_rate": 0.000102,
"loss": 6.9708,
"mean_token_accuracy": 0.07868832051753998,
"num_tokens": 608176.0,
"step": 205
},
{
"entropy": 7.692095470428467,
"epoch": 0.0065857559507009125,
"grad_norm": 1.40625,
"learning_rate": 0.00010449999999999999,
"loss": 6.9833,
"mean_token_accuracy": 0.07725078389048576,
"num_tokens": 621784.0,
"step": 210
},
{
"entropy": 7.700586032867432,
"epoch": 0.006742559663812839,
"grad_norm": 1.421875,
"learning_rate": 0.000107,
"loss": 6.9716,
"mean_token_accuracy": 0.07797399312257766,
"num_tokens": 634707.0,
"step": 215
},
{
"entropy": 7.623541641235351,
"epoch": 0.006899363376924765,
"grad_norm": 1.359375,
"learning_rate": 0.0001095,
"loss": 7.0494,
"mean_token_accuracy": 0.0720802016556263,
"num_tokens": 647835.0,
"step": 220
},
{
"entropy": 7.631550598144531,
"epoch": 0.007056167090036692,
"grad_norm": 1.3125,
"learning_rate": 0.000112,
"loss": 6.9591,
"mean_token_accuracy": 0.07618656158447265,
"num_tokens": 662587.0,
"step": 225
},
{
"entropy": 7.684398460388183,
"epoch": 0.007212970803148619,
"grad_norm": 1.3828125,
"learning_rate": 0.0001145,
"loss": 7.0602,
"mean_token_accuracy": 0.07651265673339366,
"num_tokens": 676329.0,
"step": 230
},
{
"entropy": 7.561251878738403,
"epoch": 0.007369774516260545,
"grad_norm": 1.3203125,
"learning_rate": 0.00011700000000000001,
"loss": 6.953,
"mean_token_accuracy": 0.08274711072444915,
"num_tokens": 692541.0,
"step": 235
},
{
"entropy": 7.560929489135742,
"epoch": 0.0075265782293724715,
"grad_norm": 1.1953125,
"learning_rate": 0.00011949999999999999,
"loss": 7.0198,
"mean_token_accuracy": 0.07723658978939056,
"num_tokens": 706997.0,
"step": 240
},
{
"entropy": 7.557625770568848,
"epoch": 0.007683381942484398,
"grad_norm": 1.3359375,
"learning_rate": 0.000122,
"loss": 6.9217,
"mean_token_accuracy": 0.08156572207808495,
"num_tokens": 720719.0,
"step": 245
},
{
"entropy": 7.592370510101318,
"epoch": 0.007840185655596325,
"grad_norm": 1.40625,
"learning_rate": 0.0001245,
"loss": 7.0018,
"mean_token_accuracy": 0.08049147836863994,
"num_tokens": 734572.0,
"step": 250
},
{
"entropy": 7.522368669509888,
"epoch": 0.007996989368708251,
"grad_norm": 1.2734375,
"learning_rate": 0.000127,
"loss": 6.8688,
"mean_token_accuracy": 0.08029020316898823,
"num_tokens": 751365.0,
"step": 255
},
{
"entropy": 7.458198308944702,
"epoch": 0.008153793081820177,
"grad_norm": 1.375,
"learning_rate": 0.0001295,
"loss": 6.8057,
"mean_token_accuracy": 0.08540241345763207,
"num_tokens": 765549.0,
"step": 260
},
{
"entropy": 7.365204620361328,
"epoch": 0.008310596794932104,
"grad_norm": 1.1796875,
"learning_rate": 0.000132,
"loss": 6.7974,
"mean_token_accuracy": 0.0849799670279026,
"num_tokens": 780071.0,
"step": 265
},
{
"entropy": 7.453489208221436,
"epoch": 0.00846740050804403,
"grad_norm": 1.3125,
"learning_rate": 0.00013450000000000002,
"loss": 6.8488,
"mean_token_accuracy": 0.08373216427862644,
"num_tokens": 795328.0,
"step": 270
},
{
"entropy": 7.333805704116822,
"epoch": 0.008624204221155956,
"grad_norm": 1.2890625,
"learning_rate": 0.00013700000000000002,
"loss": 6.759,
"mean_token_accuracy": 0.09399082660675048,
"num_tokens": 808404.0,
"step": 275
},
{
"entropy": 7.400871515274048,
"epoch": 0.008781007934267884,
"grad_norm": 1.4296875,
"learning_rate": 0.0001395,
"loss": 6.857,
"mean_token_accuracy": 0.08847371190786361,
"num_tokens": 823204.0,
"step": 280
},
{
"entropy": 7.292252063751221,
"epoch": 0.00893781164737981,
"grad_norm": 1.5,
"learning_rate": 0.00014199999999999998,
"loss": 6.7636,
"mean_token_accuracy": 0.08776607438921928,
"num_tokens": 836276.0,
"step": 285
},
{
"entropy": 7.366798543930054,
"epoch": 0.009094615360491736,
"grad_norm": 1.4296875,
"learning_rate": 0.0001445,
"loss": 6.7562,
"mean_token_accuracy": 0.09157689064741134,
"num_tokens": 850090.0,
"step": 290
},
{
"entropy": 7.297074222564698,
"epoch": 0.009251419073603663,
"grad_norm": 1.2890625,
"learning_rate": 0.000147,
"loss": 6.7845,
"mean_token_accuracy": 0.08689201548695565,
"num_tokens": 865931.0,
"step": 295
},
{
"entropy": 7.316424083709717,
"epoch": 0.00940822278671559,
"grad_norm": 1.390625,
"learning_rate": 0.0001495,
"loss": 6.7825,
"mean_token_accuracy": 0.08415777459740639,
"num_tokens": 879960.0,
"step": 300
},
{
"entropy": 7.245685482025147,
"epoch": 0.009565026499827515,
"grad_norm": 1.125,
"learning_rate": 0.000152,
"loss": 6.7297,
"mean_token_accuracy": 0.08968461528420449,
"num_tokens": 894711.0,
"step": 305
},
{
"entropy": 7.20286979675293,
"epoch": 0.009721830212939443,
"grad_norm": 1.28125,
"learning_rate": 0.00015450000000000001,
"loss": 6.6488,
"mean_token_accuracy": 0.08769082948565483,
"num_tokens": 911461.0,
"step": 310
},
{
"entropy": 7.2604657173156735,
"epoch": 0.009878633926051369,
"grad_norm": 1.515625,
"learning_rate": 0.000157,
"loss": 6.8178,
"mean_token_accuracy": 0.08734595999121667,
"num_tokens": 926618.0,
"step": 315
},
{
"entropy": 7.233215236663819,
"epoch": 0.010035437639163295,
"grad_norm": 1.3515625,
"learning_rate": 0.0001595,
"loss": 6.7365,
"mean_token_accuracy": 0.09149369075894356,
"num_tokens": 942310.0,
"step": 320
},
{
"entropy": 7.098740816116333,
"epoch": 0.010192241352275222,
"grad_norm": 1.1953125,
"learning_rate": 0.000162,
"loss": 6.638,
"mean_token_accuracy": 0.09136478006839752,
"num_tokens": 958180.0,
"step": 325
},
{
"entropy": 7.278954648971558,
"epoch": 0.010349045065387148,
"grad_norm": 1.2265625,
"learning_rate": 0.00016450000000000001,
"loss": 6.7407,
"mean_token_accuracy": 0.08464238122105598,
"num_tokens": 973484.0,
"step": 330
},
{
"entropy": 7.1389687061309814,
"epoch": 0.010505848778499074,
"grad_norm": 1.1328125,
"learning_rate": 0.00016700000000000002,
"loss": 6.5988,
"mean_token_accuracy": 0.09544083774089814,
"num_tokens": 988712.0,
"step": 335
},
{
"entropy": 7.1739630699157715,
"epoch": 0.010662652491611002,
"grad_norm": 1.203125,
"learning_rate": 0.00016950000000000003,
"loss": 6.6637,
"mean_token_accuracy": 0.0873688019812107,
"num_tokens": 1005316.0,
"step": 340
},
{
"entropy": 7.009389734268188,
"epoch": 0.010819456204722928,
"grad_norm": 1.2734375,
"learning_rate": 0.00017199999999999998,
"loss": 6.5965,
"mean_token_accuracy": 0.09233827069401741,
"num_tokens": 1020624.0,
"step": 345
},
{
"entropy": 7.205262613296509,
"epoch": 0.010976259917834854,
"grad_norm": 1.3828125,
"learning_rate": 0.00017449999999999999,
"loss": 6.6497,
"mean_token_accuracy": 0.09442537128925324,
"num_tokens": 1035346.0,
"step": 350
},
{
"entropy": 7.131465578079224,
"epoch": 0.011133063630946781,
"grad_norm": 1.5,
"learning_rate": 0.000177,
"loss": 6.6518,
"mean_token_accuracy": 0.08939319550991058,
"num_tokens": 1052396.0,
"step": 355
},
{
"entropy": 7.066566705703735,
"epoch": 0.011289867344058707,
"grad_norm": 1.21875,
"learning_rate": 0.0001795,
"loss": 6.6706,
"mean_token_accuracy": 0.08813088536262512,
"num_tokens": 1068158.0,
"step": 360
},
{
"entropy": 7.096987533569336,
"epoch": 0.011446671057170633,
"grad_norm": 1.21875,
"learning_rate": 0.000182,
"loss": 6.532,
"mean_token_accuracy": 0.10468010231852531,
"num_tokens": 1081891.0,
"step": 365
},
{
"entropy": 6.936192178726197,
"epoch": 0.01160347477028256,
"grad_norm": 1.390625,
"learning_rate": 0.0001845,
"loss": 6.4988,
"mean_token_accuracy": 0.10371973067522049,
"num_tokens": 1094953.0,
"step": 370
},
{
"entropy": 6.988458728790283,
"epoch": 0.011760278483394487,
"grad_norm": 1.375,
"learning_rate": 0.000187,
"loss": 6.4762,
"mean_token_accuracy": 0.09902411252260208,
"num_tokens": 1109923.0,
"step": 375
},
{
"entropy": 7.017359066009521,
"epoch": 0.011917082196506413,
"grad_norm": 1.265625,
"learning_rate": 0.0001895,
"loss": 6.5871,
"mean_token_accuracy": 0.09580302238464355,
"num_tokens": 1126987.0,
"step": 380
},
{
"entropy": 6.971819591522217,
"epoch": 0.01207388590961834,
"grad_norm": 1.3671875,
"learning_rate": 0.000192,
"loss": 6.5812,
"mean_token_accuracy": 0.09617941230535507,
"num_tokens": 1139931.0,
"step": 385
},
{
"entropy": 6.953200578689575,
"epoch": 0.012230689622730266,
"grad_norm": 1.3203125,
"learning_rate": 0.0001945,
"loss": 6.4646,
"mean_token_accuracy": 0.10358070284128189,
"num_tokens": 1155721.0,
"step": 390
},
{
"entropy": 6.9849913120269775,
"epoch": 0.012387493335842192,
"grad_norm": 1.1484375,
"learning_rate": 0.00019700000000000002,
"loss": 6.5469,
"mean_token_accuracy": 0.10082540512084961,
"num_tokens": 1171655.0,
"step": 395
},
{
"entropy": 6.938650178909302,
"epoch": 0.01254429704895412,
"grad_norm": 1.171875,
"learning_rate": 0.00019950000000000002,
"loss": 6.5281,
"mean_token_accuracy": 0.10091597810387612,
"num_tokens": 1186666.0,
"step": 400
},
{
"entropy": 6.9116593360900875,
"epoch": 0.012701100762066046,
"grad_norm": 1.46875,
"learning_rate": 0.000202,
"loss": 6.4346,
"mean_token_accuracy": 0.09778324812650681,
"num_tokens": 1198283.0,
"step": 405
},
{
"entropy": 6.876869249343872,
"epoch": 0.012857904475177971,
"grad_norm": 1.2734375,
"learning_rate": 0.00020449999999999998,
"loss": 6.4735,
"mean_token_accuracy": 0.09719930961728096,
"num_tokens": 1212613.0,
"step": 410
},
{
"entropy": 6.932867479324341,
"epoch": 0.013014708188289899,
"grad_norm": 1.6171875,
"learning_rate": 0.000207,
"loss": 6.4643,
"mean_token_accuracy": 0.10083647891879081,
"num_tokens": 1227515.0,
"step": 415
},
{
"entropy": 6.873914337158203,
"epoch": 0.013171511901401825,
"grad_norm": 1.40625,
"learning_rate": 0.0002095,
"loss": 6.4762,
"mean_token_accuracy": 0.1099552720785141,
"num_tokens": 1239022.0,
"step": 420
},
{
"entropy": 6.844020032882691,
"epoch": 0.013328315614513751,
"grad_norm": 1.1875,
"learning_rate": 0.000212,
"loss": 6.4853,
"mean_token_accuracy": 0.09865991845726967,
"num_tokens": 1254653.0,
"step": 425
},
{
"entropy": 6.919657754898071,
"epoch": 0.013485119327625679,
"grad_norm": 1.1875,
"learning_rate": 0.0002145,
"loss": 6.4894,
"mean_token_accuracy": 0.09527975097298622,
"num_tokens": 1270766.0,
"step": 430
},
{
"entropy": 6.905207824707031,
"epoch": 0.013641923040737605,
"grad_norm": 1.25,
"learning_rate": 0.00021700000000000002,
"loss": 6.4774,
"mean_token_accuracy": 0.10371477827429772,
"num_tokens": 1284742.0,
"step": 435
},
{
"entropy": 6.912538671493531,
"epoch": 0.01379872675384953,
"grad_norm": 1.234375,
"learning_rate": 0.0002195,
"loss": 6.4678,
"mean_token_accuracy": 0.10031345337629319,
"num_tokens": 1297881.0,
"step": 440
},
{
"entropy": 6.800807285308838,
"epoch": 0.013955530466961458,
"grad_norm": 1.09375,
"learning_rate": 0.000222,
"loss": 6.4071,
"mean_token_accuracy": 0.10895167514681817,
"num_tokens": 1314727.0,
"step": 445
},
{
"entropy": 6.85034818649292,
"epoch": 0.014112334180073384,
"grad_norm": 1.2421875,
"learning_rate": 0.0002245,
"loss": 6.4329,
"mean_token_accuracy": 0.10191441029310226,
"num_tokens": 1332630.0,
"step": 450
},
{
"entropy": 6.820253705978393,
"epoch": 0.01426913789318531,
"grad_norm": 1.1015625,
"learning_rate": 0.00022700000000000002,
"loss": 6.5253,
"mean_token_accuracy": 0.09508129432797433,
"num_tokens": 1348028.0,
"step": 455
},
{
"entropy": 6.8252214908599855,
"epoch": 0.014425941606297238,
"grad_norm": 1.2265625,
"learning_rate": 0.00022950000000000002,
"loss": 6.3729,
"mean_token_accuracy": 0.10276357978582382,
"num_tokens": 1363723.0,
"step": 460
},
{
"entropy": 6.869743585586548,
"epoch": 0.014582745319409163,
"grad_norm": 1.625,
"learning_rate": 0.00023200000000000003,
"loss": 6.4717,
"mean_token_accuracy": 0.10454175770282745,
"num_tokens": 1378400.0,
"step": 465
},
{
"entropy": 6.816213941574096,
"epoch": 0.01473954903252109,
"grad_norm": 1.21875,
"learning_rate": 0.00023449999999999998,
"loss": 6.3712,
"mean_token_accuracy": 0.10962107256054879,
"num_tokens": 1393383.0,
"step": 470
},
{
"entropy": 6.703394031524658,
"epoch": 0.014896352745633017,
"grad_norm": 1.3515625,
"learning_rate": 0.000237,
"loss": 6.3905,
"mean_token_accuracy": 0.10753661692142487,
"num_tokens": 1409609.0,
"step": 475
},
{
"entropy": 6.746933174133301,
"epoch": 0.015053156458744943,
"grad_norm": 1.28125,
"learning_rate": 0.0002395,
"loss": 6.3711,
"mean_token_accuracy": 0.109779604524374,
"num_tokens": 1423378.0,
"step": 480
},
{
"entropy": 6.657280206680298,
"epoch": 0.015209960171856869,
"grad_norm": 1.28125,
"learning_rate": 0.000242,
"loss": 6.3545,
"mean_token_accuracy": 0.10648095905780793,
"num_tokens": 1437722.0,
"step": 485
},
{
"entropy": 6.752739667892456,
"epoch": 0.015366763884968796,
"grad_norm": 1.203125,
"learning_rate": 0.0002445,
"loss": 6.4004,
"mean_token_accuracy": 0.10294785127043724,
"num_tokens": 1452969.0,
"step": 490
},
{
"entropy": 6.7490668296813965,
"epoch": 0.015523567598080722,
"grad_norm": 1.3515625,
"learning_rate": 0.000247,
"loss": 6.406,
"mean_token_accuracy": 0.10591119825839997,
"num_tokens": 1466014.0,
"step": 495
},
{
"entropy": 6.7571159362792965,
"epoch": 0.01568037131119265,
"grad_norm": 1.3671875,
"learning_rate": 0.0002495,
"loss": 6.4293,
"mean_token_accuracy": 0.1040202483534813,
"num_tokens": 1482087.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2615647555584000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}