{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.01568037131119265, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.651023864746094, "epoch": 0.00015680371311192648, "grad_norm": 11.5625, "learning_rate": 2e-06, "loss": 10.8028, "mean_token_accuracy": 6.958942394703626e-05, "num_tokens": 14082.0, "step": 5 }, { "entropy": 10.651004600524903, "epoch": 0.00031360742622385296, "grad_norm": 11.375, "learning_rate": 4.5e-06, "loss": 10.7633, "mean_token_accuracy": 6.574622238986194e-05, "num_tokens": 29900.0, "step": 10 }, { "entropy": 10.650343418121338, "epoch": 0.00047041113933577947, "grad_norm": 8.4375, "learning_rate": 7e-06, "loss": 10.5185, "mean_token_accuracy": 0.01316747289383784, "num_tokens": 43394.0, "step": 15 }, { "entropy": 10.64456491470337, "epoch": 0.0006272148524477059, "grad_norm": 5.34375, "learning_rate": 9.5e-06, "loss": 10.2603, "mean_token_accuracy": 0.03233455698937178, "num_tokens": 58563.0, "step": 20 }, { "entropy": 10.616307353973388, "epoch": 0.0007840185655596325, "grad_norm": 3.609375, "learning_rate": 1.2e-05, "loss": 9.9833, "mean_token_accuracy": 0.034109539538621905, "num_tokens": 73923.0, "step": 25 }, { "entropy": 10.588720226287842, "epoch": 0.0009408222786715589, "grad_norm": 2.984375, "learning_rate": 1.4500000000000002e-05, "loss": 9.8466, "mean_token_accuracy": 0.03426761133596301, "num_tokens": 87652.0, "step": 30 }, { "entropy": 10.595056247711181, "epoch": 0.0010976259917834855, "grad_norm": 2.671875, "learning_rate": 1.7000000000000003e-05, "loss": 9.7741, "mean_token_accuracy": 0.031784738413989544, "num_tokens": 101369.0, "step": 35 }, { "entropy": 10.59932107925415, "epoch": 0.0012544297048954118, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.6922, "mean_token_accuracy": 0.03506205677986145, "num_tokens": 114428.0, "step": 40 }, { "entropy": 10.581777667999267, "epoch": 0.0014112334180073384, "grad_norm": 2.3125, "learning_rate": 2.2e-05, "loss": 9.706, "mean_token_accuracy": 0.03386611118912697, "num_tokens": 130472.0, "step": 45 }, { "entropy": 10.577643585205077, "epoch": 0.001568037131119265, "grad_norm": 2.40625, "learning_rate": 2.4500000000000003e-05, "loss": 9.6852, "mean_token_accuracy": 0.030213401652872562, "num_tokens": 144077.0, "step": 50 }, { "entropy": 10.59252758026123, "epoch": 0.0017248408442311913, "grad_norm": 2.15625, "learning_rate": 2.7e-05, "loss": 9.6373, "mean_token_accuracy": 0.03242910895496607, "num_tokens": 158941.0, "step": 55 }, { "entropy": 10.579074954986572, "epoch": 0.0018816445573431179, "grad_norm": 2.140625, "learning_rate": 2.95e-05, "loss": 9.563, "mean_token_accuracy": 0.02959225047379732, "num_tokens": 174362.0, "step": 60 }, { "entropy": 10.570305156707764, "epoch": 0.002038448270455044, "grad_norm": 2.09375, "learning_rate": 3.2e-05, "loss": 9.4485, "mean_token_accuracy": 0.033058703131973746, "num_tokens": 190929.0, "step": 65 }, { "entropy": 10.55489387512207, "epoch": 0.002195251983566971, "grad_norm": 2.015625, "learning_rate": 3.4500000000000005e-05, "loss": 9.3387, "mean_token_accuracy": 0.033958965167403224, "num_tokens": 203660.0, "step": 70 }, { "entropy": 10.530017757415772, "epoch": 0.0023520556966788973, "grad_norm": 2.0625, "learning_rate": 3.7e-05, "loss": 9.2826, "mean_token_accuracy": 0.027879416570067407, "num_tokens": 218421.0, "step": 75 }, { "entropy": 10.534087371826171, "epoch": 0.0025088594097908237, "grad_norm": 2.09375, "learning_rate": 3.95e-05, "loss": 9.1439, "mean_token_accuracy": 0.03472804371267557, "num_tokens": 233734.0, "step": 80 }, { "entropy": 10.496679878234863, "epoch": 0.0026656631229027505, "grad_norm": 1.9765625, "learning_rate": 4.2000000000000004e-05, "loss": 9.0182, "mean_token_accuracy": 0.02818337455391884, "num_tokens": 247105.0, "step": 85 }, { "entropy": 10.467080688476562, "epoch": 0.002822466836014677, "grad_norm": 1.9140625, "learning_rate": 4.45e-05, "loss": 8.928, "mean_token_accuracy": 0.03165087569504976, "num_tokens": 262487.0, "step": 90 }, { "entropy": 10.403542804718018, "epoch": 0.002979270549126603, "grad_norm": 1.9921875, "learning_rate": 4.7000000000000004e-05, "loss": 8.7777, "mean_token_accuracy": 0.036813986487686634, "num_tokens": 276705.0, "step": 95 }, { "entropy": 10.354411220550537, "epoch": 0.00313607426223853, "grad_norm": 1.9765625, "learning_rate": 4.9500000000000004e-05, "loss": 8.6775, "mean_token_accuracy": 0.04005452003329992, "num_tokens": 291031.0, "step": 100 }, { "entropy": 10.269740104675293, "epoch": 0.0032928779753504563, "grad_norm": 1.890625, "learning_rate": 5.2e-05, "loss": 8.5069, "mean_token_accuracy": 0.040437552519142626, "num_tokens": 305444.0, "step": 105 }, { "entropy": 10.179180717468261, "epoch": 0.0034496816884623826, "grad_norm": 1.8671875, "learning_rate": 5.45e-05, "loss": 8.3811, "mean_token_accuracy": 0.04589438661932945, "num_tokens": 321168.0, "step": 110 }, { "entropy": 10.070209217071532, "epoch": 0.0036064854015743094, "grad_norm": 1.7265625, "learning_rate": 5.7e-05, "loss": 8.1795, "mean_token_accuracy": 0.05213871449232101, "num_tokens": 334988.0, "step": 115 }, { "entropy": 9.922878646850586, "epoch": 0.0037632891146862357, "grad_norm": 1.6796875, "learning_rate": 5.9499999999999996e-05, "loss": 8.0559, "mean_token_accuracy": 0.05347799621522427, "num_tokens": 349049.0, "step": 120 }, { "entropy": 9.7627742767334, "epoch": 0.0039200928277981625, "grad_norm": 1.765625, "learning_rate": 6.2e-05, "loss": 8.0302, "mean_token_accuracy": 0.05416244864463806, "num_tokens": 365497.0, "step": 125 }, { "entropy": 9.585789394378661, "epoch": 0.004076896540910088, "grad_norm": 1.5, "learning_rate": 6.450000000000001e-05, "loss": 7.8073, "mean_token_accuracy": 0.05755908451974392, "num_tokens": 380324.0, "step": 130 }, { "entropy": 9.368918418884277, "epoch": 0.004233700254022015, "grad_norm": 1.59375, "learning_rate": 6.7e-05, "loss": 7.6844, "mean_token_accuracy": 0.06051859185099602, "num_tokens": 393766.0, "step": 135 }, { "entropy": 9.158668899536133, "epoch": 0.004390503967133942, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.6272, "mean_token_accuracy": 0.06358711272478104, "num_tokens": 409369.0, "step": 140 }, { "entropy": 8.945510005950927, "epoch": 0.004547307680245868, "grad_norm": 1.546875, "learning_rate": 7.2e-05, "loss": 7.5019, "mean_token_accuracy": 0.06252376027405263, "num_tokens": 425475.0, "step": 145 }, { "entropy": 8.711659908294678, "epoch": 0.004704111393357795, "grad_norm": 1.59375, "learning_rate": 7.45e-05, "loss": 7.3832, "mean_token_accuracy": 0.06495344713330269, "num_tokens": 440853.0, "step": 150 }, { "entropy": 8.498833179473877, "epoch": 0.0048609151064697214, "grad_norm": 1.609375, "learning_rate": 7.7e-05, "loss": 7.3471, "mean_token_accuracy": 0.06971911787986755, "num_tokens": 457407.0, "step": 155 }, { "entropy": 8.355002212524415, "epoch": 0.005017718819581647, "grad_norm": 1.09375, "learning_rate": 7.950000000000001e-05, "loss": 7.2971, "mean_token_accuracy": 0.06931432262063027, "num_tokens": 472813.0, "step": 160 }, { "entropy": 8.208080291748047, "epoch": 0.005174522532693574, "grad_norm": 1.5, "learning_rate": 8.2e-05, "loss": 7.3059, "mean_token_accuracy": 0.06723905019462109, "num_tokens": 489742.0, "step": 165 }, { "entropy": 8.143133544921875, "epoch": 0.005331326245805501, "grad_norm": 1.4375, "learning_rate": 8.450000000000001e-05, "loss": 7.2399, "mean_token_accuracy": 0.06843472644686699, "num_tokens": 503493.0, "step": 170 }, { "entropy": 8.036779308319092, "epoch": 0.005488129958917427, "grad_norm": 1.1796875, "learning_rate": 8.7e-05, "loss": 7.1275, "mean_token_accuracy": 0.07654446959495545, "num_tokens": 520143.0, "step": 175 }, { "entropy": 7.934807920455933, "epoch": 0.005644933672029354, "grad_norm": 1.3203125, "learning_rate": 8.95e-05, "loss": 7.232, "mean_token_accuracy": 0.06283588744699956, "num_tokens": 534776.0, "step": 180 }, { "entropy": 7.953633880615234, "epoch": 0.00580173738514128, "grad_norm": 1.3359375, "learning_rate": 9.2e-05, "loss": 7.2097, "mean_token_accuracy": 0.06803618557751179, "num_tokens": 550256.0, "step": 185 }, { "entropy": 7.894899654388428, "epoch": 0.005958541098253206, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.2178, "mean_token_accuracy": 0.0686919379979372, "num_tokens": 564797.0, "step": 190 }, { "entropy": 7.844494724273682, "epoch": 0.006115344811365133, "grad_norm": 1.1953125, "learning_rate": 9.7e-05, "loss": 6.9952, "mean_token_accuracy": 0.0732124924659729, "num_tokens": 579721.0, "step": 195 }, { "entropy": 7.716418170928955, "epoch": 0.00627214852447706, "grad_norm": 1.359375, "learning_rate": 9.95e-05, "loss": 6.9564, "mean_token_accuracy": 0.07807120829820632, "num_tokens": 593431.0, "step": 200 }, { "entropy": 7.715715551376343, "epoch": 0.006428952237588986, "grad_norm": 1.6796875, "learning_rate": 0.000102, "loss": 6.9708, "mean_token_accuracy": 0.07868832051753998, "num_tokens": 608176.0, "step": 205 }, { "entropy": 7.692095470428467, "epoch": 0.0065857559507009125, "grad_norm": 1.40625, "learning_rate": 0.00010449999999999999, "loss": 6.9833, "mean_token_accuracy": 0.07725078389048576, "num_tokens": 621784.0, "step": 210 }, { "entropy": 7.700586032867432, "epoch": 0.006742559663812839, "grad_norm": 1.421875, "learning_rate": 0.000107, "loss": 6.9716, "mean_token_accuracy": 0.07797399312257766, "num_tokens": 634707.0, "step": 215 }, { "entropy": 7.623541641235351, "epoch": 0.006899363376924765, "grad_norm": 1.359375, "learning_rate": 0.0001095, "loss": 7.0494, "mean_token_accuracy": 0.0720802016556263, "num_tokens": 647835.0, "step": 220 }, { "entropy": 7.631550598144531, "epoch": 0.007056167090036692, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 6.9591, "mean_token_accuracy": 0.07618656158447265, "num_tokens": 662587.0, "step": 225 }, { "entropy": 7.684398460388183, "epoch": 0.007212970803148619, "grad_norm": 1.3828125, "learning_rate": 0.0001145, "loss": 7.0602, "mean_token_accuracy": 0.07651265673339366, "num_tokens": 676329.0, "step": 230 }, { "entropy": 7.561251878738403, "epoch": 0.007369774516260545, "grad_norm": 1.3203125, "learning_rate": 0.00011700000000000001, "loss": 6.953, "mean_token_accuracy": 0.08274711072444915, "num_tokens": 692541.0, "step": 235 }, { "entropy": 7.560929489135742, "epoch": 0.0075265782293724715, "grad_norm": 1.1953125, "learning_rate": 0.00011949999999999999, "loss": 7.0198, "mean_token_accuracy": 0.07723658978939056, "num_tokens": 706997.0, "step": 240 }, { "entropy": 7.557625770568848, "epoch": 0.007683381942484398, "grad_norm": 1.3359375, "learning_rate": 0.000122, "loss": 6.9217, "mean_token_accuracy": 0.08156572207808495, "num_tokens": 720719.0, "step": 245 }, { "entropy": 7.592370510101318, "epoch": 0.007840185655596325, "grad_norm": 1.40625, "learning_rate": 0.0001245, "loss": 7.0018, "mean_token_accuracy": 0.08049147836863994, "num_tokens": 734572.0, "step": 250 }, { "entropy": 7.522368669509888, "epoch": 0.007996989368708251, "grad_norm": 1.2734375, "learning_rate": 0.000127, "loss": 6.8688, "mean_token_accuracy": 0.08029020316898823, "num_tokens": 751365.0, "step": 255 }, { "entropy": 7.458198308944702, "epoch": 0.008153793081820177, "grad_norm": 1.375, "learning_rate": 0.0001295, "loss": 6.8057, "mean_token_accuracy": 0.08540241345763207, "num_tokens": 765549.0, "step": 260 }, { "entropy": 7.365204620361328, "epoch": 0.008310596794932104, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 6.7974, "mean_token_accuracy": 0.0849799670279026, "num_tokens": 780071.0, "step": 265 }, { "entropy": 7.453489208221436, "epoch": 0.00846740050804403, "grad_norm": 1.3125, "learning_rate": 0.00013450000000000002, "loss": 6.8488, "mean_token_accuracy": 0.08373216427862644, "num_tokens": 795328.0, "step": 270 }, { "entropy": 7.333805704116822, "epoch": 0.008624204221155956, "grad_norm": 1.2890625, "learning_rate": 0.00013700000000000002, "loss": 6.759, "mean_token_accuracy": 0.09399082660675048, "num_tokens": 808404.0, "step": 275 }, { "entropy": 7.400871515274048, "epoch": 0.008781007934267884, "grad_norm": 1.4296875, "learning_rate": 0.0001395, "loss": 6.857, "mean_token_accuracy": 0.08847371190786361, "num_tokens": 823204.0, "step": 280 }, { "entropy": 7.292252063751221, "epoch": 0.00893781164737981, "grad_norm": 1.5, "learning_rate": 0.00014199999999999998, "loss": 6.7636, "mean_token_accuracy": 0.08776607438921928, "num_tokens": 836276.0, "step": 285 }, { "entropy": 7.366798543930054, "epoch": 0.009094615360491736, "grad_norm": 1.4296875, "learning_rate": 0.0001445, "loss": 6.7562, "mean_token_accuracy": 0.09157689064741134, "num_tokens": 850090.0, "step": 290 }, { "entropy": 7.297074222564698, "epoch": 0.009251419073603663, "grad_norm": 1.2890625, "learning_rate": 0.000147, "loss": 6.7845, "mean_token_accuracy": 0.08689201548695565, "num_tokens": 865931.0, "step": 295 }, { "entropy": 7.316424083709717, "epoch": 0.00940822278671559, "grad_norm": 1.390625, "learning_rate": 0.0001495, "loss": 6.7825, "mean_token_accuracy": 0.08415777459740639, "num_tokens": 879960.0, "step": 300 }, { "entropy": 7.245685482025147, "epoch": 0.009565026499827515, "grad_norm": 1.125, "learning_rate": 0.000152, "loss": 6.7297, "mean_token_accuracy": 0.08968461528420449, "num_tokens": 894711.0, "step": 305 }, { "entropy": 7.20286979675293, "epoch": 0.009721830212939443, "grad_norm": 1.28125, "learning_rate": 0.00015450000000000001, "loss": 6.6488, "mean_token_accuracy": 0.08769082948565483, "num_tokens": 911461.0, "step": 310 }, { "entropy": 7.2604657173156735, "epoch": 0.009878633926051369, "grad_norm": 1.515625, "learning_rate": 0.000157, "loss": 6.8178, "mean_token_accuracy": 0.08734595999121667, "num_tokens": 926618.0, "step": 315 }, { "entropy": 7.233215236663819, "epoch": 0.010035437639163295, "grad_norm": 1.3515625, "learning_rate": 0.0001595, "loss": 6.7365, "mean_token_accuracy": 0.09149369075894356, "num_tokens": 942310.0, "step": 320 }, { "entropy": 7.098740816116333, "epoch": 0.010192241352275222, "grad_norm": 1.1953125, "learning_rate": 0.000162, "loss": 6.638, "mean_token_accuracy": 0.09136478006839752, "num_tokens": 958180.0, "step": 325 }, { "entropy": 7.278954648971558, "epoch": 0.010349045065387148, "grad_norm": 1.2265625, "learning_rate": 0.00016450000000000001, "loss": 6.7407, "mean_token_accuracy": 0.08464238122105598, "num_tokens": 973484.0, "step": 330 }, { "entropy": 7.1389687061309814, "epoch": 0.010505848778499074, "grad_norm": 1.1328125, "learning_rate": 0.00016700000000000002, "loss": 6.5988, "mean_token_accuracy": 0.09544083774089814, "num_tokens": 988712.0, "step": 335 }, { "entropy": 7.1739630699157715, "epoch": 0.010662652491611002, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.6637, "mean_token_accuracy": 0.0873688019812107, "num_tokens": 1005316.0, "step": 340 }, { "entropy": 7.009389734268188, "epoch": 0.010819456204722928, "grad_norm": 1.2734375, "learning_rate": 0.00017199999999999998, "loss": 6.5965, "mean_token_accuracy": 0.09233827069401741, "num_tokens": 1020624.0, "step": 345 }, { "entropy": 7.205262613296509, "epoch": 0.010976259917834854, "grad_norm": 1.3828125, "learning_rate": 0.00017449999999999999, "loss": 6.6497, "mean_token_accuracy": 0.09442537128925324, "num_tokens": 1035346.0, "step": 350 }, { "entropy": 7.131465578079224, "epoch": 0.011133063630946781, "grad_norm": 1.5, "learning_rate": 0.000177, "loss": 6.6518, "mean_token_accuracy": 0.08939319550991058, "num_tokens": 1052396.0, "step": 355 }, { "entropy": 7.066566705703735, "epoch": 0.011289867344058707, "grad_norm": 1.21875, "learning_rate": 0.0001795, "loss": 6.6706, "mean_token_accuracy": 0.08813088536262512, "num_tokens": 1068158.0, "step": 360 }, { "entropy": 7.096987533569336, "epoch": 0.011446671057170633, "grad_norm": 1.21875, "learning_rate": 0.000182, "loss": 6.532, "mean_token_accuracy": 0.10468010231852531, "num_tokens": 1081891.0, "step": 365 }, { "entropy": 6.936192178726197, "epoch": 0.01160347477028256, "grad_norm": 1.390625, "learning_rate": 0.0001845, "loss": 6.4988, "mean_token_accuracy": 0.10371973067522049, "num_tokens": 1094953.0, "step": 370 }, { "entropy": 6.988458728790283, "epoch": 0.011760278483394487, "grad_norm": 1.375, "learning_rate": 0.000187, "loss": 6.4762, "mean_token_accuracy": 0.09902411252260208, "num_tokens": 1109923.0, "step": 375 }, { "entropy": 7.017359066009521, "epoch": 0.011917082196506413, "grad_norm": 1.265625, "learning_rate": 0.0001895, "loss": 6.5871, "mean_token_accuracy": 0.09580302238464355, "num_tokens": 1126987.0, "step": 380 }, { "entropy": 6.971819591522217, "epoch": 0.01207388590961834, "grad_norm": 1.3671875, "learning_rate": 0.000192, "loss": 6.5812, "mean_token_accuracy": 0.09617941230535507, "num_tokens": 1139931.0, "step": 385 }, { "entropy": 6.953200578689575, "epoch": 0.012230689622730266, "grad_norm": 1.3203125, "learning_rate": 0.0001945, "loss": 6.4646, "mean_token_accuracy": 0.10358070284128189, "num_tokens": 1155721.0, "step": 390 }, { "entropy": 6.9849913120269775, "epoch": 0.012387493335842192, "grad_norm": 1.1484375, "learning_rate": 0.00019700000000000002, "loss": 6.5469, "mean_token_accuracy": 0.10082540512084961, "num_tokens": 1171655.0, "step": 395 }, { "entropy": 6.938650178909302, "epoch": 0.01254429704895412, "grad_norm": 1.171875, "learning_rate": 0.00019950000000000002, "loss": 6.5281, "mean_token_accuracy": 0.10091597810387612, "num_tokens": 1186666.0, "step": 400 }, { "entropy": 6.9116593360900875, "epoch": 0.012701100762066046, "grad_norm": 1.46875, "learning_rate": 0.000202, "loss": 6.4346, "mean_token_accuracy": 0.09778324812650681, "num_tokens": 1198283.0, "step": 405 }, { "entropy": 6.876869249343872, "epoch": 0.012857904475177971, "grad_norm": 1.2734375, "learning_rate": 0.00020449999999999998, "loss": 6.4735, "mean_token_accuracy": 0.09719930961728096, "num_tokens": 1212613.0, "step": 410 }, { "entropy": 6.932867479324341, "epoch": 0.013014708188289899, "grad_norm": 1.6171875, "learning_rate": 0.000207, "loss": 6.4643, "mean_token_accuracy": 0.10083647891879081, "num_tokens": 1227515.0, "step": 415 }, { "entropy": 6.873914337158203, "epoch": 0.013171511901401825, "grad_norm": 1.40625, "learning_rate": 0.0002095, "loss": 6.4762, "mean_token_accuracy": 0.1099552720785141, "num_tokens": 1239022.0, "step": 420 }, { "entropy": 6.844020032882691, "epoch": 0.013328315614513751, "grad_norm": 1.1875, "learning_rate": 0.000212, "loss": 6.4853, "mean_token_accuracy": 0.09865991845726967, "num_tokens": 1254653.0, "step": 425 }, { "entropy": 6.919657754898071, "epoch": 0.013485119327625679, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.4894, "mean_token_accuracy": 0.09527975097298622, "num_tokens": 1270766.0, "step": 430 }, { "entropy": 6.905207824707031, "epoch": 0.013641923040737605, "grad_norm": 1.25, "learning_rate": 0.00021700000000000002, "loss": 6.4774, "mean_token_accuracy": 0.10371477827429772, "num_tokens": 1284742.0, "step": 435 }, { "entropy": 6.912538671493531, "epoch": 0.01379872675384953, "grad_norm": 1.234375, "learning_rate": 0.0002195, "loss": 6.4678, "mean_token_accuracy": 0.10031345337629319, "num_tokens": 1297881.0, "step": 440 }, { "entropy": 6.800807285308838, "epoch": 0.013955530466961458, "grad_norm": 1.09375, "learning_rate": 0.000222, "loss": 6.4071, "mean_token_accuracy": 0.10895167514681817, "num_tokens": 1314727.0, "step": 445 }, { "entropy": 6.85034818649292, "epoch": 0.014112334180073384, "grad_norm": 1.2421875, "learning_rate": 0.0002245, "loss": 6.4329, "mean_token_accuracy": 0.10191441029310226, "num_tokens": 1332630.0, "step": 450 }, { "entropy": 6.820253705978393, "epoch": 0.01426913789318531, "grad_norm": 1.1015625, "learning_rate": 0.00022700000000000002, "loss": 6.5253, "mean_token_accuracy": 0.09508129432797433, "num_tokens": 1348028.0, "step": 455 }, { "entropy": 6.8252214908599855, "epoch": 0.014425941606297238, "grad_norm": 1.2265625, "learning_rate": 0.00022950000000000002, "loss": 6.3729, "mean_token_accuracy": 0.10276357978582382, "num_tokens": 1363723.0, "step": 460 }, { "entropy": 6.869743585586548, "epoch": 0.014582745319409163, "grad_norm": 1.625, "learning_rate": 0.00023200000000000003, "loss": 6.4717, "mean_token_accuracy": 0.10454175770282745, "num_tokens": 1378400.0, "step": 465 }, { "entropy": 6.816213941574096, "epoch": 0.01473954903252109, "grad_norm": 1.21875, "learning_rate": 0.00023449999999999998, "loss": 6.3712, "mean_token_accuracy": 0.10962107256054879, "num_tokens": 1393383.0, "step": 470 }, { "entropy": 6.703394031524658, "epoch": 0.014896352745633017, "grad_norm": 1.3515625, "learning_rate": 0.000237, "loss": 6.3905, "mean_token_accuracy": 0.10753661692142487, "num_tokens": 1409609.0, "step": 475 }, { "entropy": 6.746933174133301, "epoch": 0.015053156458744943, "grad_norm": 1.28125, "learning_rate": 0.0002395, "loss": 6.3711, "mean_token_accuracy": 0.109779604524374, "num_tokens": 1423378.0, "step": 480 }, { "entropy": 6.657280206680298, "epoch": 0.015209960171856869, "grad_norm": 1.28125, "learning_rate": 0.000242, "loss": 6.3545, "mean_token_accuracy": 0.10648095905780793, "num_tokens": 1437722.0, "step": 485 }, { "entropy": 6.752739667892456, "epoch": 0.015366763884968796, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 6.4004, "mean_token_accuracy": 0.10294785127043724, "num_tokens": 1452969.0, "step": 490 }, { "entropy": 6.7490668296813965, "epoch": 0.015523567598080722, "grad_norm": 1.3515625, "learning_rate": 0.000247, "loss": 6.406, "mean_token_accuracy": 0.10591119825839997, "num_tokens": 1466014.0, "step": 495 }, { "entropy": 6.7571159362792965, "epoch": 0.01568037131119265, "grad_norm": 1.3671875, "learning_rate": 0.0002495, "loss": 6.4293, "mean_token_accuracy": 0.1040202483534813, "num_tokens": 1482087.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2615647555584000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }