{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.07840185655596324, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.651023864746094, "epoch": 0.00015680371311192648, "grad_norm": 11.5625, "learning_rate": 2e-06, "loss": 10.8028, "mean_token_accuracy": 6.958942394703626e-05, "num_tokens": 14082.0, "step": 5 }, { "entropy": 10.651004600524903, "epoch": 0.00031360742622385296, "grad_norm": 11.375, "learning_rate": 4.5e-06, "loss": 10.7633, "mean_token_accuracy": 6.574622238986194e-05, "num_tokens": 29900.0, "step": 10 }, { "entropy": 10.650343418121338, "epoch": 0.00047041113933577947, "grad_norm": 8.4375, "learning_rate": 7e-06, "loss": 10.5185, "mean_token_accuracy": 0.01316747289383784, "num_tokens": 43394.0, "step": 15 }, { "entropy": 10.64456491470337, "epoch": 0.0006272148524477059, "grad_norm": 5.34375, "learning_rate": 9.5e-06, "loss": 10.2603, "mean_token_accuracy": 0.03233455698937178, "num_tokens": 58563.0, "step": 20 }, { "entropy": 10.616307353973388, "epoch": 0.0007840185655596325, "grad_norm": 3.609375, "learning_rate": 1.2e-05, "loss": 9.9833, "mean_token_accuracy": 0.034109539538621905, "num_tokens": 73923.0, "step": 25 }, { "entropy": 10.588720226287842, "epoch": 0.0009408222786715589, "grad_norm": 2.984375, "learning_rate": 1.4500000000000002e-05, "loss": 9.8466, "mean_token_accuracy": 0.03426761133596301, "num_tokens": 87652.0, "step": 30 }, { "entropy": 10.595056247711181, "epoch": 0.0010976259917834855, "grad_norm": 2.671875, "learning_rate": 1.7000000000000003e-05, "loss": 9.7741, "mean_token_accuracy": 0.031784738413989544, "num_tokens": 101369.0, "step": 35 }, { "entropy": 10.59932107925415, "epoch": 0.0012544297048954118, "grad_norm": 2.515625, "learning_rate": 1.95e-05, "loss": 9.6922, "mean_token_accuracy": 0.03506205677986145, "num_tokens": 114428.0, "step": 40 }, { "entropy": 10.581777667999267, "epoch": 0.0014112334180073384, "grad_norm": 2.3125, "learning_rate": 2.2e-05, "loss": 9.706, "mean_token_accuracy": 0.03386611118912697, "num_tokens": 130472.0, "step": 45 }, { "entropy": 10.577643585205077, "epoch": 0.001568037131119265, "grad_norm": 2.40625, "learning_rate": 2.4500000000000003e-05, "loss": 9.6852, "mean_token_accuracy": 0.030213401652872562, "num_tokens": 144077.0, "step": 50 }, { "entropy": 10.59252758026123, "epoch": 0.0017248408442311913, "grad_norm": 2.15625, "learning_rate": 2.7e-05, "loss": 9.6373, "mean_token_accuracy": 0.03242910895496607, "num_tokens": 158941.0, "step": 55 }, { "entropy": 10.579074954986572, "epoch": 0.0018816445573431179, "grad_norm": 2.140625, "learning_rate": 2.95e-05, "loss": 9.563, "mean_token_accuracy": 0.02959225047379732, "num_tokens": 174362.0, "step": 60 }, { "entropy": 10.570305156707764, "epoch": 0.002038448270455044, "grad_norm": 2.09375, "learning_rate": 3.2e-05, "loss": 9.4485, "mean_token_accuracy": 0.033058703131973746, "num_tokens": 190929.0, "step": 65 }, { "entropy": 10.55489387512207, "epoch": 0.002195251983566971, "grad_norm": 2.015625, "learning_rate": 3.4500000000000005e-05, "loss": 9.3387, "mean_token_accuracy": 0.033958965167403224, "num_tokens": 203660.0, "step": 70 }, { "entropy": 10.530017757415772, "epoch": 0.0023520556966788973, "grad_norm": 2.0625, "learning_rate": 3.7e-05, "loss": 9.2826, "mean_token_accuracy": 0.027879416570067407, "num_tokens": 218421.0, "step": 75 }, { "entropy": 10.534087371826171, "epoch": 0.0025088594097908237, "grad_norm": 2.09375, "learning_rate": 3.95e-05, "loss": 9.1439, "mean_token_accuracy": 0.03472804371267557, "num_tokens": 233734.0, "step": 80 }, { "entropy": 10.496679878234863, "epoch": 0.0026656631229027505, "grad_norm": 1.9765625, "learning_rate": 4.2000000000000004e-05, "loss": 9.0182, "mean_token_accuracy": 0.02818337455391884, "num_tokens": 247105.0, "step": 85 }, { "entropy": 10.467080688476562, "epoch": 0.002822466836014677, "grad_norm": 1.9140625, "learning_rate": 4.45e-05, "loss": 8.928, "mean_token_accuracy": 0.03165087569504976, "num_tokens": 262487.0, "step": 90 }, { "entropy": 10.403542804718018, "epoch": 0.002979270549126603, "grad_norm": 1.9921875, "learning_rate": 4.7000000000000004e-05, "loss": 8.7777, "mean_token_accuracy": 0.036813986487686634, "num_tokens": 276705.0, "step": 95 }, { "entropy": 10.354411220550537, "epoch": 0.00313607426223853, "grad_norm": 1.9765625, "learning_rate": 4.9500000000000004e-05, "loss": 8.6775, "mean_token_accuracy": 0.04005452003329992, "num_tokens": 291031.0, "step": 100 }, { "entropy": 10.269740104675293, "epoch": 0.0032928779753504563, "grad_norm": 1.890625, "learning_rate": 5.2e-05, "loss": 8.5069, "mean_token_accuracy": 0.040437552519142626, "num_tokens": 305444.0, "step": 105 }, { "entropy": 10.179180717468261, "epoch": 0.0034496816884623826, "grad_norm": 1.8671875, "learning_rate": 5.45e-05, "loss": 8.3811, "mean_token_accuracy": 0.04589438661932945, "num_tokens": 321168.0, "step": 110 }, { "entropy": 10.070209217071532, "epoch": 0.0036064854015743094, "grad_norm": 1.7265625, "learning_rate": 5.7e-05, "loss": 8.1795, "mean_token_accuracy": 0.05213871449232101, "num_tokens": 334988.0, "step": 115 }, { "entropy": 9.922878646850586, "epoch": 0.0037632891146862357, "grad_norm": 1.6796875, "learning_rate": 5.9499999999999996e-05, "loss": 8.0559, "mean_token_accuracy": 0.05347799621522427, "num_tokens": 349049.0, "step": 120 }, { "entropy": 9.7627742767334, "epoch": 0.0039200928277981625, "grad_norm": 1.765625, "learning_rate": 6.2e-05, "loss": 8.0302, "mean_token_accuracy": 0.05416244864463806, "num_tokens": 365497.0, "step": 125 }, { "entropy": 9.585789394378661, "epoch": 0.004076896540910088, "grad_norm": 1.5, "learning_rate": 6.450000000000001e-05, "loss": 7.8073, "mean_token_accuracy": 0.05755908451974392, "num_tokens": 380324.0, "step": 130 }, { "entropy": 9.368918418884277, "epoch": 0.004233700254022015, "grad_norm": 1.59375, "learning_rate": 6.7e-05, "loss": 7.6844, "mean_token_accuracy": 0.06051859185099602, "num_tokens": 393766.0, "step": 135 }, { "entropy": 9.158668899536133, "epoch": 0.004390503967133942, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.6272, "mean_token_accuracy": 0.06358711272478104, "num_tokens": 409369.0, "step": 140 }, { "entropy": 8.945510005950927, "epoch": 0.004547307680245868, "grad_norm": 1.546875, "learning_rate": 7.2e-05, "loss": 7.5019, "mean_token_accuracy": 0.06252376027405263, "num_tokens": 425475.0, "step": 145 }, { "entropy": 8.711659908294678, "epoch": 0.004704111393357795, "grad_norm": 1.59375, "learning_rate": 7.45e-05, "loss": 7.3832, "mean_token_accuracy": 0.06495344713330269, "num_tokens": 440853.0, "step": 150 }, { "entropy": 8.498833179473877, "epoch": 0.0048609151064697214, "grad_norm": 1.609375, "learning_rate": 7.7e-05, "loss": 7.3471, "mean_token_accuracy": 0.06971911787986755, "num_tokens": 457407.0, "step": 155 }, { "entropy": 8.355002212524415, "epoch": 0.005017718819581647, "grad_norm": 1.09375, "learning_rate": 7.950000000000001e-05, "loss": 7.2971, "mean_token_accuracy": 0.06931432262063027, "num_tokens": 472813.0, "step": 160 }, { "entropy": 8.208080291748047, "epoch": 0.005174522532693574, "grad_norm": 1.5, "learning_rate": 8.2e-05, "loss": 7.3059, "mean_token_accuracy": 0.06723905019462109, "num_tokens": 489742.0, "step": 165 }, { "entropy": 8.143133544921875, "epoch": 0.005331326245805501, "grad_norm": 1.4375, "learning_rate": 8.450000000000001e-05, "loss": 7.2399, "mean_token_accuracy": 0.06843472644686699, "num_tokens": 503493.0, "step": 170 }, { "entropy": 8.036779308319092, "epoch": 0.005488129958917427, "grad_norm": 1.1796875, "learning_rate": 8.7e-05, "loss": 7.1275, "mean_token_accuracy": 0.07654446959495545, "num_tokens": 520143.0, "step": 175 }, { "entropy": 7.934807920455933, "epoch": 0.005644933672029354, "grad_norm": 1.3203125, "learning_rate": 8.95e-05, "loss": 7.232, "mean_token_accuracy": 0.06283588744699956, "num_tokens": 534776.0, "step": 180 }, { "entropy": 7.953633880615234, "epoch": 0.00580173738514128, "grad_norm": 1.3359375, "learning_rate": 9.2e-05, "loss": 7.2097, "mean_token_accuracy": 0.06803618557751179, "num_tokens": 550256.0, "step": 185 }, { "entropy": 7.894899654388428, "epoch": 0.005958541098253206, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.2178, "mean_token_accuracy": 0.0686919379979372, "num_tokens": 564797.0, "step": 190 }, { "entropy": 7.844494724273682, "epoch": 0.006115344811365133, "grad_norm": 1.1953125, "learning_rate": 9.7e-05, "loss": 6.9952, "mean_token_accuracy": 0.0732124924659729, "num_tokens": 579721.0, "step": 195 }, { "entropy": 7.716418170928955, "epoch": 0.00627214852447706, "grad_norm": 1.359375, "learning_rate": 9.95e-05, "loss": 6.9564, "mean_token_accuracy": 0.07807120829820632, "num_tokens": 593431.0, "step": 200 }, { "entropy": 7.715715551376343, "epoch": 0.006428952237588986, "grad_norm": 1.6796875, "learning_rate": 0.000102, "loss": 6.9708, "mean_token_accuracy": 0.07868832051753998, "num_tokens": 608176.0, "step": 205 }, { "entropy": 7.692095470428467, "epoch": 0.0065857559507009125, "grad_norm": 1.40625, "learning_rate": 0.00010449999999999999, "loss": 6.9833, "mean_token_accuracy": 0.07725078389048576, "num_tokens": 621784.0, "step": 210 }, { "entropy": 7.700586032867432, "epoch": 0.006742559663812839, "grad_norm": 1.421875, "learning_rate": 0.000107, "loss": 6.9716, "mean_token_accuracy": 0.07797399312257766, "num_tokens": 634707.0, "step": 215 }, { "entropy": 7.623541641235351, "epoch": 0.006899363376924765, "grad_norm": 1.359375, "learning_rate": 0.0001095, "loss": 7.0494, "mean_token_accuracy": 0.0720802016556263, "num_tokens": 647835.0, "step": 220 }, { "entropy": 7.631550598144531, "epoch": 0.007056167090036692, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 6.9591, "mean_token_accuracy": 0.07618656158447265, "num_tokens": 662587.0, "step": 225 }, { "entropy": 7.684398460388183, "epoch": 0.007212970803148619, "grad_norm": 1.3828125, "learning_rate": 0.0001145, "loss": 7.0602, "mean_token_accuracy": 0.07651265673339366, "num_tokens": 676329.0, "step": 230 }, { "entropy": 7.561251878738403, "epoch": 0.007369774516260545, "grad_norm": 1.3203125, "learning_rate": 0.00011700000000000001, "loss": 6.953, "mean_token_accuracy": 0.08274711072444915, "num_tokens": 692541.0, "step": 235 }, { "entropy": 7.560929489135742, "epoch": 0.0075265782293724715, "grad_norm": 1.1953125, "learning_rate": 0.00011949999999999999, "loss": 7.0198, "mean_token_accuracy": 0.07723658978939056, "num_tokens": 706997.0, "step": 240 }, { "entropy": 7.557625770568848, "epoch": 0.007683381942484398, "grad_norm": 1.3359375, "learning_rate": 0.000122, "loss": 6.9217, "mean_token_accuracy": 0.08156572207808495, "num_tokens": 720719.0, "step": 245 }, { "entropy": 7.592370510101318, "epoch": 0.007840185655596325, "grad_norm": 1.40625, "learning_rate": 0.0001245, "loss": 7.0018, "mean_token_accuracy": 0.08049147836863994, "num_tokens": 734572.0, "step": 250 }, { "entropy": 7.522368669509888, "epoch": 0.007996989368708251, "grad_norm": 1.2734375, "learning_rate": 0.000127, "loss": 6.8688, "mean_token_accuracy": 0.08029020316898823, "num_tokens": 751365.0, "step": 255 }, { "entropy": 7.458198308944702, "epoch": 0.008153793081820177, "grad_norm": 1.375, "learning_rate": 0.0001295, "loss": 6.8057, "mean_token_accuracy": 0.08540241345763207, "num_tokens": 765549.0, "step": 260 }, { "entropy": 7.365204620361328, "epoch": 0.008310596794932104, "grad_norm": 1.1796875, "learning_rate": 0.000132, "loss": 6.7974, "mean_token_accuracy": 0.0849799670279026, "num_tokens": 780071.0, "step": 265 }, { "entropy": 7.453489208221436, "epoch": 0.00846740050804403, "grad_norm": 1.3125, "learning_rate": 0.00013450000000000002, "loss": 6.8488, "mean_token_accuracy": 0.08373216427862644, "num_tokens": 795328.0, "step": 270 }, { "entropy": 7.333805704116822, "epoch": 0.008624204221155956, "grad_norm": 1.2890625, "learning_rate": 0.00013700000000000002, "loss": 6.759, "mean_token_accuracy": 0.09399082660675048, "num_tokens": 808404.0, "step": 275 }, { "entropy": 7.400871515274048, "epoch": 0.008781007934267884, "grad_norm": 1.4296875, "learning_rate": 0.0001395, "loss": 6.857, "mean_token_accuracy": 0.08847371190786361, "num_tokens": 823204.0, "step": 280 }, { "entropy": 7.292252063751221, "epoch": 0.00893781164737981, "grad_norm": 1.5, "learning_rate": 0.00014199999999999998, "loss": 6.7636, "mean_token_accuracy": 0.08776607438921928, "num_tokens": 836276.0, "step": 285 }, { "entropy": 7.366798543930054, "epoch": 0.009094615360491736, "grad_norm": 1.4296875, "learning_rate": 0.0001445, "loss": 6.7562, "mean_token_accuracy": 0.09157689064741134, "num_tokens": 850090.0, "step": 290 }, { "entropy": 7.297074222564698, "epoch": 0.009251419073603663, "grad_norm": 1.2890625, "learning_rate": 0.000147, "loss": 6.7845, "mean_token_accuracy": 0.08689201548695565, "num_tokens": 865931.0, "step": 295 }, { "entropy": 7.316424083709717, "epoch": 0.00940822278671559, "grad_norm": 1.390625, "learning_rate": 0.0001495, "loss": 6.7825, "mean_token_accuracy": 0.08415777459740639, "num_tokens": 879960.0, "step": 300 }, { "entropy": 7.245685482025147, "epoch": 0.009565026499827515, "grad_norm": 1.125, "learning_rate": 0.000152, "loss": 6.7297, "mean_token_accuracy": 0.08968461528420449, "num_tokens": 894711.0, "step": 305 }, { "entropy": 7.20286979675293, "epoch": 0.009721830212939443, "grad_norm": 1.28125, "learning_rate": 0.00015450000000000001, "loss": 6.6488, "mean_token_accuracy": 0.08769082948565483, "num_tokens": 911461.0, "step": 310 }, { "entropy": 7.2604657173156735, "epoch": 0.009878633926051369, "grad_norm": 1.515625, "learning_rate": 0.000157, "loss": 6.8178, "mean_token_accuracy": 0.08734595999121667, "num_tokens": 926618.0, "step": 315 }, { "entropy": 7.233215236663819, "epoch": 0.010035437639163295, "grad_norm": 1.3515625, "learning_rate": 0.0001595, "loss": 6.7365, "mean_token_accuracy": 0.09149369075894356, "num_tokens": 942310.0, "step": 320 }, { "entropy": 7.098740816116333, "epoch": 0.010192241352275222, "grad_norm": 1.1953125, "learning_rate": 0.000162, "loss": 6.638, "mean_token_accuracy": 0.09136478006839752, "num_tokens": 958180.0, "step": 325 }, { "entropy": 7.278954648971558, "epoch": 0.010349045065387148, "grad_norm": 1.2265625, "learning_rate": 0.00016450000000000001, "loss": 6.7407, "mean_token_accuracy": 0.08464238122105598, "num_tokens": 973484.0, "step": 330 }, { "entropy": 7.1389687061309814, "epoch": 0.010505848778499074, "grad_norm": 1.1328125, "learning_rate": 0.00016700000000000002, "loss": 6.5988, "mean_token_accuracy": 0.09544083774089814, "num_tokens": 988712.0, "step": 335 }, { "entropy": 7.1739630699157715, "epoch": 0.010662652491611002, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.6637, "mean_token_accuracy": 0.0873688019812107, "num_tokens": 1005316.0, "step": 340 }, { "entropy": 7.009389734268188, "epoch": 0.010819456204722928, "grad_norm": 1.2734375, "learning_rate": 0.00017199999999999998, "loss": 6.5965, "mean_token_accuracy": 0.09233827069401741, "num_tokens": 1020624.0, "step": 345 }, { "entropy": 7.205262613296509, "epoch": 0.010976259917834854, "grad_norm": 1.3828125, "learning_rate": 0.00017449999999999999, "loss": 6.6497, "mean_token_accuracy": 0.09442537128925324, "num_tokens": 1035346.0, "step": 350 }, { "entropy": 7.131465578079224, "epoch": 0.011133063630946781, "grad_norm": 1.5, "learning_rate": 0.000177, "loss": 6.6518, "mean_token_accuracy": 0.08939319550991058, "num_tokens": 1052396.0, "step": 355 }, { "entropy": 7.066566705703735, "epoch": 0.011289867344058707, "grad_norm": 1.21875, "learning_rate": 0.0001795, "loss": 6.6706, "mean_token_accuracy": 0.08813088536262512, "num_tokens": 1068158.0, "step": 360 }, { "entropy": 7.096987533569336, "epoch": 0.011446671057170633, "grad_norm": 1.21875, "learning_rate": 0.000182, "loss": 6.532, "mean_token_accuracy": 0.10468010231852531, "num_tokens": 1081891.0, "step": 365 }, { "entropy": 6.936192178726197, "epoch": 0.01160347477028256, "grad_norm": 1.390625, "learning_rate": 0.0001845, "loss": 6.4988, "mean_token_accuracy": 0.10371973067522049, "num_tokens": 1094953.0, "step": 370 }, { "entropy": 6.988458728790283, "epoch": 0.011760278483394487, "grad_norm": 1.375, "learning_rate": 0.000187, "loss": 6.4762, "mean_token_accuracy": 0.09902411252260208, "num_tokens": 1109923.0, "step": 375 }, { "entropy": 7.017359066009521, "epoch": 0.011917082196506413, "grad_norm": 1.265625, "learning_rate": 0.0001895, "loss": 6.5871, "mean_token_accuracy": 0.09580302238464355, "num_tokens": 1126987.0, "step": 380 }, { "entropy": 6.971819591522217, "epoch": 0.01207388590961834, "grad_norm": 1.3671875, "learning_rate": 0.000192, "loss": 6.5812, "mean_token_accuracy": 0.09617941230535507, "num_tokens": 1139931.0, "step": 385 }, { "entropy": 6.953200578689575, "epoch": 0.012230689622730266, "grad_norm": 1.3203125, "learning_rate": 0.0001945, "loss": 6.4646, "mean_token_accuracy": 0.10358070284128189, "num_tokens": 1155721.0, "step": 390 }, { "entropy": 6.9849913120269775, "epoch": 0.012387493335842192, "grad_norm": 1.1484375, "learning_rate": 0.00019700000000000002, "loss": 6.5469, "mean_token_accuracy": 0.10082540512084961, "num_tokens": 1171655.0, "step": 395 }, { "entropy": 6.938650178909302, "epoch": 0.01254429704895412, "grad_norm": 1.171875, "learning_rate": 0.00019950000000000002, "loss": 6.5281, "mean_token_accuracy": 0.10091597810387612, "num_tokens": 1186666.0, "step": 400 }, { "entropy": 6.9116593360900875, "epoch": 0.012701100762066046, "grad_norm": 1.46875, "learning_rate": 0.000202, "loss": 6.4346, "mean_token_accuracy": 0.09778324812650681, "num_tokens": 1198283.0, "step": 405 }, { "entropy": 6.876869249343872, "epoch": 0.012857904475177971, "grad_norm": 1.2734375, "learning_rate": 0.00020449999999999998, "loss": 6.4735, "mean_token_accuracy": 0.09719930961728096, "num_tokens": 1212613.0, "step": 410 }, { "entropy": 6.932867479324341, "epoch": 0.013014708188289899, "grad_norm": 1.6171875, "learning_rate": 0.000207, "loss": 6.4643, "mean_token_accuracy": 0.10083647891879081, "num_tokens": 1227515.0, "step": 415 }, { "entropy": 6.873914337158203, "epoch": 0.013171511901401825, "grad_norm": 1.40625, "learning_rate": 0.0002095, "loss": 6.4762, "mean_token_accuracy": 0.1099552720785141, "num_tokens": 1239022.0, "step": 420 }, { "entropy": 6.844020032882691, "epoch": 0.013328315614513751, "grad_norm": 1.1875, "learning_rate": 0.000212, "loss": 6.4853, "mean_token_accuracy": 0.09865991845726967, "num_tokens": 1254653.0, "step": 425 }, { "entropy": 6.919657754898071, "epoch": 0.013485119327625679, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.4894, "mean_token_accuracy": 0.09527975097298622, "num_tokens": 1270766.0, "step": 430 }, { "entropy": 6.905207824707031, "epoch": 0.013641923040737605, "grad_norm": 1.25, "learning_rate": 0.00021700000000000002, "loss": 6.4774, "mean_token_accuracy": 0.10371477827429772, "num_tokens": 1284742.0, "step": 435 }, { "entropy": 6.912538671493531, "epoch": 0.01379872675384953, "grad_norm": 1.234375, "learning_rate": 0.0002195, "loss": 6.4678, "mean_token_accuracy": 0.10031345337629319, "num_tokens": 1297881.0, "step": 440 }, { "entropy": 6.800807285308838, "epoch": 0.013955530466961458, "grad_norm": 1.09375, "learning_rate": 0.000222, "loss": 6.4071, "mean_token_accuracy": 0.10895167514681817, "num_tokens": 1314727.0, "step": 445 }, { "entropy": 6.85034818649292, "epoch": 0.014112334180073384, "grad_norm": 1.2421875, "learning_rate": 0.0002245, "loss": 6.4329, "mean_token_accuracy": 0.10191441029310226, "num_tokens": 1332630.0, "step": 450 }, { "entropy": 6.820253705978393, "epoch": 0.01426913789318531, "grad_norm": 1.1015625, "learning_rate": 0.00022700000000000002, "loss": 6.5253, "mean_token_accuracy": 0.09508129432797433, "num_tokens": 1348028.0, "step": 455 }, { "entropy": 6.8252214908599855, "epoch": 0.014425941606297238, "grad_norm": 1.2265625, "learning_rate": 0.00022950000000000002, "loss": 6.3729, "mean_token_accuracy": 0.10276357978582382, "num_tokens": 1363723.0, "step": 460 }, { "entropy": 6.869743585586548, "epoch": 0.014582745319409163, "grad_norm": 1.625, "learning_rate": 0.00023200000000000003, "loss": 6.4717, "mean_token_accuracy": 0.10454175770282745, "num_tokens": 1378400.0, "step": 465 }, { "entropy": 6.816213941574096, "epoch": 0.01473954903252109, "grad_norm": 1.21875, "learning_rate": 0.00023449999999999998, "loss": 6.3712, "mean_token_accuracy": 0.10962107256054879, "num_tokens": 1393383.0, "step": 470 }, { "entropy": 6.703394031524658, "epoch": 0.014896352745633017, "grad_norm": 1.3515625, "learning_rate": 0.000237, "loss": 6.3905, "mean_token_accuracy": 0.10753661692142487, "num_tokens": 1409609.0, "step": 475 }, { "entropy": 6.746933174133301, "epoch": 0.015053156458744943, "grad_norm": 1.28125, "learning_rate": 0.0002395, "loss": 6.3711, "mean_token_accuracy": 0.109779604524374, "num_tokens": 1423378.0, "step": 480 }, { "entropy": 6.657280206680298, "epoch": 0.015209960171856869, "grad_norm": 1.28125, "learning_rate": 0.000242, "loss": 6.3545, "mean_token_accuracy": 0.10648095905780793, "num_tokens": 1437722.0, "step": 485 }, { "entropy": 6.752739667892456, "epoch": 0.015366763884968796, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 6.4004, "mean_token_accuracy": 0.10294785127043724, "num_tokens": 1452969.0, "step": 490 }, { "entropy": 6.7490668296813965, "epoch": 0.015523567598080722, "grad_norm": 1.3515625, "learning_rate": 0.000247, "loss": 6.406, "mean_token_accuracy": 0.10591119825839997, "num_tokens": 1466014.0, "step": 495 }, { "entropy": 6.7571159362792965, "epoch": 0.01568037131119265, "grad_norm": 1.3671875, "learning_rate": 0.0002495, "loss": 6.4293, "mean_token_accuracy": 0.1040202483534813, "num_tokens": 1482087.0, "step": 500 }, { "entropy": 6.598506212234497, "epoch": 0.015837175024304574, "grad_norm": 1.3125, "learning_rate": 0.000252, "loss": 6.2766, "mean_token_accuracy": 0.1113006167113781, "num_tokens": 1495241.0, "step": 505 }, { "entropy": 6.743651676177978, "epoch": 0.015993978737416502, "grad_norm": 1.3671875, "learning_rate": 0.0002545, "loss": 6.3714, "mean_token_accuracy": 0.1056169517338276, "num_tokens": 1509170.0, "step": 510 }, { "entropy": 6.695261478424072, "epoch": 0.01615078245052843, "grad_norm": 1.4453125, "learning_rate": 0.000257, "loss": 6.3142, "mean_token_accuracy": 0.11198153868317604, "num_tokens": 1522215.0, "step": 515 }, { "entropy": 6.772069597244263, "epoch": 0.016307586163640354, "grad_norm": 1.2578125, "learning_rate": 0.0002595, "loss": 6.3489, "mean_token_accuracy": 0.10926218628883362, "num_tokens": 1535315.0, "step": 520 }, { "entropy": 6.584142017364502, "epoch": 0.01646438987675228, "grad_norm": 1.0859375, "learning_rate": 0.000262, "loss": 6.2308, "mean_token_accuracy": 0.11487055495381356, "num_tokens": 1550143.0, "step": 525 }, { "entropy": 6.6475685119628904, "epoch": 0.01662119358986421, "grad_norm": 1.140625, "learning_rate": 0.00026450000000000003, "loss": 6.3562, "mean_token_accuracy": 0.1018921285867691, "num_tokens": 1564977.0, "step": 530 }, { "entropy": 6.716810035705566, "epoch": 0.016777997302976133, "grad_norm": 1.421875, "learning_rate": 0.00026700000000000004, "loss": 6.3036, "mean_token_accuracy": 0.10546633452177048, "num_tokens": 1580060.0, "step": 535 }, { "entropy": 6.631731700897217, "epoch": 0.01693480101608806, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 6.2829, "mean_token_accuracy": 0.10685937479138374, "num_tokens": 1594789.0, "step": 540 }, { "entropy": 6.6427947044372555, "epoch": 0.01709160472919999, "grad_norm": 0.97265625, "learning_rate": 0.00027200000000000005, "loss": 6.2729, "mean_token_accuracy": 0.1120539978146553, "num_tokens": 1610957.0, "step": 545 }, { "entropy": 6.588653326034546, "epoch": 0.017248408442311913, "grad_norm": 1.21875, "learning_rate": 0.0002745, "loss": 6.2819, "mean_token_accuracy": 0.11637941747903824, "num_tokens": 1624447.0, "step": 550 }, { "entropy": 6.620056772232056, "epoch": 0.01740521215542384, "grad_norm": 1.4765625, "learning_rate": 0.000277, "loss": 6.3078, "mean_token_accuracy": 0.10762870758771896, "num_tokens": 1639204.0, "step": 555 }, { "entropy": 6.609020042419433, "epoch": 0.017562015868535768, "grad_norm": 1.390625, "learning_rate": 0.0002795, "loss": 6.3212, "mean_token_accuracy": 0.110382679104805, "num_tokens": 1652377.0, "step": 560 }, { "entropy": 6.693290662765503, "epoch": 0.017718819581647692, "grad_norm": 1.140625, "learning_rate": 0.00028199999999999997, "loss": 6.2751, "mean_token_accuracy": 0.10745934993028641, "num_tokens": 1667254.0, "step": 565 }, { "entropy": 6.560057878494263, "epoch": 0.01787562329475962, "grad_norm": 1.3671875, "learning_rate": 0.0002845, "loss": 6.3225, "mean_token_accuracy": 0.11314097568392753, "num_tokens": 1682021.0, "step": 570 }, { "entropy": 6.629387378692627, "epoch": 0.018032427007871547, "grad_norm": 1.375, "learning_rate": 0.000287, "loss": 6.1881, "mean_token_accuracy": 0.11611460223793983, "num_tokens": 1697211.0, "step": 575 }, { "entropy": 6.556789445877075, "epoch": 0.01818923072098347, "grad_norm": 1.2734375, "learning_rate": 0.0002895, "loss": 6.2833, "mean_token_accuracy": 0.10666922554373741, "num_tokens": 1712561.0, "step": 580 }, { "entropy": 6.522421073913574, "epoch": 0.0183460344340954, "grad_norm": 1.2734375, "learning_rate": 0.000292, "loss": 6.211, "mean_token_accuracy": 0.11197596043348312, "num_tokens": 1728298.0, "step": 585 }, { "entropy": 6.53973650932312, "epoch": 0.018502838147207327, "grad_norm": 1.375, "learning_rate": 0.0002945, "loss": 6.2439, "mean_token_accuracy": 0.11992142051458358, "num_tokens": 1741697.0, "step": 590 }, { "entropy": 6.4527688980102536, "epoch": 0.01865964186031925, "grad_norm": 1.53125, "learning_rate": 0.000297, "loss": 6.2042, "mean_token_accuracy": 0.1115458443760872, "num_tokens": 1756477.0, "step": 595 }, { "entropy": 6.483115386962891, "epoch": 0.01881644557343118, "grad_norm": 1.2421875, "learning_rate": 0.0002995, "loss": 6.161, "mean_token_accuracy": 0.1176509566605091, "num_tokens": 1770965.0, "step": 600 }, { "entropy": 6.551352834701538, "epoch": 0.018973249286543106, "grad_norm": 1.3125, "learning_rate": 0.000302, "loss": 6.2809, "mean_token_accuracy": 0.11110794097185135, "num_tokens": 1785184.0, "step": 605 }, { "entropy": 6.579122543334961, "epoch": 0.01913005299965503, "grad_norm": 1.28125, "learning_rate": 0.0003045, "loss": 6.3017, "mean_token_accuracy": 0.11201615557074547, "num_tokens": 1799353.0, "step": 610 }, { "entropy": 6.484968090057373, "epoch": 0.019286856712766958, "grad_norm": 1.2109375, "learning_rate": 0.000307, "loss": 6.2272, "mean_token_accuracy": 0.11322264298796654, "num_tokens": 1813457.0, "step": 615 }, { "entropy": 6.4240114212036135, "epoch": 0.019443660425878886, "grad_norm": 1.0234375, "learning_rate": 0.0003095, "loss": 6.1879, "mean_token_accuracy": 0.11162598803639412, "num_tokens": 1829820.0, "step": 620 }, { "entropy": 6.436847734451294, "epoch": 0.01960046413899081, "grad_norm": 1.09375, "learning_rate": 0.000312, "loss": 6.1562, "mean_token_accuracy": 0.11525302529335021, "num_tokens": 1843376.0, "step": 625 }, { "entropy": 6.483410835266113, "epoch": 0.019757267852102738, "grad_norm": 0.9453125, "learning_rate": 0.0003145, "loss": 6.2293, "mean_token_accuracy": 0.1060644507408142, "num_tokens": 1858854.0, "step": 630 }, { "entropy": 6.426254606246948, "epoch": 0.019914071565214665, "grad_norm": 1.1328125, "learning_rate": 0.000317, "loss": 6.0136, "mean_token_accuracy": 0.125533090531826, "num_tokens": 1873740.0, "step": 635 }, { "entropy": 6.404020833969116, "epoch": 0.02007087527832659, "grad_norm": 1.1875, "learning_rate": 0.0003195, "loss": 6.1716, "mean_token_accuracy": 0.11641796976327896, "num_tokens": 1888942.0, "step": 640 }, { "entropy": 6.520569324493408, "epoch": 0.020227678991438517, "grad_norm": 1.171875, "learning_rate": 0.000322, "loss": 6.2086, "mean_token_accuracy": 0.12039469107985497, "num_tokens": 1904054.0, "step": 645 }, { "entropy": 6.439871692657471, "epoch": 0.020384482704550445, "grad_norm": 1.4921875, "learning_rate": 0.00032450000000000003, "loss": 6.1303, "mean_token_accuracy": 0.11612799763679504, "num_tokens": 1916464.0, "step": 650 }, { "entropy": 6.333846569061279, "epoch": 0.02054128641766237, "grad_norm": 1.1015625, "learning_rate": 0.00032700000000000003, "loss": 6.0516, "mean_token_accuracy": 0.11740432828664779, "num_tokens": 1930947.0, "step": 655 }, { "entropy": 6.440066814422607, "epoch": 0.020698090130774296, "grad_norm": 1.1171875, "learning_rate": 0.00032950000000000004, "loss": 6.1644, "mean_token_accuracy": 0.11625355631113052, "num_tokens": 1945060.0, "step": 660 }, { "entropy": 6.518965578079223, "epoch": 0.020854893843886224, "grad_norm": 1.1328125, "learning_rate": 0.00033200000000000005, "loss": 6.3127, "mean_token_accuracy": 0.11131328493356704, "num_tokens": 1959187.0, "step": 665 }, { "entropy": 6.498908805847168, "epoch": 0.02101169755699815, "grad_norm": 1.2578125, "learning_rate": 0.00033450000000000005, "loss": 6.2751, "mean_token_accuracy": 0.11170570999383926, "num_tokens": 1974516.0, "step": 670 }, { "entropy": 6.321500682830811, "epoch": 0.021168501270110076, "grad_norm": 1.09375, "learning_rate": 0.000337, "loss": 6.0763, "mean_token_accuracy": 0.12224758714437485, "num_tokens": 1987459.0, "step": 675 }, { "entropy": 6.427319049835205, "epoch": 0.021325304983222004, "grad_norm": 1.125, "learning_rate": 0.0003395, "loss": 6.1014, "mean_token_accuracy": 0.11473800018429756, "num_tokens": 2004345.0, "step": 680 }, { "entropy": 6.32919487953186, "epoch": 0.021482108696333928, "grad_norm": 1.1328125, "learning_rate": 0.000342, "loss": 6.1893, "mean_token_accuracy": 0.11112356036901475, "num_tokens": 2021128.0, "step": 685 }, { "entropy": 6.442146730422974, "epoch": 0.021638912409445855, "grad_norm": 1.15625, "learning_rate": 0.00034449999999999997, "loss": 6.1285, "mean_token_accuracy": 0.11685249358415603, "num_tokens": 2034534.0, "step": 690 }, { "entropy": 6.332594347000122, "epoch": 0.021795716122557783, "grad_norm": 1.171875, "learning_rate": 0.000347, "loss": 5.994, "mean_token_accuracy": 0.12094285562634469, "num_tokens": 2047522.0, "step": 695 }, { "entropy": 6.32836503982544, "epoch": 0.021952519835669707, "grad_norm": 1.1640625, "learning_rate": 0.0003495, "loss": 6.1174, "mean_token_accuracy": 0.11575590446591377, "num_tokens": 2063026.0, "step": 700 }, { "entropy": 6.352781915664673, "epoch": 0.022109323548781635, "grad_norm": 1.203125, "learning_rate": 0.000352, "loss": 6.1027, "mean_token_accuracy": 0.12405385375022888, "num_tokens": 2077313.0, "step": 705 }, { "entropy": 6.297963857650757, "epoch": 0.022266127261893563, "grad_norm": 1.078125, "learning_rate": 0.0003545, "loss": 6.0533, "mean_token_accuracy": 0.12451517134904862, "num_tokens": 2090545.0, "step": 710 }, { "entropy": 6.329249334335327, "epoch": 0.022422930975005487, "grad_norm": 1.2421875, "learning_rate": 0.000357, "loss": 6.1159, "mean_token_accuracy": 0.11173808798193932, "num_tokens": 2104252.0, "step": 715 }, { "entropy": 6.367383718490601, "epoch": 0.022579734688117414, "grad_norm": 1.2421875, "learning_rate": 0.0003595, "loss": 6.047, "mean_token_accuracy": 0.11943526864051819, "num_tokens": 2118020.0, "step": 720 }, { "entropy": 6.267186212539673, "epoch": 0.022736538401229342, "grad_norm": 1.046875, "learning_rate": 0.000362, "loss": 6.0012, "mean_token_accuracy": 0.1282973624765873, "num_tokens": 2132429.0, "step": 725 }, { "entropy": 6.323628377914429, "epoch": 0.022893342114341266, "grad_norm": 1.1640625, "learning_rate": 0.0003645, "loss": 6.1295, "mean_token_accuracy": 0.1254815012216568, "num_tokens": 2145763.0, "step": 730 }, { "entropy": 6.322244787216187, "epoch": 0.023050145827453194, "grad_norm": 1.03125, "learning_rate": 0.000367, "loss": 6.083, "mean_token_accuracy": 0.12271661087870597, "num_tokens": 2160583.0, "step": 735 }, { "entropy": 6.244843339920044, "epoch": 0.02320694954056512, "grad_norm": 1.046875, "learning_rate": 0.0003695, "loss": 6.0526, "mean_token_accuracy": 0.1167644202709198, "num_tokens": 2176254.0, "step": 740 }, { "entropy": 6.375514793395996, "epoch": 0.023363753253677046, "grad_norm": 1.1796875, "learning_rate": 0.000372, "loss": 6.1026, "mean_token_accuracy": 0.1191796325147152, "num_tokens": 2190456.0, "step": 745 }, { "entropy": 6.307696533203125, "epoch": 0.023520556966788973, "grad_norm": 1.1484375, "learning_rate": 0.0003745, "loss": 6.0764, "mean_token_accuracy": 0.12289957031607628, "num_tokens": 2203102.0, "step": 750 }, { "entropy": 6.40611457824707, "epoch": 0.0236773606799009, "grad_norm": 1.34375, "learning_rate": 0.000377, "loss": 6.0772, "mean_token_accuracy": 0.12269680425524712, "num_tokens": 2216866.0, "step": 755 }, { "entropy": 6.236187839508057, "epoch": 0.023834164393012825, "grad_norm": 1.2890625, "learning_rate": 0.0003795, "loss": 6.0033, "mean_token_accuracy": 0.11777962148189544, "num_tokens": 2231275.0, "step": 760 }, { "entropy": 6.256259632110596, "epoch": 0.023990968106124753, "grad_norm": 1.234375, "learning_rate": 0.000382, "loss": 6.101, "mean_token_accuracy": 0.1180748425424099, "num_tokens": 2244788.0, "step": 765 }, { "entropy": 6.308438873291015, "epoch": 0.02414777181923668, "grad_norm": 1.2109375, "learning_rate": 0.0003845, "loss": 6.1113, "mean_token_accuracy": 0.1172371581196785, "num_tokens": 2260548.0, "step": 770 }, { "entropy": 6.242420339584351, "epoch": 0.024304575532348605, "grad_norm": 1.0078125, "learning_rate": 0.00038700000000000003, "loss": 6.0436, "mean_token_accuracy": 0.1195620097219944, "num_tokens": 2277030.0, "step": 775 }, { "entropy": 6.2474593162536625, "epoch": 0.024461379245460532, "grad_norm": 1.1875, "learning_rate": 0.00038950000000000003, "loss": 6.038, "mean_token_accuracy": 0.11677318438887596, "num_tokens": 2291350.0, "step": 780 }, { "entropy": 6.340010404586792, "epoch": 0.02461818295857246, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 6.1619, "mean_token_accuracy": 0.11335810571908951, "num_tokens": 2306766.0, "step": 785 }, { "entropy": 6.247185087203979, "epoch": 0.024774986671684384, "grad_norm": 1.109375, "learning_rate": 0.00039450000000000005, "loss": 6.0213, "mean_token_accuracy": 0.12314986139535904, "num_tokens": 2322556.0, "step": 790 }, { "entropy": 6.070211410522461, "epoch": 0.02493179038479631, "grad_norm": 1.265625, "learning_rate": 0.00039700000000000005, "loss": 5.8597, "mean_token_accuracy": 0.12424484714865684, "num_tokens": 2334061.0, "step": 795 }, { "entropy": 6.18665885925293, "epoch": 0.02508859409790824, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 6.0215, "mean_token_accuracy": 0.12226074188947678, "num_tokens": 2350082.0, "step": 800 }, { "entropy": 6.2820933818817135, "epoch": 0.025245397811020164, "grad_norm": 1.1171875, "learning_rate": 0.000402, "loss": 5.9866, "mean_token_accuracy": 0.12534554153680802, "num_tokens": 2365799.0, "step": 805 }, { "entropy": 6.109661722183228, "epoch": 0.02540220152413209, "grad_norm": 1.1328125, "learning_rate": 0.0004045, "loss": 5.9468, "mean_token_accuracy": 0.12130692824721337, "num_tokens": 2379491.0, "step": 810 }, { "entropy": 6.178446578979492, "epoch": 0.02555900523724402, "grad_norm": 1.109375, "learning_rate": 0.00040699999999999997, "loss": 5.9715, "mean_token_accuracy": 0.1236006774008274, "num_tokens": 2393840.0, "step": 815 }, { "entropy": 6.055525779724121, "epoch": 0.025715808950355943, "grad_norm": 1.265625, "learning_rate": 0.0004095, "loss": 5.8116, "mean_token_accuracy": 0.13396925255656242, "num_tokens": 2408364.0, "step": 820 }, { "entropy": 6.2112726211547855, "epoch": 0.02587261266346787, "grad_norm": 1.2265625, "learning_rate": 0.000412, "loss": 5.941, "mean_token_accuracy": 0.12613581195473672, "num_tokens": 2423471.0, "step": 825 }, { "entropy": 6.06286735534668, "epoch": 0.026029416376579798, "grad_norm": 1.09375, "learning_rate": 0.0004145, "loss": 5.9854, "mean_token_accuracy": 0.1259685769677162, "num_tokens": 2437773.0, "step": 830 }, { "entropy": 6.202285575866699, "epoch": 0.026186220089691722, "grad_norm": 1.203125, "learning_rate": 0.000417, "loss": 5.9824, "mean_token_accuracy": 0.12420864850282669, "num_tokens": 2451210.0, "step": 835 }, { "entropy": 6.162640047073364, "epoch": 0.02634302380280365, "grad_norm": 1.0703125, "learning_rate": 0.0004195, "loss": 5.9749, "mean_token_accuracy": 0.12392436563968659, "num_tokens": 2466855.0, "step": 840 }, { "entropy": 6.198370170593262, "epoch": 0.026499827515915578, "grad_norm": 1.0390625, "learning_rate": 0.000422, "loss": 6.0288, "mean_token_accuracy": 0.12249074876308441, "num_tokens": 2483544.0, "step": 845 }, { "entropy": 6.083363008499146, "epoch": 0.026656631229027502, "grad_norm": 0.984375, "learning_rate": 0.0004245, "loss": 5.9422, "mean_token_accuracy": 0.12914909645915032, "num_tokens": 2496906.0, "step": 850 }, { "entropy": 6.218140172958374, "epoch": 0.02681343494213943, "grad_norm": 1.09375, "learning_rate": 0.000427, "loss": 5.9327, "mean_token_accuracy": 0.12357857301831246, "num_tokens": 2510929.0, "step": 855 }, { "entropy": 6.035630893707276, "epoch": 0.026970238655251357, "grad_norm": 1.09375, "learning_rate": 0.0004295, "loss": 5.8866, "mean_token_accuracy": 0.12890503630042077, "num_tokens": 2523088.0, "step": 860 }, { "entropy": 6.202908706665039, "epoch": 0.02712704236836328, "grad_norm": 1.125, "learning_rate": 0.000432, "loss": 6.0462, "mean_token_accuracy": 0.12496983706951141, "num_tokens": 2538069.0, "step": 865 }, { "entropy": 6.155341863632202, "epoch": 0.02728384608147521, "grad_norm": 1.234375, "learning_rate": 0.0004345, "loss": 5.9648, "mean_token_accuracy": 0.12080245763063431, "num_tokens": 2550457.0, "step": 870 }, { "entropy": 6.164808702468872, "epoch": 0.027440649794587137, "grad_norm": 1.3359375, "learning_rate": 0.000437, "loss": 6.0062, "mean_token_accuracy": 0.12498117238283157, "num_tokens": 2564626.0, "step": 875 }, { "entropy": 6.074118041992188, "epoch": 0.02759745350769906, "grad_norm": 1.0390625, "learning_rate": 0.0004395, "loss": 5.9586, "mean_token_accuracy": 0.1210741564631462, "num_tokens": 2580773.0, "step": 880 }, { "entropy": 6.084677696228027, "epoch": 0.02775425722081099, "grad_norm": 1.046875, "learning_rate": 0.000442, "loss": 5.9504, "mean_token_accuracy": 0.12536775544285775, "num_tokens": 2595110.0, "step": 885 }, { "entropy": 6.080619478225708, "epoch": 0.027911060933922916, "grad_norm": 1.0703125, "learning_rate": 0.0004445, "loss": 5.8725, "mean_token_accuracy": 0.12975198924541473, "num_tokens": 2610259.0, "step": 890 }, { "entropy": 6.119405221939087, "epoch": 0.02806786464703484, "grad_norm": 1.078125, "learning_rate": 0.000447, "loss": 5.9856, "mean_token_accuracy": 0.1261485055088997, "num_tokens": 2625589.0, "step": 895 }, { "entropy": 6.066659688949585, "epoch": 0.028224668360146768, "grad_norm": 1.1484375, "learning_rate": 0.00044950000000000003, "loss": 5.9433, "mean_token_accuracy": 0.12746250554919242, "num_tokens": 2640145.0, "step": 900 }, { "entropy": 6.1185914993286135, "epoch": 0.028381472073258696, "grad_norm": 1.1015625, "learning_rate": 0.00045200000000000004, "loss": 5.9215, "mean_token_accuracy": 0.13048022910952567, "num_tokens": 2653621.0, "step": 905 }, { "entropy": 6.019134902954102, "epoch": 0.02853827578637062, "grad_norm": 1.140625, "learning_rate": 0.00045450000000000004, "loss": 5.997, "mean_token_accuracy": 0.12859755456447602, "num_tokens": 2668380.0, "step": 910 }, { "entropy": 6.19635124206543, "epoch": 0.028695079499482547, "grad_norm": 1.265625, "learning_rate": 0.00045700000000000005, "loss": 5.9644, "mean_token_accuracy": 0.1297648772597313, "num_tokens": 2682862.0, "step": 915 }, { "entropy": 6.027379941940308, "epoch": 0.028851883212594475, "grad_norm": 1.15625, "learning_rate": 0.00045950000000000006, "loss": 5.8723, "mean_token_accuracy": 0.13426159247756003, "num_tokens": 2696586.0, "step": 920 }, { "entropy": 5.995415496826172, "epoch": 0.0290086869257064, "grad_norm": 1.0234375, "learning_rate": 0.000462, "loss": 5.8748, "mean_token_accuracy": 0.1332511007785797, "num_tokens": 2712941.0, "step": 925 }, { "entropy": 6.09525785446167, "epoch": 0.029165490638818327, "grad_norm": 1.0703125, "learning_rate": 0.0004645, "loss": 5.9343, "mean_token_accuracy": 0.12271871790289879, "num_tokens": 2728371.0, "step": 930 }, { "entropy": 5.963246011734009, "epoch": 0.029322294351930255, "grad_norm": 1.0234375, "learning_rate": 0.000467, "loss": 5.8632, "mean_token_accuracy": 0.13176240101456643, "num_tokens": 2741856.0, "step": 935 }, { "entropy": 6.0740649700164795, "epoch": 0.02947909806504218, "grad_norm": 1.0078125, "learning_rate": 0.0004695, "loss": 5.9106, "mean_token_accuracy": 0.12672237455844879, "num_tokens": 2757663.0, "step": 940 }, { "entropy": 6.102129697799683, "epoch": 0.029635901778154106, "grad_norm": 1.09375, "learning_rate": 0.000472, "loss": 5.8991, "mean_token_accuracy": 0.1298680104315281, "num_tokens": 2771074.0, "step": 945 }, { "entropy": 5.961727428436279, "epoch": 0.029792705491266034, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 5.8354, "mean_token_accuracy": 0.13212114572525024, "num_tokens": 2784369.0, "step": 950 }, { "entropy": 6.022281265258789, "epoch": 0.029949509204377958, "grad_norm": 1.1640625, "learning_rate": 0.000477, "loss": 5.9385, "mean_token_accuracy": 0.12027354538440704, "num_tokens": 2800233.0, "step": 955 }, { "entropy": 6.097547292709351, "epoch": 0.030106312917489886, "grad_norm": 1.046875, "learning_rate": 0.0004795, "loss": 5.9377, "mean_token_accuracy": 0.12930759862065316, "num_tokens": 2815270.0, "step": 960 }, { "entropy": 6.130005693435669, "epoch": 0.030263116630601813, "grad_norm": 1.0859375, "learning_rate": 0.000482, "loss": 6.0192, "mean_token_accuracy": 0.12478073239326477, "num_tokens": 2830833.0, "step": 965 }, { "entropy": 6.0437352657318115, "epoch": 0.030419920343713738, "grad_norm": 1.0234375, "learning_rate": 0.0004845, "loss": 5.9442, "mean_token_accuracy": 0.13879294395446778, "num_tokens": 2845321.0, "step": 970 }, { "entropy": 6.048642206192016, "epoch": 0.030576724056825665, "grad_norm": 1.109375, "learning_rate": 0.000487, "loss": 5.9032, "mean_token_accuracy": 0.13587410748004913, "num_tokens": 2859112.0, "step": 975 }, { "entropy": 6.0042726516723635, "epoch": 0.030733527769937593, "grad_norm": 1.1015625, "learning_rate": 0.0004895, "loss": 5.8294, "mean_token_accuracy": 0.12910271510481836, "num_tokens": 2872888.0, "step": 980 }, { "entropy": 6.00495228767395, "epoch": 0.030890331483049517, "grad_norm": 1.234375, "learning_rate": 0.000492, "loss": 5.938, "mean_token_accuracy": 0.13228848949074745, "num_tokens": 2887363.0, "step": 985 }, { "entropy": 6.064482307434082, "epoch": 0.031047135196161445, "grad_norm": 1.1484375, "learning_rate": 0.0004945, "loss": 5.9331, "mean_token_accuracy": 0.1261969804763794, "num_tokens": 2902598.0, "step": 990 }, { "entropy": 5.962180280685425, "epoch": 0.031203938909273372, "grad_norm": 1.09375, "learning_rate": 0.000497, "loss": 5.9316, "mean_token_accuracy": 0.12509682774543762, "num_tokens": 2917404.0, "step": 995 }, { "entropy": 6.087647294998169, "epoch": 0.0313607426223853, "grad_norm": 1.0234375, "learning_rate": 0.0004995, "loss": 6.0481, "mean_token_accuracy": 0.12149560004472733, "num_tokens": 2934527.0, "step": 1000 }, { "entropy": 5.987649393081665, "epoch": 0.03151754633549723, "grad_norm": 1.0859375, "learning_rate": 0.000499998026082006, "loss": 5.8305, "mean_token_accuracy": 0.13421109914779664, "num_tokens": 2949222.0, "step": 1005 }, { "entropy": 6.066426849365234, "epoch": 0.03167435004860915, "grad_norm": 1.015625, "learning_rate": 0.0004999900070995136, "loss": 5.9763, "mean_token_accuracy": 0.12479947283864021, "num_tokens": 2964168.0, "step": 1010 }, { "entropy": 5.988660573959351, "epoch": 0.031831153761721076, "grad_norm": 1.1328125, "learning_rate": 0.0004999758199023239, "loss": 5.8726, "mean_token_accuracy": 0.13721302077174186, "num_tokens": 2978217.0, "step": 1015 }, { "entropy": 5.860611200332642, "epoch": 0.031987957474833004, "grad_norm": 1.0390625, "learning_rate": 0.0004999554648793858, "loss": 5.8288, "mean_token_accuracy": 0.12761253491044044, "num_tokens": 2993577.0, "step": 1020 }, { "entropy": 5.974480104446411, "epoch": 0.03214476118794493, "grad_norm": 1.1328125, "learning_rate": 0.0004999289425887425, "loss": 5.8514, "mean_token_accuracy": 0.12751337438821791, "num_tokens": 3007649.0, "step": 1025 }, { "entropy": 5.889734697341919, "epoch": 0.03230156490105686, "grad_norm": 1.078125, "learning_rate": 0.0004998962537575161, "loss": 5.8314, "mean_token_accuracy": 0.14106257036328315, "num_tokens": 3021619.0, "step": 1030 }, { "entropy": 6.131463050842285, "epoch": 0.03245836861416879, "grad_norm": 1.09375, "learning_rate": 0.0004998573992818874, "loss": 5.9148, "mean_token_accuracy": 0.12463216632604598, "num_tokens": 3036726.0, "step": 1035 }, { "entropy": 5.956810188293457, "epoch": 0.03261517232728071, "grad_norm": 1.2109375, "learning_rate": 0.0004998123802270715, "loss": 5.9448, "mean_token_accuracy": 0.12305018752813339, "num_tokens": 3049786.0, "step": 1040 }, { "entropy": 5.986479806900024, "epoch": 0.032771976040392635, "grad_norm": 1.0234375, "learning_rate": 0.0004997611978272886, "loss": 5.9525, "mean_token_accuracy": 0.1329242967069149, "num_tokens": 3063521.0, "step": 1045 }, { "entropy": 6.006673288345337, "epoch": 0.03292877975350456, "grad_norm": 1.046875, "learning_rate": 0.0004997038534857298, "loss": 5.8735, "mean_token_accuracy": 0.12820919156074523, "num_tokens": 3077790.0, "step": 1050 }, { "entropy": 5.896439933776856, "epoch": 0.03308558346661649, "grad_norm": 0.9609375, "learning_rate": 0.0004996403487745194, "loss": 5.848, "mean_token_accuracy": 0.1296282596886158, "num_tokens": 3095577.0, "step": 1055 }, { "entropy": 5.958034658432007, "epoch": 0.03324238717972842, "grad_norm": 1.046875, "learning_rate": 0.000499570685434671, "loss": 5.8715, "mean_token_accuracy": 0.12729506567120552, "num_tokens": 3111244.0, "step": 1060 }, { "entropy": 5.850221729278564, "epoch": 0.033399190892840346, "grad_norm": 1.0546875, "learning_rate": 0.0004994948653760405, "loss": 5.6822, "mean_token_accuracy": 0.14201920107007027, "num_tokens": 3125407.0, "step": 1065 }, { "entropy": 5.910600900650024, "epoch": 0.033555994605952266, "grad_norm": 1.15625, "learning_rate": 0.0004994128906772729, "loss": 5.7931, "mean_token_accuracy": 0.13524388447403907, "num_tokens": 3137260.0, "step": 1070 }, { "entropy": 5.954425382614136, "epoch": 0.033712798319064194, "grad_norm": 1.2109375, "learning_rate": 0.000499324763585746, "loss": 5.8919, "mean_token_accuracy": 0.12603772133588792, "num_tokens": 3150418.0, "step": 1075 }, { "entropy": 5.915726375579834, "epoch": 0.03386960203217612, "grad_norm": 1.0390625, "learning_rate": 0.0004992304865175085, "loss": 5.837, "mean_token_accuracy": 0.13079922497272492, "num_tokens": 3165385.0, "step": 1080 }, { "entropy": 5.868867015838623, "epoch": 0.03402640574528805, "grad_norm": 1.015625, "learning_rate": 0.0004991300620572138, "loss": 5.841, "mean_token_accuracy": 0.1295164331793785, "num_tokens": 3179144.0, "step": 1085 }, { "entropy": 5.89624342918396, "epoch": 0.03418320945839998, "grad_norm": 1.1015625, "learning_rate": 0.0004990234929580494, "loss": 5.7452, "mean_token_accuracy": 0.13632771372795105, "num_tokens": 3192831.0, "step": 1090 }, { "entropy": 5.911666440963745, "epoch": 0.034340013171511904, "grad_norm": 1.078125, "learning_rate": 0.0004989107821416609, "loss": 5.8807, "mean_token_accuracy": 0.13042519465088845, "num_tokens": 3205820.0, "step": 1095 }, { "entropy": 6.020514869689942, "epoch": 0.034496816884623825, "grad_norm": 1.1171875, "learning_rate": 0.0004987919326980723, "loss": 5.8385, "mean_token_accuracy": 0.13410276398062707, "num_tokens": 3219618.0, "step": 1100 }, { "entropy": 5.817402315139771, "epoch": 0.03465362059773575, "grad_norm": 1.046875, "learning_rate": 0.0004986669478856011, "loss": 5.7457, "mean_token_accuracy": 0.13494893535971642, "num_tokens": 3233648.0, "step": 1105 }, { "entropy": 5.92337851524353, "epoch": 0.03481042431084768, "grad_norm": 0.9765625, "learning_rate": 0.0004985358311307688, "loss": 5.8936, "mean_token_accuracy": 0.12879264429211618, "num_tokens": 3248906.0, "step": 1110 }, { "entropy": 5.852339553833008, "epoch": 0.03496722802395961, "grad_norm": 1.21875, "learning_rate": 0.0004983985860282081, "loss": 5.7109, "mean_token_accuracy": 0.13579089120030402, "num_tokens": 3263212.0, "step": 1115 }, { "entropy": 5.866457986831665, "epoch": 0.035124031737071536, "grad_norm": 1.1484375, "learning_rate": 0.0004982552163405623, "loss": 5.7612, "mean_token_accuracy": 0.14021414518356323, "num_tokens": 3277244.0, "step": 1120 }, { "entropy": 5.96242036819458, "epoch": 0.03528083545018346, "grad_norm": 1.0546875, "learning_rate": 0.0004981057259983839, "loss": 5.9119, "mean_token_accuracy": 0.12455229237675666, "num_tokens": 3292200.0, "step": 1125 }, { "entropy": 5.904011678695679, "epoch": 0.035437639163295384, "grad_norm": 1.0703125, "learning_rate": 0.0004979501191000262, "loss": 5.7927, "mean_token_accuracy": 0.13359547033905983, "num_tokens": 3308999.0, "step": 1130 }, { "entropy": 5.829094743728637, "epoch": 0.03559444287640731, "grad_norm": 0.98828125, "learning_rate": 0.0004977883999115311, "loss": 5.8299, "mean_token_accuracy": 0.13213476166129112, "num_tokens": 3325380.0, "step": 1135 }, { "entropy": 5.848357009887695, "epoch": 0.03575124658951924, "grad_norm": 1.078125, "learning_rate": 0.0004976205728665113, "loss": 5.7401, "mean_token_accuracy": 0.14331733286380768, "num_tokens": 3339997.0, "step": 1140 }, { "entropy": 5.814362859725952, "epoch": 0.03590805030263117, "grad_norm": 1.0078125, "learning_rate": 0.0004974466425660307, "loss": 5.7597, "mean_token_accuracy": 0.13575922846794128, "num_tokens": 3353388.0, "step": 1145 }, { "entropy": 5.941767978668213, "epoch": 0.036064854015743095, "grad_norm": 1.09375, "learning_rate": 0.0004972666137784759, "loss": 5.8378, "mean_token_accuracy": 0.13422609940171243, "num_tokens": 3368534.0, "step": 1150 }, { "entropy": 5.867988395690918, "epoch": 0.03622165772885502, "grad_norm": 1.09375, "learning_rate": 0.0004970804914394271, "loss": 5.7803, "mean_token_accuracy": 0.13961924463510514, "num_tokens": 3384683.0, "step": 1155 }, { "entropy": 5.836901712417602, "epoch": 0.03637846144196694, "grad_norm": 1.1171875, "learning_rate": 0.0004968882806515225, "loss": 5.6851, "mean_token_accuracy": 0.14083293005824088, "num_tokens": 3397823.0, "step": 1160 }, { "entropy": 5.793954658508301, "epoch": 0.03653526515507887, "grad_norm": 1.0703125, "learning_rate": 0.0004966899866843177, "loss": 5.753, "mean_token_accuracy": 0.14006715640425682, "num_tokens": 3411862.0, "step": 1165 }, { "entropy": 5.860671329498291, "epoch": 0.0366920688681908, "grad_norm": 1.015625, "learning_rate": 0.000496485614974142, "loss": 5.7202, "mean_token_accuracy": 0.14168946966528892, "num_tokens": 3426306.0, "step": 1170 }, { "entropy": 5.748768091201782, "epoch": 0.036848872581302726, "grad_norm": 1.0234375, "learning_rate": 0.0004962751711239492, "loss": 5.7055, "mean_token_accuracy": 0.137933249771595, "num_tokens": 3441906.0, "step": 1175 }, { "entropy": 5.866535282135009, "epoch": 0.037005676294414654, "grad_norm": 0.98828125, "learning_rate": 0.0004960586609031636, "loss": 5.8129, "mean_token_accuracy": 0.12675541639328003, "num_tokens": 3456643.0, "step": 1180 }, { "entropy": 5.953323316574097, "epoch": 0.03716248000752658, "grad_norm": 1.0390625, "learning_rate": 0.0004958360902475224, "loss": 5.8209, "mean_token_accuracy": 0.13259705379605294, "num_tokens": 3472218.0, "step": 1185 }, { "entropy": 5.888777065277099, "epoch": 0.0373192837206385, "grad_norm": 0.96484375, "learning_rate": 0.0004956074652589125, "loss": 5.8791, "mean_token_accuracy": 0.13352179303765296, "num_tokens": 3487173.0, "step": 1190 }, { "entropy": 5.888743495941162, "epoch": 0.03747608743375043, "grad_norm": 0.98828125, "learning_rate": 0.0004953727922052035, "loss": 5.8697, "mean_token_accuracy": 0.1344257652759552, "num_tokens": 3502963.0, "step": 1195 }, { "entropy": 5.723510456085205, "epoch": 0.03763289114686236, "grad_norm": 1.0, "learning_rate": 0.0004951320775200756, "loss": 5.638, "mean_token_accuracy": 0.1404781922698021, "num_tokens": 3517807.0, "step": 1200 }, { "entropy": 5.961473083496093, "epoch": 0.037789694859974285, "grad_norm": 0.95703125, "learning_rate": 0.0004948853278028436, "loss": 5.8022, "mean_token_accuracy": 0.1324881412088871, "num_tokens": 3531597.0, "step": 1205 }, { "entropy": 5.893240833282471, "epoch": 0.03794649857308621, "grad_norm": 0.87109375, "learning_rate": 0.0004946325498182755, "loss": 5.878, "mean_token_accuracy": 0.12567512765526773, "num_tokens": 3549526.0, "step": 1210 }, { "entropy": 5.814656019210815, "epoch": 0.03810330228619814, "grad_norm": 0.98046875, "learning_rate": 0.0004943737504964076, "loss": 5.7029, "mean_token_accuracy": 0.13802678138017654, "num_tokens": 3562202.0, "step": 1215 }, { "entropy": 5.823633623123169, "epoch": 0.03826010599931006, "grad_norm": 1.0, "learning_rate": 0.000494108936932354, "loss": 5.7657, "mean_token_accuracy": 0.13985563889145852, "num_tokens": 3576824.0, "step": 1220 }, { "entropy": 5.86934757232666, "epoch": 0.03841690971242199, "grad_norm": 1.203125, "learning_rate": 0.0004938381163861124, "loss": 5.7675, "mean_token_accuracy": 0.13630534335970879, "num_tokens": 3589347.0, "step": 1225 }, { "entropy": 5.739215517044068, "epoch": 0.038573713425533916, "grad_norm": 0.92578125, "learning_rate": 0.0004935612962823645, "loss": 5.7174, "mean_token_accuracy": 0.1372951328754425, "num_tokens": 3604280.0, "step": 1230 }, { "entropy": 5.7907041072845455, "epoch": 0.038730517138645844, "grad_norm": 1.15625, "learning_rate": 0.0004932784842102739, "loss": 5.6566, "mean_token_accuracy": 0.14609543979167938, "num_tokens": 3617854.0, "step": 1235 }, { "entropy": 5.782031059265137, "epoch": 0.03888732085175777, "grad_norm": 0.97265625, "learning_rate": 0.0004929896879232758, "loss": 5.7427, "mean_token_accuracy": 0.13488340973854065, "num_tokens": 3632627.0, "step": 1240 }, { "entropy": 5.888515567779541, "epoch": 0.0390441245648697, "grad_norm": 0.92578125, "learning_rate": 0.0004926949153388668, "loss": 5.8072, "mean_token_accuracy": 0.13958224803209304, "num_tokens": 3649406.0, "step": 1245 }, { "entropy": 5.856204605102539, "epoch": 0.03920092827798162, "grad_norm": 1.046875, "learning_rate": 0.0004923941745383859, "loss": 5.8247, "mean_token_accuracy": 0.13710009753704072, "num_tokens": 3664042.0, "step": 1250 }, { "entropy": 5.801159381866455, "epoch": 0.03935773199109355, "grad_norm": 1.015625, "learning_rate": 0.000492087473766794, "loss": 5.7248, "mean_token_accuracy": 0.13974272459745407, "num_tokens": 3678964.0, "step": 1255 }, { "entropy": 5.812677669525146, "epoch": 0.039514535704205475, "grad_norm": 1.0625, "learning_rate": 0.000491774821432448, "loss": 5.7867, "mean_token_accuracy": 0.13592285215854644, "num_tokens": 3694725.0, "step": 1260 }, { "entropy": 5.827065658569336, "epoch": 0.0396713394173174, "grad_norm": 0.95703125, "learning_rate": 0.0004914562261068693, "loss": 5.6938, "mean_token_accuracy": 0.14478985965251923, "num_tokens": 3708942.0, "step": 1265 }, { "entropy": 5.804870748519898, "epoch": 0.03982814313042933, "grad_norm": 0.90625, "learning_rate": 0.0004911316965245098, "loss": 5.7437, "mean_token_accuracy": 0.1342754565179348, "num_tokens": 3727171.0, "step": 1270 }, { "entropy": 5.7694480419158936, "epoch": 0.03998494684354126, "grad_norm": 0.9921875, "learning_rate": 0.000490801241582512, "loss": 5.7494, "mean_token_accuracy": 0.14143916815519333, "num_tokens": 3742249.0, "step": 1275 }, { "entropy": 5.81528754234314, "epoch": 0.04014175055665318, "grad_norm": 1.0546875, "learning_rate": 0.000490464870340465, "loss": 5.6568, "mean_token_accuracy": 0.13865938186645507, "num_tokens": 3756267.0, "step": 1280 }, { "entropy": 5.706241655349731, "epoch": 0.040298554269765106, "grad_norm": 0.9296875, "learning_rate": 0.0004901225920201563, "loss": 5.6238, "mean_token_accuracy": 0.14538088589906692, "num_tokens": 3769846.0, "step": 1285 }, { "entropy": 5.818896913528443, "epoch": 0.040455357982877034, "grad_norm": 1.0703125, "learning_rate": 0.000489774416005319, "loss": 5.7882, "mean_token_accuracy": 0.13648639097809792, "num_tokens": 3783489.0, "step": 1290 }, { "entropy": 5.728751993179321, "epoch": 0.04061216169598896, "grad_norm": 0.96875, "learning_rate": 0.0004894203518413742, "loss": 5.6705, "mean_token_accuracy": 0.14063634797930719, "num_tokens": 3800797.0, "step": 1295 }, { "entropy": 5.821841621398926, "epoch": 0.04076896540910089, "grad_norm": 1.0703125, "learning_rate": 0.0004890604092351701, "loss": 5.7148, "mean_token_accuracy": 0.14129465371370314, "num_tokens": 3816678.0, "step": 1300 }, { "entropy": 5.754094028472901, "epoch": 0.04092576912221282, "grad_norm": 1.1953125, "learning_rate": 0.000488694598054715, "loss": 5.7167, "mean_token_accuracy": 0.13984414786100388, "num_tokens": 3830435.0, "step": 1305 }, { "entropy": 5.7894409656524655, "epoch": 0.04108257283532474, "grad_norm": 0.95703125, "learning_rate": 0.0004883229283289071, "loss": 5.688, "mean_token_accuracy": 0.14409852996468545, "num_tokens": 3844910.0, "step": 1310 }, { "entropy": 5.704872941970825, "epoch": 0.041239376548436665, "grad_norm": 0.92578125, "learning_rate": 0.00048794541024725993, "loss": 5.7349, "mean_token_accuracy": 0.13705151826143264, "num_tokens": 3859688.0, "step": 1315 }, { "entropy": 5.772118949890137, "epoch": 0.04139618026154859, "grad_norm": 0.95703125, "learning_rate": 0.0004875620541596221, "loss": 5.6293, "mean_token_accuracy": 0.14292458593845367, "num_tokens": 3875604.0, "step": 1320 }, { "entropy": 5.77454195022583, "epoch": 0.04155298397466052, "grad_norm": 1.03125, "learning_rate": 0.00048717287057589454, "loss": 5.7073, "mean_token_accuracy": 0.13829230964183808, "num_tokens": 3891463.0, "step": 1325 }, { "entropy": 5.741397094726563, "epoch": 0.04170978768777245, "grad_norm": 1.125, "learning_rate": 0.0004867778701657417, "loss": 5.7261, "mean_token_accuracy": 0.14032770767807962, "num_tokens": 3905505.0, "step": 1330 }, { "entropy": 5.805401229858399, "epoch": 0.041866591400884376, "grad_norm": 1.1171875, "learning_rate": 0.00048637706375829955, "loss": 5.6083, "mean_token_accuracy": 0.14735801219940187, "num_tokens": 3919059.0, "step": 1335 }, { "entropy": 5.642607164382935, "epoch": 0.0420233951139963, "grad_norm": 0.9921875, "learning_rate": 0.000485970462341878, "loss": 5.6655, "mean_token_accuracy": 0.14223852679133414, "num_tokens": 3934554.0, "step": 1340 }, { "entropy": 5.732195806503296, "epoch": 0.042180198827108224, "grad_norm": 1.046875, "learning_rate": 0.00048555807706366044, "loss": 5.6321, "mean_token_accuracy": 0.14635981246829033, "num_tokens": 3948836.0, "step": 1345 }, { "entropy": 5.717943096160889, "epoch": 0.04233700254022015, "grad_norm": 0.94921875, "learning_rate": 0.00048513991922939756, "loss": 5.6328, "mean_token_accuracy": 0.14274636507034302, "num_tokens": 3963374.0, "step": 1350 }, { "entropy": 5.73873291015625, "epoch": 0.04249380625333208, "grad_norm": 0.88671875, "learning_rate": 0.00048471600030309744, "loss": 5.7642, "mean_token_accuracy": 0.1433413989841938, "num_tokens": 3978790.0, "step": 1355 }, { "entropy": 5.791727018356323, "epoch": 0.04265060996644401, "grad_norm": 0.98046875, "learning_rate": 0.00048428633190671186, "loss": 5.7165, "mean_token_accuracy": 0.14199780970811843, "num_tokens": 3993320.0, "step": 1360 }, { "entropy": 5.743384075164795, "epoch": 0.042807413679555935, "grad_norm": 1.03125, "learning_rate": 0.0004838509258198167, "loss": 5.647, "mean_token_accuracy": 0.14719821512699127, "num_tokens": 4006867.0, "step": 1365 }, { "entropy": 5.710117816925049, "epoch": 0.042964217392667856, "grad_norm": 0.9296875, "learning_rate": 0.00048340979397929, "loss": 5.5949, "mean_token_accuracy": 0.14546966552734375, "num_tokens": 4022664.0, "step": 1370 }, { "entropy": 5.678111791610718, "epoch": 0.04312102110577978, "grad_norm": 1.015625, "learning_rate": 0.00048296294847898386, "loss": 5.6193, "mean_token_accuracy": 0.14935135692358018, "num_tokens": 4036213.0, "step": 1375 }, { "entropy": 5.756679725646973, "epoch": 0.04327782481889171, "grad_norm": 1.03125, "learning_rate": 0.0004825104015693934, "loss": 5.7018, "mean_token_accuracy": 0.14161612838506699, "num_tokens": 4050766.0, "step": 1380 }, { "entropy": 5.732282876968384, "epoch": 0.04343462853200364, "grad_norm": 0.875, "learning_rate": 0.0004820521656573208, "loss": 5.6864, "mean_token_accuracy": 0.148099435120821, "num_tokens": 4065983.0, "step": 1385 }, { "entropy": 5.816153573989868, "epoch": 0.043591432245115566, "grad_norm": 0.98046875, "learning_rate": 0.00048158825330553505, "loss": 5.7293, "mean_token_accuracy": 0.14191074445843696, "num_tokens": 4081755.0, "step": 1390 }, { "entropy": 5.647218370437622, "epoch": 0.043748235958227494, "grad_norm": 0.921875, "learning_rate": 0.00048111867723242763, "loss": 5.6105, "mean_token_accuracy": 0.146306511759758, "num_tokens": 4095747.0, "step": 1395 }, { "entropy": 5.771636009216309, "epoch": 0.043905039671339414, "grad_norm": 1.03125, "learning_rate": 0.0004806434503116637, "loss": 5.6161, "mean_token_accuracy": 0.15057915598154067, "num_tokens": 4109547.0, "step": 1400 }, { "entropy": 5.725102043151855, "epoch": 0.04406184338445134, "grad_norm": 1.0703125, "learning_rate": 0.0004801625855718296, "loss": 5.7245, "mean_token_accuracy": 0.1395110748708248, "num_tokens": 4125984.0, "step": 1405 }, { "entropy": 5.679219055175781, "epoch": 0.04421864709756327, "grad_norm": 0.96875, "learning_rate": 0.00047967609619607477, "loss": 5.6238, "mean_token_accuracy": 0.14524023979902267, "num_tokens": 4140603.0, "step": 1410 }, { "entropy": 5.675964784622193, "epoch": 0.0443754508106752, "grad_norm": 0.93359375, "learning_rate": 0.0004791839955217513, "loss": 5.5852, "mean_token_accuracy": 0.14772498831152917, "num_tokens": 4156800.0, "step": 1415 }, { "entropy": 5.734459352493286, "epoch": 0.044532254523787125, "grad_norm": 1.09375, "learning_rate": 0.00047868629704004786, "loss": 5.694, "mean_token_accuracy": 0.1451198197901249, "num_tokens": 4170821.0, "step": 1420 }, { "entropy": 5.695484256744384, "epoch": 0.04468905823689905, "grad_norm": 0.89453125, "learning_rate": 0.00047818301439561965, "loss": 5.6216, "mean_token_accuracy": 0.14631207138299943, "num_tokens": 4185555.0, "step": 1425 }, { "entropy": 5.674433755874634, "epoch": 0.04484586195001097, "grad_norm": 1.1015625, "learning_rate": 0.00047767416138621454, "loss": 5.6494, "mean_token_accuracy": 0.1443865902721882, "num_tokens": 4200164.0, "step": 1430 }, { "entropy": 5.7222973823547365, "epoch": 0.0450026656631229, "grad_norm": 0.98828125, "learning_rate": 0.000477159751962295, "loss": 5.6172, "mean_token_accuracy": 0.1548900417983532, "num_tokens": 4213393.0, "step": 1435 }, { "entropy": 5.670509672164917, "epoch": 0.04515946937623483, "grad_norm": 1.015625, "learning_rate": 0.00047663980022665507, "loss": 5.5355, "mean_token_accuracy": 0.15677547156810762, "num_tokens": 4226794.0, "step": 1440 }, { "entropy": 5.806225967407227, "epoch": 0.045316273089346756, "grad_norm": 0.96484375, "learning_rate": 0.00047611432043403437, "loss": 5.7712, "mean_token_accuracy": 0.13765899315476418, "num_tokens": 4243575.0, "step": 1445 }, { "entropy": 5.715469264984131, "epoch": 0.045473076802458684, "grad_norm": 0.984375, "learning_rate": 0.0004755833269907267, "loss": 5.6882, "mean_token_accuracy": 0.14131314307451248, "num_tokens": 4257947.0, "step": 1450 }, { "entropy": 5.7218750476837155, "epoch": 0.04562988051557061, "grad_norm": 0.84375, "learning_rate": 0.0004750468344541857, "loss": 5.6569, "mean_token_accuracy": 0.14194273352622985, "num_tokens": 4274140.0, "step": 1455 }, { "entropy": 5.794920873641968, "epoch": 0.04578668422868253, "grad_norm": 1.0, "learning_rate": 0.00047450485753262525, "loss": 5.6275, "mean_token_accuracy": 0.14596797823905944, "num_tokens": 4287415.0, "step": 1460 }, { "entropy": 5.602665996551513, "epoch": 0.04594348794179446, "grad_norm": 1.046875, "learning_rate": 0.00047395741108461633, "loss": 5.5512, "mean_token_accuracy": 0.15124925673007966, "num_tokens": 4301281.0, "step": 1465 }, { "entropy": 5.795319700241089, "epoch": 0.04610029165490639, "grad_norm": 0.99609375, "learning_rate": 0.00047340451011867985, "loss": 5.6918, "mean_token_accuracy": 0.14298617839813232, "num_tokens": 4316413.0, "step": 1470 }, { "entropy": 5.6644445896148685, "epoch": 0.046257095368018315, "grad_norm": 1.0546875, "learning_rate": 0.00047284616979287515, "loss": 5.6087, "mean_token_accuracy": 0.14939066469669343, "num_tokens": 4330355.0, "step": 1475 }, { "entropy": 5.713419389724732, "epoch": 0.04641389908113024, "grad_norm": 0.97265625, "learning_rate": 0.00047228240541438433, "loss": 5.5912, "mean_token_accuracy": 0.147909464687109, "num_tokens": 4344710.0, "step": 1480 }, { "entropy": 5.616871118545532, "epoch": 0.04657070279424217, "grad_norm": 1.046875, "learning_rate": 0.00047171323243909257, "loss": 5.57, "mean_token_accuracy": 0.1550672844052315, "num_tokens": 4357853.0, "step": 1485 }, { "entropy": 5.6620786666870115, "epoch": 0.04672750650735409, "grad_norm": 1.015625, "learning_rate": 0.00047113866647116457, "loss": 5.5682, "mean_token_accuracy": 0.1481015995144844, "num_tokens": 4372473.0, "step": 1490 }, { "entropy": 5.713062810897827, "epoch": 0.04688431022046602, "grad_norm": 0.96484375, "learning_rate": 0.0004705587232626164, "loss": 5.7357, "mean_token_accuracy": 0.13680261969566346, "num_tokens": 4387178.0, "step": 1495 }, { "entropy": 5.670087432861328, "epoch": 0.04704111393357795, "grad_norm": 0.890625, "learning_rate": 0.00046997341871288424, "loss": 5.6205, "mean_token_accuracy": 0.1452601358294487, "num_tokens": 4402092.0, "step": 1500 }, { "entropy": 5.699921464920044, "epoch": 0.047197917646689874, "grad_norm": 1.1015625, "learning_rate": 0.0004693827688683879, "loss": 5.5736, "mean_token_accuracy": 0.15034027099609376, "num_tokens": 4415190.0, "step": 1505 }, { "entropy": 5.647108316421509, "epoch": 0.0473547213598018, "grad_norm": 0.921875, "learning_rate": 0.0004687867899220914, "loss": 5.5482, "mean_token_accuracy": 0.14983870908617974, "num_tokens": 4430402.0, "step": 1510 }, { "entropy": 5.681677961349488, "epoch": 0.04751152507291373, "grad_norm": 0.890625, "learning_rate": 0.00046818549821305846, "loss": 5.6694, "mean_token_accuracy": 0.14604835733771324, "num_tokens": 4445547.0, "step": 1515 }, { "entropy": 5.612594366073608, "epoch": 0.04766832878602565, "grad_norm": 0.96484375, "learning_rate": 0.00046757891022600494, "loss": 5.5101, "mean_token_accuracy": 0.15138526260852814, "num_tokens": 4460175.0, "step": 1520 }, { "entropy": 5.647563648223877, "epoch": 0.04782513249913758, "grad_norm": 1.0078125, "learning_rate": 0.0004669670425908471, "loss": 5.6422, "mean_token_accuracy": 0.1430087998509407, "num_tokens": 4475687.0, "step": 1525 }, { "entropy": 5.663858413696289, "epoch": 0.047981936212249506, "grad_norm": 0.81640625, "learning_rate": 0.0004663499120822451, "loss": 5.6162, "mean_token_accuracy": 0.148489810526371, "num_tokens": 4492494.0, "step": 1530 }, { "entropy": 5.622017478942871, "epoch": 0.04813873992536143, "grad_norm": 1.0078125, "learning_rate": 0.0004657275356191437, "loss": 5.4682, "mean_token_accuracy": 0.15244067311286927, "num_tokens": 4506566.0, "step": 1535 }, { "entropy": 5.626275539398193, "epoch": 0.04829554363847336, "grad_norm": 0.91796875, "learning_rate": 0.00046509993026430804, "loss": 5.6286, "mean_token_accuracy": 0.14129947870969772, "num_tokens": 4522463.0, "step": 1540 }, { "entropy": 5.617114162445068, "epoch": 0.04845234735158529, "grad_norm": 0.8984375, "learning_rate": 0.0004644671132238558, "loss": 5.5217, "mean_token_accuracy": 0.15152865946292876, "num_tokens": 4537401.0, "step": 1545 }, { "entropy": 5.60228967666626, "epoch": 0.04860915106469721, "grad_norm": 1.015625, "learning_rate": 0.00046382910184678585, "loss": 5.5717, "mean_token_accuracy": 0.1512614145874977, "num_tokens": 4549712.0, "step": 1550 }, { "entropy": 5.602184009552002, "epoch": 0.04876595477780914, "grad_norm": 0.9296875, "learning_rate": 0.0004631859136245025, "loss": 5.4804, "mean_token_accuracy": 0.1518227055668831, "num_tokens": 4563601.0, "step": 1555 }, { "entropy": 5.686416435241699, "epoch": 0.048922758490921064, "grad_norm": 0.93359375, "learning_rate": 0.0004625375661903357, "loss": 5.5304, "mean_token_accuracy": 0.14626965522766114, "num_tokens": 4577309.0, "step": 1560 }, { "entropy": 5.540439081192017, "epoch": 0.04907956220403299, "grad_norm": 1.0078125, "learning_rate": 0.00046188407731905787, "loss": 5.4883, "mean_token_accuracy": 0.1563427686691284, "num_tokens": 4590389.0, "step": 1565 }, { "entropy": 5.711526823043823, "epoch": 0.04923636591714492, "grad_norm": 0.9140625, "learning_rate": 0.00046122546492639643, "loss": 5.6104, "mean_token_accuracy": 0.14507472813129424, "num_tokens": 4607042.0, "step": 1570 }, { "entropy": 5.665983533859253, "epoch": 0.04939316963025685, "grad_norm": 0.921875, "learning_rate": 0.000460561747068543, "loss": 5.5964, "mean_token_accuracy": 0.15060784667730331, "num_tokens": 4624377.0, "step": 1575 }, { "entropy": 5.604173374176026, "epoch": 0.04954997334336877, "grad_norm": 0.94921875, "learning_rate": 0.0004598929419416578, "loss": 5.5906, "mean_token_accuracy": 0.14650059193372728, "num_tokens": 4638816.0, "step": 1580 }, { "entropy": 5.548513317108155, "epoch": 0.049706777056480696, "grad_norm": 0.99609375, "learning_rate": 0.00045921906788137123, "loss": 5.4659, "mean_token_accuracy": 0.1494405135512352, "num_tokens": 4653170.0, "step": 1585 }, { "entropy": 5.642472791671753, "epoch": 0.04986358076959262, "grad_norm": 1.1015625, "learning_rate": 0.00045854014336228115, "loss": 5.5829, "mean_token_accuracy": 0.15180073976516723, "num_tokens": 4668809.0, "step": 1590 }, { "entropy": 5.599613761901855, "epoch": 0.05002038448270455, "grad_norm": 1.0078125, "learning_rate": 0.00045785618699744615, "loss": 5.5059, "mean_token_accuracy": 0.15332444459199907, "num_tokens": 4682695.0, "step": 1595 }, { "entropy": 5.674669170379639, "epoch": 0.05017718819581648, "grad_norm": 0.95703125, "learning_rate": 0.00045716721753787543, "loss": 5.5992, "mean_token_accuracy": 0.1441897891461849, "num_tokens": 4697566.0, "step": 1600 }, { "entropy": 5.615376663208008, "epoch": 0.050333991908928406, "grad_norm": 1.0625, "learning_rate": 0.0004564732538720148, "loss": 5.5736, "mean_token_accuracy": 0.15400946587324144, "num_tokens": 4713419.0, "step": 1605 }, { "entropy": 5.671611595153808, "epoch": 0.05049079562204033, "grad_norm": 0.91015625, "learning_rate": 0.00045577431502522877, "loss": 5.6863, "mean_token_accuracy": 0.14871388226747512, "num_tokens": 4728407.0, "step": 1610 }, { "entropy": 5.560825538635254, "epoch": 0.050647599335152255, "grad_norm": 0.99609375, "learning_rate": 0.0004550704201592787, "loss": 5.466, "mean_token_accuracy": 0.16336653530597686, "num_tokens": 4742860.0, "step": 1615 }, { "entropy": 5.664677143096924, "epoch": 0.05080440304826418, "grad_norm": 1.0, "learning_rate": 0.0004543615885717981, "loss": 5.5615, "mean_token_accuracy": 0.1503000631928444, "num_tokens": 4757249.0, "step": 1620 }, { "entropy": 5.638796377182007, "epoch": 0.05096120676137611, "grad_norm": 0.96875, "learning_rate": 0.00045364783969576296, "loss": 5.595, "mean_token_accuracy": 0.14745519459247589, "num_tokens": 4772147.0, "step": 1625 }, { "entropy": 5.648314714431763, "epoch": 0.05111801047448804, "grad_norm": 0.9609375, "learning_rate": 0.0004529291930989592, "loss": 5.5434, "mean_token_accuracy": 0.15235277265310287, "num_tokens": 4784627.0, "step": 1630 }, { "entropy": 5.654696750640869, "epoch": 0.051274814187599965, "grad_norm": 0.95703125, "learning_rate": 0.0004522056684834464, "loss": 5.6175, "mean_token_accuracy": 0.14991778507828712, "num_tokens": 4799817.0, "step": 1635 }, { "entropy": 5.680637693405151, "epoch": 0.051431617900711886, "grad_norm": 0.98046875, "learning_rate": 0.0004514772856850173, "loss": 5.5911, "mean_token_accuracy": 0.14739327132701874, "num_tokens": 4813178.0, "step": 1640 }, { "entropy": 5.5131996154785154, "epoch": 0.051588421613823814, "grad_norm": 0.89453125, "learning_rate": 0.0004507440646726542, "loss": 5.4405, "mean_token_accuracy": 0.16182133853435515, "num_tokens": 4827652.0, "step": 1645 }, { "entropy": 5.645104265213012, "epoch": 0.05174522532693574, "grad_norm": 1.015625, "learning_rate": 0.0004500060255479818, "loss": 5.552, "mean_token_accuracy": 0.14753093272447587, "num_tokens": 4839978.0, "step": 1650 }, { "entropy": 5.603615236282349, "epoch": 0.05190202904004767, "grad_norm": 0.96875, "learning_rate": 0.0004492631885447151, "loss": 5.5562, "mean_token_accuracy": 0.15101770609617232, "num_tokens": 4854612.0, "step": 1655 }, { "entropy": 5.616217136383057, "epoch": 0.052058832753159597, "grad_norm": 0.99609375, "learning_rate": 0.00044851557402810616, "loss": 5.5119, "mean_token_accuracy": 0.14714247435331346, "num_tokens": 4869188.0, "step": 1660 }, { "entropy": 5.665006017684936, "epoch": 0.052215636466271524, "grad_norm": 0.93359375, "learning_rate": 0.00044776320249438444, "loss": 5.5835, "mean_token_accuracy": 0.15070897787809373, "num_tokens": 4882938.0, "step": 1665 }, { "entropy": 5.568822383880615, "epoch": 0.052372440179383445, "grad_norm": 0.9765625, "learning_rate": 0.00044700609457019565, "loss": 5.4814, "mean_token_accuracy": 0.1596212700009346, "num_tokens": 4897999.0, "step": 1670 }, { "entropy": 5.672763919830322, "epoch": 0.05252924389249537, "grad_norm": 0.9453125, "learning_rate": 0.0004462442710120359, "loss": 5.6476, "mean_token_accuracy": 0.14675597250461578, "num_tokens": 4912664.0, "step": 1675 }, { "entropy": 5.588794136047364, "epoch": 0.0526860476056073, "grad_norm": 0.890625, "learning_rate": 0.000445477752705683, "loss": 5.5276, "mean_token_accuracy": 0.15189943909645082, "num_tokens": 4928610.0, "step": 1680 }, { "entropy": 5.594437313079834, "epoch": 0.05284285131871923, "grad_norm": 0.984375, "learning_rate": 0.00044470656066562336, "loss": 5.4753, "mean_token_accuracy": 0.16013056188821792, "num_tokens": 4942044.0, "step": 1685 }, { "entropy": 5.559233140945435, "epoch": 0.052999655031831155, "grad_norm": 0.96484375, "learning_rate": 0.0004439307160344765, "loss": 5.5138, "mean_token_accuracy": 0.15794520378112792, "num_tokens": 4955380.0, "step": 1690 }, { "entropy": 5.6098854541778564, "epoch": 0.05315645874494308, "grad_norm": 0.98828125, "learning_rate": 0.00044315024008241473, "loss": 5.503, "mean_token_accuracy": 0.15251349955797194, "num_tokens": 4968707.0, "step": 1695 }, { "entropy": 5.52094841003418, "epoch": 0.053313262458055004, "grad_norm": 1.046875, "learning_rate": 0.0004423651542065806, "loss": 5.583, "mean_token_accuracy": 0.15648411214351654, "num_tokens": 4982462.0, "step": 1700 }, { "entropy": 5.645457363128662, "epoch": 0.05347006617116693, "grad_norm": 0.99609375, "learning_rate": 0.00044157547993050006, "loss": 5.4863, "mean_token_accuracy": 0.1566183090209961, "num_tokens": 4996556.0, "step": 1705 }, { "entropy": 5.49437985420227, "epoch": 0.05362686988427886, "grad_norm": 0.94140625, "learning_rate": 0.00044078123890349227, "loss": 5.3734, "mean_token_accuracy": 0.1659584552049637, "num_tokens": 5009338.0, "step": 1710 }, { "entropy": 5.506396293640137, "epoch": 0.05378367359739079, "grad_norm": 1.03125, "learning_rate": 0.00043998245290007606, "loss": 5.5344, "mean_token_accuracy": 0.1501413643360138, "num_tokens": 5024586.0, "step": 1715 }, { "entropy": 5.665162134170532, "epoch": 0.053940477310502714, "grad_norm": 0.9765625, "learning_rate": 0.00043917914381937323, "loss": 5.4667, "mean_token_accuracy": 0.15752882063388823, "num_tokens": 5038807.0, "step": 1720 }, { "entropy": 5.454025506973267, "epoch": 0.05409728102361464, "grad_norm": 1.0390625, "learning_rate": 0.00043837133368450815, "loss": 5.5053, "mean_token_accuracy": 0.15899511128664018, "num_tokens": 5051883.0, "step": 1725 }, { "entropy": 5.630865240097046, "epoch": 0.05425408473672656, "grad_norm": 0.92578125, "learning_rate": 0.0004375590446420037, "loss": 5.432, "mean_token_accuracy": 0.15725974589586258, "num_tokens": 5067601.0, "step": 1730 }, { "entropy": 5.523392963409424, "epoch": 0.05441088844983849, "grad_norm": 0.9609375, "learning_rate": 0.0004367422989611743, "loss": 5.4978, "mean_token_accuracy": 0.15299071222543717, "num_tokens": 5083331.0, "step": 1735 }, { "entropy": 5.6384416103363035, "epoch": 0.05456769216295042, "grad_norm": 0.98046875, "learning_rate": 0.0004359211190335153, "loss": 5.5192, "mean_token_accuracy": 0.15755498856306077, "num_tokens": 5098192.0, "step": 1740 }, { "entropy": 5.597709608078003, "epoch": 0.054724495876062346, "grad_norm": 0.9296875, "learning_rate": 0.00043509552737208923, "loss": 5.4884, "mean_token_accuracy": 0.15653315633535386, "num_tokens": 5114763.0, "step": 1745 }, { "entropy": 5.558363723754883, "epoch": 0.05488129958917427, "grad_norm": 1.078125, "learning_rate": 0.00043426554661090853, "loss": 5.5527, "mean_token_accuracy": 0.15365547090768814, "num_tokens": 5128419.0, "step": 1750 }, { "entropy": 5.5542590618133545, "epoch": 0.0550381033022862, "grad_norm": 0.8671875, "learning_rate": 0.00043343119950431516, "loss": 5.4396, "mean_token_accuracy": 0.16456325799226762, "num_tokens": 5142470.0, "step": 1755 }, { "entropy": 5.544502449035645, "epoch": 0.05519490701539812, "grad_norm": 0.93359375, "learning_rate": 0.00043259250892635644, "loss": 5.4659, "mean_token_accuracy": 0.15672120749950408, "num_tokens": 5157122.0, "step": 1760 }, { "entropy": 5.574978923797607, "epoch": 0.05535171072851005, "grad_norm": 1.046875, "learning_rate": 0.0004317494978701582, "loss": 5.4053, "mean_token_accuracy": 0.16559310555458068, "num_tokens": 5169717.0, "step": 1765 }, { "entropy": 5.495390892028809, "epoch": 0.05550851444162198, "grad_norm": 0.953125, "learning_rate": 0.0004309021894472943, "loss": 5.5142, "mean_token_accuracy": 0.15167766213417053, "num_tokens": 5185024.0, "step": 1770 }, { "entropy": 5.585932874679566, "epoch": 0.055665318154733905, "grad_norm": 1.0234375, "learning_rate": 0.0004300506068871534, "loss": 5.4923, "mean_token_accuracy": 0.16034476310014725, "num_tokens": 5199670.0, "step": 1775 }, { "entropy": 5.567832994461059, "epoch": 0.05582212186784583, "grad_norm": 0.91796875, "learning_rate": 0.00042919477353630135, "loss": 5.4805, "mean_token_accuracy": 0.1543068364262581, "num_tokens": 5213033.0, "step": 1780 }, { "entropy": 5.524223852157593, "epoch": 0.05597892558095776, "grad_norm": 0.91015625, "learning_rate": 0.000428334712857842, "loss": 5.4247, "mean_token_accuracy": 0.16250368505716323, "num_tokens": 5227857.0, "step": 1785 }, { "entropy": 5.496453952789307, "epoch": 0.05613572929406968, "grad_norm": 1.0078125, "learning_rate": 0.00042747044843077304, "loss": 5.4351, "mean_token_accuracy": 0.15133761167526244, "num_tokens": 5244198.0, "step": 1790 }, { "entropy": 5.47076268196106, "epoch": 0.05629253300718161, "grad_norm": 0.96484375, "learning_rate": 0.00042660200394934047, "loss": 5.3509, "mean_token_accuracy": 0.16515569239854813, "num_tokens": 5259603.0, "step": 1795 }, { "entropy": 5.541412210464477, "epoch": 0.056449336720293536, "grad_norm": 0.9140625, "learning_rate": 0.00042572940322238844, "loss": 5.4829, "mean_token_accuracy": 0.15599187165498735, "num_tokens": 5275078.0, "step": 1800 }, { "entropy": 5.515583229064942, "epoch": 0.056606140433405464, "grad_norm": 1.0625, "learning_rate": 0.00042485267017270664, "loss": 5.4015, "mean_token_accuracy": 0.15718774795532225, "num_tokens": 5288614.0, "step": 1805 }, { "entropy": 5.5446430206298825, "epoch": 0.05676294414651739, "grad_norm": 0.87109375, "learning_rate": 0.0004239718288363745, "loss": 5.4667, "mean_token_accuracy": 0.15240791141986848, "num_tokens": 5306437.0, "step": 1810 }, { "entropy": 5.567139291763306, "epoch": 0.05691974785962932, "grad_norm": 0.93359375, "learning_rate": 0.0004230869033621023, "loss": 5.5704, "mean_token_accuracy": 0.15007242411375046, "num_tokens": 5320750.0, "step": 1815 }, { "entropy": 5.589888191223144, "epoch": 0.05707655157274124, "grad_norm": 1.046875, "learning_rate": 0.0004221979180105688, "loss": 5.5042, "mean_token_accuracy": 0.15344637930393218, "num_tokens": 5334329.0, "step": 1820 }, { "entropy": 5.502320384979248, "epoch": 0.05723335528585317, "grad_norm": 0.95703125, "learning_rate": 0.00042130489715375645, "loss": 5.3988, "mean_token_accuracy": 0.16416364461183547, "num_tokens": 5348480.0, "step": 1825 }, { "entropy": 5.4765801429748535, "epoch": 0.057390158998965095, "grad_norm": 1.0234375, "learning_rate": 0.00042040786527428335, "loss": 5.3333, "mean_token_accuracy": 0.16420571655035018, "num_tokens": 5363805.0, "step": 1830 }, { "entropy": 5.436630821228027, "epoch": 0.05754696271207702, "grad_norm": 0.95703125, "learning_rate": 0.0004195068469647315, "loss": 5.3937, "mean_token_accuracy": 0.1599104017019272, "num_tokens": 5377536.0, "step": 1835 }, { "entropy": 5.564624500274658, "epoch": 0.05770376642518895, "grad_norm": 0.89453125, "learning_rate": 0.00041860186692697297, "loss": 5.4683, "mean_token_accuracy": 0.15769407153129578, "num_tokens": 5393066.0, "step": 1840 }, { "entropy": 5.546552610397339, "epoch": 0.05786057013830088, "grad_norm": 0.90234375, "learning_rate": 0.00041769294997149264, "loss": 5.3845, "mean_token_accuracy": 0.16675785779953003, "num_tokens": 5406260.0, "step": 1845 }, { "entropy": 5.554831600189209, "epoch": 0.0580173738514128, "grad_norm": 0.99609375, "learning_rate": 0.0004167801210167081, "loss": 5.4875, "mean_token_accuracy": 0.15391432791948317, "num_tokens": 5421238.0, "step": 1850 }, { "entropy": 5.410466814041138, "epoch": 0.058174177564524726, "grad_norm": 0.9453125, "learning_rate": 0.0004158634050882861, "loss": 5.3638, "mean_token_accuracy": 0.1567578598856926, "num_tokens": 5436752.0, "step": 1855 }, { "entropy": 5.50055193901062, "epoch": 0.058330981277636654, "grad_norm": 0.9375, "learning_rate": 0.0004149428273184569, "loss": 5.4708, "mean_token_accuracy": 0.15318142026662826, "num_tokens": 5453104.0, "step": 1860 }, { "entropy": 5.572831535339356, "epoch": 0.05848778499074858, "grad_norm": 0.953125, "learning_rate": 0.0004140184129453253, "loss": 5.4378, "mean_token_accuracy": 0.15755112171173097, "num_tokens": 5467277.0, "step": 1865 }, { "entropy": 5.463003301620484, "epoch": 0.05864458870386051, "grad_norm": 1.0, "learning_rate": 0.000413090187312178, "loss": 5.3706, "mean_token_accuracy": 0.15910724699497222, "num_tokens": 5482366.0, "step": 1870 }, { "entropy": 5.539995718002319, "epoch": 0.05880139241697244, "grad_norm": 0.9140625, "learning_rate": 0.0004121581758667898, "loss": 5.4547, "mean_token_accuracy": 0.15378581136465072, "num_tokens": 5497444.0, "step": 1875 }, { "entropy": 5.549549913406372, "epoch": 0.05895819613008436, "grad_norm": 1.0078125, "learning_rate": 0.00041122240416072533, "loss": 5.4401, "mean_token_accuracy": 0.158327154815197, "num_tokens": 5510313.0, "step": 1880 }, { "entropy": 5.460352230072021, "epoch": 0.059114999843196285, "grad_norm": 1.0, "learning_rate": 0.0004102828978486385, "loss": 5.4253, "mean_token_accuracy": 0.16176005005836486, "num_tokens": 5525084.0, "step": 1885 }, { "entropy": 5.481763887405395, "epoch": 0.05927180355630821, "grad_norm": 1.1484375, "learning_rate": 0.0004093396826875695, "loss": 5.3245, "mean_token_accuracy": 0.16924351155757905, "num_tokens": 5538274.0, "step": 1890 }, { "entropy": 5.577309608459473, "epoch": 0.05942860726942014, "grad_norm": 0.88671875, "learning_rate": 0.00040839278453623837, "loss": 5.4952, "mean_token_accuracy": 0.15003783777356147, "num_tokens": 5554272.0, "step": 1895 }, { "entropy": 5.522237920761109, "epoch": 0.05958541098253207, "grad_norm": 0.97265625, "learning_rate": 0.0004074422293543363, "loss": 5.4811, "mean_token_accuracy": 0.16081224530935287, "num_tokens": 5569006.0, "step": 1900 }, { "entropy": 5.49424934387207, "epoch": 0.059742214695643996, "grad_norm": 0.9765625, "learning_rate": 0.0004064880432018137, "loss": 5.4787, "mean_token_accuracy": 0.16519856750965117, "num_tokens": 5581573.0, "step": 1905 }, { "entropy": 5.609365940093994, "epoch": 0.059899018408755916, "grad_norm": 1.140625, "learning_rate": 0.00040553025223816615, "loss": 5.5393, "mean_token_accuracy": 0.1521975040435791, "num_tokens": 5596483.0, "step": 1910 }, { "entropy": 5.554807329177857, "epoch": 0.060055822121867844, "grad_norm": 1.0859375, "learning_rate": 0.00040456888272171653, "loss": 5.4246, "mean_token_accuracy": 0.1567584291100502, "num_tokens": 5609804.0, "step": 1915 }, { "entropy": 5.5278465270996096, "epoch": 0.06021262583497977, "grad_norm": 0.96875, "learning_rate": 0.00040360396100889577, "loss": 5.5035, "mean_token_accuracy": 0.15543259531259537, "num_tokens": 5623651.0, "step": 1920 }, { "entropy": 5.511450386047363, "epoch": 0.0603694295480917, "grad_norm": 0.94921875, "learning_rate": 0.0004026355135535202, "loss": 5.4059, "mean_token_accuracy": 0.16002338379621506, "num_tokens": 5637973.0, "step": 1925 }, { "entropy": 5.48571138381958, "epoch": 0.06052623326120363, "grad_norm": 0.890625, "learning_rate": 0.000401663566906066, "loss": 5.5188, "mean_token_accuracy": 0.15829627513885497, "num_tokens": 5653942.0, "step": 1930 }, { "entropy": 5.569460535049439, "epoch": 0.060683036974315555, "grad_norm": 1.0078125, "learning_rate": 0.00040068814771294134, "loss": 5.4165, "mean_token_accuracy": 0.1597804084420204, "num_tokens": 5668894.0, "step": 1935 }, { "entropy": 5.483691549301147, "epoch": 0.060839840687427475, "grad_norm": 0.9921875, "learning_rate": 0.0003997092827157562, "loss": 5.3076, "mean_token_accuracy": 0.16481563746929168, "num_tokens": 5683529.0, "step": 1940 }, { "entropy": 5.411105680465698, "epoch": 0.0609966444005394, "grad_norm": 0.9375, "learning_rate": 0.000398726998750589, "loss": 5.3979, "mean_token_accuracy": 0.16174078732728958, "num_tokens": 5698624.0, "step": 1945 }, { "entropy": 5.516795873641968, "epoch": 0.06115344811365133, "grad_norm": 0.99609375, "learning_rate": 0.00039774132274725076, "loss": 5.3894, "mean_token_accuracy": 0.15667195618152618, "num_tokens": 5711924.0, "step": 1950 }, { "entropy": 5.5290087223052975, "epoch": 0.06131025182676326, "grad_norm": 1.0625, "learning_rate": 0.00039675228172854707, "loss": 5.4199, "mean_token_accuracy": 0.16616879552602767, "num_tokens": 5726094.0, "step": 1955 }, { "entropy": 5.541859483718872, "epoch": 0.061467055539875186, "grad_norm": 0.94921875, "learning_rate": 0.0003957599028095371, "loss": 5.4431, "mean_token_accuracy": 0.16165485680103303, "num_tokens": 5741372.0, "step": 1960 }, { "entropy": 5.532270002365112, "epoch": 0.061623859252987113, "grad_norm": 0.9921875, "learning_rate": 0.00039476421319679017, "loss": 5.4086, "mean_token_accuracy": 0.16190743297338486, "num_tokens": 5756986.0, "step": 1965 }, { "entropy": 5.437832164764404, "epoch": 0.061780662966099034, "grad_norm": 0.92578125, "learning_rate": 0.00039376524018764, "loss": 5.3666, "mean_token_accuracy": 0.16611046195030213, "num_tokens": 5770209.0, "step": 1970 }, { "entropy": 5.436462259292602, "epoch": 0.06193746667921096, "grad_norm": 1.0078125, "learning_rate": 0.00039276301116943616, "loss": 5.3436, "mean_token_accuracy": 0.16721372902393342, "num_tokens": 5784315.0, "step": 1975 }, { "entropy": 5.456621170043945, "epoch": 0.06209427039232289, "grad_norm": 0.9609375, "learning_rate": 0.0003917575536187936, "loss": 5.3639, "mean_token_accuracy": 0.16664596050977706, "num_tokens": 5799298.0, "step": 1980 }, { "entropy": 5.469586610794067, "epoch": 0.06225107410543482, "grad_norm": 0.93359375, "learning_rate": 0.00039074889510083894, "loss": 5.3858, "mean_token_accuracy": 0.16036681234836578, "num_tokens": 5814394.0, "step": 1985 }, { "entropy": 5.520676326751709, "epoch": 0.062407877818546745, "grad_norm": 1.03125, "learning_rate": 0.00038973706326845495, "loss": 5.4764, "mean_token_accuracy": 0.1597631722688675, "num_tokens": 5829537.0, "step": 1990 }, { "entropy": 5.514448499679565, "epoch": 0.06256468153165867, "grad_norm": 0.8984375, "learning_rate": 0.0003887220858615225, "loss": 5.4459, "mean_token_accuracy": 0.15997925251722336, "num_tokens": 5843452.0, "step": 1995 }, { "entropy": 5.548208999633789, "epoch": 0.0627214852447706, "grad_norm": 0.9375, "learning_rate": 0.0003877039907061597, "loss": 5.4272, "mean_token_accuracy": 0.15218425393104554, "num_tokens": 5857283.0, "step": 2000 }, { "entropy": 5.423493385314941, "epoch": 0.06287828895788253, "grad_norm": 0.9453125, "learning_rate": 0.0003866828057139598, "loss": 5.348, "mean_token_accuracy": 0.16844379752874375, "num_tokens": 5872202.0, "step": 2005 }, { "entropy": 5.522428369522094, "epoch": 0.06303509267099446, "grad_norm": 0.99609375, "learning_rate": 0.00038565855888122503, "loss": 5.4183, "mean_token_accuracy": 0.15921104848384857, "num_tokens": 5885593.0, "step": 2010 }, { "entropy": 5.485387945175171, "epoch": 0.06319189638410637, "grad_norm": 0.9609375, "learning_rate": 0.00038463127828819975, "loss": 5.3541, "mean_token_accuracy": 0.16191442757844926, "num_tokens": 5899446.0, "step": 2015 }, { "entropy": 5.489001369476318, "epoch": 0.0633487000972183, "grad_norm": 0.90625, "learning_rate": 0.00038360099209830043, "loss": 5.351, "mean_token_accuracy": 0.1628739595413208, "num_tokens": 5916710.0, "step": 2020 }, { "entropy": 5.440134334564209, "epoch": 0.06350550381033022, "grad_norm": 0.90234375, "learning_rate": 0.0003825677285573433, "loss": 5.432, "mean_token_accuracy": 0.1569529414176941, "num_tokens": 5933406.0, "step": 2025 }, { "entropy": 5.470552062988281, "epoch": 0.06366230752344215, "grad_norm": 0.95703125, "learning_rate": 0.00038153151599277027, "loss": 5.3142, "mean_token_accuracy": 0.16807927638292314, "num_tokens": 5947305.0, "step": 2030 }, { "entropy": 5.413301801681518, "epoch": 0.06381911123655408, "grad_norm": 0.9296875, "learning_rate": 0.0003804923828128723, "loss": 5.4033, "mean_token_accuracy": 0.1616388663649559, "num_tokens": 5964244.0, "step": 2035 }, { "entropy": 5.560881328582764, "epoch": 0.06397591494966601, "grad_norm": 0.98046875, "learning_rate": 0.0003794503575060104, "loss": 5.4285, "mean_token_accuracy": 0.16694391518831253, "num_tokens": 5979126.0, "step": 2040 }, { "entropy": 5.386257219314575, "epoch": 0.06413271866277793, "grad_norm": 1.0546875, "learning_rate": 0.00037840546863983484, "loss": 5.2873, "mean_token_accuracy": 0.17639683783054352, "num_tokens": 5991237.0, "step": 2045 }, { "entropy": 5.490569543838501, "epoch": 0.06428952237588986, "grad_norm": 1.0, "learning_rate": 0.0003773577448605015, "loss": 5.4583, "mean_token_accuracy": 0.1567297637462616, "num_tokens": 6005763.0, "step": 2050 }, { "entropy": 5.600405073165893, "epoch": 0.06444632608900179, "grad_norm": 0.98046875, "learning_rate": 0.0003763072148918872, "loss": 5.4518, "mean_token_accuracy": 0.1669362559914589, "num_tokens": 6019246.0, "step": 2055 }, { "entropy": 5.475091743469238, "epoch": 0.06460312980211372, "grad_norm": 0.9453125, "learning_rate": 0.0003752539075348017, "loss": 5.394, "mean_token_accuracy": 0.16765405088663102, "num_tokens": 6033353.0, "step": 2060 }, { "entropy": 5.4313554763793945, "epoch": 0.06475993351522565, "grad_norm": 1.0078125, "learning_rate": 0.00037419785166619817, "loss": 5.3058, "mean_token_accuracy": 0.164634045958519, "num_tokens": 6047396.0, "step": 2065 }, { "entropy": 5.438332796096802, "epoch": 0.06491673722833757, "grad_norm": 1.0625, "learning_rate": 0.0003731390762383818, "loss": 5.3261, "mean_token_accuracy": 0.16622865200042725, "num_tokens": 6059997.0, "step": 2070 }, { "entropy": 5.47605676651001, "epoch": 0.06507354094144949, "grad_norm": 0.8984375, "learning_rate": 0.0003720776102782158, "loss": 5.4121, "mean_token_accuracy": 0.1672607406973839, "num_tokens": 6076310.0, "step": 2075 }, { "entropy": 5.506420993804932, "epoch": 0.06523034465456141, "grad_norm": 1.03125, "learning_rate": 0.00037101348288632555, "loss": 5.4357, "mean_token_accuracy": 0.16408559679985046, "num_tokens": 6089342.0, "step": 2080 }, { "entropy": 5.500313711166382, "epoch": 0.06538714836767334, "grad_norm": 0.94140625, "learning_rate": 0.0003699467232363012, "loss": 5.4016, "mean_token_accuracy": 0.16145640909671782, "num_tokens": 6104146.0, "step": 2085 }, { "entropy": 5.442271518707275, "epoch": 0.06554395208078527, "grad_norm": 1.0078125, "learning_rate": 0.0003688773605738973, "loss": 5.2839, "mean_token_accuracy": 0.1639725610613823, "num_tokens": 6118856.0, "step": 2090 }, { "entropy": 5.418323945999146, "epoch": 0.0657007557938972, "grad_norm": 0.94921875, "learning_rate": 0.00036780542421623134, "loss": 5.2861, "mean_token_accuracy": 0.16729723662137985, "num_tokens": 6132745.0, "step": 2095 }, { "entropy": 5.440960121154785, "epoch": 0.06585755950700913, "grad_norm": 0.9609375, "learning_rate": 0.0003667309435509802, "loss": 5.4028, "mean_token_accuracy": 0.16144924014806747, "num_tokens": 6148961.0, "step": 2100 }, { "entropy": 5.454626750946045, "epoch": 0.06601436322012105, "grad_norm": 0.9921875, "learning_rate": 0.0003656539480355741, "loss": 5.2672, "mean_token_accuracy": 0.17965516299009324, "num_tokens": 6163253.0, "step": 2105 }, { "entropy": 5.343049764633179, "epoch": 0.06617116693323298, "grad_norm": 0.8515625, "learning_rate": 0.0003645744671963891, "loss": 5.3038, "mean_token_accuracy": 0.16757653951644896, "num_tokens": 6177629.0, "step": 2110 }, { "entropy": 5.498579788208008, "epoch": 0.06632797064634491, "grad_norm": 1.03125, "learning_rate": 0.0003634925306279376, "loss": 5.4428, "mean_token_accuracy": 0.16230330765247344, "num_tokens": 6192102.0, "step": 2115 }, { "entropy": 5.5992106914520265, "epoch": 0.06648477435945684, "grad_norm": 0.88671875, "learning_rate": 0.0003624081679920574, "loss": 5.4747, "mean_token_accuracy": 0.15547768026590347, "num_tokens": 6209005.0, "step": 2120 }, { "entropy": 5.49295563697815, "epoch": 0.06664157807256876, "grad_norm": 0.91015625, "learning_rate": 0.0003613214090170977, "loss": 5.3607, "mean_token_accuracy": 0.15989728271961212, "num_tokens": 6223134.0, "step": 2125 }, { "entropy": 5.478620433807373, "epoch": 0.06679838178568069, "grad_norm": 0.95703125, "learning_rate": 0.0003602322834971048, "loss": 5.4698, "mean_token_accuracy": 0.1545787662267685, "num_tokens": 6238474.0, "step": 2130 }, { "entropy": 5.428533124923706, "epoch": 0.0669551854987926, "grad_norm": 1.015625, "learning_rate": 0.0003591408212910051, "loss": 5.3, "mean_token_accuracy": 0.16924979537725449, "num_tokens": 6253296.0, "step": 2135 }, { "entropy": 5.48041467666626, "epoch": 0.06711198921190453, "grad_norm": 0.8671875, "learning_rate": 0.0003580470523217863, "loss": 5.3992, "mean_token_accuracy": 0.1572578251361847, "num_tokens": 6267239.0, "step": 2140 }, { "entropy": 5.5361556053161625, "epoch": 0.06726879292501646, "grad_norm": 1.0390625, "learning_rate": 0.0003569510065756771, "loss": 5.3284, "mean_token_accuracy": 0.16762975305318834, "num_tokens": 6281887.0, "step": 2145 }, { "entropy": 5.402921390533447, "epoch": 0.06742559663812839, "grad_norm": 1.078125, "learning_rate": 0.0003558527141013254, "loss": 5.2977, "mean_token_accuracy": 0.17072063982486724, "num_tokens": 6295972.0, "step": 2150 }, { "entropy": 5.447606754302979, "epoch": 0.06758240035124032, "grad_norm": 0.95703125, "learning_rate": 0.0003547522050089742, "loss": 5.3777, "mean_token_accuracy": 0.16163324415683747, "num_tokens": 6311624.0, "step": 2155 }, { "entropy": 5.480730867385864, "epoch": 0.06773920406435224, "grad_norm": 0.93359375, "learning_rate": 0.00035364950946963606, "loss": 5.3373, "mean_token_accuracy": 0.17015375643968583, "num_tokens": 6326691.0, "step": 2160 }, { "entropy": 5.453211641311645, "epoch": 0.06789600777746417, "grad_norm": 0.9296875, "learning_rate": 0.0003525446577142663, "loss": 5.4, "mean_token_accuracy": 0.16562338769435883, "num_tokens": 6340656.0, "step": 2165 }, { "entropy": 5.415660095214844, "epoch": 0.0680528114905761, "grad_norm": 1.015625, "learning_rate": 0.00035143768003293395, "loss": 5.3165, "mean_token_accuracy": 0.16582199484109877, "num_tokens": 6354504.0, "step": 2170 }, { "entropy": 5.484099197387695, "epoch": 0.06820961520368803, "grad_norm": 0.8984375, "learning_rate": 0.0003503286067739913, "loss": 5.434, "mean_token_accuracy": 0.16360560953617095, "num_tokens": 6370042.0, "step": 2175 }, { "entropy": 5.540794420242309, "epoch": 0.06836641891679995, "grad_norm": 0.9296875, "learning_rate": 0.00034921746834324193, "loss": 5.4698, "mean_token_accuracy": 0.16043284088373183, "num_tokens": 6385413.0, "step": 2180 }, { "entropy": 5.499316692352295, "epoch": 0.06852322262991188, "grad_norm": 1.03125, "learning_rate": 0.0003481042952031072, "loss": 5.3512, "mean_token_accuracy": 0.16809642761945726, "num_tokens": 6400468.0, "step": 2185 }, { "entropy": 5.459881019592285, "epoch": 0.06868002634302381, "grad_norm": 0.98046875, "learning_rate": 0.0003469891178717911, "loss": 5.4017, "mean_token_accuracy": 0.16188558787107468, "num_tokens": 6414720.0, "step": 2190 }, { "entropy": 5.51483473777771, "epoch": 0.06883683005613572, "grad_norm": 1.0625, "learning_rate": 0.0003458719669224436, "loss": 5.4079, "mean_token_accuracy": 0.1607223004102707, "num_tokens": 6429678.0, "step": 2195 }, { "entropy": 5.382878208160401, "epoch": 0.06899363376924765, "grad_norm": 1.03125, "learning_rate": 0.0003447528729823221, "loss": 5.2761, "mean_token_accuracy": 0.17314398288726807, "num_tokens": 6442481.0, "step": 2200 }, { "entropy": 5.489427852630615, "epoch": 0.06915043748235958, "grad_norm": 0.90625, "learning_rate": 0.0003436318667319525, "loss": 5.445, "mean_token_accuracy": 0.15897778123617173, "num_tokens": 6458397.0, "step": 2205 }, { "entropy": 5.430074548721313, "epoch": 0.0693072411954715, "grad_norm": 0.91796875, "learning_rate": 0.00034250897890428716, "loss": 5.234, "mean_token_accuracy": 0.17394062131643295, "num_tokens": 6471874.0, "step": 2210 }, { "entropy": 5.454744720458985, "epoch": 0.06946404490858343, "grad_norm": 1.0234375, "learning_rate": 0.0003413842402838633, "loss": 5.4338, "mean_token_accuracy": 0.16406074166297913, "num_tokens": 6485719.0, "step": 2215 }, { "entropy": 5.4392256259918215, "epoch": 0.06962084862169536, "grad_norm": 1.0, "learning_rate": 0.00034025768170595834, "loss": 5.2209, "mean_token_accuracy": 0.17636980563402177, "num_tokens": 6500368.0, "step": 2220 }, { "entropy": 5.4150715351104735, "epoch": 0.06977765233480729, "grad_norm": 0.83984375, "learning_rate": 0.0003391293340557446, "loss": 5.2868, "mean_token_accuracy": 0.1690964236855507, "num_tokens": 6516829.0, "step": 2225 }, { "entropy": 5.421437788009643, "epoch": 0.06993445604791922, "grad_norm": 0.91015625, "learning_rate": 0.0003379992282674431, "loss": 5.3989, "mean_token_accuracy": 0.16200968623161316, "num_tokens": 6532550.0, "step": 2230 }, { "entropy": 5.415826034545899, "epoch": 0.07009125976103114, "grad_norm": 0.984375, "learning_rate": 0.0003368673953234749, "loss": 5.3133, "mean_token_accuracy": 0.17040503472089769, "num_tokens": 6547899.0, "step": 2235 }, { "entropy": 5.430303144454956, "epoch": 0.07024806347414307, "grad_norm": 1.0078125, "learning_rate": 0.00033573386625361176, "loss": 5.2606, "mean_token_accuracy": 0.17038411349058152, "num_tokens": 6564150.0, "step": 2240 }, { "entropy": 5.394917631149292, "epoch": 0.070404867187255, "grad_norm": 1.0390625, "learning_rate": 0.00033459867213412567, "loss": 5.2915, "mean_token_accuracy": 0.17163457870483398, "num_tokens": 6579795.0, "step": 2245 }, { "entropy": 5.3988746166229244, "epoch": 0.07056167090036693, "grad_norm": 1.0390625, "learning_rate": 0.000333461844086937, "loss": 5.3316, "mean_token_accuracy": 0.16311462223529816, "num_tokens": 6595974.0, "step": 2250 }, { "entropy": 5.435396146774292, "epoch": 0.07071847461347884, "grad_norm": 1.078125, "learning_rate": 0.00033232341327876097, "loss": 5.3441, "mean_token_accuracy": 0.17145417332649232, "num_tokens": 6610385.0, "step": 2255 }, { "entropy": 5.472650051116943, "epoch": 0.07087527832659077, "grad_norm": 0.96484375, "learning_rate": 0.0003311834109202531, "loss": 5.3341, "mean_token_accuracy": 0.17234935164451598, "num_tokens": 6625078.0, "step": 2260 }, { "entropy": 5.461251878738404, "epoch": 0.0710320820397027, "grad_norm": 1.09375, "learning_rate": 0.00033004186826515416, "loss": 5.2843, "mean_token_accuracy": 0.16021159738302232, "num_tokens": 6638390.0, "step": 2265 }, { "entropy": 5.407567644119263, "epoch": 0.07118888575281462, "grad_norm": 1.0390625, "learning_rate": 0.0003288988166094324, "loss": 5.3173, "mean_token_accuracy": 0.1673991709947586, "num_tokens": 6651721.0, "step": 2270 }, { "entropy": 5.420019674301147, "epoch": 0.07134568946592655, "grad_norm": 1.0625, "learning_rate": 0.00032775428729042656, "loss": 5.3146, "mean_token_accuracy": 0.1679161623120308, "num_tokens": 6667175.0, "step": 2275 }, { "entropy": 5.4789347648620605, "epoch": 0.07150249317903848, "grad_norm": 0.88671875, "learning_rate": 0.000326608311685986, "loss": 5.4204, "mean_token_accuracy": 0.16072620302438737, "num_tokens": 6682681.0, "step": 2280 }, { "entropy": 5.408848476409912, "epoch": 0.0716592968921504, "grad_norm": 0.96484375, "learning_rate": 0.0003254609212136108, "loss": 5.2796, "mean_token_accuracy": 0.1738677978515625, "num_tokens": 6697555.0, "step": 2285 }, { "entropy": 5.338811588287354, "epoch": 0.07181610060526233, "grad_norm": 1.015625, "learning_rate": 0.00032431214732959036, "loss": 5.1247, "mean_token_accuracy": 0.1783951237797737, "num_tokens": 6711298.0, "step": 2290 }, { "entropy": 5.344261217117309, "epoch": 0.07197290431837426, "grad_norm": 0.9921875, "learning_rate": 0.000323162021528141, "loss": 5.2803, "mean_token_accuracy": 0.17247539311647414, "num_tokens": 6726700.0, "step": 2295 }, { "entropy": 5.388544130325317, "epoch": 0.07212970803148619, "grad_norm": 0.98046875, "learning_rate": 0.00032201057534054264, "loss": 5.22, "mean_token_accuracy": 0.1700620949268341, "num_tokens": 6742399.0, "step": 2300 }, { "entropy": 5.38937554359436, "epoch": 0.07228651174459812, "grad_norm": 0.90625, "learning_rate": 0.00032085784033427414, "loss": 5.2808, "mean_token_accuracy": 0.17642759680747985, "num_tokens": 6756718.0, "step": 2305 }, { "entropy": 5.344116592407227, "epoch": 0.07244331545771004, "grad_norm": 0.953125, "learning_rate": 0.0003197038481121478, "loss": 5.1643, "mean_token_accuracy": 0.17331337034702302, "num_tokens": 6770915.0, "step": 2310 }, { "entropy": 5.406969451904297, "epoch": 0.07260011917082196, "grad_norm": 0.87890625, "learning_rate": 0.0003185486303114436, "loss": 5.3816, "mean_token_accuracy": 0.16489416509866714, "num_tokens": 6785250.0, "step": 2315 }, { "entropy": 5.440972566604614, "epoch": 0.07275692288393389, "grad_norm": 1.0625, "learning_rate": 0.0003173922186030409, "loss": 5.3405, "mean_token_accuracy": 0.16699183732271194, "num_tokens": 6800057.0, "step": 2320 }, { "entropy": 5.389354228973389, "epoch": 0.07291372659704581, "grad_norm": 1.078125, "learning_rate": 0.000316234644690551, "loss": 5.2416, "mean_token_accuracy": 0.1720912516117096, "num_tokens": 6814100.0, "step": 2325 }, { "entropy": 5.375819158554077, "epoch": 0.07307053031015774, "grad_norm": 1.1875, "learning_rate": 0.0003150759403094473, "loss": 5.19, "mean_token_accuracy": 0.18120640218257905, "num_tokens": 6826933.0, "step": 2330 }, { "entropy": 5.3471251964569095, "epoch": 0.07322733402326967, "grad_norm": 1.0078125, "learning_rate": 0.00031391613722619587, "loss": 5.1391, "mean_token_accuracy": 0.1811688706278801, "num_tokens": 6840279.0, "step": 2335 }, { "entropy": 5.294892311096191, "epoch": 0.0733841377363816, "grad_norm": 0.953125, "learning_rate": 0.000312755267237384, "loss": 5.1874, "mean_token_accuracy": 0.17787426859140396, "num_tokens": 6854987.0, "step": 2340 }, { "entropy": 5.373378753662109, "epoch": 0.07354094144949352, "grad_norm": 0.98046875, "learning_rate": 0.0003115933621688488, "loss": 5.2862, "mean_token_accuracy": 0.16869913190603256, "num_tokens": 6870559.0, "step": 2345 }, { "entropy": 5.493012857437134, "epoch": 0.07369774516260545, "grad_norm": 0.9765625, "learning_rate": 0.00031043045387480487, "loss": 5.3371, "mean_token_accuracy": 0.1719384267926216, "num_tokens": 6884027.0, "step": 2350 }, { "entropy": 5.370590591430664, "epoch": 0.07385454887571738, "grad_norm": 1.03125, "learning_rate": 0.0003092665742369703, "loss": 5.327, "mean_token_accuracy": 0.1683666244149208, "num_tokens": 6897276.0, "step": 2355 }, { "entropy": 5.350070476531982, "epoch": 0.07401135258882931, "grad_norm": 0.96484375, "learning_rate": 0.00030810175516369343, "loss": 5.2637, "mean_token_accuracy": 0.1680775538086891, "num_tokens": 6912054.0, "step": 2360 }, { "entropy": 5.490565586090088, "epoch": 0.07416815630194123, "grad_norm": 0.92578125, "learning_rate": 0.0003069360285890775, "loss": 5.3106, "mean_token_accuracy": 0.1678343892097473, "num_tokens": 6926864.0, "step": 2365 }, { "entropy": 5.410408210754395, "epoch": 0.07432496001505316, "grad_norm": 1.0546875, "learning_rate": 0.00030576942647210547, "loss": 5.2572, "mean_token_accuracy": 0.17173388600349426, "num_tokens": 6939946.0, "step": 2370 }, { "entropy": 5.332781887054443, "epoch": 0.07448176372816508, "grad_norm": 1.078125, "learning_rate": 0.00030460198079576355, "loss": 5.2163, "mean_token_accuracy": 0.1741424486041069, "num_tokens": 6953320.0, "step": 2375 }, { "entropy": 5.467446136474609, "epoch": 0.074638567441277, "grad_norm": 1.0234375, "learning_rate": 0.0003034337235661648, "loss": 5.3685, "mean_token_accuracy": 0.16742643415927888, "num_tokens": 6967118.0, "step": 2380 }, { "entropy": 5.401697874069214, "epoch": 0.07479537115438893, "grad_norm": 0.90234375, "learning_rate": 0.0003022646868116714, "loss": 5.2851, "mean_token_accuracy": 0.17228549867868423, "num_tokens": 6982949.0, "step": 2385 }, { "entropy": 5.350200128555298, "epoch": 0.07495217486750086, "grad_norm": 0.99609375, "learning_rate": 0.0003010949025820163, "loss": 5.2321, "mean_token_accuracy": 0.1780702739953995, "num_tokens": 6997750.0, "step": 2390 }, { "entropy": 5.374381256103516, "epoch": 0.07510897858061279, "grad_norm": 0.9765625, "learning_rate": 0.0002999244029474252, "loss": 5.2905, "mean_token_accuracy": 0.1750371888279915, "num_tokens": 7012581.0, "step": 2395 }, { "entropy": 5.446659708023072, "epoch": 0.07526578229372471, "grad_norm": 1.1796875, "learning_rate": 0.00029875321999773684, "loss": 5.239, "mean_token_accuracy": 0.1738226056098938, "num_tokens": 7026192.0, "step": 2400 }, { "entropy": 5.442251110076905, "epoch": 0.07542258600683664, "grad_norm": 1.0, "learning_rate": 0.00029758138584152333, "loss": 5.4083, "mean_token_accuracy": 0.1644318714737892, "num_tokens": 7040496.0, "step": 2405 }, { "entropy": 5.438568544387818, "epoch": 0.07557938971994857, "grad_norm": 0.94140625, "learning_rate": 0.0002964089326052102, "loss": 5.2907, "mean_token_accuracy": 0.17047504484653472, "num_tokens": 7055739.0, "step": 2410 }, { "entropy": 5.405134677886963, "epoch": 0.0757361934330605, "grad_norm": 0.95703125, "learning_rate": 0.0002952358924321949, "loss": 5.339, "mean_token_accuracy": 0.16206610202789307, "num_tokens": 7070071.0, "step": 2415 }, { "entropy": 5.410668659210205, "epoch": 0.07589299714617243, "grad_norm": 1.03125, "learning_rate": 0.00029406229748196657, "loss": 5.3378, "mean_token_accuracy": 0.16102805286645888, "num_tokens": 7085329.0, "step": 2420 }, { "entropy": 5.337376546859741, "epoch": 0.07604980085928435, "grad_norm": 1.0859375, "learning_rate": 0.0002928881799292235, "loss": 5.1477, "mean_token_accuracy": 0.17660113275051117, "num_tokens": 7100313.0, "step": 2425 }, { "entropy": 5.369079828262329, "epoch": 0.07620660457239628, "grad_norm": 1.0625, "learning_rate": 0.00029171357196299154, "loss": 5.2666, "mean_token_accuracy": 0.17177634239196776, "num_tokens": 7113781.0, "step": 2430 }, { "entropy": 5.37522292137146, "epoch": 0.0763634082855082, "grad_norm": 0.98828125, "learning_rate": 0.0002905385057857414, "loss": 5.2384, "mean_token_accuracy": 0.1755241796374321, "num_tokens": 7128338.0, "step": 2435 }, { "entropy": 5.393016338348389, "epoch": 0.07652021199862012, "grad_norm": 1.015625, "learning_rate": 0.0002893630136125058, "loss": 5.224, "mean_token_accuracy": 0.17592531442642212, "num_tokens": 7142392.0, "step": 2440 }, { "entropy": 5.360267114639282, "epoch": 0.07667701571173205, "grad_norm": 0.89453125, "learning_rate": 0.0002881871276699967, "loss": 5.2994, "mean_token_accuracy": 0.1711569085717201, "num_tokens": 7158080.0, "step": 2445 }, { "entropy": 5.409264707565308, "epoch": 0.07683381942484398, "grad_norm": 1.03125, "learning_rate": 0.00028701088019572114, "loss": 5.253, "mean_token_accuracy": 0.1703270971775055, "num_tokens": 7172421.0, "step": 2450 }, { "entropy": 5.4173094749450685, "epoch": 0.0769906231379559, "grad_norm": 0.97265625, "learning_rate": 0.0002858343034370977, "loss": 5.2463, "mean_token_accuracy": 0.16973855420947076, "num_tokens": 7188369.0, "step": 2455 }, { "entropy": 5.4142214298248295, "epoch": 0.07714742685106783, "grad_norm": 0.9453125, "learning_rate": 0.00028465742965057267, "loss": 5.3641, "mean_token_accuracy": 0.1718568906188011, "num_tokens": 7203434.0, "step": 2460 }, { "entropy": 5.403614521026611, "epoch": 0.07730423056417976, "grad_norm": 1.0859375, "learning_rate": 0.00028348029110073533, "loss": 5.2666, "mean_token_accuracy": 0.1755361244082451, "num_tokens": 7217709.0, "step": 2465 }, { "entropy": 5.4026562690734865, "epoch": 0.07746103427729169, "grad_norm": 0.8671875, "learning_rate": 0.00028230292005943365, "loss": 5.2665, "mean_token_accuracy": 0.1695285990834236, "num_tokens": 7233475.0, "step": 2470 }, { "entropy": 5.397445344924927, "epoch": 0.07761783799040362, "grad_norm": 0.8515625, "learning_rate": 0.00028112534880488945, "loss": 5.2636, "mean_token_accuracy": 0.16677384972572326, "num_tokens": 7250753.0, "step": 2475 }, { "entropy": 5.282281112670899, "epoch": 0.07777464170351554, "grad_norm": 0.9375, "learning_rate": 0.0002799476096208137, "loss": 5.1742, "mean_token_accuracy": 0.1840490221977234, "num_tokens": 7266061.0, "step": 2480 }, { "entropy": 5.370245885848999, "epoch": 0.07793144541662747, "grad_norm": 0.89453125, "learning_rate": 0.00027876973479552087, "loss": 5.3002, "mean_token_accuracy": 0.17231762111186982, "num_tokens": 7281798.0, "step": 2485 }, { "entropy": 5.4180694103240965, "epoch": 0.0780882491297394, "grad_norm": 0.92578125, "learning_rate": 0.00027759175662104424, "loss": 5.2373, "mean_token_accuracy": 0.1746474653482437, "num_tokens": 7295541.0, "step": 2490 }, { "entropy": 5.420738077163696, "epoch": 0.07824505284285131, "grad_norm": 0.94921875, "learning_rate": 0.0002764137073922508, "loss": 5.3273, "mean_token_accuracy": 0.16565654724836348, "num_tokens": 7311099.0, "step": 2495 }, { "entropy": 5.381645679473877, "epoch": 0.07840185655596324, "grad_norm": 0.97265625, "learning_rate": 0.00027523561940595505, "loss": 5.176, "mean_token_accuracy": 0.18013110309839248, "num_tokens": 7323866.0, "step": 2500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.2850889213952e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }