{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 25, "global_step": 2926, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.2600676015019416, "epoch": 0.003417927027257968, "grad_norm": 0.486328125, "learning_rate": 0.00015000000000000001, "loss": 1.3553205490112306, "mean_token_accuracy": 0.7003426559269428, "num_tokens": 50495.0, "step": 10 }, { "entropy": 1.0893292173743248, "epoch": 0.006835854054515936, "grad_norm": 0.53125, "learning_rate": 2.9289321881345254e-05, "loss": 1.1145251274108887, "mean_token_accuracy": 0.7432689998298884, "num_tokens": 99591.0, "step": 20 }, { "epoch": 0.00854481756814492, "eval_entropy": 1.0693371649831533, "eval_loss": 1.040876865386963, "eval_mean_token_accuracy": 0.7473227139562368, "eval_num_tokens": 125580.0, "eval_runtime": 32.1389, "eval_samples_per_second": 7.965, "eval_steps_per_second": 0.996, "step": 25 }, { "entropy": 1.136149488389492, "epoch": 0.010253781081773904, "grad_norm": 0.6952905654907227, "learning_rate": 6.59090909090909e-05, "loss": 1.118192481994629, "mean_token_accuracy": 0.7425699919462204, "num_tokens": 23478.0, "step": 30 }, { "entropy": 1.143788156658411, "epoch": 0.013671708109031872, "grad_norm": 0.708786129951477, "learning_rate": 8.863636363636364e-05, "loss": 1.1115641593933105, "mean_token_accuracy": 0.7380502671003342, "num_tokens": 74079.0, "step": 40 }, { "entropy": 1.031112465262413, "epoch": 0.01708963513628984, "grad_norm": 0.551914393901825, "learning_rate": 0.00011136363636363636, "loss": 1.0043062210083007, "mean_token_accuracy": 0.7607270315289497, "num_tokens": 121523.0, "step": 50 }, { "epoch": 0.01708963513628984, "eval_entropy": 0.9792779758572578, "eval_loss": 0.9474607706069946, "eval_mean_token_accuracy": 0.7642499133944511, "eval_num_tokens": 121523.0, "eval_runtime": 32.42, "eval_samples_per_second": 7.896, "eval_steps_per_second": 0.987, "step": 50 }, { "entropy": 1.0256493411958219, "epoch": 0.020507562163547807, "grad_norm": 0.6798339486122131, "learning_rate": 0.0001340909090909091, "loss": 0.9909649848937988, "mean_token_accuracy": 0.7597807608544827, "num_tokens": 169298.0, "step": 60 }, { "entropy": 1.0200331829488278, "epoch": 0.023925489190805775, "grad_norm": 0.7172015309333801, "learning_rate": 0.00015681818181818182, "loss": 0.9925822257995606, "mean_token_accuracy": 0.760905759036541, "num_tokens": 215812.0, "step": 70 }, { "epoch": 0.02563445270443476, "eval_entropy": 0.9389796517789364, "eval_loss": 0.9137760996818542, "eval_mean_token_accuracy": 0.7696583028882742, "eval_num_tokens": 238841.0, "eval_runtime": 32.4362, "eval_samples_per_second": 7.892, "eval_steps_per_second": 0.987, "step": 75 }, { "entropy": 1.0091111920773983, "epoch": 0.027343416218063743, "grad_norm": 0.5625494122505188, "learning_rate": 0.00017954545454545456, "loss": 0.9961751937866211, "mean_token_accuracy": 0.7597843900322914, "num_tokens": 262446.0, "step": 80 }, { "entropy": 1.0306036248803139, "epoch": 0.03076134324532171, "grad_norm": 0.6916620135307312, "learning_rate": 0.00019999993873041723, "loss": 1.008632755279541, "mean_token_accuracy": 0.7560263566672802, "num_tokens": 307540.0, "step": 90 }, { "entropy": 1.0128997907042503, "epoch": 0.03417927027257968, "grad_norm": 0.5265458226203918, "learning_rate": 0.00019999258647132646, "loss": 0.9914002418518066, "mean_token_accuracy": 0.7570689752697944, "num_tokens": 354777.0, "step": 100 }, { "epoch": 0.03417927027257968, "eval_entropy": 0.9012311659753323, "eval_loss": 0.8966313600540161, "eval_mean_token_accuracy": 0.7727285120636225, "eval_num_tokens": 354777.0, "eval_runtime": 32.4154, "eval_samples_per_second": 7.897, "eval_steps_per_second": 0.987, "step": 100 }, { "entropy": 0.9638666190207005, "epoch": 0.03759719729983765, "grad_norm": 0.5038418769836426, "learning_rate": 0.00019997298132799407, "loss": 0.9364572525024414, "mean_token_accuracy": 0.7678967766463757, "num_tokens": 405355.0, "step": 110 }, { "entropy": 0.9465805731713772, "epoch": 0.041015124327095615, "grad_norm": 0.4934922456741333, "learning_rate": 0.00019994112570279366, "loss": 0.9496530532836914, "mean_token_accuracy": 0.7676978453993797, "num_tokens": 453525.0, "step": 120 }, { "epoch": 0.0427240878407246, "eval_entropy": 0.8910342156887054, "eval_loss": 0.8766279220581055, "eval_mean_token_accuracy": 0.7756589185446501, "eval_num_tokens": 478081.0, "eval_runtime": 32.4243, "eval_samples_per_second": 7.895, "eval_steps_per_second": 0.987, "step": 125 }, { "entropy": 1.0112694174051284, "epoch": 0.04443305135435358, "grad_norm": 0.5341691374778748, "learning_rate": 0.00019989702349924754, "loss": 0.9902518272399903, "mean_token_accuracy": 0.7600088074803353, "num_tokens": 500728.0, "step": 130 }, { "entropy": 1.0307338863611222, "epoch": 0.04785097838161155, "grad_norm": 0.4941849112510681, "learning_rate": 0.00019984068012154823, "loss": 0.9965475082397461, "mean_token_accuracy": 0.7593892373144626, "num_tokens": 546115.0, "step": 140 }, { "entropy": 0.9555066972970963, "epoch": 0.05126890540886952, "grad_norm": 0.46804171800613403, "learning_rate": 0.00019977210247389647, "loss": 0.938600730895996, "mean_token_accuracy": 0.7718380980193615, "num_tokens": 591332.0, "step": 150 }, { "epoch": 0.05126890540886952, "eval_entropy": 0.8860863335430622, "eval_loss": 0.8679022789001465, "eval_mean_token_accuracy": 0.7788128759711981, "eval_num_tokens": 591332.0, "eval_runtime": 32.463, "eval_samples_per_second": 7.886, "eval_steps_per_second": 0.986, "step": 150 }, { "entropy": 0.9176225580275059, "epoch": 0.054686832436127486, "grad_norm": 0.5647802352905273, "learning_rate": 0.00019969129895965502, "loss": 0.9094284057617188, "mean_token_accuracy": 0.7718568064272404, "num_tokens": 638922.0, "step": 160 }, { "entropy": 0.9221074335277081, "epoch": 0.058104759463385454, "grad_norm": 0.4803485572338104, "learning_rate": 0.00019959827948031898, "loss": 0.895450496673584, "mean_token_accuracy": 0.7760300859808922, "num_tokens": 687534.0, "step": 170 }, { "epoch": 0.05981372297701444, "eval_entropy": 0.8816897980868816, "eval_loss": 0.8514255881309509, "eval_mean_token_accuracy": 0.7821575775742531, "eval_num_tokens": 712836.0, "eval_runtime": 32.5266, "eval_samples_per_second": 7.87, "eval_steps_per_second": 0.984, "step": 175 }, { "entropy": 0.9514009088277817, "epoch": 0.06152268649064342, "grad_norm": 0.5159069299697876, "learning_rate": 0.00019949305543430254, "loss": 0.9298910140991211, "mean_token_accuracy": 0.7662424340844154, "num_tokens": 737751.0, "step": 180 }, { "entropy": 0.936088802292943, "epoch": 0.0649406135179014, "grad_norm": 0.5905720591545105, "learning_rate": 0.0001993756397155421, "loss": 0.9271375656127929, "mean_token_accuracy": 0.7713530980050564, "num_tokens": 783903.0, "step": 190 }, { "entropy": 0.8810944482684135, "epoch": 0.06835854054515936, "grad_norm": 0.5631661415100098, "learning_rate": 0.0001992460467119164, "loss": 0.8553449630737304, "mean_token_accuracy": 0.7837967626750469, "num_tokens": 835058.0, "step": 200 }, { "epoch": 0.06835854054515936, "eval_entropy": 0.8469126336276531, "eval_loss": 0.843980073928833, "eval_mean_token_accuracy": 0.7836501188576221, "eval_num_tokens": 835058.0, "eval_runtime": 32.5036, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.985, "step": 200 }, { "entropy": 0.9015118815004826, "epoch": 0.07177646757241733, "grad_norm": 0.5022907257080078, "learning_rate": 0.00019910429230348347, "loss": 0.8947334289550781, "mean_token_accuracy": 0.775901124626398, "num_tokens": 881548.0, "step": 210 }, { "entropy": 0.9544241480529309, "epoch": 0.0751943945996753, "grad_norm": 0.6783669590950012, "learning_rate": 0.00019895039386053464, "loss": 0.939936351776123, "mean_token_accuracy": 0.7679277427494526, "num_tokens": 930380.0, "step": 220 }, { "epoch": 0.07690335811330429, "eval_entropy": 0.86623908393085, "eval_loss": 0.8365424871444702, "eval_mean_token_accuracy": 0.7847181409597397, "eval_num_tokens": 953371.0, "eval_runtime": 32.6302, "eval_samples_per_second": 7.845, "eval_steps_per_second": 0.981, "step": 225 }, { "entropy": 0.9503094263374805, "epoch": 0.07861232162693327, "grad_norm": 0.5332171320915222, "learning_rate": 0.00019878437024146604, "loss": 0.9248787879943847, "mean_token_accuracy": 0.7707160159945488, "num_tokens": 977205.0, "step": 230 }, { "entropy": 0.9480014778673649, "epoch": 0.08203024865419123, "grad_norm": 0.636835515499115, "learning_rate": 0.0001986062417904677, "loss": 0.9326526641845703, "mean_token_accuracy": 0.7707653798162937, "num_tokens": 1023070.0, "step": 240 }, { "entropy": 0.9017960362136364, "epoch": 0.0854481756814492, "grad_norm": 0.6051347851753235, "learning_rate": 0.00019841603033503077, "loss": 0.890564250946045, "mean_token_accuracy": 0.7787797845900059, "num_tokens": 1068509.0, "step": 250 }, { "epoch": 0.0854481756814492, "eval_entropy": 0.8300079107284546, "eval_loss": 0.8322861194610596, "eval_mean_token_accuracy": 0.7865318432450294, "eval_num_tokens": 1068509.0, "eval_runtime": 32.5945, "eval_samples_per_second": 7.854, "eval_steps_per_second": 0.982, "step": 250 }, { "entropy": 0.9348328456282615, "epoch": 0.08886610270870716, "grad_norm": 0.5464855432510376, "learning_rate": 0.00019821375918327268, "loss": 0.9178380966186523, "mean_token_accuracy": 0.7756208308041096, "num_tokens": 1114975.0, "step": 260 }, { "entropy": 0.8812198378145695, "epoch": 0.09228402973596514, "grad_norm": 0.4713146686553955, "learning_rate": 0.0001979994531210809, "loss": 0.8591255187988281, "mean_token_accuracy": 0.7836810939013958, "num_tokens": 1162702.0, "step": 270 }, { "epoch": 0.09399299324959412, "eval_entropy": 0.8178850021213293, "eval_loss": 0.8219032287597656, "eval_mean_token_accuracy": 0.7888985127210617, "eval_num_tokens": 1187390.0, "eval_runtime": 32.6097, "eval_samples_per_second": 7.85, "eval_steps_per_second": 0.981, "step": 275 }, { "entropy": 0.7962687697261572, "epoch": 0.0957019567632231, "grad_norm": 0.45879796147346497, "learning_rate": 0.00019777313840907613, "loss": 0.778873348236084, "mean_token_accuracy": 0.7989643529057503, "num_tokens": 1212186.0, "step": 280 }, { "entropy": 0.9441293470561505, "epoch": 0.09911988379048108, "grad_norm": 0.5591995120048523, "learning_rate": 0.0001975348427793939, "loss": 0.931028175354004, "mean_token_accuracy": 0.7705901082605123, "num_tokens": 1261641.0, "step": 290 }, { "entropy": 0.9185084633529186, "epoch": 0.10253781081773904, "grad_norm": 0.5129427909851074, "learning_rate": 0.0001972845954322866, "loss": 0.9040238380432128, "mean_token_accuracy": 0.7761635169386863, "num_tokens": 1309392.0, "step": 300 }, { "epoch": 0.10253781081773904, "eval_entropy": 0.8404651805758476, "eval_loss": 0.8196567296981812, "eval_mean_token_accuracy": 0.7885849270969629, "eval_num_tokens": 1309392.0, "eval_runtime": 32.6325, "eval_samples_per_second": 7.845, "eval_steps_per_second": 0.981, "step": 300 }, { "entropy": 0.9515121657401323, "epoch": 0.10595573784499701, "grad_norm": 0.6107913851737976, "learning_rate": 0.00019702242703254546, "loss": 0.9385555267333985, "mean_token_accuracy": 0.7681696146726609, "num_tokens": 1359229.0, "step": 310 }, { "entropy": 0.914220716059208, "epoch": 0.10937366487225497, "grad_norm": 0.5568957328796387, "learning_rate": 0.00019674836970574254, "loss": 0.8987955093383789, "mean_token_accuracy": 0.7780232340097427, "num_tokens": 1404361.0, "step": 320 }, { "epoch": 0.11108262838588397, "eval_entropy": 0.8228043504059315, "eval_loss": 0.8159385919570923, "eval_mean_token_accuracy": 0.7894312981516123, "eval_num_tokens": 1424972.0, "eval_runtime": 32.6314, "eval_samples_per_second": 7.845, "eval_steps_per_second": 0.981, "step": 325 }, { "entropy": 1.0007071375846863, "epoch": 0.11279159189951295, "grad_norm": 0.6453739404678345, "learning_rate": 0.00019646245703429456, "loss": 0.9830230712890625, "mean_token_accuracy": 0.7651846624910832, "num_tokens": 1447390.0, "step": 330 }, { "entropy": 0.903276839107275, "epoch": 0.11620951892677091, "grad_norm": 0.584945023059845, "learning_rate": 0.00019616472405334747, "loss": 0.8930956840515136, "mean_token_accuracy": 0.7818102724850178, "num_tokens": 1495240.0, "step": 340 }, { "entropy": 0.8742344193160534, "epoch": 0.11962744595402888, "grad_norm": 0.530391275882721, "learning_rate": 0.00019585520724648353, "loss": 0.8604484558105469, "mean_token_accuracy": 0.7872159354388714, "num_tokens": 1542650.0, "step": 350 }, { "epoch": 0.11962744595402888, "eval_entropy": 0.8151113502681255, "eval_loss": 0.8080641031265259, "eval_mean_token_accuracy": 0.7918843850493431, "eval_num_tokens": 1542650.0, "eval_runtime": 32.6195, "eval_samples_per_second": 7.848, "eval_steps_per_second": 0.981, "step": 350 }, { "entropy": 0.9260273765772581, "epoch": 0.12304537298128684, "grad_norm": 0.5639971494674683, "learning_rate": 0.00019553394454125057, "loss": 0.9099954605102539, "mean_token_accuracy": 0.7739293292164803, "num_tokens": 1590267.0, "step": 360 }, { "entropy": 0.8605987407267094, "epoch": 0.1264633000085448, "grad_norm": 0.5054117441177368, "learning_rate": 0.00019520097530451445, "loss": 0.8408944129943847, "mean_token_accuracy": 0.7852211132645607, "num_tokens": 1643921.0, "step": 370 }, { "epoch": 0.1281722635221738, "eval_entropy": 0.7877141386270523, "eval_loss": 0.803894579410553, "eval_mean_token_accuracy": 0.7931277714669704, "eval_num_tokens": 1668079.0, "eval_runtime": 32.6553, "eval_samples_per_second": 7.839, "eval_steps_per_second": 0.98, "step": 375 }, { "entropy": 0.8402018003165722, "epoch": 0.1298812270358028, "grad_norm": 0.7080391049385071, "learning_rate": 0.00019485634033763506, "loss": 0.8387722969055176, "mean_token_accuracy": 0.7905740939080715, "num_tokens": 1693171.0, "step": 380 }, { "entropy": 0.8122920129448176, "epoch": 0.13329915406306075, "grad_norm": 0.4884185791015625, "learning_rate": 0.00019450008187146684, "loss": 0.7884160041809082, "mean_token_accuracy": 0.7995197549462318, "num_tokens": 1741842.0, "step": 390 }, { "entropy": 0.8610376358032227, "epoch": 0.13671708109031872, "grad_norm": 0.6019439697265625, "learning_rate": 0.0001941322435611836, "loss": 0.8544740676879883, "mean_token_accuracy": 0.7863288387656212, "num_tokens": 1789054.0, "step": 400 }, { "epoch": 0.13671708109031872, "eval_entropy": 0.8057211544364691, "eval_loss": 0.8004281520843506, "eval_mean_token_accuracy": 0.7926788628101349, "eval_num_tokens": 1789054.0, "eval_runtime": 32.6897, "eval_samples_per_second": 7.831, "eval_steps_per_second": 0.979, "step": 400 }, { "entropy": 0.9050097674131393, "epoch": 0.14013500811757668, "grad_norm": 0.701719343662262, "learning_rate": 0.00019375287048092928, "loss": 0.8894415855407715, "mean_token_accuracy": 0.7790660828351974, "num_tokens": 1836694.0, "step": 410 }, { "entropy": 0.8502700824290514, "epoch": 0.14355293514483466, "grad_norm": 0.5158707499504089, "learning_rate": 0.00019336200911829462, "loss": 0.822513484954834, "mean_token_accuracy": 0.7917489908635617, "num_tokens": 1884795.0, "step": 420 }, { "epoch": 0.14526189865846365, "eval_entropy": 0.7786619961261749, "eval_loss": 0.7941492795944214, "eval_mean_token_accuracy": 0.795093884691596, "eval_num_tokens": 1906817.0, "eval_runtime": 32.6621, "eval_samples_per_second": 7.838, "eval_steps_per_second": 0.98, "step": 425 }, { "entropy": 0.8885743632912636, "epoch": 0.14697086217209263, "grad_norm": 0.5763893723487854, "learning_rate": 0.00019295970736862064, "loss": 0.8765960693359375, "mean_token_accuracy": 0.7833322003483772, "num_tokens": 1931776.0, "step": 430 }, { "entropy": 0.8891543313860893, "epoch": 0.1503887891993506, "grad_norm": 0.5412898063659668, "learning_rate": 0.0001925460145291297, "loss": 0.8739751815795899, "mean_token_accuracy": 0.7810932233929634, "num_tokens": 1981794.0, "step": 440 }, { "entropy": 0.8810034863650799, "epoch": 0.15380671622660858, "grad_norm": 0.4799567759037018, "learning_rate": 0.00019212098129288473, "loss": 0.8641800880432129, "mean_token_accuracy": 0.785812397301197, "num_tokens": 2032831.0, "step": 450 }, { "epoch": 0.15380671622660858, "eval_entropy": 0.8059570249170065, "eval_loss": 0.7902603149414062, "eval_mean_token_accuracy": 0.7959560509771109, "eval_num_tokens": 2032831.0, "eval_runtime": 32.6415, "eval_samples_per_second": 7.843, "eval_steps_per_second": 0.98, "step": 450 }, { "entropy": 0.8998822886496782, "epoch": 0.15722464325386654, "grad_norm": 0.6191452145576477, "learning_rate": 0.0001916846597425773, "loss": 0.878938865661621, "mean_token_accuracy": 0.7810092575848102, "num_tokens": 2082699.0, "step": 460 }, { "entropy": 0.9274133644998074, "epoch": 0.1606425702811245, "grad_norm": 0.5060327649116516, "learning_rate": 0.00019123710334414552, "loss": 0.9187069892883301, "mean_token_accuracy": 0.7734548069536686, "num_tokens": 2129343.0, "step": 470 }, { "epoch": 0.16235153379475348, "eval_entropy": 0.7861206252127886, "eval_loss": 0.7843623161315918, "eval_mean_token_accuracy": 0.7965397275984287, "eval_num_tokens": 2154727.0, "eval_runtime": 32.6107, "eval_samples_per_second": 7.85, "eval_steps_per_second": 0.981, "step": 475 }, { "entropy": 0.8581852417439222, "epoch": 0.16406049730838246, "grad_norm": 0.5885692834854126, "learning_rate": 0.0001907783669402227, "loss": 0.8446619033813476, "mean_token_accuracy": 0.7875718802213669, "num_tokens": 2178667.0, "step": 480 }, { "entropy": 0.9119165766984224, "epoch": 0.16747842433564045, "grad_norm": 0.5744176506996155, "learning_rate": 0.00019030850674341666, "loss": 0.9125348091125488, "mean_token_accuracy": 0.7730302430689335, "num_tokens": 2228020.0, "step": 490 }, { "entropy": 0.946759483218193, "epoch": 0.1708963513628984, "grad_norm": 0.48804807662963867, "learning_rate": 0.00018982758032942186, "loss": 0.9263985633850098, "mean_token_accuracy": 0.77376104965806, "num_tokens": 2274822.0, "step": 500 }, { "epoch": 0.1708963513628984, "eval_entropy": 0.7850293070077896, "eval_loss": 0.7818621397018433, "eval_mean_token_accuracy": 0.7967414036393166, "eval_num_tokens": 2274822.0, "eval_runtime": 32.6612, "eval_samples_per_second": 7.838, "eval_steps_per_second": 0.98, "step": 500 }, { "entropy": 0.850209466740489, "epoch": 0.17431427839015637, "grad_norm": 0.5423233509063721, "learning_rate": 0.00018933564662996393, "loss": 0.8323702812194824, "mean_token_accuracy": 0.790254071354866, "num_tokens": 2324238.0, "step": 510 }, { "entropy": 0.8254084564745426, "epoch": 0.17773220541741433, "grad_norm": 0.6329611539840698, "learning_rate": 0.0001888327659255786, "loss": 0.8157858848571777, "mean_token_accuracy": 0.7952801741659641, "num_tokens": 2369938.0, "step": 520 }, { "epoch": 0.1794411689310433, "eval_entropy": 0.7873559519648552, "eval_loss": 0.7806037664413452, "eval_mean_token_accuracy": 0.7967518828809261, "eval_num_tokens": 2396938.0, "eval_runtime": 32.5735, "eval_samples_per_second": 7.859, "eval_steps_per_second": 0.982, "step": 525 }, { "entropy": 0.7927372690290213, "epoch": 0.18115013244467232, "grad_norm": 0.5249568819999695, "learning_rate": 0.00018831899983822475, "loss": 0.7778078556060791, "mean_token_accuracy": 0.8018042631447315, "num_tokens": 2418510.0, "step": 530 }, { "entropy": 0.8573413282632828, "epoch": 0.18456805947193028, "grad_norm": 0.597499430179596, "learning_rate": 0.00018779441132373362, "loss": 0.8551907539367676, "mean_token_accuracy": 0.7869668185710907, "num_tokens": 2464421.0, "step": 540 }, { "entropy": 0.9104309018701315, "epoch": 0.18798598649918824, "grad_norm": 0.5782085061073303, "learning_rate": 0.0001872590646640942, "loss": 0.8853252410888672, "mean_token_accuracy": 0.782588554173708, "num_tokens": 2506949.0, "step": 550 }, { "epoch": 0.18798598649918824, "eval_entropy": 0.7909549381583929, "eval_loss": 0.7767490148544312, "eval_mean_token_accuracy": 0.7989067882299423, "eval_num_tokens": 2506949.0, "eval_runtime": 32.5781, "eval_samples_per_second": 7.858, "eval_steps_per_second": 0.982, "step": 550 }, { "entropy": 0.9016286168247462, "epoch": 0.1914039135264462, "grad_norm": 0.6918966770172119, "learning_rate": 0.0001867130254595763, "loss": 0.8875547409057617, "mean_token_accuracy": 0.7801647335290909, "num_tokens": 2551893.0, "step": 560 }, { "entropy": 0.7990992326289416, "epoch": 0.1948218405537042, "grad_norm": 0.44646406173706055, "learning_rate": 0.00018615636062069193, "loss": 0.7881239891052246, "mean_token_accuracy": 0.8021551303565502, "num_tokens": 2601200.0, "step": 570 }, { "epoch": 0.19653080406733317, "eval_entropy": 0.7736214082688093, "eval_loss": 0.7739249467849731, "eval_mean_token_accuracy": 0.7984153404831886, "eval_num_tokens": 2625970.0, "eval_runtime": 32.6428, "eval_samples_per_second": 7.842, "eval_steps_per_second": 0.98, "step": 575 }, { "entropy": 0.8380344811826944, "epoch": 0.19823976758096215, "grad_norm": 0.5394240617752075, "learning_rate": 0.0001855891383599964, "loss": 0.8400195121765137, "mean_token_accuracy": 0.7881024792790413, "num_tokens": 2648956.0, "step": 580 }, { "entropy": 0.8434151515364647, "epoch": 0.2016576946082201, "grad_norm": 0.5002357959747314, "learning_rate": 0.00018501142818372964, "loss": 0.8170535087585449, "mean_token_accuracy": 0.794566561281681, "num_tokens": 2694536.0, "step": 590 }, { "entropy": 0.7922864239662886, "epoch": 0.20507562163547807, "grad_norm": 0.5080456137657166, "learning_rate": 0.00018442330088329882, "loss": 0.7768840312957763, "mean_token_accuracy": 0.7996326476335526, "num_tokens": 2745360.0, "step": 600 }, { "epoch": 0.20507562163547807, "eval_entropy": 0.7685494627803564, "eval_loss": 0.7737076282501221, "eval_mean_token_accuracy": 0.7998364306986332, "eval_num_tokens": 2745360.0, "eval_runtime": 32.6306, "eval_samples_per_second": 7.845, "eval_steps_per_second": 0.981, "step": 600 }, { "entropy": 0.8512289695441723, "epoch": 0.20849354866273606, "grad_norm": 0.8412303328514099, "learning_rate": 0.00018382482852660414, "loss": 0.8491168022155762, "mean_token_accuracy": 0.7873495660722256, "num_tokens": 2790839.0, "step": 610 }, { "entropy": 0.8139516353607178, "epoch": 0.21191147568999402, "grad_norm": 0.5720385313034058, "learning_rate": 0.00018321608444920738, "loss": 0.7931262969970703, "mean_token_accuracy": 0.7983397327363491, "num_tokens": 2843698.0, "step": 620 }, { "epoch": 0.213620439203623, "eval_entropy": 0.7624373491853476, "eval_loss": 0.7696622610092163, "eval_mean_token_accuracy": 0.8000017125159502, "eval_num_tokens": 2870945.0, "eval_runtime": 32.5975, "eval_samples_per_second": 7.853, "eval_steps_per_second": 0.982, "step": 625 }, { "entropy": 0.8417224410921336, "epoch": 0.21532940271725198, "grad_norm": 0.5085984468460083, "learning_rate": 0.0001825971432453457, "loss": 0.8314865112304688, "mean_token_accuracy": 0.7912811681628227, "num_tokens": 2894559.0, "step": 630 }, { "entropy": 0.8762644857168198, "epoch": 0.21874732974450994, "grad_norm": 0.5597890019416809, "learning_rate": 0.00018196808075879114, "loss": 0.8614648818969727, "mean_token_accuracy": 0.7858939148485661, "num_tokens": 2944113.0, "step": 640 }, { "entropy": 0.8845491908490658, "epoch": 0.22216525677176793, "grad_norm": 0.5694191455841064, "learning_rate": 0.00018132897407355657, "loss": 0.8676918029785157, "mean_token_accuracy": 0.7828861311078071, "num_tokens": 2992188.0, "step": 650 }, { "epoch": 0.22216525677176793, "eval_entropy": 0.7651609890162945, "eval_loss": 0.7629461884498596, "eval_mean_token_accuracy": 0.8016721252351999, "eval_num_tokens": 2992188.0, "eval_runtime": 32.6395, "eval_samples_per_second": 7.843, "eval_steps_per_second": 0.98, "step": 650 }, { "entropy": 0.9146428674459457, "epoch": 0.2255831837990259, "grad_norm": 0.5276857614517212, "learning_rate": 0.00018067990150445016, "loss": 0.8943714141845703, "mean_token_accuracy": 0.7790229134261608, "num_tokens": 3039298.0, "step": 660 }, { "entropy": 0.7951211579144001, "epoch": 0.22900111082628385, "grad_norm": 0.5947771668434143, "learning_rate": 0.0001800209425874789, "loss": 0.7826883792877197, "mean_token_accuracy": 0.8007356464862824, "num_tokens": 3088419.0, "step": 670 }, { "epoch": 0.23071007433991284, "eval_entropy": 0.7665124572813511, "eval_loss": 0.7581461668014526, "eval_mean_token_accuracy": 0.8026615120470524, "eval_num_tokens": 3113387.0, "eval_runtime": 32.6339, "eval_samples_per_second": 7.845, "eval_steps_per_second": 0.981, "step": 675 }, { "entropy": 0.8008962716907263, "epoch": 0.23241903785354182, "grad_norm": 0.5073366761207581, "learning_rate": 0.0001793521780701024, "loss": 0.7925901889801026, "mean_token_accuracy": 0.7972975365817547, "num_tokens": 3138173.0, "step": 680 }, { "entropy": 0.8295211162418127, "epoch": 0.2358369648807998, "grad_norm": 0.6248682737350464, "learning_rate": 0.000178673689901338, "loss": 0.8191262245178222, "mean_token_accuracy": 0.7940905131399632, "num_tokens": 3182437.0, "step": 690 }, { "entropy": 0.8073327772319316, "epoch": 0.23925489190805777, "grad_norm": 0.582673966884613, "learning_rate": 0.00017798556122171938, "loss": 0.7840201377868652, "mean_token_accuracy": 0.7995604500174522, "num_tokens": 3229286.0, "step": 700 }, { "epoch": 0.23925489190805777, "eval_entropy": 0.7552605923265219, "eval_loss": 0.7581686973571777, "eval_mean_token_accuracy": 0.8022663723677397, "eval_num_tokens": 3229286.0, "eval_runtime": 32.7242, "eval_samples_per_second": 7.823, "eval_steps_per_second": 0.978, "step": 700 }, { "entropy": 0.7811179537326097, "epoch": 0.24267281893531573, "grad_norm": 0.5043304562568665, "learning_rate": 0.00017728787635310826, "loss": 0.7765492916107177, "mean_token_accuracy": 0.8002728261053562, "num_tokens": 3278460.0, "step": 710 }, { "entropy": 0.8374413985759019, "epoch": 0.2460907459625737, "grad_norm": 0.5113959312438965, "learning_rate": 0.000176580720788362, "loss": 0.8117224693298339, "mean_token_accuracy": 0.7954827964305877, "num_tokens": 3323710.0, "step": 720 }, { "epoch": 0.2477997094762027, "eval_entropy": 0.7489179540425539, "eval_loss": 0.7608813643455505, "eval_mean_token_accuracy": 0.8018700126558542, "eval_num_tokens": 3348967.0, "eval_runtime": 32.6984, "eval_samples_per_second": 7.829, "eval_steps_per_second": 0.979, "step": 725 }, { "entropy": 0.8640857309103012, "epoch": 0.24950867298983168, "grad_norm": 0.5439287424087524, "learning_rate": 0.00017586418118085742, "loss": 0.861956787109375, "mean_token_accuracy": 0.782987778633833, "num_tokens": 3374483.0, "step": 730 }, { "entropy": 0.8198690854012967, "epoch": 0.2529266000170896, "grad_norm": 0.5498844981193542, "learning_rate": 0.00017513834533387256, "loss": 0.7932277679443359, "mean_token_accuracy": 0.7930847354233265, "num_tokens": 3425284.0, "step": 740 }, { "entropy": 0.8567254289984703, "epoch": 0.2563445270443476, "grad_norm": 0.575046718120575, "learning_rate": 0.00017440330218982717, "loss": 0.844538688659668, "mean_token_accuracy": 0.7879870742559433, "num_tokens": 3473198.0, "step": 750 }, { "epoch": 0.2563445270443476, "eval_entropy": 0.7522654607892036, "eval_loss": 0.7591322064399719, "eval_mean_token_accuracy": 0.8022094331681728, "eval_num_tokens": 3473198.0, "eval_runtime": 32.5916, "eval_samples_per_second": 7.855, "eval_steps_per_second": 0.982, "step": 750 }, { "entropy": 0.8989825204014779, "epoch": 0.2597624540716056, "grad_norm": 0.46154603362083435, "learning_rate": 0.0001736591418193844, "loss": 0.8899558067321778, "mean_token_accuracy": 0.7821005254983902, "num_tokens": 3522189.0, "step": 760 }, { "entropy": 0.8200666073709726, "epoch": 0.26318038109886355, "grad_norm": 0.6104792952537537, "learning_rate": 0.0001729059554104131, "loss": 0.7961187839508057, "mean_token_accuracy": 0.7963723540306091, "num_tokens": 3572845.0, "step": 770 }, { "epoch": 0.2648893446124925, "eval_entropy": 0.7473378330469131, "eval_loss": 0.7550503015518188, "eval_mean_token_accuracy": 0.8024975471198559, "eval_num_tokens": 3597729.0, "eval_runtime": 32.6181, "eval_samples_per_second": 7.848, "eval_steps_per_second": 0.981, "step": 775 }, { "entropy": 0.8045445740222931, "epoch": 0.2665983081261215, "grad_norm": 0.5377092361450195, "learning_rate": 0.0001721438352568144, "loss": 0.7989499568939209, "mean_token_accuracy": 0.796073941886425, "num_tokens": 3620934.0, "step": 780 }, { "entropy": 0.7875147189944982, "epoch": 0.27001623515337947, "grad_norm": 0.5906500220298767, "learning_rate": 0.0001713728747472119, "loss": 0.7800149917602539, "mean_token_accuracy": 0.8019427113234997, "num_tokens": 3666872.0, "step": 790 }, { "entropy": 0.8653329361230135, "epoch": 0.27343416218063743, "grad_norm": 0.6267643570899963, "learning_rate": 0.00017059316835350808, "loss": 0.8605043411254882, "mean_token_accuracy": 0.7878318265080452, "num_tokens": 3713318.0, "step": 800 }, { "epoch": 0.27343416218063743, "eval_entropy": 0.770980479195714, "eval_loss": 0.7552855014801025, "eval_mean_token_accuracy": 0.8025437407195568, "eval_num_tokens": 3713318.0, "eval_runtime": 32.6834, "eval_samples_per_second": 7.833, "eval_steps_per_second": 0.979, "step": 800 }, { "entropy": 0.795812277123332, "epoch": 0.2768520892078954, "grad_norm": 0.5157990455627441, "learning_rate": 0.00016980481161930794, "loss": 0.7769721508026123, "mean_token_accuracy": 0.7985086388885975, "num_tokens": 3761523.0, "step": 810 }, { "entropy": 0.7850888863205909, "epoch": 0.28027001623515335, "grad_norm": 0.5042206048965454, "learning_rate": 0.00016900790114821122, "loss": 0.7836944103240967, "mean_token_accuracy": 0.7981749847531319, "num_tokens": 3813836.0, "step": 820 }, { "epoch": 0.2819789797487824, "eval_entropy": 0.7642055042088032, "eval_loss": 0.7502511739730835, "eval_mean_token_accuracy": 0.8033925238996744, "eval_num_tokens": 3838428.0, "eval_runtime": 32.5371, "eval_samples_per_second": 7.868, "eval_steps_per_second": 0.983, "step": 825 }, { "entropy": 0.8371281690895558, "epoch": 0.28368794326241137, "grad_norm": 0.5662909150123596, "learning_rate": 0.00016820253459197494, "loss": 0.8017690658569336, "mean_token_accuracy": 0.7955864246934652, "num_tokens": 3861556.0, "step": 830 }, { "entropy": 0.8396706741303206, "epoch": 0.28710587028966933, "grad_norm": 0.6416739225387573, "learning_rate": 0.00016738881063854723, "loss": 0.8341230392456055, "mean_token_accuracy": 0.7900606267154217, "num_tokens": 3905123.0, "step": 840 }, { "entropy": 0.8452721174806357, "epoch": 0.2905237973169273, "grad_norm": 0.6046516299247742, "learning_rate": 0.0001665668289999743, "loss": 0.8393696784973145, "mean_token_accuracy": 0.7913000397384167, "num_tokens": 3951295.0, "step": 850 }, { "epoch": 0.2905237973169273, "eval_entropy": 0.7603745739907026, "eval_loss": 0.7504570484161377, "eval_mean_token_accuracy": 0.8041685316711664, "eval_num_tokens": 3951295.0, "eval_runtime": 32.5482, "eval_samples_per_second": 7.865, "eval_steps_per_second": 0.983, "step": 850 }, { "entropy": 0.8369365192949771, "epoch": 0.29394172434418525, "grad_norm": 0.4931451082229614, "learning_rate": 0.000165736690400182, "loss": 0.8118236541748047, "mean_token_accuracy": 0.7955066107213498, "num_tokens": 3996465.0, "step": 860 }, { "entropy": 0.8153265129774809, "epoch": 0.2973596513714432, "grad_norm": 0.48623228073120117, "learning_rate": 0.00016489849656263337, "loss": 0.8089279174804688, "mean_token_accuracy": 0.7952679857611656, "num_tokens": 4043163.0, "step": 870 }, { "epoch": 0.2990686148850722, "eval_entropy": 0.7621881738305092, "eval_loss": 0.7468876838684082, "eval_mean_token_accuracy": 0.8038825057446957, "eval_num_tokens": 4064909.0, "eval_runtime": 32.5277, "eval_samples_per_second": 7.87, "eval_steps_per_second": 0.984, "step": 875 }, { "entropy": 0.8572983916848897, "epoch": 0.3007775783987012, "grad_norm": 0.48486313223838806, "learning_rate": 0.00016405235019786342, "loss": 0.8545586585998535, "mean_token_accuracy": 0.788145849853754, "num_tokens": 4090312.0, "step": 880 }, { "entropy": 0.8321780387312174, "epoch": 0.30419550542595913, "grad_norm": 0.5222928524017334, "learning_rate": 0.00016319835499089357, "loss": 0.8050444602966309, "mean_token_accuracy": 0.7938913144171238, "num_tokens": 4136984.0, "step": 890 }, { "entropy": 0.8131867442280054, "epoch": 0.30761343245321715, "grad_norm": 0.5593435168266296, "learning_rate": 0.00016233661558852589, "loss": 0.8005794525146485, "mean_token_accuracy": 0.7981902278959752, "num_tokens": 4182930.0, "step": 900 }, { "epoch": 0.30761343245321715, "eval_entropy": 0.7397047821432352, "eval_loss": 0.7391353845596313, "eval_mean_token_accuracy": 0.807006636634469, "eval_num_tokens": 4182930.0, "eval_runtime": 32.4819, "eval_samples_per_second": 7.881, "eval_steps_per_second": 0.985, "step": 900 }, { "entropy": 0.818829319998622, "epoch": 0.3110313594804751, "grad_norm": 0.5209222435951233, "learning_rate": 0.00016146723758652022, "loss": 0.8059531211853027, "mean_token_accuracy": 0.7948882877826691, "num_tokens": 4231251.0, "step": 910 }, { "entropy": 0.8251776993274689, "epoch": 0.3144492865077331, "grad_norm": 0.5925418734550476, "learning_rate": 0.00016059032751665454, "loss": 0.8086865425109864, "mean_token_accuracy": 0.7940934114158154, "num_tokens": 4280166.0, "step": 920 }, { "epoch": 0.31615825002136205, "eval_entropy": 0.741329038515687, "eval_loss": 0.7370421290397644, "eval_mean_token_accuracy": 0.8069011252373457, "eval_num_tokens": 4307100.0, "eval_runtime": 32.4627, "eval_samples_per_second": 7.886, "eval_steps_per_second": 0.986, "step": 925 }, { "entropy": 0.765642897412181, "epoch": 0.31786721353499103, "grad_norm": 0.5677841305732727, "learning_rate": 0.00015970599283367078, "loss": 0.7514712333679199, "mean_token_accuracy": 0.8063071981072426, "num_tokens": 4336292.0, "step": 930 }, { "entropy": 0.7642712559551, "epoch": 0.321285140562249, "grad_norm": 0.5148168206214905, "learning_rate": 0.00015881434190210763, "loss": 0.7541075706481933, "mean_token_accuracy": 0.8060836717486382, "num_tokens": 4388266.0, "step": 940 }, { "entropy": 0.8410390850156546, "epoch": 0.32470306758950696, "grad_norm": 0.7363119125366211, "learning_rate": 0.00015791548398302164, "loss": 0.8303253173828125, "mean_token_accuracy": 0.7919544480741024, "num_tokens": 4433500.0, "step": 950 }, { "epoch": 0.32470306758950696, "eval_entropy": 0.7385244891047478, "eval_loss": 0.7364199161529541, "eval_mean_token_accuracy": 0.8064117543399334, "eval_num_tokens": 4433500.0, "eval_runtime": 32.4989, "eval_samples_per_second": 7.877, "eval_steps_per_second": 0.985, "step": 950 }, { "entropy": 0.8260718151926995, "epoch": 0.3281209946167649, "grad_norm": 0.5341859459877014, "learning_rate": 0.00015700952922059874, "loss": 0.8289309501647949, "mean_token_accuracy": 0.7920399971306324, "num_tokens": 4479489.0, "step": 960 }, { "entropy": 0.7881720349192619, "epoch": 0.3315389216440229, "grad_norm": 0.7280305027961731, "learning_rate": 0.00015609658862865725, "loss": 0.7682159423828125, "mean_token_accuracy": 0.8035141505300999, "num_tokens": 4530797.0, "step": 970 }, { "epoch": 0.33324788515765186, "eval_entropy": 0.7407499924302101, "eval_loss": 0.7331442832946777, "eval_mean_token_accuracy": 0.8074121940881014, "eval_num_tokens": 4559773.0, "eval_runtime": 32.5019, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.985, "step": 975 }, { "entropy": 0.7880524016916752, "epoch": 0.3349568486712809, "grad_norm": 0.6096550226211548, "learning_rate": 0.0001551767740770446, "loss": 0.7723751068115234, "mean_token_accuracy": 0.8043812476098537, "num_tokens": 4581669.0, "step": 980 }, { "entropy": 0.7872831225395203, "epoch": 0.33837477569853885, "grad_norm": 0.5057272911071777, "learning_rate": 0.00015425019827792902, "loss": 0.7812077045440674, "mean_token_accuracy": 0.8002652741968632, "num_tokens": 4630513.0, "step": 990 }, { "entropy": 0.8601962827146054, "epoch": 0.3417927027257968, "grad_norm": 0.6072553992271423, "learning_rate": 0.00015331697477198792, "loss": 0.8457524299621582, "mean_token_accuracy": 0.7890366986393929, "num_tokens": 4676077.0, "step": 1000 }, { "epoch": 0.3417927027257968, "eval_entropy": 0.7451446056365967, "eval_loss": 0.7285513281822205, "eval_mean_token_accuracy": 0.80840396694839, "eval_num_tokens": 4676077.0, "eval_runtime": 32.5072, "eval_samples_per_second": 7.875, "eval_steps_per_second": 0.984, "step": 1000 }, { "entropy": 0.8780841417610645, "epoch": 0.3452106297530548, "grad_norm": 0.6355507969856262, "learning_rate": 0.00015237721791449497, "loss": 0.8509461402893066, "mean_token_accuracy": 0.7890427649021149, "num_tokens": 4719356.0, "step": 1010 }, { "entropy": 0.8176627814769745, "epoch": 0.34862855678031274, "grad_norm": 0.5865179300308228, "learning_rate": 0.00015143104286130722, "loss": 0.8123026847839355, "mean_token_accuracy": 0.795345525443554, "num_tokens": 4768569.0, "step": 1020 }, { "epoch": 0.3503375202939417, "eval_entropy": 0.7301500011235476, "eval_loss": 0.7274665832519531, "eval_mean_token_accuracy": 0.8079865016043186, "eval_num_tokens": 4793965.0, "eval_runtime": 32.5203, "eval_samples_per_second": 7.872, "eval_steps_per_second": 0.984, "step": 1025 }, { "entropy": 0.8386632338166237, "epoch": 0.3520464838075707, "grad_norm": 0.5760496854782104, "learning_rate": 0.00015047856555475405, "loss": 0.8192385673522949, "mean_token_accuracy": 0.7943773828446865, "num_tokens": 4817157.0, "step": 1030 }, { "entropy": 0.8414398148655892, "epoch": 0.35546441083482866, "grad_norm": 0.6798858046531677, "learning_rate": 0.00014951990270942991, "loss": 0.8329007148742675, "mean_token_accuracy": 0.790632463246584, "num_tokens": 4866025.0, "step": 1040 }, { "entropy": 0.8049224857240915, "epoch": 0.3588823378620866, "grad_norm": 0.6678990721702576, "learning_rate": 0.00014855517179789238, "loss": 0.7853578567504883, "mean_token_accuracy": 0.7974557019770145, "num_tokens": 4915676.0, "step": 1050 }, { "epoch": 0.3588823378620866, "eval_entropy": 0.7328374776989222, "eval_loss": 0.7274249792098999, "eval_mean_token_accuracy": 0.8089383095502853, "eval_num_tokens": 4915676.0, "eval_runtime": 32.4738, "eval_samples_per_second": 7.883, "eval_steps_per_second": 0.985, "step": 1050 }, { "entropy": 0.827161880582571, "epoch": 0.36230026488934464, "grad_norm": 0.5211610794067383, "learning_rate": 0.0001475844910362673, "loss": 0.8180788040161133, "mean_token_accuracy": 0.7956268422305584, "num_tokens": 4963558.0, "step": 1060 }, { "entropy": 0.8426773726940155, "epoch": 0.3657181919166026, "grad_norm": 0.5229407548904419, "learning_rate": 0.0001466079793697628, "loss": 0.8286858558654785, "mean_token_accuracy": 0.791385481506586, "num_tokens": 5013165.0, "step": 1070 }, { "epoch": 0.3674271554302316, "eval_entropy": 0.7287974283099174, "eval_loss": 0.7251026034355164, "eval_mean_token_accuracy": 0.8087449353188276, "eval_num_tokens": 5037412.0, "eval_runtime": 32.4973, "eval_samples_per_second": 7.878, "eval_steps_per_second": 0.985, "step": 1075 }, { "entropy": 0.7869369875639677, "epoch": 0.36913611894386056, "grad_norm": 0.5398491024971008, "learning_rate": 0.00014562575645809392, "loss": 0.76619873046875, "mean_token_accuracy": 0.8015293650329113, "num_tokens": 5064171.0, "step": 1080 }, { "entropy": 0.7933939069509506, "epoch": 0.3725540459711185, "grad_norm": 0.5217536091804504, "learning_rate": 0.00014463794266081993, "loss": 0.7810101985931397, "mean_token_accuracy": 0.7977319084107876, "num_tokens": 5114271.0, "step": 1090 }, { "entropy": 0.8145204957574605, "epoch": 0.3759719729983765, "grad_norm": 0.6378165483474731, "learning_rate": 0.0001436446590225957, "loss": 0.7995360851287842, "mean_token_accuracy": 0.7963194355368615, "num_tokens": 5164849.0, "step": 1100 }, { "epoch": 0.3759719729983765, "eval_entropy": 0.7224072255194187, "eval_loss": 0.7258445024490356, "eval_mean_token_accuracy": 0.8094426840543747, "eval_num_tokens": 5164849.0, "eval_runtime": 32.4659, "eval_samples_per_second": 7.885, "eval_steps_per_second": 0.986, "step": 1100 }, { "entropy": 0.8088543228805065, "epoch": 0.37938990002563444, "grad_norm": 0.5665172338485718, "learning_rate": 0.00014264602725833889, "loss": 0.7946016311645507, "mean_token_accuracy": 0.802227259427309, "num_tokens": 5212036.0, "step": 1110 }, { "entropy": 0.8042231686413288, "epoch": 0.3828078270528924, "grad_norm": 0.5462493300437927, "learning_rate": 0.00014164216973831554, "loss": 0.7905406475067138, "mean_token_accuracy": 0.7975196823477745, "num_tokens": 5259601.0, "step": 1120 }, { "epoch": 0.3845167905665214, "eval_entropy": 0.7332466039806604, "eval_loss": 0.7217105031013489, "eval_mean_token_accuracy": 0.8097752016037703, "eval_num_tokens": 5285653.0, "eval_runtime": 32.5314, "eval_samples_per_second": 7.869, "eval_steps_per_second": 0.984, "step": 1125 }, { "entropy": 0.7697301335632801, "epoch": 0.38622575408015036, "grad_norm": 0.46639689803123474, "learning_rate": 0.000140633209473145, "loss": 0.749844741821289, "mean_token_accuracy": 0.8087578162550926, "num_tokens": 5308035.0, "step": 1130 }, { "entropy": 0.7382064629346132, "epoch": 0.3896436811074084, "grad_norm": 0.6214824318885803, "learning_rate": 0.00013961927009872635, "loss": 0.7318979740142822, "mean_token_accuracy": 0.8110274896025658, "num_tokens": 5358532.0, "step": 1140 }, { "entropy": 0.8200155161321163, "epoch": 0.39306160813466634, "grad_norm": 0.5116494297981262, "learning_rate": 0.00013860047586108847, "loss": 0.8156219482421875, "mean_token_accuracy": 0.7928235337138176, "num_tokens": 5404679.0, "step": 1150 }, { "epoch": 0.39306160813466634, "eval_entropy": 0.7200065050274134, "eval_loss": 0.7224220633506775, "eval_mean_token_accuracy": 0.8092462345957756, "eval_num_tokens": 5404679.0, "eval_runtime": 32.5201, "eval_samples_per_second": 7.872, "eval_steps_per_second": 0.984, "step": 1150 }, { "entropy": 0.7471101813018322, "epoch": 0.3964795351619243, "grad_norm": 0.6286695003509521, "learning_rate": 0.000137576951601165, "loss": 0.721110486984253, "mean_token_accuracy": 0.8117256015539169, "num_tokens": 5457566.0, "step": 1160 }, { "entropy": 0.7424865119159222, "epoch": 0.39989746218918226, "grad_norm": 0.5141443014144897, "learning_rate": 0.00013654882273949687, "loss": 0.7295090675354003, "mean_token_accuracy": 0.8102657824754715, "num_tokens": 5506965.0, "step": 1170 }, { "epoch": 0.40160642570281124, "eval_entropy": 0.7222198080271482, "eval_loss": 0.7179678678512573, "eval_mean_token_accuracy": 0.8107004519551992, "eval_num_tokens": 5531529.0, "eval_runtime": 32.5483, "eval_samples_per_second": 7.865, "eval_steps_per_second": 0.983, "step": 1175 }, { "entropy": 0.8053314633667469, "epoch": 0.4033153892164402, "grad_norm": 0.7132169008255005, "learning_rate": 0.00013551621526086327, "loss": 0.7890602588653565, "mean_token_accuracy": 0.7956084564328194, "num_tokens": 5554204.0, "step": 1180 }, { "entropy": 0.8563751470297575, "epoch": 0.4067333162436982, "grad_norm": 0.6268016695976257, "learning_rate": 0.00013447925569884376, "loss": 0.8365967750549317, "mean_token_accuracy": 0.7909242726862431, "num_tokens": 5597625.0, "step": 1190 }, { "entropy": 0.8078042831271887, "epoch": 0.41015124327095615, "grad_norm": 0.6837403178215027, "learning_rate": 0.00013343807112031327, "loss": 0.7975335121154785, "mean_token_accuracy": 0.7958420798182487, "num_tokens": 5645765.0, "step": 1200 }, { "epoch": 0.41015124327095615, "eval_entropy": 0.711488027125597, "eval_loss": 0.7188196778297424, "eval_mean_token_accuracy": 0.8109075669199228, "eval_num_tokens": 5645765.0, "eval_runtime": 32.5021, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.985, "step": 1200 }, { "entropy": 0.7705740612000227, "epoch": 0.4135691702982141, "grad_norm": 0.5480158925056458, "learning_rate": 0.00013239278910987152, "loss": 0.7573784828186035, "mean_token_accuracy": 0.8046229638159275, "num_tokens": 5694447.0, "step": 1210 }, { "entropy": 0.8250246964395046, "epoch": 0.4169870973254721, "grad_norm": 0.6693493127822876, "learning_rate": 0.00013134353775420894, "loss": 0.7927688598632813, "mean_token_accuracy": 0.7985307432711124, "num_tokens": 5742053.0, "step": 1220 }, { "epoch": 0.4186960608391011, "eval_entropy": 0.7028289344161749, "eval_loss": 0.7150291204452515, "eval_mean_token_accuracy": 0.8113893959671259, "eval_num_tokens": 5765131.0, "eval_runtime": 32.5146, "eval_samples_per_second": 7.873, "eval_steps_per_second": 0.984, "step": 1225 }, { "entropy": 0.7481278918683529, "epoch": 0.4204050243527301, "grad_norm": 0.5626993179321289, "learning_rate": 0.00013029044562641134, "loss": 0.7459975242614746, "mean_token_accuracy": 0.810116047412157, "num_tokens": 5788534.0, "step": 1230 }, { "entropy": 0.8283022619783879, "epoch": 0.42382295137998804, "grad_norm": 0.6033257842063904, "learning_rate": 0.00012923364177020482, "loss": 0.8174246788024903, "mean_token_accuracy": 0.7946907714009285, "num_tokens": 5834731.0, "step": 1240 }, { "entropy": 0.762397014349699, "epoch": 0.427240878407246, "grad_norm": 0.5459337830543518, "learning_rate": 0.00012817325568414297, "loss": 0.7549442291259766, "mean_token_accuracy": 0.8046312466263771, "num_tokens": 5888788.0, "step": 1250 }, { "epoch": 0.427240878407246, "eval_entropy": 0.7237848732620478, "eval_loss": 0.7120697498321533, "eval_mean_token_accuracy": 0.8127239029854536, "eval_num_tokens": 5888788.0, "eval_runtime": 32.5537, "eval_samples_per_second": 7.864, "eval_steps_per_second": 0.983, "step": 1250 }, { "entropy": 0.8118621993809938, "epoch": 0.43065880543450397, "grad_norm": 0.5670892000198364, "learning_rate": 0.00012710941730573836, "loss": 0.786963415145874, "mean_token_accuracy": 0.7991264708340168, "num_tokens": 5940945.0, "step": 1260 }, { "entropy": 0.8265308391302824, "epoch": 0.4340767324617619, "grad_norm": 0.58514404296875, "learning_rate": 0.0001260422569955403, "loss": 0.8180745124816895, "mean_token_accuracy": 0.7946577452123165, "num_tokens": 5987771.0, "step": 1270 }, { "epoch": 0.4357856959753909, "eval_entropy": 0.7171956170350313, "eval_loss": 0.7113481163978577, "eval_mean_token_accuracy": 0.8121560588479042, "eval_num_tokens": 6013715.0, "eval_runtime": 32.5293, "eval_samples_per_second": 7.87, "eval_steps_per_second": 0.984, "step": 1275 }, { "entropy": 0.8262432683259249, "epoch": 0.4374946594890199, "grad_norm": 0.652851939201355, "learning_rate": 0.00012497190552116083, "loss": 0.8104188919067383, "mean_token_accuracy": 0.7939992636442185, "num_tokens": 6039288.0, "step": 1280 }, { "entropy": 0.7597002040594816, "epoch": 0.4409125865162779, "grad_norm": 0.5283879637718201, "learning_rate": 0.0001238984940412505, "loss": 0.7422741889953614, "mean_token_accuracy": 0.8095363132655621, "num_tokens": 6087651.0, "step": 1290 }, { "entropy": 0.7729848586022854, "epoch": 0.44433051354353587, "grad_norm": 0.6668198704719543, "learning_rate": 0.00012282215408942674, "loss": 0.7518921852111816, "mean_token_accuracy": 0.8074666738510132, "num_tokens": 6133232.0, "step": 1300 }, { "epoch": 0.44433051354353587, "eval_entropy": 0.7048162054270506, "eval_loss": 0.7114033699035645, "eval_mean_token_accuracy": 0.8132472056895494, "eval_num_tokens": 6133232.0, "eval_runtime": 32.5592, "eval_samples_per_second": 7.863, "eval_steps_per_second": 0.983, "step": 1300 }, { "entropy": 0.7919327396899462, "epoch": 0.4477484405707938, "grad_norm": 0.7264841198921204, "learning_rate": 0.00012174301755815571, "loss": 0.784566068649292, "mean_token_accuracy": 0.801679265499115, "num_tokens": 6177149.0, "step": 1310 }, { "entropy": 0.7804473422467708, "epoch": 0.4511663675980518, "grad_norm": 0.7080020308494568, "learning_rate": 0.00012066121668259072, "loss": 0.7683864593505859, "mean_token_accuracy": 0.8041128098964692, "num_tokens": 6224301.0, "step": 1320 }, { "epoch": 0.45287533111168077, "eval_entropy": 0.7122832704335451, "eval_loss": 0.7075121402740479, "eval_mean_token_accuracy": 0.8129062969237566, "eval_num_tokens": 6249760.0, "eval_runtime": 32.5042, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.984, "step": 1325 }, { "entropy": 0.7673846136778593, "epoch": 0.45458429462530975, "grad_norm": 0.47276806831359863, "learning_rate": 0.00011957688402436826, "loss": 0.7500048637390136, "mean_token_accuracy": 0.8052079066634178, "num_tokens": 6273667.0, "step": 1330 }, { "entropy": 0.7663803111761809, "epoch": 0.4580022216525677, "grad_norm": 0.5211388468742371, "learning_rate": 0.00011849015245536424, "loss": 0.7578155040740967, "mean_token_accuracy": 0.8071829579770565, "num_tokens": 6323164.0, "step": 1340 }, { "entropy": 0.8483320087194443, "epoch": 0.46142014867982567, "grad_norm": 0.5593488216400146, "learning_rate": 0.0001174011551414121, "loss": 0.8137017250061035, "mean_token_accuracy": 0.7960939630866051, "num_tokens": 6367928.0, "step": 1350 }, { "epoch": 0.46142014867982567, "eval_entropy": 0.7004928775131702, "eval_loss": 0.7064136266708374, "eval_mean_token_accuracy": 0.8134569376707077, "eval_num_tokens": 6367928.0, "eval_runtime": 32.4753, "eval_samples_per_second": 7.883, "eval_steps_per_second": 0.985, "step": 1350 }, { "entropy": 0.7482695568352937, "epoch": 0.46483807570708363, "grad_norm": 0.6436233520507812, "learning_rate": 0.00011631002552598503, "loss": 0.7543563365936279, "mean_token_accuracy": 0.8053471855819225, "num_tokens": 6414719.0, "step": 1360 }, { "entropy": 0.7612337287515402, "epoch": 0.46825600273434165, "grad_norm": 0.6195892691612244, "learning_rate": 0.0001152168973138439, "loss": 0.7435910701751709, "mean_token_accuracy": 0.8076206877827644, "num_tokens": 6465494.0, "step": 1370 }, { "epoch": 0.46996496624797063, "eval_entropy": 0.7111266031861305, "eval_loss": 0.7041518688201904, "eval_mean_token_accuracy": 0.8130570650100708, "eval_num_tokens": 6489945.0, "eval_runtime": 32.5587, "eval_samples_per_second": 7.863, "eval_steps_per_second": 0.983, "step": 1375 }, { "entropy": 0.7827417716383934, "epoch": 0.4716739297615996, "grad_norm": 0.5481026768684387, "learning_rate": 0.0001141219044546536, "loss": 0.7692788124084473, "mean_token_accuracy": 0.8012573964893818, "num_tokens": 6514928.0, "step": 1380 }, { "entropy": 0.8570831570774317, "epoch": 0.47509185678885757, "grad_norm": 0.6454991102218628, "learning_rate": 0.00011302518112656897, "loss": 0.8441422462463379, "mean_token_accuracy": 0.786506038159132, "num_tokens": 6561291.0, "step": 1390 }, { "entropy": 0.8111637011170387, "epoch": 0.47850978381611553, "grad_norm": 0.5012980103492737, "learning_rate": 0.00011192686171979288, "loss": 0.8026445388793946, "mean_token_accuracy": 0.7964430071413517, "num_tokens": 6606995.0, "step": 1400 }, { "epoch": 0.47850978381611553, "eval_entropy": 0.6970334611833096, "eval_loss": 0.7001909017562866, "eval_mean_token_accuracy": 0.8144857585430145, "eval_num_tokens": 6606995.0, "eval_runtime": 32.5377, "eval_samples_per_second": 7.868, "eval_steps_per_second": 0.983, "step": 1400 }, { "entropy": 0.8142560321837664, "epoch": 0.4819277108433735, "grad_norm": 0.6923454999923706, "learning_rate": 0.00011082708082010839, "loss": 0.7896495342254639, "mean_token_accuracy": 0.7999372504651546, "num_tokens": 6651262.0, "step": 1410 }, { "entropy": 0.7541784971952439, "epoch": 0.48534563787063145, "grad_norm": 0.5750320553779602, "learning_rate": 0.0001097259731923869, "loss": 0.7421460151672363, "mean_token_accuracy": 0.8080541737377643, "num_tokens": 6699436.0, "step": 1420 }, { "epoch": 0.48705460138426043, "eval_entropy": 0.7030851934105158, "eval_loss": 0.6975977420806885, "eval_mean_token_accuracy": 0.8151122163981199, "eval_num_tokens": 6723464.0, "eval_runtime": 32.5721, "eval_samples_per_second": 7.859, "eval_steps_per_second": 0.982, "step": 1425 }, { "entropy": 0.7732356287539005, "epoch": 0.4887635648978894, "grad_norm": 0.6692112684249878, "learning_rate": 0.00010862367376407432, "loss": 0.7660270690917969, "mean_token_accuracy": 0.8035531021654606, "num_tokens": 6747857.0, "step": 1430 }, { "entropy": 0.7560388691723346, "epoch": 0.4921814919251474, "grad_norm": 0.5274794101715088, "learning_rate": 0.00010752031760865728, "loss": 0.7368973731994629, "mean_token_accuracy": 0.8090716004371643, "num_tokens": 6796429.0, "step": 1440 }, { "entropy": 0.7908974122256041, "epoch": 0.4955994189524054, "grad_norm": 0.4911586046218872, "learning_rate": 0.00010641603992911158, "loss": 0.7843417644500732, "mean_token_accuracy": 0.8022970989346504, "num_tokens": 6843753.0, "step": 1450 }, { "epoch": 0.4955994189524054, "eval_entropy": 0.7044373229146004, "eval_loss": 0.6949427127838135, "eval_mean_token_accuracy": 0.8151835780590773, "eval_num_tokens": 6843753.0, "eval_runtime": 32.5751, "eval_samples_per_second": 7.859, "eval_steps_per_second": 0.982, "step": 1450 }, { "entropy": 0.7853588089346886, "epoch": 0.49901734597966335, "grad_norm": 0.4415193796157837, "learning_rate": 0.00010531097604133473, "loss": 0.7712342739105225, "mean_token_accuracy": 0.8053767092525959, "num_tokens": 6889412.0, "step": 1460 }, { "entropy": 0.730915354192257, "epoch": 0.5024352730069213, "grad_norm": 0.47233015298843384, "learning_rate": 0.00010420526135756444, "loss": 0.7267525672912598, "mean_token_accuracy": 0.8125036112964154, "num_tokens": 6939916.0, "step": 1470 }, { "epoch": 0.5041442365205503, "eval_entropy": 0.7217494286596775, "eval_loss": 0.6922969818115234, "eval_mean_token_accuracy": 0.8169958014041185, "eval_num_tokens": 6963309.0, "eval_runtime": 32.513, "eval_samples_per_second": 7.874, "eval_steps_per_second": 0.984, "step": 1475 }, { "entropy": 0.7474553748965264, "epoch": 0.5058532000341792, "grad_norm": 0.5465685129165649, "learning_rate": 0.00010309903136978575, "loss": 0.7162308692932129, "mean_token_accuracy": 0.8151901520788669, "num_tokens": 6986979.0, "step": 1480 }, { "entropy": 0.8350271973758936, "epoch": 0.5092711270614373, "grad_norm": 0.8223411440849304, "learning_rate": 0.00010199242163312794, "loss": 0.8277231216430664, "mean_token_accuracy": 0.7921891517937183, "num_tokens": 7037591.0, "step": 1490 }, { "entropy": 0.8443024232983589, "epoch": 0.5126890540886953, "grad_norm": 0.6216680407524109, "learning_rate": 0.00010088556774925387, "loss": 0.826251220703125, "mean_token_accuracy": 0.7934649467468262, "num_tokens": 7082012.0, "step": 1500 }, { "epoch": 0.5126890540886953, "eval_entropy": 0.6949329674243927, "eval_loss": 0.6909105777740479, "eval_mean_token_accuracy": 0.8162583336234093, "eval_num_tokens": 7082012.0, "eval_runtime": 32.5406, "eval_samples_per_second": 7.867, "eval_steps_per_second": 0.983, "step": 1500 }, { "entropy": 0.7664934404194355, "epoch": 0.5161069811159532, "grad_norm": 0.4688818156719208, "learning_rate": 9.97786053497438e-05, "loss": 0.7553867816925048, "mean_token_accuracy": 0.8041857704520226, "num_tokens": 7129239.0, "step": 1510 }, { "entropy": 0.7467406760901213, "epoch": 0.5195249081432112, "grad_norm": 0.5349637269973755, "learning_rate": 9.86716700794751e-05, "loss": 0.7290421009063721, "mean_token_accuracy": 0.810805543512106, "num_tokens": 7176709.0, "step": 1520 }, { "epoch": 0.5212338716568401, "eval_entropy": 0.6912414748221636, "eval_loss": 0.6880679130554199, "eval_mean_token_accuracy": 0.8175152335315943, "eval_num_tokens": 7198599.0, "eval_runtime": 32.5234, "eval_samples_per_second": 7.871, "eval_steps_per_second": 0.984, "step": 1525 }, { "entropy": 0.7089745387434959, "epoch": 0.5229428351704691, "grad_norm": 0.4970061779022217, "learning_rate": 9.756489758000105e-05, "loss": 0.691909646987915, "mean_token_accuracy": 0.8186588749289513, "num_tokens": 7225416.0, "step": 1530 }, { "entropy": 0.7925937842577696, "epoch": 0.5263607621977271, "grad_norm": 0.6043300628662109, "learning_rate": 9.645842347292908e-05, "loss": 0.788155460357666, "mean_token_accuracy": 0.7994618818163872, "num_tokens": 7273046.0, "step": 1540 }, { "entropy": 0.6987096827477217, "epoch": 0.529778689224985, "grad_norm": 0.5128796696662903, "learning_rate": 9.535238334330234e-05, "loss": 0.6659093856811523, "mean_token_accuracy": 0.8243751518428326, "num_tokens": 7322822.0, "step": 1550 }, { "epoch": 0.529778689224985, "eval_entropy": 0.7001140043139458, "eval_loss": 0.6867726445198059, "eval_mean_token_accuracy": 0.8168847281485796, "eval_num_tokens": 7322822.0, "eval_runtime": 32.4995, "eval_samples_per_second": 7.877, "eval_steps_per_second": 0.985, "step": 1550 }, { "entropy": 0.7453165553510189, "epoch": 0.533196616252243, "grad_norm": 0.6003188490867615, "learning_rate": 9.424691272298522e-05, "loss": 0.7359031200408935, "mean_token_accuracy": 0.8109373219311238, "num_tokens": 7370793.0, "step": 1560 }, { "entropy": 0.7829654891043901, "epoch": 0.536614543279501, "grad_norm": 0.6426380276679993, "learning_rate": 9.314214707405578e-05, "loss": 0.7814960479736328, "mean_token_accuracy": 0.802507346868515, "num_tokens": 7415437.0, "step": 1570 }, { "epoch": 0.53832350679313, "eval_entropy": 0.6993504334241152, "eval_loss": 0.6848057508468628, "eval_mean_token_accuracy": 0.817769967019558, "eval_num_tokens": 7437929.0, "eval_runtime": 32.4676, "eval_samples_per_second": 7.885, "eval_steps_per_second": 0.986, "step": 1575 }, { "entropy": 0.7911600664258003, "epoch": 0.5400324703067589, "grad_norm": 0.46196243166923523, "learning_rate": 9.20382217722062e-05, "loss": 0.7808879852294922, "mean_token_accuracy": 0.8050209023058414, "num_tokens": 7461751.0, "step": 1580 }, { "entropy": 0.8003505248576402, "epoch": 0.5434503973340169, "grad_norm": 0.6887136697769165, "learning_rate": 9.093527209015428e-05, "loss": 0.7642087459564209, "mean_token_accuracy": 0.8055305682122708, "num_tokens": 7509191.0, "step": 1590 }, { "entropy": 0.8003017157316208, "epoch": 0.5468683243612749, "grad_norm": 0.7519078850746155, "learning_rate": 8.983343318106745e-05, "loss": 0.7946379661560059, "mean_token_accuracy": 0.8008874267339706, "num_tokens": 7557898.0, "step": 1600 }, { "epoch": 0.5468683243612749, "eval_entropy": 0.6895345561206341, "eval_loss": 0.682197630405426, "eval_mean_token_accuracy": 0.8186191953718662, "eval_num_tokens": 7557898.0, "eval_runtime": 32.5239, "eval_samples_per_second": 7.871, "eval_steps_per_second": 0.984, "step": 1600 }, { "entropy": 0.7015115257352591, "epoch": 0.5502862513885328, "grad_norm": 0.45591458678245544, "learning_rate": 8.873284006200129e-05, "loss": 0.6760759353637695, "mean_token_accuracy": 0.8240564435720443, "num_tokens": 7606551.0, "step": 1610 }, { "entropy": 0.6873151533305645, "epoch": 0.5537041784157908, "grad_norm": 0.7503350377082825, "learning_rate": 8.763362759735486e-05, "loss": 0.6830436706542968, "mean_token_accuracy": 0.8215327501296997, "num_tokens": 7655943.0, "step": 1620 }, { "epoch": 0.5554131419294198, "eval_entropy": 0.6954763662070036, "eval_loss": 0.6825394630432129, "eval_mean_token_accuracy": 0.8192094713449478, "eval_num_tokens": 7679462.0, "eval_runtime": 32.4902, "eval_samples_per_second": 7.879, "eval_steps_per_second": 0.985, "step": 1625 }, { "entropy": 0.7175914201885462, "epoch": 0.5571221054430487, "grad_norm": 0.506363570690155, "learning_rate": 8.65359304823447e-05, "loss": 0.7104014396667481, "mean_token_accuracy": 0.8144126996397972, "num_tokens": 7704856.0, "step": 1630 }, { "entropy": 0.684526550769806, "epoch": 0.5605400324703067, "grad_norm": 0.47179755568504333, "learning_rate": 8.543988322649954e-05, "loss": 0.6660084247589111, "mean_token_accuracy": 0.8225892163813114, "num_tokens": 7756433.0, "step": 1640 }, { "entropy": 0.8113386046141386, "epoch": 0.5639579594975648, "grad_norm": 0.5647494196891785, "learning_rate": 8.434562013717774e-05, "loss": 0.7892371654510498, "mean_token_accuracy": 0.8024112187325955, "num_tokens": 7800781.0, "step": 1650 }, { "epoch": 0.5639579594975648, "eval_entropy": 0.6803799960762262, "eval_loss": 0.6814059019088745, "eval_mean_token_accuracy": 0.8198210597038269, "eval_num_tokens": 7800781.0, "eval_runtime": 32.5489, "eval_samples_per_second": 7.865, "eval_steps_per_second": 0.983, "step": 1650 }, { "entropy": 0.7244523506611585, "epoch": 0.5673758865248227, "grad_norm": 0.48115718364715576, "learning_rate": 8.325327530310972e-05, "loss": 0.7086876392364502, "mean_token_accuracy": 0.8146171241998672, "num_tokens": 7850500.0, "step": 1660 }, { "entropy": 0.7694044571369887, "epoch": 0.5707938135520807, "grad_norm": 0.7885907888412476, "learning_rate": 8.216298257796678e-05, "loss": 0.7577213764190673, "mean_token_accuracy": 0.8088521212339401, "num_tokens": 7894460.0, "step": 1670 }, { "epoch": 0.5725027770657096, "eval_entropy": 0.689734099432826, "eval_loss": 0.6795113682746887, "eval_mean_token_accuracy": 0.8193087466061115, "eval_num_tokens": 7915198.0, "eval_runtime": 32.4654, "eval_samples_per_second": 7.885, "eval_steps_per_second": 0.986, "step": 1675 }, { "entropy": 0.7575687125325203, "epoch": 0.5742117405793387, "grad_norm": 0.5657883882522583, "learning_rate": 8.107487556395901e-05, "loss": 0.7516120433807373, "mean_token_accuracy": 0.8099164560437202, "num_tokens": 7938871.0, "step": 1680 }, { "entropy": 0.7479819674044847, "epoch": 0.5776296676065966, "grad_norm": 0.5981023907661438, "learning_rate": 7.998908759546405e-05, "loss": 0.7331737995147705, "mean_token_accuracy": 0.8109016142785549, "num_tokens": 7986967.0, "step": 1690 }, { "entropy": 0.7127784315496684, "epoch": 0.5810475946338546, "grad_norm": 0.5446374416351318, "learning_rate": 7.890575172268858e-05, "loss": 0.6960432529449463, "mean_token_accuracy": 0.816921915858984, "num_tokens": 8038667.0, "step": 1700 }, { "epoch": 0.5810475946338546, "eval_entropy": 0.6878421176224947, "eval_loss": 0.6786676645278931, "eval_mean_token_accuracy": 0.8191769048571587, "eval_num_tokens": 8038667.0, "eval_runtime": 32.6367, "eval_samples_per_second": 7.844, "eval_steps_per_second": 0.98, "step": 1700 }, { "entropy": 0.7568402998149395, "epoch": 0.5844655216611125, "grad_norm": 0.5637646913528442, "learning_rate": 7.782500069536443e-05, "loss": 0.7467115879058838, "mean_token_accuracy": 0.8103341706097126, "num_tokens": 8085866.0, "step": 1710 }, { "entropy": 0.7543296214193106, "epoch": 0.5878834486883705, "grad_norm": 0.5011135935783386, "learning_rate": 7.674696694648183e-05, "loss": 0.7485779762268067, "mean_token_accuracy": 0.8080232337117195, "num_tokens": 8134284.0, "step": 1720 }, { "epoch": 0.5895924122019995, "eval_entropy": 0.6893986221402884, "eval_loss": 0.6773992776870728, "eval_mean_token_accuracy": 0.8196295741945505, "eval_num_tokens": 8156806.0, "eval_runtime": 32.6057, "eval_samples_per_second": 7.851, "eval_steps_per_second": 0.981, "step": 1725 }, { "entropy": 0.8183664843440056, "epoch": 0.5913013757156285, "grad_norm": 0.5187571048736572, "learning_rate": 7.567178257606146e-05, "loss": 0.7994352817535401, "mean_token_accuracy": 0.7991348020732403, "num_tokens": 8180060.0, "step": 1730 }, { "entropy": 0.862914065271616, "epoch": 0.5947193027428864, "grad_norm": 0.6644055247306824, "learning_rate": 7.4599579334967e-05, "loss": 0.8406139373779297, "mean_token_accuracy": 0.7935954198241234, "num_tokens": 8225765.0, "step": 1740 }, { "entropy": 0.7744019731879235, "epoch": 0.5981372297701444, "grad_norm": 0.5454498529434204, "learning_rate": 7.353048860876064e-05, "loss": 0.7569465160369873, "mean_token_accuracy": 0.8064947456121445, "num_tokens": 8273313.0, "step": 1750 }, { "epoch": 0.5981372297701444, "eval_entropy": 0.6880827695131302, "eval_loss": 0.6778668761253357, "eval_mean_token_accuracy": 0.8190348986536264, "eval_num_tokens": 8273313.0, "eval_runtime": 32.4973, "eval_samples_per_second": 7.878, "eval_steps_per_second": 0.985, "step": 1750 }, { "entropy": 0.6878764893859625, "epoch": 0.6015551567974023, "grad_norm": 0.5708960294723511, "learning_rate": 7.246464140160365e-05, "loss": 0.6662783622741699, "mean_token_accuracy": 0.8213848076760769, "num_tokens": 8322356.0, "step": 1760 }, { "entropy": 0.7368987411260605, "epoch": 0.6049730838246603, "grad_norm": 0.4885517358779907, "learning_rate": 7.1402168320203e-05, "loss": 0.734394121170044, "mean_token_accuracy": 0.8115066438913345, "num_tokens": 8371767.0, "step": 1770 }, { "epoch": 0.6066820473382893, "eval_entropy": 0.6817968115210533, "eval_loss": 0.6757955551147461, "eval_mean_token_accuracy": 0.8204179033637047, "eval_num_tokens": 8395150.0, "eval_runtime": 32.4907, "eval_samples_per_second": 7.879, "eval_steps_per_second": 0.985, "step": 1775 }, { "entropy": 0.7217590250074863, "epoch": 0.6083910108519183, "grad_norm": 0.54530930519104, "learning_rate": 7.034319955780735e-05, "loss": 0.6975030899047852, "mean_token_accuracy": 0.8191726803779602, "num_tokens": 8418891.0, "step": 1780 }, { "entropy": 0.759762617573142, "epoch": 0.6118089378791762, "grad_norm": 0.5948047041893005, "learning_rate": 6.928786487825348e-05, "loss": 0.7440184116363525, "mean_token_accuracy": 0.807938826829195, "num_tokens": 8467595.0, "step": 1790 }, { "entropy": 0.7751124188303947, "epoch": 0.6152268649064343, "grad_norm": 0.7067475914955139, "learning_rate": 6.823629360006504e-05, "loss": 0.7460795879364014, "mean_token_accuracy": 0.8089013800024987, "num_tokens": 8516779.0, "step": 1800 }, { "epoch": 0.6152268649064343, "eval_entropy": 0.6731869708746672, "eval_loss": 0.673740029335022, "eval_mean_token_accuracy": 0.8215623293071985, "eval_num_tokens": 8516779.0, "eval_runtime": 32.5195, "eval_samples_per_second": 7.872, "eval_steps_per_second": 0.984, "step": 1800 }, { "entropy": 0.7652524448931217, "epoch": 0.6186447919336923, "grad_norm": 0.573112964630127, "learning_rate": 6.718861458060634e-05, "loss": 0.7655494689941407, "mean_token_accuracy": 0.8049928575754166, "num_tokens": 8563658.0, "step": 1810 }, { "entropy": 0.7533473178744317, "epoch": 0.6220627189609502, "grad_norm": 0.5001428723335266, "learning_rate": 6.614495620029238e-05, "loss": 0.731645154953003, "mean_token_accuracy": 0.815316341817379, "num_tokens": 8607280.0, "step": 1820 }, { "epoch": 0.6237716824745791, "eval_entropy": 0.6760462690144777, "eval_loss": 0.6731796264648438, "eval_mean_token_accuracy": 0.8210084475576878, "eval_num_tokens": 8631570.0, "eval_runtime": 32.5048, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.984, "step": 1825 }, { "entropy": 0.7785196773707866, "epoch": 0.6254806459882082, "grad_norm": 0.6337042450904846, "learning_rate": 6.51054463468574e-05, "loss": 0.7558555126190185, "mean_token_accuracy": 0.8058261357247829, "num_tokens": 8655345.0, "step": 1830 }, { "entropy": 0.7649154797196388, "epoch": 0.6288985730154661, "grad_norm": 0.5913355946540833, "learning_rate": 6.407021239968371e-05, "loss": 0.7588380336761474, "mean_token_accuracy": 0.8053297519683837, "num_tokens": 8700351.0, "step": 1840 }, { "entropy": 0.7844179723411798, "epoch": 0.6323165000427241, "grad_norm": 0.6086034178733826, "learning_rate": 6.303938121419295e-05, "loss": 0.7802872657775879, "mean_token_accuracy": 0.8035823844373227, "num_tokens": 8751552.0, "step": 1850 }, { "epoch": 0.6323165000427241, "eval_entropy": 0.6918724570423365, "eval_loss": 0.6699243187904358, "eval_mean_token_accuracy": 0.8219087645411491, "eval_num_tokens": 8751552.0, "eval_runtime": 32.5593, "eval_samples_per_second": 7.863, "eval_steps_per_second": 0.983, "step": 1850 }, { "entropy": 0.7972814869135618, "epoch": 0.6357344270699821, "grad_norm": 0.5157380700111389, "learning_rate": 6.201307910630146e-05, "loss": 0.7538751602172852, "mean_token_accuracy": 0.8092072702944278, "num_tokens": 8795469.0, "step": 1860 }, { "entropy": 0.7942239165306091, "epoch": 0.63915235409724, "grad_norm": 0.6042788028717041, "learning_rate": 6.099143183694185e-05, "loss": 0.7757480144500732, "mean_token_accuracy": 0.8043014384806156, "num_tokens": 8839975.0, "step": 1870 }, { "epoch": 0.6408613176108691, "eval_entropy": 0.6643337700515985, "eval_loss": 0.6681345701217651, "eval_mean_token_accuracy": 0.822357814759016, "eval_num_tokens": 8864636.0, "eval_runtime": 32.502, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.985, "step": 1875 }, { "entropy": 0.7517622873187065, "epoch": 0.642570281124498, "grad_norm": 0.6731847524642944, "learning_rate": 5.9974564596652375e-05, "loss": 0.7436028480529785, "mean_token_accuracy": 0.8090323090553284, "num_tokens": 8886750.0, "step": 1880 }, { "entropy": 0.734363779425621, "epoch": 0.645988208151756, "grad_norm": 0.5949045419692993, "learning_rate": 5.8962601990236545e-05, "loss": 0.7188807010650635, "mean_token_accuracy": 0.8148549936711789, "num_tokens": 8934893.0, "step": 1890 }, { "entropy": 0.7205371145159006, "epoch": 0.6494061351790139, "grad_norm": 0.6062500476837158, "learning_rate": 5.79556680214941e-05, "loss": 0.7039190292358398, "mean_token_accuracy": 0.8170817263424397, "num_tokens": 8985225.0, "step": 1900 }, { "epoch": 0.6494061351790139, "eval_entropy": 0.6739299017935991, "eval_loss": 0.6656136512756348, "eval_mean_token_accuracy": 0.8219083081930876, "eval_num_tokens": 8985225.0, "eval_runtime": 32.5695, "eval_samples_per_second": 7.86, "eval_steps_per_second": 0.983, "step": 1900 }, { "entropy": 0.7479930385947228, "epoch": 0.6528240622062719, "grad_norm": 0.6024976968765259, "learning_rate": 5.695388607802603e-05, "loss": 0.7273672103881836, "mean_token_accuracy": 0.8128669574856758, "num_tokens": 9034378.0, "step": 1910 }, { "entropy": 0.7050946086645127, "epoch": 0.6562419892335298, "grad_norm": 0.6390378475189209, "learning_rate": 5.5957378916114766e-05, "loss": 0.6898663520812989, "mean_token_accuracy": 0.8202776715159417, "num_tokens": 9083822.0, "step": 1920 }, { "epoch": 0.6579509527471589, "eval_entropy": 0.6668643578886986, "eval_loss": 0.6642057299613953, "eval_mean_token_accuracy": 0.8225639518350363, "eval_num_tokens": 9106403.0, "eval_runtime": 32.5658, "eval_samples_per_second": 7.861, "eval_steps_per_second": 0.983, "step": 1925 }, { "entropy": 0.7865349762141705, "epoch": 0.6596599162607878, "grad_norm": 0.5823968052864075, "learning_rate": 5.4966268645682037e-05, "loss": 0.773893404006958, "mean_token_accuracy": 0.8043547578155994, "num_tokens": 9131386.0, "step": 1930 }, { "entropy": 0.7573930438607931, "epoch": 0.6630778432880458, "grad_norm": 0.5634140372276306, "learning_rate": 5.398067671532554e-05, "loss": 0.7383981227874756, "mean_token_accuracy": 0.810357116907835, "num_tokens": 9181672.0, "step": 1940 }, { "entropy": 0.7444441251456737, "epoch": 0.6664957703153037, "grad_norm": 0.5634564161300659, "learning_rate": 5.30007238974371e-05, "loss": 0.715367317199707, "mean_token_accuracy": 0.8161345295608043, "num_tokens": 9229065.0, "step": 1950 }, { "epoch": 0.6664957703153037, "eval_entropy": 0.667938893660903, "eval_loss": 0.6625745296478271, "eval_mean_token_accuracy": 0.8220944050699472, "eval_num_tokens": 9229065.0, "eval_runtime": 32.5889, "eval_samples_per_second": 7.855, "eval_steps_per_second": 0.982, "step": 1950 }, { "entropy": 0.7767221700400114, "epoch": 0.6699136973425618, "grad_norm": 0.5166037678718567, "learning_rate": 5.202653027340341e-05, "loss": 0.765186071395874, "mean_token_accuracy": 0.8100834608078002, "num_tokens": 9274928.0, "step": 1960 }, { "entropy": 0.7660458698868752, "epoch": 0.6733316243698197, "grad_norm": 0.5478764176368713, "learning_rate": 5.105821521889147e-05, "loss": 0.7520006656646728, "mean_token_accuracy": 0.8094162195920944, "num_tokens": 9325169.0, "step": 1970 }, { "epoch": 0.6750405878834487, "eval_entropy": 0.6612209193408489, "eval_loss": 0.6612023115158081, "eval_mean_token_accuracy": 0.8231339156627655, "eval_num_tokens": 9349091.0, "eval_runtime": 32.6144, "eval_samples_per_second": 7.849, "eval_steps_per_second": 0.981, "step": 1975 }, { "entropy": 0.785111240670085, "epoch": 0.6767495513970777, "grad_norm": 0.721108615398407, "learning_rate": 5.009589738922052e-05, "loss": 0.7930411338806153, "mean_token_accuracy": 0.8013198770582676, "num_tokens": 9369995.0, "step": 1980 }, { "entropy": 0.7857901852577924, "epoch": 0.6801674784243357, "grad_norm": 0.6027366518974304, "learning_rate": 4.9139694704822326e-05, "loss": 0.7535711765289307, "mean_token_accuracy": 0.8079273730516434, "num_tokens": 9417148.0, "step": 1990 }, { "entropy": 0.7289311088621616, "epoch": 0.6835854054515936, "grad_norm": 0.552121102809906, "learning_rate": 4.8189724336791456e-05, "loss": 0.6994921207427979, "mean_token_accuracy": 0.8187321200966835, "num_tokens": 9468520.0, "step": 2000 }, { "epoch": 0.6835854054515936, "eval_entropy": 0.6680661998689175, "eval_loss": 0.6595595479011536, "eval_mean_token_accuracy": 0.8238746467977762, "eval_num_tokens": 9468520.0, "eval_runtime": 32.5862, "eval_samples_per_second": 7.856, "eval_steps_per_second": 0.982, "step": 2000 }, { "entropy": 0.7077226992696524, "epoch": 0.6870033324788516, "grad_norm": 0.5503117442131042, "learning_rate": 4.7246102692527314e-05, "loss": 0.6956156730651856, "mean_token_accuracy": 0.8213571734726429, "num_tokens": 9520166.0, "step": 2010 }, { "entropy": 0.7663476031273604, "epoch": 0.6904212595061096, "grad_norm": 0.6200604438781738, "learning_rate": 4.630894540146994e-05, "loss": 0.7606002807617187, "mean_token_accuracy": 0.8068253338336945, "num_tokens": 9570547.0, "step": 2020 }, { "epoch": 0.6921302230197385, "eval_entropy": 0.6676463298499584, "eval_loss": 0.6581661701202393, "eval_mean_token_accuracy": 0.8241461012512445, "eval_num_tokens": 9593672.0, "eval_runtime": 32.5143, "eval_samples_per_second": 7.873, "eval_steps_per_second": 0.984, "step": 2025 }, { "entropy": 0.7571568485349417, "epoch": 0.6938391865333675, "grad_norm": 0.6294745802879333, "learning_rate": 4.537836730093077e-05, "loss": 0.7340333461761475, "mean_token_accuracy": 0.8121012486517429, "num_tokens": 9618466.0, "step": 2030 }, { "entropy": 0.7618828386068344, "epoch": 0.6972571135606255, "grad_norm": 0.5088632106781006, "learning_rate": 4.4454482422021e-05, "loss": 0.744665002822876, "mean_token_accuracy": 0.8096645012497902, "num_tokens": 9667228.0, "step": 2040 }, { "entropy": 0.7383288767188787, "epoch": 0.7006750405878834, "grad_norm": 0.5766125321388245, "learning_rate": 4.3537403975678315e-05, "loss": 0.7258750915527343, "mean_token_accuracy": 0.8161473520100117, "num_tokens": 9713714.0, "step": 2050 }, { "epoch": 0.7006750405878834, "eval_entropy": 0.6651978325098753, "eval_loss": 0.6558593511581421, "eval_mean_token_accuracy": 0.8251358140259981, "eval_num_tokens": 9713714.0, "eval_runtime": 32.5025, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.985, "step": 2050 }, { "entropy": 0.7635805677622557, "epoch": 0.7040929676151414, "grad_norm": 0.6300836801528931, "learning_rate": 4.262724433879427e-05, "loss": 0.7414310455322266, "mean_token_accuracy": 0.8105963818728924, "num_tokens": 9760727.0, "step": 2060 }, { "entropy": 0.7665166191756725, "epoch": 0.7075108946423994, "grad_norm": 0.5252206921577454, "learning_rate": 4.172411504044375e-05, "loss": 0.7504849433898926, "mean_token_accuracy": 0.8100805446505547, "num_tokens": 9808108.0, "step": 2070 }, { "epoch": 0.7092198581560284, "eval_entropy": 0.6657087150961161, "eval_loss": 0.6561708450317383, "eval_mean_token_accuracy": 0.8234847020357847, "eval_num_tokens": 9833878.0, "eval_runtime": 32.4853, "eval_samples_per_second": 7.88, "eval_steps_per_second": 0.985, "step": 2075 }, { "entropy": 0.7739077024161816, "epoch": 0.7109288216696573, "grad_norm": 0.7093223333358765, "learning_rate": 4.0828126748218654e-05, "loss": 0.753156042098999, "mean_token_accuracy": 0.8082724556326866, "num_tokens": 9855760.0, "step": 2080 }, { "entropy": 0.7730333257466555, "epoch": 0.7143467486969153, "grad_norm": 0.6004301309585571, "learning_rate": 3.993938925466674e-05, "loss": 0.7471571445465088, "mean_token_accuracy": 0.8072588540613651, "num_tokens": 9904182.0, "step": 2090 }, { "entropy": 0.7263076733797789, "epoch": 0.7177646757241732, "grad_norm": 0.5550140738487244, "learning_rate": 3.9058011463837974e-05, "loss": 0.7263860702514648, "mean_token_accuracy": 0.8129746846854686, "num_tokens": 9954352.0, "step": 2100 }, { "epoch": 0.7177646757241732, "eval_entropy": 0.6623709443956614, "eval_loss": 0.6543427109718323, "eval_mean_token_accuracy": 0.8249485101550817, "eval_num_tokens": 9954352.0, "eval_runtime": 32.6266, "eval_samples_per_second": 7.846, "eval_steps_per_second": 0.981, "step": 2100 }, { "entropy": 0.7489235173910856, "epoch": 0.7211826027514313, "grad_norm": 0.720840573310852, "learning_rate": 3.8184101377939476e-05, "loss": 0.7226673603057862, "mean_token_accuracy": 0.8142540246248245, "num_tokens": 10001696.0, "step": 2110 }, { "entropy": 0.689397944882512, "epoch": 0.7246005297786893, "grad_norm": 0.5519832968711853, "learning_rate": 3.73177660841015e-05, "loss": 0.6655806064605713, "mean_token_accuracy": 0.8236007198691369, "num_tokens": 10051435.0, "step": 2120 }, { "epoch": 0.7263094932923182, "eval_entropy": 0.6580320056527853, "eval_loss": 0.6523653864860535, "eval_mean_token_accuracy": 0.825190607458353, "eval_num_tokens": 10076452.0, "eval_runtime": 32.5452, "eval_samples_per_second": 7.866, "eval_steps_per_second": 0.983, "step": 2125 }, { "entropy": 0.7550150021910668, "epoch": 0.7280184568059472, "grad_norm": 0.609462320804596, "learning_rate": 3.645911174125479e-05, "loss": 0.7256326675415039, "mean_token_accuracy": 0.8133809432387352, "num_tokens": 10097596.0, "step": 2130 }, { "entropy": 0.7556207679212094, "epoch": 0.7314363838332052, "grad_norm": 0.509903609752655, "learning_rate": 3.560824356712238e-05, "loss": 0.7371315002441406, "mean_token_accuracy": 0.8115937277674675, "num_tokens": 10143130.0, "step": 2140 }, { "entropy": 0.7149132907390594, "epoch": 0.7348543108604632, "grad_norm": 0.6229613423347473, "learning_rate": 3.47652658253263e-05, "loss": 0.7009588241577148, "mean_token_accuracy": 0.8162322334945202, "num_tokens": 10192913.0, "step": 2150 }, { "epoch": 0.7348543108604632, "eval_entropy": 0.6570977903902531, "eval_loss": 0.6511036157608032, "eval_mean_token_accuracy": 0.8255328629165888, "eval_num_tokens": 10192913.0, "eval_runtime": 32.5048, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.984, "step": 2150 }, { "entropy": 0.7812049750238657, "epoch": 0.7382722378877211, "grad_norm": 0.682597279548645, "learning_rate": 3.393028181261142e-05, "loss": 0.7646748065948487, "mean_token_accuracy": 0.8081333816051484, "num_tokens": 10240506.0, "step": 2160 }, { "entropy": 0.7046744357794523, "epoch": 0.7416901649149791, "grad_norm": 0.6965001225471497, "learning_rate": 3.3103393846187445e-05, "loss": 0.6830405712127685, "mean_token_accuracy": 0.8225828550755978, "num_tokens": 10289324.0, "step": 2170 }, { "epoch": 0.743399128428608, "eval_entropy": 0.6515689790248871, "eval_loss": 0.6498388051986694, "eval_mean_token_accuracy": 0.8258727006614208, "eval_num_tokens": 10313829.0, "eval_runtime": 32.5295, "eval_samples_per_second": 7.87, "eval_steps_per_second": 0.984, "step": 2175 }, { "entropy": 0.7740226969122886, "epoch": 0.745108091942237, "grad_norm": 0.7107183933258057, "learning_rate": 3.228470325119164e-05, "loss": 0.7719791412353516, "mean_token_accuracy": 0.8062848366796971, "num_tokens": 10337899.0, "step": 2180 }, { "entropy": 0.6804906763136387, "epoch": 0.748526018969495, "grad_norm": 0.8012505173683167, "learning_rate": 3.147431034827208e-05, "loss": 0.6739416599273682, "mean_token_accuracy": 0.8224732950329781, "num_tokens": 10383023.0, "step": 2190 }, { "entropy": 0.7387298934161663, "epoch": 0.751943945996753, "grad_norm": 0.5948705077171326, "learning_rate": 3.067231444129507e-05, "loss": 0.7141981601715088, "mean_token_accuracy": 0.8123697496950626, "num_tokens": 10436562.0, "step": 2200 }, { "epoch": 0.751943945996753, "eval_entropy": 0.6572407782077789, "eval_loss": 0.6485446095466614, "eval_mean_token_accuracy": 0.8260926008224487, "eval_num_tokens": 10436562.0, "eval_runtime": 32.5179, "eval_samples_per_second": 7.873, "eval_steps_per_second": 0.984, "step": 2200 }, { "entropy": 0.7102626815438271, "epoch": 0.7553618730240109, "grad_norm": 0.45274314284324646, "learning_rate": 2.9878813805176253e-05, "loss": 0.6939650535583496, "mean_token_accuracy": 0.821110887080431, "num_tokens": 10484097.0, "step": 2210 }, { "entropy": 0.6937402199953795, "epoch": 0.7587798000512689, "grad_norm": 0.5389388203620911, "learning_rate": 2.9093905673838606e-05, "loss": 0.6805085659027099, "mean_token_accuracy": 0.8231124863028526, "num_tokens": 10531946.0, "step": 2220 }, { "epoch": 0.7604887635648979, "eval_entropy": 0.6562957186251879, "eval_loss": 0.6482586860656738, "eval_mean_token_accuracy": 0.8258698955178261, "eval_num_tokens": 10556164.0, "eval_runtime": 32.5336, "eval_samples_per_second": 7.869, "eval_steps_per_second": 0.984, "step": 2225 }, { "entropy": 0.7634148493409156, "epoch": 0.7621977270785268, "grad_norm": 0.5631259083747864, "learning_rate": 2.8317686228297192e-05, "loss": 0.7458550453186035, "mean_token_accuracy": 0.8041129514575005, "num_tokens": 10581095.0, "step": 2230 }, { "entropy": 0.7783615037798881, "epoch": 0.7656156541057848, "grad_norm": 0.4985562562942505, "learning_rate": 2.7550250584873637e-05, "loss": 0.7557303428649902, "mean_token_accuracy": 0.8075458481907845, "num_tokens": 10629253.0, "step": 2240 }, { "entropy": 0.7126111596822738, "epoch": 0.7690335811330428, "grad_norm": 0.5650884509086609, "learning_rate": 2.6791692783540633e-05, "loss": 0.6887269973754883, "mean_token_accuracy": 0.821088171005249, "num_tokens": 10678619.0, "step": 2250 }, { "epoch": 0.7690335811330428, "eval_entropy": 0.653578756377101, "eval_loss": 0.6471341252326965, "eval_mean_token_accuracy": 0.8266212977468967, "eval_num_tokens": 10678619.0, "eval_runtime": 32.5421, "eval_samples_per_second": 7.867, "eval_steps_per_second": 0.983, "step": 2250 }, { "entropy": 0.6648651383817196, "epoch": 0.7724515081603007, "grad_norm": 0.48509320616722107, "learning_rate": 2.604210577639855e-05, "loss": 0.6434546947479248, "mean_token_accuracy": 0.827840019762516, "num_tokens": 10728226.0, "step": 2260 }, { "entropy": 0.7198113534599543, "epoch": 0.7758694351875588, "grad_norm": 0.8218326568603516, "learning_rate": 2.5301581416285147e-05, "loss": 0.7089159965515137, "mean_token_accuracy": 0.8145917497575283, "num_tokens": 10778245.0, "step": 2270 }, { "epoch": 0.7775783987011877, "eval_entropy": 0.652136854827404, "eval_loss": 0.6467763185501099, "eval_mean_token_accuracy": 0.8270386923104525, "eval_num_tokens": 10801879.0, "eval_runtime": 32.5386, "eval_samples_per_second": 7.868, "eval_steps_per_second": 0.983, "step": 2275 }, { "entropy": 0.7346194788813591, "epoch": 0.7792873622148168, "grad_norm": 0.5933800935745239, "learning_rate": 2.457021044552028e-05, "loss": 0.7139677047729492, "mean_token_accuracy": 0.8131411246955395, "num_tokens": 10827578.0, "step": 2280 }, { "entropy": 0.756122961640358, "epoch": 0.7827052892420747, "grad_norm": 0.6672066450119019, "learning_rate": 2.3848082484786426e-05, "loss": 0.7328310489654541, "mean_token_accuracy": 0.8131688497960567, "num_tokens": 10873441.0, "step": 2290 }, { "entropy": 0.6612967252731323, "epoch": 0.7861232162693327, "grad_norm": 0.5208282470703125, "learning_rate": 2.3135286022146785e-05, "loss": 0.6452344417572021, "mean_token_accuracy": 0.8288177840411663, "num_tokens": 10919727.0, "step": 2300 }, { "epoch": 0.7861232162693327, "eval_entropy": 0.6515894420444965, "eval_loss": 0.6458343267440796, "eval_mean_token_accuracy": 0.8261187877506018, "eval_num_tokens": 10919727.0, "eval_runtime": 32.562, "eval_samples_per_second": 7.862, "eval_steps_per_second": 0.983, "step": 2300 }, { "entropy": 0.7304637894034386, "epoch": 0.7895411432965906, "grad_norm": 0.738002359867096, "learning_rate": 2.243190840220214e-05, "loss": 0.7215014457702636, "mean_token_accuracy": 0.8141652099788189, "num_tokens": 10969951.0, "step": 2310 }, { "entropy": 0.7662419803440571, "epoch": 0.7929590703238486, "grad_norm": 0.5868961811065674, "learning_rate": 2.173803581538775e-05, "loss": 0.7481863021850585, "mean_token_accuracy": 0.8079202443361282, "num_tokens": 11019244.0, "step": 2320 }, { "epoch": 0.7946680338374775, "eval_entropy": 0.650886744260788, "eval_loss": 0.6445406079292297, "eval_mean_token_accuracy": 0.8274833615869284, "eval_num_tokens": 11040646.0, "eval_runtime": 32.5078, "eval_samples_per_second": 7.875, "eval_steps_per_second": 0.984, "step": 2325 }, { "entropy": 0.702366477996111, "epoch": 0.7963769973511066, "grad_norm": 0.5595235824584961, "learning_rate": 2.1053753287411892e-05, "loss": 0.6811541080474853, "mean_token_accuracy": 0.822179126739502, "num_tokens": 11066388.0, "step": 2330 }, { "entropy": 0.75776182487607, "epoch": 0.7997949243783645, "grad_norm": 0.669806718826294, "learning_rate": 2.037914466883688e-05, "loss": 0.7357389450073242, "mean_token_accuracy": 0.811240018159151, "num_tokens": 11111032.0, "step": 2340 }, { "entropy": 0.6907448621466756, "epoch": 0.8032128514056225, "grad_norm": 0.5382040739059448, "learning_rate": 1.9714292624804275e-05, "loss": 0.6850921630859375, "mean_token_accuracy": 0.8219761483371257, "num_tokens": 11162497.0, "step": 2350 }, { "epoch": 0.8032128514056225, "eval_entropy": 0.6502471938729286, "eval_loss": 0.6438165903091431, "eval_mean_token_accuracy": 0.8278086725622416, "eval_num_tokens": 11162497.0, "eval_runtime": 32.5785, "eval_samples_per_second": 7.858, "eval_steps_per_second": 0.982, "step": 2350 }, { "entropy": 0.6725162204355002, "epoch": 0.8066307784328804, "grad_norm": 0.47493892908096313, "learning_rate": 1.905927862490512e-05, "loss": 0.6554149627685547, "mean_token_accuracy": 0.8262991026043892, "num_tokens": 11211623.0, "step": 2360 }, { "entropy": 0.7101132038980722, "epoch": 0.8100487054601384, "grad_norm": 0.5834583044052124, "learning_rate": 1.8414182933197023e-05, "loss": 0.6969385147094727, "mean_token_accuracy": 0.8214772522449494, "num_tokens": 11259236.0, "step": 2370 }, { "epoch": 0.8117576689737674, "eval_entropy": 0.6499252859503031, "eval_loss": 0.6433589458465576, "eval_mean_token_accuracy": 0.8272677790373564, "eval_num_tokens": 11281620.0, "eval_runtime": 32.6124, "eval_samples_per_second": 7.85, "eval_steps_per_second": 0.981, "step": 2375 }, { "entropy": 0.7414477836340666, "epoch": 0.8134666324873964, "grad_norm": 0.5209059119224548, "learning_rate": 1.7779084598368635e-05, "loss": 0.7268849372863769, "mean_token_accuracy": 0.8158441334962845, "num_tokens": 11306119.0, "step": 2380 }, { "entropy": 0.7430920496582984, "epoch": 0.8168845595146543, "grad_norm": 0.6851968169212341, "learning_rate": 1.7154061444053237e-05, "loss": 0.7404438972473144, "mean_token_accuracy": 0.8101868823170661, "num_tokens": 11355199.0, "step": 2390 }, { "entropy": 0.7235891550779343, "epoch": 0.8203024865419123, "grad_norm": 0.5767418742179871, "learning_rate": 1.6539190059292288e-05, "loss": 0.7079296112060547, "mean_token_accuracy": 0.8172104585915804, "num_tokens": 11404488.0, "step": 2400 }, { "epoch": 0.8203024865419123, "eval_entropy": 0.6570469662547112, "eval_loss": 0.6428108215332031, "eval_mean_token_accuracy": 0.8273015934973955, "eval_num_tokens": 11404488.0, "eval_runtime": 32.6527, "eval_samples_per_second": 7.84, "eval_steps_per_second": 0.98, "step": 2400 }, { "entropy": 0.7659241635352373, "epoch": 0.8237204135691703, "grad_norm": 0.5965316295623779, "learning_rate": 1.5934545789150623e-05, "loss": 0.7549265861511231, "mean_token_accuracy": 0.8072838112711906, "num_tokens": 11453374.0, "step": 2410 }, { "entropy": 0.7300883550196886, "epoch": 0.8271383405964282, "grad_norm": 0.5207374095916748, "learning_rate": 1.5340202725483487e-05, "loss": 0.7029576778411866, "mean_token_accuracy": 0.8164526544511318, "num_tokens": 11501777.0, "step": 2420 }, { "epoch": 0.8288473041100572, "eval_entropy": 0.6553569138050079, "eval_loss": 0.641933798789978, "eval_mean_token_accuracy": 0.8275820016860962, "eval_num_tokens": 11527261.0, "eval_runtime": 32.6148, "eval_samples_per_second": 7.849, "eval_steps_per_second": 0.981, "step": 2425 }, { "entropy": 0.7407207667827607, "epoch": 0.8305562676236863, "grad_norm": 0.49078667163848877, "learning_rate": 1.4756233697857746e-05, "loss": 0.71334810256958, "mean_token_accuracy": 0.8155447125434876, "num_tokens": 11551134.0, "step": 2430 }, { "entropy": 0.687175927311182, "epoch": 0.8339741946509442, "grad_norm": 0.6775448322296143, "learning_rate": 1.4182710264627341e-05, "loss": 0.6605133533477783, "mean_token_accuracy": 0.8263660438358784, "num_tokens": 11598933.0, "step": 2440 }, { "entropy": 0.7657349318265915, "epoch": 0.8373921216782022, "grad_norm": 0.7116291522979736, "learning_rate": 1.3619702704164783e-05, "loss": 0.7508980751037597, "mean_token_accuracy": 0.8105187758803367, "num_tokens": 11649337.0, "step": 2450 }, { "epoch": 0.8373921216782022, "eval_entropy": 0.6494570691138506, "eval_loss": 0.6415493488311768, "eval_mean_token_accuracy": 0.827751325443387, "eval_num_tokens": 11649337.0, "eval_runtime": 32.5345, "eval_samples_per_second": 7.869, "eval_steps_per_second": 0.984, "step": 2450 }, { "entropy": 0.7346297159790993, "epoch": 0.8408100487054602, "grad_norm": 0.7070845365524292, "learning_rate": 1.3067280006249261e-05, "loss": 0.72440505027771, "mean_token_accuracy": 0.812112944573164, "num_tokens": 11697361.0, "step": 2460 }, { "entropy": 0.6898879475891591, "epoch": 0.8442279757327181, "grad_norm": 0.5906277298927307, "learning_rate": 1.2525509863612916e-05, "loss": 0.6653994560241699, "mean_token_accuracy": 0.824587044864893, "num_tokens": 11743307.0, "step": 2470 }, { "epoch": 0.845936939246347, "eval_entropy": 0.6489466484636068, "eval_loss": 0.640968918800354, "eval_mean_token_accuracy": 0.8277594074606895, "eval_num_tokens": 11767237.0, "eval_runtime": 32.5474, "eval_samples_per_second": 7.865, "eval_steps_per_second": 0.983, "step": 2475 }, { "entropy": 0.7420150343328714, "epoch": 0.8476459027599761, "grad_norm": 0.6130893230438232, "learning_rate": 1.1994458663645835e-05, "loss": 0.7171807289123535, "mean_token_accuracy": 0.8172306433320046, "num_tokens": 11788968.0, "step": 2480 }, { "entropy": 0.6987740892916918, "epoch": 0.851063829787234, "grad_norm": 0.5828075408935547, "learning_rate": 1.1474191480261098e-05, "loss": 0.6787797451019287, "mean_token_accuracy": 0.8233332350850106, "num_tokens": 11839109.0, "step": 2490 }, { "entropy": 0.7257452422752977, "epoch": 0.854481756814492, "grad_norm": 0.5111470818519592, "learning_rate": 1.096477206592067e-05, "loss": 0.7015585422515869, "mean_token_accuracy": 0.8180849917232991, "num_tokens": 11889064.0, "step": 2500 }, { "epoch": 0.854481756814492, "eval_entropy": 0.6452019456773996, "eval_loss": 0.6404462456703186, "eval_mean_token_accuracy": 0.827375078573823, "eval_num_tokens": 11889064.0, "eval_runtime": 32.7054, "eval_samples_per_second": 7.827, "eval_steps_per_second": 0.978, "step": 2500 }, { "entropy": 0.7539002969861031, "epoch": 0.85789968384175, "grad_norm": 0.63209068775177, "learning_rate": 1.046626284382356e-05, "loss": 0.7466847419738769, "mean_token_accuracy": 0.8092853993177413, "num_tokens": 11935729.0, "step": 2510 }, { "entropy": 0.6735727831721305, "epoch": 0.8613176108690079, "grad_norm": 0.48319295048713684, "learning_rate": 9.978724900256265e-06, "loss": 0.6552696228027344, "mean_token_accuracy": 0.8258471079170704, "num_tokens": 11986975.0, "step": 2520 }, { "epoch": 0.863026574382637, "eval_entropy": 0.6486122142523527, "eval_loss": 0.6401728987693787, "eval_mean_token_accuracy": 0.8278232961893082, "eval_num_tokens": 12010780.0, "eval_runtime": 32.6273, "eval_samples_per_second": 7.846, "eval_steps_per_second": 0.981, "step": 2525 }, { "entropy": 0.7377024326473475, "epoch": 0.8647355378962659, "grad_norm": 0.6024383306503296, "learning_rate": 9.502217977107642e-06, "loss": 0.725794792175293, "mean_token_accuracy": 0.8168808005750179, "num_tokens": 12033819.0, "step": 2530 }, { "entropy": 0.6924330729991197, "epoch": 0.8681534649235239, "grad_norm": 0.5526846051216125, "learning_rate": 9.036800464548157e-06, "loss": 0.6714127540588379, "mean_token_accuracy": 0.8240827329456806, "num_tokens": 12082307.0, "step": 2540 }, { "entropy": 0.7305394794791937, "epoch": 0.8715713919507818, "grad_norm": 0.4549733102321625, "learning_rate": 8.582529393874927e-06, "loss": 0.7102427005767822, "mean_token_accuracy": 0.8165039896965027, "num_tokens": 12130018.0, "step": 2550 }, { "epoch": 0.8715713919507818, "eval_entropy": 0.6483217645436525, "eval_loss": 0.6397960782051086, "eval_mean_token_accuracy": 0.828344039618969, "eval_num_tokens": 12130018.0, "eval_runtime": 32.5906, "eval_samples_per_second": 7.855, "eval_steps_per_second": 0.982, "step": 2550 }, { "entropy": 0.6853050304576754, "epoch": 0.8749893189780398, "grad_norm": 0.5434498190879822, "learning_rate": 8.139460430523104e-06, "loss": 0.6624485492706299, "mean_token_accuracy": 0.8262315645813942, "num_tokens": 12178126.0, "step": 2560 }, { "entropy": 0.6818725261837244, "epoch": 0.8784072460052977, "grad_norm": 0.642160952091217, "learning_rate": 7.707647867244928e-06, "loss": 0.6672566890716553, "mean_token_accuracy": 0.8246341213583946, "num_tokens": 12227181.0, "step": 2570 }, { "epoch": 0.8801162095189268, "eval_entropy": 0.6478469502180815, "eval_loss": 0.6394245624542236, "eval_mean_token_accuracy": 0.8280942086130381, "eval_num_tokens": 12251947.0, "eval_runtime": 32.5909, "eval_samples_per_second": 7.855, "eval_steps_per_second": 0.982, "step": 2575 }, { "entropy": 0.6886890552937984, "epoch": 0.8818251730325558, "grad_norm": 0.472001850605011, "learning_rate": 7.287144617456654e-06, "loss": 0.6606461524963378, "mean_token_accuracy": 0.8270013853907585, "num_tokens": 12278219.0, "step": 2580 }, { "entropy": 0.7449534449726343, "epoch": 0.8852431000598138, "grad_norm": 0.4806518256664276, "learning_rate": 6.8780022087547305e-06, "loss": 0.7350006580352784, "mean_token_accuracy": 0.8134893275797367, "num_tokens": 12324590.0, "step": 2590 }, { "entropy": 0.6892618909478188, "epoch": 0.8886610270870717, "grad_norm": 0.8003678917884827, "learning_rate": 6.4802707766016825e-06, "loss": 0.6735070228576661, "mean_token_accuracy": 0.8235712304711342, "num_tokens": 12370465.0, "step": 2600 }, { "epoch": 0.8886610270870717, "eval_entropy": 0.6483608782291412, "eval_loss": 0.6388651132583618, "eval_mean_token_accuracy": 0.8282469250261784, "eval_num_tokens": 12370465.0, "eval_runtime": 32.6321, "eval_samples_per_second": 7.845, "eval_steps_per_second": 0.981, "step": 2600 }, { "entropy": 0.7182144347578288, "epoch": 0.8920789541143297, "grad_norm": 0.5940407514572144, "learning_rate": 6.09399905818262e-06, "loss": 0.6957920551300049, "mean_token_accuracy": 0.8216035731136799, "num_tokens": 12415923.0, "step": 2610 }, { "entropy": 0.7306089602410794, "epoch": 0.8954968811415877, "grad_norm": 0.5374943614006042, "learning_rate": 5.7192343864331255e-06, "loss": 0.7158644199371338, "mean_token_accuracy": 0.8140112727880477, "num_tokens": 12464233.0, "step": 2620 }, { "epoch": 0.8972058446552166, "eval_entropy": 0.6480556409806013, "eval_loss": 0.6388079524040222, "eval_mean_token_accuracy": 0.8276491928845644, "eval_num_tokens": 12490627.0, "eval_runtime": 32.6018, "eval_samples_per_second": 7.852, "eval_steps_per_second": 0.982, "step": 2625 }, { "entropy": 0.7090828090906143, "epoch": 0.8989148081688456, "grad_norm": 0.6297702193260193, "learning_rate": 5.3560226842390596e-06, "loss": 0.6868664264678955, "mean_token_accuracy": 0.8201880976557732, "num_tokens": 12518591.0, "step": 2630 }, { "entropy": 0.7153299488127232, "epoch": 0.9023327351961036, "grad_norm": 0.552191436290741, "learning_rate": 5.004408458809473e-06, "loss": 0.6930214405059815, "mean_token_accuracy": 0.8172111846506596, "num_tokens": 12569948.0, "step": 2640 }, { "entropy": 0.7137423895299435, "epoch": 0.9057506622233615, "grad_norm": 0.5232876539230347, "learning_rate": 4.664434796222528e-06, "loss": 0.7068160533905029, "mean_token_accuracy": 0.8190832555294036, "num_tokens": 12620238.0, "step": 2650 }, { "epoch": 0.9057506622233615, "eval_entropy": 0.6479176562279463, "eval_loss": 0.6384446024894714, "eval_mean_token_accuracy": 0.827843364328146, "eval_num_tokens": 12620238.0, "eval_runtime": 32.5681, "eval_samples_per_second": 7.86, "eval_steps_per_second": 0.983, "step": 2650 }, { "entropy": 0.6815611261874437, "epoch": 0.9091685892506195, "grad_norm": 0.7127875089645386, "learning_rate": 4.336143356146028e-06, "loss": 0.6582761764526367, "mean_token_accuracy": 0.8260635226964951, "num_tokens": 12669309.0, "step": 2660 }, { "entropy": 0.7074244495481252, "epoch": 0.9125865162778775, "grad_norm": 0.5414922833442688, "learning_rate": 4.019574366732426e-06, "loss": 0.6834642887115479, "mean_token_accuracy": 0.8240615390241146, "num_tokens": 12716960.0, "step": 2670 }, { "epoch": 0.9142954797915065, "eval_entropy": 0.6465785261243582, "eval_loss": 0.6383459568023682, "eval_mean_token_accuracy": 0.8281074147671461, "eval_num_tokens": 12737104.0, "eval_runtime": 32.6379, "eval_samples_per_second": 7.844, "eval_steps_per_second": 0.98, "step": 2675 }, { "entropy": 0.737743879109621, "epoch": 0.9160044433051354, "grad_norm": 0.7617110013961792, "learning_rate": 3.7147666196893693e-06, "loss": 0.72126145362854, "mean_token_accuracy": 0.8160571806132794, "num_tokens": 12760793.0, "step": 2680 }, { "entropy": 0.7016262900084257, "epoch": 0.9194223703323934, "grad_norm": 0.508277177810669, "learning_rate": 3.421757465526243e-06, "loss": 0.6778374671936035, "mean_token_accuracy": 0.8244507744908333, "num_tokens": 12809918.0, "step": 2690 }, { "entropy": 0.7006717912852765, "epoch": 0.9228402973596513, "grad_norm": 0.5380056500434875, "learning_rate": 3.140582808977355e-06, "loss": 0.6844939708709716, "mean_token_accuracy": 0.8254795782268047, "num_tokens": 12858956.0, "step": 2700 }, { "epoch": 0.9228402973596513, "eval_entropy": 0.6461731214076281, "eval_loss": 0.6381875872612, "eval_mean_token_accuracy": 0.8280313592404127, "eval_num_tokens": 12858956.0, "eval_runtime": 32.6956, "eval_samples_per_second": 7.83, "eval_steps_per_second": 0.979, "step": 2700 }, { "entropy": 0.6936084788292647, "epoch": 0.9262582243869093, "grad_norm": 0.7185409665107727, "learning_rate": 2.8712771046021768e-06, "loss": 0.6746735572814941, "mean_token_accuracy": 0.8217683151364327, "num_tokens": 12908472.0, "step": 2710 }, { "entropy": 0.7185607634484767, "epoch": 0.9296761514141673, "grad_norm": 0.6331292390823364, "learning_rate": 2.6138733525633895e-06, "loss": 0.700202465057373, "mean_token_accuracy": 0.8168184526264668, "num_tokens": 12957487.0, "step": 2720 }, { "epoch": 0.9313851149277963, "eval_entropy": 0.6467475481331348, "eval_loss": 0.6379902958869934, "eval_mean_token_accuracy": 0.8283456135541201, "eval_num_tokens": 12978759.0, "eval_runtime": 32.6564, "eval_samples_per_second": 7.839, "eval_steps_per_second": 0.98, "step": 2725 }, { "entropy": 0.7706727508455515, "epoch": 0.9330940784414252, "grad_norm": 0.5760138034820557, "learning_rate": 2.3684030945831158e-06, "loss": 0.7569189071655273, "mean_token_accuracy": 0.8080990195274353, "num_tokens": 13002599.0, "step": 2730 }, { "entropy": 0.7010563030838967, "epoch": 0.9365120054686833, "grad_norm": 0.5545640587806702, "learning_rate": 2.134896410077891e-06, "loss": 0.6833337783813477, "mean_token_accuracy": 0.8220656841993332, "num_tokens": 13051935.0, "step": 2740 }, { "entropy": 0.7135491766035557, "epoch": 0.9399299324959413, "grad_norm": 0.47150468826293945, "learning_rate": 1.9133819124727005e-06, "loss": 0.6957959651947021, "mean_token_accuracy": 0.8195874467492104, "num_tokens": 13102587.0, "step": 2750 }, { "epoch": 0.9399299324959413, "eval_entropy": 0.6465013269335032, "eval_loss": 0.6378064155578613, "eval_mean_token_accuracy": 0.8284552879631519, "eval_num_tokens": 13102587.0, "eval_runtime": 32.5024, "eval_samples_per_second": 7.876, "eval_steps_per_second": 0.985, "step": 2750 }, { "entropy": 0.718373591452837, "epoch": 0.9433478595231992, "grad_norm": 0.7023600339889526, "learning_rate": 1.7038867456948383e-06, "loss": 0.7024884223937988, "mean_token_accuracy": 0.8127410352230072, "num_tokens": 13151230.0, "step": 2760 }, { "entropy": 0.6812984146177768, "epoch": 0.9467657865504572, "grad_norm": 0.5730180144309998, "learning_rate": 1.5064365808477254e-06, "loss": 0.6751970291137696, "mean_token_accuracy": 0.825221062451601, "num_tokens": 13199667.0, "step": 2770 }, { "epoch": 0.9484747500640861, "eval_entropy": 0.6464472748339176, "eval_loss": 0.6376645565032959, "eval_mean_token_accuracy": 0.8284712266176939, "eval_num_tokens": 13222849.0, "eval_runtime": 32.5065, "eval_samples_per_second": 7.875, "eval_steps_per_second": 0.984, "step": 2775 }, { "entropy": 0.6846175715327263, "epoch": 0.9501837135777151, "grad_norm": 0.4973992705345154, "learning_rate": 1.321055613065203e-06, "loss": 0.6522854328155517, "mean_token_accuracy": 0.8291602872312069, "num_tokens": 13246877.0, "step": 2780 }, { "entropy": 0.7449381787329912, "epoch": 0.9536016406049731, "grad_norm": 0.5896213054656982, "learning_rate": 1.1477665585467257e-06, "loss": 0.7295150756835938, "mean_token_accuracy": 0.8137959085404873, "num_tokens": 13291131.0, "step": 2790 }, { "entropy": 0.7088073439896106, "epoch": 0.9570195676322311, "grad_norm": 0.48523518443107605, "learning_rate": 9.865906517738e-07, "loss": 0.6960892677307129, "mean_token_accuracy": 0.8195622898638248, "num_tokens": 13341632.0, "step": 2800 }, { "epoch": 0.9570195676322311, "eval_entropy": 0.6466101501137018, "eval_loss": 0.6376082897186279, "eval_mean_token_accuracy": 0.8284325748682022, "eval_num_tokens": 13341632.0, "eval_runtime": 32.5248, "eval_samples_per_second": 7.871, "eval_steps_per_second": 0.984, "step": 2800 }, { "entropy": 0.6897268868982792, "epoch": 0.960437494659489, "grad_norm": 0.5249438285827637, "learning_rate": 8.375476429078544e-07, "loss": 0.6755472183227539, "mean_token_accuracy": 0.8227805390954017, "num_tokens": 13395014.0, "step": 2810 }, { "entropy": 0.7521859399974347, "epoch": 0.963855421686747, "grad_norm": 0.5275380611419678, "learning_rate": 7.006557953702198e-07, "loss": 0.7428174018859863, "mean_token_accuracy": 0.8101296730339527, "num_tokens": 13447963.0, "step": 2820 }, { "epoch": 0.965564385200376, "eval_entropy": 0.6466463468968868, "eval_loss": 0.6376487612724304, "eval_mean_token_accuracy": 0.8285549189895391, "eval_num_tokens": 13471931.0, "eval_runtime": 32.4665, "eval_samples_per_second": 7.885, "eval_steps_per_second": 0.986, "step": 2825 }, { "entropy": 0.7089713286608458, "epoch": 0.9672733487140049, "grad_norm": 0.5778820514678955, "learning_rate": 5.759318836040861e-07, "loss": 0.6880727291107178, "mean_token_accuracy": 0.8235937155783176, "num_tokens": 13494899.0, "step": 2830 }, { "entropy": 0.7000694863498211, "epoch": 0.9706912757412629, "grad_norm": 0.7135331034660339, "learning_rate": 4.6339119101902473e-07, "loss": 0.6771084308624268, "mean_token_accuracy": 0.8221731469035148, "num_tokens": 13539972.0, "step": 2840 }, { "entropy": 0.6829410705715417, "epoch": 0.9741092027685209, "grad_norm": 0.6099685430526733, "learning_rate": 3.630475081181861e-07, "loss": 0.655033540725708, "mean_token_accuracy": 0.8259231664240361, "num_tokens": 13587391.0, "step": 2850 }, { "epoch": 0.9741092027685209, "eval_entropy": 0.6465384587645531, "eval_loss": 0.6375482082366943, "eval_mean_token_accuracy": 0.828503267839551, "eval_num_tokens": 13587391.0, "eval_runtime": 32.5191, "eval_samples_per_second": 7.872, "eval_steps_per_second": 0.984, "step": 2850 }, { "entropy": 0.7193181496113539, "epoch": 0.9775271297957788, "grad_norm": 0.6574059724807739, "learning_rate": 2.7491313080844074e-07, "loss": 0.7081467151641846, "mean_token_accuracy": 0.8188973918557167, "num_tokens": 13636095.0, "step": 2860 }, { "entropy": 0.7227353582158684, "epoch": 0.9809450568230368, "grad_norm": 0.6026723980903625, "learning_rate": 1.989988588936509e-07, "loss": 0.7178384304046631, "mean_token_accuracy": 0.8183843664824962, "num_tokens": 13685656.0, "step": 2870 }, { "epoch": 0.9826540203366658, "eval_entropy": 0.646482452750206, "eval_loss": 0.6376971006393433, "eval_mean_token_accuracy": 0.8282717633992434, "eval_num_tokens": 13710861.0, "eval_runtime": 32.5648, "eval_samples_per_second": 7.861, "eval_steps_per_second": 0.983, "step": 2875 }, { "entropy": 0.6969666961580515, "epoch": 0.9843629838502947, "grad_norm": 0.6726225018501282, "learning_rate": 1.3531399475132934e-07, "loss": 0.6770923137664795, "mean_token_accuracy": 0.8201491139829159, "num_tokens": 13736037.0, "step": 2880 }, { "entropy": 0.7437307950109243, "epoch": 0.9877809108775527, "grad_norm": 0.6295607089996338, "learning_rate": 8.386634219269551e-08, "loss": 0.7483133792877197, "mean_token_accuracy": 0.8097194038331509, "num_tokens": 13784654.0, "step": 2890 }, { "entropy": 0.7080582052469253, "epoch": 0.9911988379048108, "grad_norm": 0.5197203755378723, "learning_rate": 4.466220550641831e-08, "loss": 0.6913296222686768, "mean_token_accuracy": 0.8222644709050655, "num_tokens": 13832230.0, "step": 2900 }, { "epoch": 0.9911988379048108, "eval_entropy": 0.6466146521270275, "eval_loss": 0.6376142501831055, "eval_mean_token_accuracy": 0.8284369762986898, "eval_num_tokens": 13832230.0, "eval_runtime": 32.5153, "eval_samples_per_second": 7.873, "eval_steps_per_second": 0.984, "step": 2900 }, { "entropy": 0.7204008292406797, "epoch": 0.9946167649320687, "grad_norm": 0.6330618858337402, "learning_rate": 1.770638868614505e-08, "loss": 0.7113766670227051, "mean_token_accuracy": 0.8157438091933727, "num_tokens": 13881699.0, "step": 2910 }, { "entropy": 0.7834692295640707, "epoch": 0.9980346919593267, "grad_norm": 0.5942244529724121, "learning_rate": 3.0021948417724433e-09, "loss": 0.7758901119232178, "mean_token_accuracy": 0.8049186132848263, "num_tokens": 13926410.0, "step": 2920 }, { "epoch": 0.9997436554729556, "eval_entropy": 0.646532105281949, "eval_loss": 0.6376615762710571, "eval_mean_token_accuracy": 0.8283750601112843, "eval_num_tokens": 13951499.0, "eval_runtime": 32.5193, "eval_samples_per_second": 7.872, "eval_steps_per_second": 0.984, "step": 2925 }, { "epoch": 1.0, "eval_entropy": 0.646526113152504, "eval_loss": 0.6376044750213623, "eval_mean_token_accuracy": 0.828487666323781, "eval_num_tokens": 13954682.0, "eval_runtime": 32.5825, "eval_samples_per_second": 7.857, "eval_steps_per_second": 0.982, "step": 2926 } ], "logging_steps": 10, "max_steps": 2926, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9.507902841041303e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }