{ "best_global_step": 4000, "best_metric": 0.9059992432594299, "best_model_checkpoint": "/output/checkpoint-4000", "epoch": 1.0, "eval_steps": 1000, "global_step": 6875, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.9690187186002732, "epoch": 0.0014545454545454545, "grad_norm": 3.43977427482605, "learning_rate": 3.6e-06, "loss": 3.0029, "mean_token_accuracy": 0.5691731169819831, "num_tokens": 79064.0, "step": 10 }, { "entropy": 1.9884992867708207, "epoch": 0.002909090909090909, "grad_norm": 2.83909010887146, "learning_rate": 7.6e-06, "loss": 2.8692, "mean_token_accuracy": 0.5725244455039501, "num_tokens": 154393.0, "step": 20 }, { "entropy": 1.9358498841524123, "epoch": 0.004363636363636364, "grad_norm": 1.7116823196411133, "learning_rate": 1.16e-05, "loss": 2.3806, "mean_token_accuracy": 0.6368451230227947, "num_tokens": 228943.0, "step": 30 }, { "entropy": 1.7093544438481332, "epoch": 0.005818181818181818, "grad_norm": 1.6132644414901733, "learning_rate": 1.56e-05, "loss": 1.8428, "mean_token_accuracy": 0.7234954014420509, "num_tokens": 306256.0, "step": 40 }, { "entropy": 1.2660569161176682, "epoch": 0.007272727272727273, "grad_norm": 0.6458194255828857, "learning_rate": 1.9600000000000002e-05, "loss": 1.4382, "mean_token_accuracy": 0.7754112549126149, "num_tokens": 384266.0, "step": 50 }, { "entropy": 1.1226252019405365, "epoch": 0.008727272727272728, "grad_norm": 0.6182602047920227, "learning_rate": 2.36e-05, "loss": 1.3458, "mean_token_accuracy": 0.7865310192108155, "num_tokens": 461739.0, "step": 60 }, { "entropy": 1.125070570409298, "epoch": 0.010181818181818183, "grad_norm": 0.6158664226531982, "learning_rate": 2.7600000000000003e-05, "loss": 1.2877, "mean_token_accuracy": 0.7905296355485916, "num_tokens": 537886.0, "step": 70 }, { "entropy": 1.1717857442796231, "epoch": 0.011636363636363636, "grad_norm": 0.7183849811553955, "learning_rate": 3.16e-05, "loss": 1.2715, "mean_token_accuracy": 0.7846172668039799, "num_tokens": 615757.0, "step": 80 }, { "entropy": 1.1927465781569482, "epoch": 0.01309090909090909, "grad_norm": 0.8525499105453491, "learning_rate": 3.56e-05, "loss": 1.1248, "mean_token_accuracy": 0.7961836472153664, "num_tokens": 695863.0, "step": 90 }, { "entropy": 1.1620682552456856, "epoch": 0.014545454545454545, "grad_norm": 0.5231317281723022, "learning_rate": 3.960000000000001e-05, "loss": 1.0643, "mean_token_accuracy": 0.7999849386513234, "num_tokens": 772443.0, "step": 100 }, { "entropy": 1.045405673980713, "epoch": 0.016, "grad_norm": 0.49973607063293457, "learning_rate": 4.36e-05, "loss": 0.979, "mean_token_accuracy": 0.8065101094543934, "num_tokens": 846969.0, "step": 110 }, { "entropy": 0.9968309663236141, "epoch": 0.017454545454545455, "grad_norm": 0.3941137492656708, "learning_rate": 4.76e-05, "loss": 0.9938, "mean_token_accuracy": 0.8016430333256721, "num_tokens": 923000.0, "step": 120 }, { "entropy": 0.9893214151263237, "epoch": 0.01890909090909091, "grad_norm": 0.37142255902290344, "learning_rate": 5.16e-05, "loss": 0.9833, "mean_token_accuracy": 0.8012244574725628, "num_tokens": 1000553.0, "step": 130 }, { "entropy": 0.9901775293052196, "epoch": 0.020363636363636365, "grad_norm": 0.4280157685279846, "learning_rate": 5.560000000000001e-05, "loss": 0.9994, "mean_token_accuracy": 0.7991660989820957, "num_tokens": 1080518.0, "step": 140 }, { "entropy": 1.0011372923851014, "epoch": 0.02181818181818182, "grad_norm": 0.46264714002609253, "learning_rate": 5.96e-05, "loss": 0.9677, "mean_token_accuracy": 0.8027120277285575, "num_tokens": 1157512.0, "step": 150 }, { "entropy": 1.0423012726008891, "epoch": 0.02327272727272727, "grad_norm": 0.5806897282600403, "learning_rate": 6.36e-05, "loss": 1.0167, "mean_token_accuracy": 0.7943629838526249, "num_tokens": 1237133.0, "step": 160 }, { "entropy": 0.9785076573491096, "epoch": 0.024727272727272726, "grad_norm": 0.4361409544944763, "learning_rate": 6.76e-05, "loss": 0.9548, "mean_token_accuracy": 0.805290812253952, "num_tokens": 1313695.0, "step": 170 }, { "entropy": 1.0021748550236225, "epoch": 0.02618181818181818, "grad_norm": 0.33419522643089294, "learning_rate": 7.16e-05, "loss": 0.9693, "mean_token_accuracy": 0.8024131752550602, "num_tokens": 1391060.0, "step": 180 }, { "entropy": 0.9982842341065407, "epoch": 0.027636363636363636, "grad_norm": 0.3242931663990021, "learning_rate": 7.560000000000001e-05, "loss": 0.9685, "mean_token_accuracy": 0.8046549871563912, "num_tokens": 1466252.0, "step": 190 }, { "entropy": 1.0053840905427933, "epoch": 0.02909090909090909, "grad_norm": 0.37451791763305664, "learning_rate": 7.960000000000001e-05, "loss": 0.9732, "mean_token_accuracy": 0.8007707796990872, "num_tokens": 1546051.0, "step": 200 }, { "entropy": 1.0307183906435966, "epoch": 0.030545454545454546, "grad_norm": 0.36106330156326294, "learning_rate": 8.36e-05, "loss": 0.9932, "mean_token_accuracy": 0.7989874318242073, "num_tokens": 1623829.0, "step": 210 }, { "entropy": 1.004240720719099, "epoch": 0.032, "grad_norm": 0.37988972663879395, "learning_rate": 8.76e-05, "loss": 0.9644, "mean_token_accuracy": 0.8057900808751584, "num_tokens": 1700491.0, "step": 220 }, { "entropy": 0.9733926706016064, "epoch": 0.03345454545454545, "grad_norm": 0.3222545087337494, "learning_rate": 9.16e-05, "loss": 0.9392, "mean_token_accuracy": 0.8078257352113724, "num_tokens": 1774420.0, "step": 230 }, { "entropy": 1.0155424050986768, "epoch": 0.03490909090909091, "grad_norm": 0.3336285352706909, "learning_rate": 9.56e-05, "loss": 0.9734, "mean_token_accuracy": 0.8015428952872753, "num_tokens": 1851932.0, "step": 240 }, { "entropy": 0.965352301299572, "epoch": 0.03636363636363636, "grad_norm": 0.43020081520080566, "learning_rate": 9.960000000000001e-05, "loss": 0.9282, "mean_token_accuracy": 0.8091536939144135, "num_tokens": 1927921.0, "step": 250 }, { "entropy": 0.9632523223757744, "epoch": 0.03781818181818182, "grad_norm": 0.32411623001098633, "learning_rate": 0.00010360000000000001, "loss": 0.9377, "mean_token_accuracy": 0.8093271479010582, "num_tokens": 2002244.0, "step": 260 }, { "entropy": 0.9855949737131595, "epoch": 0.03927272727272727, "grad_norm": 0.29636406898498535, "learning_rate": 0.00010760000000000001, "loss": 0.9383, "mean_token_accuracy": 0.8091096922755241, "num_tokens": 2076471.0, "step": 270 }, { "entropy": 0.9959837473928929, "epoch": 0.04072727272727273, "grad_norm": 0.31697383522987366, "learning_rate": 0.00011160000000000002, "loss": 0.9631, "mean_token_accuracy": 0.8035324491560459, "num_tokens": 2152670.0, "step": 280 }, { "entropy": 0.9984123289585114, "epoch": 0.04218181818181818, "grad_norm": 0.30740225315093994, "learning_rate": 0.00011559999999999999, "loss": 0.9652, "mean_token_accuracy": 0.8041438944637775, "num_tokens": 2227827.0, "step": 290 }, { "entropy": 0.9823802955448627, "epoch": 0.04363636363636364, "grad_norm": 0.5217260122299194, "learning_rate": 0.00011960000000000001, "loss": 0.9501, "mean_token_accuracy": 0.8054948531091213, "num_tokens": 2304457.0, "step": 300 }, { "entropy": 0.986659524589777, "epoch": 0.04509090909090909, "grad_norm": 0.37950316071510315, "learning_rate": 0.0001236, "loss": 0.9508, "mean_token_accuracy": 0.8070364102721215, "num_tokens": 2381034.0, "step": 310 }, { "entropy": 0.9770919024944306, "epoch": 0.04654545454545454, "grad_norm": 0.2790478467941284, "learning_rate": 0.0001276, "loss": 0.9416, "mean_token_accuracy": 0.8086497105658055, "num_tokens": 2457635.0, "step": 320 }, { "entropy": 0.9718254946172238, "epoch": 0.048, "grad_norm": 0.29544803500175476, "learning_rate": 0.0001316, "loss": 0.9455, "mean_token_accuracy": 0.8079691752791405, "num_tokens": 2534043.0, "step": 330 }, { "entropy": 0.9868722438812256, "epoch": 0.04945454545454545, "grad_norm": 0.3150554895401001, "learning_rate": 0.00013560000000000002, "loss": 0.9516, "mean_token_accuracy": 0.8049276761710644, "num_tokens": 2610676.0, "step": 340 }, { "entropy": 0.9821666151285171, "epoch": 0.05090909090909091, "grad_norm": 0.30912908911705017, "learning_rate": 0.0001396, "loss": 0.9413, "mean_token_accuracy": 0.80631243288517, "num_tokens": 2687398.0, "step": 350 }, { "entropy": 0.9813764326274395, "epoch": 0.05236363636363636, "grad_norm": 0.3392393887042999, "learning_rate": 0.0001436, "loss": 0.9551, "mean_token_accuracy": 0.8057433366775513, "num_tokens": 2763780.0, "step": 360 }, { "entropy": 0.9714535295963287, "epoch": 0.05381818181818182, "grad_norm": 0.593127429485321, "learning_rate": 0.0001476, "loss": 0.9446, "mean_token_accuracy": 0.8071163192391395, "num_tokens": 2841687.0, "step": 370 }, { "entropy": 0.9950341284275055, "epoch": 0.05527272727272727, "grad_norm": 0.5920702219009399, "learning_rate": 0.0001516, "loss": 0.9567, "mean_token_accuracy": 0.8022288359701634, "num_tokens": 2921696.0, "step": 380 }, { "entropy": 0.9623408317565918, "epoch": 0.05672727272727273, "grad_norm": 0.26438552141189575, "learning_rate": 0.00015560000000000001, "loss": 0.9451, "mean_token_accuracy": 0.8056230574846268, "num_tokens": 2999827.0, "step": 390 }, { "entropy": 0.969329858571291, "epoch": 0.05818181818181818, "grad_norm": 0.28617411851882935, "learning_rate": 0.0001596, "loss": 0.9311, "mean_token_accuracy": 0.8082362949848175, "num_tokens": 3075878.0, "step": 400 }, { "entropy": 0.9626947619020939, "epoch": 0.05963636363636363, "grad_norm": 0.29560142755508423, "learning_rate": 0.0001636, "loss": 0.9325, "mean_token_accuracy": 0.8075426079332828, "num_tokens": 3149659.0, "step": 410 }, { "entropy": 0.9842231079936028, "epoch": 0.06109090909090909, "grad_norm": 0.36081886291503906, "learning_rate": 0.0001676, "loss": 0.9597, "mean_token_accuracy": 0.8048615127801895, "num_tokens": 3224908.0, "step": 420 }, { "entropy": 0.9678519986569881, "epoch": 0.06254545454545454, "grad_norm": 0.32404276728630066, "learning_rate": 0.0001716, "loss": 0.9501, "mean_token_accuracy": 0.8070563480257988, "num_tokens": 3300465.0, "step": 430 }, { "entropy": 0.9691661924123764, "epoch": 0.064, "grad_norm": 0.3594436049461365, "learning_rate": 0.0001756, "loss": 0.9418, "mean_token_accuracy": 0.80767857208848, "num_tokens": 3378460.0, "step": 440 }, { "entropy": 1.000221849232912, "epoch": 0.06545454545454546, "grad_norm": 0.27946728467941284, "learning_rate": 0.0001796, "loss": 0.9784, "mean_token_accuracy": 0.8053525581955909, "num_tokens": 3457035.0, "step": 450 }, { "entropy": 0.9556974627077579, "epoch": 0.0669090909090909, "grad_norm": 0.3116967976093292, "learning_rate": 0.00018360000000000002, "loss": 0.9295, "mean_token_accuracy": 0.8102393008768558, "num_tokens": 3531556.0, "step": 460 }, { "entropy": 1.0009116798639297, "epoch": 0.06836363636363636, "grad_norm": 0.24993526935577393, "learning_rate": 0.0001876, "loss": 0.9652, "mean_token_accuracy": 0.8023554868996143, "num_tokens": 3608896.0, "step": 470 }, { "entropy": 0.9631584003567696, "epoch": 0.06981818181818182, "grad_norm": 0.39844977855682373, "learning_rate": 0.0001916, "loss": 0.9402, "mean_token_accuracy": 0.8080028325319291, "num_tokens": 3685526.0, "step": 480 }, { "entropy": 0.9812145739793777, "epoch": 0.07127272727272728, "grad_norm": 0.25667306780815125, "learning_rate": 0.0001956, "loss": 0.9498, "mean_token_accuracy": 0.8053297907114029, "num_tokens": 3762930.0, "step": 490 }, { "entropy": 0.9755678996443748, "epoch": 0.07272727272727272, "grad_norm": 0.25863754749298096, "learning_rate": 0.0001996, "loss": 0.9655, "mean_token_accuracy": 0.8062391959130764, "num_tokens": 3841245.0, "step": 500 }, { "entropy": 0.9802602089941501, "epoch": 0.07418181818181818, "grad_norm": 0.36054691672325134, "learning_rate": 0.00019999901694803208, "loss": 0.9497, "mean_token_accuracy": 0.8051057532429695, "num_tokens": 3918834.0, "step": 510 }, { "entropy": 0.9571634404361248, "epoch": 0.07563636363636364, "grad_norm": 0.4442167580127716, "learning_rate": 0.00019999561876852487, "loss": 0.9338, "mean_token_accuracy": 0.8084112584590912, "num_tokens": 3995115.0, "step": 520 }, { "entropy": 0.963586512953043, "epoch": 0.07709090909090908, "grad_norm": 0.31452101469039917, "learning_rate": 0.0001999897934075395, "loss": 0.9485, "mean_token_accuracy": 0.8092979274690151, "num_tokens": 4072831.0, "step": 530 }, { "entropy": 0.9710368476808071, "epoch": 0.07854545454545454, "grad_norm": 0.271147757768631, "learning_rate": 0.0001999815410065451, "loss": 0.9452, "mean_token_accuracy": 0.8060981146991253, "num_tokens": 4149986.0, "step": 540 }, { "entropy": 0.9665751494467258, "epoch": 0.08, "grad_norm": 0.34051278233528137, "learning_rate": 0.0001999708617659513, "loss": 0.9449, "mean_token_accuracy": 0.8084499321877956, "num_tokens": 4225284.0, "step": 550 }, { "entropy": 0.9917739503085613, "epoch": 0.08145454545454546, "grad_norm": 0.28123149275779724, "learning_rate": 0.00019995775594510375, "loss": 0.965, "mean_token_accuracy": 0.8031023532152176, "num_tokens": 4304103.0, "step": 560 }, { "entropy": 0.9659538678824902, "epoch": 0.0829090909090909, "grad_norm": 0.3097119927406311, "learning_rate": 0.00019994222386227756, "loss": 0.9469, "mean_token_accuracy": 0.8073901452124119, "num_tokens": 4378474.0, "step": 570 }, { "entropy": 0.9613742314279079, "epoch": 0.08436363636363636, "grad_norm": 0.36504626274108887, "learning_rate": 0.0001999242658946697, "loss": 0.9362, "mean_token_accuracy": 0.8093178525567055, "num_tokens": 4455068.0, "step": 580 }, { "entropy": 0.9502459809184074, "epoch": 0.08581818181818182, "grad_norm": 0.30682137608528137, "learning_rate": 0.00019990388247838976, "loss": 0.9296, "mean_token_accuracy": 0.8076415918767452, "num_tokens": 4532441.0, "step": 590 }, { "entropy": 0.9592754155397415, "epoch": 0.08727272727272728, "grad_norm": 0.2672958970069885, "learning_rate": 0.0001998810741084495, "loss": 0.9517, "mean_token_accuracy": 0.8078010775148868, "num_tokens": 4608937.0, "step": 600 }, { "entropy": 0.9618418499827385, "epoch": 0.08872727272727272, "grad_norm": 0.3508414328098297, "learning_rate": 0.00019985584133875062, "loss": 0.929, "mean_token_accuracy": 0.8108504980802536, "num_tokens": 4683807.0, "step": 610 }, { "entropy": 0.9733804412186146, "epoch": 0.09018181818181818, "grad_norm": 0.3088361620903015, "learning_rate": 0.00019982818478207146, "loss": 0.9496, "mean_token_accuracy": 0.8067471913993358, "num_tokens": 4761822.0, "step": 620 }, { "entropy": 0.948646043241024, "epoch": 0.09163636363636364, "grad_norm": 0.29966917634010315, "learning_rate": 0.00019979810511005215, "loss": 0.9269, "mean_token_accuracy": 0.8102207146584988, "num_tokens": 4836571.0, "step": 630 }, { "entropy": 0.9861510775983333, "epoch": 0.09309090909090909, "grad_norm": 0.2919958233833313, "learning_rate": 0.0001997656030531781, "loss": 0.97, "mean_token_accuracy": 0.8068868108093739, "num_tokens": 4912711.0, "step": 640 }, { "entropy": 0.9733738884329796, "epoch": 0.09454545454545454, "grad_norm": 0.2824857234954834, "learning_rate": 0.00019973067940076252, "loss": 0.9599, "mean_token_accuracy": 0.8068003825843334, "num_tokens": 4990087.0, "step": 650 }, { "entropy": 0.9654402084648609, "epoch": 0.096, "grad_norm": 0.5585899353027344, "learning_rate": 0.00019969333500092698, "loss": 0.9415, "mean_token_accuracy": 0.8078834369778634, "num_tokens": 5068076.0, "step": 660 }, { "entropy": 0.9511952914297581, "epoch": 0.09745454545454546, "grad_norm": 0.27784818410873413, "learning_rate": 0.00019965357076058104, "loss": 0.9276, "mean_token_accuracy": 0.810407143086195, "num_tokens": 5144288.0, "step": 670 }, { "entropy": 0.9477476179599762, "epoch": 0.0989090909090909, "grad_norm": 0.39101967215538025, "learning_rate": 0.0001996113876454002, "loss": 0.9259, "mean_token_accuracy": 0.811048673093319, "num_tokens": 5218249.0, "step": 680 }, { "entropy": 0.9532744571566582, "epoch": 0.10036363636363636, "grad_norm": 0.32930827140808105, "learning_rate": 0.00019956678667980217, "loss": 0.9209, "mean_token_accuracy": 0.8119081415235996, "num_tokens": 5294409.0, "step": 690 }, { "entropy": 0.9863594181835651, "epoch": 0.10181818181818182, "grad_norm": 0.31709808111190796, "learning_rate": 0.0001995197689469225, "loss": 0.9568, "mean_token_accuracy": 0.8043609701097012, "num_tokens": 5373459.0, "step": 700 }, { "entropy": 0.9500035136938095, "epoch": 0.10327272727272727, "grad_norm": 0.35338568687438965, "learning_rate": 0.00019947033558858775, "loss": 0.9333, "mean_token_accuracy": 0.8085519306361675, "num_tokens": 5450783.0, "step": 710 }, { "entropy": 0.9919221103191376, "epoch": 0.10472727272727272, "grad_norm": 0.3136957287788391, "learning_rate": 0.00019941848780528806, "loss": 0.9667, "mean_token_accuracy": 0.8043533161282539, "num_tokens": 5527972.0, "step": 720 }, { "entropy": 0.9358678698539734, "epoch": 0.10618181818181818, "grad_norm": 0.30247825384140015, "learning_rate": 0.00019936422685614799, "loss": 0.9128, "mean_token_accuracy": 0.812498589605093, "num_tokens": 5601051.0, "step": 730 }, { "entropy": 0.9480448178946972, "epoch": 0.10763636363636364, "grad_norm": 0.3738067150115967, "learning_rate": 0.00019930755405889582, "loss": 0.927, "mean_token_accuracy": 0.8110132366418839, "num_tokens": 5674547.0, "step": 740 }, { "entropy": 0.9623192340135575, "epoch": 0.10909090909090909, "grad_norm": 0.341701865196228, "learning_rate": 0.0001992484707898317, "loss": 0.9471, "mean_token_accuracy": 0.808195649087429, "num_tokens": 5753663.0, "step": 750 }, { "entropy": 0.9636863119900226, "epoch": 0.11054545454545454, "grad_norm": 0.3272800147533417, "learning_rate": 0.00019918697848379398, "loss": 0.9372, "mean_token_accuracy": 0.8089156173169613, "num_tokens": 5829244.0, "step": 760 }, { "entropy": 0.952582273632288, "epoch": 0.112, "grad_norm": 0.2747955024242401, "learning_rate": 0.00019912307863412468, "loss": 0.9246, "mean_token_accuracy": 0.8115990363061428, "num_tokens": 5905553.0, "step": 770 }, { "entropy": 0.956246180832386, "epoch": 0.11345454545454546, "grad_norm": 0.28963592648506165, "learning_rate": 0.00019905677279263303, "loss": 0.9513, "mean_token_accuracy": 0.8093406230211257, "num_tokens": 5982595.0, "step": 780 }, { "entropy": 0.9501231409609318, "epoch": 0.1149090909090909, "grad_norm": 0.2975050210952759, "learning_rate": 0.0001989880625695577, "loss": 0.9227, "mean_token_accuracy": 0.8131072640419006, "num_tokens": 6058325.0, "step": 790 }, { "entropy": 0.9440824434161186, "epoch": 0.11636363636363636, "grad_norm": 0.34666338562965393, "learning_rate": 0.00019891694963352803, "loss": 0.9146, "mean_token_accuracy": 0.8128655597567558, "num_tokens": 6133747.0, "step": 800 }, { "entropy": 0.9762783326208592, "epoch": 0.11781818181818182, "grad_norm": 0.4371774196624756, "learning_rate": 0.00019884343571152313, "loss": 0.9608, "mean_token_accuracy": 0.8071666911244393, "num_tokens": 6212280.0, "step": 810 }, { "entropy": 0.9690908081829548, "epoch": 0.11927272727272727, "grad_norm": 0.3035489618778229, "learning_rate": 0.0001987675225888302, "loss": 0.9328, "mean_token_accuracy": 0.8099577404558659, "num_tokens": 6288436.0, "step": 820 }, { "entropy": 0.9473535366356373, "epoch": 0.12072727272727272, "grad_norm": 0.2877722680568695, "learning_rate": 0.000198689212109001, "loss": 0.9367, "mean_token_accuracy": 0.8102696388959885, "num_tokens": 6365114.0, "step": 830 }, { "entropy": 0.9800632715225219, "epoch": 0.12218181818181818, "grad_norm": 0.3979131877422333, "learning_rate": 0.0001986085061738072, "loss": 0.9526, "mean_token_accuracy": 0.807623814046383, "num_tokens": 6442583.0, "step": 840 }, { "entropy": 0.9318563066422939, "epoch": 0.12363636363636364, "grad_norm": 0.36992502212524414, "learning_rate": 0.00019852540674319415, "loss": 0.9192, "mean_token_accuracy": 0.8144332192838192, "num_tokens": 6518109.0, "step": 850 }, { "entropy": 0.9581544451415539, "epoch": 0.12509090909090909, "grad_norm": 0.2897164225578308, "learning_rate": 0.00019843991583523332, "loss": 0.925, "mean_token_accuracy": 0.8085106551647187, "num_tokens": 6598310.0, "step": 860 }, { "entropy": 0.9448593385517597, "epoch": 0.12654545454545454, "grad_norm": 0.2775498926639557, "learning_rate": 0.0001983520355260732, "loss": 0.9303, "mean_token_accuracy": 0.8096731394529343, "num_tokens": 6676666.0, "step": 870 }, { "entropy": 0.9634767659008503, "epoch": 0.128, "grad_norm": 0.3571963906288147, "learning_rate": 0.000198261767949889, "loss": 0.9336, "mean_token_accuracy": 0.809954322874546, "num_tokens": 6753460.0, "step": 880 }, { "entropy": 0.9582797236740589, "epoch": 0.12945454545454546, "grad_norm": 0.3039088845252991, "learning_rate": 0.0001981691152988307, "loss": 0.9457, "mean_token_accuracy": 0.8096859961748123, "num_tokens": 6830638.0, "step": 890 }, { "entropy": 0.941552960127592, "epoch": 0.13090909090909092, "grad_norm": 0.32802486419677734, "learning_rate": 0.00019807407982296992, "loss": 0.9149, "mean_token_accuracy": 0.8126296833157539, "num_tokens": 6906602.0, "step": 900 }, { "entropy": 0.9520909287035465, "epoch": 0.13236363636363635, "grad_norm": 0.3812902569770813, "learning_rate": 0.00019797666383024516, "loss": 0.9332, "mean_token_accuracy": 0.8106161102652549, "num_tokens": 6981252.0, "step": 910 }, { "entropy": 0.9571222126483917, "epoch": 0.1338181818181818, "grad_norm": 0.33096054196357727, "learning_rate": 0.00019787686968640594, "loss": 0.933, "mean_token_accuracy": 0.8085237428545952, "num_tokens": 7059497.0, "step": 920 }, { "entropy": 0.9404919967055321, "epoch": 0.13527272727272727, "grad_norm": 0.3364405333995819, "learning_rate": 0.00019777469981495515, "loss": 0.9238, "mean_token_accuracy": 0.8110041253268718, "num_tokens": 7135602.0, "step": 930 }, { "entropy": 0.9433817587792873, "epoch": 0.13672727272727273, "grad_norm": 0.28743976354599, "learning_rate": 0.0001976701566970903, "loss": 0.9178, "mean_token_accuracy": 0.8115247070789338, "num_tokens": 7211560.0, "step": 940 }, { "entropy": 0.9528502456843853, "epoch": 0.13818181818181818, "grad_norm": 0.28429099917411804, "learning_rate": 0.0001975632428716432, "loss": 0.9356, "mean_token_accuracy": 0.81063963919878, "num_tokens": 7289139.0, "step": 950 }, { "entropy": 0.9531728699803352, "epoch": 0.13963636363636364, "grad_norm": 0.30310696363449097, "learning_rate": 0.0001974539609350184, "loss": 0.9214, "mean_token_accuracy": 0.8126495592296124, "num_tokens": 7365669.0, "step": 960 }, { "entropy": 0.9738307923078537, "epoch": 0.1410909090909091, "grad_norm": 0.3467698395252228, "learning_rate": 0.00019734231354113003, "loss": 0.9643, "mean_token_accuracy": 0.8050346717238426, "num_tokens": 7443919.0, "step": 970 }, { "entropy": 0.9685733772814273, "epoch": 0.14254545454545456, "grad_norm": 0.29552823305130005, "learning_rate": 0.00019722830340133748, "loss": 0.942, "mean_token_accuracy": 0.8079716853797436, "num_tokens": 7520114.0, "step": 980 }, { "entropy": 0.9668281979858875, "epoch": 0.144, "grad_norm": 0.2899906039237976, "learning_rate": 0.00019711193328437936, "loss": 0.9367, "mean_token_accuracy": 0.8102179229259491, "num_tokens": 7597364.0, "step": 990 }, { "entropy": 0.9519609495997429, "epoch": 0.14545454545454545, "grad_norm": 0.2897755205631256, "learning_rate": 0.0001969932060163065, "loss": 0.9446, "mean_token_accuracy": 0.8093790285289287, "num_tokens": 7674378.0, "step": 1000 }, { "epoch": 0.14545454545454545, "eval_entropy": 0.9725983184814453, "eval_loss": 0.9227215051651001, "eval_mean_token_accuracy": 0.8082753699302674, "eval_num_tokens": 7674378.0, "eval_runtime": 78.3318, "eval_samples_per_second": 63.831, "eval_steps_per_second": 7.979, "step": 1000 }, { "entropy": 0.9554769098758698, "epoch": 0.1469090909090909, "grad_norm": 0.40527433156967163, "learning_rate": 0.00019687212448041305, "loss": 0.9341, "mean_token_accuracy": 0.8105138674378395, "num_tokens": 7749244.0, "step": 1010 }, { "entropy": 0.9631451539695263, "epoch": 0.14836363636363636, "grad_norm": 0.2934854030609131, "learning_rate": 0.00019674869161716673, "loss": 0.9429, "mean_token_accuracy": 0.8103604264557361, "num_tokens": 7827130.0, "step": 1020 }, { "entropy": 0.9962614960968494, "epoch": 0.14981818181818182, "grad_norm": 0.29253679513931274, "learning_rate": 0.00019662291042413726, "loss": 0.9789, "mean_token_accuracy": 0.8047004818916321, "num_tokens": 7905729.0, "step": 1030 }, { "entropy": 0.9482852481305599, "epoch": 0.15127272727272728, "grad_norm": 0.29692456126213074, "learning_rate": 0.00019649478395592355, "loss": 0.9362, "mean_token_accuracy": 0.8123825170099735, "num_tokens": 7980537.0, "step": 1040 }, { "entropy": 0.955985976755619, "epoch": 0.15272727272727274, "grad_norm": 0.4257398843765259, "learning_rate": 0.00019636431532407968, "loss": 0.9342, "mean_token_accuracy": 0.8100227758288383, "num_tokens": 8056340.0, "step": 1050 }, { "entropy": 0.9584499664604664, "epoch": 0.15418181818181817, "grad_norm": 0.29070353507995605, "learning_rate": 0.00019623150769703908, "loss": 0.9383, "mean_token_accuracy": 0.810140723735094, "num_tokens": 8132679.0, "step": 1060 }, { "entropy": 0.9684336230158805, "epoch": 0.15563636363636363, "grad_norm": 0.3143501579761505, "learning_rate": 0.00019609636430003785, "loss": 0.9499, "mean_token_accuracy": 0.8064659915864467, "num_tokens": 8208680.0, "step": 1070 }, { "entropy": 0.9466678649187088, "epoch": 0.1570909090909091, "grad_norm": 0.29853272438049316, "learning_rate": 0.00019595888841503618, "loss": 0.925, "mean_token_accuracy": 0.8112887017428875, "num_tokens": 8287768.0, "step": 1080 }, { "entropy": 0.950913506001234, "epoch": 0.15854545454545454, "grad_norm": 0.3101540505886078, "learning_rate": 0.00019581908338063897, "loss": 0.9298, "mean_token_accuracy": 0.8090488716959954, "num_tokens": 8366655.0, "step": 1090 }, { "entropy": 0.9407593891024589, "epoch": 0.16, "grad_norm": 0.29976364970207214, "learning_rate": 0.00019567695259201434, "loss": 0.9345, "mean_token_accuracy": 0.8117971464991569, "num_tokens": 8442053.0, "step": 1100 }, { "entropy": 0.955774050205946, "epoch": 0.16145454545454546, "grad_norm": 0.34253445267677307, "learning_rate": 0.00019553249950081164, "loss": 0.9431, "mean_token_accuracy": 0.8093701273202896, "num_tokens": 8518218.0, "step": 1110 }, { "entropy": 0.98501892760396, "epoch": 0.16290909090909092, "grad_norm": 0.33748891949653625, "learning_rate": 0.00019538572761507714, "loss": 0.9831, "mean_token_accuracy": 0.8018230192363263, "num_tokens": 8597394.0, "step": 1120 }, { "entropy": 0.9631325028836727, "epoch": 0.16436363636363635, "grad_norm": 0.38818150758743286, "learning_rate": 0.0001952366404991693, "loss": 0.9509, "mean_token_accuracy": 0.8064041070640087, "num_tokens": 8675541.0, "step": 1130 }, { "entropy": 0.9727548152208328, "epoch": 0.1658181818181818, "grad_norm": 0.3559781312942505, "learning_rate": 0.00019508524177367184, "loss": 0.949, "mean_token_accuracy": 0.8060977406799793, "num_tokens": 8755075.0, "step": 1140 }, { "entropy": 0.9649280205368995, "epoch": 0.16727272727272727, "grad_norm": 0.30704405903816223, "learning_rate": 0.0001949315351153061, "loss": 0.9547, "mean_token_accuracy": 0.8092526689171791, "num_tokens": 8831736.0, "step": 1150 }, { "entropy": 0.9345536336302758, "epoch": 0.16872727272727273, "grad_norm": 0.30081990361213684, "learning_rate": 0.00019477552425684148, "loss": 0.9178, "mean_token_accuracy": 0.8131528303027153, "num_tokens": 8911228.0, "step": 1160 }, { "entropy": 0.9596106916666031, "epoch": 0.17018181818181818, "grad_norm": 0.3070826232433319, "learning_rate": 0.000194617212987005, "loss": 0.9362, "mean_token_accuracy": 0.8075219623744487, "num_tokens": 8988216.0, "step": 1170 }, { "entropy": 0.9631124071776866, "epoch": 0.17163636363636364, "grad_norm": 0.3408432900905609, "learning_rate": 0.00019445660515038927, "loss": 0.9423, "mean_token_accuracy": 0.8091696575284004, "num_tokens": 9065626.0, "step": 1180 }, { "entropy": 0.9516327641904354, "epoch": 0.1730909090909091, "grad_norm": 0.31564784049987793, "learning_rate": 0.00019429370464735897, "loss": 0.9521, "mean_token_accuracy": 0.8093578301370143, "num_tokens": 9142973.0, "step": 1190 }, { "entropy": 0.9371618889272213, "epoch": 0.17454545454545456, "grad_norm": 0.3847862184047699, "learning_rate": 0.0001941285154339563, "loss": 0.9091, "mean_token_accuracy": 0.812215743213892, "num_tokens": 9218296.0, "step": 1200 }, { "entropy": 0.9448715083301067, "epoch": 0.176, "grad_norm": 0.3291180431842804, "learning_rate": 0.0001939610415218048, "loss": 0.9186, "mean_token_accuracy": 0.8123110935091973, "num_tokens": 9293398.0, "step": 1210 }, { "entropy": 0.966688671708107, "epoch": 0.17745454545454545, "grad_norm": 0.30451062321662903, "learning_rate": 0.00019379128697801206, "loss": 0.951, "mean_token_accuracy": 0.8065337009727955, "num_tokens": 9373633.0, "step": 1220 }, { "entropy": 0.9484643906354904, "epoch": 0.1789090909090909, "grad_norm": 0.2932063341140747, "learning_rate": 0.0001936192559250707, "loss": 0.9325, "mean_token_accuracy": 0.8090389378368854, "num_tokens": 9451080.0, "step": 1230 }, { "entropy": 0.9615976348519325, "epoch": 0.18036363636363636, "grad_norm": 0.33180785179138184, "learning_rate": 0.00019344495254075854, "loss": 0.9344, "mean_token_accuracy": 0.8113547652959824, "num_tokens": 9526463.0, "step": 1240 }, { "entropy": 0.9671885691583156, "epoch": 0.18181818181818182, "grad_norm": 0.30535823106765747, "learning_rate": 0.000193268381058037, "loss": 0.9717, "mean_token_accuracy": 0.8057887375354766, "num_tokens": 9605802.0, "step": 1250 }, { "entropy": 0.9746878013014794, "epoch": 0.18327272727272728, "grad_norm": 0.3194335699081421, "learning_rate": 0.00019308954576494826, "loss": 0.948, "mean_token_accuracy": 0.8088590256869793, "num_tokens": 9683267.0, "step": 1260 }, { "entropy": 0.925223445147276, "epoch": 0.18472727272727274, "grad_norm": 0.3094640076160431, "learning_rate": 0.00019290845100451123, "loss": 0.9105, "mean_token_accuracy": 0.8131582289934158, "num_tokens": 9760203.0, "step": 1270 }, { "entropy": 0.9676970973610878, "epoch": 0.18618181818181817, "grad_norm": 0.3541739284992218, "learning_rate": 0.000192725101174616, "loss": 0.9339, "mean_token_accuracy": 0.8105718605220318, "num_tokens": 9837897.0, "step": 1280 }, { "entropy": 0.9446438558399677, "epoch": 0.18763636363636363, "grad_norm": 0.31916889548301697, "learning_rate": 0.00019253950072791712, "loss": 0.9307, "mean_token_accuracy": 0.8087717853486538, "num_tokens": 9914578.0, "step": 1290 }, { "entropy": 0.9461817003786563, "epoch": 0.1890909090909091, "grad_norm": 0.30146437883377075, "learning_rate": 0.00019235165417172536, "loss": 0.9266, "mean_token_accuracy": 0.8111361682415008, "num_tokens": 9991551.0, "step": 1300 }, { "entropy": 0.9666557475924492, "epoch": 0.19054545454545455, "grad_norm": 0.32777443528175354, "learning_rate": 0.00019216156606789836, "loss": 0.9374, "mean_token_accuracy": 0.8101299934089183, "num_tokens": 10067407.0, "step": 1310 }, { "entropy": 0.9579305075109005, "epoch": 0.192, "grad_norm": 0.3164553642272949, "learning_rate": 0.00019196924103272972, "loss": 0.9383, "mean_token_accuracy": 0.8088756151497364, "num_tokens": 10143656.0, "step": 1320 }, { "entropy": 0.9566913366317749, "epoch": 0.19345454545454546, "grad_norm": 0.3002376854419708, "learning_rate": 0.00019177468373683708, "loss": 0.9359, "mean_token_accuracy": 0.8092375807464123, "num_tokens": 10221715.0, "step": 1330 }, { "entropy": 0.9349559977650642, "epoch": 0.19490909090909092, "grad_norm": 0.3056219518184662, "learning_rate": 0.00019157789890504847, "loss": 0.9207, "mean_token_accuracy": 0.8103202067315578, "num_tokens": 10299354.0, "step": 1340 }, { "entropy": 0.9478652633726596, "epoch": 0.19636363636363635, "grad_norm": 0.3512885272502899, "learning_rate": 0.0001913788913162877, "loss": 0.9331, "mean_token_accuracy": 0.8110518783330918, "num_tokens": 10376102.0, "step": 1350 }, { "entropy": 0.9545814357697964, "epoch": 0.1978181818181818, "grad_norm": 0.3496834635734558, "learning_rate": 0.00019117766580345832, "loss": 0.9344, "mean_token_accuracy": 0.8108161889016628, "num_tokens": 10452922.0, "step": 1360 }, { "entropy": 0.9444903768599033, "epoch": 0.19927272727272727, "grad_norm": 0.33390098810195923, "learning_rate": 0.0001909742272533262, "loss": 0.9189, "mean_token_accuracy": 0.8123569242656231, "num_tokens": 10529714.0, "step": 1370 }, { "entropy": 0.9337248101830482, "epoch": 0.20072727272727273, "grad_norm": 0.4034648537635803, "learning_rate": 0.00019076858060640083, "loss": 0.9289, "mean_token_accuracy": 0.8110757023096085, "num_tokens": 10606511.0, "step": 1380 }, { "entropy": 0.9631103947758675, "epoch": 0.20218181818181818, "grad_norm": 0.32546374201774597, "learning_rate": 0.00019056073085681543, "loss": 0.9318, "mean_token_accuracy": 0.8103945441544056, "num_tokens": 10682172.0, "step": 1390 }, { "entropy": 0.9652538903057575, "epoch": 0.20363636363636364, "grad_norm": 0.3356182277202606, "learning_rate": 0.00019035068305220555, "loss": 0.954, "mean_token_accuracy": 0.806369586288929, "num_tokens": 10760611.0, "step": 1400 }, { "entropy": 0.959171961992979, "epoch": 0.2050909090909091, "grad_norm": 0.4710279405117035, "learning_rate": 0.00019013844229358667, "loss": 0.9416, "mean_token_accuracy": 0.8092709675431251, "num_tokens": 10839415.0, "step": 1410 }, { "entropy": 0.9554042249917984, "epoch": 0.20654545454545453, "grad_norm": 0.39765721559524536, "learning_rate": 0.00018992401373523006, "loss": 0.9311, "mean_token_accuracy": 0.8113908626139164, "num_tokens": 10917800.0, "step": 1420 }, { "entropy": 0.9345662452280521, "epoch": 0.208, "grad_norm": 0.3606942892074585, "learning_rate": 0.00018970740258453784, "loss": 0.9218, "mean_token_accuracy": 0.8098172180354595, "num_tokens": 10994499.0, "step": 1430 }, { "entropy": 0.9311383411288261, "epoch": 0.20945454545454545, "grad_norm": 0.3340699374675751, "learning_rate": 0.0001894886141019164, "loss": 0.9041, "mean_token_accuracy": 0.8147461965680123, "num_tokens": 11069175.0, "step": 1440 }, { "entropy": 0.9625661939382553, "epoch": 0.2109090909090909, "grad_norm": 0.3354319632053375, "learning_rate": 0.00018926765360064877, "loss": 0.9407, "mean_token_accuracy": 0.8064736150205135, "num_tokens": 11146085.0, "step": 1450 }, { "entropy": 0.9429851680994034, "epoch": 0.21236363636363637, "grad_norm": 0.32050856947898865, "learning_rate": 0.0001890445264467653, "loss": 0.9253, "mean_token_accuracy": 0.8105651929974556, "num_tokens": 11221965.0, "step": 1460 }, { "entropy": 0.930499044060707, "epoch": 0.21381818181818182, "grad_norm": 0.35083913803100586, "learning_rate": 0.0001888192380589138, "loss": 0.9082, "mean_token_accuracy": 0.8133820489048957, "num_tokens": 11297583.0, "step": 1470 }, { "entropy": 0.9538578160107136, "epoch": 0.21527272727272728, "grad_norm": 0.3205820918083191, "learning_rate": 0.00018859179390822746, "loss": 0.9313, "mean_token_accuracy": 0.8103922225534916, "num_tokens": 11373362.0, "step": 1480 }, { "entropy": 0.9458141349256038, "epoch": 0.21672727272727274, "grad_norm": 0.34689080715179443, "learning_rate": 0.00018836219951819236, "loss": 0.9188, "mean_token_accuracy": 0.8122154355049134, "num_tokens": 11449026.0, "step": 1490 }, { "entropy": 0.9495655484497547, "epoch": 0.21818181818181817, "grad_norm": 0.3351272642612457, "learning_rate": 0.00018813046046451312, "loss": 0.9309, "mean_token_accuracy": 0.8108266346156597, "num_tokens": 11529710.0, "step": 1500 }, { "entropy": 0.9607556290924549, "epoch": 0.21963636363636363, "grad_norm": 0.2975183129310608, "learning_rate": 0.00018789658237497765, "loss": 0.9472, "mean_token_accuracy": 0.8094669461250306, "num_tokens": 11606684.0, "step": 1510 }, { "entropy": 0.9780306808650494, "epoch": 0.2210909090909091, "grad_norm": 0.30866914987564087, "learning_rate": 0.00018766057092932026, "loss": 0.9885, "mean_token_accuracy": 0.8058537535369397, "num_tokens": 11686025.0, "step": 1520 }, { "entropy": 0.9589258328080177, "epoch": 0.22254545454545455, "grad_norm": 0.2969805896282196, "learning_rate": 0.00018742243185908397, "loss": 0.928, "mean_token_accuracy": 0.8105280227959156, "num_tokens": 11761670.0, "step": 1530 }, { "entropy": 0.9614237651228905, "epoch": 0.224, "grad_norm": 0.3447507321834564, "learning_rate": 0.00018718217094748117, "loss": 0.9589, "mean_token_accuracy": 0.8076143585145473, "num_tokens": 11840949.0, "step": 1540 }, { "entropy": 0.9415218912065029, "epoch": 0.22545454545454546, "grad_norm": 0.4087255597114563, "learning_rate": 0.00018693979402925316, "loss": 0.9412, "mean_token_accuracy": 0.8099103234708309, "num_tokens": 11918454.0, "step": 1550 }, { "entropy": 0.9644451148808002, "epoch": 0.22690909090909092, "grad_norm": 0.36078566312789917, "learning_rate": 0.00018669530699052863, "loss": 0.9429, "mean_token_accuracy": 0.8090198636054993, "num_tokens": 11997450.0, "step": 1560 }, { "entropy": 0.9489136710762978, "epoch": 0.22836363636363635, "grad_norm": 0.3263258635997772, "learning_rate": 0.00018644871576868047, "loss": 0.9294, "mean_token_accuracy": 0.8090980783104896, "num_tokens": 12073862.0, "step": 1570 }, { "entropy": 0.9820632249116897, "epoch": 0.2298181818181818, "grad_norm": 0.3392266631126404, "learning_rate": 0.00018620002635218175, "loss": 0.9619, "mean_token_accuracy": 0.8049184948205947, "num_tokens": 12154103.0, "step": 1580 }, { "entropy": 0.9613321676850319, "epoch": 0.23127272727272727, "grad_norm": 0.3108541965484619, "learning_rate": 0.00018594924478046026, "loss": 0.9361, "mean_token_accuracy": 0.8093224719166756, "num_tokens": 12230848.0, "step": 1590 }, { "entropy": 0.9354442425072194, "epoch": 0.23272727272727273, "grad_norm": 0.3270244896411896, "learning_rate": 0.00018569637714375178, "loss": 0.919, "mean_token_accuracy": 0.810560081154108, "num_tokens": 12308605.0, "step": 1600 }, { "entropy": 0.990824494510889, "epoch": 0.23418181818181819, "grad_norm": 0.31900009512901306, "learning_rate": 0.00018544142958295225, "loss": 0.9741, "mean_token_accuracy": 0.8050805293023586, "num_tokens": 12387234.0, "step": 1610 }, { "entropy": 0.932359478622675, "epoch": 0.23563636363636364, "grad_norm": 0.41305163502693176, "learning_rate": 0.00018518440828946863, "loss": 0.9181, "mean_token_accuracy": 0.8122582986950875, "num_tokens": 12463203.0, "step": 1620 }, { "entropy": 0.9484110824763775, "epoch": 0.2370909090909091, "grad_norm": 0.3127359449863434, "learning_rate": 0.0001849253195050685, "loss": 0.9259, "mean_token_accuracy": 0.8118439868092537, "num_tokens": 12539819.0, "step": 1630 }, { "entropy": 0.9479153640568256, "epoch": 0.23854545454545453, "grad_norm": 0.3151299059391022, "learning_rate": 0.00018466416952172846, "loss": 0.9253, "mean_token_accuracy": 0.808732783049345, "num_tokens": 12619081.0, "step": 1640 }, { "entropy": 0.9727005705237388, "epoch": 0.24, "grad_norm": 0.32946428656578064, "learning_rate": 0.0001844009646814815, "loss": 0.9607, "mean_token_accuracy": 0.8065188810229301, "num_tokens": 12696222.0, "step": 1650 }, { "entropy": 0.9596579805016517, "epoch": 0.24145454545454545, "grad_norm": 0.3054264783859253, "learning_rate": 0.00018413571137626265, "loss": 0.9346, "mean_token_accuracy": 0.8099383614957333, "num_tokens": 12770009.0, "step": 1660 }, { "entropy": 0.9318838283419609, "epoch": 0.2429090909090909, "grad_norm": 0.38207921385765076, "learning_rate": 0.00018386841604775415, "loss": 0.9114, "mean_token_accuracy": 0.8137748256325722, "num_tokens": 12845015.0, "step": 1670 }, { "entropy": 0.9751473486423492, "epoch": 0.24436363636363637, "grad_norm": 0.3861842751502991, "learning_rate": 0.0001835990851872287, "loss": 0.9493, "mean_token_accuracy": 0.8080014623701572, "num_tokens": 12922447.0, "step": 1680 }, { "entropy": 0.9198803529143333, "epoch": 0.24581818181818182, "grad_norm": 0.3217521011829376, "learning_rate": 0.000183327725335392, "loss": 0.9063, "mean_token_accuracy": 0.8148512996733188, "num_tokens": 12999334.0, "step": 1690 }, { "entropy": 0.9567082822322845, "epoch": 0.24727272727272728, "grad_norm": 0.34669220447540283, "learning_rate": 0.00018305434308222383, "loss": 0.9382, "mean_token_accuracy": 0.8091933868825436, "num_tokens": 13076110.0, "step": 1700 }, { "entropy": 0.9501121707260609, "epoch": 0.2487272727272727, "grad_norm": 0.3057405352592468, "learning_rate": 0.000182778945066818, "loss": 0.9297, "mean_token_accuracy": 0.81047957316041, "num_tokens": 13151198.0, "step": 1710 }, { "entropy": 0.9429646603763103, "epoch": 0.25018181818181817, "grad_norm": 0.3221091628074646, "learning_rate": 0.00018250153797722118, "loss": 0.9311, "mean_token_accuracy": 0.8111985780298709, "num_tokens": 13226772.0, "step": 1720 }, { "entropy": 0.9599173679947853, "epoch": 0.25163636363636366, "grad_norm": 0.31713050603866577, "learning_rate": 0.00018222212855027045, "loss": 0.9345, "mean_token_accuracy": 0.8075641810894012, "num_tokens": 13306183.0, "step": 1730 }, { "entropy": 0.9429551161825657, "epoch": 0.2530909090909091, "grad_norm": 0.3050651252269745, "learning_rate": 0.00018194072357142967, "loss": 0.9326, "mean_token_accuracy": 0.8090726666152477, "num_tokens": 13384697.0, "step": 1740 }, { "entropy": 0.9429156497120857, "epoch": 0.2545454545454545, "grad_norm": 0.404987633228302, "learning_rate": 0.00018165732987462482, "loss": 0.9109, "mean_token_accuracy": 0.8144759446382522, "num_tokens": 13460101.0, "step": 1750 }, { "entropy": 0.9501292340457439, "epoch": 0.256, "grad_norm": 0.3385776877403259, "learning_rate": 0.00018137195434207772, "loss": 0.9283, "mean_token_accuracy": 0.8100073337554932, "num_tokens": 13536659.0, "step": 1760 }, { "entropy": 0.9687538675963878, "epoch": 0.25745454545454544, "grad_norm": 0.3240547478199005, "learning_rate": 0.00018108460390413937, "loss": 0.9518, "mean_token_accuracy": 0.806635819375515, "num_tokens": 13615612.0, "step": 1770 }, { "entropy": 0.9552951484918595, "epoch": 0.2589090909090909, "grad_norm": 0.32524409890174866, "learning_rate": 0.0001807952855391212, "loss": 0.9224, "mean_token_accuracy": 0.8102507315576076, "num_tokens": 13691703.0, "step": 1780 }, { "entropy": 0.9637807898223401, "epoch": 0.26036363636363635, "grad_norm": 0.32301396131515503, "learning_rate": 0.00018050400627312588, "loss": 0.9489, "mean_token_accuracy": 0.8067096285521984, "num_tokens": 13770988.0, "step": 1790 }, { "entropy": 0.9319825753569603, "epoch": 0.26181818181818184, "grad_norm": 0.3573399484157562, "learning_rate": 0.00018021077317987655, "loss": 0.9117, "mean_token_accuracy": 0.8137773007154465, "num_tokens": 13845817.0, "step": 1800 }, { "entropy": 0.9618785664439201, "epoch": 0.26327272727272727, "grad_norm": 0.33567363023757935, "learning_rate": 0.00017991559338054517, "loss": 0.9512, "mean_token_accuracy": 0.8086851388216019, "num_tokens": 13921319.0, "step": 1810 }, { "entropy": 0.960854459553957, "epoch": 0.2647272727272727, "grad_norm": 0.37292754650115967, "learning_rate": 0.00017961847404357944, "loss": 0.938, "mean_token_accuracy": 0.8094214454293251, "num_tokens": 13998752.0, "step": 1820 }, { "entropy": 0.9524516589939594, "epoch": 0.2661818181818182, "grad_norm": 0.3304807245731354, "learning_rate": 0.00017931942238452874, "loss": 0.938, "mean_token_accuracy": 0.8107712835073471, "num_tokens": 14077253.0, "step": 1830 }, { "entropy": 0.9252058751881123, "epoch": 0.2676363636363636, "grad_norm": 0.33476701378822327, "learning_rate": 0.000179018445665869, "loss": 0.8945, "mean_token_accuracy": 0.8162094913423061, "num_tokens": 14150885.0, "step": 1840 }, { "entropy": 1.0102965272963047, "epoch": 0.2690909090909091, "grad_norm": 0.3192066550254822, "learning_rate": 0.00017871555119682625, "loss": 1.0206, "mean_token_accuracy": 0.8030799396336079, "num_tokens": 14229299.0, "step": 1850 }, { "entropy": 0.9697954557836056, "epoch": 0.27054545454545453, "grad_norm": 0.34754517674446106, "learning_rate": 0.00017841074633319904, "loss": 0.9557, "mean_token_accuracy": 0.8078889131546021, "num_tokens": 14304823.0, "step": 1860 }, { "entropy": 0.9449729457497597, "epoch": 0.272, "grad_norm": 0.3253391981124878, "learning_rate": 0.0001781040384771801, "loss": 0.918, "mean_token_accuracy": 0.8116657704114913, "num_tokens": 14380159.0, "step": 1870 }, { "entropy": 0.9418261803686618, "epoch": 0.27345454545454545, "grad_norm": 0.30982857942581177, "learning_rate": 0.00017779543507717612, "loss": 0.9228, "mean_token_accuracy": 0.8130053669214249, "num_tokens": 14455983.0, "step": 1880 }, { "entropy": 0.9387239389121532, "epoch": 0.27490909090909094, "grad_norm": 0.35093173384666443, "learning_rate": 0.0001774849436276273, "loss": 0.9102, "mean_token_accuracy": 0.8151706494390965, "num_tokens": 14531144.0, "step": 1890 }, { "entropy": 0.9262372322380543, "epoch": 0.27636363636363637, "grad_norm": 0.3041590452194214, "learning_rate": 0.00017717257166882503, "loss": 0.9008, "mean_token_accuracy": 0.8168079420924187, "num_tokens": 14604877.0, "step": 1900 }, { "entropy": 0.9444479495286942, "epoch": 0.2778181818181818, "grad_norm": 0.3268347382545471, "learning_rate": 0.00017685832678672906, "loss": 0.9324, "mean_token_accuracy": 0.8125970877707005, "num_tokens": 14682285.0, "step": 1910 }, { "entropy": 0.9417746476829052, "epoch": 0.2792727272727273, "grad_norm": 0.34488826990127563, "learning_rate": 0.000176542216612783, "loss": 0.9103, "mean_token_accuracy": 0.8135712221264839, "num_tokens": 14758010.0, "step": 1920 }, { "entropy": 0.9153248682618141, "epoch": 0.2807272727272727, "grad_norm": 0.327629953622818, "learning_rate": 0.00017622424882372912, "loss": 0.8994, "mean_token_accuracy": 0.8184183113276958, "num_tokens": 14831408.0, "step": 1930 }, { "entropy": 0.9517436102032661, "epoch": 0.2821818181818182, "grad_norm": 0.3337823152542114, "learning_rate": 0.000175904431141422, "loss": 0.927, "mean_token_accuracy": 0.8096821196377277, "num_tokens": 14910742.0, "step": 1940 }, { "entropy": 0.9344942085444927, "epoch": 0.28363636363636363, "grad_norm": 0.38580557703971863, "learning_rate": 0.0001755827713326408, "loss": 0.9282, "mean_token_accuracy": 0.8125026755034923, "num_tokens": 14984373.0, "step": 1950 }, { "entropy": 0.9408765397965908, "epoch": 0.2850909090909091, "grad_norm": 0.35432329773902893, "learning_rate": 0.00017525927720890086, "loss": 0.9051, "mean_token_accuracy": 0.8168821662664414, "num_tokens": 15058109.0, "step": 1960 }, { "entropy": 0.9451767437160015, "epoch": 0.28654545454545455, "grad_norm": 0.37497565150260925, "learning_rate": 0.00017493395662626383, "loss": 0.927, "mean_token_accuracy": 0.8118024595081806, "num_tokens": 15134759.0, "step": 1970 }, { "entropy": 0.9334485501050949, "epoch": 0.288, "grad_norm": 0.3791519105434418, "learning_rate": 0.00017460681748514701, "loss": 0.9232, "mean_token_accuracy": 0.811272544413805, "num_tokens": 15212159.0, "step": 1980 }, { "entropy": 0.965351027995348, "epoch": 0.28945454545454546, "grad_norm": 0.32630297541618347, "learning_rate": 0.0001742778677301314, "loss": 0.9295, "mean_token_accuracy": 0.8107661835849285, "num_tokens": 15290445.0, "step": 1990 }, { "entropy": 0.960039559751749, "epoch": 0.2909090909090909, "grad_norm": 0.3436606526374817, "learning_rate": 0.00017394711534976875, "loss": 0.9372, "mean_token_accuracy": 0.8104394495487213, "num_tokens": 15368377.0, "step": 2000 }, { "epoch": 0.2909090909090909, "eval_entropy": 0.9545571558952332, "eval_loss": 0.9135851860046387, "eval_mean_token_accuracy": 0.8095944012641907, "eval_num_tokens": 15368377.0, "eval_runtime": 78.1006, "eval_samples_per_second": 64.02, "eval_steps_per_second": 8.002, "step": 2000 }, { "entropy": 0.93552967607975, "epoch": 0.2923636363636364, "grad_norm": 0.3713809847831726, "learning_rate": 0.00017361456837638773, "loss": 0.9054, "mean_token_accuracy": 0.8160525418817997, "num_tokens": 15443459.0, "step": 2010 }, { "entropy": 0.9752048850059509, "epoch": 0.2938181818181818, "grad_norm": 0.3389149308204651, "learning_rate": 0.0001732802348858986, "loss": 0.9717, "mean_token_accuracy": 0.8063795827329159, "num_tokens": 15521440.0, "step": 2020 }, { "entropy": 0.9328745149075985, "epoch": 0.2952727272727273, "grad_norm": 0.307253360748291, "learning_rate": 0.0001729441229975973, "loss": 0.9088, "mean_token_accuracy": 0.8136720769107342, "num_tokens": 15596124.0, "step": 2030 }, { "entropy": 0.9618542812764644, "epoch": 0.29672727272727273, "grad_norm": 0.3493705093860626, "learning_rate": 0.0001726062408739682, "loss": 0.9413, "mean_token_accuracy": 0.8102415710687637, "num_tokens": 15673126.0, "step": 2040 }, { "entropy": 0.9472650431096554, "epoch": 0.29818181818181816, "grad_norm": 0.3055593967437744, "learning_rate": 0.0001722665967204859, "loss": 0.93, "mean_token_accuracy": 0.8135502748191357, "num_tokens": 15748318.0, "step": 2050 }, { "entropy": 0.9465427048504352, "epoch": 0.29963636363636365, "grad_norm": 0.3755161762237549, "learning_rate": 0.0001719251987854158, "loss": 0.9201, "mean_token_accuracy": 0.8124631099402905, "num_tokens": 15824620.0, "step": 2060 }, { "entropy": 0.9456887245178223, "epoch": 0.3010909090909091, "grad_norm": 0.32835713028907776, "learning_rate": 0.0001715820553596141, "loss": 0.9368, "mean_token_accuracy": 0.8130617618560791, "num_tokens": 15899968.0, "step": 2070 }, { "entropy": 0.9543628983199597, "epoch": 0.30254545454545456, "grad_norm": 0.3607058525085449, "learning_rate": 0.00017123717477632617, "loss": 0.925, "mean_token_accuracy": 0.8120505645871162, "num_tokens": 15979356.0, "step": 2080 }, { "entropy": 0.9334946945309639, "epoch": 0.304, "grad_norm": 0.3168565332889557, "learning_rate": 0.00017089056541098432, "loss": 0.9073, "mean_token_accuracy": 0.8149824872612953, "num_tokens": 16056328.0, "step": 2090 }, { "entropy": 0.9526524029672145, "epoch": 0.3054545454545455, "grad_norm": 0.3339099586009979, "learning_rate": 0.00017054223568100432, "loss": 0.9332, "mean_token_accuracy": 0.8111643262207509, "num_tokens": 16133661.0, "step": 2100 }, { "entropy": 0.9297716051340104, "epoch": 0.3069090909090909, "grad_norm": 0.37411344051361084, "learning_rate": 0.00017019219404558112, "loss": 0.9131, "mean_token_accuracy": 0.8139175310730934, "num_tokens": 16208975.0, "step": 2110 }, { "entropy": 0.9196740917861461, "epoch": 0.30836363636363634, "grad_norm": 0.3221561908721924, "learning_rate": 0.00016984044900548325, "loss": 0.892, "mean_token_accuracy": 0.8175107464194298, "num_tokens": 16285565.0, "step": 2120 }, { "entropy": 0.9326213136315346, "epoch": 0.3098181818181818, "grad_norm": 0.3141707181930542, "learning_rate": 0.00016948700910284653, "loss": 0.9109, "mean_token_accuracy": 0.814671640843153, "num_tokens": 16360976.0, "step": 2130 }, { "entropy": 0.9365306921303272, "epoch": 0.31127272727272726, "grad_norm": 0.5048186779022217, "learning_rate": 0.0001691318829209665, "loss": 0.9152, "mean_token_accuracy": 0.8133588239550591, "num_tokens": 16435360.0, "step": 2140 }, { "entropy": 0.9475600443780422, "epoch": 0.31272727272727274, "grad_norm": 0.33213672041893005, "learning_rate": 0.00016877507908409, "loss": 0.9127, "mean_token_accuracy": 0.813559490442276, "num_tokens": 16510866.0, "step": 2150 }, { "entropy": 0.9257668554782867, "epoch": 0.3141818181818182, "grad_norm": 0.3788197934627533, "learning_rate": 0.00016841660625720585, "loss": 0.9233, "mean_token_accuracy": 0.811751264333725, "num_tokens": 16586819.0, "step": 2160 }, { "entropy": 0.9617751978337765, "epoch": 0.31563636363636366, "grad_norm": 0.4031602442264557, "learning_rate": 0.00016805647314583428, "loss": 0.9339, "mean_token_accuracy": 0.8118709713220597, "num_tokens": 16663718.0, "step": 2170 }, { "entropy": 0.9458882667124271, "epoch": 0.3170909090909091, "grad_norm": 0.3160066306591034, "learning_rate": 0.0001676946884958155, "loss": 0.9418, "mean_token_accuracy": 0.8106794603168964, "num_tokens": 16739810.0, "step": 2180 }, { "entropy": 0.9457833237946034, "epoch": 0.3185454545454545, "grad_norm": 0.34538161754608154, "learning_rate": 0.00016733126109309753, "loss": 0.9234, "mean_token_accuracy": 0.8111150979995727, "num_tokens": 16817590.0, "step": 2190 }, { "entropy": 0.9471365615725518, "epoch": 0.32, "grad_norm": 0.32485249638557434, "learning_rate": 0.0001669661997635225, "loss": 0.938, "mean_token_accuracy": 0.8131156258285046, "num_tokens": 16892279.0, "step": 2200 }, { "entropy": 0.9507883109152317, "epoch": 0.32145454545454544, "grad_norm": 0.3409273326396942, "learning_rate": 0.00016659951337261256, "loss": 0.9323, "mean_token_accuracy": 0.8105610504746437, "num_tokens": 16971570.0, "step": 2210 }, { "entropy": 0.9707157976925374, "epoch": 0.3229090909090909, "grad_norm": 0.4358591139316559, "learning_rate": 0.0001662312108253546, "loss": 0.9563, "mean_token_accuracy": 0.808458685129881, "num_tokens": 17048391.0, "step": 2220 }, { "entropy": 0.962416484951973, "epoch": 0.32436363636363635, "grad_norm": 0.32611650228500366, "learning_rate": 0.00016586130106598372, "loss": 0.9379, "mean_token_accuracy": 0.8086472131311894, "num_tokens": 17125614.0, "step": 2230 }, { "entropy": 0.923296982795, "epoch": 0.32581818181818184, "grad_norm": 0.38609233498573303, "learning_rate": 0.00016548979307776636, "loss": 0.9116, "mean_token_accuracy": 0.8152348309755325, "num_tokens": 17201164.0, "step": 2240 }, { "entropy": 0.9433801986277104, "epoch": 0.32727272727272727, "grad_norm": 0.3359317481517792, "learning_rate": 0.00016511669588278188, "loss": 0.9247, "mean_token_accuracy": 0.8113768070936203, "num_tokens": 17278206.0, "step": 2250 }, { "entropy": 0.9336811497807502, "epoch": 0.3287272727272727, "grad_norm": 0.31968075037002563, "learning_rate": 0.00016474201854170358, "loss": 0.9103, "mean_token_accuracy": 0.8159900955855847, "num_tokens": 17354469.0, "step": 2260 }, { "entropy": 0.9368410244584083, "epoch": 0.3301818181818182, "grad_norm": 0.32750600576400757, "learning_rate": 0.00016436577015357872, "loss": 0.9207, "mean_token_accuracy": 0.8116543501615524, "num_tokens": 17432087.0, "step": 2270 }, { "entropy": 0.9387645564973355, "epoch": 0.3316363636363636, "grad_norm": 0.32613465189933777, "learning_rate": 0.00016398795985560736, "loss": 0.9177, "mean_token_accuracy": 0.8138992644846439, "num_tokens": 17507413.0, "step": 2280 }, { "entropy": 0.955746828019619, "epoch": 0.3330909090909091, "grad_norm": 0.3252658545970917, "learning_rate": 0.00016360859682292066, "loss": 0.9273, "mean_token_accuracy": 0.8117515601217746, "num_tokens": 17586012.0, "step": 2290 }, { "entropy": 0.9415918923914433, "epoch": 0.33454545454545453, "grad_norm": 0.3188813030719757, "learning_rate": 0.00016322769026835794, "loss": 0.9323, "mean_token_accuracy": 0.8117557033896446, "num_tokens": 17664213.0, "step": 2300 }, { "entropy": 0.9359489880502224, "epoch": 0.336, "grad_norm": 0.33735203742980957, "learning_rate": 0.00016284524944224296, "loss": 0.9136, "mean_token_accuracy": 0.8152964189648628, "num_tokens": 17739740.0, "step": 2310 }, { "entropy": 0.9483966782689095, "epoch": 0.33745454545454545, "grad_norm": 0.33717650175094604, "learning_rate": 0.00016246128363215926, "loss": 0.9323, "mean_token_accuracy": 0.8132497929036617, "num_tokens": 17816245.0, "step": 2320 }, { "entropy": 0.9411058373749256, "epoch": 0.3389090909090909, "grad_norm": 0.32491806149482727, "learning_rate": 0.00016207580216272483, "loss": 0.9234, "mean_token_accuracy": 0.8120617903769016, "num_tokens": 17894511.0, "step": 2330 }, { "entropy": 0.9490449778735638, "epoch": 0.34036363636363637, "grad_norm": 0.3255004286766052, "learning_rate": 0.00016168881439536527, "loss": 0.9261, "mean_token_accuracy": 0.8118731305003166, "num_tokens": 17971114.0, "step": 2340 }, { "entropy": 0.9435882270336151, "epoch": 0.3418181818181818, "grad_norm": 0.3351687490940094, "learning_rate": 0.0001613003297280868, "loss": 0.9258, "mean_token_accuracy": 0.8116018794476986, "num_tokens": 18049687.0, "step": 2350 }, { "entropy": 0.9387622274458408, "epoch": 0.3432727272727273, "grad_norm": 0.358738511800766, "learning_rate": 0.0001609103575952478, "loss": 0.9196, "mean_token_accuracy": 0.813437120616436, "num_tokens": 18124677.0, "step": 2360 }, { "entropy": 0.92884556427598, "epoch": 0.3447272727272727, "grad_norm": 0.38657838106155396, "learning_rate": 0.00016051890746732978, "loss": 0.9007, "mean_token_accuracy": 0.8151167511940003, "num_tokens": 18201388.0, "step": 2370 }, { "entropy": 0.9288479879498481, "epoch": 0.3461818181818182, "grad_norm": 0.387179970741272, "learning_rate": 0.00016012598885070748, "loss": 0.9131, "mean_token_accuracy": 0.8137955233454705, "num_tokens": 18275995.0, "step": 2380 }, { "entropy": 0.9669632643461228, "epoch": 0.34763636363636363, "grad_norm": 0.3194025158882141, "learning_rate": 0.0001597316112874178, "loss": 0.9505, "mean_token_accuracy": 0.8098523296415806, "num_tokens": 18351968.0, "step": 2390 }, { "entropy": 0.9311579629778862, "epoch": 0.3490909090909091, "grad_norm": 0.3317321538925171, "learning_rate": 0.00015933578435492834, "loss": 0.9173, "mean_token_accuracy": 0.8136695794761181, "num_tokens": 18429882.0, "step": 2400 }, { "entropy": 0.9734658777713776, "epoch": 0.35054545454545455, "grad_norm": 0.33316028118133545, "learning_rate": 0.00015893851766590454, "loss": 0.9715, "mean_token_accuracy": 0.8081215254962444, "num_tokens": 18506409.0, "step": 2410 }, { "entropy": 0.9483408346772194, "epoch": 0.352, "grad_norm": 0.3269667625427246, "learning_rate": 0.00015853982086797632, "loss": 0.9327, "mean_token_accuracy": 0.8124340586364269, "num_tokens": 18584276.0, "step": 2420 }, { "entropy": 0.9598711885511875, "epoch": 0.35345454545454547, "grad_norm": 0.35559943318367004, "learning_rate": 0.00015813970364350404, "loss": 0.934, "mean_token_accuracy": 0.8129792243242264, "num_tokens": 18663675.0, "step": 2430 }, { "entropy": 0.9243545681238174, "epoch": 0.3549090909090909, "grad_norm": 0.3285573422908783, "learning_rate": 0.00015773817570934287, "loss": 0.9103, "mean_token_accuracy": 0.8160747058689595, "num_tokens": 18739787.0, "step": 2440 }, { "entropy": 0.9421109184622765, "epoch": 0.3563636363636364, "grad_norm": 0.3947218954563141, "learning_rate": 0.00015733524681660734, "loss": 0.9155, "mean_token_accuracy": 0.8172662526369094, "num_tokens": 18816021.0, "step": 2450 }, { "entropy": 0.94013966396451, "epoch": 0.3578181818181818, "grad_norm": 0.33459532260894775, "learning_rate": 0.0001569309267504341, "loss": 0.9249, "mean_token_accuracy": 0.8147119626402854, "num_tokens": 18894131.0, "step": 2460 }, { "entropy": 0.93881671205163, "epoch": 0.3592727272727273, "grad_norm": 0.532590389251709, "learning_rate": 0.00015652522532974463, "loss": 0.9183, "mean_token_accuracy": 0.8175694108009338, "num_tokens": 18971093.0, "step": 2470 }, { "entropy": 0.9401829384267331, "epoch": 0.36072727272727273, "grad_norm": 0.3573850691318512, "learning_rate": 0.00015611815240700657, "loss": 0.9116, "mean_token_accuracy": 0.8167402453720569, "num_tokens": 19046555.0, "step": 2480 }, { "entropy": 0.9053499557077884, "epoch": 0.36218181818181816, "grad_norm": 0.37487003207206726, "learning_rate": 0.0001557097178679944, "loss": 0.8757, "mean_token_accuracy": 0.8230059690773487, "num_tokens": 19119410.0, "step": 2490 }, { "entropy": 0.9198244661092758, "epoch": 0.36363636363636365, "grad_norm": 0.3617284297943115, "learning_rate": 0.0001552999316315497, "loss": 0.8972, "mean_token_accuracy": 0.8209393374621868, "num_tokens": 19196135.0, "step": 2500 }, { "entropy": 0.9223854258656502, "epoch": 0.3650909090909091, "grad_norm": 0.4283069968223572, "learning_rate": 0.00015488880364933986, "loss": 0.9079, "mean_token_accuracy": 0.8193068109452725, "num_tokens": 19271772.0, "step": 2510 }, { "entropy": 0.9177697144448758, "epoch": 0.36654545454545456, "grad_norm": 0.3647020757198334, "learning_rate": 0.00015447634390561673, "loss": 0.8898, "mean_token_accuracy": 0.8221660308539868, "num_tokens": 19345709.0, "step": 2520 }, { "entropy": 0.9341088324785233, "epoch": 0.368, "grad_norm": 0.4360695779323578, "learning_rate": 0.00015406256241697397, "loss": 0.9136, "mean_token_accuracy": 0.8160908088088036, "num_tokens": 19422973.0, "step": 2530 }, { "entropy": 0.9377870224416256, "epoch": 0.3694545454545455, "grad_norm": 0.3926893472671509, "learning_rate": 0.00015364746923210383, "loss": 0.9092, "mean_token_accuracy": 0.8166688092052936, "num_tokens": 19499742.0, "step": 2540 }, { "entropy": 0.934078136831522, "epoch": 0.3709090909090909, "grad_norm": 0.40978193283081055, "learning_rate": 0.00015323107443155308, "loss": 0.9122, "mean_token_accuracy": 0.8181058809161186, "num_tokens": 19576335.0, "step": 2550 }, { "entropy": 0.9231787696480751, "epoch": 0.37236363636363634, "grad_norm": 0.711661696434021, "learning_rate": 0.00015281338812747836, "loss": 0.9058, "mean_token_accuracy": 0.8205353997647762, "num_tokens": 19651253.0, "step": 2560 }, { "entropy": 0.9429825611412526, "epoch": 0.3738181818181818, "grad_norm": 0.5801389217376709, "learning_rate": 0.00015239442046340043, "loss": 0.9243, "mean_token_accuracy": 0.8164154589176178, "num_tokens": 19727856.0, "step": 2570 }, { "entropy": 0.9396571643650532, "epoch": 0.37527272727272726, "grad_norm": 0.4592108726501465, "learning_rate": 0.0001519741816139579, "loss": 0.9048, "mean_token_accuracy": 0.8183368548750878, "num_tokens": 19803736.0, "step": 2580 }, { "entropy": 0.9264605455100536, "epoch": 0.37672727272727274, "grad_norm": 0.41448894143104553, "learning_rate": 0.00015155268178466028, "loss": 0.9131, "mean_token_accuracy": 0.8172147408127785, "num_tokens": 19880288.0, "step": 2590 }, { "entropy": 0.9423249386250973, "epoch": 0.3781818181818182, "grad_norm": 0.36910226941108704, "learning_rate": 0.00015112993121163974, "loss": 0.911, "mean_token_accuracy": 0.8178658500313759, "num_tokens": 19958616.0, "step": 2600 }, { "entropy": 0.9392407588660717, "epoch": 0.37963636363636366, "grad_norm": 0.4865938723087311, "learning_rate": 0.00015070594016140308, "loss": 0.9265, "mean_token_accuracy": 0.8160700887441635, "num_tokens": 20036860.0, "step": 2610 }, { "entropy": 0.9442516446113587, "epoch": 0.3810909090909091, "grad_norm": 0.4857174754142761, "learning_rate": 0.00015028071893058185, "loss": 0.9325, "mean_token_accuracy": 0.8172270834445954, "num_tokens": 20113912.0, "step": 2620 }, { "entropy": 0.9298271015286446, "epoch": 0.3825454545454545, "grad_norm": 0.3504846394062042, "learning_rate": 0.00014985427784568273, "loss": 0.9085, "mean_token_accuracy": 0.8181630812585354, "num_tokens": 20190831.0, "step": 2630 }, { "entropy": 0.9338633924722671, "epoch": 0.384, "grad_norm": 0.5028424859046936, "learning_rate": 0.0001494266272628366, "loss": 0.9165, "mean_token_accuracy": 0.8184519417583942, "num_tokens": 20267706.0, "step": 2640 }, { "entropy": 0.9261907540261746, "epoch": 0.38545454545454544, "grad_norm": 0.39501842856407166, "learning_rate": 0.00014899777756754691, "loss": 0.9128, "mean_token_accuracy": 0.8201067417860031, "num_tokens": 20342990.0, "step": 2650 }, { "entropy": 0.9520396128296852, "epoch": 0.3869090909090909, "grad_norm": 0.8775481581687927, "learning_rate": 0.00014856773917443762, "loss": 0.9312, "mean_token_accuracy": 0.8147456295788288, "num_tokens": 20419842.0, "step": 2660 }, { "entropy": 0.926639711856842, "epoch": 0.38836363636363636, "grad_norm": 0.43765246868133545, "learning_rate": 0.0001481365225270003, "loss": 0.9036, "mean_token_accuracy": 0.8191298067569732, "num_tokens": 20496226.0, "step": 2670 }, { "entropy": 0.9401526026427746, "epoch": 0.38981818181818184, "grad_norm": 0.4963286221027374, "learning_rate": 0.00014770413809734041, "loss": 0.9218, "mean_token_accuracy": 0.8168404638767243, "num_tokens": 20573037.0, "step": 2680 }, { "entropy": 0.9355879001319408, "epoch": 0.39127272727272727, "grad_norm": 0.35393384099006653, "learning_rate": 0.00014727059638592295, "loss": 0.9185, "mean_token_accuracy": 0.8172001279890537, "num_tokens": 20650509.0, "step": 2690 }, { "entropy": 0.9356629192829132, "epoch": 0.3927272727272727, "grad_norm": 0.3640415668487549, "learning_rate": 0.00014683590792131766, "loss": 0.9027, "mean_token_accuracy": 0.8211157515645027, "num_tokens": 20724944.0, "step": 2700 }, { "entropy": 0.9365813709795475, "epoch": 0.3941818181818182, "grad_norm": 0.4473666548728943, "learning_rate": 0.00014640008325994316, "loss": 0.9141, "mean_token_accuracy": 0.8174393519759178, "num_tokens": 20800950.0, "step": 2710 }, { "entropy": 0.9238623924553394, "epoch": 0.3956363636363636, "grad_norm": 0.37241610884666443, "learning_rate": 0.00014596313298581058, "loss": 0.8932, "mean_token_accuracy": 0.8217294663190842, "num_tokens": 20875390.0, "step": 2720 }, { "entropy": 0.9539158314466476, "epoch": 0.3970909090909091, "grad_norm": 0.41429755091667175, "learning_rate": 0.00014552506771026667, "loss": 0.9324, "mean_token_accuracy": 0.8137750118970871, "num_tokens": 20954271.0, "step": 2730 }, { "entropy": 0.9392914563417435, "epoch": 0.39854545454545454, "grad_norm": 0.36372101306915283, "learning_rate": 0.00014508589807173594, "loss": 0.9199, "mean_token_accuracy": 0.8174258455634117, "num_tokens": 21031738.0, "step": 2740 }, { "entropy": 0.9314709268510342, "epoch": 0.4, "grad_norm": 0.6674671769142151, "learning_rate": 0.00014464563473546245, "loss": 0.9073, "mean_token_accuracy": 0.8193281888961792, "num_tokens": 21106326.0, "step": 2750 }, { "entropy": 0.9411804787814617, "epoch": 0.40145454545454545, "grad_norm": 0.46535301208496094, "learning_rate": 0.00014420428839325057, "loss": 0.9291, "mean_token_accuracy": 0.8160315252840519, "num_tokens": 21186853.0, "step": 2760 }, { "entropy": 0.9423932202160359, "epoch": 0.4029090909090909, "grad_norm": 0.37130892276763916, "learning_rate": 0.00014376186976320575, "loss": 0.9168, "mean_token_accuracy": 0.8181857027113437, "num_tokens": 21265098.0, "step": 2770 }, { "entropy": 0.9356568641960621, "epoch": 0.40436363636363637, "grad_norm": 0.3903407156467438, "learning_rate": 0.00014331838958947374, "loss": 0.9191, "mean_token_accuracy": 0.8169067747890949, "num_tokens": 21342699.0, "step": 2780 }, { "entropy": 0.9259685985744, "epoch": 0.4058181818181818, "grad_norm": 0.7272932529449463, "learning_rate": 0.00014287385864198007, "loss": 0.9111, "mean_token_accuracy": 0.8178241029381752, "num_tokens": 21417249.0, "step": 2790 }, { "entropy": 0.9134186536073685, "epoch": 0.4072727272727273, "grad_norm": 0.6104690432548523, "learning_rate": 0.0001424282877161682, "loss": 0.8962, "mean_token_accuracy": 0.8213642582297325, "num_tokens": 21491979.0, "step": 2800 }, { "entropy": 0.9297884210944176, "epoch": 0.4087272727272727, "grad_norm": 0.3607460856437683, "learning_rate": 0.00014198168763273752, "loss": 0.9043, "mean_token_accuracy": 0.817758695781231, "num_tokens": 21569581.0, "step": 2810 }, { "entropy": 0.921866150945425, "epoch": 0.4101818181818182, "grad_norm": 0.3911571502685547, "learning_rate": 0.0001415340692373806, "loss": 0.9039, "mean_token_accuracy": 0.8202633537352085, "num_tokens": 21645313.0, "step": 2820 }, { "entropy": 0.949428279697895, "epoch": 0.41163636363636363, "grad_norm": 0.4143660068511963, "learning_rate": 0.0001410854434005197, "loss": 0.9279, "mean_token_accuracy": 0.8163035720586777, "num_tokens": 21722390.0, "step": 2830 }, { "entropy": 0.9189708463847637, "epoch": 0.41309090909090906, "grad_norm": 0.6003644466400146, "learning_rate": 0.0001406358210170428, "loss": 0.8956, "mean_token_accuracy": 0.8213484719395637, "num_tokens": 21800558.0, "step": 2840 }, { "entropy": 0.9367615543305874, "epoch": 0.41454545454545455, "grad_norm": 0.402132511138916, "learning_rate": 0.00014018521300603905, "loss": 0.9122, "mean_token_accuracy": 0.8187360368669033, "num_tokens": 21877227.0, "step": 2850 }, { "entropy": 0.9265430241823196, "epoch": 0.416, "grad_norm": 0.39140671491622925, "learning_rate": 0.0001397336303105336, "loss": 0.9063, "mean_token_accuracy": 0.8227818325161934, "num_tokens": 21951033.0, "step": 2860 }, { "entropy": 0.9349323078989983, "epoch": 0.41745454545454547, "grad_norm": 0.417484313249588, "learning_rate": 0.00013928108389722177, "loss": 0.9161, "mean_token_accuracy": 0.8168958708643913, "num_tokens": 22029456.0, "step": 2870 }, { "entropy": 0.9182321138679981, "epoch": 0.4189090909090909, "grad_norm": 0.9603578448295593, "learning_rate": 0.00013882758475620285, "loss": 0.8906, "mean_token_accuracy": 0.8226393982768059, "num_tokens": 22103768.0, "step": 2880 }, { "entropy": 0.9337234787642956, "epoch": 0.4203636363636364, "grad_norm": 0.9330223798751831, "learning_rate": 0.0001383731439007132, "loss": 0.9237, "mean_token_accuracy": 0.814931558072567, "num_tokens": 22182926.0, "step": 2890 }, { "entropy": 0.9424798399209976, "epoch": 0.4218181818181818, "grad_norm": 0.34551888704299927, "learning_rate": 0.00013791777236685855, "loss": 0.9136, "mean_token_accuracy": 0.8205113738775254, "num_tokens": 22259520.0, "step": 2900 }, { "entropy": 0.9198446124792099, "epoch": 0.4232727272727273, "grad_norm": 0.4358190894126892, "learning_rate": 0.00013746148121334642, "loss": 0.8901, "mean_token_accuracy": 0.8215723693370819, "num_tokens": 22334318.0, "step": 2910 }, { "entropy": 0.9174405969679356, "epoch": 0.42472727272727273, "grad_norm": 0.4261787235736847, "learning_rate": 0.00013700428152121701, "loss": 0.8959, "mean_token_accuracy": 0.8221362054347991, "num_tokens": 22410832.0, "step": 2920 }, { "entropy": 0.9318659543991089, "epoch": 0.42618181818181816, "grad_norm": 0.5009744763374329, "learning_rate": 0.0001365461843935747, "loss": 0.9019, "mean_token_accuracy": 0.8202016733586788, "num_tokens": 22486296.0, "step": 2930 }, { "entropy": 0.9342516735196114, "epoch": 0.42763636363636365, "grad_norm": 0.3965824544429779, "learning_rate": 0.00013608720095531794, "loss": 0.9133, "mean_token_accuracy": 0.8176328152418136, "num_tokens": 22563289.0, "step": 2940 }, { "entropy": 0.942034150660038, "epoch": 0.4290909090909091, "grad_norm": 0.4476518929004669, "learning_rate": 0.00013562734235286937, "loss": 0.9263, "mean_token_accuracy": 0.819250100851059, "num_tokens": 22638561.0, "step": 2950 }, { "entropy": 0.9392903119325637, "epoch": 0.43054545454545456, "grad_norm": 0.5829343795776367, "learning_rate": 0.00013516661975390476, "loss": 0.9163, "mean_token_accuracy": 0.8194300256669521, "num_tokens": 22714187.0, "step": 2960 }, { "entropy": 0.9254804484546184, "epoch": 0.432, "grad_norm": 0.573879063129425, "learning_rate": 0.0001347050443470824, "loss": 0.9169, "mean_token_accuracy": 0.8167784102261066, "num_tokens": 22792256.0, "step": 2970 }, { "entropy": 0.9662094607949256, "epoch": 0.4334545454545455, "grad_norm": 0.47143566608428955, "learning_rate": 0.00013424262734177078, "loss": 0.9346, "mean_token_accuracy": 0.8130164839327335, "num_tokens": 22868956.0, "step": 2980 }, { "entropy": 0.9308706648647785, "epoch": 0.4349090909090909, "grad_norm": 0.36211660504341125, "learning_rate": 0.00013377937996777666, "loss": 0.9079, "mean_token_accuracy": 0.8199804499745369, "num_tokens": 22944002.0, "step": 2990 }, { "entropy": 0.9251275800168515, "epoch": 0.43636363636363634, "grad_norm": 0.3628769814968109, "learning_rate": 0.0001333153134750725, "loss": 0.9148, "mean_token_accuracy": 0.8186253055930137, "num_tokens": 23022304.0, "step": 3000 }, { "epoch": 0.43636363636363634, "eval_entropy": 0.947712210559845, "eval_loss": 0.9226884841918945, "eval_mean_token_accuracy": 0.8106017510414123, "eval_num_tokens": 23022304.0, "eval_runtime": 78.0625, "eval_samples_per_second": 64.051, "eval_steps_per_second": 8.006, "step": 3000 }, { "entropy": 0.9396435245871544, "epoch": 0.43781818181818183, "grad_norm": 0.347475528717041, "learning_rate": 0.0001328504391335229, "loss": 0.9084, "mean_token_accuracy": 0.8182823576033116, "num_tokens": 23097660.0, "step": 3010 }, { "entropy": 0.916470754146576, "epoch": 0.43927272727272726, "grad_norm": 0.39701876044273376, "learning_rate": 0.0001323847682326111, "loss": 0.8897, "mean_token_accuracy": 0.822086288779974, "num_tokens": 23171356.0, "step": 3020 }, { "entropy": 0.9525364696979522, "epoch": 0.44072727272727275, "grad_norm": 0.39641302824020386, "learning_rate": 0.00013191831208116486, "loss": 0.9539, "mean_token_accuracy": 0.8152362138032914, "num_tokens": 23248906.0, "step": 3030 }, { "entropy": 0.9237325944006443, "epoch": 0.4421818181818182, "grad_norm": 0.5871150493621826, "learning_rate": 0.00013145108200708175, "loss": 0.8914, "mean_token_accuracy": 0.8203249268233777, "num_tokens": 23322555.0, "step": 3040 }, { "entropy": 0.9378106243908405, "epoch": 0.44363636363636366, "grad_norm": 0.3605862259864807, "learning_rate": 0.00013098308935705403, "loss": 0.9241, "mean_token_accuracy": 0.8165755428373813, "num_tokens": 23400467.0, "step": 3050 }, { "entropy": 0.9633555516600609, "epoch": 0.4450909090909091, "grad_norm": 0.4816967248916626, "learning_rate": 0.00013051434549629317, "loss": 0.9773, "mean_token_accuracy": 0.8138452783226967, "num_tokens": 23478934.0, "step": 3060 }, { "entropy": 0.9115117900073528, "epoch": 0.4465454545454545, "grad_norm": 0.36916565895080566, "learning_rate": 0.00013004486180825383, "loss": 0.8961, "mean_token_accuracy": 0.823471300303936, "num_tokens": 23552888.0, "step": 3070 }, { "entropy": 0.9228253945708275, "epoch": 0.448, "grad_norm": 0.6769089698791504, "learning_rate": 0.00012957464969435734, "loss": 0.8953, "mean_token_accuracy": 0.8215885289013386, "num_tokens": 23626705.0, "step": 3080 }, { "entropy": 0.9263963654637337, "epoch": 0.44945454545454544, "grad_norm": 0.4560895562171936, "learning_rate": 0.00012910372057371491, "loss": 0.9051, "mean_token_accuracy": 0.8180726014077664, "num_tokens": 23703595.0, "step": 3090 }, { "entropy": 0.9448229886591435, "epoch": 0.4509090909090909, "grad_norm": 0.5193542242050171, "learning_rate": 0.0001286320858828502, "loss": 0.9195, "mean_token_accuracy": 0.8177183635532856, "num_tokens": 23779080.0, "step": 3100 }, { "entropy": 0.9222862467169761, "epoch": 0.45236363636363636, "grad_norm": 0.6392302513122559, "learning_rate": 0.0001281597570754218, "loss": 0.9057, "mean_token_accuracy": 0.8185005567967891, "num_tokens": 23854814.0, "step": 3110 }, { "entropy": 0.9366964548826218, "epoch": 0.45381818181818184, "grad_norm": 0.544901430606842, "learning_rate": 0.00012768674562194476, "loss": 0.9275, "mean_token_accuracy": 0.8163784302771091, "num_tokens": 23933307.0, "step": 3120 }, { "entropy": 0.9299830220639705, "epoch": 0.4552727272727273, "grad_norm": 0.4428144693374634, "learning_rate": 0.0001272130630095123, "loss": 0.9112, "mean_token_accuracy": 0.8183266878128052, "num_tokens": 24009025.0, "step": 3130 }, { "entropy": 0.9151601083576679, "epoch": 0.4567272727272727, "grad_norm": 0.38302376866340637, "learning_rate": 0.00012673872074151683, "loss": 0.8858, "mean_token_accuracy": 0.8227717474102973, "num_tokens": 24084460.0, "step": 3140 }, { "entropy": 0.9553165949881077, "epoch": 0.4581818181818182, "grad_norm": 0.34640029072761536, "learning_rate": 0.00012626373033737033, "loss": 0.9359, "mean_token_accuracy": 0.8156644940376282, "num_tokens": 24160235.0, "step": 3150 }, { "entropy": 0.9485594473779202, "epoch": 0.4596363636363636, "grad_norm": 0.730147659778595, "learning_rate": 0.00012578810333222488, "loss": 0.9349, "mean_token_accuracy": 0.8165864571928978, "num_tokens": 24238608.0, "step": 3160 }, { "entropy": 0.9255790121853351, "epoch": 0.4610909090909091, "grad_norm": 0.42998138070106506, "learning_rate": 0.00012531185127669244, "loss": 0.9021, "mean_token_accuracy": 0.8210115492343902, "num_tokens": 24315473.0, "step": 3170 }, { "entropy": 0.9337904252111912, "epoch": 0.46254545454545454, "grad_norm": 0.41894665360450745, "learning_rate": 0.00012483498573656436, "loss": 0.911, "mean_token_accuracy": 0.818168356269598, "num_tokens": 24393906.0, "step": 3180 }, { "entropy": 0.9694912165403367, "epoch": 0.464, "grad_norm": 0.3748018741607666, "learning_rate": 0.0001243575182925303, "loss": 1.0177, "mean_token_accuracy": 0.810963698849082, "num_tokens": 24473099.0, "step": 3190 }, { "entropy": 0.9436316221952439, "epoch": 0.46545454545454545, "grad_norm": 0.792568027973175, "learning_rate": 0.0001238794605398974, "loss": 0.9198, "mean_token_accuracy": 0.8177410371601581, "num_tokens": 24549264.0, "step": 3200 }, { "entropy": 0.9587245568633079, "epoch": 0.4669090909090909, "grad_norm": 0.39849016070365906, "learning_rate": 0.00012340082408830835, "loss": 0.9658, "mean_token_accuracy": 0.814987201988697, "num_tokens": 24625693.0, "step": 3210 }, { "entropy": 0.948624425381422, "epoch": 0.46836363636363637, "grad_norm": 0.3882438540458679, "learning_rate": 0.0001229216205614595, "loss": 0.9192, "mean_token_accuracy": 0.8177899941802025, "num_tokens": 24701883.0, "step": 3220 }, { "entropy": 0.9479258358478546, "epoch": 0.4698181818181818, "grad_norm": 0.5587784647941589, "learning_rate": 0.00012244186159681873, "loss": 0.9434, "mean_token_accuracy": 0.8147072538733482, "num_tokens": 24780137.0, "step": 3230 }, { "entropy": 0.9296126678586006, "epoch": 0.4712727272727273, "grad_norm": 0.35228222608566284, "learning_rate": 0.00012196155884534269, "loss": 0.9097, "mean_token_accuracy": 0.8193468026816845, "num_tokens": 24856002.0, "step": 3240 }, { "entropy": 0.9226066932082176, "epoch": 0.4727272727272727, "grad_norm": 0.6554537415504456, "learning_rate": 0.00012148072397119394, "loss": 0.891, "mean_token_accuracy": 0.8198705278337002, "num_tokens": 24931747.0, "step": 3250 }, { "entropy": 0.9482523567974568, "epoch": 0.4741818181818182, "grad_norm": 0.6361430287361145, "learning_rate": 0.00012099936865145763, "loss": 0.9299, "mean_token_accuracy": 0.8141291528940201, "num_tokens": 25008782.0, "step": 3260 }, { "entropy": 0.944165738672018, "epoch": 0.47563636363636363, "grad_norm": 0.41412845253944397, "learning_rate": 0.00012051750457585789, "loss": 0.9122, "mean_token_accuracy": 0.8184866182506084, "num_tokens": 25085940.0, "step": 3270 }, { "entropy": 0.9486552193760872, "epoch": 0.47709090909090907, "grad_norm": 0.6368948221206665, "learning_rate": 0.00012003514344647413, "loss": 0.9258, "mean_token_accuracy": 0.8154248282313347, "num_tokens": 25163594.0, "step": 3280 }, { "entropy": 0.9159012153744698, "epoch": 0.47854545454545455, "grad_norm": 0.5390453338623047, "learning_rate": 0.00011955229697745655, "loss": 0.8938, "mean_token_accuracy": 0.8222610250115394, "num_tokens": 25238709.0, "step": 3290 }, { "entropy": 0.9439261749386787, "epoch": 0.48, "grad_norm": 0.43710118532180786, "learning_rate": 0.00011906897689474199, "loss": 0.9254, "mean_token_accuracy": 0.818860150873661, "num_tokens": 25314417.0, "step": 3300 }, { "entropy": 0.9147123090922833, "epoch": 0.48145454545454547, "grad_norm": 0.39578351378440857, "learning_rate": 0.00011858519493576893, "loss": 0.8903, "mean_token_accuracy": 0.8215675607323647, "num_tokens": 25390270.0, "step": 3310 }, { "entropy": 0.9170261770486832, "epoch": 0.4829090909090909, "grad_norm": 0.3433591425418854, "learning_rate": 0.00011810096284919252, "loss": 0.9035, "mean_token_accuracy": 0.8198836460709572, "num_tokens": 25466771.0, "step": 3320 }, { "entropy": 0.9297826215624809, "epoch": 0.4843636363636364, "grad_norm": 0.3432069718837738, "learning_rate": 0.00011761629239459926, "loss": 0.9082, "mean_token_accuracy": 0.8195572912693023, "num_tokens": 25543759.0, "step": 3330 }, { "entropy": 0.9283205479383468, "epoch": 0.4858181818181818, "grad_norm": 0.4968811869621277, "learning_rate": 0.00011713119534222152, "loss": 0.9147, "mean_token_accuracy": 0.8183020256459713, "num_tokens": 25621348.0, "step": 3340 }, { "entropy": 0.9285181269049645, "epoch": 0.48727272727272725, "grad_norm": 1.168716311454773, "learning_rate": 0.00011664568347265146, "loss": 0.906, "mean_token_accuracy": 0.8207002833485604, "num_tokens": 25697445.0, "step": 3350 }, { "entropy": 0.9199300065636635, "epoch": 0.48872727272727273, "grad_norm": 0.3925750255584717, "learning_rate": 0.00011615976857655522, "loss": 0.9024, "mean_token_accuracy": 0.8196565262973309, "num_tokens": 25774629.0, "step": 3360 }, { "entropy": 0.917039792984724, "epoch": 0.49018181818181816, "grad_norm": 0.39110034704208374, "learning_rate": 0.00011567346245438632, "loss": 0.8925, "mean_token_accuracy": 0.8205363370478154, "num_tokens": 25851159.0, "step": 3370 }, { "entropy": 0.9277261577546596, "epoch": 0.49163636363636365, "grad_norm": 0.3983883261680603, "learning_rate": 0.0001151867769160994, "loss": 0.89, "mean_token_accuracy": 0.8212614722549916, "num_tokens": 25927101.0, "step": 3380 }, { "entropy": 0.925445581227541, "epoch": 0.4930909090909091, "grad_norm": 0.4415944516658783, "learning_rate": 0.00011469972378086302, "loss": 0.9093, "mean_token_accuracy": 0.8164033927023411, "num_tokens": 26004710.0, "step": 3390 }, { "entropy": 0.9090649954974651, "epoch": 0.49454545454545457, "grad_norm": 0.36825454235076904, "learning_rate": 0.00011421231487677293, "loss": 0.8923, "mean_token_accuracy": 0.8208632886409759, "num_tokens": 26081021.0, "step": 3400 }, { "entropy": 0.9246860764920711, "epoch": 0.496, "grad_norm": 0.34179189801216125, "learning_rate": 0.0001137245620405648, "loss": 0.895, "mean_token_accuracy": 0.8194523319602013, "num_tokens": 26156724.0, "step": 3410 }, { "entropy": 0.9491905942559242, "epoch": 0.4974545454545454, "grad_norm": 0.37097907066345215, "learning_rate": 0.00011323647711732652, "loss": 0.9263, "mean_token_accuracy": 0.8174832746386528, "num_tokens": 26235045.0, "step": 3420 }, { "entropy": 0.9204013898968697, "epoch": 0.4989090909090909, "grad_norm": 1.1383200883865356, "learning_rate": 0.00011274807196021095, "loss": 0.9073, "mean_token_accuracy": 0.8202569909393788, "num_tokens": 26310893.0, "step": 3430 }, { "entropy": 0.9221264578402042, "epoch": 0.5003636363636363, "grad_norm": 0.9400169253349304, "learning_rate": 0.0001122593584301477, "loss": 0.8983, "mean_token_accuracy": 0.8210197605192662, "num_tokens": 26385660.0, "step": 3440 }, { "entropy": 0.9211826339364052, "epoch": 0.5018181818181818, "grad_norm": 0.47897812724113464, "learning_rate": 0.00011177034839555519, "loss": 0.903, "mean_token_accuracy": 0.8199583508074284, "num_tokens": 26462236.0, "step": 3450 }, { "entropy": 0.9359012946486474, "epoch": 0.5032727272727273, "grad_norm": 0.35076892375946045, "learning_rate": 0.00011128105373205256, "loss": 0.9084, "mean_token_accuracy": 0.8181154794991017, "num_tokens": 26539077.0, "step": 3460 }, { "entropy": 0.9265558190643788, "epoch": 0.5047272727272727, "grad_norm": 0.3212345242500305, "learning_rate": 0.0001107914863221711, "loss": 0.9012, "mean_token_accuracy": 0.8197455100715161, "num_tokens": 26616327.0, "step": 3470 }, { "entropy": 0.9231369532644749, "epoch": 0.5061818181818182, "grad_norm": 0.7979731559753418, "learning_rate": 0.0001103016580550658, "loss": 0.902, "mean_token_accuracy": 0.8190245240926742, "num_tokens": 26692145.0, "step": 3480 }, { "entropy": 0.9156353622674942, "epoch": 0.5076363636363637, "grad_norm": 0.3245525062084198, "learning_rate": 0.00010981158082622653, "loss": 0.894, "mean_token_accuracy": 0.8221806295216083, "num_tokens": 26767988.0, "step": 3490 }, { "entropy": 0.9295620888471603, "epoch": 0.509090909090909, "grad_norm": 0.36039286851882935, "learning_rate": 0.00010932126653718919, "loss": 0.9055, "mean_token_accuracy": 0.8197094917297363, "num_tokens": 26843488.0, "step": 3500 }, { "entropy": 0.9358175002038479, "epoch": 0.5105454545454545, "grad_norm": 0.4395211935043335, "learning_rate": 0.0001088307270952468, "loss": 0.93, "mean_token_accuracy": 0.8159300364553929, "num_tokens": 26921791.0, "step": 3510 }, { "entropy": 0.9184973612427711, "epoch": 0.512, "grad_norm": 0.4433652460575104, "learning_rate": 0.00010833997441316004, "loss": 0.8887, "mean_token_accuracy": 0.8236219830811023, "num_tokens": 26996743.0, "step": 3520 }, { "entropy": 0.9166963383555412, "epoch": 0.5134545454545455, "grad_norm": 0.401826947927475, "learning_rate": 0.00010784902040886832, "loss": 0.8952, "mean_token_accuracy": 0.8214032381772995, "num_tokens": 27073260.0, "step": 3530 }, { "entropy": 0.9150002479553223, "epoch": 0.5149090909090909, "grad_norm": 0.4118078947067261, "learning_rate": 0.00010735787700520004, "loss": 0.8916, "mean_token_accuracy": 0.8216412000358104, "num_tokens": 27148611.0, "step": 3540 }, { "entropy": 0.9454425044357777, "epoch": 0.5163636363636364, "grad_norm": 0.7244296073913574, "learning_rate": 0.00010686655612958325, "loss": 0.9173, "mean_token_accuracy": 0.816456987708807, "num_tokens": 27230353.0, "step": 3550 }, { "entropy": 0.9069771558046341, "epoch": 0.5178181818181818, "grad_norm": 0.32180866599082947, "learning_rate": 0.00010637506971375577, "loss": 0.898, "mean_token_accuracy": 0.8206721089780331, "num_tokens": 27308270.0, "step": 3560 }, { "entropy": 0.9277030676603317, "epoch": 0.5192727272727272, "grad_norm": 0.577333390712738, "learning_rate": 0.00010588342969347578, "loss": 0.8913, "mean_token_accuracy": 0.8211231052875518, "num_tokens": 27385138.0, "step": 3570 }, { "entropy": 0.9140991292893886, "epoch": 0.5207272727272727, "grad_norm": 0.4405682682991028, "learning_rate": 0.00010539164800823155, "loss": 0.9013, "mean_token_accuracy": 0.8207581497728824, "num_tokens": 27460730.0, "step": 3580 }, { "entropy": 0.9315586917102336, "epoch": 0.5221818181818182, "grad_norm": 0.8212738633155823, "learning_rate": 0.00010489973660095182, "loss": 0.9001, "mean_token_accuracy": 0.8187609612941742, "num_tokens": 27538332.0, "step": 3590 }, { "entropy": 0.9198866352438927, "epoch": 0.5236363636363637, "grad_norm": 1.2040369510650635, "learning_rate": 0.00010440770741771553, "loss": 0.8999, "mean_token_accuracy": 0.8207184448838234, "num_tokens": 27614736.0, "step": 3600 }, { "entropy": 0.9046032093465328, "epoch": 0.525090909090909, "grad_norm": 0.6865532398223877, "learning_rate": 0.00010391557240746192, "loss": 0.8698, "mean_token_accuracy": 0.8253046363592148, "num_tokens": 27688293.0, "step": 3610 }, { "entropy": 0.9542017750442028, "epoch": 0.5265454545454545, "grad_norm": 0.4730345904827118, "learning_rate": 0.00010342334352170016, "loss": 0.939, "mean_token_accuracy": 0.8143124967813492, "num_tokens": 27768383.0, "step": 3620 }, { "entropy": 0.9306189320981503, "epoch": 0.528, "grad_norm": 0.376300573348999, "learning_rate": 0.00010293103271421916, "loss": 0.9123, "mean_token_accuracy": 0.8206489957869053, "num_tokens": 27842512.0, "step": 3630 }, { "entropy": 0.9370056606829167, "epoch": 0.5294545454545454, "grad_norm": 0.4288793206214905, "learning_rate": 0.00010243865194079745, "loss": 0.9279, "mean_token_accuracy": 0.8167462557554245, "num_tokens": 27921618.0, "step": 3640 }, { "entropy": 0.921815349906683, "epoch": 0.5309090909090909, "grad_norm": 0.5747948884963989, "learning_rate": 0.00010194621315891253, "loss": 0.8987, "mean_token_accuracy": 0.8218463979661464, "num_tokens": 27998037.0, "step": 3650 }, { "entropy": 0.9359241731464862, "epoch": 0.5323636363636364, "grad_norm": 0.4183412492275238, "learning_rate": 0.0001014537283274507, "loss": 0.9061, "mean_token_accuracy": 0.8193797774612903, "num_tokens": 28075384.0, "step": 3660 }, { "entropy": 0.9195265114307404, "epoch": 0.5338181818181819, "grad_norm": 0.7315105199813843, "learning_rate": 0.00010096120940641656, "loss": 0.8984, "mean_token_accuracy": 0.8199678152799607, "num_tokens": 28151833.0, "step": 3670 }, { "entropy": 0.9044848591089248, "epoch": 0.5352727272727272, "grad_norm": 0.8692927360534668, "learning_rate": 0.00010046866835664261, "loss": 0.886, "mean_token_accuracy": 0.8231448031961918, "num_tokens": 28227799.0, "step": 3680 }, { "entropy": 0.9234697446227074, "epoch": 0.5367272727272727, "grad_norm": 0.6376194357872009, "learning_rate": 9.997611713949872e-05, "loss": 0.9013, "mean_token_accuracy": 0.819769125431776, "num_tokens": 28304947.0, "step": 3690 }, { "entropy": 0.9290397010743618, "epoch": 0.5381818181818182, "grad_norm": 0.5948243737220764, "learning_rate": 9.948356771660168e-05, "loss": 0.9035, "mean_token_accuracy": 0.8185986518859864, "num_tokens": 28382467.0, "step": 3700 }, { "entropy": 0.9379419051110744, "epoch": 0.5396363636363637, "grad_norm": 2.2813308238983154, "learning_rate": 9.899103204952468e-05, "loss": 0.9169, "mean_token_accuracy": 0.815712084621191, "num_tokens": 28461716.0, "step": 3710 }, { "entropy": 0.9275504149496555, "epoch": 0.5410909090909091, "grad_norm": 0.34508106112480164, "learning_rate": 9.849852209950689e-05, "loss": 0.9048, "mean_token_accuracy": 0.8185636311769485, "num_tokens": 28538563.0, "step": 3720 }, { "entropy": 0.9352700494229793, "epoch": 0.5425454545454546, "grad_norm": 0.37615418434143066, "learning_rate": 9.80060498271629e-05, "loss": 0.9155, "mean_token_accuracy": 0.8164530210196972, "num_tokens": 28619086.0, "step": 3730 }, { "entropy": 0.9283501178026199, "epoch": 0.544, "grad_norm": 0.7256191968917847, "learning_rate": 9.751362719219235e-05, "loss": 0.9183, "mean_token_accuracy": 0.8186564229428768, "num_tokens": 28695671.0, "step": 3740 }, { "entropy": 0.9386952750384807, "epoch": 0.5454545454545454, "grad_norm": 0.6169796586036682, "learning_rate": 9.702126615308941e-05, "loss": 0.9019, "mean_token_accuracy": 0.8199047222733498, "num_tokens": 28771736.0, "step": 3750 }, { "entropy": 0.9412241369485855, "epoch": 0.5469090909090909, "grad_norm": 0.7588170766830444, "learning_rate": 9.65289786668524e-05, "loss": 0.9407, "mean_token_accuracy": 0.8170472726225853, "num_tokens": 28849338.0, "step": 3760 }, { "entropy": 0.9540625616908074, "epoch": 0.5483636363636364, "grad_norm": 0.38552454113960266, "learning_rate": 9.603677668869331e-05, "loss": 0.9463, "mean_token_accuracy": 0.8130639024078846, "num_tokens": 28930968.0, "step": 3770 }, { "entropy": 0.9177017278969288, "epoch": 0.5498181818181819, "grad_norm": 0.4654134511947632, "learning_rate": 9.554467217174777e-05, "loss": 0.8947, "mean_token_accuracy": 0.8225653968751431, "num_tokens": 29006513.0, "step": 3780 }, { "entropy": 0.9458075389266014, "epoch": 0.5512727272727272, "grad_norm": 0.8493314981460571, "learning_rate": 9.505267706678436e-05, "loss": 0.9878, "mean_token_accuracy": 0.8140935592353344, "num_tokens": 29083506.0, "step": 3790 }, { "entropy": 0.9165011703968048, "epoch": 0.5527272727272727, "grad_norm": 0.4751242399215698, "learning_rate": 9.45608033219147e-05, "loss": 0.8935, "mean_token_accuracy": 0.8196017131209373, "num_tokens": 29160892.0, "step": 3800 }, { "entropy": 0.9129310235381126, "epoch": 0.5541818181818182, "grad_norm": 0.3513168394565582, "learning_rate": 9.406906288230316e-05, "loss": 0.899, "mean_token_accuracy": 0.821053197979927, "num_tokens": 29235237.0, "step": 3810 }, { "entropy": 0.9064737364649773, "epoch": 0.5556363636363636, "grad_norm": 0.38477998971939087, "learning_rate": 9.357746768987676e-05, "loss": 0.8776, "mean_token_accuracy": 0.824255996197462, "num_tokens": 29309459.0, "step": 3820 }, { "entropy": 0.9401685081422329, "epoch": 0.5570909090909091, "grad_norm": 0.3995867967605591, "learning_rate": 9.308602968303524e-05, "loss": 0.9129, "mean_token_accuracy": 0.8195973120629787, "num_tokens": 29386095.0, "step": 3830 }, { "entropy": 0.9213009759783745, "epoch": 0.5585454545454546, "grad_norm": 0.643458902835846, "learning_rate": 9.2594760796361e-05, "loss": 0.8994, "mean_token_accuracy": 0.8200056202709675, "num_tokens": 29462603.0, "step": 3840 }, { "entropy": 0.918635991960764, "epoch": 0.56, "grad_norm": 0.8464357852935791, "learning_rate": 9.210367296032943e-05, "loss": 0.9001, "mean_token_accuracy": 0.8222006931900978, "num_tokens": 29537771.0, "step": 3850 }, { "entropy": 0.9163896553218365, "epoch": 0.5614545454545454, "grad_norm": 0.37169432640075684, "learning_rate": 9.161277810101906e-05, "loss": 0.895, "mean_token_accuracy": 0.8202171288430691, "num_tokens": 29615868.0, "step": 3860 }, { "entropy": 0.9250077605247498, "epoch": 0.5629090909090909, "grad_norm": 1.156219720840454, "learning_rate": 9.112208813982203e-05, "loss": 0.906, "mean_token_accuracy": 0.8188555419445038, "num_tokens": 29693840.0, "step": 3870 }, { "entropy": 0.9499965131282806, "epoch": 0.5643636363636364, "grad_norm": 1.324691891670227, "learning_rate": 9.063161499315442e-05, "loss": 0.9182, "mean_token_accuracy": 0.8170868992805481, "num_tokens": 29772620.0, "step": 3880 }, { "entropy": 0.9008949503302575, "epoch": 0.5658181818181818, "grad_norm": 0.43073347210884094, "learning_rate": 9.014137057216711e-05, "loss": 0.8852, "mean_token_accuracy": 0.8227784849703312, "num_tokens": 29848445.0, "step": 3890 }, { "entropy": 0.8970596104860306, "epoch": 0.5672727272727273, "grad_norm": 0.45119038224220276, "learning_rate": 8.965136678245631e-05, "loss": 0.8933, "mean_token_accuracy": 0.8247206792235374, "num_tokens": 29922761.0, "step": 3900 }, { "entropy": 0.9342648290097714, "epoch": 0.5687272727272727, "grad_norm": 0.9876037240028381, "learning_rate": 8.916161552377436e-05, "loss": 0.9123, "mean_token_accuracy": 0.8185786202549934, "num_tokens": 30000359.0, "step": 3910 }, { "entropy": 0.9663207672536374, "epoch": 0.5701818181818182, "grad_norm": 0.6844055652618408, "learning_rate": 8.867212868974107e-05, "loss": 0.9551, "mean_token_accuracy": 0.8155784040689469, "num_tokens": 30077474.0, "step": 3920 }, { "entropy": 0.9191053174436092, "epoch": 0.5716363636363636, "grad_norm": 0.5892969369888306, "learning_rate": 8.81829181675546e-05, "loss": 0.8949, "mean_token_accuracy": 0.8220530681312084, "num_tokens": 30151340.0, "step": 3930 }, { "entropy": 0.9044974833726883, "epoch": 0.5730909090909091, "grad_norm": 0.778037428855896, "learning_rate": 8.769399583770292e-05, "loss": 0.8892, "mean_token_accuracy": 0.8229080185294151, "num_tokens": 30228713.0, "step": 3940 }, { "entropy": 0.9285637088119983, "epoch": 0.5745454545454546, "grad_norm": 0.3809204697608948, "learning_rate": 8.72053735736752e-05, "loss": 0.9108, "mean_token_accuracy": 0.8179547920823097, "num_tokens": 30307555.0, "step": 3950 }, { "entropy": 0.9175647012889385, "epoch": 0.576, "grad_norm": 1.3078035116195679, "learning_rate": 8.671706324167353e-05, "loss": 0.8917, "mean_token_accuracy": 0.8220877289772034, "num_tokens": 30383413.0, "step": 3960 }, { "entropy": 0.9246532939374447, "epoch": 0.5774545454545454, "grad_norm": 0.5710193514823914, "learning_rate": 8.622907670032464e-05, "loss": 0.9018, "mean_token_accuracy": 0.8195373341441154, "num_tokens": 30461770.0, "step": 3970 }, { "entropy": 0.9507615320384503, "epoch": 0.5789090909090909, "grad_norm": 0.36621034145355225, "learning_rate": 8.574142580039214e-05, "loss": 0.9635, "mean_token_accuracy": 0.8138333059847355, "num_tokens": 30541665.0, "step": 3980 }, { "entropy": 0.9386632166802883, "epoch": 0.5803636363636364, "grad_norm": 0.4421805143356323, "learning_rate": 8.525412238448848e-05, "loss": 0.9079, "mean_token_accuracy": 0.8193704970180988, "num_tokens": 30619217.0, "step": 3990 }, { "entropy": 0.9030759565532207, "epoch": 0.5818181818181818, "grad_norm": 0.4840448498725891, "learning_rate": 8.47671782867875e-05, "loss": 0.8797, "mean_token_accuracy": 0.8235183075070381, "num_tokens": 30693435.0, "step": 4000 }, { "epoch": 0.5818181818181818, "eval_entropy": 0.9226345249176026, "eval_loss": 0.9059992432594299, "eval_mean_token_accuracy": 0.8117552498817444, "eval_num_tokens": 30693435.0, "eval_runtime": 78.4875, "eval_samples_per_second": 63.704, "eval_steps_per_second": 7.963, "step": 4000 }, { "entropy": 0.9224749609827996, "epoch": 0.5832727272727273, "grad_norm": 0.3205111622810364, "learning_rate": 8.428060533273695e-05, "loss": 0.8999, "mean_token_accuracy": 0.8211710818111897, "num_tokens": 30768893.0, "step": 4010 }, { "entropy": 0.9314353063702583, "epoch": 0.5847272727272728, "grad_norm": 0.35186830163002014, "learning_rate": 8.37944153387714e-05, "loss": 0.9154, "mean_token_accuracy": 0.8171250179409981, "num_tokens": 30845555.0, "step": 4020 }, { "entropy": 0.9353597678244114, "epoch": 0.5861818181818181, "grad_norm": 0.6230372786521912, "learning_rate": 8.330862011202519e-05, "loss": 0.9066, "mean_token_accuracy": 0.8200264059007167, "num_tokens": 30921718.0, "step": 4030 }, { "entropy": 0.9002460077404976, "epoch": 0.5876363636363636, "grad_norm": 0.3467552959918976, "learning_rate": 8.282323145004571e-05, "loss": 0.8692, "mean_token_accuracy": 0.8239211171865464, "num_tokens": 30997508.0, "step": 4040 }, { "entropy": 0.9211130246520043, "epoch": 0.5890909090909091, "grad_norm": 2.3690154552459717, "learning_rate": 8.233826114050696e-05, "loss": 0.9048, "mean_token_accuracy": 0.8180987447500229, "num_tokens": 31075376.0, "step": 4050 }, { "entropy": 0.9173007644712925, "epoch": 0.5905454545454546, "grad_norm": 0.3382624685764313, "learning_rate": 8.185372096092322e-05, "loss": 0.885, "mean_token_accuracy": 0.8216130308806896, "num_tokens": 31151185.0, "step": 4060 }, { "entropy": 0.9371884010732174, "epoch": 0.592, "grad_norm": 0.9030754566192627, "learning_rate": 8.13696226783631e-05, "loss": 0.9301, "mean_token_accuracy": 0.8147789672017097, "num_tokens": 31229056.0, "step": 4070 }, { "entropy": 0.9133959837257862, "epoch": 0.5934545454545455, "grad_norm": 0.35741662979125977, "learning_rate": 8.08859780491636e-05, "loss": 0.8917, "mean_token_accuracy": 0.8221455074846744, "num_tokens": 31304335.0, "step": 4080 }, { "entropy": 0.9080164395272732, "epoch": 0.5949090909090909, "grad_norm": 0.49753931164741516, "learning_rate": 8.040279881864492e-05, "loss": 0.887, "mean_token_accuracy": 0.8221993774175644, "num_tokens": 31379536.0, "step": 4090 }, { "entropy": 0.9248534195125103, "epoch": 0.5963636363636363, "grad_norm": 0.35766759514808655, "learning_rate": 7.992009672082495e-05, "loss": 0.9019, "mean_token_accuracy": 0.8192827641963959, "num_tokens": 31456220.0, "step": 4100 }, { "entropy": 0.9308187551796436, "epoch": 0.5978181818181818, "grad_norm": 0.6227002739906311, "learning_rate": 7.943788347813432e-05, "loss": 0.9086, "mean_token_accuracy": 0.8193796806037426, "num_tokens": 31533446.0, "step": 4110 }, { "entropy": 0.9144325762987137, "epoch": 0.5992727272727273, "grad_norm": 1.2459226846694946, "learning_rate": 7.895617080113195e-05, "loss": 0.9024, "mean_token_accuracy": 0.8201359301805496, "num_tokens": 31611084.0, "step": 4120 }, { "entropy": 0.9166338913142681, "epoch": 0.6007272727272728, "grad_norm": 0.3561236560344696, "learning_rate": 7.847497038822044e-05, "loss": 0.8981, "mean_token_accuracy": 0.8198485419154167, "num_tokens": 31688912.0, "step": 4130 }, { "entropy": 0.9203705497086048, "epoch": 0.6021818181818182, "grad_norm": 0.6236023306846619, "learning_rate": 7.799429392536209e-05, "loss": 0.8902, "mean_token_accuracy": 0.8216739609837532, "num_tokens": 31764534.0, "step": 4140 }, { "entropy": 0.9371412299573422, "epoch": 0.6036363636363636, "grad_norm": 0.8278318047523499, "learning_rate": 7.751415308579494e-05, "loss": 0.923, "mean_token_accuracy": 0.8161679744720459, "num_tokens": 31841612.0, "step": 4150 }, { "entropy": 0.9218975573778152, "epoch": 0.6050909090909091, "grad_norm": 0.7787909507751465, "learning_rate": 7.70345595297496e-05, "loss": 0.9358, "mean_token_accuracy": 0.8203811950981617, "num_tokens": 31919103.0, "step": 4160 }, { "entropy": 0.9152127832174302, "epoch": 0.6065454545454545, "grad_norm": 0.3186095058917999, "learning_rate": 7.655552490416571e-05, "loss": 0.8983, "mean_token_accuracy": 0.8220426417887211, "num_tokens": 31997642.0, "step": 4170 }, { "entropy": 0.9264437086880207, "epoch": 0.608, "grad_norm": 1.0923210382461548, "learning_rate": 7.607706084240931e-05, "loss": 0.8971, "mean_token_accuracy": 0.8194640293717385, "num_tokens": 32074441.0, "step": 4180 }, { "entropy": 0.9173982113599777, "epoch": 0.6094545454545455, "grad_norm": 0.45009058713912964, "learning_rate": 7.559917896399043e-05, "loss": 0.8987, "mean_token_accuracy": 0.8222583763301372, "num_tokens": 32150958.0, "step": 4190 }, { "entropy": 0.9083267413079739, "epoch": 0.610909090909091, "grad_norm": 0.6000900864601135, "learning_rate": 7.512189087428057e-05, "loss": 0.8963, "mean_token_accuracy": 0.8209093257784843, "num_tokens": 32226361.0, "step": 4200 }, { "entropy": 0.9476249985396862, "epoch": 0.6123636363636363, "grad_norm": 0.34333670139312744, "learning_rate": 7.464520816423117e-05, "loss": 0.9171, "mean_token_accuracy": 0.8171191327273846, "num_tokens": 32305274.0, "step": 4210 }, { "entropy": 0.9213205456733704, "epoch": 0.6138181818181818, "grad_norm": 0.323318213224411, "learning_rate": 7.416914241009198e-05, "loss": 0.9058, "mean_token_accuracy": 0.820676113665104, "num_tokens": 32379985.0, "step": 4220 }, { "entropy": 0.9409652277827263, "epoch": 0.6152727272727273, "grad_norm": 0.5688571929931641, "learning_rate": 7.369370517312999e-05, "loss": 0.9373, "mean_token_accuracy": 0.8150431983172893, "num_tokens": 32461118.0, "step": 4230 }, { "entropy": 0.8937712088227272, "epoch": 0.6167272727272727, "grad_norm": 0.3120442032814026, "learning_rate": 7.321890799934859e-05, "loss": 0.8769, "mean_token_accuracy": 0.8248605616390705, "num_tokens": 32536163.0, "step": 4240 }, { "entropy": 0.9199181906878948, "epoch": 0.6181818181818182, "grad_norm": 0.3446398973464966, "learning_rate": 7.274476241920722e-05, "loss": 0.8886, "mean_token_accuracy": 0.8221151031553745, "num_tokens": 32610946.0, "step": 4250 }, { "entropy": 0.9408010371029377, "epoch": 0.6196363636363637, "grad_norm": 0.4573688507080078, "learning_rate": 7.227127994734143e-05, "loss": 0.927, "mean_token_accuracy": 0.815653482824564, "num_tokens": 32688544.0, "step": 4260 }, { "entropy": 0.9303324475884438, "epoch": 0.6210909090909091, "grad_norm": 0.351698637008667, "learning_rate": 7.17984720822831e-05, "loss": 0.9094, "mean_token_accuracy": 0.8197804532945157, "num_tokens": 32764950.0, "step": 4270 }, { "entropy": 0.9053874962031842, "epoch": 0.6225454545454545, "grad_norm": 0.35766610503196716, "learning_rate": 7.13263503061813e-05, "loss": 0.8853, "mean_token_accuracy": 0.8218501470983028, "num_tokens": 32842151.0, "step": 4280 }, { "entropy": 0.9122004747390747, "epoch": 0.624, "grad_norm": 0.3826545774936676, "learning_rate": 7.085492608452338e-05, "loss": 0.8946, "mean_token_accuracy": 0.8221177138388157, "num_tokens": 32916904.0, "step": 4290 }, { "entropy": 0.9165596097707749, "epoch": 0.6254545454545455, "grad_norm": 1.2036513090133667, "learning_rate": 7.038421086585666e-05, "loss": 0.8885, "mean_token_accuracy": 0.8209186360239983, "num_tokens": 32993609.0, "step": 4300 }, { "entropy": 0.9260142505168915, "epoch": 0.6269090909090909, "grad_norm": 1.3860843181610107, "learning_rate": 6.991421608151017e-05, "loss": 0.8996, "mean_token_accuracy": 0.8197734817862511, "num_tokens": 33071167.0, "step": 4310 }, { "entropy": 0.9168666034936905, "epoch": 0.6283636363636363, "grad_norm": 2.340118885040283, "learning_rate": 6.944495314531727e-05, "loss": 0.8975, "mean_token_accuracy": 0.8201201424002648, "num_tokens": 33147789.0, "step": 4320 }, { "entropy": 0.9065008342266083, "epoch": 0.6298181818181818, "grad_norm": 0.6106637716293335, "learning_rate": 6.897643345333834e-05, "loss": 0.8967, "mean_token_accuracy": 0.8197059437632561, "num_tokens": 33225832.0, "step": 4330 }, { "entropy": 0.9281016632914543, "epoch": 0.6312727272727273, "grad_norm": 0.9546725153923035, "learning_rate": 6.850866838358409e-05, "loss": 0.906, "mean_token_accuracy": 0.8203367196023464, "num_tokens": 33301739.0, "step": 4340 }, { "entropy": 0.9266930267214775, "epoch": 0.6327272727272727, "grad_norm": 0.3478836417198181, "learning_rate": 6.804166929573917e-05, "loss": 0.8965, "mean_token_accuracy": 0.8206172339618206, "num_tokens": 33377878.0, "step": 4350 }, { "entropy": 0.9037258170545102, "epoch": 0.6341818181818182, "grad_norm": 0.3244507312774658, "learning_rate": 6.75754475308864e-05, "loss": 0.885, "mean_token_accuracy": 0.8226259790360928, "num_tokens": 33454196.0, "step": 4360 }, { "entropy": 0.9108875006437301, "epoch": 0.6356363636363637, "grad_norm": 0.3166865408420563, "learning_rate": 6.711001441123121e-05, "loss": 0.8991, "mean_token_accuracy": 0.8241880655288696, "num_tokens": 33529129.0, "step": 4370 }, { "entropy": 0.9191383279860019, "epoch": 0.637090909090909, "grad_norm": 0.351441890001297, "learning_rate": 6.664538123982683e-05, "loss": 0.8989, "mean_token_accuracy": 0.8207916006445884, "num_tokens": 33607830.0, "step": 4380 }, { "entropy": 0.9276580266654492, "epoch": 0.6385454545454545, "grad_norm": 0.34574443101882935, "learning_rate": 6.618155930029973e-05, "loss": 0.9048, "mean_token_accuracy": 0.8198268927633763, "num_tokens": 33685645.0, "step": 4390 }, { "entropy": 0.9335759162902832, "epoch": 0.64, "grad_norm": 0.5790361762046814, "learning_rate": 6.571855985657552e-05, "loss": 0.917, "mean_token_accuracy": 0.8164054766297341, "num_tokens": 33763192.0, "step": 4400 }, { "entropy": 0.9067804291844368, "epoch": 0.6414545454545455, "grad_norm": 0.3304104208946228, "learning_rate": 6.525639415260563e-05, "loss": 0.8866, "mean_token_accuracy": 0.8219463184475899, "num_tokens": 33838644.0, "step": 4410 }, { "entropy": 0.9119504414498806, "epoch": 0.6429090909090909, "grad_norm": 0.8898224234580994, "learning_rate": 6.479507341209393e-05, "loss": 0.8943, "mean_token_accuracy": 0.8221902497112751, "num_tokens": 33914910.0, "step": 4420 }, { "entropy": 0.9117854446172714, "epoch": 0.6443636363636364, "grad_norm": 0.8432343006134033, "learning_rate": 6.433460883822452e-05, "loss": 0.8844, "mean_token_accuracy": 0.821457427740097, "num_tokens": 33990914.0, "step": 4430 }, { "entropy": 0.9375110886991024, "epoch": 0.6458181818181818, "grad_norm": 0.5810782313346863, "learning_rate": 6.387501161338928e-05, "loss": 0.9054, "mean_token_accuracy": 0.8187261156737804, "num_tokens": 34069434.0, "step": 4440 }, { "entropy": 0.937576549500227, "epoch": 0.6472727272727272, "grad_norm": 0.35709822177886963, "learning_rate": 6.341629289891659e-05, "loss": 0.9263, "mean_token_accuracy": 0.8171633973717689, "num_tokens": 34148749.0, "step": 4450 }, { "entropy": 0.9383350938558579, "epoch": 0.6487272727272727, "grad_norm": 0.5527284741401672, "learning_rate": 6.295846383480026e-05, "loss": 0.9314, "mean_token_accuracy": 0.8169618725776673, "num_tokens": 34225306.0, "step": 4460 }, { "entropy": 0.9290240414440631, "epoch": 0.6501818181818182, "grad_norm": 0.7125141024589539, "learning_rate": 6.250153553942878e-05, "loss": 0.8952, "mean_token_accuracy": 0.820123678445816, "num_tokens": 34301885.0, "step": 4470 }, { "entropy": 0.9101897843182087, "epoch": 0.6516363636363637, "grad_norm": 0.7149432897567749, "learning_rate": 6.204551910931557e-05, "loss": 0.893, "mean_token_accuracy": 0.8224738091230392, "num_tokens": 34378346.0, "step": 4480 }, { "entropy": 0.8988116376101971, "epoch": 0.653090909090909, "grad_norm": 1.1322219371795654, "learning_rate": 6.159042561882934e-05, "loss": 0.8757, "mean_token_accuracy": 0.8231632746756077, "num_tokens": 34454099.0, "step": 4490 }, { "entropy": 0.9239438407123088, "epoch": 0.6545454545454545, "grad_norm": 0.34981048107147217, "learning_rate": 6.113626611992519e-05, "loss": 0.9089, "mean_token_accuracy": 0.8181489415466785, "num_tokens": 34531037.0, "step": 4500 }, { "entropy": 0.9121604941785335, "epoch": 0.656, "grad_norm": 0.8667944669723511, "learning_rate": 6.0683051641876175e-05, "loss": 0.8849, "mean_token_accuracy": 0.8227492026984692, "num_tokens": 34606413.0, "step": 4510 }, { "entropy": 0.9448349975049496, "epoch": 0.6574545454545454, "grad_norm": 0.4684516191482544, "learning_rate": 6.023079319100555e-05, "loss": 0.9271, "mean_token_accuracy": 0.8161519937217235, "num_tokens": 34682859.0, "step": 4520 }, { "entropy": 0.9321636602282524, "epoch": 0.6589090909090909, "grad_norm": 0.3283658027648926, "learning_rate": 5.977950175041943e-05, "loss": 0.9136, "mean_token_accuracy": 0.8175563149154186, "num_tokens": 34761381.0, "step": 4530 }, { "entropy": 0.9159560807049274, "epoch": 0.6603636363636364, "grad_norm": 1.8966891765594482, "learning_rate": 5.932918827974003e-05, "loss": 0.8926, "mean_token_accuracy": 0.8220967844128608, "num_tokens": 34836927.0, "step": 4540 }, { "entropy": 0.9200945071876049, "epoch": 0.6618181818181819, "grad_norm": 0.3431169390678406, "learning_rate": 5.887986371483962e-05, "loss": 0.9019, "mean_token_accuracy": 0.8226698577404022, "num_tokens": 34913494.0, "step": 4550 }, { "entropy": 0.8993129044771194, "epoch": 0.6632727272727272, "grad_norm": 0.3218921720981598, "learning_rate": 5.843153896757475e-05, "loss": 0.8754, "mean_token_accuracy": 0.8246046505868435, "num_tokens": 34989288.0, "step": 4560 }, { "entropy": 0.9213286116719246, "epoch": 0.6647272727272727, "grad_norm": 0.44739851355552673, "learning_rate": 5.798422492552151e-05, "loss": 0.8968, "mean_token_accuracy": 0.8216261245310307, "num_tokens": 35065311.0, "step": 4570 }, { "entropy": 0.9399213455617428, "epoch": 0.6661818181818182, "grad_norm": 0.3798374533653259, "learning_rate": 5.7537932451710864e-05, "loss": 0.9269, "mean_token_accuracy": 0.816948776692152, "num_tokens": 35143191.0, "step": 4580 }, { "entropy": 0.9026488415896893, "epoch": 0.6676363636363636, "grad_norm": 0.3327493369579315, "learning_rate": 5.7092672384365045e-05, "loss": 0.8772, "mean_token_accuracy": 0.8241571098566055, "num_tokens": 35219781.0, "step": 4590 }, { "entropy": 0.9310063399374485, "epoch": 0.6690909090909091, "grad_norm": 0.5970094799995422, "learning_rate": 5.664845553663427e-05, "loss": 0.9159, "mean_token_accuracy": 0.8162389121949672, "num_tokens": 35301018.0, "step": 4600 }, { "entropy": 0.9052704386413097, "epoch": 0.6705454545454546, "grad_norm": 1.2368245124816895, "learning_rate": 5.620529269633419e-05, "loss": 0.8824, "mean_token_accuracy": 0.8242752820253372, "num_tokens": 35375305.0, "step": 4610 }, { "entropy": 0.9087167643010616, "epoch": 0.672, "grad_norm": 0.5536038875579834, "learning_rate": 5.5763194625683735e-05, "loss": 0.8892, "mean_token_accuracy": 0.8252256274223327, "num_tokens": 35449523.0, "step": 4620 }, { "entropy": 0.931006995588541, "epoch": 0.6734545454545454, "grad_norm": 0.7629865407943726, "learning_rate": 5.532217206104401e-05, "loss": 0.9011, "mean_token_accuracy": 0.8168572470545769, "num_tokens": 35525855.0, "step": 4630 }, { "entropy": 0.9062797881662845, "epoch": 0.6749090909090909, "grad_norm": 0.34807315468788147, "learning_rate": 5.488223571265733e-05, "loss": 0.8869, "mean_token_accuracy": 0.8224447555840015, "num_tokens": 35600766.0, "step": 4640 }, { "entropy": 0.9221105262637138, "epoch": 0.6763636363636364, "grad_norm": 0.3406118154525757, "learning_rate": 5.4443396264387304e-05, "loss": 0.9019, "mean_token_accuracy": 0.819121991097927, "num_tokens": 35677614.0, "step": 4650 }, { "entropy": 0.9147805757820606, "epoch": 0.6778181818181818, "grad_norm": 1.066024899482727, "learning_rate": 5.4005664373459285e-05, "loss": 0.8992, "mean_token_accuracy": 0.8201844908297062, "num_tokens": 35754102.0, "step": 4660 }, { "entropy": 0.8988436676561833, "epoch": 0.6792727272727273, "grad_norm": 0.47898566722869873, "learning_rate": 5.3569050670201516e-05, "loss": 0.8794, "mean_token_accuracy": 0.8236523412168026, "num_tokens": 35828877.0, "step": 4670 }, { "entropy": 0.917811781913042, "epoch": 0.6807272727272727, "grad_norm": 1.123764991760254, "learning_rate": 5.313356575778708e-05, "loss": 0.8936, "mean_token_accuracy": 0.8228101126849652, "num_tokens": 35903785.0, "step": 4680 }, { "entropy": 0.9052754618227482, "epoch": 0.6821818181818182, "grad_norm": 0.34496447443962097, "learning_rate": 5.269922021197635e-05, "loss": 0.8813, "mean_token_accuracy": 0.8240257889032364, "num_tokens": 35978342.0, "step": 4690 }, { "entropy": 0.9212935179471969, "epoch": 0.6836363636363636, "grad_norm": 0.34346017241477966, "learning_rate": 5.22660245808602e-05, "loss": 0.9071, "mean_token_accuracy": 0.8209236077964306, "num_tokens": 36055844.0, "step": 4700 }, { "entropy": 0.9109322354197502, "epoch": 0.6850909090909091, "grad_norm": 0.8080201148986816, "learning_rate": 5.1833989384603674e-05, "loss": 0.8938, "mean_token_accuracy": 0.8222977101802826, "num_tokens": 36133038.0, "step": 4710 }, { "entropy": 0.9155547618865967, "epoch": 0.6865454545454546, "grad_norm": 0.43798285722732544, "learning_rate": 5.140312511519072e-05, "loss": 0.8869, "mean_token_accuracy": 0.8229060113430023, "num_tokens": 36208973.0, "step": 4720 }, { "entropy": 0.9071539863944054, "epoch": 0.688, "grad_norm": 0.6105244755744934, "learning_rate": 5.097344223616927e-05, "loss": 0.8864, "mean_token_accuracy": 0.8228571750223637, "num_tokens": 36286284.0, "step": 4730 }, { "entropy": 0.9173211127519607, "epoch": 0.6894545454545454, "grad_norm": 0.4710405766963959, "learning_rate": 5.054495118239724e-05, "loss": 0.8989, "mean_token_accuracy": 0.8202463157474995, "num_tokens": 36364109.0, "step": 4740 }, { "entropy": 0.9191012769937515, "epoch": 0.6909090909090909, "grad_norm": 0.39346182346343994, "learning_rate": 5.011766235978892e-05, "loss": 0.9027, "mean_token_accuracy": 0.8204705208539963, "num_tokens": 36440260.0, "step": 4750 }, { "entropy": 0.9279646016657352, "epoch": 0.6923636363636364, "grad_norm": 0.46738266944885254, "learning_rate": 4.969158614506252e-05, "loss": 0.9008, "mean_token_accuracy": 0.8226397335529327, "num_tokens": 36515689.0, "step": 4760 }, { "entropy": 0.921799573302269, "epoch": 0.6938181818181818, "grad_norm": 2.155463457107544, "learning_rate": 4.9266732885487926e-05, "loss": 0.8976, "mean_token_accuracy": 0.8203616641461849, "num_tokens": 36592038.0, "step": 4770 }, { "entropy": 0.9005033083260059, "epoch": 0.6952727272727273, "grad_norm": 0.3272842466831207, "learning_rate": 4.88431128986356e-05, "loss": 0.8826, "mean_token_accuracy": 0.8243346132338047, "num_tokens": 36670238.0, "step": 4780 }, { "entropy": 0.9036756217479706, "epoch": 0.6967272727272728, "grad_norm": 0.3420988917350769, "learning_rate": 4.8420736472125994e-05, "loss": 0.9006, "mean_token_accuracy": 0.8209830693900585, "num_tokens": 36745652.0, "step": 4790 }, { "entropy": 0.9203361749649048, "epoch": 0.6981818181818182, "grad_norm": 1.3303462266921997, "learning_rate": 4.7999613863379513e-05, "loss": 0.9036, "mean_token_accuracy": 0.8206400662660599, "num_tokens": 36824621.0, "step": 4800 }, { "entropy": 0.9381427116692066, "epoch": 0.6996363636363636, "grad_norm": 0.4559713900089264, "learning_rate": 4.7579755299367713e-05, "loss": 0.9342, "mean_token_accuracy": 0.8164194501936436, "num_tokens": 36901731.0, "step": 4810 }, { "entropy": 0.9082010470330715, "epoch": 0.7010909090909091, "grad_norm": 0.31959229707717896, "learning_rate": 4.716117097636477e-05, "loss": 0.8837, "mean_token_accuracy": 0.8240106962621212, "num_tokens": 36979208.0, "step": 4820 }, { "entropy": 0.9182284452021122, "epoch": 0.7025454545454546, "grad_norm": 0.5974369645118713, "learning_rate": 4.67438710596999e-05, "loss": 0.8948, "mean_token_accuracy": 0.8215501293540001, "num_tokens": 37055307.0, "step": 4830 }, { "entropy": 0.9068014062941074, "epoch": 0.704, "grad_norm": 0.3271491825580597, "learning_rate": 4.6327865683510396e-05, "loss": 0.8898, "mean_token_accuracy": 0.8260469518601894, "num_tokens": 37129546.0, "step": 4840 }, { "entropy": 0.9046911887824536, "epoch": 0.7054545454545454, "grad_norm": 0.3307289481163025, "learning_rate": 4.591316495049567e-05, "loss": 0.8944, "mean_token_accuracy": 0.8209660328924656, "num_tokens": 37208382.0, "step": 4850 }, { "entropy": 0.906683124601841, "epoch": 0.7069090909090909, "grad_norm": 0.31656327843666077, "learning_rate": 4.549977893167188e-05, "loss": 0.8929, "mean_token_accuracy": 0.8215794719755649, "num_tokens": 37283806.0, "step": 4860 }, { "entropy": 0.9107134640216827, "epoch": 0.7083636363636364, "grad_norm": 0.33436915278434753, "learning_rate": 4.508771766612727e-05, "loss": 0.8912, "mean_token_accuracy": 0.8219263046979904, "num_tokens": 37362060.0, "step": 4870 }, { "entropy": 0.938027660548687, "epoch": 0.7098181818181818, "grad_norm": 0.3237261474132538, "learning_rate": 4.467699116077847e-05, "loss": 0.9307, "mean_token_accuracy": 0.8167957946658134, "num_tokens": 37439998.0, "step": 4880 }, { "entropy": 0.9301370844244957, "epoch": 0.7112727272727273, "grad_norm": 0.3891702890396118, "learning_rate": 4.4267609390127344e-05, "loss": 0.922, "mean_token_accuracy": 0.8177198253571987, "num_tokens": 37515912.0, "step": 4890 }, { "entropy": 0.911509207636118, "epoch": 0.7127272727272728, "grad_norm": 0.2914981544017792, "learning_rate": 4.385958229601898e-05, "loss": 0.8769, "mean_token_accuracy": 0.8222219668328762, "num_tokens": 37592700.0, "step": 4900 }, { "entropy": 0.9143662184476853, "epoch": 0.7141818181818181, "grad_norm": 0.3326908051967621, "learning_rate": 4.345291978739995e-05, "loss": 0.8977, "mean_token_accuracy": 0.8202255286276341, "num_tokens": 37669405.0, "step": 4910 }, { "entropy": 0.9253424435853959, "epoch": 0.7156363636363636, "grad_norm": 0.3408204913139343, "learning_rate": 4.304763174007798e-05, "loss": 0.8967, "mean_token_accuracy": 0.8195987194776535, "num_tokens": 37749117.0, "step": 4920 }, { "entropy": 0.9295443311333657, "epoch": 0.7170909090909091, "grad_norm": 0.3627084195613861, "learning_rate": 4.264372799648193e-05, "loss": 0.9048, "mean_token_accuracy": 0.8182410605251789, "num_tokens": 37828392.0, "step": 4930 }, { "entropy": 0.9167982846498489, "epoch": 0.7185454545454546, "grad_norm": 0.40901535749435425, "learning_rate": 4.224121836542277e-05, "loss": 0.9011, "mean_token_accuracy": 0.8199195042252541, "num_tokens": 37905217.0, "step": 4940 }, { "entropy": 0.9198883838951588, "epoch": 0.72, "grad_norm": 0.7457308173179626, "learning_rate": 4.1840112621855465e-05, "loss": 0.9056, "mean_token_accuracy": 0.8203414805233479, "num_tokens": 37982324.0, "step": 4950 }, { "entropy": 0.9170742996037007, "epoch": 0.7214545454545455, "grad_norm": 0.5554471015930176, "learning_rate": 4.144042050664154e-05, "loss": 0.8942, "mean_token_accuracy": 0.8203064344823361, "num_tokens": 38061849.0, "step": 4960 }, { "entropy": 0.9040765814483166, "epoch": 0.722909090909091, "grad_norm": 1.6444945335388184, "learning_rate": 4.104215172631255e-05, "loss": 0.8776, "mean_token_accuracy": 0.8247710056602955, "num_tokens": 38137324.0, "step": 4970 }, { "entropy": 0.9116667337715626, "epoch": 0.7243636363636363, "grad_norm": 0.5622697472572327, "learning_rate": 4.0645315952834264e-05, "loss": 0.9033, "mean_token_accuracy": 0.819647303968668, "num_tokens": 38214376.0, "step": 4980 }, { "entropy": 0.9142092511057853, "epoch": 0.7258181818181818, "grad_norm": 2.6932389736175537, "learning_rate": 4.024992282337184e-05, "loss": 0.884, "mean_token_accuracy": 0.8248827517032623, "num_tokens": 38287505.0, "step": 4990 }, { "entropy": 0.9225122049450875, "epoch": 0.7272727272727273, "grad_norm": 1.9417043924331665, "learning_rate": 3.9855981940055895e-05, "loss": 0.8931, "mean_token_accuracy": 0.8227336160838604, "num_tokens": 38364587.0, "step": 5000 }, { "epoch": 0.7272727272727273, "eval_entropy": 0.9167415462493896, "eval_loss": 0.944766104221344, "eval_mean_token_accuracy": 0.8129959221839905, "eval_num_tokens": 38364587.0, "eval_runtime": 78.076, "eval_samples_per_second": 64.04, "eval_steps_per_second": 8.005, "step": 5000 }, { "entropy": 0.9145618513226509, "epoch": 0.7287272727272728, "grad_norm": 1.0130982398986816, "learning_rate": 3.946350286974914e-05, "loss": 0.889, "mean_token_accuracy": 0.8210049398243427, "num_tokens": 38442118.0, "step": 5010 }, { "entropy": 0.9164961226284504, "epoch": 0.7301818181818182, "grad_norm": 0.3274339735507965, "learning_rate": 3.907249514381419e-05, "loss": 0.8902, "mean_token_accuracy": 0.821975689381361, "num_tokens": 38519059.0, "step": 5020 }, { "entropy": 0.903435967862606, "epoch": 0.7316363636363636, "grad_norm": 2.559694290161133, "learning_rate": 3.8682968257881954e-05, "loss": 0.8971, "mean_token_accuracy": 0.8234760813415051, "num_tokens": 38595562.0, "step": 5030 }, { "entropy": 0.8993699155747891, "epoch": 0.7330909090909091, "grad_norm": 0.8827573657035828, "learning_rate": 3.82949316716211e-05, "loss": 0.8912, "mean_token_accuracy": 0.8228749997913838, "num_tokens": 38668505.0, "step": 5040 }, { "entropy": 0.9492502108216285, "epoch": 0.7345454545454545, "grad_norm": 0.3277486264705658, "learning_rate": 3.7908394808508427e-05, "loss": 0.9327, "mean_token_accuracy": 0.8169902831315994, "num_tokens": 38748156.0, "step": 5050 }, { "entropy": 0.9224891781806945, "epoch": 0.736, "grad_norm": 3.9432334899902344, "learning_rate": 3.752336705559988e-05, "loss": 0.8988, "mean_token_accuracy": 0.8203701607882976, "num_tokens": 38825253.0, "step": 5060 }, { "entropy": 0.9180438406765461, "epoch": 0.7374545454545455, "grad_norm": 2.536931276321411, "learning_rate": 3.7139857763302665e-05, "loss": 0.8999, "mean_token_accuracy": 0.819855236262083, "num_tokens": 38904647.0, "step": 5070 }, { "entropy": 0.918037424236536, "epoch": 0.738909090909091, "grad_norm": 0.34127771854400635, "learning_rate": 3.675787624514802e-05, "loss": 0.9006, "mean_token_accuracy": 0.8193914517760277, "num_tokens": 38982580.0, "step": 5080 }, { "entropy": 0.9227818869054317, "epoch": 0.7403636363636363, "grad_norm": 0.3767578601837158, "learning_rate": 3.637743177756529e-05, "loss": 0.8943, "mean_token_accuracy": 0.8203182458877564, "num_tokens": 39058467.0, "step": 5090 }, { "entropy": 0.9119371868669987, "epoch": 0.7418181818181818, "grad_norm": 1.933066964149475, "learning_rate": 3.5998533599656495e-05, "loss": 0.8961, "mean_token_accuracy": 0.8217470467090606, "num_tokens": 39133672.0, "step": 5100 }, { "entropy": 0.9073677368462085, "epoch": 0.7432727272727273, "grad_norm": 0.3380196690559387, "learning_rate": 3.5621190912971904e-05, "loss": 0.8874, "mean_token_accuracy": 0.8223125129938126, "num_tokens": 39207784.0, "step": 5110 }, { "entropy": 0.9009414814412594, "epoch": 0.7447272727272727, "grad_norm": 3.2998690605163574, "learning_rate": 3.524541288128667e-05, "loss": 0.8741, "mean_token_accuracy": 0.8245840072631836, "num_tokens": 39281502.0, "step": 5120 }, { "entropy": 0.9070143595337867, "epoch": 0.7461818181818182, "grad_norm": 0.2989789843559265, "learning_rate": 3.4871208630378305e-05, "loss": 0.8772, "mean_token_accuracy": 0.8259104959666729, "num_tokens": 39354545.0, "step": 5130 }, { "entropy": 0.9156953662633895, "epoch": 0.7476363636363637, "grad_norm": 0.3448035418987274, "learning_rate": 3.449858724780502e-05, "loss": 0.9086, "mean_token_accuracy": 0.8190042689442635, "num_tokens": 39434017.0, "step": 5140 }, { "entropy": 0.9149294622242451, "epoch": 0.7490909090909091, "grad_norm": 0.3348819315433502, "learning_rate": 3.412755778268505e-05, "loss": 0.8929, "mean_token_accuracy": 0.8223293416202069, "num_tokens": 39510040.0, "step": 5150 }, { "entropy": 0.92013523504138, "epoch": 0.7505454545454545, "grad_norm": 0.7382948398590088, "learning_rate": 3.3758129245476766e-05, "loss": 0.9099, "mean_token_accuracy": 0.8201128125190735, "num_tokens": 39587287.0, "step": 5160 }, { "entropy": 0.9161408551037311, "epoch": 0.752, "grad_norm": 0.6711187958717346, "learning_rate": 3.339031060776014e-05, "loss": 0.9098, "mean_token_accuracy": 0.8177258402109147, "num_tokens": 39664088.0, "step": 5170 }, { "entropy": 0.9200255520641804, "epoch": 0.7534545454545455, "grad_norm": 0.34548547863960266, "learning_rate": 3.3024110802018535e-05, "loss": 0.8878, "mean_token_accuracy": 0.8237753942608833, "num_tokens": 39737765.0, "step": 5180 }, { "entropy": 0.9344703152775764, "epoch": 0.7549090909090909, "grad_norm": 0.3410409986972809, "learning_rate": 3.265953872142206e-05, "loss": 0.9205, "mean_token_accuracy": 0.8173702888190746, "num_tokens": 39816946.0, "step": 5190 }, { "entropy": 0.9066876843571663, "epoch": 0.7563636363636363, "grad_norm": 0.39815202355384827, "learning_rate": 3.229660321961147e-05, "loss": 0.8959, "mean_token_accuracy": 0.8212850585579872, "num_tokens": 39895255.0, "step": 5200 }, { "entropy": 0.9421879507601261, "epoch": 0.7578181818181818, "grad_norm": 1.315977931022644, "learning_rate": 3.193531311048311e-05, "loss": 0.9193, "mean_token_accuracy": 0.8162787385284901, "num_tokens": 39972246.0, "step": 5210 }, { "entropy": 0.9184886425733566, "epoch": 0.7592727272727273, "grad_norm": 0.32920485734939575, "learning_rate": 3.157567716797498e-05, "loss": 0.893, "mean_token_accuracy": 0.822785185277462, "num_tokens": 40049383.0, "step": 5220 }, { "entropy": 0.8912613660097122, "epoch": 0.7607272727272727, "grad_norm": 0.33051466941833496, "learning_rate": 3.121770412585364e-05, "loss": 0.8607, "mean_token_accuracy": 0.8278714805841446, "num_tokens": 40122483.0, "step": 5230 }, { "entropy": 0.9078203670680522, "epoch": 0.7621818181818182, "grad_norm": 0.32255810499191284, "learning_rate": 3.086140267750195e-05, "loss": 0.883, "mean_token_accuracy": 0.8227630846202374, "num_tokens": 40200942.0, "step": 5240 }, { "entropy": 0.9007733002305031, "epoch": 0.7636363636363637, "grad_norm": 0.3562650978565216, "learning_rate": 3.0506781475708234e-05, "loss": 0.8855, "mean_token_accuracy": 0.8229335404932498, "num_tokens": 40277363.0, "step": 5250 }, { "entropy": 0.9164358474314213, "epoch": 0.765090909090909, "grad_norm": 0.35381633043289185, "learning_rate": 3.0153849132455868e-05, "loss": 0.8919, "mean_token_accuracy": 0.8217478588223457, "num_tokens": 40354782.0, "step": 5260 }, { "entropy": 0.913616917282343, "epoch": 0.7665454545454545, "grad_norm": 0.35221511125564575, "learning_rate": 2.9802614218714342e-05, "loss": 0.8862, "mean_token_accuracy": 0.8239908576011657, "num_tokens": 40430145.0, "step": 5270 }, { "entropy": 0.9246010832488537, "epoch": 0.768, "grad_norm": 0.32586926221847534, "learning_rate": 2.9453085264231023e-05, "loss": 0.9003, "mean_token_accuracy": 0.8196610607206821, "num_tokens": 40507149.0, "step": 5280 }, { "entropy": 0.9094504900276661, "epoch": 0.7694545454545455, "grad_norm": 1.4361320734024048, "learning_rate": 2.910527075732401e-05, "loss": 0.8834, "mean_token_accuracy": 0.8229763463139534, "num_tokens": 40584650.0, "step": 5290 }, { "entropy": 0.9310476154088974, "epoch": 0.7709090909090909, "grad_norm": 0.33833417296409607, "learning_rate": 2.875917914467598e-05, "loss": 0.9038, "mean_token_accuracy": 0.8182396002113819, "num_tokens": 40662417.0, "step": 5300 }, { "entropy": 0.9101719483733177, "epoch": 0.7723636363636364, "grad_norm": 0.3172771632671356, "learning_rate": 2.8414818831129098e-05, "loss": 0.8864, "mean_token_accuracy": 0.821593638509512, "num_tokens": 40739831.0, "step": 5310 }, { "entropy": 0.9114699877798558, "epoch": 0.7738181818181818, "grad_norm": 2.5748441219329834, "learning_rate": 2.8072198179480908e-05, "loss": 0.8998, "mean_token_accuracy": 0.8192075364291668, "num_tokens": 40818006.0, "step": 5320 }, { "entropy": 0.9052566841244698, "epoch": 0.7752727272727272, "grad_norm": 0.8072139620780945, "learning_rate": 2.7731325510281252e-05, "loss": 0.8905, "mean_token_accuracy": 0.8216906942427158, "num_tokens": 40895087.0, "step": 5330 }, { "entropy": 0.9593810178339481, "epoch": 0.7767272727272727, "grad_norm": 1.659779667854309, "learning_rate": 2.7392209101630157e-05, "loss": 0.9655, "mean_token_accuracy": 0.8138592358678579, "num_tokens": 40972952.0, "step": 5340 }, { "entropy": 0.9060130745172501, "epoch": 0.7781818181818182, "grad_norm": 0.5863545536994934, "learning_rate": 2.7054857188976784e-05, "loss": 0.8805, "mean_token_accuracy": 0.8246444381773472, "num_tokens": 41049635.0, "step": 5350 }, { "entropy": 0.931407830119133, "epoch": 0.7796363636363637, "grad_norm": 0.34131190180778503, "learning_rate": 2.6719277964919527e-05, "loss": 0.9083, "mean_token_accuracy": 0.8182107910513878, "num_tokens": 41126152.0, "step": 5360 }, { "entropy": 0.9074273183941841, "epoch": 0.7810909090909091, "grad_norm": 0.35227325558662415, "learning_rate": 2.6385479579007012e-05, "loss": 0.8771, "mean_token_accuracy": 0.8249678060412406, "num_tokens": 41200196.0, "step": 5370 }, { "entropy": 0.9232403814792634, "epoch": 0.7825454545454545, "grad_norm": 2.6211049556732178, "learning_rate": 2.6053470137540077e-05, "loss": 0.895, "mean_token_accuracy": 0.8201713971793652, "num_tokens": 41276170.0, "step": 5380 }, { "entropy": 0.9107597105205059, "epoch": 0.784, "grad_norm": 0.9971133470535278, "learning_rate": 2.5723257703375147e-05, "loss": 0.8952, "mean_token_accuracy": 0.8221598446369172, "num_tokens": 41354544.0, "step": 5390 }, { "entropy": 0.9056881733238697, "epoch": 0.7854545454545454, "grad_norm": 0.4628162384033203, "learning_rate": 2.5394850295728146e-05, "loss": 0.8938, "mean_token_accuracy": 0.8212578587234021, "num_tokens": 41430868.0, "step": 5400 }, { "entropy": 0.9165485695004463, "epoch": 0.7869090909090909, "grad_norm": 0.3809981346130371, "learning_rate": 2.5068255889979976e-05, "loss": 0.8876, "mean_token_accuracy": 0.8206007726490497, "num_tokens": 41508162.0, "step": 5410 }, { "entropy": 0.9290221504867077, "epoch": 0.7883636363636364, "grad_norm": 0.32021892070770264, "learning_rate": 2.4743482417482735e-05, "loss": 0.9133, "mean_token_accuracy": 0.8185132816433907, "num_tokens": 41588151.0, "step": 5420 }, { "entropy": 0.9080618299543858, "epoch": 0.7898181818181819, "grad_norm": 0.32850199937820435, "learning_rate": 2.4420537765367142e-05, "loss": 0.8793, "mean_token_accuracy": 0.8246118858456611, "num_tokens": 41663786.0, "step": 5430 }, { "entropy": 0.9262031398713588, "epoch": 0.7912727272727272, "grad_norm": 2.3897554874420166, "learning_rate": 2.409942977635091e-05, "loss": 0.9047, "mean_token_accuracy": 0.8178823798894882, "num_tokens": 41743108.0, "step": 5440 }, { "entropy": 0.9042971536517144, "epoch": 0.7927272727272727, "grad_norm": 0.3209560811519623, "learning_rate": 2.3780166248548364e-05, "loss": 0.8868, "mean_token_accuracy": 0.8218206010758877, "num_tokens": 41819645.0, "step": 5450 }, { "entropy": 0.9179877236485481, "epoch": 0.7941818181818182, "grad_norm": 0.3202578127384186, "learning_rate": 2.346275493528109e-05, "loss": 0.9153, "mean_token_accuracy": 0.820369104295969, "num_tokens": 41896535.0, "step": 5460 }, { "entropy": 0.9163044169545174, "epoch": 0.7956363636363636, "grad_norm": 0.817571759223938, "learning_rate": 2.314720354488959e-05, "loss": 0.8894, "mean_token_accuracy": 0.819698441028595, "num_tokens": 41973115.0, "step": 5470 }, { "entropy": 0.9083671689033508, "epoch": 0.7970909090909091, "grad_norm": 1.006474494934082, "learning_rate": 2.2833519740546103e-05, "loss": 0.8804, "mean_token_accuracy": 0.8232364565134048, "num_tokens": 42050256.0, "step": 5480 }, { "entropy": 0.9098470561206341, "epoch": 0.7985454545454546, "grad_norm": 0.35074856877326965, "learning_rate": 2.252171114006847e-05, "loss": 0.9051, "mean_token_accuracy": 0.8213311359286308, "num_tokens": 42125229.0, "step": 5490 }, { "entropy": 0.9336720332503319, "epoch": 0.8, "grad_norm": 0.3655327260494232, "learning_rate": 2.2211785315735213e-05, "loss": 0.919, "mean_token_accuracy": 0.8171964854001998, "num_tokens": 42202853.0, "step": 5500 }, { "entropy": 0.9251384161412716, "epoch": 0.8014545454545454, "grad_norm": 0.3506443202495575, "learning_rate": 2.1903749794101522e-05, "loss": 0.9048, "mean_token_accuracy": 0.8205279417335987, "num_tokens": 42279546.0, "step": 5510 }, { "entropy": 0.9413960322737693, "epoch": 0.8029090909090909, "grad_norm": 0.3986915051937103, "learning_rate": 2.159761205581664e-05, "loss": 0.9188, "mean_token_accuracy": 0.8179226972162723, "num_tokens": 42356932.0, "step": 5520 }, { "entropy": 0.9280008278787136, "epoch": 0.8043636363636364, "grad_norm": 1.7976831197738647, "learning_rate": 2.129337953544203e-05, "loss": 0.9192, "mean_token_accuracy": 0.817876136302948, "num_tokens": 42434945.0, "step": 5530 }, { "entropy": 0.917744517326355, "epoch": 0.8058181818181818, "grad_norm": 0.670444130897522, "learning_rate": 2.0991059621270915e-05, "loss": 0.8856, "mean_token_accuracy": 0.8219639703631401, "num_tokens": 42512155.0, "step": 5540 }, { "entropy": 0.9068499661982059, "epoch": 0.8072727272727273, "grad_norm": 0.5417830348014832, "learning_rate": 2.0690659655148857e-05, "loss": 0.8847, "mean_token_accuracy": 0.8228611163794994, "num_tokens": 42589538.0, "step": 5550 }, { "entropy": 0.8938118264079093, "epoch": 0.8087272727272727, "grad_norm": 0.8048520088195801, "learning_rate": 2.039218693229545e-05, "loss": 0.8767, "mean_token_accuracy": 0.825986260175705, "num_tokens": 42663055.0, "step": 5560 }, { "entropy": 0.9236326240003109, "epoch": 0.8101818181818182, "grad_norm": 1.3545376062393188, "learning_rate": 2.009564870112709e-05, "loss": 0.9078, "mean_token_accuracy": 0.8180381782352925, "num_tokens": 42740723.0, "step": 5570 }, { "entropy": 0.8940872102975845, "epoch": 0.8116363636363636, "grad_norm": 0.5655390024185181, "learning_rate": 1.9801052163081006e-05, "loss": 0.8713, "mean_token_accuracy": 0.8249186836183071, "num_tokens": 42816045.0, "step": 5580 }, { "entropy": 0.914474855363369, "epoch": 0.8130909090909091, "grad_norm": 0.35351067781448364, "learning_rate": 1.9508404472440418e-05, "loss": 0.8969, "mean_token_accuracy": 0.8209439516067505, "num_tokens": 42893348.0, "step": 5590 }, { "entropy": 0.9080572672188282, "epoch": 0.8145454545454546, "grad_norm": 0.4727298617362976, "learning_rate": 1.9217712736160705e-05, "loss": 0.8863, "mean_token_accuracy": 0.8232846416532993, "num_tokens": 42969891.0, "step": 5600 }, { "entropy": 0.9193252146244049, "epoch": 0.816, "grad_norm": 0.3219492435455322, "learning_rate": 1.8928984013696927e-05, "loss": 0.8887, "mean_token_accuracy": 0.8216960929334164, "num_tokens": 43048711.0, "step": 5610 }, { "entropy": 0.9039079166948796, "epoch": 0.8174545454545454, "grad_norm": 0.41121330857276917, "learning_rate": 1.8642225316832167e-05, "loss": 0.8823, "mean_token_accuracy": 0.8243647992610932, "num_tokens": 43124290.0, "step": 5620 }, { "entropy": 0.9116926275193691, "epoch": 0.8189090909090909, "grad_norm": 0.4170006215572357, "learning_rate": 1.8357443609507547e-05, "loss": 0.8885, "mean_token_accuracy": 0.8218486055731773, "num_tokens": 43200155.0, "step": 5630 }, { "entropy": 0.8914009846746922, "epoch": 0.8203636363636364, "grad_norm": 0.3774668574333191, "learning_rate": 1.8074645807652825e-05, "loss": 0.8614, "mean_token_accuracy": 0.8262716047465801, "num_tokens": 43274762.0, "step": 5640 }, { "entropy": 0.9105676539242268, "epoch": 0.8218181818181818, "grad_norm": 0.3389342427253723, "learning_rate": 1.7793838779018674e-05, "loss": 0.9006, "mean_token_accuracy": 0.821910735219717, "num_tokens": 43352595.0, "step": 5650 }, { "entropy": 0.9219238504767417, "epoch": 0.8232727272727273, "grad_norm": 0.45230501890182495, "learning_rate": 1.7515029343009777e-05, "loss": 0.9283, "mean_token_accuracy": 0.8188553206622601, "num_tokens": 43429221.0, "step": 5660 }, { "entropy": 0.9218499854207038, "epoch": 0.8247272727272728, "grad_norm": 0.4920508861541748, "learning_rate": 1.7238224270519165e-05, "loss": 0.9065, "mean_token_accuracy": 0.8194623336195945, "num_tokens": 43505245.0, "step": 5670 }, { "entropy": 0.8820628426969052, "epoch": 0.8261818181818181, "grad_norm": 0.4515336751937866, "learning_rate": 1.696343028376394e-05, "loss": 0.8686, "mean_token_accuracy": 0.8276709161698819, "num_tokens": 43579860.0, "step": 5680 }, { "entropy": 0.9073334261775017, "epoch": 0.8276363636363636, "grad_norm": 0.3067150115966797, "learning_rate": 1.669065405612193e-05, "loss": 0.8829, "mean_token_accuracy": 0.8239874728024006, "num_tokens": 43655093.0, "step": 5690 }, { "entropy": 0.9091994293034077, "epoch": 0.8290909090909091, "grad_norm": 0.3159719705581665, "learning_rate": 1.6419902211969643e-05, "loss": 0.8874, "mean_token_accuracy": 0.8220887213945389, "num_tokens": 43731458.0, "step": 5700 }, { "entropy": 0.9184407569468022, "epoch": 0.8305454545454546, "grad_norm": 0.5727894902229309, "learning_rate": 1.6151181326521332e-05, "loss": 0.9082, "mean_token_accuracy": 0.8187850311398506, "num_tokens": 43807665.0, "step": 5710 }, { "entropy": 0.9286717921495438, "epoch": 0.832, "grad_norm": 0.7335017323493958, "learning_rate": 1.5884497925669418e-05, "loss": 0.9085, "mean_token_accuracy": 0.8177166223526001, "num_tokens": 43885791.0, "step": 5720 }, { "entropy": 0.9017570033669472, "epoch": 0.8334545454545454, "grad_norm": 0.30094099044799805, "learning_rate": 1.5619858485825967e-05, "loss": 0.8766, "mean_token_accuracy": 0.823994617909193, "num_tokens": 43963234.0, "step": 5730 }, { "entropy": 0.9207366243004799, "epoch": 0.8349090909090909, "grad_norm": 0.3066195845603943, "learning_rate": 1.535726943376543e-05, "loss": 0.9014, "mean_token_accuracy": 0.8193856805562973, "num_tokens": 44041938.0, "step": 5740 }, { "entropy": 0.9334449142217636, "epoch": 0.8363636363636363, "grad_norm": 0.3157121539115906, "learning_rate": 1.5096737146468522e-05, "loss": 0.9157, "mean_token_accuracy": 0.8169816955924034, "num_tokens": 44119391.0, "step": 5750 }, { "entropy": 0.9535537295043468, "epoch": 0.8378181818181818, "grad_norm": 0.3890473544597626, "learning_rate": 1.4838267950967356e-05, "loss": 0.9345, "mean_token_accuracy": 0.8143138892948627, "num_tokens": 44197991.0, "step": 5760 }, { "entropy": 0.9177822828292846, "epoch": 0.8392727272727273, "grad_norm": 0.3412627577781677, "learning_rate": 1.458186812419187e-05, "loss": 0.8999, "mean_token_accuracy": 0.8185959592461586, "num_tokens": 44276841.0, "step": 5770 }, { "entropy": 0.912161386013031, "epoch": 0.8407272727272728, "grad_norm": 0.36407360434532166, "learning_rate": 1.4327543892817288e-05, "loss": 0.8862, "mean_token_accuracy": 0.8223249286413192, "num_tokens": 44353553.0, "step": 5780 }, { "entropy": 0.8996298290789128, "epoch": 0.8421818181818181, "grad_norm": 0.3385894000530243, "learning_rate": 1.407530143311299e-05, "loss": 0.8744, "mean_token_accuracy": 0.8245961762964725, "num_tokens": 44430454.0, "step": 5790 }, { "entropy": 0.8858574166893959, "epoch": 0.8436363636363636, "grad_norm": 0.3109019100666046, "learning_rate": 1.3825146870792487e-05, "loss": 0.8609, "mean_token_accuracy": 0.8287350215017796, "num_tokens": 44504637.0, "step": 5800 }, { "entropy": 0.905403683334589, "epoch": 0.8450909090909091, "grad_norm": 0.33812251687049866, "learning_rate": 1.3577086280864632e-05, "loss": 0.8917, "mean_token_accuracy": 0.8217367753386497, "num_tokens": 44582467.0, "step": 5810 }, { "entropy": 0.8935080736875534, "epoch": 0.8465454545454546, "grad_norm": 0.4578856825828552, "learning_rate": 1.3331125687486126e-05, "loss": 0.8703, "mean_token_accuracy": 0.8245539911091327, "num_tokens": 44659005.0, "step": 5820 }, { "entropy": 0.9361538954079152, "epoch": 0.848, "grad_norm": 0.31013602018356323, "learning_rate": 1.3087271063815244e-05, "loss": 0.923, "mean_token_accuracy": 0.8165486060082913, "num_tokens": 44739227.0, "step": 5830 }, { "entropy": 0.9088335067033768, "epoch": 0.8494545454545455, "grad_norm": 0.32604363560676575, "learning_rate": 1.2845528331866671e-05, "loss": 0.8863, "mean_token_accuracy": 0.8229722075164319, "num_tokens": 44816692.0, "step": 5840 }, { "entropy": 0.8995483376085758, "epoch": 0.850909090909091, "grad_norm": 0.3095364570617676, "learning_rate": 1.2605903362367824e-05, "loss": 0.875, "mean_token_accuracy": 0.8238675244152546, "num_tokens": 44893443.0, "step": 5850 }, { "entropy": 0.9014830864965916, "epoch": 0.8523636363636363, "grad_norm": 0.49402737617492676, "learning_rate": 1.2368401974616153e-05, "loss": 0.8729, "mean_token_accuracy": 0.8236888878047466, "num_tokens": 44970393.0, "step": 5860 }, { "entropy": 0.9028633058071136, "epoch": 0.8538181818181818, "grad_norm": 0.30887338519096375, "learning_rate": 1.213302993633793e-05, "loss": 0.8759, "mean_token_accuracy": 0.8243600711226463, "num_tokens": 45046091.0, "step": 5870 }, { "entropy": 0.9114751204848289, "epoch": 0.8552727272727273, "grad_norm": 0.9053654670715332, "learning_rate": 1.1899792963548117e-05, "loss": 0.8926, "mean_token_accuracy": 0.8210045278072358, "num_tokens": 45124224.0, "step": 5880 }, { "entropy": 0.9158106587827206, "epoch": 0.8567272727272728, "grad_norm": 0.3252062499523163, "learning_rate": 1.1668696720411572e-05, "loss": 0.8935, "mean_token_accuracy": 0.8214658476412297, "num_tokens": 45200375.0, "step": 5890 }, { "entropy": 0.9093938983976841, "epoch": 0.8581818181818182, "grad_norm": 0.36540377140045166, "learning_rate": 1.143974681910547e-05, "loss": 0.9017, "mean_token_accuracy": 0.8203778505325318, "num_tokens": 45276728.0, "step": 5900 }, { "entropy": 0.9019094638526439, "epoch": 0.8596363636363636, "grad_norm": 0.9092381596565247, "learning_rate": 1.1212948819682999e-05, "loss": 0.8854, "mean_token_accuracy": 0.8230563633143901, "num_tokens": 45351853.0, "step": 5910 }, { "entropy": 0.9108839437365532, "epoch": 0.8610909090909091, "grad_norm": 0.3634931147098541, "learning_rate": 1.098830822993843e-05, "loss": 0.8772, "mean_token_accuracy": 0.8236395262181759, "num_tokens": 45427231.0, "step": 5920 }, { "entropy": 0.9179142944514751, "epoch": 0.8625454545454545, "grad_norm": 0.32144612073898315, "learning_rate": 1.0765830505273273e-05, "loss": 0.8924, "mean_token_accuracy": 0.8206780150532722, "num_tokens": 45503521.0, "step": 5930 }, { "entropy": 0.9086673229932785, "epoch": 0.864, "grad_norm": 0.3346118927001953, "learning_rate": 1.0545521048563785e-05, "loss": 0.8869, "mean_token_accuracy": 0.8204560600221157, "num_tokens": 45581502.0, "step": 5940 }, { "entropy": 0.9081209503114224, "epoch": 0.8654545454545455, "grad_norm": 0.6537035703659058, "learning_rate": 1.0327385210029801e-05, "loss": 0.8852, "mean_token_accuracy": 0.8215902402997017, "num_tokens": 45659228.0, "step": 5950 }, { "entropy": 0.9263642437756061, "epoch": 0.866909090909091, "grad_norm": 0.3149193823337555, "learning_rate": 1.0111428287104829e-05, "loss": 0.9329, "mean_token_accuracy": 0.8180480360984802, "num_tokens": 45737235.0, "step": 5960 }, { "entropy": 0.9080370858311653, "epoch": 0.8683636363636363, "grad_norm": 0.33345770835876465, "learning_rate": 9.897655524307342e-06, "loss": 0.8877, "mean_token_accuracy": 0.8218265272676945, "num_tokens": 45814371.0, "step": 5970 }, { "entropy": 0.899022338539362, "epoch": 0.8698181818181818, "grad_norm": 1.97817862033844, "learning_rate": 9.686072113113407e-06, "loss": 0.8803, "mean_token_accuracy": 0.8241935893893242, "num_tokens": 45890122.0, "step": 5980 }, { "entropy": 0.9251417450606823, "epoch": 0.8712727272727273, "grad_norm": 0.3278456926345825, "learning_rate": 9.476683191830666e-06, "loss": 0.8925, "mean_token_accuracy": 0.8199293427169323, "num_tokens": 45969291.0, "step": 5990 }, { "entropy": 0.899966686218977, "epoch": 0.8727272727272727, "grad_norm": 0.324158251285553, "learning_rate": 9.269493845473523e-06, "loss": 0.8847, "mean_token_accuracy": 0.8225129701197147, "num_tokens": 46044659.0, "step": 6000 }, { "epoch": 0.8727272727272727, "eval_entropy": 0.9082655986785889, "eval_loss": 0.9296354651451111, "eval_mean_token_accuracy": 0.8134225456237792, "eval_num_tokens": 46044659.0, "eval_runtime": 78.1885, "eval_samples_per_second": 63.948, "eval_steps_per_second": 7.994, "step": 6000 }, { "entropy": 0.8993717812001705, "epoch": 0.8741818181818182, "grad_norm": 0.33104297518730164, "learning_rate": 9.06450910563968e-06, "loss": 0.8686, "mean_token_accuracy": 0.8254872515797615, "num_tokens": 46119591.0, "step": 6010 }, { "entropy": 0.9017520911991597, "epoch": 0.8756363636363637, "grad_norm": 0.3194045424461365, "learning_rate": 8.861733950387915e-06, "loss": 0.8883, "mean_token_accuracy": 0.8212776839733124, "num_tokens": 46197101.0, "step": 6020 }, { "entropy": 0.9101865872740745, "epoch": 0.8770909090909091, "grad_norm": 0.30542537569999695, "learning_rate": 8.661173304117178e-06, "loss": 0.889, "mean_token_accuracy": 0.8223033159971237, "num_tokens": 46273776.0, "step": 6030 }, { "entropy": 0.891840324550867, "epoch": 0.8785454545454545, "grad_norm": 0.6645185351371765, "learning_rate": 8.462832037446993e-06, "loss": 0.8706, "mean_token_accuracy": 0.8264122419059277, "num_tokens": 46347359.0, "step": 6040 }, { "entropy": 0.9125166840851306, "epoch": 0.88, "grad_norm": 0.3202907145023346, "learning_rate": 8.266714967099286e-06, "loss": 0.8944, "mean_token_accuracy": 0.8212385781109333, "num_tokens": 46424205.0, "step": 6050 }, { "entropy": 0.9032726883888245, "epoch": 0.8814545454545455, "grad_norm": 0.8547842502593994, "learning_rate": 8.072826855781257e-06, "loss": 0.8836, "mean_token_accuracy": 0.8238522745668888, "num_tokens": 46501005.0, "step": 6060 }, { "entropy": 0.9115559689700603, "epoch": 0.8829090909090909, "grad_norm": 0.2994537949562073, "learning_rate": 7.88117241206985e-06, "loss": 0.8964, "mean_token_accuracy": 0.8225395679473877, "num_tokens": 46577416.0, "step": 6070 }, { "entropy": 0.9119720533490181, "epoch": 0.8843636363636364, "grad_norm": 0.31298911571502686, "learning_rate": 7.691756290297259e-06, "loss": 0.879, "mean_token_accuracy": 0.8213375210762024, "num_tokens": 46654800.0, "step": 6080 }, { "entropy": 0.8955303199589253, "epoch": 0.8858181818181818, "grad_norm": 6.103427886962891, "learning_rate": 7.504583090438062e-06, "loss": 0.8648, "mean_token_accuracy": 0.8251885525882244, "num_tokens": 46730256.0, "step": 6090 }, { "entropy": 0.8955484725534916, "epoch": 0.8872727272727273, "grad_norm": 0.3136664032936096, "learning_rate": 7.319657357997413e-06, "loss": 0.8783, "mean_token_accuracy": 0.8237858466804028, "num_tokens": 46805882.0, "step": 6100 }, { "entropy": 0.9244707800447941, "epoch": 0.8887272727272727, "grad_norm": 0.34006479382514954, "learning_rate": 7.136983583900615e-06, "loss": 0.9219, "mean_token_accuracy": 0.8182192638516426, "num_tokens": 46883478.0, "step": 6110 }, { "entropy": 0.9033333383500576, "epoch": 0.8901818181818182, "grad_norm": 0.34446612000465393, "learning_rate": 6.956566204384199e-06, "loss": 0.8934, "mean_token_accuracy": 0.8230147622525692, "num_tokens": 46958821.0, "step": 6120 }, { "entropy": 0.8889298714697361, "epoch": 0.8916363636363637, "grad_norm": 0.31922370195388794, "learning_rate": 6.778409600888029e-06, "loss": 0.8707, "mean_token_accuracy": 0.8255295574665069, "num_tokens": 47034208.0, "step": 6130 }, { "entropy": 0.9161468952894211, "epoch": 0.893090909090909, "grad_norm": 3.375911235809326, "learning_rate": 6.6025180999490305e-06, "loss": 0.9118, "mean_token_accuracy": 0.8201681829988956, "num_tokens": 47111500.0, "step": 6140 }, { "entropy": 0.9138515323400498, "epoch": 0.8945454545454545, "grad_norm": 0.3383484184741974, "learning_rate": 6.428895973096056e-06, "loss": 0.8851, "mean_token_accuracy": 0.8209197491407394, "num_tokens": 47188237.0, "step": 6150 }, { "entropy": 0.9050987802445889, "epoch": 0.896, "grad_norm": 0.36527344584465027, "learning_rate": 6.257547436746141e-06, "loss": 0.8905, "mean_token_accuracy": 0.8225465290248394, "num_tokens": 47264603.0, "step": 6160 }, { "entropy": 0.9179876156151294, "epoch": 0.8974545454545455, "grad_norm": 0.3297809064388275, "learning_rate": 6.088476652102145e-06, "loss": 0.8951, "mean_token_accuracy": 0.8211302883923054, "num_tokens": 47340993.0, "step": 6170 }, { "entropy": 0.9083369344472885, "epoch": 0.8989090909090909, "grad_norm": 1.8338009119033813, "learning_rate": 5.921687725051632e-06, "loss": 0.8852, "mean_token_accuracy": 0.82315573990345, "num_tokens": 47415150.0, "step": 6180 }, { "entropy": 0.8889398947358131, "epoch": 0.9003636363636364, "grad_norm": 0.3286149501800537, "learning_rate": 5.757184706067277e-06, "loss": 0.869, "mean_token_accuracy": 0.8250431105494499, "num_tokens": 47491474.0, "step": 6190 }, { "entropy": 0.905424141138792, "epoch": 0.9018181818181819, "grad_norm": 0.3469639718532562, "learning_rate": 5.594971590108399e-06, "loss": 0.9018, "mean_token_accuracy": 0.8211894407868385, "num_tokens": 47567827.0, "step": 6200 }, { "entropy": 0.9114717729389668, "epoch": 0.9032727272727272, "grad_norm": 1.8720717430114746, "learning_rate": 5.4350523165239645e-06, "loss": 0.8947, "mean_token_accuracy": 0.820029516518116, "num_tokens": 47647385.0, "step": 6210 }, { "entropy": 0.8960614062845706, "epoch": 0.9047272727272727, "grad_norm": 0.32637879252433777, "learning_rate": 5.277430768956922e-06, "loss": 0.8671, "mean_token_accuracy": 0.8259123407304287, "num_tokens": 47720917.0, "step": 6220 }, { "entropy": 0.9236697740852833, "epoch": 0.9061818181818182, "grad_norm": 0.3289095163345337, "learning_rate": 5.122110775249927e-06, "loss": 0.8918, "mean_token_accuracy": 0.8198946259915829, "num_tokens": 47798165.0, "step": 6230 }, { "entropy": 0.9044543921947479, "epoch": 0.9076363636363637, "grad_norm": 0.3405933976173401, "learning_rate": 4.969096107352316e-06, "loss": 0.8831, "mean_token_accuracy": 0.8225955821573734, "num_tokens": 47873847.0, "step": 6240 }, { "entropy": 0.9037906058132649, "epoch": 0.9090909090909091, "grad_norm": 0.32288992404937744, "learning_rate": 4.818390481228547e-06, "loss": 0.8831, "mean_token_accuracy": 0.8237175151705742, "num_tokens": 47950263.0, "step": 6250 }, { "entropy": 0.8919797301292419, "epoch": 0.9105454545454545, "grad_norm": 0.3142983913421631, "learning_rate": 4.669997556767988e-06, "loss": 0.8745, "mean_token_accuracy": 0.8249924443662167, "num_tokens": 48025710.0, "step": 6260 }, { "entropy": 0.8958311684429645, "epoch": 0.912, "grad_norm": 0.301633358001709, "learning_rate": 4.52392093769593e-06, "loss": 0.882, "mean_token_accuracy": 0.8238031409680844, "num_tokens": 48101876.0, "step": 6270 }, { "entropy": 0.9080388635396958, "epoch": 0.9134545454545454, "grad_norm": 0.3057876229286194, "learning_rate": 4.380164171486198e-06, "loss": 0.8974, "mean_token_accuracy": 0.8207934826612473, "num_tokens": 48181398.0, "step": 6280 }, { "entropy": 0.9020656362175942, "epoch": 0.9149090909090909, "grad_norm": 0.32301098108291626, "learning_rate": 4.238730749274913e-06, "loss": 0.884, "mean_token_accuracy": 0.8238483086228371, "num_tokens": 48257041.0, "step": 6290 }, { "entropy": 0.9208923012018204, "epoch": 0.9163636363636364, "grad_norm": 0.3088277578353882, "learning_rate": 4.099624105775764e-06, "loss": 0.8969, "mean_token_accuracy": 0.8195697702467442, "num_tokens": 48336009.0, "step": 6300 }, { "entropy": 0.9096413090825081, "epoch": 0.9178181818181819, "grad_norm": 0.3320503234863281, "learning_rate": 3.962847619196496e-06, "loss": 0.8889, "mean_token_accuracy": 0.8219702959060669, "num_tokens": 48413520.0, "step": 6310 }, { "entropy": 0.9034752696752548, "epoch": 0.9192727272727272, "grad_norm": 0.38523438572883606, "learning_rate": 3.82840461115702e-06, "loss": 0.8728, "mean_token_accuracy": 0.8240837588906288, "num_tokens": 48488903.0, "step": 6320 }, { "entropy": 0.8971277795732021, "epoch": 0.9207272727272727, "grad_norm": 2.067976236343384, "learning_rate": 3.6962983466086684e-06, "loss": 0.8661, "mean_token_accuracy": 0.8253998480737209, "num_tokens": 48564337.0, "step": 6330 }, { "entropy": 0.9000528261065484, "epoch": 0.9221818181818182, "grad_norm": 0.33974602818489075, "learning_rate": 3.5665320337548666e-06, "loss": 0.8667, "mean_token_accuracy": 0.8244885370135308, "num_tokens": 48641523.0, "step": 6340 }, { "entropy": 0.9108474776148796, "epoch": 0.9236363636363636, "grad_norm": 0.3082718253135681, "learning_rate": 3.43910882397328e-06, "loss": 0.8816, "mean_token_accuracy": 0.821860957890749, "num_tokens": 48717572.0, "step": 6350 }, { "entropy": 0.91778749153018, "epoch": 0.9250909090909091, "grad_norm": 0.7094966173171997, "learning_rate": 3.314031811739268e-06, "loss": 0.9008, "mean_token_accuracy": 0.820485782623291, "num_tokens": 48794160.0, "step": 6360 }, { "entropy": 0.9082001946866513, "epoch": 0.9265454545454546, "grad_norm": 0.8361312747001648, "learning_rate": 3.1913040345507593e-06, "loss": 0.8926, "mean_token_accuracy": 0.822116008400917, "num_tokens": 48869605.0, "step": 6370 }, { "entropy": 0.9257027067244052, "epoch": 0.928, "grad_norm": 0.33025625348091125, "learning_rate": 3.0709284728544047e-06, "loss": 0.9251, "mean_token_accuracy": 0.818819022923708, "num_tokens": 48944924.0, "step": 6380 }, { "entropy": 0.9270994037389755, "epoch": 0.9294545454545454, "grad_norm": 1.8861573934555054, "learning_rate": 2.9529080499732917e-06, "loss": 0.9123, "mean_token_accuracy": 0.8182081528007984, "num_tokens": 49023270.0, "step": 6390 }, { "entropy": 0.9081657931208611, "epoch": 0.9309090909090909, "grad_norm": 2.497610330581665, "learning_rate": 2.837245632035893e-06, "loss": 0.8942, "mean_token_accuracy": 0.8210309714078903, "num_tokens": 49099764.0, "step": 6400 }, { "entropy": 0.9176856569945813, "epoch": 0.9323636363636364, "grad_norm": 2.121029853820801, "learning_rate": 2.723944027906503e-06, "loss": 0.9129, "mean_token_accuracy": 0.820872713625431, "num_tokens": 49177635.0, "step": 6410 }, { "entropy": 0.9278782814741134, "epoch": 0.9338181818181818, "grad_norm": 0.3344612121582031, "learning_rate": 2.6130059891169797e-06, "loss": 0.9445, "mean_token_accuracy": 0.8178577579557895, "num_tokens": 49257160.0, "step": 6420 }, { "entropy": 0.8968269281089306, "epoch": 0.9352727272727273, "grad_norm": 0.32175830006599426, "learning_rate": 2.504434209799966e-06, "loss": 0.88, "mean_token_accuracy": 0.8237360425293445, "num_tokens": 49333387.0, "step": 6430 }, { "entropy": 0.9058445796370507, "epoch": 0.9367272727272727, "grad_norm": 0.3254484534263611, "learning_rate": 2.3982313266234193e-06, "loss": 0.8815, "mean_token_accuracy": 0.8237637273967267, "num_tokens": 49408486.0, "step": 6440 }, { "entropy": 0.9265412963926792, "epoch": 0.9381818181818182, "grad_norm": 0.331331342458725, "learning_rate": 2.294399918726618e-06, "loss": 0.9117, "mean_token_accuracy": 0.8172571666538715, "num_tokens": 49484948.0, "step": 6450 }, { "entropy": 0.9107875868678093, "epoch": 0.9396363636363636, "grad_norm": 0.45179134607315063, "learning_rate": 2.1929425076575067e-06, "loss": 0.8875, "mean_token_accuracy": 0.8206865198910236, "num_tokens": 49564787.0, "step": 6460 }, { "entropy": 0.9484403192996979, "epoch": 0.9410909090909091, "grad_norm": 0.32299381494522095, "learning_rate": 2.093861557311479e-06, "loss": 0.9599, "mean_token_accuracy": 0.8149694137275219, "num_tokens": 49644908.0, "step": 6470 }, { "entropy": 0.9207295253872871, "epoch": 0.9425454545454546, "grad_norm": 0.3640280067920685, "learning_rate": 1.997159473871544e-06, "loss": 0.9052, "mean_token_accuracy": 0.8190280869603157, "num_tokens": 49723356.0, "step": 6480 }, { "entropy": 0.9006929636001587, "epoch": 0.944, "grad_norm": 0.31023108959198, "learning_rate": 1.9028386057498202e-06, "loss": 0.8671, "mean_token_accuracy": 0.8262156061828136, "num_tokens": 49797029.0, "step": 6490 }, { "entropy": 0.935797930508852, "epoch": 0.9454545454545454, "grad_norm": 0.33681347966194153, "learning_rate": 1.810901243530616e-06, "loss": 0.915, "mean_token_accuracy": 0.8161994099617005, "num_tokens": 49876080.0, "step": 6500 }, { "entropy": 0.9388311050832272, "epoch": 0.9469090909090909, "grad_norm": 2.5916805267333984, "learning_rate": 1.7213496199147198e-06, "loss": 0.924, "mean_token_accuracy": 0.8182121217250824, "num_tokens": 49955757.0, "step": 6510 }, { "entropy": 0.924860893189907, "epoch": 0.9483636363636364, "grad_norm": 0.3176397383213043, "learning_rate": 1.6341859096652162e-06, "loss": 0.9189, "mean_token_accuracy": 0.8182754583656788, "num_tokens": 50034921.0, "step": 6520 }, { "entropy": 0.9215592637658119, "epoch": 0.9498181818181818, "grad_norm": 0.3312931954860687, "learning_rate": 1.5494122295546778e-06, "loss": 0.897, "mean_token_accuracy": 0.8201039671897888, "num_tokens": 50111618.0, "step": 6530 }, { "entropy": 0.9161364257335662, "epoch": 0.9512727272727273, "grad_norm": 0.3159554600715637, "learning_rate": 1.4670306383137089e-06, "loss": 0.8933, "mean_token_accuracy": 0.8197489641606808, "num_tokens": 50188800.0, "step": 6540 }, { "entropy": 0.8958120048046112, "epoch": 0.9527272727272728, "grad_norm": 0.3147352933883667, "learning_rate": 1.38704313658101e-06, "loss": 0.8729, "mean_token_accuracy": 0.8254260867834091, "num_tokens": 50264579.0, "step": 6550 }, { "entropy": 0.903196832537651, "epoch": 0.9541818181818181, "grad_norm": 0.31137725710868835, "learning_rate": 1.3094516668547762e-06, "loss": 0.8806, "mean_token_accuracy": 0.8244303494691849, "num_tokens": 50340059.0, "step": 6560 }, { "entropy": 0.8903951339423657, "epoch": 0.9556363636363636, "grad_norm": 2.127527952194214, "learning_rate": 1.2342581134455008e-06, "loss": 0.8679, "mean_token_accuracy": 0.8251245476305484, "num_tokens": 50415334.0, "step": 6570 }, { "entropy": 0.9220633573830128, "epoch": 0.9570909090909091, "grad_norm": 0.3190872073173523, "learning_rate": 1.161464302430214e-06, "loss": 0.9037, "mean_token_accuracy": 0.8186452768743038, "num_tokens": 50495609.0, "step": 6580 }, { "entropy": 0.9037490114569664, "epoch": 0.9585454545454546, "grad_norm": 0.35063058137893677, "learning_rate": 1.0910720016081627e-06, "loss": 0.8781, "mean_token_accuracy": 0.8231127128005028, "num_tokens": 50571158.0, "step": 6590 }, { "entropy": 0.898887837678194, "epoch": 0.96, "grad_norm": 0.3321762979030609, "learning_rate": 1.0230829204578769e-06, "loss": 0.8647, "mean_token_accuracy": 0.8250281892716884, "num_tokens": 50646197.0, "step": 6600 }, { "entropy": 0.908264522254467, "epoch": 0.9614545454545455, "grad_norm": 0.3521866500377655, "learning_rate": 9.574987100956352e-07, "loss": 0.8764, "mean_token_accuracy": 0.8238757200539112, "num_tokens": 50724334.0, "step": 6610 }, { "entropy": 0.9157738953828811, "epoch": 0.9629090909090909, "grad_norm": 0.3183552026748657, "learning_rate": 8.943209632354054e-07, "loss": 0.8934, "mean_token_accuracy": 0.8203241616487503, "num_tokens": 50803191.0, "step": 6620 }, { "entropy": 0.9221185706555843, "epoch": 0.9643636363636363, "grad_norm": 0.32127588987350464, "learning_rate": 8.335512141500846e-07, "loss": 0.8943, "mean_token_accuracy": 0.8205978877842426, "num_tokens": 50881278.0, "step": 6630 }, { "entropy": 0.91321404799819, "epoch": 0.9658181818181818, "grad_norm": 0.3270174264907837, "learning_rate": 7.751909386343242e-07, "loss": 0.8821, "mean_token_accuracy": 0.8214927159249783, "num_tokens": 50956132.0, "step": 6640 }, { "entropy": 0.9102289408445359, "epoch": 0.9672727272727273, "grad_norm": 1.5056520700454712, "learning_rate": 7.192415539686665e-07, "loss": 0.891, "mean_token_accuracy": 0.8208358325064182, "num_tokens": 51034586.0, "step": 6650 }, { "entropy": 0.8969598315656185, "epoch": 0.9687272727272728, "grad_norm": 0.30618613958358765, "learning_rate": 6.65704418885111e-07, "loss": 0.8673, "mean_token_accuracy": 0.8258568048477173, "num_tokens": 51112025.0, "step": 6660 }, { "entropy": 0.9234667181968689, "epoch": 0.9701818181818181, "grad_norm": 0.3337618112564087, "learning_rate": 6.145808335341243e-07, "loss": 0.8963, "mean_token_accuracy": 0.8207845896482467, "num_tokens": 51189368.0, "step": 6670 }, { "entropy": 0.9242277570068836, "epoch": 0.9716363636363636, "grad_norm": 0.32344672083854675, "learning_rate": 5.658720394530478e-07, "loss": 0.8976, "mean_token_accuracy": 0.8184162557125092, "num_tokens": 51268418.0, "step": 6680 }, { "entropy": 0.9331931956112385, "epoch": 0.9730909090909091, "grad_norm": 0.36297062039375305, "learning_rate": 5.195792195359924e-07, "loss": 0.9198, "mean_token_accuracy": 0.8186567753553391, "num_tokens": 51347561.0, "step": 6690 }, { "entropy": 0.9222750753164292, "epoch": 0.9745454545454545, "grad_norm": 0.3219527006149292, "learning_rate": 4.7570349800507546e-07, "loss": 0.8938, "mean_token_accuracy": 0.8191801868379116, "num_tokens": 51425804.0, "step": 6700 }, { "entropy": 0.904650616645813, "epoch": 0.976, "grad_norm": 0.3058840334415436, "learning_rate": 4.342459403831242e-07, "loss": 0.8824, "mean_token_accuracy": 0.8226540274918079, "num_tokens": 51503722.0, "step": 6710 }, { "entropy": 0.9009366378188133, "epoch": 0.9774545454545455, "grad_norm": 0.32405465841293335, "learning_rate": 3.952075534678079e-07, "loss": 0.8749, "mean_token_accuracy": 0.8230279020965099, "num_tokens": 51578996.0, "step": 6720 }, { "entropy": 0.9061621010303498, "epoch": 0.978909090909091, "grad_norm": 2.5726563930511475, "learning_rate": 3.585892853071928e-07, "loss": 0.8912, "mean_token_accuracy": 0.8214048929512501, "num_tokens": 51657221.0, "step": 6730 }, { "entropy": 0.9052648693323135, "epoch": 0.9803636363636363, "grad_norm": 0.2956988513469696, "learning_rate": 3.2439202517668286e-07, "loss": 0.8914, "mean_token_accuracy": 0.8212430521845817, "num_tokens": 51735276.0, "step": 6740 }, { "entropy": 0.9187554679811001, "epoch": 0.9818181818181818, "grad_norm": 0.3320491909980774, "learning_rate": 2.926166035574923e-07, "loss": 0.9299, "mean_token_accuracy": 0.8186180919408799, "num_tokens": 51813941.0, "step": 6750 }, { "entropy": 0.9081330545246601, "epoch": 0.9832727272727273, "grad_norm": 0.30943775177001953, "learning_rate": 2.632637921163831e-07, "loss": 0.8868, "mean_token_accuracy": 0.8217815391719341, "num_tokens": 51890812.0, "step": 6760 }, { "entropy": 0.8877025507390499, "epoch": 0.9847272727272727, "grad_norm": 0.3373887240886688, "learning_rate": 2.3633430368702262e-07, "loss": 0.855, "mean_token_accuracy": 0.8284515894949436, "num_tokens": 51962819.0, "step": 6770 }, { "entropy": 0.9245131060481071, "epoch": 0.9861818181818182, "grad_norm": 1.2123104333877563, "learning_rate": 2.118287922526059e-07, "loss": 0.8985, "mean_token_accuracy": 0.8212319493293763, "num_tokens": 52041518.0, "step": 6780 }, { "entropy": 0.9151236355304718, "epoch": 0.9876363636363636, "grad_norm": 0.3329769968986511, "learning_rate": 1.8974785292999898e-07, "loss": 0.8917, "mean_token_accuracy": 0.8217348761856555, "num_tokens": 52120146.0, "step": 6790 }, { "entropy": 0.9201492570340634, "epoch": 0.9890909090909091, "grad_norm": 0.334018349647522, "learning_rate": 1.7009202195529057e-07, "loss": 0.9226, "mean_token_accuracy": 0.8178925760090351, "num_tokens": 52198078.0, "step": 6800 }, { "entropy": 0.9055890217423439, "epoch": 0.9905454545454545, "grad_norm": 0.8450275659561157, "learning_rate": 1.5286177667074262e-07, "loss": 0.8797, "mean_token_accuracy": 0.8226368710398674, "num_tokens": 52273502.0, "step": 6810 }, { "entropy": 0.9188882060348987, "epoch": 0.992, "grad_norm": 0.3331072926521301, "learning_rate": 1.3805753551323864e-07, "loss": 0.9063, "mean_token_accuracy": 0.8196715794503688, "num_tokens": 52350145.0, "step": 6820 }, { "entropy": 0.9134249776601792, "epoch": 0.9934545454545455, "grad_norm": 0.3241958022117615, "learning_rate": 1.2567965800407473e-07, "loss": 0.8883, "mean_token_accuracy": 0.8222455978393555, "num_tokens": 52429758.0, "step": 6830 }, { "entropy": 0.8976367473602295, "epoch": 0.9949090909090909, "grad_norm": 1.5700055360794067, "learning_rate": 1.157284447402819e-07, "loss": 0.8828, "mean_token_accuracy": 0.8237587973475456, "num_tokens": 52504858.0, "step": 6840 }, { "entropy": 0.9396997675299644, "epoch": 0.9963636363636363, "grad_norm": 0.32852768898010254, "learning_rate": 1.0820413738729128e-07, "loss": 0.9255, "mean_token_accuracy": 0.8178542837500572, "num_tokens": 52582462.0, "step": 6850 }, { "entropy": 0.904629698395729, "epoch": 0.9978181818181818, "grad_norm": 0.6703066229820251, "learning_rate": 1.031069186730529e-07, "loss": 0.8881, "mean_token_accuracy": 0.8228366106748581, "num_tokens": 52658068.0, "step": 6860 }, { "entropy": 0.9132826693356038, "epoch": 0.9992727272727273, "grad_norm": 0.3042033910751343, "learning_rate": 1.0043691238364123e-07, "loss": 0.8982, "mean_token_accuracy": 0.8215601086616516, "num_tokens": 52733067.0, "step": 6870 } ], "logging_steps": 10, "max_steps": 6875, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.34572363346346e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }