[ { "loss": 4.2828514099121096, "grad_norm": 3.3195607662200928, "learning_rate": 7.82608695652174e-05, "entropy": 1.1838731363415718, "mean_token_accuracy": 0.452268467284739, "num_tokens": 24645.0, "epoch": 0.13245033112582782, "step": 10 }, { "eval_loss": 0.5712648034095764, "eval_runtime": 8.7607, "eval_samples_per_second": 17.122, "eval_steps_per_second": 4.338, "eval_entropy": 0.5471524494258981, "eval_mean_token_accuracy": 0.8050595286645388, "eval_num_tokens": 24645.0, "epoch": 0.13245033112582782, "step": 10 }, { "loss": 0.46926422119140626, "grad_norm": 3.0499935150146484, "learning_rate": 0.00016521739130434784, "entropy": 0.4832126975059509, "mean_token_accuracy": 0.8076777458190918, "num_tokens": 48985.0, "epoch": 0.26490066225165565, "step": 20 }, { "eval_loss": 0.5358471870422363, "eval_runtime": 8.8684, "eval_samples_per_second": 16.914, "eval_steps_per_second": 4.285, "eval_entropy": 0.4200292041427211, "eval_mean_token_accuracy": 0.7469924860878995, "eval_num_tokens": 48985.0, "epoch": 0.26490066225165565, "step": 20 }, { "loss": 0.39472386837005613, "grad_norm": 2.067092180252075, "learning_rate": 0.00019414634146341464, "entropy": 0.3605545647442341, "mean_token_accuracy": 0.8380664870142936, "num_tokens": 73226.0, "epoch": 0.3973509933774834, "step": 30 }, { "eval_loss": 0.5321611166000366, "eval_runtime": 8.8949, "eval_samples_per_second": 16.864, "eval_steps_per_second": 4.272, "eval_entropy": 0.36939919249791847, "eval_mean_token_accuracy": 0.8029448617445795, "eval_num_tokens": 73226.0, "epoch": 0.3973509933774834, "step": 30 }, { "loss": 0.39537787437438965, "grad_norm": 1.270966649055481, "learning_rate": 0.00018439024390243903, "entropy": 0.3851592864841223, "mean_token_accuracy": 0.8292971581220627, "num_tokens": 97170.0, "epoch": 0.5298013245033113, "step": 40 }, { "eval_loss": 0.512241542339325, "eval_runtime": 8.856, "eval_samples_per_second": 16.938, "eval_steps_per_second": 4.291, "eval_entropy": 0.3763781021300115, "eval_mean_token_accuracy": 0.7811560207291653, "eval_num_tokens": 97170.0, "epoch": 0.5298013245033113, "step": 40 }, { "loss": 0.3449979066848755, "grad_norm": 1.178625226020813, "learning_rate": 0.00017463414634146342, "entropy": 0.3603811550885439, "mean_token_accuracy": 0.8657324358820915, "num_tokens": 121386.0, "epoch": 0.6622516556291391, "step": 50 }, { "eval_loss": 0.6070794463157654, "eval_runtime": 8.9125, "eval_samples_per_second": 16.83, "eval_steps_per_second": 4.264, "eval_entropy": 0.36585210116678163, "eval_mean_token_accuracy": 0.7500313332206324, "eval_num_tokens": 121386.0, "epoch": 0.6622516556291391, "step": 50 }, { "loss": 0.30911884307861326, "grad_norm": 2.8266186714172363, "learning_rate": 0.00016487804878048782, "entropy": 0.2615261286497116, "mean_token_accuracy": 0.8826999247074128, "num_tokens": 145580.0, "epoch": 0.7947019867549668, "step": 60 }, { "eval_loss": 0.7182475924491882, "eval_runtime": 8.8882, "eval_samples_per_second": 16.876, "eval_steps_per_second": 4.275, "eval_entropy": 0.2628652969081151, "eval_mean_token_accuracy": 0.7899749420191112, "eval_num_tokens": 145580.0, "epoch": 0.7947019867549668, "step": 60 }, { "loss": 0.24180982112884522, "grad_norm": 1.6042029857635498, "learning_rate": 0.0001551219512195122, "entropy": 0.2673916194587946, "mean_token_accuracy": 0.911859568953514, "num_tokens": 170643.0, "epoch": 0.9271523178807947, "step": 70 }, { "eval_loss": 0.821165919303894, "eval_runtime": 8.8971, "eval_samples_per_second": 16.859, "eval_steps_per_second": 4.271, "eval_entropy": 0.27867767418195544, "eval_mean_token_accuracy": 0.7433740669175198, "eval_num_tokens": 170643.0, "epoch": 0.9271523178807947, "step": 70 }, { "loss": 0.22081174850463867, "grad_norm": 2.7884373664855957, "learning_rate": 0.0001453658536585366, "entropy": 0.2026200779762707, "mean_token_accuracy": 0.9230157701592696, "num_tokens": 193746.0, "epoch": 1.0529801324503312, "step": 80 }, { "eval_loss": 0.8150429725646973, "eval_runtime": 8.9086, "eval_samples_per_second": 16.838, "eval_steps_per_second": 4.266, "eval_entropy": 0.22414806843000024, "eval_mean_token_accuracy": 0.8047775735980586, "eval_num_tokens": 193746.0, "epoch": 1.0529801324503312, "step": 80 }, { "loss": 0.14040154218673706, "grad_norm": 1.3541489839553833, "learning_rate": 0.000135609756097561, "entropy": 0.16504043247550726, "mean_token_accuracy": 0.9462000757455826, "num_tokens": 218576.0, "epoch": 1.185430463576159, "step": 90 }, { "eval_loss": 0.8339773416519165, "eval_runtime": 8.973, "eval_samples_per_second": 16.717, "eval_steps_per_second": 4.235, "eval_entropy": 0.2065272086060998, "eval_mean_token_accuracy": 0.7746240653489765, "eval_num_tokens": 218576.0, "epoch": 1.185430463576159, "step": 90 }, { "loss": 0.12467809915542602, "grad_norm": 4.511893272399902, "learning_rate": 0.00012585365853658536, "entropy": 0.10107915503322147, "mean_token_accuracy": 0.9587799295783043, "num_tokens": 243344.0, "epoch": 1.3178807947019868, "step": 100 }, { "eval_loss": 0.7112035155296326, "eval_runtime": 8.9282, "eval_samples_per_second": 16.801, "eval_steps_per_second": 4.256, "eval_entropy": 0.15474749381016745, "eval_mean_token_accuracy": 0.8157424864016081, "eval_num_tokens": 243344.0, "epoch": 1.3178807947019868, "step": 100 }, { "loss": 0.12197786569595337, "grad_norm": 1.6361427307128906, "learning_rate": 0.00011609756097560975, "entropy": 0.07562960358336568, "mean_token_accuracy": 0.9517370820045471, "num_tokens": 267786.0, "epoch": 1.4503311258278146, "step": 110 }, { "eval_loss": 1.0470056533813477, "eval_runtime": 8.9724, "eval_samples_per_second": 16.718, "eval_steps_per_second": 4.235, "eval_entropy": 0.14818870221681305, "eval_mean_token_accuracy": 0.7478383512873399, "eval_num_tokens": 267786.0, "epoch": 1.4503311258278146, "step": 110 }, { "loss": 0.10809319019317627, "grad_norm": 1.6775206327438354, "learning_rate": 0.00010634146341463416, "entropy": 0.08924289270071313, "mean_token_accuracy": 0.9604727029800415, "num_tokens": 292317.0, "epoch": 1.5827814569536423, "step": 120 }, { "eval_loss": 1.0492334365844727, "eval_runtime": 8.8734, "eval_samples_per_second": 16.904, "eval_steps_per_second": 4.282, "eval_entropy": 0.14410611607232376, "eval_mean_token_accuracy": 0.8007205567861858, "eval_num_tokens": 292317.0, "epoch": 1.5827814569536423, "step": 120 }, { "loss": 0.03908039927482605, "grad_norm": 2.2686848640441895, "learning_rate": 9.658536585365854e-05, "entropy": 0.06353283888893202, "mean_token_accuracy": 0.9815119966864586, "num_tokens": 316521.0, "epoch": 1.7152317880794703, "step": 130 }, { "eval_loss": 1.4305915832519531, "eval_runtime": 8.8602, "eval_samples_per_second": 16.93, "eval_steps_per_second": 4.289, "eval_entropy": 0.0935905459689246, "eval_mean_token_accuracy": 0.7892387258379083, "eval_num_tokens": 316521.0, "epoch": 1.7152317880794703, "step": 130 }, { "loss": 0.04100652039051056, "grad_norm": 5.218770980834961, "learning_rate": 8.682926829268293e-05, "entropy": 0.03381892999459524, "mean_token_accuracy": 0.984375512599945, "num_tokens": 340919.0, "epoch": 1.847682119205298, "step": 140 }, { "eval_loss": 1.5555816888809204, "eval_runtime": 8.7739, "eval_samples_per_second": 17.096, "eval_steps_per_second": 4.331, "eval_entropy": 0.07794101885673099, "eval_mean_token_accuracy": 0.8050282001495361, "eval_num_tokens": 340919.0, "epoch": 1.847682119205298, "step": 140 }, { "loss": 0.03830587565898895, "grad_norm": 0.13190802931785583, "learning_rate": 7.707317073170732e-05, "entropy": 0.026670162624213845, "mean_token_accuracy": 0.9837620735168457, "num_tokens": 364991.0, "epoch": 1.980132450331126, "step": 150 }, { "eval_loss": 1.2507771253585815, "eval_runtime": 8.8746, "eval_samples_per_second": 16.902, "eval_steps_per_second": 4.282, "eval_entropy": 0.0817602070930757, "eval_mean_token_accuracy": 0.7987468728893682, "eval_num_tokens": 364991.0, "epoch": 1.980132450331126, "step": 150 }, { "loss": 0.07177287340164185, "grad_norm": 2.2161507606506348, "learning_rate": 6.731707317073171e-05, "entropy": 0.01958650479240245, "mean_token_accuracy": 0.9884510479475322, "num_tokens": 387642.0, "epoch": 2.1059602649006623, "step": 160 }, { "eval_loss": 1.3437883853912354, "eval_runtime": 8.8478, "eval_samples_per_second": 16.953, "eval_steps_per_second": 4.295, "eval_entropy": 0.06764962662648606, "eval_mean_token_accuracy": 0.7787750677058571, "eval_num_tokens": 387642.0, "epoch": 2.1059602649006623, "step": 160 }, { "loss": 0.009113987535238266, "grad_norm": 0.039817001670598984, "learning_rate": 5.756097560975609e-05, "entropy": 0.01661088205728447, "mean_token_accuracy": 0.9937208637595176, "num_tokens": 412538.0, "epoch": 2.23841059602649, "step": 170 }, { "eval_loss": 1.5150843858718872, "eval_runtime": 8.7479, "eval_samples_per_second": 17.147, "eval_steps_per_second": 4.344, "eval_entropy": 0.06736165528357226, "eval_mean_token_accuracy": 0.7647556442963449, "eval_num_tokens": 412538.0, "epoch": 2.23841059602649, "step": 170 }, { "loss": 0.003525285795331001, "grad_norm": 0.00853405799716711, "learning_rate": 4.7804878048780485e-05, "entropy": 0.00830267872515833, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 437055.0, "epoch": 2.370860927152318, "step": 180 }, { "eval_loss": 1.644209384918213, "eval_runtime": 8.7784, "eval_samples_per_second": 17.087, "eval_steps_per_second": 4.329, "eval_entropy": 0.06734515197259545, "eval_mean_token_accuracy": 0.7691416097314734, "eval_num_tokens": 437055.0, "epoch": 2.370860927152318, "step": 180 }, { "loss": 0.001157384179532528, "grad_norm": 0.09711030125617981, "learning_rate": 3.804878048780488e-05, "entropy": 0.004432732032000786, "mean_token_accuracy": 1.0, "num_tokens": 461493.0, "epoch": 2.5033112582781456, "step": 190 }, { "eval_loss": 1.7609623670578003, "eval_runtime": 8.7515, "eval_samples_per_second": 17.14, "eval_steps_per_second": 4.342, "eval_entropy": 0.06280427154553381, "eval_mean_token_accuracy": 0.7669486277981808, "eval_num_tokens": 461493.0, "epoch": 2.5033112582781456, "step": 190 }, { "loss": 0.0030027683824300766, "grad_norm": 0.012400347739458084, "learning_rate": 2.8292682926829267e-05, "entropy": 0.004392967079911614, "mean_token_accuracy": 0.997916667163372, "num_tokens": 485528.0, "epoch": 2.6357615894039736, "step": 200 }, { "eval_loss": 1.8287278413772583, "eval_runtime": 8.7245, "eval_samples_per_second": 17.193, "eval_steps_per_second": 4.356, "eval_entropy": 0.06022026199015703, "eval_mean_token_accuracy": 0.7735275751666019, "eval_num_tokens": 485528.0, "epoch": 2.6357615894039736, "step": 200 }, { "loss": 0.0011992882937192917, "grad_norm": 0.004404825158417225, "learning_rate": 1.853658536585366e-05, "entropy": 0.0030429765494773163, "mean_token_accuracy": 1.0, "num_tokens": 510081.0, "epoch": 2.7682119205298013, "step": 210 }, { "eval_loss": 1.8526947498321533, "eval_runtime": 8.6297, "eval_samples_per_second": 17.382, "eval_steps_per_second": 4.403, "eval_entropy": 0.057951420073789596, "eval_mean_token_accuracy": 0.7669486277981808, "eval_num_tokens": 510081.0, "epoch": 2.7682119205298013, "step": 210 }, { "loss": 0.007075458765029907, "grad_norm": 0.029240623116493225, "learning_rate": 8.780487804878048e-06, "entropy": 0.006888014055220992, "mean_token_accuracy": 0.9928314402699471, "num_tokens": 534422.0, "epoch": 2.9006622516556293, "step": 220 }, { "eval_loss": 1.8728781938552856, "eval_runtime": 8.6887, "eval_samples_per_second": 17.264, "eval_steps_per_second": 4.374, "eval_entropy": 0.05773907397892081, "eval_mean_token_accuracy": 0.7735275751666019, "eval_num_tokens": 534422.0, "epoch": 2.9006622516556293, "step": 220 }, { "eval_loss": 1.882822871208191, "eval_runtime": 8.6056, "eval_samples_per_second": 17.43, "eval_steps_per_second": 4.416, "eval_entropy": 0.05690596842377042, "eval_mean_token_accuracy": 0.7669486277981808, "eval_num_tokens": 552555.0, "epoch": 3.0, "step": 228 }, { "train_runtime": 1087.8226, "train_samples_per_second": 3.326, "train_steps_per_second": 0.21, "total_flos": 3.178031783683891e+16, "train_loss": 0.3232832907233387, "epoch": 3.0, "step": 228 } ]