{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 108, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.7206335216760635, "epoch": 0.027777777777777776, "grad_norm": 12.239052772521973, "learning_rate": 0.0, "loss": 2.2445, "mean_token_accuracy": 0.5234357602894306, "num_tokens": 3149.0, "step": 1 }, { "entropy": 1.7157433032989502, "epoch": 0.05555555555555555, "grad_norm": 12.409416198730469, "learning_rate": 2.0000000000000002e-07, "loss": 2.2591, "mean_token_accuracy": 0.5426237694919109, "num_tokens": 6352.0, "step": 2 }, { "entropy": 1.7281817346811295, "epoch": 0.08333333333333333, "grad_norm": 12.136215209960938, "learning_rate": 4.0000000000000003e-07, "loss": 2.2025, "mean_token_accuracy": 0.5330252423882484, "num_tokens": 9480.0, "step": 3 }, { "entropy": 1.7453971356153488, "epoch": 0.1111111111111111, "grad_norm": 12.494486808776855, "learning_rate": 6.000000000000001e-07, "loss": 2.2858, "mean_token_accuracy": 0.5153909176588058, "num_tokens": 12696.0, "step": 4 }, { "entropy": 1.7059053778648376, "epoch": 0.1388888888888889, "grad_norm": 12.915605545043945, "learning_rate": 8.000000000000001e-07, "loss": 2.2393, "mean_token_accuracy": 0.5214959308505058, "num_tokens": 15845.0, "step": 5 }, { "entropy": 1.7419584095478058, "epoch": 0.16666666666666666, "grad_norm": 11.967181205749512, "learning_rate": 1.0000000000000002e-06, "loss": 2.2269, "mean_token_accuracy": 0.5283601805567741, "num_tokens": 18953.0, "step": 6 }, { "entropy": 1.7141934782266617, "epoch": 0.19444444444444445, "grad_norm": 11.107477188110352, "learning_rate": 1.2000000000000002e-06, "loss": 2.1667, "mean_token_accuracy": 0.5402880758047104, "num_tokens": 22106.0, "step": 7 }, { "entropy": 1.7215740531682968, "epoch": 0.2222222222222222, "grad_norm": 10.586934089660645, "learning_rate": 1.4000000000000001e-06, "loss": 2.1178, "mean_token_accuracy": 0.558077298104763, "num_tokens": 25320.0, "step": 8 }, { "entropy": 1.7224711626768112, "epoch": 0.25, "grad_norm": 10.22936725616455, "learning_rate": 1.6000000000000001e-06, "loss": 1.9993, "mean_token_accuracy": 0.5679031684994698, "num_tokens": 28514.0, "step": 9 }, { "entropy": 1.7291602343320847, "epoch": 0.2777777777777778, "grad_norm": 10.116068840026855, "learning_rate": 1.8000000000000001e-06, "loss": 2.002, "mean_token_accuracy": 0.5621381998062134, "num_tokens": 31645.0, "step": 10 }, { "entropy": 1.823133796453476, "epoch": 0.3055555555555556, "grad_norm": 8.050676345825195, "learning_rate": 2.0000000000000003e-06, "loss": 1.8115, "mean_token_accuracy": 0.6078527420759201, "num_tokens": 34837.0, "step": 11 }, { "entropy": 1.8218258619308472, "epoch": 0.3333333333333333, "grad_norm": 8.03921127319336, "learning_rate": 2.2e-06, "loss": 1.7858, "mean_token_accuracy": 0.5981088206171989, "num_tokens": 37987.0, "step": 12 }, { "entropy": 1.7872179597616196, "epoch": 0.3611111111111111, "grad_norm": 7.6152801513671875, "learning_rate": 2.4000000000000003e-06, "loss": 1.6719, "mean_token_accuracy": 0.6255820393562317, "num_tokens": 41170.0, "step": 13 }, { "entropy": 1.6922450810670853, "epoch": 0.3888888888888889, "grad_norm": 6.331522464752197, "learning_rate": 2.6e-06, "loss": 1.4919, "mean_token_accuracy": 0.6602419465780258, "num_tokens": 44250.0, "step": 14 }, { "entropy": 1.6007178127765656, "epoch": 0.4166666666666667, "grad_norm": 6.234885215759277, "learning_rate": 2.8000000000000003e-06, "loss": 1.3792, "mean_token_accuracy": 0.6762521862983704, "num_tokens": 47446.0, "step": 15 }, { "entropy": 1.5817099809646606, "epoch": 0.4444444444444444, "grad_norm": 6.2869696617126465, "learning_rate": 3e-06, "loss": 1.3805, "mean_token_accuracy": 0.6645312234759331, "num_tokens": 50759.0, "step": 16 }, { "entropy": 1.412723958492279, "epoch": 0.4722222222222222, "grad_norm": 5.045506000518799, "learning_rate": 3.2000000000000003e-06, "loss": 1.2176, "mean_token_accuracy": 0.7046914845705032, "num_tokens": 53926.0, "step": 17 }, { "entropy": 1.3380708545446396, "epoch": 0.5, "grad_norm": 4.068710803985596, "learning_rate": 3.4000000000000005e-06, "loss": 1.2425, "mean_token_accuracy": 0.6927981376647949, "num_tokens": 57077.0, "step": 18 }, { "entropy": 1.2170532494783401, "epoch": 0.5277777777777778, "grad_norm": 3.499069929122925, "learning_rate": 3.6000000000000003e-06, "loss": 1.189, "mean_token_accuracy": 0.705949991941452, "num_tokens": 60181.0, "step": 19 }, { "entropy": 1.2205703258514404, "epoch": 0.5555555555555556, "grad_norm": 22.419281005859375, "learning_rate": 3.8000000000000005e-06, "loss": 1.2191, "mean_token_accuracy": 0.6920858323574066, "num_tokens": 63319.0, "step": 20 }, { "entropy": 1.132231056690216, "epoch": 0.5833333333333334, "grad_norm": 3.432077646255493, "learning_rate": 4.000000000000001e-06, "loss": 1.1323, "mean_token_accuracy": 0.7145579382777214, "num_tokens": 66437.0, "step": 21 }, { "entropy": 1.1085182875394821, "epoch": 0.6111111111111112, "grad_norm": 3.328181505203247, "learning_rate": 4.2000000000000004e-06, "loss": 1.118, "mean_token_accuracy": 0.7220780923962593, "num_tokens": 69581.0, "step": 22 }, { "entropy": 1.1160272061824799, "epoch": 0.6388888888888888, "grad_norm": 2.7953662872314453, "learning_rate": 4.4e-06, "loss": 1.062, "mean_token_accuracy": 0.7369436100125313, "num_tokens": 72724.0, "step": 23 }, { "entropy": 1.1081153899431229, "epoch": 0.6666666666666666, "grad_norm": 2.8708362579345703, "learning_rate": 4.600000000000001e-06, "loss": 1.0555, "mean_token_accuracy": 0.7323780283331871, "num_tokens": 75861.0, "step": 24 }, { "entropy": 1.0733779296278954, "epoch": 0.6944444444444444, "grad_norm": 2.657761335372925, "learning_rate": 4.800000000000001e-06, "loss": 1.0127, "mean_token_accuracy": 0.7391822040081024, "num_tokens": 79168.0, "step": 25 }, { "entropy": 1.0697464495897293, "epoch": 0.7222222222222222, "grad_norm": 2.6338393688201904, "learning_rate": 5e-06, "loss": 1.0236, "mean_token_accuracy": 0.725149542093277, "num_tokens": 82378.0, "step": 26 }, { "entropy": 1.0295503363013268, "epoch": 0.75, "grad_norm": 2.6113545894622803, "learning_rate": 5.2e-06, "loss": 1.0343, "mean_token_accuracy": 0.7344670742750168, "num_tokens": 85511.0, "step": 27 }, { "entropy": 0.9814292415976524, "epoch": 0.7777777777777778, "grad_norm": 2.581925868988037, "learning_rate": 5.400000000000001e-06, "loss": 0.9725, "mean_token_accuracy": 0.7381312251091003, "num_tokens": 88660.0, "step": 28 }, { "entropy": 1.007811225950718, "epoch": 0.8055555555555556, "grad_norm": 2.579724073410034, "learning_rate": 5.600000000000001e-06, "loss": 1.0091, "mean_token_accuracy": 0.7310391962528229, "num_tokens": 91875.0, "step": 29 }, { "entropy": 0.9555631652474403, "epoch": 0.8333333333333334, "grad_norm": 2.651214599609375, "learning_rate": 5.8e-06, "loss": 0.9463, "mean_token_accuracy": 0.749499000608921, "num_tokens": 95039.0, "step": 30 }, { "entropy": 1.0038460940122604, "epoch": 0.8611111111111112, "grad_norm": 2.505073070526123, "learning_rate": 6e-06, "loss": 1.0151, "mean_token_accuracy": 0.7300070971250534, "num_tokens": 98259.0, "step": 31 }, { "entropy": 1.0190542414784431, "epoch": 0.8888888888888888, "grad_norm": 2.6049623489379883, "learning_rate": 6.200000000000001e-06, "loss": 0.9595, "mean_token_accuracy": 0.7381655722856522, "num_tokens": 101389.0, "step": 32 }, { "entropy": 1.0043294206261635, "epoch": 0.9166666666666666, "grad_norm": 2.5841352939605713, "learning_rate": 6.4000000000000006e-06, "loss": 0.9548, "mean_token_accuracy": 0.7301696166396141, "num_tokens": 104591.0, "step": 33 }, { "entropy": 1.0013394877314568, "epoch": 0.9444444444444444, "grad_norm": 2.4673030376434326, "learning_rate": 6.600000000000001e-06, "loss": 0.9206, "mean_token_accuracy": 0.7463522851467133, "num_tokens": 107798.0, "step": 34 }, { "entropy": 0.9427972882986069, "epoch": 0.9722222222222222, "grad_norm": 2.594034433364868, "learning_rate": 6.800000000000001e-06, "loss": 0.8944, "mean_token_accuracy": 0.7576184198260307, "num_tokens": 110869.0, "step": 35 }, { "entropy": 0.9821532517671585, "epoch": 1.0, "grad_norm": 2.5436978340148926, "learning_rate": 7e-06, "loss": 0.9404, "mean_token_accuracy": 0.7452764138579369, "num_tokens": 112970.0, "step": 36 }, { "entropy": 0.948033794760704, "epoch": 1.0277777777777777, "grad_norm": 2.457702159881592, "learning_rate": 7.2000000000000005e-06, "loss": 0.818, "mean_token_accuracy": 0.7714106887578964, "num_tokens": 116138.0, "step": 37 }, { "entropy": 0.849656954407692, "epoch": 1.0555555555555556, "grad_norm": 2.256528377532959, "learning_rate": 7.4e-06, "loss": 0.7358, "mean_token_accuracy": 0.797737255692482, "num_tokens": 119378.0, "step": 38 }, { "entropy": 0.8578782826662064, "epoch": 1.0833333333333333, "grad_norm": 2.557046413421631, "learning_rate": 7.600000000000001e-06, "loss": 0.8029, "mean_token_accuracy": 0.7780278623104095, "num_tokens": 122490.0, "step": 39 }, { "entropy": 0.769713781774044, "epoch": 1.1111111111111112, "grad_norm": 2.5916965007781982, "learning_rate": 7.800000000000002e-06, "loss": 0.7244, "mean_token_accuracy": 0.7930369228124619, "num_tokens": 125646.0, "step": 40 }, { "entropy": 0.7162968814373016, "epoch": 1.1388888888888888, "grad_norm": 2.44321608543396, "learning_rate": 8.000000000000001e-06, "loss": 0.6747, "mean_token_accuracy": 0.8100233748555183, "num_tokens": 128738.0, "step": 41 }, { "entropy": 0.7322863712906837, "epoch": 1.1666666666666667, "grad_norm": 2.5348217487335205, "learning_rate": 8.2e-06, "loss": 0.7154, "mean_token_accuracy": 0.7932721599936485, "num_tokens": 131900.0, "step": 42 }, { "entropy": 0.7626946941018105, "epoch": 1.1944444444444444, "grad_norm": 2.7120513916015625, "learning_rate": 8.400000000000001e-06, "loss": 0.7576, "mean_token_accuracy": 0.7777007296681404, "num_tokens": 135078.0, "step": 43 }, { "entropy": 0.8006442189216614, "epoch": 1.2222222222222223, "grad_norm": 2.7017619609832764, "learning_rate": 8.6e-06, "loss": 0.7101, "mean_token_accuracy": 0.7920609414577484, "num_tokens": 138176.0, "step": 44 }, { "entropy": 0.7950561568140984, "epoch": 1.25, "grad_norm": 2.666325807571411, "learning_rate": 8.8e-06, "loss": 0.7427, "mean_token_accuracy": 0.8027379214763641, "num_tokens": 141349.0, "step": 45 }, { "entropy": 0.793344184756279, "epoch": 1.2777777777777777, "grad_norm": 2.776358127593994, "learning_rate": 9e-06, "loss": 0.6878, "mean_token_accuracy": 0.8111961334943771, "num_tokens": 144461.0, "step": 46 }, { "entropy": 0.7685084566473961, "epoch": 1.3055555555555556, "grad_norm": 2.5511598587036133, "learning_rate": 9.200000000000002e-06, "loss": 0.6777, "mean_token_accuracy": 0.8126928880810738, "num_tokens": 147642.0, "step": 47 }, { "entropy": 0.796379953622818, "epoch": 1.3333333333333333, "grad_norm": 2.5649895668029785, "learning_rate": 9.4e-06, "loss": 0.7652, "mean_token_accuracy": 0.7886124402284622, "num_tokens": 150894.0, "step": 48 }, { "entropy": 0.7704698145389557, "epoch": 1.3611111111111112, "grad_norm": 2.559164047241211, "learning_rate": 9.600000000000001e-06, "loss": 0.7427, "mean_token_accuracy": 0.7878011912107468, "num_tokens": 154057.0, "step": 49 }, { "entropy": 0.6923560723662376, "epoch": 1.3888888888888888, "grad_norm": 2.321601390838623, "learning_rate": 9.800000000000001e-06, "loss": 0.7077, "mean_token_accuracy": 0.804372176527977, "num_tokens": 157317.0, "step": 50 }, { "entropy": 0.7212042436003685, "epoch": 1.4166666666666667, "grad_norm": 2.2511632442474365, "learning_rate": 1e-05, "loss": 0.6909, "mean_token_accuracy": 0.799708366394043, "num_tokens": 160493.0, "step": 51 }, { "entropy": 0.6932398602366447, "epoch": 1.4444444444444444, "grad_norm": 2.192110776901245, "learning_rate": 9.99266706925562e-06, "loss": 0.6846, "mean_token_accuracy": 0.7934979721903801, "num_tokens": 163690.0, "step": 52 }, { "entropy": 0.7240612953901291, "epoch": 1.4722222222222223, "grad_norm": 2.0434861183166504, "learning_rate": 9.970689785771798e-06, "loss": 0.6793, "mean_token_accuracy": 0.8052623942494392, "num_tokens": 166925.0, "step": 53 }, { "entropy": 0.7377813756465912, "epoch": 1.5, "grad_norm": 1.978843092918396, "learning_rate": 9.934132612707631e-06, "loss": 0.6852, "mean_token_accuracy": 0.8033023402094841, "num_tokens": 170012.0, "step": 54 }, { "entropy": 0.706544779241085, "epoch": 1.5277777777777777, "grad_norm": 1.989449381828308, "learning_rate": 9.883102778550434e-06, "loss": 0.65, "mean_token_accuracy": 0.8123279586434364, "num_tokens": 173174.0, "step": 55 }, { "entropy": 0.689531534910202, "epoch": 1.5555555555555556, "grad_norm": 2.1900088787078857, "learning_rate": 9.817749962596115e-06, "loss": 0.7314, "mean_token_accuracy": 0.7898781001567841, "num_tokens": 176217.0, "step": 56 }, { "entropy": 0.7628979608416557, "epoch": 1.5833333333333335, "grad_norm": 2.2131078243255615, "learning_rate": 9.738265855914014e-06, "loss": 0.7844, "mean_token_accuracy": 0.7743321061134338, "num_tokens": 179345.0, "step": 57 }, { "entropy": 0.7197903394699097, "epoch": 1.6111111111111112, "grad_norm": 2.043686628341675, "learning_rate": 9.644883599083959e-06, "loss": 0.7147, "mean_token_accuracy": 0.7910747677087784, "num_tokens": 182534.0, "step": 58 }, { "entropy": 0.7264939621090889, "epoch": 1.6388888888888888, "grad_norm": 1.9586451053619385, "learning_rate": 9.537877098354787e-06, "loss": 0.6769, "mean_token_accuracy": 0.8056130409240723, "num_tokens": 185775.0, "step": 59 }, { "entropy": 0.7570189833641052, "epoch": 1.6666666666666665, "grad_norm": 2.0687789916992188, "learning_rate": 9.417560222230115e-06, "loss": 0.7804, "mean_token_accuracy": 0.7776985839009285, "num_tokens": 188983.0, "step": 60 }, { "entropy": 0.716331735253334, "epoch": 1.6944444444444444, "grad_norm": 1.974429965019226, "learning_rate": 9.284285880837947e-06, "loss": 0.7131, "mean_token_accuracy": 0.8018393665552139, "num_tokens": 192190.0, "step": 61 }, { "entropy": 0.7596073672175407, "epoch": 1.7222222222222223, "grad_norm": 2.0154805183410645, "learning_rate": 9.138444990784455e-06, "loss": 0.7203, "mean_token_accuracy": 0.799439825117588, "num_tokens": 195293.0, "step": 62 }, { "entropy": 0.7313190475106239, "epoch": 1.75, "grad_norm": 1.892073631286621, "learning_rate": 8.98046532852822e-06, "loss": 0.6366, "mean_token_accuracy": 0.8158354088664055, "num_tokens": 198464.0, "step": 63 }, { "entropy": 0.6996584385633469, "epoch": 1.7777777777777777, "grad_norm": 2.004039764404297, "learning_rate": 8.810810275638183e-06, "loss": 0.7021, "mean_token_accuracy": 0.7982058823108673, "num_tokens": 201581.0, "step": 64 }, { "entropy": 0.6911773085594177, "epoch": 1.8055555555555556, "grad_norm": 2.0379583835601807, "learning_rate": 8.629977459615655e-06, "loss": 0.6898, "mean_token_accuracy": 0.8074537888169289, "num_tokens": 204669.0, "step": 65 }, { "entropy": 0.6928622052073479, "epoch": 1.8333333333333335, "grad_norm": 2.0388221740722656, "learning_rate": 8.438497294267117e-06, "loss": 0.7297, "mean_token_accuracy": 0.7990831881761551, "num_tokens": 207828.0, "step": 66 }, { "entropy": 0.6930385380983353, "epoch": 1.8611111111111112, "grad_norm": 2.110360860824585, "learning_rate": 8.23693142390914e-06, "loss": 0.7039, "mean_token_accuracy": 0.7907350063323975, "num_tokens": 211003.0, "step": 67 }, { "entropy": 0.6812680587172508, "epoch": 1.8888888888888888, "grad_norm": 1.8298258781433105, "learning_rate": 8.025871075968828e-06, "loss": 0.6573, "mean_token_accuracy": 0.805952712893486, "num_tokens": 214219.0, "step": 68 }, { "entropy": 0.6855239048600197, "epoch": 1.9166666666666665, "grad_norm": 1.94973886013031, "learning_rate": 7.805935326811913e-06, "loss": 0.6789, "mean_token_accuracy": 0.8042339980602264, "num_tokens": 217381.0, "step": 69 }, { "entropy": 0.7017524242401123, "epoch": 1.9444444444444444, "grad_norm": 1.844860315322876, "learning_rate": 7.57776928588511e-06, "loss": 0.6916, "mean_token_accuracy": 0.7993432655930519, "num_tokens": 220575.0, "step": 70 }, { "entropy": 0.6723021641373634, "epoch": 1.9722222222222223, "grad_norm": 1.9816311597824097, "learning_rate": 7.342042203498952e-06, "loss": 0.6899, "mean_token_accuracy": 0.8051915913820267, "num_tokens": 223785.0, "step": 71 }, { "entropy": 0.7291323319077492, "epoch": 2.0, "grad_norm": 1.919629454612732, "learning_rate": 7.099445507801324e-06, "loss": 0.6998, "mean_token_accuracy": 0.7905183210968971, "num_tokens": 225909.0, "step": 72 }, { "entropy": 0.61961829662323, "epoch": 2.0277777777777777, "grad_norm": 1.885007381439209, "learning_rate": 6.850690776699574e-06, "loss": 0.448, "mean_token_accuracy": 0.868491642177105, "num_tokens": 229208.0, "step": 73 }, { "entropy": 0.6041020900011063, "epoch": 2.0555555555555554, "grad_norm": 1.7473875284194946, "learning_rate": 6.5965076506799e-06, "loss": 0.4395, "mean_token_accuracy": 0.8738656416535378, "num_tokens": 232368.0, "step": 74 }, { "entropy": 0.5625318512320518, "epoch": 2.0833333333333335, "grad_norm": 1.7840373516082764, "learning_rate": 6.337641692646106e-06, "loss": 0.4065, "mean_token_accuracy": 0.8808101117610931, "num_tokens": 235594.0, "step": 75 }, { "entropy": 0.5406039394438267, "epoch": 2.111111111111111, "grad_norm": 1.6404682397842407, "learning_rate": 6.074852201055121e-06, "loss": 0.4094, "mean_token_accuracy": 0.8790416568517685, "num_tokens": 238743.0, "step": 76 }, { "entropy": 0.4563685469329357, "epoch": 2.138888888888889, "grad_norm": 1.6808091402053833, "learning_rate": 5.808909982763825e-06, "loss": 0.3968, "mean_token_accuracy": 0.8820647746324539, "num_tokens": 241937.0, "step": 77 }, { "entropy": 0.41335177794098854, "epoch": 2.1666666666666665, "grad_norm": 1.589560866355896, "learning_rate": 5.540595092119709e-06, "loss": 0.3575, "mean_token_accuracy": 0.8966728746891022, "num_tokens": 245098.0, "step": 78 }, { "entropy": 0.39409590885043144, "epoch": 2.1944444444444446, "grad_norm": 1.8227696418762207, "learning_rate": 5.270694542927089e-06, "loss": 0.3687, "mean_token_accuracy": 0.8862845078110695, "num_tokens": 248263.0, "step": 79 }, { "entropy": 0.3667695038020611, "epoch": 2.2222222222222223, "grad_norm": 2.003453493118286, "learning_rate": 5e-06, "loss": 0.3747, "mean_token_accuracy": 0.8866413086652756, "num_tokens": 251385.0, "step": 80 }, { "entropy": 0.372307363897562, "epoch": 2.25, "grad_norm": 2.1508708000183105, "learning_rate": 4.729305457072913e-06, "loss": 0.3925, "mean_token_accuracy": 0.8885233998298645, "num_tokens": 254521.0, "step": 81 }, { "entropy": 0.3625626228749752, "epoch": 2.2777777777777777, "grad_norm": 1.9702527523040771, "learning_rate": 4.459404907880293e-06, "loss": 0.3527, "mean_token_accuracy": 0.8954600095748901, "num_tokens": 257696.0, "step": 82 }, { "entropy": 0.3951098136603832, "epoch": 2.3055555555555554, "grad_norm": 2.033423662185669, "learning_rate": 4.191090017236177e-06, "loss": 0.3693, "mean_token_accuracy": 0.8858270421624184, "num_tokens": 260926.0, "step": 83 }, { "entropy": 0.362130768597126, "epoch": 2.3333333333333335, "grad_norm": 2.009316921234131, "learning_rate": 3.92514779894488e-06, "loss": 0.3742, "mean_token_accuracy": 0.8943712711334229, "num_tokens": 264056.0, "step": 84 }, { "entropy": 0.4374544806778431, "epoch": 2.361111111111111, "grad_norm": 2.210038185119629, "learning_rate": 3.662358307353897e-06, "loss": 0.4179, "mean_token_accuracy": 0.8706259727478027, "num_tokens": 267312.0, "step": 85 }, { "entropy": 0.42751823738217354, "epoch": 2.388888888888889, "grad_norm": 2.0217461585998535, "learning_rate": 3.403492349320101e-06, "loss": 0.3789, "mean_token_accuracy": 0.8888283669948578, "num_tokens": 270471.0, "step": 86 }, { "entropy": 0.4250110536813736, "epoch": 2.4166666666666665, "grad_norm": 1.8796360492706299, "learning_rate": 3.149309223300428e-06, "loss": 0.3811, "mean_token_accuracy": 0.8900559470057487, "num_tokens": 273631.0, "step": 87 }, { "entropy": 0.43111632391810417, "epoch": 2.4444444444444446, "grad_norm": 1.7372019290924072, "learning_rate": 2.9005544921986774e-06, "loss": 0.3647, "mean_token_accuracy": 0.8927169218659401, "num_tokens": 276837.0, "step": 88 }, { "entropy": 0.4418785385787487, "epoch": 2.4722222222222223, "grad_norm": 1.9140700101852417, "learning_rate": 2.65795779650105e-06, "loss": 0.3596, "mean_token_accuracy": 0.890064924955368, "num_tokens": 280046.0, "step": 89 }, { "entropy": 0.44870807603001595, "epoch": 2.5, "grad_norm": 1.9130913019180298, "learning_rate": 2.422230714114891e-06, "loss": 0.403, "mean_token_accuracy": 0.8809220641851425, "num_tokens": 283146.0, "step": 90 }, { "entropy": 0.43657322600483894, "epoch": 2.5277777777777777, "grad_norm": 1.7632478475570679, "learning_rate": 2.1940646731880887e-06, "loss": 0.3667, "mean_token_accuracy": 0.8956960290670395, "num_tokens": 286244.0, "step": 91 }, { "entropy": 0.43981461971998215, "epoch": 2.5555555555555554, "grad_norm": 1.8031526803970337, "learning_rate": 1.9741289240311757e-06, "loss": 0.3486, "mean_token_accuracy": 0.8991769030690193, "num_tokens": 289470.0, "step": 92 }, { "entropy": 0.46824824810028076, "epoch": 2.5833333333333335, "grad_norm": 1.8402049541473389, "learning_rate": 1.7630685760908623e-06, "loss": 0.3879, "mean_token_accuracy": 0.8875113874673843, "num_tokens": 292592.0, "step": 93 }, { "entropy": 0.43110212683677673, "epoch": 2.611111111111111, "grad_norm": 1.7616424560546875, "learning_rate": 1.561502705732883e-06, "loss": 0.3538, "mean_token_accuracy": 0.893041767179966, "num_tokens": 295627.0, "step": 94 }, { "entropy": 0.4747701808810234, "epoch": 2.638888888888889, "grad_norm": 1.8937019109725952, "learning_rate": 1.370022540384347e-06, "loss": 0.396, "mean_token_accuracy": 0.8820464089512825, "num_tokens": 298854.0, "step": 95 }, { "entropy": 0.42968159168958664, "epoch": 2.6666666666666665, "grad_norm": 1.7988896369934082, "learning_rate": 1.1891897243618184e-06, "loss": 0.3595, "mean_token_accuracy": 0.8860316947102547, "num_tokens": 302047.0, "step": 96 }, { "entropy": 0.41574111208319664, "epoch": 2.6944444444444446, "grad_norm": 1.8018600940704346, "learning_rate": 1.0195346714717813e-06, "loss": 0.3355, "mean_token_accuracy": 0.9010386317968369, "num_tokens": 305164.0, "step": 97 }, { "entropy": 0.44235648587346077, "epoch": 2.7222222222222223, "grad_norm": 1.782006025314331, "learning_rate": 8.615550092155478e-07, "loss": 0.3585, "mean_token_accuracy": 0.8858170583844185, "num_tokens": 308277.0, "step": 98 }, { "entropy": 0.4145592227578163, "epoch": 2.75, "grad_norm": 1.7571319341659546, "learning_rate": 7.157141191620548e-07, "loss": 0.3524, "mean_token_accuracy": 0.8962656855583191, "num_tokens": 311428.0, "step": 99 }, { "entropy": 0.44449520111083984, "epoch": 2.7777777777777777, "grad_norm": 1.6875940561294556, "learning_rate": 5.824397777698859e-07, "loss": 0.3692, "mean_token_accuracy": 0.8917764648795128, "num_tokens": 314558.0, "step": 100 }, { "entropy": 0.42087528854608536, "epoch": 2.8055555555555554, "grad_norm": 1.6768156290054321, "learning_rate": 4.6212290164521554e-07, "loss": 0.3383, "mean_token_accuracy": 0.895787350833416, "num_tokens": 317656.0, "step": 101 }, { "entropy": 0.42996737360954285, "epoch": 2.8333333333333335, "grad_norm": 1.751430630683899, "learning_rate": 3.5511640091604293e-07, "loss": 0.3595, "mean_token_accuracy": 0.8938910216093063, "num_tokens": 320851.0, "step": 102 }, { "entropy": 0.41593609377741814, "epoch": 2.861111111111111, "grad_norm": 1.8688925504684448, "learning_rate": 2.617341440859883e-07, "loss": 0.3478, "mean_token_accuracy": 0.892216868698597, "num_tokens": 324023.0, "step": 103 }, { "entropy": 0.46036434918642044, "epoch": 2.888888888888889, "grad_norm": 1.765503168106079, "learning_rate": 1.8225003740388546e-07, "loss": 0.3977, "mean_token_accuracy": 0.8861500397324562, "num_tokens": 327183.0, "step": 104 }, { "entropy": 0.4100455492734909, "epoch": 2.9166666666666665, "grad_norm": 1.7134056091308594, "learning_rate": 1.1689722144956672e-07, "loss": 0.3664, "mean_token_accuracy": 0.8897344619035721, "num_tokens": 330411.0, "step": 105 }, { "entropy": 0.4413677863776684, "epoch": 2.9444444444444446, "grad_norm": 1.9713915586471558, "learning_rate": 6.58673872923693e-08, "loss": 0.3903, "mean_token_accuracy": 0.8836557418107986, "num_tokens": 333553.0, "step": 106 }, { "entropy": 0.41848642379045486, "epoch": 2.9722222222222223, "grad_norm": 1.7020299434661865, "learning_rate": 2.9310214228202016e-08, "loss": 0.3578, "mean_token_accuracy": 0.8925286307930946, "num_tokens": 336750.0, "step": 107 }, { "entropy": 0.4184332340955734, "epoch": 3.0, "grad_norm": 1.7416514158248901, "learning_rate": 7.332930744380906e-09, "loss": 0.3532, "mean_token_accuracy": 0.8908478692173958, "num_tokens": 338921.0, "step": 108 } ], "logging_steps": 1, "max_steps": 108, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5784577125646336.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }