{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 16875, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008888888888888889, "grad_norm": 69.5, "learning_rate": 2.8994082840236688e-06, "loss": 0.6647, "step": 50 }, { "epoch": 0.017777777777777778, "grad_norm": 44.75, "learning_rate": 5.857988165680474e-06, "loss": 0.6167, "step": 100 }, { "epoch": 0.02666666666666667, "grad_norm": 93.0, "learning_rate": 8.816568047337279e-06, "loss": 0.5663, "step": 150 }, { "epoch": 0.035555555555555556, "grad_norm": 49.5, "learning_rate": 1.1775147928994083e-05, "loss": 0.5885, "step": 200 }, { "epoch": 0.044444444444444446, "grad_norm": 44.0, "learning_rate": 1.4733727810650888e-05, "loss": 0.5075, "step": 250 }, { "epoch": 0.05333333333333334, "grad_norm": 39.0, "learning_rate": 1.7692307692307694e-05, "loss": 0.4993, "step": 300 }, { "epoch": 0.06222222222222222, "grad_norm": 39.0, "learning_rate": 1.9986696498760357e-05, "loss": 0.525, "step": 350 }, { "epoch": 0.07111111111111111, "grad_norm": 66.0, "learning_rate": 1.9926226038580155e-05, "loss": 0.5397, "step": 400 }, { "epoch": 0.08, "grad_norm": 50.25, "learning_rate": 1.9865755578399954e-05, "loss": 0.5969, "step": 450 }, { "epoch": 0.08888888888888889, "grad_norm": 44.25, "learning_rate": 1.980528511821975e-05, "loss": 0.5574, "step": 500 }, { "epoch": 0.08888888888888889, "eval_loss": 0.04251113533973694, "eval_runtime": 0.8673, "eval_samples_per_second": 11.53, "eval_steps_per_second": 2.306, "step": 500 }, { "epoch": 0.09777777777777778, "grad_norm": 47.75, "learning_rate": 1.9744814658039547e-05, "loss": 0.5719, "step": 550 }, { "epoch": 0.10666666666666667, "grad_norm": 39.75, "learning_rate": 1.9684344197859345e-05, "loss": 0.575, "step": 600 }, { "epoch": 0.11555555555555555, "grad_norm": 51.5, "learning_rate": 1.9623873737679144e-05, "loss": 0.582, "step": 650 }, { "epoch": 0.12444444444444444, "grad_norm": 48.5, "learning_rate": 1.9563403277498942e-05, "loss": 0.5276, "step": 700 }, { "epoch": 0.13333333333333333, "grad_norm": 65.0, "learning_rate": 1.950293281731874e-05, "loss": 0.5876, "step": 750 }, { "epoch": 0.14222222222222222, "grad_norm": 43.5, "learning_rate": 1.944246235713854e-05, "loss": 0.5616, "step": 800 }, { "epoch": 0.1511111111111111, "grad_norm": 55.25, "learning_rate": 1.9381991896958337e-05, "loss": 0.5332, "step": 850 }, { "epoch": 0.16, "grad_norm": 59.75, "learning_rate": 1.9321521436778135e-05, "loss": 0.5586, "step": 900 }, { "epoch": 0.1688888888888889, "grad_norm": 44.75, "learning_rate": 1.9261050976597933e-05, "loss": 0.5412, "step": 950 }, { "epoch": 0.17777777777777778, "grad_norm": 74.0, "learning_rate": 1.9200580516417732e-05, "loss": 0.5757, "step": 1000 }, { "epoch": 0.17777777777777778, "eval_loss": 0.040884535759687424, "eval_runtime": 0.2448, "eval_samples_per_second": 40.844, "eval_steps_per_second": 8.169, "step": 1000 }, { "epoch": 0.18666666666666668, "grad_norm": 63.25, "learning_rate": 1.914011005623753e-05, "loss": 0.5731, "step": 1050 }, { "epoch": 0.19555555555555557, "grad_norm": 46.0, "learning_rate": 1.9079639596057325e-05, "loss": 0.5527, "step": 1100 }, { "epoch": 0.20444444444444446, "grad_norm": 49.25, "learning_rate": 1.9019169135877123e-05, "loss": 0.5854, "step": 1150 }, { "epoch": 0.21333333333333335, "grad_norm": 39.75, "learning_rate": 1.895869867569692e-05, "loss": 0.5437, "step": 1200 }, { "epoch": 0.2222222222222222, "grad_norm": 49.75, "learning_rate": 1.889822821551672e-05, "loss": 0.5386, "step": 1250 }, { "epoch": 0.2311111111111111, "grad_norm": 73.0, "learning_rate": 1.8837757755336518e-05, "loss": 0.5514, "step": 1300 }, { "epoch": 0.24, "grad_norm": 40.25, "learning_rate": 1.8777287295156316e-05, "loss": 0.5508, "step": 1350 }, { "epoch": 0.24888888888888888, "grad_norm": 33.25, "learning_rate": 1.8716816834976115e-05, "loss": 0.5709, "step": 1400 }, { "epoch": 0.2577777777777778, "grad_norm": 31.875, "learning_rate": 1.8656346374795913e-05, "loss": 0.5281, "step": 1450 }, { "epoch": 0.26666666666666666, "grad_norm": 44.0, "learning_rate": 1.859587591461571e-05, "loss": 0.589, "step": 1500 }, { "epoch": 0.26666666666666666, "eval_loss": 0.02658979222178459, "eval_runtime": 0.2453, "eval_samples_per_second": 40.774, "eval_steps_per_second": 8.155, "step": 1500 }, { "epoch": 0.27555555555555555, "grad_norm": 42.0, "learning_rate": 1.853540545443551e-05, "loss": 0.5987, "step": 1550 }, { "epoch": 0.28444444444444444, "grad_norm": 46.0, "learning_rate": 1.8474934994255308e-05, "loss": 0.531, "step": 1600 }, { "epoch": 0.29333333333333333, "grad_norm": 72.0, "learning_rate": 1.8414464534075106e-05, "loss": 0.5679, "step": 1650 }, { "epoch": 0.3022222222222222, "grad_norm": 65.0, "learning_rate": 1.83539940738949e-05, "loss": 0.5447, "step": 1700 }, { "epoch": 0.3111111111111111, "grad_norm": 50.75, "learning_rate": 1.82935236137147e-05, "loss": 0.6193, "step": 1750 }, { "epoch": 0.32, "grad_norm": 46.75, "learning_rate": 1.8233053153534498e-05, "loss": 0.5606, "step": 1800 }, { "epoch": 0.3288888888888889, "grad_norm": 52.5, "learning_rate": 1.8172582693354296e-05, "loss": 0.5106, "step": 1850 }, { "epoch": 0.3377777777777778, "grad_norm": 37.75, "learning_rate": 1.8112112233174094e-05, "loss": 0.5475, "step": 1900 }, { "epoch": 0.3466666666666667, "grad_norm": 52.5, "learning_rate": 1.8051641772993893e-05, "loss": 0.5578, "step": 1950 }, { "epoch": 0.35555555555555557, "grad_norm": 35.0, "learning_rate": 1.799117131281369e-05, "loss": 0.5796, "step": 2000 }, { "epoch": 0.35555555555555557, "eval_loss": 0.01918725296854973, "eval_runtime": 0.2325, "eval_samples_per_second": 43.013, "eval_steps_per_second": 8.603, "step": 2000 }, { "epoch": 0.36444444444444446, "grad_norm": 47.25, "learning_rate": 1.793070085263349e-05, "loss": 0.5821, "step": 2050 }, { "epoch": 0.37333333333333335, "grad_norm": 45.75, "learning_rate": 1.7870230392453288e-05, "loss": 0.6066, "step": 2100 }, { "epoch": 0.38222222222222224, "grad_norm": 95.0, "learning_rate": 1.7809759932273086e-05, "loss": 0.5818, "step": 2150 }, { "epoch": 0.39111111111111113, "grad_norm": 50.25, "learning_rate": 1.7749289472092884e-05, "loss": 0.555, "step": 2200 }, { "epoch": 0.4, "grad_norm": 57.75, "learning_rate": 1.7688819011912683e-05, "loss": 0.6096, "step": 2250 }, { "epoch": 0.4088888888888889, "grad_norm": 50.0, "learning_rate": 1.762834855173248e-05, "loss": 0.5591, "step": 2300 }, { "epoch": 0.4177777777777778, "grad_norm": 38.0, "learning_rate": 1.7567878091552276e-05, "loss": 0.5534, "step": 2350 }, { "epoch": 0.4266666666666667, "grad_norm": 55.25, "learning_rate": 1.7507407631372074e-05, "loss": 0.5954, "step": 2400 }, { "epoch": 0.43555555555555553, "grad_norm": 61.25, "learning_rate": 1.7446937171191872e-05, "loss": 0.5246, "step": 2450 }, { "epoch": 0.4444444444444444, "grad_norm": 37.5, "learning_rate": 1.738646671101167e-05, "loss": 0.5513, "step": 2500 }, { "epoch": 0.4444444444444444, "eval_loss": 0.019861677661538124, "eval_runtime": 0.2317, "eval_samples_per_second": 43.161, "eval_steps_per_second": 8.632, "step": 2500 }, { "epoch": 0.4533333333333333, "grad_norm": 50.5, "learning_rate": 1.732599625083147e-05, "loss": 0.5717, "step": 2550 }, { "epoch": 0.4622222222222222, "grad_norm": 41.75, "learning_rate": 1.7265525790651267e-05, "loss": 0.5213, "step": 2600 }, { "epoch": 0.4711111111111111, "grad_norm": 59.75, "learning_rate": 1.7205055330471066e-05, "loss": 0.5403, "step": 2650 }, { "epoch": 0.48, "grad_norm": 34.75, "learning_rate": 1.7144584870290864e-05, "loss": 0.5731, "step": 2700 }, { "epoch": 0.4888888888888889, "grad_norm": 53.0, "learning_rate": 1.7084114410110662e-05, "loss": 0.5839, "step": 2750 }, { "epoch": 0.49777777777777776, "grad_norm": 60.0, "learning_rate": 1.702364394993046e-05, "loss": 0.5833, "step": 2800 }, { "epoch": 0.5066666666666667, "grad_norm": 55.75, "learning_rate": 1.696317348975026e-05, "loss": 0.5696, "step": 2850 }, { "epoch": 0.5155555555555555, "grad_norm": 57.75, "learning_rate": 1.6902703029570057e-05, "loss": 0.5804, "step": 2900 }, { "epoch": 0.5244444444444445, "grad_norm": 47.5, "learning_rate": 1.6842232569389852e-05, "loss": 0.5935, "step": 2950 }, { "epoch": 0.5333333333333333, "grad_norm": 39.25, "learning_rate": 1.678176210920965e-05, "loss": 0.516, "step": 3000 }, { "epoch": 0.5333333333333333, "eval_loss": 0.016407368704676628, "eval_runtime": 0.2357, "eval_samples_per_second": 42.428, "eval_steps_per_second": 8.486, "step": 3000 }, { "epoch": 0.5422222222222223, "grad_norm": 80.5, "learning_rate": 1.672129164902945e-05, "loss": 0.6103, "step": 3050 }, { "epoch": 0.5511111111111111, "grad_norm": 65.5, "learning_rate": 1.6660821188849247e-05, "loss": 0.4698, "step": 3100 }, { "epoch": 0.56, "grad_norm": 60.0, "learning_rate": 1.6600350728669045e-05, "loss": 0.6191, "step": 3150 }, { "epoch": 0.5688888888888889, "grad_norm": 53.25, "learning_rate": 1.6539880268488844e-05, "loss": 0.518, "step": 3200 }, { "epoch": 0.5777777777777777, "grad_norm": 74.0, "learning_rate": 1.6479409808308642e-05, "loss": 0.5538, "step": 3250 }, { "epoch": 0.5866666666666667, "grad_norm": 42.25, "learning_rate": 1.641893934812844e-05, "loss": 0.6062, "step": 3300 }, { "epoch": 0.5955555555555555, "grad_norm": 48.25, "learning_rate": 1.635846888794824e-05, "loss": 0.5821, "step": 3350 }, { "epoch": 0.6044444444444445, "grad_norm": 48.25, "learning_rate": 1.6297998427768037e-05, "loss": 0.5769, "step": 3400 }, { "epoch": 0.6133333333333333, "grad_norm": 53.75, "learning_rate": 1.6237527967587835e-05, "loss": 0.5545, "step": 3450 }, { "epoch": 0.6222222222222222, "grad_norm": 44.5, "learning_rate": 1.6177057507407634e-05, "loss": 0.5537, "step": 3500 }, { "epoch": 0.6222222222222222, "eval_loss": 0.0168689526617527, "eval_runtime": 0.2329, "eval_samples_per_second": 42.943, "eval_steps_per_second": 8.589, "step": 3500 }, { "epoch": 0.6311111111111111, "grad_norm": 72.0, "learning_rate": 1.611658704722743e-05, "loss": 0.5742, "step": 3550 }, { "epoch": 0.64, "grad_norm": 35.0, "learning_rate": 1.6056116587047227e-05, "loss": 0.5335, "step": 3600 }, { "epoch": 0.6488888888888888, "grad_norm": 38.25, "learning_rate": 1.5995646126867025e-05, "loss": 0.5515, "step": 3650 }, { "epoch": 0.6577777777777778, "grad_norm": 42.25, "learning_rate": 1.5935175666686823e-05, "loss": 0.5416, "step": 3700 }, { "epoch": 0.6666666666666666, "grad_norm": 37.75, "learning_rate": 1.587470520650662e-05, "loss": 0.5504, "step": 3750 }, { "epoch": 0.6755555555555556, "grad_norm": 69.0, "learning_rate": 1.581423474632642e-05, "loss": 0.5644, "step": 3800 }, { "epoch": 0.6844444444444444, "grad_norm": 39.5, "learning_rate": 1.575376428614622e-05, "loss": 0.5868, "step": 3850 }, { "epoch": 0.6933333333333334, "grad_norm": 41.0, "learning_rate": 1.5693293825966017e-05, "loss": 0.572, "step": 3900 }, { "epoch": 0.7022222222222222, "grad_norm": 44.5, "learning_rate": 1.5632823365785815e-05, "loss": 0.5448, "step": 3950 }, { "epoch": 0.7111111111111111, "grad_norm": 35.0, "learning_rate": 1.5572352905605613e-05, "loss": 0.5392, "step": 4000 }, { "epoch": 0.7111111111111111, "eval_loss": 0.013791784644126892, "eval_runtime": 0.2368, "eval_samples_per_second": 42.229, "eval_steps_per_second": 8.446, "step": 4000 }, { "epoch": 0.72, "grad_norm": 43.75, "learning_rate": 1.551188244542541e-05, "loss": 0.4832, "step": 4050 }, { "epoch": 0.7288888888888889, "grad_norm": 43.0, "learning_rate": 1.545141198524521e-05, "loss": 0.5232, "step": 4100 }, { "epoch": 0.7377777777777778, "grad_norm": 44.25, "learning_rate": 1.5390941525065005e-05, "loss": 0.5381, "step": 4150 }, { "epoch": 0.7466666666666667, "grad_norm": 52.5, "learning_rate": 1.5330471064884803e-05, "loss": 0.5427, "step": 4200 }, { "epoch": 0.7555555555555555, "grad_norm": 51.25, "learning_rate": 1.52700006047046e-05, "loss": 0.5796, "step": 4250 }, { "epoch": 0.7644444444444445, "grad_norm": 42.25, "learning_rate": 1.52095301445244e-05, "loss": 0.5196, "step": 4300 }, { "epoch": 0.7733333333333333, "grad_norm": 34.75, "learning_rate": 1.5149059684344198e-05, "loss": 0.5521, "step": 4350 }, { "epoch": 0.7822222222222223, "grad_norm": 26.75, "learning_rate": 1.5088589224163996e-05, "loss": 0.5732, "step": 4400 }, { "epoch": 0.7911111111111111, "grad_norm": 53.25, "learning_rate": 1.5028118763983795e-05, "loss": 0.5951, "step": 4450 }, { "epoch": 0.8, "grad_norm": 27.875, "learning_rate": 1.4967648303803593e-05, "loss": 0.5393, "step": 4500 }, { "epoch": 0.8, "eval_loss": 0.015166623517870903, "eval_runtime": 0.2317, "eval_samples_per_second": 43.162, "eval_steps_per_second": 8.632, "step": 4500 }, { "epoch": 0.8088888888888889, "grad_norm": 31.25, "learning_rate": 1.4907177843623391e-05, "loss": 0.5691, "step": 4550 }, { "epoch": 0.8177777777777778, "grad_norm": 28.125, "learning_rate": 1.4846707383443188e-05, "loss": 0.5535, "step": 4600 }, { "epoch": 0.8266666666666667, "grad_norm": 32.75, "learning_rate": 1.4786236923262986e-05, "loss": 0.5656, "step": 4650 }, { "epoch": 0.8355555555555556, "grad_norm": 56.25, "learning_rate": 1.4725766463082784e-05, "loss": 0.5505, "step": 4700 }, { "epoch": 0.8444444444444444, "grad_norm": 73.0, "learning_rate": 1.4665296002902583e-05, "loss": 0.585, "step": 4750 }, { "epoch": 0.8533333333333334, "grad_norm": 55.5, "learning_rate": 1.4604825542722381e-05, "loss": 0.5366, "step": 4800 }, { "epoch": 0.8622222222222222, "grad_norm": 48.75, "learning_rate": 1.454435508254218e-05, "loss": 0.5466, "step": 4850 }, { "epoch": 0.8711111111111111, "grad_norm": 47.75, "learning_rate": 1.4483884622361976e-05, "loss": 0.5458, "step": 4900 }, { "epoch": 0.88, "grad_norm": 42.75, "learning_rate": 1.4423414162181774e-05, "loss": 0.5499, "step": 4950 }, { "epoch": 0.8888888888888888, "grad_norm": 62.0, "learning_rate": 1.4362943702001573e-05, "loss": 0.5606, "step": 5000 }, { "epoch": 0.8888888888888888, "eval_loss": 0.014741213992238045, "eval_runtime": 0.2391, "eval_samples_per_second": 41.821, "eval_steps_per_second": 8.364, "step": 5000 }, { "epoch": 0.8977777777777778, "grad_norm": 49.5, "learning_rate": 1.4302473241821371e-05, "loss": 0.542, "step": 5050 }, { "epoch": 0.9066666666666666, "grad_norm": 61.0, "learning_rate": 1.424200278164117e-05, "loss": 0.5337, "step": 5100 }, { "epoch": 0.9155555555555556, "grad_norm": 27.625, "learning_rate": 1.4181532321460968e-05, "loss": 0.4814, "step": 5150 }, { "epoch": 0.9244444444444444, "grad_norm": 51.75, "learning_rate": 1.4121061861280764e-05, "loss": 0.5558, "step": 5200 }, { "epoch": 0.9333333333333333, "grad_norm": 38.0, "learning_rate": 1.4060591401100562e-05, "loss": 0.563, "step": 5250 }, { "epoch": 0.9422222222222222, "grad_norm": 53.5, "learning_rate": 1.400012094092036e-05, "loss": 0.5361, "step": 5300 }, { "epoch": 0.9511111111111111, "grad_norm": 55.5, "learning_rate": 1.3939650480740159e-05, "loss": 0.5272, "step": 5350 }, { "epoch": 0.96, "grad_norm": 39.5, "learning_rate": 1.3879180020559957e-05, "loss": 0.5477, "step": 5400 }, { "epoch": 0.9688888888888889, "grad_norm": 44.25, "learning_rate": 1.3818709560379756e-05, "loss": 0.5576, "step": 5450 }, { "epoch": 0.9777777777777777, "grad_norm": 49.25, "learning_rate": 1.3758239100199552e-05, "loss": 0.5449, "step": 5500 }, { "epoch": 0.9777777777777777, "eval_loss": 0.017370671033859253, "eval_runtime": 0.2343, "eval_samples_per_second": 42.681, "eval_steps_per_second": 8.536, "step": 5500 }, { "epoch": 0.9866666666666667, "grad_norm": 51.5, "learning_rate": 1.369776864001935e-05, "loss": 0.5486, "step": 5550 }, { "epoch": 0.9955555555555555, "grad_norm": 45.0, "learning_rate": 1.3637298179839149e-05, "loss": 0.5165, "step": 5600 }, { "epoch": 1.0044444444444445, "grad_norm": 31.375, "learning_rate": 1.3576827719658947e-05, "loss": 0.4315, "step": 5650 }, { "epoch": 1.0133333333333334, "grad_norm": 59.0, "learning_rate": 1.3516357259478746e-05, "loss": 0.2956, "step": 5700 }, { "epoch": 1.0222222222222221, "grad_norm": 43.25, "learning_rate": 1.3455886799298544e-05, "loss": 0.2986, "step": 5750 }, { "epoch": 1.031111111111111, "grad_norm": 34.25, "learning_rate": 1.339541633911834e-05, "loss": 0.2607, "step": 5800 }, { "epoch": 1.04, "grad_norm": 39.5, "learning_rate": 1.3334945878938139e-05, "loss": 0.321, "step": 5850 }, { "epoch": 1.048888888888889, "grad_norm": 32.25, "learning_rate": 1.3274475418757937e-05, "loss": 0.3027, "step": 5900 }, { "epoch": 1.0577777777777777, "grad_norm": 60.25, "learning_rate": 1.3214004958577735e-05, "loss": 0.3313, "step": 5950 }, { "epoch": 1.0666666666666667, "grad_norm": 43.75, "learning_rate": 1.3153534498397534e-05, "loss": 0.302, "step": 6000 }, { "epoch": 1.0666666666666667, "eval_loss": 0.013352945446968079, "eval_runtime": 0.2372, "eval_samples_per_second": 42.164, "eval_steps_per_second": 8.433, "step": 6000 }, { "epoch": 1.0755555555555556, "grad_norm": 32.75, "learning_rate": 1.3093064038217332e-05, "loss": 0.3092, "step": 6050 }, { "epoch": 1.0844444444444445, "grad_norm": 28.75, "learning_rate": 1.3032593578037129e-05, "loss": 0.3224, "step": 6100 }, { "epoch": 1.0933333333333333, "grad_norm": 48.0, "learning_rate": 1.2972123117856927e-05, "loss": 0.3313, "step": 6150 }, { "epoch": 1.1022222222222222, "grad_norm": 39.0, "learning_rate": 1.2911652657676725e-05, "loss": 0.321, "step": 6200 }, { "epoch": 1.1111111111111112, "grad_norm": 608.0, "learning_rate": 1.2851182197496524e-05, "loss": 0.3081, "step": 6250 }, { "epoch": 1.12, "grad_norm": 33.75, "learning_rate": 1.2790711737316322e-05, "loss": 0.3186, "step": 6300 }, { "epoch": 1.1288888888888888, "grad_norm": 24.625, "learning_rate": 1.273024127713612e-05, "loss": 0.3168, "step": 6350 }, { "epoch": 1.1377777777777778, "grad_norm": 35.25, "learning_rate": 1.2669770816955917e-05, "loss": 0.2926, "step": 6400 }, { "epoch": 1.1466666666666667, "grad_norm": 36.0, "learning_rate": 1.2609300356775715e-05, "loss": 0.3467, "step": 6450 }, { "epoch": 1.1555555555555554, "grad_norm": 32.0, "learning_rate": 1.2548829896595513e-05, "loss": 0.2906, "step": 6500 }, { "epoch": 1.1555555555555554, "eval_loss": 0.012937337160110474, "eval_runtime": 0.2433, "eval_samples_per_second": 41.104, "eval_steps_per_second": 8.221, "step": 6500 }, { "epoch": 1.1644444444444444, "grad_norm": 36.5, "learning_rate": 1.2488359436415312e-05, "loss": 0.3198, "step": 6550 }, { "epoch": 1.1733333333333333, "grad_norm": 31.625, "learning_rate": 1.242788897623511e-05, "loss": 0.3089, "step": 6600 }, { "epoch": 1.1822222222222223, "grad_norm": 19.0, "learning_rate": 1.2367418516054908e-05, "loss": 0.3189, "step": 6650 }, { "epoch": 1.1911111111111112, "grad_norm": 44.0, "learning_rate": 1.2306948055874705e-05, "loss": 0.2821, "step": 6700 }, { "epoch": 1.2, "grad_norm": 26.375, "learning_rate": 1.2246477595694503e-05, "loss": 0.3345, "step": 6750 }, { "epoch": 1.208888888888889, "grad_norm": 34.0, "learning_rate": 1.2186007135514301e-05, "loss": 0.2933, "step": 6800 }, { "epoch": 1.2177777777777778, "grad_norm": 51.0, "learning_rate": 1.21255366753341e-05, "loss": 0.3073, "step": 6850 }, { "epoch": 1.2266666666666666, "grad_norm": 36.75, "learning_rate": 1.2065066215153898e-05, "loss": 0.2922, "step": 6900 }, { "epoch": 1.2355555555555555, "grad_norm": 30.875, "learning_rate": 1.2004595754973696e-05, "loss": 0.346, "step": 6950 }, { "epoch": 1.2444444444444445, "grad_norm": 39.75, "learning_rate": 1.1944125294793493e-05, "loss": 0.2795, "step": 7000 }, { "epoch": 1.2444444444444445, "eval_loss": 0.013419872149825096, "eval_runtime": 0.2304, "eval_samples_per_second": 43.394, "eval_steps_per_second": 8.679, "step": 7000 }, { "epoch": 1.2533333333333334, "grad_norm": 26.375, "learning_rate": 1.1883654834613291e-05, "loss": 0.3054, "step": 7050 }, { "epoch": 1.2622222222222224, "grad_norm": 39.75, "learning_rate": 1.182318437443309e-05, "loss": 0.3053, "step": 7100 }, { "epoch": 1.271111111111111, "grad_norm": 46.25, "learning_rate": 1.1762713914252888e-05, "loss": 0.3227, "step": 7150 }, { "epoch": 1.28, "grad_norm": 20.25, "learning_rate": 1.1702243454072686e-05, "loss": 0.3362, "step": 7200 }, { "epoch": 1.2888888888888888, "grad_norm": 53.5, "learning_rate": 1.1641772993892485e-05, "loss": 0.2854, "step": 7250 }, { "epoch": 1.2977777777777777, "grad_norm": 63.25, "learning_rate": 1.1581302533712281e-05, "loss": 0.3259, "step": 7300 }, { "epoch": 1.3066666666666666, "grad_norm": 35.25, "learning_rate": 1.152083207353208e-05, "loss": 0.3024, "step": 7350 }, { "epoch": 1.3155555555555556, "grad_norm": 41.5, "learning_rate": 1.1460361613351878e-05, "loss": 0.3036, "step": 7400 }, { "epoch": 1.3244444444444445, "grad_norm": 30.75, "learning_rate": 1.1399891153171676e-05, "loss": 0.3375, "step": 7450 }, { "epoch": 1.3333333333333333, "grad_norm": 40.25, "learning_rate": 1.1339420692991474e-05, "loss": 0.304, "step": 7500 }, { "epoch": 1.3333333333333333, "eval_loss": 0.011497000232338905, "eval_runtime": 0.2306, "eval_samples_per_second": 43.364, "eval_steps_per_second": 8.673, "step": 7500 }, { "epoch": 1.3422222222222222, "grad_norm": 31.875, "learning_rate": 1.1278950232811273e-05, "loss": 0.3073, "step": 7550 }, { "epoch": 1.3511111111111112, "grad_norm": 27.0, "learning_rate": 1.121847977263107e-05, "loss": 0.3235, "step": 7600 }, { "epoch": 1.3599999999999999, "grad_norm": 43.75, "learning_rate": 1.1158009312450868e-05, "loss": 0.3392, "step": 7650 }, { "epoch": 1.3688888888888888, "grad_norm": 45.75, "learning_rate": 1.1097538852270666e-05, "loss": 0.3393, "step": 7700 }, { "epoch": 1.3777777777777778, "grad_norm": 58.25, "learning_rate": 1.1037068392090464e-05, "loss": 0.342, "step": 7750 }, { "epoch": 1.3866666666666667, "grad_norm": 40.5, "learning_rate": 1.0976597931910263e-05, "loss": 0.3167, "step": 7800 }, { "epoch": 1.3955555555555557, "grad_norm": 40.25, "learning_rate": 1.0916127471730061e-05, "loss": 0.2775, "step": 7850 }, { "epoch": 1.4044444444444444, "grad_norm": 31.0, "learning_rate": 1.0855657011549857e-05, "loss": 0.2936, "step": 7900 }, { "epoch": 1.4133333333333333, "grad_norm": 41.5, "learning_rate": 1.0795186551369656e-05, "loss": 0.3132, "step": 7950 }, { "epoch": 1.4222222222222223, "grad_norm": 79.5, "learning_rate": 1.0734716091189454e-05, "loss": 0.3007, "step": 8000 }, { "epoch": 1.4222222222222223, "eval_loss": 0.010556383058428764, "eval_runtime": 0.2401, "eval_samples_per_second": 41.645, "eval_steps_per_second": 8.329, "step": 8000 }, { "epoch": 1.431111111111111, "grad_norm": 23.875, "learning_rate": 1.0674245631009252e-05, "loss": 0.3166, "step": 8050 }, { "epoch": 1.44, "grad_norm": 26.625, "learning_rate": 1.061377517082905e-05, "loss": 0.3079, "step": 8100 }, { "epoch": 1.448888888888889, "grad_norm": 52.5, "learning_rate": 1.0553304710648849e-05, "loss": 0.3107, "step": 8150 }, { "epoch": 1.4577777777777778, "grad_norm": 54.0, "learning_rate": 1.0492834250468646e-05, "loss": 0.3267, "step": 8200 }, { "epoch": 1.4666666666666668, "grad_norm": 41.25, "learning_rate": 1.0432363790288444e-05, "loss": 0.3177, "step": 8250 }, { "epoch": 1.4755555555555555, "grad_norm": 42.5, "learning_rate": 1.0371893330108242e-05, "loss": 0.3303, "step": 8300 }, { "epoch": 1.4844444444444445, "grad_norm": 37.5, "learning_rate": 1.031142286992804e-05, "loss": 0.325, "step": 8350 }, { "epoch": 1.4933333333333334, "grad_norm": 36.25, "learning_rate": 1.0250952409747839e-05, "loss": 0.2704, "step": 8400 }, { "epoch": 1.5022222222222221, "grad_norm": 30.625, "learning_rate": 1.0190481949567637e-05, "loss": 0.3716, "step": 8450 }, { "epoch": 1.511111111111111, "grad_norm": 57.25, "learning_rate": 1.0130011489387434e-05, "loss": 0.3312, "step": 8500 }, { "epoch": 1.511111111111111, "eval_loss": 0.008495492860674858, "eval_runtime": 0.2373, "eval_samples_per_second": 42.14, "eval_steps_per_second": 8.428, "step": 8500 }, { "epoch": 1.52, "grad_norm": 37.5, "learning_rate": 1.0069541029207232e-05, "loss": 0.3069, "step": 8550 }, { "epoch": 1.528888888888889, "grad_norm": 37.25, "learning_rate": 1.000907056902703e-05, "loss": 0.3316, "step": 8600 }, { "epoch": 1.537777777777778, "grad_norm": 35.25, "learning_rate": 9.948600108846829e-06, "loss": 0.306, "step": 8650 }, { "epoch": 1.5466666666666666, "grad_norm": 41.75, "learning_rate": 9.888129648666627e-06, "loss": 0.3417, "step": 8700 }, { "epoch": 1.5555555555555556, "grad_norm": 154.0, "learning_rate": 9.827659188486425e-06, "loss": 0.3217, "step": 8750 }, { "epoch": 1.5644444444444443, "grad_norm": 42.0, "learning_rate": 9.767188728306224e-06, "loss": 0.304, "step": 8800 }, { "epoch": 1.5733333333333333, "grad_norm": 26.125, "learning_rate": 9.70671826812602e-06, "loss": 0.3119, "step": 8850 }, { "epoch": 1.5822222222222222, "grad_norm": 24.375, "learning_rate": 9.646247807945819e-06, "loss": 0.3162, "step": 8900 }, { "epoch": 1.5911111111111111, "grad_norm": 17.75, "learning_rate": 9.585777347765617e-06, "loss": 0.3566, "step": 8950 }, { "epoch": 1.6, "grad_norm": 28.75, "learning_rate": 9.525306887585415e-06, "loss": 0.2844, "step": 9000 }, { "epoch": 1.6, "eval_loss": 0.010613194666802883, "eval_runtime": 0.2357, "eval_samples_per_second": 42.431, "eval_steps_per_second": 8.486, "step": 9000 }, { "epoch": 1.608888888888889, "grad_norm": 25.625, "learning_rate": 9.464836427405213e-06, "loss": 0.2979, "step": 9050 }, { "epoch": 1.6177777777777778, "grad_norm": 33.0, "learning_rate": 9.404365967225012e-06, "loss": 0.3155, "step": 9100 }, { "epoch": 1.6266666666666667, "grad_norm": 25.625, "learning_rate": 9.343895507044808e-06, "loss": 0.3136, "step": 9150 }, { "epoch": 1.6355555555555554, "grad_norm": 38.75, "learning_rate": 9.283425046864607e-06, "loss": 0.3223, "step": 9200 }, { "epoch": 1.6444444444444444, "grad_norm": 40.5, "learning_rate": 9.222954586684405e-06, "loss": 0.3562, "step": 9250 }, { "epoch": 1.6533333333333333, "grad_norm": 29.375, "learning_rate": 9.162484126504203e-06, "loss": 0.3067, "step": 9300 }, { "epoch": 1.6622222222222223, "grad_norm": 44.25, "learning_rate": 9.102013666324002e-06, "loss": 0.3332, "step": 9350 }, { "epoch": 1.6711111111111112, "grad_norm": 28.5, "learning_rate": 9.0415432061438e-06, "loss": 0.2975, "step": 9400 }, { "epoch": 1.6800000000000002, "grad_norm": 40.25, "learning_rate": 8.981072745963597e-06, "loss": 0.3248, "step": 9450 }, { "epoch": 1.6888888888888889, "grad_norm": 28.375, "learning_rate": 8.920602285783395e-06, "loss": 0.3053, "step": 9500 }, { "epoch": 1.6888888888888889, "eval_loss": 0.010935052298009396, "eval_runtime": 0.2331, "eval_samples_per_second": 42.905, "eval_steps_per_second": 8.581, "step": 9500 }, { "epoch": 1.6977777777777778, "grad_norm": 28.875, "learning_rate": 8.860131825603193e-06, "loss": 0.3015, "step": 9550 }, { "epoch": 1.7066666666666666, "grad_norm": 30.75, "learning_rate": 8.799661365422991e-06, "loss": 0.3051, "step": 9600 }, { "epoch": 1.7155555555555555, "grad_norm": 41.25, "learning_rate": 8.73919090524279e-06, "loss": 0.2987, "step": 9650 }, { "epoch": 1.7244444444444444, "grad_norm": 24.125, "learning_rate": 8.678720445062588e-06, "loss": 0.3083, "step": 9700 }, { "epoch": 1.7333333333333334, "grad_norm": 41.75, "learning_rate": 8.618249984882385e-06, "loss": 0.2924, "step": 9750 }, { "epoch": 1.7422222222222223, "grad_norm": 35.5, "learning_rate": 8.557779524702183e-06, "loss": 0.3256, "step": 9800 }, { "epoch": 1.751111111111111, "grad_norm": 26.875, "learning_rate": 8.497309064521981e-06, "loss": 0.317, "step": 9850 }, { "epoch": 1.76, "grad_norm": 32.25, "learning_rate": 8.43683860434178e-06, "loss": 0.3248, "step": 9900 }, { "epoch": 1.7688888888888887, "grad_norm": 28.875, "learning_rate": 8.376368144161578e-06, "loss": 0.311, "step": 9950 }, { "epoch": 1.7777777777777777, "grad_norm": 36.0, "learning_rate": 8.315897683981376e-06, "loss": 0.3339, "step": 10000 }, { "epoch": 1.7777777777777777, "eval_loss": 0.008871009573340416, "eval_runtime": 0.238, "eval_samples_per_second": 42.021, "eval_steps_per_second": 8.404, "step": 10000 }, { "epoch": 1.7866666666666666, "grad_norm": 30.5, "learning_rate": 8.255427223801173e-06, "loss": 0.3088, "step": 10050 }, { "epoch": 1.7955555555555556, "grad_norm": 21.875, "learning_rate": 8.194956763620971e-06, "loss": 0.3369, "step": 10100 }, { "epoch": 1.8044444444444445, "grad_norm": 30.125, "learning_rate": 8.13448630344077e-06, "loss": 0.2748, "step": 10150 }, { "epoch": 1.8133333333333335, "grad_norm": 39.25, "learning_rate": 8.074015843260568e-06, "loss": 0.3141, "step": 10200 }, { "epoch": 1.8222222222222222, "grad_norm": 72.5, "learning_rate": 8.013545383080366e-06, "loss": 0.2874, "step": 10250 }, { "epoch": 1.8311111111111111, "grad_norm": 36.5, "learning_rate": 7.953074922900164e-06, "loss": 0.2908, "step": 10300 }, { "epoch": 1.8399999999999999, "grad_norm": 51.0, "learning_rate": 7.892604462719961e-06, "loss": 0.281, "step": 10350 }, { "epoch": 1.8488888888888888, "grad_norm": 34.5, "learning_rate": 7.83213400253976e-06, "loss": 0.3403, "step": 10400 }, { "epoch": 1.8577777777777778, "grad_norm": 33.5, "learning_rate": 7.771663542359558e-06, "loss": 0.2971, "step": 10450 }, { "epoch": 1.8666666666666667, "grad_norm": 47.5, "learning_rate": 7.711193082179356e-06, "loss": 0.3233, "step": 10500 }, { "epoch": 1.8666666666666667, "eval_loss": 0.008435798808932304, "eval_runtime": 0.2404, "eval_samples_per_second": 41.595, "eval_steps_per_second": 8.319, "step": 10500 }, { "epoch": 1.8755555555555556, "grad_norm": 45.75, "learning_rate": 7.650722621999154e-06, "loss": 0.307, "step": 10550 }, { "epoch": 1.8844444444444446, "grad_norm": 34.0, "learning_rate": 7.590252161818952e-06, "loss": 0.3293, "step": 10600 }, { "epoch": 1.8933333333333333, "grad_norm": 51.25, "learning_rate": 7.52978170163875e-06, "loss": 0.3265, "step": 10650 }, { "epoch": 1.9022222222222223, "grad_norm": 33.25, "learning_rate": 7.4693112414585474e-06, "loss": 0.3356, "step": 10700 }, { "epoch": 1.911111111111111, "grad_norm": 45.25, "learning_rate": 7.408840781278346e-06, "loss": 0.303, "step": 10750 }, { "epoch": 1.92, "grad_norm": 40.75, "learning_rate": 7.348370321098144e-06, "loss": 0.3251, "step": 10800 }, { "epoch": 1.9288888888888889, "grad_norm": 32.0, "learning_rate": 7.2878998609179415e-06, "loss": 0.2962, "step": 10850 }, { "epoch": 1.9377777777777778, "grad_norm": 29.0, "learning_rate": 7.22742940073774e-06, "loss": 0.3057, "step": 10900 }, { "epoch": 1.9466666666666668, "grad_norm": 34.25, "learning_rate": 7.166958940557538e-06, "loss": 0.3112, "step": 10950 }, { "epoch": 1.9555555555555557, "grad_norm": 27.5, "learning_rate": 7.106488480377336e-06, "loss": 0.323, "step": 11000 }, { "epoch": 1.9555555555555557, "eval_loss": 0.008191155269742012, "eval_runtime": 0.2402, "eval_samples_per_second": 41.624, "eval_steps_per_second": 8.325, "step": 11000 }, { "epoch": 1.9644444444444444, "grad_norm": 48.5, "learning_rate": 7.046018020197134e-06, "loss": 0.3373, "step": 11050 }, { "epoch": 1.9733333333333334, "grad_norm": 26.375, "learning_rate": 6.985547560016932e-06, "loss": 0.307, "step": 11100 }, { "epoch": 1.982222222222222, "grad_norm": 29.125, "learning_rate": 6.92507709983673e-06, "loss": 0.3005, "step": 11150 }, { "epoch": 1.991111111111111, "grad_norm": 44.25, "learning_rate": 6.864606639656528e-06, "loss": 0.3017, "step": 11200 }, { "epoch": 2.0, "grad_norm": 35.0, "learning_rate": 6.804136179476326e-06, "loss": 0.3092, "step": 11250 }, { "epoch": 2.008888888888889, "grad_norm": 30.625, "learning_rate": 6.743665719296124e-06, "loss": 0.2326, "step": 11300 }, { "epoch": 2.017777777777778, "grad_norm": 25.625, "learning_rate": 6.683195259115922e-06, "loss": 0.2262, "step": 11350 }, { "epoch": 2.026666666666667, "grad_norm": 37.5, "learning_rate": 6.62272479893572e-06, "loss": 0.2507, "step": 11400 }, { "epoch": 2.0355555555555553, "grad_norm": 28.75, "learning_rate": 6.562254338755518e-06, "loss": 0.2335, "step": 11450 }, { "epoch": 2.0444444444444443, "grad_norm": 33.5, "learning_rate": 6.501783878575316e-06, "loss": 0.2481, "step": 11500 }, { "epoch": 2.0444444444444443, "eval_loss": 0.008659908547997475, "eval_runtime": 0.2316, "eval_samples_per_second": 43.172, "eval_steps_per_second": 8.634, "step": 11500 }, { "epoch": 2.0533333333333332, "grad_norm": 19.375, "learning_rate": 6.4413134183951144e-06, "loss": 0.2288, "step": 11550 }, { "epoch": 2.062222222222222, "grad_norm": 33.25, "learning_rate": 6.380842958214912e-06, "loss": 0.2372, "step": 11600 }, { "epoch": 2.071111111111111, "grad_norm": 17.25, "learning_rate": 6.32037249803471e-06, "loss": 0.2476, "step": 11650 }, { "epoch": 2.08, "grad_norm": 29.5, "learning_rate": 6.2599020378545085e-06, "loss": 0.2467, "step": 11700 }, { "epoch": 2.088888888888889, "grad_norm": 22.375, "learning_rate": 6.199431577674306e-06, "loss": 0.2503, "step": 11750 }, { "epoch": 2.097777777777778, "grad_norm": 35.5, "learning_rate": 6.138961117494104e-06, "loss": 0.249, "step": 11800 }, { "epoch": 2.1066666666666665, "grad_norm": 38.25, "learning_rate": 6.078490657313903e-06, "loss": 0.2392, "step": 11850 }, { "epoch": 2.1155555555555554, "grad_norm": 40.75, "learning_rate": 6.0180201971337e-06, "loss": 0.2451, "step": 11900 }, { "epoch": 2.1244444444444444, "grad_norm": 17.875, "learning_rate": 5.957549736953498e-06, "loss": 0.2744, "step": 11950 }, { "epoch": 2.1333333333333333, "grad_norm": 18.25, "learning_rate": 5.897079276773297e-06, "loss": 0.2577, "step": 12000 }, { "epoch": 2.1333333333333333, "eval_loss": 0.0083710215985775, "eval_runtime": 0.2415, "eval_samples_per_second": 41.406, "eval_steps_per_second": 8.281, "step": 12000 }, { "epoch": 2.1422222222222222, "grad_norm": 18.0, "learning_rate": 5.836608816593094e-06, "loss": 0.2294, "step": 12050 }, { "epoch": 2.151111111111111, "grad_norm": 42.5, "learning_rate": 5.776138356412892e-06, "loss": 0.2363, "step": 12100 }, { "epoch": 2.16, "grad_norm": 26.5, "learning_rate": 5.715667896232691e-06, "loss": 0.2335, "step": 12150 }, { "epoch": 2.168888888888889, "grad_norm": 41.5, "learning_rate": 5.655197436052488e-06, "loss": 0.259, "step": 12200 }, { "epoch": 2.1777777777777776, "grad_norm": 29.875, "learning_rate": 5.5947269758722865e-06, "loss": 0.2568, "step": 12250 }, { "epoch": 2.1866666666666665, "grad_norm": 57.0, "learning_rate": 5.534256515692085e-06, "loss": 0.2489, "step": 12300 }, { "epoch": 2.1955555555555555, "grad_norm": 49.0, "learning_rate": 5.473786055511883e-06, "loss": 0.2464, "step": 12350 }, { "epoch": 2.2044444444444444, "grad_norm": 27.375, "learning_rate": 5.4133155953316806e-06, "loss": 0.2362, "step": 12400 }, { "epoch": 2.2133333333333334, "grad_norm": 41.25, "learning_rate": 5.352845135151479e-06, "loss": 0.2397, "step": 12450 }, { "epoch": 2.2222222222222223, "grad_norm": 38.0, "learning_rate": 5.292374674971277e-06, "loss": 0.2569, "step": 12500 }, { "epoch": 2.2222222222222223, "eval_loss": 0.008943794295191765, "eval_runtime": 0.2377, "eval_samples_per_second": 42.063, "eval_steps_per_second": 8.413, "step": 12500 }, { "epoch": 2.2311111111111113, "grad_norm": 14.75, "learning_rate": 5.231904214791075e-06, "loss": 0.252, "step": 12550 }, { "epoch": 2.24, "grad_norm": 20.125, "learning_rate": 5.171433754610873e-06, "loss": 0.2718, "step": 12600 }, { "epoch": 2.2488888888888887, "grad_norm": 30.125, "learning_rate": 5.110963294430671e-06, "loss": 0.2743, "step": 12650 }, { "epoch": 2.2577777777777777, "grad_norm": 45.75, "learning_rate": 5.050492834250469e-06, "loss": 0.273, "step": 12700 }, { "epoch": 2.2666666666666666, "grad_norm": 29.25, "learning_rate": 4.990022374070267e-06, "loss": 0.2208, "step": 12750 }, { "epoch": 2.2755555555555556, "grad_norm": 50.25, "learning_rate": 4.929551913890065e-06, "loss": 0.2514, "step": 12800 }, { "epoch": 2.2844444444444445, "grad_norm": 30.125, "learning_rate": 4.869081453709863e-06, "loss": 0.2246, "step": 12850 }, { "epoch": 2.2933333333333334, "grad_norm": 60.5, "learning_rate": 4.808610993529661e-06, "loss": 0.2303, "step": 12900 }, { "epoch": 2.3022222222222224, "grad_norm": 37.25, "learning_rate": 4.748140533349459e-06, "loss": 0.2476, "step": 12950 }, { "epoch": 2.311111111111111, "grad_norm": 26.875, "learning_rate": 4.687670073169257e-06, "loss": 0.2241, "step": 13000 }, { "epoch": 2.311111111111111, "eval_loss": 0.008464875631034374, "eval_runtime": 0.2287, "eval_samples_per_second": 43.727, "eval_steps_per_second": 8.745, "step": 13000 }, { "epoch": 2.32, "grad_norm": 37.0, "learning_rate": 4.627199612989055e-06, "loss": 0.2368, "step": 13050 }, { "epoch": 2.328888888888889, "grad_norm": 30.375, "learning_rate": 4.5667291528088535e-06, "loss": 0.2178, "step": 13100 }, { "epoch": 2.3377777777777777, "grad_norm": 45.5, "learning_rate": 4.506258692628651e-06, "loss": 0.2493, "step": 13150 }, { "epoch": 2.3466666666666667, "grad_norm": 36.25, "learning_rate": 4.445788232448449e-06, "loss": 0.235, "step": 13200 }, { "epoch": 2.3555555555555556, "grad_norm": 32.25, "learning_rate": 4.3853177722682476e-06, "loss": 0.2474, "step": 13250 }, { "epoch": 2.3644444444444446, "grad_norm": 27.875, "learning_rate": 4.324847312088045e-06, "loss": 0.2374, "step": 13300 }, { "epoch": 2.3733333333333335, "grad_norm": 13.0625, "learning_rate": 4.264376851907843e-06, "loss": 0.2404, "step": 13350 }, { "epoch": 2.3822222222222225, "grad_norm": 34.25, "learning_rate": 4.203906391727642e-06, "loss": 0.2331, "step": 13400 }, { "epoch": 2.391111111111111, "grad_norm": 21.375, "learning_rate": 4.143435931547439e-06, "loss": 0.2332, "step": 13450 }, { "epoch": 2.4, "grad_norm": 36.5, "learning_rate": 4.082965471367237e-06, "loss": 0.2423, "step": 13500 }, { "epoch": 2.4, "eval_loss": 0.008836803957819939, "eval_runtime": 0.2285, "eval_samples_per_second": 43.761, "eval_steps_per_second": 8.752, "step": 13500 }, { "epoch": 2.408888888888889, "grad_norm": 24.625, "learning_rate": 4.022495011187036e-06, "loss": 0.2503, "step": 13550 }, { "epoch": 2.417777777777778, "grad_norm": 35.75, "learning_rate": 3.962024551006833e-06, "loss": 0.2484, "step": 13600 }, { "epoch": 2.4266666666666667, "grad_norm": 41.75, "learning_rate": 3.9015540908266315e-06, "loss": 0.26, "step": 13650 }, { "epoch": 2.4355555555555557, "grad_norm": 33.25, "learning_rate": 3.84108363064643e-06, "loss": 0.2402, "step": 13700 }, { "epoch": 2.4444444444444446, "grad_norm": 46.25, "learning_rate": 3.7806131704662272e-06, "loss": 0.2083, "step": 13750 }, { "epoch": 2.453333333333333, "grad_norm": 27.875, "learning_rate": 3.7201427102860256e-06, "loss": 0.214, "step": 13800 }, { "epoch": 2.462222222222222, "grad_norm": 21.625, "learning_rate": 3.6596722501058234e-06, "loss": 0.2677, "step": 13850 }, { "epoch": 2.471111111111111, "grad_norm": 30.75, "learning_rate": 3.5992017899256213e-06, "loss": 0.2371, "step": 13900 }, { "epoch": 2.48, "grad_norm": 38.75, "learning_rate": 3.5387313297454196e-06, "loss": 0.2461, "step": 13950 }, { "epoch": 2.488888888888889, "grad_norm": 25.75, "learning_rate": 3.4782608695652175e-06, "loss": 0.2414, "step": 14000 }, { "epoch": 2.488888888888889, "eval_loss": 0.00847357977181673, "eval_runtime": 0.2327, "eval_samples_per_second": 42.968, "eval_steps_per_second": 8.594, "step": 14000 }, { "epoch": 2.497777777777778, "grad_norm": 63.0, "learning_rate": 3.417790409385016e-06, "loss": 0.2657, "step": 14050 }, { "epoch": 2.506666666666667, "grad_norm": 49.0, "learning_rate": 3.3573199492048137e-06, "loss": 0.2417, "step": 14100 }, { "epoch": 2.5155555555555553, "grad_norm": 31.625, "learning_rate": 3.2968494890246116e-06, "loss": 0.2388, "step": 14150 }, { "epoch": 2.5244444444444447, "grad_norm": 38.25, "learning_rate": 3.23637902884441e-06, "loss": 0.2432, "step": 14200 }, { "epoch": 2.533333333333333, "grad_norm": 25.75, "learning_rate": 3.1759085686642078e-06, "loss": 0.2342, "step": 14250 }, { "epoch": 2.542222222222222, "grad_norm": 29.875, "learning_rate": 3.1154381084840057e-06, "loss": 0.2453, "step": 14300 }, { "epoch": 2.551111111111111, "grad_norm": 26.875, "learning_rate": 3.054967648303804e-06, "loss": 0.229, "step": 14350 }, { "epoch": 2.56, "grad_norm": 22.0, "learning_rate": 2.994497188123602e-06, "loss": 0.2452, "step": 14400 }, { "epoch": 2.568888888888889, "grad_norm": 38.25, "learning_rate": 2.9340267279433997e-06, "loss": 0.2435, "step": 14450 }, { "epoch": 2.5777777777777775, "grad_norm": 20.0, "learning_rate": 2.873556267763198e-06, "loss": 0.2353, "step": 14500 }, { "epoch": 2.5777777777777775, "eval_loss": 0.008571269921958447, "eval_runtime": 0.2385, "eval_samples_per_second": 41.921, "eval_steps_per_second": 8.384, "step": 14500 }, { "epoch": 2.586666666666667, "grad_norm": 37.0, "learning_rate": 2.813085807582996e-06, "loss": 0.2355, "step": 14550 }, { "epoch": 2.5955555555555554, "grad_norm": 25.25, "learning_rate": 2.752615347402794e-06, "loss": 0.2666, "step": 14600 }, { "epoch": 2.6044444444444443, "grad_norm": 51.25, "learning_rate": 2.692144887222592e-06, "loss": 0.2361, "step": 14650 }, { "epoch": 2.6133333333333333, "grad_norm": 21.75, "learning_rate": 2.63167442704239e-06, "loss": 0.2313, "step": 14700 }, { "epoch": 2.6222222222222222, "grad_norm": 36.25, "learning_rate": 2.571203966862188e-06, "loss": 0.2238, "step": 14750 }, { "epoch": 2.631111111111111, "grad_norm": 27.5, "learning_rate": 2.510733506681986e-06, "loss": 0.2526, "step": 14800 }, { "epoch": 2.64, "grad_norm": 42.5, "learning_rate": 2.450263046501784e-06, "loss": 0.2189, "step": 14850 }, { "epoch": 2.648888888888889, "grad_norm": 26.0, "learning_rate": 2.389792586321582e-06, "loss": 0.23, "step": 14900 }, { "epoch": 2.6577777777777776, "grad_norm": 26.875, "learning_rate": 2.3293221261413803e-06, "loss": 0.2432, "step": 14950 }, { "epoch": 2.6666666666666665, "grad_norm": 42.75, "learning_rate": 2.268851665961178e-06, "loss": 0.2274, "step": 15000 }, { "epoch": 2.6666666666666665, "eval_loss": 0.008635434322059155, "eval_runtime": 0.2354, "eval_samples_per_second": 42.477, "eval_steps_per_second": 8.495, "step": 15000 }, { "epoch": 2.6755555555555555, "grad_norm": 61.0, "learning_rate": 2.208381205780976e-06, "loss": 0.2729, "step": 15050 }, { "epoch": 2.6844444444444444, "grad_norm": 54.0, "learning_rate": 2.1479107456007743e-06, "loss": 0.252, "step": 15100 }, { "epoch": 2.6933333333333334, "grad_norm": 36.25, "learning_rate": 2.0874402854205722e-06, "loss": 0.248, "step": 15150 }, { "epoch": 2.7022222222222223, "grad_norm": 36.5, "learning_rate": 2.02696982524037e-06, "loss": 0.2529, "step": 15200 }, { "epoch": 2.7111111111111112, "grad_norm": 55.5, "learning_rate": 1.9664993650601684e-06, "loss": 0.2213, "step": 15250 }, { "epoch": 2.7199999999999998, "grad_norm": 26.375, "learning_rate": 1.9060289048799663e-06, "loss": 0.2291, "step": 15300 }, { "epoch": 2.728888888888889, "grad_norm": 19.625, "learning_rate": 1.8455584446997644e-06, "loss": 0.2448, "step": 15350 }, { "epoch": 2.7377777777777776, "grad_norm": 24.75, "learning_rate": 1.7850879845195623e-06, "loss": 0.2385, "step": 15400 }, { "epoch": 2.7466666666666666, "grad_norm": 18.25, "learning_rate": 1.7246175243393604e-06, "loss": 0.2213, "step": 15450 }, { "epoch": 2.7555555555555555, "grad_norm": 21.375, "learning_rate": 1.6641470641591585e-06, "loss": 0.2616, "step": 15500 }, { "epoch": 2.7555555555555555, "eval_loss": 0.008459658361971378, "eval_runtime": 0.2312, "eval_samples_per_second": 43.248, "eval_steps_per_second": 8.65, "step": 15500 }, { "epoch": 2.7644444444444445, "grad_norm": 29.125, "learning_rate": 1.6036766039789564e-06, "loss": 0.2575, "step": 15550 }, { "epoch": 2.7733333333333334, "grad_norm": 22.375, "learning_rate": 1.5432061437987544e-06, "loss": 0.2523, "step": 15600 }, { "epoch": 2.7822222222222224, "grad_norm": 12.9375, "learning_rate": 1.4827356836185525e-06, "loss": 0.2463, "step": 15650 }, { "epoch": 2.7911111111111113, "grad_norm": 26.5, "learning_rate": 1.4222652234383504e-06, "loss": 0.2429, "step": 15700 }, { "epoch": 2.8, "grad_norm": 36.25, "learning_rate": 1.3617947632581485e-06, "loss": 0.2605, "step": 15750 }, { "epoch": 2.8088888888888888, "grad_norm": 42.25, "learning_rate": 1.3013243030779466e-06, "loss": 0.2566, "step": 15800 }, { "epoch": 2.8177777777777777, "grad_norm": 16.25, "learning_rate": 1.2408538428977445e-06, "loss": 0.2234, "step": 15850 }, { "epoch": 2.8266666666666667, "grad_norm": 20.625, "learning_rate": 1.1803833827175426e-06, "loss": 0.2523, "step": 15900 }, { "epoch": 2.8355555555555556, "grad_norm": 39.5, "learning_rate": 1.1199129225373407e-06, "loss": 0.2528, "step": 15950 }, { "epoch": 2.8444444444444446, "grad_norm": 30.875, "learning_rate": 1.0594424623571386e-06, "loss": 0.2304, "step": 16000 }, { "epoch": 2.8444444444444446, "eval_loss": 0.008183728903532028, "eval_runtime": 0.2301, "eval_samples_per_second": 43.458, "eval_steps_per_second": 8.692, "step": 16000 }, { "epoch": 2.8533333333333335, "grad_norm": 35.5, "learning_rate": 9.989720021769367e-07, "loss": 0.2496, "step": 16050 }, { "epoch": 2.862222222222222, "grad_norm": 38.75, "learning_rate": 9.385015419967347e-07, "loss": 0.2264, "step": 16100 }, { "epoch": 2.871111111111111, "grad_norm": 44.75, "learning_rate": 8.780310818165328e-07, "loss": 0.2509, "step": 16150 }, { "epoch": 2.88, "grad_norm": 42.0, "learning_rate": 8.175606216363307e-07, "loss": 0.269, "step": 16200 }, { "epoch": 2.888888888888889, "grad_norm": 25.5, "learning_rate": 7.570901614561288e-07, "loss": 0.2497, "step": 16250 }, { "epoch": 2.897777777777778, "grad_norm": 30.75, "learning_rate": 6.966197012759268e-07, "loss": 0.2629, "step": 16300 }, { "epoch": 2.9066666666666667, "grad_norm": 29.875, "learning_rate": 6.361492410957248e-07, "loss": 0.2537, "step": 16350 }, { "epoch": 2.9155555555555557, "grad_norm": 39.5, "learning_rate": 5.756787809155228e-07, "loss": 0.2633, "step": 16400 }, { "epoch": 2.924444444444444, "grad_norm": 25.75, "learning_rate": 5.152083207353208e-07, "loss": 0.2272, "step": 16450 }, { "epoch": 2.9333333333333336, "grad_norm": 31.375, "learning_rate": 4.5473786055511884e-07, "loss": 0.2259, "step": 16500 }, { "epoch": 2.9333333333333336, "eval_loss": 0.008398449048399925, "eval_runtime": 0.2374, "eval_samples_per_second": 42.13, "eval_steps_per_second": 8.426, "step": 16500 }, { "epoch": 2.942222222222222, "grad_norm": 30.625, "learning_rate": 3.942674003749169e-07, "loss": 0.2386, "step": 16550 }, { "epoch": 2.951111111111111, "grad_norm": 24.625, "learning_rate": 3.3379694019471493e-07, "loss": 0.2298, "step": 16600 }, { "epoch": 2.96, "grad_norm": 40.25, "learning_rate": 2.733264800145129e-07, "loss": 0.2364, "step": 16650 }, { "epoch": 2.968888888888889, "grad_norm": 27.0, "learning_rate": 2.1285601983431096e-07, "loss": 0.2397, "step": 16700 }, { "epoch": 2.977777777777778, "grad_norm": 36.75, "learning_rate": 1.5238555965410898e-07, "loss": 0.2443, "step": 16750 }, { "epoch": 2.986666666666667, "grad_norm": 31.0, "learning_rate": 9.191509947390701e-08, "loss": 0.2231, "step": 16800 }, { "epoch": 2.9955555555555557, "grad_norm": 26.5, "learning_rate": 3.144463929370503e-08, "loss": 0.2604, "step": 16850 } ], "logging_steps": 50, "max_steps": 16875, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.4299467032690688e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }