{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9993764290168364, "eval_steps": 500, "global_step": 1202, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.020785699438786116, "grad_norm": 2.734440803527832, "learning_rate": 5e-06, "loss": 3.9975, "step": 25 }, { "epoch": 0.04157139887757223, "grad_norm": 2.1083433628082275, "learning_rate": 1e-05, "loss": 3.9298, "step": 50 }, { "epoch": 0.06235709831635834, "grad_norm": 1.990794062614441, "learning_rate": 9.782986111111113e-06, "loss": 3.7079, "step": 75 }, { "epoch": 0.08314279775514447, "grad_norm": 1.1073641777038574, "learning_rate": 9.565972222222222e-06, "loss": 3.4886, "step": 100 }, { "epoch": 0.10392849719393057, "grad_norm": 0.7308239340782166, "learning_rate": 9.348958333333335e-06, "loss": 3.286, "step": 125 }, { "epoch": 0.12471419663271668, "grad_norm": 0.6134746670722961, "learning_rate": 9.131944444444445e-06, "loss": 3.1505, "step": 150 }, { "epoch": 0.1454998960715028, "grad_norm": 0.5232350826263428, "learning_rate": 8.914930555555556e-06, "loss": 3.099, "step": 175 }, { "epoch": 0.16628559551028893, "grad_norm": 0.5310938954353333, "learning_rate": 8.697916666666667e-06, "loss": 3.0112, "step": 200 }, { "epoch": 0.18707129494907504, "grad_norm": 0.4157707095146179, "learning_rate": 8.48090277777778e-06, "loss": 2.8997, "step": 225 }, { "epoch": 0.20785699438786115, "grad_norm": 0.38247939944267273, "learning_rate": 8.263888888888888e-06, "loss": 2.8774, "step": 250 }, { "epoch": 0.22864269382664726, "grad_norm": 0.43697381019592285, "learning_rate": 8.046875e-06, "loss": 2.8397, "step": 275 }, { "epoch": 0.24942839326543337, "grad_norm": 0.43171486258506775, "learning_rate": 7.829861111111112e-06, "loss": 2.7897, "step": 300 }, { "epoch": 0.2702140927042195, "grad_norm": 0.35729026794433594, "learning_rate": 7.612847222222223e-06, "loss": 2.7498, "step": 325 }, { "epoch": 0.2909997921430056, "grad_norm": 0.4240734279155731, "learning_rate": 7.395833333333335e-06, "loss": 2.6836, "step": 350 }, { "epoch": 0.31178549158179175, "grad_norm": 0.3893283009529114, "learning_rate": 7.1788194444444445e-06, "loss": 2.7183, "step": 375 }, { "epoch": 0.33257119102057786, "grad_norm": 0.3917147219181061, "learning_rate": 6.961805555555556e-06, "loss": 2.6586, "step": 400 }, { "epoch": 0.35335689045936397, "grad_norm": 0.44135338068008423, "learning_rate": 6.744791666666667e-06, "loss": 2.653, "step": 425 }, { "epoch": 0.3741425898981501, "grad_norm": 0.3476935625076294, "learning_rate": 6.5277777777777784e-06, "loss": 2.5654, "step": 450 }, { "epoch": 0.3949282893369362, "grad_norm": 0.24660900235176086, "learning_rate": 6.310763888888889e-06, "loss": 2.5625, "step": 475 }, { "epoch": 0.4157139887757223, "grad_norm": 0.2546718716621399, "learning_rate": 6.093750000000001e-06, "loss": 2.5691, "step": 500 }, { "epoch": 0.4364996882145084, "grad_norm": 0.24869012832641602, "learning_rate": 5.876736111111112e-06, "loss": 2.5861, "step": 525 }, { "epoch": 0.4572853876532945, "grad_norm": 0.2396017462015152, "learning_rate": 5.659722222222222e-06, "loss": 2.565, "step": 550 }, { "epoch": 0.4780710870920806, "grad_norm": 0.26274845004081726, "learning_rate": 5.442708333333334e-06, "loss": 2.5191, "step": 575 }, { "epoch": 0.49885678653086674, "grad_norm": 0.24700729548931122, "learning_rate": 5.2256944444444445e-06, "loss": 2.486, "step": 600 }, { "epoch": 0.5196424859696529, "grad_norm": 0.2400694340467453, "learning_rate": 5.008680555555556e-06, "loss": 2.4332, "step": 625 }, { "epoch": 0.540428185408439, "grad_norm": 0.23329533636569977, "learning_rate": 4.791666666666668e-06, "loss": 2.5027, "step": 650 }, { "epoch": 0.5612138848472251, "grad_norm": 0.2405698299407959, "learning_rate": 4.574652777777778e-06, "loss": 2.4649, "step": 675 }, { "epoch": 0.5819995842860112, "grad_norm": 0.2957931458950043, "learning_rate": 4.357638888888889e-06, "loss": 2.4246, "step": 700 }, { "epoch": 0.6027852837247973, "grad_norm": 0.2754002511501312, "learning_rate": 4.140625000000001e-06, "loss": 2.5025, "step": 725 }, { "epoch": 0.6235709831635835, "grad_norm": 0.2665573060512543, "learning_rate": 3.9236111111111114e-06, "loss": 2.4752, "step": 750 }, { "epoch": 0.6443566826023696, "grad_norm": 0.26163598895072937, "learning_rate": 3.7065972222222226e-06, "loss": 2.4401, "step": 775 }, { "epoch": 0.6651423820411557, "grad_norm": 0.25856491923332214, "learning_rate": 3.4895833333333333e-06, "loss": 2.4005, "step": 800 }, { "epoch": 0.6859280814799418, "grad_norm": 0.2826252579689026, "learning_rate": 3.2725694444444445e-06, "loss": 2.4668, "step": 825 }, { "epoch": 0.7067137809187279, "grad_norm": 0.23859556019306183, "learning_rate": 3.055555555555556e-06, "loss": 2.4815, "step": 850 }, { "epoch": 0.727499480357514, "grad_norm": 0.1961268186569214, "learning_rate": 2.838541666666667e-06, "loss": 2.4864, "step": 875 }, { "epoch": 0.7482851797963002, "grad_norm": 0.23380087316036224, "learning_rate": 2.621527777777778e-06, "loss": 2.445, "step": 900 }, { "epoch": 0.7690708792350862, "grad_norm": 0.181913822889328, "learning_rate": 2.404513888888889e-06, "loss": 2.4395, "step": 925 }, { "epoch": 0.7898565786738724, "grad_norm": 0.1909315139055252, "learning_rate": 2.1875000000000002e-06, "loss": 2.48, "step": 950 }, { "epoch": 0.8106422781126585, "grad_norm": 0.2427852749824524, "learning_rate": 1.9704861111111114e-06, "loss": 2.4229, "step": 975 }, { "epoch": 0.8314279775514446, "grad_norm": 0.2102808803319931, "learning_rate": 1.7534722222222223e-06, "loss": 2.4376, "step": 1000 }, { "epoch": 0.8522136769902308, "grad_norm": 0.2348516285419464, "learning_rate": 1.5364583333333335e-06, "loss": 2.4957, "step": 1025 }, { "epoch": 0.8729993764290168, "grad_norm": 0.24628274142742157, "learning_rate": 1.3194444444444446e-06, "loss": 2.4533, "step": 1050 }, { "epoch": 0.893785075867803, "grad_norm": 0.19529680907726288, "learning_rate": 1.1024305555555556e-06, "loss": 2.5214, "step": 1075 }, { "epoch": 0.914570775306589, "grad_norm": 0.21463939547538757, "learning_rate": 8.854166666666668e-07, "loss": 2.4413, "step": 1100 }, { "epoch": 0.9353564747453752, "grad_norm": 0.20561440289020538, "learning_rate": 6.684027777777778e-07, "loss": 2.42, "step": 1125 }, { "epoch": 0.9561421741841613, "grad_norm": 0.21936245262622833, "learning_rate": 4.5138888888888893e-07, "loss": 2.5077, "step": 1150 }, { "epoch": 0.9769278736229474, "grad_norm": 0.20694172382354736, "learning_rate": 2.3437500000000003e-07, "loss": 2.4735, "step": 1175 }, { "epoch": 0.9977135730617335, "grad_norm": 0.23707596957683563, "learning_rate": 1.736111111111111e-08, "loss": 2.4102, "step": 1200 } ], "logging_steps": 25, "max_steps": 1202, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.61064189789568e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }