{ "best_global_step": 500, "best_metric": 0.3842231333255768, "best_model_checkpoint": null, "epoch": 100.0, "eval_steps": 500, "global_step": 5400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.8518518518518519, "grad_norm": 7.101864814758301, "learning_rate": 9.900000000000002e-06, "loss": 0.8974, "step": 100 }, { "epoch": 3.7037037037037037, "grad_norm": 10.462117195129395, "learning_rate": 1.9900000000000003e-05, "loss": 0.4183, "step": 200 }, { "epoch": 5.555555555555555, "grad_norm": 0.6395331025123596, "learning_rate": 2.9900000000000002e-05, "loss": 0.109, "step": 300 }, { "epoch": 7.407407407407407, "grad_norm": 11.952120780944824, "learning_rate": 3.99e-05, "loss": 0.0507, "step": 400 }, { "epoch": 9.25925925925926, "grad_norm": 0.16501592099666595, "learning_rate": 4.99e-05, "loss": 0.0316, "step": 500 }, { "epoch": 9.25925925925926, "eval_loss": 0.3842231333255768, "eval_runtime": 0.2479, "eval_samples_per_second": 44.376, "eval_steps_per_second": 12.103, "step": 500 }, { "epoch": 11.11111111111111, "grad_norm": 0.6681220531463623, "learning_rate": 4.898979591836735e-05, "loss": 0.0549, "step": 600 }, { "epoch": 12.962962962962964, "grad_norm": 0.18139339983463287, "learning_rate": 4.796938775510204e-05, "loss": 0.0309, "step": 700 }, { "epoch": 14.814814814814815, "grad_norm": 0.1267923265695572, "learning_rate": 4.6948979591836736e-05, "loss": 0.023, "step": 800 }, { "epoch": 16.666666666666668, "grad_norm": 0.012054799124598503, "learning_rate": 4.592857142857143e-05, "loss": 0.0031, "step": 900 }, { "epoch": 18.51851851851852, "grad_norm": 0.014743717387318611, "learning_rate": 4.4908163265306125e-05, "loss": 0.026, "step": 1000 }, { "epoch": 18.51851851851852, "eval_loss": 0.4349963665008545, "eval_runtime": 0.1782, "eval_samples_per_second": 61.73, "eval_steps_per_second": 16.835, "step": 1000 }, { "epoch": 20.37037037037037, "grad_norm": 0.014977260492742062, "learning_rate": 4.388775510204082e-05, "loss": 0.001, "step": 1100 }, { "epoch": 22.22222222222222, "grad_norm": 0.008753976784646511, "learning_rate": 4.286734693877551e-05, "loss": 0.0004, "step": 1200 }, { "epoch": 24.074074074074073, "grad_norm": 0.014590133912861347, "learning_rate": 4.184693877551021e-05, "loss": 0.0005, "step": 1300 }, { "epoch": 25.925925925925927, "grad_norm": 0.03366304934024811, "learning_rate": 4.08265306122449e-05, "loss": 0.0001, "step": 1400 }, { "epoch": 27.77777777777778, "grad_norm": 0.015341528691351414, "learning_rate": 3.980612244897959e-05, "loss": 0.0001, "step": 1500 }, { "epoch": 27.77777777777778, "eval_loss": 0.5423622131347656, "eval_runtime": 0.1826, "eval_samples_per_second": 60.25, "eval_steps_per_second": 16.432, "step": 1500 }, { "epoch": 29.62962962962963, "grad_norm": 0.004611788783222437, "learning_rate": 3.8785714285714285e-05, "loss": 0.0001, "step": 1600 }, { "epoch": 31.48148148148148, "grad_norm": 0.0017561103450134397, "learning_rate": 3.776530612244898e-05, "loss": 0.0075, "step": 1700 }, { "epoch": 33.333333333333336, "grad_norm": 0.011370708234608173, "learning_rate": 3.674489795918368e-05, "loss": 0.0046, "step": 1800 }, { "epoch": 35.18518518518518, "grad_norm": 0.0015067611820995808, "learning_rate": 3.572448979591837e-05, "loss": 0.0001, "step": 1900 }, { "epoch": 37.03703703703704, "grad_norm": 0.0012736656935885549, "learning_rate": 3.470408163265306e-05, "loss": 0.0001, "step": 2000 }, { "epoch": 37.03703703703704, "eval_loss": 0.5318173766136169, "eval_runtime": 0.1851, "eval_samples_per_second": 59.427, "eval_steps_per_second": 16.207, "step": 2000 }, { "epoch": 38.888888888888886, "grad_norm": 0.0020575050730258226, "learning_rate": 3.3683673469387757e-05, "loss": 0.0001, "step": 2100 }, { "epoch": 40.74074074074074, "grad_norm": 0.002286889823153615, "learning_rate": 3.266326530612245e-05, "loss": 0.0007, "step": 2200 }, { "epoch": 42.592592592592595, "grad_norm": 0.011977535672485828, "learning_rate": 3.1642857142857145e-05, "loss": 0.0029, "step": 2300 }, { "epoch": 44.44444444444444, "grad_norm": 0.18020747601985931, "learning_rate": 3.062244897959184e-05, "loss": 0.0293, "step": 2400 }, { "epoch": 46.2962962962963, "grad_norm": 0.00249957456253469, "learning_rate": 2.960204081632653e-05, "loss": 0.0201, "step": 2500 }, { "epoch": 46.2962962962963, "eval_loss": 0.49513018131256104, "eval_runtime": 0.1867, "eval_samples_per_second": 58.916, "eval_steps_per_second": 16.068, "step": 2500 }, { "epoch": 48.148148148148145, "grad_norm": 0.0021083306055516005, "learning_rate": 2.8581632653061225e-05, "loss": 0.0052, "step": 2600 }, { "epoch": 50.0, "grad_norm": 0.006301419343799353, "learning_rate": 2.7561224489795916e-05, "loss": 0.0001, "step": 2700 }, { "epoch": 51.851851851851855, "grad_norm": 0.001658000866882503, "learning_rate": 2.6540816326530614e-05, "loss": 0.0001, "step": 2800 }, { "epoch": 53.7037037037037, "grad_norm": 0.0013888307148590684, "learning_rate": 2.5520408163265308e-05, "loss": 0.0018, "step": 2900 }, { "epoch": 55.55555555555556, "grad_norm": 0.059469956904649734, "learning_rate": 2.45e-05, "loss": 0.0001, "step": 3000 }, { "epoch": 55.55555555555556, "eval_loss": 0.5068791508674622, "eval_runtime": 0.1872, "eval_samples_per_second": 58.764, "eval_steps_per_second": 16.026, "step": 3000 }, { "epoch": 57.407407407407405, "grad_norm": 0.002175951609387994, "learning_rate": 2.3479591836734697e-05, "loss": 0.0001, "step": 3100 }, { "epoch": 59.25925925925926, "grad_norm": 0.0020811487920582294, "learning_rate": 2.2459183673469388e-05, "loss": 0.0, "step": 3200 }, { "epoch": 61.111111111111114, "grad_norm": 0.002122443402186036, "learning_rate": 2.1438775510204082e-05, "loss": 0.0114, "step": 3300 }, { "epoch": 62.96296296296296, "grad_norm": 0.00158906658180058, "learning_rate": 2.0418367346938777e-05, "loss": 0.0, "step": 3400 }, { "epoch": 64.81481481481481, "grad_norm": 0.0007862930651754141, "learning_rate": 1.939795918367347e-05, "loss": 0.0, "step": 3500 }, { "epoch": 64.81481481481481, "eval_loss": 0.5442617535591125, "eval_runtime": 0.1844, "eval_samples_per_second": 59.657, "eval_steps_per_second": 16.27, "step": 3500 }, { "epoch": 66.66666666666667, "grad_norm": 0.008862162008881569, "learning_rate": 1.8377551020408165e-05, "loss": 0.0005, "step": 3600 }, { "epoch": 68.51851851851852, "grad_norm": 0.0025289393961429596, "learning_rate": 1.7357142857142856e-05, "loss": 0.0078, "step": 3700 }, { "epoch": 70.37037037037037, "grad_norm": 0.0008086733869276941, "learning_rate": 1.633673469387755e-05, "loss": 0.0001, "step": 3800 }, { "epoch": 72.22222222222223, "grad_norm": 0.0024846054147928953, "learning_rate": 1.5316326530612245e-05, "loss": 0.0, "step": 3900 }, { "epoch": 74.07407407407408, "grad_norm": 0.001633179490454495, "learning_rate": 1.4295918367346938e-05, "loss": 0.0, "step": 4000 }, { "epoch": 74.07407407407408, "eval_loss": 0.5683199167251587, "eval_runtime": 0.1872, "eval_samples_per_second": 58.759, "eval_steps_per_second": 16.025, "step": 4000 }, { "epoch": 75.92592592592592, "grad_norm": 0.002557038329541683, "learning_rate": 1.3275510204081634e-05, "loss": 0.0, "step": 4100 }, { "epoch": 77.77777777777777, "grad_norm": 0.002890221541747451, "learning_rate": 1.2255102040816327e-05, "loss": 0.0, "step": 4200 }, { "epoch": 79.62962962962963, "grad_norm": 0.0013914318988099694, "learning_rate": 1.1234693877551021e-05, "loss": 0.0, "step": 4300 }, { "epoch": 81.48148148148148, "grad_norm": 0.0009156959713436663, "learning_rate": 1.0214285714285715e-05, "loss": 0.0, "step": 4400 }, { "epoch": 83.33333333333333, "grad_norm": 0.0012320117093622684, "learning_rate": 9.19387755102041e-06, "loss": 0.0, "step": 4500 }, { "epoch": 83.33333333333333, "eval_loss": 0.5750726461410522, "eval_runtime": 0.1871, "eval_samples_per_second": 58.787, "eval_steps_per_second": 16.033, "step": 4500 }, { "epoch": 85.18518518518519, "grad_norm": 0.000415924092521891, "learning_rate": 8.173469387755103e-06, "loss": 0.0, "step": 4600 }, { "epoch": 87.03703703703704, "grad_norm": 0.0011823369422927499, "learning_rate": 7.153061224489796e-06, "loss": 0.0, "step": 4700 }, { "epoch": 88.88888888888889, "grad_norm": 0.0014568202896043658, "learning_rate": 6.1326530612244905e-06, "loss": 0.0, "step": 4800 }, { "epoch": 90.74074074074075, "grad_norm": 0.0004411433474160731, "learning_rate": 5.112244897959184e-06, "loss": 0.0, "step": 4900 }, { "epoch": 92.5925925925926, "grad_norm": 0.0016104909591376781, "learning_rate": 4.0918367346938775e-06, "loss": 0.0, "step": 5000 }, { "epoch": 92.5925925925926, "eval_loss": 0.5782183408737183, "eval_runtime": 0.1887, "eval_samples_per_second": 58.296, "eval_steps_per_second": 15.899, "step": 5000 }, { "epoch": 94.44444444444444, "grad_norm": 0.0005303300567902625, "learning_rate": 3.0714285714285715e-06, "loss": 0.0, "step": 5100 }, { "epoch": 96.29629629629629, "grad_norm": 0.00046598046901635826, "learning_rate": 2.0510204081632654e-06, "loss": 0.0, "step": 5200 }, { "epoch": 98.14814814814815, "grad_norm": 0.0015102053293958306, "learning_rate": 1.0306122448979592e-06, "loss": 0.0, "step": 5300 }, { "epoch": 100.0, "grad_norm": 0.001883647171780467, "learning_rate": 1.0204081632653062e-08, "loss": 0.0, "step": 5400 } ], "logging_steps": 100, "max_steps": 5400, "num_input_tokens_seen": 0, "num_train_epochs": 100, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 728814845952000.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }