{ "best_global_step": 240, "best_metric": 2.09912371635437, "best_model_checkpoint": "./mt5_summary_model\\checkpoint-240", "epoch": 3.0, "eval_steps": 40, "global_step": 240, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.125, "grad_norm": 41460.79296875, "learning_rate": 1.955e-05, "loss": 15.9769, "step": 10 }, { "epoch": 0.25, "grad_norm": 7548.4443359375, "learning_rate": 1.9050000000000002e-05, "loss": 14.8679, "step": 20 }, { "epoch": 0.375, "grad_norm": 6171.39013671875, "learning_rate": 1.855e-05, "loss": 14.4649, "step": 30 }, { "epoch": 0.5, "grad_norm": 3173.07275390625, "learning_rate": 1.805e-05, "loss": 12.9826, "step": 40 }, { "epoch": 0.5, "eval_loss": 7.740403175354004, "eval_runtime": 45.4998, "eval_samples_per_second": 1.582, "eval_steps_per_second": 0.198, "step": 40 }, { "epoch": 0.625, "grad_norm": 3397.85302734375, "learning_rate": 1.755e-05, "loss": 11.9366, "step": 50 }, { "epoch": 0.75, "grad_norm": 6715.337890625, "learning_rate": 1.705e-05, "loss": 11.328, "step": 60 }, { "epoch": 0.875, "grad_norm": 4861.546875, "learning_rate": 1.6550000000000002e-05, "loss": 11.3735, "step": 70 }, { "epoch": 1.0, "grad_norm": 12531.2421875, "learning_rate": 1.605e-05, "loss": 10.5015, "step": 80 }, { "epoch": 1.0, "eval_loss": 5.373843669891357, "eval_runtime": 172.11, "eval_samples_per_second": 0.418, "eval_steps_per_second": 0.052, "step": 80 }, { "epoch": 1.125, "grad_norm": 1363.3099365234375, "learning_rate": 1.5550000000000002e-05, "loss": 9.7802, "step": 90 }, { "epoch": 1.25, "grad_norm": 3557.00537109375, "learning_rate": 1.505e-05, "loss": 9.3325, "step": 100 }, { "epoch": 1.375, "grad_norm": 448.0030517578125, "learning_rate": 1.4550000000000001e-05, "loss": 8.1717, "step": 110 }, { "epoch": 1.5, "grad_norm": 845.931640625, "learning_rate": 1.4050000000000001e-05, "loss": 7.581, "step": 120 }, { "epoch": 1.5, "eval_loss": 3.380208969116211, "eval_runtime": 172.0401, "eval_samples_per_second": 0.419, "eval_steps_per_second": 0.052, "step": 120 }, { "epoch": 1.625, "grad_norm": 1770.1221923828125, "learning_rate": 1.355e-05, "loss": 7.053, "step": 130 }, { "epoch": 1.75, "grad_norm": 38.347225189208984, "learning_rate": 1.305e-05, "loss": 6.2872, "step": 140 }, { "epoch": 1.875, "grad_norm": 139.71669006347656, "learning_rate": 1.255e-05, "loss": 5.6765, "step": 150 }, { "epoch": 2.0, "grad_norm": 67.0308837890625, "learning_rate": 1.2050000000000002e-05, "loss": 4.9915, "step": 160 }, { "epoch": 2.0, "eval_loss": 2.404210329055786, "eval_runtime": 172.0874, "eval_samples_per_second": 0.418, "eval_steps_per_second": 0.052, "step": 160 }, { "epoch": 2.125, "grad_norm": 73.80687713623047, "learning_rate": 1.1550000000000001e-05, "loss": 4.6035, "step": 170 }, { "epoch": 2.25, "grad_norm": 14.295919418334961, "learning_rate": 1.1050000000000001e-05, "loss": 4.4453, "step": 180 }, { "epoch": 2.375, "grad_norm": 18.72945785522461, "learning_rate": 1.055e-05, "loss": 3.8718, "step": 190 }, { "epoch": 2.5, "grad_norm": 132.57345581054688, "learning_rate": 1.005e-05, "loss": 3.8554, "step": 200 }, { "epoch": 2.5, "eval_loss": 2.212625741958618, "eval_runtime": 172.1408, "eval_samples_per_second": 0.418, "eval_steps_per_second": 0.052, "step": 200 }, { "epoch": 2.625, "grad_norm": 6.234254360198975, "learning_rate": 9.55e-06, "loss": 3.481, "step": 210 }, { "epoch": 2.75, "grad_norm": 5.568007946014404, "learning_rate": 9.050000000000001e-06, "loss": 3.4293, "step": 220 }, { "epoch": 2.875, "grad_norm": 6.030545234680176, "learning_rate": 8.550000000000001e-06, "loss": 3.2727, "step": 230 }, { "epoch": 3.0, "grad_norm": 5.541934013366699, "learning_rate": 8.050000000000001e-06, "loss": 3.2418, "step": 240 }, { "epoch": 3.0, "eval_loss": 2.09912371635437, "eval_runtime": 172.0066, "eval_samples_per_second": 0.419, "eval_steps_per_second": 0.052, "step": 240 } ], "logging_steps": 10, "max_steps": 400, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 40, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4604337145774080.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }