| { | |
| "best_global_step": 240, | |
| "best_metric": 2.09912371635437, | |
| "best_model_checkpoint": "./mt5_summary_model\\checkpoint-240", | |
| "epoch": 3.0, | |
| "eval_steps": 40, | |
| "global_step": 240, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.125, | |
| "grad_norm": 41460.79296875, | |
| "learning_rate": 1.955e-05, | |
| "loss": 15.9769, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 7548.4443359375, | |
| "learning_rate": 1.9050000000000002e-05, | |
| "loss": 14.8679, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.375, | |
| "grad_norm": 6171.39013671875, | |
| "learning_rate": 1.855e-05, | |
| "loss": 14.4649, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 3173.07275390625, | |
| "learning_rate": 1.805e-05, | |
| "loss": 12.9826, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_loss": 7.740403175354004, | |
| "eval_runtime": 45.4998, | |
| "eval_samples_per_second": 1.582, | |
| "eval_steps_per_second": 0.198, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.625, | |
| "grad_norm": 3397.85302734375, | |
| "learning_rate": 1.755e-05, | |
| "loss": 11.9366, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 6715.337890625, | |
| "learning_rate": 1.705e-05, | |
| "loss": 11.328, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.875, | |
| "grad_norm": 4861.546875, | |
| "learning_rate": 1.6550000000000002e-05, | |
| "loss": 11.3735, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 12531.2421875, | |
| "learning_rate": 1.605e-05, | |
| "loss": 10.5015, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 5.373843669891357, | |
| "eval_runtime": 172.11, | |
| "eval_samples_per_second": 0.418, | |
| "eval_steps_per_second": 0.052, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.125, | |
| "grad_norm": 1363.3099365234375, | |
| "learning_rate": 1.5550000000000002e-05, | |
| "loss": 9.7802, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 3557.00537109375, | |
| "learning_rate": 1.505e-05, | |
| "loss": 9.3325, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.375, | |
| "grad_norm": 448.0030517578125, | |
| "learning_rate": 1.4550000000000001e-05, | |
| "loss": 8.1717, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 845.931640625, | |
| "learning_rate": 1.4050000000000001e-05, | |
| "loss": 7.581, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "eval_loss": 3.380208969116211, | |
| "eval_runtime": 172.0401, | |
| "eval_samples_per_second": 0.419, | |
| "eval_steps_per_second": 0.052, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.625, | |
| "grad_norm": 1770.1221923828125, | |
| "learning_rate": 1.355e-05, | |
| "loss": 7.053, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 38.347225189208984, | |
| "learning_rate": 1.305e-05, | |
| "loss": 6.2872, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.875, | |
| "grad_norm": 139.71669006347656, | |
| "learning_rate": 1.255e-05, | |
| "loss": 5.6765, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 67.0308837890625, | |
| "learning_rate": 1.2050000000000002e-05, | |
| "loss": 4.9915, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 2.404210329055786, | |
| "eval_runtime": 172.0874, | |
| "eval_samples_per_second": 0.418, | |
| "eval_steps_per_second": 0.052, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 2.125, | |
| "grad_norm": 73.80687713623047, | |
| "learning_rate": 1.1550000000000001e-05, | |
| "loss": 4.6035, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 2.25, | |
| "grad_norm": 14.295919418334961, | |
| "learning_rate": 1.1050000000000001e-05, | |
| "loss": 4.4453, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 2.375, | |
| "grad_norm": 18.72945785522461, | |
| "learning_rate": 1.055e-05, | |
| "loss": 3.8718, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "grad_norm": 132.57345581054688, | |
| "learning_rate": 1.005e-05, | |
| "loss": 3.8554, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "eval_loss": 2.212625741958618, | |
| "eval_runtime": 172.1408, | |
| "eval_samples_per_second": 0.418, | |
| "eval_steps_per_second": 0.052, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 2.625, | |
| "grad_norm": 6.234254360198975, | |
| "learning_rate": 9.55e-06, | |
| "loss": 3.481, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 2.75, | |
| "grad_norm": 5.568007946014404, | |
| "learning_rate": 9.050000000000001e-06, | |
| "loss": 3.4293, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 2.875, | |
| "grad_norm": 6.030545234680176, | |
| "learning_rate": 8.550000000000001e-06, | |
| "loss": 3.2727, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 5.541934013366699, | |
| "learning_rate": 8.050000000000001e-06, | |
| "loss": 3.2418, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 2.09912371635437, | |
| "eval_runtime": 172.0066, | |
| "eval_samples_per_second": 0.419, | |
| "eval_steps_per_second": 0.052, | |
| "step": 240 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 400, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 40, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4604337145774080.0, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |