mt5-base-turkish-news-summarizer / trainer_state.json
nicktimur's picture
Upload folder using huggingface_hub
1381f54 verified
Raw
History Blame Contribute Delete
6.1 kB
{
"best_global_step": 240,
"best_metric": 2.09912371635437,
"best_model_checkpoint": "./mt5_summary_model\\checkpoint-240",
"epoch": 3.0,
"eval_steps": 40,
"global_step": 240,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.125,
"grad_norm": 41460.79296875,
"learning_rate": 1.955e-05,
"loss": 15.9769,
"step": 10
},
{
"epoch": 0.25,
"grad_norm": 7548.4443359375,
"learning_rate": 1.9050000000000002e-05,
"loss": 14.8679,
"step": 20
},
{
"epoch": 0.375,
"grad_norm": 6171.39013671875,
"learning_rate": 1.855e-05,
"loss": 14.4649,
"step": 30
},
{
"epoch": 0.5,
"grad_norm": 3173.07275390625,
"learning_rate": 1.805e-05,
"loss": 12.9826,
"step": 40
},
{
"epoch": 0.5,
"eval_loss": 7.740403175354004,
"eval_runtime": 45.4998,
"eval_samples_per_second": 1.582,
"eval_steps_per_second": 0.198,
"step": 40
},
{
"epoch": 0.625,
"grad_norm": 3397.85302734375,
"learning_rate": 1.755e-05,
"loss": 11.9366,
"step": 50
},
{
"epoch": 0.75,
"grad_norm": 6715.337890625,
"learning_rate": 1.705e-05,
"loss": 11.328,
"step": 60
},
{
"epoch": 0.875,
"grad_norm": 4861.546875,
"learning_rate": 1.6550000000000002e-05,
"loss": 11.3735,
"step": 70
},
{
"epoch": 1.0,
"grad_norm": 12531.2421875,
"learning_rate": 1.605e-05,
"loss": 10.5015,
"step": 80
},
{
"epoch": 1.0,
"eval_loss": 5.373843669891357,
"eval_runtime": 172.11,
"eval_samples_per_second": 0.418,
"eval_steps_per_second": 0.052,
"step": 80
},
{
"epoch": 1.125,
"grad_norm": 1363.3099365234375,
"learning_rate": 1.5550000000000002e-05,
"loss": 9.7802,
"step": 90
},
{
"epoch": 1.25,
"grad_norm": 3557.00537109375,
"learning_rate": 1.505e-05,
"loss": 9.3325,
"step": 100
},
{
"epoch": 1.375,
"grad_norm": 448.0030517578125,
"learning_rate": 1.4550000000000001e-05,
"loss": 8.1717,
"step": 110
},
{
"epoch": 1.5,
"grad_norm": 845.931640625,
"learning_rate": 1.4050000000000001e-05,
"loss": 7.581,
"step": 120
},
{
"epoch": 1.5,
"eval_loss": 3.380208969116211,
"eval_runtime": 172.0401,
"eval_samples_per_second": 0.419,
"eval_steps_per_second": 0.052,
"step": 120
},
{
"epoch": 1.625,
"grad_norm": 1770.1221923828125,
"learning_rate": 1.355e-05,
"loss": 7.053,
"step": 130
},
{
"epoch": 1.75,
"grad_norm": 38.347225189208984,
"learning_rate": 1.305e-05,
"loss": 6.2872,
"step": 140
},
{
"epoch": 1.875,
"grad_norm": 139.71669006347656,
"learning_rate": 1.255e-05,
"loss": 5.6765,
"step": 150
},
{
"epoch": 2.0,
"grad_norm": 67.0308837890625,
"learning_rate": 1.2050000000000002e-05,
"loss": 4.9915,
"step": 160
},
{
"epoch": 2.0,
"eval_loss": 2.404210329055786,
"eval_runtime": 172.0874,
"eval_samples_per_second": 0.418,
"eval_steps_per_second": 0.052,
"step": 160
},
{
"epoch": 2.125,
"grad_norm": 73.80687713623047,
"learning_rate": 1.1550000000000001e-05,
"loss": 4.6035,
"step": 170
},
{
"epoch": 2.25,
"grad_norm": 14.295919418334961,
"learning_rate": 1.1050000000000001e-05,
"loss": 4.4453,
"step": 180
},
{
"epoch": 2.375,
"grad_norm": 18.72945785522461,
"learning_rate": 1.055e-05,
"loss": 3.8718,
"step": 190
},
{
"epoch": 2.5,
"grad_norm": 132.57345581054688,
"learning_rate": 1.005e-05,
"loss": 3.8554,
"step": 200
},
{
"epoch": 2.5,
"eval_loss": 2.212625741958618,
"eval_runtime": 172.1408,
"eval_samples_per_second": 0.418,
"eval_steps_per_second": 0.052,
"step": 200
},
{
"epoch": 2.625,
"grad_norm": 6.234254360198975,
"learning_rate": 9.55e-06,
"loss": 3.481,
"step": 210
},
{
"epoch": 2.75,
"grad_norm": 5.568007946014404,
"learning_rate": 9.050000000000001e-06,
"loss": 3.4293,
"step": 220
},
{
"epoch": 2.875,
"grad_norm": 6.030545234680176,
"learning_rate": 8.550000000000001e-06,
"loss": 3.2727,
"step": 230
},
{
"epoch": 3.0,
"grad_norm": 5.541934013366699,
"learning_rate": 8.050000000000001e-06,
"loss": 3.2418,
"step": 240
},
{
"epoch": 3.0,
"eval_loss": 2.09912371635437,
"eval_runtime": 172.0066,
"eval_samples_per_second": 0.419,
"eval_steps_per_second": 0.052,
"step": 240
}
],
"logging_steps": 10,
"max_steps": 400,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 40,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4604337145774080.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}