{ "best_global_step": 1000, "best_metric": 0.9205830097198486, "best_model_checkpoint": "runs/emotts_ravdess\\checkpoint-1000", "epoch": 24.395061728395063, "eval_steps": 1000, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.6172839506172839, "grad_norm": 46.678199768066406, "learning_rate": 4.800000000000001e-07, "loss": 3.4472, "step": 25 }, { "epoch": 1.2222222222222223, "grad_norm": 26.903335571289062, "learning_rate": 9.800000000000001e-07, "loss": 2.9051, "step": 50 }, { "epoch": 1.8395061728395061, "grad_norm": 16.712799072265625, "learning_rate": 1.48e-06, "loss": 2.2302, "step": 75 }, { "epoch": 2.4444444444444446, "grad_norm": 11.607951164245605, "learning_rate": 1.98e-06, "loss": 1.7683, "step": 100 }, { "epoch": 3.049382716049383, "grad_norm": 7.216983318328857, "learning_rate": 2.4800000000000004e-06, "loss": 1.5434, "step": 125 }, { "epoch": 3.6666666666666665, "grad_norm": 10.899630546569824, "learning_rate": 2.9800000000000003e-06, "loss": 1.4385, "step": 150 }, { "epoch": 4.271604938271605, "grad_norm": 6.701765537261963, "learning_rate": 3.48e-06, "loss": 1.3262, "step": 175 }, { "epoch": 4.888888888888889, "grad_norm": 9.419053077697754, "learning_rate": 3.980000000000001e-06, "loss": 1.285, "step": 200 }, { "epoch": 5.493827160493828, "grad_norm": 5.913278579711914, "learning_rate": 4.48e-06, "loss": 1.2503, "step": 225 }, { "epoch": 6.098765432098766, "grad_norm": 8.171669006347656, "learning_rate": 4.980000000000001e-06, "loss": 1.1868, "step": 250 }, { "epoch": 6.716049382716049, "grad_norm": 5.54558801651001, "learning_rate": 5.480000000000001e-06, "loss": 1.1478, "step": 275 }, { "epoch": 7.320987654320987, "grad_norm": 5.325434684753418, "learning_rate": 5.98e-06, "loss": 1.1245, "step": 300 }, { "epoch": 7.938271604938271, "grad_norm": 5.406148433685303, "learning_rate": 6.480000000000001e-06, "loss": 1.1145, "step": 325 }, { "epoch": 8.54320987654321, "grad_norm": 8.461536407470703, "learning_rate": 6.98e-06, "loss": 1.0641, "step": 350 }, { "epoch": 9.148148148148149, "grad_norm": 3.8533031940460205, "learning_rate": 7.48e-06, "loss": 1.0573, "step": 375 }, { "epoch": 9.765432098765432, "grad_norm": 7.569976806640625, "learning_rate": 7.980000000000002e-06, "loss": 1.061, "step": 400 }, { "epoch": 10.37037037037037, "grad_norm": 10.156228065490723, "learning_rate": 8.48e-06, "loss": 1.0485, "step": 425 }, { "epoch": 10.987654320987655, "grad_norm": 4.668756484985352, "learning_rate": 8.98e-06, "loss": 1.0216, "step": 450 }, { "epoch": 11.592592592592592, "grad_norm": 5.087125301361084, "learning_rate": 9.48e-06, "loss": 1.0319, "step": 475 }, { "epoch": 12.197530864197532, "grad_norm": 7.943349361419678, "learning_rate": 9.980000000000001e-06, "loss": 1.0, "step": 500 }, { "epoch": 12.814814814814815, "grad_norm": 7.655898571014404, "learning_rate": 9.931428571428571e-06, "loss": 1.0052, "step": 525 }, { "epoch": 13.419753086419753, "grad_norm": 4.458106994628906, "learning_rate": 9.86e-06, "loss": 1.0001, "step": 550 }, { "epoch": 14.024691358024691, "grad_norm": 9.058222770690918, "learning_rate": 9.78857142857143e-06, "loss": 1.0015, "step": 575 }, { "epoch": 14.641975308641975, "grad_norm": 4.795205593109131, "learning_rate": 9.717142857142858e-06, "loss": 0.9836, "step": 600 }, { "epoch": 15.246913580246913, "grad_norm": 10.566876411437988, "learning_rate": 9.645714285714286e-06, "loss": 1.0019, "step": 625 }, { "epoch": 15.864197530864198, "grad_norm": 7.610626220703125, "learning_rate": 9.574285714285715e-06, "loss": 0.9779, "step": 650 }, { "epoch": 16.469135802469136, "grad_norm": 6.008159637451172, "learning_rate": 9.502857142857144e-06, "loss": 0.9798, "step": 675 }, { "epoch": 17.074074074074073, "grad_norm": 6.685286521911621, "learning_rate": 9.431428571428573e-06, "loss": 0.9753, "step": 700 }, { "epoch": 17.691358024691358, "grad_norm": 2.7540247440338135, "learning_rate": 9.360000000000002e-06, "loss": 0.967, "step": 725 }, { "epoch": 18.296296296296298, "grad_norm": 4.825072288513184, "learning_rate": 9.28857142857143e-06, "loss": 0.9575, "step": 750 }, { "epoch": 18.91358024691358, "grad_norm": 6.618119716644287, "learning_rate": 9.217142857142858e-06, "loss": 0.9675, "step": 775 }, { "epoch": 19.51851851851852, "grad_norm": 5.465808391571045, "learning_rate": 9.145714285714287e-06, "loss": 0.9626, "step": 800 }, { "epoch": 20.123456790123456, "grad_norm": 4.9501051902771, "learning_rate": 9.074285714285716e-06, "loss": 0.9638, "step": 825 }, { "epoch": 20.74074074074074, "grad_norm": 4.926831245422363, "learning_rate": 9.002857142857144e-06, "loss": 0.9582, "step": 850 }, { "epoch": 21.34567901234568, "grad_norm": 6.605464458465576, "learning_rate": 8.931428571428573e-06, "loss": 0.9551, "step": 875 }, { "epoch": 21.962962962962962, "grad_norm": 5.774538040161133, "learning_rate": 8.860000000000002e-06, "loss": 0.9596, "step": 900 }, { "epoch": 22.567901234567902, "grad_norm": 4.304802417755127, "learning_rate": 8.788571428571429e-06, "loss": 0.9489, "step": 925 }, { "epoch": 23.17283950617284, "grad_norm": 5.171604633331299, "learning_rate": 8.717142857142858e-06, "loss": 0.953, "step": 950 }, { "epoch": 23.790123456790123, "grad_norm": 7.152281761169434, "learning_rate": 8.645714285714287e-06, "loss": 0.9604, "step": 975 }, { "epoch": 24.395061728395063, "grad_norm": 4.954558849334717, "learning_rate": 8.574285714285714e-06, "loss": 0.9489, "step": 1000 }, { "epoch": 24.395061728395063, "eval_loss": 0.9205830097198486, "eval_runtime": 2.2708, "eval_samples_per_second": 63.413, "eval_steps_per_second": 31.707, "step": 1000 } ], "logging_steps": 25, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 98, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 821472814356480.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }