{ "best_global_step": 2000, "best_metric": 0.9721, "best_model_checkpoint": "./sifta-fakenews-xlmr/checkpoint-2000", "epoch": 1.5785319652722967, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.07892659826361484, "grad_norm": 7.519743919372559, "learning_rate": 3.1230283911671926e-06, "loss": 1.3593978881835938, "step": 100 }, { "epoch": 0.15785319652722968, "grad_norm": 44.37847137451172, "learning_rate": 6.2776025236593065e-06, "loss": 0.6375294876098633, "step": 200 }, { "epoch": 0.23677979479084452, "grad_norm": 3.3530941009521484, "learning_rate": 9.43217665615142e-06, "loss": 0.3285886001586914, "step": 300 }, { "epoch": 0.31570639305445936, "grad_norm": 4.9190993309021, "learning_rate": 1.2586750788643533e-05, "loss": 0.31189311981201173, "step": 400 }, { "epoch": 0.39463299131807417, "grad_norm": 13.304952621459961, "learning_rate": 1.574132492113565e-05, "loss": 0.28032915115356444, "step": 500 }, { "epoch": 0.39463299131807417, "eval_accuracy": 0.9513, "eval_f1": 0.951, "eval_loss": 0.11800144612789154, "eval_runtime": 17.0078, "eval_samples_per_second": 297.922, "eval_steps_per_second": 9.349, "step": 500 }, { "epoch": 0.47355958958168903, "grad_norm": 69.24589538574219, "learning_rate": 1.889589905362776e-05, "loss": 0.23949861526489258, "step": 600 }, { "epoch": 0.5524861878453039, "grad_norm": 77.79669952392578, "learning_rate": 1.9993585719507573e-05, "loss": 0.26106679916381836, "step": 700 }, { "epoch": 0.6314127861089187, "grad_norm": 9.278132438659668, "learning_rate": 1.9958691794328414e-05, "loss": 0.26748144149780273, "step": 800 }, { "epoch": 0.7103393843725335, "grad_norm": 10.259608268737793, "learning_rate": 1.9893564256008604e-05, "loss": 0.2700900650024414, "step": 900 }, { "epoch": 0.7892659826361483, "grad_norm": 1.331714153289795, "learning_rate": 1.9798400825377246e-05, "loss": 0.23025428771972656, "step": 1000 }, { "epoch": 0.7892659826361483, "eval_accuracy": 0.9637, "eval_f1": 0.9636, "eval_loss": 0.11573408544063568, "eval_runtime": 16.2817, "eval_samples_per_second": 311.209, "eval_steps_per_second": 9.766, "step": 1000 }, { "epoch": 0.8681925808997633, "grad_norm": 0.1167285144329071, "learning_rate": 1.9673490409291412e-05, "loss": 0.22350259780883788, "step": 1100 }, { "epoch": 0.9471191791633781, "grad_norm": 21.29085922241211, "learning_rate": 1.9519212223543213e-05, "loss": 0.24957496643066407, "step": 1200 }, { "epoch": 1.0260457774269929, "grad_norm": 6.630244731903076, "learning_rate": 1.933603464159779e-05, "loss": 0.2235790252685547, "step": 1300 }, { "epoch": 1.1049723756906078, "grad_norm": 3.18111252784729, "learning_rate": 1.912451377265733e-05, "loss": 0.17377975463867187, "step": 1400 }, { "epoch": 1.1838989739542225, "grad_norm": 1.588996410369873, "learning_rate": 1.888529177336798e-05, "loss": 0.18398305892944336, "step": 1500 }, { "epoch": 1.1838989739542225, "eval_accuracy": 0.9692, "eval_f1": 0.9691, "eval_loss": 0.08150316029787064, "eval_runtime": 16.4485, "eval_samples_per_second": 308.053, "eval_steps_per_second": 9.667, "step": 1500 }, { "epoch": 1.2628255722178374, "grad_norm": 2.542539119720459, "learning_rate": 1.861909489829517e-05, "loss": 0.20040679931640626, "step": 1600 }, { "epoch": 1.3417521704814521, "grad_norm": 1.4010111093521118, "learning_rate": 1.8326731295085838e-05, "loss": 0.1535040855407715, "step": 1700 }, { "epoch": 1.420678768745067, "grad_norm": 2.9616997241973877, "learning_rate": 1.800908855101132e-05, "loss": 0.1694472312927246, "step": 1800 }, { "epoch": 1.499605367008682, "grad_norm": 8.78850269317627, "learning_rate": 1.766713099833931e-05, "loss": 0.18262014389038086, "step": 1900 }, { "epoch": 1.5785319652722967, "grad_norm": 5.830899715423584, "learning_rate": 1.730189678671552e-05, "loss": 0.15452383995056151, "step": 2000 }, { "epoch": 1.5785319652722967, "eval_accuracy": 0.9722, "eval_f1": 0.9721, "eval_loss": 0.08517046272754669, "eval_runtime": 17.0389, "eval_samples_per_second": 297.379, "eval_steps_per_second": 9.332, "step": 2000 } ], "logging_steps": 100, "max_steps": 6335, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8418501327298560.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }