{ "best_global_step": 2000, "best_metric": 0.9721, "best_model_checkpoint": "./sifta-fakenews-xlmr/checkpoint-2000", "epoch": 2.7624309392265194, "eval_steps": 500, "global_step": 3500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.07892659826361484, "grad_norm": 7.519743919372559, "learning_rate": 3.1230283911671926e-06, "loss": 1.3593978881835938, "step": 100 }, { "epoch": 0.15785319652722968, "grad_norm": 44.37847137451172, "learning_rate": 6.2776025236593065e-06, "loss": 0.6375294876098633, "step": 200 }, { "epoch": 0.23677979479084452, "grad_norm": 3.3530941009521484, "learning_rate": 9.43217665615142e-06, "loss": 0.3285886001586914, "step": 300 }, { "epoch": 0.31570639305445936, "grad_norm": 4.9190993309021, "learning_rate": 1.2586750788643533e-05, "loss": 0.31189311981201173, "step": 400 }, { "epoch": 0.39463299131807417, "grad_norm": 13.304952621459961, "learning_rate": 1.574132492113565e-05, "loss": 0.28032915115356444, "step": 500 }, { "epoch": 0.39463299131807417, "eval_accuracy": 0.9513, "eval_f1": 0.951, "eval_loss": 0.11800144612789154, "eval_runtime": 17.0078, "eval_samples_per_second": 297.922, "eval_steps_per_second": 9.349, "step": 500 }, { "epoch": 0.47355958958168903, "grad_norm": 69.24589538574219, "learning_rate": 1.889589905362776e-05, "loss": 0.23949861526489258, "step": 600 }, { "epoch": 0.5524861878453039, "grad_norm": 77.79669952392578, "learning_rate": 1.9993585719507573e-05, "loss": 0.26106679916381836, "step": 700 }, { "epoch": 0.6314127861089187, "grad_norm": 9.278132438659668, "learning_rate": 1.9958691794328414e-05, "loss": 0.26748144149780273, "step": 800 }, { "epoch": 0.7103393843725335, "grad_norm": 10.259608268737793, "learning_rate": 1.9893564256008604e-05, "loss": 0.2700900650024414, "step": 900 }, { "epoch": 0.7892659826361483, "grad_norm": 1.331714153289795, "learning_rate": 1.9798400825377246e-05, "loss": 0.23025428771972656, "step": 1000 }, { "epoch": 0.7892659826361483, "eval_accuracy": 0.9637, "eval_f1": 0.9636, "eval_loss": 0.11573408544063568, "eval_runtime": 16.2817, "eval_samples_per_second": 311.209, "eval_steps_per_second": 9.766, "step": 1000 }, { "epoch": 0.8681925808997633, "grad_norm": 0.1167285144329071, "learning_rate": 1.9673490409291412e-05, "loss": 0.22350259780883788, "step": 1100 }, { "epoch": 0.9471191791633781, "grad_norm": 21.29085922241211, "learning_rate": 1.9519212223543213e-05, "loss": 0.24957496643066407, "step": 1200 }, { "epoch": 1.0260457774269929, "grad_norm": 6.630244731903076, "learning_rate": 1.933603464159779e-05, "loss": 0.2235790252685547, "step": 1300 }, { "epoch": 1.1049723756906078, "grad_norm": 3.18111252784729, "learning_rate": 1.912451377265733e-05, "loss": 0.17377975463867187, "step": 1400 }, { "epoch": 1.1838989739542225, "grad_norm": 1.588996410369873, "learning_rate": 1.888529177336798e-05, "loss": 0.18398305892944336, "step": 1500 }, { "epoch": 1.1838989739542225, "eval_accuracy": 0.9692, "eval_f1": 0.9691, "eval_loss": 0.08150316029787064, "eval_runtime": 16.4485, "eval_samples_per_second": 308.053, "eval_steps_per_second": 9.667, "step": 1500 }, { "epoch": 1.2628255722178374, "grad_norm": 2.542539119720459, "learning_rate": 1.861909489829517e-05, "loss": 0.20040679931640626, "step": 1600 }, { "epoch": 1.3417521704814521, "grad_norm": 1.4010111093521118, "learning_rate": 1.8326731295085838e-05, "loss": 0.1535040855407715, "step": 1700 }, { "epoch": 1.420678768745067, "grad_norm": 2.9616997241973877, "learning_rate": 1.800908855101132e-05, "loss": 0.1694472312927246, "step": 1800 }, { "epoch": 1.499605367008682, "grad_norm": 8.78850269317627, "learning_rate": 1.766713099833931e-05, "loss": 0.18262014389038086, "step": 1900 }, { "epoch": 1.5785319652722967, "grad_norm": 5.830899715423584, "learning_rate": 1.730189678671552e-05, "loss": 0.15452383995056151, "step": 2000 }, { "epoch": 1.5785319652722967, "eval_accuracy": 0.9722, "eval_f1": 0.9721, "eval_loss": 0.08517046272754669, "eval_runtime": 17.0389, "eval_samples_per_second": 297.379, "eval_steps_per_second": 9.332, "step": 2000 }, { "epoch": 1.6574585635359116, "grad_norm": 14.781915664672852, "learning_rate": 1.6914494731443005e-05, "loss": 0.17684141159057618, "step": 2100 }, { "epoch": 1.7363851617995265, "grad_norm": 14.542154312133789, "learning_rate": 1.6506100947227483e-05, "loss": 0.16984281539916993, "step": 2200 }, { "epoch": 1.8153117600631412, "grad_norm": 2.6693317890167236, "learning_rate": 1.607795527760824e-05, "loss": 0.16369407653808593, "step": 2300 }, { "epoch": 1.8942383583267561, "grad_norm": 35.68703842163086, "learning_rate": 1.5631357530914576e-05, "loss": 0.16996910095214843, "step": 2400 }, { "epoch": 1.973164956590371, "grad_norm": 8.133594512939453, "learning_rate": 1.5167663534174963e-05, "loss": 0.17478582382202149, "step": 2500 }, { "epoch": 1.973164956590371, "eval_accuracy": 0.9722, "eval_f1": 0.9721, "eval_loss": 0.07743066549301147, "eval_runtime": 17.1006, "eval_samples_per_second": 296.305, "eval_steps_per_second": 9.298, "step": 2500 }, { "epoch": 2.0520915548539858, "grad_norm": 3.4671425819396973, "learning_rate": 1.468828101695897e-05, "loss": 0.14399107933044433, "step": 2600 }, { "epoch": 2.1310181531176005, "grad_norm": 29.677196502685547, "learning_rate": 1.4194665337648121e-05, "loss": 0.15213555335998535, "step": 2700 }, { "epoch": 2.2099447513812156, "grad_norm": 7.875465393066406, "learning_rate": 1.368831506511036e-05, "loss": 0.14315860748291015, "step": 2800 }, { "epoch": 2.2888713496448303, "grad_norm": 20.07367706298828, "learning_rate": 1.3170767429191709e-05, "loss": 0.13439299583435058, "step": 2900 }, { "epoch": 2.367797947908445, "grad_norm": 0.5996111631393433, "learning_rate": 1.2643593653836975e-05, "loss": 0.15156855583190917, "step": 3000 }, { "epoch": 2.367797947908445, "eval_accuracy": 0.9714, "eval_f1": 0.9712, "eval_loss": 0.08889847248792648, "eval_runtime": 17.0683, "eval_samples_per_second": 296.866, "eval_steps_per_second": 9.316, "step": 3000 }, { "epoch": 2.44672454617206, "grad_norm": 9.044219970703125, "learning_rate": 1.2108394187007715e-05, "loss": 0.12777873992919922, "step": 3100 }, { "epoch": 2.525651144435675, "grad_norm": 0.1941675990819931, "learning_rate": 1.1566793841878931e-05, "loss": 0.13878602981567384, "step": 3200 }, { "epoch": 2.6045777426992895, "grad_norm": 8.129409790039062, "learning_rate": 1.1020436864065368e-05, "loss": 0.14199438095092773, "step": 3300 }, { "epoch": 2.6835043409629042, "grad_norm": 0.1269533634185791, "learning_rate": 1.0470981939852842e-05, "loss": 0.12948278427124024, "step": 3400 }, { "epoch": 2.7624309392265194, "grad_norm": 4.474359512329102, "learning_rate": 9.92009716058909e-06, "loss": 0.12795443534851075, "step": 3500 }, { "epoch": 2.7624309392265194, "eval_accuracy": 0.9722, "eval_f1": 0.972, "eval_loss": 0.08592783659696579, "eval_runtime": 17.0846, "eval_samples_per_second": 296.584, "eval_steps_per_second": 9.307, "step": 3500 } ], "logging_steps": 100, "max_steps": 6335, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 3 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.473211421171712e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }