{ "best_global_step": 1218, "best_metric": 0.7279029462738301, "best_model_checkpoint": "./deberta-unfair-tos/checkpoint-1218", "epoch": 14.0, "eval_steps": 500, "global_step": 1218, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.28901734104046245, "grad_norm": 0.6572251319885254, "learning_rate": 3.6641221374045806e-06, "loss": 0.324, "step": 25 }, { "epoch": 0.5780346820809249, "grad_norm": 5.866250038146973, "learning_rate": 7.480916030534352e-06, "loss": 0.351, "step": 50 }, { "epoch": 0.8670520231213873, "grad_norm": 7.3032636642456055, "learning_rate": 1.1297709923664125e-05, "loss": 0.3958, "step": 75 }, { "epoch": 1.0, "eval_f1_macro": 0.09475873757916975, "eval_f1_micro": 0.0742146320893949, "eval_loss": 0.288751482963562, "eval_precision_micro": 0.039163328882955054, "eval_recall_micro": 0.7068273092369478, "eval_runtime": 17.1509, "eval_samples_per_second": 132.646, "eval_steps_per_second": 4.198, "step": 87 }, { "epoch": 1.1502890173410405, "grad_norm": 2.369174003601074, "learning_rate": 1.5114503816793895e-05, "loss": 0.2875, "step": 100 }, { "epoch": 1.439306358381503, "grad_norm": 1.5161077976226807, "learning_rate": 1.8931297709923668e-05, "loss": 0.1816, "step": 125 }, { "epoch": 1.7283236994219653, "grad_norm": 1.0002554655075073, "learning_rate": 1.9988401693084502e-05, "loss": 0.1207, "step": 150 }, { "epoch": 2.0, "eval_f1_macro": 0.26524636829070025, "eval_f1_micro": 0.25287356321839083, "eval_loss": 0.08097408711910248, "eval_precision_micro": 0.14534534534534535, "eval_recall_micro": 0.9718875502008032, "eval_runtime": 17.2746, "eval_samples_per_second": 131.696, "eval_steps_per_second": 4.168, "step": 174 }, { "epoch": 2.0115606936416186, "grad_norm": 0.8926426768302917, "learning_rate": 1.9933871110628215e-05, "loss": 0.0923, "step": 175 }, { "epoch": 2.300578034682081, "grad_norm": 10.878843307495117, "learning_rate": 1.9834897861561572e-05, "loss": 0.0774, "step": 200 }, { "epoch": 2.5895953757225434, "grad_norm": 1.0657168626785278, "learning_rate": 1.9691924737527694e-05, "loss": 0.0676, "step": 225 }, { "epoch": 2.878612716763006, "grad_norm": 4.809388160705566, "learning_rate": 1.9505591379087126e-05, "loss": 0.049, "step": 250 }, { "epoch": 3.0, "eval_f1_macro": 0.4353178441624277, "eval_f1_micro": 0.44317096466093603, "eval_loss": 0.07703664153814316, "eval_precision_micro": 0.2907268170426065, "eval_recall_micro": 0.9317269076305221, "eval_runtime": 17.4749, "eval_samples_per_second": 130.187, "eval_steps_per_second": 4.12, "step": 261 }, { "epoch": 3.161849710982659, "grad_norm": 1.4025094509124756, "learning_rate": 1.927673141406083e-05, "loss": 0.0538, "step": 275 }, { "epoch": 3.4508670520231215, "grad_norm": 0.3441365957260132, "learning_rate": 1.9006368728002864e-05, "loss": 0.0507, "step": 300 }, { "epoch": 3.739884393063584, "grad_norm": 0.5084119439125061, "learning_rate": 1.8695712883488243e-05, "loss": 0.0253, "step": 325 }, { "epoch": 4.0, "eval_f1_macro": 0.49704492410886936, "eval_f1_micro": 0.46774193548387094, "eval_loss": 0.09584943950176239, "eval_precision_micro": 0.3122476446837147, "eval_recall_micro": 0.9317269076305221, "eval_runtime": 17.0721, "eval_samples_per_second": 133.258, "eval_steps_per_second": 4.217, "step": 348 }, { "epoch": 4.023121387283237, "grad_norm": 0.3451331555843353, "learning_rate": 1.8346153708709267e-05, "loss": 0.0369, "step": 350 }, { "epoch": 4.312138728323699, "grad_norm": 0.7666098475456238, "learning_rate": 1.795925507959027e-05, "loss": 0.0188, "step": 375 }, { "epoch": 4.601156069364162, "grad_norm": 0.3931030333042145, "learning_rate": 1.7536747923238566e-05, "loss": 0.0175, "step": 400 }, { "epoch": 4.890173410404624, "grad_norm": 10.357611656188965, "learning_rate": 1.7080522474033194e-05, "loss": 0.0277, "step": 425 }, { "epoch": 5.0, "eval_f1_macro": 0.5729573660442645, "eval_f1_micro": 0.5513905683192262, "eval_loss": 0.10878393799066544, "eval_precision_micro": 0.3944636678200692, "eval_recall_micro": 0.9156626506024096, "eval_runtime": 17.1098, "eval_samples_per_second": 132.965, "eval_steps_per_second": 4.208, "step": 435 }, { "epoch": 5.173410404624278, "grad_norm": 0.42035040259361267, "learning_rate": 1.659261981699653e-05, "loss": 0.018, "step": 450 }, { "epoch": 5.46242774566474, "grad_norm": 4.960078716278076, "learning_rate": 1.6075222756282513e-05, "loss": 0.0152, "step": 475 }, { "epoch": 5.7514450867052025, "grad_norm": 0.6047903299331665, "learning_rate": 1.5530646049634473e-05, "loss": 0.0121, "step": 500 }, { "epoch": 6.0, "eval_f1_macro": 0.6328988151219024, "eval_f1_micro": 0.6419019316493314, "eval_loss": 0.16698166728019714, "eval_precision_micro": 0.5094339622641509, "eval_recall_micro": 0.8674698795180723, "eval_runtime": 16.9188, "eval_samples_per_second": 134.466, "eval_steps_per_second": 4.256, "step": 522 }, { "epoch": 6.034682080924855, "grad_norm": 0.10740824788808823, "learning_rate": 1.4961326052502146e-05, "loss": 0.0135, "step": 525 }, { "epoch": 6.323699421965318, "grad_norm": 2.375861406326294, "learning_rate": 1.4369809818148586e-05, "loss": 0.0088, "step": 550 }, { "epoch": 6.61271676300578, "grad_norm": 0.30369603633880615, "learning_rate": 1.3758743702511495e-05, "loss": 0.0109, "step": 575 }, { "epoch": 6.901734104046243, "grad_norm": 0.2703251540660858, "learning_rate": 1.3130861524799091e-05, "loss": 0.0111, "step": 600 }, { "epoch": 7.0, "eval_f1_macro": 0.674210169675286, "eval_f1_micro": 0.6728682170542636, "eval_loss": 0.13765300810337067, "eval_precision_micro": 0.547979797979798, "eval_recall_micro": 0.8714859437751004, "eval_runtime": 16.9576, "eval_samples_per_second": 134.158, "eval_steps_per_second": 4.246, "step": 609 }, { "epoch": 7.184971098265896, "grad_norm": 0.16049759089946747, "learning_rate": 1.248897233678826e-05, "loss": 0.0065, "step": 625 }, { "epoch": 7.473988439306359, "grad_norm": 0.30845990777015686, "learning_rate": 1.1835947855543356e-05, "loss": 0.0074, "step": 650 }, { "epoch": 7.763005780346821, "grad_norm": 0.40923434495925903, "learning_rate": 1.1174709615779827e-05, "loss": 0.0082, "step": 675 }, { "epoch": 8.0, "eval_f1_macro": 0.6818995873907134, "eval_f1_micro": 0.6787330316742082, "eval_loss": 0.14643684029579163, "eval_precision_micro": 0.5434782608695652, "eval_recall_micro": 0.9036144578313253, "eval_runtime": 16.8897, "eval_samples_per_second": 134.697, "eval_steps_per_second": 4.263, "step": 696 }, { "epoch": 8.046242774566474, "grad_norm": 0.188787579536438, "learning_rate": 1.0508215899350986e-05, "loss": 0.0063, "step": 700 }, { "epoch": 8.335260115606937, "grad_norm": 0.4512380361557007, "learning_rate": 9.839448500333616e-06, "loss": 0.0061, "step": 725 }, { "epoch": 8.624277456647398, "grad_norm": 0.191133514046669, "learning_rate": 9.17139938492331e-06, "loss": 0.0049, "step": 750 }, { "epoch": 8.913294797687861, "grad_norm": 0.6083097457885742, "learning_rate": 8.507057305821294e-06, "loss": 0.0043, "step": 775 }, { "epoch": 9.0, "eval_f1_macro": 0.6575205455489375, "eval_f1_micro": 0.6676737160120846, "eval_loss": 0.15850034356117249, "eval_precision_micro": 0.5351089588377724, "eval_recall_micro": 0.8875502008032129, "eval_runtime": 17.1028, "eval_samples_per_second": 133.019, "eval_steps_per_second": 4.21, "step": 783 }, { "epoch": 9.196531791907514, "grad_norm": 0.09172528237104416, "learning_rate": 7.849394430997941e-06, "loss": 0.0037, "step": 800 }, { "epoch": 9.485549132947977, "grad_norm": 0.0930006131529808, "learning_rate": 7.201353046653892e-06, "loss": 0.0033, "step": 825 }, { "epoch": 9.77456647398844, "grad_norm": 0.25650352239608765, "learning_rate": 6.565832393867808e-06, "loss": 0.0054, "step": 850 }, { "epoch": 10.0, "eval_f1_macro": 0.7011244720560289, "eval_f1_micro": 0.7041322314049587, "eval_loss": 0.22890231013298035, "eval_precision_micro": 0.598314606741573, "eval_recall_micro": 0.8554216867469879, "eval_runtime": 17.0241, "eval_samples_per_second": 133.634, "eval_steps_per_second": 4.229, "step": 870 }, { "epoch": 10.057803468208093, "grad_norm": 0.20074431598186493, "learning_rate": 5.945675697821627e-06, "loss": 0.0041, "step": 875 }, { "epoch": 10.346820809248555, "grad_norm": 0.06646797806024551, "learning_rate": 5.343657447632593e-06, "loss": 0.0027, "step": 900 }, { "epoch": 10.635838150289018, "grad_norm": 0.10714161396026611, "learning_rate": 4.7624709837002794e-06, "loss": 0.0025, "step": 925 }, { "epoch": 10.92485549132948, "grad_norm": 0.14236567914485931, "learning_rate": 4.204716448100967e-06, "loss": 0.0038, "step": 950 }, { "epoch": 11.0, "eval_f1_macro": 0.7042070354121188, "eval_f1_micro": 0.7103109656301145, "eval_loss": 0.2040930837392807, "eval_precision_micro": 0.5994475138121547, "eval_recall_micro": 0.8714859437751004, "eval_runtime": 17.0325, "eval_samples_per_second": 133.568, "eval_steps_per_second": 4.227, "step": 957 }, { "epoch": 11.208092485549132, "grad_norm": 0.20406219363212585, "learning_rate": 3.6728891519374467e-06, "loss": 0.0028, "step": 975 }, { "epoch": 11.497109826589595, "grad_norm": 0.26664334535598755, "learning_rate": 3.1693684116870915e-06, "loss": 0.0027, "step": 1000 }, { "epoch": 11.786127167630058, "grad_norm": 0.09276499599218369, "learning_rate": 2.6964069044927044e-06, "loss": 0.0024, "step": 1025 }, { "epoch": 12.0, "eval_f1_macro": 0.7031684663931863, "eval_f1_micro": 0.7166666666666667, "eval_loss": 0.225614532828331, "eval_precision_micro": 0.6125356125356125, "eval_recall_micro": 0.8634538152610441, "eval_runtime": 17.0969, "eval_samples_per_second": 133.065, "eval_steps_per_second": 4.211, "step": 1044 }, { "epoch": 12.06936416184971, "grad_norm": 0.1458662748336792, "learning_rate": 2.2561205900189064e-06, "loss": 0.0027, "step": 1050 }, { "epoch": 12.358381502890174, "grad_norm": 0.1117081567645073, "learning_rate": 1.8504792439623475e-06, "loss": 0.0025, "step": 1075 }, { "epoch": 12.647398843930636, "grad_norm": 0.17292848229408264, "learning_rate": 1.4812976455672278e-06, "loss": 0.0025, "step": 1100 }, { "epoch": 12.936416184971097, "grad_norm": 0.37239304184913635, "learning_rate": 1.1502274585720252e-06, "loss": 0.0021, "step": 1125 }, { "epoch": 13.0, "eval_f1_macro": 0.7020439217567145, "eval_f1_micro": 0.7174280879864636, "eval_loss": 0.22631782293319702, "eval_precision_micro": 0.6198830409356725, "eval_recall_micro": 0.8514056224899599, "eval_runtime": 17.1562, "eval_samples_per_second": 132.605, "eval_steps_per_second": 4.197, "step": 1131 }, { "epoch": 13.219653179190752, "grad_norm": 0.051143016666173935, "learning_rate": 8.587498419108009e-07, "loss": 0.0021, "step": 1150 }, { "epoch": 13.508670520231213, "grad_norm": 0.20565341413021088, "learning_rate": 6.08168823227695e-07, "loss": 0.0028, "step": 1175 }, { "epoch": 13.797687861271676, "grad_norm": 0.015616578981280327, "learning_rate": 3.996054648505965e-07, "loss": 0.0021, "step": 1200 }, { "epoch": 14.0, "eval_f1_macro": 0.710205871606475, "eval_f1_micro": 0.7279029462738301, "eval_loss": 0.23643752932548523, "eval_precision_micro": 0.6402439024390244, "eval_recall_micro": 0.8433734939759037, "eval_runtime": 16.9864, "eval_samples_per_second": 133.93, "eval_steps_per_second": 4.239, "step": 1218 } ], "logging_steps": 25, "max_steps": 1305, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.374646862938112e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }