deberta-unfair-tos / checkpoint-1218 /trainer_state.json
canpolatbulbul's picture
Upload folder using huggingface_hub
a6a3d5a verified
Raw
History Blame Contribute Delete
14.8 kB
{
"best_global_step": 1218,
"best_metric": 0.7279029462738301,
"best_model_checkpoint": "./deberta-unfair-tos/checkpoint-1218",
"epoch": 14.0,
"eval_steps": 500,
"global_step": 1218,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.28901734104046245,
"grad_norm": 0.6572251319885254,
"learning_rate": 3.6641221374045806e-06,
"loss": 0.324,
"step": 25
},
{
"epoch": 0.5780346820809249,
"grad_norm": 5.866250038146973,
"learning_rate": 7.480916030534352e-06,
"loss": 0.351,
"step": 50
},
{
"epoch": 0.8670520231213873,
"grad_norm": 7.3032636642456055,
"learning_rate": 1.1297709923664125e-05,
"loss": 0.3958,
"step": 75
},
{
"epoch": 1.0,
"eval_f1_macro": 0.09475873757916975,
"eval_f1_micro": 0.0742146320893949,
"eval_loss": 0.288751482963562,
"eval_precision_micro": 0.039163328882955054,
"eval_recall_micro": 0.7068273092369478,
"eval_runtime": 17.1509,
"eval_samples_per_second": 132.646,
"eval_steps_per_second": 4.198,
"step": 87
},
{
"epoch": 1.1502890173410405,
"grad_norm": 2.369174003601074,
"learning_rate": 1.5114503816793895e-05,
"loss": 0.2875,
"step": 100
},
{
"epoch": 1.439306358381503,
"grad_norm": 1.5161077976226807,
"learning_rate": 1.8931297709923668e-05,
"loss": 0.1816,
"step": 125
},
{
"epoch": 1.7283236994219653,
"grad_norm": 1.0002554655075073,
"learning_rate": 1.9988401693084502e-05,
"loss": 0.1207,
"step": 150
},
{
"epoch": 2.0,
"eval_f1_macro": 0.26524636829070025,
"eval_f1_micro": 0.25287356321839083,
"eval_loss": 0.08097408711910248,
"eval_precision_micro": 0.14534534534534535,
"eval_recall_micro": 0.9718875502008032,
"eval_runtime": 17.2746,
"eval_samples_per_second": 131.696,
"eval_steps_per_second": 4.168,
"step": 174
},
{
"epoch": 2.0115606936416186,
"grad_norm": 0.8926426768302917,
"learning_rate": 1.9933871110628215e-05,
"loss": 0.0923,
"step": 175
},
{
"epoch": 2.300578034682081,
"grad_norm": 10.878843307495117,
"learning_rate": 1.9834897861561572e-05,
"loss": 0.0774,
"step": 200
},
{
"epoch": 2.5895953757225434,
"grad_norm": 1.0657168626785278,
"learning_rate": 1.9691924737527694e-05,
"loss": 0.0676,
"step": 225
},
{
"epoch": 2.878612716763006,
"grad_norm": 4.809388160705566,
"learning_rate": 1.9505591379087126e-05,
"loss": 0.049,
"step": 250
},
{
"epoch": 3.0,
"eval_f1_macro": 0.4353178441624277,
"eval_f1_micro": 0.44317096466093603,
"eval_loss": 0.07703664153814316,
"eval_precision_micro": 0.2907268170426065,
"eval_recall_micro": 0.9317269076305221,
"eval_runtime": 17.4749,
"eval_samples_per_second": 130.187,
"eval_steps_per_second": 4.12,
"step": 261
},
{
"epoch": 3.161849710982659,
"grad_norm": 1.4025094509124756,
"learning_rate": 1.927673141406083e-05,
"loss": 0.0538,
"step": 275
},
{
"epoch": 3.4508670520231215,
"grad_norm": 0.3441365957260132,
"learning_rate": 1.9006368728002864e-05,
"loss": 0.0507,
"step": 300
},
{
"epoch": 3.739884393063584,
"grad_norm": 0.5084119439125061,
"learning_rate": 1.8695712883488243e-05,
"loss": 0.0253,
"step": 325
},
{
"epoch": 4.0,
"eval_f1_macro": 0.49704492410886936,
"eval_f1_micro": 0.46774193548387094,
"eval_loss": 0.09584943950176239,
"eval_precision_micro": 0.3122476446837147,
"eval_recall_micro": 0.9317269076305221,
"eval_runtime": 17.0721,
"eval_samples_per_second": 133.258,
"eval_steps_per_second": 4.217,
"step": 348
},
{
"epoch": 4.023121387283237,
"grad_norm": 0.3451331555843353,
"learning_rate": 1.8346153708709267e-05,
"loss": 0.0369,
"step": 350
},
{
"epoch": 4.312138728323699,
"grad_norm": 0.7666098475456238,
"learning_rate": 1.795925507959027e-05,
"loss": 0.0188,
"step": 375
},
{
"epoch": 4.601156069364162,
"grad_norm": 0.3931030333042145,
"learning_rate": 1.7536747923238566e-05,
"loss": 0.0175,
"step": 400
},
{
"epoch": 4.890173410404624,
"grad_norm": 10.357611656188965,
"learning_rate": 1.7080522474033194e-05,
"loss": 0.0277,
"step": 425
},
{
"epoch": 5.0,
"eval_f1_macro": 0.5729573660442645,
"eval_f1_micro": 0.5513905683192262,
"eval_loss": 0.10878393799066544,
"eval_precision_micro": 0.3944636678200692,
"eval_recall_micro": 0.9156626506024096,
"eval_runtime": 17.1098,
"eval_samples_per_second": 132.965,
"eval_steps_per_second": 4.208,
"step": 435
},
{
"epoch": 5.173410404624278,
"grad_norm": 0.42035040259361267,
"learning_rate": 1.659261981699653e-05,
"loss": 0.018,
"step": 450
},
{
"epoch": 5.46242774566474,
"grad_norm": 4.960078716278076,
"learning_rate": 1.6075222756282513e-05,
"loss": 0.0152,
"step": 475
},
{
"epoch": 5.7514450867052025,
"grad_norm": 0.6047903299331665,
"learning_rate": 1.5530646049634473e-05,
"loss": 0.0121,
"step": 500
},
{
"epoch": 6.0,
"eval_f1_macro": 0.6328988151219024,
"eval_f1_micro": 0.6419019316493314,
"eval_loss": 0.16698166728019714,
"eval_precision_micro": 0.5094339622641509,
"eval_recall_micro": 0.8674698795180723,
"eval_runtime": 16.9188,
"eval_samples_per_second": 134.466,
"eval_steps_per_second": 4.256,
"step": 522
},
{
"epoch": 6.034682080924855,
"grad_norm": 0.10740824788808823,
"learning_rate": 1.4961326052502146e-05,
"loss": 0.0135,
"step": 525
},
{
"epoch": 6.323699421965318,
"grad_norm": 2.375861406326294,
"learning_rate": 1.4369809818148586e-05,
"loss": 0.0088,
"step": 550
},
{
"epoch": 6.61271676300578,
"grad_norm": 0.30369603633880615,
"learning_rate": 1.3758743702511495e-05,
"loss": 0.0109,
"step": 575
},
{
"epoch": 6.901734104046243,
"grad_norm": 0.2703251540660858,
"learning_rate": 1.3130861524799091e-05,
"loss": 0.0111,
"step": 600
},
{
"epoch": 7.0,
"eval_f1_macro": 0.674210169675286,
"eval_f1_micro": 0.6728682170542636,
"eval_loss": 0.13765300810337067,
"eval_precision_micro": 0.547979797979798,
"eval_recall_micro": 0.8714859437751004,
"eval_runtime": 16.9576,
"eval_samples_per_second": 134.158,
"eval_steps_per_second": 4.246,
"step": 609
},
{
"epoch": 7.184971098265896,
"grad_norm": 0.16049759089946747,
"learning_rate": 1.248897233678826e-05,
"loss": 0.0065,
"step": 625
},
{
"epoch": 7.473988439306359,
"grad_norm": 0.30845990777015686,
"learning_rate": 1.1835947855543356e-05,
"loss": 0.0074,
"step": 650
},
{
"epoch": 7.763005780346821,
"grad_norm": 0.40923434495925903,
"learning_rate": 1.1174709615779827e-05,
"loss": 0.0082,
"step": 675
},
{
"epoch": 8.0,
"eval_f1_macro": 0.6818995873907134,
"eval_f1_micro": 0.6787330316742082,
"eval_loss": 0.14643684029579163,
"eval_precision_micro": 0.5434782608695652,
"eval_recall_micro": 0.9036144578313253,
"eval_runtime": 16.8897,
"eval_samples_per_second": 134.697,
"eval_steps_per_second": 4.263,
"step": 696
},
{
"epoch": 8.046242774566474,
"grad_norm": 0.188787579536438,
"learning_rate": 1.0508215899350986e-05,
"loss": 0.0063,
"step": 700
},
{
"epoch": 8.335260115606937,
"grad_norm": 0.4512380361557007,
"learning_rate": 9.839448500333616e-06,
"loss": 0.0061,
"step": 725
},
{
"epoch": 8.624277456647398,
"grad_norm": 0.191133514046669,
"learning_rate": 9.17139938492331e-06,
"loss": 0.0049,
"step": 750
},
{
"epoch": 8.913294797687861,
"grad_norm": 0.6083097457885742,
"learning_rate": 8.507057305821294e-06,
"loss": 0.0043,
"step": 775
},
{
"epoch": 9.0,
"eval_f1_macro": 0.6575205455489375,
"eval_f1_micro": 0.6676737160120846,
"eval_loss": 0.15850034356117249,
"eval_precision_micro": 0.5351089588377724,
"eval_recall_micro": 0.8875502008032129,
"eval_runtime": 17.1028,
"eval_samples_per_second": 133.019,
"eval_steps_per_second": 4.21,
"step": 783
},
{
"epoch": 9.196531791907514,
"grad_norm": 0.09172528237104416,
"learning_rate": 7.849394430997941e-06,
"loss": 0.0037,
"step": 800
},
{
"epoch": 9.485549132947977,
"grad_norm": 0.0930006131529808,
"learning_rate": 7.201353046653892e-06,
"loss": 0.0033,
"step": 825
},
{
"epoch": 9.77456647398844,
"grad_norm": 0.25650352239608765,
"learning_rate": 6.565832393867808e-06,
"loss": 0.0054,
"step": 850
},
{
"epoch": 10.0,
"eval_f1_macro": 0.7011244720560289,
"eval_f1_micro": 0.7041322314049587,
"eval_loss": 0.22890231013298035,
"eval_precision_micro": 0.598314606741573,
"eval_recall_micro": 0.8554216867469879,
"eval_runtime": 17.0241,
"eval_samples_per_second": 133.634,
"eval_steps_per_second": 4.229,
"step": 870
},
{
"epoch": 10.057803468208093,
"grad_norm": 0.20074431598186493,
"learning_rate": 5.945675697821627e-06,
"loss": 0.0041,
"step": 875
},
{
"epoch": 10.346820809248555,
"grad_norm": 0.06646797806024551,
"learning_rate": 5.343657447632593e-06,
"loss": 0.0027,
"step": 900
},
{
"epoch": 10.635838150289018,
"grad_norm": 0.10714161396026611,
"learning_rate": 4.7624709837002794e-06,
"loss": 0.0025,
"step": 925
},
{
"epoch": 10.92485549132948,
"grad_norm": 0.14236567914485931,
"learning_rate": 4.204716448100967e-06,
"loss": 0.0038,
"step": 950
},
{
"epoch": 11.0,
"eval_f1_macro": 0.7042070354121188,
"eval_f1_micro": 0.7103109656301145,
"eval_loss": 0.2040930837392807,
"eval_precision_micro": 0.5994475138121547,
"eval_recall_micro": 0.8714859437751004,
"eval_runtime": 17.0325,
"eval_samples_per_second": 133.568,
"eval_steps_per_second": 4.227,
"step": 957
},
{
"epoch": 11.208092485549132,
"grad_norm": 0.20406219363212585,
"learning_rate": 3.6728891519374467e-06,
"loss": 0.0028,
"step": 975
},
{
"epoch": 11.497109826589595,
"grad_norm": 0.26664334535598755,
"learning_rate": 3.1693684116870915e-06,
"loss": 0.0027,
"step": 1000
},
{
"epoch": 11.786127167630058,
"grad_norm": 0.09276499599218369,
"learning_rate": 2.6964069044927044e-06,
"loss": 0.0024,
"step": 1025
},
{
"epoch": 12.0,
"eval_f1_macro": 0.7031684663931863,
"eval_f1_micro": 0.7166666666666667,
"eval_loss": 0.225614532828331,
"eval_precision_micro": 0.6125356125356125,
"eval_recall_micro": 0.8634538152610441,
"eval_runtime": 17.0969,
"eval_samples_per_second": 133.065,
"eval_steps_per_second": 4.211,
"step": 1044
},
{
"epoch": 12.06936416184971,
"grad_norm": 0.1458662748336792,
"learning_rate": 2.2561205900189064e-06,
"loss": 0.0027,
"step": 1050
},
{
"epoch": 12.358381502890174,
"grad_norm": 0.1117081567645073,
"learning_rate": 1.8504792439623475e-06,
"loss": 0.0025,
"step": 1075
},
{
"epoch": 12.647398843930636,
"grad_norm": 0.17292848229408264,
"learning_rate": 1.4812976455672278e-06,
"loss": 0.0025,
"step": 1100
},
{
"epoch": 12.936416184971097,
"grad_norm": 0.37239304184913635,
"learning_rate": 1.1502274585720252e-06,
"loss": 0.0021,
"step": 1125
},
{
"epoch": 13.0,
"eval_f1_macro": 0.7020439217567145,
"eval_f1_micro": 0.7174280879864636,
"eval_loss": 0.22631782293319702,
"eval_precision_micro": 0.6198830409356725,
"eval_recall_micro": 0.8514056224899599,
"eval_runtime": 17.1562,
"eval_samples_per_second": 132.605,
"eval_steps_per_second": 4.197,
"step": 1131
},
{
"epoch": 13.219653179190752,
"grad_norm": 0.051143016666173935,
"learning_rate": 8.587498419108009e-07,
"loss": 0.0021,
"step": 1150
},
{
"epoch": 13.508670520231213,
"grad_norm": 0.20565341413021088,
"learning_rate": 6.08168823227695e-07,
"loss": 0.0028,
"step": 1175
},
{
"epoch": 13.797687861271676,
"grad_norm": 0.015616578981280327,
"learning_rate": 3.996054648505965e-07,
"loss": 0.0021,
"step": 1200
},
{
"epoch": 14.0,
"eval_f1_macro": 0.710205871606475,
"eval_f1_micro": 0.7279029462738301,
"eval_loss": 0.23643752932548523,
"eval_precision_micro": 0.6402439024390244,
"eval_recall_micro": 0.8433734939759037,
"eval_runtime": 16.9864,
"eval_samples_per_second": 133.93,
"eval_steps_per_second": 4.239,
"step": 1218
}
],
"logging_steps": 25,
"max_steps": 1305,
"num_input_tokens_seen": 0,
"num_train_epochs": 15,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.374646862938112e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}