adaption_adaptive_math_2 / trainer_state.json
Charley890's picture
Add 11 files
121d948 verified
Raw
History Blame Contribute Delete
20.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 21,
"global_step": 105,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.047619047619047616,
"grad_norm": 0.2336401790380478,
"learning_rate": 0.0,
"loss": 1.597024917602539,
"step": 1
},
{
"epoch": 0.09523809523809523,
"grad_norm": 0.139324352145195,
"learning_rate": 1.25e-05,
"loss": 1.0992431640625,
"step": 2
},
{
"epoch": 0.14285714285714285,
"grad_norm": 0.18670302629470825,
"learning_rate": 2.5e-05,
"loss": 1.25390625,
"step": 3
},
{
"epoch": 0.19047619047619047,
"grad_norm": 0.1872895509004593,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.28125,
"step": 4
},
{
"epoch": 0.23809523809523808,
"grad_norm": 0.27610132098197937,
"learning_rate": 5e-05,
"loss": 1.421875,
"step": 5
},
{
"epoch": 0.2857142857142857,
"grad_norm": 0.18864712119102478,
"learning_rate": 4.955445544554456e-05,
"loss": 1.202880859375,
"step": 6
},
{
"epoch": 0.3333333333333333,
"grad_norm": 0.195709228515625,
"learning_rate": 4.910891089108911e-05,
"loss": 1.349365234375,
"step": 7
},
{
"epoch": 0.38095238095238093,
"grad_norm": 0.19647514820098877,
"learning_rate": 4.866336633663367e-05,
"loss": 1.292724609375,
"step": 8
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.13170799612998962,
"learning_rate": 4.821782178217822e-05,
"loss": 1.17919921875,
"step": 9
},
{
"epoch": 0.47619047619047616,
"grad_norm": 0.11354876309633255,
"learning_rate": 4.7772277227722775e-05,
"loss": 1.047119140625,
"step": 10
},
{
"epoch": 0.5238095238095238,
"grad_norm": 0.10402568429708481,
"learning_rate": 4.7326732673267326e-05,
"loss": 1.0447998046875,
"step": 11
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.11599553376436234,
"learning_rate": 4.688118811881188e-05,
"loss": 1.234375,
"step": 12
},
{
"epoch": 0.6190476190476191,
"grad_norm": 0.10330411046743393,
"learning_rate": 4.643564356435644e-05,
"loss": 1.03271484375,
"step": 13
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.09363178163766861,
"learning_rate": 4.599009900990099e-05,
"loss": 1.108642578125,
"step": 14
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.07801345735788345,
"learning_rate": 4.554455445544555e-05,
"loss": 1.20751953125,
"step": 15
},
{
"epoch": 0.7619047619047619,
"grad_norm": 0.08759468048810959,
"learning_rate": 4.5099009900990106e-05,
"loss": 1.11328125,
"step": 16
},
{
"epoch": 0.8095238095238095,
"grad_norm": 0.0739271342754364,
"learning_rate": 4.4653465346534656e-05,
"loss": 0.991943359375,
"step": 17
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.07324020564556122,
"learning_rate": 4.4207920792079214e-05,
"loss": 1.015625,
"step": 18
},
{
"epoch": 0.9047619047619048,
"grad_norm": 0.0887310728430748,
"learning_rate": 4.3762376237623764e-05,
"loss": 1.12646484375,
"step": 19
},
{
"epoch": 0.9523809523809523,
"grad_norm": 0.09081307798624039,
"learning_rate": 4.331683168316832e-05,
"loss": 1.125732421875,
"step": 20
},
{
"epoch": 1.0,
"grad_norm": 0.09143728017807007,
"learning_rate": 4.287128712871287e-05,
"loss": 1.086482048034668,
"step": 21
},
{
"epoch": 1.0,
"eval_loss": 0.89794921875,
"eval_runtime": 6.2074,
"eval_samples_per_second": 0.483,
"eval_steps_per_second": 0.161,
"step": 21
},
{
"epoch": 1.0476190476190477,
"grad_norm": 0.11578790843486786,
"learning_rate": 4.242574257425743e-05,
"loss": 1.1945695877075195,
"step": 22
},
{
"epoch": 1.0952380952380953,
"grad_norm": 0.07215438783168793,
"learning_rate": 4.198019801980198e-05,
"loss": 0.892822265625,
"step": 23
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.06692706048488617,
"learning_rate": 4.153465346534654e-05,
"loss": 0.9228515625,
"step": 24
},
{
"epoch": 1.1904761904761905,
"grad_norm": 0.06746720522642136,
"learning_rate": 4.1089108910891094e-05,
"loss": 0.95361328125,
"step": 25
},
{
"epoch": 1.2380952380952381,
"grad_norm": 0.08407702296972275,
"learning_rate": 4.0643564356435645e-05,
"loss": 0.990966796875,
"step": 26
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.05947112664580345,
"learning_rate": 4.01980198019802e-05,
"loss": 0.9287109375,
"step": 27
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.0628310814499855,
"learning_rate": 3.975247524752476e-05,
"loss": 1.0950927734375,
"step": 28
},
{
"epoch": 1.380952380952381,
"grad_norm": 0.07003499567508698,
"learning_rate": 3.930693069306931e-05,
"loss": 1.0634765625,
"step": 29
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.05565551668405533,
"learning_rate": 3.886138613861387e-05,
"loss": 1.027587890625,
"step": 30
},
{
"epoch": 1.4761904761904763,
"grad_norm": 0.058880023658275604,
"learning_rate": 3.841584158415842e-05,
"loss": 0.938232421875,
"step": 31
},
{
"epoch": 1.5238095238095237,
"grad_norm": 0.05786323547363281,
"learning_rate": 3.7970297029702975e-05,
"loss": 0.9415283203125,
"step": 32
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.0752716138958931,
"learning_rate": 3.7524752475247526e-05,
"loss": 1.10986328125,
"step": 33
},
{
"epoch": 1.619047619047619,
"grad_norm": 0.06447714567184448,
"learning_rate": 3.707920792079208e-05,
"loss": 0.9547119140625,
"step": 34
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.057373639196157455,
"learning_rate": 3.6633663366336634e-05,
"loss": 1.0313720703125,
"step": 35
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.06472651660442352,
"learning_rate": 3.618811881188119e-05,
"loss": 1.12939453125,
"step": 36
},
{
"epoch": 1.7619047619047619,
"grad_norm": 0.06590702384710312,
"learning_rate": 3.574257425742575e-05,
"loss": 1.0234375,
"step": 37
},
{
"epoch": 1.8095238095238095,
"grad_norm": 0.05247596651315689,
"learning_rate": 3.5297029702970306e-05,
"loss": 0.9293212890625,
"step": 38
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.054419517517089844,
"learning_rate": 3.4851485148514856e-05,
"loss": 0.956298828125,
"step": 39
},
{
"epoch": 1.9047619047619047,
"grad_norm": 0.06416720896959305,
"learning_rate": 3.4405940594059413e-05,
"loss": 1.055419921875,
"step": 40
},
{
"epoch": 1.9523809523809523,
"grad_norm": 0.06087876111268997,
"learning_rate": 3.3960396039603964e-05,
"loss": 1.0548095703125,
"step": 41
},
{
"epoch": 2.0,
"grad_norm": 0.06107616424560547,
"learning_rate": 3.351485148514852e-05,
"loss": 1.0191421508789062,
"step": 42
},
{
"epoch": 2.0,
"eval_loss": 0.85693359375,
"eval_runtime": 5.8934,
"eval_samples_per_second": 0.509,
"eval_steps_per_second": 0.17,
"step": 42
},
{
"epoch": 2.0476190476190474,
"grad_norm": 0.07328856736421585,
"learning_rate": 3.306930693069307e-05,
"loss": 1.1238336563110352,
"step": 43
},
{
"epoch": 2.0952380952380953,
"grad_norm": 0.06458962708711624,
"learning_rate": 3.262376237623763e-05,
"loss": 0.8521728515625,
"step": 44
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.05227170139551163,
"learning_rate": 3.217821782178218e-05,
"loss": 0.875732421875,
"step": 45
},
{
"epoch": 2.1904761904761907,
"grad_norm": 0.05606422200798988,
"learning_rate": 3.173267326732674e-05,
"loss": 0.908447265625,
"step": 46
},
{
"epoch": 2.238095238095238,
"grad_norm": 0.06455234438180923,
"learning_rate": 3.128712871287129e-05,
"loss": 0.9385986328125,
"step": 47
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.05182703956961632,
"learning_rate": 3.0841584158415845e-05,
"loss": 0.8916015625,
"step": 48
},
{
"epoch": 2.3333333333333335,
"grad_norm": 0.056314852088689804,
"learning_rate": 3.0396039603960395e-05,
"loss": 1.0513916015625,
"step": 49
},
{
"epoch": 2.380952380952381,
"grad_norm": 0.06813926994800568,
"learning_rate": 2.9950495049504956e-05,
"loss": 1.01904296875,
"step": 50
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.05330316722393036,
"learning_rate": 2.950495049504951e-05,
"loss": 0.9931640625,
"step": 51
},
{
"epoch": 2.4761904761904763,
"grad_norm": 0.047916412353515625,
"learning_rate": 2.9059405940594064e-05,
"loss": 0.9019775390625,
"step": 52
},
{
"epoch": 2.5238095238095237,
"grad_norm": 0.052138037979602814,
"learning_rate": 2.8613861386138618e-05,
"loss": 0.9117431640625,
"step": 53
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.06863577663898468,
"learning_rate": 2.8168316831683172e-05,
"loss": 1.06787109375,
"step": 54
},
{
"epoch": 2.619047619047619,
"grad_norm": 0.053087200969457626,
"learning_rate": 2.7722772277227726e-05,
"loss": 0.9228515625,
"step": 55
},
{
"epoch": 2.6666666666666665,
"grad_norm": 0.053308919072151184,
"learning_rate": 2.727722772277228e-05,
"loss": 0.9986572265625,
"step": 56
},
{
"epoch": 2.7142857142857144,
"grad_norm": 0.06101275607943535,
"learning_rate": 2.6831683168316834e-05,
"loss": 1.0927734375,
"step": 57
},
{
"epoch": 2.761904761904762,
"grad_norm": 0.06312154233455658,
"learning_rate": 2.6386138613861387e-05,
"loss": 0.991943359375,
"step": 58
},
{
"epoch": 2.8095238095238093,
"grad_norm": 0.04727683961391449,
"learning_rate": 2.594059405940594e-05,
"loss": 0.90283203125,
"step": 59
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.050816185772418976,
"learning_rate": 2.5495049504950495e-05,
"loss": 0.928955078125,
"step": 60
},
{
"epoch": 2.9047619047619047,
"grad_norm": 0.06634709984064102,
"learning_rate": 2.504950495049505e-05,
"loss": 1.029541015625,
"step": 61
},
{
"epoch": 2.9523809523809526,
"grad_norm": 0.05809742957353592,
"learning_rate": 2.4603960396039603e-05,
"loss": 1.0267333984375,
"step": 62
},
{
"epoch": 3.0,
"grad_norm": 0.060985397547483444,
"learning_rate": 2.415841584158416e-05,
"loss": 0.987398624420166,
"step": 63
},
{
"epoch": 3.0,
"eval_loss": 0.84130859375,
"eval_runtime": 5.8936,
"eval_samples_per_second": 0.509,
"eval_steps_per_second": 0.17,
"step": 63
},
{
"epoch": 3.0476190476190474,
"grad_norm": 0.07713712006807327,
"learning_rate": 2.3712871287128714e-05,
"loss": 1.0920753479003906,
"step": 64
},
{
"epoch": 3.0952380952380953,
"grad_norm": 0.05062828212976456,
"learning_rate": 2.3267326732673272e-05,
"loss": 0.8311767578125,
"step": 65
},
{
"epoch": 3.142857142857143,
"grad_norm": 0.05484438315033913,
"learning_rate": 2.2821782178217826e-05,
"loss": 0.852294921875,
"step": 66
},
{
"epoch": 3.1904761904761907,
"grad_norm": 0.05483638867735863,
"learning_rate": 2.237623762376238e-05,
"loss": 0.885986328125,
"step": 67
},
{
"epoch": 3.238095238095238,
"grad_norm": 0.06613826751708984,
"learning_rate": 2.1930693069306934e-05,
"loss": 0.91259765625,
"step": 68
},
{
"epoch": 3.2857142857142856,
"grad_norm": 0.05269517004489899,
"learning_rate": 2.1485148514851487e-05,
"loss": 0.8701171875,
"step": 69
},
{
"epoch": 3.3333333333333335,
"grad_norm": 0.05947788804769516,
"learning_rate": 2.103960396039604e-05,
"loss": 1.0263671875,
"step": 70
},
{
"epoch": 3.380952380952381,
"grad_norm": 0.06955339759588242,
"learning_rate": 2.0594059405940595e-05,
"loss": 0.994140625,
"step": 71
},
{
"epoch": 3.4285714285714284,
"grad_norm": 0.05246608331799507,
"learning_rate": 2.014851485148515e-05,
"loss": 0.9725341796875,
"step": 72
},
{
"epoch": 3.4761904761904763,
"grad_norm": 0.04798204451799393,
"learning_rate": 1.9702970297029703e-05,
"loss": 0.8829345703125,
"step": 73
},
{
"epoch": 3.5238095238095237,
"grad_norm": 0.05153437331318855,
"learning_rate": 1.925742574257426e-05,
"loss": 0.8934326171875,
"step": 74
},
{
"epoch": 3.571428571428571,
"grad_norm": 0.07233956456184387,
"learning_rate": 1.8811881188118814e-05,
"loss": 1.041259765625,
"step": 75
},
{
"epoch": 3.619047619047619,
"grad_norm": 0.05623261630535126,
"learning_rate": 1.8366336633663368e-05,
"loss": 0.9068603515625,
"step": 76
},
{
"epoch": 3.6666666666666665,
"grad_norm": 0.0568804107606411,
"learning_rate": 1.7920792079207922e-05,
"loss": 0.9783935546875,
"step": 77
},
{
"epoch": 3.7142857142857144,
"grad_norm": 0.0646575391292572,
"learning_rate": 1.7475247524752476e-05,
"loss": 1.0751953125,
"step": 78
},
{
"epoch": 3.761904761904762,
"grad_norm": 0.06511656194925308,
"learning_rate": 1.7029702970297033e-05,
"loss": 0.97216796875,
"step": 79
},
{
"epoch": 3.8095238095238093,
"grad_norm": 0.04965182766318321,
"learning_rate": 1.6584158415841587e-05,
"loss": 0.8896484375,
"step": 80
},
{
"epoch": 3.857142857142857,
"grad_norm": 0.050047993659973145,
"learning_rate": 1.613861386138614e-05,
"loss": 0.9139404296875,
"step": 81
},
{
"epoch": 3.9047619047619047,
"grad_norm": 0.06543626636266708,
"learning_rate": 1.5693069306930695e-05,
"loss": 1.013427734375,
"step": 82
},
{
"epoch": 3.9523809523809526,
"grad_norm": 0.059756673872470856,
"learning_rate": 1.524752475247525e-05,
"loss": 1.0125732421875,
"step": 83
},
{
"epoch": 4.0,
"grad_norm": 0.06354590505361557,
"learning_rate": 1.4801980198019805e-05,
"loss": 0.9644265174865723,
"step": 84
},
{
"epoch": 4.0,
"eval_loss": 0.83056640625,
"eval_runtime": 5.8955,
"eval_samples_per_second": 0.509,
"eval_steps_per_second": 0.17,
"step": 84
},
{
"epoch": 4.0476190476190474,
"grad_norm": 0.07922310382127762,
"learning_rate": 1.4356435643564359e-05,
"loss": 1.0685958862304688,
"step": 85
},
{
"epoch": 4.095238095238095,
"grad_norm": 0.050637226551771164,
"learning_rate": 1.3910891089108913e-05,
"loss": 0.818603515625,
"step": 86
},
{
"epoch": 4.142857142857143,
"grad_norm": 0.05398539826273918,
"learning_rate": 1.3465346534653467e-05,
"loss": 0.83544921875,
"step": 87
},
{
"epoch": 4.190476190476191,
"grad_norm": 0.05893166363239288,
"learning_rate": 1.301980198019802e-05,
"loss": 0.868896484375,
"step": 88
},
{
"epoch": 4.238095238095238,
"grad_norm": 0.06877650320529938,
"learning_rate": 1.2574257425742574e-05,
"loss": 0.8961181640625,
"step": 89
},
{
"epoch": 4.285714285714286,
"grad_norm": 0.05526193976402283,
"learning_rate": 1.212871287128713e-05,
"loss": 0.855712890625,
"step": 90
},
{
"epoch": 4.333333333333333,
"grad_norm": 0.06256742030382156,
"learning_rate": 1.1683168316831684e-05,
"loss": 1.0123291015625,
"step": 91
},
{
"epoch": 4.380952380952381,
"grad_norm": 0.07355812937021255,
"learning_rate": 1.123762376237624e-05,
"loss": 0.978515625,
"step": 92
},
{
"epoch": 4.428571428571429,
"grad_norm": 0.05362411215901375,
"learning_rate": 1.0792079207920793e-05,
"loss": 0.9608154296875,
"step": 93
},
{
"epoch": 4.476190476190476,
"grad_norm": 0.04871255159378052,
"learning_rate": 1.0346534653465347e-05,
"loss": 0.871337890625,
"step": 94
},
{
"epoch": 4.523809523809524,
"grad_norm": 0.05343654006719589,
"learning_rate": 9.900990099009901e-06,
"loss": 0.8802490234375,
"step": 95
},
{
"epoch": 4.571428571428571,
"grad_norm": 0.08328408747911453,
"learning_rate": 9.455445544554455e-06,
"loss": 1.024658203125,
"step": 96
},
{
"epoch": 4.619047619047619,
"grad_norm": 0.056153565645217896,
"learning_rate": 9.00990099009901e-06,
"loss": 0.8939208984375,
"step": 97
},
{
"epoch": 4.666666666666667,
"grad_norm": 0.058305393904447556,
"learning_rate": 8.564356435643565e-06,
"loss": 0.96630859375,
"step": 98
},
{
"epoch": 4.714285714285714,
"grad_norm": 0.06576362997293472,
"learning_rate": 8.118811881188119e-06,
"loss": 1.060791015625,
"step": 99
},
{
"epoch": 4.761904761904762,
"grad_norm": 0.06733548641204834,
"learning_rate": 7.673267326732674e-06,
"loss": 0.959716796875,
"step": 100
},
{
"epoch": 4.809523809523809,
"grad_norm": 0.0538371279835701,
"learning_rate": 7.227722772277229e-06,
"loss": 0.8809814453125,
"step": 101
},
{
"epoch": 4.857142857142857,
"grad_norm": 0.051455527544021606,
"learning_rate": 6.782178217821783e-06,
"loss": 0.908447265625,
"step": 102
},
{
"epoch": 4.904761904761905,
"grad_norm": 0.06762618571519852,
"learning_rate": 6.336633663366337e-06,
"loss": 1.001220703125,
"step": 103
},
{
"epoch": 4.9523809523809526,
"grad_norm": 0.06271763890981674,
"learning_rate": 5.891089108910892e-06,
"loss": 1.003173828125,
"step": 104
},
{
"epoch": 5.0,
"grad_norm": 0.0635267123579979,
"learning_rate": 5.4455445544554465e-06,
"loss": 0.9531912803649902,
"step": 105
},
{
"epoch": 5.0,
"eval_loss": 0.83056640625,
"eval_runtime": 5.907,
"eval_samples_per_second": 0.508,
"eval_steps_per_second": 0.169,
"step": 105
}
],
"logging_steps": 1.0,
"max_steps": 105,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.510693293439058e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}