{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 21, "global_step": 105, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.047619047619047616, "grad_norm": 0.2336401790380478, "learning_rate": 0.0, "loss": 1.597024917602539, "step": 1 }, { "epoch": 0.09523809523809523, "grad_norm": 0.139324352145195, "learning_rate": 1.25e-05, "loss": 1.0992431640625, "step": 2 }, { "epoch": 0.14285714285714285, "grad_norm": 0.18670302629470825, "learning_rate": 2.5e-05, "loss": 1.25390625, "step": 3 }, { "epoch": 0.19047619047619047, "grad_norm": 0.1872895509004593, "learning_rate": 3.7500000000000003e-05, "loss": 1.28125, "step": 4 }, { "epoch": 0.23809523809523808, "grad_norm": 0.27610132098197937, "learning_rate": 5e-05, "loss": 1.421875, "step": 5 }, { "epoch": 0.2857142857142857, "grad_norm": 0.18864712119102478, "learning_rate": 4.955445544554456e-05, "loss": 1.202880859375, "step": 6 }, { "epoch": 0.3333333333333333, "grad_norm": 0.195709228515625, "learning_rate": 4.910891089108911e-05, "loss": 1.349365234375, "step": 7 }, { "epoch": 0.38095238095238093, "grad_norm": 0.19647514820098877, "learning_rate": 4.866336633663367e-05, "loss": 1.292724609375, "step": 8 }, { "epoch": 0.42857142857142855, "grad_norm": 0.13170799612998962, "learning_rate": 4.821782178217822e-05, "loss": 1.17919921875, "step": 9 }, { "epoch": 0.47619047619047616, "grad_norm": 0.11354876309633255, "learning_rate": 4.7772277227722775e-05, "loss": 1.047119140625, "step": 10 }, { "epoch": 0.5238095238095238, "grad_norm": 0.10402568429708481, "learning_rate": 4.7326732673267326e-05, "loss": 1.0447998046875, "step": 11 }, { "epoch": 0.5714285714285714, "grad_norm": 0.11599553376436234, "learning_rate": 4.688118811881188e-05, "loss": 1.234375, "step": 12 }, { "epoch": 0.6190476190476191, "grad_norm": 0.10330411046743393, "learning_rate": 4.643564356435644e-05, "loss": 1.03271484375, "step": 13 }, { "epoch": 0.6666666666666666, "grad_norm": 0.09363178163766861, "learning_rate": 4.599009900990099e-05, "loss": 1.108642578125, "step": 14 }, { "epoch": 0.7142857142857143, "grad_norm": 0.07801345735788345, "learning_rate": 4.554455445544555e-05, "loss": 1.20751953125, "step": 15 }, { "epoch": 0.7619047619047619, "grad_norm": 0.08759468048810959, "learning_rate": 4.5099009900990106e-05, "loss": 1.11328125, "step": 16 }, { "epoch": 0.8095238095238095, "grad_norm": 0.0739271342754364, "learning_rate": 4.4653465346534656e-05, "loss": 0.991943359375, "step": 17 }, { "epoch": 0.8571428571428571, "grad_norm": 0.07324020564556122, "learning_rate": 4.4207920792079214e-05, "loss": 1.015625, "step": 18 }, { "epoch": 0.9047619047619048, "grad_norm": 0.0887310728430748, "learning_rate": 4.3762376237623764e-05, "loss": 1.12646484375, "step": 19 }, { "epoch": 0.9523809523809523, "grad_norm": 0.09081307798624039, "learning_rate": 4.331683168316832e-05, "loss": 1.125732421875, "step": 20 }, { "epoch": 1.0, "grad_norm": 0.09143728017807007, "learning_rate": 4.287128712871287e-05, "loss": 1.086482048034668, "step": 21 }, { "epoch": 1.0, "eval_loss": 0.89794921875, "eval_runtime": 6.2074, "eval_samples_per_second": 0.483, "eval_steps_per_second": 0.161, "step": 21 }, { "epoch": 1.0476190476190477, "grad_norm": 0.11578790843486786, "learning_rate": 4.242574257425743e-05, "loss": 1.1945695877075195, "step": 22 }, { "epoch": 1.0952380952380953, "grad_norm": 0.07215438783168793, "learning_rate": 4.198019801980198e-05, "loss": 0.892822265625, "step": 23 }, { "epoch": 1.1428571428571428, "grad_norm": 0.06692706048488617, "learning_rate": 4.153465346534654e-05, "loss": 0.9228515625, "step": 24 }, { "epoch": 1.1904761904761905, "grad_norm": 0.06746720522642136, "learning_rate": 4.1089108910891094e-05, "loss": 0.95361328125, "step": 25 }, { "epoch": 1.2380952380952381, "grad_norm": 0.08407702296972275, "learning_rate": 4.0643564356435645e-05, "loss": 0.990966796875, "step": 26 }, { "epoch": 1.2857142857142856, "grad_norm": 0.05947112664580345, "learning_rate": 4.01980198019802e-05, "loss": 0.9287109375, "step": 27 }, { "epoch": 1.3333333333333333, "grad_norm": 0.0628310814499855, "learning_rate": 3.975247524752476e-05, "loss": 1.0950927734375, "step": 28 }, { "epoch": 1.380952380952381, "grad_norm": 0.07003499567508698, "learning_rate": 3.930693069306931e-05, "loss": 1.0634765625, "step": 29 }, { "epoch": 1.4285714285714286, "grad_norm": 0.05565551668405533, "learning_rate": 3.886138613861387e-05, "loss": 1.027587890625, "step": 30 }, { "epoch": 1.4761904761904763, "grad_norm": 0.058880023658275604, "learning_rate": 3.841584158415842e-05, "loss": 0.938232421875, "step": 31 }, { "epoch": 1.5238095238095237, "grad_norm": 0.05786323547363281, "learning_rate": 3.7970297029702975e-05, "loss": 0.9415283203125, "step": 32 }, { "epoch": 1.5714285714285714, "grad_norm": 0.0752716138958931, "learning_rate": 3.7524752475247526e-05, "loss": 1.10986328125, "step": 33 }, { "epoch": 1.619047619047619, "grad_norm": 0.06447714567184448, "learning_rate": 3.707920792079208e-05, "loss": 0.9547119140625, "step": 34 }, { "epoch": 1.6666666666666665, "grad_norm": 0.057373639196157455, "learning_rate": 3.6633663366336634e-05, "loss": 1.0313720703125, "step": 35 }, { "epoch": 1.7142857142857144, "grad_norm": 0.06472651660442352, "learning_rate": 3.618811881188119e-05, "loss": 1.12939453125, "step": 36 }, { "epoch": 1.7619047619047619, "grad_norm": 0.06590702384710312, "learning_rate": 3.574257425742575e-05, "loss": 1.0234375, "step": 37 }, { "epoch": 1.8095238095238095, "grad_norm": 0.05247596651315689, "learning_rate": 3.5297029702970306e-05, "loss": 0.9293212890625, "step": 38 }, { "epoch": 1.8571428571428572, "grad_norm": 0.054419517517089844, "learning_rate": 3.4851485148514856e-05, "loss": 0.956298828125, "step": 39 }, { "epoch": 1.9047619047619047, "grad_norm": 0.06416720896959305, "learning_rate": 3.4405940594059413e-05, "loss": 1.055419921875, "step": 40 }, { "epoch": 1.9523809523809523, "grad_norm": 0.06087876111268997, "learning_rate": 3.3960396039603964e-05, "loss": 1.0548095703125, "step": 41 }, { "epoch": 2.0, "grad_norm": 0.06107616424560547, "learning_rate": 3.351485148514852e-05, "loss": 1.0191421508789062, "step": 42 }, { "epoch": 2.0, "eval_loss": 0.85693359375, "eval_runtime": 5.8934, "eval_samples_per_second": 0.509, "eval_steps_per_second": 0.17, "step": 42 }, { "epoch": 2.0476190476190474, "grad_norm": 0.07328856736421585, "learning_rate": 3.306930693069307e-05, "loss": 1.1238336563110352, "step": 43 }, { "epoch": 2.0952380952380953, "grad_norm": 0.06458962708711624, "learning_rate": 3.262376237623763e-05, "loss": 0.8521728515625, "step": 44 }, { "epoch": 2.142857142857143, "grad_norm": 0.05227170139551163, "learning_rate": 3.217821782178218e-05, "loss": 0.875732421875, "step": 45 }, { "epoch": 2.1904761904761907, "grad_norm": 0.05606422200798988, "learning_rate": 3.173267326732674e-05, "loss": 0.908447265625, "step": 46 }, { "epoch": 2.238095238095238, "grad_norm": 0.06455234438180923, "learning_rate": 3.128712871287129e-05, "loss": 0.9385986328125, "step": 47 }, { "epoch": 2.2857142857142856, "grad_norm": 0.05182703956961632, "learning_rate": 3.0841584158415845e-05, "loss": 0.8916015625, "step": 48 }, { "epoch": 2.3333333333333335, "grad_norm": 0.056314852088689804, "learning_rate": 3.0396039603960395e-05, "loss": 1.0513916015625, "step": 49 }, { "epoch": 2.380952380952381, "grad_norm": 0.06813926994800568, "learning_rate": 2.9950495049504956e-05, "loss": 1.01904296875, "step": 50 }, { "epoch": 2.4285714285714284, "grad_norm": 0.05330316722393036, "learning_rate": 2.950495049504951e-05, "loss": 0.9931640625, "step": 51 }, { "epoch": 2.4761904761904763, "grad_norm": 0.047916412353515625, "learning_rate": 2.9059405940594064e-05, "loss": 0.9019775390625, "step": 52 }, { "epoch": 2.5238095238095237, "grad_norm": 0.052138037979602814, "learning_rate": 2.8613861386138618e-05, "loss": 0.9117431640625, "step": 53 }, { "epoch": 2.571428571428571, "grad_norm": 0.06863577663898468, "learning_rate": 2.8168316831683172e-05, "loss": 1.06787109375, "step": 54 }, { "epoch": 2.619047619047619, "grad_norm": 0.053087200969457626, "learning_rate": 2.7722772277227726e-05, "loss": 0.9228515625, "step": 55 }, { "epoch": 2.6666666666666665, "grad_norm": 0.053308919072151184, "learning_rate": 2.727722772277228e-05, "loss": 0.9986572265625, "step": 56 }, { "epoch": 2.7142857142857144, "grad_norm": 0.06101275607943535, "learning_rate": 2.6831683168316834e-05, "loss": 1.0927734375, "step": 57 }, { "epoch": 2.761904761904762, "grad_norm": 0.06312154233455658, "learning_rate": 2.6386138613861387e-05, "loss": 0.991943359375, "step": 58 }, { "epoch": 2.8095238095238093, "grad_norm": 0.04727683961391449, "learning_rate": 2.594059405940594e-05, "loss": 0.90283203125, "step": 59 }, { "epoch": 2.857142857142857, "grad_norm": 0.050816185772418976, "learning_rate": 2.5495049504950495e-05, "loss": 0.928955078125, "step": 60 }, { "epoch": 2.9047619047619047, "grad_norm": 0.06634709984064102, "learning_rate": 2.504950495049505e-05, "loss": 1.029541015625, "step": 61 }, { "epoch": 2.9523809523809526, "grad_norm": 0.05809742957353592, "learning_rate": 2.4603960396039603e-05, "loss": 1.0267333984375, "step": 62 }, { "epoch": 3.0, "grad_norm": 0.060985397547483444, "learning_rate": 2.415841584158416e-05, "loss": 0.987398624420166, "step": 63 }, { "epoch": 3.0, "eval_loss": 0.84130859375, "eval_runtime": 5.8936, "eval_samples_per_second": 0.509, "eval_steps_per_second": 0.17, "step": 63 }, { "epoch": 3.0476190476190474, "grad_norm": 0.07713712006807327, "learning_rate": 2.3712871287128714e-05, "loss": 1.0920753479003906, "step": 64 }, { "epoch": 3.0952380952380953, "grad_norm": 0.05062828212976456, "learning_rate": 2.3267326732673272e-05, "loss": 0.8311767578125, "step": 65 }, { "epoch": 3.142857142857143, "grad_norm": 0.05484438315033913, "learning_rate": 2.2821782178217826e-05, "loss": 0.852294921875, "step": 66 }, { "epoch": 3.1904761904761907, "grad_norm": 0.05483638867735863, "learning_rate": 2.237623762376238e-05, "loss": 0.885986328125, "step": 67 }, { "epoch": 3.238095238095238, "grad_norm": 0.06613826751708984, "learning_rate": 2.1930693069306934e-05, "loss": 0.91259765625, "step": 68 }, { "epoch": 3.2857142857142856, "grad_norm": 0.05269517004489899, "learning_rate": 2.1485148514851487e-05, "loss": 0.8701171875, "step": 69 }, { "epoch": 3.3333333333333335, "grad_norm": 0.05947788804769516, "learning_rate": 2.103960396039604e-05, "loss": 1.0263671875, "step": 70 }, { "epoch": 3.380952380952381, "grad_norm": 0.06955339759588242, "learning_rate": 2.0594059405940595e-05, "loss": 0.994140625, "step": 71 }, { "epoch": 3.4285714285714284, "grad_norm": 0.05246608331799507, "learning_rate": 2.014851485148515e-05, "loss": 0.9725341796875, "step": 72 }, { "epoch": 3.4761904761904763, "grad_norm": 0.04798204451799393, "learning_rate": 1.9702970297029703e-05, "loss": 0.8829345703125, "step": 73 }, { "epoch": 3.5238095238095237, "grad_norm": 0.05153437331318855, "learning_rate": 1.925742574257426e-05, "loss": 0.8934326171875, "step": 74 }, { "epoch": 3.571428571428571, "grad_norm": 0.07233956456184387, "learning_rate": 1.8811881188118814e-05, "loss": 1.041259765625, "step": 75 }, { "epoch": 3.619047619047619, "grad_norm": 0.05623261630535126, "learning_rate": 1.8366336633663368e-05, "loss": 0.9068603515625, "step": 76 }, { "epoch": 3.6666666666666665, "grad_norm": 0.0568804107606411, "learning_rate": 1.7920792079207922e-05, "loss": 0.9783935546875, "step": 77 }, { "epoch": 3.7142857142857144, "grad_norm": 0.0646575391292572, "learning_rate": 1.7475247524752476e-05, "loss": 1.0751953125, "step": 78 }, { "epoch": 3.761904761904762, "grad_norm": 0.06511656194925308, "learning_rate": 1.7029702970297033e-05, "loss": 0.97216796875, "step": 79 }, { "epoch": 3.8095238095238093, "grad_norm": 0.04965182766318321, "learning_rate": 1.6584158415841587e-05, "loss": 0.8896484375, "step": 80 }, { "epoch": 3.857142857142857, "grad_norm": 0.050047993659973145, "learning_rate": 1.613861386138614e-05, "loss": 0.9139404296875, "step": 81 }, { "epoch": 3.9047619047619047, "grad_norm": 0.06543626636266708, "learning_rate": 1.5693069306930695e-05, "loss": 1.013427734375, "step": 82 }, { "epoch": 3.9523809523809526, "grad_norm": 0.059756673872470856, "learning_rate": 1.524752475247525e-05, "loss": 1.0125732421875, "step": 83 }, { "epoch": 4.0, "grad_norm": 0.06354590505361557, "learning_rate": 1.4801980198019805e-05, "loss": 0.9644265174865723, "step": 84 }, { "epoch": 4.0, "eval_loss": 0.83056640625, "eval_runtime": 5.8955, "eval_samples_per_second": 0.509, "eval_steps_per_second": 0.17, "step": 84 }, { "epoch": 4.0476190476190474, "grad_norm": 0.07922310382127762, "learning_rate": 1.4356435643564359e-05, "loss": 1.0685958862304688, "step": 85 }, { "epoch": 4.095238095238095, "grad_norm": 0.050637226551771164, "learning_rate": 1.3910891089108913e-05, "loss": 0.818603515625, "step": 86 }, { "epoch": 4.142857142857143, "grad_norm": 0.05398539826273918, "learning_rate": 1.3465346534653467e-05, "loss": 0.83544921875, "step": 87 }, { "epoch": 4.190476190476191, "grad_norm": 0.05893166363239288, "learning_rate": 1.301980198019802e-05, "loss": 0.868896484375, "step": 88 }, { "epoch": 4.238095238095238, "grad_norm": 0.06877650320529938, "learning_rate": 1.2574257425742574e-05, "loss": 0.8961181640625, "step": 89 }, { "epoch": 4.285714285714286, "grad_norm": 0.05526193976402283, "learning_rate": 1.212871287128713e-05, "loss": 0.855712890625, "step": 90 }, { "epoch": 4.333333333333333, "grad_norm": 0.06256742030382156, "learning_rate": 1.1683168316831684e-05, "loss": 1.0123291015625, "step": 91 }, { "epoch": 4.380952380952381, "grad_norm": 0.07355812937021255, "learning_rate": 1.123762376237624e-05, "loss": 0.978515625, "step": 92 }, { "epoch": 4.428571428571429, "grad_norm": 0.05362411215901375, "learning_rate": 1.0792079207920793e-05, "loss": 0.9608154296875, "step": 93 }, { "epoch": 4.476190476190476, "grad_norm": 0.04871255159378052, "learning_rate": 1.0346534653465347e-05, "loss": 0.871337890625, "step": 94 }, { "epoch": 4.523809523809524, "grad_norm": 0.05343654006719589, "learning_rate": 9.900990099009901e-06, "loss": 0.8802490234375, "step": 95 }, { "epoch": 4.571428571428571, "grad_norm": 0.08328408747911453, "learning_rate": 9.455445544554455e-06, "loss": 1.024658203125, "step": 96 }, { "epoch": 4.619047619047619, "grad_norm": 0.056153565645217896, "learning_rate": 9.00990099009901e-06, "loss": 0.8939208984375, "step": 97 }, { "epoch": 4.666666666666667, "grad_norm": 0.058305393904447556, "learning_rate": 8.564356435643565e-06, "loss": 0.96630859375, "step": 98 }, { "epoch": 4.714285714285714, "grad_norm": 0.06576362997293472, "learning_rate": 8.118811881188119e-06, "loss": 1.060791015625, "step": 99 }, { "epoch": 4.761904761904762, "grad_norm": 0.06733548641204834, "learning_rate": 7.673267326732674e-06, "loss": 0.959716796875, "step": 100 }, { "epoch": 4.809523809523809, "grad_norm": 0.0538371279835701, "learning_rate": 7.227722772277229e-06, "loss": 0.8809814453125, "step": 101 }, { "epoch": 4.857142857142857, "grad_norm": 0.051455527544021606, "learning_rate": 6.782178217821783e-06, "loss": 0.908447265625, "step": 102 }, { "epoch": 4.904761904761905, "grad_norm": 0.06762618571519852, "learning_rate": 6.336633663366337e-06, "loss": 1.001220703125, "step": 103 }, { "epoch": 4.9523809523809526, "grad_norm": 0.06271763890981674, "learning_rate": 5.891089108910892e-06, "loss": 1.003173828125, "step": 104 }, { "epoch": 5.0, "grad_norm": 0.0635267123579979, "learning_rate": 5.4455445544554465e-06, "loss": 0.9531912803649902, "step": 105 }, { "epoch": 5.0, "eval_loss": 0.83056640625, "eval_runtime": 5.907, "eval_samples_per_second": 0.508, "eval_steps_per_second": 0.169, "step": 105 } ], "logging_steps": 1.0, "max_steps": 105, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.510693293439058e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }