{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9813084112149533, "eval_steps": 26, "global_step": 424, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02336448598130841, "grad_norm": 16.625, "learning_rate": 1.0477479818042947e-05, "loss": 1.0571476936340332, "step": 5 }, { "epoch": 0.04672897196261682, "grad_norm": 5.84375, "learning_rate": 2.357432959059663e-05, "loss": 0.5670325279235839, "step": 10 }, { "epoch": 0.07009345794392523, "grad_norm": 4.34375, "learning_rate": 2.6192615944772643e-05, "loss": 0.534730339050293, "step": 15 }, { "epoch": 0.09345794392523364, "grad_norm": 5.03125, "learning_rate": 2.6188214228158065e-05, "loss": 0.528727674484253, "step": 20 }, { "epoch": 0.11682242990654206, "grad_norm": 4.84375, "learning_rate": 2.618042818650518e-05, "loss": 0.5030421733856201, "step": 25 }, { "epoch": 0.14018691588785046, "grad_norm": 5.1875, "learning_rate": 2.6169260503942314e-05, "loss": 0.5157054424285888, "step": 30 }, { "epoch": 0.16355140186915887, "grad_norm": 4.09375, "learning_rate": 2.6154715030370898e-05, "loss": 0.4850313186645508, "step": 35 }, { "epoch": 0.18691588785046728, "grad_norm": 4.5, "learning_rate": 2.6136796780138316e-05, "loss": 0.4838898181915283, "step": 40 }, { "epoch": 0.2102803738317757, "grad_norm": 4.25, "learning_rate": 2.6115511930309236e-05, "loss": 0.5209589004516602, "step": 45 }, { "epoch": 0.2336448598130841, "grad_norm": 4.375, "learning_rate": 2.609086781853618e-05, "loss": 0.48980093002319336, "step": 50 }, { "epoch": 0.24299065420560748, "eval_loss": 0.4843875467777252, "eval_runtime": 55.6497, "eval_samples_per_second": 7.116, "eval_steps_per_second": 7.116, "step": 52 }, { "epoch": 0.24766355140186916, "eval_loss": 0.4850113093852997, "eval_runtime": 63.4929, "eval_samples_per_second": 6.237, "eval_steps_per_second": 6.237, "step": 53 }, { "epoch": 0.2570093457943925, "grad_norm": 4.28125, "learning_rate": 2.606287294052997e-05, "loss": 0.46539983749389646, "step": 55 }, { "epoch": 0.2803738317757009, "grad_norm": 4.4375, "learning_rate": 2.6031536947130925e-05, "loss": 0.4871384143829346, "step": 60 }, { "epoch": 0.3037383177570093, "grad_norm": 3.890625, "learning_rate": 2.599687064098191e-05, "loss": 0.4708998203277588, "step": 65 }, { "epoch": 0.32710280373831774, "grad_norm": 4.0625, "learning_rate": 2.5958885972804244e-05, "loss": 0.4961503028869629, "step": 70 }, { "epoch": 0.35046728971962615, "grad_norm": 4.0625, "learning_rate": 2.591759603727788e-05, "loss": 0.4586769104003906, "step": 75 }, { "epoch": 0.3644859813084112, "eval_loss": 0.47235846519470215, "eval_runtime": 60.6823, "eval_samples_per_second": 6.526, "eval_steps_per_second": 6.526, "step": 78 }, { "epoch": 0.37383177570093457, "grad_norm": 4.3125, "learning_rate": 2.587301506852717e-05, "loss": 0.45466132164001466, "step": 80 }, { "epoch": 0.397196261682243, "grad_norm": 3.90625, "learning_rate": 2.582515843521389e-05, "loss": 0.45511479377746583, "step": 85 }, { "epoch": 0.4205607476635514, "grad_norm": 4.28125, "learning_rate": 2.577404263523907e-05, "loss": 0.44046764373779296, "step": 90 }, { "epoch": 0.4439252336448598, "grad_norm": 3.65625, "learning_rate": 2.57196852900556e-05, "loss": 0.4845860958099365, "step": 95 }, { "epoch": 0.4672897196261682, "grad_norm": 3.34375, "learning_rate": 2.566210513859348e-05, "loss": 0.46938457489013674, "step": 100 }, { "epoch": 0.48598130841121495, "eval_loss": 0.4602718651294708, "eval_runtime": 57.4013, "eval_samples_per_second": 6.899, "eval_steps_per_second": 6.899, "step": 104 }, { "epoch": 0.49065420560747663, "grad_norm": 4.25, "learning_rate": 2.5601322030799827e-05, "loss": 0.4705543041229248, "step": 105 }, { "epoch": 0.4953271028037383, "eval_loss": 0.45894455909729004, "eval_runtime": 64.3876, "eval_samples_per_second": 6.15, "eval_steps_per_second": 6.15, "step": 106 }, { "epoch": 0.514018691588785, "grad_norm": 3.8125, "learning_rate": 2.5537356920795893e-05, "loss": 0.45661373138427735, "step": 110 }, { "epoch": 0.5373831775700935, "grad_norm": 3.96875, "learning_rate": 2.5470231859653427e-05, "loss": 0.4881335735321045, "step": 115 }, { "epoch": 0.5607476635514018, "grad_norm": 3.5625, "learning_rate": 2.539996998779286e-05, "loss": 0.4613192558288574, "step": 120 }, { "epoch": 0.5841121495327103, "grad_norm": 3.96875, "learning_rate": 2.532659552700601e-05, "loss": 0.482680082321167, "step": 125 }, { "epoch": 0.6074766355140186, "grad_norm": 3.84375, "learning_rate": 2.525013377210592e-05, "loss": 0.4225574493408203, "step": 130 }, { "epoch": 0.6074766355140186, "eval_loss": 0.45120301842689514, "eval_runtime": 64.3659, "eval_samples_per_second": 6.152, "eval_steps_per_second": 6.152, "step": 130 }, { "epoch": 0.6308411214953271, "grad_norm": 4.09375, "learning_rate": 2.517061108220685e-05, "loss": 0.43398637771606446, "step": 135 }, { "epoch": 0.6542056074766355, "grad_norm": 3.65625, "learning_rate": 2.5088054871637335e-05, "loss": 0.4436498165130615, "step": 140 }, { "epoch": 0.677570093457944, "grad_norm": 3.5, "learning_rate": 2.500249360048947e-05, "loss": 0.44930062294006345, "step": 145 }, { "epoch": 0.7009345794392523, "grad_norm": 3.796875, "learning_rate": 2.4913956764807738e-05, "loss": 0.45390973091125486, "step": 150 }, { "epoch": 0.7242990654205608, "grad_norm": 4.15625, "learning_rate": 2.4822474886420593e-05, "loss": 0.4333805561065674, "step": 155 }, { "epoch": 0.7289719626168224, "eval_loss": 0.44806569814682007, "eval_runtime": 58.3512, "eval_samples_per_second": 6.786, "eval_steps_per_second": 6.786, "step": 156 }, { "epoch": 0.7429906542056075, "eval_loss": 0.44679105281829834, "eval_runtime": 53.2561, "eval_samples_per_second": 7.436, "eval_steps_per_second": 7.436, "step": 159 }, { "epoch": 0.7476635514018691, "grad_norm": 3.28125, "learning_rate": 2.4728079502418555e-05, "loss": 0.4298356056213379, "step": 160 }, { "epoch": 0.7710280373831776, "grad_norm": 3.5, "learning_rate": 2.46308031542822e-05, "loss": 0.45917558670043945, "step": 165 }, { "epoch": 0.794392523364486, "grad_norm": 3.40625, "learning_rate": 2.4530679376663966e-05, "loss": 0.4135223388671875, "step": 170 }, { "epoch": 0.8177570093457944, "grad_norm": 3.5625, "learning_rate": 2.4427742685827546e-05, "loss": 0.4308349609375, "step": 175 }, { "epoch": 0.8411214953271028, "grad_norm": 3.5625, "learning_rate": 2.432202856774887e-05, "loss": 0.4360647678375244, "step": 180 }, { "epoch": 0.8504672897196262, "eval_loss": 0.44622713327407837, "eval_runtime": 54.0702, "eval_samples_per_second": 7.324, "eval_steps_per_second": 7.324, "step": 182 }, { "epoch": 0.8644859813084113, "grad_norm": 3.40625, "learning_rate": 2.421357346588286e-05, "loss": 0.44407052993774415, "step": 185 }, { "epoch": 0.8878504672897196, "grad_norm": 3.515625, "learning_rate": 2.410241476860002e-05, "loss": 0.42552666664123534, "step": 190 }, { "epoch": 0.9112149532710281, "grad_norm": 3.90625, "learning_rate": 2.3988590796297346e-05, "loss": 0.47596588134765627, "step": 195 }, { "epoch": 0.9345794392523364, "grad_norm": 3.84375, "learning_rate": 2.3872140788187892e-05, "loss": 0.4219630241394043, "step": 200 }, { "epoch": 0.9579439252336449, "grad_norm": 3.453125, "learning_rate": 2.37531048887736e-05, "loss": 0.44322934150695803, "step": 205 }, { "epoch": 0.9719626168224299, "eval_loss": 0.442614883184433, "eval_runtime": 62.8656, "eval_samples_per_second": 6.299, "eval_steps_per_second": 6.299, "step": 208 }, { "epoch": 0.9813084112149533, "grad_norm": 3.375, "learning_rate": 2.3631524134006092e-05, "loss": 0.4280299186706543, "step": 210 }, { "epoch": 0.9906542056074766, "eval_loss": 0.43994140625, "eval_runtime": 57.058, "eval_samples_per_second": 6.94, "eval_steps_per_second": 6.94, "step": 212 }, { "epoch": 1.0046728971962617, "grad_norm": 2.78125, "learning_rate": 2.350744043714004e-05, "loss": 0.412522029876709, "step": 215 }, { "epoch": 1.02803738317757, "grad_norm": 3.265625, "learning_rate": 2.3380896574284195e-05, "loss": 0.3000824213027954, "step": 220 }, { "epoch": 1.0514018691588785, "grad_norm": 3.625, "learning_rate": 2.3251936169654928e-05, "loss": 0.29865827560424807, "step": 225 }, { "epoch": 1.074766355140187, "grad_norm": 3.234375, "learning_rate": 2.3120603680537385e-05, "loss": 0.32170352935791013, "step": 230 }, { "epoch": 1.0934579439252337, "eval_loss": 0.4519166946411133, "eval_runtime": 60.0729, "eval_samples_per_second": 6.592, "eval_steps_per_second": 6.592, "step": 234 }, { "epoch": 1.0981308411214954, "grad_norm": 3.5, "learning_rate": 2.2986944381959467e-05, "loss": 0.32140297889709474, "step": 235 }, { "epoch": 1.1214953271028036, "grad_norm": 3.546875, "learning_rate": 2.2851004351083894e-05, "loss": 0.3222970485687256, "step": 240 }, { "epoch": 1.144859813084112, "grad_norm": 3.234375, "learning_rate": 2.271283045132377e-05, "loss": 0.31093592643737794, "step": 245 }, { "epoch": 1.1682242990654206, "grad_norm": 3.65625, "learning_rate": 2.2572470316187064e-05, "loss": 0.3200420141220093, "step": 250 }, { "epoch": 1.191588785046729, "grad_norm": 3.34375, "learning_rate": 2.2429972332855617e-05, "loss": 0.3097134351730347, "step": 255 }, { "epoch": 1.2149532710280373, "grad_norm": 3.4375, "learning_rate": 2.2285385625504386e-05, "loss": 0.2976833820343018, "step": 260 }, { "epoch": 1.2149532710280373, "eval_loss": 0.45616593956947327, "eval_runtime": 56.6532, "eval_samples_per_second": 6.99, "eval_steps_per_second": 6.99, "step": 260 }, { "epoch": 1.2383177570093458, "grad_norm": 3.453125, "learning_rate": 2.213876003836653e-05, "loss": 0.302638578414917, "step": 265 }, { "epoch": 1.2383177570093458, "eval_loss": 0.4536404013633728, "eval_runtime": 63.9718, "eval_samples_per_second": 6.19, "eval_steps_per_second": 6.19, "step": 265 }, { "epoch": 1.2616822429906542, "grad_norm": 3.1875, "learning_rate": 2.1990146118550325e-05, "loss": 0.3010557651519775, "step": 270 }, { "epoch": 1.2850467289719627, "grad_norm": 3.515625, "learning_rate": 2.183959509861378e-05, "loss": 0.29446218013763426, "step": 275 }, { "epoch": 1.308411214953271, "grad_norm": 3.546875, "learning_rate": 2.16871588789029e-05, "loss": 0.3248613357543945, "step": 280 }, { "epoch": 1.3317757009345794, "grad_norm": 3.96875, "learning_rate": 2.1532890009659805e-05, "loss": 0.29060137271881104, "step": 285 }, { "epoch": 1.3364485981308412, "eval_loss": 0.4469919800758362, "eval_runtime": 40.3935, "eval_samples_per_second": 9.804, "eval_steps_per_second": 9.804, "step": 286 }, { "epoch": 1.355140186915888, "grad_norm": 3.453125, "learning_rate": 2.137684167290675e-05, "loss": 0.30477614402770997, "step": 290 }, { "epoch": 1.3785046728971961, "grad_norm": 3.46875, "learning_rate": 2.1219067664112372e-05, "loss": 0.31689789295196535, "step": 295 }, { "epoch": 1.4018691588785046, "grad_norm": 3.65625, "learning_rate": 2.1059622373646478e-05, "loss": 0.28146681785583494, "step": 300 }, { "epoch": 1.425233644859813, "grad_norm": 3.5, "learning_rate": 2.0898560768029707e-05, "loss": 0.3086798667907715, "step": 305 }, { "epoch": 1.4485981308411215, "grad_norm": 3.53125, "learning_rate": 2.0735938370984625e-05, "loss": 0.30053484439849854, "step": 310 }, { "epoch": 1.4579439252336448, "eval_loss": 0.4480014443397522, "eval_runtime": 47.0762, "eval_samples_per_second": 8.412, "eval_steps_per_second": 8.412, "step": 312 }, { "epoch": 1.47196261682243, "grad_norm": 3.59375, "learning_rate": 2.0571811244294655e-05, "loss": 0.30966882705688475, "step": 315 }, { "epoch": 1.485981308411215, "eval_loss": 0.4486345648765564, "eval_runtime": 50.9547, "eval_samples_per_second": 7.772, "eval_steps_per_second": 7.772, "step": 318 }, { "epoch": 1.4953271028037383, "grad_norm": 3.296875, "learning_rate": 2.040623596847762e-05, "loss": 0.30327141284942627, "step": 320 }, { "epoch": 1.5186915887850467, "grad_norm": 3.15625, "learning_rate": 2.0239269623280375e-05, "loss": 0.2928351879119873, "step": 325 }, { "epoch": 1.542056074766355, "grad_norm": 3.640625, "learning_rate": 2.0070969768001355e-05, "loss": 0.30496037006378174, "step": 330 }, { "epoch": 1.5654205607476634, "grad_norm": 3.375, "learning_rate": 1.9901394421647857e-05, "loss": 0.30050930976867674, "step": 335 }, { "epoch": 1.5794392523364484, "eval_loss": 0.4455008804798126, "eval_runtime": 65.8944, "eval_samples_per_second": 6.01, "eval_steps_per_second": 6.01, "step": 338 }, { "epoch": 1.588785046728972, "grad_norm": 3.640625, "learning_rate": 1.9730602042934775e-05, "loss": 0.30058119297027586, "step": 340 }, { "epoch": 1.6121495327102804, "grad_norm": 3.390625, "learning_rate": 1.955865151013178e-05, "loss": 0.3002913951873779, "step": 345 }, { "epoch": 1.6355140186915889, "grad_norm": 3.65625, "learning_rate": 1.9385602100765877e-05, "loss": 0.2978963375091553, "step": 350 }, { "epoch": 1.6588785046728973, "grad_norm": 3.421875, "learning_rate": 1.921151347118631e-05, "loss": 0.30049972534179686, "step": 355 }, { "epoch": 1.6822429906542056, "grad_norm": 3.515625, "learning_rate": 1.9036445635998852e-05, "loss": 0.3050508499145508, "step": 360 }, { "epoch": 1.7009345794392523, "eval_loss": 0.4410502016544342, "eval_runtime": 64.5037, "eval_samples_per_second": 6.139, "eval_steps_per_second": 6.139, "step": 364 }, { "epoch": 1.705607476635514, "grad_norm": 3.640625, "learning_rate": 1.8860458947376653e-05, "loss": 0.29273965358734133, "step": 365 }, { "epoch": 1.7289719626168223, "grad_norm": 3.296875, "learning_rate": 1.868361407425465e-05, "loss": 0.2988182544708252, "step": 370 }, { "epoch": 1.7336448598130842, "eval_loss": 0.441893070936203, "eval_runtime": 57.6479, "eval_samples_per_second": 6.869, "eval_steps_per_second": 6.869, "step": 371 }, { "epoch": 1.7523364485981308, "grad_norm": 3.546875, "learning_rate": 1.8505971981414815e-05, "loss": 0.2948916912078857, "step": 375 }, { "epoch": 1.7757009345794392, "grad_norm": 4.03125, "learning_rate": 1.8327593908469397e-05, "loss": 0.3248611927032471, "step": 380 }, { "epoch": 1.7990654205607477, "grad_norm": 3.375, "learning_rate": 1.814854134874943e-05, "loss": 0.3255984544754028, "step": 385 }, { "epoch": 1.8224299065420562, "grad_norm": 3.859375, "learning_rate": 1.796887602810579e-05, "loss": 0.29858739376068116, "step": 390 }, { "epoch": 1.8224299065420562, "eval_loss": 0.43862152099609375, "eval_runtime": 61.1595, "eval_samples_per_second": 6.475, "eval_steps_per_second": 6.475, "step": 390 }, { "epoch": 1.8457943925233646, "grad_norm": 3.609375, "learning_rate": 1.7788659883630035e-05, "loss": 0.31806967258453367, "step": 395 }, { "epoch": 1.8691588785046729, "grad_norm": 3.703125, "learning_rate": 1.760795504230251e-05, "loss": 0.3062360525131226, "step": 400 }, { "epoch": 1.8925233644859814, "grad_norm": 3.90625, "learning_rate": 1.742682379957492e-05, "loss": 0.30818881988525393, "step": 405 }, { "epoch": 1.9158878504672896, "grad_norm": 3.71875, "learning_rate": 1.7245328597894847e-05, "loss": 0.2948075532913208, "step": 410 }, { "epoch": 1.939252336448598, "grad_norm": 3.265625, "learning_rate": 1.7063532005179608e-05, "loss": 0.2957978487014771, "step": 415 }, { "epoch": 1.9439252336448598, "eval_loss": 0.43459007143974304, "eval_runtime": 66.1061, "eval_samples_per_second": 5.99, "eval_steps_per_second": 5.99, "step": 416 }, { "epoch": 1.9626168224299065, "grad_norm": 3.84375, "learning_rate": 1.688149669324683e-05, "loss": 0.3337227821350098, "step": 420 }, { "epoch": 1.9813084112149533, "eval_loss": 0.4314902722835541, "eval_runtime": 66.515, "eval_samples_per_second": 5.954, "eval_steps_per_second": 5.954, "step": 424 } ], "logging_steps": 5, "max_steps": 856, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 26, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.9865684657086464e+16, "train_batch_size": 35, "trial_name": null, "trial_params": null }