{ "best_global_step": 3000, "best_metric": 3.9151711463928223, "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-3000", "epoch": 3.0, "eval_steps": 500, "global_step": 3279, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04577706569008926, "grad_norm": 0.950545608997345, "learning_rate": 2.474747474747475e-05, "loss": 26.02827392578125, "step": 50 }, { "epoch": 0.09155413138017852, "grad_norm": 0.9253817200660706, "learning_rate": 5e-05, "loss": 25.6423583984375, "step": 100 }, { "epoch": 0.1373311970702678, "grad_norm": 1.8487942218780518, "learning_rate": 4.9213836477987426e-05, "loss": 25.38603759765625, "step": 150 }, { "epoch": 0.18310826276035705, "grad_norm": 0.9318061470985413, "learning_rate": 4.842767295597484e-05, "loss": 25.09637451171875, "step": 200 }, { "epoch": 0.22888532845044632, "grad_norm": 1.2386919260025024, "learning_rate": 4.7641509433962266e-05, "loss": 24.62987548828125, "step": 250 }, { "epoch": 0.2746623941405356, "grad_norm": 0.9762535691261292, "learning_rate": 4.685534591194969e-05, "loss": 24.32124755859375, "step": 300 }, { "epoch": 0.3204394598306249, "grad_norm": 1.3880475759506226, "learning_rate": 4.606918238993711e-05, "loss": 24.26835205078125, "step": 350 }, { "epoch": 0.3662165255207141, "grad_norm": 0.7988409399986267, "learning_rate": 4.528301886792453e-05, "loss": 23.8698388671875, "step": 400 }, { "epoch": 0.41199359121080337, "grad_norm": 0.7432121634483337, "learning_rate": 4.449685534591195e-05, "loss": 23.6873876953125, "step": 450 }, { "epoch": 0.45777065690089264, "grad_norm": 2.9906067848205566, "learning_rate": 4.3710691823899376e-05, "loss": 23.65133056640625, "step": 500 }, { "epoch": 0.45777065690089264, "eval_loss": 4.262399196624756, "eval_runtime": 11.9465, "eval_samples_per_second": 59.097, "eval_steps_per_second": 7.45, "step": 500 }, { "epoch": 0.5035477225909819, "grad_norm": 0.7991481423377991, "learning_rate": 4.292452830188679e-05, "loss": 23.3265283203125, "step": 550 }, { "epoch": 0.5493247882810712, "grad_norm": 0.8507863283157349, "learning_rate": 4.213836477987422e-05, "loss": 23.256435546875, "step": 600 }, { "epoch": 0.5951018539711604, "grad_norm": 0.8129443526268005, "learning_rate": 4.135220125786164e-05, "loss": 23.2051806640625, "step": 650 }, { "epoch": 0.6408789196612498, "grad_norm": 0.7767907977104187, "learning_rate": 4.0566037735849064e-05, "loss": 22.90304443359375, "step": 700 }, { "epoch": 0.686655985351339, "grad_norm": 0.8058496117591858, "learning_rate": 3.977987421383648e-05, "loss": 22.94605224609375, "step": 750 }, { "epoch": 0.7324330510414282, "grad_norm": 0.7904766798019409, "learning_rate": 3.8993710691823904e-05, "loss": 22.76631591796875, "step": 800 }, { "epoch": 0.7782101167315175, "grad_norm": 0.7378940582275391, "learning_rate": 3.820754716981133e-05, "loss": 22.6701904296875, "step": 850 }, { "epoch": 0.8239871824216067, "grad_norm": 0.9154200553894043, "learning_rate": 3.7421383647798744e-05, "loss": 22.53183349609375, "step": 900 }, { "epoch": 0.8697642481116961, "grad_norm": 0.8045285940170288, "learning_rate": 3.663522012578616e-05, "loss": 22.55562744140625, "step": 950 }, { "epoch": 0.9155413138017853, "grad_norm": 1.2049347162246704, "learning_rate": 3.5849056603773584e-05, "loss": 22.30632568359375, "step": 1000 }, { "epoch": 0.9155413138017853, "eval_loss": 4.1011881828308105, "eval_runtime": 11.9002, "eval_samples_per_second": 59.327, "eval_steps_per_second": 7.479, "step": 1000 }, { "epoch": 0.9613183794918746, "grad_norm": 0.8331048488616943, "learning_rate": 3.506289308176101e-05, "loss": 22.24485107421875, "step": 1050 }, { "epoch": 1.0064087891966125, "grad_norm": 0.7863403558731079, "learning_rate": 3.4276729559748424e-05, "loss": 21.805654296875, "step": 1100 }, { "epoch": 1.0521858548867018, "grad_norm": 0.8146964907646179, "learning_rate": 3.349056603773585e-05, "loss": 22.14404052734375, "step": 1150 }, { "epoch": 1.0979629205767911, "grad_norm": 0.7487536072731018, "learning_rate": 3.270440251572327e-05, "loss": 22.0405126953125, "step": 1200 }, { "epoch": 1.1437399862668802, "grad_norm": 0.7023004293441772, "learning_rate": 3.1918238993710694e-05, "loss": 21.87947021484375, "step": 1250 }, { "epoch": 1.1895170519569696, "grad_norm": 0.8285568356513977, "learning_rate": 3.113207547169811e-05, "loss": 21.8118017578125, "step": 1300 }, { "epoch": 1.2352941176470589, "grad_norm": 0.8095338940620422, "learning_rate": 3.0345911949685535e-05, "loss": 21.712080078125, "step": 1350 }, { "epoch": 1.281071183337148, "grad_norm": 0.7827941179275513, "learning_rate": 2.9559748427672958e-05, "loss": 21.71359375, "step": 1400 }, { "epoch": 1.3268482490272373, "grad_norm": 0.7628238201141357, "learning_rate": 2.8773584905660378e-05, "loss": 21.643154296875, "step": 1450 }, { "epoch": 1.3726253147173266, "grad_norm": 0.802753746509552, "learning_rate": 2.7987421383647798e-05, "loss": 21.62091796875, "step": 1500 }, { "epoch": 1.3726253147173266, "eval_loss": 4.01209020614624, "eval_runtime": 11.9226, "eval_samples_per_second": 59.215, "eval_steps_per_second": 7.465, "step": 1500 }, { "epoch": 1.418402380407416, "grad_norm": 0.7911498546600342, "learning_rate": 2.720125786163522e-05, "loss": 21.520439453125, "step": 1550 }, { "epoch": 1.4641794460975053, "grad_norm": 0.7967684864997864, "learning_rate": 2.641509433962264e-05, "loss": 21.51121337890625, "step": 1600 }, { "epoch": 1.5099565117875944, "grad_norm": 0.8296108841896057, "learning_rate": 2.5628930817610065e-05, "loss": 21.4302001953125, "step": 1650 }, { "epoch": 1.5557335774776837, "grad_norm": 0.799700140953064, "learning_rate": 2.4842767295597485e-05, "loss": 21.27000244140625, "step": 1700 }, { "epoch": 1.601510643167773, "grad_norm": 0.7474468946456909, "learning_rate": 2.405660377358491e-05, "loss": 21.2945166015625, "step": 1750 }, { "epoch": 1.6472877088578621, "grad_norm": 0.8560371994972229, "learning_rate": 2.327044025157233e-05, "loss": 21.26280517578125, "step": 1800 }, { "epoch": 1.6930647745479515, "grad_norm": 0.7146944999694824, "learning_rate": 2.248427672955975e-05, "loss": 21.30601806640625, "step": 1850 }, { "epoch": 1.7388418402380408, "grad_norm": 0.6856210827827454, "learning_rate": 2.1698113207547172e-05, "loss": 21.30221435546875, "step": 1900 }, { "epoch": 1.7846189059281299, "grad_norm": 0.6851561069488525, "learning_rate": 2.0911949685534592e-05, "loss": 21.15216552734375, "step": 1950 }, { "epoch": 1.8303959716182194, "grad_norm": 0.8206948637962341, "learning_rate": 2.0125786163522016e-05, "loss": 21.1641748046875, "step": 2000 }, { "epoch": 1.8303959716182194, "eval_loss": 3.951535940170288, "eval_runtime": 11.8555, "eval_samples_per_second": 59.55, "eval_steps_per_second": 7.507, "step": 2000 }, { "epoch": 1.8761730373083085, "grad_norm": 0.7400506734848022, "learning_rate": 1.9339622641509436e-05, "loss": 21.05539306640625, "step": 2050 }, { "epoch": 1.9219501029983979, "grad_norm": 0.6370204091072083, "learning_rate": 1.8553459119496856e-05, "loss": 21.11379638671875, "step": 2100 }, { "epoch": 1.9677271686884872, "grad_norm": 0.8683918118476868, "learning_rate": 1.7767295597484276e-05, "loss": 21.1146435546875, "step": 2150 }, { "epoch": 2.012817578393225, "grad_norm": 0.7333459258079529, "learning_rate": 1.69811320754717e-05, "loss": 20.737890625, "step": 2200 }, { "epoch": 2.058594644083314, "grad_norm": 0.680478572845459, "learning_rate": 1.619496855345912e-05, "loss": 21.101630859375, "step": 2250 }, { "epoch": 2.1043717097734036, "grad_norm": 0.8762068152427673, "learning_rate": 1.540880503144654e-05, "loss": 21.0653857421875, "step": 2300 }, { "epoch": 2.1501487754634927, "grad_norm": 0.8605155348777771, "learning_rate": 1.4622641509433963e-05, "loss": 21.01951171875, "step": 2350 }, { "epoch": 2.1959258411535822, "grad_norm": 0.8293413519859314, "learning_rate": 1.3836477987421385e-05, "loss": 20.94828369140625, "step": 2400 }, { "epoch": 2.2417029068436714, "grad_norm": 0.6899017095565796, "learning_rate": 1.3050314465408805e-05, "loss": 20.9380712890625, "step": 2450 }, { "epoch": 2.2874799725337605, "grad_norm": 0.7276245951652527, "learning_rate": 1.2264150943396227e-05, "loss": 21.033203125, "step": 2500 }, { "epoch": 2.2874799725337605, "eval_loss": 3.9277429580688477, "eval_runtime": 11.8976, "eval_samples_per_second": 59.34, "eval_steps_per_second": 7.48, "step": 2500 }, { "epoch": 2.33325703822385, "grad_norm": 0.6670855283737183, "learning_rate": 1.1477987421383648e-05, "loss": 20.87577880859375, "step": 2550 }, { "epoch": 2.379034103913939, "grad_norm": 0.7529842853546143, "learning_rate": 1.069182389937107e-05, "loss": 21.0073095703125, "step": 2600 }, { "epoch": 2.424811169604028, "grad_norm": 0.6587186455726624, "learning_rate": 9.905660377358492e-06, "loss": 20.84186279296875, "step": 2650 }, { "epoch": 2.4705882352941178, "grad_norm": 0.7700671553611755, "learning_rate": 9.119496855345912e-06, "loss": 20.9491015625, "step": 2700 }, { "epoch": 2.516365300984207, "grad_norm": 0.7723618745803833, "learning_rate": 8.333333333333334e-06, "loss": 20.86789306640625, "step": 2750 }, { "epoch": 2.562142366674296, "grad_norm": 0.7601158022880554, "learning_rate": 7.547169811320755e-06, "loss": 20.905009765625, "step": 2800 }, { "epoch": 2.6079194323643855, "grad_norm": 0.8978911638259888, "learning_rate": 6.761006289308176e-06, "loss": 20.7809033203125, "step": 2850 }, { "epoch": 2.6536964980544746, "grad_norm": 0.7408691048622131, "learning_rate": 5.974842767295598e-06, "loss": 20.84373779296875, "step": 2900 }, { "epoch": 2.699473563744564, "grad_norm": 0.7798228859901428, "learning_rate": 5.188679245283019e-06, "loss": 20.96936279296875, "step": 2950 }, { "epoch": 2.7452506294346533, "grad_norm": 0.7453646659851074, "learning_rate": 4.40251572327044e-06, "loss": 20.81538818359375, "step": 3000 }, { "epoch": 2.7452506294346533, "eval_loss": 3.9151711463928223, "eval_runtime": 11.9267, "eval_samples_per_second": 59.195, "eval_steps_per_second": 7.462, "step": 3000 }, { "epoch": 2.7910276951247424, "grad_norm": 0.7813104391098022, "learning_rate": 3.6163522012578618e-06, "loss": 20.85503662109375, "step": 3050 }, { "epoch": 2.836804760814832, "grad_norm": 0.7470929026603699, "learning_rate": 2.830188679245283e-06, "loss": 20.86689697265625, "step": 3100 }, { "epoch": 2.882581826504921, "grad_norm": 0.7827481031417847, "learning_rate": 2.0440251572327044e-06, "loss": 20.801142578125, "step": 3150 }, { "epoch": 2.9283588921950106, "grad_norm": 0.8394864201545715, "learning_rate": 1.257861635220126e-06, "loss": 20.861923828125, "step": 3200 }, { "epoch": 2.9741359578850997, "grad_norm": 0.7399877905845642, "learning_rate": 4.7169811320754717e-07, "loss": 20.7888671875, "step": 3250 }, { "epoch": 3.0, "step": 3279, "total_flos": 2.782532121447629e+16, "train_loss": 21.985386016929464, "train_runtime": 7952.9013, "train_samples_per_second": 26.364, "train_steps_per_second": 0.412 } ], "logging_steps": 50, "max_steps": 3279, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.782532121447629e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }