{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9978994991113266, "eval_steps": 500, "global_step": 386, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0025852318629827112, "grad_norm": 0.19946137070655823, "learning_rate": 5.128205128205128e-06, "loss": 0.4855, "mean_token_accuracy": 0.8692543655633926, "step": 1 }, { "epoch": 0.012926159314913557, "grad_norm": 0.18048785626888275, "learning_rate": 2.564102564102564e-05, "loss": 0.5257, "mean_token_accuracy": 0.8587683830410242, "step": 5 }, { "epoch": 0.025852318629827113, "grad_norm": 0.18388661742210388, "learning_rate": 5.128205128205128e-05, "loss": 0.5986, "mean_token_accuracy": 0.838620126247406, "step": 10 }, { "epoch": 0.038778477944740666, "grad_norm": 0.13041158020496368, "learning_rate": 7.692307692307693e-05, "loss": 0.5464, "mean_token_accuracy": 0.8496200017631054, "step": 15 }, { "epoch": 0.051704637259654226, "grad_norm": 0.10899022966623306, "learning_rate": 0.00010256410256410256, "loss": 0.4321, "mean_token_accuracy": 0.8813652157783508, "step": 20 }, { "epoch": 0.06463079657456779, "grad_norm": 0.12952959537506104, "learning_rate": 0.00012820512820512823, "loss": 0.4429, "mean_token_accuracy": 0.8760499283671379, "step": 25 }, { "epoch": 0.07755695588948133, "grad_norm": 0.11217343807220459, "learning_rate": 0.00015384615384615385, "loss": 0.4426, "mean_token_accuracy": 0.8728497698903084, "step": 30 }, { "epoch": 0.09048311520439489, "grad_norm": 0.11570142209529877, "learning_rate": 0.0001794871794871795, "loss": 0.4326, "mean_token_accuracy": 0.8739698991179466, "step": 35 }, { "epoch": 0.10340927451930845, "grad_norm": 0.11375421285629272, "learning_rate": 0.00019999590166142655, "loss": 0.4398, "mean_token_accuracy": 0.8683982357382775, "step": 40 }, { "epoch": 0.11633543383422201, "grad_norm": 0.09867997467517853, "learning_rate": 0.00019985249508066755, "loss": 0.3217, "mean_token_accuracy": 0.9007599778473377, "step": 45 }, { "epoch": 0.12926159314913557, "grad_norm": 0.10740496963262558, "learning_rate": 0.00019950450737506824, "loss": 0.3468, "mean_token_accuracy": 0.8914886720478534, "step": 50 }, { "epoch": 0.14218775246404913, "grad_norm": 0.10870860517024994, "learning_rate": 0.00019895265151345518, "loss": 0.297, "mean_token_accuracy": 0.9054083719849586, "step": 55 }, { "epoch": 0.15511391177896267, "grad_norm": 0.1147221028804779, "learning_rate": 0.00019819805815653768, "loss": 0.2912, "mean_token_accuracy": 0.9063926823437214, "step": 60 }, { "epoch": 0.16804007109387623, "grad_norm": 0.1086113452911377, "learning_rate": 0.00019724227334037256, "loss": 0.2709, "mean_token_accuracy": 0.9122237786650658, "step": 65 }, { "epoch": 0.18096623040878979, "grad_norm": 0.11263403296470642, "learning_rate": 0.00019608725530879375, "loss": 0.2775, "mean_token_accuracy": 0.9088832184672355, "step": 70 }, { "epoch": 0.19389238972370335, "grad_norm": 0.11787361651659012, "learning_rate": 0.00019473537050129704, "loss": 0.2758, "mean_token_accuracy": 0.909870583564043, "step": 75 }, { "epoch": 0.2068185490386169, "grad_norm": 0.0966123640537262, "learning_rate": 0.00019318938870459984, "loss": 0.2113, "mean_token_accuracy": 0.9297552116215229, "step": 80 }, { "epoch": 0.21974470835353047, "grad_norm": 0.09169968962669373, "learning_rate": 0.00019145247737780961, "loss": 0.2097, "mean_token_accuracy": 0.9294927291572094, "step": 85 }, { "epoch": 0.23267086766844403, "grad_norm": 0.10205108672380447, "learning_rate": 0.0001895281951628281, "loss": 0.2354, "mean_token_accuracy": 0.9218288294970989, "step": 90 }, { "epoch": 0.24559702698335756, "grad_norm": 0.11714070290327072, "learning_rate": 0.00018742048459328682, "loss": 0.2286, "mean_token_accuracy": 0.9224011048674583, "step": 95 }, { "epoch": 0.25852318629827115, "grad_norm": 0.08743036538362503, "learning_rate": 0.00018513366401695276, "loss": 0.2524, "mean_token_accuracy": 0.9145891763269901, "step": 100 }, { "epoch": 0.2714493456131847, "grad_norm": 0.12086658179759979, "learning_rate": 0.00018267241874815314, "loss": 0.2355, "mean_token_accuracy": 0.9212763957679272, "step": 105 }, { "epoch": 0.28437550492809827, "grad_norm": 0.10271570086479187, "learning_rate": 0.0001800417914683471, "loss": 0.2033, "mean_token_accuracy": 0.9312141306698323, "step": 110 }, { "epoch": 0.2973016642430118, "grad_norm": 0.11228019744157791, "learning_rate": 0.0001772471718945119, "loss": 0.1578, "mean_token_accuracy": 0.946045958250761, "step": 115 }, { "epoch": 0.31022782355792533, "grad_norm": 0.1075127124786377, "learning_rate": 0.00017429428573651024, "loss": 0.2109, "mean_token_accuracy": 0.928734278678894, "step": 120 }, { "epoch": 0.3231539828728389, "grad_norm": 0.16245290637016296, "learning_rate": 0.00017118918296606537, "loss": 0.2544, "mean_token_accuracy": 0.9145586542785168, "step": 125 }, { "epoch": 0.33608014218775245, "grad_norm": 0.0984274297952652, "learning_rate": 0.0001679382254213768, "loss": 0.2398, "mean_token_accuracy": 0.9193581290543079, "step": 130 }, { "epoch": 0.34900630150266604, "grad_norm": 0.14143706858158112, "learning_rate": 0.00016454807377277398, "loss": 0.2187, "mean_token_accuracy": 0.9259690448641777, "step": 135 }, { "epoch": 0.36193246081757957, "grad_norm": 0.10752697288990021, "learning_rate": 0.0001610256738761125, "loss": 0.2205, "mean_token_accuracy": 0.9248595975339413, "step": 140 }, { "epoch": 0.37485862013249316, "grad_norm": 0.15562467277050018, "learning_rate": 0.00015737824254187275, "loss": 0.2399, "mean_token_accuracy": 0.9187141321599483, "step": 145 }, { "epoch": 0.3877847794474067, "grad_norm": 0.10149288177490234, "learning_rate": 0.00015361325274911779, "loss": 0.1906, "mean_token_accuracy": 0.9351025439798832, "step": 150 }, { "epoch": 0.4007109387623202, "grad_norm": 0.13106182217597961, "learning_rate": 0.00014973841833460457, "loss": 0.2366, "mean_token_accuracy": 0.9191612683236599, "step": 155 }, { "epoch": 0.4136370980772338, "grad_norm": 0.12485964596271515, "learning_rate": 0.0001457616781884173, "loss": 0.2532, "mean_token_accuracy": 0.9145220316946506, "step": 160 }, { "epoch": 0.42656325739214734, "grad_norm": 0.12415427714586258, "learning_rate": 0.0001416911799885049, "loss": 0.1772, "mean_token_accuracy": 0.9388307243585586, "step": 165 }, { "epoch": 0.43948941670706093, "grad_norm": 0.12156961858272552, "learning_rate": 0.0001375352635074461, "loss": 0.1974, "mean_token_accuracy": 0.9322396464645862, "step": 170 }, { "epoch": 0.45241557602197446, "grad_norm": 0.08770665526390076, "learning_rate": 0.00013330244352564527, "loss": 0.2159, "mean_token_accuracy": 0.9263734519481659, "step": 175 }, { "epoch": 0.46534173533688805, "grad_norm": 0.11970090866088867, "learning_rate": 0.00012900139238596598, "loss": 0.1788, "mean_token_accuracy": 0.9383759558200836, "step": 180 }, { "epoch": 0.4782678946518016, "grad_norm": 0.0777999758720398, "learning_rate": 0.00012464092222554552, "loss": 0.1921, "mean_token_accuracy": 0.9340388782322406, "step": 185 }, { "epoch": 0.4911940539667151, "grad_norm": 0.1088053435087204, "learning_rate": 0.00012022996692119424, "loss": 0.2428, "mean_token_accuracy": 0.9170919217169284, "step": 190 }, { "epoch": 0.5041202132816287, "grad_norm": 0.12958504259586334, "learning_rate": 0.00011577756378537033, "loss": 0.1805, "mean_token_accuracy": 0.9373964861035347, "step": 195 }, { "epoch": 0.5170463725965423, "grad_norm": 0.08942475914955139, "learning_rate": 0.00011129283505023274, "loss": 0.1757, "mean_token_accuracy": 0.9391221977770329, "step": 200 }, { "epoch": 0.5299725319114558, "grad_norm": 0.12055882811546326, "learning_rate": 0.00010678496917770719, "loss": 0.2274, "mean_token_accuracy": 0.9221370957791806, "step": 205 }, { "epoch": 0.5428986912263694, "grad_norm": 0.09946688264608383, "learning_rate": 0.00010226320203385878, "loss": 0.2235, "mean_token_accuracy": 0.9239851593971252, "step": 210 }, { "epoch": 0.5558248505412829, "grad_norm": 0.08823594450950623, "learning_rate": 9.773679796614124e-05, "loss": 0.1757, "mean_token_accuracy": 0.9392839625477791, "step": 215 }, { "epoch": 0.5687510098561965, "grad_norm": 0.09366550296545029, "learning_rate": 9.321503082229282e-05, "loss": 0.215, "mean_token_accuracy": 0.9264558620750905, "step": 220 }, { "epoch": 0.58167716917111, "grad_norm": 0.1250247210264206, "learning_rate": 8.87071649497673e-05, "loss": 0.203, "mean_token_accuracy": 0.9299200311303139, "step": 225 }, { "epoch": 0.5946033284860236, "grad_norm": 0.07920438051223755, "learning_rate": 8.422243621462969e-05, "loss": 0.1777, "mean_token_accuracy": 0.93870100826025, "step": 230 }, { "epoch": 0.6075294878009372, "grad_norm": 0.09220347553491592, "learning_rate": 7.97700330788058e-05, "loss": 0.2382, "mean_token_accuracy": 0.9188789471983909, "step": 235 }, { "epoch": 0.6204556471158507, "grad_norm": 0.09347136318683624, "learning_rate": 7.535907777445449e-05, "loss": 0.1768, "mean_token_accuracy": 0.9390825219452381, "step": 240 }, { "epoch": 0.6333818064307642, "grad_norm": 0.06848734617233276, "learning_rate": 7.099860761403403e-05, "loss": 0.1909, "mean_token_accuracy": 0.9346477761864662, "step": 245 }, { "epoch": 0.6463079657456778, "grad_norm": 0.08231879770755768, "learning_rate": 6.669755647435474e-05, "loss": 0.2094, "mean_token_accuracy": 0.9281139463186264, "step": 250 }, { "epoch": 0.6592341250605914, "grad_norm": 0.14479972422122955, "learning_rate": 6.24647364925539e-05, "loss": 0.1897, "mean_token_accuracy": 0.9346370972692967, "step": 255 }, { "epoch": 0.6721602843755049, "grad_norm": 0.10493209958076477, "learning_rate": 5.830882001149517e-05, "loss": 0.1977, "mean_token_accuracy": 0.9318774163722991, "step": 260 }, { "epoch": 0.6850864436904185, "grad_norm": 0.08989942073822021, "learning_rate": 5.423832181158274e-05, "loss": 0.1786, "mean_token_accuracy": 0.9378982990980148, "step": 265 }, { "epoch": 0.6980126030053321, "grad_norm": 0.0723404809832573, "learning_rate": 5.0261581665395475e-05, "loss": 0.1854, "mean_token_accuracy": 0.9353665545582771, "step": 270 }, { "epoch": 0.7109387623202456, "grad_norm": 0.08017778396606445, "learning_rate": 4.6386747250882224e-05, "loss": 0.2185, "mean_token_accuracy": 0.9242644280195236, "step": 275 }, { "epoch": 0.7238649216351591, "grad_norm": 0.09016852080821991, "learning_rate": 4.2621757458127285e-05, "loss": 0.1912, "mean_token_accuracy": 0.9338557474315167, "step": 280 }, { "epoch": 0.7367910809500727, "grad_norm": 0.0839182510972023, "learning_rate": 3.8974326123887515e-05, "loss": 0.1764, "mean_token_accuracy": 0.9384186826646328, "step": 285 }, { "epoch": 0.7497172402649863, "grad_norm": 0.08571181446313858, "learning_rate": 3.5451926227225997e-05, "loss": 0.1984, "mean_token_accuracy": 0.931569704413414, "step": 290 }, { "epoch": 0.7626433995798998, "grad_norm": 0.09723369032144547, "learning_rate": 3.20617745786232e-05, "loss": 0.2095, "mean_token_accuracy": 0.9279029227793216, "step": 295 }, { "epoch": 0.7755695588948134, "grad_norm": 0.08322826772928238, "learning_rate": 2.8810817033934656e-05, "loss": 0.214, "mean_token_accuracy": 0.926049928367138, "step": 300 }, { "epoch": 0.788495718209727, "grad_norm": 0.0943559929728508, "learning_rate": 2.5705714263489776e-05, "loss": 0.2025, "mean_token_accuracy": 0.9304434671998024, "step": 305 }, { "epoch": 0.8014218775246404, "grad_norm": 0.12426702678203583, "learning_rate": 2.275282810548811e-05, "loss": 0.2255, "mean_token_accuracy": 0.92267579510808, "step": 310 }, { "epoch": 0.814348036839554, "grad_norm": 0.07339806854724884, "learning_rate": 1.9958208531652877e-05, "loss": 0.2119, "mean_token_accuracy": 0.9270739153027534, "step": 315 }, { "epoch": 0.8272741961544676, "grad_norm": 0.07293356955051422, "learning_rate": 1.73275812518469e-05, "loss": 0.1728, "mean_token_accuracy": 0.9397997766733169, "step": 320 }, { "epoch": 0.8402003554693812, "grad_norm": 0.06353917717933655, "learning_rate": 1.4866335983047264e-05, "loss": 0.2043, "mean_token_accuracy": 0.9285617105662822, "step": 325 }, { "epoch": 0.8531265147842947, "grad_norm": 0.0852632075548172, "learning_rate": 1.2579515406713193e-05, "loss": 0.1894, "mean_token_accuracy": 0.9348805241286755, "step": 330 }, { "epoch": 0.8660526740992083, "grad_norm": 0.10367190837860107, "learning_rate": 1.0471804837171916e-05, "loss": 0.2155, "mean_token_accuracy": 0.9256119452416897, "step": 335 }, { "epoch": 0.8789788334141219, "grad_norm": 0.07647697627544403, "learning_rate": 8.547522622190385e-06, "loss": 0.191, "mean_token_accuracy": 0.9336939886212349, "step": 340 }, { "epoch": 0.8919049927290353, "grad_norm": 0.09329604357481003, "learning_rate": 6.810611295400171e-06, "loss": 0.162, "mean_token_accuracy": 0.9432654656469822, "step": 345 }, { "epoch": 0.9048311520439489, "grad_norm": 0.10007894039154053, "learning_rate": 5.264629498702967e-06, "loss": 0.2196, "mean_token_accuracy": 0.9224743604660034, "step": 350 }, { "epoch": 0.9177573113588625, "grad_norm": 0.09568954259157181, "learning_rate": 3.91274469120626e-06, "loss": 0.2326, "mean_token_accuracy": 0.9203760787844658, "step": 355 }, { "epoch": 0.9306834706737761, "grad_norm": 0.09242628514766693, "learning_rate": 2.7577266596274576e-06, "loss": 0.217, "mean_token_accuracy": 0.9255997397005558, "step": 360 }, { "epoch": 0.9436096299886896, "grad_norm": 0.08556357026100159, "learning_rate": 1.8019418434623404e-06, "loss": 0.1704, "mean_token_accuracy": 0.9403167776763439, "step": 365 }, { "epoch": 0.9565357893036032, "grad_norm": 0.08201264590024948, "learning_rate": 1.0473484865448525e-06, "loss": 0.1877, "mean_token_accuracy": 0.9344814352691173, "step": 370 }, { "epoch": 0.9694619486185168, "grad_norm": 0.08764708787202835, "learning_rate": 4.954926249317815e-07, "loss": 0.1614, "mean_token_accuracy": 0.943453174829483, "step": 375 }, { "epoch": 0.9823881079334302, "grad_norm": 0.09879707545042038, "learning_rate": 1.4750491933247512e-07, "loss": 0.1984, "mean_token_accuracy": 0.9314216762781143, "step": 380 }, { "epoch": 0.9953142672483438, "grad_norm": 0.0833079144358635, "learning_rate": 4.0983385734660875e-09, "loss": 0.1962, "mean_token_accuracy": 0.9319176472723484, "step": 385 }, { "epoch": 0.9978994991113266, "mean_token_accuracy": 0.9182563126087189, "step": 386, "total_flos": 1.112161775475753e+17, "train_loss": 0.24216800009339584, "train_runtime": 6297.1418, "train_samples_per_second": 0.983, "train_steps_per_second": 0.061 } ], "logging_steps": 5, "max_steps": 386, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.112161775475753e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }