{ "best_global_step": 2500, "best_metric": 3.4325599670410156, "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-2500", "epoch": 3.0, "eval_steps": 500, "global_step": 2688, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05585032113934655, "grad_norm": 0.708092451095581, "learning_rate": 3.0246913580246916e-05, "loss": 20.53129150390625, "step": 50 }, { "epoch": 0.1117006422786931, "grad_norm": 0.6190989017486572, "learning_rate": 4.9654775604142695e-05, "loss": 20.3445361328125, "step": 100 }, { "epoch": 0.16755096341803966, "grad_norm": 0.5028762221336365, "learning_rate": 4.8695818948983505e-05, "loss": 20.208651123046874, "step": 150 }, { "epoch": 0.2234012845573862, "grad_norm": 0.5830720663070679, "learning_rate": 4.773686229382432e-05, "loss": 20.0191845703125, "step": 200 }, { "epoch": 0.27925160569673274, "grad_norm": 1.2075963020324707, "learning_rate": 4.677790563866514e-05, "loss": 19.857196044921874, "step": 250 }, { "epoch": 0.3351019268360793, "grad_norm": 0.7960541844367981, "learning_rate": 4.581894898350595e-05, "loss": 19.7943798828125, "step": 300 }, { "epoch": 0.3909522479754259, "grad_norm": 0.5681961178779602, "learning_rate": 4.4859992328346764e-05, "loss": 19.644644775390624, "step": 350 }, { "epoch": 0.4468025691147724, "grad_norm": 0.5845203995704651, "learning_rate": 4.3901035673187574e-05, "loss": 19.550875244140624, "step": 400 }, { "epoch": 0.502652890254119, "grad_norm": 0.579823911190033, "learning_rate": 4.2942079018028384e-05, "loss": 19.49732666015625, "step": 450 }, { "epoch": 0.5585032113934655, "grad_norm": 0.5753065943717957, "learning_rate": 4.19831223628692e-05, "loss": 19.393812255859373, "step": 500 }, { "epoch": 0.5585032113934655, "eval_loss": 3.5303454399108887, "eval_runtime": 9.0561, "eval_samples_per_second": 63.935, "eval_steps_per_second": 8.061, "step": 500 }, { "epoch": 0.6143535325328121, "grad_norm": 0.6646850109100342, "learning_rate": 4.102416570771002e-05, "loss": 19.3396826171875, "step": 550 }, { "epoch": 0.6702038536721586, "grad_norm": 0.5389931797981262, "learning_rate": 4.006520905255083e-05, "loss": 19.26292724609375, "step": 600 }, { "epoch": 0.7260541748115051, "grad_norm": 18.08650779724121, "learning_rate": 3.9106252397391644e-05, "loss": 19.2409912109375, "step": 650 }, { "epoch": 0.7819044959508518, "grad_norm": 0.5375329852104187, "learning_rate": 3.8147295742232454e-05, "loss": 19.192125244140627, "step": 700 }, { "epoch": 0.8377548170901983, "grad_norm": 0.5194340348243713, "learning_rate": 3.7188339087073263e-05, "loss": 19.237432861328124, "step": 750 }, { "epoch": 0.8936051382295448, "grad_norm": 0.5628377199172974, "learning_rate": 3.622938243191408e-05, "loss": 19.087825927734375, "step": 800 }, { "epoch": 0.9494554593688914, "grad_norm": 0.5108382105827332, "learning_rate": 3.52704257767549e-05, "loss": 19.06609375, "step": 850 }, { "epoch": 1.0044680256911478, "grad_norm": 0.5543744564056396, "learning_rate": 3.4311469121595707e-05, "loss": 18.77072021484375, "step": 900 }, { "epoch": 1.0603183468304942, "grad_norm": 0.6037471890449524, "learning_rate": 3.3352512466436516e-05, "loss": 18.96982421875, "step": 950 }, { "epoch": 1.1161686679698408, "grad_norm": 0.5822243094444275, "learning_rate": 3.239355581127733e-05, "loss": 18.948385009765627, "step": 1000 }, { "epoch": 1.1161686679698408, "eval_loss": 3.4744184017181396, "eval_runtime": 9.0468, "eval_samples_per_second": 64.001, "eval_steps_per_second": 8.069, "step": 1000 }, { "epoch": 1.1720189891091874, "grad_norm": 0.6110577583312988, "learning_rate": 3.143459915611814e-05, "loss": 18.887904052734374, "step": 1050 }, { "epoch": 1.2278693102485339, "grad_norm": 0.6810954213142395, "learning_rate": 3.0475642500958956e-05, "loss": 18.870596923828124, "step": 1100 }, { "epoch": 1.2837196313878805, "grad_norm": 0.5141286849975586, "learning_rate": 2.951668584579977e-05, "loss": 18.86670654296875, "step": 1150 }, { "epoch": 1.339569952527227, "grad_norm": 0.5824834704399109, "learning_rate": 2.8557729190640586e-05, "loss": 18.940731201171875, "step": 1200 }, { "epoch": 1.3954202736665735, "grad_norm": 0.5844902992248535, "learning_rate": 2.75987725354814e-05, "loss": 18.92754150390625, "step": 1250 }, { "epoch": 1.4512705948059201, "grad_norm": 0.5832068920135498, "learning_rate": 2.6639815880322212e-05, "loss": 18.806781005859374, "step": 1300 }, { "epoch": 1.5071209159452668, "grad_norm": 0.5681942701339722, "learning_rate": 2.5680859225163022e-05, "loss": 18.814879150390624, "step": 1350 }, { "epoch": 1.5629712370846134, "grad_norm": 0.5460590720176697, "learning_rate": 2.472190257000384e-05, "loss": 18.78223388671875, "step": 1400 }, { "epoch": 1.6188215582239598, "grad_norm": 0.6541451811790466, "learning_rate": 2.376294591484465e-05, "loss": 18.7625, "step": 1450 }, { "epoch": 1.6746718793633062, "grad_norm": 0.5325785279273987, "learning_rate": 2.2803989259685462e-05, "loss": 18.798499755859375, "step": 1500 }, { "epoch": 1.6746718793633062, "eval_loss": 3.448370933532715, "eval_runtime": 9.0498, "eval_samples_per_second": 63.98, "eval_steps_per_second": 8.067, "step": 1500 }, { "epoch": 1.7305222005026528, "grad_norm": 1.295803189277649, "learning_rate": 2.184503260452628e-05, "loss": 18.752318115234374, "step": 1550 }, { "epoch": 1.7863725216419994, "grad_norm": 0.5719322562217712, "learning_rate": 2.088607594936709e-05, "loss": 18.77613037109375, "step": 1600 }, { "epoch": 1.842222842781346, "grad_norm": 0.5277766585350037, "learning_rate": 1.9927119294207902e-05, "loss": 18.774757080078125, "step": 1650 }, { "epoch": 1.8980731639206927, "grad_norm": 0.7951223254203796, "learning_rate": 1.896816263904872e-05, "loss": 18.718056640625, "step": 1700 }, { "epoch": 1.953923485060039, "grad_norm": 0.6089980602264404, "learning_rate": 1.8009205983889528e-05, "loss": 18.657005615234375, "step": 1750 }, { "epoch": 2.0089360513822956, "grad_norm": 0.689607560634613, "learning_rate": 1.705024932873034e-05, "loss": 18.4244384765625, "step": 1800 }, { "epoch": 2.064786372521642, "grad_norm": 0.5486071705818176, "learning_rate": 1.6091292673571158e-05, "loss": 18.660447998046877, "step": 1850 }, { "epoch": 2.1206366936609884, "grad_norm": 0.5985398888587952, "learning_rate": 1.513233601841197e-05, "loss": 18.749791259765626, "step": 1900 }, { "epoch": 2.176487014800335, "grad_norm": 0.6870599985122681, "learning_rate": 1.4173379363252781e-05, "loss": 18.71692138671875, "step": 1950 }, { "epoch": 2.2323373359396816, "grad_norm": 0.5832541584968567, "learning_rate": 1.3214422708093596e-05, "loss": 18.6642626953125, "step": 2000 }, { "epoch": 2.2323373359396816, "eval_loss": 3.434812545776367, "eval_runtime": 9.0755, "eval_samples_per_second": 63.798, "eval_steps_per_second": 8.044, "step": 2000 }, { "epoch": 2.2881876570790283, "grad_norm": 0.5366337895393372, "learning_rate": 1.2255466052934408e-05, "loss": 18.6031298828125, "step": 2050 }, { "epoch": 2.344037978218375, "grad_norm": 0.5727832317352295, "learning_rate": 1.1296509397775221e-05, "loss": 18.664876708984377, "step": 2100 }, { "epoch": 2.3998882993577215, "grad_norm": 0.5798032283782959, "learning_rate": 1.0337552742616034e-05, "loss": 18.55861572265625, "step": 2150 }, { "epoch": 2.4557386204970677, "grad_norm": 0.6107646226882935, "learning_rate": 9.378596087456847e-06, "loss": 18.614580078125, "step": 2200 }, { "epoch": 2.5115889416364143, "grad_norm": 0.564208447933197, "learning_rate": 8.41963943229766e-06, "loss": 18.59590087890625, "step": 2250 }, { "epoch": 2.567439262775761, "grad_norm": 0.5309619903564453, "learning_rate": 7.460682777138474e-06, "loss": 18.567191162109374, "step": 2300 }, { "epoch": 2.6232895839151076, "grad_norm": 0.7527127265930176, "learning_rate": 6.501726121979287e-06, "loss": 18.62651611328125, "step": 2350 }, { "epoch": 2.679139905054454, "grad_norm": 0.5464082956314087, "learning_rate": 5.5427694668200995e-06, "loss": 18.56793212890625, "step": 2400 }, { "epoch": 2.7349902261938004, "grad_norm": 0.5442795753479004, "learning_rate": 4.583812811660914e-06, "loss": 18.675174560546875, "step": 2450 }, { "epoch": 2.790840547333147, "grad_norm": 0.6047973036766052, "learning_rate": 3.6248561565017264e-06, "loss": 18.68692626953125, "step": 2500 }, { "epoch": 2.790840547333147, "eval_loss": 3.4325599670410156, "eval_runtime": 9.0716, "eval_samples_per_second": 63.826, "eval_steps_per_second": 8.047, "step": 2500 }, { "epoch": 2.8466908684724936, "grad_norm": 0.5565047264099121, "learning_rate": 2.6658995013425397e-06, "loss": 18.537215576171874, "step": 2550 }, { "epoch": 2.9025411896118403, "grad_norm": 1.1597777605056763, "learning_rate": 1.7069428461833525e-06, "loss": 18.571363525390623, "step": 2600 }, { "epoch": 2.958391510751187, "grad_norm": 0.6304506659507751, "learning_rate": 7.479861910241657e-07, "loss": 18.627213134765626, "step": 2650 }, { "epoch": 3.0, "step": 2688, "total_flos": 2.281119745572864e+16, "train_loss": 18.99221926643735, "train_runtime": 5922.3639, "train_samples_per_second": 29.023, "train_steps_per_second": 0.454 } ], "logging_steps": 50, "max_steps": 2688, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.281119745572864e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }