{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9953488372093023, "eval_steps": 500, "global_step": 107, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.009302325581395349, "grad_norm": 0.33000171184539795, "learning_rate": 1.8181818181818182e-05, "loss": 1.2009, "mean_token_accuracy": 0.673521239310503, "step": 1 }, { "epoch": 0.046511627906976744, "grad_norm": 0.3065112829208374, "learning_rate": 9.090909090909092e-05, "loss": 1.1539, "mean_token_accuracy": 0.6822087187319994, "step": 5 }, { "epoch": 0.09302325581395349, "grad_norm": 0.3443320393562317, "learning_rate": 0.00018181818181818183, "loss": 1.1184, "mean_token_accuracy": 0.6890031665563583, "step": 10 }, { "epoch": 0.13953488372093023, "grad_norm": 0.23821508884429932, "learning_rate": 0.00019914448613738106, "loss": 1.0085, "mean_token_accuracy": 0.709736293554306, "step": 15 }, { "epoch": 0.18604651162790697, "grad_norm": 0.1719299852848053, "learning_rate": 0.0001956940335732209, "loss": 0.9457, "mean_token_accuracy": 0.7221233680844307, "step": 20 }, { "epoch": 0.23255813953488372, "grad_norm": 0.15530090034008026, "learning_rate": 0.00018968727415326884, "loss": 0.9069, "mean_token_accuracy": 0.7291829422116279, "step": 25 }, { "epoch": 0.27906976744186046, "grad_norm": 0.1351461559534073, "learning_rate": 0.00018128466845916154, "loss": 0.8542, "mean_token_accuracy": 0.7403964079916477, "step": 30 }, { "epoch": 0.32558139534883723, "grad_norm": 0.12998437881469727, "learning_rate": 0.00017071067811865476, "loss": 0.8219, "mean_token_accuracy": 0.7473064973950386, "step": 35 }, { "epoch": 0.37209302325581395, "grad_norm": 0.1579654961824417, "learning_rate": 0.00015824776968678024, "loss": 0.7689, "mean_token_accuracy": 0.7591808065772057, "step": 40 }, { "epoch": 0.4186046511627907, "grad_norm": 0.13961397111415863, "learning_rate": 0.00014422886902190014, "loss": 0.7605, "mean_token_accuracy": 0.7607541777193546, "step": 45 }, { "epoch": 0.46511627906976744, "grad_norm": 0.15156981348991394, "learning_rate": 0.00012902846772544624, "loss": 0.7466, "mean_token_accuracy": 0.7628601484000683, "step": 50 }, { "epoch": 0.5116279069767442, "grad_norm": 0.1230233684182167, "learning_rate": 0.00011305261922200519, "loss": 0.7338, "mean_token_accuracy": 0.7658133447170258, "step": 55 }, { "epoch": 0.5581395348837209, "grad_norm": 0.1458376795053482, "learning_rate": 9.67280917178224e-05, "loss": 0.7271, "mean_token_accuracy": 0.7671422854065895, "step": 60 }, { "epoch": 0.6046511627906976, "grad_norm": 0.1341293305158615, "learning_rate": 8.049096779838719e-05, "loss": 0.7137, "mean_token_accuracy": 0.7699349835515022, "step": 65 }, { "epoch": 0.6511627906976745, "grad_norm": 0.13247253000736237, "learning_rate": 6.477499520787665e-05, "loss": 0.6963, "mean_token_accuracy": 0.7752044893801212, "step": 70 }, { "epoch": 0.6976744186046512, "grad_norm": 0.12003805488348007, "learning_rate": 5.000000000000002e-05, "loss": 0.6957, "mean_token_accuracy": 0.774368204921484, "step": 75 }, { "epoch": 0.7441860465116279, "grad_norm": 0.11840014159679413, "learning_rate": 3.6560671583635467e-05, "loss": 0.6922, "mean_token_accuracy": 0.7757050350308419, "step": 80 }, { "epoch": 0.7906976744186046, "grad_norm": 0.13812483847141266, "learning_rate": 2.4816019252102273e-05, "loss": 0.6854, "mean_token_accuracy": 0.777467641979456, "step": 85 }, { "epoch": 0.8372093023255814, "grad_norm": 0.12007566541433334, "learning_rate": 1.5079781847342123e-05, "loss": 0.6774, "mean_token_accuracy": 0.7794982820749283, "step": 90 }, { "epoch": 0.8837209302325582, "grad_norm": 0.11563662439584732, "learning_rate": 7.612046748871327e-06, "loss": 0.6787, "mean_token_accuracy": 0.7794713638722897, "step": 95 }, { "epoch": 0.9302325581395349, "grad_norm": 0.11361019313335419, "learning_rate": 2.612302072266637e-06, "loss": 0.6715, "mean_token_accuracy": 0.7792891427874565, "step": 100 }, { "epoch": 0.9767441860465116, "grad_norm": 0.11059077084064484, "learning_rate": 2.141076761396521e-07, "loss": 0.6896, "mean_token_accuracy": 0.7759934611618519, "step": 105 }, { "epoch": 0.9953488372093023, "mean_token_accuracy": 0.7779956627637148, "step": 107, "total_flos": 3.0828954034110464e+16, "train_loss": 0.7957682988353979, "train_runtime": 1817.9416, "train_samples_per_second": 0.946, "train_steps_per_second": 0.059 } ], "logging_steps": 5, "max_steps": 107, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.0828954034110464e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }