{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9943502824858759, "eval_steps": 500, "global_step": 44, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04519774011299435, "grad_norm": 0.15303204953670502, "learning_rate": 6.666666666666667e-05, "loss": 1.0135, "mean_token_accuracy": 0.7157474607229233, "step": 1 }, { "epoch": 0.22598870056497175, "grad_norm": 0.10195861756801605, "learning_rate": 0.00019458172417006347, "loss": 0.9708, "mean_token_accuracy": 0.719270593021065, "step": 5 }, { "epoch": 0.4519774011299435, "grad_norm": 0.10714796930551529, "learning_rate": 0.00014016954246529696, "loss": 0.9087, "mean_token_accuracy": 0.7353649735450745, "step": 10 }, { "epoch": 0.6779661016949152, "grad_norm": 0.09064473956823349, "learning_rate": 5.983045753470308e-05, "loss": 0.8416, "mean_token_accuracy": 0.7480618946254254, "step": 15 }, { "epoch": 0.903954802259887, "grad_norm": 0.08322014659643173, "learning_rate": 5.418275829936537e-06, "loss": 0.8185, "mean_token_accuracy": 0.7534565337002277, "step": 20 }, { "epoch": 1.1355932203389831, "grad_norm": 0.0759216845035553, "learning_rate": 9.597340598905852e-05, "loss": 0.811, "mean_token_accuracy": 0.7538863693674406, "step": 25 }, { "epoch": 1.3615819209039548, "grad_norm": 0.08596349507570267, "learning_rate": 5.713074385969457e-05, "loss": 0.7729, "mean_token_accuracy": 0.7635015636682511, "step": 30 }, { "epoch": 1.5875706214689265, "grad_norm": 0.07819920778274536, "learning_rate": 2.514892518288988e-05, "loss": 0.7476, "mean_token_accuracy": 0.7687385514378547, "step": 35 }, { "epoch": 1.8135593220338984, "grad_norm": 0.07582569867372513, "learning_rate": 5.146355805285452e-06, "loss": 0.7477, "mean_token_accuracy": 0.7625166442245245, "step": 40 }, { "epoch": 1.9943502824858759, "mean_token_accuracy": 0.7703462559729815, "step": 44, "total_flos": 4.581572145947443e+16, "train_loss": 0.3802848349918019, "train_runtime": 844.2371, "train_samples_per_second": 0.839, "train_steps_per_second": 0.052 } ], "logging_steps": 5, "max_steps": 44, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.581572145947443e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }