{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 7.0, "eval_steps": 500, "global_step": 77, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.45454545454545453, "grad_norm": 2.5707619190216064, "learning_rate": 2e-05, "loss": 0.7696, "loss_nan_ranks": 0, "loss_rank_avg": 0.7344862818717957, "step": 5, "valid_targets_mean": 10940.0, "valid_targets_min": 1296 }, { "epoch": 0.9090909090909091, "grad_norm": 3.0747663974761963, "learning_rate": 3.9979273472934556e-05, "loss": 0.7194, "loss_nan_ranks": 0, "loss_rank_avg": 0.7147436141967773, "step": 10, "valid_targets_mean": 11399.7, "valid_targets_min": 1921 }, { "epoch": 1.3636363636363638, "grad_norm": 1.2209486961364746, "learning_rate": 3.925834574695599e-05, "loss": 0.6838, "loss_nan_ranks": 0, "loss_rank_avg": 0.6719205975532532, "step": 15, "valid_targets_mean": 10668.7, "valid_targets_min": 1431 }, { "epoch": 1.8181818181818183, "grad_norm": 0.8381664156913757, "learning_rate": 3.754365204805189e-05, "loss": 0.6437, "loss_nan_ranks": 0, "loss_rank_avg": 0.6438973546028137, "step": 20, "valid_targets_mean": 9851.9, "valid_targets_min": 1661 }, { "epoch": 2.2727272727272725, "grad_norm": 0.6093587875366211, "learning_rate": 3.4923673716953717e-05, "loss": 0.6272, "loss_nan_ranks": 0, "loss_rank_avg": 0.6231866478919983, "step": 25, "valid_targets_mean": 10324.9, "valid_targets_min": 1431 }, { "epoch": 2.7272727272727275, "grad_norm": 0.4461829960346222, "learning_rate": 3.153360644229735e-05, "loss": 0.5939, "loss_nan_ranks": 0, "loss_rank_avg": 0.5710898041725159, "step": 30, "valid_targets_mean": 10086.1, "valid_targets_min": 1922 }, { "epoch": 3.1818181818181817, "grad_norm": 0.3415960967540741, "learning_rate": 2.7548383915052287e-05, "loss": 0.5959, "loss_nan_ranks": 0, "loss_rank_avg": 0.5762262344360352, "step": 35, "valid_targets_mean": 11156.6, "valid_targets_min": 2289 }, { "epoch": 3.6363636363636362, "grad_norm": 0.33736804127693176, "learning_rate": 2.317365092912503e-05, "loss": 0.5729, "loss_nan_ranks": 0, "loss_rank_avg": 0.5794134736061096, "step": 40, "valid_targets_mean": 10489.0, "valid_targets_min": 2207 }, { "epoch": 4.090909090909091, "grad_norm": 0.24178124964237213, "learning_rate": 1.8635151732706586e-05, "loss": 0.5683, "loss_nan_ranks": 0, "loss_rank_avg": 0.5701989531517029, "step": 45, "valid_targets_mean": 11467.8, "valid_targets_min": 1523 }, { "epoch": 4.545454545454545, "grad_norm": 0.25526440143585205, "learning_rate": 1.4167081210903501e-05, "loss": 0.5605, "loss_nan_ranks": 0, "loss_rank_avg": 0.5524492859840393, "step": 50, "valid_targets_mean": 9196.7, "valid_targets_min": 1978 }, { "epoch": 5.0, "grad_norm": 0.2626790702342987, "learning_rate": 1.0000000000000006e-05, "loss": 0.548, "loss_nan_ranks": 0, "loss_rank_avg": 0.5532940626144409, "step": 55, "valid_targets_mean": 11774.8, "valid_targets_min": 1740 }, { "epoch": 5.454545454545454, "grad_norm": 0.21153761446475983, "learning_rate": 6.348937135626922e-06, "loss": 0.5557, "loss_nan_ranks": 0, "loss_rank_avg": 0.5435238480567932, "step": 60, "valid_targets_mean": 10416.2, "valid_targets_min": 1523 }, { "epoch": 5.909090909090909, "grad_norm": 0.22004517912864685, "learning_rate": 3.402294160019499e-06, "loss": 0.5368, "loss_nan_ranks": 0, "loss_rank_avg": 0.5342128276824951, "step": 65, "valid_targets_mean": 10384.5, "valid_targets_min": 1559 }, { "epoch": 6.363636363636363, "grad_norm": 0.2335129827260971, "learning_rate": 1.3121232567865793e-06, "loss": 0.541, "loss_nan_ranks": 0, "loss_rank_avg": 0.5447248816490173, "step": 70, "valid_targets_mean": 11540.8, "valid_targets_min": 1740 }, { "epoch": 6.818181818181818, "grad_norm": 0.20155416429042816, "learning_rate": 1.862810792733849e-07, "loss": 0.5444, "loss_nan_ranks": 0, "loss_rank_avg": 0.5294170379638672, "step": 75, "valid_targets_mean": 10089.2, "valid_targets_min": 1758 }, { "epoch": 7.0, "step": 77, "total_flos": 496687094169600.0, "train_loss": 0.0, "train_runtime": 1.107, "train_samples_per_second": 6323.517, "train_steps_per_second": 69.559 } ], "logging_steps": 5, "max_steps": 77, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 400, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 496687094169600.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }