{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 834, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.17985611510791366, "grad_norm": 0.9889341592788696, "learning_rate": 0.0001995649347969019, "loss": 3.5084, "step": 50 }, { "epoch": 0.3597122302158273, "grad_norm": 1.3072373867034912, "learning_rate": 0.00019588933215113926, "loss": 2.8647, "step": 100 }, { "epoch": 0.539568345323741, "grad_norm": 1.416175127029419, "learning_rate": 0.00018860113594683148, "loss": 2.8011, "step": 150 }, { "epoch": 0.7194244604316546, "grad_norm": 1.3511329889297485, "learning_rate": 0.00017797492616144256, "loss": 2.796, "step": 200 }, { "epoch": 0.8992805755395683, "grad_norm": 1.0564734935760498, "learning_rate": 0.0001644110411450398, "loss": 2.6583, "step": 250 }, { "epoch": 1.0, "eval_loss": 2.709125280380249, "eval_runtime": 4.5805, "eval_samples_per_second": 66.15, "eval_steps_per_second": 8.296, "step": 278 }, { "epoch": 1.079136690647482, "grad_norm": 1.3963377475738525, "learning_rate": 0.0001484204950275565, "loss": 2.6333, "step": 300 }, { "epoch": 1.2589928057553956, "grad_norm": 0.9653306603431702, "learning_rate": 0.00013060572545878875, "loss": 2.5746, "step": 350 }, { "epoch": 1.4388489208633093, "grad_norm": 1.270931601524353, "learning_rate": 0.00011163789700258655, "loss": 2.6636, "step": 400 }, { "epoch": 1.6187050359712232, "grad_norm": 1.5205957889556885, "learning_rate": 9.223161527109937e-05, "loss": 2.6855, "step": 450 }, { "epoch": 1.7985611510791366, "grad_norm": 1.5966553688049316, "learning_rate": 7.311800443430251e-05, "loss": 2.4911, "step": 500 }, { "epoch": 1.9784172661870505, "grad_norm": 1.0975911617279053, "learning_rate": 5.501716239923642e-05, "loss": 2.5095, "step": 550 }, { "epoch": 2.0, "eval_loss": 2.6189730167388916, "eval_runtime": 4.5727, "eval_samples_per_second": 66.262, "eval_steps_per_second": 8.31, "step": 556 }, { "epoch": 2.158273381294964, "grad_norm": 1.6500194072723389, "learning_rate": 3.861103139944449e-05, "loss": 2.5351, "step": 600 }, { "epoch": 2.338129496402878, "grad_norm": 1.2627792358398438, "learning_rate": 2.451770608467432e-05, "loss": 2.4278, "step": 650 }, { "epoch": 2.5179856115107913, "grad_norm": 1.2723170518875122, "learning_rate": 1.326814704364262e-05, "loss": 2.5119, "step": 700 }, { "epoch": 2.697841726618705, "grad_norm": 1.461732268333435, "learning_rate": 5.286177068899989e-06, "loss": 2.4941, "step": 750 }, { "epoch": 2.8776978417266186, "grad_norm": 1.4850504398345947, "learning_rate": 8.725137967920738e-07, "loss": 2.6372, "step": 800 }, { "epoch": 3.0, "eval_loss": 2.6041791439056396, "eval_runtime": 4.5702, "eval_samples_per_second": 66.299, "eval_steps_per_second": 8.315, "step": 834 } ], "logging_steps": 50, "max_steps": 834, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.060585900867584e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }