{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 30, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.5333333333333333, "grad_norm": 0.9012682437896729, "learning_rate": 9.966191788709714e-07, "log_odds_chosen": 0.9927773475646973, "log_odds_ratio": -0.47375020384788513, "logits/chosen": 4.043400764465332, "logits/rejected": 4.5044355392456055, "logps/chosen": -1.5020328760147095, "logps/rejected": -2.389401912689209, "loss": 2.3713, "nll_loss": 2.3238818645477295, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.15020330250263214, "rewards/margins": 0.088736891746521, "rewards/rejected": -0.23894019424915314, "step": 5 }, { "epoch": 1.0, "grad_norm": 0.9028968214988708, "learning_rate": 8.83022221559489e-07, "log_odds_chosen": 0.9902886748313904, "log_odds_ratio": -0.5574756264686584, "logits/chosen": 4.209258079528809, "logits/rejected": 4.346748352050781, "logps/chosen": -1.4047656059265137, "logps/rejected": -2.313467264175415, "loss": 2.3148, "nll_loss": 2.2753841876983643, "rewards/accuracies": 0.6285714507102966, "rewards/chosen": -0.14047658443450928, "rewards/margins": 0.09087015688419342, "rewards/rejected": -0.2313467264175415, "step": 10 }, { "epoch": 1.5333333333333332, "grad_norm": 0.8105126619338989, "learning_rate": 6.434016163555451e-07, "log_odds_chosen": 0.8671220541000366, "log_odds_ratio": -0.544124960899353, "logits/chosen": 4.157012939453125, "logits/rejected": 4.290781021118164, "logps/chosen": -1.4531787633895874, "logps/rejected": -2.2471916675567627, "loss": 2.3567, "nll_loss": 2.30228853225708, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.14531788229942322, "rewards/margins": 0.07940130680799484, "rewards/rejected": -0.22471916675567627, "step": 15 }, { "epoch": 2.0, "grad_norm": 0.8526118397712708, "learning_rate": 3.56598383644455e-07, "log_odds_chosen": 1.1391531229019165, "log_odds_ratio": -0.4789137840270996, "logits/chosen": 4.081291675567627, "logits/rejected": 4.590013027191162, "logps/chosen": -1.4622834920883179, "logps/rejected": -2.482956886291504, "loss": 2.3068, "nll_loss": 2.2980434894561768, "rewards/accuracies": 0.7714285850524902, "rewards/chosen": -0.1462283581495285, "rewards/margins": 0.10206736624240875, "rewards/rejected": -0.24829572439193726, "step": 20 }, { "epoch": 2.533333333333333, "grad_norm": 0.7531288862228394, "learning_rate": 1.1697777844051104e-07, "log_odds_chosen": 1.1075918674468994, "log_odds_ratio": -0.5166323184967041, "logits/chosen": 4.147093772888184, "logits/rejected": 4.431370735168457, "logps/chosen": -1.4894083738327026, "logps/rejected": -2.5067427158355713, "loss": 2.3673, "nll_loss": 2.315680980682373, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.14894084632396698, "rewards/margins": 0.10173343122005463, "rewards/rejected": -0.250674307346344, "step": 25 }, { "epoch": 3.0, "grad_norm": 0.8306752443313599, "learning_rate": 3.380821129028488e-09, "log_odds_chosen": 0.8599945902824402, "log_odds_ratio": -0.507698655128479, "logits/chosen": 4.097240447998047, "logits/rejected": 4.431210994720459, "logps/chosen": -1.415029764175415, "logps/rejected": -2.174788475036621, "loss": 2.3028, "nll_loss": 2.276947498321533, "rewards/accuracies": 0.7714285850524902, "rewards/chosen": -0.1415029764175415, "rewards/margins": 0.07597588747739792, "rewards/rejected": -0.21747885644435883, "step": 30 } ], "logging_steps": 5, "max_steps": 30, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }