{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.45, "eval_steps": 500, "global_step": 98, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "completion_length": 0.25416667461395265, "completions/clipped_ratio": 0.99375, "completions/max_length": 128.0, "completions/max_terminated_length": 9.8, "completions/mean_length": 127.45416717529297, "completions/mean_terminated_length": 8.133333587646485, "completions/min_length": 107.8, "completions/min_terminated_length": 5.4, "epoch": 0.125, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 6.857142857142857e-06, "loss": 0.0, "num_tokens": 245160.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 5 }, { "completion_length": 0.20208334922790527, "completions/clipped_ratio": 0.9979166666666666, "completions/max_length": 128.0, "completions/max_terminated_length": 19.4, "completions/mean_length": 127.93541717529297, "completions/mean_terminated_length": 19.4, "completions/min_length": 121.8, "completions/min_terminated_length": 19.4, "epoch": 0.25, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 1.5428571428571428e-05, "loss": 0.0, "num_tokens": 490341.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 10 }, { "completion_length": 0.23750000800937415, "completions/clipped_ratio": 0.9958333333333333, "completions/max_length": 128.0, "completions/max_terminated_length": 22.8, "completions/mean_length": 127.70416717529297, "completions/mean_terminated_length": 22.8, "completions/min_length": 99.6, "completions/min_terminated_length": 22.8, "epoch": 0.375, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 2.4e-05, "loss": 0.0, "num_tokens": 735705.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 15 }, { "completion_length": 0.15208333730697632, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 14.6, "completions/mean_length": 127.88541717529297, "completions/mean_terminated_length": 14.6, "completions/min_length": 117.0, "completions/min_terminated_length": 14.6, "epoch": 0.5, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 3.2571428571428566e-05, "loss": 0.0, "num_tokens": 981030.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 20 }, { "completion_length": 0.13541666883975267, "completions/clipped_ratio": 0.9916666666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 13.0, "completions/mean_length": 127.06875152587891, "completions/mean_terminated_length": 13.0, "completions/min_length": 38.6, "completions/min_terminated_length": 13.0, "epoch": 0.625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 4.1142857142857146e-05, "loss": 0.0, "num_tokens": 1226233.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 25 }, { "completion_length": 0.17291667070239783, "completions/clipped_ratio": 0.9958333333333333, "completions/max_length": 128.0, "completions/max_terminated_length": 16.6, "completions/mean_length": 127.63958435058593, "completions/mean_terminated_length": 16.6, "completions/min_length": 93.4, "completions/min_terminated_length": 16.6, "epoch": 0.75, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 4.971428571428572e-05, "loss": 0.0, "num_tokens": 1471656.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 30 }, { "completion_length": 0.1708333373069763, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 16.4, "completions/mean_length": 127.90416717529297, "completions/mean_terminated_length": 16.4, "completions/min_length": 118.8, "completions/min_terminated_length": 16.4, "epoch": 0.875, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 5.8285714285714284e-05, "loss": 0.0, "num_tokens": 1716970.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 35 }, { "completion_length": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 128.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 128.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 128.0, "completions/min_terminated_length": 0.0, "epoch": 1.0, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 5.975456118835079e-05, "loss": 0.0, "num_tokens": 1962424.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 40 }, { "completion_length": 0.10625, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 10.2, "completions/mean_length": 127.83958435058594, "completions/mean_terminated_length": 10.2, "completions/min_length": 112.6, "completions/min_terminated_length": 10.2, "epoch": 1.125, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 5.876663613361844e-05, "loss": 0.0, "num_tokens": 2207607.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 45 }, { "completion_length": 0.01666666716337204, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 1.6, "completions/mean_length": 127.75, "completions/mean_terminated_length": 1.6, "completions/min_length": 104.0, "completions/min_terminated_length": 1.6, "epoch": 1.25, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 5.705450129187439e-05, "loss": 0.0, "num_tokens": 2453161.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 50 }, { "completion_length": 0.06041666865348816, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 5.8, "completions/mean_length": 127.79375, "completions/mean_terminated_length": 5.8, "completions/min_length": 108.2, "completions/min_terminated_length": 5.8, "epoch": 1.375, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 5.467646136167482e-05, "loss": 0.0, "num_tokens": 2698744.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 55 }, { "completion_length": 0.10625, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 10.2, "completions/mean_length": 127.83958435058594, "completions/mean_terminated_length": 10.2, "completions/min_length": 112.6, "completions/min_terminated_length": 10.2, "epoch": 1.5, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 5.1713497640698144e-05, "loss": 0.0, "num_tokens": 2943913.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 60 }, { "completion_length": 0.06875000204890966, "completions/clipped_ratio": 0.9958333333333333, "completions/max_length": 128.0, "completions/max_terminated_length": 6.6, "completions/mean_length": 127.53541717529296, "completions/mean_terminated_length": 6.6, "completions/min_length": 83.4, "completions/min_terminated_length": 6.6, "epoch": 1.625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 4.826651030477895e-05, "loss": 0.0, "num_tokens": 3188874.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 65 }, { "completion_length": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 128.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 128.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 128.0, "completions/min_terminated_length": 0.0, "epoch": 1.75, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 4.445288237343632e-05, "loss": 0.0, "num_tokens": 3434112.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 70 }, { "completion_length": 0.16875000800937415, "completions/clipped_ratio": 0.9958333333333333, "completions/max_length": 128.0, "completions/max_terminated_length": 16.2, "completions/mean_length": 127.63541717529297, "completions/mean_terminated_length": 16.2, "completions/min_length": 93.0, "completions/min_terminated_length": 16.2, "epoch": 1.875, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 4.0402482371929574e-05, "loss": 0.0, "num_tokens": 3679205.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 75 }, { "completion_length": 0.45625, "completions/clipped_ratio": 0.9958333333333333, "completions/max_length": 128.0, "completions/max_terminated_length": 23.2, "completions/mean_length": 127.92291717529297, "completions/mean_terminated_length": 21.9, "completions/min_length": 123.0, "completions/min_terminated_length": 20.6, "epoch": 2.0, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 3.6253241814390675e-05, "loss": 0.0, "num_tokens": 3924684.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 80 }, { "completion_length": 0.22083334922790526, "completions/clipped_ratio": 0.9979166666666666, "completions/max_length": 128.0, "completions/max_terminated_length": 21.2, "completions/mean_length": 127.95416717529297, "completions/mean_terminated_length": 21.2, "completions/min_length": 123.6, "completions/min_terminated_length": 21.2, "epoch": 2.125, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 3.2146458111541086e-05, "loss": 0.0, "num_tokens": 4169802.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 85 }, { "completion_length": 0.14166667461395263, "completions/clipped_ratio": 0.9979166666666668, "completions/max_length": 128.0, "completions/max_terminated_length": 13.6, "completions/mean_length": 127.875, "completions/mean_terminated_length": 13.6, "completions/min_length": 116.0, "completions/min_terminated_length": 13.6, "epoch": 2.25, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 2.8221982856837173e-05, "loss": 0.0, "num_tokens": 4415206.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 90 }, { "completion_length": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 128.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 128.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 128.0, "completions/min_terminated_length": 0.0, "epoch": 2.375, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "kl": NaN, "learning_rate": 2.4613459348188633e-05, "loss": 0.0, "num_tokens": 4660218.0, "reward": 0.0, "reward_std": 0.0, "rewards/wrapper/mean": 0.0, "rewards/wrapper/std": 0.0, "step": 95 } ], "logging_steps": 5, "max_steps": 120, "num_input_tokens_seen": 4807273, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 24, "trial_name": null, "trial_params": null }