{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.369438529014587, "epoch": 0.0025, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 1e-05, "loss": 0.0, "num_tokens": 81920.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361862421035767, "epoch": 0.005, "grad_norm": 0.0, "learning_rate": 9.975000000000002e-06, "loss": 0.0, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35631263256073, "epoch": 0.0075, "grad_norm": 0.0, "learning_rate": 9.950000000000001e-06, "loss": 0.0, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358352303504944, "epoch": 0.01, "grad_norm": 0.0, "learning_rate": 9.925e-06, "loss": 0.0, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3544700145721436, "epoch": 0.0125, "grad_norm": 0.0, "learning_rate": 9.9e-06, "loss": 0.0, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.359458684921265, "epoch": 0.015, "grad_norm": 0.0, "learning_rate": 9.875000000000001e-06, "loss": 0.0, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358532786369324, "epoch": 0.0175, "grad_norm": 0.0, "learning_rate": 9.85e-06, "loss": 0.0, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.359454154968262, "epoch": 0.02, "grad_norm": 0.0, "learning_rate": 9.825000000000002e-06, "loss": 0.0, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.357772588729858, "epoch": 0.0225, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 9.800000000000001e-06, "loss": 0.0, "num_tokens": 163840.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354452610015869, "epoch": 0.025, "grad_norm": 0.0, "learning_rate": 9.775e-06, "loss": 0.0, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362765550613403, "epoch": 0.0275, "grad_norm": 0.0, "learning_rate": 9.75e-06, "loss": 0.0, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.349831581115723, "epoch": 0.03, "grad_norm": 0.0, "learning_rate": 9.725000000000001e-06, "loss": 0.0, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361098527908325, "epoch": 0.0325, "grad_norm": 0.0, "learning_rate": 9.7e-06, "loss": 0.0, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361657619476318, "epoch": 0.035, "grad_norm": 0.0, "learning_rate": 9.675000000000001e-06, "loss": 0.0, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358333349227905, "epoch": 0.0375, "grad_norm": 0.0, "learning_rate": 9.65e-06, "loss": 0.0, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361846923828125, "epoch": 0.04, "grad_norm": 0.0, "learning_rate": 9.625e-06, "loss": 0.0, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.353164434432983, "epoch": 0.0425, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 9.600000000000001e-06, "loss": 0.0, "num_tokens": 245760.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355193018913269, "epoch": 0.045, "grad_norm": 0.0, "learning_rate": 9.575e-06, "loss": 0.0, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355559706687927, "epoch": 0.0475, "grad_norm": 0.0, "learning_rate": 9.55e-06, "loss": 0.0, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358516216278076, "epoch": 0.05, "grad_norm": 0.0, "learning_rate": 9.525000000000001e-06, "loss": 0.0, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362407088279724, "epoch": 0.0525, "grad_norm": 0.0, "learning_rate": 9.5e-06, "loss": 0.0, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3559370040893555, "epoch": 0.055, "grad_norm": 0.0, "learning_rate": 9.475000000000002e-06, "loss": 0.0, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355936765670776, "epoch": 0.0575, "grad_norm": 0.0, "learning_rate": 9.450000000000001e-06, "loss": 0.0, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.367756128311157, "epoch": 0.06, "grad_norm": 0.0, "learning_rate": 9.425e-06, "loss": 0.0, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.359081983566284, "epoch": 0.0625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 9.4e-06, "loss": 0.0, "num_tokens": 327680.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.359453916549683, "epoch": 0.065, "grad_norm": 0.0, "learning_rate": 9.375000000000001e-06, "loss": 0.0, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357423901557922, "epoch": 0.0675, "grad_norm": 0.0, "learning_rate": 9.350000000000002e-06, "loss": 0.0, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362042188644409, "epoch": 0.07, "grad_norm": 0.0, "learning_rate": 9.325000000000001e-06, "loss": 0.0, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358163237571716, "epoch": 0.0725, "grad_norm": 0.0, "learning_rate": 9.3e-06, "loss": 0.0, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357796311378479, "epoch": 0.075, "grad_norm": 0.0, "learning_rate": 9.275e-06, "loss": 0.0, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.360013961791992, "epoch": 0.0775, "grad_norm": 0.0, "learning_rate": 9.250000000000001e-06, "loss": 0.0, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354282975196838, "epoch": 0.08, "grad_norm": 0.0, "learning_rate": 9.225e-06, "loss": 0.0, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.358327150344849, "epoch": 0.0825, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 9.200000000000002e-06, "loss": 0.0, "num_tokens": 409600.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363318681716919, "epoch": 0.085, "grad_norm": 0.0, "learning_rate": 9.175000000000001e-06, "loss": 0.0, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352967858314514, "epoch": 0.0875, "grad_norm": 0.0, "learning_rate": 9.15e-06, "loss": 0.0, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3574066162109375, "epoch": 0.09, "grad_norm": 0.0, "learning_rate": 9.125e-06, "loss": 0.0, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357410788536072, "epoch": 0.0925, "grad_norm": 0.0, "learning_rate": 9.100000000000001e-06, "loss": 0.0, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354451537132263, "epoch": 0.095, "grad_norm": 0.0, "learning_rate": 9.075e-06, "loss": 0.0, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.365721702575684, "epoch": 0.0975, "grad_norm": 0.0, "learning_rate": 9.050000000000001e-06, "loss": 0.0, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.348904967308044, "epoch": 0.1, "grad_norm": 0.0, "learning_rate": 9.025e-06, "loss": 0.0, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.357222557067871, "epoch": 0.1025, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 9e-06, "loss": 0.0, "num_tokens": 491520.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355740547180176, "epoch": 0.105, "grad_norm": 0.0, "learning_rate": 8.975e-06, "loss": 0.0, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.34890341758728, "epoch": 0.1075, "grad_norm": 0.0, "learning_rate": 8.95e-06, "loss": 0.0, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356113791465759, "epoch": 0.11, "grad_norm": 0.0, "learning_rate": 8.925e-06, "loss": 0.0, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355374813079834, "epoch": 0.1125, "grad_norm": 0.0, "learning_rate": 8.900000000000001e-06, "loss": 0.0, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3614726066589355, "epoch": 0.115, "grad_norm": 0.0, "learning_rate": 8.875e-06, "loss": 0.0, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.359627962112427, "epoch": 0.1175, "grad_norm": 0.0, "learning_rate": 8.85e-06, "loss": 0.0, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355189919471741, "epoch": 0.12, "grad_norm": 0.0, "learning_rate": 8.825000000000001e-06, "loss": 0.0, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.357407331466675, "epoch": 0.1225, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 8.8e-06, "loss": 0.0, "num_tokens": 573440.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.351681590080261, "epoch": 0.125, "grad_norm": 0.0, "learning_rate": 8.775e-06, "loss": 0.0, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354265213012695, "epoch": 0.1275, "grad_norm": 0.0, "learning_rate": 8.750000000000001e-06, "loss": 0.0, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.351495146751404, "epoch": 0.13, "grad_norm": 0.0, "learning_rate": 8.725000000000002e-06, "loss": 0.0, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.349096179008484, "epoch": 0.1325, "grad_norm": 0.0, "learning_rate": 8.700000000000001e-06, "loss": 0.0, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354640483856201, "epoch": 0.135, "grad_norm": 0.0, "learning_rate": 8.675e-06, "loss": 0.0, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352414965629578, "epoch": 0.1375, "grad_norm": 0.0, "learning_rate": 8.65e-06, "loss": 0.0, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.351497530937195, "epoch": 0.14, "grad_norm": 0.0, "learning_rate": 8.625000000000001e-06, "loss": 0.0, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.35981810092926, "epoch": 0.1425, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 8.6e-06, "loss": 0.0, "num_tokens": 655360.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358149290084839, "epoch": 0.145, "grad_norm": 0.0, "learning_rate": 8.575000000000002e-06, "loss": 0.0, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.353531837463379, "epoch": 0.1475, "grad_norm": 0.0, "learning_rate": 8.550000000000001e-06, "loss": 0.0, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357410669326782, "epoch": 0.15, "grad_norm": 0.0, "learning_rate": 8.525e-06, "loss": 0.0, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362405300140381, "epoch": 0.1525, "grad_norm": 0.0, "learning_rate": 8.5e-06, "loss": 0.0, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354081869125366, "epoch": 0.155, "grad_norm": 0.0, "learning_rate": 8.475000000000001e-06, "loss": 0.0, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356305956840515, "epoch": 0.1575, "grad_norm": 0.0, "learning_rate": 8.45e-06, "loss": 0.0, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354457974433899, "epoch": 0.16, "grad_norm": 0.0, "learning_rate": 8.425000000000001e-06, "loss": 0.0, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.361861705780029, "epoch": 0.1625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 8.400000000000001e-06, "loss": 0.0, "num_tokens": 737280.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.353907465934753, "epoch": 0.165, "grad_norm": 0.0, "learning_rate": 8.375e-06, "loss": 0.0, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352243661880493, "epoch": 0.1675, "grad_norm": 0.0, "learning_rate": 8.35e-06, "loss": 0.0, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357968091964722, "epoch": 0.17, "grad_norm": 0.0, "learning_rate": 8.325e-06, "loss": 0.0, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354275941848755, "epoch": 0.1725, "grad_norm": 0.0, "learning_rate": 8.3e-06, "loss": 0.0, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.353910565376282, "epoch": 0.175, "grad_norm": 0.0, "learning_rate": 8.275000000000001e-06, "loss": 0.0, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358715772628784, "epoch": 0.1775, "grad_norm": 0.0, "learning_rate": 8.25e-06, "loss": 0.0, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357971787452698, "epoch": 0.18, "grad_norm": 0.0, "learning_rate": 8.225e-06, "loss": 0.0, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.350202202796936, "epoch": 0.1825, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 8.2e-06, "loss": 0.0, "num_tokens": 819200.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.359816074371338, "epoch": 0.185, "grad_norm": 0.0, "learning_rate": 8.175e-06, "loss": 0.0, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356489419937134, "epoch": 0.1875, "grad_norm": 0.0, "learning_rate": 8.15e-06, "loss": 0.0, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354463458061218, "epoch": 0.19, "grad_norm": 0.0, "learning_rate": 8.125000000000001e-06, "loss": 0.0, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3553794622421265, "epoch": 0.1925, "grad_norm": 0.0, "learning_rate": 8.1e-06, "loss": 0.0, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355569362640381, "epoch": 0.195, "grad_norm": 0.0, "learning_rate": 8.075000000000001e-06, "loss": 0.0, "step": 78 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3505799770355225, "epoch": 0.1975, "grad_norm": 0.0, "learning_rate": 8.050000000000001e-06, "loss": 0.0, "step": 79 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355196475982666, "epoch": 0.2, "grad_norm": 0.0, "learning_rate": 8.025e-06, "loss": 0.0, "step": 80 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.363699555397034, "epoch": 0.2025, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 8.000000000000001e-06, "loss": 0.0, "num_tokens": 901120.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 81 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361477255821228, "epoch": 0.205, "grad_norm": 0.0, "learning_rate": 7.975e-06, "loss": 0.0, "step": 82 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.349467039108276, "epoch": 0.2075, "grad_norm": 0.0, "learning_rate": 7.950000000000002e-06, "loss": 0.0, "step": 83 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35796594619751, "epoch": 0.21, "grad_norm": 0.0, "learning_rate": 7.925000000000001e-06, "loss": 0.0, "step": 84 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356119871139526, "epoch": 0.2125, "grad_norm": 0.0, "learning_rate": 7.9e-06, "loss": 0.0, "step": 85 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362959980964661, "epoch": 0.215, "grad_norm": 0.0, "learning_rate": 7.875e-06, "loss": 0.0, "step": 86 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358152985572815, "epoch": 0.2175, "grad_norm": 0.0, "learning_rate": 7.850000000000001e-06, "loss": 0.0, "step": 87 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.351126432418823, "epoch": 0.22, "grad_norm": 0.0, "learning_rate": 7.825e-06, "loss": 0.0, "step": 88 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.353165030479431, "epoch": 0.2225, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 7.800000000000002e-06, "loss": 0.0, "num_tokens": 983040.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 89 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3511306047439575, "epoch": 0.225, "grad_norm": 0.0, "learning_rate": 7.775000000000001e-06, "loss": 0.0, "step": 90 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358151316642761, "epoch": 0.2275, "grad_norm": 0.0, "learning_rate": 7.75e-06, "loss": 0.0, "step": 91 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.360924482345581, "epoch": 0.23, "grad_norm": 0.0, "learning_rate": 7.725e-06, "loss": 0.0, "step": 92 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354089617729187, "epoch": 0.2325, "grad_norm": 0.0, "learning_rate": 7.7e-06, "loss": 0.0, "step": 93 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.364252090454102, "epoch": 0.235, "grad_norm": 0.0, "learning_rate": 7.675e-06, "loss": 0.0, "step": 94 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3596354722976685, "epoch": 0.2375, "grad_norm": 0.0, "learning_rate": 7.650000000000001e-06, "loss": 0.0, "step": 95 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.353907585144043, "epoch": 0.24, "grad_norm": 0.0, "learning_rate": 7.625e-06, "loss": 0.0, "step": 96 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.352238178253174, "epoch": 0.2425, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 7.600000000000001e-06, "loss": 0.0, "num_tokens": 1064960.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 97 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356118559837341, "epoch": 0.245, "grad_norm": 0.0, "learning_rate": 7.575e-06, "loss": 0.0, "step": 98 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.350016474723816, "epoch": 0.2475, "grad_norm": 0.0, "learning_rate": 7.5500000000000006e-06, "loss": 0.0, "step": 99 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356671094894409, "epoch": 0.25, "grad_norm": 0.0, "learning_rate": 7.525e-06, "loss": 0.0, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358888626098633, "epoch": 0.2525, "grad_norm": 0.0, "learning_rate": 7.500000000000001e-06, "loss": 0.0, "step": 101 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356119871139526, "epoch": 0.255, "grad_norm": 0.0, "learning_rate": 7.475000000000001e-06, "loss": 0.0, "step": 102 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354820370674133, "epoch": 0.2575, "grad_norm": 0.0, "learning_rate": 7.450000000000001e-06, "loss": 0.0, "step": 103 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35278582572937, "epoch": 0.26, "grad_norm": 0.0, "learning_rate": 7.425000000000001e-06, "loss": 0.0, "step": 104 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.361664414405823, "epoch": 0.2625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 7.4e-06, "loss": 0.0, "num_tokens": 1146880.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362587094306946, "epoch": 0.265, "grad_norm": 0.0, "learning_rate": 7.375000000000001e-06, "loss": 0.0, "step": 106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361659288406372, "epoch": 0.2675, "grad_norm": 0.0, "learning_rate": 7.350000000000001e-06, "loss": 0.0, "step": 107 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35519552230835, "epoch": 0.27, "grad_norm": 0.0, "learning_rate": 7.325000000000001e-06, "loss": 0.0, "step": 108 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3592623472213745, "epoch": 0.2725, "grad_norm": 0.0, "learning_rate": 7.3e-06, "loss": 0.0, "step": 109 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.36148202419281, "epoch": 0.275, "grad_norm": 0.0, "learning_rate": 7.275000000000001e-06, "loss": 0.0, "step": 110 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361296892166138, "epoch": 0.2775, "grad_norm": 0.0, "learning_rate": 7.25e-06, "loss": 0.0, "step": 111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355571746826172, "epoch": 0.28, "grad_norm": 0.0, "learning_rate": 7.225000000000001e-06, "loss": 0.0, "step": 112 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.3522549867630005, "epoch": 0.2825, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 7.2000000000000005e-06, "loss": 0.0, "num_tokens": 1228800.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 113 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361860990524292, "epoch": 0.285, "grad_norm": 0.0, "learning_rate": 7.175000000000001e-06, "loss": 0.0, "step": 114 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357979655265808, "epoch": 0.2875, "grad_norm": 0.0, "learning_rate": 7.15e-06, "loss": 0.0, "step": 115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363341808319092, "epoch": 0.29, "grad_norm": 0.0, "learning_rate": 7.125e-06, "loss": 0.0, "step": 116 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35871422290802, "epoch": 0.2925, "grad_norm": 0.0, "learning_rate": 7.100000000000001e-06, "loss": 0.0, "step": 117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356124520301819, "epoch": 0.295, "grad_norm": 0.0, "learning_rate": 7.075000000000001e-06, "loss": 0.0, "step": 118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3601953983306885, "epoch": 0.2975, "grad_norm": 0.0, "learning_rate": 7.05e-06, "loss": 0.0, "step": 119 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.36924946308136, "epoch": 0.3, "grad_norm": 0.0, "learning_rate": 7.0250000000000005e-06, "loss": 0.0, "step": 120 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.3561201095581055, "epoch": 0.3025, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 7e-06, "loss": 0.0, "num_tokens": 1310720.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357042670249939, "epoch": 0.305, "grad_norm": 0.0, "learning_rate": 6.975000000000001e-06, "loss": 0.0, "step": 122 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358524203300476, "epoch": 0.3075, "grad_norm": 0.0, "learning_rate": 6.95e-06, "loss": 0.0, "step": 123 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.360369324684143, "epoch": 0.31, "grad_norm": 0.0, "learning_rate": 6.925000000000001e-06, "loss": 0.0, "step": 124 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357417345046997, "epoch": 0.3125, "grad_norm": 0.0, "learning_rate": 6.9e-06, "loss": 0.0, "step": 125 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356303572654724, "epoch": 0.315, "grad_norm": 0.0, "learning_rate": 6.875e-06, "loss": 0.0, "step": 126 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354269742965698, "epoch": 0.3175, "grad_norm": 0.0, "learning_rate": 6.850000000000001e-06, "loss": 0.0, "step": 127 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352428197860718, "epoch": 0.32, "grad_norm": 0.0, "learning_rate": 6.825000000000001e-06, "loss": 0.0, "step": 128 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.361114501953125, "epoch": 0.3225, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 6.800000000000001e-06, "loss": 0.0, "num_tokens": 1392640.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 129 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358340382575989, "epoch": 0.325, "grad_norm": 0.0, "learning_rate": 6.775e-06, "loss": 0.0, "step": 130 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.353169202804565, "epoch": 0.3275, "grad_norm": 0.0, "learning_rate": 6.750000000000001e-06, "loss": 0.0, "step": 131 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357048511505127, "epoch": 0.33, "grad_norm": 0.0, "learning_rate": 6.725000000000001e-06, "loss": 0.0, "step": 132 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35649573802948, "epoch": 0.3325, "grad_norm": 0.0, "learning_rate": 6.700000000000001e-06, "loss": 0.0, "step": 133 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358709454536438, "epoch": 0.335, "grad_norm": 0.0, "learning_rate": 6.6750000000000005e-06, "loss": 0.0, "step": 134 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363331317901611, "epoch": 0.3375, "grad_norm": 0.0, "learning_rate": 6.650000000000001e-06, "loss": 0.0, "step": 135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.348363399505615, "epoch": 0.34, "grad_norm": 0.0, "learning_rate": 6.625e-06, "loss": 0.0, "step": 136 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.358344316482544, "epoch": 0.3425, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 6.600000000000001e-06, "loss": 0.0, "num_tokens": 1474560.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 137 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356676459312439, "epoch": 0.345, "grad_norm": 0.0, "learning_rate": 6.5750000000000006e-06, "loss": 0.0, "step": 138 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352797508239746, "epoch": 0.3475, "grad_norm": 0.0, "learning_rate": 6.550000000000001e-06, "loss": 0.0, "step": 139 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.349105596542358, "epoch": 0.35, "grad_norm": 0.0, "learning_rate": 6.525e-06, "loss": 0.0, "step": 140 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357233166694641, "epoch": 0.3525, "grad_norm": 0.0, "learning_rate": 6.5000000000000004e-06, "loss": 0.0, "step": 141 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363148212432861, "epoch": 0.355, "grad_norm": 0.0, "learning_rate": 6.475e-06, "loss": 0.0, "step": 142 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35871422290802, "epoch": 0.3575, "grad_norm": 0.0, "learning_rate": 6.450000000000001e-06, "loss": 0.0, "step": 143 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.360373854637146, "epoch": 0.36, "grad_norm": 0.0, "learning_rate": 6.425e-06, "loss": 0.0, "step": 144 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.357598543167114, "epoch": 0.3625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 6.4000000000000006e-06, "loss": 0.0, "num_tokens": 1556480.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3570393323898315, "epoch": 0.365, "grad_norm": 0.0, "learning_rate": 6.375e-06, "loss": 0.0, "step": 146 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.346142292022705, "epoch": 0.3675, "grad_norm": 0.0, "learning_rate": 6.35e-06, "loss": 0.0, "step": 147 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3601826429367065, "epoch": 0.37, "grad_norm": 0.0, "learning_rate": 6.3250000000000004e-06, "loss": 0.0, "step": 148 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357412576675415, "epoch": 0.3725, "grad_norm": 0.0, "learning_rate": 6.300000000000001e-06, "loss": 0.0, "step": 149 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355007290840149, "epoch": 0.375, "grad_norm": 0.0, "learning_rate": 6.275e-06, "loss": 0.0, "step": 150 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362216234207153, "epoch": 0.3775, "grad_norm": 0.0, "learning_rate": 6.25e-06, "loss": 0.0, "step": 151 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.360553860664368, "epoch": 0.38, "grad_norm": 0.0, "learning_rate": 6.225000000000001e-06, "loss": 0.0, "step": 152 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.365534067153931, "epoch": 0.3825, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 6.200000000000001e-06, "loss": 0.0, "num_tokens": 1638400.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 153 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357408404350281, "epoch": 0.385, "grad_norm": 0.0, "learning_rate": 6.175000000000001e-06, "loss": 0.0, "step": 154 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355557084083557, "epoch": 0.3875, "grad_norm": 0.0, "learning_rate": 6.15e-06, "loss": 0.0, "step": 155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3555556535720825, "epoch": 0.39, "grad_norm": 0.0, "learning_rate": 6.125000000000001e-06, "loss": 0.0, "step": 156 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.351309895515442, "epoch": 0.3925, "grad_norm": 0.0, "learning_rate": 6.1e-06, "loss": 0.0, "step": 157 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.364061713218689, "epoch": 0.395, "grad_norm": 0.0, "learning_rate": 6.075000000000001e-06, "loss": 0.0, "step": 158 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352782487869263, "epoch": 0.3975, "grad_norm": 0.0, "learning_rate": 6.0500000000000005e-06, "loss": 0.0, "step": 159 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.362393140792847, "epoch": 0.4, "grad_norm": 0.0, "learning_rate": 6.025000000000001e-06, "loss": 0.0, "step": 160 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.353896856307983, "epoch": 0.4025, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 6e-06, "loss": 0.0, "num_tokens": 1720320.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 161 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363700032234192, "epoch": 0.405, "grad_norm": 0.0, "learning_rate": 5.975e-06, "loss": 0.0, "step": 162 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356860876083374, "epoch": 0.4075, "grad_norm": 0.0, "learning_rate": 5.950000000000001e-06, "loss": 0.0, "step": 163 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355201363563538, "epoch": 0.41, "grad_norm": 0.0, "learning_rate": 5.925000000000001e-06, "loss": 0.0, "step": 164 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35501492023468, "epoch": 0.4125, "grad_norm": 0.0, "learning_rate": 5.9e-06, "loss": 0.0, "step": 165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.349655389785767, "epoch": 0.415, "grad_norm": 0.0, "learning_rate": 5.8750000000000005e-06, "loss": 0.0, "step": 166 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356123208999634, "epoch": 0.4175, "grad_norm": 0.0, "learning_rate": 5.85e-06, "loss": 0.0, "step": 167 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.360193133354187, "epoch": 0.42, "grad_norm": 0.0, "learning_rate": 5.825000000000001e-06, "loss": 0.0, "step": 168 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.350937485694885, "epoch": 0.4225, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 5.8e-06, "loss": 0.0, "num_tokens": 1802240.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 169 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3575849533081055, "epoch": 0.425, "grad_norm": 0.0, "learning_rate": 5.775000000000001e-06, "loss": 0.0, "step": 170 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35370945930481, "epoch": 0.4275, "grad_norm": 0.0, "learning_rate": 5.75e-06, "loss": 0.0, "step": 171 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3507561683654785, "epoch": 0.43, "grad_norm": 0.0, "learning_rate": 5.725e-06, "loss": 0.0, "step": 172 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35998797416687, "epoch": 0.4325, "grad_norm": 0.0, "learning_rate": 5.7e-06, "loss": 0.0, "step": 173 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.358882784843445, "epoch": 0.435, "grad_norm": 0.0, "learning_rate": 5.675000000000001e-06, "loss": 0.0, "step": 174 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.359807848930359, "epoch": 0.4375, "grad_norm": 0.0, "learning_rate": 5.65e-06, "loss": 0.0, "step": 175 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.364059567451477, "epoch": 0.44, "grad_norm": 0.0, "learning_rate": 5.625e-06, "loss": 0.0, "step": 176 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.354447245597839, "epoch": 0.4425, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 5.600000000000001e-06, "loss": 0.0, "num_tokens": 1884160.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 177 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.35500431060791, "epoch": 0.445, "grad_norm": 0.0, "learning_rate": 5.575000000000001e-06, "loss": 0.0, "step": 178 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363319993019104, "epoch": 0.4475, "grad_norm": 0.0, "learning_rate": 5.550000000000001e-06, "loss": 0.0, "step": 179 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3551894426345825, "epoch": 0.45, "grad_norm": 0.0, "learning_rate": 5.5250000000000005e-06, "loss": 0.0, "step": 180 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355369210243225, "epoch": 0.4525, "grad_norm": 0.0, "learning_rate": 5.500000000000001e-06, "loss": 0.0, "step": 181 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352790117263794, "epoch": 0.455, "grad_norm": 0.0, "learning_rate": 5.475e-06, "loss": 0.0, "step": 182 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3614726066589355, "epoch": 0.4575, "grad_norm": 0.0, "learning_rate": 5.450000000000001e-06, "loss": 0.0, "step": 183 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361098766326904, "epoch": 0.46, "grad_norm": 0.0, "learning_rate": 5.4250000000000006e-06, "loss": 0.0, "step": 184 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.351694226264954, "epoch": 0.4625, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 5.400000000000001e-06, "loss": 0.0, "num_tokens": 1966080.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.356864809989929, "epoch": 0.465, "grad_norm": 0.0, "learning_rate": 5.375e-06, "loss": 0.0, "step": 186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.361114978790283, "epoch": 0.4675, "grad_norm": 0.0, "learning_rate": 5.3500000000000004e-06, "loss": 0.0, "step": 187 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.352982759475708, "epoch": 0.47, "grad_norm": 0.0, "learning_rate": 5.325e-06, "loss": 0.0, "step": 188 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.357232093811035, "epoch": 0.4725, "grad_norm": 0.0, "learning_rate": 5.300000000000001e-06, "loss": 0.0, "step": 189 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355199456214905, "epoch": 0.475, "grad_norm": 0.0, "learning_rate": 5.275e-06, "loss": 0.0, "step": 190 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3581565618515015, "epoch": 0.4775, "grad_norm": 0.0, "learning_rate": 5.2500000000000006e-06, "loss": 0.0, "step": 191 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.353541254997253, "epoch": 0.48, "grad_norm": 0.0, "learning_rate": 5.225e-06, "loss": 0.0, "step": 192 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 7.351318120956421, "epoch": 0.4825, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 5.2e-06, "loss": 0.0, "num_tokens": 2048000.0, "reward": 0.0, "reward_std": 0.0, "rewards/reward_action_type/mean": 0.0, "rewards/reward_action_type/std": 0.0, "rewards/reward_final_answer_f1/mean": 0.0, "rewards/reward_final_answer_f1/std": 0.0, "rewards/reward_tool_exact/mean": 0.0, "rewards/reward_tool_exact/std": 0.0, "step": 193 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.355379819869995, "epoch": 0.485, "grad_norm": 0.0, "learning_rate": 5.1750000000000004e-06, "loss": 0.0, "step": 194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354274749755859, "epoch": 0.4875, "grad_norm": 0.0, "learning_rate": 5.150000000000001e-06, "loss": 0.0, "step": 195 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3535319566726685, "epoch": 0.49, "grad_norm": 0.0, "learning_rate": 5.125e-06, "loss": 0.0, "step": 196 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.3544546365737915, "epoch": 0.4925, "grad_norm": 0.0, "learning_rate": 5.1e-06, "loss": 0.0, "step": 197 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.363884687423706, "epoch": 0.495, "grad_norm": 0.0, "learning_rate": 5.075e-06, "loss": 0.0, "step": 198 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.354459643363953, "epoch": 0.4975, "grad_norm": 0.0, "learning_rate": 5.050000000000001e-06, "loss": 0.0, "step": 199 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "entropy": 7.364799976348877, "epoch": 0.5, "grad_norm": 0.0, "learning_rate": 5.025e-06, "loss": 0.0, "step": 200 } ], "logging_steps": 1, "max_steps": 400, "num_input_tokens_seen": 2048000, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }