ajChakrarborty's picture
Upload folder using huggingface_hub
672c84f verified
Raw
History Blame Contribute Delete
87 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.5,
"eval_steps": 500,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.369438529014587,
"epoch": 0.0025,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 1e-05,
"loss": 0.0,
"num_tokens": 81920.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361862421035767,
"epoch": 0.005,
"grad_norm": 0.0,
"learning_rate": 9.975000000000002e-06,
"loss": 0.0,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35631263256073,
"epoch": 0.0075,
"grad_norm": 0.0,
"learning_rate": 9.950000000000001e-06,
"loss": 0.0,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358352303504944,
"epoch": 0.01,
"grad_norm": 0.0,
"learning_rate": 9.925e-06,
"loss": 0.0,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3544700145721436,
"epoch": 0.0125,
"grad_norm": 0.0,
"learning_rate": 9.9e-06,
"loss": 0.0,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.359458684921265,
"epoch": 0.015,
"grad_norm": 0.0,
"learning_rate": 9.875000000000001e-06,
"loss": 0.0,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358532786369324,
"epoch": 0.0175,
"grad_norm": 0.0,
"learning_rate": 9.85e-06,
"loss": 0.0,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.359454154968262,
"epoch": 0.02,
"grad_norm": 0.0,
"learning_rate": 9.825000000000002e-06,
"loss": 0.0,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.357772588729858,
"epoch": 0.0225,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 9.800000000000001e-06,
"loss": 0.0,
"num_tokens": 163840.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354452610015869,
"epoch": 0.025,
"grad_norm": 0.0,
"learning_rate": 9.775e-06,
"loss": 0.0,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362765550613403,
"epoch": 0.0275,
"grad_norm": 0.0,
"learning_rate": 9.75e-06,
"loss": 0.0,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.349831581115723,
"epoch": 0.03,
"grad_norm": 0.0,
"learning_rate": 9.725000000000001e-06,
"loss": 0.0,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361098527908325,
"epoch": 0.0325,
"grad_norm": 0.0,
"learning_rate": 9.7e-06,
"loss": 0.0,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361657619476318,
"epoch": 0.035,
"grad_norm": 0.0,
"learning_rate": 9.675000000000001e-06,
"loss": 0.0,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358333349227905,
"epoch": 0.0375,
"grad_norm": 0.0,
"learning_rate": 9.65e-06,
"loss": 0.0,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361846923828125,
"epoch": 0.04,
"grad_norm": 0.0,
"learning_rate": 9.625e-06,
"loss": 0.0,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.353164434432983,
"epoch": 0.0425,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 9.600000000000001e-06,
"loss": 0.0,
"num_tokens": 245760.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355193018913269,
"epoch": 0.045,
"grad_norm": 0.0,
"learning_rate": 9.575e-06,
"loss": 0.0,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355559706687927,
"epoch": 0.0475,
"grad_norm": 0.0,
"learning_rate": 9.55e-06,
"loss": 0.0,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358516216278076,
"epoch": 0.05,
"grad_norm": 0.0,
"learning_rate": 9.525000000000001e-06,
"loss": 0.0,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362407088279724,
"epoch": 0.0525,
"grad_norm": 0.0,
"learning_rate": 9.5e-06,
"loss": 0.0,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3559370040893555,
"epoch": 0.055,
"grad_norm": 0.0,
"learning_rate": 9.475000000000002e-06,
"loss": 0.0,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355936765670776,
"epoch": 0.0575,
"grad_norm": 0.0,
"learning_rate": 9.450000000000001e-06,
"loss": 0.0,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.367756128311157,
"epoch": 0.06,
"grad_norm": 0.0,
"learning_rate": 9.425e-06,
"loss": 0.0,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.359081983566284,
"epoch": 0.0625,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 9.4e-06,
"loss": 0.0,
"num_tokens": 327680.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.359453916549683,
"epoch": 0.065,
"grad_norm": 0.0,
"learning_rate": 9.375000000000001e-06,
"loss": 0.0,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357423901557922,
"epoch": 0.0675,
"grad_norm": 0.0,
"learning_rate": 9.350000000000002e-06,
"loss": 0.0,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362042188644409,
"epoch": 0.07,
"grad_norm": 0.0,
"learning_rate": 9.325000000000001e-06,
"loss": 0.0,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358163237571716,
"epoch": 0.0725,
"grad_norm": 0.0,
"learning_rate": 9.3e-06,
"loss": 0.0,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357796311378479,
"epoch": 0.075,
"grad_norm": 0.0,
"learning_rate": 9.275e-06,
"loss": 0.0,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.360013961791992,
"epoch": 0.0775,
"grad_norm": 0.0,
"learning_rate": 9.250000000000001e-06,
"loss": 0.0,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354282975196838,
"epoch": 0.08,
"grad_norm": 0.0,
"learning_rate": 9.225e-06,
"loss": 0.0,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.358327150344849,
"epoch": 0.0825,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 9.200000000000002e-06,
"loss": 0.0,
"num_tokens": 409600.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363318681716919,
"epoch": 0.085,
"grad_norm": 0.0,
"learning_rate": 9.175000000000001e-06,
"loss": 0.0,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352967858314514,
"epoch": 0.0875,
"grad_norm": 0.0,
"learning_rate": 9.15e-06,
"loss": 0.0,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3574066162109375,
"epoch": 0.09,
"grad_norm": 0.0,
"learning_rate": 9.125e-06,
"loss": 0.0,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357410788536072,
"epoch": 0.0925,
"grad_norm": 0.0,
"learning_rate": 9.100000000000001e-06,
"loss": 0.0,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354451537132263,
"epoch": 0.095,
"grad_norm": 0.0,
"learning_rate": 9.075e-06,
"loss": 0.0,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.365721702575684,
"epoch": 0.0975,
"grad_norm": 0.0,
"learning_rate": 9.050000000000001e-06,
"loss": 0.0,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.348904967308044,
"epoch": 0.1,
"grad_norm": 0.0,
"learning_rate": 9.025e-06,
"loss": 0.0,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.357222557067871,
"epoch": 0.1025,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 9e-06,
"loss": 0.0,
"num_tokens": 491520.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355740547180176,
"epoch": 0.105,
"grad_norm": 0.0,
"learning_rate": 8.975e-06,
"loss": 0.0,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.34890341758728,
"epoch": 0.1075,
"grad_norm": 0.0,
"learning_rate": 8.95e-06,
"loss": 0.0,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356113791465759,
"epoch": 0.11,
"grad_norm": 0.0,
"learning_rate": 8.925e-06,
"loss": 0.0,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355374813079834,
"epoch": 0.1125,
"grad_norm": 0.0,
"learning_rate": 8.900000000000001e-06,
"loss": 0.0,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3614726066589355,
"epoch": 0.115,
"grad_norm": 0.0,
"learning_rate": 8.875e-06,
"loss": 0.0,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.359627962112427,
"epoch": 0.1175,
"grad_norm": 0.0,
"learning_rate": 8.85e-06,
"loss": 0.0,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355189919471741,
"epoch": 0.12,
"grad_norm": 0.0,
"learning_rate": 8.825000000000001e-06,
"loss": 0.0,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.357407331466675,
"epoch": 0.1225,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 8.8e-06,
"loss": 0.0,
"num_tokens": 573440.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.351681590080261,
"epoch": 0.125,
"grad_norm": 0.0,
"learning_rate": 8.775e-06,
"loss": 0.0,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354265213012695,
"epoch": 0.1275,
"grad_norm": 0.0,
"learning_rate": 8.750000000000001e-06,
"loss": 0.0,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.351495146751404,
"epoch": 0.13,
"grad_norm": 0.0,
"learning_rate": 8.725000000000002e-06,
"loss": 0.0,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.349096179008484,
"epoch": 0.1325,
"grad_norm": 0.0,
"learning_rate": 8.700000000000001e-06,
"loss": 0.0,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354640483856201,
"epoch": 0.135,
"grad_norm": 0.0,
"learning_rate": 8.675e-06,
"loss": 0.0,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352414965629578,
"epoch": 0.1375,
"grad_norm": 0.0,
"learning_rate": 8.65e-06,
"loss": 0.0,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.351497530937195,
"epoch": 0.14,
"grad_norm": 0.0,
"learning_rate": 8.625000000000001e-06,
"loss": 0.0,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.35981810092926,
"epoch": 0.1425,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 8.6e-06,
"loss": 0.0,
"num_tokens": 655360.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358149290084839,
"epoch": 0.145,
"grad_norm": 0.0,
"learning_rate": 8.575000000000002e-06,
"loss": 0.0,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.353531837463379,
"epoch": 0.1475,
"grad_norm": 0.0,
"learning_rate": 8.550000000000001e-06,
"loss": 0.0,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357410669326782,
"epoch": 0.15,
"grad_norm": 0.0,
"learning_rate": 8.525e-06,
"loss": 0.0,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362405300140381,
"epoch": 0.1525,
"grad_norm": 0.0,
"learning_rate": 8.5e-06,
"loss": 0.0,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354081869125366,
"epoch": 0.155,
"grad_norm": 0.0,
"learning_rate": 8.475000000000001e-06,
"loss": 0.0,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356305956840515,
"epoch": 0.1575,
"grad_norm": 0.0,
"learning_rate": 8.45e-06,
"loss": 0.0,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354457974433899,
"epoch": 0.16,
"grad_norm": 0.0,
"learning_rate": 8.425000000000001e-06,
"loss": 0.0,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.361861705780029,
"epoch": 0.1625,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 8.400000000000001e-06,
"loss": 0.0,
"num_tokens": 737280.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.353907465934753,
"epoch": 0.165,
"grad_norm": 0.0,
"learning_rate": 8.375e-06,
"loss": 0.0,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352243661880493,
"epoch": 0.1675,
"grad_norm": 0.0,
"learning_rate": 8.35e-06,
"loss": 0.0,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357968091964722,
"epoch": 0.17,
"grad_norm": 0.0,
"learning_rate": 8.325e-06,
"loss": 0.0,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354275941848755,
"epoch": 0.1725,
"grad_norm": 0.0,
"learning_rate": 8.3e-06,
"loss": 0.0,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.353910565376282,
"epoch": 0.175,
"grad_norm": 0.0,
"learning_rate": 8.275000000000001e-06,
"loss": 0.0,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358715772628784,
"epoch": 0.1775,
"grad_norm": 0.0,
"learning_rate": 8.25e-06,
"loss": 0.0,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357971787452698,
"epoch": 0.18,
"grad_norm": 0.0,
"learning_rate": 8.225e-06,
"loss": 0.0,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.350202202796936,
"epoch": 0.1825,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 8.2e-06,
"loss": 0.0,
"num_tokens": 819200.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.359816074371338,
"epoch": 0.185,
"grad_norm": 0.0,
"learning_rate": 8.175e-06,
"loss": 0.0,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356489419937134,
"epoch": 0.1875,
"grad_norm": 0.0,
"learning_rate": 8.15e-06,
"loss": 0.0,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354463458061218,
"epoch": 0.19,
"grad_norm": 0.0,
"learning_rate": 8.125000000000001e-06,
"loss": 0.0,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3553794622421265,
"epoch": 0.1925,
"grad_norm": 0.0,
"learning_rate": 8.1e-06,
"loss": 0.0,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355569362640381,
"epoch": 0.195,
"grad_norm": 0.0,
"learning_rate": 8.075000000000001e-06,
"loss": 0.0,
"step": 78
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3505799770355225,
"epoch": 0.1975,
"grad_norm": 0.0,
"learning_rate": 8.050000000000001e-06,
"loss": 0.0,
"step": 79
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355196475982666,
"epoch": 0.2,
"grad_norm": 0.0,
"learning_rate": 8.025e-06,
"loss": 0.0,
"step": 80
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.363699555397034,
"epoch": 0.2025,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 8.000000000000001e-06,
"loss": 0.0,
"num_tokens": 901120.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 81
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361477255821228,
"epoch": 0.205,
"grad_norm": 0.0,
"learning_rate": 7.975e-06,
"loss": 0.0,
"step": 82
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.349467039108276,
"epoch": 0.2075,
"grad_norm": 0.0,
"learning_rate": 7.950000000000002e-06,
"loss": 0.0,
"step": 83
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35796594619751,
"epoch": 0.21,
"grad_norm": 0.0,
"learning_rate": 7.925000000000001e-06,
"loss": 0.0,
"step": 84
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356119871139526,
"epoch": 0.2125,
"grad_norm": 0.0,
"learning_rate": 7.9e-06,
"loss": 0.0,
"step": 85
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362959980964661,
"epoch": 0.215,
"grad_norm": 0.0,
"learning_rate": 7.875e-06,
"loss": 0.0,
"step": 86
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358152985572815,
"epoch": 0.2175,
"grad_norm": 0.0,
"learning_rate": 7.850000000000001e-06,
"loss": 0.0,
"step": 87
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.351126432418823,
"epoch": 0.22,
"grad_norm": 0.0,
"learning_rate": 7.825e-06,
"loss": 0.0,
"step": 88
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.353165030479431,
"epoch": 0.2225,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 7.800000000000002e-06,
"loss": 0.0,
"num_tokens": 983040.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 89
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3511306047439575,
"epoch": 0.225,
"grad_norm": 0.0,
"learning_rate": 7.775000000000001e-06,
"loss": 0.0,
"step": 90
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358151316642761,
"epoch": 0.2275,
"grad_norm": 0.0,
"learning_rate": 7.75e-06,
"loss": 0.0,
"step": 91
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.360924482345581,
"epoch": 0.23,
"grad_norm": 0.0,
"learning_rate": 7.725e-06,
"loss": 0.0,
"step": 92
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354089617729187,
"epoch": 0.2325,
"grad_norm": 0.0,
"learning_rate": 7.7e-06,
"loss": 0.0,
"step": 93
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.364252090454102,
"epoch": 0.235,
"grad_norm": 0.0,
"learning_rate": 7.675e-06,
"loss": 0.0,
"step": 94
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3596354722976685,
"epoch": 0.2375,
"grad_norm": 0.0,
"learning_rate": 7.650000000000001e-06,
"loss": 0.0,
"step": 95
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.353907585144043,
"epoch": 0.24,
"grad_norm": 0.0,
"learning_rate": 7.625e-06,
"loss": 0.0,
"step": 96
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.352238178253174,
"epoch": 0.2425,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 7.600000000000001e-06,
"loss": 0.0,
"num_tokens": 1064960.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 97
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356118559837341,
"epoch": 0.245,
"grad_norm": 0.0,
"learning_rate": 7.575e-06,
"loss": 0.0,
"step": 98
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.350016474723816,
"epoch": 0.2475,
"grad_norm": 0.0,
"learning_rate": 7.5500000000000006e-06,
"loss": 0.0,
"step": 99
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356671094894409,
"epoch": 0.25,
"grad_norm": 0.0,
"learning_rate": 7.525e-06,
"loss": 0.0,
"step": 100
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358888626098633,
"epoch": 0.2525,
"grad_norm": 0.0,
"learning_rate": 7.500000000000001e-06,
"loss": 0.0,
"step": 101
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356119871139526,
"epoch": 0.255,
"grad_norm": 0.0,
"learning_rate": 7.475000000000001e-06,
"loss": 0.0,
"step": 102
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354820370674133,
"epoch": 0.2575,
"grad_norm": 0.0,
"learning_rate": 7.450000000000001e-06,
"loss": 0.0,
"step": 103
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35278582572937,
"epoch": 0.26,
"grad_norm": 0.0,
"learning_rate": 7.425000000000001e-06,
"loss": 0.0,
"step": 104
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.361664414405823,
"epoch": 0.2625,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 7.4e-06,
"loss": 0.0,
"num_tokens": 1146880.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362587094306946,
"epoch": 0.265,
"grad_norm": 0.0,
"learning_rate": 7.375000000000001e-06,
"loss": 0.0,
"step": 106
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361659288406372,
"epoch": 0.2675,
"grad_norm": 0.0,
"learning_rate": 7.350000000000001e-06,
"loss": 0.0,
"step": 107
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35519552230835,
"epoch": 0.27,
"grad_norm": 0.0,
"learning_rate": 7.325000000000001e-06,
"loss": 0.0,
"step": 108
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3592623472213745,
"epoch": 0.2725,
"grad_norm": 0.0,
"learning_rate": 7.3e-06,
"loss": 0.0,
"step": 109
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.36148202419281,
"epoch": 0.275,
"grad_norm": 0.0,
"learning_rate": 7.275000000000001e-06,
"loss": 0.0,
"step": 110
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361296892166138,
"epoch": 0.2775,
"grad_norm": 0.0,
"learning_rate": 7.25e-06,
"loss": 0.0,
"step": 111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355571746826172,
"epoch": 0.28,
"grad_norm": 0.0,
"learning_rate": 7.225000000000001e-06,
"loss": 0.0,
"step": 112
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.3522549867630005,
"epoch": 0.2825,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 7.2000000000000005e-06,
"loss": 0.0,
"num_tokens": 1228800.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 113
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361860990524292,
"epoch": 0.285,
"grad_norm": 0.0,
"learning_rate": 7.175000000000001e-06,
"loss": 0.0,
"step": 114
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357979655265808,
"epoch": 0.2875,
"grad_norm": 0.0,
"learning_rate": 7.15e-06,
"loss": 0.0,
"step": 115
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363341808319092,
"epoch": 0.29,
"grad_norm": 0.0,
"learning_rate": 7.125e-06,
"loss": 0.0,
"step": 116
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35871422290802,
"epoch": 0.2925,
"grad_norm": 0.0,
"learning_rate": 7.100000000000001e-06,
"loss": 0.0,
"step": 117
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356124520301819,
"epoch": 0.295,
"grad_norm": 0.0,
"learning_rate": 7.075000000000001e-06,
"loss": 0.0,
"step": 118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3601953983306885,
"epoch": 0.2975,
"grad_norm": 0.0,
"learning_rate": 7.05e-06,
"loss": 0.0,
"step": 119
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.36924946308136,
"epoch": 0.3,
"grad_norm": 0.0,
"learning_rate": 7.0250000000000005e-06,
"loss": 0.0,
"step": 120
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.3561201095581055,
"epoch": 0.3025,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 7e-06,
"loss": 0.0,
"num_tokens": 1310720.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 121
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357042670249939,
"epoch": 0.305,
"grad_norm": 0.0,
"learning_rate": 6.975000000000001e-06,
"loss": 0.0,
"step": 122
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358524203300476,
"epoch": 0.3075,
"grad_norm": 0.0,
"learning_rate": 6.95e-06,
"loss": 0.0,
"step": 123
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.360369324684143,
"epoch": 0.31,
"grad_norm": 0.0,
"learning_rate": 6.925000000000001e-06,
"loss": 0.0,
"step": 124
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357417345046997,
"epoch": 0.3125,
"grad_norm": 0.0,
"learning_rate": 6.9e-06,
"loss": 0.0,
"step": 125
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356303572654724,
"epoch": 0.315,
"grad_norm": 0.0,
"learning_rate": 6.875e-06,
"loss": 0.0,
"step": 126
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354269742965698,
"epoch": 0.3175,
"grad_norm": 0.0,
"learning_rate": 6.850000000000001e-06,
"loss": 0.0,
"step": 127
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352428197860718,
"epoch": 0.32,
"grad_norm": 0.0,
"learning_rate": 6.825000000000001e-06,
"loss": 0.0,
"step": 128
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.361114501953125,
"epoch": 0.3225,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 6.800000000000001e-06,
"loss": 0.0,
"num_tokens": 1392640.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 129
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358340382575989,
"epoch": 0.325,
"grad_norm": 0.0,
"learning_rate": 6.775e-06,
"loss": 0.0,
"step": 130
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.353169202804565,
"epoch": 0.3275,
"grad_norm": 0.0,
"learning_rate": 6.750000000000001e-06,
"loss": 0.0,
"step": 131
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357048511505127,
"epoch": 0.33,
"grad_norm": 0.0,
"learning_rate": 6.725000000000001e-06,
"loss": 0.0,
"step": 132
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35649573802948,
"epoch": 0.3325,
"grad_norm": 0.0,
"learning_rate": 6.700000000000001e-06,
"loss": 0.0,
"step": 133
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358709454536438,
"epoch": 0.335,
"grad_norm": 0.0,
"learning_rate": 6.6750000000000005e-06,
"loss": 0.0,
"step": 134
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363331317901611,
"epoch": 0.3375,
"grad_norm": 0.0,
"learning_rate": 6.650000000000001e-06,
"loss": 0.0,
"step": 135
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.348363399505615,
"epoch": 0.34,
"grad_norm": 0.0,
"learning_rate": 6.625e-06,
"loss": 0.0,
"step": 136
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.358344316482544,
"epoch": 0.3425,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 6.600000000000001e-06,
"loss": 0.0,
"num_tokens": 1474560.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 137
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356676459312439,
"epoch": 0.345,
"grad_norm": 0.0,
"learning_rate": 6.5750000000000006e-06,
"loss": 0.0,
"step": 138
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352797508239746,
"epoch": 0.3475,
"grad_norm": 0.0,
"learning_rate": 6.550000000000001e-06,
"loss": 0.0,
"step": 139
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.349105596542358,
"epoch": 0.35,
"grad_norm": 0.0,
"learning_rate": 6.525e-06,
"loss": 0.0,
"step": 140
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357233166694641,
"epoch": 0.3525,
"grad_norm": 0.0,
"learning_rate": 6.5000000000000004e-06,
"loss": 0.0,
"step": 141
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363148212432861,
"epoch": 0.355,
"grad_norm": 0.0,
"learning_rate": 6.475e-06,
"loss": 0.0,
"step": 142
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35871422290802,
"epoch": 0.3575,
"grad_norm": 0.0,
"learning_rate": 6.450000000000001e-06,
"loss": 0.0,
"step": 143
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.360373854637146,
"epoch": 0.36,
"grad_norm": 0.0,
"learning_rate": 6.425e-06,
"loss": 0.0,
"step": 144
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.357598543167114,
"epoch": 0.3625,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 6.4000000000000006e-06,
"loss": 0.0,
"num_tokens": 1556480.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3570393323898315,
"epoch": 0.365,
"grad_norm": 0.0,
"learning_rate": 6.375e-06,
"loss": 0.0,
"step": 146
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.346142292022705,
"epoch": 0.3675,
"grad_norm": 0.0,
"learning_rate": 6.35e-06,
"loss": 0.0,
"step": 147
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3601826429367065,
"epoch": 0.37,
"grad_norm": 0.0,
"learning_rate": 6.3250000000000004e-06,
"loss": 0.0,
"step": 148
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357412576675415,
"epoch": 0.3725,
"grad_norm": 0.0,
"learning_rate": 6.300000000000001e-06,
"loss": 0.0,
"step": 149
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355007290840149,
"epoch": 0.375,
"grad_norm": 0.0,
"learning_rate": 6.275e-06,
"loss": 0.0,
"step": 150
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362216234207153,
"epoch": 0.3775,
"grad_norm": 0.0,
"learning_rate": 6.25e-06,
"loss": 0.0,
"step": 151
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.360553860664368,
"epoch": 0.38,
"grad_norm": 0.0,
"learning_rate": 6.225000000000001e-06,
"loss": 0.0,
"step": 152
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.365534067153931,
"epoch": 0.3825,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 6.200000000000001e-06,
"loss": 0.0,
"num_tokens": 1638400.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 153
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357408404350281,
"epoch": 0.385,
"grad_norm": 0.0,
"learning_rate": 6.175000000000001e-06,
"loss": 0.0,
"step": 154
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355557084083557,
"epoch": 0.3875,
"grad_norm": 0.0,
"learning_rate": 6.15e-06,
"loss": 0.0,
"step": 155
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3555556535720825,
"epoch": 0.39,
"grad_norm": 0.0,
"learning_rate": 6.125000000000001e-06,
"loss": 0.0,
"step": 156
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.351309895515442,
"epoch": 0.3925,
"grad_norm": 0.0,
"learning_rate": 6.1e-06,
"loss": 0.0,
"step": 157
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.364061713218689,
"epoch": 0.395,
"grad_norm": 0.0,
"learning_rate": 6.075000000000001e-06,
"loss": 0.0,
"step": 158
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352782487869263,
"epoch": 0.3975,
"grad_norm": 0.0,
"learning_rate": 6.0500000000000005e-06,
"loss": 0.0,
"step": 159
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.362393140792847,
"epoch": 0.4,
"grad_norm": 0.0,
"learning_rate": 6.025000000000001e-06,
"loss": 0.0,
"step": 160
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.353896856307983,
"epoch": 0.4025,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 6e-06,
"loss": 0.0,
"num_tokens": 1720320.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 161
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363700032234192,
"epoch": 0.405,
"grad_norm": 0.0,
"learning_rate": 5.975e-06,
"loss": 0.0,
"step": 162
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356860876083374,
"epoch": 0.4075,
"grad_norm": 0.0,
"learning_rate": 5.950000000000001e-06,
"loss": 0.0,
"step": 163
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355201363563538,
"epoch": 0.41,
"grad_norm": 0.0,
"learning_rate": 5.925000000000001e-06,
"loss": 0.0,
"step": 164
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35501492023468,
"epoch": 0.4125,
"grad_norm": 0.0,
"learning_rate": 5.9e-06,
"loss": 0.0,
"step": 165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.349655389785767,
"epoch": 0.415,
"grad_norm": 0.0,
"learning_rate": 5.8750000000000005e-06,
"loss": 0.0,
"step": 166
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356123208999634,
"epoch": 0.4175,
"grad_norm": 0.0,
"learning_rate": 5.85e-06,
"loss": 0.0,
"step": 167
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.360193133354187,
"epoch": 0.42,
"grad_norm": 0.0,
"learning_rate": 5.825000000000001e-06,
"loss": 0.0,
"step": 168
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.350937485694885,
"epoch": 0.4225,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 5.8e-06,
"loss": 0.0,
"num_tokens": 1802240.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 169
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3575849533081055,
"epoch": 0.425,
"grad_norm": 0.0,
"learning_rate": 5.775000000000001e-06,
"loss": 0.0,
"step": 170
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35370945930481,
"epoch": 0.4275,
"grad_norm": 0.0,
"learning_rate": 5.75e-06,
"loss": 0.0,
"step": 171
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3507561683654785,
"epoch": 0.43,
"grad_norm": 0.0,
"learning_rate": 5.725e-06,
"loss": 0.0,
"step": 172
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35998797416687,
"epoch": 0.4325,
"grad_norm": 0.0,
"learning_rate": 5.7e-06,
"loss": 0.0,
"step": 173
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.358882784843445,
"epoch": 0.435,
"grad_norm": 0.0,
"learning_rate": 5.675000000000001e-06,
"loss": 0.0,
"step": 174
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.359807848930359,
"epoch": 0.4375,
"grad_norm": 0.0,
"learning_rate": 5.65e-06,
"loss": 0.0,
"step": 175
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.364059567451477,
"epoch": 0.44,
"grad_norm": 0.0,
"learning_rate": 5.625e-06,
"loss": 0.0,
"step": 176
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.354447245597839,
"epoch": 0.4425,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 5.600000000000001e-06,
"loss": 0.0,
"num_tokens": 1884160.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 177
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.35500431060791,
"epoch": 0.445,
"grad_norm": 0.0,
"learning_rate": 5.575000000000001e-06,
"loss": 0.0,
"step": 178
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363319993019104,
"epoch": 0.4475,
"grad_norm": 0.0,
"learning_rate": 5.550000000000001e-06,
"loss": 0.0,
"step": 179
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3551894426345825,
"epoch": 0.45,
"grad_norm": 0.0,
"learning_rate": 5.5250000000000005e-06,
"loss": 0.0,
"step": 180
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355369210243225,
"epoch": 0.4525,
"grad_norm": 0.0,
"learning_rate": 5.500000000000001e-06,
"loss": 0.0,
"step": 181
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352790117263794,
"epoch": 0.455,
"grad_norm": 0.0,
"learning_rate": 5.475e-06,
"loss": 0.0,
"step": 182
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3614726066589355,
"epoch": 0.4575,
"grad_norm": 0.0,
"learning_rate": 5.450000000000001e-06,
"loss": 0.0,
"step": 183
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361098766326904,
"epoch": 0.46,
"grad_norm": 0.0,
"learning_rate": 5.4250000000000006e-06,
"loss": 0.0,
"step": 184
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.351694226264954,
"epoch": 0.4625,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 5.400000000000001e-06,
"loss": 0.0,
"num_tokens": 1966080.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.356864809989929,
"epoch": 0.465,
"grad_norm": 0.0,
"learning_rate": 5.375e-06,
"loss": 0.0,
"step": 186
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.361114978790283,
"epoch": 0.4675,
"grad_norm": 0.0,
"learning_rate": 5.3500000000000004e-06,
"loss": 0.0,
"step": 187
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.352982759475708,
"epoch": 0.47,
"grad_norm": 0.0,
"learning_rate": 5.325e-06,
"loss": 0.0,
"step": 188
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.357232093811035,
"epoch": 0.4725,
"grad_norm": 0.0,
"learning_rate": 5.300000000000001e-06,
"loss": 0.0,
"step": 189
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355199456214905,
"epoch": 0.475,
"grad_norm": 0.0,
"learning_rate": 5.275e-06,
"loss": 0.0,
"step": 190
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3581565618515015,
"epoch": 0.4775,
"grad_norm": 0.0,
"learning_rate": 5.2500000000000006e-06,
"loss": 0.0,
"step": 191
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.353541254997253,
"epoch": 0.48,
"grad_norm": 0.0,
"learning_rate": 5.225e-06,
"loss": 0.0,
"step": 192
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 512.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 512.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 512.0,
"completions/min_terminated_length": 0.0,
"entropy": 7.351318120956421,
"epoch": 0.4825,
"frac_reward_zero_std": 1.0,
"grad_norm": 0.0,
"learning_rate": 5.2e-06,
"loss": 0.0,
"num_tokens": 2048000.0,
"reward": 0.0,
"reward_std": 0.0,
"rewards/reward_action_type/mean": 0.0,
"rewards/reward_action_type/std": 0.0,
"rewards/reward_final_answer_f1/mean": 0.0,
"rewards/reward_final_answer_f1/std": 0.0,
"rewards/reward_tool_exact/mean": 0.0,
"rewards/reward_tool_exact/std": 0.0,
"step": 193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.355379819869995,
"epoch": 0.485,
"grad_norm": 0.0,
"learning_rate": 5.1750000000000004e-06,
"loss": 0.0,
"step": 194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354274749755859,
"epoch": 0.4875,
"grad_norm": 0.0,
"learning_rate": 5.150000000000001e-06,
"loss": 0.0,
"step": 195
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3535319566726685,
"epoch": 0.49,
"grad_norm": 0.0,
"learning_rate": 5.125e-06,
"loss": 0.0,
"step": 196
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.3544546365737915,
"epoch": 0.4925,
"grad_norm": 0.0,
"learning_rate": 5.1e-06,
"loss": 0.0,
"step": 197
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.363884687423706,
"epoch": 0.495,
"grad_norm": 0.0,
"learning_rate": 5.075e-06,
"loss": 0.0,
"step": 198
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.354459643363953,
"epoch": 0.4975,
"grad_norm": 0.0,
"learning_rate": 5.050000000000001e-06,
"loss": 0.0,
"step": 199
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"entropy": 7.364799976348877,
"epoch": 0.5,
"grad_norm": 0.0,
"learning_rate": 5.025e-06,
"loss": 0.0,
"step": 200
}
],
"logging_steps": 1,
"max_steps": 400,
"num_input_tokens_seen": 2048000,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}