{"timestamp_utc": "2026-04-12T15:25:26Z", "mode": "train", "global_step": 1, "epoch": 4.016548178495401e-05, "loss": 0.1191, "grad_norm": 10.253804206848145, "learning_rate": 1e-05, "num_tokens": 2463.0, "completions/mean_length": 121.875, "completions/min_length": 81.0, "completions/max_length": 160.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.875, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 160.0, "rewards/meter/mean": 0.42592284083366394, "rewards/meter/std": 0.33591756224632263, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9937220811843872, "rewards/repeat_penalty/std": 0.004517034627497196, "rewards/repeat_floor/mean": 0.9990583658218384, "rewards/repeat_floor/std": 0.0006775603396818042, "rewards/near_duplicate_penalty/mean": 0.9937220811843872, "rewards/near_duplicate_penalty/std": 0.004517034627497196, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15973103046417236, "rewards/total_composite/std": 0.12557268142700195, "reward": 0.15973103046417236, "reward_std": 0.12557268142700195, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2232884168624878, "sampling/sampling_logp_difference/max": 2.2234439849853516, "sampling/importance_sampling_ratio/min": 0.10823570936918259, "sampling/importance_sampling_ratio/mean": 1.0212712287902832, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.127237632870674, "clip_ratio/low_mean": 0.1246343944221735, "clip_ratio/low_min": 0.1246343944221735, "clip_ratio/high_mean": 0.08433323167264462, "clip_ratio/high_max": 0.08433323167264462, "clip_ratio/region_mean": 0.20896762609481812, "reward_total_mean": 0.15973103046417236, "reward_meter_mean": 0.42592284083366394, "reward_meter_std": 0.33591756224632263, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9937220811843872, "reward_repeat_penalty_std": 0.004517034627497196, "reward_repeat_floor_mean": 0.9990583658218384, "reward_repeat_floor_std": 0.0006775603396818042, "reward_near_duplicate_penalty_mean": 0.9937220811843872, "reward_near_duplicate_penalty_std": 0.004517034627497196, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.15973103046417236, "reward_total_composite_std": 0.12557268142700195, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 1.0} {"timestamp_utc": "2026-04-12T15:25:36Z", "mode": "train", "global_step": 2, "epoch": 8.033096356990803e-05, "loss": 0.0996, "grad_norm": 14.527668952941895, "learning_rate": 9.996969696969698e-06, "num_tokens": 4959.0, "completions/mean_length": 111.0, "completions/min_length": 96.0, "completions/max_length": 125.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.0, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.718535304069519, "rewards/meter/std": 0.17709191143512726, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.768750011920929, "rewards/judge_quality/std": 0.21767853200435638, "rewards/repeat_penalty/mean": 0.9838680028915405, "rewards/repeat_penalty/std": 0.006402861792594194, "rewards/repeat_floor/mean": 0.9975801706314087, "rewards/repeat_floor/std": 0.0009604145889170468, "rewards/near_duplicate_penalty/mean": 0.9838680028915405, "rewards/near_duplicate_penalty/std": 0.006402861792594194, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5599968433380127, "rewards/total_composite/std": 0.22703492641448975, "reward": 0.5599968433380127, "reward_std": 0.22703492641448975, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1736430674791336, "sampling/sampling_logp_difference/max": 3.8660693168640137, "sampling/importance_sampling_ratio/min": 0.020940518006682396, "sampling/importance_sampling_ratio/mean": 0.9950367212295532, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6591976061463356, "clip_ratio/low_mean": 0.06499460339546204, "clip_ratio/low_min": 0.06499460339546204, "clip_ratio/high_mean": 0.0667342699598521, "clip_ratio/high_max": 0.0667342699598521, "clip_ratio/region_mean": 0.13172887335531414, "reward_total_mean": 0.5599968433380127, "reward_meter_mean": 0.718535304069519, "reward_meter_std": 0.17709191143512726, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9838680028915405, "reward_repeat_penalty_std": 0.006402861792594194, "reward_repeat_floor_mean": 0.9975801706314087, "reward_repeat_floor_std": 0.0009604145889170468, "reward_near_duplicate_penalty_mean": 0.9838680028915405, "reward_near_duplicate_penalty_std": 0.006402861792594194, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.768750011920929, "reward_judge_quality_std": 0.21767853200435638, "reward_total_composite_mean": 0.5599968433380127, "reward_total_composite_std": 0.22703492641448975, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 2.0} {"timestamp_utc": "2026-04-12T15:25:44Z", "mode": "train", "global_step": 3, "epoch": 0.00012049644535486203, "loss": 0.1111, "grad_norm": 16.40032196044922, "learning_rate": 9.993939393939395e-06, "num_tokens": 6509.0, "completions/mean_length": 38.75, "completions/min_length": 30.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.75, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.35528749227523804, "rewards/meter/std": 0.3985433578491211, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9887152910232544, "rewards/lexical_plausibility/std": 0.022863244637846947, "rewards/judge_quality/mean": 0.6262500286102295, "rewards/judge_quality/std": 0.3325631320476532, "rewards/repeat_penalty/mean": 0.9862549304962158, "rewards/repeat_penalty/std": 0.020482772961258888, "rewards/repeat_floor/mean": 0.9979382753372192, "rewards/repeat_floor/std": 0.0030724238604307175, "rewards/near_duplicate_penalty/mean": 0.9862549304962158, "rewards/near_duplicate_penalty/std": 0.020482772961258888, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.28549739718437195, "rewards/total_composite/std": 0.39841151237487793, "reward": 0.28549739718437195, "reward_std": 0.39841148257255554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2212861031293869, "sampling/sampling_logp_difference/max": 1.8380317687988281, "sampling/importance_sampling_ratio/min": 0.15913031995296478, "sampling/importance_sampling_ratio/mean": 1.007591962814331, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8705281987786293, "clip_ratio/low_mean": 0.15355645678937435, "clip_ratio/low_min": 0.15355645678937435, "clip_ratio/high_mean": 0.0538194440305233, "clip_ratio/high_max": 0.0538194440305233, "clip_ratio/region_mean": 0.20737590081989765, "reward_total_mean": 0.28549739718437195, "reward_meter_mean": 0.35528749227523804, "reward_meter_std": 0.3985433578491211, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9887152910232544, "reward_lexical_plausibility_std": 0.022863244637846947, "reward_repeat_penalty_mean": 0.9862549304962158, "reward_repeat_penalty_std": 0.020482772961258888, "reward_repeat_floor_mean": 0.9979382753372192, "reward_repeat_floor_std": 0.0030724238604307175, "reward_near_duplicate_penalty_mean": 0.9862549304962158, "reward_near_duplicate_penalty_std": 0.020482772961258888, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6262500286102295, "reward_judge_quality_std": 0.3325631320476532, "reward_total_composite_mean": 0.28549739718437195, "reward_total_composite_std": 0.39841151237487793, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 3.0} {"timestamp_utc": "2026-04-12T15:25:56Z", "mode": "train", "global_step": 4, "epoch": 0.00016066192713981605, "loss": -0.1386, "grad_norm": 8.324551582336426, "learning_rate": 9.990909090909093e-06, "num_tokens": 9508.0, "completions/mean_length": 159.875, "completions/min_length": 96.0, "completions/max_length": 229.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.875, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 229.0, "rewards/meter/mean": 0.5181947946548462, "rewards/meter/std": 0.3963140845298767, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9840686321258545, "rewards/lexical_plausibility/std": 0.03130572661757469, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9750292897224426, "rewards/repeat_penalty/std": 0.055296771228313446, "rewards/repeat_floor/mean": 0.9972373247146606, "rewards/repeat_floor/std": 0.0055242059752345085, "rewards/near_duplicate_penalty/mean": 0.9920720458030701, "rewards/near_duplicate_penalty/std": 0.007942475378513336, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.17476558685302734, "rewards/total_composite/std": 0.14435797929763794, "reward": 0.17476558685302734, "reward_std": 0.14435797929763794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22558651864528656, "sampling/sampling_logp_difference/max": 2.412989616394043, "sampling/importance_sampling_ratio/min": 0.08954718708992004, "sampling/importance_sampling_ratio/mean": 1.0321437120437622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5734728425741196, "clip_ratio/low_mean": 0.12947455421090126, "clip_ratio/low_min": 0.12947455421090126, "clip_ratio/high_mean": 0.07497359253466129, "clip_ratio/high_max": 0.07497359253466129, "clip_ratio/region_mean": 0.20444814674556255, "reward_total_mean": 0.17476558685302734, "reward_meter_mean": 0.5181947946548462, "reward_meter_std": 0.3963140845298767, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9840686321258545, "reward_lexical_plausibility_std": 0.03130572661757469, "reward_repeat_penalty_mean": 0.9750292897224426, "reward_repeat_penalty_std": 0.055296771228313446, "reward_repeat_floor_mean": 0.9972373247146606, "reward_repeat_floor_std": 0.0055242059752345085, "reward_near_duplicate_penalty_mean": 0.9920720458030701, "reward_near_duplicate_penalty_std": 0.007942475378513336, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.17476558685302734, "reward_total_composite_std": 0.14435797929763794, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 4.0} {"timestamp_utc": "2026-04-12T15:26:05Z", "mode": "train", "global_step": 5, "epoch": 0.00020082740892477004, "loss": -0.0003, "grad_norm": 17.628894805908203, "learning_rate": 9.987878787878788e-06, "num_tokens": 11109.0, "completions/mean_length": 46.125, "completions/min_length": 37.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5038740634918213, "rewards/meter/std": 0.48447510600090027, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5087500214576721, "rewards/judge_quality/std": 0.21820290386676788, "rewards/repeat_penalty/mean": 0.992081880569458, "rewards/repeat_penalty/std": 0.020084861665964127, "rewards/repeat_floor/mean": 0.9988123178482056, "rewards/repeat_floor/std": 0.003012728178873658, "rewards/near_duplicate_penalty/mean": 0.992081880569458, "rewards/near_duplicate_penalty/std": 0.020084861665964127, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25947105884552, "rewards/total_composite/std": 0.29764559864997864, "reward": 0.25947105884552, "reward_std": 0.29764559864997864, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2340587079524994, "sampling/sampling_logp_difference/max": 1.5304131507873535, "sampling/importance_sampling_ratio/min": 0.21644623577594757, "sampling/importance_sampling_ratio/mean": 1.0601122379302979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2103342562913895, "clip_ratio/low_mean": 0.12461328227072954, "clip_ratio/low_min": 0.12461328227072954, "clip_ratio/high_mean": 0.058544520288705826, "clip_ratio/high_max": 0.058544520288705826, "clip_ratio/region_mean": 0.18315780255943537, "reward_total_mean": 0.25947105884552, "reward_meter_mean": 0.5038740634918213, "reward_meter_std": 0.48447510600090027, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.992081880569458, "reward_repeat_penalty_std": 0.020084861665964127, "reward_repeat_floor_mean": 0.9988123178482056, "reward_repeat_floor_std": 0.003012728178873658, "reward_near_duplicate_penalty_mean": 0.992081880569458, "reward_near_duplicate_penalty_std": 0.020084861665964127, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5087500214576721, "reward_judge_quality_std": 0.21820290386676788, "reward_total_composite_mean": 0.25947105884552, "reward_total_composite_std": 0.29764559864997864, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 5.0} {"timestamp_utc": "2026-04-12T15:26:14Z", "mode": "train", "global_step": 6, "epoch": 0.00024099289070972406, "loss": -0.0588, "grad_norm": 18.911636352539062, "learning_rate": 9.984848484848485e-06, "num_tokens": 12709.0, "completions/mean_length": 42.0, "completions/min_length": 33.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.550910234451294, "rewards/meter/std": 0.4658724069595337, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2745385766029358, "rewards/repeat_penalty/mean": 0.9660366773605347, "rewards/repeat_penalty/std": 0.049621619284152985, "rewards/repeat_floor/mean": 0.9952383637428284, "rewards/repeat_floor/std": 0.006644129753112793, "rewards/near_duplicate_penalty/mean": 0.9725293517112732, "rewards/near_duplicate_penalty/std": 0.034934960305690765, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.29271385073661804, "rewards/total_composite/std": 0.29651957750320435, "reward": 0.29271385073661804, "reward_std": 0.29651951789855957, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24054525792598724, "sampling/sampling_logp_difference/max": 1.5981216430664062, "sampling/importance_sampling_ratio/min": 0.2022761106491089, "sampling/importance_sampling_ratio/mean": 1.0655957460403442, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4212131202220917, "clip_ratio/low_mean": 0.08407547883689404, "clip_ratio/low_min": 0.08407547883689404, "clip_ratio/high_mean": 0.09894526936113834, "clip_ratio/high_max": 0.09894526936113834, "clip_ratio/region_mean": 0.18302074819803238, "reward_total_mean": 0.29271385073661804, "reward_meter_mean": 0.550910234451294, "reward_meter_std": 0.4658724069595337, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9660366773605347, "reward_repeat_penalty_std": 0.049621619284152985, "reward_repeat_floor_mean": 0.9952383637428284, "reward_repeat_floor_std": 0.006644129753112793, "reward_near_duplicate_penalty_mean": 0.9725293517112732, "reward_near_duplicate_penalty_std": 0.034934960305690765, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2745385766029358, "reward_total_composite_mean": 0.29271385073661804, "reward_total_composite_std": 0.29651957750320435, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 6.0} {"timestamp_utc": "2026-04-12T15:26:23Z", "mode": "train", "global_step": 7, "epoch": 0.00028115837249467805, "loss": 0.0227, "grad_norm": 20.267526626586914, "learning_rate": 9.981818181818183e-06, "num_tokens": 14297.0, "completions/mean_length": 39.5, "completions/min_length": 35.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6312246322631836, "rewards/meter/std": 0.4418559670448303, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.990004301071167, "rewards/repeat_penalty/std": 0.01144260074943304, "rewards/repeat_floor/mean": 0.998500645160675, "rewards/repeat_floor/std": 0.001716392464004457, "rewards/near_duplicate_penalty/mean": 0.990004301071167, "rewards/near_duplicate_penalty/std": 0.01144260074943304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26341506838798523, "rewards/total_composite/std": 0.17551356554031372, "reward": 0.26341506838798523, "reward_std": 0.17551355063915253, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2223813384771347, "sampling/sampling_logp_difference/max": 1.7176733016967773, "sampling/importance_sampling_ratio/min": 0.17948326468467712, "sampling/importance_sampling_ratio/mean": 1.0373649597167969, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9773674011230469, "clip_ratio/low_mean": 0.07656641863286495, "clip_ratio/low_min": 0.07656641863286495, "clip_ratio/high_mean": 0.10327381175011396, "clip_ratio/high_max": 0.10327381175011396, "clip_ratio/region_mean": 0.17984023038297892, "reward_total_mean": 0.26341506838798523, "reward_meter_mean": 0.6312246322631836, "reward_meter_std": 0.4418559670448303, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.990004301071167, "reward_repeat_penalty_std": 0.01144260074943304, "reward_repeat_floor_mean": 0.998500645160675, "reward_repeat_floor_std": 0.001716392464004457, "reward_near_duplicate_penalty_mean": 0.990004301071167, "reward_near_duplicate_penalty_std": 0.01144260074943304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.26341506838798523, "reward_total_composite_std": 0.17551356554031372, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 7.0} {"timestamp_utc": "2026-04-12T15:26:37Z", "mode": "train", "global_step": 8, "epoch": 0.0003213238542796321, "loss": -0.0994, "grad_norm": 5.759873867034912, "learning_rate": 9.97878787878788e-06, "num_tokens": 18531.0, "completions/mean_length": 334.25, "completions/min_length": 242.0, "completions/max_length": 388.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 334.25, "completions/min_terminated_length": 242.0, "completions/max_terminated_length": 388.0, "rewards/meter/mean": 0.7083072662353516, "rewards/meter/std": 0.20774205029010773, "rewards/count_adherence/mean": 0.9090909361839294, "rewards/count_adherence/std": 0.048592954874038696, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9727272987365723, "rewards/count_floor/std": 0.014577888883650303, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9861735701560974, "rewards/repeat_penalty/std": 0.01844516023993492, "rewards/repeat_floor/mean": 0.9983733296394348, "rewards/repeat_floor/std": 0.0017793928273022175, "rewards/near_duplicate_penalty/mean": 0.9937269687652588, "rewards/near_duplicate_penalty/std": 0.003104675328359008, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923807382583618, "rewards/distinct_2/std": 0.01718667894601822, "rewards/total_composite/mean": 0.22860600054264069, "rewards/total_composite/std": 0.08173606544733047, "reward": 0.22860600054264069, "reward_std": 0.08173606544733047, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20303091406822205, "sampling/sampling_logp_difference/max": 2.9986186027526855, "sampling/importance_sampling_ratio/min": 0.04985589161515236, "sampling/importance_sampling_ratio/mean": 1.024811029434204, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.436163306236267, "clip_ratio/low_mean": 0.07238915748894215, "clip_ratio/low_min": 0.07238915748894215, "clip_ratio/high_mean": 0.13320296816527843, "clip_ratio/high_max": 0.13320296816527843, "clip_ratio/region_mean": 0.20559212565422058, "reward_total_mean": 0.22860600054264069, "reward_meter_mean": 0.7083072662353516, "reward_meter_std": 0.20774205029010773, "reward_count_adherence_mean": 0.9090909361839294, "reward_count_adherence_std": 0.048592954874038696, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9727272987365723, "reward_count_floor_std": 0.014577888883650303, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9861735701560974, "reward_repeat_penalty_std": 0.01844516023993492, "reward_repeat_floor_mean": 0.9983733296394348, "reward_repeat_floor_std": 0.0017793928273022175, "reward_near_duplicate_penalty_mean": 0.9937269687652588, "reward_near_duplicate_penalty_std": 0.003104675328359008, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923807382583618, "reward_distinct_2_std": 0.01718667894601822, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.22860600054264069, "reward_total_composite_std": 0.08173606544733047, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 8.0} {"timestamp_utc": "2026-04-12T15:26:48Z", "mode": "train", "global_step": 9, "epoch": 0.0003614893360645861, "loss": 0.0052, "grad_norm": 10.515203475952148, "learning_rate": 9.975757575757577e-06, "num_tokens": 21015.0, "completions/mean_length": 127.5, "completions/min_length": 110.0, "completions/max_length": 146.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.5, "completions/min_terminated_length": 110.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.656243085861206, "rewards/meter/std": 0.28146716952323914, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625820279121399, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9812500476837158, "rewards/count_floor/std": 0.025877466425299644, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3137759864330292, "rewards/repeat_penalty/mean": 0.9839040637016296, "rewards/repeat_penalty/std": 0.014884334988892078, "rewards/repeat_floor/mean": 0.997585654258728, "rewards/repeat_floor/std": 0.002232639119029045, "rewards/near_duplicate_penalty/mean": 0.9839040637016296, "rewards/near_duplicate_penalty/std": 0.014884334988892078, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.364164799451828, "rewards/total_composite/std": 0.25800395011901855, "reward": 0.364164799451828, "reward_std": 0.25800392031669617, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23039698600769043, "sampling/sampling_logp_difference/max": 2.888472080230713, "sampling/importance_sampling_ratio/min": 0.055661194026470184, "sampling/importance_sampling_ratio/mean": 0.9615637063980103, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7885613832622766, "clip_ratio/low_mean": 0.09423136431723833, "clip_ratio/low_min": 0.09423136431723833, "clip_ratio/high_mean": 0.08434331836178899, "clip_ratio/high_max": 0.08434331836178899, "clip_ratio/region_mean": 0.17857468267902732, "reward_total_mean": 0.364164799451828, "reward_meter_mean": 0.656243085861206, "reward_meter_std": 0.28146716952323914, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625820279121399, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9812500476837158, "reward_count_floor_std": 0.025877466425299644, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9839040637016296, "reward_repeat_penalty_std": 0.014884334988892078, "reward_repeat_floor_mean": 0.997585654258728, "reward_repeat_floor_std": 0.002232639119029045, "reward_near_duplicate_penalty_mean": 0.9839040637016296, "reward_near_duplicate_penalty_std": 0.014884334988892078, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3137759864330292, "reward_total_composite_mean": 0.364164799451828, "reward_total_composite_std": 0.25800395011901855, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 9.0} {"timestamp_utc": "2026-04-12T15:26:58Z", "mode": "train", "global_step": 10, "epoch": 0.0004016548178495401, "loss": 0.0707, "grad_norm": 13.917400360107422, "learning_rate": 9.972727272727274e-06, "num_tokens": 23094.0, "completions/mean_length": 85.875, "completions/min_length": 64.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.875, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.7418884038925171, "rewards/meter/std": 0.28886109590530396, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9732223749160767, "rewards/repeat_penalty/std": 0.02280677855014801, "rewards/repeat_floor/mean": 0.9965280294418335, "rewards/repeat_floor/std": 0.0028661310207098722, "rewards/near_duplicate_penalty/mean": 0.9824955463409424, "rewards/near_duplicate_penalty/std": 0.017405029386281967, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9905967712402344, "rewards/distinct_2/std": 0.017439009621739388, "rewards/total_composite/mean": 0.32619839906692505, "rewards/total_composite/std": 0.136269211769104, "reward": 0.32619839906692505, "reward_std": 0.1362692266702652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.230515256524086, "sampling/sampling_logp_difference/max": 1.4770076274871826, "sampling/importance_sampling_ratio/min": 0.2283198982477188, "sampling/importance_sampling_ratio/mean": 1.0057719945907593, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.104541003704071, "clip_ratio/low_mean": 0.07275313138961792, "clip_ratio/low_min": 0.07275313138961792, "clip_ratio/high_mean": 0.14823600091040134, "clip_ratio/high_max": 0.14823600091040134, "clip_ratio/region_mean": 0.22098913230001926, "reward_total_mean": 0.32619839906692505, "reward_meter_mean": 0.7418884038925171, "reward_meter_std": 0.28886109590530396, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9732223749160767, "reward_repeat_penalty_std": 0.02280677855014801, "reward_repeat_floor_mean": 0.9965280294418335, "reward_repeat_floor_std": 0.0028661310207098722, "reward_near_duplicate_penalty_mean": 0.9824955463409424, "reward_near_duplicate_penalty_std": 0.017405029386281967, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9905967712402344, "reward_distinct_2_std": 0.017439009621739388, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.32619839906692505, "reward_total_composite_std": 0.136269211769104, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 10.0} {"timestamp_utc": "2026-04-12T15:27:06Z", "mode": "train", "global_step": 11, "epoch": 0.00044182029963449413, "loss": 0.026, "grad_norm": 14.798701286315918, "learning_rate": 9.96969696969697e-06, "num_tokens": 24829.0, "completions/mean_length": 50.875, "completions/min_length": 28.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.875, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.3353729248046875, "rewards/meter/std": 0.3401470482349396, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9405688643455505, "rewards/repeat_penalty/std": 0.1435241848230362, "rewards/repeat_floor/mean": 0.993354320526123, "rewards/repeat_floor/std": 0.015140877105295658, "rewards/near_duplicate_penalty/mean": 0.9754068851470947, "rewards/near_duplicate_penalty/std": 0.04600444808602333, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9879807829856873, "rewards/distinct_2/std": 0.03399552404880524, "rewards/total_composite/mean": 0.07768288999795914, "rewards/total_composite/std": 0.0734281837940216, "reward": 0.07768288999795914, "reward_std": 0.07342817634344101, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18992814421653748, "sampling/sampling_logp_difference/max": 1.4641127586364746, "sampling/importance_sampling_ratio/min": 0.23128311336040497, "sampling/importance_sampling_ratio/mean": 1.0147560834884644, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.485662467777729, "clip_ratio/low_mean": 0.10995643772184849, "clip_ratio/low_min": 0.10995643772184849, "clip_ratio/high_mean": 0.04779450502246618, "clip_ratio/high_max": 0.04779450502246618, "clip_ratio/region_mean": 0.15775094274431467, "reward_total_mean": 0.07768288999795914, "reward_meter_mean": 0.3353729248046875, "reward_meter_std": 0.3401470482349396, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9405688643455505, "reward_repeat_penalty_std": 0.1435241848230362, "reward_repeat_floor_mean": 0.993354320526123, "reward_repeat_floor_std": 0.015140877105295658, "reward_near_duplicate_penalty_mean": 0.9754068851470947, "reward_near_duplicate_penalty_std": 0.04600444808602333, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9879807829856873, "reward_distinct_2_std": 0.03399552404880524, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.07768288999795914, "reward_total_composite_std": 0.0734281837940216, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 11.0} {"timestamp_utc": "2026-04-12T15:27:21Z", "mode": "train", "global_step": 12, "epoch": 0.0004819857814194481, "loss": 0.1291, "grad_norm": 7.750916481018066, "learning_rate": 9.966666666666667e-06, "num_tokens": 29320.0, "completions/mean_length": 336.375, "completions/min_length": 224.0, "completions/max_length": 459.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 336.375, "completions/min_terminated_length": 224.0, "completions/max_terminated_length": 459.0, "rewards/meter/mean": 0.6111171245574951, "rewards/meter/std": 0.25081607699394226, "rewards/count_adherence/mean": 0.9519230723381042, "rewards/count_adherence/std": 0.05723259598016739, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.985576868057251, "rewards/count_floor/std": 0.017169784754514694, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9864811897277832, "rewards/repeat_penalty/std": 0.017781730741262436, "rewards/repeat_floor/mean": 0.998455286026001, "rewards/repeat_floor/std": 0.0017400516662746668, "rewards/near_duplicate_penalty/mean": 0.9946328997612, "rewards/near_duplicate_penalty/std": 0.003203645348548889, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9917812347412109, "rewards/distinct_2/std": 0.01605413667857647, "rewards/total_composite/mean": 0.12012744694948196, "rewards/total_composite/std": 0.08017784357070923, "reward": 0.12012744694948196, "reward_std": 0.08017783612012863, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22707612812519073, "sampling/sampling_logp_difference/max": 2.110173225402832, "sampling/importance_sampling_ratio/min": 0.12121696770191193, "sampling/importance_sampling_ratio/mean": 1.0317015647888184, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.876276522874832, "clip_ratio/low_mean": 0.13203903660178185, "clip_ratio/low_min": 0.13203903660178185, "clip_ratio/high_mean": 0.06098760478198528, "clip_ratio/high_max": 0.06098760478198528, "clip_ratio/region_mean": 0.19302664138376713, "reward_total_mean": 0.12012744694948196, "reward_meter_mean": 0.6111171245574951, "reward_meter_std": 0.25081607699394226, "reward_count_adherence_mean": 0.9519230723381042, "reward_count_adherence_std": 0.05723259598016739, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.985576868057251, "reward_count_floor_std": 0.017169784754514694, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9864811897277832, "reward_repeat_penalty_std": 0.017781730741262436, "reward_repeat_floor_mean": 0.998455286026001, "reward_repeat_floor_std": 0.0017400516662746668, "reward_near_duplicate_penalty_mean": 0.9946328997612, "reward_near_duplicate_penalty_std": 0.003203645348548889, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9917812347412109, "reward_distinct_2_std": 0.01605413667857647, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.12012744694948196, "reward_total_composite_std": 0.08017784357070923, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 12.0} {"timestamp_utc": "2026-04-12T15:27:30Z", "mode": "train", "global_step": 13, "epoch": 0.0005221512632044022, "loss": 0.1698, "grad_norm": 16.573932647705078, "learning_rate": 9.963636363636364e-06, "num_tokens": 30974.0, "completions/mean_length": 46.75, "completions/min_length": 30.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.75, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.5358141660690308, "rewards/meter/std": 0.40260711312294006, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8793129920959473, "rewards/lexical_plausibility/std": 0.16006377339363098, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9961528182029724, "rewards/repeat_penalty/std": 0.005420883186161518, "rewards/repeat_floor/mean": 0.9994229078292847, "rewards/repeat_floor/std": 0.0008131422218866646, "rewards/near_duplicate_penalty/mean": 0.9961528182029724, "rewards/near_duplicate_penalty/std": 0.005420883186161518, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17765599489212036, "rewards/total_composite/std": 0.14073699712753296, "reward": 0.17765599489212036, "reward_std": 0.14073699712753296, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23024636507034302, "sampling/sampling_logp_difference/max": 1.6995067596435547, "sampling/importance_sampling_ratio/min": 0.1827736496925354, "sampling/importance_sampling_ratio/mean": 1.0083376169204712, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.80851811170578, "clip_ratio/low_mean": 0.11393210291862488, "clip_ratio/low_min": 0.11393210291862488, "clip_ratio/high_mean": 0.07991453260183334, "clip_ratio/high_max": 0.07991453260183334, "clip_ratio/region_mean": 0.19384663552045822, "reward_total_mean": 0.17765599489212036, "reward_meter_mean": 0.5358141660690308, "reward_meter_std": 0.40260711312294006, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8793129920959473, "reward_lexical_plausibility_std": 0.16006377339363098, "reward_repeat_penalty_mean": 0.9961528182029724, "reward_repeat_penalty_std": 0.005420883186161518, "reward_repeat_floor_mean": 0.9994229078292847, "reward_repeat_floor_std": 0.0008131422218866646, "reward_near_duplicate_penalty_mean": 0.9961528182029724, "reward_near_duplicate_penalty_std": 0.005420883186161518, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.17765599489212036, "reward_total_composite_std": 0.14073699712753296, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 13.0} {"timestamp_utc": "2026-04-12T15:27:40Z", "mode": "train", "global_step": 14, "epoch": 0.0005623167449893561, "loss": -0.0211, "grad_norm": 16.62190818786621, "learning_rate": 9.960606060606062e-06, "num_tokens": 32583.0, "completions/mean_length": 42.125, "completions/min_length": 29.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.5649515390396118, "rewards/meter/std": 0.45746996998786926, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.5787500143051147, "rewards/judge_quality/std": 0.22433632612228394, "rewards/repeat_penalty/mean": 0.9921665191650391, "rewards/repeat_penalty/std": 0.01081833429634571, "rewards/repeat_floor/mean": 0.998824954032898, "rewards/repeat_floor/std": 0.0016227505402639508, "rewards/near_duplicate_penalty/mean": 0.9921665191650391, "rewards/near_duplicate_penalty/std": 0.01081833429634571, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3522951602935791, "rewards/total_composite/std": 0.317210853099823, "reward": 0.3522951602935791, "reward_std": 0.317210853099823, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19130516052246094, "sampling/sampling_logp_difference/max": 1.6429328918457031, "sampling/importance_sampling_ratio/min": 0.1934119462966919, "sampling/importance_sampling_ratio/mean": 1.0410844087600708, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6727047264575958, "clip_ratio/low_mean": 0.10082429647445679, "clip_ratio/low_min": 0.10082429647445679, "clip_ratio/high_mean": 0.11190067790448666, "clip_ratio/high_max": 0.11190067790448666, "clip_ratio/region_mean": 0.21272497437894344, "reward_total_mean": 0.3522951602935791, "reward_meter_mean": 0.5649515390396118, "reward_meter_std": 0.45746996998786926, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9921665191650391, "reward_repeat_penalty_std": 0.01081833429634571, "reward_repeat_floor_mean": 0.998824954032898, "reward_repeat_floor_std": 0.0016227505402639508, "reward_near_duplicate_penalty_mean": 0.9921665191650391, "reward_near_duplicate_penalty_std": 0.01081833429634571, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5787500143051147, "reward_judge_quality_std": 0.22433632612228394, "reward_total_composite_mean": 0.3522951602935791, "reward_total_composite_std": 0.317210853099823, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 14.0} {"timestamp_utc": "2026-04-12T15:27:50Z", "mode": "train", "global_step": 15, "epoch": 0.0006024822267743102, "loss": -0.123, "grad_norm": 15.516450881958008, "learning_rate": 9.957575757575757e-06, "num_tokens": 34370.0, "completions/mean_length": 53.375, "completions/min_length": 10.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.375, "completions/min_terminated_length": 10.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.30706876516342163, "rewards/meter/std": 0.4386492073535919, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9929812550544739, "rewards/repeat_penalty/std": 0.019852008670568466, "rewards/repeat_floor/mean": 0.9989472031593323, "rewards/repeat_floor/std": 0.002977801486849785, "rewards/near_duplicate_penalty/mean": 0.9929812550544739, "rewards/near_duplicate_penalty/std": 0.019852008670568466, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22470685839653015, "rewards/total_composite/std": 0.3384774923324585, "reward": 0.22470685839653015, "reward_std": 0.3384774923324585, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2112843096256256, "sampling/sampling_logp_difference/max": 2.0283632278442383, "sampling/importance_sampling_ratio/min": 0.13155066967010498, "sampling/importance_sampling_ratio/mean": 1.0471327304840088, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.098313555121422, "clip_ratio/low_mean": 0.1331961303949356, "clip_ratio/low_min": 0.1331961303949356, "clip_ratio/high_mean": 0.06151947192847729, "clip_ratio/high_max": 0.06151947192847729, "clip_ratio/region_mean": 0.1947156023234129, "reward_total_mean": 0.22470685839653015, "reward_meter_mean": 0.30706876516342163, "reward_meter_std": 0.4386492073535919, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.9929812550544739, "reward_repeat_penalty_std": 0.019852008670568466, "reward_repeat_floor_mean": 0.9989472031593323, "reward_repeat_floor_std": 0.002977801486849785, "reward_near_duplicate_penalty_mean": 0.9929812550544739, "reward_near_duplicate_penalty_std": 0.019852008670568466, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.22470685839653015, "reward_total_composite_std": 0.3384774923324585, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 15.0} {"timestamp_utc": "2026-04-12T15:28:06Z", "mode": "train", "global_step": 16, "epoch": 0.0006426477085592642, "loss": -0.1233, "grad_norm": 4.472887992858887, "learning_rate": 9.954545454545456e-06, "num_tokens": 38592.0, "completions/mean_length": 380.75, "completions/min_length": 285.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 362.0000305175781, "completions/min_terminated_length": 285.0, "completions/max_terminated_length": 489.0, "rewards/meter/mean": 0.646077036857605, "rewards/meter/std": 0.22905045747756958, "rewards/count_adherence/mean": 0.8958333730697632, "rewards/count_adherence/std": 0.058925580233335495, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.96875, "rewards/count_floor/std": 0.017677679657936096, "rewards/lexical_plausibility/mean": 0.9700763821601868, "rewards/lexical_plausibility/std": 0.08350753784179688, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9905528426170349, "rewards/repeat_penalty/std": 0.011145573109388351, "rewards/repeat_floor/mean": 0.9989702701568604, "rewards/repeat_floor/std": 0.001023361925035715, "rewards/near_duplicate_penalty/mean": 0.9970415830612183, "rewards/near_duplicate_penalty/std": 0.0005189756629988551, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9934895634651184, "rewards/distinct_2/std": 0.01092198584228754, "rewards/total_composite/mean": 0.20287978649139404, "rewards/total_composite/std": 0.10549522191286087, "reward": 0.20287978649139404, "reward_std": 0.10549522191286087, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22138601541519165, "sampling/sampling_logp_difference/max": 1.7725324630737305, "sampling/importance_sampling_ratio/min": 0.16990217566490173, "sampling/importance_sampling_ratio/mean": 1.0467000007629395, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.758598208427429, "clip_ratio/low_mean": 0.04998158477246761, "clip_ratio/low_min": 0.04998158477246761, "clip_ratio/high_mean": 0.13737528584897518, "clip_ratio/high_max": 0.13737528584897518, "clip_ratio/region_mean": 0.1873568706214428, "reward_total_mean": 0.20287978649139404, "reward_meter_mean": 0.646077036857605, "reward_meter_std": 0.22905045747756958, "reward_count_adherence_mean": 0.8958333730697632, "reward_count_adherence_std": 0.058925580233335495, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.96875, "reward_count_floor_std": 0.017677679657936096, "reward_lexical_plausibility_mean": 0.9700763821601868, "reward_lexical_plausibility_std": 0.08350753784179688, "reward_repeat_penalty_mean": 0.9905528426170349, "reward_repeat_penalty_std": 0.011145573109388351, "reward_repeat_floor_mean": 0.9989702701568604, "reward_repeat_floor_std": 0.001023361925035715, "reward_near_duplicate_penalty_mean": 0.9970415830612183, "reward_near_duplicate_penalty_std": 0.0005189756629988551, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9934895634651184, "reward_distinct_2_std": 0.01092198584228754, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.20287978649139404, "reward_total_composite_std": 0.10549522191286087, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 16.0} {"timestamp_utc": "2026-04-12T15:28:15Z", "mode": "train", "global_step": 17, "epoch": 0.0006828131903442181, "loss": 0.1407, "grad_norm": 14.15239143371582, "learning_rate": 9.951515151515152e-06, "num_tokens": 40533.0, "completions/mean_length": 65.625, "completions/min_length": 47.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.625, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.4984070062637329, "rewards/meter/std": 0.42103222012519836, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9718775153160095, "rewards/lexical_plausibility/std": 0.05715625733137131, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9909399747848511, "rewards/repeat_penalty/std": 0.017375122755765915, "rewards/repeat_floor/mean": 0.9986410140991211, "rewards/repeat_floor/std": 0.0026062640827149153, "rewards/near_duplicate_penalty/mean": 0.9909399747848511, "rewards/near_duplicate_penalty/std": 0.017375122755765915, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1791306436061859, "rewards/total_composite/std": 0.17350420355796814, "reward": 0.1791306436061859, "reward_std": 0.17350421845912933, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20403529703617096, "sampling/sampling_logp_difference/max": 1.0976190567016602, "sampling/importance_sampling_ratio/min": 0.33366456627845764, "sampling/importance_sampling_ratio/mean": 1.026328444480896, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2219748347997665, "clip_ratio/low_mean": 0.1221171673387289, "clip_ratio/low_min": 0.1221171673387289, "clip_ratio/high_mean": 0.07865174673497677, "clip_ratio/high_max": 0.07865174673497677, "clip_ratio/region_mean": 0.20076891407370567, "reward_total_mean": 0.1791306436061859, "reward_meter_mean": 0.4984070062637329, "reward_meter_std": 0.42103222012519836, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9718775153160095, "reward_lexical_plausibility_std": 0.05715625733137131, "reward_repeat_penalty_mean": 0.9909399747848511, "reward_repeat_penalty_std": 0.017375122755765915, "reward_repeat_floor_mean": 0.9986410140991211, "reward_repeat_floor_std": 0.0026062640827149153, "reward_near_duplicate_penalty_mean": 0.9909399747848511, "reward_near_duplicate_penalty_std": 0.017375122755765915, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.1791306436061859, "reward_total_composite_std": 0.17350420355796814, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 17.0} {"timestamp_utc": "2026-04-12T15:28:26Z", "mode": "train", "global_step": 18, "epoch": 0.0007229786721291722, "loss": 0.0279, "grad_norm": 8.760952949523926, "learning_rate": 9.948484848484849e-06, "num_tokens": 43125.0, "completions/mean_length": 125.0, "completions/min_length": 82.0, "completions/max_length": 150.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 125.0, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.3913823366165161, "rewards/meter/std": 0.29120635986328125, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9837819933891296, "rewards/lexical_plausibility/std": 0.040401432663202286, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.9826048612594604, "rewards/repeat_penalty/std": 0.018295876681804657, "rewards/repeat_floor/mean": 0.9979451894760132, "rewards/repeat_floor/std": 0.001798599842004478, "rewards/near_duplicate_penalty/mean": 0.9919602870941162, "rewards/near_duplicate_penalty/std": 0.005748011637479067, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9905686378479004, "rewards/distinct_2/std": 0.01752571202814579, "rewards/total_composite/mean": 0.14996148645877838, "rewards/total_composite/std": 0.1391526311635971, "reward": 0.14996148645877838, "reward_std": 0.1391526311635971, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21279513835906982, "sampling/sampling_logp_difference/max": 1.3045446872711182, "sampling/importance_sampling_ratio/min": 0.29111722111701965, "sampling/importance_sampling_ratio/mean": 1.0226211547851562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.263792857527733, "clip_ratio/low_mean": 0.12045164220035076, "clip_ratio/low_min": 0.12045164220035076, "clip_ratio/high_mean": 0.06518849171698093, "clip_ratio/high_max": 0.06518849171698093, "clip_ratio/region_mean": 0.1856401339173317, "reward_total_mean": 0.14996148645877838, "reward_meter_mean": 0.3913823366165161, "reward_meter_std": 0.29120635986328125, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9837819933891296, "reward_lexical_plausibility_std": 0.040401432663202286, "reward_repeat_penalty_mean": 0.9826048612594604, "reward_repeat_penalty_std": 0.018295876681804657, "reward_repeat_floor_mean": 0.9979451894760132, "reward_repeat_floor_std": 0.001798599842004478, "reward_near_duplicate_penalty_mean": 0.9919602870941162, "reward_near_duplicate_penalty_std": 0.005748011637479067, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9905686378479004, "reward_distinct_2_std": 0.01752571202814579, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.14996148645877838, "reward_total_composite_std": 0.1391526311635971, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 18.0} {"timestamp_utc": "2026-04-12T15:28:42Z", "mode": "train", "global_step": 19, "epoch": 0.0007631441539141262, "loss": -0.0062, "grad_norm": 4.123045444488525, "learning_rate": 9.945454545454546e-06, "num_tokens": 46986.0, "completions/mean_length": 463.625, "completions/min_length": 351.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 434.6000061035156, "completions/min_terminated_length": 351.0, "completions/max_terminated_length": 509.0, "rewards/meter/mean": 0.7735102772712708, "rewards/meter/std": 0.18511484563350677, "rewards/count_adherence/mean": 0.953125, "rewards/count_adherence/std": 0.05540033057332039, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9859374761581421, "rewards/count_floor/std": 0.016620110720396042, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9906105995178223, "rewards/repeat_penalty/std": 0.006933511700481176, "rewards/repeat_floor/mean": 0.9989017248153687, "rewards/repeat_floor/std": 0.0006824919255450368, "rewards/near_duplicate_penalty/mean": 0.9958175420761108, "rewards/near_duplicate_penalty/std": 0.001465248642489314, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9947676658630371, "rewards/distinct_2/std": 0.006208095233887434, "rewards/total_composite/mean": 0.13303399085998535, "rewards/total_composite/std": 0.05913260579109192, "reward": 0.13303399085998535, "reward_std": 0.05913260951638222, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22717344760894775, "sampling/sampling_logp_difference/max": 1.536581039428711, "sampling/importance_sampling_ratio/min": 0.21511532366275787, "sampling/importance_sampling_ratio/mean": 1.0486820936203003, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.131060630083084, "clip_ratio/low_mean": 0.08844146691262722, "clip_ratio/low_min": 0.08844146691262722, "clip_ratio/high_mean": 0.028282828629016876, "clip_ratio/high_max": 0.028282828629016876, "clip_ratio/region_mean": 0.1167242955416441, "reward_total_mean": 0.13303399085998535, "reward_meter_mean": 0.7735102772712708, "reward_meter_std": 0.18511484563350677, "reward_count_adherence_mean": 0.953125, "reward_count_adherence_std": 0.05540033057332039, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9859374761581421, "reward_count_floor_std": 0.016620110720396042, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9906105995178223, "reward_repeat_penalty_std": 0.006933511700481176, "reward_repeat_floor_mean": 0.9989017248153687, "reward_repeat_floor_std": 0.0006824919255450368, "reward_near_duplicate_penalty_mean": 0.9958175420761108, "reward_near_duplicate_penalty_std": 0.001465248642489314, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9947676658630371, "reward_distinct_2_std": 0.006208095233887434, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.13303399085998535, "reward_total_composite_std": 0.05913260579109192, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 19.0} {"timestamp_utc": "2026-04-12T15:28:52Z", "mode": "train", "global_step": 20, "epoch": 0.0008033096356990802, "loss": 0.0119, "grad_norm": 13.167397499084473, "learning_rate": 9.942424242424244e-06, "num_tokens": 48850.0, "completions/mean_length": 79.0, "completions/min_length": 52.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.0, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.7391309142112732, "rewards/meter/std": 0.3295347988605499, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9912289381027222, "rewards/repeat_penalty/std": 0.017576977610588074, "rewards/repeat_floor/mean": 0.9990683794021606, "rewards/repeat_floor/std": 0.001569906948134303, "rewards/near_duplicate_penalty/mean": 0.9976356029510498, "rewards/near_duplicate_penalty/std": 0.002671419410035014, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9935897588729858, "rewards/distinct_2/std": 0.018130943179130554, "rewards/total_composite/mean": 0.25470268726348877, "rewards/total_composite/std": 0.13675996661186218, "reward": 0.25470268726348877, "reward_std": 0.13675996661186218, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1914476603269577, "sampling/sampling_logp_difference/max": 1.754624366760254, "sampling/importance_sampling_ratio/min": 0.1729722023010254, "sampling/importance_sampling_ratio/mean": 1.0130658149719238, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.942652314901352, "clip_ratio/low_mean": 0.0659028347581625, "clip_ratio/low_min": 0.0659028347581625, "clip_ratio/high_mean": 0.12095401994884014, "clip_ratio/high_max": 0.12095401994884014, "clip_ratio/region_mean": 0.18685685470700264, "reward_total_mean": 0.25470268726348877, "reward_meter_mean": 0.7391309142112732, "reward_meter_std": 0.3295347988605499, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9912289381027222, "reward_repeat_penalty_std": 0.017576977610588074, "reward_repeat_floor_mean": 0.9990683794021606, "reward_repeat_floor_std": 0.001569906948134303, "reward_near_duplicate_penalty_mean": 0.9976356029510498, "reward_near_duplicate_penalty_std": 0.002671419410035014, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9935897588729858, "reward_distinct_2_std": 0.018130943179130554, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.25470268726348877, "reward_total_composite_std": 0.13675996661186218, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 20.0} {"timestamp_utc": "2026-04-12T15:29:03Z", "mode": "train", "global_step": 21, "epoch": 0.0008434751174840342, "loss": 0.1395, "grad_norm": 18.839717864990234, "learning_rate": 9.939393939393939e-06, "num_tokens": 50629.0, "completions/mean_length": 54.375, "completions/min_length": 42.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.375, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.16253086924552917, "rewards/meter/std": 0.32640475034713745, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9408199787139893, "rewards/repeat_penalty/std": 0.10722612589597702, "rewards/repeat_floor/mean": 0.9939693212509155, "rewards/repeat_floor/std": 0.008080698549747467, "rewards/near_duplicate_penalty/mean": 0.9694105386734009, "rewards/near_duplicate_penalty/std": 0.027310004457831383, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.12064145505428314, "rewards/total_composite/std": 0.28272712230682373, "reward": 0.12064145505428314, "reward_std": 0.28272712230682373, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.31002137064933777, "sampling/sampling_logp_difference/max": 1.9811716079711914, "sampling/importance_sampling_ratio/min": 0.13790756464004517, "sampling/importance_sampling_ratio/mean": 1.0304527282714844, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9839466661214828, "clip_ratio/low_mean": 0.21813260950148106, "clip_ratio/low_min": 0.21813260950148106, "clip_ratio/high_mean": 0.02083333395421505, "clip_ratio/high_max": 0.02083333395421505, "clip_ratio/region_mean": 0.2389659434556961, "reward_total_mean": 0.12064145505428314, "reward_meter_mean": 0.16253086924552917, "reward_meter_std": 0.32640475034713745, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9408199787139893, "reward_repeat_penalty_std": 0.10722612589597702, "reward_repeat_floor_mean": 0.9939693212509155, "reward_repeat_floor_std": 0.008080698549747467, "reward_near_duplicate_penalty_mean": 0.9694105386734009, "reward_near_duplicate_penalty_std": 0.027310004457831383, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.12064145505428314, "reward_total_composite_std": 0.28272712230682373, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 21.0} {"timestamp_utc": "2026-04-12T15:29:13Z", "mode": "train", "global_step": 22, "epoch": 0.0008836405992689883, "loss": 0.1318, "grad_norm": 18.062366485595703, "learning_rate": 9.936363636363638e-06, "num_tokens": 52412.0, "completions/mean_length": 39.875, "completions/min_length": 32.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.7118128538131714, "rewards/meter/std": 0.30599501729011536, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9786217212677002, "rewards/repeat_penalty/std": 0.03314605727791786, "rewards/repeat_floor/mean": 0.9973337650299072, "rewards/repeat_floor/std": 0.0035276152193546295, "rewards/near_duplicate_penalty/mean": 0.9879943132400513, "rewards/near_duplicate_penalty/std": 0.010588407516479492, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.4631122946739197, "rewards/total_composite/std": 0.3377132713794708, "reward": 0.4631122946739197, "reward_std": 0.3377132713794708, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18866823613643646, "sampling/sampling_logp_difference/max": 1.7111029624938965, "sampling/importance_sampling_ratio/min": 0.18066641688346863, "sampling/importance_sampling_ratio/mean": 1.0093622207641602, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3397293128073215, "clip_ratio/low_mean": 0.09336858335882425, "clip_ratio/low_min": 0.09336858335882425, "clip_ratio/high_mean": 0.02302631549537182, "clip_ratio/high_max": 0.02302631549537182, "clip_ratio/region_mean": 0.11639489885419607, "reward_total_mean": 0.4631122946739197, "reward_meter_mean": 0.7118128538131714, "reward_meter_std": 0.30599501729011536, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9786217212677002, "reward_repeat_penalty_std": 0.03314605727791786, "reward_repeat_floor_mean": 0.9973337650299072, "reward_repeat_floor_std": 0.0035276152193546295, "reward_near_duplicate_penalty_mean": 0.9879943132400513, "reward_near_duplicate_penalty_std": 0.010588407516479492, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.4631122946739197, "reward_total_composite_std": 0.3377132713794708, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 22.0} {"timestamp_utc": "2026-04-12T15:29:30Z", "mode": "train", "global_step": 23, "epoch": 0.0009238060810539422, "loss": 0.1579, "grad_norm": 1.7903239727020264, "learning_rate": 9.933333333333334e-06, "num_tokens": 55561.0, "completions/mean_length": 509.625, "completions/min_length": 500.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 505.66668701171875, "completions/min_terminated_length": 500.0, "completions/max_terminated_length": 511.0, "rewards/meter/mean": 0.7652940154075623, "rewards/meter/std": 0.17092706263065338, "rewards/count_adherence/mean": 0.9910714626312256, "rewards/count_adherence/std": 0.025253823027014732, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9973214268684387, "rewards/count_floor/std": 0.007576148957014084, "rewards/lexical_plausibility/mean": 0.9985464811325073, "rewards/lexical_plausibility/std": 0.004111087881028652, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.9815077185630798, "rewards/repeat_penalty/std": 0.03388342633843422, "rewards/repeat_floor/mean": 0.9980646371841431, "rewards/repeat_floor/std": 0.003204014850780368, "rewards/near_duplicate_penalty/mean": 0.9956598281860352, "rewards/near_duplicate_penalty/std": 0.002639841055497527, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9857295751571655, "rewards/distinct_2/std": 0.03214246407151222, "rewards/total_composite/mean": 0.19023799896240234, "rewards/total_composite/std": 0.08524578809738159, "reward": 0.19023799896240234, "reward_std": 0.08524578809738159, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17710649967193604, "sampling/sampling_logp_difference/max": 1.5074372291564941, "sampling/importance_sampling_ratio/min": 0.22147683799266815, "sampling/importance_sampling_ratio/mean": 1.0306750535964966, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.85990309715271, "clip_ratio/low_mean": 0.04566798359155655, "clip_ratio/low_min": 0.04566798359155655, "clip_ratio/high_mean": 0.020792564377188683, "clip_ratio/high_max": 0.020792564377188683, "clip_ratio/region_mean": 0.06646054796874523, "reward_total_mean": 0.19023799896240234, "reward_meter_mean": 0.7652940154075623, "reward_meter_std": 0.17092706263065338, "reward_count_adherence_mean": 0.9910714626312256, "reward_count_adherence_std": 0.025253823027014732, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9973214268684387, "reward_count_floor_std": 0.007576148957014084, "reward_lexical_plausibility_mean": 0.9985464811325073, "reward_lexical_plausibility_std": 0.004111087881028652, "reward_repeat_penalty_mean": 0.9815077185630798, "reward_repeat_penalty_std": 0.03388342633843422, "reward_repeat_floor_mean": 0.9980646371841431, "reward_repeat_floor_std": 0.003204014850780368, "reward_near_duplicate_penalty_mean": 0.9956598281860352, "reward_near_duplicate_penalty_std": 0.002639841055497527, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9857295751571655, "reward_distinct_2_std": 0.03214246407151222, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.19023799896240234, "reward_total_composite_std": 0.08524578809738159, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 23.0} {"timestamp_utc": "2026-04-12T15:29:42Z", "mode": "train", "global_step": 24, "epoch": 0.0009639715628388962, "loss": 0.171, "grad_norm": 15.77658462524414, "learning_rate": 9.930303030303031e-06, "num_tokens": 57564.0, "completions/mean_length": 83.375, "completions/min_length": 61.0, "completions/max_length": 116.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 83.375, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.7255039215087891, "rewards/meter/std": 0.34764692187309265, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9726814031600952, "rewards/repeat_penalty/std": 0.029803479090332985, "rewards/repeat_floor/mean": 0.996475338935852, "rewards/repeat_floor/std": 0.003498756093904376, "rewards/near_duplicate_penalty/mean": 0.9827389121055603, "rewards/near_duplicate_penalty/std": 0.013923194259405136, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9896050095558167, "rewards/distinct_2/std": 0.019247809424996376, "rewards/total_composite/mean": 0.293908953666687, "rewards/total_composite/std": 0.14653658866882324, "reward": 0.293908953666687, "reward_std": 0.14653658866882324, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2087927609682083, "sampling/sampling_logp_difference/max": 1.8262858390808105, "sampling/importance_sampling_ratio/min": 0.1610104739665985, "sampling/importance_sampling_ratio/mean": 1.0376325845718384, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.086565062403679, "clip_ratio/low_mean": 0.07746557146310806, "clip_ratio/low_min": 0.07746557146310806, "clip_ratio/high_mean": 0.12272364646196365, "clip_ratio/high_max": 0.12272364646196365, "clip_ratio/region_mean": 0.20018921792507172, "reward_total_mean": 0.293908953666687, "reward_meter_mean": 0.7255039215087891, "reward_meter_std": 0.34764692187309265, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9726814031600952, "reward_repeat_penalty_std": 0.029803479090332985, "reward_repeat_floor_mean": 0.996475338935852, "reward_repeat_floor_std": 0.003498756093904376, "reward_near_duplicate_penalty_mean": 0.9827389121055603, "reward_near_duplicate_penalty_std": 0.013923194259405136, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9896050095558167, "reward_distinct_2_std": 0.019247809424996376, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.293908953666687, "reward_total_composite_std": 0.14653658866882324, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 24.0} {"timestamp_utc": "2026-04-12T15:29:56Z", "mode": "train", "global_step": 25, "epoch": 0.0010041370446238502, "loss": 0.0352, "grad_norm": 14.53252124786377, "learning_rate": 9.927272727272728e-06, "num_tokens": 59742.0, "completions/mean_length": 87.25, "completions/min_length": 76.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.25, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.6735032796859741, "rewards/meter/std": 0.3561065196990967, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.958823561668396, "rewards/lexical_plausibility/std": 0.11646464467048645, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9920245409011841, "rewards/repeat_penalty/std": 0.00808724295347929, "rewards/repeat_floor/mean": 0.9988037347793579, "rewards/repeat_floor/std": 0.0012130799004808068, "rewards/near_duplicate_penalty/mean": 0.9920245409011841, "rewards/near_duplicate_penalty/std": 0.00808724295347929, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26689326763153076, "rewards/total_composite/std": 0.1506560742855072, "reward": 0.26689326763153076, "reward_std": 0.1506560742855072, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1992534101009369, "sampling/sampling_logp_difference/max": 1.8375164270401, "sampling/importance_sampling_ratio/min": 0.15921235084533691, "sampling/importance_sampling_ratio/mean": 1.0229802131652832, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6130416989326477, "clip_ratio/low_mean": 0.09780654683709145, "clip_ratio/low_min": 0.09780654683709145, "clip_ratio/high_mean": 0.10350676998496056, "clip_ratio/high_max": 0.10350676998496056, "clip_ratio/region_mean": 0.201313316822052, "reward_total_mean": 0.26689326763153076, "reward_meter_mean": 0.6735032796859741, "reward_meter_std": 0.3561065196990967, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.958823561668396, "reward_lexical_plausibility_std": 0.11646464467048645, "reward_repeat_penalty_mean": 0.9920245409011841, "reward_repeat_penalty_std": 0.00808724295347929, "reward_repeat_floor_mean": 0.9988037347793579, "reward_repeat_floor_std": 0.0012130799004808068, "reward_near_duplicate_penalty_mean": 0.9920245409011841, "reward_near_duplicate_penalty_std": 0.00808724295347929, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.26689326763153076, "reward_total_composite_std": 0.1506560742855072, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 25.0} {"timestamp_utc": "2026-04-12T15:30:07Z", "mode": "train", "global_step": 26, "epoch": 0.0010443025264088043, "loss": 0.055, "grad_norm": 12.390909194946289, "learning_rate": 9.924242424242425e-06, "num_tokens": 61561.0, "completions/mean_length": 68.375, "completions/min_length": 44.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.375, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.3102201819419861, "rewards/meter/std": 0.34473279118537903, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.981586754322052, "rewards/lexical_plausibility/std": 0.05208052322268486, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.9818671941757202, "rewards/repeat_penalty/std": 0.015078977681696415, "rewards/repeat_floor/mean": 0.9972801208496094, "rewards/repeat_floor/std": 0.002261844929307699, "rewards/near_duplicate_penalty/mean": 0.9818671941757202, "rewards/near_duplicate_penalty/std": 0.015078977681696415, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16526462137699127, "rewards/total_composite/std": 0.21345311403274536, "reward": 0.16526462137699127, "reward_std": 0.21345311403274536, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20714733004570007, "sampling/sampling_logp_difference/max": 1.583723545074463, "sampling/importance_sampling_ratio/min": 0.20520955324172974, "sampling/importance_sampling_ratio/mean": 1.0312914848327637, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8172488510608673, "clip_ratio/low_mean": 0.1448319312185049, "clip_ratio/low_min": 0.1448319312185049, "clip_ratio/high_mean": 0.04946471005678177, "clip_ratio/high_max": 0.04946471005678177, "clip_ratio/region_mean": 0.19429664127528667, "reward_total_mean": 0.16526462137699127, "reward_meter_mean": 0.3102201819419861, "reward_meter_std": 0.34473279118537903, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.981586754322052, "reward_lexical_plausibility_std": 0.05208052322268486, "reward_repeat_penalty_mean": 0.9818671941757202, "reward_repeat_penalty_std": 0.015078977681696415, "reward_repeat_floor_mean": 0.9972801208496094, "reward_repeat_floor_std": 0.002261844929307699, "reward_near_duplicate_penalty_mean": 0.9818671941757202, "reward_near_duplicate_penalty_std": 0.015078977681696415, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.16526462137699127, "reward_total_composite_std": 0.21345311403274536, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 26.0} {"timestamp_utc": "2026-04-12T15:30:23Z", "mode": "train", "global_step": 27, "epoch": 0.0010844680081937583, "loss": 0.1186, "grad_norm": 17.233257293701172, "learning_rate": 9.921212121212121e-06, "num_tokens": 63455.0, "completions/mean_length": 61.75, "completions/min_length": 48.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.75, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.6537008285522461, "rewards/meter/std": 0.4205484986305237, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9908088445663452, "rewards/lexical_plausibility/std": 0.025996576994657516, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9815423488616943, "rewards/repeat_penalty/std": 0.02558419480919838, "rewards/repeat_floor/mean": 0.9976505041122437, "rewards/repeat_floor/std": 0.0026978568639606237, "rewards/near_duplicate_penalty/mean": 0.9887744188308716, "rewards/near_duplicate_penalty/std": 0.007379098795354366, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.23420360684394836, "rewards/total_composite/std": 0.16933497786521912, "reward": 0.23420360684394836, "reward_std": 0.16933497786521912, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23756131529808044, "sampling/sampling_logp_difference/max": 2.162611961364746, "sampling/importance_sampling_ratio/min": 0.11502428352832794, "sampling/importance_sampling_ratio/mean": 1.0507766008377075, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0019322484731674, "clip_ratio/low_mean": 0.09170935861766338, "clip_ratio/low_min": 0.09170935861766338, "clip_ratio/high_mean": 0.15436112694442272, "clip_ratio/high_max": 0.15436112694442272, "clip_ratio/region_mean": 0.2460704855620861, "reward_total_mean": 0.23420360684394836, "reward_meter_mean": 0.6537008285522461, "reward_meter_std": 0.4205484986305237, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9908088445663452, "reward_lexical_plausibility_std": 0.025996576994657516, "reward_repeat_penalty_mean": 0.9815423488616943, "reward_repeat_penalty_std": 0.02558419480919838, "reward_repeat_floor_mean": 0.9976505041122437, "reward_repeat_floor_std": 0.0026978568639606237, "reward_near_duplicate_penalty_mean": 0.9887744188308716, "reward_near_duplicate_penalty_std": 0.007379098795354366, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.23420360684394836, "reward_total_composite_std": 0.16933497786521912, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 27.0} {"timestamp_utc": "2026-04-12T15:30:33Z", "mode": "train", "global_step": 28, "epoch": 0.0011246334899787122, "loss": 0.0357, "grad_norm": 11.514175415039062, "learning_rate": 9.918181818181818e-06, "num_tokens": 65139.0, "completions/mean_length": 63.5, "completions/min_length": 55.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.5, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.962704062461853, "rewards/meter/std": 0.06590832024812698, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.998999297618866, "rewards/repeat_penalty/std": 0.002014234196394682, "rewards/repeat_floor/mean": 0.9998499155044556, "rewards/repeat_floor/std": 0.00030213952413760126, "rewards/near_duplicate_penalty/mean": 0.998999297618866, "rewards/near_duplicate_penalty/std": 0.002014234196394682, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31323373317718506, "rewards/total_composite/std": 0.11740633845329285, "reward": 0.31323373317718506, "reward_std": 0.11740633100271225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2057531177997589, "sampling/sampling_logp_difference/max": 1.7660636901855469, "sampling/importance_sampling_ratio/min": 0.17100480198860168, "sampling/importance_sampling_ratio/mean": 1.002128005027771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8552557826042175, "clip_ratio/low_mean": 0.05429360922425985, "clip_ratio/low_min": 0.05429360922425985, "clip_ratio/high_mean": 0.13596890307962894, "clip_ratio/high_max": 0.13596890307962894, "clip_ratio/region_mean": 0.1902625123038888, "reward_total_mean": 0.31323373317718506, "reward_meter_mean": 0.962704062461853, "reward_meter_std": 0.06590832024812698, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.998999297618866, "reward_repeat_penalty_std": 0.002014234196394682, "reward_repeat_floor_mean": 0.9998499155044556, "reward_repeat_floor_std": 0.00030213952413760126, "reward_near_duplicate_penalty_mean": 0.998999297618866, "reward_near_duplicate_penalty_std": 0.002014234196394682, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.31323373317718506, "reward_total_composite_std": 0.11740633845329285, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 28.0} {"timestamp_utc": "2026-04-12T15:30:46Z", "mode": "train", "global_step": 29, "epoch": 0.0011647989717636664, "loss": 0.1162, "grad_norm": 9.114456176757812, "learning_rate": 9.915151515151515e-06, "num_tokens": 68295.0, "completions/mean_length": 157.5, "completions/min_length": 117.0, "completions/max_length": 212.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 157.5, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 212.0, "rewards/meter/mean": 0.13019584119319916, "rewards/meter/std": 0.09870223701000214, "rewards/count_adherence/mean": 0.984375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.995312511920929, "rewards/count_floor/std": 0.013258260674774647, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.9913126230239868, "rewards/repeat_penalty/std": 0.007308544125407934, "rewards/repeat_floor/mean": 0.99884432554245, "rewards/repeat_floor/std": 0.0006962743354961276, "rewards/near_duplicate_penalty/mean": 0.9937939643859863, "rewards/near_duplicate_penalty/std": 0.0016443743370473385, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9975025057792664, "rewards/distinct_2/std": 0.0070640011690557, "rewards/total_composite/mean": 0.0525735467672348, "rewards/total_composite/std": 0.04172529652714729, "reward": 0.0525735467672348, "reward_std": 0.04172529652714729, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23808272182941437, "sampling/sampling_logp_difference/max": 1.764352798461914, "sampling/importance_sampling_ratio/min": 0.17582903802394867, "sampling/importance_sampling_ratio/mean": 1.0574243068695068, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5588284730911255, "clip_ratio/low_mean": 0.1294011827558279, "clip_ratio/low_min": 0.1294011827558279, "clip_ratio/high_mean": 0.11166917532682419, "clip_ratio/high_max": 0.11166917532682419, "clip_ratio/region_mean": 0.2410703580826521, "reward_total_mean": 0.0525735467672348, "reward_meter_mean": 0.13019584119319916, "reward_meter_std": 0.09870223701000214, "reward_count_adherence_mean": 0.984375, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.995312511920929, "reward_count_floor_std": 0.013258260674774647, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9913126230239868, "reward_repeat_penalty_std": 0.007308544125407934, "reward_repeat_floor_mean": 0.99884432554245, "reward_repeat_floor_std": 0.0006962743354961276, "reward_near_duplicate_penalty_mean": 0.9937939643859863, "reward_near_duplicate_penalty_std": 0.0016443743370473385, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9975025057792664, "reward_distinct_2_std": 0.0070640011690557, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.0525735467672348, "reward_total_composite_std": 0.04172529652714729, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 29.0} {"timestamp_utc": "2026-04-12T15:30:57Z", "mode": "train", "global_step": 30, "epoch": 0.0012049644535486203, "loss": 0.1002, "grad_norm": 11.642829895019531, "learning_rate": 9.912121212121213e-06, "num_tokens": 70145.0, "completions/mean_length": 67.25, "completions/min_length": 53.0, "completions/max_length": 88.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.25, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.6778810024261475, "rewards/meter/std": 0.33140578866004944, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6599999666213989, "rewards/judge_quality/std": 0.2805097699165344, "rewards/repeat_penalty/mean": 0.9941116571426392, "rewards/repeat_penalty/std": 0.005025853868573904, "rewards/repeat_floor/mean": 0.9991167783737183, "rewards/repeat_floor/std": 0.000753876578528434, "rewards/near_duplicate_penalty/mean": 0.9941116571426392, "rewards/near_duplicate_penalty/std": 0.005025853868573904, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.467239111661911, "rewards/total_composite/std": 0.3392532467842102, "reward": 0.467239111661911, "reward_std": 0.3392532169818878, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16195835173130035, "sampling/sampling_logp_difference/max": 1.5645742416381836, "sampling/importance_sampling_ratio/min": 0.20917704701423645, "sampling/importance_sampling_ratio/mean": 1.00449538230896, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3717585802078247, "clip_ratio/low_mean": 0.10288059245795012, "clip_ratio/low_min": 0.10288059245795012, "clip_ratio/high_mean": 0.05898871552199125, "clip_ratio/high_max": 0.05898871552199125, "clip_ratio/region_mean": 0.16186930797994137, "reward_total_mean": 0.467239111661911, "reward_meter_mean": 0.6778810024261475, "reward_meter_std": 0.33140578866004944, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9941116571426392, "reward_repeat_penalty_std": 0.005025853868573904, "reward_repeat_floor_mean": 0.9991167783737183, "reward_repeat_floor_std": 0.000753876578528434, "reward_near_duplicate_penalty_mean": 0.9941116571426392, "reward_near_duplicate_penalty_std": 0.005025853868573904, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6599999666213989, "reward_judge_quality_std": 0.2805097699165344, "reward_total_composite_mean": 0.467239111661911, "reward_total_composite_std": 0.3392532467842102, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 30.0} {"timestamp_utc": "2026-04-12T15:31:08Z", "mode": "train", "global_step": 31, "epoch": 0.0012451299353335742, "loss": 0.0048, "grad_norm": 13.63132095336914, "learning_rate": 9.90909090909091e-06, "num_tokens": 71800.0, "completions/mean_length": 56.875, "completions/min_length": 34.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.875, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.4364202320575714, "rewards/meter/std": 0.3727029860019684, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.26385873556137085, "rewards/repeat_penalty/mean": 0.9707009792327881, "rewards/repeat_penalty/std": 0.05309678614139557, "rewards/repeat_floor/mean": 0.9960089325904846, "rewards/repeat_floor/std": 0.006874763872474432, "rewards/near_duplicate_penalty/mean": 0.9786378145217896, "rewards/near_duplicate_penalty/std": 0.03214501217007637, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.22145074605941772, "rewards/total_composite/std": 0.2818836569786072, "reward": 0.22145074605941772, "reward_std": 0.28188368678092957, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19524186849594116, "sampling/sampling_logp_difference/max": 2.38645076751709, "sampling/importance_sampling_ratio/min": 0.09195548295974731, "sampling/importance_sampling_ratio/mean": 1.041056513786316, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7630411237478256, "clip_ratio/low_mean": 0.13699123077094555, "clip_ratio/low_min": 0.13699123077094555, "clip_ratio/high_mean": 0.03808922600001097, "clip_ratio/high_max": 0.03808922600001097, "clip_ratio/region_mean": 0.17508045677095652, "reward_total_mean": 0.22145074605941772, "reward_meter_mean": 0.4364202320575714, "reward_meter_std": 0.3727029860019684, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9707009792327881, "reward_repeat_penalty_std": 0.05309678614139557, "reward_repeat_floor_mean": 0.9960089325904846, "reward_repeat_floor_std": 0.006874763872474432, "reward_near_duplicate_penalty_mean": 0.9786378145217896, "reward_near_duplicate_penalty_std": 0.03214501217007637, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.26385873556137085, "reward_total_composite_mean": 0.22145074605941772, "reward_total_composite_std": 0.2818836569786072, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 31.0} {"timestamp_utc": "2026-04-12T15:31:18Z", "mode": "train", "global_step": 32, "epoch": 0.0012852954171185284, "loss": 0.1396, "grad_norm": 12.520078659057617, "learning_rate": 9.906060606060607e-06, "num_tokens": 73554.0, "completions/mean_length": 57.25, "completions/min_length": 32.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.25, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.6373588442802429, "rewards/meter/std": 0.42701539397239685, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.99669349193573, "rewards/repeat_penalty/std": 0.00636273343116045, "rewards/repeat_floor/mean": 0.9995039701461792, "rewards/repeat_floor/std": 0.000954415590967983, "rewards/near_duplicate_penalty/mean": 0.99669349193573, "rewards/near_duplicate_penalty/std": 0.00636273343116045, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1878948211669922, "rewards/total_composite/std": 0.1571483612060547, "reward": 0.1878948211669922, "reward_std": 0.1571483612060547, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19454073905944824, "sampling/sampling_logp_difference/max": 1.4174580574035645, "sampling/importance_sampling_ratio/min": 0.24232923984527588, "sampling/importance_sampling_ratio/mean": 1.019760251045227, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9404871463775635, "clip_ratio/low_mean": 0.1199952345341444, "clip_ratio/low_min": 0.1199952345341444, "clip_ratio/high_mean": 0.0848543792963028, "clip_ratio/high_max": 0.0848543792963028, "clip_ratio/region_mean": 0.2048496138304472, "reward_total_mean": 0.1878948211669922, "reward_meter_mean": 0.6373588442802429, "reward_meter_std": 0.42701539397239685, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.99669349193573, "reward_repeat_penalty_std": 0.00636273343116045, "reward_repeat_floor_mean": 0.9995039701461792, "reward_repeat_floor_std": 0.000954415590967983, "reward_near_duplicate_penalty_mean": 0.99669349193573, "reward_near_duplicate_penalty_std": 0.00636273343116045, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.1878948211669922, "reward_total_composite_std": 0.1571483612060547, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 32.0} {"timestamp_utc": "2026-04-12T15:31:31Z", "mode": "train", "global_step": 33, "epoch": 0.0013254608989034823, "loss": 0.0278, "grad_norm": 8.586396217346191, "learning_rate": 9.903030303030305e-06, "num_tokens": 76304.0, "completions/mean_length": 154.75, "completions/min_length": 108.0, "completions/max_length": 204.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.75, "completions/min_terminated_length": 108.0, "completions/max_terminated_length": 204.0, "rewards/meter/mean": 0.36529800295829773, "rewards/meter/std": 0.22657908499240875, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9947916269302368, "rewards/lexical_plausibility/std": 0.014731398783624172, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9920752644538879, "rewards/repeat_penalty/std": 0.014160385355353355, "rewards/repeat_floor/mean": 0.9990055561065674, "rewards/repeat_floor/std": 0.0015801809495314956, "rewards/near_duplicate_penalty/mean": 0.9953945875167847, "rewards/near_duplicate_penalty/std": 0.004976656287908554, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9966261982917786, "rewards/distinct_2/std": 0.009542594663798809, "rewards/total_composite/mean": 0.0919654443860054, "rewards/total_composite/std": 0.06707508116960526, "reward": 0.0919654443860054, "reward_std": 0.06707508116960526, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23216886818408966, "sampling/sampling_logp_difference/max": 1.5689716339111328, "sampling/importance_sampling_ratio/min": 0.2082592397928238, "sampling/importance_sampling_ratio/mean": 1.0328764915466309, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7506909668445587, "clip_ratio/low_mean": 0.09479101933538914, "clip_ratio/low_min": 0.09479101933538914, "clip_ratio/high_mean": 0.11930768936872482, "clip_ratio/high_max": 0.11930768936872482, "clip_ratio/region_mean": 0.21409870870411396, "reward_total_mean": 0.0919654443860054, "reward_meter_mean": 0.36529800295829773, "reward_meter_std": 0.22657908499240875, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9947916269302368, "reward_lexical_plausibility_std": 0.014731398783624172, "reward_repeat_penalty_mean": 0.9920752644538879, "reward_repeat_penalty_std": 0.014160385355353355, "reward_repeat_floor_mean": 0.9990055561065674, "reward_repeat_floor_std": 0.0015801809495314956, "reward_near_duplicate_penalty_mean": 0.9953945875167847, "reward_near_duplicate_penalty_std": 0.004976656287908554, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9966261982917786, "reward_distinct_2_std": 0.009542594663798809, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.0919654443860054, "reward_total_composite_std": 0.06707508116960526, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 33.0} {"timestamp_utc": "2026-04-12T15:31:42Z", "mode": "train", "global_step": 34, "epoch": 0.0013656263806884363, "loss": 0.0938, "grad_norm": 10.180171012878418, "learning_rate": 9.9e-06, "num_tokens": 78449.0, "completions/mean_length": 103.125, "completions/min_length": 65.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.125, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.411704421043396, "rewards/meter/std": 0.3591403663158417, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3412500023841858, "rewards/judge_quality/std": 0.2391316145658493, "rewards/repeat_penalty/mean": 0.9769642353057861, "rewards/repeat_penalty/std": 0.01614268682897091, "rewards/repeat_floor/mean": 0.9971598386764526, "rewards/repeat_floor/std": 0.001443410525098443, "rewards/near_duplicate_penalty/mean": 0.9873068332672119, "rewards/near_duplicate_penalty/std": 0.007589713204652071, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9895973801612854, "rewards/distinct_2/std": 0.01927127316594124, "rewards/total_composite/mean": 0.09900060296058655, "rewards/total_composite/std": 0.07295992225408554, "reward": 0.09900060296058655, "reward_std": 0.07295991480350494, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22360895574092865, "sampling/sampling_logp_difference/max": 2.222749710083008, "sampling/importance_sampling_ratio/min": 0.10831087827682495, "sampling/importance_sampling_ratio/mean": 1.0236644744873047, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.525913953781128, "clip_ratio/low_mean": 0.1048739105463028, "clip_ratio/low_min": 0.1048739105463028, "clip_ratio/high_mean": 0.11431151069700718, "clip_ratio/high_max": 0.11431151069700718, "clip_ratio/region_mean": 0.21918542124330997, "reward_total_mean": 0.09900060296058655, "reward_meter_mean": 0.411704421043396, "reward_meter_std": 0.3591403663158417, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9769642353057861, "reward_repeat_penalty_std": 0.01614268682897091, "reward_repeat_floor_mean": 0.9971598386764526, "reward_repeat_floor_std": 0.001443410525098443, "reward_near_duplicate_penalty_mean": 0.9873068332672119, "reward_near_duplicate_penalty_std": 0.007589713204652071, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9895973801612854, "reward_distinct_2_std": 0.01927127316594124, "reward_judge_quality_mean": 0.3412500023841858, "reward_judge_quality_std": 0.2391316145658493, "reward_total_composite_mean": 0.09900060296058655, "reward_total_composite_std": 0.07295992225408554, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 34.0} {"timestamp_utc": "2026-04-12T15:31:57Z", "mode": "train", "global_step": 35, "epoch": 0.0014057918624733904, "loss": 0.0145, "grad_norm": 5.9968180656433105, "learning_rate": 9.896969696969699e-06, "num_tokens": 82036.0, "completions/mean_length": 238.375, "completions/min_length": 160.0, "completions/max_length": 372.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 238.375, "completions/min_terminated_length": 160.0, "completions/max_terminated_length": 372.0, "rewards/meter/mean": 0.38229402899742126, "rewards/meter/std": 0.2463291436433792, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.05750546231865883, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.017251653596758842, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.9921417236328125, "rewards/repeat_penalty/std": 0.0073619126342237, "rewards/repeat_floor/mean": 0.9989433288574219, "rewards/repeat_floor/std": 0.000841090630274266, "rewards/near_duplicate_penalty/mean": 0.9941961169242859, "rewards/near_duplicate_penalty/std": 0.00413910299539566, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9979321956634521, "rewards/distinct_2/std": 0.0058486973866820335, "rewards/total_composite/mean": 0.1344568133354187, "rewards/total_composite/std": 0.11377713084220886, "reward": 0.1344568133354187, "reward_std": 0.11377713084220886, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2276795357465744, "sampling/sampling_logp_difference/max": 1.8151664733886719, "sampling/importance_sampling_ratio/min": 0.1628108024597168, "sampling/importance_sampling_ratio/mean": 1.056570053100586, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9400649964809418, "clip_ratio/low_mean": 0.1554820965975523, "clip_ratio/low_min": 0.1554820965975523, "clip_ratio/high_mean": 0.0467352420091629, "clip_ratio/high_max": 0.0467352420091629, "clip_ratio/region_mean": 0.2022173386067152, "reward_total_mean": 0.1344568133354187, "reward_meter_mean": 0.38229402899742126, "reward_meter_std": 0.2463291436433792, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.05750546231865883, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.017251653596758842, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9921417236328125, "reward_repeat_penalty_std": 0.0073619126342237, "reward_repeat_floor_mean": 0.9989433288574219, "reward_repeat_floor_std": 0.000841090630274266, "reward_near_duplicate_penalty_mean": 0.9941961169242859, "reward_near_duplicate_penalty_std": 0.00413910299539566, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9979321956634521, "reward_distinct_2_std": 0.0058486973866820335, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.1344568133354187, "reward_total_composite_std": 0.11377713084220886, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 35.0} {"timestamp_utc": "2026-04-12T15:32:14Z", "mode": "train", "global_step": 36, "epoch": 0.0014459573442583444, "loss": -0.1239, "grad_norm": 3.8850080966949463, "learning_rate": 9.893939393939395e-06, "num_tokens": 85617.0, "completions/mean_length": 417.625, "completions/min_length": 273.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 361.0, "completions/min_terminated_length": 273.0, "completions/max_terminated_length": 441.0, "rewards/meter/mean": 0.3704602122306824, "rewards/meter/std": 0.2523605525493622, "rewards/count_adherence/mean": 0.904411792755127, "rewards/count_adherence/std": 0.05388972535729408, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9713234901428223, "rewards/count_floor/std": 0.016166917979717255, "rewards/lexical_plausibility/mean": 0.9926470518112183, "rewards/lexical_plausibility/std": 0.020797256380319595, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.11259915679693222, "rewards/repeat_penalty/mean": 0.9598931074142456, "rewards/repeat_penalty/std": 0.07228787988424301, "rewards/repeat_floor/mean": 0.9958555102348328, "rewards/repeat_floor/std": 0.006967020686715841, "rewards/near_duplicate_penalty/mean": 0.990498960018158, "rewards/near_duplicate_penalty/std": 0.009715107269585133, "rewards/opening_diversity/mean": 0.9934210777282715, "rewards/opening_diversity/std": 0.01860806532204151, "rewards/distinct_2/mean": 0.9741712212562561, "rewards/distinct_2/std": 0.04915395379066467, "rewards/total_composite/mean": 0.09012877196073532, "rewards/total_composite/std": 0.07985422015190125, "reward": 0.09012877196073532, "reward_std": 0.07985421270132065, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23293013870716095, "sampling/sampling_logp_difference/max": 1.5956039428710938, "sampling/importance_sampling_ratio/min": 0.20278601348400116, "sampling/importance_sampling_ratio/mean": 1.050012469291687, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.258246600627899, "clip_ratio/low_mean": 0.06290536001324654, "clip_ratio/low_min": 0.06290536001324654, "clip_ratio/high_mean": 0.053880227729678154, "clip_ratio/high_max": 0.053880227729678154, "clip_ratio/region_mean": 0.11678558774292469, "reward_total_mean": 0.09012877196073532, "reward_meter_mean": 0.3704602122306824, "reward_meter_std": 0.2523605525493622, "reward_count_adherence_mean": 0.904411792755127, "reward_count_adherence_std": 0.05388972535729408, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9713234901428223, "reward_count_floor_std": 0.016166917979717255, "reward_lexical_plausibility_mean": 0.9926470518112183, "reward_lexical_plausibility_std": 0.020797256380319595, "reward_repeat_penalty_mean": 0.9598931074142456, "reward_repeat_penalty_std": 0.07228787988424301, "reward_repeat_floor_mean": 0.9958555102348328, "reward_repeat_floor_std": 0.006967020686715841, "reward_near_duplicate_penalty_mean": 0.990498960018158, "reward_near_duplicate_penalty_std": 0.009715107269585133, "reward_opening_diversity_mean": 0.9934210777282715, "reward_opening_diversity_std": 0.01860806532204151, "reward_distinct_2_mean": 0.9741712212562561, "reward_distinct_2_std": 0.04915395379066467, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.11259915679693222, "reward_total_composite_mean": 0.09012877196073532, "reward_total_composite_std": 0.07985422015190125, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 36.0} {"timestamp_utc": "2026-04-12T15:32:25Z", "mode": "train", "global_step": 37, "epoch": 0.0014861228260432983, "loss": 0.0721, "grad_norm": 10.824390411376953, "learning_rate": 9.890909090909092e-06, "num_tokens": 87528.0, "completions/mean_length": 62.875, "completions/min_length": 43.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.875, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.8028993606567383, "rewards/meter/std": 0.3583672344684601, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9925150275230408, "rewards/repeat_penalty/std": 0.01191670261323452, "rewards/repeat_floor/mean": 0.998877227306366, "rewards/repeat_floor/std": 0.001787504879757762, "rewards/near_duplicate_penalty/mean": 0.9925150275230408, "rewards/near_duplicate_penalty/std": 0.01191670261323452, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2672617733478546, "rewards/total_composite/std": 0.14594782888889313, "reward": 0.2672617733478546, "reward_std": 0.14594782888889313, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21163925528526306, "sampling/sampling_logp_difference/max": 1.3112602233886719, "sampling/importance_sampling_ratio/min": 0.26948022842407227, "sampling/importance_sampling_ratio/mean": 1.0406631231307983, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2507003843784332, "clip_ratio/low_mean": 0.07544384896755219, "clip_ratio/low_min": 0.07544384896755219, "clip_ratio/high_mean": 0.16523032821714878, "clip_ratio/high_max": 0.16523032821714878, "clip_ratio/region_mean": 0.24067417718470097, "reward_total_mean": 0.2672617733478546, "reward_meter_mean": 0.8028993606567383, "reward_meter_std": 0.3583672344684601, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9925150275230408, "reward_repeat_penalty_std": 0.01191670261323452, "reward_repeat_floor_mean": 0.998877227306366, "reward_repeat_floor_std": 0.001787504879757762, "reward_near_duplicate_penalty_mean": 0.9925150275230408, "reward_near_duplicate_penalty_std": 0.01191670261323452, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.2672617733478546, "reward_total_composite_std": 0.14594782888889313, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 37.0} {"timestamp_utc": "2026-04-12T15:32:35Z", "mode": "train", "global_step": 38, "epoch": 0.0015262883078282525, "loss": -0.019, "grad_norm": 14.67089557647705, "learning_rate": 9.887878787878789e-06, "num_tokens": 89053.0, "completions/mean_length": 45.625, "completions/min_length": 33.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.625, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.40140506625175476, "rewards/meter/std": 0.4438471496105194, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9613440036773682, "rewards/lexical_plausibility/std": 0.09522879123687744, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.9098960161209106, "rewards/repeat_penalty/std": 0.1974615901708603, "rewards/repeat_floor/mean": 0.9886674880981445, "rewards/repeat_floor/std": 0.02346639521420002, "rewards/near_duplicate_penalty/mean": 0.9612413644790649, "rewards/near_duplicate_penalty/std": 0.053749240934848785, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9595141410827637, "rewards/distinct_2/std": 0.11451122164726257, "rewards/total_composite/mean": 0.16040226817131042, "rewards/total_composite/std": 0.1722187101840973, "reward": 0.16040226817131042, "reward_std": 0.1722187101840973, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2073492407798767, "sampling/sampling_logp_difference/max": 1.552976131439209, "sampling/importance_sampling_ratio/min": 0.21161723136901855, "sampling/importance_sampling_ratio/mean": 1.0489842891693115, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7606774419546127, "clip_ratio/low_mean": 0.13604292180389166, "clip_ratio/low_min": 0.13604292180389166, "clip_ratio/high_mean": 0.06482307612895966, "clip_ratio/high_max": 0.06482307612895966, "clip_ratio/region_mean": 0.20086599793285131, "reward_total_mean": 0.16040226817131042, "reward_meter_mean": 0.40140506625175476, "reward_meter_std": 0.4438471496105194, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9613440036773682, "reward_lexical_plausibility_std": 0.09522879123687744, "reward_repeat_penalty_mean": 0.9098960161209106, "reward_repeat_penalty_std": 0.1974615901708603, "reward_repeat_floor_mean": 0.9886674880981445, "reward_repeat_floor_std": 0.02346639521420002, "reward_near_duplicate_penalty_mean": 0.9612413644790649, "reward_near_duplicate_penalty_std": 0.053749240934848785, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9595141410827637, "reward_distinct_2_std": 0.11451122164726257, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.16040226817131042, "reward_total_composite_std": 0.1722187101840973, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 38.0} {"timestamp_utc": "2026-04-12T15:32:51Z", "mode": "train", "global_step": 39, "epoch": 0.0015664537896132064, "loss": 0.1693, "grad_norm": 3.7285618782043457, "learning_rate": 9.884848484848486e-06, "num_tokens": 93483.0, "completions/mean_length": 436.75, "completions/min_length": 336.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 411.66668701171875, "completions/min_terminated_length": 336.0, "completions/max_terminated_length": 478.0, "rewards/meter/mean": 0.7699059247970581, "rewards/meter/std": 0.3402743935585022, "rewards/count_adherence/mean": 0.9615384340286255, "rewards/count_adherence/std": 0.041117113083601, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9884614944458008, "rewards/count_floor/std": 0.012335150502622128, "rewards/lexical_plausibility/mean": 0.9794768691062927, "rewards/lexical_plausibility/std": 0.05804818123579025, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.9960432052612305, "rewards/repeat_penalty/std": 0.0015128182712942362, "rewards/repeat_floor/mean": 0.9994064569473267, "rewards/repeat_floor/std": 0.00022692015045322478, "rewards/near_duplicate_penalty/mean": 0.9960432052612305, "rewards/near_duplicate_penalty/std": 0.0015128182712942362, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1492643654346466, "rewards/total_composite/std": 0.0966491624712944, "reward": 0.1492643654346466, "reward_std": 0.0966491550207138, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21291592717170715, "sampling/sampling_logp_difference/max": 1.6394968032836914, "sampling/importance_sampling_ratio/min": 0.19407767057418823, "sampling/importance_sampling_ratio/mean": 1.039568305015564, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.262940913438797, "clip_ratio/low_mean": 0.10346917249262333, "clip_ratio/low_min": 0.10346917249262333, "clip_ratio/high_mean": 0.02666666731238365, "clip_ratio/high_max": 0.02666666731238365, "clip_ratio/region_mean": 0.13013583980500698, "reward_total_mean": 0.1492643654346466, "reward_meter_mean": 0.7699059247970581, "reward_meter_std": 0.3402743935585022, "reward_count_adherence_mean": 0.9615384340286255, "reward_count_adherence_std": 0.041117113083601, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9884614944458008, "reward_count_floor_std": 0.012335150502622128, "reward_lexical_plausibility_mean": 0.9794768691062927, "reward_lexical_plausibility_std": 0.05804818123579025, "reward_repeat_penalty_mean": 0.9960432052612305, "reward_repeat_penalty_std": 0.0015128182712942362, "reward_repeat_floor_mean": 0.9994064569473267, "reward_repeat_floor_std": 0.00022692015045322478, "reward_near_duplicate_penalty_mean": 0.9960432052612305, "reward_near_duplicate_penalty_std": 0.0015128182712942362, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.1492643654346466, "reward_total_composite_std": 0.0966491624712944, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 39.0} {"timestamp_utc": "2026-04-12T15:33:02Z", "mode": "train", "global_step": 40, "epoch": 0.0016066192713981603, "loss": 0.0421, "grad_norm": 14.545975685119629, "learning_rate": 9.881818181818182e-06, "num_tokens": 95288.0, "completions/mean_length": 52.625, "completions/min_length": 36.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.6627398729324341, "rewards/meter/std": 0.4211808443069458, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9653618931770325, "rewards/lexical_plausibility/std": 0.06416625529527664, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.10350983589887619, "rewards/repeat_penalty/mean": 0.9966648817062378, "rewards/repeat_penalty/std": 0.006504828110337257, "rewards/repeat_floor/mean": 0.9994997382164001, "rewards/repeat_floor/std": 0.0009757138323038816, "rewards/near_duplicate_penalty/mean": 0.9966648817062378, "rewards/near_duplicate_penalty/std": 0.006504828110337257, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24780182540416718, "rewards/total_composite/std": 0.18882529437541962, "reward": 0.24780182540416718, "reward_std": 0.1888253092765808, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2167918086051941, "sampling/sampling_logp_difference/max": 1.2831764221191406, "sampling/importance_sampling_ratio/min": 0.2771555483341217, "sampling/importance_sampling_ratio/mean": 1.0531648397445679, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5625782012939453, "clip_ratio/low_mean": 0.09673448745161295, "clip_ratio/low_min": 0.09673448745161295, "clip_ratio/high_mean": 0.10798456333577633, "clip_ratio/high_max": 0.10798456333577633, "clip_ratio/region_mean": 0.20471905078738928, "reward_total_mean": 0.24780182540416718, "reward_meter_mean": 0.6627398729324341, "reward_meter_std": 0.4211808443069458, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9653618931770325, "reward_lexical_plausibility_std": 0.06416625529527664, "reward_repeat_penalty_mean": 0.9966648817062378, "reward_repeat_penalty_std": 0.006504828110337257, "reward_repeat_floor_mean": 0.9994997382164001, "reward_repeat_floor_std": 0.0009757138323038816, "reward_near_duplicate_penalty_mean": 0.9966648817062378, "reward_near_duplicate_penalty_std": 0.006504828110337257, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.10350983589887619, "reward_total_composite_mean": 0.24780182540416718, "reward_total_composite_std": 0.18882529437541962, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 40.0} {"timestamp_utc": "2026-04-12T15:33:08Z", "mode": "train", "global_step": 41, "epoch": 0.0016467847531831145, "loss": 0.0762, "grad_norm": 18.142820358276367, "learning_rate": 9.87878787878788e-06, "num_tokens": 96765.0, "completions/mean_length": 28.625, "completions/min_length": 28.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.6262686252593994, "rewards/meter/std": 0.21932648122310638, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9275000095367432, "rewards/judge_quality/std": 0.013887288980185986, "rewards/repeat_penalty/mean": 0.995519757270813, "rewards/repeat_penalty/std": 0.001612812397070229, "rewards/repeat_floor/mean": 0.9993279576301575, "rewards/repeat_floor/std": 0.0002419229131191969, "rewards/near_duplicate_penalty/mean": 0.995519757270813, "rewards/near_duplicate_penalty/std": 0.001612812397070229, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5809922814369202, "rewards/total_composite/std": 0.20403531193733215, "reward": 0.5809922814369202, "reward_std": 0.20403531193733215, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04791252315044403, "sampling/sampling_logp_difference/max": 1.212748646736145, "sampling/importance_sampling_ratio/min": 0.2973787784576416, "sampling/importance_sampling_ratio/mean": 0.9945252537727356, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.19142003450542688, "clip_ratio/low_mean": 0.022727273404598236, "clip_ratio/low_min": 0.022727273404598236, "clip_ratio/high_mean": 0.022321429569274187, "clip_ratio/high_max": 0.022321429569274187, "clip_ratio/region_mean": 0.04504870297387242, "reward_total_mean": 0.5809922814369202, "reward_meter_mean": 0.6262686252593994, "reward_meter_std": 0.21932648122310638, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.995519757270813, "reward_repeat_penalty_std": 0.001612812397070229, "reward_repeat_floor_mean": 0.9993279576301575, "reward_repeat_floor_std": 0.0002419229131191969, "reward_near_duplicate_penalty_mean": 0.995519757270813, "reward_near_duplicate_penalty_std": 0.001612812397070229, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9275000095367432, "reward_judge_quality_std": 0.013887288980185986, "reward_total_composite_mean": 0.5809922814369202, "reward_total_composite_std": 0.20403531193733215, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 41.0} {"timestamp_utc": "2026-04-12T15:33:23Z", "mode": "train", "global_step": 42, "epoch": 0.0016869502349680684, "loss": 0.1345, "grad_norm": 1.6544698476791382, "learning_rate": 9.875757575757576e-06, "num_tokens": 99084.0, "completions/mean_length": 507.875, "completions/min_length": 479.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 479.0, "completions/min_terminated_length": 479.0, "completions/max_terminated_length": 479.0, "rewards/meter/mean": 0.6511483192443848, "rewards/meter/std": 0.3560481667518616, "rewards/count_adherence/mean": 0.9500000476837158, "rewards/count_adherence/std": 0.030860668048262596, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.009258192032575607, "rewards/lexical_plausibility/mean": 0.9631125926971436, "rewards/lexical_plausibility/std": 0.04655386880040169, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9927043914794922, "rewards/repeat_penalty/std": 0.0060564796440303326, "rewards/repeat_floor/mean": 0.9990572929382324, "rewards/repeat_floor/std": 0.0006409144261851907, "rewards/near_duplicate_penalty/mean": 0.9952572584152222, "rewards/near_duplicate_penalty/std": 0.001910837716422975, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9974303245544434, "rewards/distinct_2/std": 0.004765058867633343, "rewards/total_composite/mean": 0.1181429922580719, "rewards/total_composite/std": 0.10310676693916321, "reward": 0.1181429922580719, "reward_std": 0.10310675948858261, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21991652250289917, "sampling/sampling_logp_difference/max": 1.5076560974121094, "sampling/importance_sampling_ratio/min": 0.22142839431762695, "sampling/importance_sampling_ratio/mean": 1.0317631959915161, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3663713037967682, "clip_ratio/low_mean": 0.019050104543566704, "clip_ratio/low_min": 0.019050104543566704, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.019050104543566704, "reward_total_mean": 0.1181429922580719, "reward_meter_mean": 0.6511483192443848, "reward_meter_std": 0.3560481667518616, "reward_count_adherence_mean": 0.9500000476837158, "reward_count_adherence_std": 0.030860668048262596, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.009258192032575607, "reward_lexical_plausibility_mean": 0.9631125926971436, "reward_lexical_plausibility_std": 0.04655386880040169, "reward_repeat_penalty_mean": 0.9927043914794922, "reward_repeat_penalty_std": 0.0060564796440303326, "reward_repeat_floor_mean": 0.9990572929382324, "reward_repeat_floor_std": 0.0006409144261851907, "reward_near_duplicate_penalty_mean": 0.9952572584152222, "reward_near_duplicate_penalty_std": 0.001910837716422975, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9974303245544434, "reward_distinct_2_std": 0.004765058867633343, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.1181429922580719, "reward_total_composite_std": 0.10310676693916321, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 42.0} {"timestamp_utc": "2026-04-12T15:33:34Z", "mode": "train", "global_step": 43, "epoch": 0.0017271157167530224, "loss": 0.0228, "grad_norm": 13.056751251220703, "learning_rate": 9.872727272727274e-06, "num_tokens": 101057.0, "completions/mean_length": 76.625, "completions/min_length": 42.0, "completions/max_length": 103.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 76.625, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.5245823860168457, "rewards/meter/std": 0.3338170349597931, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9497177600860596, "rewards/lexical_plausibility/std": 0.08389555662870407, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9922226071357727, "rewards/repeat_penalty/std": 0.005637835245579481, "rewards/repeat_floor/mean": 0.9988333582878113, "rewards/repeat_floor/std": 0.0008456670329906046, "rewards/near_duplicate_penalty/mean": 0.9922226071357727, "rewards/near_duplicate_penalty/std": 0.005637835245579481, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14095836877822876, "rewards/total_composite/std": 0.10865902900695801, "reward": 0.14095836877822876, "reward_std": 0.10865902900695801, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2289411872625351, "sampling/sampling_logp_difference/max": 1.0979537963867188, "sampling/importance_sampling_ratio/min": 0.33355289697647095, "sampling/importance_sampling_ratio/mean": 1.0378375053405762, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9542465806007385, "clip_ratio/low_mean": 0.10622397344559431, "clip_ratio/low_min": 0.10622397344559431, "clip_ratio/high_mean": 0.07670014910399914, "clip_ratio/high_max": 0.07670014910399914, "clip_ratio/region_mean": 0.18292412254959345, "reward_total_mean": 0.14095836877822876, "reward_meter_mean": 0.5245823860168457, "reward_meter_std": 0.3338170349597931, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9497177600860596, "reward_lexical_plausibility_std": 0.08389555662870407, "reward_repeat_penalty_mean": 0.9922226071357727, "reward_repeat_penalty_std": 0.005637835245579481, "reward_repeat_floor_mean": 0.9988333582878113, "reward_repeat_floor_std": 0.0008456670329906046, "reward_near_duplicate_penalty_mean": 0.9922226071357727, "reward_near_duplicate_penalty_std": 0.005637835245579481, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.14095836877822876, "reward_total_composite_std": 0.10865902900695801, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 43.0} {"timestamp_utc": "2026-04-12T15:33:45Z", "mode": "train", "global_step": 44, "epoch": 0.0017672811985379765, "loss": 0.0465, "grad_norm": 10.664681434631348, "learning_rate": 9.869696969696971e-06, "num_tokens": 103524.0, "completions/mean_length": 133.375, "completions/min_length": 125.0, "completions/max_length": 141.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.375, "completions/min_terminated_length": 125.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.6796356439590454, "rewards/meter/std": 0.3681916892528534, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9957386255264282, "rewards/lexical_plausibility/std": 0.012052967213094234, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9921809434890747, "rewards/repeat_penalty/std": 0.00745220435783267, "rewards/repeat_floor/mean": 0.9988270998001099, "rewards/repeat_floor/std": 0.0011178392451256514, "rewards/near_duplicate_penalty/mean": 0.9921809434890747, "rewards/near_duplicate_penalty/std": 0.00745220435783267, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25574326515197754, "rewards/total_composite/std": 0.160466730594635, "reward": 0.25574326515197754, "reward_std": 0.160466730594635, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20719045400619507, "sampling/sampling_logp_difference/max": 2.266843318939209, "sampling/importance_sampling_ratio/min": 0.10363882035017014, "sampling/importance_sampling_ratio/mean": 1.025524616241455, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9783300161361694, "clip_ratio/low_mean": 0.0797614585608244, "clip_ratio/low_min": 0.0797614585608244, "clip_ratio/high_mean": 0.12393800355494022, "clip_ratio/high_max": 0.12393800355494022, "clip_ratio/region_mean": 0.20369946211576462, "reward_total_mean": 0.25574326515197754, "reward_meter_mean": 0.6796356439590454, "reward_meter_std": 0.3681916892528534, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9957386255264282, "reward_lexical_plausibility_std": 0.012052967213094234, "reward_repeat_penalty_mean": 0.9921809434890747, "reward_repeat_penalty_std": 0.00745220435783267, "reward_repeat_floor_mean": 0.9988270998001099, "reward_repeat_floor_std": 0.0011178392451256514, "reward_near_duplicate_penalty_mean": 0.9921809434890747, "reward_near_duplicate_penalty_std": 0.00745220435783267, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.25574326515197754, "reward_total_composite_std": 0.160466730594635, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 44.0} {"timestamp_utc": "2026-04-12T15:33:55Z", "mode": "train", "global_step": 45, "epoch": 0.0018074466803229305, "loss": 0.0274, "grad_norm": 13.253972053527832, "learning_rate": 9.866666666666668e-06, "num_tokens": 105392.0, "completions/mean_length": 60.5, "completions/min_length": 45.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.5, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.5734286308288574, "rewards/meter/std": 0.4587654173374176, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9921802282333374, "rewards/repeat_penalty/std": 0.00954827107489109, "rewards/repeat_floor/mean": 0.9988269805908203, "rewards/repeat_floor/std": 0.0014322433853521943, "rewards/near_duplicate_penalty/mean": 0.9921802282333374, "rewards/near_duplicate_penalty/std": 0.00954827107489109, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24287740886211395, "rewards/total_composite/std": 0.19906795024871826, "reward": 0.24287740886211395, "reward_std": 0.19906793534755707, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2012096345424652, "sampling/sampling_logp_difference/max": 1.835031509399414, "sampling/importance_sampling_ratio/min": 0.15960848331451416, "sampling/importance_sampling_ratio/mean": 1.0404279232025146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1705244183540344, "clip_ratio/low_mean": 0.08109668269753456, "clip_ratio/low_min": 0.08109668269753456, "clip_ratio/high_mean": 0.1209473479539156, "clip_ratio/high_max": 0.1209473479539156, "clip_ratio/region_mean": 0.20204403065145016, "reward_total_mean": 0.24287740886211395, "reward_meter_mean": 0.5734286308288574, "reward_meter_std": 0.4587654173374176, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9921802282333374, "reward_repeat_penalty_std": 0.00954827107489109, "reward_repeat_floor_mean": 0.9988269805908203, "reward_repeat_floor_std": 0.0014322433853521943, "reward_near_duplicate_penalty_mean": 0.9921802282333374, "reward_near_duplicate_penalty_std": 0.00954827107489109, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.24287740886211395, "reward_total_composite_std": 0.19906795024871826, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 45.0} {"timestamp_utc": "2026-04-12T15:34:05Z", "mode": "train", "global_step": 46, "epoch": 0.0018476121621078844, "loss": 0.2277, "grad_norm": 18.42459487915039, "learning_rate": 9.863636363636364e-06, "num_tokens": 106794.0, "completions/mean_length": 53.25, "completions/min_length": 34.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.5852382779121399, "rewards/meter/std": 0.4186255633831024, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.7778487801551819, "rewards/lexical_plausibility/std": 0.20808249711990356, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9214205741882324, "rewards/repeat_penalty/std": 0.12742295861244202, "rewards/repeat_floor/mean": 0.9904617667198181, "rewards/repeat_floor/std": 0.01590562053024769, "rewards/near_duplicate_penalty/mean": 0.9674508571624756, "rewards/near_duplicate_penalty/std": 0.05521593987941742, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9482681155204773, "rewards/distinct_2/std": 0.08636173605918884, "rewards/total_composite/mean": 0.08721469342708588, "rewards/total_composite/std": 0.06235937774181366, "reward": 0.08721469342708588, "reward_std": 0.06235937401652336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2607600688934326, "sampling/sampling_logp_difference/max": 2.129840850830078, "sampling/importance_sampling_ratio/min": 0.11885620653629303, "sampling/importance_sampling_ratio/mean": 1.0428297519683838, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.413048952817917, "clip_ratio/low_mean": 0.08067348599433899, "clip_ratio/low_min": 0.08067348599433899, "clip_ratio/high_mean": 0.1449983101338148, "clip_ratio/high_max": 0.1449983101338148, "clip_ratio/region_mean": 0.2256717961281538, "reward_total_mean": 0.08721469342708588, "reward_meter_mean": 0.5852382779121399, "reward_meter_std": 0.4186255633831024, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.7778487801551819, "reward_lexical_plausibility_std": 0.20808249711990356, "reward_repeat_penalty_mean": 0.9214205741882324, "reward_repeat_penalty_std": 0.12742295861244202, "reward_repeat_floor_mean": 0.9904617667198181, "reward_repeat_floor_std": 0.01590562053024769, "reward_near_duplicate_penalty_mean": 0.9674508571624756, "reward_near_duplicate_penalty_std": 0.05521593987941742, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9482681155204773, "reward_distinct_2_std": 0.08636173605918884, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.08721469342708588, "reward_total_composite_std": 0.06235937774181366, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 46.0} {"timestamp_utc": "2026-04-12T15:34:15Z", "mode": "train", "global_step": 47, "epoch": 0.0018877776438928386, "loss": 0.079, "grad_norm": 24.17237663269043, "learning_rate": 9.860606060606061e-06, "num_tokens": 108435.0, "completions/mean_length": 35.125, "completions/min_length": 28.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.4072815477848053, "rewards/meter/std": 0.3229300379753113, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9438661336898804, "rewards/lexical_plausibility/std": 0.06871479749679565, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.990066647529602, "rewards/repeat_penalty/std": 0.014448706060647964, "rewards/repeat_floor/mean": 0.9985100030899048, "rewards/repeat_floor/std": 0.0021673087030649185, "rewards/near_duplicate_penalty/mean": 0.990066647529602, "rewards/near_duplicate_penalty/std": 0.014448706060647964, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18267777562141418, "rewards/total_composite/std": 0.14632606506347656, "reward": 0.18267777562141418, "reward_std": 0.14632606506347656, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23760807514190674, "sampling/sampling_logp_difference/max": 1.9303264617919922, "sampling/importance_sampling_ratio/min": 0.14510083198547363, "sampling/importance_sampling_ratio/mean": 0.996955156326294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5569427162408829, "clip_ratio/low_mean": 0.12464997917413712, "clip_ratio/low_min": 0.12464997917413712, "clip_ratio/high_mean": 0.06870941631495953, "clip_ratio/high_max": 0.06870941631495953, "clip_ratio/region_mean": 0.19335939548909664, "reward_total_mean": 0.18267777562141418, "reward_meter_mean": 0.4072815477848053, "reward_meter_std": 0.3229300379753113, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9438661336898804, "reward_lexical_plausibility_std": 0.06871479749679565, "reward_repeat_penalty_mean": 0.990066647529602, "reward_repeat_penalty_std": 0.014448706060647964, "reward_repeat_floor_mean": 0.9985100030899048, "reward_repeat_floor_std": 0.0021673087030649185, "reward_near_duplicate_penalty_mean": 0.990066647529602, "reward_near_duplicate_penalty_std": 0.014448706060647964, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.18267777562141418, "reward_total_composite_std": 0.14632606506347656, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 47.0} {"timestamp_utc": "2026-04-12T15:34:27Z", "mode": "train", "global_step": 48, "epoch": 0.0019279431256777925, "loss": 0.1594, "grad_norm": 9.763179779052734, "learning_rate": 9.857575757575758e-06, "num_tokens": 110717.0, "completions/mean_length": 108.25, "completions/min_length": 76.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 108.25, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 140.0, "rewards/meter/mean": 0.5324523448944092, "rewards/meter/std": 0.2819362282752991, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9986978769302368, "rewards/lexical_plausibility/std": 0.0036828548181802034, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.172688826918602, "rewards/repeat_penalty/mean": 0.9970675706863403, "rewards/repeat_penalty/std": 0.0017854582984000444, "rewards/repeat_floor/mean": 0.9995601177215576, "rewards/repeat_floor/std": 0.0002678222372196615, "rewards/near_duplicate_penalty/mean": 0.9970675706863403, "rewards/near_duplicate_penalty/std": 0.0017854582984000444, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2149481475353241, "rewards/total_composite/std": 0.09053788334131241, "reward": 0.2149481475353241, "reward_std": 0.09053788334131241, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17114581167697906, "sampling/sampling_logp_difference/max": 1.2221838235855103, "sampling/importance_sampling_ratio/min": 0.2945861518383026, "sampling/importance_sampling_ratio/mean": 1.0245773792266846, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5544067025184631, "clip_ratio/low_mean": 0.07282837852835655, "clip_ratio/low_min": 0.07282837852835655, "clip_ratio/high_mean": 0.08689650148153305, "clip_ratio/high_max": 0.08689650148153305, "clip_ratio/region_mean": 0.1597248800098896, "reward_total_mean": 0.2149481475353241, "reward_meter_mean": 0.5324523448944092, "reward_meter_std": 0.2819362282752991, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9986978769302368, "reward_lexical_plausibility_std": 0.0036828548181802034, "reward_repeat_penalty_mean": 0.9970675706863403, "reward_repeat_penalty_std": 0.0017854582984000444, "reward_repeat_floor_mean": 0.9995601177215576, "reward_repeat_floor_std": 0.0002678222372196615, "reward_near_duplicate_penalty_mean": 0.9970675706863403, "reward_near_duplicate_penalty_std": 0.0017854582984000444, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.172688826918602, "reward_total_composite_mean": 0.2149481475353241, "reward_total_composite_std": 0.09053788334131241, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 48.0} {"timestamp_utc": "2026-04-12T15:34:39Z", "mode": "train", "global_step": 49, "epoch": 0.0019681086074627464, "loss": 0.1162, "grad_norm": 15.116177558898926, "learning_rate": 9.854545454545456e-06, "num_tokens": 112441.0, "completions/mean_length": 51.5, "completions/min_length": 35.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.3499334156513214, "rewards/meter/std": 0.37027695775032043, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.35374999046325684, "rewards/judge_quality/std": 0.24224767088890076, "rewards/repeat_penalty/mean": 0.9889936447143555, "rewards/repeat_penalty/std": 0.009213130921125412, "rewards/repeat_floor/mean": 0.9983490705490112, "rewards/repeat_floor/std": 0.0013819633750244975, "rewards/near_duplicate_penalty/mean": 0.9889936447143555, "rewards/near_duplicate_penalty/std": 0.009213130921125412, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09926129877567291, "rewards/total_composite/std": 0.1285303235054016, "reward": 0.09926129877567291, "reward_std": 0.12853030860424042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24942898750305176, "sampling/sampling_logp_difference/max": 2.068516254425049, "sampling/importance_sampling_ratio/min": 0.12637315690517426, "sampling/importance_sampling_ratio/mean": 1.0445268154144287, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.220777377486229, "clip_ratio/low_mean": 0.14375014416873455, "clip_ratio/low_min": 0.14375014416873455, "clip_ratio/high_mean": 0.0872842688113451, "clip_ratio/high_max": 0.0872842688113451, "clip_ratio/region_mean": 0.23103441298007965, "reward_total_mean": 0.09926129877567291, "reward_meter_mean": 0.3499334156513214, "reward_meter_std": 0.37027695775032043, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9889936447143555, "reward_repeat_penalty_std": 0.009213130921125412, "reward_repeat_floor_mean": 0.9983490705490112, "reward_repeat_floor_std": 0.0013819633750244975, "reward_near_duplicate_penalty_mean": 0.9889936447143555, "reward_near_duplicate_penalty_std": 0.009213130921125412, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35374999046325684, "reward_judge_quality_std": 0.24224767088890076, "reward_total_composite_mean": 0.09926129877567291, "reward_total_composite_std": 0.1285303235054016, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 49.0} {"timestamp_utc": "2026-04-12T15:34:49Z", "mode": "train", "global_step": 50, "epoch": 0.0020082740892477004, "loss": 0.0165, "grad_norm": 12.628697395324707, "learning_rate": 9.851515151515151e-06, "num_tokens": 114218.0, "completions/mean_length": 65.125, "completions/min_length": 50.0, "completions/max_length": 101.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.125, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.17972107231616974, "rewards/meter/std": 0.2734915316104889, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5837500095367432, "rewards/judge_quality/std": 0.2557307481765747, "rewards/repeat_penalty/mean": 0.9935485124588013, "rewards/repeat_penalty/std": 0.013540077954530716, "rewards/repeat_floor/mean": 0.9990322589874268, "rewards/repeat_floor/std": 0.002030999632552266, "rewards/near_duplicate_penalty/mean": 0.9935485124588013, "rewards/near_duplicate_penalty/std": 0.013540077954530716, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09714251756668091, "rewards/total_composite/std": 0.12042219936847687, "reward": 0.09714251756668091, "reward_std": 0.12042219936847687, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2302437573671341, "sampling/sampling_logp_difference/max": 1.4848899841308594, "sampling/importance_sampling_ratio/min": 0.22652727365493774, "sampling/importance_sampling_ratio/mean": 1.0109827518463135, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2434477508068085, "clip_ratio/low_mean": 0.1374474922195077, "clip_ratio/low_min": 0.1374474922195077, "clip_ratio/high_mean": 0.07342592626810074, "clip_ratio/high_max": 0.07342592626810074, "clip_ratio/region_mean": 0.21087341848760843, "reward_total_mean": 0.09714251756668091, "reward_meter_mean": 0.17972107231616974, "reward_meter_std": 0.2734915316104889, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9935485124588013, "reward_repeat_penalty_std": 0.013540077954530716, "reward_repeat_floor_mean": 0.9990322589874268, "reward_repeat_floor_std": 0.002030999632552266, "reward_near_duplicate_penalty_mean": 0.9935485124588013, "reward_near_duplicate_penalty_std": 0.013540077954530716, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5837500095367432, "reward_judge_quality_std": 0.2557307481765747, "reward_total_composite_mean": 0.09714251756668091, "reward_total_composite_std": 0.12042219936847687, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 50.0} {"timestamp_utc": "2026-04-12T15:37:32Z", "mode": "eval", "global_step": 50, "epoch": 0.0020082740892477004, "eval_loss": NaN, "eval_runtime": 163.655, "eval_samples_per_second": 0.635, "eval_steps_per_second": 0.079, "eval_num_tokens": 114218.0, "eval_completions/mean_length": 175.16346153846155, "eval_completions/min_length": 38.23076923076923, "eval_completions/max_length": 416.61538461538464, "eval_completions/clipped_ratio": 0.04807692307692308, "eval_completions/mean_terminated_length": 158.04258493276743, "eval_completions/min_terminated_length": 38.23076923076923, "eval_completions/max_terminated_length": 333.9230769230769, "eval_rewards/meter/mean": 0.31429795691600215, "eval_rewards/meter/std": 0.32833211009319013, "eval_rewards/count_adherence/mean": 0.9764095040468069, "eval_rewards/count_adherence/std": 0.04316165212255258, "eval_rewards/arabic_clean/mean": 0.9230769230769231, "eval_rewards/arabic_clean/std": 0.1987869510283837, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9956730741720933, "eval_rewards/arabic_floor/std": 0.012238385012516608, "eval_rewards/count_floor/mean": 0.992922842502594, "eval_rewards/count_floor/std": 0.01294849870296625, "eval_rewards/lexical_plausibility/mean": 0.9796242438829862, "eval_rewards/lexical_plausibility/std": 0.045520682783367544, "eval_rewards/judge_quality/mean": 0.36173075896043044, "eval_rewards/judge_quality/std": 0.1917116017295764, "eval_rewards/repeat_penalty/mean": 0.9708329714261569, "eval_rewards/repeat_penalty/std": 0.0467274531077307, "eval_rewards/repeat_floor/mean": 0.9970654936937186, "eval_rewards/repeat_floor/std": 0.004295328734979893, "eval_rewards/near_duplicate_penalty/mean": 0.989183797286107, "eval_rewards/near_duplicate_penalty/std": 0.014242813295613114, "eval_rewards/opening_diversity/mean": 0.9921875, "eval_rewards/opening_diversity/std": 0.022097086533904076, "eval_rewards/distinct_2/mean": 0.9906296409093417, "eval_rewards/distinct_2/std": 0.019931892918136258, "eval_rewards/total_composite/mean": 0.10798603410904224, "eval_rewards/total_composite/std": 0.12781854145801985, "eval_reward": 0.10798603410904224, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.15063365606161264, "eval_sampling/sampling_logp_difference/max": 1.2357948743380034, "eval_sampling/importance_sampling_ratio/min": 0.29498302936553955, "eval_sampling/importance_sampling_ratio/mean": 1.0426076375521147, "eval_sampling/importance_sampling_ratio/max": 1.624151321557852, "eval_entropy": 2.499734410872826, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.10798603410904224, "eval_reward_meter_mean": 0.31429795691600215, "eval_reward_meter_std": 0.32833211009319013, "eval_reward_count_adherence_mean": 0.9764095040468069, "eval_reward_count_adherence_std": 0.04316165212255258, "eval_reward_arabic_clean_mean": 0.9230769230769231, "eval_reward_arabic_clean_std": 0.1987869510283837, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9956730741720933, "eval_reward_arabic_floor_std": 0.012238385012516608, "eval_reward_count_floor_mean": 0.992922842502594, "eval_reward_count_floor_std": 0.01294849870296625, "eval_reward_lexical_plausibility_mean": 0.9796242438829862, "eval_reward_lexical_plausibility_std": 0.045520682783367544, "eval_reward_repeat_penalty_mean": 0.9708329714261569, "eval_reward_repeat_penalty_std": 0.0467274531077307, "eval_reward_repeat_floor_mean": 0.9970654936937186, "eval_reward_repeat_floor_std": 0.004295328734979893, "eval_reward_near_duplicate_penalty_mean": 0.989183797286107, "eval_reward_near_duplicate_penalty_std": 0.014242813295613114, "eval_reward_opening_diversity_mean": 0.9921875, "eval_reward_opening_diversity_std": 0.022097086533904076, "eval_reward_distinct_2_mean": 0.9906296409093417, "eval_reward_distinct_2_std": 0.019931892918136258, "eval_reward_judge_quality_mean": 0.36173075896043044, "eval_reward_judge_quality_std": 0.1917116017295764, "eval_reward_total_composite_mean": 0.10798603410904224, "eval_reward_total_composite_std": 0.12781854145801985, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 50.0} {"timestamp_utc": "2026-04-12T15:37:47Z", "mode": "train", "global_step": 51, "epoch": 0.0020484395710326547, "loss": 0.1796, "grad_norm": 10.217948913574219, "learning_rate": 9.84848484848485e-06, "num_tokens": 116472.0, "completions/mean_length": 108.75, "completions/min_length": 65.0, "completions/max_length": 139.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 108.75, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 139.0, "rewards/meter/mean": 0.2087373584508896, "rewards/meter/std": 0.27834978699684143, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9901316165924072, "rewards/lexical_plausibility/std": 0.027912110090255737, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9795576930046082, "rewards/repeat_penalty/std": 0.03321705386042595, "rewards/repeat_floor/mean": 0.997545599937439, "rewards/repeat_floor/std": 0.003270600223913789, "rewards/near_duplicate_penalty/mean": 0.9900475740432739, "rewards/near_duplicate_penalty/std": 0.005164245143532753, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.07415324449539185, "rewards/total_composite/std": 0.10081373155117035, "reward": 0.07415324449539185, "reward_std": 0.10081371665000916, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2235293835401535, "sampling/sampling_logp_difference/max": 1.7983970642089844, "sampling/importance_sampling_ratio/min": 0.1995221972465515, "sampling/importance_sampling_ratio/mean": 1.035662055015564, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.48785662651062, "clip_ratio/low_mean": 0.10533129796385765, "clip_ratio/low_min": 0.10533129796385765, "clip_ratio/high_mean": 0.07935485057532787, "clip_ratio/high_max": 0.07935485057532787, "clip_ratio/region_mean": 0.18468614853918552, "reward_total_mean": 0.07415324449539185, "reward_meter_mean": 0.2087373584508896, "reward_meter_std": 0.27834978699684143, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9901316165924072, "reward_lexical_plausibility_std": 0.027912110090255737, "reward_repeat_penalty_mean": 0.9795576930046082, "reward_repeat_penalty_std": 0.03321705386042595, "reward_repeat_floor_mean": 0.997545599937439, "reward_repeat_floor_std": 0.003270600223913789, "reward_near_duplicate_penalty_mean": 0.9900475740432739, "reward_near_duplicate_penalty_std": 0.005164245143532753, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.07415324449539185, "reward_total_composite_std": 0.10081373155117035, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 51.0} {"timestamp_utc": "2026-04-12T15:37:57Z", "mode": "train", "global_step": 52, "epoch": 0.0020886050528176087, "loss": -0.0216, "grad_norm": 24.365684509277344, "learning_rate": 9.845454545454546e-06, "num_tokens": 117883.0, "completions/mean_length": 23.375, "completions/min_length": 17.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.375, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.4259107708930969, "rewards/meter/std": 0.39908939599990845, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9703159332275391, "rewards/lexical_plausibility/std": 0.08395931124687195, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19917435944080353, "rewards/total_composite/std": 0.17407074570655823, "reward": 0.19917435944080353, "reward_std": 0.17407073080539703, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18808428943157196, "sampling/sampling_logp_difference/max": 1.4671764373779297, "sampling/importance_sampling_ratio/min": 0.23057562112808228, "sampling/importance_sampling_ratio/mean": 1.0117603540420532, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7564258873462677, "clip_ratio/low_mean": 0.07030866295099258, "clip_ratio/low_min": 0.07030866295099258, "clip_ratio/high_mean": 0.07976588793098927, "clip_ratio/high_max": 0.07976588793098927, "clip_ratio/region_mean": 0.15007455088198185, "reward_total_mean": 0.19917435944080353, "reward_meter_mean": 0.4259107708930969, "reward_meter_std": 0.39908939599990845, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9703159332275391, "reward_lexical_plausibility_std": 0.08395931124687195, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.19917435944080353, "reward_total_composite_std": 0.17407074570655823, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 52.0} {"timestamp_utc": "2026-04-12T15:38:09Z", "mode": "train", "global_step": 53, "epoch": 0.0021287705346025626, "loss": 0.0065, "grad_norm": 7.9538373947143555, "learning_rate": 9.842424242424243e-06, "num_tokens": 120549.0, "completions/mean_length": 154.25, "completions/min_length": 105.0, "completions/max_length": 196.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.25, "completions/min_terminated_length": 105.0, "completions/max_terminated_length": 196.0, "rewards/meter/mean": 0.5221389532089233, "rewards/meter/std": 0.36941981315612793, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8817651867866516, "rewards/lexical_plausibility/std": 0.1428799331188202, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.995241641998291, "rewards/repeat_penalty/std": 0.005499041173607111, "rewards/repeat_floor/mean": 0.9992862939834595, "rewards/repeat_floor/std": 0.0008248515077866614, "rewards/near_duplicate_penalty/mean": 0.995241641998291, "rewards/near_duplicate_penalty/std": 0.005499041173607111, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1543811410665512, "rewards/total_composite/std": 0.11782321333885193, "reward": 0.1543811410665512, "reward_std": 0.11782321333885193, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2051299810409546, "sampling/sampling_logp_difference/max": 1.1630926132202148, "sampling/importance_sampling_ratio/min": 0.3125181794166565, "sampling/importance_sampling_ratio/mean": 1.04629647731781, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.848069667816162, "clip_ratio/low_mean": 0.11896091513335705, "clip_ratio/low_min": 0.11896091513335705, "clip_ratio/high_mean": 0.07578452862799168, "clip_ratio/high_max": 0.07578452862799168, "clip_ratio/region_mean": 0.19474544376134872, "reward_total_mean": 0.1543811410665512, "reward_meter_mean": 0.5221389532089233, "reward_meter_std": 0.36941981315612793, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8817651867866516, "reward_lexical_plausibility_std": 0.1428799331188202, "reward_repeat_penalty_mean": 0.995241641998291, "reward_repeat_penalty_std": 0.005499041173607111, "reward_repeat_floor_mean": 0.9992862939834595, "reward_repeat_floor_std": 0.0008248515077866614, "reward_near_duplicate_penalty_mean": 0.995241641998291, "reward_near_duplicate_penalty_std": 0.005499041173607111, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1543811410665512, "reward_total_composite_std": 0.11782321333885193, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 53.0} {"timestamp_utc": "2026-04-12T15:38:20Z", "mode": "train", "global_step": 54, "epoch": 0.0021689360163875166, "loss": 0.0778, "grad_norm": 13.751712799072266, "learning_rate": 9.83939393939394e-06, "num_tokens": 122237.0, "completions/mean_length": 47.0, "completions/min_length": 35.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.6743103265762329, "rewards/meter/std": 0.37354472279548645, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9696969985961914, "rewards/lexical_plausibility/std": 0.08570991456508636, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.990012526512146, "rewards/repeat_penalty/std": 0.027903828769922256, "rewards/repeat_floor/mean": 0.9990427494049072, "rewards/repeat_floor/std": 0.0026558798272162676, "rewards/near_duplicate_penalty/mean": 0.9991129636764526, "rewards/near_duplicate_penalty/std": 0.0021831849589943886, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.2338332235813141, "rewards/total_composite/std": 0.16309471428394318, "reward": 0.2338332235813141, "reward_std": 0.16309471428394318, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23054999113082886, "sampling/sampling_logp_difference/max": 1.2963180541992188, "sampling/importance_sampling_ratio/min": 0.2735370695590973, "sampling/importance_sampling_ratio/mean": 1.0494039058685303, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.69976544380188, "clip_ratio/low_mean": 0.11132789682596922, "clip_ratio/low_min": 0.11132789682596922, "clip_ratio/high_mean": 0.07033322565257549, "clip_ratio/high_max": 0.07033322565257549, "clip_ratio/region_mean": 0.1816611224785447, "reward_total_mean": 0.2338332235813141, "reward_meter_mean": 0.6743103265762329, "reward_meter_std": 0.37354472279548645, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9696969985961914, "reward_lexical_plausibility_std": 0.08570991456508636, "reward_repeat_penalty_mean": 0.990012526512146, "reward_repeat_penalty_std": 0.027903828769922256, "reward_repeat_floor_mean": 0.9990427494049072, "reward_repeat_floor_std": 0.0026558798272162676, "reward_near_duplicate_penalty_mean": 0.9991129636764526, "reward_near_duplicate_penalty_std": 0.0021831849589943886, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.2338332235813141, "reward_total_composite_std": 0.16309471428394318, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 54.0} {"timestamp_utc": "2026-04-12T15:38:36Z", "mode": "train", "global_step": 55, "epoch": 0.0022091014981724705, "loss": 0.117, "grad_norm": 3.5803184509277344, "learning_rate": 9.836363636363637e-06, "num_tokens": 126215.0, "completions/mean_length": 416.25, "completions/min_length": 259.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 384.3333435058594, "completions/min_terminated_length": 259.0, "completions/max_terminated_length": 503.0, "rewards/meter/mean": 0.3558233380317688, "rewards/meter/std": 0.33072230219841003, "rewards/count_adherence/mean": 0.8671875, "rewards/count_adherence/std": 0.0521576851606369, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9601562023162842, "rewards/count_floor/std": 0.015647288411855698, "rewards/lexical_plausibility/mean": 0.9793447256088257, "rewards/lexical_plausibility/std": 0.04138510674238205, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.989062488079071, "rewards/repeat_penalty/std": 0.009795082733035088, "rewards/repeat_floor/mean": 0.9987688064575195, "rewards/repeat_floor/std": 0.0009688546415418386, "rewards/near_duplicate_penalty/mean": 0.9959406852722168, "rewards/near_duplicate_penalty/std": 0.0019094451563432813, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.993085503578186, "rewards/distinct_2/std": 0.008636143989861012, "rewards/total_composite/mean": 0.06600721180438995, "rewards/total_composite/std": 0.06121479719877243, "reward": 0.06600721180438995, "reward_std": 0.06121479719877243, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23353834450244904, "sampling/sampling_logp_difference/max": 1.7532901763916016, "sampling/importance_sampling_ratio/min": 0.17320314049720764, "sampling/importance_sampling_ratio/mean": 1.0502129793167114, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0999017655849457, "clip_ratio/low_mean": 0.08828209713101387, "clip_ratio/low_min": 0.08828209713101387, "clip_ratio/high_mean": 0.056370774284005165, "clip_ratio/high_max": 0.056370774284005165, "clip_ratio/region_mean": 0.14465287141501904, "reward_total_mean": 0.06600721180438995, "reward_meter_mean": 0.3558233380317688, "reward_meter_std": 0.33072230219841003, "reward_count_adherence_mean": 0.8671875, "reward_count_adherence_std": 0.0521576851606369, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9601562023162842, "reward_count_floor_std": 0.015647288411855698, "reward_lexical_plausibility_mean": 0.9793447256088257, "reward_lexical_plausibility_std": 0.04138510674238205, "reward_repeat_penalty_mean": 0.989062488079071, "reward_repeat_penalty_std": 0.009795082733035088, "reward_repeat_floor_mean": 0.9987688064575195, "reward_repeat_floor_std": 0.0009688546415418386, "reward_near_duplicate_penalty_mean": 0.9959406852722168, "reward_near_duplicate_penalty_std": 0.0019094451563432813, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.993085503578186, "reward_distinct_2_std": 0.008636143989861012, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.06600721180438995, "reward_total_composite_std": 0.06121479719877243, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 55.0} {"timestamp_utc": "2026-04-12T15:38:45Z", "mode": "train", "global_step": 56, "epoch": 0.0022492669799574244, "loss": 0.1691, "grad_norm": 15.630742073059082, "learning_rate": 9.833333333333333e-06, "num_tokens": 127853.0, "completions/mean_length": 44.75, "completions/min_length": 34.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.75, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.8525811433792114, "rewards/meter/std": 0.29226991534233093, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9888150691986084, "rewards/lexical_plausibility/std": 0.022782549262046814, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.2796139121055603, "rewards/repeat_penalty/mean": 0.9708560705184937, "rewards/repeat_penalty/std": 0.052419934421777725, "rewards/repeat_floor/mean": 0.996009349822998, "rewards/repeat_floor/std": 0.006806257180869579, "rewards/near_duplicate_penalty/mean": 0.9784122705459595, "rewards/near_duplicate_penalty/std": 0.03164125978946686, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.3470025658607483, "rewards/total_composite/std": 0.27790409326553345, "reward": 0.3470025658607483, "reward_std": 0.27790409326553345, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21946589648723602, "sampling/sampling_logp_difference/max": 1.6893329620361328, "sampling/importance_sampling_ratio/min": 0.18464264273643494, "sampling/importance_sampling_ratio/mean": 1.0393718481063843, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.309250071644783, "clip_ratio/low_mean": 0.15036188997328281, "clip_ratio/low_min": 0.15036188997328281, "clip_ratio/high_mean": 0.049383943900465965, "clip_ratio/high_max": 0.049383943900465965, "clip_ratio/region_mean": 0.19974583387374878, "reward_total_mean": 0.3470025658607483, "reward_meter_mean": 0.8525811433792114, "reward_meter_std": 0.29226991534233093, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9888150691986084, "reward_lexical_plausibility_std": 0.022782549262046814, "reward_repeat_penalty_mean": 0.9708560705184937, "reward_repeat_penalty_std": 0.052419934421777725, "reward_repeat_floor_mean": 0.996009349822998, "reward_repeat_floor_std": 0.006806257180869579, "reward_near_duplicate_penalty_mean": 0.9784122705459595, "reward_near_duplicate_penalty_std": 0.03164125978946686, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.2796139121055603, "reward_total_composite_mean": 0.3470025658607483, "reward_total_composite_std": 0.27790409326553345, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 56.0} {"timestamp_utc": "2026-04-12T15:38:56Z", "mode": "train", "global_step": 57, "epoch": 0.002289432461742379, "loss": 0.039, "grad_norm": 10.930910110473633, "learning_rate": 9.830303030303032e-06, "num_tokens": 129740.0, "completions/mean_length": 64.875, "completions/min_length": 42.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.875, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.8454275727272034, "rewards/meter/std": 0.3148094713687897, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9343099594116211, "rewards/lexical_plausibility/std": 0.09829296171665192, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.268537700176239, "rewards/repeat_penalty/mean": 0.993340015411377, "rewards/repeat_penalty/std": 0.01577628031373024, "rewards/repeat_floor/mean": 0.9990010261535645, "rewards/repeat_floor/std": 0.0023664399050176144, "rewards/near_duplicate_penalty/mean": 0.993340015411377, "rewards/near_duplicate_penalty/std": 0.01577628031373024, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3210640847682953, "rewards/total_composite/std": 0.2879931926727295, "reward": 0.3210640847682953, "reward_std": 0.2879932224750519, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20600314438343048, "sampling/sampling_logp_difference/max": 1.6941933631896973, "sampling/importance_sampling_ratio/min": 0.3185790479183197, "sampling/importance_sampling_ratio/mean": 1.0374006032943726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.514877498149872, "clip_ratio/low_mean": 0.11329697445034981, "clip_ratio/low_min": 0.11329697445034981, "clip_ratio/high_mean": 0.12848603911697865, "clip_ratio/high_max": 0.12848603911697865, "clip_ratio/region_mean": 0.24178301356732845, "reward_total_mean": 0.3210640847682953, "reward_meter_mean": 0.8454275727272034, "reward_meter_std": 0.3148094713687897, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9343099594116211, "reward_lexical_plausibility_std": 0.09829296171665192, "reward_repeat_penalty_mean": 0.993340015411377, "reward_repeat_penalty_std": 0.01577628031373024, "reward_repeat_floor_mean": 0.9990010261535645, "reward_repeat_floor_std": 0.0023664399050176144, "reward_near_duplicate_penalty_mean": 0.993340015411377, "reward_near_duplicate_penalty_std": 0.01577628031373024, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.268537700176239, "reward_total_composite_mean": 0.3210640847682953, "reward_total_composite_std": 0.2879931926727295, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 57.0} {"timestamp_utc": "2026-04-12T15:39:06Z", "mode": "train", "global_step": 58, "epoch": 0.0023295979435273327, "loss": 0.1269, "grad_norm": 15.922411918640137, "learning_rate": 9.827272727272729e-06, "num_tokens": 131445.0, "completions/mean_length": 46.125, "completions/min_length": 33.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.25518494844436646, "rewards/meter/std": 0.3260885775089264, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9750437140464783, "rewards/repeat_penalty/std": 0.06004312261939049, "rewards/repeat_floor/mean": 0.9966843128204346, "rewards/repeat_floor/std": 0.007807428482919931, "rewards/near_duplicate_penalty/mean": 0.9836643934249878, "rewards/near_duplicate_penalty/std": 0.03597417101264, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.1558072566986084, "rewards/total_composite/std": 0.26507842540740967, "reward": 0.1558072566986084, "reward_std": 0.26507842540740967, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2382640540599823, "sampling/sampling_logp_difference/max": 1.806563377380371, "sampling/importance_sampling_ratio/min": 0.1642175316810608, "sampling/importance_sampling_ratio/mean": 1.0559062957763672, "sampling/importance_sampling_ratio/max": 1.9906350374221802, "entropy": 2.646505504846573, "clip_ratio/low_mean": 0.13163077924400568, "clip_ratio/low_min": 0.13163077924400568, "clip_ratio/high_mean": 0.0778409093618393, "clip_ratio/high_max": 0.0778409093618393, "clip_ratio/region_mean": 0.20947168860584497, "reward_total_mean": 0.1558072566986084, "reward_meter_mean": 0.25518494844436646, "reward_meter_std": 0.3260885775089264, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9750437140464783, "reward_repeat_penalty_std": 0.06004312261939049, "reward_repeat_floor_mean": 0.9966843128204346, "reward_repeat_floor_std": 0.007807428482919931, "reward_near_duplicate_penalty_mean": 0.9836643934249878, "reward_near_duplicate_penalty_std": 0.03597417101264, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.1558072566986084, "reward_total_composite_std": 0.26507842540740967, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 58.0} {"timestamp_utc": "2026-04-12T15:39:14Z", "mode": "train", "global_step": 59, "epoch": 0.0023697634253122867, "loss": 0.0084, "grad_norm": 20.86791229248047, "learning_rate": 9.824242424242425e-06, "num_tokens": 132945.0, "completions/mean_length": 32.5, "completions/min_length": 27.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.5, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.5404990911483765, "rewards/meter/std": 0.3343353271484375, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6937500238418579, "rewards/judge_quality/std": 0.32275325059890747, "rewards/repeat_penalty/mean": 0.9985888004302979, "rewards/repeat_penalty/std": 0.00263221119530499, "rewards/repeat_floor/mean": 0.9997882843017578, "rewards/repeat_floor/std": 0.0003948377270717174, "rewards/near_duplicate_penalty/mean": 0.9985888004302979, "rewards/near_duplicate_penalty/std": 0.00263221119530499, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44012579321861267, "rewards/total_composite/std": 0.344654381275177, "reward": 0.44012579321861267, "reward_std": 0.344654381275177, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22032026946544647, "sampling/sampling_logp_difference/max": 2.4319496154785156, "sampling/importance_sampling_ratio/min": 0.08786536008119583, "sampling/importance_sampling_ratio/mean": 0.9949856996536255, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.05552601441741, "clip_ratio/low_mean": 0.08308576047420502, "clip_ratio/low_min": 0.08308576047420502, "clip_ratio/high_mean": 0.09974937606602907, "clip_ratio/high_max": 0.09974937606602907, "clip_ratio/region_mean": 0.1828351365402341, "reward_total_mean": 0.44012579321861267, "reward_meter_mean": 0.5404990911483765, "reward_meter_std": 0.3343353271484375, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9985888004302979, "reward_repeat_penalty_std": 0.00263221119530499, "reward_repeat_floor_mean": 0.9997882843017578, "reward_repeat_floor_std": 0.0003948377270717174, "reward_near_duplicate_penalty_mean": 0.9985888004302979, "reward_near_duplicate_penalty_std": 0.00263221119530499, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6937500238418579, "reward_judge_quality_std": 0.32275325059890747, "reward_total_composite_mean": 0.44012579321861267, "reward_total_composite_std": 0.344654381275177, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 59.0} {"timestamp_utc": "2026-04-12T15:39:26Z", "mode": "train", "global_step": 60, "epoch": 0.0024099289070972406, "loss": 0.1221, "grad_norm": 10.750651359558105, "learning_rate": 9.821212121212122e-06, "num_tokens": 135227.0, "completions/mean_length": 99.25, "completions/min_length": 70.0, "completions/max_length": 131.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.25, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.8280071020126343, "rewards/meter/std": 0.2582924962043762, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9965113997459412, "rewards/repeat_penalty/std": 0.0037187119014561176, "rewards/repeat_floor/mean": 0.9994766712188721, "rewards/repeat_floor/std": 0.0005578127456828952, "rewards/near_duplicate_penalty/mean": 0.9965113997459412, "rewards/near_duplicate_penalty/std": 0.0037187119014561176, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.222237229347229, "rewards/total_composite/std": 0.10033319145441055, "reward": 0.222237229347229, "reward_std": 0.10033319145441055, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21776022017002106, "sampling/sampling_logp_difference/max": 1.4216468334197998, "sampling/importance_sampling_ratio/min": 0.2413162887096405, "sampling/importance_sampling_ratio/mean": 1.0483505725860596, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8715760707855225, "clip_ratio/low_mean": 0.11581573635339737, "clip_ratio/low_min": 0.11581573635339737, "clip_ratio/high_mean": 0.0863803569227457, "clip_ratio/high_max": 0.0863803569227457, "clip_ratio/region_mean": 0.20219609327614307, "reward_total_mean": 0.222237229347229, "reward_meter_mean": 0.8280071020126343, "reward_meter_std": 0.2582924962043762, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9965113997459412, "reward_repeat_penalty_std": 0.0037187119014561176, "reward_repeat_floor_mean": 0.9994766712188721, "reward_repeat_floor_std": 0.0005578127456828952, "reward_near_duplicate_penalty_mean": 0.9965113997459412, "reward_near_duplicate_penalty_std": 0.0037187119014561176, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.222237229347229, "reward_total_composite_std": 0.10033319145441055, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 60.0} {"timestamp_utc": "2026-04-12T15:39:38Z", "mode": "train", "global_step": 61, "epoch": 0.0024500943888821946, "loss": 0.0213, "grad_norm": 11.486438751220703, "learning_rate": 9.81818181818182e-06, "num_tokens": 137117.0, "completions/mean_length": 71.25, "completions/min_length": 48.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.25, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.39732348918914795, "rewards/meter/std": 0.3453885316848755, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9852941036224365, "rewards/lexical_plausibility/std": 0.04159451276063919, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.9746606349945068, "rewards/repeat_penalty/std": 0.03274624049663544, "rewards/repeat_floor/mean": 0.9970314502716064, "rewards/repeat_floor/std": 0.0034739612601697445, "rewards/near_duplicate_penalty/mean": 0.9889459013938904, "rewards/near_duplicate_penalty/std": 0.010812339372932911, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9854395389556885, "rewards/distinct_2/std": 0.027018221095204353, "rewards/total_composite/mean": 0.22805894911289215, "rewards/total_composite/std": 0.27717325091362, "reward": 0.22805894911289215, "reward_std": 0.2771732211112976, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19503915309906006, "sampling/sampling_logp_difference/max": 1.6394710540771484, "sampling/importance_sampling_ratio/min": 0.19408267736434937, "sampling/importance_sampling_ratio/mean": 1.0252107381820679, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.917788788676262, "clip_ratio/low_mean": 0.10975828021764755, "clip_ratio/low_min": 0.10975828021764755, "clip_ratio/high_mean": 0.07531298883259296, "clip_ratio/high_max": 0.07531298883259296, "clip_ratio/region_mean": 0.18507126905024052, "reward_total_mean": 0.22805894911289215, "reward_meter_mean": 0.39732348918914795, "reward_meter_std": 0.3453885316848755, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9852941036224365, "reward_lexical_plausibility_std": 0.04159451276063919, "reward_repeat_penalty_mean": 0.9746606349945068, "reward_repeat_penalty_std": 0.03274624049663544, "reward_repeat_floor_mean": 0.9970314502716064, "reward_repeat_floor_std": 0.0034739612601697445, "reward_near_duplicate_penalty_mean": 0.9889459013938904, "reward_near_duplicate_penalty_std": 0.010812339372932911, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9854395389556885, "reward_distinct_2_std": 0.027018221095204353, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.22805894911289215, "reward_total_composite_std": 0.27717325091362, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 61.0} {"timestamp_utc": "2026-04-12T15:39:49Z", "mode": "train", "global_step": 62, "epoch": 0.0024902598706671485, "loss": 0.1336, "grad_norm": 8.1593599319458, "learning_rate": 9.815151515151516e-06, "num_tokens": 139449.0, "completions/mean_length": 126.5, "completions/min_length": 72.0, "completions/max_length": 153.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.4721960127353668, "rewards/meter/std": 0.36472707986831665, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9060581922531128, "rewards/lexical_plausibility/std": 0.07539358735084534, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9983223676681519, "rewards/repeat_penalty/std": 0.002827560994774103, "rewards/repeat_floor/mean": 0.9997483491897583, "rewards/repeat_floor/std": 0.00042413041228428483, "rewards/near_duplicate_penalty/mean": 0.9983223676681519, "rewards/near_duplicate_penalty/std": 0.002827560994774103, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12167593836784363, "rewards/total_composite/std": 0.114832803606987, "reward": 0.12167593836784363, "reward_std": 0.1148327961564064, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21668383479118347, "sampling/sampling_logp_difference/max": 2.096221923828125, "sampling/importance_sampling_ratio/min": 0.1229199469089508, "sampling/importance_sampling_ratio/mean": 1.0373650789260864, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5818874835968018, "clip_ratio/low_mean": 0.13090897910296917, "clip_ratio/low_min": 0.13090897910296917, "clip_ratio/high_mean": 0.07697806879878044, "clip_ratio/high_max": 0.07697806879878044, "clip_ratio/region_mean": 0.2078870479017496, "reward_total_mean": 0.12167593836784363, "reward_meter_mean": 0.4721960127353668, "reward_meter_std": 0.36472707986831665, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9060581922531128, "reward_lexical_plausibility_std": 0.07539358735084534, "reward_repeat_penalty_mean": 0.9983223676681519, "reward_repeat_penalty_std": 0.002827560994774103, "reward_repeat_floor_mean": 0.9997483491897583, "reward_repeat_floor_std": 0.00042413041228428483, "reward_near_duplicate_penalty_mean": 0.9983223676681519, "reward_near_duplicate_penalty_std": 0.002827560994774103, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.12167593836784363, "reward_total_composite_std": 0.114832803606987, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 62.0} {"timestamp_utc": "2026-04-12T15:39:59Z", "mode": "train", "global_step": 63, "epoch": 0.002530425352452103, "loss": 0.1348, "grad_norm": 15.880659103393555, "learning_rate": 9.812121212121212e-06, "num_tokens": 141089.0, "completions/mean_length": 42.0, "completions/min_length": 30.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.3279654383659363, "rewards/meter/std": 0.31591081619262695, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.9835828542709351, "rewards/repeat_penalty/std": 0.02570706605911255, "rewards/repeat_floor/mean": 0.9975374341011047, "rewards/repeat_floor/std": 0.0038560586981475353, "rewards/near_duplicate_penalty/mean": 0.9835828542709351, "rewards/near_duplicate_penalty/std": 0.02570706605911255, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1425551027059555, "rewards/total_composite/std": 0.18220064043998718, "reward": 0.1425551027059555, "reward_std": 0.18220064043998718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22257696092128754, "sampling/sampling_logp_difference/max": 2.073049545288086, "sampling/importance_sampling_ratio/min": 0.12580156326293945, "sampling/importance_sampling_ratio/mean": 1.0265105962753296, "sampling/importance_sampling_ratio/max": 1.9564517736434937, "entropy": 2.4436209201812744, "clip_ratio/low_mean": 0.1373596116900444, "clip_ratio/low_min": 0.1373596116900444, "clip_ratio/high_mean": 0.04627193138003349, "clip_ratio/high_max": 0.04627193138003349, "clip_ratio/region_mean": 0.1836315430700779, "reward_total_mean": 0.1425551027059555, "reward_meter_mean": 0.3279654383659363, "reward_meter_std": 0.31591081619262695, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9835828542709351, "reward_repeat_penalty_std": 0.02570706605911255, "reward_repeat_floor_mean": 0.9975374341011047, "reward_repeat_floor_std": 0.0038560586981475353, "reward_near_duplicate_penalty_mean": 0.9835828542709351, "reward_near_duplicate_penalty_std": 0.02570706605911255, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.1425551027059555, "reward_total_composite_std": 0.18220064043998718, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 63.0} {"timestamp_utc": "2026-04-12T15:40:10Z", "mode": "train", "global_step": 64, "epoch": 0.002570590834237057, "loss": -0.0646, "grad_norm": 8.46484661102295, "learning_rate": 9.809090909090911e-06, "num_tokens": 143675.0, "completions/mean_length": 138.25, "completions/min_length": 101.0, "completions/max_length": 170.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.25, "completions/min_terminated_length": 101.0, "completions/max_terminated_length": 170.0, "rewards/meter/mean": 0.9050223231315613, "rewards/meter/std": 0.18551981449127197, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9393068552017212, "rewards/lexical_plausibility/std": 0.095570407807827, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9850629568099976, "rewards/repeat_penalty/std": 0.025699971243739128, "rewards/repeat_floor/mean": 0.9983018636703491, "rewards/repeat_floor/std": 0.0028515057638287544, "rewards/near_duplicate_penalty/mean": 0.9943779706954956, "rewards/near_duplicate_penalty/std": 0.008487415499985218, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990501880645752, "rewards/distinct_2/std": 0.0175889004021883, "rewards/total_composite/mean": 0.13550083339214325, "rewards/total_composite/std": 0.027694441378116608, "reward": 0.13550083339214325, "reward_std": 0.027694443240761757, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19049707055091858, "sampling/sampling_logp_difference/max": 2.0743465423583984, "sampling/importance_sampling_ratio/min": 0.12563849985599518, "sampling/importance_sampling_ratio/mean": 1.0256162881851196, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9644009470939636, "clip_ratio/low_mean": 0.023514851927757263, "clip_ratio/low_min": 0.023514851927757263, "clip_ratio/high_mean": 0.20162308029830456, "clip_ratio/high_max": 0.20162308029830456, "clip_ratio/region_mean": 0.22513793222606182, "reward_total_mean": 0.13550083339214325, "reward_meter_mean": 0.9050223231315613, "reward_meter_std": 0.18551981449127197, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9393068552017212, "reward_lexical_plausibility_std": 0.095570407807827, "reward_repeat_penalty_mean": 0.9850629568099976, "reward_repeat_penalty_std": 0.025699971243739128, "reward_repeat_floor_mean": 0.9983018636703491, "reward_repeat_floor_std": 0.0028515057638287544, "reward_near_duplicate_penalty_mean": 0.9943779706954956, "reward_near_duplicate_penalty_std": 0.008487415499985218, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990501880645752, "reward_distinct_2_std": 0.0175889004021883, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.13550083339214325, "reward_total_composite_std": 0.027694441378116608, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 64.0} {"timestamp_utc": "2026-04-12T15:40:21Z", "mode": "train", "global_step": 65, "epoch": 0.0026107563160220107, "loss": 0.0429, "grad_norm": 9.566802024841309, "learning_rate": 9.806060606060607e-06, "num_tokens": 145911.0, "completions/mean_length": 86.5, "completions/min_length": 59.0, "completions/max_length": 108.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.5, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.26148083806037903, "rewards/meter/std": 0.3580758571624756, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9787825345993042, "rewards/lexical_plausibility/std": 0.03981919214129448, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9905944466590881, "rewards/repeat_penalty/std": 0.006443301681429148, "rewards/repeat_floor/mean": 0.9985891580581665, "rewards/repeat_floor/std": 0.0009664942626841366, "rewards/near_duplicate_penalty/mean": 0.9905944466590881, "rewards/near_duplicate_penalty/std": 0.006443301681429148, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.05834570527076721, "rewards/total_composite/std": 0.08223804831504822, "reward": 0.05834570527076721, "reward_std": 0.08223804831504822, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21089264750480652, "sampling/sampling_logp_difference/max": 1.4266748428344727, "sampling/importance_sampling_ratio/min": 0.2401059865951538, "sampling/importance_sampling_ratio/mean": 1.0309840440750122, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6042764484882355, "clip_ratio/low_mean": 0.15297048538923264, "clip_ratio/low_min": 0.15297048538923264, "clip_ratio/high_mean": 0.04924657475203276, "clip_ratio/high_max": 0.04924657475203276, "clip_ratio/region_mean": 0.2022170601412654, "reward_total_mean": 0.05834570527076721, "reward_meter_mean": 0.26148083806037903, "reward_meter_std": 0.3580758571624756, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9787825345993042, "reward_lexical_plausibility_std": 0.03981919214129448, "reward_repeat_penalty_mean": 0.9905944466590881, "reward_repeat_penalty_std": 0.006443301681429148, "reward_repeat_floor_mean": 0.9985891580581665, "reward_repeat_floor_std": 0.0009664942626841366, "reward_near_duplicate_penalty_mean": 0.9905944466590881, "reward_near_duplicate_penalty_std": 0.006443301681429148, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.05834570527076721, "reward_total_composite_std": 0.08223804831504822, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 65.0} {"timestamp_utc": "2026-04-12T15:40:30Z", "mode": "train", "global_step": 66, "epoch": 0.0026509217978069647, "loss": 0.0282, "grad_norm": 11.81692886352539, "learning_rate": 9.803030303030304e-06, "num_tokens": 147708.0, "completions/mean_length": 44.625, "completions/min_length": 44.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.9933011531829834, "rewards/meter/std": 0.011455508880317211, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.949999988079071, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9623221158981323, "rewards/repeat_penalty/std": 0.020256616175174713, "rewards/repeat_floor/mean": 0.9943482875823975, "rewards/repeat_floor/std": 0.0030385067220777273, "rewards/near_duplicate_penalty/mean": 0.9623221158981323, "rewards/near_duplicate_penalty/std": 0.020256616175174713, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.9382868409156799, "rewards/total_composite/std": 0.009567228145897388, "reward": 0.9382868409156799, "reward_std": 0.009567230939865112, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0628151223063469, "sampling/sampling_logp_difference/max": 1.1648931503295898, "sampling/importance_sampling_ratio/min": 0.311955988407135, "sampling/importance_sampling_ratio/mean": 0.9966855049133301, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.24568559974431992, "clip_ratio/low_mean": 0.013586956076323986, "clip_ratio/low_min": 0.013586956076323986, "clip_ratio/high_mean": 0.044823233503848314, "clip_ratio/high_max": 0.044823233503848314, "clip_ratio/region_mean": 0.0584101895801723, "reward_total_mean": 0.9382868409156799, "reward_meter_mean": 0.9933011531829834, "reward_meter_std": 0.011455508880317211, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9623221158981323, "reward_repeat_penalty_std": 0.020256616175174713, "reward_repeat_floor_mean": 0.9943482875823975, "reward_repeat_floor_std": 0.0030385067220777273, "reward_near_duplicate_penalty_mean": 0.9623221158981323, "reward_near_duplicate_penalty_std": 0.020256616175174713, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.949999988079071, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.9382868409156799, "reward_total_composite_std": 0.009567228145897388, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 66.0} {"timestamp_utc": "2026-04-12T15:40:40Z", "mode": "train", "global_step": 67, "epoch": 0.0026910872795919186, "loss": 0.2793, "grad_norm": 15.087583541870117, "learning_rate": 9.800000000000001e-06, "num_tokens": 149338.0, "completions/mean_length": 45.75, "completions/min_length": 28.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.75, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.26053667068481445, "rewards/meter/std": 0.4058288037776947, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.29232752323150635, "rewards/repeat_penalty/mean": 0.9497696757316589, "rewards/repeat_penalty/std": 0.030571458861231804, "rewards/repeat_floor/mean": 0.9924654960632324, "rewards/repeat_floor/std": 0.004585713148117065, "rewards/near_duplicate_penalty/mean": 0.9497696757316589, "rewards/near_duplicate_penalty/std": 0.030571458861231804, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11962468922138214, "rewards/total_composite/std": 0.16466636955738068, "reward": 0.11962468922138214, "reward_std": 0.16466636955738068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2025369107723236, "sampling/sampling_logp_difference/max": 1.726677417755127, "sampling/importance_sampling_ratio/min": 0.17787444591522217, "sampling/importance_sampling_ratio/mean": 1.036473035812378, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.786854311823845, "clip_ratio/low_mean": 0.08405422745272517, "clip_ratio/low_min": 0.08405422745272517, "clip_ratio/high_mean": 0.09464126825332642, "clip_ratio/high_max": 0.09464126825332642, "clip_ratio/region_mean": 0.1786954957060516, "reward_total_mean": 0.11962468922138214, "reward_meter_mean": 0.26053667068481445, "reward_meter_std": 0.4058288037776947, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9497696757316589, "reward_repeat_penalty_std": 0.030571458861231804, "reward_repeat_floor_mean": 0.9924654960632324, "reward_repeat_floor_std": 0.004585713148117065, "reward_near_duplicate_penalty_mean": 0.9497696757316589, "reward_near_duplicate_penalty_std": 0.030571458861231804, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.29232752323150635, "reward_total_composite_mean": 0.11962468922138214, "reward_total_composite_std": 0.16466636955738068, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 67.0} {"timestamp_utc": "2026-04-12T15:40:50Z", "mode": "train", "global_step": 68, "epoch": 0.0027312527613768726, "loss": 0.0546, "grad_norm": 16.317995071411133, "learning_rate": 9.796969696969698e-06, "num_tokens": 150970.0, "completions/mean_length": 49.0, "completions/min_length": 32.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.24453140795230865, "rewards/meter/std": 0.2780782878398895, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9454997181892395, "rewards/lexical_plausibility/std": 0.13229869306087494, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9586745500564575, "rewards/repeat_penalty/std": 0.03985991328954697, "rewards/repeat_floor/mean": 0.9938011765480042, "rewards/repeat_floor/std": 0.005978988483548164, "rewards/near_duplicate_penalty/mean": 0.9586745500564575, "rewards/near_duplicate_penalty/std": 0.03985991328954697, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.04745898395776749, "rewards/total_composite/std": 0.03720048442482948, "reward": 0.04745898395776749, "reward_std": 0.037200480699539185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2399846315383911, "sampling/sampling_logp_difference/max": 1.7153024673461914, "sampling/importance_sampling_ratio/min": 0.28902629017829895, "sampling/importance_sampling_ratio/mean": 1.050329327583313, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2161257565021515, "clip_ratio/low_mean": 0.10240742564201355, "clip_ratio/low_min": 0.10240742564201355, "clip_ratio/high_mean": 0.0988451074808836, "clip_ratio/high_max": 0.0988451074808836, "clip_ratio/region_mean": 0.20125253312289715, "reward_total_mean": 0.04745898395776749, "reward_meter_mean": 0.24453140795230865, "reward_meter_std": 0.2780782878398895, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9454997181892395, "reward_lexical_plausibility_std": 0.13229869306087494, "reward_repeat_penalty_mean": 0.9586745500564575, "reward_repeat_penalty_std": 0.03985991328954697, "reward_repeat_floor_mean": 0.9938011765480042, "reward_repeat_floor_std": 0.005978988483548164, "reward_near_duplicate_penalty_mean": 0.9586745500564575, "reward_near_duplicate_penalty_std": 0.03985991328954697, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.04745898395776749, "reward_total_composite_std": 0.03720048442482948, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 68.0} {"timestamp_utc": "2026-04-12T15:40:57Z", "mode": "train", "global_step": 69, "epoch": 0.002771418243161827, "loss": 0.1148, "grad_norm": 23.034942626953125, "learning_rate": 9.793939393939394e-06, "num_tokens": 152365.0, "completions/mean_length": 26.375, "completions/min_length": 23.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.375, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.8718483448028564, "rewards/meter/std": 0.15568596124649048, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9087499976158142, "rewards/judge_quality/std": 0.10507651418447495, "rewards/repeat_penalty/mean": 0.982042670249939, "rewards/repeat_penalty/std": 0.014344698749482632, "rewards/repeat_floor/mean": 0.9973064064979553, "rewards/repeat_floor/std": 0.0021517009008675814, "rewards/near_duplicate_penalty/mean": 0.982042670249939, "rewards/near_duplicate_penalty/std": 0.014344698749482632, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.8043801188468933, "rewards/total_composite/std": 0.19763554632663727, "reward": 0.8043801188468933, "reward_std": 0.19763551652431488, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06679823249578476, "sampling/sampling_logp_difference/max": 1.2693195343017578, "sampling/importance_sampling_ratio/min": 0.2810227870941162, "sampling/importance_sampling_ratio/mean": 0.994265615940094, "sampling/importance_sampling_ratio/max": 1.9343113899230957, "entropy": 0.247740825638175, "clip_ratio/low_mean": 0.0037878789007663727, "clip_ratio/low_min": 0.0037878789007663727, "clip_ratio/high_mean": 0.053493162617087364, "clip_ratio/high_max": 0.053493162617087364, "clip_ratio/region_mean": 0.05728104151785374, "reward_total_mean": 0.8043801188468933, "reward_meter_mean": 0.8718483448028564, "reward_meter_std": 0.15568596124649048, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.982042670249939, "reward_repeat_penalty_std": 0.014344698749482632, "reward_repeat_floor_mean": 0.9973064064979553, "reward_repeat_floor_std": 0.0021517009008675814, "reward_near_duplicate_penalty_mean": 0.982042670249939, "reward_near_duplicate_penalty_std": 0.014344698749482632, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9087499976158142, "reward_judge_quality_std": 0.10507651418447495, "reward_total_composite_mean": 0.8043801188468933, "reward_total_composite_std": 0.19763554632663727, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 69.0} {"timestamp_utc": "2026-04-12T15:41:14Z", "mode": "train", "global_step": 70, "epoch": 0.002811583724946781, "loss": 0.1482, "grad_norm": 3.9465537071228027, "learning_rate": 9.790909090909093e-06, "num_tokens": 156555.0, "completions/mean_length": 431.75, "completions/min_length": 291.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 405.0, "completions/min_terminated_length": 291.0, "completions/max_terminated_length": 507.0, "rewards/meter/mean": 0.8073446750640869, "rewards/meter/std": 0.13133519887924194, "rewards/count_adherence/mean": 0.8653846383094788, "rewards/count_adherence/std": 0.05439282953739166, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9596153497695923, "rewards/count_floor/std": 0.01631784252822399, "rewards/lexical_plausibility/mean": 0.9824336767196655, "rewards/lexical_plausibility/std": 0.04754986613988876, "rewards/judge_quality/mean": 0.15625, "rewards/judge_quality/std": 0.09425459802150726, "rewards/repeat_penalty/mean": 0.9940862655639648, "rewards/repeat_penalty/std": 0.005090711172670126, "rewards/repeat_floor/mean": 0.999253511428833, "rewards/repeat_floor/std": 0.0005315811140462756, "rewards/near_duplicate_penalty/mean": 0.9964444041252136, "rewards/near_duplicate_penalty/std": 0.0019520486239343882, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9976320266723633, "rewards/distinct_2/std": 0.004385976120829582, "rewards/total_composite/mean": 0.12153446674346924, "rewards/total_composite/std": 0.08290655165910721, "reward": 0.12153446674346924, "reward_std": 0.08290655165910721, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2274150252342224, "sampling/sampling_logp_difference/max": 1.5501213073730469, "sampling/importance_sampling_ratio/min": 0.21222223341464996, "sampling/importance_sampling_ratio/mean": 1.0611239671707153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9055804908275604, "clip_ratio/low_mean": 0.06976692005991936, "clip_ratio/low_min": 0.06976692005991936, "clip_ratio/high_mean": 0.04721180908381939, "clip_ratio/high_max": 0.04721180908381939, "clip_ratio/region_mean": 0.11697872914373875, "reward_total_mean": 0.12153446674346924, "reward_meter_mean": 0.8073446750640869, "reward_meter_std": 0.13133519887924194, "reward_count_adherence_mean": 0.8653846383094788, "reward_count_adherence_std": 0.05439282953739166, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9596153497695923, "reward_count_floor_std": 0.01631784252822399, "reward_lexical_plausibility_mean": 0.9824336767196655, "reward_lexical_plausibility_std": 0.04754986613988876, "reward_repeat_penalty_mean": 0.9940862655639648, "reward_repeat_penalty_std": 0.005090711172670126, "reward_repeat_floor_mean": 0.999253511428833, "reward_repeat_floor_std": 0.0005315811140462756, "reward_near_duplicate_penalty_mean": 0.9964444041252136, "reward_near_duplicate_penalty_std": 0.0019520486239343882, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9976320266723633, "reward_distinct_2_std": 0.004385976120829582, "reward_judge_quality_mean": 0.15625, "reward_judge_quality_std": 0.09425459802150726, "reward_total_composite_mean": 0.12153446674346924, "reward_total_composite_std": 0.08290655165910721, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 70.0} {"timestamp_utc": "2026-04-12T15:41:24Z", "mode": "train", "global_step": 71, "epoch": 0.002851749206731735, "loss": 0.0477, "grad_norm": 13.31476879119873, "learning_rate": 9.787878787878788e-06, "num_tokens": 158053.0, "completions/mean_length": 28.25, "completions/min_length": 23.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.25, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.748448371887207, "rewards/meter/std": 0.2588638663291931, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8612500429153442, "rewards/judge_quality/std": 0.16617010533809662, "rewards/repeat_penalty/mean": 0.8858761787414551, "rewards/repeat_penalty/std": 0.09615682810544968, "rewards/repeat_floor/mean": 0.9891153573989868, "rewards/repeat_floor/std": 0.008976382203400135, "rewards/near_duplicate_penalty/mean": 0.9914911985397339, "rewards/near_duplicate_penalty/std": 0.009008262306451797, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8932409286499023, "rewards/distinct_2/std": 0.09393897652626038, "rewards/total_composite/mean": 0.642677366733551, "rewards/total_composite/std": 0.2716851532459259, "reward": 0.642677366733551, "reward_std": 0.2716851532459259, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11929537355899811, "sampling/sampling_logp_difference/max": 1.7623071670532227, "sampling/importance_sampling_ratio/min": 0.17164838314056396, "sampling/importance_sampling_ratio/mean": 1.0300935506820679, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8854544442147017, "clip_ratio/low_mean": 0.0507183913141489, "clip_ratio/low_min": 0.0507183913141489, "clip_ratio/high_mean": 0.05932382959872484, "clip_ratio/high_max": 0.05932382959872484, "clip_ratio/region_mean": 0.11004222091287374, "reward_total_mean": 0.642677366733551, "reward_meter_mean": 0.748448371887207, "reward_meter_std": 0.2588638663291931, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8858761787414551, "reward_repeat_penalty_std": 0.09615682810544968, "reward_repeat_floor_mean": 0.9891153573989868, "reward_repeat_floor_std": 0.008976382203400135, "reward_near_duplicate_penalty_mean": 0.9914911985397339, "reward_near_duplicate_penalty_std": 0.009008262306451797, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8932409286499023, "reward_distinct_2_std": 0.09393897652626038, "reward_judge_quality_mean": 0.8612500429153442, "reward_judge_quality_std": 0.16617010533809662, "reward_total_composite_mean": 0.642677366733551, "reward_total_composite_std": 0.2716851532459259, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 71.0} {"timestamp_utc": "2026-04-12T15:41:36Z", "mode": "train", "global_step": 72, "epoch": 0.0028919146885166887, "loss": -0.0528, "grad_norm": 12.80850887298584, "learning_rate": 9.784848484848486e-06, "num_tokens": 159897.0, "completions/mean_length": 54.5, "completions/min_length": 42.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.5, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.6490570306777954, "rewards/meter/std": 0.3876386284828186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9399245977401733, "rewards/lexical_plausibility/std": 0.11370430886745453, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9924507737159729, "rewards/repeat_penalty/std": 0.01201132033020258, "rewards/repeat_floor/mean": 0.9988676309585571, "rewards/repeat_floor/std": 0.0018016992835327983, "rewards/near_duplicate_penalty/mean": 0.9924507737159729, "rewards/near_duplicate_penalty/std": 0.01201132033020258, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20356422662734985, "rewards/total_composite/std": 0.1556379348039627, "reward": 0.20356422662734985, "reward_std": 0.1556379348039627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19354785978794098, "sampling/sampling_logp_difference/max": 1.5727412700653076, "sampling/importance_sampling_ratio/min": 0.20747564733028412, "sampling/importance_sampling_ratio/mean": 1.0351853370666504, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.354126736521721, "clip_ratio/low_mean": 0.09373548906296492, "clip_ratio/low_min": 0.09373548906296492, "clip_ratio/high_mean": 0.06477318424731493, "clip_ratio/high_max": 0.06477318424731493, "clip_ratio/region_mean": 0.15850867331027985, "reward_total_mean": 0.20356422662734985, "reward_meter_mean": 0.6490570306777954, "reward_meter_std": 0.3876386284828186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9399245977401733, "reward_lexical_plausibility_std": 0.11370430886745453, "reward_repeat_penalty_mean": 0.9924507737159729, "reward_repeat_penalty_std": 0.01201132033020258, "reward_repeat_floor_mean": 0.9988676309585571, "reward_repeat_floor_std": 0.0018016992835327983, "reward_near_duplicate_penalty_mean": 0.9924507737159729, "reward_near_duplicate_penalty_std": 0.01201132033020258, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.20356422662734985, "reward_total_composite_std": 0.1556379348039627, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 72.0} {"timestamp_utc": "2026-04-12T15:41:46Z", "mode": "train", "global_step": 73, "epoch": 0.0029320801703016427, "loss": -0.0327, "grad_norm": 14.568339347839355, "learning_rate": 9.781818181818183e-06, "num_tokens": 161446.0, "completions/mean_length": 43.625, "completions/min_length": 30.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.625, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.691016435623169, "rewards/meter/std": 0.39511194825172424, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9733875393867493, "rewards/repeat_penalty/std": 0.033725347369909286, "rewards/repeat_floor/mean": 0.9960081577301025, "rewards/repeat_floor/std": 0.005058803129941225, "rewards/near_duplicate_penalty/mean": 0.9733875393867493, "rewards/near_duplicate_penalty/std": 0.033725347369909286, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2363760620355606, "rewards/total_composite/std": 0.16948167979717255, "reward": 0.2363760620355606, "reward_std": 0.16948167979717255, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22721387445926666, "sampling/sampling_logp_difference/max": 1.0508317947387695, "sampling/importance_sampling_ratio/min": 0.34964677691459656, "sampling/importance_sampling_ratio/mean": 1.0778717994689941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.77302822470665, "clip_ratio/low_mean": 0.09030991233885288, "clip_ratio/low_min": 0.09030991233885288, "clip_ratio/high_mean": 0.10500114597380161, "clip_ratio/high_max": 0.10500114597380161, "clip_ratio/region_mean": 0.1953110583126545, "reward_total_mean": 0.2363760620355606, "reward_meter_mean": 0.691016435623169, "reward_meter_std": 0.39511194825172424, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.9733875393867493, "reward_repeat_penalty_std": 0.033725347369909286, "reward_repeat_floor_mean": 0.9960081577301025, "reward_repeat_floor_std": 0.005058803129941225, "reward_near_duplicate_penalty_mean": 0.9733875393867493, "reward_near_duplicate_penalty_std": 0.033725347369909286, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.2363760620355606, "reward_total_composite_std": 0.16948167979717255, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 73.0} {"timestamp_utc": "2026-04-12T15:41:56Z", "mode": "train", "global_step": 74, "epoch": 0.0029722456520865966, "loss": 0.1199, "grad_norm": 14.732952117919922, "learning_rate": 9.77878787878788e-06, "num_tokens": 163147.0, "completions/mean_length": 44.625, "completions/min_length": 38.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.2882691025733948, "rewards/meter/std": 0.3729732632637024, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.04419417306780815, "rewards/judge_quality/mean": 0.45375001430511475, "rewards/judge_quality/std": 0.17919962108135223, "rewards/repeat_penalty/mean": 0.9798584580421448, "rewards/repeat_penalty/std": 0.03511206805706024, "rewards/repeat_floor/mean": 0.9974900484085083, "rewards/repeat_floor/std": 0.00400077598169446, "rewards/near_duplicate_penalty/mean": 0.9887615442276001, "rewards/near_duplicate_penalty/std": 0.01619119755923748, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.15449298918247223, "rewards/total_composite/std": 0.23706699907779694, "reward": 0.15449298918247223, "reward_std": 0.23706696927547455, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21905067563056946, "sampling/sampling_logp_difference/max": 1.7052898406982422, "sampling/importance_sampling_ratio/min": 0.18171970546245575, "sampling/importance_sampling_ratio/mean": 1.0297564268112183, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2557131201028824, "clip_ratio/low_mean": 0.14629038237035275, "clip_ratio/low_min": 0.14629038237035275, "clip_ratio/high_mean": 0.04858299531042576, "clip_ratio/high_max": 0.04858299531042576, "clip_ratio/region_mean": 0.1948733776807785, "reward_total_mean": 0.15449298918247223, "reward_meter_mean": 0.2882691025733948, "reward_meter_std": 0.3729732632637024, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.04419417306780815, "reward_repeat_penalty_mean": 0.9798584580421448, "reward_repeat_penalty_std": 0.03511206805706024, "reward_repeat_floor_mean": 0.9974900484085083, "reward_repeat_floor_std": 0.00400077598169446, "reward_near_duplicate_penalty_mean": 0.9887615442276001, "reward_near_duplicate_penalty_std": 0.01619119755923748, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.45375001430511475, "reward_judge_quality_std": 0.17919962108135223, "reward_total_composite_mean": 0.15449298918247223, "reward_total_composite_std": 0.23706699907779694, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 74.0} {"timestamp_utc": "2026-04-12T15:42:12Z", "mode": "train", "global_step": 75, "epoch": 0.003012411133871551, "loss": -0.0741, "grad_norm": 3.5783498287200928, "learning_rate": 9.775757575757576e-06, "num_tokens": 166702.0, "completions/mean_length": 490.375, "completions/min_length": 424.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 468.75, "completions/min_terminated_length": 424.0, "completions/max_terminated_length": 493.0, "rewards/meter/mean": 0.47243809700012207, "rewards/meter/std": 0.24235592782497406, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.09977654367685318, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.02993295155465603, "rewards/lexical_plausibility/mean": 0.9230168461799622, "rewards/lexical_plausibility/std": 0.09823575615882874, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9928020238876343, "rewards/repeat_penalty/std": 0.0057755764573812485, "rewards/repeat_floor/mean": 0.9991464614868164, "rewards/repeat_floor/std": 0.0005958321271464229, "rewards/near_duplicate_penalty/mean": 0.9965962767601013, "rewards/near_duplicate_penalty/std": 0.0015001635765656829, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.996188759803772, "rewards/distinct_2/std": 0.004702497273683548, "rewards/total_composite/mean": 0.05822772905230522, "rewards/total_composite/std": 0.03356262668967247, "reward": 0.05822772905230522, "reward_std": 0.03356262668967247, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23616062104701996, "sampling/sampling_logp_difference/max": 1.720937728881836, "sampling/importance_sampling_ratio/min": 0.17889831960201263, "sampling/importance_sampling_ratio/mean": 1.0708262920379639, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.286005437374115, "clip_ratio/low_mean": 0.03473265469074249, "clip_ratio/low_min": 0.03473265469074249, "clip_ratio/high_mean": 0.044642968103289604, "clip_ratio/high_max": 0.044642968103289604, "clip_ratio/region_mean": 0.0793756227940321, "reward_total_mean": 0.05822772905230522, "reward_meter_mean": 0.47243809700012207, "reward_meter_std": 0.24235592782497406, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.09977654367685318, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.02993295155465603, "reward_lexical_plausibility_mean": 0.9230168461799622, "reward_lexical_plausibility_std": 0.09823575615882874, "reward_repeat_penalty_mean": 0.9928020238876343, "reward_repeat_penalty_std": 0.0057755764573812485, "reward_repeat_floor_mean": 0.9991464614868164, "reward_repeat_floor_std": 0.0005958321271464229, "reward_near_duplicate_penalty_mean": 0.9965962767601013, "reward_near_duplicate_penalty_std": 0.0015001635765656829, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.996188759803772, "reward_distinct_2_std": 0.004702497273683548, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.05822772905230522, "reward_total_composite_std": 0.03356262668967247, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 75.0} {"timestamp_utc": "2026-04-12T15:42:23Z", "mode": "train", "global_step": 76, "epoch": 0.003052576615656505, "loss": -0.0453, "grad_norm": 10.16315746307373, "learning_rate": 9.772727272727273e-06, "num_tokens": 168886.0, "completions/mean_length": 84.0, "completions/min_length": 68.0, "completions/max_length": 128.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.18300165235996246, "rewards/meter/std": 0.1538061946630478, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9643131494522095, "rewards/lexical_plausibility/std": 0.0722564160823822, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9956752061843872, "rewards/repeat_penalty/std": 0.004371351096779108, "rewards/repeat_floor/mean": 0.9993512630462646, "rewards/repeat_floor/std": 0.0006557052838616073, "rewards/near_duplicate_penalty/mean": 0.9956752061843872, "rewards/near_duplicate_penalty/std": 0.004371351096779108, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.04776401072740555, "rewards/total_composite/std": 0.05731336027383804, "reward": 0.04776401072740555, "reward_std": 0.05731336399912834, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23373211920261383, "sampling/sampling_logp_difference/max": 1.646296501159668, "sampling/importance_sampling_ratio/min": 0.19276247918605804, "sampling/importance_sampling_ratio/mean": 1.0429555177688599, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.4562574326992035, "clip_ratio/low_mean": 0.12433180119842291, "clip_ratio/low_min": 0.12433180119842291, "clip_ratio/high_mean": 0.05970418266952038, "clip_ratio/high_max": 0.05970418266952038, "clip_ratio/region_mean": 0.1840359838679433, "reward_total_mean": 0.04776401072740555, "reward_meter_mean": 0.18300165235996246, "reward_meter_std": 0.1538061946630478, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9643131494522095, "reward_lexical_plausibility_std": 0.0722564160823822, "reward_repeat_penalty_mean": 0.9956752061843872, "reward_repeat_penalty_std": 0.004371351096779108, "reward_repeat_floor_mean": 0.9993512630462646, "reward_repeat_floor_std": 0.0006557052838616073, "reward_near_duplicate_penalty_mean": 0.9956752061843872, "reward_near_duplicate_penalty_std": 0.004371351096779108, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.04776401072740555, "reward_total_composite_std": 0.05731336027383804, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 76.0} {"timestamp_utc": "2026-04-12T15:42:35Z", "mode": "train", "global_step": 77, "epoch": 0.003092742097441459, "loss": 0.1764, "grad_norm": 11.057759284973145, "learning_rate": 9.76969696969697e-06, "num_tokens": 170779.0, "completions/mean_length": 72.625, "completions/min_length": 45.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.625, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.4394851624965668, "rewards/meter/std": 0.4574509263038635, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.927527666091919, "rewards/lexical_plausibility/std": 0.11085552722215652, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.995111882686615, "rewards/repeat_penalty/std": 0.009327364154160023, "rewards/repeat_floor/mean": 0.9992667436599731, "rewards/repeat_floor/std": 0.001399110071361065, "rewards/near_duplicate_penalty/mean": 0.995111882686615, "rewards/near_duplicate_penalty/std": 0.009327364154160023, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16453397274017334, "rewards/total_composite/std": 0.18075242638587952, "reward": 0.16453397274017334, "reward_std": 0.18075241148471832, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23954260349273682, "sampling/sampling_logp_difference/max": 1.5823326110839844, "sampling/importance_sampling_ratio/min": 0.2054952085018158, "sampling/importance_sampling_ratio/mean": 1.0527844429016113, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.435519188642502, "clip_ratio/low_mean": 0.10869949869811535, "clip_ratio/low_min": 0.10869949869811535, "clip_ratio/high_mean": 0.1150579359382391, "clip_ratio/high_max": 0.1150579359382391, "clip_ratio/region_mean": 0.22375743463635445, "reward_total_mean": 0.16453397274017334, "reward_meter_mean": 0.4394851624965668, "reward_meter_std": 0.4574509263038635, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.927527666091919, "reward_lexical_plausibility_std": 0.11085552722215652, "reward_repeat_penalty_mean": 0.995111882686615, "reward_repeat_penalty_std": 0.009327364154160023, "reward_repeat_floor_mean": 0.9992667436599731, "reward_repeat_floor_std": 0.001399110071361065, "reward_near_duplicate_penalty_mean": 0.995111882686615, "reward_near_duplicate_penalty_std": 0.009327364154160023, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.16453397274017334, "reward_total_composite_std": 0.18075242638587952, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 77.0} {"timestamp_utc": "2026-04-12T15:42:47Z", "mode": "train", "global_step": 78, "epoch": 0.003132907579226413, "loss": 0.0939, "grad_norm": 8.838769912719727, "learning_rate": 9.766666666666667e-06, "num_tokens": 173451.0, "completions/mean_length": 128.0, "completions/min_length": 94.0, "completions/max_length": 158.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 128.0, "completions/min_terminated_length": 94.0, "completions/max_terminated_length": 158.0, "rewards/meter/mean": 0.758094072341919, "rewards/meter/std": 0.31945016980171204, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9223395586013794, "rewards/lexical_plausibility/std": 0.09644214063882828, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9941157102584839, "rewards/repeat_penalty/std": 0.005136305466294289, "rewards/repeat_floor/mean": 0.999117374420166, "rewards/repeat_floor/std": 0.0007704399758949876, "rewards/near_duplicate_penalty/mean": 0.9941157102584839, "rewards/near_duplicate_penalty/std": 0.005136305466294289, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18528631329536438, "rewards/total_composite/std": 0.13080137968063354, "reward": 0.18528631329536438, "reward_std": 0.13080137968063354, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23385238647460938, "sampling/sampling_logp_difference/max": 1.537796974182129, "sampling/importance_sampling_ratio/min": 0.2148539274930954, "sampling/importance_sampling_ratio/mean": 1.0435125827789307, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.3352877497673035, "clip_ratio/low_mean": 0.1070121843367815, "clip_ratio/low_min": 0.1070121843367815, "clip_ratio/high_mean": 0.07725760340690613, "clip_ratio/high_max": 0.07725760340690613, "clip_ratio/region_mean": 0.18426978774368763, "reward_total_mean": 0.18528631329536438, "reward_meter_mean": 0.758094072341919, "reward_meter_std": 0.31945016980171204, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9223395586013794, "reward_lexical_plausibility_std": 0.09644214063882828, "reward_repeat_penalty_mean": 0.9941157102584839, "reward_repeat_penalty_std": 0.005136305466294289, "reward_repeat_floor_mean": 0.999117374420166, "reward_repeat_floor_std": 0.0007704399758949876, "reward_near_duplicate_penalty_mean": 0.9941157102584839, "reward_near_duplicate_penalty_std": 0.005136305466294289, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.18528631329536438, "reward_total_composite_std": 0.13080137968063354, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 78.0} {"timestamp_utc": "2026-04-12T15:43:00Z", "mode": "train", "global_step": 79, "epoch": 0.0031730730610113667, "loss": 0.1918, "grad_norm": 7.480940341949463, "learning_rate": 9.763636363636365e-06, "num_tokens": 176286.0, "completions/mean_length": 151.375, "completions/min_length": 113.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.375, "completions/min_terminated_length": 113.0, "completions/max_terminated_length": 263.0, "rewards/meter/mean": 0.505182147026062, "rewards/meter/std": 0.33270955085754395, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.023145509883761406, "rewards/lexical_plausibility/mean": 0.8953814506530762, "rewards/lexical_plausibility/std": 0.1638709306716919, "rewards/judge_quality/mean": 0.2499999850988388, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9931508302688599, "rewards/repeat_penalty/std": 0.009013802744448185, "rewards/repeat_floor/mean": 0.9991541504859924, "rewards/repeat_floor/std": 0.0008856873610056937, "rewards/near_duplicate_penalty/mean": 0.9961925745010376, "rewards/near_duplicate_penalty/std": 0.003039491130039096, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9969475269317627, "rewards/distinct_2/std": 0.008633782155811787, "rewards/total_composite/mean": 0.15535502135753632, "rewards/total_composite/std": 0.13758698105812073, "reward": 0.15535502135753632, "reward_std": 0.13758698105812073, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23767443001270294, "sampling/sampling_logp_difference/max": 1.6421737670898438, "sampling/importance_sampling_ratio/min": 0.19355882704257965, "sampling/importance_sampling_ratio/mean": 1.0542786121368408, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.9226368367671967, "clip_ratio/low_mean": 0.09021471440792084, "clip_ratio/low_min": 0.09021471440792084, "clip_ratio/high_mean": 0.10830162838101387, "clip_ratio/high_max": 0.10830162838101387, "clip_ratio/region_mean": 0.1985163427889347, "reward_total_mean": 0.15535502135753632, "reward_meter_mean": 0.505182147026062, "reward_meter_std": 0.33270955085754395, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.023145509883761406, "reward_lexical_plausibility_mean": 0.8953814506530762, "reward_lexical_plausibility_std": 0.1638709306716919, "reward_repeat_penalty_mean": 0.9931508302688599, "reward_repeat_penalty_std": 0.009013802744448185, "reward_repeat_floor_mean": 0.9991541504859924, "reward_repeat_floor_std": 0.0008856873610056937, "reward_near_duplicate_penalty_mean": 0.9961925745010376, "reward_near_duplicate_penalty_std": 0.003039491130039096, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9969475269317627, "reward_distinct_2_std": 0.008633782155811787, "reward_judge_quality_mean": 0.2499999850988388, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.15535502135753632, "reward_total_composite_std": 0.13758698105812073, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 79.0} {"timestamp_utc": "2026-04-12T15:43:08Z", "mode": "train", "global_step": 80, "epoch": 0.0032132385427963207, "loss": 0.0313, "grad_norm": 15.44277572631836, "learning_rate": 9.760606060606062e-06, "num_tokens": 177964.0, "completions/mean_length": 44.75, "completions/min_length": 36.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.75, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.5841773748397827, "rewards/meter/std": 0.4157775640487671, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.974759578704834, "rewards/lexical_plausibility/std": 0.028471704572439194, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121344089508057, "rewards/repeat_penalty/mean": 0.99813312292099, "rewards/repeat_penalty/std": 0.0023070746101439, "rewards/repeat_floor/mean": 0.9997199773788452, "rewards/repeat_floor/std": 0.0003460668376646936, "rewards/near_duplicate_penalty/mean": 0.99813312292099, "rewards/near_duplicate_penalty/std": 0.0023070746101439, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2804443836212158, "rewards/total_composite/std": 0.30718445777893066, "reward": 0.2804443836212158, "reward_std": 0.30718445777893066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22217977046966553, "sampling/sampling_logp_difference/max": 1.2089881896972656, "sampling/importance_sampling_ratio/min": 0.29849913716316223, "sampling/importance_sampling_ratio/mean": 1.059512734413147, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.1421422958374023, "clip_ratio/low_mean": 0.08887456730008125, "clip_ratio/low_min": 0.08887456730008125, "clip_ratio/high_mean": 0.10736673697829247, "clip_ratio/high_max": 0.10736673697829247, "clip_ratio/region_mean": 0.19624130427837372, "reward_total_mean": 0.2804443836212158, "reward_meter_mean": 0.5841773748397827, "reward_meter_std": 0.4157775640487671, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.974759578704834, "reward_lexical_plausibility_std": 0.028471704572439194, "reward_repeat_penalty_mean": 0.99813312292099, "reward_repeat_penalty_std": 0.0023070746101439, "reward_repeat_floor_mean": 0.9997199773788452, "reward_repeat_floor_std": 0.0003460668376646936, "reward_near_duplicate_penalty_mean": 0.99813312292099, "reward_near_duplicate_penalty_std": 0.0023070746101439, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121344089508057, "reward_total_composite_mean": 0.2804443836212158, "reward_total_composite_std": 0.30718445777893066, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 80.0} {"timestamp_utc": "2026-04-12T15:43:18Z", "mode": "train", "global_step": 81, "epoch": 0.003253404024581275, "loss": -0.0645, "grad_norm": 14.706957817077637, "learning_rate": 9.757575757575758e-06, "num_tokens": 179701.0, "completions/mean_length": 44.125, "completions/min_length": 33.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.5484030246734619, "rewards/meter/std": 0.44246095418930054, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8968328237533569, "rewards/lexical_plausibility/std": 0.16266535222530365, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.9913541078567505, "rewards/repeat_penalty/std": 0.012487656436860561, "rewards/repeat_floor/mean": 0.998703122138977, "rewards/repeat_floor/std": 0.0018731470918282866, "rewards/near_duplicate_penalty/mean": 0.9913541078567505, "rewards/near_duplicate_penalty/std": 0.012487656436860561, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2909441292285919, "rewards/total_composite/std": 0.30240848660469055, "reward": 0.2909441292285919, "reward_std": 0.30240851640701294, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2205350548028946, "sampling/sampling_logp_difference/max": 1.7228679656982422, "sampling/importance_sampling_ratio/min": 0.17855332791805267, "sampling/importance_sampling_ratio/mean": 1.0267966985702515, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7641369998455048, "clip_ratio/low_mean": 0.09226511046290398, "clip_ratio/low_min": 0.09226511046290398, "clip_ratio/high_mean": 0.09743781574070454, "clip_ratio/high_max": 0.09743781574070454, "clip_ratio/region_mean": 0.1897029262036085, "reward_total_mean": 0.2909441292285919, "reward_meter_mean": 0.5484030246734619, "reward_meter_std": 0.44246095418930054, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8968328237533569, "reward_lexical_plausibility_std": 0.16266535222530365, "reward_repeat_penalty_mean": 0.9913541078567505, "reward_repeat_penalty_std": 0.012487656436860561, "reward_repeat_floor_mean": 0.998703122138977, "reward_repeat_floor_std": 0.0018731470918282866, "reward_near_duplicate_penalty_mean": 0.9913541078567505, "reward_near_duplicate_penalty_std": 0.012487656436860561, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.2909441292285919, "reward_total_composite_std": 0.30240848660469055, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 81.0} {"timestamp_utc": "2026-04-12T15:43:28Z", "mode": "train", "global_step": 82, "epoch": 0.003293569506366229, "loss": 0.0241, "grad_norm": 16.850309371948242, "learning_rate": 9.754545454545455e-06, "num_tokens": 181481.0, "completions/mean_length": 59.5, "completions/min_length": 52.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.5, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.6107265949249268, "rewards/meter/std": 0.2725120186805725, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9830554127693176, "rewards/repeat_penalty/std": 0.03362467139959335, "rewards/repeat_floor/mean": 0.9980804920196533, "rewards/repeat_floor/std": 0.003408765187487006, "rewards/near_duplicate_penalty/mean": 0.9936132431030273, "rewards/near_duplicate_penalty/std": 0.010421634651720524, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.17677387595176697, "rewards/total_composite/std": 0.08098450303077698, "reward": 0.17677387595176697, "reward_std": 0.08098450303077698, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19317473471164703, "sampling/sampling_logp_difference/max": 2.1691017150878906, "sampling/importance_sampling_ratio/min": 0.11428023129701614, "sampling/importance_sampling_ratio/mean": 0.9689168334007263, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.841888353228569, "clip_ratio/low_mean": 0.06377946771681309, "clip_ratio/low_min": 0.06377946771681309, "clip_ratio/high_mean": 0.09316704235970974, "clip_ratio/high_max": 0.09316704235970974, "clip_ratio/region_mean": 0.15694651007652283, "reward_total_mean": 0.17677387595176697, "reward_meter_mean": 0.6107265949249268, "reward_meter_std": 0.2725120186805725, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9830554127693176, "reward_repeat_penalty_std": 0.03362467139959335, "reward_repeat_floor_mean": 0.9980804920196533, "reward_repeat_floor_std": 0.003408765187487006, "reward_near_duplicate_penalty_mean": 0.9936132431030273, "reward_near_duplicate_penalty_std": 0.010421634651720524, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.17677387595176697, "reward_total_composite_std": 0.08098450303077698, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 82.0} {"timestamp_utc": "2026-04-12T15:43:37Z", "mode": "train", "global_step": 83, "epoch": 0.003333734988151183, "loss": 0.0495, "grad_norm": 19.120960235595703, "learning_rate": 9.751515151515152e-06, "num_tokens": 183033.0, "completions/mean_length": 41.0, "completions/min_length": 37.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5597180128097534, "rewards/meter/std": 0.4198746383190155, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.914467453956604, "rewards/lexical_plausibility/std": 0.10147204250097275, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 1.0, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19074517488479614, "rewards/total_composite/std": 0.17437240481376648, "reward": 0.19074517488479614, "reward_std": 0.17437238991260529, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2425851970911026, "sampling/sampling_logp_difference/max": 2.108829975128174, "sampling/importance_sampling_ratio/min": 0.23900221288204193, "sampling/importance_sampling_ratio/mean": 1.015384554862976, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.782499670982361, "clip_ratio/low_mean": 0.1307391026057303, "clip_ratio/low_min": 0.1307391026057303, "clip_ratio/high_mean": 0.04645378701388836, "clip_ratio/high_max": 0.04645378701388836, "clip_ratio/region_mean": 0.17719288961961865, "reward_total_mean": 0.19074517488479614, "reward_meter_mean": 0.5597180128097534, "reward_meter_std": 0.4198746383190155, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.914467453956604, "reward_lexical_plausibility_std": 0.10147204250097275, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 1.0, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.19074517488479614, "reward_total_composite_std": 0.17437240481376648, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 83.0} {"timestamp_utc": "2026-04-12T15:43:47Z", "mode": "train", "global_step": 84, "epoch": 0.003373900469936137, "loss": -0.0664, "grad_norm": 13.650961875915527, "learning_rate": 9.74848484848485e-06, "num_tokens": 184523.0, "completions/mean_length": 45.25, "completions/min_length": 29.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.525891900062561, "rewards/meter/std": 0.45709413290023804, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9930555820465088, "rewards/lexical_plausibility/std": 0.01285861898213625, "rewards/judge_quality/mean": 0.6599999666213989, "rewards/judge_quality/std": 0.2805097699165344, "rewards/repeat_penalty/mean": 0.9931754469871521, "rewards/repeat_penalty/std": 0.012115638703107834, "rewards/repeat_floor/mean": 0.9989762902259827, "rewards/repeat_floor/std": 0.0018173520220443606, "rewards/near_duplicate_penalty/mean": 0.9931754469871521, "rewards/near_duplicate_penalty/std": 0.012115638703107834, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.308012992143631, "rewards/total_composite/std": 0.2992304563522339, "reward": 0.308012992143631, "reward_std": 0.2992304563522339, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1705971211194992, "sampling/sampling_logp_difference/max": 1.1007606983184814, "sampling/importance_sampling_ratio/min": 0.33261796832084656, "sampling/importance_sampling_ratio/mean": 1.0181703567504883, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6049704849720001, "clip_ratio/low_mean": 0.050076065585017204, "clip_ratio/low_min": 0.050076065585017204, "clip_ratio/high_mean": 0.1008609514683485, "clip_ratio/high_max": 0.1008609514683485, "clip_ratio/region_mean": 0.1509370170533657, "reward_total_mean": 0.308012992143631, "reward_meter_mean": 0.525891900062561, "reward_meter_std": 0.45709413290023804, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9930555820465088, "reward_lexical_plausibility_std": 0.01285861898213625, "reward_repeat_penalty_mean": 0.9931754469871521, "reward_repeat_penalty_std": 0.012115638703107834, "reward_repeat_floor_mean": 0.9989762902259827, "reward_repeat_floor_std": 0.0018173520220443606, "reward_near_duplicate_penalty_mean": 0.9931754469871521, "reward_near_duplicate_penalty_std": 0.012115638703107834, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6599999666213989, "reward_judge_quality_std": 0.2805097699165344, "reward_total_composite_mean": 0.308012992143631, "reward_total_composite_std": 0.2992304563522339, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 84.0} {"timestamp_utc": "2026-04-12T15:43:56Z", "mode": "train", "global_step": 85, "epoch": 0.003414065951721091, "loss": 0.1338, "grad_norm": 11.762645721435547, "learning_rate": 9.745454545454547e-06, "num_tokens": 186131.0, "completions/mean_length": 50.0, "completions/min_length": 36.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.4237501919269562, "rewards/meter/std": 0.3781985640525818, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9809688329696655, "rewards/lexical_plausibility/std": 0.05382820963859558, "rewards/judge_quality/mean": 0.5587500333786011, "rewards/judge_quality/std": 0.30286434292793274, "rewards/repeat_penalty/mean": 0.9983229041099548, "rewards/repeat_penalty/std": 0.0031740295235067606, "rewards/repeat_floor/mean": 0.9997484683990479, "rewards/repeat_floor/std": 0.00047610781621187925, "rewards/near_duplicate_penalty/mean": 0.9983229041099548, "rewards/near_duplicate_penalty/std": 0.0031740295235067606, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2398170679807663, "rewards/total_composite/std": 0.28019580245018005, "reward": 0.2398170679807663, "reward_std": 0.28019580245018005, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19141238927841187, "sampling/sampling_logp_difference/max": 1.9095420837402344, "sampling/importance_sampling_ratio/min": 0.14814820885658264, "sampling/importance_sampling_ratio/mean": 1.0343586206436157, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.041260287165642, "clip_ratio/low_mean": 0.1227434640750289, "clip_ratio/low_min": 0.1227434640750289, "clip_ratio/high_mean": 0.04827235825359821, "clip_ratio/high_max": 0.04827235825359821, "clip_ratio/region_mean": 0.1710158223286271, "reward_total_mean": 0.2398170679807663, "reward_meter_mean": 0.4237501919269562, "reward_meter_std": 0.3781985640525818, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9809688329696655, "reward_lexical_plausibility_std": 0.05382820963859558, "reward_repeat_penalty_mean": 0.9983229041099548, "reward_repeat_penalty_std": 0.0031740295235067606, "reward_repeat_floor_mean": 0.9997484683990479, "reward_repeat_floor_std": 0.00047610781621187925, "reward_near_duplicate_penalty_mean": 0.9983229041099548, "reward_near_duplicate_penalty_std": 0.0031740295235067606, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5587500333786011, "reward_judge_quality_std": 0.30286434292793274, "reward_total_composite_mean": 0.2398170679807663, "reward_total_composite_std": 0.28019580245018005, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 85.0} {"timestamp_utc": "2026-04-12T15:44:06Z", "mode": "train", "global_step": 86, "epoch": 0.0034542314335060447, "loss": 0.1462, "grad_norm": 14.28665828704834, "learning_rate": 9.742424242424244e-06, "num_tokens": 187884.0, "completions/mean_length": 50.125, "completions/min_length": 34.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.9526747465133667, "rewards/meter/std": 0.08271235227584839, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9904210567474365, "rewards/repeat_penalty/std": 0.011389861814677715, "rewards/repeat_floor/mean": 0.9985631704330444, "rewards/repeat_floor/std": 0.001708473195321858, "rewards/near_duplicate_penalty/mean": 0.9904210567474365, "rewards/near_duplicate_penalty/std": 0.011389861814677715, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31550276279449463, "rewards/total_composite/std": 0.12497393041849136, "reward": 0.31550276279449463, "reward_std": 0.12497393041849136, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22854943573474884, "sampling/sampling_logp_difference/max": 1.1131696701049805, "sampling/importance_sampling_ratio/min": 0.32851600646972656, "sampling/importance_sampling_ratio/mean": 1.0479401350021362, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.876336634159088, "clip_ratio/low_mean": 0.04768762364983559, "clip_ratio/low_min": 0.04768762364983559, "clip_ratio/high_mean": 0.15912827104330063, "clip_ratio/high_max": 0.15912827104330063, "clip_ratio/region_mean": 0.20681589469313622, "reward_total_mean": 0.31550276279449463, "reward_meter_mean": 0.9526747465133667, "reward_meter_std": 0.08271235227584839, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9904210567474365, "reward_repeat_penalty_std": 0.011389861814677715, "reward_repeat_floor_mean": 0.9985631704330444, "reward_repeat_floor_std": 0.001708473195321858, "reward_near_duplicate_penalty_mean": 0.9904210567474365, "reward_near_duplicate_penalty_std": 0.011389861814677715, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.31550276279449463, "reward_total_composite_std": 0.12497393041849136, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 86.0} {"timestamp_utc": "2026-04-12T15:44:16Z", "mode": "train", "global_step": 87, "epoch": 0.003494396915290999, "loss": 0.0422, "grad_norm": 13.136268615722656, "learning_rate": 9.739393939393941e-06, "num_tokens": 189556.0, "completions/mean_length": 53.0, "completions/min_length": 39.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.0, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.5176620483398438, "rewards/meter/std": 0.43811485171318054, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9929601550102234, "rewards/lexical_plausibility/std": 0.014150693081319332, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9975244998931885, "rewards/repeat_penalty/std": 0.004858794622123241, "rewards/repeat_floor/mean": 0.9996286630630493, "rewards/repeat_floor/std": 0.0007288263295777142, "rewards/near_duplicate_penalty/mean": 0.9975244998931885, "rewards/near_duplicate_penalty/std": 0.004858794622123241, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15177512168884277, "rewards/total_composite/std": 0.1423334777355194, "reward": 0.15177512168884277, "reward_std": 0.1423334777355194, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22891774773597717, "sampling/sampling_logp_difference/max": 1.6756830215454102, "sampling/importance_sampling_ratio/min": 0.1871802806854248, "sampling/importance_sampling_ratio/mean": 1.0692352056503296, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0857196748256683, "clip_ratio/low_mean": 0.12169018387794495, "clip_ratio/low_min": 0.12169018387794495, "clip_ratio/high_mean": 0.07350949756801128, "clip_ratio/high_max": 0.07350949756801128, "clip_ratio/region_mean": 0.19519968144595623, "reward_total_mean": 0.15177512168884277, "reward_meter_mean": 0.5176620483398438, "reward_meter_std": 0.43811485171318054, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9929601550102234, "reward_lexical_plausibility_std": 0.014150693081319332, "reward_repeat_penalty_mean": 0.9975244998931885, "reward_repeat_penalty_std": 0.004858794622123241, "reward_repeat_floor_mean": 0.9996286630630493, "reward_repeat_floor_std": 0.0007288263295777142, "reward_near_duplicate_penalty_mean": 0.9975244998931885, "reward_near_duplicate_penalty_std": 0.004858794622123241, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.15177512168884277, "reward_total_composite_std": 0.1423334777355194, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 87.0} {"timestamp_utc": "2026-04-12T15:44:27Z", "mode": "train", "global_step": 88, "epoch": 0.003534562397075953, "loss": 0.0892, "grad_norm": 9.307430267333984, "learning_rate": 9.736363636363637e-06, "num_tokens": 191834.0, "completions/mean_length": 91.75, "completions/min_length": 72.0, "completions/max_length": 153.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.75, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.4519146680831909, "rewards/meter/std": 0.3520658612251282, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9498867392539978, "rewards/lexical_plausibility/std": 0.09293685108423233, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9991486072540283, "rewards/repeat_penalty/std": 0.001082957023754716, "rewards/repeat_floor/mean": 0.9998722672462463, "rewards/repeat_floor/std": 0.0001624451979296282, "rewards/near_duplicate_penalty/mean": 0.9991486072540283, "rewards/near_duplicate_penalty/std": 0.001082957023754716, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16503232717514038, "rewards/total_composite/std": 0.17378371953964233, "reward": 0.16503232717514038, "reward_std": 0.17378371953964233, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24502447247505188, "sampling/sampling_logp_difference/max": 1.5297584533691406, "sampling/importance_sampling_ratio/min": 0.21658797562122345, "sampling/importance_sampling_ratio/mean": 1.049220323562622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.324828267097473, "clip_ratio/low_mean": 0.12661213986575603, "clip_ratio/low_min": 0.12661213986575603, "clip_ratio/high_mean": 0.08353758230805397, "clip_ratio/high_max": 0.08353758230805397, "clip_ratio/region_mean": 0.21014972217381, "reward_total_mean": 0.16503232717514038, "reward_meter_mean": 0.4519146680831909, "reward_meter_std": 0.3520658612251282, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9498867392539978, "reward_lexical_plausibility_std": 0.09293685108423233, "reward_repeat_penalty_mean": 0.9991486072540283, "reward_repeat_penalty_std": 0.001082957023754716, "reward_repeat_floor_mean": 0.9998722672462463, "reward_repeat_floor_std": 0.0001624451979296282, "reward_near_duplicate_penalty_mean": 0.9991486072540283, "reward_near_duplicate_penalty_std": 0.001082957023754716, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.16503232717514038, "reward_total_composite_std": 0.17378371953964233, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 88.0} {"timestamp_utc": "2026-04-12T15:44:36Z", "mode": "train", "global_step": 89, "epoch": 0.003574727878860907, "loss": 0.0534, "grad_norm": 18.06661605834961, "learning_rate": 9.733333333333334e-06, "num_tokens": 193332.0, "completions/mean_length": 37.25, "completions/min_length": 31.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.5892886519432068, "rewards/meter/std": 0.35698428750038147, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.993443489074707, "rewards/repeat_penalty/std": 0.011376902461051941, "rewards/repeat_floor/mean": 0.999016523361206, "rewards/repeat_floor/std": 0.0017065367428585887, "rewards/near_duplicate_penalty/mean": 0.993443489074707, "rewards/near_duplicate_penalty/std": 0.011376902461051941, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33069658279418945, "rewards/total_composite/std": 0.2661266326904297, "reward": 0.33069658279418945, "reward_std": 0.2661266326904297, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21617574989795685, "sampling/sampling_logp_difference/max": 1.4496643543243408, "sampling/importance_sampling_ratio/min": 0.23464903235435486, "sampling/importance_sampling_ratio/mean": 1.0127161741256714, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8535578101873398, "clip_ratio/low_mean": 0.07034521922469139, "clip_ratio/low_min": 0.07034521922469139, "clip_ratio/high_mean": 0.07747877482324839, "clip_ratio/high_max": 0.07747877482324839, "clip_ratio/region_mean": 0.14782399404793978, "reward_total_mean": 0.33069658279418945, "reward_meter_mean": 0.5892886519432068, "reward_meter_std": 0.35698428750038147, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.993443489074707, "reward_repeat_penalty_std": 0.011376902461051941, "reward_repeat_floor_mean": 0.999016523361206, "reward_repeat_floor_std": 0.0017065367428585887, "reward_near_duplicate_penalty_mean": 0.993443489074707, "reward_near_duplicate_penalty_std": 0.011376902461051941, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.33069658279418945, "reward_total_composite_std": 0.2661266326904297, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 89.0} {"timestamp_utc": "2026-04-12T15:44:48Z", "mode": "train", "global_step": 90, "epoch": 0.003614893360645861, "loss": 0.1017, "grad_norm": 8.156938552856445, "learning_rate": 9.730303030303031e-06, "num_tokens": 196043.0, "completions/mean_length": 143.875, "completions/min_length": 124.0, "completions/max_length": 172.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 143.875, "completions/min_terminated_length": 124.0, "completions/max_terminated_length": 172.0, "rewards/meter/mean": 0.5183090567588806, "rewards/meter/std": 0.2683314085006714, "rewards/count_adherence/mean": 0.953125, "rewards/count_adherence/std": 0.06469365209341049, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9859374761581421, "rewards/count_floor/std": 0.019408106803894043, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9818274974822998, "rewards/repeat_penalty/std": 0.015070362947881222, "rewards/repeat_floor/mean": 0.9979612827301025, "rewards/repeat_floor/std": 0.001504645450040698, "rewards/near_duplicate_penalty/mean": 0.9934290647506714, "rewards/near_duplicate_penalty/std": 0.002804782474413514, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9882984757423401, "rewards/distinct_2/std": 0.013034606352448463, "rewards/total_composite/mean": 0.1824151575565338, "rewards/total_composite/std": 0.12442703545093536, "reward": 0.1824151575565338, "reward_std": 0.12442702800035477, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24606093764305115, "sampling/sampling_logp_difference/max": 1.7278642654418945, "sampling/importance_sampling_ratio/min": 0.17766344547271729, "sampling/importance_sampling_ratio/mean": 1.0536800622940063, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.9328472316265106, "clip_ratio/low_mean": 0.08303666766732931, "clip_ratio/low_min": 0.08303666766732931, "clip_ratio/high_mean": 0.09808459505438805, "clip_ratio/high_max": 0.09808459505438805, "clip_ratio/region_mean": 0.18112126272171736, "reward_total_mean": 0.1824151575565338, "reward_meter_mean": 0.5183090567588806, "reward_meter_std": 0.2683314085006714, "reward_count_adherence_mean": 0.953125, "reward_count_adherence_std": 0.06469365209341049, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9859374761581421, "reward_count_floor_std": 0.019408106803894043, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9818274974822998, "reward_repeat_penalty_std": 0.015070362947881222, "reward_repeat_floor_mean": 0.9979612827301025, "reward_repeat_floor_std": 0.001504645450040698, "reward_near_duplicate_penalty_mean": 0.9934290647506714, "reward_near_duplicate_penalty_std": 0.002804782474413514, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9882984757423401, "reward_distinct_2_std": 0.013034606352448463, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.1824151575565338, "reward_total_composite_std": 0.12442703545093536, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 90.0} {"timestamp_utc": "2026-04-12T15:45:00Z", "mode": "train", "global_step": 91, "epoch": 0.003655058842430815, "loss": 0.0859, "grad_norm": 8.105484008789062, "learning_rate": 9.727272727272728e-06, "num_tokens": 198954.0, "completions/mean_length": 165.875, "completions/min_length": 149.0, "completions/max_length": 208.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 165.875, "completions/min_terminated_length": 149.0, "completions/max_terminated_length": 208.0, "rewards/meter/mean": 0.2851950526237488, "rewards/meter/std": 0.2575579881668091, "rewards/count_adherence/mean": 0.9722222089767456, "rewards/count_adherence/std": 0.07856741547584534, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9916666746139526, "rewards/count_floor/std": 0.0235702246427536, "rewards/lexical_plausibility/mean": 0.9704553484916687, "rewards/lexical_plausibility/std": 0.05629132688045502, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9946459531784058, "rewards/repeat_penalty/std": 0.002710993867367506, "rewards/repeat_floor/mean": 0.9991968870162964, "rewards/repeat_floor/std": 0.0004066347028128803, "rewards/near_duplicate_penalty/mean": 0.9946459531784058, "rewards/near_duplicate_penalty/std": 0.002710993867367506, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0776951014995575, "rewards/total_composite/std": 0.07800179719924927, "reward": 0.0776951014995575, "reward_std": 0.07800179719924927, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23621301352977753, "sampling/sampling_logp_difference/max": 1.3729228973388672, "sampling/importance_sampling_ratio/min": 0.25336530804634094, "sampling/importance_sampling_ratio/mean": 1.0491832494735718, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.093779385089874, "clip_ratio/low_mean": 0.10351813212037086, "clip_ratio/low_min": 0.10351813212037086, "clip_ratio/high_mean": 0.09971963427960873, "clip_ratio/high_max": 0.09971963427960873, "clip_ratio/region_mean": 0.2032377663999796, "reward_total_mean": 0.0776951014995575, "reward_meter_mean": 0.2851950526237488, "reward_meter_std": 0.2575579881668091, "reward_count_adherence_mean": 0.9722222089767456, "reward_count_adherence_std": 0.07856741547584534, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9916666746139526, "reward_count_floor_std": 0.0235702246427536, "reward_lexical_plausibility_mean": 0.9704553484916687, "reward_lexical_plausibility_std": 0.05629132688045502, "reward_repeat_penalty_mean": 0.9946459531784058, "reward_repeat_penalty_std": 0.002710993867367506, "reward_repeat_floor_mean": 0.9991968870162964, "reward_repeat_floor_std": 0.0004066347028128803, "reward_near_duplicate_penalty_mean": 0.9946459531784058, "reward_near_duplicate_penalty_std": 0.002710993867367506, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.0776951014995575, "reward_total_composite_std": 0.07800179719924927, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 91.0} {"timestamp_utc": "2026-04-12T15:45:12Z", "mode": "train", "global_step": 92, "epoch": 0.003695224324215769, "loss": 0.069, "grad_norm": 8.861458778381348, "learning_rate": 9.724242424242426e-06, "num_tokens": 202043.0, "completions/mean_length": 145.125, "completions/min_length": 117.0, "completions/max_length": 219.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.125, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 219.0, "rewards/meter/mean": 0.4660497307777405, "rewards/meter/std": 0.309230774641037, "rewards/count_adherence/mean": 0.9821428656578064, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9946428537368774, "rewards/count_floor/std": 0.015152297914028168, "rewards/lexical_plausibility/mean": 0.9504303336143494, "rewards/lexical_plausibility/std": 0.06441396474838257, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9935762882232666, "rewards/repeat_penalty/std": 0.005078553222119808, "rewards/repeat_floor/mean": 0.999036431312561, "rewards/repeat_floor/std": 0.0007617836236022413, "rewards/near_duplicate_penalty/mean": 0.9935762882232666, "rewards/near_duplicate_penalty/std": 0.005078553222119808, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08608467131853104, "rewards/total_composite/std": 0.05834082514047623, "reward": 0.08608467131853104, "reward_std": 0.05834082514047623, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23572970926761627, "sampling/sampling_logp_difference/max": 1.4420547485351562, "sampling/importance_sampling_ratio/min": 0.23644143342971802, "sampling/importance_sampling_ratio/mean": 1.0500637292861938, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.634262293577194, "clip_ratio/low_mean": 0.09698570147156715, "clip_ratio/low_min": 0.09698570147156715, "clip_ratio/high_mean": 0.13141235895454884, "clip_ratio/high_max": 0.13141235895454884, "clip_ratio/region_mean": 0.228398060426116, "reward_total_mean": 0.08608467131853104, "reward_meter_mean": 0.4660497307777405, "reward_meter_std": 0.309230774641037, "reward_count_adherence_mean": 0.9821428656578064, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9946428537368774, "reward_count_floor_std": 0.015152297914028168, "reward_lexical_plausibility_mean": 0.9504303336143494, "reward_lexical_plausibility_std": 0.06441396474838257, "reward_repeat_penalty_mean": 0.9935762882232666, "reward_repeat_penalty_std": 0.005078553222119808, "reward_repeat_floor_mean": 0.999036431312561, "reward_repeat_floor_std": 0.0007617836236022413, "reward_near_duplicate_penalty_mean": 0.9935762882232666, "reward_near_duplicate_penalty_std": 0.005078553222119808, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.08608467131853104, "reward_total_composite_std": 0.05834082514047623, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 92.0} {"timestamp_utc": "2026-04-12T15:45:23Z", "mode": "train", "global_step": 93, "epoch": 0.003735389806000723, "loss": -0.0625, "grad_norm": 10.055813789367676, "learning_rate": 9.721212121212123e-06, "num_tokens": 204220.0, "completions/mean_length": 91.125, "completions/min_length": 74.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.125, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 140.0, "rewards/meter/mean": 0.7445623874664307, "rewards/meter/std": 0.3468618392944336, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9762678146362305, "rewards/repeat_penalty/std": 0.041598014533519745, "rewards/repeat_floor/mean": 0.9972038865089417, "rewards/repeat_floor/std": 0.004112606402486563, "rewards/near_duplicate_penalty/mean": 0.989409327507019, "rewards/near_duplicate_penalty/std": 0.007115801330655813, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9865831732749939, "rewards/distinct_2/std": 0.037948496639728546, "rewards/total_composite/mean": 0.16710910201072693, "rewards/total_composite/std": 0.12870369851589203, "reward": 0.16710910201072693, "reward_std": 0.12870368361473083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24216312170028687, "sampling/sampling_logp_difference/max": 1.7295198440551758, "sampling/importance_sampling_ratio/min": 0.17736954987049103, "sampling/importance_sampling_ratio/mean": 1.0720044374465942, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.665288805961609, "clip_ratio/low_mean": 0.1566590964794159, "clip_ratio/low_min": 0.1566590964794159, "clip_ratio/high_mean": 0.04208195023238659, "clip_ratio/high_max": 0.04208195023238659, "clip_ratio/region_mean": 0.19874104671180248, "reward_total_mean": 0.16710910201072693, "reward_meter_mean": 0.7445623874664307, "reward_meter_std": 0.3468618392944336, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9762678146362305, "reward_repeat_penalty_std": 0.041598014533519745, "reward_repeat_floor_mean": 0.9972038865089417, "reward_repeat_floor_std": 0.004112606402486563, "reward_near_duplicate_penalty_mean": 0.989409327507019, "reward_near_duplicate_penalty_std": 0.007115801330655813, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9865831732749939, "reward_distinct_2_std": 0.037948496639728546, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.16710910201072693, "reward_total_composite_std": 0.12870369851589203, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 93.0} {"timestamp_utc": "2026-04-12T15:45:32Z", "mode": "train", "global_step": 94, "epoch": 0.003775555287785677, "loss": 0.1152, "grad_norm": 19.25832748413086, "learning_rate": 9.718181818181818e-06, "num_tokens": 205672.0, "completions/mean_length": 31.5, "completions/min_length": 25.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.5, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.22589288651943207, "rewards/meter/std": 0.2675091326236725, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9429793357849121, "rewards/lexical_plausibility/std": 0.13593381643295288, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9963842630386353, "rewards/repeat_penalty/std": 0.010226743295788765, "rewards/repeat_floor/mean": 0.9994576573371887, "rewards/repeat_floor/std": 0.0015340187819674611, "rewards/near_duplicate_penalty/mean": 0.9963842630386353, "rewards/near_duplicate_penalty/std": 0.010226743295788765, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09153544902801514, "rewards/total_composite/std": 0.12027516216039658, "reward": 0.09153544902801514, "reward_std": 0.12027516216039658, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.207672581076622, "sampling/sampling_logp_difference/max": 1.3137211799621582, "sampling/importance_sampling_ratio/min": 0.26881787180900574, "sampling/importance_sampling_ratio/mean": 1.03855299949646, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4974738359451294, "clip_ratio/low_mean": 0.12261239439249039, "clip_ratio/low_min": 0.12261239439249039, "clip_ratio/high_mean": 0.06354166753590107, "clip_ratio/high_max": 0.06354166753590107, "clip_ratio/region_mean": 0.18615406192839146, "reward_total_mean": 0.09153544902801514, "reward_meter_mean": 0.22589288651943207, "reward_meter_std": 0.2675091326236725, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9429793357849121, "reward_lexical_plausibility_std": 0.13593381643295288, "reward_repeat_penalty_mean": 0.9963842630386353, "reward_repeat_penalty_std": 0.010226743295788765, "reward_repeat_floor_mean": 0.9994576573371887, "reward_repeat_floor_std": 0.0015340187819674611, "reward_near_duplicate_penalty_mean": 0.9963842630386353, "reward_near_duplicate_penalty_std": 0.010226743295788765, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.09153544902801514, "reward_total_composite_std": 0.12027516216039658, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 94.0} {"timestamp_utc": "2026-04-12T15:45:42Z", "mode": "train", "global_step": 95, "epoch": 0.003815720769570631, "loss": 0.1265, "grad_norm": 19.655981063842773, "learning_rate": 9.715151515151516e-06, "num_tokens": 207325.0, "completions/mean_length": 39.625, "completions/min_length": 33.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.625, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6288896203041077, "rewards/meter/std": 0.384452223777771, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9993181824684143, "rewards/repeat_penalty/std": 0.0019284712616354227, "rewards/repeat_floor/mean": 0.9998977184295654, "rewards/repeat_floor/std": 0.00028927490347996354, "rewards/near_duplicate_penalty/mean": 0.9993181824684143, "rewards/near_duplicate_penalty/std": 0.0019284712616354227, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24521130323410034, "rewards/total_composite/std": 0.15802384912967682, "reward": 0.24521130323410034, "reward_std": 0.15802384912967682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20129792392253876, "sampling/sampling_logp_difference/max": 0.9452333450317383, "sampling/importance_sampling_ratio/min": 0.38858890533447266, "sampling/importance_sampling_ratio/mean": 1.0726001262664795, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.982078045606613, "clip_ratio/low_mean": 0.07321428693830967, "clip_ratio/low_min": 0.07321428693830967, "clip_ratio/high_mean": 0.13783274590969086, "clip_ratio/high_max": 0.13783274590969086, "clip_ratio/region_mean": 0.21104703284800053, "reward_total_mean": 0.24521130323410034, "reward_meter_mean": 0.6288896203041077, "reward_meter_std": 0.384452223777771, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9993181824684143, "reward_repeat_penalty_std": 0.0019284712616354227, "reward_repeat_floor_mean": 0.9998977184295654, "reward_repeat_floor_std": 0.00028927490347996354, "reward_near_duplicate_penalty_mean": 0.9993181824684143, "reward_near_duplicate_penalty_std": 0.0019284712616354227, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.24521130323410034, "reward_total_composite_std": 0.15802384912967682, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 95.0} {"timestamp_utc": "2026-04-12T15:45:53Z", "mode": "train", "global_step": 96, "epoch": 0.003855886251355585, "loss": 0.05, "grad_norm": 10.176275253295898, "learning_rate": 9.712121212121213e-06, "num_tokens": 209638.0, "completions/mean_length": 112.125, "completions/min_length": 68.0, "completions/max_length": 150.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 112.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.27093616127967834, "rewards/meter/std": 0.30527225136756897, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.7630946040153503, "rewards/lexical_plausibility/std": 0.19082005321979523, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9934767484664917, "rewards/repeat_penalty/std": 0.008737701922655106, "rewards/repeat_floor/mean": 0.9990215301513672, "rewards/repeat_floor/std": 0.0013106464175507426, "rewards/near_duplicate_penalty/mean": 0.9934767484664917, "rewards/near_duplicate_penalty/std": 0.008737701922655106, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0771602988243103, "rewards/total_composite/std": 0.09407317638397217, "reward": 0.0771602988243103, "reward_std": 0.09407317638397217, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23485730588436127, "sampling/sampling_logp_difference/max": 1.482388973236084, "sampling/importance_sampling_ratio/min": 0.22709451615810394, "sampling/importance_sampling_ratio/mean": 1.0526814460754395, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.172715663909912, "clip_ratio/low_mean": 0.1263983454555273, "clip_ratio/low_min": 0.1263983454555273, "clip_ratio/high_mean": 0.07382924109697342, "clip_ratio/high_max": 0.07382924109697342, "clip_ratio/region_mean": 0.20022758655250072, "reward_total_mean": 0.0771602988243103, "reward_meter_mean": 0.27093616127967834, "reward_meter_std": 0.30527225136756897, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.7630946040153503, "reward_lexical_plausibility_std": 0.19082005321979523, "reward_repeat_penalty_mean": 0.9934767484664917, "reward_repeat_penalty_std": 0.008737701922655106, "reward_repeat_floor_mean": 0.9990215301513672, "reward_repeat_floor_std": 0.0013106464175507426, "reward_near_duplicate_penalty_mean": 0.9934767484664917, "reward_near_duplicate_penalty_std": 0.008737701922655106, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.0771602988243103, "reward_total_composite_std": 0.09407317638397217, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 96.0} {"timestamp_utc": "2026-04-12T15:46:01Z", "mode": "train", "global_step": 97, "epoch": 0.003896051733140539, "loss": -0.0049, "grad_norm": 12.639327049255371, "learning_rate": 9.70909090909091e-06, "num_tokens": 211384.0, "completions/mean_length": 49.25, "completions/min_length": 33.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.25, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.5977282524108887, "rewards/meter/std": 0.3484576642513275, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9726052284240723, "rewards/lexical_plausibility/std": 0.05644887313246727, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2745385766029358, "rewards/repeat_penalty/mean": 0.9990079402923584, "rewards/repeat_penalty/std": 0.0028059897013008595, "rewards/repeat_floor/mean": 0.9998512268066406, "rewards/repeat_floor/std": 0.00042089950875379145, "rewards/near_duplicate_penalty/mean": 0.9990079402923584, "rewards/near_duplicate_penalty/std": 0.0028059897013008595, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26195141673088074, "rewards/total_composite/std": 0.1852988451719284, "reward": 0.26195141673088074, "reward_std": 0.1852988302707672, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20207305252552032, "sampling/sampling_logp_difference/max": 1.3922796249389648, "sampling/importance_sampling_ratio/min": 0.24850815534591675, "sampling/importance_sampling_ratio/mean": 1.0321518182754517, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.122445374727249, "clip_ratio/low_mean": 0.14189988188445568, "clip_ratio/low_min": 0.14189988188445568, "clip_ratio/high_mean": 0.07165093161165714, "clip_ratio/high_max": 0.07165093161165714, "clip_ratio/region_mean": 0.21355081349611282, "reward_total_mean": 0.26195141673088074, "reward_meter_mean": 0.5977282524108887, "reward_meter_std": 0.3484576642513275, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9726052284240723, "reward_lexical_plausibility_std": 0.05644887313246727, "reward_repeat_penalty_mean": 0.9990079402923584, "reward_repeat_penalty_std": 0.0028059897013008595, "reward_repeat_floor_mean": 0.9998512268066406, "reward_repeat_floor_std": 0.00042089950875379145, "reward_near_duplicate_penalty_mean": 0.9990079402923584, "reward_near_duplicate_penalty_std": 0.0028059897013008595, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2745385766029358, "reward_total_composite_mean": 0.26195141673088074, "reward_total_composite_std": 0.1852988451719284, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 97.0} {"timestamp_utc": "2026-04-12T15:46:11Z", "mode": "train", "global_step": 98, "epoch": 0.003936217214925493, "loss": 0.0753, "grad_norm": 9.187956809997559, "learning_rate": 9.706060606060606e-06, "num_tokens": 213668.0, "completions/mean_length": 95.5, "completions/min_length": 67.0, "completions/max_length": 128.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 95.5, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.2505316734313965, "rewards/meter/std": 0.32169413566589355, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.18898223340511322, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05669466033577919, "rewards/lexical_plausibility/mean": 0.9390342235565186, "rewards/lexical_plausibility/std": 0.0646214485168457, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9948243498802185, "rewards/repeat_penalty/std": 0.004409181885421276, "rewards/repeat_floor/mean": 0.9992235898971558, "rewards/repeat_floor/std": 0.0006613862351514399, "rewards/near_duplicate_penalty/mean": 0.9948243498802185, "rewards/near_duplicate_penalty/std": 0.004409181885421276, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08780472725629807, "rewards/total_composite/std": 0.1362478882074356, "reward": 0.08780472725629807, "reward_std": 0.13624787330627441, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.26570001244544983, "sampling/sampling_logp_difference/max": 1.4997978210449219, "sampling/importance_sampling_ratio/min": 0.2231752872467041, "sampling/importance_sampling_ratio/mean": 1.0519211292266846, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.7513682544231415, "clip_ratio/low_mean": 0.14081784337759018, "clip_ratio/low_min": 0.14081784337759018, "clip_ratio/high_mean": 0.05643996223807335, "clip_ratio/high_max": 0.05643996223807335, "clip_ratio/region_mean": 0.19725780561566353, "reward_total_mean": 0.08780472725629807, "reward_meter_mean": 0.2505316734313965, "reward_meter_std": 0.32169413566589355, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.18898223340511322, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05669466033577919, "reward_lexical_plausibility_mean": 0.9390342235565186, "reward_lexical_plausibility_std": 0.0646214485168457, "reward_repeat_penalty_mean": 0.9948243498802185, "reward_repeat_penalty_std": 0.004409181885421276, "reward_repeat_floor_mean": 0.9992235898971558, "reward_repeat_floor_std": 0.0006613862351514399, "reward_near_duplicate_penalty_mean": 0.9948243498802185, "reward_near_duplicate_penalty_std": 0.004409181885421276, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.08780472725629807, "reward_total_composite_std": 0.1362478882074356, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 98.0} {"timestamp_utc": "2026-04-12T15:46:21Z", "mode": "train", "global_step": 99, "epoch": 0.003976382696710447, "loss": 0.1105, "grad_norm": 12.105984687805176, "learning_rate": 9.703030303030305e-06, "num_tokens": 215618.0, "completions/mean_length": 75.75, "completions/min_length": 60.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.75, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.641942024230957, "rewards/meter/std": 0.37689656019210815, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9947735071182251, "rewards/repeat_penalty/std": 0.002478251699358225, "rewards/repeat_floor/mean": 0.9992160201072693, "rewards/repeat_floor/std": 0.0003717463696375489, "rewards/near_duplicate_penalty/mean": 0.9947735071182251, "rewards/near_duplicate_penalty/std": 0.002478251699358225, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1920507550239563, "rewards/total_composite/std": 0.1380826085805893, "reward": 0.1920507550239563, "reward_std": 0.1380826085805893, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25587889552116394, "sampling/sampling_logp_difference/max": 1.5802116394042969, "sampling/importance_sampling_ratio/min": 0.20593149960041046, "sampling/importance_sampling_ratio/mean": 1.0554982423782349, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.312505006790161, "clip_ratio/low_mean": 0.1088887695223093, "clip_ratio/low_min": 0.1088887695223093, "clip_ratio/high_mean": 0.11645336635410786, "clip_ratio/high_max": 0.11645336635410786, "clip_ratio/region_mean": 0.22534213587641716, "reward_total_mean": 0.1920507550239563, "reward_meter_mean": 0.641942024230957, "reward_meter_std": 0.37689656019210815, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.9947735071182251, "reward_repeat_penalty_std": 0.002478251699358225, "reward_repeat_floor_mean": 0.9992160201072693, "reward_repeat_floor_std": 0.0003717463696375489, "reward_near_duplicate_penalty_mean": 0.9947735071182251, "reward_near_duplicate_penalty_std": 0.002478251699358225, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1920507550239563, "reward_total_composite_std": 0.1380826085805893, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 99.0} {"timestamp_utc": "2026-04-12T15:46:31Z", "mode": "train", "global_step": 100, "epoch": 0.004016548178495401, "loss": 0.1118, "grad_norm": 14.011872291564941, "learning_rate": 9.7e-06, "num_tokens": 217289.0, "completions/mean_length": 54.875, "completions/min_length": 45.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.875, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.14609289169311523, "rewards/meter/std": 0.1894940733909607, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.9940087795257568, "rewards/repeat_penalty/std": 0.0035288461949676275, "rewards/repeat_floor/mean": 0.9991012811660767, "rewards/repeat_floor/std": 0.0005293278954923153, "rewards/near_duplicate_penalty/mean": 0.9940087795257568, "rewards/near_duplicate_penalty/std": 0.0035288461949676275, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.049753956496715546, "rewards/total_composite/std": 0.04388604313135147, "reward": 0.049753956496715546, "reward_std": 0.04388603940606117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24366313219070435, "sampling/sampling_logp_difference/max": 1.695225715637207, "sampling/importance_sampling_ratio/min": 0.22670167684555054, "sampling/importance_sampling_ratio/mean": 1.0452406406402588, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5091373920440674, "clip_ratio/low_mean": 0.11318430211395025, "clip_ratio/low_min": 0.11318430211395025, "clip_ratio/high_mean": 0.07480035535991192, "clip_ratio/high_max": 0.07480035535991192, "clip_ratio/region_mean": 0.18798465747386217, "reward_total_mean": 0.049753956496715546, "reward_meter_mean": 0.14609289169311523, "reward_meter_std": 0.1894940733909607, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9940087795257568, "reward_repeat_penalty_std": 0.0035288461949676275, "reward_repeat_floor_mean": 0.9991012811660767, "reward_repeat_floor_std": 0.0005293278954923153, "reward_near_duplicate_penalty_mean": 0.9940087795257568, "reward_near_duplicate_penalty_std": 0.0035288461949676275, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.049753956496715546, "reward_total_composite_std": 0.04388604313135147, "run_id": "shaer_grpo_20260412_152315", "run_sequence_index": 0, "_plot_step": 100.0}